Skip to content
View MingZwhy's full-sized avatar
  • UCAS
  • Beijing
  • 06:22 (UTC -12:00)

Block or report MingZwhy

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
MingZwhy/README.md
Yuanteng Chen profile banner

GitHub Homepage Age 24

LLM Compression MoE Efficient Inference

👋 About Me

I am Yuanteng Chen (陈远腾), a 24-year-old Ph.D. student at the Institute of Automation, Chinese Academy of Sciences (CASIA) and Zhongguancun Academy, advised by Prof. Jian Cheng. I graduated from the University of Chinese Academy of Sciences (UCAS), majoring in Computer Science and Technology. My research focuses on efficient large language models, especially model compression and inference acceleration for modern LLMs and MoE architectures. 🪨 爱好下围棋,业余6段,野狐围棋ID“月光底下走”,欢迎来找我下棋!

🔭 Research Interests

🧩 LLM Compression

Post-training quantization, low-bit inference, pruning, and expert pruning for MoE models.

⚙️ Efficient Systems

Hardware-aware and system-aware acceleration for practical LLM deployment.

🧭 Fine-Grained MoE

Routing / Expert Selection with human intervention, routing adjustment, and inference enhancement.

I am particularly interested in making MoE models more efficient, adaptive, and practical for real-world deployment. Always looking forward to exchanging ideas around LLM compression, MoE inference, and efficient AI systems!

📰 News

📚 Selected Publications

🗓️ 2026

MODE

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

Conference on Empirical Methods in Natural Language Processing (EMNLP 2026 Main)

arXiv Latest Work EMNLP 2026 Main MoE-MLLMs Quantization Modality Bias

Ban&Pick

Ban&Pick: Enhancing Performance and Efficiency of MoE-LLMs via Smarter Routing

Yuanteng Chen, Peisong Wang, Yuantian Shao, Nanxin Zeng, Chang Xu, Jian Cheng

Findings of the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026 Findings)

arXiv EMNLP 2026 Findings Fine-Grained MoE Reasoning and Efficiency

Certain Head, Uncertain Tail

Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE

Yuanteng Chen, Peisong Wang, Nanxin Zeng, Yuantian Shao, Gang Li, Jing Liu, Jian Cheng

International Conference on Machine Learning (ICML 2026)

arXiv Fine-Grained MoE Test-Time Scaling

Block Rotation is All You Need for MXFP4 Quantization

Block Rotation is All You Need for MXFP4 Quantization

Yuantian Shao, Peisong Wang, Yuanteng Chen, Chang Xu, Zhihui Wei, Jian Cheng

International Conference on Machine Learning (ICML 2026)

arXiv MXFP4 Quantization Rotation

🗓️ 2025

EAC-MoE

EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models

Yuanteng Chen*, Yuantian Shao*, Peisong Wang, Jian Cheng

Annual Meeting of the Association for Computational Linguistics (ACL 2025 Main)

arXiv MoE Compression Expert Selection

Q-Mamba

Q-Mamba: Towards More Efficient Mamba Models via Post-Training Quantization

Chen Tianqi*, Yuanteng Chen*, Peisong Wang, Weixiang Xu, Zeyu Zhu, Jian Cheng

Findings of the Association for Computational Linguistics (ACL 2025 Findings)

ACL Anthology ACL Findings 2025 LLM Quantization Mamba

DartQuant

DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization

Yuantian Shao*, Yuanteng Chen*, Peisong Wang, Jianlin Yu, Jing Lin, Yiwu Yao, Zhihui Wei, Jian Cheng

Advances in Neural Information Processing Systems (NeurIPS 2025)

arXiv LLM Quantization Calibration

Pinned Loading

  1. UCAS-C_programming UCAS-C_programming Public

    中国科学院大学-C语言编程-五子棋

    C 23 3

  2. Berkeley_CS Berkeley_CS Public

    code of CS180, CS188 and CS182 in University of California

    Jupyter Notebook

  3. UCAS-Calab UCAS-Calab Public

    中国科学院大学-计算机体系结构研讨

    Verilog 4

  4. MODE MODE Public

    Python 4 1