2026

Attention Residuals
Attention Residuals

Kimi Team

Technical Report 2026

Replaces fixed residual accumulation with learned, content-dependent attention over depth. Fanqing Meng is a co-author with the Kimi Team.

Attention Residuals

Kimi Team

Technical Report 2026

Replaces fixed residual accumulation with learned, content-dependent attention over depth. Fanqing Meng is a co-author with the Kimi Team.

2025

MM-Eureka: Exploring Visual Aha Moment with Rule-based Large-scale Reinforcement Learning
MM-Eureka: Exploring Visual Aha Moment with Rule-based Large-scale Reinforcement Learning

Fanqing Meng, Lingxiao Du, Zongkai Liu, Zhixiang Zhou, Quanfeng Lu, Daocheng Fu, Botian Shi, Wenhai Wang, Junjun He, Kaipeng Zhang, Ping Luo, Yu Qiao, Qiaosheng Zhang, Wenqi Shao

Technical Report 2025

Extends large-scale rule-based reinforcement learning to multimodal reasoning and releases the full models, data, and training pipeline.

MM-Eureka: Exploring Visual Aha Moment with Rule-based Large-scale Reinforcement Learning

Fanqing Meng, Lingxiao Du, Zongkai Liu, Zhixiang Zhou, Quanfeng Lu, Daocheng Fu, Botian Shi, Wenhai Wang, Junjun He, Kaipeng Zhang, Ping Luo, Yu Qiao, Qiaosheng Zhang, Wenqi Shao

Technical Report 2025

Extends large-scale rule-based reinforcement learning to multimodal reasoning and releases the full models, data, and training pipeline.

Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation

Fanqing Meng*, Jiaqi Liao*, Xinyu Tan, Quanfeng Lu, Wenqi Shao, Kaipeng Zhang, Yu Cheng, Dianqi Li, Ping Luo (* equal contribution)

International Conference on Machine Learning (ICML) 2025

Introduces PhyGenBench to evaluate whether generated videos obey physical commonsense across diverse real-world scenarios.

Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation

Fanqing Meng*, Jiaqi Liao*, Xinyu Tan, Quanfeng Lu, Wenqi Shao, Kaipeng Zhang, Yu Cheng, Dianqi Li, Ping Luo (* equal contribution)

International Conference on Machine Learning (ICML) 2025

Introduces PhyGenBench to evaluate whether generated videos obey physical commonsense across diverse real-world scenarios.

2024

ChartAssistant: A Universal Chart Multimodal Language Model
ChartAssistant: A Universal Chart Multimodal Language Model

Fanqing Meng, Wenqi Shao, Quanfeng Lu, Peng Gao, Kaipeng Zhang, Yu Qiao, Ping Luo

Findings of the Association for Computational Linguistics (ACL) 2024

A chart-focused vision-language model trained through chart-to-table alignment and broad multitask instruction tuning.

ChartAssistant: A Universal Chart Multimodal Language Model

Fanqing Meng, Wenqi Shao, Quanfeng Lu, Peng Gao, Kaipeng Zhang, Yu Qiao, Ping Luo

Findings of the Association for Computational Linguistics (ACL) 2024

A chart-focused vision-language model trained through chart-to-table alignment and broad multitask instruction tuning.

MMT-Bench: A Comprehensive Multimodal Benchmark Towards Multitask AGI
MMT-Bench: A Comprehensive Multimodal Benchmark Towards Multitask AGI

Kaining Ying*, Fanqing Meng*, Jin Wang, Zhiqian Li, Han Lin, Yue Yang, Hao Zhang, Wenbo Zhang, Yuqi Lin, Shuo Liu, et al. (* equal contribution)

International Conference on Machine Learning (ICML) 2024

A 31K-question benchmark spanning 162 subtasks for diagnosing broad multimodal model capabilities.

MMT-Bench: A Comprehensive Multimodal Benchmark Towards Multitask AGI

Kaining Ying*, Fanqing Meng*, Jin Wang, Zhiqian Li, Han Lin, Yue Yang, Hao Zhang, Wenbo Zhang, Yuqi Lin, Shuo Liu, et al. (* equal contribution)

International Conference on Machine Learning (ICML) 2024

A 31K-question benchmark spanning 162 subtasks for diagnosing broad multimodal model capabilities.

2023

Foundation Model is Efficient: Multimodal Multitask Model Selector
Foundation Model is Efficient: Multimodal Multitask Model Selector

Fanqing Meng, Wenqi Shao, Zhanglin Peng, Chonghe Jiang, Kaipeng Zhang, Yu Qiao, Ping Luo

Advances in Neural Information Processing Systems (NeurIPS) 2023

Predicts transfer performance across heterogeneous multimodal tasks without brute-force fine-tuning.

Foundation Model is Efficient: Multimodal Multitask Model Selector

Fanqing Meng, Wenqi Shao, Zhanglin Peng, Chonghe Jiang, Kaipeng Zhang, Yu Qiao, Ping Luo

Advances in Neural Information Processing Systems (NeurIPS) 2023

Predicts transfer performance across heterogeneous multimodal tasks without brute-force fine-tuning.