Biography
- I am a Senior Researcher at Tencent Hunyuan. I earned my M.S. degree from Peking University in 2020 and B.S. degree from HFUT.
- At Hunyuan, my research mainly focuses on CUA/Code Agent, RL, and Synthetic Data.
- At Microsoft, I co-founded WizardLM project, which contributed the SOTA LLMs WizardLM, WizardCoder and WizardMath, I also created widely adopted methods Evol-Instruct, RLEIF and Arena-Learning.
- We are hiring research interns! If you have strong experiences in LLMs and are willing to work in Hunyuan, feel free to shoot me your resume.
News
- [Jun 2026] Inroduce two RL papers STARE for Policy Entropy Stability and VeriEvol for Multimodal Reasoning!
- [Mar 2026] Our two RL papers RubricBench and Beyond Length Scaling are featured on Huggingface Daily Paper #4 and Huggingface Daily Paper #6 respectively!
- [Jan 2026] AgentMath accepted by ICLR 2026!
- [Aug 2025] We release Hunyuan-Large-Vision which ranks
#5 globally on LMArena-Vision and is the#1 VLM of China . - [May 2025] We release Hunyuan-TurboS which ranks
#7 globally on LMArena-Text and is the #2 LLM of China . - [May 2025] AgentGen accepted by KDD 2025!
- [May 2025] WarriorCoder accepted by ACL 2025!
- [Sep 2024] WizardArena accepted by NeurIPS 2024!
- [Oct 2024] Wizard models achieves
3M+ HF downloads, 9K+ Github stars and ranks #4 globally (#1 opensource) on LMSYS Arena! - [Jun 2024] We release WizardLM-2, which ranks
#3 in monthly token usage on OpenRouter , just behind Gemini 1.5 Pro and Llama 3. - [Aug 2023] We release WizardMath. Accepted by ICLR 2025 as an
Oral paper ! - [Jun 2023] We release WizardCoder. Accepted by ICLR 2024!
- [Apr 2023] We release WizardLM. Accepted by ICLR 2024! Project link: WizardLM .
- 2 papers accepted by ACL 2023!
- 1 paper accepted by EMNLP 2022!
- 1 paper accepted by NAACL 2022 as an
Oral paper ! - 2 papers accepted by ACL 2022!
- 1 paper accepted by EMNLP 2019!
Selected Publications [Google Scholar]
(*: Equal contribution, #: The intern I mentored)
Agentic Model:
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
Haipeng Luo#, Huawen Feng#, Qingfeng Sun, Can Xu, Kai Zheng, Yufei Wang, Tao Yang, Han Hu, Yansong Tang, Di Wang
ICLR 2026 - STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
Haipeng Luo#, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong Tang
arXiv preprint arXiv:2606.19236 - VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct
Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang
arXiv preprint arXiv:2606.23543 - AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation
Mengkang Hu, Pu Zhao, Can Xu, Qingfeng Sun, Jianguang Lou, Qingwei Lin, Ping Luo, Saravan Rajmohan, Dongmei Zhang
KDD 2025 - OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents
Yuhang Zhou, Kai Zheng, Qiguang Chen, Mengkang Hu, Qingfeng Sun, Can Xu, Jingjing Chen
arXiv preprint arXiv:2601.18467 - WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models
Huawen Feng#, Pu Zhao, Qingfeng Sun, Can Xu, Fangkai Yang, Lu Wang, Qianli Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang
ACL 2025 - WizardCoder: Empowering Code Large Language Models with Evol-Instruct
Ziyang Luo, Can Xu, Pu Zhao, Qingfeng Sun, Xiubo Geng, Wenxiang Hu, Chongyang Tao, Jing Ma, Qingwei Lin, Daxin Jiang
ICLR 2024
RLVR & RLHF:
- WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
Haipeng Luo#, Qingfeng Sun#, Can Xu, Pu Zhao, Jianguang Lou, Chongyang Tao, Xiubo Geng, Qingwei Lin, Shifeng Chen, Dongmei Zhang
ICLR 2025,Oral Paper - WizardArena: Post-training Large Language Models via Simulated Offline Chatbot Arena
Haipeng Luo#*, Qingfeng Sun*, Can Xu, Pu Zhao, Qingwei Lin, Jianguang Lou, Shifeng Chen, Yansong Tang, Weizhu Chen
NeurIPS 2024 - RubricBench: Aligning Model-Generated Rubrics with Human Standards
Qiyuan Zhang, Junyi Zhou, Yufei Wang, Fuyuan Lyu, Yidong Ming, Can Xu, Qingfeng Sun, Kai Zheng, Peng Kang, Xue Liu, Chen Ma
ACL 2026 - Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models
Qiyuan Zhang, Yufei Wang, Tianhe Wu, Can Xu, Qingfeng Sun, Kai Zheng, Xue Liu, Chen Ma
ACL 2026, Findings - Zero Reinforcement Learning Towards General Domains
Yuyuan Zeng, Yufei Huang, Can Xu, Qingfeng Sun, Jianfeng Yan, Guanghui Xu, Tao Yang, Fengzong Lian
arXiv preprint arXiv:2510.25528
General LLM & VLM:
- Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought
Tencent Hunyuan Team, Core Contributor
arXiv preprint arXiv:2505.15431 - WizardLM: Empowering Large Language Models to Follow Complex Instructions
Can Xu*, Qingfeng Sun*, Kai Zheng*, Xiubo Geng, Pu Zhao, Jiazhan Feng, Chongyang Tao, Daxin Jiang
ICLR 2024 - MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain Conversation
Jiazhan Feng#, Qingfeng Sun, Can Xu, Pu Zhao, Yaming Yang, Chongyang Tao, Dongyan Zhao, Qingwei Lin
ACL 2023 - Multimodal Dialogue Response Generation
Qingfeng Sun, Yujing Wang, Can Xu, Kai Zheng, Yaming Yang, Huang Hu, Fei Xu, Jessica Zhang, Xiubo Geng, Daxin Jiang
ACL 2022 - Stylized Knowledge-Grounded Dialogue Generation via Disentangled Template Rewriting
Qingfeng Sun, Can Xu, Huang Hu, Yujing Wang, Jian Miao, Xiubo Geng, Yining Chen, Fei Xu, Daxin Jiang
NAACL 2022,Oral Paper
Open-source Projects
(showing only those I’m the project lead):
- WizardLM LLMs Family: WizardLM, WizardCoder, WizardMath
- STARE Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
- Llama-X Open Academic Research on Improving LLaMA to SOTA LLM
- MMDialog A Large-scale Multi-turn Dataset Towards VLM
- PromDA Prompt-based Data Augmentation for Low-Resource NLU Tasks
Experiences
- Dec. 2024 - Now, Senior Researcher, Tencent Hunyuan X.
- July. 2020 - Dec. 2024, Research Scientist, Microsoft AI.
- Sept. 2018 - June. 2020, Research Intern, Microsoft XiaoIce.
Academic Services
Program Committee for
- ICLR 2025, 2026
- NeurIPS 2024
- NAACL 2024
- ACL 2023, 2026
- EACL 2023
- KDD 2022, 2023
- EMNLP 2022
- COLING 2022