Selected Preprints and Publications
† indicates these authors contributed equally to this work. See my Google Scholar for earlier publications.
Publications

Your Benchmark Is an Empirical Measure Over Difficulty
Yifan Sun†, Naicheng Yu†, Jiawen Gong†, Jingyan Shen, Huan Zhang
NeurIPS · 2026

Understanding Reasoning from Pretraining to Post-Training
Jingyan Shen†, Ang Li†, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov
NeurIPS · 2026

When Reasoning Meets Its Laws
Junyu Zhang†, Yifan Sun†, Tianang Leng†, Jingyan Shen†, Ziyin Liu, Paul Pu Liang, Huan Zhang
NeurIPS · 2026

MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
Han Wang†, Yifan Sun†, Brian Ko†, Mann Talati, Jiawen Gong, Zimeng Li, Naicheng Yu, Xucheng Yu, Wei Shen, Vedant Jolly, Huan Zhang
COLM · 2026

Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs
Kairun Zhang†, Haoyu Li†, Yanjun Zhao†, Yifan Sun, Huan Zhang
ICML · 2026

Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-Tuning
Sirui Chen†, Yunzhe Qi†, Mengting Ai, Yifan Sun, Ruizhong Qiu, Jiaru Zou, Jingrui He
ICLR · 2026

Improving Data Efficiency for LLM Reinforcement Fine-Tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
Yifan Sun†, Jingyan Shen†, Yibin Wang†, Tianyu Chen, Zhendong Wang, Mingyuan Zhou, Huan Zhang
NeurIPS · 2025

MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
Jingyan Shen†, Jiarui Yao†, Rui Yang†, Yifan Sun, Feng Luo, Rui Pan, Tong Zhang, Han Zhao
EMNLP (Main Conference) · 2025
Outstanding Paper Award (7 selected out of 8,174 submissions)

AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
Feiyang Kang†, Yifan Sun†, Bingbing Wen, Si Chen, Dawn Song, Rafid Mahmood, Ruoxi Jia
COLM · 2025

The Emperor’s New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
Yifan Sun†, Han Wang†, Dongbai Li†, Gang Wang, Huan Zhang
ICML · 2025

Data Acquisition: A New Frontier in Data-centric AI
Lingjiao Chen, Bilge Acun, Newsha Ardalani, Yifan Sun, Feiyang Kang, Hanrui Lyu, Yongchan Kwon, Ruoxi Jia, Carole-Jean Wu, Matei Zaharia, James Zou
Journal of Data-centric Machine Learning Research · 2025

2D-OOB: Attributing Data Contribution through Joint Valuation Framework
Yifan Sun†, Jingyan Shen†, Yongchan Kwon
NeurIPS · 2024

Get More for Less: Principled Data Selection for Warming Up Fine-Tuning in LLMs
Feiyang Kang, Hoang Anh Just†, Yifan Sun†, Himanshu Jahagirdar†, Yuanzhi Zhang, Rongxing Du, Anit Kumar Sahu, Ruoxi Jia
ICLR · 2024
Preprints

SVIP: Towards Verifiable Inference of Open-source Large Language Models
Yifan Sun†, Yuhang Li†, Yue Zhang, Yuchen Jin, Huan Zhang
Socially Responsible and Trustworthy Foundation Models Workshop at NeurIPS 2025 (Oral Presentation) · 2025

Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains
Luca Viano, Ruida Zhou, Yifan Sun, Mahdi Namazifar, Volkan Cevher, Shoham Sabach, Mohammad Ghavamzadeh
Preprint · 2026