Publications
All Publications
Comprehensive list — accepted papers, under-review submissions, and in-preparation work. For the most current bibliographic information, please refer to my Google Scholar profile.
30 Total
17 Published
10 Under Review
3 In Preparation
Conference Paper
- COLM2026I-DLM: Introspective Diffusion Language Models Yifan Yu, Yuqing Jian, Junxiong Wang, , Donglin Zhuang, Xinyu Fang, Sri Yanamandra, Xiaoxia Wu, Qingyang Wu, Shuaiwen Leon Song, Tri Dao, Ben Athiwaratkun, James Zou, Fan Lai, Chenfeng Xu
Introspective strided decoding for diffusion language models.
- COLM2026Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution Monishwaran Maheswaran, Leon Lakhani, , Shijia Yang, Junxiong Wang, Coleman Hooper, Yuezhou Hu, Rishabh Tiwari, Jue Wang, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, Tri Dao, Xiaoxia Wu, Ben Athiwaratkun, James Zou, Chenfeng Xu
Unified multi-model orchestration for verifier-free evolution.
- ICLR2026
- ICML2026Aurora: When RL Meets Adaptive Speculative Training — A Unified Training-Serving System Junxiong Wang*, Fengxiang Bie*, Jisen Li, Zelei Shao, Yubo Wang, Yinghui Liu, Qingyang Wu, Avner May, Sri Yanamandra, Ce Zhang, Tri Dao, Percy Liang, Ben Athiwaratkun, Shuaiwen Leon Song, , Chenfeng Xu, Xiaoxia Wu
- Technical Article2026
- MLSys2026KITTY: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost Haojun Xia, Xiaoxia Wu, Jisen Li, Robert Wu, Junxiong Wang, Jue Wang, Chenxi Li, Aman Singhal, Alay Dilipbhai Shah, Alpay Ariyak, Donglin Zhuang, , Ben Athiwaratkun, Zhen Zheng, Shuaiwen Leon Song
- Together AI Blog2026CoderForge-Preview: SOTA open dataset for training efficient coding agents Alpay Ariyak*, Junda Zhang, Junxiong Wang, Shang Zhu, Federico Bianchi, Sanjana Srivastava, Ashwinee Panda, Siddhant Bharti, Chenfeng Xu, John Heo, Xiaoxia Shirley Wu, James Zou, Percy Liang, Leon Song, Ce Zhang, Ben Athiwaratkun, , Qingyang Wu*
Project core lead.
- ICML2025
- NeurIPS2024
- USENIX ATC2024Quant-LLM: Accelerating the Serving of Large Language Models via FP6-Centric Algorithm-System Co-Design on Modern GPU Haojun Xia, Zhen Zheng, Xiaoxia Wu, Shiyang Chen, Zhewei Yao, Stephen Youn, Arash Bakhtiari, Michael Wyatt, Donglin Zhuang, , Olatunji Ruwase, Yuxiong He, Shuaiwen Leon Song
- VLDB2024
- ICSE2020
Journal Paper
- IEEE TPAMI2025RenAIssance: A Survey into AI Text-to-Image Generation in the Era of Large Models Fengxiang Bie, Yibo Yang, , Adam Ghanem, Minjia Zhang, Zhewei Yao, Xiaoxia Wu, Connor Holmes, Pareesa Golnari, David A. Clifton, Yuxiong He, Dacheng Tao, Shuaiwen Leon Song
Survey Papers track.
- Sensors (MDPI)2021Binary Neural Network for Automated Visual Surface Defect Detection Wenzhe Liu, Jiehua Zhang, Zhou Su, , Li Liu
Special Issue on Intelligent Sensing and Monitoring for Industrial Process.
Under Review
- arXiv + Under Review2026Tail-Likelihood Reinforcement Learning Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar, Guanning Zeng, Qingyang Wu, , Chenfeng Xu, Haiwen Feng, Yuda Song, Aarti Singh, Ruslan Salakhutdinov, J. Andrew Bagnell, Jeff Schneider, Andrea Zanette
Tail-likelihood objective for preserving rare high-reward rollouts and improving Best-of-k inference-time scaling.
- arXiv + Under Review2026Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, , Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo
Featured in an in-depth interview by Synced (机器之心 Pro), reaching 3,839 reads.
- arXiv + Under Review · ACL 20262026
- arXiv + Under Review2026
- arXiv + Under Review · COLM 20262026Sketched Linear Contrastive Learning: Approximation, Optimization, and Statistical Scaling Ziyan Chen, , Dingxuan Zhou
- arXiv + Under Review2026From One-Pass SGD to Data Reuse: Mini-Batch Scaling Laws in Sketched Linear Regression Ziyan Chen, , Dingxuan Zhou
- arXiv + Under Review2026
- Ph.D. Thesis · University of Sydney2026Efficient Compression Algorithm-System Co-Design for Large-Scale Model Training and Inference
Doctor of Philosophy (Engineering) thesis at The University of Sydney.
- arXiv + Under Review · ICLR 20262026
- arXiv + Under Review2026Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient , Yibo Yang, Ziyan Chen, Fengxiang Bie, Haojun Xia, Xiaoxia Wu, Robert Wu, Ben Athiwaratkun, Bernard Ghanem, Shuaiwen Leon Song
In Preparation
- In Preparation2026Hierarchical Performance Isolation for Distributed LLM et al.
- In Preparation2026Bio-Inspired LLM-Based Multiagent Systems et al.
- In Preparation2026AgentGo: Agent Self-Guided Optimized Program Scheduling for Tool-Using Large Language Models et al.
Preprint Paper
- arXiv2023DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales Zhewei Yao, Reza Yazdani Aminabadi, Olatunji Ruwase, Samyam Rajbhandari, Xiaoxia Wu, Ammar Ahmad Awan, Jeff Rasley, Minjia Zhang, Conglong Li, Connor Holmes, , Michael Wyatt, Molly Smith, Lev Kurilenko, Heyang Qin, Masahiro Tanaka, Shuai Che, Shuaiwen Leon Song, Yuxiong He
- arXiv2023DeepSpeed4Science Initiative: Enabling Large-Scale Scientific Discovery through Sophisticated AI System Technologies Shuaiwen Leon Song, Bonnie Kruft, Minjia Zhang, Conglong Li, Shiyang Chen, Chengming Zhang, Masahiro Tanaka, Xiaoxia Wu, Jeff Rasley, Ammar Ahmad Awan, Connor Holmes, Martin Cai, Adam Ghanem, , et al.
Book
- Tianjin Univ. Press