📝 Publications
- Reasoning and Tool-use Compete in Agentic RL: From Quantifying Interference to Disentangled Tuning
Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang
EMNLP 2026 Oral - ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment
Xiuyu Li*, Jinkai Zhang*, Mingyang Yi, Yu Li, Longqiang Wang, Yue Wang, Ju Fan
ICML 2026
PrePrints
- Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment
Yu Li*, Xiuyu Li*, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen
Preprint