RAGEN-2: Reasoning Collapse in Agentic RL
By Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li
As reported in Research yesterday, RAGEN-2 identifies 'template collapse' in multi-turn RL training of LLM agents, where models produce input-agnostic responses that appear diverse by entropy metrics but fail to adapt to different inputs. They decompose reasoning quality into within-input diversity (entropy) and cross-input distinguishability (mutual information) and propose MI-based proxies for online monitoring. This addresses a critical blind spot in current agentic RL training diagnostics.