Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
By Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng
Introduces a simple and unified recipe for achieving gold-medal-level Olympiad reasoning: reverse-perplexity curriculum SFT, two-stage RL (verifiable rewards then proof-level RL), and test-time scaling with a verification ensemble.