Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
By Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng
Continuing our coverage from yesterday, Presents a unified recipe for converting post-trained reasoning models into olympiad-level solvers using reverse-perplexity curriculum SFT, two-stage RL (verifiable rewards then proof-level RL), and test-time scaling. Achieves gold-medal level on IMO/IPhO problems.