SPADE: Self-Play in Adaptive Synthetic Executable Environments
By Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
SPADE is a self-play RL framework where a single LLM acts as both an Environment Designer writing executable Gym-style training environments and a Reasoning Agent that learns within them. Targets continuous self-improvement with diverse, adaptive goals beyond fixed environment pools.