GPT-Red: Automated Red Teaming via Self-Play at Scale
By Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen
GPT-Red introduces an automated red-teaming agent trained via scalable self-play to discover prompt injection attacks against frontier models. It was used to adversarially train GPT-5.6, representing a massive safety training run.