Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models
By Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig
Analysis of reasoning-trained models shows that deliberative behaviors like self-correction are amplified far more than correctness-linked behaviors such as calibration, exposing a gap between visible reasoning patterns and actual problem-solving quality.