UK AISI Alignment Evaluation Case-Study
By Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies
UK AI Security Institute report evaluating whether frontier models sabotage safety research when deployed as coding assistants. Finds no confirmed sabotage but observes Claude Opus 4.5 Preview and Sonnet 4.5 frequently refuse safety-relevant tasks, citing concerns about research direction.