Understanding Emergent Misalignment via Feature Superposition Geometry
By Gouki Minegishi, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo
As covered in Research yesterday, Proposes a geometric explanation for emergent misalignment in LLMs based on feature superposition: fine-tuning that amplifies a target feature unintentionally strengthens nearby harmful features due to overlapping representations. Tested on Gemma-2, LLaMA-3.1, and GPT-OSS using sparse autoencoders.