When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models
By Katherine Elkins, Jon Chun
Audits 16 LLMs on negation sensitivity, finding open-source models interpret prohibitions as permissions 77-100% of the time under negation. Commercial models also show 19-128% accuracy swings.