Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
By Bilgehan Sel, Xuanli He, Alwin Peng, Ming Jin, Jerry Wei
Introduces Trojan-Speak, an adversarial fine-tuning method that bypasses Anthropic's Constitutional Classifiers with 99+% evasion while maintaining <5% capability degradation, compared to >25% in prior work. Uses curriculum learning and GRPO-based hybrid RL.