When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning
Researchers demonstrate that even benign fine-tuning can severely degrade LLM safety alignment by selectively sharpening pathways in model internals that bypass refusal mechanisms, revealing a previously underexamined geometric explanation for alignment fragility.