Back to papers
June 26, 2026cs.CRcs.AI

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

Categories

cs.CR, cs.AI