Back to papers
September 28, 2026cs.CLcs.AIcs.LG

Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability

Categories

cs.CL, cs.AI, cs.LG

Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability | One9Founders