Explore
Stack
Learn
Search the catalog
⌘K
$
/
₹
Sign up free
Login
Back to papers
September 3, 2026
cs.AI
From Deceptive Outputs to Deceptive Mechanisms: A Causal Framework for Language-Model Deception Research
Yakov Pyotr Shkolnikov
Original Abstract
Read on arXiv
Download PDF
Categories
cs.AI