Back to papers
March 24, 2026cs.LGcs.AI
SafeSeek: Universal Attribution of Safety Circuits in Language Models
Miao Yu, Siyuan Fu, Moayad Aloqaily, Zhenhong Zhou, Safa Otoum, Xing fan, Kun Wang, Yufei Guo, Qingsong Wen
Categories
cs.LG, cs.AI
cs.LG, cs.AI