Back to papers
March 24, 2026cs.CRcs.AIcs.CYcs.LG

Robust Safety Monitoring of Language Models via Activation Watermarking

Categories

cs.CR, cs.AI, cs.CY, cs.LG