Back to papers
August 18, 2026cs.LGcs.CL

An Empirical Study of Reward Specification and Benchmark Reliability in GRPO-based LLM Unlearning

Categories

cs.LG, cs.CL