Explore
Stack
Learn
Search the catalog
⌘K
$
/
₹
Sign up free
Login
Back to papers
September 8, 2026
cs.LG
cs.CL
Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
Jiacheng Xu
,
Feng Chen
,
Xiuneng Xu
,
Bo An
Original Abstract
Read on arXiv
Download PDF
Categories
cs.LG, cs.CL
Entropy-Regularized Rank-Masked Policy | One9Founders