Explore
AI Tools
New Tools
AI Agents
One9 Worker
LLMs
RAG & Vector DBs
Research
Assemble a stack
Founder Stacks
Compare
How We Rate
About
$
/
₹
⌘K
Sign up free
Login
Back to papers
July 29, 2026
cs.CL
SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
Jianze Wang
,
Kunwang Zheng
,
Ying Liu
,
Yu Cao
,
Qilong Zhang
,
Jinlong Chen
,
Hua Yang
,
Qianglong Chen
Original Abstract
Read on arXiv
Download PDF
Categories
cs.CL