Back to papers
June 30, 2026cs.LGstat.ML

Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions

Categories

cs.LG, stat.ML