Back to papers
July 2, 2026cs.AIcs.LG

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

Categories

cs.AI, cs.LG