ONE9FOUNDERS
New ToolsAI AgentsOne9 WorkerLLMsRAG & Vector DBsResearchAssemble a stackFounder Stacks
CompareHow We RateAbout
Back to papers
July 6, 2026cs.AI

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang
Read on arXivDownload PDF
Categories

cs.AI

ONE9FOUNDERS

India's largest AI ecosystem navigator for startup founders.

Mumbai, Maharashtra, India | hello@one9founders.com

IIT Bombay

Supported by IIT Bombay

Navigate

  • Explore AI Tools
  • New AI Tools
  • LLM Explorer
  • Research Papers
  • AI Agents
  • Assemble a stack
  • One9 Worker
  • Compare Tools

Company

  • About
  • For Colleges & Corporates
  • How We Rate
  • Terms
  • Privacy Policy

More

  • For Corporates
  • AI Training
  • Submit a Tool
  • Contact Us

© 2026 One9Founders. All rights reserved.

Get Smarter About AI Tools. Every Tuesday.

Join 5,000+ founders getting weekly security alerts, exclusive deals, and our honest picks.