Agent Arena
Benchmark AI models on real agent work
A platform that ranks AI models using outcomes from real agentic sessions, including leaderboard and token-efficiency comparisons.

Recent stories
2 linked stories
newsSECONDARY2026-08-31
Benchmark author says GLM-5.3-Flash rerun improves scores after routing error
A benchmark author says OpenRouter likely routed GLM-5.3-Flash requests to quantized endpoints because precision was not pinned. Twelve reruns using pinned FP8 and self-hosted inference improved results, suggesting earlier scores may have reflected routing.
newsPRIMARY2026-07-29
Agent Arena ranks Claude Opus 5 Max No. 2 across 7,000+ agent sessions
Agent Arena says Claude Opus 5 Max placed second and Opus 5 High placed third across more than 7,000 real agentic sessions. Practitioner reports remain mixed across harnesses and prompting styles.