AI Benchmark Leaderboard & Top Models Rankings

Verified evaluations across LiveBench contamination-free benchmarks, Artificial Analysis intelligence indices, and Autonomous Coding Agents as of September 2026.

Artificial Analysis Agent Index v1.5Showing 9 verified autonomous agents
RankAutonomous AgentUnderlying ModelAgent IndexDeepSWE v1.1Terminal-Bench 4.0SWE-AtlasAvg Cost / TaskMode
#1
Claude Codeby Anthropic
Claude 3.7 Sonnet (Thinking)78.472.8%68.5%81.2%$0.85cli
#2
Codex 2.0by OpenAI
OpenAI o377.271.0%67.0%80.5%$0.92cloud-sandbox
#3
Devin v2by Cognition AI
Claude 3.7 Sonnet + o3-mini76.570.4%65.8%79.0%$1.40cloud-sandbox
#4
Cursor Agent (v0.45)by Anysphere
Claude 3.7 Sonnet / DeepSeek-V375.869.2%66.2%78.4%$0.68ide-extension
#5
Windsurf Cascadeby Codeium
Claude 3.5 Sonnet / o3-mini74.968.0%64.5%77.0%$0.55ide-extension
#6
Aider CLIby Paul Gauthier
DeepSeek-R1 / Claude 3.7 Sonnet74.267.5%65.0%76.8%$0.48cli
#7
Cline / Roo Codeby Roo / Cline Community
DeepSeek-R1 / Claude 3.7 Sonnet73.566.8%63.8%75.5%$0.42ide-extension
#8
GitHub Copilot Workspaceby GitHub / Microsoft
OpenAI o3-mini / GPT-4o72.865.0%62.0%75.0%$0.75cloud-sandbox
#9
OpenCode Agentby Open Source Collective
DeepSeek-V3 / Qwen 2.5 Coder71.063.2%60.5%73.0%$0.22cli