AI Benchmark Leaderboard & Top Models Rankings
Verified evaluations across LiveBench contamination-free benchmarks, Artificial Analysis intelligence indices, and Autonomous Coding Agents as of September 2026.
Artificial Analysis Agent Index v1.5Showing 9 verified autonomous agents
| Rank | Autonomous Agent | Underlying Model | Agent Index | DeepSWE v1.1 | Terminal-Bench 4.0 | SWE-Atlas | Avg Cost / Task | Mode |
|---|---|---|---|---|---|---|---|---|
| #1 | Claude Codeby Anthropic | Claude 3.7 Sonnet (Thinking) | 78.4 | 72.8% | 68.5% | 81.2% | $0.85 | cli |
| #2 | Codex 2.0by OpenAI | OpenAI o3 | 77.2 | 71.0% | 67.0% | 80.5% | $0.92 | cloud-sandbox |
| #3 | Devin v2by Cognition AI | Claude 3.7 Sonnet + o3-mini | 76.5 | 70.4% | 65.8% | 79.0% | $1.40 | cloud-sandbox |
| #4 | Cursor Agent (v0.45)by Anysphere | Claude 3.7 Sonnet / DeepSeek-V3 | 75.8 | 69.2% | 66.2% | 78.4% | $0.68 | ide-extension |
| #5 | Windsurf Cascadeby Codeium | Claude 3.5 Sonnet / o3-mini | 74.9 | 68.0% | 64.5% | 77.0% | $0.55 | ide-extension |
| #6 | Aider CLIby Paul Gauthier | DeepSeek-R1 / Claude 3.7 Sonnet | 74.2 | 67.5% | 65.0% | 76.8% | $0.48 | cli |
| #7 | Cline / Roo Codeby Roo / Cline Community | DeepSeek-R1 / Claude 3.7 Sonnet | 73.5 | 66.8% | 63.8% | 75.5% | $0.42 | ide-extension |
| #8 | GitHub Copilot Workspaceby GitHub / Microsoft | OpenAI o3-mini / GPT-4o | 72.8 | 65.0% | 62.0% | 75.0% | $0.75 | cloud-sandbox |
| #9 | OpenCode Agentby Open Source Collective | DeepSeek-V3 / Qwen 2.5 Coder | 71.0 | 63.2% | 60.5% | 73.0% | $0.22 | cli |