Leaderboard
All models × all benchmarks. Green cells = near max score for that benchmark.
Top score
Mid range
Lower score
— = no data| Model | SWE-bench | HumanEval / HumanEval+ | LiveCodeBench | SWE-Lancer | MATH Benchmark | AIME | GSM8K | GPQA Diamond | BIG-Bench Hard | TruthfulQA | ARC-Challenge | HellaSwag | MMLU / MMLU-Pro | τ-bench (tau-bench) | WebArena / VisualWebArena | AgentBench | TheAgentCompany | GAIA | SW-A²-Bench | LMSYS Chatbot Arena | LiveBench | VS-Bench (Visual Strategic Bench) | WorldBench |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
GPT-5OpenAI | 74.9%v | 96.9%v | ~79%v | 66.3%v | ~95%+v | 94.6%v | 99.7%v | 85.7%v | ~91%v | ~75%v | ~97%v | 96.4%v | 93.0%v | ~79% | 58.1% | 6.8 | ~24% | 67.0%v | — | ~1426 Elo | ~82% | — | — |
Opus 4.5Anthropic | 80.9% | 95.7%v | 87.1% | — | ~97%v | 92.77%v | ~98.5%v | 87.0%v | 93.1% | ~78%v | ~96.5%v | ~96%v | 90.8%v | ~56% | 71.6% | ~6.2 | — | ~57% | — | ~1468 Elo | ~79% | — | — |
GPT-4oOpenAI | — | — | — | ~9% | 76.6%v | ~11%v | 96.1%v | 74.8%v | ~83% | ~69% | ~96%v | 95.7%v | 88.7%v | ~25% | 14.41% | 4.27 | 8.6% | ~15% | — | ~1345 Elo | ~53% | — | — |
Gemini 2.5 ProGoogle | 67.2% (multi)v | 94.2%v | — | — | — | 88.0%v | ~98%v | 86.4%v | 89.2% | — | — | — | 89.2%v | ~48% | ~48% | — | 30.3% | ~52% | — | 1448 Elo | ~76% | 83.4% | — |
Llama 4 MaverickMeta OSS | — | 88.5%v | — | — | 88.9%v | — | ~95%v | 69.8%v | ~85%v | ~62%v | 92.3%v | ~95%v | 87.8%v | — | — | — | ~7.4% | — | — | ~1417 Elo | ~67% | — | — |
Sonnet 4Anthropic | 72.7%v | — | — | 26.2% | 97.2%v | — | — | 75.4%v | 93.1% | ~72%v | — | — | — | 84.7% | ~42% | ~5.2 | 26.3% | — | — | ~1410 Elo | — | — | — |
DeepSeek V3DeepSeek OSS | 42.0%v | 90.2%v | — | — | 90.2%v | — | — | 59.1%v | ~87%v | ~60% | 95.2%v | 95.8%v | 88.2%v | — | — | ~4.5 | — | — | — | ~1363 Elo | — | — | — |
Qwen 3 72BAlibaba OSS | — | 92.7%v | 83.6%v | — | 96.4%v | 79.2%v | ~97%v | ~78%v | ~88%v | — | ~94%v | ~95%v | 88.7%v | — | — | — | — | — | — | — | ~73% | — | — |
o3OpenAI | 69.1%v | — | — | 37.3%v | ~97%v | 96.7%v | 99.2%v | 87.7%v | — | — | 98.1%v | — | — | — | — | — | — | — | — | ~1411 Elo | — | 84.9% | — |
DeepSeek R1DeepSeek OSS | 49.2%v | — | 87.1%v | — | 97.3%v | 79.8%v | 97.7%v | 71.5%v | — | — | — | — | 90.8%v | — | — | — | — | — | — | — | ~72% | — | — |
o4-miniOpenAI | 68.1%v | 97.6%v | 85.9%v | — | ~96%v | 93.4%v | — | 81.4%v | — | — | — | — | — | — | — | — | — | — | — | — | 87.3% | — | — |
Opus 4.6Anthropic | 80.8% | — | — | — | ~97–98%v | 99.79%v | — | 91.3%v | — | — | — | — | ~90.8%v | — | — | — | — | — | — | 1549 Elo (Coding) | — | — | — |
Gemini 3 ProGoogle | — | — | 91.7% | — | 96.4%v | ~93%v | — | 94.3% | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
Mistral Large 3Mistral | — | — | — | — | 93.6%v | — | ~93%v | — | — | ~65%v | — | — | 87.1%v | — | — | — | — | — | — | — | — | — | — |
Grok 4xAI | — | — | — | — | — | 100% (Heavy)v | — | 87.5–88.9%v | — | — | — | — | 92.7%v | — | — | — | — | — | — | — | — | — | — |
Kimi K2.6Moonshot OSS | 80.2%v | — | 89.6%v | — | — | — | — | — | — | — | — | — | ~86%v | — | — | — | — | — | — | — | — | — | — |
M2.5MiniMax OSS | 80.2%v | — | — | — | — | — | — | — | — | — | — | — | ~86.5%v | — | — | — | — | — | — | — | — | — | — |
Grok 3xAI | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1402 Elo | — | — | — |
Gemini 3.1 ProGoogle | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 64.0% avg accuracy |
Gemini 3 FlashGoogle | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 61.8% avg accuracy |
Qwen3.5-VL-Plus (Thinking)Alibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 59.3% avg accuracy |
GPT-5.4 ThinkingOpenAI | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58.2% avg accuracy (Thinking, high effort) |
Qwen3.5-VL-27BAlibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 56.6% avg accuracy |
Claude Opus 4.7Anthropic | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.7% avg accuracy |
Grok 4.2xAI | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.3% avg accuracy |
Qwen3.5-VL-35B-A3BAlibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 52.9% avg accuracy |
Kimi K2.5Moonshot | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 52.5% avg accuracy |
Gemma 4 31BGoogle | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.7% avg accuracy |
Qwen3.5-VL-Plus (Instruct)Alibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 48.7% avg accuracy |
GLM-4.6VOther | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 42.5% avg accuracy |
InternVL3.5Other | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 41.2% avg accuracy |
Gemma 4 E4BGoogle | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 34.6% avg accuracy |
Claude 3.7 SonnetAnthropic | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.1% | — |
GPT-4.1OpenAI | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.3% | — |
UI-TARS-1.5Other | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.5% | — |
Doubao-1.5-Thinking-ProOther | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.7% | — |
QVQ-MaxAlibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.5% | — |
Qwen-VL-MaxAlibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.2% | — |
Doubao-1.5-Vision-ProOther | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.6% | — |
Grok-2 VisionxAI | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.2% | — |
Qwen2.5-VL-72BAlibaba | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.3% | — |
InternVL3-78BOther | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.1% | — |
Llama 3.2 90B VisionMeta | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.8% | — |
Claude Sonnet 4.5Anthropic | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 36.9% Overall Execution SR (via Claude Code scaffold) | — | — | — | — |
GPT-5.2-CodexOpenAI | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 34.5% Overall Execution SR (via Codex CLI scaffold) | — | — | — | — |
Gpt 5 5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
Claude Fable 5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
Grok 4 5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
Gpt 5 6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |
Scores reflect best available result per model per benchmark. v = vendor self-reported. Benchmark names truncated — click to view full details.