benchmark.darvinyi.com

Leaderboard

All models × all benchmarks. Green cells = near max score for that benchmark.

Top score
Mid range
Lower score
— = no data
ModelSWE-benchHumanEval / HumanEval+LiveCodeBenchSWE-LancerMATH BenchmarkAIMEGSM8KGPQA DiamondBIG-Bench HardTruthfulQAARC-ChallengeHellaSwagMMLU / MMLU-Proτ-bench (tau-bench)WebArena / VisualWebArenaAgentBenchTheAgentCompanyGAIASW-A²-BenchLMSYS Chatbot ArenaLiveBenchVS-Bench (Visual Strategic Bench)WorldBench
GPT-5OpenAI
74.9%v
96.9%v
~79%v
66.3%v
~95%+v
94.6%v
99.7%v
85.7%v
~91%v
~75%v
~97%v
96.4%v
93.0%v
~79%
58.1%
6.8
~24%
67.0%v
~1426 Elo
~82%
Opus 4.5Anthropic
80.9%
95.7%v
87.1%
~97%v
92.77%v
~98.5%v
87.0%v
93.1%
~78%v
~96.5%v
~96%v
90.8%v
~56%
71.6%
~6.2
~57%
~1468 Elo
~79%
GPT-4oOpenAI
~9%
76.6%v
~11%v
96.1%v
74.8%v
~83%
~69%
~96%v
95.7%v
88.7%v
~25%
14.41%
4.27
8.6%
~15%
~1345 Elo
~53%
Gemini 2.5 ProGoogle
67.2% (multi)v
94.2%v
88.0%v
~98%v
86.4%v
89.2%
89.2%v
~48%
~48%
30.3%
~52%
1448 Elo
~76%
83.4%
Llama 4 MaverickMeta
OSS
88.5%v
88.9%v
~95%v
69.8%v
~85%v
~62%v
92.3%v
~95%v
87.8%v
~7.4%
~1417 Elo
~67%
Sonnet 4Anthropic
72.7%v
26.2%
97.2%v
75.4%v
93.1%
~72%v
84.7%
~42%
~5.2
26.3%
~1410 Elo
DeepSeek V3DeepSeek
OSS
42.0%v
90.2%v
90.2%v
59.1%v
~87%v
~60%
95.2%v
95.8%v
88.2%v
~4.5
~1363 Elo
Qwen 3 72BAlibaba
OSS
92.7%v
83.6%v
96.4%v
79.2%v
~97%v
~78%v
~88%v
~94%v
~95%v
88.7%v
~73%
o3OpenAI
69.1%v
37.3%v
~97%v
96.7%v
99.2%v
87.7%v
98.1%v
~1411 Elo
84.9%
DeepSeek R1DeepSeek
OSS
49.2%v
87.1%v
97.3%v
79.8%v
97.7%v
71.5%v
90.8%v
~72%
o4-miniOpenAI
68.1%v
97.6%v
85.9%v
~96%v
93.4%v
81.4%v
87.3%
Opus 4.6Anthropic
80.8%
~97–98%v
99.79%v
91.3%v
~90.8%v
1549 Elo (Coding)
Gemini 3 ProGoogle
91.7%
96.4%v
~93%v
94.3%
Mistral Large 3Mistral
93.6%v
~93%v
~65%v
87.1%v
Grok 4xAI
100% (Heavy)v
87.5–88.9%v
92.7%v
Kimi K2.6Moonshot
OSS
80.2%v
89.6%v
~86%v
M2.5MiniMax
OSS
80.2%v
~86.5%v
Grok 3xAI
1402 Elo
Gemini 3.1 ProGoogle
64.0% avg accuracy
Gemini 3 FlashGoogle
61.8% avg accuracy
Qwen3.5-VL-Plus (Thinking)Alibaba
59.3% avg accuracy
GPT-5.4 ThinkingOpenAI
58.2% avg accuracy (Thinking, high effort)
Qwen3.5-VL-27BAlibaba
56.6% avg accuracy
Claude Opus 4.7Anthropic
53.7% avg accuracy
Grok 4.2xAI
53.3% avg accuracy
Qwen3.5-VL-35B-A3BAlibaba
52.9% avg accuracy
Kimi K2.5Moonshot
52.5% avg accuracy
Gemma 4 31BGoogle
49.7% avg accuracy
Qwen3.5-VL-Plus (Instruct)Alibaba
48.7% avg accuracy
GLM-4.6VOther
42.5% avg accuracy
InternVL3.5Other
41.2% avg accuracy
Gemma 4 E4BGoogle
34.6% avg accuracy
Claude 3.7 SonnetAnthropic
81.1%
GPT-4.1OpenAI
80.3%
UI-TARS-1.5Other
81.5%
Doubao-1.5-Thinking-ProOther
74.7%
QVQ-MaxAlibaba
74.5%
Qwen-VL-MaxAlibaba
80.2%
Doubao-1.5-Vision-ProOther
77.6%
Grok-2 VisionxAI
70.2%
Qwen2.5-VL-72BAlibaba
80.3%
InternVL3-78BOther
74.1%
Llama 3.2 90B VisionMeta
67.8%
Claude Sonnet 4.5Anthropic
36.9% Overall Execution SR (via Claude Code scaffold)
GPT-5.2-CodexOpenAI
34.5% Overall Execution SR (via Codex CLI scaffold)
Gpt 5 5
Claude Fable 5
Grok 4 5
Gpt 5 6

Scores reflect best available result per model per benchmark. v = vendor self-reported. Benchmark names truncated — click to view full details.