Live AI Benchmark Intelligence

AI Leaderboard & Model Comparisons

Independent, verifiable rankings of GPT, Claude, Gemini, Llama, DeepSeek and 100+ frontier AI models. Evaluated continuously by Composite TrueSkill, coding benchmarks, output speed, and live API token pricing.

Head-to-Head AI Benchmarking & Pareto Analysis
● LIVE BENCHMARK EVALQ3 2026
Leads on reasoning
GPT-5.6 Sol
94.6% GPQA (56.8)
Wins at coding
Claude Opus 5
2,668 Arena ELO
Cheapest in Top 10
DeepSeek-V4 Pro
$0.48 / M tokens
Fastest output
Gemini 3.7 Flash
621 tok/s speed
Longest context
Grok 4.5
2.0M Tokens Window
Best open-weights
Kimi K3
93.5% GPQA (MoE)

Best AI for Coding

Code generation, debugging & refactoring

Best AI for Writing

Prose, tone matching & creative content

Best AI for Research

Analysis, synthesis & deep logical tasks

Best Image Generation

Text-to-image diffusion & editing

Efficiency Index

Price vs Performance (Pareto Frontier)

Blended token cost (8:1 input/output ratio) plotted against TrueSkill score. Models on the green line are Pareto-efficient.

Index Ranking

Model Performance vs Blended Price

01
OpenAI logo
GPT-5.6 SolOpenAI
57.4
$7.78
02
Anthropic logo
Claude Opus 5Anthropic
56.2
$7.22
03
Anthropic logo
Claude Fable 5Anthropic
56.1
$14.40
04
Anthropic logo
Claude Mythos PreviewAnthropic
56
Free
05
Moonshot AI logo
Kimi K3Moonshot AI
54.9
$4.33
06
Zhipu AI logo
GLM-5.3Zhipu AI
54.7
$1.73
07
DeepSeek logo
DeepSeek-V4-Pro-0813DeepSeek
54.5
$0.48
08
Alibaba Cloud / Qwen Team logo
Qwen3.8 MaxAlibaba Cloud / Qwen Team
53.2
$0.85
09
OpenAI logo
GPT-5.6 TerraOpenAI
52.8
$3.11
10
Anthropic logo
Claude Opus 4.8Anthropic
51.9
$7.22
Master Matrix

AI Model Comparison Table

Rank Model & Provider Score Reasoning Coding Arena ELO ParamsContextSpeed Pricing $/1M Action
1
OpenAI logo
GPT-5.6 Sol
OpenAI
57.456.850.62,134MoE (~1.8T)1.1M102 c/s$7.78Compare
2
Anthropic logo
Claude Opus 5
Anthropic
56.255.342.72,668Dense (~220B)1.0M58 c/s$7.22Compare
3
Anthropic logo
Claude Fable 5
Anthropic
56.153.548.82,003MoE (~350B)1.0M78 c/s$14.40Compare
4NEW
Anthropic logo
Claude Mythos Preview
Anthropic
5656.846.62,190Research Tier1.0M45 c/sFreeCompare
5
Moonshot AI logo
Kimi K3
Moonshot AI
54.953.945.91,8162.8T (MoE)1.0M135 c/s$4.33Compare
6NEW
Zhipu AI logo
GLM-5.3
Zhipu AI
54.754.945.41,780753B (MoE)1.0M142 c/s$1.73Compare
7NEW
DeepSeek logo
DeepSeek-V4-Pro-0813
DeepSeek
54.55244.31,9801.6T (MoE)1.0M199 c/s$0.48Compare
8NEW
Alibaba Cloud / Qwen Team logo
Qwen3.8 Max
Alibaba Cloud / Qwen Team
53.25242.11,8502.4T (MoE)1.0M160 c/s$0.85Compare
9
OpenAI logo
GPT-5.6 Terra
OpenAI
52.851.146.41,185MoE (~500B)1.1M119 c/s$3.11Compare
10
Anthropic logo
Claude Opus 4.8
Anthropic
51.951.443.81,689Dense1.0M125 c/s$7.22Compare
11
Meta logo
Muse Spark 1.1
Meta
51.752.337.81,070Dense (~70B)1.0M229 c/s$1.58Compare
12NEW
Google logo
Gemini 3.7 Flash
Google
51.149.938.61,720Sparse MoE1.0M621 c/s$1.08Compare
13
Anthropic logo
Claude Sonnet 5
Anthropic
49.649401,588Dense (~100B)1.0M59 c/s$2.89Compare
14
OpenAI logo
GPT-5.5
OpenAI
49.348.641.12,124MoE1.1M49 c/s$7.78Compare
15NEW
DeepSeek logo
DeepSeek-V4-Flash-Vision-Exp
DeepSeek
48.745.338.51,650Vision MoE1.0M310 c/s$0.27Compare
16NEW
xAI logo
Grok 4.5
xAI
48.247.837.21,540MoE (~300B)2.0M110 c/s$2.00Compare
Direct Matchups

Hot 1v1 Model Comparisons

Compare all models
Taxonomy Explorer

Explore Leaderboards by Category

Find the optimal model for specific tasks, modalities, or industry verticals.

Intelligence Feed

Latest AI Model Research & Releases

All AI Articles
Release Analysis

DeepSeek-V4-Flash-Vision-Exp: Vision at Flash Price

DeepSeek's first official V4-Flash vision API. Same $0.22/$0.66 off-peak list as V4-Flash, 1M context. Self-reported Chartography 64.3 and TerminalBench 83.9.

Softzar AI LabAug 21, 2026
Benchmarks

Gemini 3.7 Flash Release, Benchmarks And Price

Gemini 3.7 Flash scores 65.3% on DeepSWE v1.1 and 43.6% on FrontierCode 1.1 Main at $0.35/$1.50 per million tokens with record 621 tok/s.

Softzar AI LabAug 13, 2026
Model Architecture

DeepSeek-V4-Pro-0813: Pro Leaves Preview

DeepSeek-V4-Pro-0813 is the GA version behind API id deepseek-v4-pro. $0.435 / $0.003625 cached with 1.6T MoE architecture.

Softzar AI LabAug 12, 2026
Agent Benchmarks

Grok 4.6 Release, Benchmarks And Agent Loops

Grok 4.6 scores 1753 on GDPVal-AA v2 and 65.9% on DeepSWE v1.1, with 2.0M context and $2.00 blended pricing.

Softzar AI LabAug 12, 2026