- Benchmarks
- Compare
189 head-to-heads · updated October 7, 2026
Compare AI models metric by metric.
Each page puts two systems side by side on the metrics both were measured on. A side wins a row only when the 95% intervals do not overlap, or when run ranges or p50–p95 bands do not overlap with at least 5 runs per side; otherwise the row says tie or unclear, and why.
Who has been measured against whom
A cell is a comparison page. Darker cells share more measured metrics; a ring means at least one row separates the two.
- Shared measured metrics
- 1–22
- 23–45
- 46–67
- 68–90
- 91–113
- a row separates them
- Claude Haiku 4.515 comparisons
- Claude Opus 4.510 comparisons
- Claude Opus 4.610 comparisons
- Claude Sonnet 4.510 comparisons
- DeepSeek V3.210 comparisons
- Gemini 3 Flash10 comparisons
- GLM 510 comparisons
- GPT 5 mini10 comparisons
- GPT 5.210 comparisons
- Kimi K2.510 comparisons
- MiniMax M2.510 comparisons
- GPT-6.1 Sol (Codex CLI)7 comparisons
- Claude Sonnet 5.56 comparisons
- GPT-6 Luna (Codex CLI)5 comparisons
- Claude Fable 5.14 comparisons
- Claude Opus 5.54 comparisons
- GPT-6.1 Sol (OpenAI API)4 comparisons
- GPT-6 Luna (OpenAI API)3 comparisons
Sorted by number of comparisons, not by a score.
18 models with 74 comparison pages; 20 providers with 98 comparison pages.
Find a comparison
Selected pairs
A selection from the recorded comparisons. The bar counts the rows: a side’s color only where the data separates them.
Effort comparisons
One model at two effort settings. Only the effort differs between the two sides of a row: same route, same tasks.
Claude Sonnet 5.5
low · medium · high · default (CLI chose)
Claude Opus 5.5
low · medium · high · default (CLI chose)
GPT-6.1 Sol (Codex CLI)
low · medium · high
GPT-6.1 Sol (OpenAI API)
low · high
All pairs
189 comparisons · showing 30
- Claude Sonnet 5.5 vs Claude Opus 5.5Model vs model
- Claude Haiku 4.5 vs Claude Sonnet 5.5Model vs model
- Claude Opus 5.5 vs Claude Fable 5.1Model vs model
- Claude Sonnet 5.5 vs Claude Fable 5.1Model vs model
- Claude Haiku 4.5 vs Claude Opus 5.5Model vs model
- Claude Code vs Codex CLICoding CLI vs coding cli
- Claude Sonnet 5.5 vs GPT-6.1 Sol (Codex CLI)Model vs model
- Jev 1.13 vs Claude Haiku 4.5Router vs model
- Jev 1.13 vs Claude Sonnet 5.5Router vs model
- GPT-6.1 Sol (Codex CLI) vs GPT-6.1 Sol (OpenAI API)Model vs model
- Claude Opus 5.5 vs GPT-6.1 Sol (Codex CLI)Model vs model
- Claude Haiku 4.5 vs GPT-6.1 Sol (Codex CLI)Model vs model
- Claude Fable 5.1 vs GPT-6.1 Sol (Codex CLI)Model vs model
- Jev 1.13 vs Deterministic routing policyRouter vs router
- Deterministic routing policy vs Claude Sonnet 5.5Router vs model
- Deterministic routing policy vs Claude Haiku 4.5Router vs model
- OpenRouter vs AnthropicInference provider vs inference provider
- OpenRouter vs Google AI StudioInference provider vs inference provider
- OpenRouter vs OpenAIInference provider vs inference provider
- Groq vs Together AIInference provider vs inference provider
- Groq vs CerebrasInference provider vs inference provider
- Together AI vs Fireworks AIInference provider vs inference provider
- Amazon Bedrock vs Google Vertex AIInference provider vs inference provider
- Amazon Bedrock vs AzureInference provider vs inference provider
- Anthropic vs Amazon BedrockInference provider vs inference provider
- Anthropic vs AzureInference provider vs inference provider
- Anthropic vs Google Vertex AIInference provider vs inference provider
- Google Vertex AI vs AzureInference provider vs inference provider
- DeepInfra vs ParasailInference provider vs inference provider
- Amazon Bedrock vs Claude Platform on AWSInference provider vs inference provider