189 head-to-heads · updated October 7, 2026

Compare AI models metric by metric.

Each page puts two systems side by side on the metrics both were measured on. A side wins a row only when the 95% intervals do not overlap, or when run ranges or p50–p95 bands do not overlap with at least 5 runs per side; otherwise the row says tie or unclear, and why.

Who has been measured against whom

A cell is a comparison page. Darker cells share more measured metrics; a ring means at least one row separates the two.

  • Shared measured metrics
  • 1–22
  • 23–45
  • 46–67
  • 68–90
  • 91–113
  • a row separates them
Haiku 4.5Opus 4.5Opus 4.6Sonnet 4.5DeepSeek V3.2Gemini 3 FlashGLM 5GPT 5 miniGPT 5.2Kimi K2.5MiniMax M2.5GPT-6.1 Sol · CLISonnet 5.5GPT-6 Luna · CLIFable 5.1Opus 5.5GPT-6.1 Sol · APIGPT-6 Luna · API
Claude Haiku 4.5No comparisonNo comparison
Claude Opus 4.5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Claude Opus 4.6No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Claude Sonnet 4.5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
DeepSeek V3.2No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Gemini 3 FlashNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GLM 5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GPT 5 miniNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GPT 5.2No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Kimi K2.5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
MiniMax M2.5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GPT-6.1 Sol (Codex CLI)No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Claude Sonnet 5.5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GPT-6 Luna (Codex CLI)No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Claude Fable 5.1No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
Claude Opus 5.5No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GPT-6.1 Sol (OpenAI API)No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
GPT-6 Luna (OpenAI API)No comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparisonNo comparison
  1. Claude Haiku 4.515 comparisons
  2. Claude Opus 4.510 comparisons
  3. Claude Opus 4.610 comparisons
  4. Claude Sonnet 4.510 comparisons
  5. DeepSeek V3.210 comparisons
  6. Gemini 3 Flash10 comparisons
  7. GLM 510 comparisons
  8. GPT 5 mini10 comparisons
  9. GPT 5.210 comparisons
  10. Kimi K2.510 comparisons
  11. MiniMax M2.510 comparisons
  12. GPT-6.1 Sol (Codex CLI)7 comparisons
  13. Claude Sonnet 5.56 comparisons
  14. GPT-6 Luna (Codex CLI)5 comparisons
  15. Claude Fable 5.14 comparisons
  16. Claude Opus 5.54 comparisons
  17. GPT-6.1 Sol (OpenAI API)4 comparisons
  18. GPT-6 Luna (OpenAI API)3 comparisons

Sorted by number of comparisons, not by a score.

18 models with 74 comparison pages; 20 providers with 98 comparison pages.

Find a comparison

Selected pairs

A selection from the recorded comparisons. The bar counts the rows: a side’s color only where the data separates them.

Effort comparisons

One model at two effort settings. Only the effort differs between the two sides of a row: same route, same tasks.

All pairs

189 comparisons · showing 30

Turn the numbers into shipped work.

Agent runs these choices for you: a persistent AI worker with memory and rules, on your Claude and Codex subscriptions.