Skip to content
The Internet Compass

AI Tools

AI Benchmark Explorer

A reference table of independently published benchmark results, filterable by model or benchmark. Scores shift with each model release — check the source leaderboard for the latest figures before citing precisely.

FreeNo sign-upRuns in your browser
ModelBenchmarkScoreMeasures
Claude Opus 5MMLU91.2%Broad knowledge, undergraduate-to-expert level
Claude Opus 5SWE-bench Verified72.1%Real-world software engineering tasks
Claude Sonnet 5MMLU89.4%Broad knowledge, undergraduate-to-expert level
Claude Sonnet 5SWE-bench Verified68.9%Real-world software engineering tasks
GPT-5.1MMLU90.8%Broad knowledge, undergraduate-to-expert level
GPT-5.1SWE-bench Verified70.3%Real-world software engineering tasks
Gemini 3 ProMMLU90.1%Broad knowledge, undergraduate-to-expert level
Gemini 3 ProGPQA Diamond78.5%Graduate-level science reasoning
Claude Opus 5GPQA Diamond80.1%Graduate-level science reasoning
GPT-5.1GPQA Diamond79.2%Graduate-level science reasoning
10 of 10 rows

How it works

  1. 1Filter by model or benchmark name
  2. 2Compare scores across the models you're evaluating
  3. 3Cross-reference with pricing before deciding

Who this is for

  • Shortlisting models by capability before a pricing comparison
  • Explaining model trade-offs in a technical proposal
  • Quick reference during a model evaluation