Benchmarks for what frontier AI hasn't solved

Digital Work Index

An economically weighted measure of model performance across eight challenging benchmarks covering software engineering, logical reasoning and writing, and professional environments.
23.62
Fable 5.1
23.61
Opus 5.5
23.03
GPT-6 Astra
21.75
Opus 5
21.19
GPT-6.1 Sol
20.52
Grok 4.6
19.3
Grok 4.7
16.92
Gemini Flash 3.8
16.76
Kimi K3
16.45
GLM 5.3
16.29
Muse Spark 1.3
11.81
Qwen 3.8 Max
11.07
DeepSeek V4 Pro
6.95
Nemotron 3 Ultra 550B
All benchmarks
All Benchmarks
Sort: Newest
Benchmark Type: All
Software Engineering
Open Benchmarks Grants
Senior SWE-bench

Evaluates coding agents on senior-level software engineering tasks.

Tasteful Solve Rate
1
Fable 5.1
Fable 5.1
34.7%
2
Fable 5
Fable 5
34.7%
3
Opus 5
Opus 5
34.7%
Learn more about Senior SWE-bench
Software Engineering
Open Benchmarks Grants
LibraryDesignBench

Measures how well AI agents design libraries that other agents can use.

Pass Rate
1
Opus 5.5
Opus 5.5
48.9%
2
Fable 5.1
Fable 5.1
47.5%
3
GPT-6 Astra (mini-SWE)
GPT-6 Astra (mini-SWE)
45.1%
Learn more about LibraryDesignBench
Science & Research
Open Benchmarks Grants
Terminal-Bench-Science

Evaluates agents on scientific workflows derived from researchers’ own work.

By Resolution Rate
1
GPT-6 Astra
GPT-6 Astra
68.1%
2
Opus 5.5
Opus 5.5
63.3%
3
Fable 5.1
Fable 5.1
40.0%
Learn more about Terminal-Bench-Science
Enterprise Environments
Proprietary
SnorkelManufacturing

Evaluates manufacturing decisions using fragmented plant-floor, engineering, and supplier evidence.

By pass@1
1
GPT-6.1 Sol
GPT-6.1 Sol
19.6%
2
Grok 4.6
Grok 4.6
16.4%
3
Grok 4.7
Grok 4.7
12.1%
Learn more about SnorkelManufacturing
Knowledge Work
Proprietary
WorkplaceAgents

Evaluates AI agents on economically valuable professional work and verifiable workplace deliverables.

By pass@1
1
Grok 4.6
Grok 4.6
17.1%
2
Fable 5.1
Fable 5.1
15.8%
3
Grok 4.7
Grok 4.7
15.2%
Learn more about WorkplaceAgents
Agentic Coding
Open Benchmarks Grants
Terminal-Bench 4.0

Evaluates terminal agents on continuously updated software-engineering tasks.

By Resolution Rate
1
Opus 5.5
Opus 5.5
64.8%
2
Sonnet 5.5
Sonnet 5.5
61.8%
3
GPT-6 Astra
GPT-6 Astra
58.2%
Learn more about Terminal-Bench 4.0
Software Engineering
Proprietary
SWE-bench CLI

Evaluates validated multi-file code changes in open-source repositories.

By pass@1
1
Opus 5.5
Opus 5.5
16.6%
2
Fable 5.1
Fable 5.1
14.5%
3
Opus 5
Opus 5
14.0%
Learn more about SWE-bench CLI
Knowledge Work
Open Benchmarks Grants
Agents’ Last Exam

Evaluating AI agents on long-horizon, economically valuable professional workflows with verifiable outcomes.

By Pass Rate
1
Opus 5.5
Opus 5.5
38.2%
2
GPT-6 Astra
GPT-6 Astra
34.2%
3
GPT-6 Sol
GPT-6 Sol
32.2%
Learn more about Agents’ Last Exam
Computer Use
Open Benchmarks Grants
OSWorld 2.0

Evaluates computer-use agents on 108 long-horizon workflows.

By Binary Accuracy (500 steps)
1
Opus 5 · max
Opus 5 · max
44.33%
2
Opus 5 · high
Opus 5 · high
36.89%
3
Opus 5 · xhigh
Opus 5 · xhigh
33.33%
Learn more about OSWorld 2.0
Enterprise Environments
Proprietary
SnorkelRevOps

Evaluates revenue-operations workflows involving systems, controls, and business-state updates.

By pass@1
1
Grok 4.6
Grok 4.6
15.8%
2
Fable 5.1
Fable 5.1
14.0%
3
Kimi K3
Kimi K3
13.1%
Learn more about SnorkelRevOps
Enterprise Environments
Proprietary
SnorkelFinance 2.0

Evaluates financial workflows requiring evidence gathering, analysis, and compliance.

By pass@1
1
Grok 4.6
Grok 4.6
25.1%
2
GLM 5.3
GLM 5.3
21.2%
3
Grok 4.7
Grok 4.7
20.2%
Learn more about SnorkelFinance 2.0
Software Engineering
Open Benchmarks Grants
SlopCode Bench

Measures coding-agent performance across evolving software requirements.

By Iso Solve
1
GPT-5.5
GPT-5.5
28.06%
2
GPT-5.3
GPT-5.3
26.02%
3
GPT-5.4
GPT-5.4
23.47%
Learn more about SlopCode Bench
Enterprise Environments
Proprietary
SnorkelUnderwrite 2.0

Evaluates auditable insurance underwriting decisions using incomplete, distributed evidence.

By pass@1
1
Grok 4.7
Grok 4.7
30.5%
2
GLM 5.3
GLM 5.3
30.4%
3
Nemotron 3 Ultra 550B
Nemotron 3 Ultra 550B
30.0%
Learn more about SnorkelUnderwrite 2.0
Capability/Efficiency
Open Benchmarks Grants
Continual Learning Bench

Measures improvement across sequential, stateful tasks.

By Agg. Reward
1
Sonnet 4.6
Sonnet 4.6
+0.196
2
GPT-5.4
GPT-5.4
+0.189
3
Sonnet 4.6
Sonnet 4.6
+0.185
Learn more about Continual Learning Bench
Enterprise Environments
Proprietary
SnorkelLegal

Evaluates legal workflows requiring evidence, procedure, authority, and action.

By pass@1
1
Grok 4.6
Grok 4.6
40.7%
2
GLM 5.3
GLM 5.3
37.8%
3
Muse Spark 1.3
Muse Spark 1.3
36.5%
Learn more about SnorkelLegal
Agentic Coding
Proprietary
Agentic Coding 2.0

Evaluating whether coding agents can plan, execute, verify, and recover across complex terminal-native engineering tasks.

By pass@1
1
GPT-6 Astra
GPT-6 Astra
47.6%
2
GPT-6.1 Sol
GPT-6.1 Sol
42.8%
3
Opus 5.5
Opus 5.5
40.4%
Learn more about Agentic Coding 2.0
Agentic Coding
Open Benchmarks Grants
Terminal-Bench 3.0

Evaluates terminal agents on containerized tasks across seven domains.

By Resolution Rate
1
Opus 5
Opus 5
42.7%
2
GPT-5.6 Sol
GPT-5.6 Sol
34.6%
3
Fable 5
Fable 5
34.1%
Learn more about Terminal-Bench 3.0
View archived benchmarks
 Illution Back
Illution Front

Not more data. Better data.