Benchmarks for what frontier AI hasn't solved

Digital Work Index

An economically weighted measure of model performance across eight challenging benchmarks covering software engineering, logical reasoning and writing, and professional environments.
23.62
Fable 5.1
23.61
Opus 5.5
23.03
GPT-6 Astra
21.75
Opus 5
20.52
Grok 4.6
19.3
Grok 4.7
16.92
Gemini Flash 3.8
16.76
Kimi K3
16.45
GLM 5.3
16.29
Muse Spark 1.3
11.81
Qwen 3.8 Max
11.07
DeepSeek V4 Pro
6.95
Nemotron 3 Ultra 550B
All benchmarks
All Benchmarks
Sort: Newest
Benchmark Type: All
Software Engineering
Open Benchmarks Grants
Senior SWE-bench

Evaluates coding agents on senior-level software engineering tasks.

Tasteful Solve Rate
1
Fable 5.1
Fable 5.1
34.7%
2
Fable 5
Fable 5
34.7%
3
Opus 5
Opus 5
34.7%
Learn more about Senior SWE-bench
Software Engineering
Open Benchmarks Grants
LibraryDesignBench

Measures how well AI agents design libraries that other agents can use.

Pass Rate
1
Opus 5.5
Opus 5.5
48.9%
2
Fable 5.1
Fable 5.1
47.5%
3
GPT-6 Astra (mini-SWE)
GPT-6 Astra (mini-SWE)
45.1%
Learn more about LibraryDesignBench
Software Engineering
Proprietary
SWE-bench CLI

Evaluates validated multi-file code changes in open-source repositories.

By pass@1
1
Opus 5.5
Opus 5.5
16.6%
2
Fable 5.1
Fable 5.1
14.5%
3
Opus 5
Opus 5
14.0%
Learn more about SWE-bench CLI
Software Engineering
Open Benchmarks Grants
SlopCode Bench

Measures coding-agent performance across evolving software requirements.

By Iso Solve
1
GPT-5.5
GPT-5.5
28.06%
2
GPT-5.3
GPT-5.3
26.02%
3
GPT-5.4
GPT-5.4
23.47%
Learn more about SlopCode Bench
View archived benchmarks
 Illution Back
Illution Front

Not more data. Better data.