| Rank | Model | Harness | Provider | Score |
|---|---|---|---|---|
| 1 | Claude Opus 5 | Pi | Anthropic | 51.5% |
| 2 | GPT-6 Astra | Pi | OpenAI | 48.5% |
| 3 | Grok 4.6 | Grok Build | SpaceXAI | 48.0% |
| 4 | Grok 4.6 | Pi | SpaceXAI | 47.5% |
| 5 | Claude Opus 5 | Claude Code | Anthropic | 43.6% |
| 6 | GPT-6 Astra | Codex | OpenAI | 35.2% |
Methodology and provenance
Scores use a 0–100 percentage scale. See the benchmark repository, hosted paper PDF, and original publication for task construction, grading, aggregation, and uncertainty details.