| Rank | Model | Harness | Provider | Score |
|---|---|---|---|---|
| 1 | GPT-6 Astra | Codex | OpenAI | 64.8% |
| 2 | GPT-6 Astra | Pi | OpenAI | 64.4% |
| 3 | GPT-5.6 Sol | Pi | OpenAI | 62.1% |
| 4 | GPT-5.6 Terra | Pi | OpenAI | 62.0% |
| 5 | Grok 4.6 | Grok Build | SpaceXAI | 61.5% |
| 6 | GPT-5.6 Sol | Codex | OpenAI | 60.3% |
| 7 | Claude Opus 5 | Claude Code | Anthropic | 60.1% |
| 8 | Grok 4.6 | Pi | SpaceXAI | 59.7% |
| 9 | Claude Sonnet 5 | Pi | Anthropic | 59.5% |
| 10 | Claude Opus 5 | Pi | Anthropic | 59.5% |
| 11 | DeepSeek V4.1 Flash | Pi | DeepSeek | 59.5% |
| 12 | Claude Opus 4.8 | Claude Code | Anthropic | 58.0% |
| 13 | GPT-5.5 | Codex | OpenAI | 57.8% |
| 14 | Claude Opus 4.8 | Pi | Anthropic | 57.3% |
| 15 | Gemini 3.5 Flash | Pi | 56.9% | |
| 16 | Claude Sonnet 5 | Claude Code | Anthropic | 56.7% |
| 17 | GPT-5.5 | Pi | OpenAI | 56.7% |
| 18 | Grok 4.5 | Pi | SpaceXAI | 56.6% |
| 19 | Kimi K3 | Pi | Moonshot | 55.7% |
| 20 | GPT-5.6 Terra | Codex | OpenAI | 55.0% |
| 21 | Claude Opus 4.7 | Claude Code | Anthropic | 54.0% |
| 22 | Claude Opus 4.7 | Pi | Anthropic | 53.9% |
| 23 | GPT-5.6 Luna | Pi | OpenAI | 51.9% |
| 24 | GPT-5.6 Luna | Codex | OpenAI | 49.2% |
Methodology and provenance
Scores use a 0–100 percentage scale. See the benchmark repository, hosted paper PDF, and original publication for task construction, grading, aggregation, and uncertainty details.