benchmarks.bio

Omics · Capabilities

VariantBench results

Agentic genetic variant discovery and interpretation tasks grounded in real biological analyses.

Published score: Full benchmark (118 evaluations) · short horizon · data updated 2026-09-20

Published VariantBench scores
RankModelHarnessProviderScore
1Claude Opus 5Claude CodeAnthropic49.7%
2Claude Opus 5PiAnthropic49.4%
3GPT-6 AstraCodexOpenAI48.6%
4GPT-6 AstraPiOpenAI47.7%
5Grok 4.6Grok BuildSpaceXAI46.0%
6Claude Opus 4.8PiAnthropic42.1%
7GPT-5.6 SolCodexOpenAI42.1%
8GPT-5.6 SolPiOpenAI41.2%
9Claude Opus 4.8Claude CodeAnthropic39.8%
10Claude Sonnet 5Claude CodeAnthropic38.7%
11GPT-5.6 TerraCodexOpenAI38.7%
12Claude Sonnet 5PiAnthropic38.1%
13Grok 4.6PiSpaceXAI38.1%
14Grok 4.5PiSpaceXAI37.6%
15Claude Opus 4.7PiAnthropic37.0%
16Claude Opus 4.7Claude CodeAnthropic35.6%
17Gemini 3.5 FlashPiGoogle35.3%
18GPT-5.6 TerraPiOpenAI34.7%
19Kimi K3PiMoonshot32.8%
20GPT-5.6 LunaCodexOpenAI29.9%
21GPT-5.5PiOpenAI29.7%
22GPT-5.5CodexOpenAI28.8%
23GPT-5.6 LunaPiOpenAI28.2%

Methodology and provenance

Scores use a 0–100 percentage scale. See the benchmark repository, hosted paper PDF, and original publication for task construction, grading, aggregation, and uncertainty details.