benchmarks.bio

Therapeutics · Capabilities

TxBench-Oligo-Discovery results

Agentic benchmark tasks for oligonucleotide discovery and development decisions.

Published score: Full benchmark (113 evaluations) · short horizon · data updated 2026-09-20

Published TxBench-Oligo-Discovery scores
RankModelHarnessProviderScore
1GPT-6 AstraCodexOpenAI55.5%
2GPT-6 AstraPiOpenAI53.4%
3Claude Opus 5Claude CodeAnthropic48.1%
4Grok 4.6PiSpaceXAI44.0%
5Grok 4.6Grok BuildSpaceXAI42.8%
6Claude Opus 5PiAnthropic42.2%
7Claude Opus 4.8Claude CodeAnthropic39.9%
8Claude Opus 4.8PiAnthropic39.4%
9Claude Sonnet 5Claude CodeAnthropic39.3%
10Gemini 3.5 FlashPiGoogle38.6%
11Grok 4.5PiSpaceXAI38.4%
12GPT-5.6 SolCodexOpenAI34.5%
13DeepSeek V4.1 FlashPiDeepSeek33.9%
14GPT-5.5PiOpenAI33.6%
15GPT-5.6 TerraPiOpenAI33.3%
16GPT-5.6 TerraCodexOpenAI32.5%
17GPT-5.5CodexOpenAI30.4%
18GPT-5.6 LunaCodexOpenAI23.9%
19GPT-5.6 LunaPiOpenAI23.3%

Methodology and provenance

Scores use a 0–100 percentage scale. See the benchmark repository, hosted paper PDF, and original publication for task construction, grading, aggregation, and uncertainty details.