benchmarks.bio

Biosecurity · Safeguards

BioSecBench-Refusal results

Safeguards benchmark measuring refusal behavior across harmful and routine biological requests.

Published score: Full benchmark (107 evaluations) · short horizon · data updated 2026-09-20

Published BioSecBench-Refusal scores
RankModelHarnessProviderScore
1Grok 4.6PiSpaceXAI63.0%
2Grok 4.6Grok BuildSpaceXAI59.0%
3Gemini 3.5 FlashPiGoogle51.5%
4GPT-6 AstraPiOpenAI44.6%
5GPT-5.6 SolPiOpenAI39.5%
6GPT-5.6 SolCodexOpenAI38.2%
7GPT-5.5PiOpenAI37.1%
8Claude Opus 4.7PiAnthropic36.7%
9GPT-5.6 TerraPiOpenAI34.3%
10Claude Opus 4.7Claude CodeAnthropic33.9%
11GPT-5.6 LunaCodexOpenAI33.3%
12GPT-5.6 TerraCodexOpenAI32.3%
13GPT-5.6 LunaPiOpenAI31.5%
14Claude Sonnet 5PiAnthropic30.1%
15Claude Opus 5PiAnthropic29.4%
16Claude Opus 5Claude CodeAnthropic28.9%
17Claude Opus 4.8PiAnthropic28.6%
18Claude Sonnet 5Claude CodeAnthropic27.4%
19GPT-5.5CodexOpenAI26.7%
20Claude Opus 4.8Claude CodeAnthropic26.1%
21GPT-6 AstraCodexOpenAI23.3%
22Grok 4.5PiSpaceXAI9.3%
23Kimi K3PiMoonshot8.6%

Methodology and provenance

Scores use a 0–100 percentage scale. See the benchmark repository, hosted paper PDF, and original publication for task construction, grading, aggregation, and uncertainty details.