Human Frontier
90.2
Human-calibrated frontier signal, backed by Arena-style preference evidence and separate from raw AgMoBench benchmark composite scores.
Blended Price
$11.25/M
Input Price
$5.00/M
Output Price
$30.00/M
Speed
—
TTFT
—
Axes
Filters
Providers
vv1@harness-v1.1.1@dcdbc88cbef13624328cc6d059a007a5d29b3c00 · official-869-task · GPT-5.5 (OpenAI's default safety filters block all GPT-5.5 exploit attempts under default prompting.) · harness Codex CLI · 1 attempt · 2h timeout · exploitgym:v1@harness-v1.1.1@dcdbc88cbef13624328cc6d059a007a5d29b3c00:869-tasks · record exploitgym:v1:parent:10601e8ce73b6a9e1bdba53b701d30334f5fede41c19dda30e483ab0766b3e65
Preliminary
{
"taskCount": 869,
"harnessTag": "v1.1.1",
"metricName": "agmodbDerivedOnTargetPercent",
"taskListUrl": "https://github.com/sunblaze-ucb/exploitgym/blob/dcdbc88cbef13624328cc6d059a007a5d29b3c00/data/task_ids/v1.txt",
"aggregateOnly": true,
"onTargetCount": 129,
"evaluationDate": "2026-06-16",
"upstreamSource": "ExploitGym Team",
"attemptsPerTask": 1,
"benchmarkCommit": "dcdbc88cbef13624328cc6d059a007a5d29b3c00",
"metricSemantics": "AgMoDB-derived on_target count divided by the fixed v1 task count",
"aggregateVariant": "parent",
"measurementScope": "model-agent-system",
"agmobenchEligible": false,
"attemptsSemantics": "one submitted result trial per benchmark task, not 869 attempts per task",
"upstreamSourceUrl": null,
"preliminaryReasons": [
"missing-exact-agent-revision",
"missing-upstream-run-identity"
],
"evaluationCondition": "2h timeout",
"domainOnTargetCounts": {
"v8": 38,
"kernel": 21,
"userspace": 70
},
"attemptsProvenanceUrl": "https://github.com/sunblaze-ucb/exploitgym/blob/603efb3461d17ed05718ca778d2715db772d9385/docs/submission.md#resultsjson",
"mitigatedOnTargetCounts": {
"v8": 4,
"kernel": 8,
"userspace": 10
},
"submissionContractCommit": "603efb3461d17ed05718ca778d2715db772d9385",
"exactReproductionEligible": false
}Evidence observed 2026-06-16
v2026.06 · official-100-task · GPT-5.5 (xhigh) · harness mini-swe-agent · effort xhigh · 1 attempt · pass@1 · harbor:snorkel-ai/senior-swe-bench-v2026.06 · provider openai/gpt-5.5 · record gpt-5-5-mini-swe · run a165e24cf1b9c072a876b82730459f2c240ba89568b769933669b4d2303dea36
{
"taskCount": 100,
"agentGroup": "mini-swe-agent:gpt-5.5",
"basicPassAt1": 56.81818181818182,
"datasetPackage": "snorkel-ai/senior-swe-bench-v2026.06",
"publicTaskCount": 50,
"tastefulPassAt1": 15.909090909090908,
"agentDescription": "OpenAI GPT-5.5 via mini-swe-agent harness (Portkey→OpenAI)",
"privateTaskCount": 50,
"upstreamProvider": "openai",
"upstreamRunCount": 78,
"averageAgentSteps": 88.32954545454545,
"averageOutputTokens": 35910.045454545456,
"averageTotalCostUsd": 4.934496786363637,
"averageOutputCostUsd": 1.0773013636363638
}Evidence observed 2026-06-30
vcontinuous-leaderboard · tasks-created:2026-03-01:2026-05-15 · gpt-5.5-2026-04-23-xhigh · harness swe-rebench-react@tools · effort xhigh · 5 attempts · pass@1 · swe-rebench:standardized:128k-or-model-limit · provider gpt-5.5-2026-04-23-xhigh__tools · record gpt-5.5-2026-04-23-xhigh__tools:1772323200000:1778803200000
{
"passAt5": 70,
"developer": "openai",
"instanceType": "model",
"contextPolicy": "128k unless the model supports less",
"attemptsPerTask": 5,
"totalTokenUsage": 2120660.0327272727,
"modelReleaseDate": "2026-04-23",
"scoreStandardError": 0.9090909090909094,
"cachedTokenPercentage": 90.03088404558557,
"modelReleaseTimestamp": 1776902400000,
"standardContextTokens": 128000,
"averageInstanceCostUsd": 2.245956852727273,
"potentialContamination": true,
"aggregateTaskRangeTimestamp": {
"to": 1778803200000,
"from": 1772323200000
},
"publishedTaskRangeTimestamp": {
"to": 1778803200000,
"from": 1772323200000
}
}Evidence observed 2026-05-15
v2.1 · official-leaderboard · GPT-5.5 (xhigh) · harness codex@0.125.0 · effort xhigh · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider openai/gpt-5.5 · record leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-codex.json · run 10e2e56b-ed31-5f65-a489-69f78b902adf
{
"passAt2": 0.8888,
"passAt3": 0.9135,
"passAt4": 0.9303,
"passAt5": 0.9438,
"taskCount": 89,
"actualTokens": {
"output": 5966373,
"cachedInput": 392433664,
"uncachedInput": 336797311
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/45",
"agentDisplayUrl": "https://openai.com/codex/",
"modelDisplayUrl": "https://openai.com/index/introducing-gpt-5-5/",
"actualTrialCount": 445,
"agentOrganization": "OpenAI",
"modelOrganization": "OpenAI",
"actualTotalCostUsd": 2059.19,
"rewardHacksPercent": 0.22,
"accuracyStandardError": 1.13,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-codex.json",
"disqualifiedTrialCount": 1,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "xhigh",
"actualAverageTrialDurationSeconds": 482.6
}Evidence observed 2026-05-01
v2.1 · official-leaderboard · GPT-5.5 (xhigh) · harness terminus-2@2.0.0 · effort xhigh · 5 attempts · harbor:terminal-bench/terminal-bench-2-1 · provider openai/gpt-5.5 · record leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-terminus-2.json · run 10e2e56b-ed31-5f65-a489-69f78b902adf
{
"passAt2": 0.8461,
"passAt3": 0.864,
"passAt4": 0.8719,
"passAt5": 0.8764,
"taskCount": 89,
"actualTokens": {
"output": 10768129,
"cachedInput": 0,
"uncachedInput": 81469069
},
"datasetPackage": "terminal-bench/terminal-bench-2-1",
"leaderboardUrl": "https://www.tbench.ai/leaderboard/terminal-bench/2.1",
"pullRequestUrl": "https://github.com/harbor-framework/terminal-bench-2-1/pull/47",
"agentDisplayUrl": "https://www.tbench.ai/news/terminus",
"modelDisplayUrl": "https://openai.com/index/introducing-gpt-5-5/",
"actualTrialCount": 445,
"agentOrganization": "Terminal-Bench",
"modelOrganization": "OpenAI",
"actualTotalCostUsd": 493.85,
"rewardHacksPercent": 0.22,
"accuracyStandardError": 1.22,
"submissionDownloadUrl": "https://raw.githubusercontent.com/harbor-framework/terminal-bench-2-1/main/leaderboard/submissions/2026-05-01-openai-gpt-5-5-xhigh-terminus-2.json",
"disqualifiedTrialCount": 1,
"expectedAttemptsPerTask": 5,
"sourceFilterReasoningEffort": "xhigh",
"actualAverageTrialDurationSeconds": 726.7
}Evidence observed 2026-05-01