Touchstone

The Gauntlet — the climb

The story of the project in one view: as we build out the stack — gate probes, then the ladders (coding, agentic, C#, PHP) up to the flagship supportflow gauntlet of real merged-PR issues — each model climbs as far as it can. Every stage shows the model's score on the latest harness it fully ran (labelled); the full per-harness detail is at the bottom. New ladders and harnesses appear here automatically as we add them.

ModelScoreCovRate
Gate
11 benches
Coding
6 benches
Agentic
6 benches
C#
15 benches
PHP
5 benches
Supportflow
22 benches
qwen3.6-35b-a3b49100%75%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
15/15/15
baseline
5/5/5
baseline
6/22/22
v0.18.0
gemma-4-26b-a4b-it46100%71%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
15/15/15
baseline
5/5/5
baseline
3/22/22
v0.18.0
qwen3-next-80b4589%78%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
14/15/15
baseline
5/5/5
baseline
3/15/22
~v0.18.0
gpt-oss-20b4266%98%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
14/15/15
baseline
5/5/5
baseline
claude-sonnet-4.64166%95%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
13/15/15
baseline
5/5/5
baseline
gpt-oss-120b4166%95%
11/11/11
baseline
5/6/6
baseline
5/6/6
baseline
15/15/15
baseline
5/5/5
baseline
qwen3.6-27b4166%95%
11/11/11
v1.7.1
6/6/6
baseline
6/6/6
baseline
13/15/15
v1.7.1
5/5/5
v1.7.1
qwen3.6-35b-a3b-or4166%95%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
13/15/15
baseline
5/5/5
baseline
qwen3.6-35b-bf164166%95%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
14/15/15
baseline
5/5/5
baseline
granite-4.1-30b4066%93%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
12/15/15
baseline
5/5/5
baseline
devstral-small-2-25123971%85%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
11/15/15
baseline
4/5/5
baseline
2/3/22
~v0.18.0
mistral-small-3.1-24b-instruct-25033866%88%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
12/15/15
baseline
4/5/5
baseline
qwen3.5-122b-a10b-cluster3866%88%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
12/15/15
baseline
4/5/5
baseline
llama-3.3-70b3763%90%
9/11/11
baseline
6/6/6
baseline
6/6/6
baseline
11/13/15
~baseline
5/5/5
baseline
qwen3.5-4b3666%84%
11/11/11
baseline
3/6/6
baseline
6/6/6
baseline
11/15/15
baseline
5/5/5
baseline
granite-4.1-8b3566%81%
11/11/11
baseline
4/6/6
baseline
6/6/6
baseline
10/15/15
baseline
4/5/5
baseline
qwen3-coder-30b3566%81%
10/11/11
baseline
5/6/6
baseline
6/6/6
baseline
12/15/15
baseline
2/5/5
baseline
gemini-2.5-flash-lite3266%74%
11/11/11
baseline
4/6/6
baseline
5/6/6
baseline
9/15/15
baseline
3/5/5
baseline
qwen3.5-2b2566%58%
9/11/11
baseline
2/6/6
baseline
6/6/6
baseline
6/15/15
baseline
2/5/5
baseline
deepseek-r1-distill-qwen-32b2466%56%
7/11/11
baseline
6/6/6
baseline
1/6/6
baseline
10/15/15
baseline
0/5/5
baseline
qwen3-235b-a22b-q4-cluster1731%85%
12/15/15
baseline
5/5/5
baseline
phi-4-reasoning-plus1666%37%
4/11/11
baseline
4/6/6
baseline
2/6/6
baseline
5/15/15
baseline
1/5/5
baseline
qwen3.5-0.8b1466%33%
9/11/11
baseline
0/6/6
baseline
5/6/6
baseline
0/15/15
baseline
0/5/5
baseline
phi-458%100%
5/5/5
baseline
hermes-4.3-36b434%18%
4/22/22
v0.18.0
deepseek-r1-32b48%80%
4/5/5
baseline

Score = benches solved (rewards coverage). Cov = share of the stack attempted. Rate = solved ÷ attempted — capability once a model has had its shot, so a model that has run little but hits hard isn't buried by one that simply ran more. Each stage block reads passed / attempted / total benches.

Full detail — model × bench

Every bench, per harness. green = passed · red = failed · grey = not run. Pick a harness:

ModelScoreMissTime

Composition

The benches that make up this harness's gauntlet, by domain.