Touchstone

The Gauntlet — the climb

The story of the project in one view: as we build out the stack — gate probes, then the ladders (coding, agentic, C#, PHP) up to the flagship supportflow gauntlet of real merged-PR issues — each model climbs as far as it can. Every stage shows the model's score on the latest harness it fully ran (labelled); the full per-harness detail is at the bottom. New ladders and harnesses appear here automatically as we add them.

ModelScoreCovRate
Gate
11 benches
Coding
6 benches
Agentic
6 benches
C#
15 benches
PHP
5 benches
Supportflow
22 benches
qwen3.6-35b-a3b49100%75%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
15/15/15
baseline
5/5/5
baseline
6/22/22
v0.18.0
gemma-4-26b-a4b-it46100%71%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
15/15/15
baseline
5/5/5
baseline
3/22/22
v0.18.0
qwen3-next-80b4589%78%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
14/15/15
baseline
5/5/5
baseline
3/15/22
~v0.18.0
gpt-oss-20b4266%98%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
14/15/15
baseline
5/5/5
baseline
claude-sonnet-4.64166%95%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
13/15/15
baseline
5/5/5
baseline
gpt-oss-120b4166%95%
11/11/11
baseline
5/6/6
baseline
5/6/6
baseline
15/15/15
baseline
5/5/5
baseline
qwen3.6-27b4166%95%
11/11/11
v1.7.1
6/6/6
baseline
6/6/6
baseline
13/15/15
v1.7.1
5/5/5
v1.7.1
qwen3.6-35b-a3b-or4166%95%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
13/15/15
baseline
5/5/5
baseline
qwen3.6-35b-bf164166%95%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
14/15/15
baseline
5/5/5
baseline
granite-4.1-30b4066%93%
11/11/11
baseline
6/6/6
baseline
6/6/6
baseline
12/15/15
baseline
5/5/5
baseline
devstral-small-2-25123971%85%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
11/15/15
baseline
4/5/5
baseline
2/3/22
~v0.18.0
mistral-small-3.1-24b-instruct-25033866%88%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
12/15/15
baseline
4/5/5
baseline
qwen3.5-122b-a10b-cluster3866%88%
11/11/11
baseline
5/6/6
baseline
6/6/6
baseline
12/15/15
baseline
4/5/5
baseline
llama-3.3-70b3763%90%
9/11/11
baseline
6/6/6
baseline
6/6/6
baseline
11/13/15
~baseline
5/5/5
baseline
qwen3.5-4b3666%84%
11/11/11
baseline
3/6/6
baseline
6/6/6
baseline
11/15/15
baseline
5/5/5
baseline
granite-4.1-8b3566%81%
11/11/11
baseline
4/6/6
baseline
6/6/6
baseline
10/15/15
baseline
4/5/5
baseline
qwen3-coder-30b3566%81%
10/11/11
baseline
5/6/6
baseline
6/6/6
baseline
12/15/15
baseline
2/5/5
baseline
gemini-2.5-flash-lite3266%74%
11/11/11
baseline
4/6/6
baseline
5/6/6
baseline
9/15/15
baseline
3/5/5
baseline
qwen3.5-2b2566%58%
9/11/11
baseline
2/6/6
baseline
6/6/6
baseline
6/15/15
baseline
2/5/5
baseline
deepseek-r1-distill-qwen-32b2466%56%
7/11/11
baseline
6/6/6
baseline
1/6/6
baseline
10/15/15
baseline
0/5/5
baseline
qwen3-235b-a22b-q4-cluster1731%85%
12/15/15
baseline
5/5/5
baseline
phi-4-reasoning-plus1666%37%
4/11/11
baseline
4/6/6
baseline
2/6/6
baseline
5/15/15
baseline
1/5/5
baseline
qwen3.5-0.8b1466%33%
9/11/11
baseline
0/6/6
baseline
5/6/6
baseline
0/15/15
baseline
0/5/5
baseline
phi-458%100%
5/5/5
baseline
hermes-4.3-36b434%18%
4/22/22
v0.18.0
deepseek-r1-32b48%80%
4/5/5
baseline

Score = benches solved (rewards coverage). Cov = share of the stack attempted. Rate = solved ÷ attempted — capability once a model has had its shot, so a model that has run little but hits hard isn't buried by one that simply ran more. Each stage block reads passed / attempted / total benches.

Full detail — model × bench

Every bench, per harness. green = passed · red = failed · grey = not run. Pick a harness:

agenticcodingcsharpgatephp
ModelScoreMissTimechaincondierrormultisinglstateexpr_fix_blru_cmergetopolwildcallocchunkcsv_pedi_eedi_sexpr_groupinterkv_paluhnmask_pad_fparsetempltitlefidelfidelfidelfideltoolstoolstoolstoolstoolsvitalvitalgroupparseparseslugitempl
gemma-4-26b-a4b-it29d43/43 100%02m                                           
qwen3.6-35b-a3b25d43/43 100%01m                                           
gpt-oss-20b29d42/43 98%01m                                           
qwen3-next-80b28d42/43 98%01m                                           
claude-sonnet-4.624d41/43 95%02m                                           
gpt-oss-120b43d41/43 95%01m                                           
qwen3.6-27b25d41/43 95%016m                                           
qwen3.6-35b-a3b-or29d41/43 95%05m                                           
qwen3.6-35b-bf1628d41/43 95%016m                                           
granite-4.1-30b28d40/43 93%04m                                           
mistral-small-3.1-24b-instruct-250343d38/43 88%04m                                           
qwen3.5-122b-a10b-cluster31d38/43 88%035m                                           
devstral-small-2-251242d37/43 86%04m                                           
llama-3.3-70b42d37/43 90%214m                                           
qwen3.5-4b28d36/43 84%09m                                           
granite-4.1-8b43d35/43 81%01m                                           
qwen3-coder-30b29d35/43 81%01m                                           
gemini-2.5-flash-lite29d32/43 74%02m                                           
qwen3.5-2b28d25/43 58%01m                                           
deepseek-r1-distill-qwen-32b27d24/43 56%044m                                           
qwen3-235b-a22b-q4-cluster30d17/43 85%230m                                           
phi-4-reasoning-plus28d16/43 37%01.3h                                           
qwen3.5-0.8b28d14/43 33%01m                                           
phi-428d5/43 100%380m                                           
deepseek-r1-32b28d4/43 80%380m                                           

Composition

The benches that make up this harness's gauntlet, by domain.