Touchstone
← Benches

gate.fidelity.enum

Gategauntlet

A deterministic gate probe — harness-invariant vitals / fidelity / tool-use check that every model must clear before the ladders count.

Solved
21/23
runs passed
Models
22
have attempted
Harnesses
2
scaffolds tried

Runs (latest per model × harness — solved sorted first)

ModelHarnessResultTurnstok/sLatencyCtxWhen
gpt-oss-120bbaselinePASS134.2497ms64k2026-06-23
granite-4.1-8bbaselinePASS114.4139ms64k2026-06-23
llama-3.3-70bbaselinePASS12.7741ms64k2026-06-23
devstral-small-2-2512baselinePASS17.5268ms64k2026-06-23
mistral-small-3.1-24b-instruct-2503baselinePASS17.6262ms64k2026-06-23
qwen3.5-122b-a10b-clusterbaselinePASS116.819.7s64k2026-06-29
qwen3.5-4bbaselinePASS145.47.3s128k2026-06-30
gpt-oss-20bbaselinePASS173.9988ms64k2026-07-01
qwen3-coder-30bbaselinePASS117.2116ms64k2026-07-01
gemma-4-26b-a4b-itbaselinePASS16.8294ms64k2026-07-01
qwen3.6-35b-a3b-orbaselinePASS189.73.0s64k2026-07-01
gemini-2.5-flash-litebaselinePASS10.91.2s64k2026-07-01
qwen3.5-0.8bbaselinePASS123.087ms64k2026-07-01
qwen3.6-27bbaselinePASS17.930.1s64k2026-07-01
qwen3.6-35b-bf16baselinePASS134.27.7s64k2026-07-02
qwen3.5-2bbaselinePASS127.074ms64k2026-07-02
granite-4.1-30bbaselinePASS16.4313ms64k2026-07-02
qwen3.6-27bv1.7.1PASS16.9434ms64k2026-07-02
qwen3.6-35b-a3bbaselinePASS125.2119ms64k2026-07-02
qwen3-next-80bbaselinePASS117.7113ms64k2026-07-02
claude-sonnet-4.6baselinePASS12.51.6s195k2026-07-06
deepseek-r1-distill-qwen-32bbaselinefail14.61.5m64k2026-07-02
phi-4-reasoning-plusbaselinefail114.423.6s64k2026-07-02

Transcripts

gpt-oss-120b · baseline · PASS
done
granite-4.1-8b · baseline · PASS
done
llama-3.3-70b · baseline · PASS
done
devstral-small-2-2512 · baseline · PASS
done
mistral-small-3.1-24b-instruct-2503 · baseline · PASS
done
qwen3.5-122b-a10b-cluster · baseline · PASS
done
qwen3.5-4b · baseline · PASS


done
gpt-oss-20b · baseline · PASS
done
qwen3-coder-30b · baseline · PASS
done
gemma-4-26b-a4b-it · baseline · PASS
done
qwen3.6-35b-a3b-or · baseline · PASS
done
gemini-2.5-flash-lite · baseline · PASS
done
qwen3.5-0.8b · baseline · PASS
done
qwen3.6-27b · baseline · PASS


done
qwen3.6-35b-bf16 · baseline · PASS


done
qwen3.5-2b · baseline · PASS
done
granite-4.1-30b · baseline · PASS
done
qwen3.6-27b · v1.7.1 · PASS


done
qwen3.6-35b-a3b · baseline · PASS


done
qwen3-next-80b · baseline · PASS
done
claude-sonnet-4.6 · baseline · PASS
done
deepseek-r1-distill-qwen-32b · baseline · fail


The correct status for a task that has been completed and merged is:

**done**
phi-4-reasoning-plus · baseline · fail
User says: "A task's work has been completed and merged. Reply with the single status value that means finished. Choose exactly one from this list: todo, backlog, in_progress, in_review, done, blocked, cancelled. Output only that one value in lowercase, nothing else." So answer is "done". But check instructions: "A task's work has been completed and merged" implies that the correct status is "done", because it means finished.

Wait, but careful reading: The list provided: todo, backlog, in_progress, in_review, done, blocked, cancelled. Which one means finished? "Done" means finished. But check instructions: "A task's work has been completed and merged." That implies that the status is "done". So answer should be "done".

But wait, maybe it's "in_review"? No, because "merged" means code review passed. But then "done" is the final state.

Wait, but careful reading: "A task's work has been completed and merged." The instructions say: "Reply with the single status value that means finished." So answer is "done". But check list: "todo", "backlog", "in_progress", "in_review", "done", "blocked", "cancelled". Which one means finished? "Done" means finished. So answer is "done".

I must output exactly "done" in lowercase, nothing else.

Thus answer: done

I'll produce final answer as "done". We'll check instructions: "Output only that one value in lowercase, nothing else." So I'll output "done" with no extra text.

I'll now produce answer.done