Hacker News new | ask | show | jobs
by MysticBirdie 157 days ago
(Edit: Updated results + Windsurf coding demo showing same 40%→100% pattern in production AI workflows. Domain grounding > model scale.) Compositional Chaining Benchmark — by Chain Type

Chain Type

Triad: 81.8%

Raw: 72.7%

∆ (Triad–Raw): +9.1pp

FAULT_INJECTION

Triad: 100%

Raw: 71.4%

∆: +28.6pp

CROSS_CHARACTER

Triad: 50%*

Raw: 100% *Triad cross-char losses were 100% rate limit timeouts (ERRORs), not model mistakes.

Depth Drift — Accuracy vs. Hops Step | Triad | Raw 1⃣ 75% | 87.5% 2⃣ 75% | 75% 3⃣ 83.3% | 66.7% ← Raw degrades 4⃣ 100% | 100% 5⃣ 100% | 100%

Raw drops 21pp between steps 1–3, while Triad improves.

Fault Injection — The Key Result Injected Error | Triad | Raw Hadrian’s Wall as existing | PASS | FAIL Julius Caesar as living | PASS | PASS Paper money replacing coins | PASS | FAIL

Triad: 3/3. Raw: 1/3.

In short: Triad consistently maintains compositional reasoning under stress and even strengthens across depth