Figure 02 · Audit quality
Codex scored higher on the reconstructed finding set
GPT-5.6 SolGrok 4.6 Build
One run per model. Harnesses differed. Manually reconstructed ground truth under a closed-world policy; unmatched headings are not automatically invalid. Accuracy is undefined.