| Agent | Model | Reward | Runtime | Tools | Classification | |
|---|---|---|---|---|---|---|
| claude-code | claude-opus-5 | ✗ failed | 30m 43s | 77 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 34m 34s | 88 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 23m 55s | 54 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 27m 42s | 56 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 33m 21s | 87 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 29m 17s | 68 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 34m 14s | 81 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 31m 46s | 77 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 29m 24s | 85 | GOOD_FAILURE | view → |
| claude-code | claude-opus-5 | ✗ failed | 33m 21s | 92 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 26m 44s | 64 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 2h 31m | 64 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 28m 19s | 86 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 32m 49s | 81 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 23m 44s | 54 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 27m 51s | 60 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 23m 36s | 63 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 31m 26s | 70 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 25m 13s | 57 | GOOD_FAILURE | view → |
| codex | gpt-5.6-sol | ✗ failed | 27m 37s | 56 | GOOD_FAILURE | view → |
The task as the agent saw it and the verifier graded it. The reference solution/ is included below for transparency.