- Published
- Aug 26, 2026, 11:00 PM UTC
- Question pack
- coding-fast-v4.10
- Coverage
- 2 measured configurations
- Batch
- snapshot-2026-08-26T23-00-00Z-r3
Same-batch evidence
| Measure | Qwen 3.8 / Max | Kimi K3 / High |
|---|---|---|
| Rank | #10 | #21 |
| Score | 66/100 | 61/100 |
| Elapsed | 21m 19s | 27m 47s |
| Reference cost | $0.89 | $0.44 |
| Route | Custom endpoint | Custom endpoint |
| Black-box Regression Audit | 10/20 | 9/20 |
| Retry Planner Counterexamples | 17/20 | 13/20 |
| CI Adversarial Audit | 12/20 | 12/20 |
| Transaction Regression Design | 13/20 | 14/20 |
| Cache Regression Test Design | 14/20 | 13/20 |
The decision this comparison can support
Does the measured quality difference remain useful after you account for route reliability, elapsed time, and your own task profile?
Start with the score and question profile. Use elapsed time only after both configurations clear your quality floor, and leave cost undecided when either side is not covered.