QwenQoderBench
QwenQoderBench - in-house coding benchmark to evaluate user experience on Qoder. Evaluated with Claude Code harness, avg@5, 6-hour timeout, max_tokens=32768, temp=1.0, 256K context.
Category
Agentic Coding
Max Score
—
Score Type
percent
Active
Yes
Model Scores
Scores for QwenQoderBench
| Model | Score | Date | Verified |
|---|---|---|---|
| Qwen3.8-2.4T-A95B |
82.13%
|
18.08.2026 | Verified |
| Fable-5 |
100.00%
|
18.08.2026 | Unverified |
| GPT-5.6 Sol |
64.64%
|
18.08.2026 | Unverified |
| Claude Opus 4.8 |
98.48%
|
18.08.2026 | Unverified |
| Qwen3.7-Max |
36.80
|
18.08.2026 | Unverified |