QwenQoderBench

QwenQoderBench - in-house coding benchmark to evaluate user experience on Qoder. Evaluated with Claude Code harness, avg@5, 6-hour timeout, max_tokens=32768, temp=1.0, 256K context.

Category

Agentic Coding

Max Score

—

Score Type

percent

Active

Yes

Model Scores

Scores for QwenQoderBench

Model Score Date Verified
Qwen3.8-2.4T-A95B
82.13%
18.08.2026 Verified
Fable-5
100.00%
18.08.2026 Unverified
GPT-5.6 Sol
64.64%
18.08.2026 Unverified
Claude Opus 4.8
98.48%
18.08.2026 Unverified
Qwen3.7-Max
36.80
18.08.2026 Unverified