QwenSWEBench

QwenSWEBench - in-house coding benchmark for evaluating software engineering capabilities. Evaluated with Claude Code harness, avg@3, 8-hour timeout, max_tokens=32768, temp=1.0, 256K context.

Category

Agentic Coding

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for QwenSWEBench

Model Score Date Verified
Qwen3.8-27B
80.27%
18.08.2026 Verified
Qwen3.6-27B
49.30
18.08.2026 Unverified
Qwen3.7-Plus
26.76%
18.08.2026 Unverified
Opus4.6 Max
39.19%
18.08.2026 Unverified
Qwen3.8-2.4T-A95B
84.86%
18.08.2026 Verified
Fable-5
100.00%
18.08.2026 Unverified
GPT-5.6 Sol
65.41%
18.08.2026 Unverified
Claude Opus 4.8
93.78%
18.08.2026 Unverified
Qwen3.7-Max
38.11%
18.08.2026 Unverified