QwenSWEBench
QwenSWEBench - in-house coding benchmark for evaluating software engineering capabilities. Evaluated with Claude Code harness, avg@3, 8-hour timeout, max_tokens=32768, temp=1.0, 256K context.
Category
Agentic Coding
Max Score
100.0
Score Type
percent
Active
Yes
Model Scores
Scores for QwenSWEBench
| Model | Score | Date | Verified |
|---|---|---|---|
| Qwen3.8-27B |
80.27%
|
18.08.2026 | Verified |
| Qwen3.6-27B |
49.30
|
18.08.2026 | Unverified |
| Qwen3.7-Plus |
26.76%
|
18.08.2026 | Unverified |
| Opus4.6 Max |
39.19%
|
18.08.2026 | Unverified |
| Qwen3.8-2.4T-A95B |
84.86%
|
18.08.2026 | Verified |
| Fable-5 |
100.00%
|
18.08.2026 | Unverified |
| GPT-5.6 Sol |
65.41%
|
18.08.2026 | Unverified |
| Claude Opus 4.8 |
93.78%
|
18.08.2026 | Unverified |
| Qwen3.7-Max |
38.11%
|
18.08.2026 | Unverified |