Qwen3.5-27B vs Qwen3.6-27B vs Qwen3.8-27B vs Qwen3.8-Flash-Next
New ComparisonScores are fetched live from the current database on every visit — nothing is cached.
Benchmark Scores Comparison
Qwen3.6-27B
Qwen3.5-27B
Qwen3.8-Flash-Next
Qwen3.8-27B
Qwen3.6-27B
27.0B params
Score: 100.0
Qwen3.5-27B
27.0B params
Score: 100.0
Qwen3.8-Flash-Next
125.0B params
Score: 70.0
Qwen3.8-27B
27.0B params
Score: 100.0
Coverage matrix
4 models × 128 benchmarks — hover a benchmark name for its category
Shading = score relative to the best score among the selected models:
Low
Mid
High
Missing (—)
The totals row shows how many of the 128 benchmarks each model has scores for.
| Benchmark | Qwen3.5-27B Qwen Team (Alibaba Cloud) | Qwen3.6-27B Qwen Team (Alibaba Cloud) | Qwen3.8-27B Qwen Team (Alibaba Cloud) | Qwen3.8-Flash-Next Qwen Team (Alibaba) |
|---|---|---|---|---|
| HMMT Feb 25 | 92 | 93.8 | — | — |
| DynaMath | 87.7 | 85.6 | — | — |
| GPQA Diamond | 85.5 | 87.8 | 89.2 | 91.7 |
| IFBench (prompt loose) | — | 69.1 | 79.5 | — |
| MathVista (mini) | 87.8 | 87.4 | — | — |
| MMBench EN-DEV v1.1 | 92.6 | 92.3 | — | — |
| Nuscene | 15.2 | — | — | — |
| LiveCodeBench v6 | 80.7 | 83.9 | 90.3 | 91.9 |
| SWE-bench Pro | 51.2 | 53.5 | 61.7 | 62.5 |
| BFCL-V4 | 68.5 | — | — | — |
| RealWorldQA | 83.7 | 84.1 | 85.9 | 88.5 |
| Agents' Last Exam (Score) | — | — | 42.9 | 51.2 |
| EmbSpatialBench | 84.5 | 84.6 | — | — |
| AA-LCR | 66.1 | 73.3 | — | — |
| Hypersim | 13 | — | — | — |
| MathVision | 86 | 85.1 | 90 | 90.6 |
| AIME 26 | 92.6 | 94.1 | — | — |
| BrowseComp-zh | 62.1 | — | — | — |
| MAXIFE | 88 | — | — | — |
| AndroidWorld | 64.2 | 70.3 | 81.9 | 84.5 |
| Agents' Last Exam | — | 10.6 | 20.4 | 24.3 |
| Toolathlon Verified | — | — | 67.1 | 73.5 |
| RecreationBench | — | 29.8 | 47.1 | 49.9 |
| VITA-Bench | 41.8 | — | — | — |
| TAU3-Bench | 68.4 | — | — | — |
| ScreenSpot Pro | 70.3 | 76.1 | — | — |
| OJBench | 40.1 | — | — | — |
| WMDP (Bio) | — | 84.8 | — | — |
| MMStar | 81 | 81.4 | — | — |
| OCRBench | 89.4 | — | — | — |
| Seal-0 | 47.2 | — | — | — |
| PMC-VQA | 62.4 | — | — | — |
| DeepSearch QA | — | 71.1 | — | — |
| MMLongBench-Doc | 60.2 | — | — | — |
| WildClawBench | — | 43.2 | — | — |
| AI2D_TEST | 92.9 | — | — | — |
| LingoQA | 82 | — | — | — |
| NOVA-63 | 58.1 | — | — | — |
| NL2Repo | 27.3 | 36.2 | 42.3 | — |
| HPCT | — | 48.7 | — | — |
| MMMU-Pro | 75 | 75.8 | — | — |
| INCLUDE | 81.6 | — | — | — |
| QwenClawBench | 52.2 | 53.4 | — | — |
| BabyVision | 44.6 | 28.9 | 65.7 | — |
| SLAKE | 80 | — | — | — |
| MMMLU | 85.9 | — | — | — |
| Claw-Eval Avg | 64.3 | 72.4 | 56.9 | 60.4 |
| VideoMMMU | 82.3 | 84.4 | — | — |
| HMMT Nov 25 | 89.8 | 90.7 | — | — |
| Multi-Challenge | 60.8 | — | — | — |
| PolyMATH | 71.2 | — | — | — |
| SWE-MM | — | 25.7 | 38.6 | — |
| MMLU-ProX | 82.2 | — | — | — |
| MMLU-Pro | 86.1 | 86.2 | — | — |
| CodeForces | 1899 | — | — | — |
| SuperGPQA | 65.6 | 66 | — | — |
| OSWorld-Verified | 56.2 | 63.9 | 84.3 | — |
| TIR-Bench | 59.8 | — | — | — |
| Global PIQA | 87.5 | — | — | — |
| IFEval | 95 | — | — | — |
| HLE (with tools) | 48.5 | — | 30.8 | 35.9 |
| LVBench | 73.6 | — | 72.4 | 76.6 |
| CharXiv (RQ) | 79.5 | 78.4 | 83.7 | 84.6 |
| BrowseComp | 61 | — | — | — |
| MedXpertQA-MM | 62.4 | — | — | — |
| MMLU-Redux | 93.2 | 93.5 | — | — |
| NL2Repo-Bench | — | — | 42.3 | 48.1 |
| SkillsBench | — | 46.6 | — | — |
| WebArena-Verified | — | 48.8 | 64.8 | — |
| CoWorkBench | — | 61 | 70.7 | 73.9 |
| Lab Bench (ProtocolQA) | — | 69.1 | — | — |
| MCPMark | 36.3 | — | — | — |
| SWE-bench Multilingual | 69.3 | 71.3 | 73.8 | 81 |
| MMVU | 73.3 | — | — | — |
| FullStackBench zh | 57.4 | — | — | — |
| MLVU | 85.9 | 86.6 | — | — |
| Beam128K | — | 63 | — | — |
| IFBench | 76.5 | 70.8 | 79.5 | 81.3 |
| FullStackBench en | 60.1 | — | — | — |
| SWE-bench Verified | 75 | 77.2 | — | — |
| IMOAnswerBench | 79.9 | 80.8 | — | — |
| Humanity's Last Exam | 24.3 | 24 | 30.8 | — |
| CountBench | 97.8 | 97.8 | — | — |
| WMDP (Chem) | — | 74.8 | — | — |
| ERQA | 60.5 | 62.5 | 65.5 | 72.3 |
| VideoMME (w/o sub.) | 82.8 | — | — | — |
| Terminal-Bench 2.0 | 41.6 | 59.3 | — | — |
| DeepPlanning | 22.6 | — | — | — |
| QwenSWEBench | — | 49.3 | 79 | — |
| QwenWebBench | 1068 | 1487 | — | — |
| TAU2-Bench | 79 | — | — | — |
| ODInW13 | 41.1 | — | — | — |
| VlmsAreBlind | 96.9 | 97 | — | — |
| Terminal-Bench 2.1 (Terminus-2) | — | 63.4 | 73 | — |
| OmniDocBench 1.5 | 88.9 | 89.4 | 91.1 | — |
| HallusionBench | 70 | — | — | — |
| OCRBench | 89.4 | 89.4 | — | — |
| HMMT Feb 26 | 84.3 | 84.3 | — | — |
| CC-OCR | 81 | 81.2 | — | — |
| RefCOCO (avg) | 90.9 | 92.5 | — | — |
| JobBench | — | 21.8 | 33.4 | 55.7 |
| SciCode (subtask) | — | 39.8 | — | — |
| Tool Decathlon | 31.5 | — | — | — |
| OSWorld 2.0 (Partial) | — | — | 48 | 52.3 |
| OSWorld 2.0 (Binary) | — | — | 19.4 | 19.4 |
| ZEROBench_sub | 36.2 | — | — | — |
| C-Eval | 90.5 | 91.4 | — | — |
| WideSearch | 66.4 | — | — | — |
| SimpleVQA | 56 | 56.1 | — | — |
| VideoMME (w sub.) | 87 | 87.7 | — | — |
| SkillsBench Avg5 | 27.2 | 48.2 | — | — |
| Vision2Web | — | 45 | 62.9 | 64 |
| TauBench V3 Banking | — | 16.7 | — | — |
| Claw-Eval Pass^3 | 46.2 | 60.6 | 57.4 | 64.4 |
| WMT24++ (en→xx) | 77.6 | — | — | — |
| LongBench v2 | 60.6 | — | — | — |
| MCP-Atlas | 68.4 | 62.5 | — | — |
| V-Star | 93.7 | 94.7 | — | — |
| DeepSWE 1.1 | — | 13.3 | 42.2 | 58.7 |
| MBCT | — | 45.9 | — | — |
| VCT | — | 33.7 | — | — |
| Gaia2 | — | 40 | — | — |
| SUNRGBD | 35.4 | — | — | — |
| RefSpatialBench | 67.7 | 70 | — | — |
| MMMU | 82.3 | 82.9 | — | — |
| GDPVal-AA v2 | — | 1141 | — | — |
| MVBench | 74.6 | 75.5 | — | — |
| ZEROBench | 10 | — | — | — |
| Covered | 98/128 | 78/128 | 35/128 | 25/128 |
Fully comparable benchmarks
Scored by all 4 selected models (12)
| Benchmark | Category | Qwen3.6-27B | Qwen3.5-27B | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|---|---|---|
| GPQA Diamond | stem_reasoning | 87.8 | 85.5 | 91.7 | 89.2 |
| LiveCodeBench v6 | stem_reasoning | 83.9 | 80.7 | 91.9 | 90.3 |
| SWE-bench Pro | coding_agent | 53.5 | 51.2 | 62.5 | 61.7 |
| RealWorldQA | vision_language | 84.1 | 83.7 | 88.5 | 85.9 |
| MathVision | vision_language | 85.1 | 86 | 90.6 | 90 |
| AndroidWorld | general_agent | 70.3 | 64.2 | 84.5 | 81.9 |
| Claw-Eval Avg | coding_agent | 72.4 | 64.3 | 60.4 | 56.9 |
| CharXiv (RQ) | document_understanding | 78.4 | 79.5 | 84.6 | 83.7 |
| SWE-bench Multilingual | coding_agent | 71.3 | 69.3 | 81 | 73.8 |
| IFBench | instruction_following | 70.8 | 76.5 | 81.3 | 79.5 |
| ERQA | spatial_intelligence | 62.5 | 60.5 | 72.3 | 65.5 |
| Claw-Eval Pass^3 | coding_agent | 60.6 | 46.2 | 64.4 | 57.4 |
Partial coverage benchmarks
Scored by at least one but not all selected models (116) — missing scores show as —
| Benchmark | Category | Qwen3.6-27B | Qwen3.5-27B | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|---|---|---|
| HMMT Feb 25 2/4 models | stem_reasoning | 93.8 | 92 | — | — |
| DynaMath 2/4 models | vision_language | 85.6 | 87.7 | — | — |
| IFBench (prompt loose) 2/4 models | instruction_following | 69.1 | — | — | 79.5 |
| MathVista (mini) 2/4 models | vision_language | 87.4 | 87.8 | — | — |
| MMBench EN-DEV v1.1 2/4 models | vision_language | 92.3 | 92.6 | — | — |
| Nuscene 1/4 models | spatial_intelligence | — | 15.2 | — | — |
| BFCL-V4 1/4 models | general_agent | — | 68.5 | — | — |
| Agents' Last Exam (Score) 2/4 models | general_agent | — | — | 51.2 | 42.9 |
| EmbSpatialBench 2/4 models | spatial_intelligence | 84.6 | 84.5 | — | — |
| AA-LCR 2/4 models | long_context | 73.3 | 66.1 | — | — |
| Hypersim 1/4 models | spatial_intelligence | — | 13 | — | — |
| AIME 26 2/4 models | stem_reasoning | 94.1 | 92.6 | — | — |
| BrowseComp-zh 1/4 models | general_agent | — | 62.1 | — | — |
| MAXIFE 1/4 models | multilingual | — | 88 | — | — |
| Agents' Last Exam 3/4 models | general_agent | 10.6 | — | 24.3 | 20.4 |
| Toolathlon Verified 2/4 models | general_agent | — | — | 73.5 | 67.1 |
| RecreationBench 3/4 models | general_agent | 29.8 | — | 49.9 | 47.1 |
| VITA-Bench 1/4 models | general_agent | — | 41.8 | — | — |
| TAU3-Bench 1/4 models | general_agent | — | 68.4 | — | — |
| ScreenSpot Pro 2/4 models | general_agent | 76.1 | 70.3 | — | — |
| OJBench 1/4 models | stem_reasoning | — | 40.1 | — | — |
| WMDP (Bio) 1/4 models | safety | 84.8 | — | — | — |
| MMStar 2/4 models | vision_language | 81.4 | 81 | — | — |
| OCRBench 1/4 models | document_understanding | — | 89.4 | — | — |
| Seal-0 1/4 models | general_agent | — | 47.2 | — | — |
| PMC-VQA 1/4 models | vision_language | — | 62.4 | — | — |
| DeepSearch QA 1/4 models | general_agent | 71.1 | — | — | — |
| MMLongBench-Doc 1/4 models | document_understanding | — | 60.2 | — | — |
| WildClawBench 1/4 models | coding_agent | 43.2 | — | — | — |
| AI2D_TEST 1/4 models | document_understanding | — | 92.9 | — | — |
| LingoQA 1/4 models | spatial_intelligence | — | 82 | — | — |
| NOVA-63 1/4 models | multilingual | — | 58.1 | — | — |
| NL2Repo 3/4 models | coding_agent | 36.2 | 27.3 | — | 42.3 |
| HPCT 1/4 models | safety | 48.7 | — | — | — |
| MMMU-Pro 2/4 models | vision_language | 75.8 | 75 | — | — |
| INCLUDE 1/4 models | multilingual | — | 81.6 | — | — |
| QwenClawBench 2/4 models | coding_agent | 53.4 | 52.2 | — | — |
| BabyVision 3/4 models | vision_language | 28.9 | 44.6 | — | 65.7 |
| SLAKE 1/4 models | vision_language | — | 80 | — | — |
| MMMLU 1/4 models | multilingual | — | 85.9 | — | — |
| VideoMMMU 2/4 models | video_understanding | 84.4 | 82.3 | — | — |
| HMMT Nov 25 2/4 models | stem_reasoning | 90.7 | 89.8 | — | — |
| Multi-Challenge 1/4 models | instruction_following | — | 60.8 | — | — |
| PolyMATH 1/4 models | multilingual | — | 71.2 | — | — |
| SWE-MM 2/4 models | coding_agent | 25.7 | — | — | 38.6 |
| MMLU-ProX 1/4 models | multilingual | — | 82.2 | — | — |
| MMLU-Pro 2/4 models | knowledge | 86.2 | 86.1 | — | — |
| CodeForces 1/4 models | stem_reasoning | — | 1899 | — | — |
| SuperGPQA 2/4 models | knowledge | 66 | 65.6 | — | — |
| OSWorld-Verified 3/4 models | general_agent | 63.9 | 56.2 | — | 84.3 |
| TIR-Bench 1/4 models | vision_language | — | 59.8 | — | — |
| Global PIQA 1/4 models | multilingual | — | 87.5 | — | — |
| IFEval 1/4 models | instruction_following | — | 95 | — | — |
| HLE (with tools) 3/4 models | stem_reasoning | — | 48.5 | 35.9 | 30.8 |
| LVBench 3/4 models | video_understanding | — | 73.6 | 76.6 | 72.4 |
| BrowseComp 1/4 models | general_agent | — | 61 | — | — |
| MedXpertQA-MM 1/4 models | vision_language | — | 62.4 | — | — |
| MMLU-Redux 2/4 models | knowledge | 93.5 | 93.2 | — | — |
| NL2Repo-Bench 2/4 models | coding_agent | — | — | 48.1 | 42.3 |
| SkillsBench 1/4 models | general_agent | 46.6 | — | — | — |
| WebArena-Verified 2/4 models | general_agent | 48.8 | — | — | 64.8 |
| CoWorkBench 3/4 models | general_agent | 61 | — | 73.9 | 70.7 |
| Lab Bench (ProtocolQA) 1/4 models | safety | 69.1 | — | — | — |
| MCPMark 1/4 models | general_agent | — | 36.3 | — | — |
| MMVU 1/4 models | video_understanding | — | 73.3 | — | — |
| FullStackBench zh 1/4 models | coding_agent | — | 57.4 | — | — |
| MLVU 2/4 models | video_understanding | 86.6 | 85.9 | — | — |
| Beam128K 1/4 models | long_context | 63 | — | — | — |
| FullStackBench en 1/4 models | coding_agent | — | 60.1 | — | — |
| SWE-bench Verified 2/4 models | coding_agent | 77.2 | 75 | — | — |
| IMOAnswerBench 2/4 models | stem_reasoning | 80.8 | 79.9 | — | — |
| Humanity's Last Exam 3/4 models | stem_reasoning | 24 | 24.3 | — | 30.8 |
| CountBench 2/4 models | spatial_intelligence | 97.8 | 97.8 | — | — |
| WMDP (Chem) 1/4 models | safety | 74.8 | — | — | — |
| VideoMME (w/o sub.) 1/4 models | video_understanding | — | 82.8 | — | — |
| Terminal-Bench 2.0 2/4 models | coding_agent | 59.3 | 41.6 | — | — |
| DeepPlanning 1/4 models | general_agent | — | 22.6 | — | — |
| QwenSWEBench 2/4 models | coding_agent | 49.3 | — | — | 79 |
| QwenWebBench 2/4 models | coding_agent | 1487 | 1068 | — | — |
| TAU2-Bench 1/4 models | general_agent | — | 79 | — | — |
| ODInW13 1/4 models | spatial_intelligence | — | 41.1 | — | — |
| VlmsAreBlind 2/4 models | vision_language | 97 | 96.9 | — | — |
| Terminal-Bench 2.1 (Terminus-2) 2/4 models | coding_agent | 63.4 | — | — | 73 |
| OmniDocBench 1.5 3/4 models | document_understanding | 89.4 | 88.9 | — | 91.1 |
| HallusionBench 1/4 models | vision_language | — | 70 | — | — |
| OCRBench 2/4 models | document_understanding | 89.4 | 89.4 | — | — |
| HMMT Feb 26 2/4 models | stem_reasoning | 84.3 | 84.3 | — | — |
| CC-OCR 2/4 models | document_understanding | 81.2 | 81 | — | — |
| RefCOCO (avg) 2/4 models | spatial_intelligence | 92.5 | 90.9 | — | — |
| JobBench 3/4 models | general_agent | 21.8 | — | 55.7 | 33.4 |
| SciCode (subtask) 1/4 models | stem_reasoning | 39.8 | — | — | — |
| Tool Decathlon 1/4 models | general_agent | — | 31.5 | — | — |
| OSWorld 2.0 (Partial) 2/4 models | general_agent | — | — | 52.3 | 48 |
| OSWorld 2.0 (Binary) 2/4 models | general_agent | — | — | 19.4 | 19.4 |
| ZEROBench_sub 1/4 models | vision_language | — | 36.2 | — | — |
| C-Eval 2/4 models | knowledge | 91.4 | 90.5 | — | — |
| WideSearch 1/4 models | general_agent | — | 66.4 | — | — |
| SimpleVQA 2/4 models | vision_language | 56.1 | 56 | — | — |
| VideoMME (w sub.) 2/4 models | video_understanding | 87.7 | 87 | — | — |
| SkillsBench Avg5 2/4 models | coding_agent | 48.2 | 27.2 | — | — |
| Vision2Web 3/4 models | vision_language | 45 | — | 64 | 62.9 |
| TauBench V3 Banking 1/4 models | general_agent | 16.7 | — | — | — |
| WMT24++ (en→xx) 1/4 models | multilingual | — | 77.6 | — | — |
| LongBench v2 1/4 models | long_context | — | 60.6 | — | — |
| MCP-Atlas 2/4 models | general_agent | 62.5 | 68.4 | — | — |
| V-Star 2/4 models | vision_language | 94.7 | 93.7 | — | — |
| DeepSWE 1.1 3/4 models | coding_agent | 13.3 | — | 58.7 | 42.2 |
| MBCT 1/4 models | safety | 45.9 | — | — | — |
| VCT 1/4 models | safety | 33.7 | — | — | — |
| Gaia2 1/4 models | general_agent | 40 | — | — | — |
| SUNRGBD 1/4 models | spatial_intelligence | — | 35.4 | — | — |
| RefSpatialBench 2/4 models | spatial_intelligence | 70 | 67.7 | — | — |
| MMMU 2/4 models | vision_language | 82.9 | 82.3 | — | — |
| GDPVal-AA v2 1/4 models | general_agent | 1141 | — | — | — |
| MVBench 2/4 models | video_understanding | 75.5 | 74.6 | — | — |
| ZEROBench 1/4 models | vision_language | — | 10 | — | — |