Qwen3.5-27B vs Qwen3.6-27B vs Qwen3.8-27B vs Qwen3.8-Flash-Next

New Comparison

Scores are fetched live from the current database on every visit — nothing is cached.

Benchmark Scores Comparison

Qwen3.6-27B Qwen3.5-27B Qwen3.8-Flash-Next Qwen3.8-27B

Qwen3.6-27B

27.0B params

Score: 100.0

Qwen3.5-27B

27.0B params

Score: 100.0

Qwen3.8-Flash-Next

125.0B params

Score: 70.0

Qwen3.8-27B

27.0B params

Score: 100.0

Coverage matrix

4 models × 128 benchmarks — hover a benchmark name for its category

Full Coverage Matrix
Shading = score relative to the best score among the selected models: Low Mid High Missing (—) The totals row shows how many of the 128 benchmarks each model has scores for.
Benchmark Qwen3.5-27B Qwen Team (Alibaba Cloud) Qwen3.6-27B Qwen Team (Alibaba Cloud) Qwen3.8-27B Qwen Team (Alibaba Cloud) Qwen3.8-Flash-Next Qwen Team (Alibaba)
HMMT Feb 25 92 93.8 — —
DynaMath 87.7 85.6 — —
GPQA Diamond 85.5 87.8 89.2 91.7
IFBench (prompt loose) — 69.1 79.5 —
MathVista (mini) 87.8 87.4 — —
MMBench EN-DEV v1.1 92.6 92.3 — —
Nuscene 15.2 — — —
LiveCodeBench v6 80.7 83.9 90.3 91.9
SWE-bench Pro 51.2 53.5 61.7 62.5
BFCL-V4 68.5 — — —
RealWorldQA 83.7 84.1 85.9 88.5
Agents' Last Exam (Score) — — 42.9 51.2
EmbSpatialBench 84.5 84.6 — —
AA-LCR 66.1 73.3 — —
Hypersim 13 — — —
MathVision 86 85.1 90 90.6
AIME 26 92.6 94.1 — —
BrowseComp-zh 62.1 — — —
MAXIFE 88 — — —
AndroidWorld 64.2 70.3 81.9 84.5
Agents' Last Exam — 10.6 20.4 24.3
Toolathlon Verified — — 67.1 73.5
RecreationBench — 29.8 47.1 49.9
VITA-Bench 41.8 — — —
TAU3-Bench 68.4 — — —
ScreenSpot Pro 70.3 76.1 — —
OJBench 40.1 — — —
WMDP (Bio) — 84.8 — —
MMStar 81 81.4 — —
OCRBench 89.4 — — —
Seal-0 47.2 — — —
PMC-VQA 62.4 — — —
DeepSearch QA — 71.1 — —
MMLongBench-Doc 60.2 — — —
WildClawBench — 43.2 — —
AI2D_TEST 92.9 — — —
LingoQA 82 — — —
NOVA-63 58.1 — — —
NL2Repo 27.3 36.2 42.3 —
HPCT — 48.7 — —
MMMU-Pro 75 75.8 — —
INCLUDE 81.6 — — —
QwenClawBench 52.2 53.4 — —
BabyVision 44.6 28.9 65.7 —
SLAKE 80 — — —
MMMLU 85.9 — — —
Claw-Eval Avg 64.3 72.4 56.9 60.4
VideoMMMU 82.3 84.4 — —
HMMT Nov 25 89.8 90.7 — —
Multi-Challenge 60.8 — — —
PolyMATH 71.2 — — —
SWE-MM — 25.7 38.6 —
MMLU-ProX 82.2 — — —
MMLU-Pro 86.1 86.2 — —
CodeForces 1899 — — —
SuperGPQA 65.6 66 — —
OSWorld-Verified 56.2 63.9 84.3 —
TIR-Bench 59.8 — — —
Global PIQA 87.5 — — —
IFEval 95 — — —
HLE (with tools) 48.5 — 30.8 35.9
LVBench 73.6 — 72.4 76.6
CharXiv (RQ) 79.5 78.4 83.7 84.6
BrowseComp 61 — — —
MedXpertQA-MM 62.4 — — —
MMLU-Redux 93.2 93.5 — —
NL2Repo-Bench — — 42.3 48.1
SkillsBench — 46.6 — —
WebArena-Verified — 48.8 64.8 —
CoWorkBench — 61 70.7 73.9
Lab Bench (ProtocolQA) — 69.1 — —
MCPMark 36.3 — — —
SWE-bench Multilingual 69.3 71.3 73.8 81
MMVU 73.3 — — —
FullStackBench zh 57.4 — — —
MLVU 85.9 86.6 — —
Beam128K — 63 — —
IFBench 76.5 70.8 79.5 81.3
FullStackBench en 60.1 — — —
SWE-bench Verified 75 77.2 — —
IMOAnswerBench 79.9 80.8 — —
Humanity's Last Exam 24.3 24 30.8 —
CountBench 97.8 97.8 — —
WMDP (Chem) — 74.8 — —
ERQA 60.5 62.5 65.5 72.3
VideoMME (w/o sub.) 82.8 — — —
Terminal-Bench 2.0 41.6 59.3 — —
DeepPlanning 22.6 — — —
QwenSWEBench — 49.3 79 —
QwenWebBench 1068 1487 — —
TAU2-Bench 79 — — —
ODInW13 41.1 — — —
VlmsAreBlind 96.9 97 — —
Terminal-Bench 2.1 (Terminus-2) — 63.4 73 —
OmniDocBench 1.5 88.9 89.4 91.1 —
HallusionBench 70 — — —
OCRBench 89.4 89.4 — —
HMMT Feb 26 84.3 84.3 — —
CC-OCR 81 81.2 — —
RefCOCO (avg) 90.9 92.5 — —
JobBench — 21.8 33.4 55.7
SciCode (subtask) — 39.8 — —
Tool Decathlon 31.5 — — —
OSWorld 2.0 (Partial) — — 48 52.3
OSWorld 2.0 (Binary) — — 19.4 19.4
ZEROBench_sub 36.2 — — —
C-Eval 90.5 91.4 — —
WideSearch 66.4 — — —
SimpleVQA 56 56.1 — —
VideoMME (w sub.) 87 87.7 — —
SkillsBench Avg5 27.2 48.2 — —
Vision2Web — 45 62.9 64
TauBench V3 Banking — 16.7 — —
Claw-Eval Pass^3 46.2 60.6 57.4 64.4
WMT24++ (en→xx) 77.6 — — —
LongBench v2 60.6 — — —
MCP-Atlas 68.4 62.5 — —
V-Star 93.7 94.7 — —
DeepSWE 1.1 — 13.3 42.2 58.7
MBCT — 45.9 — —
VCT — 33.7 — —
Gaia2 — 40 — —
SUNRGBD 35.4 — — —
RefSpatialBench 67.7 70 — —
MMMU 82.3 82.9 — —
GDPVal-AA v2 — 1141 — —
MVBench 74.6 75.5 — —
ZEROBench 10 — — —
Covered 98/128 78/128 35/128 25/128

Fully comparable benchmarks

Scored by all 4 selected models (12)

Benchmark Category Qwen3.6-27B Qwen3.5-27B Qwen3.8-Flash-Next Qwen3.8-27B
GPQA Diamond stem_reasoning 87.8 85.5 91.7 89.2
LiveCodeBench v6 stem_reasoning 83.9 80.7 91.9 90.3
SWE-bench Pro coding_agent 53.5 51.2 62.5 61.7
RealWorldQA vision_language 84.1 83.7 88.5 85.9
MathVision vision_language 85.1 86 90.6 90
AndroidWorld general_agent 70.3 64.2 84.5 81.9
Claw-Eval Avg coding_agent 72.4 64.3 60.4 56.9
CharXiv (RQ) document_understanding 78.4 79.5 84.6 83.7
SWE-bench Multilingual coding_agent 71.3 69.3 81 73.8
IFBench instruction_following 70.8 76.5 81.3 79.5
ERQA spatial_intelligence 62.5 60.5 72.3 65.5
Claw-Eval Pass^3 coding_agent 60.6 46.2 64.4 57.4

Partial coverage benchmarks

Scored by at least one but not all selected models (116) — missing scores show as —

Benchmark Category Qwen3.6-27B Qwen3.5-27B Qwen3.8-Flash-Next Qwen3.8-27B
HMMT Feb 25 2/4 models stem_reasoning 93.8 92 — —
DynaMath 2/4 models vision_language 85.6 87.7 — —
IFBench (prompt loose) 2/4 models instruction_following 69.1 — — 79.5
MathVista (mini) 2/4 models vision_language 87.4 87.8 — —
MMBench EN-DEV v1.1 2/4 models vision_language 92.3 92.6 — —
Nuscene 1/4 models spatial_intelligence — 15.2 — —
BFCL-V4 1/4 models general_agent — 68.5 — —
Agents' Last Exam (Score) 2/4 models general_agent — — 51.2 42.9
EmbSpatialBench 2/4 models spatial_intelligence 84.6 84.5 — —
AA-LCR 2/4 models long_context 73.3 66.1 — —
Hypersim 1/4 models spatial_intelligence — 13 — —
AIME 26 2/4 models stem_reasoning 94.1 92.6 — —
BrowseComp-zh 1/4 models general_agent — 62.1 — —
MAXIFE 1/4 models multilingual — 88 — —
Agents' Last Exam 3/4 models general_agent 10.6 — 24.3 20.4
Toolathlon Verified 2/4 models general_agent — — 73.5 67.1
RecreationBench 3/4 models general_agent 29.8 — 49.9 47.1
VITA-Bench 1/4 models general_agent — 41.8 — —
TAU3-Bench 1/4 models general_agent — 68.4 — —
ScreenSpot Pro 2/4 models general_agent 76.1 70.3 — —
OJBench 1/4 models stem_reasoning — 40.1 — —
WMDP (Bio) 1/4 models safety 84.8 — — —
MMStar 2/4 models vision_language 81.4 81 — —
OCRBench 1/4 models document_understanding — 89.4 — —
Seal-0 1/4 models general_agent — 47.2 — —
PMC-VQA 1/4 models vision_language — 62.4 — —
DeepSearch QA 1/4 models general_agent 71.1 — — —
MMLongBench-Doc 1/4 models document_understanding — 60.2 — —
WildClawBench 1/4 models coding_agent 43.2 — — —
AI2D_TEST 1/4 models document_understanding — 92.9 — —
LingoQA 1/4 models spatial_intelligence — 82 — —
NOVA-63 1/4 models multilingual — 58.1 — —
NL2Repo 3/4 models coding_agent 36.2 27.3 — 42.3
HPCT 1/4 models safety 48.7 — — —
MMMU-Pro 2/4 models vision_language 75.8 75 — —
INCLUDE 1/4 models multilingual — 81.6 — —
QwenClawBench 2/4 models coding_agent 53.4 52.2 — —
BabyVision 3/4 models vision_language 28.9 44.6 — 65.7
SLAKE 1/4 models vision_language — 80 — —
MMMLU 1/4 models multilingual — 85.9 — —
VideoMMMU 2/4 models video_understanding 84.4 82.3 — —
HMMT Nov 25 2/4 models stem_reasoning 90.7 89.8 — —
Multi-Challenge 1/4 models instruction_following — 60.8 — —
PolyMATH 1/4 models multilingual — 71.2 — —
SWE-MM 2/4 models coding_agent 25.7 — — 38.6
MMLU-ProX 1/4 models multilingual — 82.2 — —
MMLU-Pro 2/4 models knowledge 86.2 86.1 — —
CodeForces 1/4 models stem_reasoning — 1899 — —
SuperGPQA 2/4 models knowledge 66 65.6 — —
OSWorld-Verified 3/4 models general_agent 63.9 56.2 — 84.3
TIR-Bench 1/4 models vision_language — 59.8 — —
Global PIQA 1/4 models multilingual — 87.5 — —
IFEval 1/4 models instruction_following — 95 — —
HLE (with tools) 3/4 models stem_reasoning — 48.5 35.9 30.8
LVBench 3/4 models video_understanding — 73.6 76.6 72.4
BrowseComp 1/4 models general_agent — 61 — —
MedXpertQA-MM 1/4 models vision_language — 62.4 — —
MMLU-Redux 2/4 models knowledge 93.5 93.2 — —
NL2Repo-Bench 2/4 models coding_agent — — 48.1 42.3
SkillsBench 1/4 models general_agent 46.6 — — —
WebArena-Verified 2/4 models general_agent 48.8 — — 64.8
CoWorkBench 3/4 models general_agent 61 — 73.9 70.7
Lab Bench (ProtocolQA) 1/4 models safety 69.1 — — —
MCPMark 1/4 models general_agent — 36.3 — —
MMVU 1/4 models video_understanding — 73.3 — —
FullStackBench zh 1/4 models coding_agent — 57.4 — —
MLVU 2/4 models video_understanding 86.6 85.9 — —
Beam128K 1/4 models long_context 63 — — —
FullStackBench en 1/4 models coding_agent — 60.1 — —
SWE-bench Verified 2/4 models coding_agent 77.2 75 — —
IMOAnswerBench 2/4 models stem_reasoning 80.8 79.9 — —
Humanity's Last Exam 3/4 models stem_reasoning 24 24.3 — 30.8
CountBench 2/4 models spatial_intelligence 97.8 97.8 — —
WMDP (Chem) 1/4 models safety 74.8 — — —
VideoMME (w/o sub.) 1/4 models video_understanding — 82.8 — —
Terminal-Bench 2.0 2/4 models coding_agent 59.3 41.6 — —
DeepPlanning 1/4 models general_agent — 22.6 — —
QwenSWEBench 2/4 models coding_agent 49.3 — — 79
QwenWebBench 2/4 models coding_agent 1487 1068 — —
TAU2-Bench 1/4 models general_agent — 79 — —
ODInW13 1/4 models spatial_intelligence — 41.1 — —
VlmsAreBlind 2/4 models vision_language 97 96.9 — —
Terminal-Bench 2.1 (Terminus-2) 2/4 models coding_agent 63.4 — — 73
OmniDocBench 1.5 3/4 models document_understanding 89.4 88.9 — 91.1
HallusionBench 1/4 models vision_language — 70 — —
OCRBench 2/4 models document_understanding 89.4 89.4 — —
HMMT Feb 26 2/4 models stem_reasoning 84.3 84.3 — —
CC-OCR 2/4 models document_understanding 81.2 81 — —
RefCOCO (avg) 2/4 models spatial_intelligence 92.5 90.9 — —
JobBench 3/4 models general_agent 21.8 — 55.7 33.4
SciCode (subtask) 1/4 models stem_reasoning 39.8 — — —
Tool Decathlon 1/4 models general_agent — 31.5 — —
OSWorld 2.0 (Partial) 2/4 models general_agent — — 52.3 48
OSWorld 2.0 (Binary) 2/4 models general_agent — — 19.4 19.4
ZEROBench_sub 1/4 models vision_language — 36.2 — —
C-Eval 2/4 models knowledge 91.4 90.5 — —
WideSearch 1/4 models general_agent — 66.4 — —
SimpleVQA 2/4 models vision_language 56.1 56 — —
VideoMME (w sub.) 2/4 models video_understanding 87.7 87 — —
SkillsBench Avg5 2/4 models coding_agent 48.2 27.2 — —
Vision2Web 3/4 models vision_language 45 — 64 62.9
TauBench V3 Banking 1/4 models general_agent 16.7 — — —
WMT24++ (en→xx) 1/4 models multilingual — 77.6 — —
LongBench v2 1/4 models long_context — 60.6 — —
MCP-Atlas 2/4 models general_agent 62.5 68.4 — —
V-Star 2/4 models vision_language 94.7 93.7 — —
DeepSWE 1.1 3/4 models coding_agent 13.3 — 58.7 42.2
MBCT 1/4 models safety 45.9 — — —
VCT 1/4 models safety 33.7 — — —
Gaia2 1/4 models general_agent 40 — — —
SUNRGBD 1/4 models spatial_intelligence — 35.4 — —
RefSpatialBench 2/4 models spatial_intelligence 70 67.7 — —
MMMU 2/4 models vision_language 82.9 82.3 — —
GDPVal-AA v2 1/4 models general_agent 1141 — — —
MVBench 2/4 models video_understanding 75.5 74.6 — —
ZEROBench 1/4 models vision_language — 10 — —