Qwen3.5-27B vs Qwen3.6-27B vs Qwen3.8-27B

New Comparison

Scores are fetched live from the current database on every visit — nothing is cached.

Benchmark Scores Comparison

Qwen3.6-27B Qwen3.5-27B Qwen3.8-27B

Qwen3.6-27B

27.0B params

Score: 100.0

Qwen3.5-27B

27.0B params

Score: 100.0

Qwen3.8-27B

27.0B params

Score: 100.0

Coverage matrix

3 models × 128 benchmarks — hover a benchmark name for its category

Full Coverage Matrix
Shading = score relative to the best score among the selected models: Low Mid High Missing (—) The totals row shows how many of the 128 benchmarks each model has scores for.
Benchmark Qwen3.5-27B Qwen Team (Alibaba Cloud) Qwen3.6-27B Qwen Team (Alibaba Cloud) Qwen3.8-27B Qwen Team (Alibaba Cloud)
HMMT Feb 25 92 93.8 —
DynaMath 87.7 85.6 —
GPQA Diamond 85.5 87.8 89.2
IFBench (prompt loose) — 69.1 79.5
MathVista (mini) 87.8 87.4 —
MMBench EN-DEV v1.1 92.6 92.3 —
Nuscene 15.2 — —
LiveCodeBench v6 80.7 83.9 90.3
SWE-bench Pro 51.2 53.5 61.7
BFCL-V4 68.5 — —
RealWorldQA 83.7 84.1 85.9
Agents' Last Exam (Score) — — 42.9
EmbSpatialBench 84.5 84.6 —
AA-LCR 66.1 73.3 —
Hypersim 13 — —
MathVision 86 85.1 90
AIME 26 92.6 94.1 —
BrowseComp-zh 62.1 — —
MAXIFE 88 — —
AndroidWorld 64.2 70.3 81.9
Agents' Last Exam — 10.6 20.4
Toolathlon Verified — — 67.1
RecreationBench — 29.8 47.1
VITA-Bench 41.8 — —
TAU3-Bench 68.4 — —
ScreenSpot Pro 70.3 76.1 —
OJBench 40.1 — —
WMDP (Bio) — 84.8 —
MMStar 81 81.4 —
OCRBench 89.4 — —
Seal-0 47.2 — —
PMC-VQA 62.4 — —
DeepSearch QA — 71.1 —
MMLongBench-Doc 60.2 — —
WildClawBench — 43.2 —
AI2D_TEST 92.9 — —
LingoQA 82 — —
NOVA-63 58.1 — —
NL2Repo 27.3 36.2 42.3
HPCT — 48.7 —
MMMU-Pro 75 75.8 —
INCLUDE 81.6 — —
QwenClawBench 52.2 53.4 —
BabyVision 44.6 28.9 65.7
SLAKE 80 — —
MMMLU 85.9 — —
Claw-Eval Avg 64.3 72.4 56.9
VideoMMMU 82.3 84.4 —
HMMT Nov 25 89.8 90.7 —
Multi-Challenge 60.8 — —
PolyMATH 71.2 — —
SWE-MM — 25.7 38.6
MMLU-ProX 82.2 — —
MMLU-Pro 86.1 86.2 —
CodeForces 1899 — —
SuperGPQA 65.6 66 —
OSWorld-Verified 56.2 63.9 84.3
TIR-Bench 59.8 — —
Global PIQA 87.5 — —
IFEval 95 — —
HLE (with tools) 48.5 — 30.8
LVBench 73.6 — 72.4
CharXiv (RQ) 79.5 78.4 83.7
BrowseComp 61 — —
MedXpertQA-MM 62.4 — —
MMLU-Redux 93.2 93.5 —
NL2Repo-Bench — — 42.3
SkillsBench — 46.6 —
WebArena-Verified — 48.8 64.8
CoWorkBench — 61 70.7
Lab Bench (ProtocolQA) — 69.1 —
MCPMark 36.3 — —
SWE-bench Multilingual 69.3 71.3 73.8
MMVU 73.3 — —
FullStackBench zh 57.4 — —
MLVU 85.9 86.6 —
Beam128K — 63 —
IFBench 76.5 70.8 79.5
FullStackBench en 60.1 — —
SWE-bench Verified 75 77.2 —
IMOAnswerBench 79.9 80.8 —
Humanity's Last Exam 24.3 24 30.8
CountBench 97.8 97.8 —
WMDP (Chem) — 74.8 —
ERQA 60.5 62.5 65.5
VideoMME (w/o sub.) 82.8 — —
Terminal-Bench 2.0 41.6 59.3 —
DeepPlanning 22.6 — —
QwenSWEBench — 49.3 79
QwenWebBench 1068 1487 —
TAU2-Bench 79 — —
ODInW13 41.1 — —
VlmsAreBlind 96.9 97 —
Terminal-Bench 2.1 (Terminus-2) — 63.4 73
OmniDocBench 1.5 88.9 89.4 91.1
HallusionBench 70 — —
OCRBench 89.4 89.4 —
HMMT Feb 26 84.3 84.3 —
CC-OCR 81 81.2 —
RefCOCO (avg) 90.9 92.5 —
JobBench — 21.8 33.4
SciCode (subtask) — 39.8 —
Tool Decathlon 31.5 — —
OSWorld 2.0 (Partial) — — 48
OSWorld 2.0 (Binary) — — 19.4
ZEROBench_sub 36.2 — —
C-Eval 90.5 91.4 —
WideSearch 66.4 — —
SimpleVQA 56 56.1 —
VideoMME (w sub.) 87 87.7 —
SkillsBench Avg5 27.2 48.2 —
Vision2Web — 45 62.9
TauBench V3 Banking — 16.7 —
Claw-Eval Pass^3 46.2 60.6 57.4
WMT24++ (en→xx) 77.6 — —
LongBench v2 60.6 — —
MCP-Atlas 68.4 62.5 —
V-Star 93.7 94.7 —
DeepSWE 1.1 — 13.3 42.2
MBCT — 45.9 —
VCT — 33.7 —
Gaia2 — 40 —
SUNRGBD 35.4 — —
RefSpatialBench 67.7 70 —
MMMU 82.3 82.9 —
GDPVal-AA v2 — 1141 —
MVBench 74.6 75.5 —
ZEROBench 10 — —
Covered 98/128 78/128 35/128

Fully comparable benchmarks

Scored by all 3 selected models (17)

Benchmark Category Qwen3.6-27B Qwen3.5-27B Qwen3.8-27B
GPQA Diamond stem_reasoning 87.8 85.5 89.2
LiveCodeBench v6 stem_reasoning 83.9 80.7 90.3
SWE-bench Pro coding_agent 53.5 51.2 61.7
RealWorldQA vision_language 84.1 83.7 85.9
MathVision vision_language 85.1 86 90
AndroidWorld general_agent 70.3 64.2 81.9
NL2Repo coding_agent 36.2 27.3 42.3
BabyVision vision_language 28.9 44.6 65.7
Claw-Eval Avg coding_agent 72.4 64.3 56.9
OSWorld-Verified general_agent 63.9 56.2 84.3
CharXiv (RQ) document_understanding 78.4 79.5 83.7
SWE-bench Multilingual coding_agent 71.3 69.3 73.8
IFBench instruction_following 70.8 76.5 79.5
Humanity's Last Exam stem_reasoning 24 24.3 30.8
ERQA spatial_intelligence 62.5 60.5 65.5
OmniDocBench 1.5 document_understanding 89.4 88.9 91.1
Claw-Eval Pass^3 coding_agent 60.6 46.2 57.4

Partial coverage benchmarks

Scored by at least one but not all selected models (111) — missing scores show as —

Benchmark Category Qwen3.6-27B Qwen3.5-27B Qwen3.8-27B
HMMT Feb 25 2/3 models stem_reasoning 93.8 92 —
DynaMath 2/3 models vision_language 85.6 87.7 —
IFBench (prompt loose) 2/3 models instruction_following 69.1 — 79.5
MathVista (mini) 2/3 models vision_language 87.4 87.8 —
MMBench EN-DEV v1.1 2/3 models vision_language 92.3 92.6 —
Nuscene 1/3 models spatial_intelligence — 15.2 —
BFCL-V4 1/3 models general_agent — 68.5 —
Agents' Last Exam (Score) 1/3 models general_agent — — 42.9
EmbSpatialBench 2/3 models spatial_intelligence 84.6 84.5 —
AA-LCR 2/3 models long_context 73.3 66.1 —
Hypersim 1/3 models spatial_intelligence — 13 —
AIME 26 2/3 models stem_reasoning 94.1 92.6 —
BrowseComp-zh 1/3 models general_agent — 62.1 —
MAXIFE 1/3 models multilingual — 88 —
Agents' Last Exam 2/3 models general_agent 10.6 — 20.4
Toolathlon Verified 1/3 models general_agent — — 67.1
RecreationBench 2/3 models general_agent 29.8 — 47.1
VITA-Bench 1/3 models general_agent — 41.8 —
TAU3-Bench 1/3 models general_agent — 68.4 —
ScreenSpot Pro 2/3 models general_agent 76.1 70.3 —
OJBench 1/3 models stem_reasoning — 40.1 —
WMDP (Bio) 1/3 models safety 84.8 — —
MMStar 2/3 models vision_language 81.4 81 —
OCRBench 1/3 models document_understanding — 89.4 —
Seal-0 1/3 models general_agent — 47.2 —
PMC-VQA 1/3 models vision_language — 62.4 —
DeepSearch QA 1/3 models general_agent 71.1 — —
MMLongBench-Doc 1/3 models document_understanding — 60.2 —
WildClawBench 1/3 models coding_agent 43.2 — —
AI2D_TEST 1/3 models document_understanding — 92.9 —
LingoQA 1/3 models spatial_intelligence — 82 —
NOVA-63 1/3 models multilingual — 58.1 —
HPCT 1/3 models safety 48.7 — —
MMMU-Pro 2/3 models vision_language 75.8 75 —
INCLUDE 1/3 models multilingual — 81.6 —
QwenClawBench 2/3 models coding_agent 53.4 52.2 —
SLAKE 1/3 models vision_language — 80 —
MMMLU 1/3 models multilingual — 85.9 —
VideoMMMU 2/3 models video_understanding 84.4 82.3 —
HMMT Nov 25 2/3 models stem_reasoning 90.7 89.8 —
Multi-Challenge 1/3 models instruction_following — 60.8 —
PolyMATH 1/3 models multilingual — 71.2 —
SWE-MM 2/3 models coding_agent 25.7 — 38.6
MMLU-ProX 1/3 models multilingual — 82.2 —
MMLU-Pro 2/3 models knowledge 86.2 86.1 —
CodeForces 1/3 models stem_reasoning — 1899 —
SuperGPQA 2/3 models knowledge 66 65.6 —
TIR-Bench 1/3 models vision_language — 59.8 —
Global PIQA 1/3 models multilingual — 87.5 —
IFEval 1/3 models instruction_following — 95 —
HLE (with tools) 2/3 models stem_reasoning — 48.5 30.8
LVBench 2/3 models video_understanding — 73.6 72.4
BrowseComp 1/3 models general_agent — 61 —
MedXpertQA-MM 1/3 models vision_language — 62.4 —
MMLU-Redux 2/3 models knowledge 93.5 93.2 —
NL2Repo-Bench 1/3 models coding_agent — — 42.3
SkillsBench 1/3 models general_agent 46.6 — —
WebArena-Verified 2/3 models general_agent 48.8 — 64.8
CoWorkBench 2/3 models general_agent 61 — 70.7
Lab Bench (ProtocolQA) 1/3 models safety 69.1 — —
MCPMark 1/3 models general_agent — 36.3 —
MMVU 1/3 models video_understanding — 73.3 —
FullStackBench zh 1/3 models coding_agent — 57.4 —
MLVU 2/3 models video_understanding 86.6 85.9 —
Beam128K 1/3 models long_context 63 — —
FullStackBench en 1/3 models coding_agent — 60.1 —
SWE-bench Verified 2/3 models coding_agent 77.2 75 —
IMOAnswerBench 2/3 models stem_reasoning 80.8 79.9 —
CountBench 2/3 models spatial_intelligence 97.8 97.8 —
WMDP (Chem) 1/3 models safety 74.8 — —
VideoMME (w/o sub.) 1/3 models video_understanding — 82.8 —
Terminal-Bench 2.0 2/3 models coding_agent 59.3 41.6 —
DeepPlanning 1/3 models general_agent — 22.6 —
QwenSWEBench 2/3 models coding_agent 49.3 — 79
QwenWebBench 2/3 models coding_agent 1487 1068 —
TAU2-Bench 1/3 models general_agent — 79 —
ODInW13 1/3 models spatial_intelligence — 41.1 —
VlmsAreBlind 2/3 models vision_language 97 96.9 —
Terminal-Bench 2.1 (Terminus-2) 2/3 models coding_agent 63.4 — 73
HallusionBench 1/3 models vision_language — 70 —
OCRBench 2/3 models document_understanding 89.4 89.4 —
HMMT Feb 26 2/3 models stem_reasoning 84.3 84.3 —
CC-OCR 2/3 models document_understanding 81.2 81 —
RefCOCO (avg) 2/3 models spatial_intelligence 92.5 90.9 —
JobBench 2/3 models general_agent 21.8 — 33.4
SciCode (subtask) 1/3 models stem_reasoning 39.8 — —
Tool Decathlon 1/3 models general_agent — 31.5 —
OSWorld 2.0 (Partial) 1/3 models general_agent — — 48
OSWorld 2.0 (Binary) 1/3 models general_agent — — 19.4
ZEROBench_sub 1/3 models vision_language — 36.2 —
C-Eval 2/3 models knowledge 91.4 90.5 —
WideSearch 1/3 models general_agent — 66.4 —
SimpleVQA 2/3 models vision_language 56.1 56 —
VideoMME (w sub.) 2/3 models video_understanding 87.7 87 —
SkillsBench Avg5 2/3 models coding_agent 48.2 27.2 —
Vision2Web 2/3 models vision_language 45 — 62.9
TauBench V3 Banking 1/3 models general_agent 16.7 — —
WMT24++ (en→xx) 1/3 models multilingual — 77.6 —
LongBench v2 1/3 models long_context — 60.6 —
MCP-Atlas 2/3 models general_agent 62.5 68.4 —
V-Star 2/3 models vision_language 94.7 93.7 —
DeepSWE 1.1 2/3 models coding_agent 13.3 — 42.2
MBCT 1/3 models safety 45.9 — —
VCT 1/3 models safety 33.7 — —
Gaia2 1/3 models general_agent 40 — —
SUNRGBD 1/3 models spatial_intelligence — 35.4 —
RefSpatialBench 2/3 models spatial_intelligence 70 67.7 —
MMMU 2/3 models vision_language 82.9 82.3 —
GDPVal-AA v2 1/3 models general_agent 1141 — —
MVBench 2/3 models video_understanding 75.5 74.6 —
ZEROBench 1/3 models vision_language — 10 —