Qwen3.5-27B vs Qwen3.5-397B-A17B vs Qwen3.6-27B vs Qwen3.6-35B-A3B vs Qwen3.6-Plus vs Qwen3.7-Max vs Qwen3.7-Plus vs Qwen3.8-2.4T-A95B vs Qwen3.8-27B vs Qwen3.8-Flash-Next

New Comparison

Scores are fetched live from the current database on every visit — nothing is cached.

Benchmark Scores Comparison

Qwen3.6-35B-A3B Qwen3.6-27B Qwen3.5-397B-A17B Qwen3.6-Plus Qwen3.7-Plus Qwen3.5-27B Qwen3.7-Max Qwen3.8-Flash-Next Qwen3.8-2.4T-A95B Qwen3.8-27B

Qwen3.6-35B-A3B

35.0B params

Score: 100.0

Qwen3.6-27B

27.0B params

Score: 100.0

Qwen3.5-397B-A17B

Score: 15.0

Qwen3.6-Plus

Score: 15.0

Qwen3.7-Plus

Score: 15.0

Qwen3.5-27B

27.0B params

Score: 100.0

Qwen3.7-Max

Score: 15.0

Qwen3.8-Flash-Next

125.0B params

Score: 70.0

Qwen3.8-2.4T-A95B

2.4T params

Score: 70.0

Qwen3.8-27B

27.0B params

Score: 100.0

Coverage matrix

10 models × 206 benchmarks — hover a benchmark name for its category

Full Coverage Matrix
Shading = score relative to the best score among the selected models: Low Mid High Missing (—) The totals row shows how many of the 206 benchmarks each model has scores for.
Benchmark Qwen3.5-27B Qwen Team (Alibaba Cloud) Qwen3.6-35B-A3B Qwen Team (Alibaba Cloud) Qwen3.6-27B Qwen Team (Alibaba Cloud) Qwen3.8-27B Qwen Team (Alibaba Cloud) Qwen3.8-2.4T-A95B Qwen Qwen3.8-Flash-Next Qwen Team (Alibaba) Qwen3.5-397B-A17B Qwen Team (Alibaba Cloud) Qwen3.6-Plus Qwen Team (Alibaba Cloud) Qwen3.7-Plus Qwen Team (Alibaba Cloud) Qwen3.7-Max Qwen Team (Alibaba Cloud)
OmniScience Accuracy — — — — — — 35.9 — — —
Apex-Shortlist (with tools) — — — — — — 60.4 — — —
HMMT Feb 25 92 90.7 93.8 — — — 94.8 — — —
DynaMath 87.7 82.8 85.6 — — — 86.3 — — —
GPQA Diamond 85.5 86 87.8 89.2 92.6 91.7 88.4 — 90.3 90
IFBench (prompt loose) — — 69.1 79.5 — — 78.2 — 79.1 —
MathVista (mini) 87.8 86.4 87.4 — — — — — — —
MMBench EN-DEV v1.1 92.6 92.8 92.3 — — — — — — —
ProfBench (Search) — — — — — — 53 — — —
ArXivMath — — — — 67.1 — — — — —
Nuscene 15.2 — — — — — — — — —
LiveCodeBench v6 80.7 80.4 83.9 90.3 — 91.9 83.6 — 89.6 —
Hy-LifeSearch (Internal) — — — — 47.5 — — — — —
MRCR v2 256K (8-needle) — — — — 92.9 — — — — 86.7
TauBench V3 Retail — — — — — — 88.5 — — —
Automation-Bench — — — — 27.3 — — — — 14.2
SWE-bench Pro 51.2 49.5 53.5 61.7 67.7 62.5 50.9 — 57.6 60.6
BFCL-V4 68.5 — — — — — — — — —
RealWorldQA 83.7 85.3 84.1 85.9 — 88.5 83.9 — 86.9 —
Agents' Last Exam (Score) — — — 42.9 — 51.2 — — 33.6 —
BioMysteryBench — — — — 58.9 — — — — —
PRBench-Finance — — — — 58.3 — — — — 46.8
EmbSpatialBench 84.5 84.3 84.6 — — — — — — —
AA-LCR 66.1 — 73.3 — — — 68.3 — — —
Hypersim 13 — — — — — — — — —
MathVision 86 — 85.1 90 — 90.6 — — 90.3 —
AIME 26 92.6 92.7 94.1 — — — 93.3 — — 97
BrowseComp-zh 62.1 — — — — — — — — —
MAXIFE 88 — — — — — — — — —
AndroidWorld 64.2 — 70.3 81.9 — 84.5 — — 81 —
AgentWorldBench Terminal — — — — — — 55.3 50.58 — —
Agents' Last Exam — — 10.6 20.4 27 24.3 — — 13.2 11.8
Toolathlon Verified — 41.7 — 67.1 72.5 73.5 38.3 — 50.6 49.7
Hy-Backend 2.0 (Internal) — — — — 34.9 — — — — —
PLawBench — — — — 73.2 — — — — 58.9
RecreationBench — — 29.8 47.1 — 49.9 — — 30.2 —
VITA-Bench 41.8 35.6 — — — — — — — —
TAU3-Bench 68.4 67.2 — — — — — — — —
ScreenSpot Pro 70.3 — 76.1 — — — — — — —
OJBench 40.1 — — — — — — — — —
Hy-SWE Max Verified (Internal) — — — — 65.2 — — — — —
AgentWorldBench Overall — — — — — — 54.74 50.81 — —
OmniScience Non-Hallucination — — — — — — 7.4 — — —
Hy-BrowseComp-Pro2 (Internal) — — — — 46.7 — — — — —
WMDP (Bio) — — 84.8 — — — — — — —
QwenReactBench — — — — 1724 — — — — 1538
MMStar 81 80.7 81.4 — — — 83.8 — — —
GDPVal — — — — — — 34.6 — — —
OCRBench 89.4 — — — — — — — — —
OfficeQA Pro — — — — 65.4 — — — — —
Apex-Shortlist (no tools) — — — — — — 61.4 — — —
Seal-0 47.2 — — — — — — — — —
TauBench V3 Average — — — — — — 71 — — —
PMC-VQA 62.4 — — — — — — — — —
QwenSVGBench — — — — 1713 — — — — 1499
DeepSearch QA — — 71.1 — — — — — — —
MMLongBench-Doc 60.2 — — — — — — — — —
SWE Atlas - TW — 13.3 — — 52.8 — 18.5 — — —
IOI 2025 — — — — — — 441.3 — — —
Longbench v2 (≤ 1M) — — — — — — 68.9 — — —
WildClawBench — 68.7 43.2 — — — 70.7 — — —
AgentWorldBench Web — — — — — — 48.55 50.78 — —
SWE Atlas - QnA — 15.5 — — 55.4 — 20.4 — — —
AI2D_TEST 92.9 92.7 — — — — — — — —
LingoQA 82 — — — — — — — — —
ParseBench Text Formatting — 58.3 — — — — — — — —
NOVA-63 58.1 — — — — — — — — —
NL2Repo 27.3 29.4 36.2 42.3 55.9 — 32.2 — 41.1 47.2
HPCT — — 48.7 — — — — — — —
PRBench-Legal — — — — 57.6 — — — — 48.5
MMMU-Pro 75 75.3 75.8 — — — 79 — — —
TauBench V3 Airline — — — — — — 76.5 — — —
INCLUDE 81.6 — — — — — — — — —
QwenClawBench 52.2 52.6 53.4 — — — 51.8 — — —
BabyVision 44.6 — 28.9 65.7 — — — — 64.7 —
SLAKE 80 — — — — — — — — —
MMMLU 85.9 — — — — — — — — —
Claw-Eval Avg 64.3 68.7 72.4 56.9 — 60.4 70.7 — 60.1 —
VideoMMMU 82.3 83.7 84.4 — — — 84.7 — — —
HMMT Nov 25 89.8 89.1 90.7 — — — 92.7 — — 95
Apex-Agents — — — — 34 — — — — —
Multi-Challenge 60.8 — — — — — 63.9 — — —
PolyMATH 71.2 — — — — — — — — —
PinchBench — — — — — — 86.6 — — —
SWE-MM — — 25.7 38.6 — — — — 30 —
MMLU-ProX 82.2 — — — — — 86.4 — — —
WorkSpaceBench — — — — 67.7 — — — — 61.4
MMLU-Pro 86.1 85.2 86.2 — — — 87.8 — — —
CodeForces 1899 — — — — — — — — —
BankerToolBench — — — — 74.7 — — — — —
SuperGPQA 65.6 64.7 66 — — — 70.4 — — —
E-Bench-Code (Internal) — — — — 67.1 — — — — —
OSWorld-Verified 56.2 — 63.9 84.3 — — — — 73.3 —
TIR-Bench 59.8 — — — — — — — — —
Global PIQA 87.5 — — — — — — — — —
AgentWorldBench Search — — — — — — 30.81 21.94 — —
ExploitGym (6h) — — — — 26 — — — — —
IFEval 95 — — — — — — — — —
HLE (with tools) 48.5 28.9 — 30.8 56.2 35.9 48.3 — 34.7 53.5
LVBench 73.6 71.4 — 72.4 — 76.6 — — 76.2 —
CharXiv (RQ) 79.5 78 78.4 83.7 — 84.6 80.8 — 85.8 —
RULER (1M) — — — — — — 90.1 — — —
FrontierSWE — — — — 73.5 — — — — 40.7
Vals.ai Financial Agent 1.1 (without web search) — — — — — — 61.3 — — —
CritPt (no tools) — — — — 20 — 2.4 — — 13.4
BrowseComp 61 62 — — — — 40.5 — — —
MedXpertQA-MM 62.4 — — — — — — — — —
MMLU-Redux 93.2 93.3 93.5 — — — 94.9 — — —
NL2Repo-Bench — — — 42.3 55.9 48.1 — — 41.1 47.2
DRACO — — — — 76.4 — — — — —
SkillsBench — — 46.6 — 70.2 — — — — 61.2
WebArena-Verified — — 48.8 64.8 — — — — 55.3 —
ParseBench Text Content — 90.7 — — — — — — — —
CoWorkBench — — 61 70.7 74.8 73.9 — — 65.1 64.6
Lab Bench (ProtocolQA) — — 69.1 — — — — — — —
MCPMark 36.3 37 — — — — — — — —
SWE-bench Multilingual 69.3 67.2 71.3 73.8 82.6 81 69.3 — 75.8 —
MMVU 73.3 — — — — — — — — —
PaperBench — — — — 93 — — — — 64.8
FullStackBench zh 57.4 — — — — — — — — —
MLVU 85.9 86.2 86.6 — — — 86.7 — — —
TauBench V3 Telecom — — — — — — 98 — — —
Hy-FinAgentBench (Internal) — — — — 77.2 — — — — —
Beam128K — — 63 — — — — — — —
IFBench 76.5 — 70.8 79.5 82.8 81.3 — — 79.1 79.1
FullStackBench en 60.1 — — — — — — — — —
SWE-bench Verified 75 73.4 77.2 — — — 76.2 — — —
IMOAnswerBench 79.9 78.9 80.8 — — — 80.9 — — 90
Humanity's Last Exam 24.3 21.4 24 30.8 43.6 — 28.7 — 34.7 41.4
CountBench 97.8 96.1 97.8 — — — 97.2 — — —
WMDP (Chem) — — 74.8 — — — — — — —
ERQA 60.5 61.8 62.5 65.5 — 72.3 67.5 — 69.8 —
VideoMME (w/o sub.) 82.8 82.5 — — — — — — — —
Terminal-Bench 2.0 41.6 51.5 59.3 — — — 52.5 — — —
IMOAnswerBench (with tools) — — — — — — 84.51 — — —
DeepPlanning 22.6 25.9 — — — — — — — —
QwenSWEBench — — 49.3 79 80.7 — — — 59.2 63.4
ExploitGym (2h) — — — — 14 — — — — —
QwenWebBench 1068 1397 1487 — — — 1186 — — —
TAU2-Bench 79 — — — — — — — — —
ODInW13 41.1 50.8 — — — — — — — —
VlmsAreBlind 96.9 96.6 97 — — — — — — —
SUPERChem — — — — 61.9 — — — — —
HorizonMath (pass@4) — — — — 5.31 — — — — —
Terminal-Bench 2.1 (Terminus-2) — 52.5 63.4 73 86.6 — 53.5 — 64 75
DeepSWE — 0 — — 56.6 — 1 — — —
ExploitBench — — — — 28.8 — — — — —
BrokenArXiv — — — — 42.7 — — — — —
OmniDocBench 1.5 88.9 89.9 89.4 91.1 — — — — 91.4 —
HallusionBench 70 69.8 — — — — — — — —
OCRBench 89.4 90 89.4 — — — — — — —
HMMT Feb 26 84.3 83.6 84.3 — — — 87.9 — — 97.1
AgentWorldBench OS — — — — — — 60.85 60.33 — —
AgentWorldBench MCP — — — — — — 68.31 55.28 — —
Vals.ai Financial Agent 1.1 (with web search) — — — — — — 59 — — —
Hy-FinmodelBench v2 (Internal) — — — — 52.5 — — — — —
MathArena Apex 2025 — — — — 72.8 — — — — —
Terminal Bench 2.1 — — — — 86.6 — — — — 74.5
AgentWorldBench SWE — — — — — — 64.44 59.08 — —
CC-OCR 81 81.9 81.2 — — — 82 — — —
RefCOCO (avg) 90.9 92 92.5 — — — 92.3 — — —
JobBench — — 21.8 33.4 53.4 55.7 — — 27.6 31.3
Artificial Analysis Intelligence Index — 32 — — — — — — — —
$OneMillion-Bench — — — — 52.5 — — — — 44.4
SciCode (subtask) — — 39.8 — — — 48 — — —
Tool Decathlon 31.5 26.9 — — — — — — — —
QwenQoderBench — — — — 58.4 — — — — 36.8
Frontier-Bench v0.1 — 1.4 — — — — 1.4 — — —
OSWorld 2.0 (Partial) — — — 48 — 52.3 — — 21.5 —
ParseBench Mean — 44.1 — — — — — — — —
OSWorld 2.0 (Binary) — — — 19.4 — 19.4 — — 2.8 —
ZEROBench_sub 36.2 34.4 — — — — — — — —
C-Eval 90.5 90 91.4 — — — 93 — — —
WideSearch 66.4 60.1 — — 81.9 — 74 — — 75.2
SimpleVQA 56 58.9 56.1 — — — 67.1 — — —
VideoMME (w sub.) 87 86.6 87.7 — — — 87.5 — — —
SkillsBench Avg5 27.2 28.7 48.2 — 66.7 — 30 — — —
Vision2Web — — 45 62.9 — 64 — — 42.1 —
TauBench V3 Banking — — 16.7 — — — 20.9 — — —
HealthBench — — — — 60.2 — — — — 54.5
Claw-Eval Pass^3 46.2 50 60.6 57.4 — 64.4 48.1 — 57.4 —
WMT24++ (en→xx) 77.6 — — — — — 86.8 — — —
E-Bench (Internal) — — — — 66.8 — — — — —
ProgramBench — — — — 10.5 — — — — —
LongBench v2 60.6 — — — 66.3 — — — — 65.3
MCP-Atlas 68.4 62.8 62.5 — 81.9 — 72.3 — — 76.4
AndroidBench — — — — 75.1 — — — — 56.5
SWE-Marathon — — — — 31 — — — — —
Cybergym — — — — 78.5 — — — — —
SWE Atlas - RF — 11.4 — — 51 — 18.4 — — —
V-Star 93.7 90.1 94.7 — — — 95.8 — — —
AgentWorldBench Android — — — — — — 54.9 57.65 — —
DeepSWE 1.1 — — 13.3 42.2 56.6 58.7 — — 14.2 18
Terminal-Bench 2.1 (Claude Code) — 49.2 — — — — 48.6 — — —
MBCT — — 45.9 — — — — — — —
Hy-CompanyBench V2 (Internal) — — — — 63.3 — — — — —
VCT — — 33.7 — — — — — — —
Harbor-Index — — — — 38.8 — — — — —
Gaia2 — — 40 — — — — — — —
MLS-Bench-Lite — — — — 41 — — — — 31.7
SUNRGBD 35.4 — — — — — — — — —
RefSpatialBench 67.7 64.3 70 — — — — — — —
MMMU 82.3 81.7 82.9 — — — 85 — — —
GDPVal-AA v2 — — 1141 — 1739 — — — — —
MVBench 74.6 74.6 75.5 — — — 77.6 — — —
ZEROBench 10 — — — — — — — — —
Covered 98/206 73/206 78/206 35/206 68/206 25/206 84/206 8/206 35/206 39/206

Partial coverage benchmarks

Scored by at least one but not all selected models (206) — missing scores show as —

Benchmark Category Qwen3.6-35B-A3B Qwen3.6-27B Qwen3.5-397B-A17B Qwen3.6-Plus Qwen3.7-Plus Qwen3.5-27B Qwen3.7-Max Qwen3.8-Flash-Next Qwen3.8-2.4T-A95B Qwen3.8-27B
OmniScience Accuracy 1/10 models knowledge — — 35.9 — — — — — — —
Apex-Shortlist (with tools) 1/10 models stem_reasoning — — 60.4 — — — — — — —
HMMT Feb 25 4/10 models stem_reasoning 90.7 93.8 94.8 — — 92 — — — —
DynaMath 4/10 models vision_language 82.8 85.6 86.3 — — 87.7 — — — —
GPQA Diamond 9/10 models stem_reasoning 86 87.8 88.4 — 90.3 85.5 90 91.7 92.6 89.2
IFBench (prompt loose) 4/10 models instruction_following — 69.1 78.2 — 79.1 — — — — 79.5
MathVista (mini) 3/10 models vision_language 86.4 87.4 — — — 87.8 — — — —
MMBench EN-DEV v1.1 3/10 models vision_language 92.8 92.3 — — — 92.6 — — — —
ProfBench (Search) 1/10 models general_agent — — 53 — — — — — — —
ArXivMath 1/10 models stem_reasoning — — — — — — — — 67.1 —
Nuscene 1/10 models spatial_intelligence — — — — — 15.2 — — — —
LiveCodeBench v6 7/10 models stem_reasoning 80.4 83.9 83.6 — 89.6 80.7 — 91.9 — 90.3
Hy-LifeSearch (Internal) 1/10 models general_agent — — — — — — — — 47.5 —
MRCR v2 256K (8-needle) 2/10 models long_context — — — — — — 86.7 — 92.9 —
TauBench V3 Retail 1/10 models general_agent — — 88.5 — — — — — — —
Automation-Bench 2/10 models general_agent — — — — — — 14.2 — 27.3 —
SWE-bench Pro 9/10 models coding_agent 49.5 53.5 50.9 — 57.6 51.2 60.6 62.5 67.7 61.7
BFCL-V4 1/10 models general_agent — — — — — 68.5 — — — —
RealWorldQA 7/10 models vision_language 85.3 84.1 83.9 — 86.9 83.7 — 88.5 — 85.9
Agents' Last Exam (Score) 3/10 models general_agent — — — — 33.6 — — 51.2 — 42.9
BioMysteryBench 1/10 models stem_reasoning — — — — — — — — 58.9 —
PRBench-Finance 2/10 models general_capabilities — — — — — — 46.8 — 58.3 —
EmbSpatialBench 3/10 models spatial_intelligence 84.3 84.6 — — — 84.5 — — — —
AA-LCR 3/10 models long_context — 73.3 68.3 — — 66.1 — — — —
Hypersim 1/10 models spatial_intelligence — — — — — 13 — — — —
MathVision 5/10 models vision_language — 85.1 — — 90.3 86 — 90.6 — 90
AIME 26 5/10 models stem_reasoning 92.7 94.1 93.3 — — 92.6 97 — — —
BrowseComp-zh 1/10 models general_agent — — — — — 62.1 — — — —
MAXIFE 1/10 models multilingual — — — — — 88 — — — —
AndroidWorld 5/10 models general_agent — 70.3 — — 81 64.2 — 84.5 — 81.9
AgentWorldBench Terminal 2/10 models general_agent — — 55.3 50.58 — — — — — —
Agents' Last Exam 6/10 models general_agent — 10.6 — — 13.2 — 11.8 24.3 27 20.4
Toolathlon Verified 7/10 models general_agent 41.7 — 38.3 — 50.6 — 49.7 73.5 72.5 67.1
Hy-Backend 2.0 (Internal) 1/10 models coding_agent — — — — — — — — 34.9 —
PLawBench 2/10 models general_capabilities — — — — — — 58.9 — 73.2 —
RecreationBench 4/10 models general_agent — 29.8 — — 30.2 — — 49.9 — 47.1
VITA-Bench 2/10 models general_agent 35.6 — — — — 41.8 — — — —
TAU3-Bench 2/10 models general_agent 67.2 — — — — 68.4 — — — —
ScreenSpot Pro 2/10 models general_agent — 76.1 — — — 70.3 — — — —
OJBench 1/10 models stem_reasoning — — — — — 40.1 — — — —
Hy-SWE Max Verified (Internal) 1/10 models coding_agent — — — — — — — — 65.2 —
AgentWorldBench Overall 2/10 models general_agent — — 54.74 50.81 — — — — — —
OmniScience Non-Hallucination 1/10 models knowledge — — 7.4 — — — — — — —
Hy-BrowseComp-Pro2 (Internal) 1/10 models general_agent — — — — — — — — 46.7 —
WMDP (Bio) 1/10 models safety — 84.8 — — — — — — — —
QwenReactBench 2/10 models coding_agent — — — — — — 1538 — 1724 —
MMStar 4/10 models vision_language 80.7 81.4 83.8 — — 81 — — — —
GDPVal 1/10 models general_agent — — 34.6 — — — — — — —
OCRBench 1/10 models document_understanding — — — — — 89.4 — — — —
OfficeQA Pro 1/10 models general_agent — — — — — — — — 65.4 —
Apex-Shortlist (no tools) 1/10 models stem_reasoning — — 61.4 — — — — — — —
Seal-0 1/10 models general_agent — — — — — 47.2 — — — —
TauBench V3 Average 1/10 models general_agent — — 71 — — — — — — —
PMC-VQA 1/10 models vision_language — — — — — 62.4 — — — —
QwenSVGBench 2/10 models coding_agent — — — — — — 1499 — 1713 —
DeepSearch QA 1/10 models general_agent — 71.1 — — — — — — — —
MMLongBench-Doc 1/10 models document_understanding — — — — — 60.2 — — — —
SWE Atlas - TW 3/10 models coding_agent 13.3 — 18.5 — — — — — 52.8 —
IOI 2025 1/10 models stem_reasoning — — 441.3 — — — — — — —
Longbench v2 (≤ 1M) 1/10 models long_context — — 68.9 — — — — — — —
WildClawBench 3/10 models coding_agent 68.7 43.2 70.7 — — — — — — —
AgentWorldBench Web 2/10 models general_agent — — 48.55 50.78 — — — — — —
SWE Atlas - QnA 3/10 models coding_agent 15.5 — 20.4 — — — — — 55.4 —
AI2D_TEST 2/10 models document_understanding 92.7 — — — — 92.9 — — — —
LingoQA 1/10 models spatial_intelligence — — — — — 82 — — — —
ParseBench Text Formatting 1/10 models document_understanding 58.3 — — — — — — — — —
NOVA-63 1/10 models multilingual — — — — — 58.1 — — — —
NL2Repo 8/10 models coding_agent 29.4 36.2 32.2 — 41.1 27.3 47.2 — 55.9 42.3
HPCT 1/10 models safety — 48.7 — — — — — — — —
PRBench-Legal 2/10 models general_capabilities — — — — — — 48.5 — 57.6 —
MMMU-Pro 4/10 models vision_language 75.3 75.8 79 — — 75 — — — —
TauBench V3 Airline 1/10 models general_agent — — 76.5 — — — — — — —
INCLUDE 1/10 models multilingual — — — — — 81.6 — — — —
QwenClawBench 4/10 models coding_agent 52.6 53.4 51.8 — — 52.2 — — — —
BabyVision 4/10 models vision_language — 28.9 — — 64.7 44.6 — — — 65.7
SLAKE 1/10 models vision_language — — — — — 80 — — — —
MMMLU 1/10 models multilingual — — — — — 85.9 — — — —
Claw-Eval Avg 7/10 models coding_agent 68.7 72.4 70.7 — 60.1 64.3 — 60.4 — 56.9
VideoMMMU 4/10 models video_understanding 83.7 84.4 84.7 — — 82.3 — — — —
HMMT Nov 25 5/10 models stem_reasoning 89.1 90.7 92.7 — — 89.8 95 — — —
Apex-Agents 1/10 models general_agent — — — — — — — — 34 —
Multi-Challenge 2/10 models instruction_following — — 63.9 — — 60.8 — — — —
PolyMATH 1/10 models multilingual — — — — — 71.2 — — — —
PinchBench 1/10 models general_agent — — 86.6 — — — — — — —
SWE-MM 3/10 models coding_agent — 25.7 — — 30 — — — — 38.6
MMLU-ProX 2/10 models multilingual — — 86.4 — — 82.2 — — — —
WorkSpaceBench 2/10 models general_agent — — — — — — 61.4 — 67.7 —
MMLU-Pro 4/10 models knowledge 85.2 86.2 87.8 — — 86.1 — — — —
CodeForces 1/10 models stem_reasoning — — — — — 1899 — — — —
BankerToolBench 1/10 models general_agent — — — — — — — — 74.7 —
SuperGPQA 4/10 models knowledge 64.7 66 70.4 — — 65.6 — — — —
E-Bench-Code (Internal) 1/10 models coding_agent — — — — — — — — 67.1 —
OSWorld-Verified 4/10 models general_agent — 63.9 — — 73.3 56.2 — — — 84.3
TIR-Bench 1/10 models vision_language — — — — — 59.8 — — — —
Global PIQA 1/10 models multilingual — — — — — 87.5 — — — —
AgentWorldBench Search 2/10 models general_agent — — 30.81 21.94 — — — — — —
ExploitGym (6h) 1/10 models cybersecurity — — — — — — — — 26 —
IFEval 1/10 models instruction_following — — — — — 95 — — — —
HLE (with tools) 8/10 models stem_reasoning 28.9 — 48.3 — 34.7 48.5 53.5 35.9 56.2 30.8
LVBench 5/10 models video_understanding 71.4 — — — 76.2 73.6 — 76.6 — 72.4
CharXiv (RQ) 7/10 models document_understanding 78 78.4 80.8 — 85.8 79.5 — 84.6 — 83.7
RULER (1M) 1/10 models long_context — — 90.1 — — — — — — —
FrontierSWE 2/10 models coding_agent — — — — — — 40.7 — 73.5 —
Vals.ai Financial Agent 1.1 (without web search) 1/10 models general_agent — — 61.3 — — — — — — —
CritPt (no tools) 3/10 models stem_reasoning — — 2.4 — — — 13.4 — 20 —
BrowseComp 3/10 models general_agent 62 — 40.5 — — 61 — — — —
MedXpertQA-MM 1/10 models vision_language — — — — — 62.4 — — — —
MMLU-Redux 4/10 models knowledge 93.3 93.5 94.9 — — 93.2 — — — —
NL2Repo-Bench 5/10 models coding_agent — — — — 41.1 — 47.2 48.1 55.9 42.3
DRACO 1/10 models general_agent — — — — — — — — 76.4 —
SkillsBench 3/10 models general_agent — 46.6 — — — — 61.2 — 70.2 —
WebArena-Verified 3/10 models general_agent — 48.8 — — 55.3 — — — — 64.8
ParseBench Text Content 1/10 models document_understanding 90.7 — — — — — — — — —
CoWorkBench 6/10 models general_agent — 61 — — 65.1 — 64.6 73.9 74.8 70.7
Lab Bench (ProtocolQA) 1/10 models safety — 69.1 — — — — — — — —
MCPMark 2/10 models general_agent 37 — — — — 36.3 — — — —
SWE-bench Multilingual 8/10 models coding_agent 67.2 71.3 69.3 — 75.8 69.3 — 81 82.6 73.8
MMVU 1/10 models video_understanding — — — — — 73.3 — — — —
PaperBench 2/10 models coding_agent — — — — — — 64.8 — 93 —
FullStackBench zh 1/10 models coding_agent — — — — — 57.4 — — — —
MLVU 4/10 models video_understanding 86.2 86.6 86.7 — — 85.9 — — — —
TauBench V3 Telecom 1/10 models general_agent — — 98 — — — — — — —
Hy-FinAgentBench (Internal) 1/10 models domain_finance — — — — — — — — 77.2 —
Beam128K 1/10 models long_context — 63 — — — — — — — —
IFBench 7/10 models instruction_following — 70.8 — — 79.1 76.5 79.1 81.3 82.8 79.5
FullStackBench en 1/10 models coding_agent — — — — — 60.1 — — — —
SWE-bench Verified 4/10 models coding_agent 73.4 77.2 76.2 — — 75 — — — —
IMOAnswerBench 5/10 models stem_reasoning 78.9 80.8 80.9 — — 79.9 90 — — —
Humanity's Last Exam 8/10 models stem_reasoning 21.4 24 28.7 — 34.7 24.3 41.4 — 43.6 30.8
CountBench 4/10 models spatial_intelligence 96.1 97.8 97.2 — — 97.8 — — — —
WMDP (Chem) 1/10 models safety — 74.8 — — — — — — — —
ERQA 7/10 models spatial_intelligence 61.8 62.5 67.5 — 69.8 60.5 — 72.3 — 65.5
VideoMME (w/o sub.) 2/10 models video_understanding 82.5 — — — — 82.8 — — — —
Terminal-Bench 2.0 4/10 models coding_agent 51.5 59.3 52.5 — — 41.6 — — — —
IMOAnswerBench (with tools) 1/10 models stem_reasoning — — 84.51 — — — — — — —
DeepPlanning 2/10 models general_agent 25.9 — — — — 22.6 — — — —
QwenSWEBench 5/10 models coding_agent — 49.3 — — 59.2 — 63.4 — 80.7 79
ExploitGym (2h) 1/10 models cybersecurity — — — — — — — — 14 —
QwenWebBench 4/10 models coding_agent 1397 1487 1186 — — 1068 — — — —
TAU2-Bench 1/10 models general_agent — — — — — 79 — — — —
ODInW13 2/10 models spatial_intelligence 50.8 — — — — 41.1 — — — —
VlmsAreBlind 3/10 models vision_language 96.6 97 — — — 96.9 — — — —
SUPERChem 1/10 models stem_reasoning — — — — — — — — 61.9 —
HorizonMath (pass@4) 1/10 models stem_reasoning — — — — — — — — 5.31 —
Terminal-Bench 2.1 (Terminus-2) 7/10 models coding_agent 52.5 63.4 53.5 — 64 — 75 — 86.6 73
DeepSWE 3/10 models coding_agent 0 — 1 — — — — — 56.6 —
ExploitBench 1/10 models cybersecurity — — — — — — — — 28.8 —
BrokenArXiv 1/10 models stem_reasoning — — — — — — — — 42.7 —
OmniDocBench 1.5 5/10 models document_understanding 89.9 89.4 — — 91.4 88.9 — — — 91.1
HallusionBench 2/10 models vision_language 69.8 — — — — 70 — — — —
OCRBench 3/10 models document_understanding 90 89.4 — — — 89.4 — — — —
HMMT Feb 26 5/10 models stem_reasoning 83.6 84.3 87.9 — — 84.3 97.1 — — —
AgentWorldBench OS 2/10 models general_agent — — 60.85 60.33 — — — — — —
AgentWorldBench MCP 2/10 models general_agent — — 68.31 55.28 — — — — — —
Vals.ai Financial Agent 1.1 (with web search) 1/10 models general_agent — — 59 — — — — — — —
Hy-FinmodelBench v2 (Internal) 1/10 models domain_finance — — — — — — — — 52.5 —
MathArena Apex 2025 1/10 models stem_reasoning — — — — — — — — 72.8 —
Terminal Bench 2.1 2/10 models coding_agent — — — — — — 74.5 — 86.6 —
AgentWorldBench SWE 2/10 models general_agent — — 64.44 59.08 — — — — — —
CC-OCR 4/10 models document_understanding 81.9 81.2 82 — — 81 — — — —
RefCOCO (avg) 4/10 models spatial_intelligence 92 92.5 92.3 — — 90.9 — — — —
JobBench 6/10 models general_agent — 21.8 — — 27.6 — 31.3 55.7 53.4 33.4
Artificial Analysis Intelligence Index 1/10 models composite 32 — — — — — — — — —
$OneMillion-Bench 2/10 models general_capabilities — — — — — — 44.4 — 52.5 —
SciCode (subtask) 2/10 models stem_reasoning — 39.8 48 — — — — — — —
Tool Decathlon 2/10 models general_agent 26.9 — — — — 31.5 — — — —
QwenQoderBench 2/10 models coding_agent — — — — — — 36.8 — 58.4 —
Frontier-Bench v0.1 2/10 models coding_agent 1.4 — 1.4 — — — — — — —
OSWorld 2.0 (Partial) 3/10 models general_agent — — — — 21.5 — — 52.3 — 48
ParseBench Mean 1/10 models document_understanding 44.1 — — — — — — — — —
OSWorld 2.0 (Binary) 3/10 models general_agent — — — — 2.8 — — 19.4 — 19.4
ZEROBench_sub 2/10 models vision_language 34.4 — — — — 36.2 — — — —
C-Eval 4/10 models knowledge 90 91.4 93 — — 90.5 — — — —
WideSearch 5/10 models general_agent 60.1 — 74 — — 66.4 75.2 — 81.9 —
SimpleVQA 4/10 models vision_language 58.9 56.1 67.1 — — 56 — — — —
VideoMME (w sub.) 4/10 models video_understanding 86.6 87.7 87.5 — — 87 — — — —
SkillsBench Avg5 5/10 models coding_agent 28.7 48.2 30 — — 27.2 — — 66.7 —
Vision2Web 4/10 models vision_language — 45 — — 42.1 — — 64 — 62.9
TauBench V3 Banking 2/10 models general_agent — 16.7 20.9 — — — — — — —
HealthBench 2/10 models general_capabilities — — — — — — 54.5 — 60.2 —
Claw-Eval Pass^3 7/10 models coding_agent 50 60.6 48.1 — 57.4 46.2 — 64.4 — 57.4
WMT24++ (en→xx) 2/10 models multilingual — — 86.8 — — 77.6 — — — —
E-Bench (Internal) 1/10 models general_agent — — — — — — — — 66.8 —
ProgramBench 1/10 models coding_agent — — — — — — — — 10.5 —
LongBench v2 3/10 models long_context — — — — — 60.6 65.3 — 66.3 —
MCP-Atlas 6/10 models general_agent 62.8 62.5 72.3 — — 68.4 76.4 — 81.9 —
AndroidBench 2/10 models coding_agent — — — — — — 56.5 — 75.1 —
SWE-Marathon 1/10 models coding_agent — — — — — — — — 31 —
Cybergym 1/10 models general_agent — — — — — — — — 78.5 —
SWE Atlas - RF 3/10 models coding_agent 11.4 — 18.4 — — — — — 51 —
V-Star 4/10 models vision_language 90.1 94.7 95.8 — — 93.7 — — — —
AgentWorldBench Android 2/10 models general_agent — — 54.9 57.65 — — — — — —
DeepSWE 1.1 6/10 models coding_agent — 13.3 — — 14.2 — 18 58.7 56.6 42.2
Terminal-Bench 2.1 (Claude Code) 2/10 models coding_agent 49.2 — 48.6 — — — — — — —
MBCT 1/10 models safety — 45.9 — — — — — — — —
Hy-CompanyBench V2 (Internal) 1/10 models general_agent — — — — — — — — 63.3 —
VCT 1/10 models safety — 33.7 — — — — — — — —
Harbor-Index 1/10 models coding_agent — — — — — — — — 38.8 —
Gaia2 1/10 models general_agent — 40 — — — — — — — —
MLS-Bench-Lite 2/10 models coding_agent — — — — — — 31.7 — 41 —
SUNRGBD 1/10 models spatial_intelligence — — — — — 35.4 — — — —
RefSpatialBench 3/10 models spatial_intelligence 64.3 70 — — — 67.7 — — — —
MMMU 4/10 models vision_language 81.7 82.9 85 — — 82.3 — — — —
GDPVal-AA v2 2/10 models general_agent — 1141 — — — — — — 1739 —
MVBench 4/10 models video_understanding 74.6 75.5 77.6 — — 74.6 — — — —
ZEROBench 1/10 models vision_language — — — — — 10 — — — —