Qwen3.6-35B-A3B vs Qwen3.6-27B vs Qwen3.5-397B-A17B vs Qwen3.6-Plus vs Qwen3.7-Plus vs Qwen3.5-27B vs Qwen3.7-Max vs Qwen3.8-Flash-Next vs Qwen3.8-2.4T-A95B vs Qwen3.8-27B
New ComparisonScores are fetched live from the current database on every visit — nothing is cached.
Benchmark Scores Comparison
Qwen3.6-35B-A3B
35.0B params
Score: 100.0
Qwen3.6-27B
27.0B params
Score: 100.0
Qwen3.5-397B-A17B
Score: 15.0
Qwen3.6-Plus
Score: 15.0
Qwen3.7-Plus
Score: 15.0
Qwen3.5-27B
27.0B params
Score: 100.0
Qwen3.7-Max
Score: 15.0
Qwen3.8-Flash-Next
125.0B params
Score: 70.0
Qwen3.8-2.4T-A95B
2.4T params
Score: 70.0
Qwen3.8-27B
27.0B params
Score: 100.0
Coverage matrix
10 models × 206 benchmarks — hover a benchmark name for its category
| Benchmark | Qwen3.5-27B Qwen Team (Alibaba Cloud) | Qwen3.6-35B-A3B Qwen Team (Alibaba Cloud) | Qwen3.6-27B Qwen Team (Alibaba Cloud) | Qwen3.8-27B Qwen Team (Alibaba Cloud) | Qwen3.8-2.4T-A95B Qwen | Qwen3.8-Flash-Next Qwen Team (Alibaba) | Qwen3.5-397B-A17B Qwen Team (Alibaba Cloud) | Qwen3.6-Plus Qwen Team (Alibaba Cloud) | Qwen3.7-Plus Qwen Team (Alibaba Cloud) | Qwen3.7-Max Qwen Team (Alibaba Cloud) |
|---|---|---|---|---|---|---|---|---|---|---|
| OmniScience Accuracy | — | — | — | — | — | — | 35.9 | — | — | — |
| Apex-Shortlist (with tools) | — | — | — | — | — | — | 60.4 | — | — | — |
| HMMT Feb 25 | 92 | 90.7 | 93.8 | — | — | — | 94.8 | — | — | — |
| DynaMath | 87.7 | 82.8 | 85.6 | — | — | — | 86.3 | — | — | — |
| GPQA Diamond | 85.5 | 86 | 87.8 | 89.2 | 92.6 | 91.7 | 88.4 | — | 90.3 | 90 |
| IFBench (prompt loose) | — | — | 69.1 | 79.5 | — | — | 78.2 | — | 79.1 | — |
| MathVista (mini) | 87.8 | 86.4 | 87.4 | — | — | — | — | — | — | — |
| MMBench EN-DEV v1.1 | 92.6 | 92.8 | 92.3 | — | — | — | — | — | — | — |
| ProfBench (Search) | — | — | — | — | — | — | 53 | — | — | — |
| ArXivMath | — | — | — | — | 67.1 | — | — | — | — | — |
| Nuscene | 15.2 | — | — | — | — | — | — | — | — | — |
| LiveCodeBench v6 | 80.7 | 80.4 | 83.9 | 90.3 | — | 91.9 | 83.6 | — | 89.6 | — |
| Hy-LifeSearch (Internal) | — | — | — | — | 47.5 | — | — | — | — | — |
| MRCR v2 256K (8-needle) | — | — | — | — | 92.9 | — | — | — | — | 86.7 |
| TauBench V3 Retail | — | — | — | — | — | — | 88.5 | — | — | — |
| Automation-Bench | — | — | — | — | 27.3 | — | — | — | — | 14.2 |
| SWE-bench Pro | 51.2 | 49.5 | 53.5 | 61.7 | 67.7 | 62.5 | 50.9 | — | 57.6 | 60.6 |
| BFCL-V4 | 68.5 | — | — | — | — | — | — | — | — | — |
| RealWorldQA | 83.7 | 85.3 | 84.1 | 85.9 | — | 88.5 | 83.9 | — | 86.9 | — |
| Agents' Last Exam (Score) | — | — | — | 42.9 | — | 51.2 | — | — | 33.6 | — |
| BioMysteryBench | — | — | — | — | 58.9 | — | — | — | — | — |
| PRBench-Finance | — | — | — | — | 58.3 | — | — | — | — | 46.8 |
| EmbSpatialBench | 84.5 | 84.3 | 84.6 | — | — | — | — | — | — | — |
| AA-LCR | 66.1 | — | 73.3 | — | — | — | 68.3 | — | — | — |
| Hypersim | 13 | — | — | — | — | — | — | — | — | — |
| MathVision | 86 | — | 85.1 | 90 | — | 90.6 | — | — | 90.3 | — |
| AIME 26 | 92.6 | 92.7 | 94.1 | — | — | — | 93.3 | — | — | 97 |
| BrowseComp-zh | 62.1 | — | — | — | — | — | — | — | — | — |
| MAXIFE | 88 | — | — | — | — | — | — | — | — | — |
| AndroidWorld | 64.2 | — | 70.3 | 81.9 | — | 84.5 | — | — | 81 | — |
| AgentWorldBench Terminal | — | — | — | — | — | — | 55.3 | 50.58 | — | — |
| Agents' Last Exam | — | — | 10.6 | 20.4 | 27 | 24.3 | — | — | 13.2 | 11.8 |
| Toolathlon Verified | — | 41.7 | — | 67.1 | 72.5 | 73.5 | 38.3 | — | 50.6 | 49.7 |
| Hy-Backend 2.0 (Internal) | — | — | — | — | 34.9 | — | — | — | — | — |
| PLawBench | — | — | — | — | 73.2 | — | — | — | — | 58.9 |
| RecreationBench | — | — | 29.8 | 47.1 | — | 49.9 | — | — | 30.2 | — |
| VITA-Bench | 41.8 | 35.6 | — | — | — | — | — | — | — | — |
| TAU3-Bench | 68.4 | 67.2 | — | — | — | — | — | — | — | — |
| ScreenSpot Pro | 70.3 | — | 76.1 | — | — | — | — | — | — | — |
| OJBench | 40.1 | — | — | — | — | — | — | — | — | — |
| Hy-SWE Max Verified (Internal) | — | — | — | — | 65.2 | — | — | — | — | — |
| AgentWorldBench Overall | — | — | — | — | — | — | 54.74 | 50.81 | — | — |
| OmniScience Non-Hallucination | — | — | — | — | — | — | 7.4 | — | — | — |
| Hy-BrowseComp-Pro2 (Internal) | — | — | — | — | 46.7 | — | — | — | — | — |
| WMDP (Bio) | — | — | 84.8 | — | — | — | — | — | — | — |
| QwenReactBench | — | — | — | — | 1724 | — | — | — | — | 1538 |
| MMStar | 81 | 80.7 | 81.4 | — | — | — | 83.8 | — | — | — |
| GDPVal | — | — | — | — | — | — | 34.6 | — | — | — |
| OCRBench | 89.4 | — | — | — | — | — | — | — | — | — |
| OfficeQA Pro | — | — | — | — | 65.4 | — | — | — | — | — |
| Apex-Shortlist (no tools) | — | — | — | — | — | — | 61.4 | — | — | — |
| Seal-0 | 47.2 | — | — | — | — | — | — | — | — | — |
| TauBench V3 Average | — | — | — | — | — | — | 71 | — | — | — |
| PMC-VQA | 62.4 | — | — | — | — | — | — | — | — | — |
| QwenSVGBench | — | — | — | — | 1713 | — | — | — | — | 1499 |
| DeepSearch QA | — | — | 71.1 | — | — | — | — | — | — | — |
| MMLongBench-Doc | 60.2 | — | — | — | — | — | — | — | — | — |
| SWE Atlas - TW | — | 13.3 | — | — | 52.8 | — | 18.5 | — | — | — |
| IOI 2025 | — | — | — | — | — | — | 441.3 | — | — | — |
| Longbench v2 (≤ 1M) | — | — | — | — | — | — | 68.9 | — | — | — |
| WildClawBench | — | 68.7 | 43.2 | — | — | — | 70.7 | — | — | — |
| AgentWorldBench Web | — | — | — | — | — | — | 48.55 | 50.78 | — | — |
| SWE Atlas - QnA | — | 15.5 | — | — | 55.4 | — | 20.4 | — | — | — |
| AI2D_TEST | 92.9 | 92.7 | — | — | — | — | — | — | — | — |
| LingoQA | 82 | — | — | — | — | — | — | — | — | — |
| ParseBench Text Formatting | — | 58.3 | — | — | — | — | — | — | — | — |
| NOVA-63 | 58.1 | — | — | — | — | — | — | — | — | — |
| NL2Repo | 27.3 | 29.4 | 36.2 | 42.3 | 55.9 | — | 32.2 | — | 41.1 | 47.2 |
| HPCT | — | — | 48.7 | — | — | — | — | — | — | — |
| PRBench-Legal | — | — | — | — | 57.6 | — | — | — | — | 48.5 |
| MMMU-Pro | 75 | 75.3 | 75.8 | — | — | — | 79 | — | — | — |
| TauBench V3 Airline | — | — | — | — | — | — | 76.5 | — | — | — |
| INCLUDE | 81.6 | — | — | — | — | — | — | — | — | — |
| QwenClawBench | 52.2 | 52.6 | 53.4 | — | — | — | 51.8 | — | — | — |
| BabyVision | 44.6 | — | 28.9 | 65.7 | — | — | — | — | 64.7 | — |
| SLAKE | 80 | — | — | — | — | — | — | — | — | — |
| MMMLU | 85.9 | — | — | — | — | — | — | — | — | — |
| Claw-Eval Avg | 64.3 | 68.7 | 72.4 | 56.9 | — | 60.4 | 70.7 | — | 60.1 | — |
| VideoMMMU | 82.3 | 83.7 | 84.4 | — | — | — | 84.7 | — | — | — |
| HMMT Nov 25 | 89.8 | 89.1 | 90.7 | — | — | — | 92.7 | — | — | 95 |
| Apex-Agents | — | — | — | — | 34 | — | — | — | — | — |
| Multi-Challenge | 60.8 | — | — | — | — | — | 63.9 | — | — | — |
| PolyMATH | 71.2 | — | — | — | — | — | — | — | — | — |
| PinchBench | — | — | — | — | — | — | 86.6 | — | — | — |
| SWE-MM | — | — | 25.7 | 38.6 | — | — | — | — | 30 | — |
| MMLU-ProX | 82.2 | — | — | — | — | — | 86.4 | — | — | — |
| WorkSpaceBench | — | — | — | — | 67.7 | — | — | — | — | 61.4 |
| MMLU-Pro | 86.1 | 85.2 | 86.2 | — | — | — | 87.8 | — | — | — |
| CodeForces | 1899 | — | — | — | — | — | — | — | — | — |
| BankerToolBench | — | — | — | — | 74.7 | — | — | — | — | — |
| SuperGPQA | 65.6 | 64.7 | 66 | — | — | — | 70.4 | — | — | — |
| E-Bench-Code (Internal) | — | — | — | — | 67.1 | — | — | — | — | — |
| OSWorld-Verified | 56.2 | — | 63.9 | 84.3 | — | — | — | — | 73.3 | — |
| TIR-Bench | 59.8 | — | — | — | — | — | — | — | — | — |
| Global PIQA | 87.5 | — | — | — | — | — | — | — | — | — |
| AgentWorldBench Search | — | — | — | — | — | — | 30.81 | 21.94 | — | — |
| ExploitGym (6h) | — | — | — | — | 26 | — | — | — | — | — |
| IFEval | 95 | — | — | — | — | — | — | — | — | — |
| HLE (with tools) | 48.5 | 28.9 | — | 30.8 | 56.2 | 35.9 | 48.3 | — | 34.7 | 53.5 |
| LVBench | 73.6 | 71.4 | — | 72.4 | — | 76.6 | — | — | 76.2 | — |
| CharXiv (RQ) | 79.5 | 78 | 78.4 | 83.7 | — | 84.6 | 80.8 | — | 85.8 | — |
| RULER (1M) | — | — | — | — | — | — | 90.1 | — | — | — |
| FrontierSWE | — | — | — | — | 73.5 | — | — | — | — | 40.7 |
| Vals.ai Financial Agent 1.1 (without web search) | — | — | — | — | — | — | 61.3 | — | — | — |
| CritPt (no tools) | — | — | — | — | 20 | — | 2.4 | — | — | 13.4 |
| BrowseComp | 61 | 62 | — | — | — | — | 40.5 | — | — | — |
| MedXpertQA-MM | 62.4 | — | — | — | — | — | — | — | — | — |
| MMLU-Redux | 93.2 | 93.3 | 93.5 | — | — | — | 94.9 | — | — | — |
| NL2Repo-Bench | — | — | — | 42.3 | 55.9 | 48.1 | — | — | 41.1 | 47.2 |
| DRACO | — | — | — | — | 76.4 | — | — | — | — | — |
| SkillsBench | — | — | 46.6 | — | 70.2 | — | — | — | — | 61.2 |
| WebArena-Verified | — | — | 48.8 | 64.8 | — | — | — | — | 55.3 | — |
| ParseBench Text Content | — | 90.7 | — | — | — | — | — | — | — | — |
| CoWorkBench | — | — | 61 | 70.7 | 74.8 | 73.9 | — | — | 65.1 | 64.6 |
| Lab Bench (ProtocolQA) | — | — | 69.1 | — | — | — | — | — | — | — |
| MCPMark | 36.3 | 37 | — | — | — | — | — | — | — | — |
| SWE-bench Multilingual | 69.3 | 67.2 | 71.3 | 73.8 | 82.6 | 81 | 69.3 | — | 75.8 | — |
| MMVU | 73.3 | — | — | — | — | — | — | — | — | — |
| PaperBench | — | — | — | — | 93 | — | — | — | — | 64.8 |
| FullStackBench zh | 57.4 | — | — | — | — | — | — | — | — | — |
| MLVU | 85.9 | 86.2 | 86.6 | — | — | — | 86.7 | — | — | — |
| TauBench V3 Telecom | — | — | — | — | — | — | 98 | — | — | — |
| Hy-FinAgentBench (Internal) | — | — | — | — | 77.2 | — | — | — | — | — |
| Beam128K | — | — | 63 | — | — | — | — | — | — | — |
| IFBench | 76.5 | — | 70.8 | 79.5 | 82.8 | 81.3 | — | — | 79.1 | 79.1 |
| FullStackBench en | 60.1 | — | — | — | — | — | — | — | — | — |
| SWE-bench Verified | 75 | 73.4 | 77.2 | — | — | — | 76.2 | — | — | — |
| IMOAnswerBench | 79.9 | 78.9 | 80.8 | — | — | — | 80.9 | — | — | 90 |
| Humanity's Last Exam | 24.3 | 21.4 | 24 | 30.8 | 43.6 | — | 28.7 | — | 34.7 | 41.4 |
| CountBench | 97.8 | 96.1 | 97.8 | — | — | — | 97.2 | — | — | — |
| WMDP (Chem) | — | — | 74.8 | — | — | — | — | — | — | — |
| ERQA | 60.5 | 61.8 | 62.5 | 65.5 | — | 72.3 | 67.5 | — | 69.8 | — |
| VideoMME (w/o sub.) | 82.8 | 82.5 | — | — | — | — | — | — | — | — |
| Terminal-Bench 2.0 | 41.6 | 51.5 | 59.3 | — | — | — | 52.5 | — | — | — |
| IMOAnswerBench (with tools) | — | — | — | — | — | — | 84.51 | — | — | — |
| DeepPlanning | 22.6 | 25.9 | — | — | — | — | — | — | — | — |
| QwenSWEBench | — | — | 49.3 | 79 | 80.7 | — | — | — | 59.2 | 63.4 |
| ExploitGym (2h) | — | — | — | — | 14 | — | — | — | — | — |
| QwenWebBench | 1068 | 1397 | 1487 | — | — | — | 1186 | — | — | — |
| TAU2-Bench | 79 | — | — | — | — | — | — | — | — | — |
| ODInW13 | 41.1 | 50.8 | — | — | — | — | — | — | — | — |
| VlmsAreBlind | 96.9 | 96.6 | 97 | — | — | — | — | — | — | — |
| SUPERChem | — | — | — | — | 61.9 | — | — | — | — | — |
| HorizonMath (pass@4) | — | — | — | — | 5.31 | — | — | — | — | — |
| Terminal-Bench 2.1 (Terminus-2) | — | 52.5 | 63.4 | 73 | 86.6 | — | 53.5 | — | 64 | 75 |
| DeepSWE | — | 0 | — | — | 56.6 | — | 1 | — | — | — |
| ExploitBench | — | — | — | — | 28.8 | — | — | — | — | — |
| BrokenArXiv | — | — | — | — | 42.7 | — | — | — | — | — |
| OmniDocBench 1.5 | 88.9 | 89.9 | 89.4 | 91.1 | — | — | — | — | 91.4 | — |
| HallusionBench | 70 | 69.8 | — | — | — | — | — | — | — | — |
| OCRBench | 89.4 | 90 | 89.4 | — | — | — | — | — | — | — |
| HMMT Feb 26 | 84.3 | 83.6 | 84.3 | — | — | — | 87.9 | — | — | 97.1 |
| AgentWorldBench OS | — | — | — | — | — | — | 60.85 | 60.33 | — | — |
| AgentWorldBench MCP | — | — | — | — | — | — | 68.31 | 55.28 | — | — |
| Vals.ai Financial Agent 1.1 (with web search) | — | — | — | — | — | — | 59 | — | — | — |
| Hy-FinmodelBench v2 (Internal) | — | — | — | — | 52.5 | — | — | — | — | — |
| MathArena Apex 2025 | — | — | — | — | 72.8 | — | — | — | — | — |
| Terminal Bench 2.1 | — | — | — | — | 86.6 | — | — | — | — | 74.5 |
| AgentWorldBench SWE | — | — | — | — | — | — | 64.44 | 59.08 | — | — |
| CC-OCR | 81 | 81.9 | 81.2 | — | — | — | 82 | — | — | — |
| RefCOCO (avg) | 90.9 | 92 | 92.5 | — | — | — | 92.3 | — | — | — |
| JobBench | — | — | 21.8 | 33.4 | 53.4 | 55.7 | — | — | 27.6 | 31.3 |
| Artificial Analysis Intelligence Index | — | 32 | — | — | — | — | — | — | — | — |
| $OneMillion-Bench | — | — | — | — | 52.5 | — | — | — | — | 44.4 |
| SciCode (subtask) | — | — | 39.8 | — | — | — | 48 | — | — | — |
| Tool Decathlon | 31.5 | 26.9 | — | — | — | — | — | — | — | — |
| QwenQoderBench | — | — | — | — | 58.4 | — | — | — | — | 36.8 |
| Frontier-Bench v0.1 | — | 1.4 | — | — | — | — | 1.4 | — | — | — |
| OSWorld 2.0 (Partial) | — | — | — | 48 | — | 52.3 | — | — | 21.5 | — |
| ParseBench Mean | — | 44.1 | — | — | — | — | — | — | — | — |
| OSWorld 2.0 (Binary) | — | — | — | 19.4 | — | 19.4 | — | — | 2.8 | — |
| ZEROBench_sub | 36.2 | 34.4 | — | — | — | — | — | — | — | — |
| C-Eval | 90.5 | 90 | 91.4 | — | — | — | 93 | — | — | — |
| WideSearch | 66.4 | 60.1 | — | — | 81.9 | — | 74 | — | — | 75.2 |
| SimpleVQA | 56 | 58.9 | 56.1 | — | — | — | 67.1 | — | — | — |
| VideoMME (w sub.) | 87 | 86.6 | 87.7 | — | — | — | 87.5 | — | — | — |
| SkillsBench Avg5 | 27.2 | 28.7 | 48.2 | — | 66.7 | — | 30 | — | — | — |
| Vision2Web | — | — | 45 | 62.9 | — | 64 | — | — | 42.1 | — |
| TauBench V3 Banking | — | — | 16.7 | — | — | — | 20.9 | — | — | — |
| HealthBench | — | — | — | — | 60.2 | — | — | — | — | 54.5 |
| Claw-Eval Pass^3 | 46.2 | 50 | 60.6 | 57.4 | — | 64.4 | 48.1 | — | 57.4 | — |
| WMT24++ (en→xx) | 77.6 | — | — | — | — | — | 86.8 | — | — | — |
| E-Bench (Internal) | — | — | — | — | 66.8 | — | — | — | — | — |
| ProgramBench | — | — | — | — | 10.5 | — | — | — | — | — |
| LongBench v2 | 60.6 | — | — | — | 66.3 | — | — | — | — | 65.3 |
| MCP-Atlas | 68.4 | 62.8 | 62.5 | — | 81.9 | — | 72.3 | — | — | 76.4 |
| AndroidBench | — | — | — | — | 75.1 | — | — | — | — | 56.5 |
| SWE-Marathon | — | — | — | — | 31 | — | — | — | — | — |
| Cybergym | — | — | — | — | 78.5 | — | — | — | — | — |
| SWE Atlas - RF | — | 11.4 | — | — | 51 | — | 18.4 | — | — | — |
| V-Star | 93.7 | 90.1 | 94.7 | — | — | — | 95.8 | — | — | — |
| AgentWorldBench Android | — | — | — | — | — | — | 54.9 | 57.65 | — | — |
| DeepSWE 1.1 | — | — | 13.3 | 42.2 | 56.6 | 58.7 | — | — | 14.2 | 18 |
| Terminal-Bench 2.1 (Claude Code) | — | 49.2 | — | — | — | — | 48.6 | — | — | — |
| MBCT | — | — | 45.9 | — | — | — | — | — | — | — |
| Hy-CompanyBench V2 (Internal) | — | — | — | — | 63.3 | — | — | — | — | — |
| VCT | — | — | 33.7 | — | — | — | — | — | — | — |
| Harbor-Index | — | — | — | — | 38.8 | — | — | — | — | — |
| Gaia2 | — | — | 40 | — | — | — | — | — | — | — |
| MLS-Bench-Lite | — | — | — | — | 41 | — | — | — | — | 31.7 |
| SUNRGBD | 35.4 | — | — | — | — | — | — | — | — | — |
| RefSpatialBench | 67.7 | 64.3 | 70 | — | — | — | — | — | — | — |
| MMMU | 82.3 | 81.7 | 82.9 | — | — | — | 85 | — | — | — |
| GDPVal-AA v2 | — | — | 1141 | — | 1739 | — | — | — | — | — |
| MVBench | 74.6 | 74.6 | 75.5 | — | — | — | 77.6 | — | — | — |
| ZEROBench | 10 | — | — | — | — | — | — | — | — | — |
| Covered | 98/206 | 73/206 | 78/206 | 35/206 | 68/206 | 25/206 | 84/206 | 8/206 | 35/206 | 39/206 |
Partial coverage benchmarks
Scored by at least one but not all selected models (206) — missing scores show as —
| Benchmark | Category | Qwen3.6-35B-A3B | Qwen3.6-27B | Qwen3.5-397B-A17B | Qwen3.6-Plus | Qwen3.7-Plus | Qwen3.5-27B | Qwen3.7-Max | Qwen3.8-Flash-Next | Qwen3.8-2.4T-A95B | Qwen3.8-27B |
|---|---|---|---|---|---|---|---|---|---|---|---|
| OmniScience Accuracy 1/10 models | knowledge | — | — | 35.9 | — | — | — | — | — | — | — |
| Apex-Shortlist (with tools) 1/10 models | stem_reasoning | — | — | 60.4 | — | — | — | — | — | — | — |
| HMMT Feb 25 4/10 models | stem_reasoning | 90.7 | 93.8 | 94.8 | — | — | 92 | — | — | — | — |
| DynaMath 4/10 models | vision_language | 82.8 | 85.6 | 86.3 | — | — | 87.7 | — | — | — | — |
| GPQA Diamond 9/10 models | stem_reasoning | 86 | 87.8 | 88.4 | — | 90.3 | 85.5 | 90 | 91.7 | 92.6 | 89.2 |
| IFBench (prompt loose) 4/10 models | instruction_following | — | 69.1 | 78.2 | — | 79.1 | — | — | — | — | 79.5 |
| MathVista (mini) 3/10 models | vision_language | 86.4 | 87.4 | — | — | — | 87.8 | — | — | — | — |
| MMBench EN-DEV v1.1 3/10 models | vision_language | 92.8 | 92.3 | — | — | — | 92.6 | — | — | — | — |
| ProfBench (Search) 1/10 models | general_agent | — | — | 53 | — | — | — | — | — | — | — |
| ArXivMath 1/10 models | stem_reasoning | — | — | — | — | — | — | — | — | 67.1 | — |
| Nuscene 1/10 models | spatial_intelligence | — | — | — | — | — | 15.2 | — | — | — | — |
| LiveCodeBench v6 7/10 models | stem_reasoning | 80.4 | 83.9 | 83.6 | — | 89.6 | 80.7 | — | 91.9 | — | 90.3 |
| Hy-LifeSearch (Internal) 1/10 models | general_agent | — | — | — | — | — | — | — | — | 47.5 | — |
| MRCR v2 256K (8-needle) 2/10 models | long_context | — | — | — | — | — | — | 86.7 | — | 92.9 | — |
| TauBench V3 Retail 1/10 models | general_agent | — | — | 88.5 | — | — | — | — | — | — | — |
| Automation-Bench 2/10 models | general_agent | — | — | — | — | — | — | 14.2 | — | 27.3 | — |
| SWE-bench Pro 9/10 models | coding_agent | 49.5 | 53.5 | 50.9 | — | 57.6 | 51.2 | 60.6 | 62.5 | 67.7 | 61.7 |
| BFCL-V4 1/10 models | general_agent | — | — | — | — | — | 68.5 | — | — | — | — |
| RealWorldQA 7/10 models | vision_language | 85.3 | 84.1 | 83.9 | — | 86.9 | 83.7 | — | 88.5 | — | 85.9 |
| Agents' Last Exam (Score) 3/10 models | general_agent | — | — | — | — | 33.6 | — | — | 51.2 | — | 42.9 |
| BioMysteryBench 1/10 models | stem_reasoning | — | — | — | — | — | — | — | — | 58.9 | — |
| PRBench-Finance 2/10 models | general_capabilities | — | — | — | — | — | — | 46.8 | — | 58.3 | — |
| EmbSpatialBench 3/10 models | spatial_intelligence | 84.3 | 84.6 | — | — | — | 84.5 | — | — | — | — |
| AA-LCR 3/10 models | long_context | — | 73.3 | 68.3 | — | — | 66.1 | — | — | — | — |
| Hypersim 1/10 models | spatial_intelligence | — | — | — | — | — | 13 | — | — | — | — |
| MathVision 5/10 models | vision_language | — | 85.1 | — | — | 90.3 | 86 | — | 90.6 | — | 90 |
| AIME 26 5/10 models | stem_reasoning | 92.7 | 94.1 | 93.3 | — | — | 92.6 | 97 | — | — | — |
| BrowseComp-zh 1/10 models | general_agent | — | — | — | — | — | 62.1 | — | — | — | — |
| MAXIFE 1/10 models | multilingual | — | — | — | — | — | 88 | — | — | — | — |
| AndroidWorld 5/10 models | general_agent | — | 70.3 | — | — | 81 | 64.2 | — | 84.5 | — | 81.9 |
| AgentWorldBench Terminal 2/10 models | general_agent | — | — | 55.3 | 50.58 | — | — | — | — | — | — |
| Agents' Last Exam 6/10 models | general_agent | — | 10.6 | — | — | 13.2 | — | 11.8 | 24.3 | 27 | 20.4 |
| Toolathlon Verified 7/10 models | general_agent | 41.7 | — | 38.3 | — | 50.6 | — | 49.7 | 73.5 | 72.5 | 67.1 |
| Hy-Backend 2.0 (Internal) 1/10 models | coding_agent | — | — | — | — | — | — | — | — | 34.9 | — |
| PLawBench 2/10 models | general_capabilities | — | — | — | — | — | — | 58.9 | — | 73.2 | — |
| RecreationBench 4/10 models | general_agent | — | 29.8 | — | — | 30.2 | — | — | 49.9 | — | 47.1 |
| VITA-Bench 2/10 models | general_agent | 35.6 | — | — | — | — | 41.8 | — | — | — | — |
| TAU3-Bench 2/10 models | general_agent | 67.2 | — | — | — | — | 68.4 | — | — | — | — |
| ScreenSpot Pro 2/10 models | general_agent | — | 76.1 | — | — | — | 70.3 | — | — | — | — |
| OJBench 1/10 models | stem_reasoning | — | — | — | — | — | 40.1 | — | — | — | — |
| Hy-SWE Max Verified (Internal) 1/10 models | coding_agent | — | — | — | — | — | — | — | — | 65.2 | — |
| AgentWorldBench Overall 2/10 models | general_agent | — | — | 54.74 | 50.81 | — | — | — | — | — | — |
| OmniScience Non-Hallucination 1/10 models | knowledge | — | — | 7.4 | — | — | — | — | — | — | — |
| Hy-BrowseComp-Pro2 (Internal) 1/10 models | general_agent | — | — | — | — | — | — | — | — | 46.7 | — |
| WMDP (Bio) 1/10 models | safety | — | 84.8 | — | — | — | — | — | — | — | — |
| QwenReactBench 2/10 models | coding_agent | — | — | — | — | — | — | 1538 | — | 1724 | — |
| MMStar 4/10 models | vision_language | 80.7 | 81.4 | 83.8 | — | — | 81 | — | — | — | — |
| GDPVal 1/10 models | general_agent | — | — | 34.6 | — | — | — | — | — | — | — |
| OCRBench 1/10 models | document_understanding | — | — | — | — | — | 89.4 | — | — | — | — |
| OfficeQA Pro 1/10 models | general_agent | — | — | — | — | — | — | — | — | 65.4 | — |
| Apex-Shortlist (no tools) 1/10 models | stem_reasoning | — | — | 61.4 | — | — | — | — | — | — | — |
| Seal-0 1/10 models | general_agent | — | — | — | — | — | 47.2 | — | — | — | — |
| TauBench V3 Average 1/10 models | general_agent | — | — | 71 | — | — | — | — | — | — | — |
| PMC-VQA 1/10 models | vision_language | — | — | — | — | — | 62.4 | — | — | — | — |
| QwenSVGBench 2/10 models | coding_agent | — | — | — | — | — | — | 1499 | — | 1713 | — |
| DeepSearch QA 1/10 models | general_agent | — | 71.1 | — | — | — | — | — | — | — | — |
| MMLongBench-Doc 1/10 models | document_understanding | — | — | — | — | — | 60.2 | — | — | — | — |
| SWE Atlas - TW 3/10 models | coding_agent | 13.3 | — | 18.5 | — | — | — | — | — | 52.8 | — |
| IOI 2025 1/10 models | stem_reasoning | — | — | 441.3 | — | — | — | — | — | — | — |
| Longbench v2 (≤ 1M) 1/10 models | long_context | — | — | 68.9 | — | — | — | — | — | — | — |
| WildClawBench 3/10 models | coding_agent | 68.7 | 43.2 | 70.7 | — | — | — | — | — | — | — |
| AgentWorldBench Web 2/10 models | general_agent | — | — | 48.55 | 50.78 | — | — | — | — | — | — |
| SWE Atlas - QnA 3/10 models | coding_agent | 15.5 | — | 20.4 | — | — | — | — | — | 55.4 | — |
| AI2D_TEST 2/10 models | document_understanding | 92.7 | — | — | — | — | 92.9 | — | — | — | — |
| LingoQA 1/10 models | spatial_intelligence | — | — | — | — | — | 82 | — | — | — | — |
| ParseBench Text Formatting 1/10 models | document_understanding | 58.3 | — | — | — | — | — | — | — | — | — |
| NOVA-63 1/10 models | multilingual | — | — | — | — | — | 58.1 | — | — | — | — |
| NL2Repo 8/10 models | coding_agent | 29.4 | 36.2 | 32.2 | — | 41.1 | 27.3 | 47.2 | — | 55.9 | 42.3 |
| HPCT 1/10 models | safety | — | 48.7 | — | — | — | — | — | — | — | — |
| PRBench-Legal 2/10 models | general_capabilities | — | — | — | — | — | — | 48.5 | — | 57.6 | — |
| MMMU-Pro 4/10 models | vision_language | 75.3 | 75.8 | 79 | — | — | 75 | — | — | — | — |
| TauBench V3 Airline 1/10 models | general_agent | — | — | 76.5 | — | — | — | — | — | — | — |
| INCLUDE 1/10 models | multilingual | — | — | — | — | — | 81.6 | — | — | — | — |
| QwenClawBench 4/10 models | coding_agent | 52.6 | 53.4 | 51.8 | — | — | 52.2 | — | — | — | — |
| BabyVision 4/10 models | vision_language | — | 28.9 | — | — | 64.7 | 44.6 | — | — | — | 65.7 |
| SLAKE 1/10 models | vision_language | — | — | — | — | — | 80 | — | — | — | — |
| MMMLU 1/10 models | multilingual | — | — | — | — | — | 85.9 | — | — | — | — |
| Claw-Eval Avg 7/10 models | coding_agent | 68.7 | 72.4 | 70.7 | — | 60.1 | 64.3 | — | 60.4 | — | 56.9 |
| VideoMMMU 4/10 models | video_understanding | 83.7 | 84.4 | 84.7 | — | — | 82.3 | — | — | — | — |
| HMMT Nov 25 5/10 models | stem_reasoning | 89.1 | 90.7 | 92.7 | — | — | 89.8 | 95 | — | — | — |
| Apex-Agents 1/10 models | general_agent | — | — | — | — | — | — | — | — | 34 | — |
| Multi-Challenge 2/10 models | instruction_following | — | — | 63.9 | — | — | 60.8 | — | — | — | — |
| PolyMATH 1/10 models | multilingual | — | — | — | — | — | 71.2 | — | — | — | — |
| PinchBench 1/10 models | general_agent | — | — | 86.6 | — | — | — | — | — | — | — |
| SWE-MM 3/10 models | coding_agent | — | 25.7 | — | — | 30 | — | — | — | — | 38.6 |
| MMLU-ProX 2/10 models | multilingual | — | — | 86.4 | — | — | 82.2 | — | — | — | — |
| WorkSpaceBench 2/10 models | general_agent | — | — | — | — | — | — | 61.4 | — | 67.7 | — |
| MMLU-Pro 4/10 models | knowledge | 85.2 | 86.2 | 87.8 | — | — | 86.1 | — | — | — | — |
| CodeForces 1/10 models | stem_reasoning | — | — | — | — | — | 1899 | — | — | — | — |
| BankerToolBench 1/10 models | general_agent | — | — | — | — | — | — | — | — | 74.7 | — |
| SuperGPQA 4/10 models | knowledge | 64.7 | 66 | 70.4 | — | — | 65.6 | — | — | — | — |
| E-Bench-Code (Internal) 1/10 models | coding_agent | — | — | — | — | — | — | — | — | 67.1 | — |
| OSWorld-Verified 4/10 models | general_agent | — | 63.9 | — | — | 73.3 | 56.2 | — | — | — | 84.3 |
| TIR-Bench 1/10 models | vision_language | — | — | — | — | — | 59.8 | — | — | — | — |
| Global PIQA 1/10 models | multilingual | — | — | — | — | — | 87.5 | — | — | — | — |
| AgentWorldBench Search 2/10 models | general_agent | — | — | 30.81 | 21.94 | — | — | — | — | — | — |
| ExploitGym (6h) 1/10 models | cybersecurity | — | — | — | — | — | — | — | — | 26 | — |
| IFEval 1/10 models | instruction_following | — | — | — | — | — | 95 | — | — | — | — |
| HLE (with tools) 8/10 models | stem_reasoning | 28.9 | — | 48.3 | — | 34.7 | 48.5 | 53.5 | 35.9 | 56.2 | 30.8 |
| LVBench 5/10 models | video_understanding | 71.4 | — | — | — | 76.2 | 73.6 | — | 76.6 | — | 72.4 |
| CharXiv (RQ) 7/10 models | document_understanding | 78 | 78.4 | 80.8 | — | 85.8 | 79.5 | — | 84.6 | — | 83.7 |
| RULER (1M) 1/10 models | long_context | — | — | 90.1 | — | — | — | — | — | — | — |
| FrontierSWE 2/10 models | coding_agent | — | — | — | — | — | — | 40.7 | — | 73.5 | — |
| Vals.ai Financial Agent 1.1 (without web search) 1/10 models | general_agent | — | — | 61.3 | — | — | — | — | — | — | — |
| CritPt (no tools) 3/10 models | stem_reasoning | — | — | 2.4 | — | — | — | 13.4 | — | 20 | — |
| BrowseComp 3/10 models | general_agent | 62 | — | 40.5 | — | — | 61 | — | — | — | — |
| MedXpertQA-MM 1/10 models | vision_language | — | — | — | — | — | 62.4 | — | — | — | — |
| MMLU-Redux 4/10 models | knowledge | 93.3 | 93.5 | 94.9 | — | — | 93.2 | — | — | — | — |
| NL2Repo-Bench 5/10 models | coding_agent | — | — | — | — | 41.1 | — | 47.2 | 48.1 | 55.9 | 42.3 |
| DRACO 1/10 models | general_agent | — | — | — | — | — | — | — | — | 76.4 | — |
| SkillsBench 3/10 models | general_agent | — | 46.6 | — | — | — | — | 61.2 | — | 70.2 | — |
| WebArena-Verified 3/10 models | general_agent | — | 48.8 | — | — | 55.3 | — | — | — | — | 64.8 |
| ParseBench Text Content 1/10 models | document_understanding | 90.7 | — | — | — | — | — | — | — | — | — |
| CoWorkBench 6/10 models | general_agent | — | 61 | — | — | 65.1 | — | 64.6 | 73.9 | 74.8 | 70.7 |
| Lab Bench (ProtocolQA) 1/10 models | safety | — | 69.1 | — | — | — | — | — | — | — | — |
| MCPMark 2/10 models | general_agent | 37 | — | — | — | — | 36.3 | — | — | — | — |
| SWE-bench Multilingual 8/10 models | coding_agent | 67.2 | 71.3 | 69.3 | — | 75.8 | 69.3 | — | 81 | 82.6 | 73.8 |
| MMVU 1/10 models | video_understanding | — | — | — | — | — | 73.3 | — | — | — | — |
| PaperBench 2/10 models | coding_agent | — | — | — | — | — | — | 64.8 | — | 93 | — |
| FullStackBench zh 1/10 models | coding_agent | — | — | — | — | — | 57.4 | — | — | — | — |
| MLVU 4/10 models | video_understanding | 86.2 | 86.6 | 86.7 | — | — | 85.9 | — | — | — | — |
| TauBench V3 Telecom 1/10 models | general_agent | — | — | 98 | — | — | — | — | — | — | — |
| Hy-FinAgentBench (Internal) 1/10 models | domain_finance | — | — | — | — | — | — | — | — | 77.2 | — |
| Beam128K 1/10 models | long_context | — | 63 | — | — | — | — | — | — | — | — |
| IFBench 7/10 models | instruction_following | — | 70.8 | — | — | 79.1 | 76.5 | 79.1 | 81.3 | 82.8 | 79.5 |
| FullStackBench en 1/10 models | coding_agent | — | — | — | — | — | 60.1 | — | — | — | — |
| SWE-bench Verified 4/10 models | coding_agent | 73.4 | 77.2 | 76.2 | — | — | 75 | — | — | — | — |
| IMOAnswerBench 5/10 models | stem_reasoning | 78.9 | 80.8 | 80.9 | — | — | 79.9 | 90 | — | — | — |
| Humanity's Last Exam 8/10 models | stem_reasoning | 21.4 | 24 | 28.7 | — | 34.7 | 24.3 | 41.4 | — | 43.6 | 30.8 |
| CountBench 4/10 models | spatial_intelligence | 96.1 | 97.8 | 97.2 | — | — | 97.8 | — | — | — | — |
| WMDP (Chem) 1/10 models | safety | — | 74.8 | — | — | — | — | — | — | — | — |
| ERQA 7/10 models | spatial_intelligence | 61.8 | 62.5 | 67.5 | — | 69.8 | 60.5 | — | 72.3 | — | 65.5 |
| VideoMME (w/o sub.) 2/10 models | video_understanding | 82.5 | — | — | — | — | 82.8 | — | — | — | — |
| Terminal-Bench 2.0 4/10 models | coding_agent | 51.5 | 59.3 | 52.5 | — | — | 41.6 | — | — | — | — |
| IMOAnswerBench (with tools) 1/10 models | stem_reasoning | — | — | 84.51 | — | — | — | — | — | — | — |
| DeepPlanning 2/10 models | general_agent | 25.9 | — | — | — | — | 22.6 | — | — | — | — |
| QwenSWEBench 5/10 models | coding_agent | — | 49.3 | — | — | 59.2 | — | 63.4 | — | 80.7 | 79 |
| ExploitGym (2h) 1/10 models | cybersecurity | — | — | — | — | — | — | — | — | 14 | — |
| QwenWebBench 4/10 models | coding_agent | 1397 | 1487 | 1186 | — | — | 1068 | — | — | — | — |
| TAU2-Bench 1/10 models | general_agent | — | — | — | — | — | 79 | — | — | — | — |
| ODInW13 2/10 models | spatial_intelligence | 50.8 | — | — | — | — | 41.1 | — | — | — | — |
| VlmsAreBlind 3/10 models | vision_language | 96.6 | 97 | — | — | — | 96.9 | — | — | — | — |
| SUPERChem 1/10 models | stem_reasoning | — | — | — | — | — | — | — | — | 61.9 | — |
| HorizonMath (pass@4) 1/10 models | stem_reasoning | — | — | — | — | — | — | — | — | 5.31 | — |
| Terminal-Bench 2.1 (Terminus-2) 7/10 models | coding_agent | 52.5 | 63.4 | 53.5 | — | 64 | — | 75 | — | 86.6 | 73 |
| DeepSWE 3/10 models | coding_agent | 0 | — | 1 | — | — | — | — | — | 56.6 | — |
| ExploitBench 1/10 models | cybersecurity | — | — | — | — | — | — | — | — | 28.8 | — |
| BrokenArXiv 1/10 models | stem_reasoning | — | — | — | — | — | — | — | — | 42.7 | — |
| OmniDocBench 1.5 5/10 models | document_understanding | 89.9 | 89.4 | — | — | 91.4 | 88.9 | — | — | — | 91.1 |
| HallusionBench 2/10 models | vision_language | 69.8 | — | — | — | — | 70 | — | — | — | — |
| OCRBench 3/10 models | document_understanding | 90 | 89.4 | — | — | — | 89.4 | — | — | — | — |
| HMMT Feb 26 5/10 models | stem_reasoning | 83.6 | 84.3 | 87.9 | — | — | 84.3 | 97.1 | — | — | — |
| AgentWorldBench OS 2/10 models | general_agent | — | — | 60.85 | 60.33 | — | — | — | — | — | — |
| AgentWorldBench MCP 2/10 models | general_agent | — | — | 68.31 | 55.28 | — | — | — | — | — | — |
| Vals.ai Financial Agent 1.1 (with web search) 1/10 models | general_agent | — | — | 59 | — | — | — | — | — | — | — |
| Hy-FinmodelBench v2 (Internal) 1/10 models | domain_finance | — | — | — | — | — | — | — | — | 52.5 | — |
| MathArena Apex 2025 1/10 models | stem_reasoning | — | — | — | — | — | — | — | — | 72.8 | — |
| Terminal Bench 2.1 2/10 models | coding_agent | — | — | — | — | — | — | 74.5 | — | 86.6 | — |
| AgentWorldBench SWE 2/10 models | general_agent | — | — | 64.44 | 59.08 | — | — | — | — | — | — |
| CC-OCR 4/10 models | document_understanding | 81.9 | 81.2 | 82 | — | — | 81 | — | — | — | — |
| RefCOCO (avg) 4/10 models | spatial_intelligence | 92 | 92.5 | 92.3 | — | — | 90.9 | — | — | — | — |
| JobBench 6/10 models | general_agent | — | 21.8 | — | — | 27.6 | — | 31.3 | 55.7 | 53.4 | 33.4 |
| Artificial Analysis Intelligence Index 1/10 models | composite | 32 | — | — | — | — | — | — | — | — | — |
| $OneMillion-Bench 2/10 models | general_capabilities | — | — | — | — | — | — | 44.4 | — | 52.5 | — |
| SciCode (subtask) 2/10 models | stem_reasoning | — | 39.8 | 48 | — | — | — | — | — | — | — |
| Tool Decathlon 2/10 models | general_agent | 26.9 | — | — | — | — | 31.5 | — | — | — | — |
| QwenQoderBench 2/10 models | coding_agent | — | — | — | — | — | — | 36.8 | — | 58.4 | — |
| Frontier-Bench v0.1 2/10 models | coding_agent | 1.4 | — | 1.4 | — | — | — | — | — | — | — |
| OSWorld 2.0 (Partial) 3/10 models | general_agent | — | — | — | — | 21.5 | — | — | 52.3 | — | 48 |
| ParseBench Mean 1/10 models | document_understanding | 44.1 | — | — | — | — | — | — | — | — | — |
| OSWorld 2.0 (Binary) 3/10 models | general_agent | — | — | — | — | 2.8 | — | — | 19.4 | — | 19.4 |
| ZEROBench_sub 2/10 models | vision_language | 34.4 | — | — | — | — | 36.2 | — | — | — | — |
| C-Eval 4/10 models | knowledge | 90 | 91.4 | 93 | — | — | 90.5 | — | — | — | — |
| WideSearch 5/10 models | general_agent | 60.1 | — | 74 | — | — | 66.4 | 75.2 | — | 81.9 | — |
| SimpleVQA 4/10 models | vision_language | 58.9 | 56.1 | 67.1 | — | — | 56 | — | — | — | — |
| VideoMME (w sub.) 4/10 models | video_understanding | 86.6 | 87.7 | 87.5 | — | — | 87 | — | — | — | — |
| SkillsBench Avg5 5/10 models | coding_agent | 28.7 | 48.2 | 30 | — | — | 27.2 | — | — | 66.7 | — |
| Vision2Web 4/10 models | vision_language | — | 45 | — | — | 42.1 | — | — | 64 | — | 62.9 |
| TauBench V3 Banking 2/10 models | general_agent | — | 16.7 | 20.9 | — | — | — | — | — | — | — |
| HealthBench 2/10 models | general_capabilities | — | — | — | — | — | — | 54.5 | — | 60.2 | — |
| Claw-Eval Pass^3 7/10 models | coding_agent | 50 | 60.6 | 48.1 | — | 57.4 | 46.2 | — | 64.4 | — | 57.4 |
| WMT24++ (en→xx) 2/10 models | multilingual | — | — | 86.8 | — | — | 77.6 | — | — | — | — |
| E-Bench (Internal) 1/10 models | general_agent | — | — | — | — | — | — | — | — | 66.8 | — |
| ProgramBench 1/10 models | coding_agent | — | — | — | — | — | — | — | — | 10.5 | — |
| LongBench v2 3/10 models | long_context | — | — | — | — | — | 60.6 | 65.3 | — | 66.3 | — |
| MCP-Atlas 6/10 models | general_agent | 62.8 | 62.5 | 72.3 | — | — | 68.4 | 76.4 | — | 81.9 | — |
| AndroidBench 2/10 models | coding_agent | — | — | — | — | — | — | 56.5 | — | 75.1 | — |
| SWE-Marathon 1/10 models | coding_agent | — | — | — | — | — | — | — | — | 31 | — |
| Cybergym 1/10 models | general_agent | — | — | — | — | — | — | — | — | 78.5 | — |
| SWE Atlas - RF 3/10 models | coding_agent | 11.4 | — | 18.4 | — | — | — | — | — | 51 | — |
| V-Star 4/10 models | vision_language | 90.1 | 94.7 | 95.8 | — | — | 93.7 | — | — | — | — |
| AgentWorldBench Android 2/10 models | general_agent | — | — | 54.9 | 57.65 | — | — | — | — | — | — |
| DeepSWE 1.1 6/10 models | coding_agent | — | 13.3 | — | — | 14.2 | — | 18 | 58.7 | 56.6 | 42.2 |
| Terminal-Bench 2.1 (Claude Code) 2/10 models | coding_agent | 49.2 | — | 48.6 | — | — | — | — | — | — | — |
| MBCT 1/10 models | safety | — | 45.9 | — | — | — | — | — | — | — | — |
| Hy-CompanyBench V2 (Internal) 1/10 models | general_agent | — | — | — | — | — | — | — | — | 63.3 | — |
| VCT 1/10 models | safety | — | 33.7 | — | — | — | — | — | — | — | — |
| Harbor-Index 1/10 models | coding_agent | — | — | — | — | — | — | — | — | 38.8 | — |
| Gaia2 1/10 models | general_agent | — | 40 | — | — | — | — | — | — | — | — |
| MLS-Bench-Lite 2/10 models | coding_agent | — | — | — | — | — | — | 31.7 | — | 41 | — |
| SUNRGBD 1/10 models | spatial_intelligence | — | — | — | — | — | 35.4 | — | — | — | — |
| RefSpatialBench 3/10 models | spatial_intelligence | 64.3 | 70 | — | — | — | 67.7 | — | — | — | — |
| MMMU 4/10 models | vision_language | 81.7 | 82.9 | 85 | — | — | 82.3 | — | — | — | — |
| GDPVal-AA v2 2/10 models | general_agent | — | 1141 | — | — | — | — | — | — | 1739 | — |
| MVBench 4/10 models | video_understanding | 74.6 | 75.5 | 77.6 | — | — | 74.6 | — | — | — | — |
| ZEROBench 1/10 models | vision_language | — | — | — | — | — | 10 | — | — | — | — |