ZEROBench_sub

ZEROBench subset - visual reasoning puzzle benchmark.

Category

Vision & Language

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for ZEROBench_sub

Model Score Date Verified
Qwen3.6-35B-A3B
82.35%
16.04.2026 Verified
Gemma4-31B-it
26.00
16.04.2026 Unverified
Qwen3.5-35B-A3B
79.41%
16.04.2026 Unverified
Gemma4-26B-A4B
2.94%
16.04.2026 Unverified
Claude-Sonnet-4.5
2.94%
16.04.2026 Unverified
Qwen3.5-27B
100.00%
16.04.2026 Unverified
Qwen3.5-4B
2.94%
01.02.2026 Verified
Qwen3.5-122B-A10B
100.00%
01.02.2026 Verified
GPT-5-mini 2025-08-07
12.75%
01.02.2026 Unverified
Qwen3-235B-A22B
23.53%
01.02.2026 Unverified
Qwen3-VL-235B-A22B
23.53%
01.02.2026 Verified