LongBench v2

LongBench v2 - long context understanding benchmark.

Category

Long Context

Max Score

—

Score Type

percent

Active

Yes

Model Scores

Scores for LongBench v2

Model Score Date Verified
GPT-5.6 Sol
95.48%
18.08.2026 Unverified
Claude Opus 4.8
100.00%
18.08.2026 Unverified
Qwen3.7-Max
91.40%
18.08.2026 Unverified
Qwen3.8-2.4T-A95B
93.67%
18.08.2026 Verified
Qwen3.5-4B
56.79%
01.02.2026 Verified
Qwen3.5-122B-A10B
79.86%
01.02.2026 Verified
Qwen3.5-35B-A3B
77.15%
01.02.2026 Unverified
Qwen3.5-27B
80.77%
01.02.2026 Unverified
Qwen3-235B-A22B
67.65%
01.02.2026 Unverified
GPT-5-mini 2025-08-07
72.17%
01.02.2026 Unverified
DeepSeek-V3.2
34.62%
26.06.2026 Verified
DeepSeek-V4-Flash
44.80%
26.06.2026 Verified
DeepSeek-V4-Pro
60.18%
26.06.2026 Verified
MiniCPM5-2B
42.53%
— Verified
LFM2.5-2.6B
12.22%
— Verified
Qwen3.5-2B
24.90
— Verified
Gemma4-E2B
18.78%
— Verified
granite-4.2-3B
25.11%
— Verified
Nemotron-3-Nano-4B
16.06%
— Verified
Gemma4-E4B
40.27%
— Verified
LFM2.5-8B-A1B
12.44%
— Verified