LongBench v2
LongBench v2 - long context understanding benchmark.
Category
Long Context
Max Score
—
Score Type
percent
Active
Yes
Model Scores
Scores for LongBench v2
| Model | Score | Date | Verified |
|---|---|---|---|
| GPT-5.6 Sol |
95.48%
|
18.08.2026 | Unverified |
| Claude Opus 4.8 |
100.00%
|
18.08.2026 | Unverified |
| Qwen3.7-Max |
91.40%
|
18.08.2026 | Unverified |
| Qwen3.8-2.4T-A95B |
93.67%
|
18.08.2026 | Verified |
| Qwen3.5-4B |
56.79%
|
01.02.2026 | Verified |
| Qwen3.5-122B-A10B |
79.86%
|
01.02.2026 | Verified |
| Qwen3.5-35B-A3B |
77.15%
|
01.02.2026 | Unverified |
| Qwen3.5-27B |
80.77%
|
01.02.2026 | Unverified |
| Qwen3-235B-A22B |
67.65%
|
01.02.2026 | Unverified |
| GPT-5-mini 2025-08-07 |
72.17%
|
01.02.2026 | Unverified |
| DeepSeek-V3.2 |
34.62%
|
26.06.2026 | Verified |
| DeepSeek-V4-Flash |
44.80%
|
26.06.2026 | Verified |
| DeepSeek-V4-Pro |
60.18%
|
26.06.2026 | Verified |
| MiniCPM5-2B |
42.53%
|
— | Verified |
| LFM2.5-2.6B |
12.22%
|
— | Verified |
| Qwen3.5-2B |
24.90
|
— | Verified |
| Gemma4-E2B |
18.78%
|
— | Verified |
| granite-4.2-3B |
25.11%
|
— | Verified |
| Nemotron-3-Nano-4B |
16.06%
|
— | Verified |
| Gemma4-E4B |
40.27%
|
— | Verified |
| LFM2.5-8B-A1B |
12.44%
|
— | Verified |