Terminal-Bench 2.0
Terminal-Bench 2.0 - agentic coding and terminal use benchmark. Harbor/Terminus-2 harness; 3h timeout, 32 CPU/48 GB RAM; temp=1.0, top_p=0.95, top_k=20, max_tokens=80K, 256K ctx; avg of 5 runs.
Category
Agentic Coding
Max Score
100.0
Score Type
percent
Active
Yes
Model Scores
Scores for Terminal-Bench 2.0
| Model | Score | Date | Verified |
|---|---|---|---|
| Qwen3.6-35B-A3B |
53.55%
|
16.04.2026 | Verified |
| Gemma4-31B-it |
30.05%
|
16.04.2026 | Unverified |
| Qwen3.5-35B-A3B |
23.50%
|
16.04.2026 | Unverified |
| Gemma4-26B-A4B |
6.28%
|
16.04.2026 | Unverified |
| Qwen3.6-27B |
74.86%
|
22.04.2026 | Verified |
| Qwen3.5-397B-A17B |
56.28%
|
22.04.2026 | Unverified |
| Claude 4.5 Opus |
74.86%
|
22.04.2026 | Unverified |
| Qwen3.5-27B |
26.50%
|
16.04.2026 | Unverified |
| Qwen3.5-122B-A10B |
47.81%
|
01.02.2026 | Verified |
| GPT-5-mini 2025-08-07 |
31.90
|
01.02.2026 | Unverified |
| Qwen3-Coder-Next |
11.75%
|
03.02.2026 | Verified |
| DeepSeek-V3.2 |
20.22%
|
03.02.2026 | Verified |
| GLM-4.7 |
14.21%
|
03.02.2026 | Verified |
| MiniMax M2.1 |
1.91%
|
03.02.2026 | Verified |
| Kimi K2.6 |
95.08%
|
23.08.2026 | Verified |
| GPT-5.4 |
91.53%
|
23.08.2026 | Verified |
| Claude Opus 4.6 |
91.53%
|
23.08.2026 | Verified |
| Gemini 3.1 Pro |
100.00%
|
23.08.2026 | Verified |
| Kimi K2.5 |
51.64%
|
23.08.2026 | Verified |
| Opus-4.6 |
91.53%
|
26.06.2026 | Verified |
| GLM-5.1 |
86.34%
|
26.06.2026 | Verified |
| DeepSeek-V4-Pro |
98.36%
|
26.06.2026 | Verified |
| DeepSeek-V4-Flash |
68.31%
|
26.06.2026 | Verified |