Terminal-Bench 2.0

Terminal-Bench 2.0 - agentic coding and terminal use benchmark. Harbor/Terminus-2 harness; 3h timeout, 32 CPU/48 GB RAM; temp=1.0, top_p=0.95, top_k=20, max_tokens=80K, 256K ctx; avg of 5 runs.

Category

Agentic Coding

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for Terminal-Bench 2.0

Model Score Date Verified
Qwen3.6-35B-A3B
53.55%
16.04.2026 Verified
Gemma4-31B-it
30.05%
16.04.2026 Unverified
Qwen3.5-35B-A3B
23.50%
16.04.2026 Unverified
Gemma4-26B-A4B
6.28%
16.04.2026 Unverified
Qwen3.6-27B
74.86%
22.04.2026 Verified
Qwen3.5-397B-A17B
56.28%
22.04.2026 Unverified
Claude 4.5 Opus
74.86%
22.04.2026 Unverified
Qwen3.5-27B
26.50%
16.04.2026 Unverified
Qwen3.5-122B-A10B
47.81%
01.02.2026 Verified
GPT-5-mini 2025-08-07
31.90
01.02.2026 Unverified
Qwen3-Coder-Next
11.75%
03.02.2026 Verified
DeepSeek-V3.2
20.22%
03.02.2026 Verified
GLM-4.7
14.21%
03.02.2026 Verified
MiniMax M2.1
1.91%
03.02.2026 Verified
Kimi K2.6
95.08%
23.08.2026 Verified
GPT-5.4
91.53%
23.08.2026 Verified
Claude Opus 4.6
91.53%
23.08.2026 Verified
Gemini 3.1 Pro
100.00%
23.08.2026 Verified
Kimi K2.5
51.64%
23.08.2026 Verified
Opus-4.6
91.53%
26.06.2026 Verified
GLM-5.1
86.34%
26.06.2026 Verified
DeepSeek-V4-Pro
98.36%
26.06.2026 Verified
DeepSeek-V4-Flash
68.31%
26.06.2026 Verified