Terminal Bench 2.1

Terminal Bench 2.1 - agentic coding and terminal use benchmark. Evaluated with Claude Code (avg@10), 5-hour timeout, max_tokens=131,072.

Category

Agentic Coding

Max Score

—

Score Type

percent

Active

Yes

Model Scores

Scores for Terminal Bench 2.1

Model Score Date Verified
GLM 5.1 Thinking
53.10%
11.06.2026 Unverified
GPT 5.5
86.25%
11.06.2026 Unverified
Kimi K2.6
59.31%
11.06.2026 Unverified
MiniMax-M2.7
56.21%
11.06.2026 Unverified
Qwen3.8-2.4T-A95B
95.57%
18.08.2026 Verified
Fable-5
93.35%
18.08.2026 Unverified
GPT-5.6 Sol
98.00%
18.08.2026 Unverified
Claude Opus 4.8
93.35%
18.08.2026 Unverified
Qwen3.7-Max
82.15%
18.08.2026 Unverified
DeepSeek V4 Pro
65.63%
11.06.2026 Unverified
Claude Opus 4.7
72.84%
11.06.2026 Unverified
MiniMax-M3
72.73%
11.06.2026 Unverified
Gemini 3.1 Pro
77.49%
11.06.2026 Unverified
Kimi K3
97.45%
18.08.2026 Verified
DeepSeek-V4-Flash-0731
91.24%
31.07.2026 Verified
DeepSeek-V4-Flash
68.07%
13.08.2026 Verified
GLM-5.2
89.36%
31.07.2026 Verified
Opus-4.8
93.79%
31.07.2026 Verified
DeepSeek-V4-Pro
79.49%
13.08.2026 Verified
DeepSeek-V4-Pro-0813
97.01%
13.08.2026 Verified
GLM-5.3-Flash
93.02%
27.08.2026 Verified
DeepSeek-V4-Vision-Exp
92.57%
27.08.2026 Verified
GPT-5.3 Terra
96.45%
27.08.2026 Verified
Gemini 3.7 Flash
94.68%
27.08.2026 Verified
GLM-5.3
97.34%
28.08.2026 Verified
DeepSeek-V4-Flash-Vision-Exp
92.57%
08.09.2026 Verified
LFM2.5-2.6B
4.55%
— Verified
Qwen3.5-2B
2.88%
— Verified
Qwen3.5-4B
28.16%
— Verified
granite-4.2-3B
14.97%
— Verified
Nemotron-3-Nano-4B
3.77%
— Verified
Gemma4-E4B
1.66%
— Verified
LFM2.5-8B-A1B
1.66%
— Verified
DeepSeek-V4.1-Flash
100.00%
10.09.2026 Verified
MiniCPM5-2B
9.09%
— Verified
Gemma4-E2B
0.40
— Verified