Terminal-Bench 2.1 (Terminus-2)

Terminal-Bench 2.1 evaluated with Harbor/Terminus-2 framework, parser=json, temp=1.0, top_p=1.0, 128K context, 4h timeout, 32 CPU/48GB RAM, avg of 5 runs.

Category

Agentic Coding

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for Terminal-Bench 2.1 (Terminus-2)

Model Score Date Verified
Ornith-1.0-9B
32.60%
25.06.2026 Verified
Qwen3.5-9B
0.44%
25.06.2026 Unverified
Qwen3.5-35B-A3B
30.09%
25.06.2026 Unverified
Gemma4-12B
21.00
25.06.2026 Unverified
Gemma4-31B-it
31.12%
25.06.2026 Unverified
Ornith-1.0-35B
63.72%
25.06.2026 Verified
Qwen3.6-35B-A3B
46.46%
25.06.2026 Unverified
Qwen3.5-397B-A17B
47.94%
25.06.2026 Unverified
NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16
52.21%
04.06.2026 Verified
MiniMax-M2.7
50.89%
04.06.2026 Unverified
GLM-5.1
56.49%
04.06.2026 Unverified
Kimi K2.6
68.14%
04.06.2026 Unverified
DeepSeek-V4-Pro
41.59%
04.06.2026 Unverified
DeepSeek-V4-Flash
48.97%
04.06.2026 Unverified
Qwen3.8-27B
76.70%
18.08.2026 Verified
Qwen3.6-27B
62.54%
18.08.2026 Unverified
Qwen3.7-Plus
63.42%
18.08.2026 Unverified
Muse Glimmer-30B
45.28%
18.08.2026 Unverified
Opus4.6 Max
84.37%
18.08.2026 Unverified
Muse-Glimmer-30B
45.28%
01.08.2026 Verified
GLM-5.2
88.50%
17.06.2026 Verified
Gemini 3.1 Pro
78.17%
17.06.2026 Unverified
GPT-5.5
92.92%
17.06.2026 Unverified
Claude Opus 4.8
94.40%
17.06.2026 Unverified
Qwen3.7-Max
79.65%
17.06.2026 Unverified
MiniMax-M3
64.90%
17.06.2026 Unverified
Ornith-1.5-35B-A3B
69.03%
19.08.2026 Verified
Ornith-1.0-35B-A3B
63.72%
19.08.2026 Unverified
Gemma-4-31B
31.12%
19.08.2026 Unverified
Hy4 preview
94.99%
28.08.2026 Verified
DeepSeek V4 Pro
98.67%
28.08.2026 Verified
Qwen3.8-2.4T-A95B
96.76%
28.08.2026 Verified
GLM-5.3
99.11%
28.08.2026 Verified
Kimi K3
99.26%
28.08.2026 Verified
GPT-5.6 Sol
100.00%
28.08.2026 Verified
Claude Opus 5
96.90%
28.08.2026 Verified
Hy3
73.45%
28.08.2026 Verified