AgentWorldBench Terminal

AgentWorldBench Terminal domain - open-ended rubric evaluation for language world models simulating terminal environments. Normalized to 0-100.

Category

General Agents

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for AgentWorldBench Terminal

Model Score Date Verified
Qwen-AgentWorld-35B-A3B
70.27%
24.06.2026 Verified
Qwen-AgentWorld-397B-A17B
91.74%
24.06.2026 Unverified
Qwen3.5-35B-A3B
25.68%
24.06.2026 Unverified
Qwen3.5-397B-A17B
77.90%
24.06.2026 Unverified
Qwen3.6-Plus
51.03%
24.06.2026 Unverified
GPT-5.4
68.74%
24.06.2026 Unverified
Claude Opus 4.8
100.00%
24.06.2026 Unverified
Claude Opus 4.6
90.49%
24.06.2026 Unverified
Gemini 3.1 Pro
61.79%
24.06.2026 Unverified
Claude Sonnet 4.6
87.47%
24.06.2026 Unverified
DeepSeek-V4-Pro
54.90%
24.06.2026 Unverified
GLM-5.1
32.46%
24.06.2026 Unverified
Kimi K2.6
62.19%
24.06.2026 Unverified
MiniMax-M2.7
41.62
24.06.2026 Unverified