WildClawBench

WildClawBench - agentic coding evaluation benchmark. Overall score from internlm/WildClawBench.

Category

Agentic Coding

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for WildClawBench

Model Score Date Verified
Muse-Glimmer-30B
63.38%
01.08.2026 Verified
Gemma4-31B-it
48.68%
01.08.2026 Unverified
Qwen3.6-27B
56.91%
01.08.2026 Unverified
Kimi K3
73.53%
18.08.2026 Verified
GLM-5.2
73.09%
17.06.2026 Verified
Ornith-1.0-35B-A3B
96.03%
19.08.2026 Unverified
Qwen3.6-35B-A3B
94.41%
19.08.2026 Unverified
Gemma-4-31B
64.71%
19.08.2026 Unverified
Qwen3.5-397B-A17B
97.35%
19.08.2026 Unverified
Kimi K2.7 Code
62.35%
23.08.2026 Unverified
MiniCPM5-2B
28.53%
— Verified
LFM2.5-2.6B
8.38%
— Verified
Qwen3.5-2B
6.91%
— Verified
Gemma4-E2B
6.47%
— Verified
Qwen3.5-4B
18.38%
— Verified
Nemotron-3-Nano-4B
6.47%
— Verified
Gemma4-E4B
14.41%
— Verified
Ornith-1.5-35B-A3B
100.00%
19.08.2026 Verified
granite-4.2-3B
22.79%
— Verified
LFM2.5-8B-A1B
4.50
— Verified