DeepSWE

DeepSWE - agentic coding benchmark from datacurve/deep-swe dataset evaluating software engineering agent capabilities.

Category

Agentic Coding

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for DeepSWE

Model Score Date Verified
DeepSeek-V4-Flash-0731
74.83%
31.07.2026 Verified
DeepSeek-V4-Flash
10.04%
13.08.2026 Verified
GLM-5.2
63.55%
31.07.2026 Verified
Opus-4.8
79.78%
31.07.2026 Verified
DeepSeek-V4-Pro
17.61%
13.08.2026 Verified
Ornith-1.5-35B-A3B
30.26%
19.08.2026 Verified
Ornith-1.0-35B-A3B
0.00
19.08.2026 Unverified
Qwen3.6-35B-A3B
0.00
19.08.2026 Unverified
Qwen3.5-397B-A17B
1.38%
19.08.2026 Unverified
DeepSeek-V4-Pro-0813
86.24%
13.08.2026 Verified
Kimi K3
92.85%
13.08.2026 Verified
Fable-5
96.29%
13.08.2026 Verified
Hy3
38.51%
28.08.2026 Verified
Hy4 preview
88.45%
28.08.2026 Verified
Qwen3.8-2.4T-A95B
77.85%
28.08.2026 Verified
GLM-5.3
92.02%
28.08.2026 Verified
GPT-5.6 Sol
100.00%
28.08.2026 Verified
Claude Opus 5
94.64%
28.08.2026 Verified
DeepSeek-V4-Flash-Vision-Exp
81.57%
08.09.2026 Verified
DeepSeek V4 Pro
86.24%
28.08.2026 Verified