Hy-SWE Max Verified (Internal)

Tencent internal 300-task agentic coding benchmark; Claude Code scaffold, 200-turn budget, 16 CPU/32 GB sandbox, no web access, avg of 3 runs.

Category

Agentic Coding

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for Hy-SWE Max Verified (Internal)

Model Score Date Verified
Hy3
49.00
28.08.2026 Verified
Hy4 preview
72.04%
28.08.2026 Verified
Qwen3.8-2.4T-A95B
76.78%
28.08.2026 Verified
GLM-5.3
86.26%
28.08.2026 Verified
Kimi K3
78.67%
28.08.2026 Verified
GPT-5.6 Sol
98.58%
28.08.2026 Verified
Claude Opus 5
100.00%
28.08.2026 Verified
DeepSeek V4 Pro
79.15%
28.08.2026 Verified