Hy-SWE Max Verified (Internal)
Tencent internal 300-task agentic coding benchmark; Claude Code scaffold, 200-turn budget, 16 CPU/32 GB sandbox, no web access, avg of 3 runs.
Category
Agentic Coding
Max Score
100.0
Score Type
percent
Active
Yes
Model Scores
Scores for Hy-SWE Max Verified (Internal)
| Model | Score | Date | Verified |
|---|---|---|---|
| Hy3 |
49.00
|
28.08.2026 | Verified |
| Hy4 preview |
72.04%
|
28.08.2026 | Verified |
| Qwen3.8-2.4T-A95B |
76.78%
|
28.08.2026 | Verified |
| GLM-5.3 |
86.26%
|
28.08.2026 | Verified |
| Kimi K3 |
78.67%
|
28.08.2026 | Verified |
| GPT-5.6 Sol |
98.58%
|
28.08.2026 | Verified |
| Claude Opus 5 |
100.00%
|
28.08.2026 | Verified |
| DeepSeek V4 Pro |
79.15%
|
28.08.2026 | Verified |