DeepSearch QA

DeepSearch QA - full-task agentic benchmark measuring ability to work within scaffolds, write and debug code, and resolve multi-turn requests from start to finish.

Category

General Agents

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for DeepSearch QA

Model Score Date Verified
Gemma4-31B-it
61.70
01.08.2026 Unverified
Qwen3.6-27B
28.23%
01.08.2026 Unverified
Kimi K3
100.00%
18.08.2026 Verified
GPT-5.4
50.75%
23.08.2026 Verified
Claude Opus 4.6
88.89%
23.08.2026 Verified
Gemini 3.1 Pro
60.66%
23.08.2026 Verified
Kimi K2.5
81.98%
23.08.2026 Verified
Muse-Glimmer-30B
38.74%
01.08.2026 Verified
Kimi K2.6
92.49%
23.08.2026 Verified