GPT-5-mini 2025-08-07

OpenAI

Parameters

—

Architecture

—

Released

—

License

—

About

No detailed description available for this model.

Benchmark Scores

Benchmark Score Date
MMLU-Pro
knowledge
76.45%
01.02.2026
MMLU-Redux
knowledge
92.02%
01.02.2026
SuperGPQA
knowledge
72.97%
01.02.2026
IFEval
instruction_following
98.17%
01.02.2026
IFBench
instruction_following
87.69%
01.02.2026
Multi-Challenge
instruction_following
76.39%
01.02.2026
AA-LCR
long_context
85.00%
01.02.2026
LongBench v2
long_context
72.17%
01.02.2026
Humanity's Last Exam
stem_reasoning
32.77%
01.02.2026
GPQA Diamond
stem_reasoning
78.26%
01.02.2026
HMMT Feb 25
stem_reasoning
87.56%
01.02.2026
HMMT Nov 25
stem_reasoning
37.56%
01.02.2026
SWE-bench Verified
coding_agent
82.11%
01.02.2026
Terminal-Bench 2.0
coding_agent
31.90
01.02.2026
LiveCodeBench v6
stem_reasoning
82.26%
01.02.2026
CodeForces
stem_reasoning
60.99%
01.02.2026
OJBench
stem_reasoning
55.51%
01.02.2026
FullStackBench en
coding_agent
30.60
01.02.2026
FullStackBench zh
coding_agent
35.20
01.02.2026
BFCL-V4
general_agent
60.24%
01.02.2026
TAU2-Bench
general_agent
66.30%
01.02.2026
VITA-Bench
general_agent
24.61%
01.02.2026
DeepPlanning
general_agent
17.53%
01.02.2026
HLE (with tools)
stem_reasoning
39.19%
01.02.2026
BrowseComp
general_agent
51.08%
01.02.2026
BrowseComp-zh
general_agent
69.37%
01.02.2026
WideSearch
general_agent
23.48%
01.02.2026
Seal-0
general_agent
34.20
01.02.2026
MMMLU
multilingual
82.10%
01.02.2026
MMLU-ProX
multilingual
49.03%
01.02.2026
NOVA-63
multilingual
51.90
01.02.2026
INCLUDE
multilingual
83.72%
01.02.2026
Global PIQA
multilingual
100.00%
01.02.2026
PolyMATH
multilingual
85.50%
01.02.2026
WMT24++ (en→xx)
multilingual
87.82%
01.02.2026
MAXIFE
multilingual
73.00%
01.02.2026
MMMU
vision_language
86.90%
01.02.2026
MMMU-Pro
vision_language
58.93%
01.02.2026
MathVision
vision_language
50.00%
01.02.2026
MathVista (mini)
vision_language
79.10
01.02.2026
DynaMath
vision_language
29.21%
01.02.2026
ZEROBench
vision_language
3.00
01.02.2026
ZEROBench_sub
vision_language
12.75%
01.02.2026
VlmsAreBlind
vision_language
75.80
01.02.2026
BabyVision
vision_language
10.78%
01.02.2026
RealWorldQA
vision_language
77.91%
01.02.2026
MMStar
vision_language
8.49%
01.02.2026
MMBench EN-DEV v1.1
vision_language
86.80
01.02.2026
SimpleVQA
vision_language
56.54%
01.02.2026
HallusionBench
vision_language
32.67%
01.02.2026
OmniDocBench 1.5
document_understanding
84.03%
01.02.2026
CharXiv (RQ)
document_understanding
10.28%
01.02.2026
MMLongBench-Doc
document_understanding
50.30
01.02.2026
CC-OCR
document_understanding
19.42%
01.02.2026
OCRBench
document_understanding
76.60
01.02.2026
ERQA
spatial_intelligence
41.90%
01.02.2026
CountBench
spatial_intelligence
12.82%
01.02.2026
EmbSpatialBench
spatial_intelligence
69.53%
01.02.2026
RefSpatialBench
spatial_intelligence
10.03%
01.02.2026
LingoQA
spatial_intelligence
71.68%
01.02.2026
VideoMME (w sub.)
video_understanding
47.15%
01.02.2026
VideoMME (w/o sub.)
video_understanding
41.86%
01.02.2026
VideoMMMU
video_understanding
60.87%
01.02.2026
MLVU
video_understanding
72.41%
01.02.2026
MMVU
video_understanding
28.49%
01.02.2026
TIR-Bench
vision_language
24.60
01.02.2026
V-Star
vision_language
32.91%
01.02.2026
SLAKE
vision_language
58.74%
01.02.2026
PMC-VQA
vision_language
36.30
01.02.2026
MedXpertQA-MM
vision_language
24.89%
01.02.2026
OCRBench
document_understanding
35.48%
01.02.2026
C-Eval
knowledge
82.20
01.02.2026
AI2D_TEST
document_understanding
83.06%
01.02.2026

Related Models