llmboard.ai
Benchmarks
CompareRankings
llmboard.ai
Benchmarks
CompareRankings
HomeBenchmarksmathMMLU-Pro

math benchmark

MMLU-Pro

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

Updated Aug 7, 2026

Published models100
Registry coverage129
MetricScore
EvidenceB

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

MMLU-Pro leaderboard

Sorted by the source-provided rank. Higher score is better according to the registry.

100 rows
Columns

Show columns

1ACQwen3.7 MaxAlibaba Cloud / Qwen Team89.6%100.0%129CAug 7, 2026
2ACQwen3.6 PlusAlibaba Cloud / Qwen Team88.5%99.2%129CAug 7, 2026
3ACQwen3.7-PlusAlibaba Cloud / Qwen Team88.5%98.4%129CAug 7, 2026
4MIMiniMax M2.1MiniMax88.0%97.7%129CAug 7, 2026
5ACQwen3.5-397B-A17BAlibaba Cloud / Qwen Team87.8%96.9%129CAug 7, 2026
6DEDeepSeek-V4-Pro-MaxDeepSeek87.5%96.1%129CAug 7, 2026
7MAKimi K2.5Moonshot AI87.1%95.3%129CAug 7, 2026
8BAERNIE 5.0Baidu87.0%94.5%129CAug 7, 2026
9NVNemotron 3 Ultra (550B A55B)NVIDIA86.8%93.8%129CAug 7, 2026
10ACQwen3.5-122B-A10BAlibaba Cloud / Qwen Team86.7%93.0%129CAug 7, 2026
11DEDeepSeek-V4-Flash-MaxDeepSeek86.2%92.2%129CAug 7, 2026
12ACQwen3.6-27BAlibaba Cloud / Qwen Team86.2%91.4%129CAug 7, 2026
13ACQwen3.5-27BAlibaba Cloud / Qwen Team86.1%90.6%129CAug 7, 2026
14ACQwen3.5-35B-A3BAlibaba Cloud / Qwen Team85.3%89.8%129CAug 7, 2026
15GOGemma 4 31BGoogle85.2%89.1%129CAug 7, 2026
16ACQwen3.6-35B-A3BAlibaba Cloud / Qwen Team85.2%88.3%129CAug 7, 2026
17DEDeepSeek-R1-0528DeepSeek85.0%87.5%129CAug 7, 2026
18DEDeepSeek-V3.2 (Thinking)DeepSeek85.0%86.7%129CAug 7, 2026
19DEDeepSeek-V3.2DeepSeek85.0%85.9%129CAug 7, 2026
20DEDeepSeek-V3.2-ExpDeepSeek85.0%85.2%129CAug 7, 2026
21MIMAI-Thinking-1Microsoft85.0%84.4%129CAug 7, 2026
22XIMiMo-V2-FlashXiaomi84.9%83.6%129CAug 7, 2026
23ZAGLM-4.5Zhipu AI84.6%82.8%129CAug 7, 2026
24MAKimi K2-Thinking-0905Moonshot AI84.6%82.0%129CAug 7, 2026
25ACQwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team84.4%81.3%129CAug 7, 2026
26ZAGLM-4.7Zhipu AI84.3%80.5%129CAug 7, 2026
27LAK-EXAONE-236B-A23BLG AI Research83.8%79.7%129CAug 7, 2026
28ACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team83.8%78.9%129CAug 7, 2026
29NVNemotron 3 Super (120B A12B)NVIDIA83.7%78.1%129CAug 7, 2026
30DEDeepSeek-V3.1DeepSeek83.7%77.3%129CAug 7, 2026
31ACQwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team83.0%76.6%129CAug 7, 2026
32ACQwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team82.7%75.8%129CAug 7, 2026
33MELongCat-Flash-ChatMeituan82.7%75.0%129CAug 7, 2026
34GOGemma 4 26B-A4BGoogle82.6%74.2%129CAug 7, 2026
35MELongCat-Flash-ThinkingMeituan82.6%73.4%129CAug 7, 2026
36MAKimi K2 0905Moonshot AI82.5%72.7%129CAug 7, 2026
37ACQwen3.5-9BAlibaba Cloud / Qwen Team82.5%71.9%129CAug 7, 2026
38ACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team82.1%71.1%129CAug 7, 2026
39MIMiniMax M2MiniMax82.0%70.3%129CAug 7, 2026
40ACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team81.8%69.5%129CAug 7, 2026
41SASarvam-105BSarvam AI81.7%68.8%129CAug 7, 2026
42AMNova 2 ProAmazon81.6%68.0%129CAug 7, 2026
43ZAGLM-4.5-AirZhipu AI81.4%67.2%129CAug 7, 2026
44DEDeepSeek-V3 0324DeepSeek81.2%66.4%129CAug 7, 2026
45MAKimi K2 InstructMoonshot AI81.1%65.6%129CAug 7, 2026
46MAKimi K2-Instruct-0905Moonshot AI81.1%64.8%129CAug 7, 2026
47MIMiniMax M1 80KMiniMax81.1%64.1%129CAug 7, 2026
48AMNova 2 LiteAmazon80.9%63.3%129CAug 7, 2026
49OPGPT OSS 120B HighOpenAI80.7%62.5%129CAug 7, 2026
50AMNova 2 OmniAmazon80.7%61.7%129CAug 7, 2026
51MIMiniMax M1 40KMiniMax80.6%60.9%129CAug 7, 2026
52ACQwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team80.6%60.2%129CAug 7, 2026
53MELlama 4 MaverickMeta80.5%59.4%129CAug 7, 2026
54ACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team80.5%58.6%129CAug 7, 2026
55SASarvam-30BSarvam AI80.0%57.8%129CAug 7, 2026
56ACQwen3.5-4BAlibaba Cloud / Qwen Team79.1%57.0%129CAug 7, 2026
57ACQwen3 VL 32B InstructAlibaba Cloud / Qwen Team78.6%56.3%129CAug 7, 2026
58NVNemotron 3 Nano (30B A3B)NVIDIA78.3%55.5%129CAug 7, 2026
59MELongCat-Flash-LiteMeituan78.3%54.7%129CAug 7, 2026
60MAMistral Small 4Mistral AI78.0%53.9%129CAug 7, 2026
61ACQwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team77.8%53.1%129CAug 7, 2026
62ANClaude 3.5 SonnetAnthropic77.6%52.3%129CAug 7, 2026
63GODiffusionGemma 26B-A4BGoogle77.6%51.6%129CAug 7, 2026
64ACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team77.3%50.8%129CAug 7, 2026
65GOGemma 4 12BGoogle77.2%50.0%129CAug 7, 2026
66GOGemini 2.0 FlashGoogle76.4%49.2%129CAug 7, 2026
67ANClaude 3.5 SonnetAnthropic76.1%48.4%129CAug 7, 2026
68MIPhi 4 Reasoning PlusMicrosoft76.0%47.7%129CAug 7, 2026
69DEDeepSeek-V3DeepSeek75.9%46.9%129CAug 7, 2026
70GOGemini 1.5 ProGoogle75.8%46.1%129CAug 7, 2026
71XAGrok-2xAI75.5%45.3%129CAug 7, 2026
72OPGPT-4oOpenAI74.7%44.5%129CAug 7, 2026
73MELlama 4 ScoutMeta74.3%43.8%129CAug 7, 2026
74MIPhi 4 ReasoningMicrosoft74.3%43.0%129CAug 7, 2026
75ACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team73.6%42.2%129CAug 7, 2026
76MELlama 3.1 405B InstructMeta73.3%41.4%129CAug 7, 2026
77OPGPT-4oOpenAI72.6%40.6%129CAug 7, 2026
78XAGrok-2 minixAI72.0%39.8%129CAug 7, 2026
79GOGemini 2.0 Flash-LiteGoogle71.6%39.1%129CAug 7, 2026
80ACQwen3 VL 8B InstructAlibaba Cloud / Qwen Team71.6%38.3%129CAug 7, 2026
81ACQwen2.5 72B InstructAlibaba Cloud / Qwen Team71.1%37.5%129CAug 7, 2026
82MIPhi 4Microsoft70.4%36.7%129CAug 7, 2026
83GOGemma 4 E4BGoogle69.4%35.9%129CAug 7, 2026
84MAKimi K2 BaseMoonshot AI69.2%35.2%129CAug 7, 2026
85MAMistral Small 3.2 24B InstructMistral AI69.1%34.4%129CAug 7, 2026
86ACQwen2.5 32B InstructAlibaba Cloud / Qwen Team69.0%33.6%129CAug 7, 2026
87MELlama 3.3 70B InstructMeta68.9%32.8%129CAug 7, 2026
88ACQwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team68.8%32.0%129CAug 7, 2026
89ANClaude 3 OpusAnthropic68.5%31.3%129CAug 7, 2026
90XIMiMo-V2.5-ProXiaomi68.5%30.5%129CAug 7, 2026
91ACQwen3 235B A22BAlibaba Cloud / Qwen Team68.2%29.7%129CAug 7, 2026
92GOGemma 3 27BGoogle67.5%28.9%129CAug 7, 2026
93GOGemini 1.5 FlashGoogle67.3%28.1%129CAug 7, 2026
94ACQwen3 VL 4B InstructAlibaba Cloud / Qwen Team67.1%27.3%129CAug 7, 2026
95OPMiniCPM-SALAOpenBMB67.0%26.6%129CAug 7, 2026
96MAMistral Small 3.1 24B InstructMistral AI66.8%25.8%129CAug 7, 2026
97ACQwen3.5-2BAlibaba Cloud / Qwen Team66.5%25.0%129CAug 7, 2026
98MELlama 3.1 70B InstructMeta66.4%24.2%129CAug 7, 2026
99MAMistral Small 3 24B InstructMistral AI66.3%23.4%129CAug 7, 2026
100ANClaude 3.5 HaikuAnthropic65.0%22.7%129CAug 7, 2026

Score distribution

Top published rows on the benchmark's original scale.

MMLU-Pro

MMLU-Pro highlights

The top published results on this benchmark's own scale.

Rank #1Qwen3.7 Max89.6%Rank #2Qwen3.6 Plus88.5%Rank #3Qwen3.7-Plus88.5%Rank #4MiniMax M2.188.0%

What is MMLU-Pro?

Definition and scoring fields from the benchmark registry.

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

Scores are shown in ratio. The current registry marks this benchmark as not independently verified with evidence level B.

Family
MMLU-Pro
Modality
text
Primary category
math
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
mmlu-pro|llm-stats-current

Source-native results are preserved. Eligibility for the overall LLMBoard score is a separate policy decision.

FAQ

Common questions about MMLU-Pro.

Which model scores highest on MMLU-Pro?

Qwen3.7 Max is currently ranked first with 89.6%.

What does MMLU-Pro measure?

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating trivial questions, and focusing on reasoning-intensive tasks. Features over 12,000 curated questions across 14 domains and causes a 16-33% accuracy drop compared to original MMLU.

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

100 unique published model results are currently shown.

Does this benchmark affect the overall score?

This benchmark is marked as eligible for the current LLMBoard capability methodology.

Rankings

OverallCodingText ArenaPricing

Modalities

Image GenerationVideo GenerationSpeech-to-TextEmbeddings

Benchmarks

All BenchmarksReasoningMathCoding

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai