llmboard.ai
Benchmarks
CompareRankings
llmboard.ai
Benchmarks
CompareRankings
HomeBenchmarksmathMMLU

math benchmark

MMLU

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

Updated Aug 7, 2026

Published models100
Registry coverage100
MetricScore
EvidenceB

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

MMLU leaderboard

Sorted by the source-provided rank. Higher score is better according to the registry.

100 rows
Columns

Show columns

1OPGPT-5OpenAI92.5%100.0%100CAug 7, 2026
2OPo1OpenAI91.8%99.0%100CAug 7, 2026
3OPGPT-4.5OpenAI90.8%98.0%100CAug 7, 2026
4OPo1-previewOpenAI90.8%97.0%100CAug 7, 2026
5ACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team90.6%96.0%100CAug 7, 2026
6SASarvam-105BSarvam AI90.6%95.0%100CAug 7, 2026
7ANClaude 3.5 SonnetAnthropic90.4%93.9%100CAug 7, 2026
8ANClaude 3.5 SonnetAnthropic90.4%92.9%100CAug 7, 2026
9OPGPT-4.1OpenAI90.2%91.9%100CAug 7, 2026
10MAKimi K2 0905Moonshot AI90.2%90.9%100CAug 7, 2026
11OPGPT OSS 120BOpenAI90.0%89.9%100CAug 7, 2026
12MELongCat-Flash-ChatMeituan89.7%88.9%100CAug 7, 2026
13MAKimi K2 InstructMoonshot AI89.5%87.9%100CAug 7, 2026
14MAKimi K2-Instruct-0905Moonshot AI89.5%86.9%100CAug 7, 2026
15XIMiMo-V2.5-ProXiaomi89.4%85.9%100CAug 7, 2026
16ACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team88.8%84.8%100CAug 7, 2026
17OPGPT-4oOpenAI88.7%83.8%100CAug 7, 2026
18ACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team88.7%82.8%100CAug 7, 2026
19DEDeepSeek-V3DeepSeek88.5%81.8%100CAug 7, 2026
20ACQwen3 235B A22BAlibaba Cloud / Qwen Team87.8%80.8%100CAug 7, 2026
21MAKimi K2 BaseMoonshot AI87.8%79.8%100CAug 7, 2026
22ACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team87.6%78.8%100CAug 7, 2026
23OPGPT-4.1 miniOpenAI87.5%77.8%100CAug 7, 2026
24XAGrok-2xAI87.5%76.8%100CAug 7, 2026
25MAKimi-k1.5Moonshot AI87.4%75.8%100CAug 7, 2026
26MELlama 3.1 405B InstructMeta87.3%74.8%100CAug 7, 2026
27OPo3-miniOpenAI86.9%73.7%100CAug 7, 2026
28ANClaude 3 OpusAnthropic86.8%72.7%100CAug 7, 2026
29OPGPT-4 TurboOpenAI86.5%71.7%100CAug 7, 2026
30OPGPT-4OpenAI86.4%70.7%100CAug 7, 2026
31ACQwen3 VL 32B InstructAlibaba Cloud / Qwen Team86.4%69.7%100CAug 7, 2026
32XAGrok-2 minixAI86.2%68.7%100CAug 7, 2026
33MELlama 3.2 90B InstructMeta86.0%67.7%100CAug 7, 2026
34MELlama 3.3 70B InstructMeta86.0%66.7%100CAug 7, 2026
35GOGemini 1.5 ProGoogle85.9%65.7%100CAug 7, 2026
36AMNova ProAmazon85.9%64.7%100CAug 7, 2026
37OPGPT-4oOpenAI85.7%63.6%100CAug 7, 2026
38MELongCat-Flash-LiteMeituan85.5%62.6%100CAug 7, 2026
39MELlama 4 MaverickMeta85.5%61.6%100CAug 7, 2026
40OPGPT OSS 20BOpenAI85.3%60.6%100CAug 7, 2026
41OPo1-miniOpenAI85.2%59.6%100CAug 7, 2026
42ACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team85.2%58.6%100CAug 7, 2026
43SASarvam-30BSarvam AI85.1%57.6%100CAug 7, 2026
44ACQwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team85.0%56.6%100CAug 7, 2026
45MIPhi 4Microsoft84.8%55.6%100CAug 7, 2026
46MAMistral Large 2Mistral AI84.0%54.5%100CAug 7, 2026
47MELlama 3.1 70B InstructMeta83.6%53.5%100CAug 7, 2026
48ACQwen2.5 32B InstructAlibaba Cloud / Qwen Team83.3%52.5%100CAug 7, 2026
49ACQwen2 72B InstructAlibaba Cloud / Qwen Team82.3%51.5%100CAug 7, 2026
50OPGPT-4o miniOpenAI82.0%50.5%100CAug 7, 2026
51ACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team81.5%49.5%100CAug 7, 2026
52XAGrok-1.5xAI81.3%48.5%100CAug 7, 2026
53ALJamba 1.5 LargeAI21 Labs81.2%47.5%100CAug 7, 2026
54MAMistral Small 3.1 24B BaseMistral AI81.0%46.5%100CAug 7, 2026
55MAMistral Small 3 24B BaseMistral AI80.7%45.5%100CAug 7, 2026
56ACQwen3 VL 8B InstructAlibaba Cloud / Qwen Team80.7%44.4%100CAug 7, 2026
57MAMistral Small 3.1 24B InstructMistral AI80.6%43.4%100CAug 7, 2026
58MAMistral Small 3.2 24B InstructMistral AI80.5%42.4%100CAug 7, 2026
59AMNova LiteAmazon80.5%41.4%100CAug 7, 2026
60DEDeepSeek-V2.5DeepSeek80.4%40.4%100CAug 7, 2026
61NVLlama 3.1 Nemotron 70B InstructNVIDIA80.2%39.4%100CAug 7, 2026
62OPGPT-4.1 nanoOpenAI80.1%38.4%100CAug 7, 2026
63ACQwen2.5 14B InstructAlibaba Cloud / Qwen Team79.7%37.4%100CAug 7, 2026
64MELlama 4 ScoutMeta79.6%36.4%100CAug 7, 2026
65MAMinistral 3 (14B Base 2512)Mistral AI79.4%35.4%100CAug 7, 2026
66NRHermes 3 70BNous Research79.1%34.3%100CAug 7, 2026
67ANClaude 3 SonnetAnthropic79.0%33.3%100CAug 7, 2026
68GOGemini 1.5 FlashGoogle78.9%32.3%100CAug 7, 2026
69MIPhi-3.5-MoE-instructMicrosoft78.9%31.3%100CAug 7, 2026
70ACQwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team78.4%30.3%100CAug 7, 2026
71AMNova MicroAmazon77.6%29.3%100CAug 7, 2026
72ACQwen3 VL 4B InstructAlibaba Cloud / Qwen Team77.2%28.3%100CAug 7, 2026
73MAMinistral 3 (8B Base 2512)Mistral AI76.1%27.3%100CAug 7, 2026
74COCommand R+Cohere75.7%26.3%100CAug 7, 2026
75ANClaude 3 HaikuAnthropic75.2%25.3%100CAug 7, 2026
76GOGemma 2 27BGoogle75.2%24.2%100CAug 7, 2026
77ACQwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team75.1%23.2%100CAug 7, 2026
78MELlama 3.2 11B InstructMeta73.0%22.2%100CAug 7, 2026
79GOGemini 1.0 ProGoogle71.8%21.2%100CAug 7, 2026
80GOGemma 2 9BGoogle71.3%20.2%100CAug 7, 2026
81MAMinistral 3 (3B Base 2512)Mistral AI70.7%19.2%100CAug 7, 2026
82ACQwen2 7B InstructAlibaba Cloud / Qwen Team70.5%18.2%100CAug 7, 2026
83OPGPT-3.5 TurboOpenAI69.8%17.2%100BAug 7, 2026
84ALJamba 1.5 MiniAI21 Labs69.7%16.2%100CAug 7, 2026
85MELlama 3.1 8B InstructMeta69.4%15.2%100CAug 7, 2026
86MAPixtral-12BMistral AI69.2%14.1%100CAug 7, 2026
87MIPhi-3.5-mini-instructMicrosoft69.0%13.1%100CAug 7, 2026
88MAMistral NeMo InstructMistral AI68.0%12.1%100CAug 7, 2026
89ACQwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team67.6%11.1%100CAug 7, 2026
90MIPhi 4 MiniMicrosoft67.3%10.1%100CAug 7, 2026
91IBGranite 3.3 8B InstructIBM65.5%9.1%100CAug 7, 2026
92MAMinistral 8B InstructMistral AI65.0%8.1%100CAug 7, 2026
93GOGemma 3n E4B InstructedGoogle64.9%7.1%100CAug 7, 2026
94GOGemma 3n E4B Instructed LiteRT PreviewGoogle64.9%6.1%100CAug 7, 2026
95IBGranite 3.3 8B BaseIBM63.9%5.0%100CAug 7, 2026
96MELlama 3.2 3B InstructMeta63.4%4.0%100CAug 7, 2026
97IBIBM Granite 4.0 Tiny PreviewIBM60.4%3.0%100CAug 7, 2026
98GOGemma 3n E2B InstructedGoogle60.1%2.0%100CAug 7, 2026
99GOGemma 3n E2B Instructed LiteRT (Preview)Google60.1%1.0%100CAug 7, 2026
100BAERNIE 4.5Baidu41.9%0.0%100CAug 7, 2026

Score distribution

Top published rows on the benchmark's original scale.

MMLU

MMLU highlights

The top published results on this benchmark's own scale.

Rank #1GPT-592.5%Rank #2o191.8%Rank #3GPT-4.590.8%Rank #4o1-preview90.8%

What is MMLU?

Definition and scoring fields from the benchmark registry.

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

Scores are shown in ratio. The current registry marks this benchmark as not independently verified with evidence level B.

Family
MMLU
Modality
text
Primary category
math
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
mmlu|llm-stats-current

Source-native results are preserved. Eligibility for the overall LLMBoard score is a separate policy decision.

FAQ

Common questions about MMLU.

Which model scores highest on MMLU?

GPT-5 is currently ranked first with 92.5%.

What does MMLU measure?

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and professional domains

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

100 unique published model results are currently shown.

Does this benchmark affect the overall score?

This benchmark is marked as eligible for the current LLMBoard capability methodology.

Rankings

OverallCodingText ArenaPricing

Modalities

Image GenerationVideo GenerationSpeech-to-TextEmbeddings

Benchmarks

All BenchmarksReasoningMathCoding

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai