MMLU-Redux

Are We Done with MMLU?

Models scored

48

evaluated

Modality

text

Category

general

+3 more

Published

2024

arxiv.org

Citations

148

Semantic Scholar

Influential

15

citations

References

65

cited works

Venue

North American Chapter of the Association for Computational Linguistics

published in

Abstract

Aryo Pradipta Gema, Joshua Ong Jun Leang, Giwon Hong, Alessio Devoto, et al. (+12)

Maybe not. We identify and analyse errors in the popular Massive Multitask Language Understanding (MMLU) benchmark. Even though MMLU is widely adopted, our analysis demonstrates numerous ground truth errors that obscure the true capabilities of LLMs. For example, we find that 57% of the analysed questions in the Virology subset contain errors. To address this issue, we introduce a comprehensive framework for identifying dataset errors using a novel error annotation protocol. Then, we create MMLU-Redux, which is a subset of 5,700 manually re-annotated questions across all 57 MMLU subjects. We estimate that 6.49% of MMLU questions contain errors. Using MMLU-Redux, we demonstrate significant discrepancies with the model performance metrics that were originally reported. Our results strongly advocate for revising MMLU's error-ridden questions to enhance its future utility and reliability as a benchmark. https://huggingface.co/datasets/edinburgh-dawg/mmlu-redux-2.0.

generallanguagemathreasoning

Search

#ModelLabScore
01Qwen3.7 MaxAlibaba Cloud / Qwen Team95
02Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team95
03Qwen3.6 PlusAlibaba Cloud / Qwen Team95
04Qwen3.7-PlusAlibaba Cloud / Qwen Team95
05Kimi K2-Thinking-0905Moonshot AI94
06Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team94
07Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team94
08Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team94
09Qwen3.6-27BAlibaba Cloud / Qwen Team94
10DeepSeek-R1-0528DeepSeek93
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team93
12Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team93
13Qwen3.5-27BAlibaba Cloud / Qwen Team93
14Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team93
15MiMo-V2.5-ProXiaomi93
16Kimi K2-Instruct-0905Moonshot AI93
17Kimi K2 InstructMoonshot AI93
18Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team93
19Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team92
20Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team92
21DeepSeek-V3.1DeepSeek92
22Qwen3.5-9BAlibaba Cloud / Qwen Team91
23Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team91
24Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team91
25Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team90
26LongCat-Flash-ThinkingMeituan89
27DeepSeek-V3DeepSeek89
28Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team89
29Qwen3.5-4BAlibaba Cloud / Qwen Team89
30Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team88
31Qwen3 235B A22BAlibaba Cloud / Qwen Team87
32Qwen2.5 72B InstructAlibaba Cloud / Qwen Team87
33Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team86
34Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team85
35Qwen2.5 32B InstructAlibaba Cloud / Qwen Team84
36Ministral 3 (14B Base 2512)Mistral AI82
37Mistral Large 3Mistral AI82
38Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team82
39Qwen2.5 14B InstructAlibaba Cloud / Qwen Team80
40Qwen3.5-2BAlibaba Cloud / Qwen Team80
41Ministral 3 (8B Base 2512)Mistral AI79
42Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team78
43Qwen2.5 7B InstructAlibaba Cloud / Qwen Team75
44Ministral 3 (3B Base 2512)Mistral AI74
45Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team71
46Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team67
47Qwen3.5-0.8BAlibaba Cloud / Qwen Team60
48ERNIE 4.5Baidu43

48 of 48 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC