Models scored
48
evaluated
Modality
text
Category
general
+3 more
Published
2024
arxiv.org
Citations
148
Semantic Scholar
Influential
15
citations
References
65
cited works
Venue
North American Chapter of the Association for Computational Linguistics
published in
Abstract
Aryo Pradipta Gema, Joshua Ong Jun Leang, Giwon Hong, Alessio Devoto, et al. (+12)
Maybe not. We identify and analyse errors in the popular Massive Multitask Language Understanding (MMLU) benchmark. Even though MMLU is widely adopted, our analysis demonstrates numerous ground truth errors that obscure the true capabilities of LLMs. For example, we find that 57% of the analysed questions in the Virology subset contain errors. To address this issue, we introduce a comprehensive framework for identifying dataset errors using a novel error annotation protocol. Then, we create MMLU-Redux, which is a subset of 5,700 manually re-annotated questions across all 57 MMLU subjects. We estimate that 6.49% of MMLU questions contain errors. Using MMLU-Redux, we demonstrate significant discrepancies with the model performance metrics that were originally reported. Our results strongly advocate for revising MMLU's error-ridden questions to enhance its future utility and reliability as a benchmark. https://huggingface.co/datasets/edinburgh-dawg/mmlu-redux-2.0.
Search
| # | Model | Lab | Score |
|---|---|---|---|
| 01 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 95 |
| 02 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 95 |
| 03 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 95 |
| 04 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 95 |
| 05 | Kimi K2-Thinking-0905 | Moonshot AI | 94 |
| 06 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 94 |
| 07 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 94 |
| 08 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 94 |
| 09 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 94 |
| 10 | DeepSeek-R1-0528 | DeepSeek | 93 |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 93 |
| 12 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 93 |
| 13 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 93 |
| 14 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 93 |
| 15 | MiMo-V2.5-Pro | Xiaomi | 93 |
| 16 | Kimi K2-Instruct-0905 | Moonshot AI | 93 |
| 17 | Kimi K2 Instruct | Moonshot AI | 93 |
| 18 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 93 |
| 19 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 92 |
| 20 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 92 |
| 21 | DeepSeek-V3.1 | DeepSeek | 92 |
| 22 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 91 |
| 23 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 91 |
| 24 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 91 |
| 25 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 90 |
| 26 | LongCat-Flash-Thinking | Meituan | 89 |
| 27 | DeepSeek-V3 | DeepSeek | 89 |
| 28 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 89 |
| 29 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 89 |
| 30 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 88 |
| 31 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 87 |
| 32 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 87 |
| 33 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 86 |
| 34 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 85 |
| 35 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 84 |
| 36 | Ministral 3 (14B Base 2512) | Mistral AI | 82 |
| 37 | Mistral Large 3 | Mistral AI | 82 |
| 38 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 82 |
| 39 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 80 |
| 40 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 80 |
| 41 | Ministral 3 (8B Base 2512) | Mistral AI | 79 |
| 42 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 78 |
| 43 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 75 |
| 44 | Ministral 3 (3B Base 2512) | Mistral AI | 74 |
| 45 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 71 |
| 46 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 67 |
| 47 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 60 |
| 48 | ERNIE 4.5 | Baidu | 43 |
48 of 48 models · score normalized 0–100 where available