SuperGPQA

Scaling LLM Evaluation across 285 Graduate Disciplines

Models scored

34

evaluated

Modality

text

Category

chemistry

+8 more

Published

2025

arxiv.org

Citations

0

Semantic Scholar

Influential

0

citations

References

0

cited works

Venue

published in

Abstract

M-A-P Team, Xinrun Du, Yifan Yao, Kaijing Ma, et al. (+93)

Large language models (LLMs) have demonstrated remarkable proficiency in mainstream academic disciplines such as mathematics, physics, and computer science. However, human knowledge encompasses over 200 specialized disciplines, far exceeding the scope of existing benchmarks. The capabilities of LLMs in many of these specialized fields-particularly in light industry, agriculture, and service-oriented disciplines-remain inadequately evaluated. To address this gap, we present SuperGPQA, a comprehensive benchmark that evaluates graduate-level knowledge and reasoning capabilities across 285 disciplines. Our benchmark employs a novel Human-LLM collaborative filtering mechanism to eliminate trivial or ambiguous questions through iterative refinement based on both LLM responses and expert feedback. Our experimental results reveal significant room for improvement in the performance of current state-of-the-art LLMs across diverse knowledge domains (e.g., the reasoning-focused model DeepSeek-R1 achieved the highest accuracy of 61.82% on SuperGPQA), highlighting the considerable gap between current model capabilities and artificial general intelligence. Additionally, we present comprehensive insights from our management of a large-scale annotation process, involving over 80 expert annotators and an interactive Human-LLM collaborative system, offering valuable methodological guidance for future research initiatives of comparable scope.

chemistryeconomicsfinancegeneralhealthcarelegalmathphysicsreasoning

Search

#ModelLabScore
01Qwen3.7 MaxAlibaba Cloud / Qwen Team74
02Qwen3.6 PlusAlibaba Cloud / Qwen Team72
03Qwen3.7-PlusAlibaba Cloud / Qwen Team71
04Seed 2.1 ProByteDance71
05Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team70
06Seed 2.1 TurboByteDance67
07Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team67
08Qwen3.6-27BAlibaba Cloud / Qwen Team66
09Qwen3.5-27BAlibaba Cloud / Qwen Team66
10Qwen3 MaxAlibaba Cloud / Qwen Team65
11Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team65
12Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team65
13Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team64
14Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team63
15Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team63
16Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team61
17Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team60
18Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team59
19Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team59
20Qwen3.5-9BAlibaba Cloud / Qwen Team58
21Kimi K2-Instruct-0905Moonshot AI57
22Kimi K2 InstructMoonshot AI57
23Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team56
24Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team55
25Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team53
26Qwen3.5-4BAlibaba Cloud / Qwen Team53
27Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team51
28Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team47
29Kimi K2 BaseMoonshot AI45
30Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team45
31Qwen3 235B A22BAlibaba Cloud / Qwen Team44
32Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team40
33Qwen3.5-2BAlibaba Cloud / Qwen Team38
34Qwen3.5-0.8BAlibaba Cloud / Qwen Team21

34 of 34 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC