GDPval-AA

GDPval-AA

Models scored

42

evaluated

Modality

text

Category

agents

+4 more

Published

Search

#ModelLabScore
01Claude Opus 5Anthropic62
02Claude Fable 5Anthropic61
03GPT-5.6 SolOpenAI58
04Kimi K3Moonshot AI56
05Claude Opus 4.8Anthropic55
06Claude Sonnet 5Anthropic54
07Claude Opus 4.6Anthropic54
08GPT-5.6 TerraOpenAI53
09GPT-5.6 LunaOpenAI53
10Grok 4.5xAI51
11Claude Opus 4.7Anthropic51
12MiniMax M3MiniMax48
13GPT-5.4OpenAI48
14MiMo-V2-ProXiaomi48
15Gemini 3.6 FlashGoogle47
16Claude Sonnet 4.6Anthropic47
17MiMo-V2-OmniXiaomi47
18Gemini 3.5 FlashGoogle46
19DeepSeek-V4-Pro-MaxDeepSeek44
20Qwen3.7 MaxAlibaba Cloud / Qwen Team44
21MiMo-V2.5-ProXiaomi43
22GLM-5.1Zhipu AI43
23DeepSeek-V4-Flash-MaxDeepSeek40
24Kimi K2.6Moonshot AI40
25GPT-5.4 miniOpenAI40
26Nemotron 3 Ultra (550B A55B)NVIDIA39
27MiniMax M2.7MiniMax39
28Muse SparkMeta39
29Qwen3.6 PlusAlibaba Cloud / Qwen Team39
30Qwen3.6-27BAlibaba Cloud / Qwen Team39
31Gemini 3.5 Flash-LiteGoogle38
32GPT-5.5OpenAI38
33GPT-5.4 nanoOpenAI37
34Grok 4.3xAI37
35Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team35
36Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team33
37Gemini 3.1 ProGoogle33
38Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team32
39Qwen3.7-PlusAlibaba Cloud / Qwen Team32
40Mistral Medium 3.5Mistral AI31
41Claude Haiku 4.5Anthropic30
42Gemma 4 31BGoogle26

42 of 42 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC