SWE-Bench Pro

SWE-Bench Pro

Models scored

43

evaluated

Modality

text

Category

agents

+2 more

Published

Search

#ModelLabScore
01Claude Fable 5Anthropic80
02Claude Mythos PreviewAnthropic78
03Claude Opus 4.8Anthropic69
04Grok 4.5xAI65
05GPT-5.6 SolOpenAI65
06Claude Opus 4.7Anthropic64
07GPT-5.6 TerraOpenAI63
08Claude Sonnet 5Anthropic63
09GPT-5.6 LunaOpenAI63
10GLM-5.2Zhipu AI62
11Muse Spark 1.1Meta62
12Qwen3.7 MaxAlibaba Cloud / Qwen Team61
13MiniMax M3MiniMax59
14Gemini 3.6 FlashGoogle59
15GPT-5.5OpenAI59
16Kimi K2.6Moonshot AI59
17GLM-5.1Zhipu AI58
18Hy3Tencent58
19GPT-5.4OpenAI58
20Qwen3.7-PlusAlibaba Cloud / Qwen Team58
21Seed 2.1 ProByteDance57
22MiMo-V2.5-ProXiaomi57
23Seed 2.1 TurboByteDance57
24GPT-5.3 CodexOpenAI57
25Qwen3.6 PlusAlibaba Cloud / Qwen Team57
26GPT-5.2 CodexOpenAI56
27MiniMax M2.7MiniMax56
28MiMo-V2.5Xiaomi56
29DeepSeek-V4-Pro-MaxDeepSeek55
30MiniMax M2.5MiniMax55
31Gemini 3.5 FlashGoogle55
32GPT-5.4 miniOpenAI54
33Gemini 3.1 ProGoogle54
34Gemini 3.5 Flash-LiteGoogle54
35Qwen3.6-27BAlibaba Cloud / Qwen Team54
36MAI-Thinking-1Microsoft53
37DeepSeek-V4-Flash-MaxDeepSeek53
38Muse SparkMeta52
39GPT-5.4 nanoOpenAI52
40MAI-Code-1-FlashMicrosoft51
41Kimi K2.5Moonshot AI51
42Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team50
43North Mini Code 1.0Cohere40

43 of 43 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC