Models scored
30
evaluated
Modality
text
Category
agents
+2 more
Published
—
Search
| # | Model | Lab | Score |
|---|---|---|---|
| 01 | Muse Spark 1.1 | Meta | 76 |
| 02 | Kimi K3 | Moonshot AI | 73 |
| 03 | Claude Opus 4.8 | Anthropic | 60 |
| 04 | GPT-5.6 Sol | OpenAI | 58 |
| 05 | Gemini 3.5 Flash | 56 | |
| 06 | GPT-5.5 | OpenAI | 56 |
| 07 | GPT-5.4 | OpenAI | 55 |
| 08 | Claude Sonnet 5 | Anthropic | 54 |
| 09 | GPT-5.6 Luna | OpenAI | 53 |
| 10 | GPT-5.6 Terra | OpenAI | 53 |
| 11 | DeepSeek-V4-Pro-Max | DeepSeek | 52 |
| 12 | Seed 2.1 Pro | ByteDance | 51 |
| 13 | Kimi K2.6 | Moonshot AI | 50 |
| 14 | Gemini 3 Flash | 49 | |
| 15 | Seed 2.1 Turbo | ByteDance | 49 |
| 16 | Hy3 | Tencent | 49 |
| 17 | GLM-5.2 | Zhipu AI | 48 |
| 18 | DeepSeek-V4-Flash-Max | DeepSeek | 48 |
| 19 | GPT-5.2 | OpenAI | 46 |
| 20 | MiniMax M2.7 | MiniMax | 46 |
| 21 | MiniMax M2.1 | MiniMax | 44 |
| 22 | GPT-5.4 mini | OpenAI | 43 |
| 23 | GLM-5.1 | Zhipu AI | 41 |
| 24 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 40 |
| 25 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 38 |
| 26 | GPT-5.4 nano | OpenAI | 36 |
| 27 | DeepSeek-V3.2-Speciale | DeepSeek | 35 |
| 28 | DeepSeek-V3.2 (Thinking) | DeepSeek | 35 |
| 29 | DeepSeek-V3.2 | DeepSeek | 35 |
| 30 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 27 |
30 of 30 models · score normalized 0–100 where available