Models scored
30
evaluated
Modality
text
Category
agents
+3 more
Published
—
Search
| # | Model | Lab | Score |
|---|---|---|---|
| 01 | Muse Spark 1.1 | Meta | 88 |
| 02 | Kimi K3 | Moonshot AI | 84 |
| 03 | Seed 2.1 Pro | ByteDance | 84 |
| 04 | Gemini 3.5 Flash | 84 | |
| 05 | Claude Opus 4.8 | Anthropic | 82 |
| 06 | Seed 2.1 Turbo | ByteDance | 80 |
| 07 | Hy3 | Tencent | 79 |
| 08 | Claude Opus 4.7 | Anthropic | 77 |
| 09 | GLM-5.2 | Zhipu AI | 77 |
| 10 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 76 |
| 11 | Kimi K2.7 Code | Moonshot AI | 76 |
| 12 | GPT-5.5 | OpenAI | 75 |
| 13 | MiniMax M3 | MiniMax | 74 |
| 14 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 74 |
| 15 | DeepSeek-V4-Pro-Max | DeepSeek | 74 |
| 16 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 73 |
| 17 | GLM-5.1 | Zhipu AI | 72 |
| 18 | Gemini 3.1 Pro | 69 | |
| 19 | DeepSeek-V4-Flash-Max | DeepSeek | 69 |
| 20 | GLM-5 | Zhipu AI | 68 |
| 21 | GPT-5.4 | OpenAI | 67 |
| 22 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 63 |
| 23 | Claude Opus 4.6 | Anthropic | 63 |
| 24 | Claude Opus 4.5 | Anthropic | 62 |
| 25 | Claude Sonnet 4.6 | Anthropic | 61 |
| 26 | GPT-5.2 | OpenAI | 61 |
| 27 | GPT-5.4 mini | OpenAI | 58 |
| 28 | Gemini 3 Flash | 57 | |
| 29 | GPT-5.4 nano | OpenAI | 56 |
| 30 | Nova 2 Lite | Amazon | 25 |
30 of 30 models · score normalized 0–100 where available