Models scored
26
evaluated
Modality
text
Category
agents
+2 more
Published
—
Search
| # | Model | Lab | Score |
|---|---|---|---|
| 01 | Gemini 3.5 Flash | 58 | |
| 02 | Muse Spark 1.1 | Meta | 57 |
| 03 | Claude Fable 5 | Anthropic | 56 |
| 04 | Claude Opus 4.8 | Anthropic | 54 |
| 05 | GPT-5.5 | OpenAI | 52 |
| 06 | Claude Opus 4.7 | Anthropic | 52 |
| 07 | Claude Sonnet 4.6 | Anthropic | 51 |
| 08 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 48 |
| 09 | MiniMax M3 | MiniMax | 48 |
| 10 | GPT-5.4 mini | OpenAI | 45 |
| 11 | Kimi K2.6 | Moonshot AI | 45 |
| 12 | GLM-5.1 | Zhipu AI | 45 |
| 13 | Gemini 3.1 Pro | 43 | |
| 14 | Gemini 3 Flash | 43 | |
| 15 | MiMo-V2.5-Pro | Xiaomi | 42 |
| 16 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 41 |
| 17 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 38 |
| 18 | GPT-5.4 nano | OpenAI | 38 |
| 19 | Grok 4.3 | xAI | 38 |
| 20 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 38 |
| 21 | MiMo-V2.5 | Xiaomi | 37 |
| 22 | Mistral Medium 3.5 | Mistral AI | 32 |
| 23 | Claude Haiku 4.5 | Anthropic | 31 |
| 24 | Gemini 3.1 Flash-Lite | 30 | |
| 25 | Grok-4.20 Beta Reasoning | xAI | 28 |
| 26 | MiniMax M2.7 | MiniMax | 28 |
26 of 26 models · score normalized 0–100 where available