Toolathlon

Toolathlon

Models scored

30

evaluated

Modality

text

Category

agents

+2 more

Published

Search

#ModelLabScore
01Muse Spark 1.1Meta76
02Kimi K3Moonshot AI73
03Claude Opus 4.8Anthropic60
04GPT-5.6 SolOpenAI58
05Gemini 3.5 FlashGoogle56
06GPT-5.5OpenAI56
07GPT-5.4OpenAI55
08Claude Sonnet 5Anthropic54
09GPT-5.6 LunaOpenAI53
10GPT-5.6 TerraOpenAI53
11DeepSeek-V4-Pro-MaxDeepSeek52
12Seed 2.1 ProByteDance51
13Kimi K2.6Moonshot AI50
14Gemini 3 FlashGoogle49
15Seed 2.1 TurboByteDance49
16Hy3Tencent49
17GLM-5.2Zhipu AI48
18DeepSeek-V4-Flash-MaxDeepSeek48
19GPT-5.2OpenAI46
20MiniMax M2.7MiniMax46
21MiniMax M2.1MiniMax44
22GPT-5.4 miniOpenAI43
23GLM-5.1Zhipu AI41
24Qwen3.6 PlusAlibaba Cloud / Qwen Team40
25Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team38
26GPT-5.4 nanoOpenAI36
27DeepSeek-V3.2-SpecialeDeepSeek35
28DeepSeek-V3.2 (Thinking)DeepSeek35
29DeepSeek-V3.2DeepSeek35
30Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team27

30 of 30 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC