Terminal-Bench 2.0

Terminal-Bench 2.0

Models scored

49

evaluated

Modality

text

Category

agents

+3 more

Published

Search

#ModelLabScore
01GPT-5.5OpenAI83
02Claude Mythos PreviewAnthropic82
03Claude Sonnet 5Anthropic80
04GPT-5.3 CodexOpenAI77
05Gemini 3.5 FlashGoogle76
06GPT-5.4OpenAI75
07Claude Opus 4.8Anthropic75
08Qwen3.7-PlusAlibaba Cloud / Qwen Team70
09Qwen3.7 MaxAlibaba Cloud / Qwen Team70
10Claude Opus 4.7Anthropic69
11GLM-5.1Zhipu AI69
12Gemini 3.1 ProGoogle69
13MiMo-V2.5-ProXiaomi68
14DeepSeek-V4-Pro-MaxDeepSeek68
15Kimi K2.6Moonshot AI67
16MiMo-V2.5Xiaomi66
17Claude Opus 4.6Anthropic65
18GPT-5.2 CodexOpenAI64
19Qwen3.6 PlusAlibaba Cloud / Qwen Team62
20GPT-5.4 miniOpenAI60
21Qwen3.6-27BAlibaba Cloud / Qwen Team59
22Claude Opus 4.5Anthropic59
23Claude Sonnet 4.6Anthropic59
24Muse SparkMeta59
25MiMo-V2-ProXiaomi57
26MiniMax M2.7MiniMax57
27DeepSeek-V4-Flash-MaxDeepSeek57
28GLM-5Zhipu AI56
29MAI-Code-1-FlashMicrosoft55
30Gemini 3 ProGoogle54
31GPT-5.1 CodexOpenAI53
32Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team53
33Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team52
34Step-3.5-FlashStepFun51
35Kimi K2.5Moonshot AI51
36Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team49
37Gemini 3 FlashGoogle48
38DeepSeek-V3.2 (Thinking)DeepSeek46
39DeepSeek-V3.2-SpecialeDeepSeek46
40DeepSeek-V3.2DeepSeek46
41GPT-5.4 nanoOpenAI46
42MAI-Thinking-1Microsoft46
43Qwen3.5-27BAlibaba Cloud / Qwen Team42
44GLM-4.7Zhipu AI41
45Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team41
46MiMo-V2-FlashXiaomi39
47Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team38
48North Mini Code 1.0Cohere36
49Nemotron 3 Super (120B A12B)NVIDIA31

49 of 49 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC