Terminal-Bench

Terminal-Bench

Models scored

25

evaluated

Modality

text

Category

agents

+2 more

Published

Search

#ModelLabScore
01Claude Sonnet 4.5Anthropic50
02MiniMax M2.1MiniMax48
03Kimi K2-Thinking-0905Moonshot AI47
04MiniMax M2MiniMax46
05Claude Opus 4.1Anthropic43
06Nova 2 ProAmazon41
07Claude Haiku 4.5Anthropic41
08GLM-4.6Zhipu AI41
09LongCat-Flash-ChatMeituan40
10Claude Opus 4Anthropic39
11DeepSeek-V3.2-ExpDeepSeek38
12GLM-4.5Zhipu AI38
13Claude Sonnet 4Anthropic36
14Claude 3.7 SonnetAnthropic35
15LongCat-Flash-LiteMeituan34
16GLM-4.7Zhipu AI33
17Nova 2 LiteAmazon33
18DeepSeek-V3.1DeepSeek31
19MiMo-V2-FlashXiaomi31
20Kimi K2 InstructMoonshot AI30
21GLM-4.5-AirZhipu AI30
22Nemotron 3 Super (120B A12B)NVIDIA26
23Kimi K2-Instruct-0905Moonshot AI25
24Nemotron 3 Nano (30B A3B)NVIDIA9
25DeepSeek-R1-0528DeepSeek6

25 of 25 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC