Models scored
65
evaluated
Modality
text
Category
general
+2 more
Published
2023
arxiv.org
Citations
917
Semantic Scholar
Influential
151
citations
References
0
cited works
Venue
arXiv.org
published in
Abstract
Jeffrey Zhou, Tianjian Lu, Swaroop Mishra, Siddhartha Brahma, et al. (+4)
One core capability of Large Language Models (LLMs) is to follow natural language instructions. However, the evaluation of such abilities is not standardized: Human evaluations are expensive, slow, and not objectively reproducible, while LLM-based auto-evaluation is potentially biased or limited by the ability of the evaluator LLM. To overcome these issues, we introduce Instruction-Following Eval (IFEval) for large language models. IFEval is a straightforward and easy-to-reproduce evaluation benchmark. It focuses on a set of"verifiable instructions"such as"write in more than 400 words"and"mention the keyword of AI at least 3 times". We identified 25 types of those verifiable instructions and constructed around 500 prompts, with each prompt containing one or more verifiable instructions. We show evaluation results of two widely available LLMs on the market. Our code and data can be found at https://github.com/google-research/google-research/tree/master/instruction_following_eval
Search
| # | Model | Lab | Score |
|---|---|---|---|
| 01 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 95 |
| 02 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 95 |
| 03 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 94 |
| 04 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 94 |
| 05 | o3-mini | OpenAI | 94 |
| 06 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 93 |
| 07 | Claude 3.7 Sonnet | Anthropic | 93 |
| 08 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 93 |
| 09 | Llama 3.3 70B Instruct | Meta | 92 |
| 10 | Nova Pro | Amazon | 92 |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 92 |
| 12 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 92 |
| 13 | Gemma 3 27B | 90 | |
| 14 | Nemotron Nano 9B v2 | NVIDIA | 90 |
| 15 | Gemma 3 4B | 90 | |
| 16 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 90 |
| 17 | Kimi K2-Instruct-0905 | Moonshot AI | 90 |
| 18 | Kimi K2 Instruct | Moonshot AI | 90 |
| 19 | Nova Lite | Amazon | 90 |
| 20 | LongCat-Flash-Chat | Meituan | 90 |
| 21 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 89 |
| 22 | Gemma 3 12B | 89 | |
| 23 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 89 |
| 24 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 89 |
| 25 | Llama 3.1 405B Instruct | Meta | 89 |
| 26 | GPT-4.5 | OpenAI | 88 |
| 27 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 88 |
| 28 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 88 |
| 29 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 88 |
| 30 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 88 |
| 31 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 88 |
| 32 | Llama 3.1 70B Instruct | Meta | 88 |
| 33 | GPT-4.1 | OpenAI | 87 |
| 34 | Nova Micro | Amazon | 87 |
| 35 | Kimi-k1.5 | Moonshot AI | 87 |
| 36 | DeepSeek-V3 | DeepSeek | 86 |
| 37 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 86 |
| 38 | Phi 4 Reasoning Plus | Microsoft | 85 |
| 39 | Sarvam-105B | Sarvam AI | 85 |
| 40 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 85 |
| 41 | GPT-4.1 mini | OpenAI | 84 |
| 42 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 84 |
| 43 | QwQ-32B | Alibaba Cloud / Qwen Team | 84 |
| 44 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 84 |
| 45 | Phi 4 Reasoning | Microsoft | 83 |
| 46 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 83 |
| 47 | Mistral Small 3 24B Instruct | Mistral AI | 83 |
| 48 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 83 |
| 49 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 82 |
| 50 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 82 |
| 51 | GPT-4o | OpenAI | 81 |
| 52 | Llama 3.1 8B Instruct | Meta | 80 |
| 53 | Gemma 3 1B | 80 | |
| 54 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 79 |
| 55 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 79 |
| 56 | Llama 3.2 3B Instruct | Meta | 77 |
| 57 | MiniCPM-SALA | OpenBMB | 76 |
| 58 | Granite 3.3 8B Instruct | IBM | 75 |
| 59 | Granite 3.3 8B Base | IBM | 75 |
| 60 | GPT-4.1 nano | OpenAI | 75 |
60 of 65 models · score normalized 0–100 where available