llmboard.ai
Benchmarks
CompareRankings
llmboard.ai
Benchmarks
CompareRankings
HomeBenchmarksstructured outputIFEval

structured output benchmark

IFEval

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

Updated Aug 7, 2026

Published models65
Registry coverage65
MetricScore
EvidenceB

On this page

  • Ranking
  • Distribution
  • Highlights
  • About
  • FAQ

IFEval leaderboard

Sorted by the source-provided rank. Higher score is better according to the registry.

65 rows
Columns

Show columns

1ACQwen3.5-27BAlibaba Cloud / Qwen Team95.0%100.0%65CAug 7, 2026
2ACQwen3.7-PlusAlibaba Cloud / Qwen Team94.6%98.4%65CAug 7, 2026
3ACQwen3.6 PlusAlibaba Cloud / Qwen Team94.3%96.9%65CAug 7, 2026
4ACQwen3.7 MaxAlibaba Cloud / Qwen Team94.3%95.3%65CAug 7, 2026
5OPo3-miniOpenAI93.9%93.8%65CAug 7, 2026
6ACQwen3.5-122B-A10BAlibaba Cloud / Qwen Team93.4%92.2%65CAug 7, 2026
7ANClaude 3.7 SonnetAnthropic93.2%90.6%65CAug 7, 2026
8ACQwen3.5-397B-A17BAlibaba Cloud / Qwen Team92.6%89.1%65CAug 7, 2026
9MELlama 3.3 70B InstructMeta92.1%87.5%65CAug 7, 2026
10AMNova ProAmazon92.1%85.9%65CAug 7, 2026
11ACQwen3.5-35B-A3BAlibaba Cloud / Qwen Team91.9%84.4%65CAug 7, 2026
12ACQwen3.5-9BAlibaba Cloud / Qwen Team91.5%82.8%65CAug 7, 2026
13GOGemma 3 27BGoogle90.4%81.3%65CAug 7, 2026
14NVNemotron Nano 9B v2NVIDIA90.3%79.7%65CAug 7, 2026
15GOGemma 3 4BGoogle90.2%78.1%65CAug 7, 2026
16MAKimi K2 InstructMoonshot AI89.8%76.6%65CAug 7, 2026
17MAKimi K2-Instruct-0905Moonshot AI89.8%75.0%65CAug 7, 2026
18ACQwen3.5-4BAlibaba Cloud / Qwen Team89.8%73.4%65CAug 7, 2026
19AMNova LiteAmazon89.7%71.9%65CAug 7, 2026
20MELongCat-Flash-ChatMeituan89.6%70.3%65CAug 7, 2026
21NVLlama 3.1 Nemotron Ultra 253B v1NVIDIA89.5%68.8%65CAug 7, 2026
22GOGemma 3 12BGoogle88.9%67.2%65CAug 7, 2026
23ACQwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team88.9%65.6%65CAug 7, 2026
24ACQwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team88.7%64.1%65CAug 7, 2026
25MELlama 3.1 405B InstructMeta88.6%62.5%65CAug 7, 2026
26OPGPT-4.5OpenAI88.2%60.9%65CAug 7, 2026
27ACQwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team88.2%59.4%65CAug 7, 2026
28ACQwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team87.8%57.8%65CAug 7, 2026
29ACQwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team87.8%56.3%65CAug 7, 2026
30ACQwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team87.8%54.7%65CAug 7, 2026
31ACQwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team87.6%53.1%65CAug 7, 2026
32MELlama 3.1 70B InstructMeta87.5%51.6%65CAug 7, 2026
33OPGPT-4.1OpenAI87.4%50.0%65CAug 7, 2026
34MAKimi-k1.5Moonshot AI87.2%48.4%65CAug 7, 2026
35AMNova MicroAmazon87.2%46.9%65CAug 7, 2026
36DEDeepSeek-V3DeepSeek86.1%45.3%65CAug 7, 2026
37ACQwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team85.8%43.8%65CAug 7, 2026
38MIPhi 4 Reasoning PlusMicrosoft84.9%42.2%65CAug 7, 2026
39SASarvam-105BSarvam AI84.8%40.6%65CAug 7, 2026
40ACQwen3 VL 32B InstructAlibaba Cloud / Qwen Team84.7%39.1%65CAug 7, 2026
41OPGPT-4.1 miniOpenAI84.1%37.5%65CAug 7, 2026
42ACQwen2.5 72B InstructAlibaba Cloud / Qwen Team84.1%35.9%65CAug 7, 2026
43ACQwQ-32BAlibaba Cloud / Qwen Team83.9%34.4%65CAug 7, 2026
44ACQwen3 VL 8B InstructAlibaba Cloud / Qwen Team83.7%32.8%65CAug 7, 2026
45MIPhi 4 ReasoningMicrosoft83.4%31.3%65CAug 7, 2026
46ACQwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team83.2%29.7%65CAug 7, 2026
47MAMistral Small 3 24B InstructMistral AI82.9%28.1%65CAug 7, 2026
48ACQwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team82.6%26.6%65CAug 7, 2026
49ACQwen3 VL 4B InstructAlibaba Cloud / Qwen Team82.3%25.0%65CAug 7, 2026
50ACQwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team81.7%23.4%65CAug 7, 2026
51OPGPT-4oOpenAI81.0%21.9%65CAug 7, 2026
52MELlama 3.1 8B InstructMeta80.4%20.3%65CAug 7, 2026
53GOGemma 3 1BGoogle80.2%18.8%65CAug 7, 2026
54NVLlama 3.1 Nemotron Nano 8B V1NVIDIA79.3%17.2%65CAug 7, 2026
55ACQwen3.5-2BAlibaba Cloud / Qwen Team78.6%15.6%65CAug 7, 2026
56MELlama 3.2 3B InstructMeta77.4%14.1%65CAug 7, 2026
57OPMiniCPM-SALAOpenBMB76.3%12.5%65CAug 7, 2026
58IBGranite 3.3 8B BaseIBM74.8%10.9%65CAug 7, 2026
59IBGranite 3.3 8B InstructIBM74.8%9.4%65CAug 7, 2026
60OPGPT-4.1 nanoOpenAI74.5%7.8%65CAug 7, 2026
61ACQwen2.5 7B InstructAlibaba Cloud / Qwen Team71.2%6.3%65CAug 7, 2026
62IBIBM Granite 4.0 Tiny PreviewIBM63.0%4.7%65CAug 7, 2026
63MIPhi 4Microsoft63.0%3.1%65CAug 7, 2026
64MAPixtral-12BMistral AI61.3%1.6%65CAug 7, 2026
65ACQwen3.5-0.8BAlibaba Cloud / Qwen Team44.0%0.0%65CAug 7, 2026

Score distribution

Top published rows on the benchmark's original scale.

IFEval

IFEval highlights

The top published results on this benchmark's own scale.

Rank #1Qwen3.5-27B95.0%Rank #2Qwen3.7-Plus94.6%Rank #3Qwen3.6 Plus94.3%Rank #4Qwen3.7 Max94.3%

What is IFEval?

Definition and scoring fields from the benchmark registry.

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

Scores are shown in ratio. The current registry marks this benchmark as not independently verified with evidence level B.

Family
IFEval
Modality
text
Primary category
structured output
Score direction
higher
LLMBoard eligible
Yes
Evaluation key
ifeval|llm-stats-current

Source-native results are preserved. Eligibility for the overall LLMBoard score is a separate policy decision.

FAQ

Common questions about IFEval.

Which model scores highest on IFEval?

Qwen3.5-27B is currently ranked first with 95.0%.

What does IFEval measure?

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

Is a higher score better?

Yes. Higher values rank better for this benchmark.

How many models are compared?

65 unique published model results are currently shown.

Does this benchmark affect the overall score?

This benchmark is marked as eligible for the current LLMBoard capability methodology.

Rankings

OverallCodingText ArenaPricing

Modalities

Image GenerationVideo GenerationSpeech-to-TextEmbeddings

Benchmarks

All BenchmarksReasoningMathCoding

Vendors

All VendorsOpenAIAnthropicGoogle
llmboard.aiCopyright 2026 llmboard.ai