Skip to content
AI Atlas
BenchmarkActivecategory · instruction-following

IFBench

precise instruction following with novel constraints

quality51

Updated 9 h ago · first seen 11 Sept 2026

bench_01M293SPGX8Q1PSHHMPKC9R37H

Metric
accuracy · %
Direction
Higher is better
Results
450
Leader
grok-4-3-medium 83.33%

Score history · Qwen3 235B A22B Instruct 2507 1 row

Not enough history to chart — a single observation (51.22% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.

  • 51.22%aa_slug=qwen3-235b-a22b-instruct-2507-reasoning · evaluator=Artificial Analysis · index_version=4.311 Sept 2026

Back to the full leaderboard

Leaderboard 450 current results

Select models with +, then open Compare.

Leaderboard
#ModelScoreConfigEvaluatedSourceActions
301#301gemma-4-E2BGoogle38.03%aa_slug=gemma-4-e2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
302#302qwen3-5-omni-flashAlibaba Group37.96%aa_slug=qwen3-5-omni-flash · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
303#303hyperclova-x-seed-think-32bNaver37.89%aa_slug=hyperclova-x-seed-think-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
304#304DeepSeek V3.1DeepSeek37.82%aa_slug=deepseek-v3-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
305#305qwen3-5-9b-non-reasoningAlibaba Group37.82%aa_slug=qwen3-5-9b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
306#306grok-4-fastSpaceXAI37.69%aa_slug=grok-4-fast · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
307#307GLM 4.5 AirZ.ai (Zhipu AI)37.55%aa_slug=glm-4-5-air · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
308#308Nemotron 3 Nano 30B A3BNVIDIA37.48%aa_slug=nvidia-nemotron-3-nano-30b-a3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
309#309llama-3-instruct-70bMeta AI37.07%aa_slug=llama-3-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
310#310solar-pro-2-reasoningUpstage37.07%aa_slug=solar-pro-2-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
311#311llama-nemotron-super-49b-v1-5-reasoningNVIDIA37.01%aa_slug=llama-nemotron-super-49b-v1-5-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
312#312qwen2-5-72b-instructAlibaba Group36.87%aa_slug=qwen2-5-72b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
313#313GLM 4.6Z.ai (Zhipu AI)36.73%aa_slug=glm-4-6 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
314#314Gemma 3 12BGoogle36.73%aa_slug=gemma-3-12b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
315#315jt-miniChina Mobile36.67%aa_slug=jt-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
316#316qwen3-235b-a22b-instructAlibaba Group36.6%aa_slug=qwen3-235b-a22b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
317#317qwen3-vl-4b-reasoningAlibaba Group36.6%aa_slug=qwen3-vl-4b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
318#318Command ACohere36.46%aa_slug=command-a · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
319#319grok-4-1-fastSpaceXAI36.46%aa_slug=grok-4-1-fast · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
320#320Qwen3 32BQwen36.33%aa_slug=qwen3-32b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
321#321exaone-4-0-32b-reasoningLG AI Research36.33%aa_slug=exaone-4-0-32b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
322#322Mistral Large 3Mistral AI36.19%aa_slug=mistral-large-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
323#323qwen3-6-35b-a3b-non-reasoningAlibaba Group36.19%aa_slug=qwen3-6-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
324#324nova-premierAmazon Web Services36.19%aa_slug=nova-premier · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
325#325Claude 3 HaikuAnthropic36.12%aa_slug=claude-3-haiku · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
326#326GPT-4o (2024-08-06)OpenAI35.99%aa_slug=gpt-4o-2024-08-06 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
327#327nanbeige4-1-3bNanbeige35.44%aa_slug=nanbeige4-1-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
328#328Qwen3 Coder NextQwen35.24%aa_slug=qwen3-coder-next · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
329#329jamba-1-7-largeAI21 Labs35.17%aa_slug=jamba-1-7-large · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
330#330minicpm5-1b-non-reasoningOpenBMB35.17%aa_slug=minicpm5-1b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
331#331deepseek-v3DeepSeek34.76%aa_slug=deepseek-v3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
332#332ling-1tinclusionAI34.76%aa_slug=ling-1t · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
333#333hermes-4-llama-3-1-405bNous Research34.76%aa_slug=hermes-4-llama-3-1-405b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
334#334devstral-smallMistral AI34.56%aa_slug=devstral-small · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
335#335Pixtral LargeMistral AI34.49%aa_slug=pixtral-large-2411 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
336#336Llama-3.1-70BMeta AI34.42%aa_slug=llama-3-1-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
337#337ling-flash-2-0inclusionAI34.35%aa_slug=ling-flash-2-0 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
338#338sarvam-105bSarvam34.35%aa_slug=sarvam-105b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
339#339gpt-4oOpenAI34.29%aa_slug=gpt-4o · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
340#340GLM 4.5VZ.ai (Zhipu AI)34.22%aa_slug=glm-4-5v-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
341#341nova-liteAmazon Web Services34.15%aa_slug=nova-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
342#342intellect-3Prime Intellect34.01%aa_slug=intellect-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
343#343solar-pro-2Upstage33.74%aa_slug=solar-pro-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
344#344granite-4.1-3bIBM33.67%aa_slug=granite-4-1-3b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
345#345gemma-4-e2b-non-reasoningGoogle33.61%aa_slug=gemma-4-e2b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
346#346qwen3-4b-2507-instructAlibaba Group33.54%aa_slug=qwen3-4b-2507-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
347#347Qwen3 8BQwen33.47%aa_slug=qwen3-8b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
348#348exaone-4-0-32bLG AI Research33.47%aa_slug=exaone-4-0-32b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
349#349Mistral Small 3.2Mistral AI33.47%aa_slug=mistral-small-3-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
350#350qwen3-5-4b-non-reasoningAlibaba Group33.27%aa_slug=qwen3-5-4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
351#351gpt-4OpenAI33.2%aa_slug=gpt-4 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
352#352LFM2.5-VL-1.6BLiquid AI33.13%aa_slug=lfm2-5-vl-1-6b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
353#353Qwen3 VL 30B A3B InstructQwen33.13%aa_slug=qwen3-vl-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
354#354qwen3-30b-a3b-2507Alibaba Group33.06%aa_slug=qwen3-30b-a3b-2507 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
355#355llama-nemotron-super-49b-v1-5NVIDIA32.93%aa_slug=llama-nemotron-super-49b-v1-5 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
356#356mistral-small-4-non-reasoningMistral AI32.79%aa_slug=mistral-small-4-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
357#357Olmo-3-7B-InstructAllen Institute for AI32.79%aa_slug=olmo-3-7b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
358#358gpt-5-4-nano-non-reasoningOpenAI32.72%aa_slug=gpt-5-4-nano-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
359#359Hermes 4 405BNous Research32.72%aa_slug=hermes-4-llama-3-1-405b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
360#360Qwen3 Coder 30B A3B InstructQwen32.65%aa_slug=qwen3-coder-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
361#361Qwen3-4BQwen32.52%aa_slug=qwen3-4b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
362#362gpt-5-nano-minimalOpenAI32.52%aa_slug=gpt-5-nano-minimal · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
363#363Qwen3 VL 8B InstructQwen32.31%aa_slug=qwen3-vl-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
364#364gpt-4.1-nanoOpenAI32.04%aa_slug=gpt-4-1-nano · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
365#365Ministral 3 14BMistral AI32.04%aa_slug=ministral-3-14b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
366#366nvidia-nemotron-nano-12b-v2-vl-reasoningNVIDIA31.9%aa_slug=nvidia-nemotron-nano-12b-v2-vl-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
367#367qwen3-30b-a3b-instructAlibaba Group31.9%aa_slug=qwen3-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
368#368Qwen3-VL-4B-InstructQwen31.84%aa_slug=qwen3-vl-4b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
369#369sarvam-m-reasoningSarvam31.84%aa_slug=sarvam-m-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
370#370Gemma 3 27BGoogle31.84%aa_slug=gemma-3-27b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
371#371Mistral Large 2.0Mistral AI31.63%aa_slug=mistral-large-2407 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
372#372Devstral Small 1.0Mistral AI31.63%aa_slug=devstral-small-2505 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
373#373granite-4-0-h-smallIBM31.5%aa_slug=granite-4-0-h-small · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
374#374Qwen3.5-2BQwen31.5%aa_slug=qwen3-5-2b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
375#375gemini-2-5-flash-liteGoogle31.5%aa_slug=gemini-2-5-flash-lite · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
376#376qwen3-32b-instructAlibaba Group31.5%aa_slug=qwen3-32b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
377#377jamba-1-7-miniAI21 Labs31.36%aa_slug=jamba-1-7-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
378#378Hermes-4-70BNous Research31.29%aa_slug=hermes-4-llama-3-1-70b-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
379#379mistral-large-2Mistral AI31.22%aa_slug=mistral-large-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
380#380Devstral Small 2Mistral AI31.16%aa_slug=devstral-small-2 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
381#381qwen3-omni-30b-a3b-instructAlibaba Group31.16%aa_slug=qwen3-omni-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
382#382gpt-4o-miniOpenAI30.95%aa_slug=gpt-4o-mini · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
383#383llama-3-1-nemotron-instruct-70bNVIDIA30.75%aa_slug=llama-3-1-nemotron-instruct-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
384#384Reka Flash 3rekaai30.41%aa_slug=reka-flash-3 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
385#385llama-3-2-instruct-11b-visionMeta AI30.41%aa_slug=llama-3-2-instruct-11b-vision · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
386#386GLM 4.6VZ.ai (Zhipu AI)30.07%aa_slug=glm-4-6v-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
387#387Mistral Small 3.1Mistral AI29.93%aa_slug=mistral-small-3-1 · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
388#388devstral-mediumMistral AI29.93%aa_slug=devstral-medium · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
389#389nova-microAmazon Web Services29.39%aa_slug=nova-micro · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
390#390Ministral 3 8BMistral AI29.12%aa_slug=ministral-3-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
391#391qwen3-5-2b-non-reasoningAlibaba Group29.12%aa_slug=qwen3-5-2b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
392#392hermes-4-llama-3-1-70bNous Research28.98%aa_slug=hermes-4-llama-3-1-70b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
393#393glm-4-5vZ.ai (Zhipu AI)28.64%aa_slug=glm-4-5v · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
394#394Llama 3.1 8BMeta AI28.57%aa_slug=llama-3-1-instruct-8b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
395#395qwen3-8b-instructAlibaba Group28.57%aa_slug=qwen3-8b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
396#396Gemma 3 4BGoogle28.3%aa_slug=gemma-3-4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
397#397Kimi-Linear-48B-A3B-InstructMoonshot AI28.1%aa_slug=kimi-linear-48b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
398#398gemma-3n-e4bGoogle27.89%aa_slug=gemma-3n-e4b · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
399#399glm-4-6vZ.ai (Zhipu AI)27.89%aa_slug=glm-4-6v · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History
400#400NVIDIA-Nemotron-Nano-9B-v2NVIDIA27.62%aa_slug=nvidia-nemotron-nano-9b-v2-reasoning · evaluator=Artificial Analysis · index_version=4.3(obs. 11 Sept 2026)artificialanalysis.aiT2 History

Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.