IFBench
precise instruction following with novel constraints
Updated 9 h ago · first seen 11 Sept 2026
bench_01M293SPGX8Q1PSHHMPKC9R37H
- Metric
- accuracy · %
- Direction
- Higher is better
- Results
- 450
- Leader
- grok-4-3-medium 83.33%
Score history · tri-21b-think-v0-5 1 row
Not enough history to chart — a single observation (54.63% on 11 Sept 2026). Rows under different configurations count separately; the list below shows each one.
- 54.63%aa_slug=tri-21b-think-v0-5 · evaluator=Artificial Analysis · index_version=4.311 Sept 2026
Leaderboard 450 current results
Select models with +, then open Compare.
| # | Model | Score | Config | Evaluated | Source | Actions |
|---|---|---|---|---|---|---|
| #301gemma-4-E2BGoogle | 38.03% | aa_slug=gemma-4-e2b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #302qwen3-5-omni-flashAlibaba Group | 37.96% | aa_slug=qwen3-5-omni-flash · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #303hyperclova-x-seed-think-32bNaver | 37.89% | aa_slug=hyperclova-x-seed-think-32b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #304DeepSeek V3.1DeepSeek | 37.82% | aa_slug=deepseek-v3-1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #305qwen3-5-9b-non-reasoningAlibaba Group | 37.82% | aa_slug=qwen3-5-9b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #306grok-4-fastSpaceXAI | 37.69% | aa_slug=grok-4-fast · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #307GLM 4.5 AirZ.ai (Zhipu AI) | 37.55% | aa_slug=glm-4-5-air · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #308Nemotron 3 Nano 30B A3BNVIDIA | 37.48% | aa_slug=nvidia-nemotron-3-nano-30b-a3b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #309llama-3-instruct-70bMeta AI | 37.07% | aa_slug=llama-3-instruct-70b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #310solar-pro-2-reasoningUpstage | 37.07% | aa_slug=solar-pro-2-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #311llama-nemotron-super-49b-v1-5-reasoningNVIDIA | 37.01% | aa_slug=llama-nemotron-super-49b-v1-5-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #312qwen2-5-72b-instructAlibaba Group | 36.87% | aa_slug=qwen2-5-72b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #313GLM 4.6Z.ai (Zhipu AI) | 36.73% | aa_slug=glm-4-6 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #314Gemma 3 12BGoogle | 36.73% | aa_slug=gemma-3-12b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #315jt-miniChina Mobile | 36.67% | aa_slug=jt-mini · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #316qwen3-235b-a22b-instructAlibaba Group | 36.6% | aa_slug=qwen3-235b-a22b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #317qwen3-vl-4b-reasoningAlibaba Group | 36.6% | aa_slug=qwen3-vl-4b-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #318Command ACohere | 36.46% | aa_slug=command-a · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #319grok-4-1-fastSpaceXAI | 36.46% | aa_slug=grok-4-1-fast · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #320Qwen3 32BQwen | 36.33% | aa_slug=qwen3-32b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #321exaone-4-0-32b-reasoningLG AI Research | 36.33% | aa_slug=exaone-4-0-32b-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #322Mistral Large 3Mistral AI | 36.19% | aa_slug=mistral-large-3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #323qwen3-6-35b-a3b-non-reasoningAlibaba Group | 36.19% | aa_slug=qwen3-6-35b-a3b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #324nova-premierAmazon Web Services | 36.19% | aa_slug=nova-premier · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #325Claude 3 HaikuAnthropic | 36.12% | aa_slug=claude-3-haiku · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #326GPT-4o (2024-08-06)OpenAI | 35.99% | aa_slug=gpt-4o-2024-08-06 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #327nanbeige4-1-3bNanbeige | 35.44% | aa_slug=nanbeige4-1-3b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #328Qwen3 Coder NextQwen | 35.24% | aa_slug=qwen3-coder-next · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #329jamba-1-7-largeAI21 Labs | 35.17% | aa_slug=jamba-1-7-large · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #330minicpm5-1b-non-reasoningOpenBMB | 35.17% | aa_slug=minicpm5-1b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #331deepseek-v3DeepSeek | 34.76% | aa_slug=deepseek-v3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #332ling-1tinclusionAI | 34.76% | aa_slug=ling-1t · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #333hermes-4-llama-3-1-405bNous Research | 34.76% | aa_slug=hermes-4-llama-3-1-405b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #334devstral-smallMistral AI | 34.56% | aa_slug=devstral-small · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #335Pixtral LargeMistral AI | 34.49% | aa_slug=pixtral-large-2411 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #336Llama-3.1-70BMeta AI | 34.42% | aa_slug=llama-3-1-instruct-70b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #337ling-flash-2-0inclusionAI | 34.35% | aa_slug=ling-flash-2-0 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #338sarvam-105bSarvam | 34.35% | aa_slug=sarvam-105b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #339gpt-4oOpenAI | 34.29% | aa_slug=gpt-4o · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #340GLM 4.5VZ.ai (Zhipu AI) | 34.22% | aa_slug=glm-4-5v-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #341nova-liteAmazon Web Services | 34.15% | aa_slug=nova-lite · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #342intellect-3Prime Intellect | 34.01% | aa_slug=intellect-3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #343solar-pro-2Upstage | 33.74% | aa_slug=solar-pro-2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #344granite-4.1-3bIBM | 33.67% | aa_slug=granite-4-1-3b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #345gemma-4-e2b-non-reasoningGoogle | 33.61% | aa_slug=gemma-4-e2b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #346qwen3-4b-2507-instructAlibaba Group | 33.54% | aa_slug=qwen3-4b-2507-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #347Qwen3 8BQwen | 33.47% | aa_slug=qwen3-8b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #348exaone-4-0-32bLG AI Research | 33.47% | aa_slug=exaone-4-0-32b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #349Mistral Small 3.2Mistral AI | 33.47% | aa_slug=mistral-small-3-2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #350qwen3-5-4b-non-reasoningAlibaba Group | 33.27% | aa_slug=qwen3-5-4b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #351gpt-4OpenAI | 33.2% | aa_slug=gpt-4 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #352LFM2.5-VL-1.6BLiquid AI | 33.13% | aa_slug=lfm2-5-vl-1-6b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #353Qwen3 VL 30B A3B InstructQwen | 33.13% | aa_slug=qwen3-vl-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #354qwen3-30b-a3b-2507Alibaba Group | 33.06% | aa_slug=qwen3-30b-a3b-2507 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #355llama-nemotron-super-49b-v1-5NVIDIA | 32.93% | aa_slug=llama-nemotron-super-49b-v1-5 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #356mistral-small-4-non-reasoningMistral AI | 32.79% | aa_slug=mistral-small-4-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #357Olmo-3-7B-InstructAllen Institute for AI | 32.79% | aa_slug=olmo-3-7b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #358gpt-5-4-nano-non-reasoningOpenAI | 32.72% | aa_slug=gpt-5-4-nano-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #359Hermes 4 405BNous Research | 32.72% | aa_slug=hermes-4-llama-3-1-405b-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #360Qwen3 Coder 30B A3B InstructQwen | 32.65% | aa_slug=qwen3-coder-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #361Qwen3-4BQwen | 32.52% | aa_slug=qwen3-4b-instruct-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #362gpt-5-nano-minimalOpenAI | 32.52% | aa_slug=gpt-5-nano-minimal · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #363Qwen3 VL 8B InstructQwen | 32.31% | aa_slug=qwen3-vl-8b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #364gpt-4.1-nanoOpenAI | 32.04% | aa_slug=gpt-4-1-nano · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #365Ministral 3 14BMistral AI | 32.04% | aa_slug=ministral-3-14b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #366nvidia-nemotron-nano-12b-v2-vl-reasoningNVIDIA | 31.9% | aa_slug=nvidia-nemotron-nano-12b-v2-vl-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #367qwen3-30b-a3b-instructAlibaba Group | 31.9% | aa_slug=qwen3-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #368Qwen3-VL-4B-InstructQwen | 31.84% | aa_slug=qwen3-vl-4b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #369sarvam-m-reasoningSarvam | 31.84% | aa_slug=sarvam-m-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #370Gemma 3 27BGoogle | 31.84% | aa_slug=gemma-3-27b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #371Mistral Large 2.0Mistral AI | 31.63% | aa_slug=mistral-large-2407 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #372Devstral Small 1.0Mistral AI | 31.63% | aa_slug=devstral-small-2505 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #373granite-4-0-h-smallIBM | 31.5% | aa_slug=granite-4-0-h-small · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #374Qwen3.5-2BQwen | 31.5% | aa_slug=qwen3-5-2b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #375gemini-2-5-flash-liteGoogle | 31.5% | aa_slug=gemini-2-5-flash-lite · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #376qwen3-32b-instructAlibaba Group | 31.5% | aa_slug=qwen3-32b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #377jamba-1-7-miniAI21 Labs | 31.36% | aa_slug=jamba-1-7-mini · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #378Hermes-4-70BNous Research | 31.29% | aa_slug=hermes-4-llama-3-1-70b-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #379mistral-large-2Mistral AI | 31.22% | aa_slug=mistral-large-2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #380Devstral Small 2Mistral AI | 31.16% | aa_slug=devstral-small-2 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #381qwen3-omni-30b-a3b-instructAlibaba Group | 31.16% | aa_slug=qwen3-omni-30b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #382gpt-4o-miniOpenAI | 30.95% | aa_slug=gpt-4o-mini · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #383llama-3-1-nemotron-instruct-70bNVIDIA | 30.75% | aa_slug=llama-3-1-nemotron-instruct-70b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #384Reka Flash 3rekaai | 30.41% | aa_slug=reka-flash-3 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #385llama-3-2-instruct-11b-visionMeta AI | 30.41% | aa_slug=llama-3-2-instruct-11b-vision · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #386GLM 4.6VZ.ai (Zhipu AI) | 30.07% | aa_slug=glm-4-6v-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #387Mistral Small 3.1Mistral AI | 29.93% | aa_slug=mistral-small-3-1 · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #388devstral-mediumMistral AI | 29.93% | aa_slug=devstral-medium · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #389nova-microAmazon Web Services | 29.39% | aa_slug=nova-micro · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #390Ministral 3 8BMistral AI | 29.12% | aa_slug=ministral-3-8b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #391qwen3-5-2b-non-reasoningAlibaba Group | 29.12% | aa_slug=qwen3-5-2b-non-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #392hermes-4-llama-3-1-70bNous Research | 28.98% | aa_slug=hermes-4-llama-3-1-70b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #393glm-4-5vZ.ai (Zhipu AI) | 28.64% | aa_slug=glm-4-5v · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #394Llama 3.1 8BMeta AI | 28.57% | aa_slug=llama-3-1-instruct-8b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #395qwen3-8b-instructAlibaba Group | 28.57% | aa_slug=qwen3-8b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #396Gemma 3 4BGoogle | 28.3% | aa_slug=gemma-3-4b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #397Kimi-Linear-48B-A3B-InstructMoonshot AI | 28.1% | aa_slug=kimi-linear-48b-a3b-instruct · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #398gemma-3n-e4bGoogle | 27.89% | aa_slug=gemma-3n-e4b · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #399glm-4-6vZ.ai (Zhipu AI) | 27.89% | aa_slug=glm-4-6v · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History | |
| #400NVIDIA-Nemotron-Nano-9B-v2NVIDIA | 27.62% | aa_slug=nvidia-nemotron-nano-9b-v2-reasoning · evaluator=Artificial Analysis · index_version=4.3 | — (obs. 11 Sept 2026) | artificialanalysis.aiT2 | History |
Scores are reported as published, with their evaluation configuration (harness, prompting, judge). The bar is relative to the best score on this page. Results with different configs are not directly comparable — see methodology.
Definition
- Category
- instruction-following
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Task
- precise instruction following with novel constraints
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Metric
- accuracy · %
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
- Direction
- Higher is better
- Paper
- https://arxiv.org/abs/2507.02833
Source:AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2observed 9 h agomedium
Each value shows its source, tier and observation time. Missing rows mean no source stated them. How results are recorded →
- Evaluated models
- grok-3-mini-reasoning, gemma-4-12B, grok-4-3-low, GPT-5.1-Codex Mini, Qwen3 Coder Next, KAT-Coder-Pro V2, nova-2-0-lite-reasoning-medium, lfm2-24b-a2b +442(450 total)
As of
Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.
Claim history
Categorycategory1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| instruction-following | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Metricmetric1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| accuracy | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Paperpaper1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| https://arxiv.org/abs/2507.02833 | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Tasktask1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| precise instruction following with novel constraints | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Unitunit1
| Value | Valid from → to | Status | Source | Confidence | Extractor |
|---|---|---|---|---|---|
| % | → current | current | AI Atlas curated registry (YAML, versioned in git, every entry carries its source URL)T2 | medium | curated |
Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →
| Source | Document | Type | Tier | Last observed | Snapshots |
|---|---|---|---|---|---|
| Artificial Analysis | artificialanalysis.ai/leaderboards/models | leaderboard | T2· Quality secondary | 7 h ago | 1 |
Tier 1 = official/primary, 2 = quality secondary, 3 = community, 4 = unverified. Every snapshot is archived; see all sources and the methodology.