EstimatedAll figures are estimates, not measurements.192 GB · fp16 / bf16 · 128k tokens552 of 658 models with a known parameter count fit
- Estimated, not measured: weights = parameters × bytes/param × 1.15 runtime overhead.
- bytes/param: 4bit = 0.5, 8bit = 1.0, fp16 = 2.0 (uniform quantization, no per-layer exceptions).
- KV cache approximated at 0.5 GB per 8 192 tokens of context, independent of architecture (GQA/MLA models need less).
- A model 'fits' when the estimate is at most the device memory minus 2 GB reserved for the OS and framework.
- Mixture-of-experts models are estimated on total parameters (all experts must be resident); active parameters are ignored.
- Device memory uses the largest configuration when several are listed (e.g. Apple silicon tiers).
| Model | Params | Quant | Est. memory | Headroom | Fits | Compare |
|---|---|---|---|---|---|---|
| Intel/Qwen3.8-Flash-Next-W4A16-AutoRoundOpen weightsIntelestimated: 75.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 75.4B | fp16 | 181.3 GB | +8.7 GB | ✓ fits | |
| UI-TARS-72B-DPOOpen weightsByteDanceestimated: 73.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 73.4B | fp16 | 176.8 GB | +13.2 GB | ✓ fits | |
| Kimi-Dev-72BOpen weightsMoonshot AIestimated: 72.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 72.7B | fp16 | 175.2 GB | +14.8 GB | ✓ fits | |
| amd/Llama-3.3-70B-Instruct-FP8-KVOpen weightsAMDestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| fireworks-ai/llama-3-firefunction-v2Open weightsFireworks AIestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| NousResearch/Meta-Llama-3-70B-InstructOpen weightsNous Researchestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| NousResearch/Meta-Llama-3.1-70B-InstructOpen weightsNous Researchestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| Hermes-4-70BOpen weightsNous Researchestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| Meta-Llama-3-70BRestrictedMeta AIestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| Llama 3.3 70B InstructRestrictedMeta AIestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| Llama-3.1-70B-InstructRestrictedMeta AIestimated: 70.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 70.5B | fp16 | 170.3 GB | +19.7 GB | ✓ fits | |
| nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4Open weightsNVIDIAestimated: 67.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 67.2B | fp16 | 162.6 GB | +27.4 GB | ✓ fits | |
| nvidia/Qwen3.5-122B-A10B-NVFP4Open weightsNVIDIAestimated: 64.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 64.6B | fp16 | 156.5 GB | +33.5 GB | ✓ fits | |
| amd/gpt-oss-120b-w-mxfp4-a-fp8Open weightsAMDestimated: 59.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 59.5B | fp16 | 144.8 GB | +45.1 GB | ✓ fits | |
| ai21labs/AI21-Jamba-Mini-1.7-FP8RestrictedAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| ai21labs/AI21-Jamba2-Mini-FP8Open weightsAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| AI21-Jamba-Mini-1.6RestrictedAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| Jamba-v0.1Open weightsAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| AI21-Jamba2-MiniOpen weightsAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| AI21-Jamba-Mini-1.7RestrictedAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| AI21-Jamba-Mini-1.5RestrictedAI21 Labsestimated: 51.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 51.6B | fp16 | 126.6 GB | +63.4 GB | ✓ fits | |
| Kimi-Linear-48B-A3B-BaseOpen weightsMoonshot AIestimated: 49.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 49.1B | fp16 | 121.0 GB | +69.0 GB | ✓ fits | |
| Kimi-Linear-48B-A3B-InstructOpen weightsMoonshot AIestimated: 49.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 49.1B | fp16 | 121.0 GB | +69.0 GB | ✓ fits | |
| function-calling-v1Open weightsFireworks AIestimated: 46.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 46.7B | fp16 | 115.4 GB | +74.6 GB | ✓ fits | |
| Nous-Hermes-2-Mixtral-8x7B-DPOOpen weightsNous Researchestimated: 46.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 46.7B | fp16 | 115.4 GB | +74.6 GB | ✓ fits | |
| firefunction-v1Open weightsFireworks AIestimated: 46.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 46.7B | fp16 | 115.4 GB | +74.6 GB | ✓ fits | |
| Mixtral-8x7B-Instruct-v0.1Open weightsMistral AIestimated: 46.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 46.7B | fp16 | 115.4 GB | +74.6 GB | ✓ fits | |
| DFN2B-CLIP-ViT-L-14-39BOpen weightsAppleestimated: 39.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 39B | fp16 | 97.7 GB | +92.3 GB | ✓ fits | |
| Seed-OSS-36B-BaseOpen weightsByteDanceestimated: 36.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 36.1B | fp16 | 91.2 GB | +98.8 GB | ✓ fits | |
| NousResearch/Hermes-4.3-36B-GGUFOpen weightsNous Researchestimated: 36.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 36.1B | fp16 | 91.2 GB | +98.8 GB | ✓ fits | |
| Seed-OSS-36B-InstructOpen weightsByteDanceestimated: 36.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 36.1B | fp16 | 91.2 GB | +98.8 GB | ✓ fits | |
| Qwen/Qwen3.6-35B-A3B-FP8Open weightsQwenestimated: 36.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 36B | fp16 | 90.7 GB | +99.3 GB | ✓ fits | |
| Qwen3.6 35B A3BOpen weightsQwenestimated: 36.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 36B | fp16 | 90.7 GB | +99.3 GB | ✓ fits | |
| bartowski/endless-frontier_BigBang-v1-GGUFOpen weightsbartowskiestimated: 35.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35.5B | fp16 | 89.7 GB | +100.3 GB | ✓ fits | |
| unsloth/Qwen3.6-35B-A3B-MTP-GGUFOpen weightsUnslothestimated: 35.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35.5B | fp16 | 89.7 GB | +100.3 GB | ✓ fits | |
| cerebras/Kimi-Linear-REAP-35B-A3B-InstructOpen weightsCerebras Systemsestimated: 35.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35.1B | fp16 | 88.8 GB | +101.2 GB | ✓ fits | |
| perplexity-ai/pplx-computer-qwen-3-6-35b-a3b-nvfp4-20260709Open weightsPerplexity AIestimated: 35.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35.1B | fp16 | 88.8 GB | +101.3 GB | ✓ fits | |
| bartowski/Qwen_Qwen3.6-35B-A3B-GGUFOpen weightsbartowskiestimated: 35.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35B | fp16 | 88.5 GB | +101.5 GB | ✓ fits | |
| bartowski/Qwen_Qwen3.5-35B-A3B-GGUFOpen weightsbartowskiestimated: 35.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35B | fp16 | 88.5 GB | +101.5 GB | ✓ fits | |
| c4ai-command-r-v01RestrictedCohereestimated: 35.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 35B | fp16 | 88.5 GB | +101.5 GB | ✓ fits | |
| unsloth/Qwen3.6-35B-A3B-GGUFOpen weightsUnslothestimated: 34.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.7B | fp16 | 87.7 GB | +102.3 GB | ✓ fits | |
| bartowski/XYZAILab_XYZ-Aquila-mini-GGUFOpen weightsbartowskiestimated: 34.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.7B | fp16 | 87.7 GB | +102.3 GB | ✓ fits | |
| bartowski/thomsonreuters_Thomson-1.0-Small-GGUFOpen weightsbartowskiestimated: 34.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.7B | fp16 | 87.7 GB | +102.3 GB | ✓ fits | |
| bartowski/Kwaipilot_KAT-Coder-V2.5-Dev-GGUFOpen weightsbartowskiestimated: 34.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.7B | fp16 | 87.7 GB | +102.3 GB | ✓ fits | |
| perplexity-ai/pplx-computer-qwen-3-6-35b-a3b-mlx-20260709Open weightsPerplexity AIestimated: 34.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.7B | fp16 | 87.7 GB | +102.3 GB | ✓ fits | |
| Nous-Hermes-2-Yi-34BOpen weightsNous Researchestimated: 34.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.4B | fp16 | 87.1 GB | +102.9 GB | ✓ fits | |
| GKA-primed-HQwen3-32B-ReasonerOpen weightsAmazon Web Servicesestimated: 34.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 34.1B | fp16 | 86.5 GB | +103.5 GB | ✓ fits | |
| MiniMax-H3Open weightsMiniMaxestimated: 33.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 33.1B | fp16 | 84.2 GB | +105.8 GB | ✓ fits | |
| nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8Open weightsNVIDIAestimated: 33.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 33B | fp16 | 83.9 GB | +106.1 GB | ✓ fits | |
| SynLogic-Mix-3-32BOpen weightsMiniMaxestimated: 32.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.8B | fp16 | 83.4 GB | +106.6 GB | ✓ fits | |
| DeepSeek-R1-Distill-Qwen-32BOpen weightsDeepSeekestimated: 32.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.8B | fp16 | 83.4 GB | +106.6 GB | ✓ fits | |
| SynLogic-32BOpen weightsMiniMaxestimated: 32.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.8B | fp16 | 83.4 GB | +106.6 GB | ✓ fits | |
| Qwen3 32BOpen weightsQwenestimated: 32.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.8B | fp16 | 83.3 GB | +106.7 GB | ✓ fits | |
| c4ai-command-r-08-2024RestrictedCohereestimated: 32.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.3B | fp16 | 82.3 GB | +107.7 GB | ✓ fits | |
| aya-expanse-32bRestrictedCohereestimated: 32.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.3B | fp16 | 82.3 GB | +107.7 GB | ✓ fits | |
| OLMo-2-0325-32B-InstructOpen weightsAllen Institute for AIestimated: 32.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.2B | fp16 | 82.1 GB | +107.9 GB | ✓ fits | |
| FLUX.2-devRestrictedBlack Forest Labsestimated: 32.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 32.2B | fp16 | 82.1 GB | +107.9 GB | ✓ fits | |
| Nemotron 3 Nano 30B A3BOpen weightsNVIDIAestimated: 31.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 31.6B | fp16 | 80.6 GB | +109.4 GB | ✓ fits | |
| Gemma 4 31BOpen weightsGoogleestimated: 31.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 31.3B | fp16 | 79.9 GB | +110.1 GB | ✓ fits | |
| mlx-community/gemma-4-31b-it-4bitOpen weightsMLX Communityestimated: 31.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 31.3B | fp16 | 79.9 GB | +110.1 GB | ✓ fits | |
| GLM 4.7 FlashOpen weightsZ.ai (Zhipu AI)estimated: 31.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 31.2B | fp16 | 79.8 GB | +110.2 GB | ✓ fits | |
| unsloth/gemma-4-31B-it-qat-GGUFOpen weightsUnslothestimated: 30.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.7B | fp16 | 78.6 GB | +111.4 GB | ✓ fits | |
| mlx-community/Qwen3-30B-A3B-Instruct-2507-4bitOpen weightsMLX Communityestimated: 30.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.5B | fp16 | 78.2 GB | +111.8 GB | ✓ fits | |
| unsloth/Qwen3-30B-A3B-Thinking-2507-GGUFOpen weightsUnslothestimated: 30.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.5B | fp16 | 78.2 GB | +111.8 GB | ✓ fits | |
| browsesafeOpen weightsPerplexity AIestimated: 30.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.5B | fp16 | 78.2 GB | +111.8 GB | ✓ fits | |
| unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUFOpen weightsUnslothestimated: 30.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.5B | fp16 | 78.2 GB | +111.8 GB | ✓ fits | |
| North Mini Code (free)Open weightsCohereestimated: 30.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.5B | fp16 | 78.1 GB | +111.9 GB | ✓ fits | |
| Hy-MT2-30B-A3BOpen weightsTencentestimated: 30.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30.1B | fp16 | 77.2 GB | +112.8 GB | ✓ fits | |
| ibm-granite/granite-4.2-30b-GGUFOpen weightsIBMestimated: 30.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30B | fp16 | 77.0 GB | +113.0 GB | ✓ fits | |
| north-mini-code-1-0Cohereestimated: 30.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 30B | fp16 | 77.0 GB | +113.0 GB | ✓ fits | |
| ERNIE-4.5-VL-28B-A3B-ThinkingOpen weightsBaiduestimated: 29.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 29.7B | fp16 | 76.2 GB | +113.8 GB | ✓ fits | |
| ERNIE-4.5-VL-28B-A3B-PTOpen weightsBaiduestimated: 29.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 29.4B | fp16 | 75.6 GB | +114.4 GB | ✓ fits | |
| granite-4.1-30bOpen weightsIBMestimated: 28.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 28.9B | fp16 | 74.4 GB | +115.6 GB | ✓ fits | |
| Qwen/Qwen3.6-27B-FP8Open weightsQwenestimated: 27.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.8B | fp16 | 71.9 GB | +118.1 GB | ✓ fits | |
| Qwen/Qwen3.8-27B-FP8Open weightsQwenestimated: 27.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.8B | fp16 | 71.9 GB | +118.1 GB | ✓ fits | |
| Qwen3.8 27BOpen weightsQwenestimated: 27.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.8B | fp16 | 71.9 GB | +118.1 GB | ✓ fits | |
| Qwen3.6 27BOpen weightsQwenestimated: 27.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.8B | fp16 | 71.9 GB | +118.1 GB | ✓ fits | |
| mlx-community/Qwen3.8-27B-4bitOpen weightsMLX Communityestimated: 27.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.4B | fp16 | 70.9 GB | +119.1 GB | ✓ fits | |
| mlx-community/Qwen3.8-27B-8bitOpen weightsMLX Communityestimated: 27.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.4B | fp16 | 70.9 GB | +119.1 GB | ✓ fits | |
| unsloth/Qwen3.6-27B-MTP-GGUFOpen weightsUnslothestimated: 27.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.3B | fp16 | 70.8 GB | +119.2 GB | ✓ fits | |
| unsloth/Qwen3.8-27B-GGUFOpen weightsUnslothestimated: 27.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.3B | fp16 | 70.8 GB | +119.2 GB | ✓ fits | |
| perplexity-ai/pplx-computer-qwen-3-8-27b-dflash2-gguf-20260826Open weightsPerplexity AIestimated: 27.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27.3B | fp16 | 70.8 GB | +119.2 GB | ✓ fits | |
| bartowski/Qwen3.8-27B-GGUFOpen weightsbartowskiestimated: 27.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27B | fp16 | 70.1 GB | +119.9 GB | ✓ fits | |
| bartowski/Fara1.5-27B-GGUFOpen weightsbartowskiestimated: 27.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 27B | fp16 | 70.1 GB | +119.9 GB | ✓ fits | |
| unsloth/Qwen3.6-27B-GGUFOpen weightsUnslothestimated: 26.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 26.9B | fp16 | 69.9 GB | +120.1 GB | ✓ fits | |
| Gemma 4 26B A4BOpen weightsGoogleestimated: 25.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 25.8B | fp16 | 67.3 GB | +122.7 GB | ✓ fits | |
| unsloth/gemma-4-26B-A4B-it-GGUFOpen weightsUnslothestimated: 25.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 25.2B | fp16 | 66.0 GB | +124.0 GB | ✓ fits | |
| unsloth/gemma-4-26B-A4B-it-qat-GGUFOpen weightsUnslothestimated: 25.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 25.2B | fp16 | 66.0 GB | +124.0 GB | ✓ fits | |
| cerebras/Qwen3-Coder-REAP-25B-A3BOpen weightsCerebras Systemsestimated: 24.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24.9B | fp16 | 65.2 GB | +124.8 GB | ✓ fits | |
| unsloth/Qwen3.6-35B-A3B-NVFP4Open weightsUnslothestimated: 24.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24.6B | fp16 | 64.7 GB | +125.3 GB | ✓ fits | |
| Voxtral Small 24B 2507Open weightsMistral AIestimated: 24.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24.3B | fp16 | 63.8 GB | +126.2 GB | ✓ fits | |
| Devstral-Small-2-24B-Instruct-2512Open weightsMistral AIestimated: 24.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24B | fp16 | 63.2 GB | +126.8 GB | ✓ fits | |
| mlx-community/Devstral-Small-2-24B-Instruct-2512-4bitOpen weightsMLX Communityestimated: 24.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24B | fp16 | 63.2 GB | +126.8 GB | ✓ fits | |
| Mistral Small 3.2 24BOpen weightsMistral AIestimated: 24.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24B | fp16 | 63.2 GB | +126.8 GB | ✓ fits | |
| Mistral Small 3.1 24BOpen weightsMistral AIestimated: 24.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 24B | fp16 | 63.2 GB | +126.8 GB | ✓ fits | |
| cerebras/GLM-4.7-Flash-REAP-23B-A3BOpen weightsCerebras Systemsestimated: 23.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 23B | fp16 | 60.9 GB | +129.1 GB | ✓ fits | |
| ERNIE-4.5-21B-A3B-PTOpen weightsBaiduestimated: 21.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 21.9B | fp16 | 58.5 GB | +131.5 GB | ✓ fits | |
| ERNIE-4.5-21B-A3B-Base-PTOpen weightsBaiduestimated: 21.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 21.8B | fp16 | 58.2 GB | +131.8 GB | ✓ fits | |
| ERNIE-4.5-21B-A3B-ThinkingOpen weightsBaiduestimated: 21.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 21.8B | fp16 | 58.2 GB | +131.8 GB | ✓ fits | |
| gpt-oss-safeguard-20bOpen weightsOpenAIestimated: 21.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 21.5B | fp16 | 57.5 GB | +132.5 GB | ✓ fits | |
| unsloth/Qwen3.6-27B-NVFP4Open weightsUnslothestimated: 21.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 21.2B | fp16 | 56.8 GB | +133.2 GB | ✓ fits | |
| gpt-oss-20bOpen weightsOpenAIestimated: 20.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20.9B | fp16 | 56.1 GB | +133.9 GB | ✓ fits | |
| mlx-community/gpt-oss-20b-MXFP4-Q8Open weightsMLX Communityestimated: 20.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20.9B | fp16 | 56.1 GB | +133.9 GB | ✓ fits | |
| nvidia/Gemma-4-31B-IT-NVFP4Open weightsNVIDIAestimated: 20.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20.9B | fp16 | 56.0 GB | +134.0 GB | ✓ fits | |
| gpt-neox-20bOpen weightsEleutherAIestimated: 20.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20.7B | fp16 | 55.7 GB | +134.3 GB | ✓ fits | |
| unsloth/MiniMax-H3-GGUFOpen weightsUnslothestimated: 20.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20.1B | fp16 | 54.3 GB | +135.7 GB | ✓ fits | |
| internlm2-20bOpen weightsInternLM (Shanghai AI Laboratory)estimated: 20.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20B | fp16 | 54.0 GB | +136.0 GB | ✓ fits | |
| internlm2-base-20bOpen weightsInternLM (Shanghai AI Laboratory)estimated: 20.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20B | fp16 | 54.0 GB | +136.0 GB | ✓ fits | |
| internlm/internlm2_5-20b-chat-ggufOpen weightsInternLM (Shanghai AI Laboratory)estimated: 20.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 20B | fp16 | 54.0 GB | +136.0 GB | ✓ fits | |
| unsloth/Qwen3.8-27B-NVFP4Open weightsUnslothestimated: 19.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 19.9B | fp16 | 53.7 GB | +136.3 GB | ✓ fits | |
| internlm2-chat-20bOpen weightsInternLM (Shanghai AI Laboratory)estimated: 19.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 19.9B | fp16 | 53.7 GB | +136.3 GB | ✓ fits | |
| Intel/Qwen3.5-122B-A10B-int4-AutoRoundOpen weightsIntelestimated: 19.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 19.7B | fp16 | 53.2 GB | +136.8 GB | ✓ fits | |
| pplx-qwen-3-8-27b-dflash2-20260819Open weightsPerplexity AIestimated: 18.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 18.8B | fp16 | 51.2 GB | +138.8 GB | ✓ fits | |
| pplx-computer-qwen-3-8-27b-dflash2-20260824Open weightsPerplexity AIestimated: 18.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 18.8B | fp16 | 51.2 GB | +138.8 GB | ✓ fits | |
| nvidia/Qwen3.6-35B-A3B-NVFP4Open weightsNVIDIAestimated: 18.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 18.7B | fp16 | 51.0 GB | +139.0 GB | ✓ fits | |
| nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4Open weightsNVIDIAestimated: 18.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 18.3B | fp16 | 50.1 GB | +139.8 GB | ✓ fits | |
| nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4Open weightsNVIDIAestimated: 17.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 17.8B | fp16 | 49.0 GB | +141.0 GB | ✓ fits | |
| Kimi-VL-A3B-ThinkingOpen weightsMoonshot AIestimated: 16.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 16.4B | fp16 | 45.7 GB | +144.3 GB | ✓ fits | |
| Kimi-VL-A3B-InstructOpen weightsMoonshot AIestimated: 16.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 16.4B | fp16 | 45.7 GB | +144.3 GB | ✓ fits | |
| Kimi-VL-A3B-Thinking-2506Open weightsMoonshot AIestimated: 16.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 16.4B | fp16 | 45.7 GB | +144.3 GB | ✓ fits | |
| Moonlight-16B-A3B-InstructOpen weightsMoonshot AIestimated: 16.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 16B | fp16 | 44.7 GB | +145.3 GB | ✓ fits | |
| Moonlight-16B-A3BOpen weightsMoonshot AIestimated: 16.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 16B | fp16 | 44.7 GB | +145.3 GB | ✓ fits | |
| DeepSeek-Coder-V2-Lite-InstructOpen weightsDeepSeekestimated: 15.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 15.7B | fp16 | 44.1 GB | +145.9 GB | ✓ fits | |
| DeepSeek-V2-LiteOpen weightsDeepSeekestimated: 15.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 15.7B | fp16 | 44.1 GB | +145.9 GB | ✓ fits | |
| bartowski/DeepSeek-Coder-V2-Lite-Instruct-GGUFOpen weightsbartowskiestimated: 15.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 15.7B | fp16 | 44.1 GB | +145.9 GB | ✓ fits | |
| amd/Qwen3.8-27B-Quark-AWQ-MXFP4Open weightsAMDestimated: 15.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 15.6B | fp16 | 43.9 GB | +146.1 GB | ✓ fits | |
| BAGEL-7B-MoTOpen weightsByteDanceestimated: 14.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 14.7B | fp16 | 41.8 GB | +148.2 GB | ✓ fits | |
| Phi 4Open weightsMicrosoftestimated: 14.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 14.7B | fp16 | 41.7 GB | +148.3 GB | ✓ fits | |
| nvidia/Gemma-4-26B-A4B-NVFP4Open weightsNVIDIAestimated: 14.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 14.4B | fp16 | 41.1 GB | +148.9 GB | ✓ fits | |
| Ministral 3 14B 2512Open weightsMistral AIestimated: 13.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 13.9B | fp16 | 40.1 GB | +149.9 GB | ✓ fits | |
| Ministral-3-14B-Reasoning-2512Open weightsMistral AIestimated: 13.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 13.9B | fp16 | 40.1 GB | +149.9 GB | ✓ fits | |
| FireLLaVA-13bRestrictedFireworks AIestimated: 13.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 13.3B | fp16 | 38.7 GB | +151.3 GB | ✓ fits | |
| gemma-4-12B-it-qat-w4a16-ctOpen weightsGoogleestimated: 13.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 13.3B | fp16 | 38.6 GB | +151.4 GB | ✓ fits | |
| Llama-2-13b-chat-hfRestrictedMeta AIestimated: 13.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 13B | fp16 | 37.9 GB | +152.1 GB | ✓ fits | |
| aya-101Open weightsCohereestimated: 12.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 12.9B | fp16 | 37.7 GB | +152.3 GB | ✓ fits | |
| Mistral NemoOpen weightsMistral AIestimated: 12.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 12.3B | fp16 | 36.2 GB | +153.8 GB | ✓ fits | |
| Mistral-Nemo-Base-2407Open weightsMistral AIestimated: 12.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 12.3B | fp16 | 36.2 GB | +153.8 GB | ✓ fits | |
| mlx-community/gemma-3-12b-it-4bitOpen weightsMLX Communityestimated: 12.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 12B | fp16 | 35.6 GB | +154.4 GB | ✓ fits | |
| bartowski/kai-os_Grug-12B-GGUFOpen weightsbartowskiestimated: 12.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 12B | fp16 | 35.6 GB | +154.4 GB | ✓ fits | |
| gemma-4-12B-itOpen weightsGoogleestimated: 12.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 12B | fp16 | 35.5 GB | +154.5 GB | ✓ fits | |
| unsloth/gemma-4-12B-it-qat-GGUFOpen weightsUnslothestimated: 11.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.9B | fp16 | 35.4 GB | +154.6 GB | ✓ fits | |
| FLUX.1-Fill-devRestrictedBlack Forest Labsestimated: 11.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.9B | fp16 | 35.4 GB | +154.6 GB | ✓ fits | |
| FLUX.1-devRestrictedBlack Forest Labsestimated: 11.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.9B | fp16 | 35.4 GB | +154.6 GB | ✓ fits | |
| FLUX.1-Krea-devRestrictedBlack Forest Labsestimated: 11.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.9B | fp16 | 35.4 GB | +154.6 GB | ✓ fits | |
| FLUX.1-Kontext-devRestrictedBlack Forest Labsestimated: 11.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.9B | fp16 | 35.4 GB | +154.6 GB | ✓ fits | |
| FLUX.1-schnellRestrictedBlack Forest Labsestimated: 11.9B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.9B | fp16 | 35.4 GB | +154.7 GB | ✓ fits | |
| Intel/Qwen3-Coder-Next-int4-AutoRoundOpen weightsIntelestimated: 11.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.8B | fp16 | 35.2 GB | +154.8 GB | ✓ fits | |
| KaLM-Embedding-Gemma3-12B-2511Open weightsTencentestimated: 11.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 11.8B | fp16 | 35.1 GB | +154.9 GB | ✓ fits | |
| Nous-Hermes-2-SOLAR-10.7BOpen weightsNous Researchestimated: 10.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 10.7B | fp16 | 32.7 GB | +157.3 GB | ✓ fits | |
| Llama-3.2-11B-Vision-InstructRestrictedMeta AIestimated: 10.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 10.7B | fp16 | 32.5 GB | +157.5 GB | ✓ fits | |
| GLM-4.1V-9B-ThinkingOpen weightsZ.ai (Zhipu AI)estimated: 10.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 10.3B | fp16 | 31.7 GB | +158.3 GB | ✓ fits | |
| GLM-4.6V-FlashOpen weightsZ.ai (Zhipu AI)estimated: 10.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 10.3B | fp16 | 31.7 GB | +158.3 GB | ✓ fits | |
| Kimi-Audio-7B-InstructOpen weightsMoonshot AIestimated: 9.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.77B | fp16 | 30.5 GB | +159.5 GB | ✓ fits | |
| Kimi-Audio-7BOpen weightsMoonshot AIestimated: 9.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.77B | fp16 | 30.5 GB | +159.5 GB | ✓ fits | |
| Qwen3.5-9BOpen weightsQwenestimated: 9.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.65B | fp16 | 30.2 GB | +159.8 GB | ✓ fits | |
| glm-4-9b-chatOpen weightsZ.ai (Zhipu AI)estimated: 9.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.4B | fp16 | 29.6 GB | +160.4 GB | ✓ fits | |
| academic-ds-9BOpen weightsByteDanceestimated: 9.4B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.37B | fp16 | 29.5 GB | +160.5 GB | ✓ fits | |
| FLUX.2-klein-9BRestrictedBlack Forest Labsestimated: 9.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.08B | fp16 | 28.9 GB | +161.1 GB | ✓ fits | |
| FLUX.2-klein-base-9BRestrictedBlack Forest Labsestimated: 9.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.08B | fp16 | 28.9 GB | +161.1 GB | ✓ fits | |
| FLUX.2-klein-9b-kvRestrictedBlack Forest Labsestimated: 9.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9.08B | fp16 | 28.9 GB | +161.1 GB | ✓ fits | |
| black-forest-labs/FLUX.2-klein-9b-kv-fp8Open weightsBlack Forest Labsestimated: 9.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9B | fp16 | 28.7 GB | +161.3 GB | ✓ fits | |
| black-forest-labs/FLUX.2-klein-9b-fp8RestrictedBlack Forest Labsestimated: 9.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9B | fp16 | 28.7 GB | +161.3 GB | ✓ fits | |
| bartowski/Fara1.5-9B-GGUFOpen weightsbartowskiestimated: 9.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9B | fp16 | 28.7 GB | +161.3 GB | ✓ fits | |
| black-forest-labs/FLUX.2-klein-base-9b-fp8RestrictedBlack Forest Labsestimated: 9.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9B | fp16 | 28.7 GB | +161.3 GB | ✓ fits | |
| bartowski/tencent_UI-Mate-9B-GGUFOpen weightsbartowskiestimated: 9.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 9B | fp16 | 28.7 GB | +161.3 GB | ✓ fits | |
| unsloth/Qwen3.5-9B-GGUFOpen weightsUnslothestimated: 9.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.95B | fp16 | 28.6 GB | +161.4 GB | ✓ fits | |
| Qianfan-VL-8BOpen weightsBaiduestimated: 8.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.81B | fp16 | 28.3 GB | +161.7 GB | ✓ fits | |
| internlm3-8b-instructOpen weightsInternLM (Shanghai AI Laboratory)estimated: 8.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.8B | fp16 | 28.3 GB | +161.8 GB | ✓ fits | |
| granite-4.1-8bOpen weightsIBMestimated: 8.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.79B | fp16 | 28.2 GB | +161.8 GB | ✓ fits | |
| Qwen3 VL 8B InstructOpen weightsQwenestimated: 8.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.77B | fp16 | 28.2 GB | +161.8 GB | ✓ fits | |
| amd/Qwen3-VL-8B-Instruct-w8a8-llmcompressorOpen weightsAMDestimated: 8.8B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.77B | fp16 | 28.2 GB | +161.8 GB | ✓ fits | |
| VibeVoice-ASROpen weightsMicrosoftestimated: 8.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.67B | fp16 | 27.9 GB | +162.1 GB | ✓ fits | |
| Molmo2-8BOpen weightsAllen Institute for AIestimated: 8.7B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.66B | fp16 | 27.9 GB | +162.1 GB | ✓ fits | |
| aya-vision-8bRestrictedCohereestimated: 8.6B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.63B | fp16 | 27.9 GB | +162.2 GB | ✓ fits | |
| Intern-S1-miniOpen weightsInternLM (Shanghai AI Laboratory)estimated: 8.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.54B | fp16 | 27.6 GB | +162.4 GB | ✓ fits | |
| GKA-primed-HQwen3-8B-ReasonerOpen weightsAmazon Web Servicesestimated: 8.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.5B | fp16 | 27.6 GB | +162.4 GB | ✓ fits | |
| GDN-primed-HQwen3-8B-InstructOpen weightsAmazon Web Servicesestimated: 8.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.5B | fp16 | 27.6 GB | +162.4 GB | ✓ fits | |
| LFM2.5-8B-A1BOpen weightsLiquid AIestimated: 8.5B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.47B | fp16 | 27.5 GB | +162.5 GB | ✓ fits | |
| allenai/olmOCR-2-7B-1025-FP8Open weightsAllen Institute for AIestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.29B | fp16 | 27.1 GB | +162.9 GB | ✓ fits | |
| Qwen2.5-VL-7B-InstructOpen weightsQwenestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.29B | fp16 | 27.1 GB | +162.9 GB | ✓ fits | |
| UI-TARS 7BOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.29B | fp16 | 27.1 GB | +162.9 GB | ✓ fits | |
| olmOCR-2-7B-1025Open weightsAllen Institute for AIestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.29B | fp16 | 27.1 GB | +162.9 GB | ✓ fits | |
| UI-TARS-7B-SFTOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.29B | fp16 | 27.1 GB | +162.9 GB | ✓ fits | |
| UI-TARS-7B-DPOOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.29B | fp16 | 27.1 GB | +162.9 GB | ✓ fits | |
| Seed-Coder-8B-BaseOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.25B | fp16 | 27.0 GB | +163.0 GB | ✓ fits | |
| Stable-DiffCoder-8B-InstructOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.25B | fp16 | 27.0 GB | +163.0 GB | ✓ fits | |
| Seed-Coder-8B-InstructOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.25B | fp16 | 27.0 GB | +163.0 GB | ✓ fits | |
| Stable-DiffCoder-8B-BaseOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.25B | fp16 | 27.0 GB | +163.0 GB | ✓ fits | |
| Seed-Coder-8B-ReasoningOpen weightsByteDanceestimated: 8.3B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.25B | fp16 | 27.0 GB | +163.0 GB | ✓ fits | |
| DeepSeek-R1-0528-Qwen3-8BOpen weightsDeepSeekestimated: 8.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.19B | fp16 | 26.8 GB | +163.2 GB | ✓ fits | |
| Qwen3 8BOpen weightsQwenestimated: 8.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.19B | fp16 | 26.8 GB | +163.2 GB | ✓ fits | |
| mlx-community/Qwen3-8B-4bitOpen weightsMLX Communityestimated: 8.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.19B | fp16 | 26.8 GB | +163.2 GB | ✓ fits | |
| granite-guardian-3.3-8bOpen weightsIBMestimated: 8.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.17B | fp16 | 26.8 GB | +163.2 GB | ✓ fits | |
| granite-3.0-8b-instructOpen weightsIBMestimated: 8.2B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.17B | fp16 | 26.8 GB | +163.2 GB | ✓ fits | |
| stable-diffusion-3.5-largeRestrictedStability AIestimated: 8.1B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.15B | fp16 | 26.7 GB | +163.3 GB | ✓ fits | |
| ERNIE-ImageOpen weightsBaiduestimated: 8.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.03B | fp16 | 26.5 GB | +163.5 GB | ✓ fits | |
| ERNIE-Image-TurboOpen weightsBaiduestimated: 8.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.03B | fp16 | 26.5 GB | +163.5 GB | ✓ fits | |
| NousResearch/Hermes-3-Llama-3.1-8B-GGUFOpen weightsNous Researchestimated: 8.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.03B | fp16 | 26.5 GB | +163.5 GB | ✓ fits | |
| NousResearch/Meta-Llama-3-8B-InstructOpen weightsNous Researchestimated: 8.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.03B | fp16 | 26.5 GB | +163.5 GB | ✓ fits | |
| NousResearch/Meta-Llama-3.1-8BOpen weightsNous Researchestimated: 8.0B params × 2.0 B × 1.15 + KV cache for 131072 tokens | 8.03B | fp16 | 26.5 GB | +163.5 GB | ✓ fits |
Headroom = device memory − 2 GB reserve − estimated need. Sorted by the API (fitting models first). Compare the models you shortlist with the + buttons. Devices with these memory sizes: hardware listing.