Best local LLMs for 8 GB VRAM
Every catalogued model that fits entirely in 8 GB, with no layers moved to system RAM. Speeds are estimated on the NVIDIA GeForce RTX 4060 Laptop GPU, the most common 8 GB card in Steam's hardware survey.
- Largest popular model that fitsOlmo-3-7B-Instruct7.3B params · Q4_K_M · needs 7.96 GB~25 tok/s About reading paceOpen in the calculator →
- Best fast pickGLM-4.6V-Flash10B params · Q4_K_M · needs 7.45 GB~30 tok/s Faster than you readOpen in the calculator →
- Most downloaded that fitsQwen3.5-9B9.7B params · Q4_K_M · needs 7.05 GB~36 tok/s Faster than you readOpen in the calculator →
“Best” is not a quality ranking. The picks are the largest widely downloaded model that fits, the largest that still answers at 30 tokens a second or more, and the most downloaded; the list puts current, widely downloaded releases first. Speeds are estimates from memory bandwidth, not benchmarks.
Is 8 GB of VRAM enough for a local LLM?
For models under 9B parameters, yes: 122 of the 124 in the catalogue fit entirely at Q4_K_M, the format most people download. In the 9B to 16B band, 7 of 21 fit, and nothing larger does. 115 of the 130 that fit answer at 30 tokens a second or more on the NVIDIA GeForce RTX 4060 Laptop GPU, which is faster than most people read. A longer conversation needs more memory than the 8,192 tokens counted here, and a smaller format than Q4_K_M needs less; the calculator sizes either.
| Model size | Fit in 8 GB | For example |
|---|---|---|
| Under 4B parameters | 66 of 66 | Qwen3.5-2B · needs 2.32 GB |
| 4B to 9B parameters | 56 of 58 | Qwen3.5-4B · needs 3.98 GB |
| 9B to 16B parameters | 7 of 21 | Qwen3.5-9B · needs 7.05 GB |
| 16B to 36B parameters | 0 of 66 | none fits entirely |
| 36B and larger parameters | 0 of 51 | none fits entirely |
Models that fit in 8 GB
| Model | Parameters | Needs | Spare | Decode | Answer |
|---|---|---|---|---|---|
| Qwen3.5-9B Qwen · Q4_K_M | 9.7B | 7.05 GB | 0.95 GB | ~36 tok/s | Details |
| Qwen3.5-4B Qwen · Q4_K_M | 4.7B | 3.98 GB | 4.02 GB | ~64 tok/s | Details |
| Qwen3.5-2B Qwen · Q4_K_M | 2.3B | 2.32 GB | 5.68 GB | ~141 tok/s | Details |
| gemma-4-E4B-it Google · Q4_K_M | 8.0B | 5.86 GB | 2.14 GB | ~58 tok/s | Details |
| NVIDIA-Nemotron-3-Nano-4B-BF16 NVIDIA · Q4_K_M | 4.0B | 3.46 GB | 4.54 GB | ~65 tok/s | Details |
| gemma-4-E2B-it Google · Q4_K_M | 5.1B | 4.02 GB | 3.98 GB | ~152 tok/s | Details |
| Qwen3.5-0.8B Qwen · Q4_K_M | 873M | 1.46 GB | 6.54 GB | ~309 tok/s | Details |
| Qwen3-VL-8B-Instruct Qwen · Q4_K_M | 8.8B | 7.04 GB | 0.96 GB | ~30 tok/s | Details |
| North-Micro-Vision-Instruct CohereLabs · Q4_K_M | 2.5B | 2.99 GB | 5.01 GB | ~93 tok/s | Details |
| granite-4.2-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 0.51 GB | ~27 tok/s | Details |
| granite-4.1-3b IBM · Q4_K_M | 3.4B | 3.72 GB | 4.28 GB | ~63 tok/s | Details |
| LFM2.5-2.6B LiquidAI · Q4_K_M | 2.7B | 2.61 GB | 5.39 GB | ~101 tok/s | Details |
| Qwen3-VL-4B-Instruct Qwen · Q4_K_M | 4.4B | 4.72 GB | 3.28 GB | ~47 tok/s | Details |
| Qwen3-VL-2B-Instruct Qwen · Q4_K_M | 2.1B | 3.05 GB | 4.95 GB | ~85 tok/s | Details |
| granite-4.2-3b IBM · Q4_K_M | 3.7B | 3.72 GB | 4.28 GB | ~63 tok/s | Details |
| LFM2.5-230M LiquidAI · Q4_K_M | 230M | 1.05 GB | 6.95 GB | ~703 tok/s | Details |
| Qwen3-0.6B Qwen · Q4_K_M | 752M | 2.22 GB | 5.78 GB | ~131 tok/s | Details |
| granite-4.1-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 0.51 GB | ~27 tok/s | Details |
| LFM2.5-VL-3B LiquidAI · Q4_K_M | 3.1B | 2.85 GB | 5.15 GB | ~101 tok/s | Details |
| MiMo-V2.6-Distill-Qwen-9B XiaomiMiMo · Q4_K_M | 9.4B | 6.90 GB | 1.10 GB | ~36 tok/s | Details |
| Qwen3-4B-Instruct-2507 Qwen · Q4_K_M | 4.0B | 4.72 GB | 3.28 GB | ~47 tok/s | Details |
| Ling-3.0-tiny inclusionAI · Q4_K_M | 7.9B | 5.85 GB | 2.15 GB | ~203 tok/s | Details |
| Qwen3-8B Qwen · Q4_K_M | 8.2B | 7.04 GB | 0.96 GB | ~30 tok/s | Details |
| Olmo-3-7B-Instruct allenai · Q4_K_M | 7.3B | 7.96 GB | 0.04 GB | ~25 tok/s | Details |
| Qwen3-4B Qwen · Q4_K_M | 4.0B | 4.51 GB | 3.49 GB | ~47 tok/s | Details |
| LFM2.5-8B-A1B LiquidAI · Q4_K_M | 8.5B | 6.06 GB | 1.94 GB | ~157 tok/s | Details |
| LFM2.5-350M LiquidAI · Q4_K_M | 354M | 1.13 GB | 6.87 GB | ~453 tok/s | Details |
| Hy-MT2-1.8B Tencent · Q4_K_M | 2.0B | 2.47 GB | 5.53 GB | ~104 tok/s | Details |
| LFM2.5-1.2B-Instruct LiquidAI · Q4_K_M | 1.2B | 1.63 GB | 6.37 GB | ~167 tok/s | Details |
| Qwen3-1.7B Qwen · Q4_K_M | 2.0B | 3.02 GB | 4.98 GB | ~85 tok/s | Details |
| Nemotron-3.5-Content-Safety NVIDIA · Q4_K_M | 4.3B | 3.73 GB | 4.27 GB | ~63 tok/s | Details |
| Hy-MT2-7B Tencent · Q4_K_M | 8.0B | 6.50 GB | 1.50 GB | ~31 tok/s | Details |
| GLM-4.6V-Flash zai-org · Q4_K_M | 10B | 7.45 GB | 0.55 GB | ~30 tok/s | Details |
| Qwen2.5-VL-7B-Instruct Qwen · Q4_K_M | 8.3B | 6.36 GB | 1.64 GB | ~36 tok/s | Details |
| SmolLM3-3B HuggingFaceTB · Q4_K_M | 3.1B | 3.46 GB | 4.54 GB | ~69 tok/s | Details |
| Ministral-3-8B-Instruct-2512 Mistral AI · Q4_K_M | 8.9B | 7.14 GB | 0.86 GB | ~29 tok/s | Details |
| Ministral-3-3B-Instruct-2512 Mistral AI · Q4_K_M | 3.8B | 3.82 GB | 4.18 GB | ~58 tok/s | Details |
| NVIDIA-Nemotron-Nano-9B-v2 NVIDIA · Q4_K_M | 8.9B | 6.54 GB | 1.46 GB | ~30 tok/s | Details |
| Qwen3-VL-8B-Thinking Qwen · Q4_K_M | 8.8B | 7.04 GB | 0.96 GB | ~30 tok/s | Details |
| DeepSeek-R1-0528-Qwen3-8B DeepSeek · Q4_K_M | 8.2B | 7.04 GB | 0.96 GB | ~30 tok/s | Details |
31 devices with 8 GB
The same models fit on every one of them. What changes is speed, which follows memory bandwidth: a card with twice the bandwidth decodes roughly twice as fast.
Which card to buy, at every memory size →
Store links may pay us a commission. They never decide which models are listed — the memory arithmetic does.
What does not fit in 8 GB
Widely downloaded models that need more than 8 GB at Q4_K_M, and the smallest memory size that holds each one entirely. Each link shows what 8 GB can still do with it: a smaller format, or part of the model in system RAM at a lower speed.
| Model | Needs | Fits from | On 8 GB |
|---|---|---|---|
| gemma-4-12B-it | 9.54 GB | 10 GB | On 8 GB |
| LLaDA2.0-mini | 11.0 GB | 11 GB | On 8 GB |
| Ministral-3-14B-Instruct-2512 | 10.4 GB | 11 GB | On 8 GB |
| Qwen3-14B | 11.1 GB | 12 GB | On 8 GB |
| Qwen2.5-Coder-14B-Instruct | 11.4 GB | 12 GB | On 8 GB |
| gpt-oss-20b | 13.8 GB | 16 GB | On 8 GB |
7 more models fit in 10 GB. Best local LLMs for 10 GB →