Best local LLMs for 10 GB VRAM
Every catalogued model that fits entirely in 10 GB, with no layers moved to system RAM. Speeds are estimated on the NVIDIA GeForce RTX 3080, the most common 10 GB card in Steam's hardware survey.
- Largest popular model that fitsgemma-4-12B-it12B params · Q4_K_M · needs 9.54 GB~63 tok/s Faster than you readOpen in the calculator →
- Best fast pickMistral-Nemo-Instruct-240712B params · Q4_K_M · needs 9.62 GB~61 tok/s Faster than you readOpen in the calculator →
- Most downloaded that fitsQwen3.5-9B9.7B params · Q4_K_M · needs 7.05 GB~106 tok/s Faster than you readOpen in the calculator →
“Best” is not a quality ranking. The picks are the largest widely downloaded model that fits, the largest that still answers at 30 tokens a second or more, and the most downloaded; the list puts current, widely downloaded releases first. Speeds are estimates from memory bandwidth, not benchmarks.
Is 10 GB of VRAM enough for a local LLM?
For models under 9B parameters, yes: all 124 in the catalogue fit entirely at Q4_K_M, the format most people download. In the 9B to 16B band, 12 of 21 fit, and nothing larger does. All 137 that fit answer at 30 tokens a second or more on the NVIDIA GeForce RTX 3080, which is faster than most people read. A longer conversation needs more memory than the 8,192 tokens counted here, and a smaller format than Q4_K_M needs less; the calculator sizes either.
| Model size | Fit in 10 GB | For example |
|---|---|---|
| Under 4B parameters | 66 of 66 | Qwen3.5-2B · needs 2.32 GB |
| 4B to 9B parameters | 58 of 58 | Qwen3.5-4B · needs 3.98 GB |
| 9B to 16B parameters | 12 of 21 | Qwen3.5-9B · needs 7.05 GB |
| 16B to 36B parameters | 0 of 66 | none fits entirely |
| 36B and larger parameters | 0 of 51 | none fits entirely |
Models that fit in 10 GB
| Model | Parameters | Needs | Spare | Decode | Answer |
|---|---|---|---|---|---|
| Qwen3.5-9B Qwen · Q4_K_M | 9.7B | 7.05 GB | 2.95 GB | ~106 tok/s | Details |
| Qwen3.5-4B Qwen · Q4_K_M | 4.7B | 3.98 GB | 6.02 GB | ~191 tok/s | Details |
| gemma-4-12B-it Google · Q4_K_M | 12B | 9.54 GB | 0.46 GB | ~63 tok/s | Details |
| Qwen3.5-2B Qwen · Q4_K_M | 2.3B | 2.32 GB | 7.68 GB | ~419 tok/s | Details |
| gemma-4-E4B-it Google · Q4_K_M | 8.0B | 5.86 GB | 4.14 GB | ~171 tok/s | Details |
| NVIDIA-Nemotron-3-Nano-4B-BF16 NVIDIA · Q4_K_M | 4.0B | 3.46 GB | 6.54 GB | ~194 tok/s | Details |
| gemma-4-E2B-it Google · Q4_K_M | 5.1B | 4.02 GB | 5.98 GB | ~451 tok/s | Details |
| Qwen3.5-0.8B Qwen · Q4_K_M | 873M | 1.46 GB | 8.54 GB | ~918 tok/s | Details |
| Qwen3-VL-8B-Instruct Qwen · Q4_K_M | 8.8B | 7.04 GB | 2.96 GB | ~88 tok/s | Details |
| North-Micro-Vision-Instruct CohereLabs · Q4_K_M | 2.5B | 2.99 GB | 7.01 GB | ~276 tok/s | Details |
| granite-4.2-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 2.51 GB | ~80 tok/s | Details |
| granite-4.1-3b IBM · Q4_K_M | 3.4B | 3.72 GB | 6.28 GB | ~187 tok/s | Details |
| LFM2.5-2.6B LiquidAI · Q4_K_M | 2.7B | 2.61 GB | 7.39 GB | ~299 tok/s | Details |
| Qwen3-VL-4B-Instruct Qwen · Q4_K_M | 4.4B | 4.72 GB | 5.28 GB | ~140 tok/s | Details |
| Qwen3-VL-2B-Instruct Qwen · Q4_K_M | 2.1B | 3.05 GB | 6.95 GB | ~253 tok/s | Details |
| granite-4.2-3b IBM · Q4_K_M | 3.7B | 3.72 GB | 6.28 GB | ~187 tok/s | Details |
| LFM2.5-230M LiquidAI · Q4_K_M | 230M | 1.05 GB | 8.95 GB | ~2086 tok/s | Details |
| Qwen3-0.6B Qwen · Q4_K_M | 752M | 2.22 GB | 7.78 GB | ~388 tok/s | Details |
| granite-4.1-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 2.51 GB | ~80 tok/s | Details |
| LFM2.5-VL-3B LiquidAI · Q4_K_M | 3.1B | 2.85 GB | 7.15 GB | ~299 tok/s | Details |
| MiMo-V2.6-Distill-Qwen-9B XiaomiMiMo · Q4_K_M | 9.4B | 6.90 GB | 3.10 GB | ~106 tok/s | Details |
| Qwen3-4B-Instruct-2507 Qwen · Q4_K_M | 4.0B | 4.72 GB | 5.28 GB | ~140 tok/s | Details |
| Ling-3.0-tiny inclusionAI · Q4_K_M | 7.9B | 5.85 GB | 4.15 GB | ~603 tok/s | Details |
| Qwen3-8B Qwen · Q4_K_M | 8.2B | 7.04 GB | 2.96 GB | ~88 tok/s | Details |
| Olmo-3-7B-Instruct allenai · Q4_K_M | 7.3B | 7.96 GB | 2.04 GB | ~75 tok/s | Details |
| Qwen3-4B Qwen · Q4_K_M | 4.0B | 4.51 GB | 5.49 GB | ~140 tok/s | Details |
| LFM2.5-8B-A1B LiquidAI · Q4_K_M | 8.5B | 6.06 GB | 3.94 GB | ~466 tok/s | Details |
| LFM2.5-350M LiquidAI · Q4_K_M | 354M | 1.13 GB | 8.87 GB | ~1346 tok/s | Details |
| Hy-MT2-1.8B Tencent · Q4_K_M | 2.0B | 2.47 GB | 7.53 GB | ~310 tok/s | Details |
| LFM2.5-1.2B-Instruct LiquidAI · Q4_K_M | 1.2B | 1.63 GB | 8.37 GB | ~497 tok/s | Details |
| Qwen3-1.7B Qwen · Q4_K_M | 2.0B | 3.02 GB | 6.98 GB | ~253 tok/s | Details |
| Nemotron-3.5-Content-Safety NVIDIA · Q4_K_M | 4.3B | 3.73 GB | 6.27 GB | ~186 tok/s | Details |
| Hy-MT2-7B Tencent · Q4_K_M | 8.0B | 6.50 GB | 3.50 GB | ~91 tok/s | Details |
| GLM-4.6V-Flash zai-org · Q4_K_M | 10B | 7.45 GB | 2.55 GB | ~90 tok/s | Details |
| Qwen2.5-VL-7B-Instruct Qwen · Q4_K_M | 8.3B | 6.36 GB | 3.64 GB | ~107 tok/s | Details |
| SmolLM3-3B HuggingFaceTB · Q4_K_M | 3.1B | 3.46 GB | 6.54 GB | ~206 tok/s | Details |
| Ministral-3-8B-Instruct-2512 Mistral AI · Q4_K_M | 8.9B | 7.14 GB | 2.86 GB | ~86 tok/s | Details |
| Ministral-3-3B-Instruct-2512 Mistral AI · Q4_K_M | 3.8B | 3.82 GB | 6.18 GB | ~171 tok/s | Details |
| NVIDIA-Nemotron-Nano-9B-v2 NVIDIA · Q4_K_M | 8.9B | 6.54 GB | 3.46 GB | ~90 tok/s | Details |
| Qwen3-VL-8B-Thinking Qwen · Q4_K_M | 8.8B | 7.04 GB | 2.96 GB | ~88 tok/s | Details |
2 devices with 10 GB
The same models fit on every one of them. What changes is speed, which follows memory bandwidth: a card with twice the bandwidth decodes roughly twice as fast.
| Device | Bandwidth | Memory | Where to find one |
|---|---|---|---|
| NVIDIA GeForce RTX 3080 speeds on this page | 760 GB/s | 10 GB, dedicated | Amazon ↗ · eBay (new and used) ↗ |
| Intel Arc B570 | 380 GB/s | 10 GB, dedicated | Amazon ↗ · eBay (new and used) ↗ |
Which card to buy, at every memory size →
Store links may pay us a commission. They never decide which models are listed — the memory arithmetic does.
What does not fit in 10 GB
Widely downloaded models that need more than 10 GB at Q4_K_M, and the smallest memory size that holds each one entirely. Each link shows what 10 GB can still do with it: a smaller format, or part of the model in system RAM at a lower speed.
| Model | Needs | Fits from | On 10 GB |
|---|---|---|---|
| LLaDA2.0-mini | 11.0 GB | 11 GB | On 10 GB |
| Ministral-3-14B-Instruct-2512 | 10.4 GB | 11 GB | On 10 GB |
| Qwen3-14B | 11.1 GB | 12 GB | On 10 GB |
| Qwen2.5-Coder-14B-Instruct | 11.4 GB | 12 GB | On 10 GB |
| gpt-oss-20b | 13.8 GB | 16 GB | On 10 GB |
| gpt-oss-safeguard-20b | 13.8 GB | 16 GB | On 10 GB |
5 more models fit in 11 GB. Best local LLMs for 11 GB →