Best local LLMs for 20 GB VRAM
Every catalogued model that fits entirely in 20 GB, with no layers moved to system RAM. Speeds are estimated on the AMD Radeon RX 7900 XT, the most common 20 GB card in Steam's hardware survey.
- Largest popular model that fitsHy-MT2-30B-A3B30B params · Q4_K_M · needs 19.8 GB~233 tok/s Faster than you readOpen in the calculator →
- Most downloaded that fitsQwen3.8-27B28B params · Q4_K_M · needs 18.6 GB~42 tok/s Faster than you readOpen in the calculator →
“Best” is not a quality ranking. The picks are the largest widely downloaded model that fits, the largest that still answers at 30 tokens a second or more, and the most downloaded; the list puts current, widely downloaded releases first. Speeds are estimates from memory bandwidth, not benchmarks.
Is 20 GB of VRAM enough for a local LLM?
For models under 16B parameters, yes: all 145 in the catalogue fit entirely at Q4_K_M, the format most people download. In the 16B to 36B band, 25 of 66 fit, and nothing larger does. All 172 that fit answer at 30 tokens a second or more on the AMD Radeon RX 7900 XT, which is faster than most people read. A longer conversation needs more memory than the 8,192 tokens counted here, and a smaller format than Q4_K_M needs less; the calculator sizes either.
| Model size | Fit in 20 GB | For example |
|---|---|---|
| Under 4B parameters | 66 of 66 | Qwen3.5-2B · needs 2.32 GB |
| 4B to 9B parameters | 58 of 58 | Qwen3.5-4B · needs 3.98 GB |
| 9B to 16B parameters | 21 of 21 | Qwen3.5-9B · needs 7.05 GB |
| 16B to 36B parameters | 25 of 66 | Qwen3.8-27B · needs 18.6 GB |
| 36B and larger parameters | 0 of 51 | none fits entirely |
Models that fit in 20 GB
| Model | Parameters | Needs | Spare | Decode | Answer |
|---|---|---|---|---|---|
| Qwen3.8-27B Qwen · Q4_K_M | 28B | 18.6 GB | 1.45 GB | ~42 tok/s | Details |
| gemma-4-26B-A4B-it Google · Q4_K_M | 26B | 16.8 GB | 3.21 GB | ~234 tok/s | Details |
| Qwen3.5-9B Qwen · Q4_K_M | 9.7B | 7.05 GB | 13.0 GB | ~128 tok/s | Details |
| Qwen3.5-4B Qwen · Q4_K_M | 4.7B | 3.98 GB | 16.0 GB | ~231 tok/s | Details |
| gemma-4-12B-it Google · Q4_K_M | 12B | 9.54 GB | 10.5 GB | ~76 tok/s | Details |
| Qwen3.6-27B Qwen · Q4_K_M | 28B | 18.6 GB | 1.45 GB | ~42 tok/s | Details |
| Qwen3.5-2B Qwen · Q4_K_M | 2.3B | 2.32 GB | 17.7 GB | ~505 tok/s | Details |
| gemma-4-E4B-it Google · Q4_K_M | 8.0B | 5.86 GB | 14.1 GB | ~206 tok/s | Details |
| NVIDIA-Nemotron-3-Nano-4B-BF16 NVIDIA · Q4_K_M | 4.0B | 3.46 GB | 16.5 GB | ~234 tok/s | Details |
| gemma-4-E2B-it Google · Q4_K_M | 5.1B | 4.02 GB | 16.0 GB | ~544 tok/s | Details |
| Qwen3.5-0.8B Qwen · Q4_K_M | 873M | 1.46 GB | 18.5 GB | ~1107 tok/s | Details |
| Qwen3-VL-8B-Instruct Qwen · Q4_K_M | 8.8B | 7.04 GB | 13.0 GB | ~106 tok/s | Details |
| Qwen3.5-27B Qwen · Q4_K_M | 28B | 18.6 GB | 1.45 GB | ~42 tok/s | Details |
| North-Micro-Vision-Instruct CohereLabs · Q4_K_M | 2.5B | 2.99 GB | 17.0 GB | ~332 tok/s | Details |
| granite-4.2-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 12.5 GB | ~96 tok/s | Details |
| granite-4.1-3b IBM · Q4_K_M | 3.4B | 3.72 GB | 16.3 GB | ~225 tok/s | Details |
| LFM2.5-2.6B LiquidAI · Q4_K_M | 2.7B | 2.61 GB | 17.4 GB | ~361 tok/s | Details |
| Qwen3-VL-4B-Instruct Qwen · Q4_K_M | 4.4B | 4.72 GB | 15.3 GB | ~168 tok/s | Details |
| Qwen3-VL-2B-Instruct Qwen · Q4_K_M | 2.1B | 3.05 GB | 17.0 GB | ~305 tok/s | Details |
| granite-4.2-3b IBM · Q4_K_M | 3.7B | 3.72 GB | 16.3 GB | ~225 tok/s | Details |
| LFM2.5-230M LiquidAI · Q4_K_M | 230M | 1.05 GB | 18.9 GB | ~2516 tok/s | Details |
| Qwen3-0.6B Qwen · Q4_K_M | 752M | 2.22 GB | 17.8 GB | ~468 tok/s | Details |
| gpt-oss-20b OpenAI · Q4_K_M | 21B | 13.8 GB | 6.24 GB | ~249 tok/s | Details |
| granite-4.1-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 12.5 GB | ~96 tok/s | Details |
| LFM2.5-VL-3B LiquidAI · Q4_K_M | 3.1B | 2.85 GB | 17.1 GB | ~361 tok/s | Details |
| MiMo-V2.6-Distill-Qwen-9B XiaomiMiMo · Q4_K_M | 9.4B | 6.90 GB | 13.1 GB | ~128 tok/s | Details |
| Qwen3-4B-Instruct-2507 Qwen · Q4_K_M | 4.0B | 4.72 GB | 15.3 GB | ~168 tok/s | Details |
| Ling-3.0-tiny inclusionAI · Q4_K_M | 7.9B | 5.85 GB | 14.1 GB | ~727 tok/s | Details |
| Qwen3-8B Qwen · Q4_K_M | 8.2B | 7.04 GB | 13.0 GB | ~106 tok/s | Details |
| Olmo-3-7B-Instruct allenai · Q4_K_M | 7.3B | 7.96 GB | 12.0 GB | ~90 tok/s | Details |
| Qwen3-4B Qwen · Q4_K_M | 4.0B | 4.51 GB | 15.5 GB | ~168 tok/s | Details |
| LFM2.5-8B-A1B LiquidAI · Q4_K_M | 8.5B | 6.06 GB | 13.9 GB | ~562 tok/s | Details |
| LFM2.5-350M LiquidAI · Q4_K_M | 354M | 1.13 GB | 18.9 GB | ~1624 tok/s | Details |
| Hy-MT2-1.8B Tencent · Q4_K_M | 2.0B | 2.47 GB | 17.5 GB | ~374 tok/s | Details |
| LLaDA2.0-mini inclusionAI · Q4_K_M | 16B | 11.0 GB | 9.00 GB | ~582 tok/s | Details |
| LFM2.5-1.2B-Instruct LiquidAI · Q4_K_M | 1.2B | 1.63 GB | 18.4 GB | ~599 tok/s | Details |
| Ministral-3-14B-Instruct-2512 Mistral AI · Q4_K_M | 14B | 10.4 GB | 9.62 GB | ~68 tok/s | Details |
| Qwen3-1.7B Qwen · Q4_K_M | 2.0B | 3.02 GB | 17.0 GB | ~305 tok/s | Details |
| Nemotron-3.5-Content-Safety NVIDIA · Q4_K_M | 4.3B | 3.73 GB | 16.3 GB | ~225 tok/s | Details |
| Hy-MT2-7B Tencent · Q4_K_M | 8.0B | 6.50 GB | 13.5 GB | ~109 tok/s | Details |
The 20 GB device in the catalogue
The same models fit on every one of them. What changes is speed, which follows memory bandwidth: a card with twice the bandwidth decodes roughly twice as fast.
| Device | Bandwidth | Memory | Where to find one |
|---|---|---|---|
| AMD Radeon RX 7900 XT speeds on this page | 800 GB/s | 20 GB, dedicated | Amazon ↗ · eBay (new and used) ↗ |
Which card to buy, at every memory size →
Store links may pay us a commission. They never decide which models are listed — the memory arithmetic does.
What does not fit in 20 GB
Widely downloaded models that need more than 20 GB at Q4_K_M, and the smallest memory size that holds each one entirely. Each link shows what 20 GB can still do with it: a smaller format, or part of the model in system RAM at a lower speed.
| Model | Needs | Fits from | On 20 GB |
|---|---|---|---|
| gemma-4-31B-it | 22.2 GB | 24 GB | On 20 GB |
| Qwen3.6-35B-A3B | 23.1 GB | 24 GB | On 20 GB |
| NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 | 20.3 GB | 24 GB | On 20 GB |
| Qwen3.5-35B-A3B | 23.1 GB | 24 GB | On 20 GB |
| GLM-4.7-Flash | 20.4 GB | 24 GB | On 20 GB |
| granite-4.1-30b | 20.4 GB | 24 GB | On 20 GB |
42 more models fit in 24 GB. Best local LLMs for 24 GB →