Best local LLMs for 16 GB VRAM
Every catalogued model that fits entirely in 16 GB, with no layers moved to system RAM. Speeds are estimated on the NVIDIA GeForce RTX 5060 Ti 16GB, the most common 16 GB card in Steam's hardware survey.
- Largest popular model that fitsgpt-oss-20b21B params · Q4_K_M · needs 13.8 GB~122 tok/s Faster than you readOpen in the calculator →
- Best fast pickERNIE-4.5-21B-A3B-PT22B params · Q4_K_M · needs 14.7 GB~120 tok/s Faster than you readOpen in the calculator →
- Most downloaded that fitsQwen3.5-9B9.7B params · Q4_K_M · needs 7.05 GB~63 tok/s Faster than you readOpen in the calculator →
“Best” is not a quality ranking. The picks are the largest widely downloaded model that fits, the largest that still answers at 30 tokens a second or more, and the most downloaded; the list puts current, widely downloaded releases first. Speeds are estimates from memory bandwidth, not benchmarks.
Is 16 GB of VRAM enough for a local LLM?
For models under 16B parameters, yes: all 145 in the catalogue fit entirely at Q4_K_M, the format most people download. In the 16B to 36B band, 6 of 66 fit, and nothing larger does. 146 of the 153 that fit answer at 30 tokens a second or more on the NVIDIA GeForce RTX 5060 Ti 16GB, which is faster than most people read. A longer conversation needs more memory than the 8,192 tokens counted here, and a smaller format than Q4_K_M needs less; the calculator sizes either.
| Model size | Fit in 16 GB | For example |
|---|---|---|
| Under 4B parameters | 66 of 66 | Qwen3.5-2B · needs 2.32 GB |
| 4B to 9B parameters | 58 of 58 | Qwen3.5-4B · needs 3.98 GB |
| 9B to 16B parameters | 21 of 21 | Qwen3.5-9B · needs 7.05 GB |
| 16B to 36B parameters | 6 of 66 | gpt-oss-20b · needs 13.8 GB |
| 36B and larger parameters | 0 of 51 | none fits entirely |
Models that fit in 16 GB
| Model | Parameters | Needs | Spare | Decode | Answer |
|---|---|---|---|---|---|
| Qwen3.5-9B Qwen · Q4_K_M | 9.7B | 7.05 GB | 8.95 GB | ~63 tok/s | Details |
| Qwen3.5-4B Qwen · Q4_K_M | 4.7B | 3.98 GB | 12.0 GB | ~113 tok/s | Details |
| gemma-4-12B-it Google · Q4_K_M | 12B | 9.54 GB | 6.46 GB | ~37 tok/s | Details |
| Qwen3.5-2B Qwen · Q4_K_M | 2.3B | 2.32 GB | 13.7 GB | ~247 tok/s | Details |
| gemma-4-E4B-it Google · Q4_K_M | 8.0B | 5.86 GB | 10.1 GB | ~101 tok/s | Details |
| NVIDIA-Nemotron-3-Nano-4B-BF16 NVIDIA · Q4_K_M | 4.0B | 3.46 GB | 12.5 GB | ~114 tok/s | Details |
| gemma-4-E2B-it Google · Q4_K_M | 5.1B | 4.02 GB | 12.0 GB | ~266 tok/s | Details |
| Qwen3.5-0.8B Qwen · Q4_K_M | 873M | 1.46 GB | 14.5 GB | ~541 tok/s | Details |
| Qwen3-VL-8B-Instruct Qwen · Q4_K_M | 8.8B | 7.04 GB | 8.96 GB | ~52 tok/s | Details |
| North-Micro-Vision-Instruct CohereLabs · Q4_K_M | 2.5B | 2.99 GB | 13.0 GB | ~162 tok/s | Details |
| granite-4.2-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 8.51 GB | ~47 tok/s | Details |
| granite-4.1-3b IBM · Q4_K_M | 3.4B | 3.72 GB | 12.3 GB | ~110 tok/s | Details |
| LFM2.5-2.6B LiquidAI · Q4_K_M | 2.7B | 2.61 GB | 13.4 GB | ~176 tok/s | Details |
| Qwen3-VL-4B-Instruct Qwen · Q4_K_M | 4.4B | 4.72 GB | 11.3 GB | ~82 tok/s | Details |
| Qwen3-VL-2B-Instruct Qwen · Q4_K_M | 2.1B | 3.05 GB | 13.0 GB | ~149 tok/s | Details |
| granite-4.2-3b IBM · Q4_K_M | 3.7B | 3.72 GB | 12.3 GB | ~110 tok/s | Details |
| LFM2.5-230M LiquidAI · Q4_K_M | 230M | 1.05 GB | 14.9 GB | ~1230 tok/s | Details |
| Qwen3-0.6B Qwen · Q4_K_M | 752M | 2.22 GB | 13.8 GB | ~229 tok/s | Details |
| gpt-oss-20b OpenAI · Q4_K_M | 21B | 13.8 GB | 2.24 GB | ~122 tok/s | Details |
| granite-4.1-8b IBM · Q4_K_M | 8.8B | 7.49 GB | 8.51 GB | ~47 tok/s | Details |
| LFM2.5-VL-3B LiquidAI · Q4_K_M | 3.1B | 2.85 GB | 13.1 GB | ~176 tok/s | Details |
| MiMo-V2.6-Distill-Qwen-9B XiaomiMiMo · Q4_K_M | 9.4B | 6.90 GB | 9.10 GB | ~63 tok/s | Details |
| Qwen3-4B-Instruct-2507 Qwen · Q4_K_M | 4.0B | 4.72 GB | 11.3 GB | ~82 tok/s | Details |
| Ling-3.0-tiny inclusionAI · Q4_K_M | 7.9B | 5.85 GB | 10.1 GB | ~355 tok/s | Details |
| Qwen3-8B Qwen · Q4_K_M | 8.2B | 7.04 GB | 8.96 GB | ~52 tok/s | Details |
| Olmo-3-7B-Instruct allenai · Q4_K_M | 7.3B | 7.96 GB | 8.04 GB | ~44 tok/s | Details |
| Qwen3-4B Qwen · Q4_K_M | 4.0B | 4.51 GB | 11.5 GB | ~82 tok/s | Details |
| LFM2.5-8B-A1B LiquidAI · Q4_K_M | 8.5B | 6.06 GB | 9.94 GB | ~275 tok/s | Details |
| LFM2.5-350M LiquidAI · Q4_K_M | 354M | 1.13 GB | 14.9 GB | ~794 tok/s | Details |
| Hy-MT2-1.8B Tencent · Q4_K_M | 2.0B | 2.47 GB | 13.5 GB | ~183 tok/s | Details |
| LLaDA2.0-mini inclusionAI · Q4_K_M | 16B | 11.0 GB | 5.00 GB | ~285 tok/s | Details |
| LFM2.5-1.2B-Instruct LiquidAI · Q4_K_M | 1.2B | 1.63 GB | 14.4 GB | ~293 tok/s | Details |
| Ministral-3-14B-Instruct-2512 Mistral AI · Q4_K_M | 14B | 10.4 GB | 5.62 GB | ~33 tok/s | Details |
| Qwen3-1.7B Qwen · Q4_K_M | 2.0B | 3.02 GB | 13.0 GB | ~149 tok/s | Details |
| Nemotron-3.5-Content-Safety NVIDIA · Q4_K_M | 4.3B | 3.73 GB | 12.3 GB | ~110 tok/s | Details |
| Hy-MT2-7B Tencent · Q4_K_M | 8.0B | 6.50 GB | 9.50 GB | ~53 tok/s | Details |
| Qwen3-14B Qwen · Q4_K_M | 15B | 11.1 GB | 4.86 GB | ~31 tok/s | Details |
| GLM-4.6V-Flash zai-org · Q4_K_M | 10B | 7.45 GB | 8.55 GB | ~53 tok/s | Details |
| Qwen2.5-VL-7B-Instruct Qwen · Q4_K_M | 8.3B | 6.36 GB | 9.64 GB | ~63 tok/s | Details |
| SmolLM3-3B HuggingFaceTB · Q4_K_M | 3.1B | 3.46 GB | 12.5 GB | ~121 tok/s | Details |
21 devices with 16 GB
The same models fit on every one of them. What changes is speed, which follows memory bandwidth: a card with twice the bandwidth decodes roughly twice as fast.
Which card to buy, at every memory size →
Store links may pay us a commission. They never decide which models are listed — the memory arithmetic does.
What does not fit in 16 GB
Widely downloaded models that need more than 16 GB at Q4_K_M, and the smallest memory size that holds each one entirely. Each link shows what 16 GB can still do with it: a smaller format, or part of the model in system RAM at a lower speed.
| Model | Needs | Fits from | On 16 GB |
|---|---|---|---|
| Qwen3.8-27B | 18.6 GB | 20 GB | On 16 GB |
| gemma-4-26B-A4B-it | 16.8 GB | 20 GB | On 16 GB |
| Qwen3.6-27B | 18.6 GB | 20 GB | On 16 GB |
| Qwen3.5-27B | 18.6 GB | 20 GB | On 16 GB |
| Hy-MT2-30B-A3B | 19.8 GB | 20 GB | On 16 GB |
| Mistral-Small-3.2-24B-Instruct-2506 | 16.5 GB | 20 GB | On 16 GB |
19 more models fit in 20 GB. Best local LLMs for 20 GB →