Best LLM for 16 GB VRAM · 2026
Best LLM for 16 GB VRAM: what fits, and what to run
A 16 GB card hands a runtime about 14.4 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 38 of 80 models in the catalogue fit — 38 with headroom, 0 tightly. The pick for most people is Gemma 4 12B: The 12 GB generalist: text, image and audio in, 140+ languages. Speeds are estimated for a GeForce RTX 5080; the fit verdicts are the same for every card in the class.
Which one should I run?
One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.
| Recommendation | Model | Why | Quant · total | Tok/s est. | |
|---|---|---|---|---|---|
| Best overall | Gemma 4 12B Google · Apache 2.0 |
The 12 GB generalist: text, image and audio in, 140+ languages. | Q4_K_M · 8.2 GB | 86 | Runs great |
| Best for coding | Qwen3.5 9B Alibaba · Apache 2.0 |
The best coding model for 8–12 GB cards. | Q4_K_M · 6.3 GB | 107 | Runs great |
| Best reasoning | gpt-oss 20B OpenAI · Apache 2.0 |
Low/medium/high reasoning effort in 13 GB. | MXFP4 · 11.6 GB | 120 | Runs great |
| Best for writing | Gemma 4 12B Google · Apache 2.0 |
The 12 GB writing pick; 140+ languages. | Q4_K_M · 8.2 GB | 86 | Runs great |
| Best vision | Gemma 4 12B Google · Apache 2.0 |
Image and audio understanding on 12 GB. | Q4_K_M · 8.2 GB | 86 | Runs great |
| Best for agents | gpt-oss 20B OpenAI · Apache 2.0 |
Harmony-format tool calling, native 4-bit. | MXFP4 · 11.6 GB | 120 | Runs great |
| Best translation | Gemma 4 12B Google · Apache 2.0 |
Broad language coverage on a 12 GB card. | Q4_K_M · 8.2 GB | 86 | Runs great |
| Fastest good model | gpt-oss 20B OpenAI · Apache 2.0 |
3.6B active, native 4-bit. | MXFP4 · 11.6 GB | 120 | Runs great |
| Best long context | Qwen3.5 9B Alibaba · Apache 2.0 |
262K native in 8–12 GB. | Q4_K_M · 10.0 GB at 128K context |
107 | Runs great |
The long-context row is judged at 128K: Qwen3.5 9B holds that window on 16 GB at Q4_K_M with 4.00 GB of KV cache — that is why it can differ from the best overall pick.
Everything that fits 16 GB
Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.
| Model | Params | Quant | Weights | +KV 8K | Total | Headroom | Max context | Tok/s est. | |
|---|---|---|---|---|---|---|---|---|---|
| gpt-oss 20B | 20.9B MoE | MXFP4 | 10.8 GB | 0.19 GB | 11.6 GB | 2.8 GB | 126K | 120 | Runs great |
| Qwen3 14B | 14.8B | Q4_K_M | 8.3 GB | 1.25 GB | 10.2 GB | 4.2 GB | 35K | 70 | Runs great |
| DeepSeek-R1-Distill-Qwen 14B | 14.8B | Q4_K_M | 8.3 GB | 1.50 GB | 10.4 GB | 4.0 GB | 29K | 70 | Runs great |
| Qwen2.5-Coder 14B | 14.8B | Q4_K_M | 8.3 GB | 1.50 GB | 10.4 GB | 4.0 GB | 29K | 70 | Runs great |
| Phi-4 14B | 14.7B | Q4_K_M | 8.3 GB | 1.56 GB | 10.4 GB | 4.0 GB | 16K | 70 | Runs great |
| Ministral 3 14B | 13.9B | Q4_K_M | 7.8 GB | 1.25 GB | 9.7 GB | 4.7 GB | 38K | 74 | Runs great |
| Gemma 3 12B | 12.2B | Q4_K_M | 6.9 GB | 0.81 GB | 8.3 GB | 6.1 GB | 106K | 85 | Runs great |
| Mistral NeMo 12B | 12.2B | Q4_K_M | 6.9 GB | 1.25 GB | 8.7 GB | 5.7 GB | 44K | 85 | Runs great |
| Gemma 4 12B | 12B | Q4_K_M | 6.7 GB | 0.81 GB | 8.2 GB | 6.2 GB | 107K | 86 | Runs great |
| Qwen3.5 9B | 9.65B | Q4_K_M | 5.4 GB | 0.25 GB | 6.3 GB | 8.1 GB | 256K | 107 | Runs great |
| Ornith 1.5 9B | 9.41B | Q4_K_M | 5.3 GB | 0.25 GB | 6.1 GB | 8.3 GB | 256K | 110 | Runs great |
| Ministral 3 8B | 8.92B | Q4_K_M | 5.0 GB | 1.06 GB | 6.7 GB | 7.7 GB | 66K | 116 | Runs great |
| Granite 4.1 8B | 8.79B | Q4_K_M | 4.9 GB | 1.25 GB | 6.8 GB | 7.6 GB | 56K | 118 | Runs great |
| LFM2.5 8B-A1B | 8.47B MoE | Q4_K_M | 4.8 GB | 0.09 GB | 5.5 GB | 8.9 GB | 125K | 265 | Runs great |
| Fara 7B | 8.29B | Q4_K_M | 4.7 GB | 0.44 GB | 5.7 GB | 8.7 GB | 125K | 125 | Runs great |
| Qwen3 8B | 8.19B | Q4_K_M | 4.6 GB | 1.13 GB | 6.3 GB | 8.1 GB | 65K | 126 | Runs great |
| Llama 3.1 8B Instruct | 8.03B | Q4_K_M | 4.5 GB | 1.00 GB | 6.1 GB | 8.3 GB | 74K | 129 | Runs great |
| Gemma 4 E4B | 8.0B | Q4_K_M | 4.5 GB | 0.14 GB | 5.2 GB | 9.2 GB | 128K | 129 | Runs great |
| Ling 3.0 Tiny 7.9B-A1.3B | 7.9B MoE | Q4_K_M | 4.4 GB | 0.05 GB | 5.1 GB | 9.3 GB | 128K | 306 | Runs great |
| DeepSeek-R1-Distill-Qwen 7B | 7.62B | Q4_K_M | 4.3 GB | 0.44 GB | 5.3 GB | 9.1 GB | 128K | 136 | Runs great |
| Qwen2.5-Coder 7B | 7.62B | Q4_K_M | 4.3 GB | 0.44 GB | 5.3 GB | 9.1 GB | 128K | 136 | Runs great |
| Olmo 3 7B Instruct | 7.3B | Q4_K_M | 4.1 GB | 2.50 GB | 7.2 GB | 7.2 GB | 64K | 142 | Runs great |
| Mistral 7B Instruct v0.3 | 7.25B | Q4_K_M | 4.1 GB | 1.00 GB | 5.7 GB | 8.7 GB | 32K | 143 | Runs great |
| Gemma 4 E2B | 5.1B | Q4_K_M | 2.9 GB | 0.07 GB | 3.5 GB | 10.9 GB | 128K | 203 | Runs great |
| Qwen3.5 4B | 4.66B | Q4_K_M | 2.6 GB | 0.25 GB | 3.5 GB | 10.9 GB | 256K | 222 | Runs great |
| Gemma 3 4B | 4.3B | Q4_K_M | 2.4 GB | 0.30 GB | 3.3 GB | 11.1 GB | 128K | 240 | Runs great |
| Qwen3 4B | 4.02B | Q4_K_M | 2.3 GB | 1.13 GB | 4.0 GB | 10.4 GB | 32K | 257 | Runs great |
| Ministral 3 3B | 3.85B | Q4_K_M | 2.2 GB | 0.81 GB | 3.6 GB | 10.8 GB | 114K | 268 | Runs great |
| Phi-4-mini 3.8B | 3.84B | Q4_K_M | 2.2 GB | 1.00 GB | 3.8 GB | 10.6 GB | 93K | 269 | Runs great |
| Granite 4.1 3B | 3.4B | Q4_K_M | 1.9 GB | 0.63 GB | 3.1 GB | 11.3 GB | 128K | 304 | Runs great |
| Llama 3.2 3B Instruct | 3.21B | Q4_K_M | 1.8 GB | 0.88 GB | 3.3 GB | 11.1 GB | 109K | 322 | Runs great |
| LFM2.5 2.6B | 2.7B | Q4_K_M | 1.5 GB | 0.13 GB | 2.2 GB | 12.2 GB | 128K | 383 | Runs great |
| Qwen3.5 2B | 2.27B | Q4_K_M | 1.3 GB | 0.09 GB | 2.0 GB | 12.4 GB | 256K | 455 | Runs great |
| Qwen3 1.7B | 1.72B | Q4_K_M | 1.0 GB | 0.88 GB | 2.4 GB | 12.0 GB | 32K | 601 | Runs great |
| Llama 3.2 1B Instruct | 1.24B | Q4_K_M | 0.7 GB | 0.25 GB | 1.5 GB | 12.9 GB | 128K | 834 | Runs great |
| Gemma 3 1B | 1.0B | Q4_K_M | 0.6 GB | 0.04 GB | 1.2 GB | 13.2 GB | 32K | 1034 | Runs great |
| Qwen3.5 0.8B | 0.87B | Q4_K_M | 0.5 GB | 0.09 GB | 1.2 GB | 13.2 GB | 256K | 1188 | Runs great |
| Qwen3 0.6B | 0.6B | Q4_K_M | 0.3 GB | 0.88 GB | 1.8 GB | 12.6 GB | 32K | 1723 | Runs great |
Just out of reach
These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.
| Model | Params | Total @ Q4_K_M | Over budget | Tok/s est., offloaded | Needs |
|---|---|---|---|---|---|
| Qwen3.6 35B-A3B | 35.9B MoE | 20.9 GB | +6.5 GB | ~21 | 32 GB card |
| Ornith 1.5 35B-A3B | 35.9B MoE | 20.9 GB | +6.5 GB | ~21 | 32 GB card |
| LLM-jp 4 33B Thinking | 33.2B | 21.3 GB | +6.9 GB | ~4.8 | 32 GB card |
| Qwen3 32B | 32.8B | 21.0 GB | +6.6 GB | ~4.9 | 32 GB card |
| DeepSeek-R1-Distill-Qwen 32B | 32.8B | 21.0 GB | +6.6 GB | ~4.9 | 32 GB card |
| Qwen2.5-Coder 32B | 32.8B | 21.0 GB | +6.6 GB | ~4.9 | 32 GB card |
Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 14.4 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.