Best LLM for 16 GB VRAM · 2026

Best LLM for 16 GB VRAM: what fits, and what to run

Updated 8 Oct 2026 1 new this month

A 16 GB card hands a runtime about 14.4 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 38 of 80 models in the catalogue fit — 38 with headroom, 0 tightly. The pick for most people is Gemma 4 12B: The 12 GB generalist: text, image and audio in, 140+ languages. Speeds are estimated for a GeForce RTX 5080; the fit verdicts are the same for every card in the class.

Which one should I run?

One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.

RecommendationModelWhyQuant · totalTok/s est.
Best overall Gemma 4 12B
Google · Apache 2.0
The 12 GB generalist: text, image and audio in, 140+ languages. Q4_K_M · 8.2 GB 86 Runs great
Best for coding Qwen3.5 9B
Alibaba · Apache 2.0
The best coding model for 8–12 GB cards. Q4_K_M · 6.3 GB 107 Runs great
Best reasoning gpt-oss 20B
OpenAI · Apache 2.0
Low/medium/high reasoning effort in 13 GB. MXFP4 · 11.6 GB 120 Runs great
Best for writing Gemma 4 12B
Google · Apache 2.0
The 12 GB writing pick; 140+ languages. Q4_K_M · 8.2 GB 86 Runs great
Best vision Gemma 4 12B
Google · Apache 2.0
Image and audio understanding on 12 GB. Q4_K_M · 8.2 GB 86 Runs great
Best for agents gpt-oss 20B
OpenAI · Apache 2.0
Harmony-format tool calling, native 4-bit. MXFP4 · 11.6 GB 120 Runs great
Best translation Gemma 4 12B
Google · Apache 2.0
Broad language coverage on a 12 GB card. Q4_K_M · 8.2 GB 86 Runs great
Fastest good model gpt-oss 20B
OpenAI · Apache 2.0
3.6B active, native 4-bit. MXFP4 · 11.6 GB 120 Runs great
Best long context Qwen3.5 9B
Alibaba · Apache 2.0
262K native in 8–12 GB. Q4_K_M · 10.0 GB
at 128K context
107 Runs great

The long-context row is judged at 128K: Qwen3.5 9B holds that window on 16 GB at Q4_K_M with 4.00 GB of KV cache — that is why it can differ from the best overall pick.

Everything that fits 16 GB

Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.

ModelParamsQuantWeights+KV 8KTotalHeadroomMax contextTok/s est.
gpt-oss 20B 20.9B MoE MXFP4 10.8 GB 0.19 GB 11.6 GB 2.8 GB 126K 120 Runs great
Qwen3 14B 14.8B Q4_K_M 8.3 GB 1.25 GB 10.2 GB 4.2 GB 35K 70 Runs great
DeepSeek-R1-Distill-Qwen 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 4.0 GB 29K 70 Runs great
Qwen2.5-Coder 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 4.0 GB 29K 70 Runs great
Phi-4 14B 14.7B Q4_K_M 8.3 GB 1.56 GB 10.4 GB 4.0 GB 16K 70 Runs great
Ministral 3 14B 13.9B Q4_K_M 7.8 GB 1.25 GB 9.7 GB 4.7 GB 38K 74 Runs great
Gemma 3 12B 12.2B Q4_K_M 6.9 GB 0.81 GB 8.3 GB 6.1 GB 106K 85 Runs great
Mistral NeMo 12B 12.2B Q4_K_M 6.9 GB 1.25 GB 8.7 GB 5.7 GB 44K 85 Runs great
Gemma 4 12B 12B Q4_K_M 6.7 GB 0.81 GB 8.2 GB 6.2 GB 107K 86 Runs great
Qwen3.5 9B 9.65B Q4_K_M 5.4 GB 0.25 GB 6.3 GB 8.1 GB 256K 107 Runs great
Ornith 1.5 9B 9.41B Q4_K_M 5.3 GB 0.25 GB 6.1 GB 8.3 GB 256K 110 Runs great
Ministral 3 8B 8.92B Q4_K_M 5.0 GB 1.06 GB 6.7 GB 7.7 GB 66K 116 Runs great
Granite 4.1 8B 8.79B Q4_K_M 4.9 GB 1.25 GB 6.8 GB 7.6 GB 56K 118 Runs great
LFM2.5 8B-A1B 8.47B MoE Q4_K_M 4.8 GB 0.09 GB 5.5 GB 8.9 GB 125K 265 Runs great
Fara 7B 8.29B Q4_K_M 4.7 GB 0.44 GB 5.7 GB 8.7 GB 125K 125 Runs great
Qwen3 8B 8.19B Q4_K_M 4.6 GB 1.13 GB 6.3 GB 8.1 GB 65K 126 Runs great
Llama 3.1 8B Instruct 8.03B Q4_K_M 4.5 GB 1.00 GB 6.1 GB 8.3 GB 74K 129 Runs great
Gemma 4 E4B 8.0B Q4_K_M 4.5 GB 0.14 GB 5.2 GB 9.2 GB 128K 129 Runs great
Ling 3.0 Tiny 7.9B-A1.3B 7.9B MoE Q4_K_M 4.4 GB 0.05 GB 5.1 GB 9.3 GB 128K 306 Runs great
DeepSeek-R1-Distill-Qwen 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 9.1 GB 128K 136 Runs great
Qwen2.5-Coder 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 9.1 GB 128K 136 Runs great
Olmo 3 7B Instruct 7.3B Q4_K_M 4.1 GB 2.50 GB 7.2 GB 7.2 GB 64K 142 Runs great
Mistral 7B Instruct v0.3 7.25B Q4_K_M 4.1 GB 1.00 GB 5.7 GB 8.7 GB 32K 143 Runs great
Gemma 4 E2B 5.1B Q4_K_M 2.9 GB 0.07 GB 3.5 GB 10.9 GB 128K 203 Runs great
Qwen3.5 4B 4.66B Q4_K_M 2.6 GB 0.25 GB 3.5 GB 10.9 GB 256K 222 Runs great
Gemma 3 4B 4.3B Q4_K_M 2.4 GB 0.30 GB 3.3 GB 11.1 GB 128K 240 Runs great
Qwen3 4B 4.02B Q4_K_M 2.3 GB 1.13 GB 4.0 GB 10.4 GB 32K 257 Runs great
Ministral 3 3B 3.85B Q4_K_M 2.2 GB 0.81 GB 3.6 GB 10.8 GB 114K 268 Runs great
Phi-4-mini 3.8B 3.84B Q4_K_M 2.2 GB 1.00 GB 3.8 GB 10.6 GB 93K 269 Runs great
Granite 4.1 3B 3.4B Q4_K_M 1.9 GB 0.63 GB 3.1 GB 11.3 GB 128K 304 Runs great
Llama 3.2 3B Instruct 3.21B Q4_K_M 1.8 GB 0.88 GB 3.3 GB 11.1 GB 109K 322 Runs great
LFM2.5 2.6B 2.7B Q4_K_M 1.5 GB 0.13 GB 2.2 GB 12.2 GB 128K 383 Runs great
Qwen3.5 2B 2.27B Q4_K_M 1.3 GB 0.09 GB 2.0 GB 12.4 GB 256K 455 Runs great
Qwen3 1.7B 1.72B Q4_K_M 1.0 GB 0.88 GB 2.4 GB 12.0 GB 32K 601 Runs great
Llama 3.2 1B Instruct 1.24B Q4_K_M 0.7 GB 0.25 GB 1.5 GB 12.9 GB 128K 834 Runs great
Gemma 3 1B 1.0B Q4_K_M 0.6 GB 0.04 GB 1.2 GB 13.2 GB 32K 1034 Runs great
Qwen3.5 0.8B 0.87B Q4_K_M 0.5 GB 0.09 GB 1.2 GB 13.2 GB 256K 1188 Runs great
Qwen3 0.6B 0.6B Q4_K_M 0.3 GB 0.88 GB 1.8 GB 12.6 GB 32K 1723 Runs great

Just out of reach

These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.

ModelParamsTotal @ Q4_K_MOver budgetTok/s est., offloadedNeeds
Qwen3.6 35B-A3B 35.9B MoE 20.9 GB +6.5 GB ~21 32 GB card
Ornith 1.5 35B-A3B 35.9B MoE 20.9 GB +6.5 GB ~21 32 GB card
LLM-jp 4 33B Thinking 33.2B 21.3 GB +6.9 GB ~4.8 32 GB card
Qwen3 32B 32.8B 21.0 GB +6.6 GB ~4.9 32 GB card
DeepSeek-R1-Distill-Qwen 32B 32.8B 21.0 GB +6.6 GB ~4.9 32 GB card
Qwen2.5-Coder 32B 32.8B 21.0 GB +6.6 GB ~4.9 32 GB card

← 12 GB All VRAM classes 24 GB → Adjust context, quant or cache →

Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 14.4 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.