Best LLM for 12 GB VRAM · 2026

Best LLM for 12 GB VRAM: what fits, and what to run

Updated 8 Oct 2026 1 new this month

A 12 GB card hands a runtime about 10.6 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 37 of 80 models in the catalogue fit — 32 with headroom, 5 tightly. The pick for most people is Gemma 4 12B: The 12 GB generalist: text, image and audio in, 140+ languages. Speeds are estimated for a GeForce RTX 3060 12 GB; the fit verdicts are the same for every card in the class.

Which one should I run?

One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.

RecommendationModelWhyQuant · totalTok/s est.
Best overall Gemma 4 12B
Google · Apache 2.0
The 12 GB generalist: text, image and audio in, 140+ languages. Q4_K_M · 8.2 GB 32 Runs great
Best for coding Qwen3.5 9B
Alibaba · Apache 2.0
The best coding model for 8–12 GB cards. Q4_K_M · 6.3 GB 40 Runs great
Best reasoning Qwen3.5 9B
Alibaba · Apache 2.0
Thinking mode on a 12 GB card — ahead of the 2025 R1 distills. Q4_K_M · 6.3 GB 40 Runs great
Best for writing Gemma 4 12B
Google · Apache 2.0
The 12 GB writing pick; 140+ languages. Q4_K_M · 8.2 GB 32 Runs great
Best vision Gemma 4 12B
Google · Apache 2.0
Image and audio understanding on 12 GB. Q4_K_M · 8.2 GB 32 Runs great
Best for agents Granite 4.1 8B
IBM · Apache 2.0
Enterprise-grade tool calling in a dense 8B, no thinking overhead. Q4_K_M · 6.8 GB 44 Runs great
Best translation Gemma 4 12B
Google · Apache 2.0
Broad language coverage on a 12 GB card. Q4_K_M · 8.2 GB 32 Runs great
Fastest good model LFM2.5 8B-A1B
Liquid AI · LFM Open License v1.0
1.5B active; designed for laptops without a GPU. Q4_K_M · 5.5 GB 99 Runs great
Best long context Qwen3.5 4B
Alibaba · Apache 2.0
262K on 8 GB. Q4_K_M · 7.2 GB
at 128K context
83 Runs great

The long-context row is judged at 128K: Qwen3.5 4B holds that window on 12 GB at Q4_K_M with 4.00 GB of KV cache — that is why it can differ from the best overall pick.

Everything that fits 12 GB

Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.

ModelParamsQuantWeights+KV 8KTotalHeadroomMax contextTok/s est.
Gemma 3 12B 12.2B Q4_K_M 6.9 GB 0.81 GB 8.3 GB 2.3 GB 45K 32 Runs great
Mistral NeMo 12B 12.2B Q4_K_M 6.9 GB 1.25 GB 8.7 GB 1.9 GB 20K 32 Runs great
Gemma 4 12B 12B Q4_K_M 6.7 GB 0.81 GB 8.2 GB 2.4 GB 47K 32 Runs great
Qwen3.5 9B 9.65B Q4_K_M 5.4 GB 0.25 GB 6.3 GB 4.3 GB 146K 40 Runs great
Ornith 1.5 9B 9.41B Q4_K_M 5.3 GB 0.25 GB 6.1 GB 4.5 GB 150K 41 Runs great
Ministral 3 8B 8.92B Q4_K_M 5.0 GB 1.06 GB 6.7 GB 3.9 GB 37K 43 Runs great
Granite 4.1 8B 8.79B Q4_K_M 4.9 GB 1.25 GB 6.8 GB 3.8 GB 32K 44 Runs great
LFM2.5 8B-A1B 8.47B MoE Q4_K_M 4.8 GB 0.09 GB 5.5 GB 5.1 GB 125K 99 Runs great
Fara 7B 8.29B Q4_K_M 4.7 GB 0.44 GB 5.7 GB 4.9 GB 97K 47 Runs great
Qwen3 8B 8.19B Q4_K_M 4.6 GB 1.13 GB 6.3 GB 4.3 GB 38K 47 Runs great
Llama 3.1 8B Instruct 8.03B Q4_K_M 4.5 GB 1.00 GB 6.1 GB 4.5 GB 43K 48 Runs great
Gemma 4 E4B 8.0B Q4_K_M 4.5 GB 0.14 GB 5.2 GB 5.4 GB 128K 48 Runs great
Ling 3.0 Tiny 7.9B-A1.3B 7.9B MoE Q4_K_M 4.4 GB 0.05 GB 5.1 GB 5.5 GB 128K 115 Runs great
DeepSeek-R1-Distill-Qwen 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 5.3 GB 104K 51 Runs great
Qwen2.5-Coder 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 5.3 GB 104K 51 Runs great
Olmo 3 7B Instruct 7.3B Q4_K_M 4.1 GB 2.50 GB 7.2 GB 3.4 GB 35K 53 Runs great
Mistral 7B Instruct v0.3 7.25B Q4_K_M 4.1 GB 1.00 GB 5.7 GB 4.9 GB 32K 53 Runs great
Gemma 4 E2B 5.1B Q4_K_M 2.9 GB 0.07 GB 3.5 GB 7.1 GB 128K 76 Runs great
Qwen3.5 4B 4.66B Q4_K_M 2.6 GB 0.25 GB 3.5 GB 7.1 GB 236K 83 Runs great
Gemma 3 4B 4.3B Q4_K_M 2.4 GB 0.30 GB 3.3 GB 7.3 GB 128K 90 Runs great
Qwen3 4B 4.02B Q4_K_M 2.3 GB 1.13 GB 4.0 GB 6.6 GB 32K 96 Runs great
Ministral 3 3B 3.85B Q4_K_M 2.2 GB 0.81 GB 3.6 GB 7.0 GB 77K 101 Runs great
Phi-4-mini 3.8B 3.84B Q4_K_M 2.2 GB 1.00 GB 3.8 GB 6.8 GB 62K 101 Runs great
Granite 4.1 3B 3.4B Q4_K_M 1.9 GB 0.63 GB 3.1 GB 7.5 GB 103K 114 Runs great
Llama 3.2 3B Instruct 3.21B Q4_K_M 1.8 GB 0.88 GB 3.3 GB 7.3 GB 74K 121 Runs great
LFM2.5 2.6B 2.7B Q4_K_M 1.5 GB 0.13 GB 2.2 GB 8.4 GB 128K 144 Runs great
Qwen3.5 2B 2.27B Q4_K_M 1.3 GB 0.09 GB 2.0 GB 8.6 GB 256K 171 Runs great
Qwen3 1.7B 1.72B Q4_K_M 1.0 GB 0.88 GB 2.4 GB 8.2 GB 32K 225 Runs great
Llama 3.2 1B Instruct 1.24B Q4_K_M 0.7 GB 0.25 GB 1.5 GB 9.1 GB 128K 313 Runs great
Gemma 3 1B 1.0B Q4_K_M 0.6 GB 0.04 GB 1.2 GB 9.4 GB 32K 388 Runs great
Qwen3.5 0.8B 0.87B Q4_K_M 0.5 GB 0.09 GB 1.2 GB 9.4 GB 256K 445 Runs great
Qwen3 0.6B 0.6B Q4_K_M 0.3 GB 0.88 GB 1.8 GB 8.8 GB 32K 646 Runs great
Qwen3 14B 14.8B Q4_K_M 8.3 GB 1.25 GB 10.2 GB 0.4 GB 10K 26 Tight
DeepSeek-R1-Distill-Qwen 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 0.2 GB 8K 26 Tight
Qwen2.5-Coder 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 0.2 GB 8K 26 Tight
Phi-4 14B 14.7B Q4_K_M 8.3 GB 1.56 GB 10.4 GB 0.2 GB 8K 26 Tight
Ministral 3 14B 13.9B Q4_K_M 7.8 GB 1.25 GB 9.7 GB 0.9 GB 13K 28 Tight

Just out of reach

These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.

ModelParamsTotal @ Q4_K_MOver budgetTok/s est., offloadedNeeds
Qwen3.6 35B-A3B 35.9B MoE 20.9 GB +10.3 GB ~13 32 GB card
Ornith 1.5 35B-A3B 35.9B MoE 20.9 GB +10.3 GB ~13 32 GB card
LLM-jp 4 33B Thinking 33.2B 21.3 GB +10.7 GB ~3.0 32 GB card
Qwen3 32B 32.8B 21.0 GB +10.4 GB ~3.1 32 GB card
DeepSeek-R1-Distill-Qwen 32B 32.8B 21.0 GB +10.4 GB ~3.1 32 GB card
Qwen2.5-Coder 32B 32.8B 21.0 GB +10.4 GB ~3.1 32 GB card

← 8 GB All VRAM classes 16 GB → Adjust context, quant or cache →

Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 10.6 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.