Best LLM for 12 GB VRAM · 2026
Best LLM for 12 GB VRAM: what fits, and what to run
A 12 GB card hands a runtime about 10.6 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 37 of 80 models in the catalogue fit — 32 with headroom, 5 tightly. The pick for most people is Gemma 4 12B: The 12 GB generalist: text, image and audio in, 140+ languages. Speeds are estimated for a GeForce RTX 3060 12 GB; the fit verdicts are the same for every card in the class.
Which one should I run?
One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.
| Recommendation | Model | Why | Quant · total | Tok/s est. | |
|---|---|---|---|---|---|
| Best overall | Gemma 4 12B Google · Apache 2.0 |
The 12 GB generalist: text, image and audio in, 140+ languages. | Q4_K_M · 8.2 GB | 32 | Runs great |
| Best for coding | Qwen3.5 9B Alibaba · Apache 2.0 |
The best coding model for 8–12 GB cards. | Q4_K_M · 6.3 GB | 40 | Runs great |
| Best reasoning | Qwen3.5 9B Alibaba · Apache 2.0 |
Thinking mode on a 12 GB card — ahead of the 2025 R1 distills. | Q4_K_M · 6.3 GB | 40 | Runs great |
| Best for writing | Gemma 4 12B Google · Apache 2.0 |
The 12 GB writing pick; 140+ languages. | Q4_K_M · 8.2 GB | 32 | Runs great |
| Best vision | Gemma 4 12B Google · Apache 2.0 |
Image and audio understanding on 12 GB. | Q4_K_M · 8.2 GB | 32 | Runs great |
| Best for agents | Granite 4.1 8B IBM · Apache 2.0 |
Enterprise-grade tool calling in a dense 8B, no thinking overhead. | Q4_K_M · 6.8 GB | 44 | Runs great |
| Best translation | Gemma 4 12B Google · Apache 2.0 |
Broad language coverage on a 12 GB card. | Q4_K_M · 8.2 GB | 32 | Runs great |
| Fastest good model | LFM2.5 8B-A1B Liquid AI · LFM Open License v1.0 |
1.5B active; designed for laptops without a GPU. | Q4_K_M · 5.5 GB | 99 | Runs great |
| Best long context | Qwen3.5 4B Alibaba · Apache 2.0 |
262K on 8 GB. | Q4_K_M · 7.2 GB at 128K context |
83 | Runs great |
The long-context row is judged at 128K: Qwen3.5 4B holds that window on 12 GB at Q4_K_M with 4.00 GB of KV cache — that is why it can differ from the best overall pick.
Everything that fits 12 GB
Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.
| Model | Params | Quant | Weights | +KV 8K | Total | Headroom | Max context | Tok/s est. | |
|---|---|---|---|---|---|---|---|---|---|
| Gemma 3 12B | 12.2B | Q4_K_M | 6.9 GB | 0.81 GB | 8.3 GB | 2.3 GB | 45K | 32 | Runs great |
| Mistral NeMo 12B | 12.2B | Q4_K_M | 6.9 GB | 1.25 GB | 8.7 GB | 1.9 GB | 20K | 32 | Runs great |
| Gemma 4 12B | 12B | Q4_K_M | 6.7 GB | 0.81 GB | 8.2 GB | 2.4 GB | 47K | 32 | Runs great |
| Qwen3.5 9B | 9.65B | Q4_K_M | 5.4 GB | 0.25 GB | 6.3 GB | 4.3 GB | 146K | 40 | Runs great |
| Ornith 1.5 9B | 9.41B | Q4_K_M | 5.3 GB | 0.25 GB | 6.1 GB | 4.5 GB | 150K | 41 | Runs great |
| Ministral 3 8B | 8.92B | Q4_K_M | 5.0 GB | 1.06 GB | 6.7 GB | 3.9 GB | 37K | 43 | Runs great |
| Granite 4.1 8B | 8.79B | Q4_K_M | 4.9 GB | 1.25 GB | 6.8 GB | 3.8 GB | 32K | 44 | Runs great |
| LFM2.5 8B-A1B | 8.47B MoE | Q4_K_M | 4.8 GB | 0.09 GB | 5.5 GB | 5.1 GB | 125K | 99 | Runs great |
| Fara 7B | 8.29B | Q4_K_M | 4.7 GB | 0.44 GB | 5.7 GB | 4.9 GB | 97K | 47 | Runs great |
| Qwen3 8B | 8.19B | Q4_K_M | 4.6 GB | 1.13 GB | 6.3 GB | 4.3 GB | 38K | 47 | Runs great |
| Llama 3.1 8B Instruct | 8.03B | Q4_K_M | 4.5 GB | 1.00 GB | 6.1 GB | 4.5 GB | 43K | 48 | Runs great |
| Gemma 4 E4B | 8.0B | Q4_K_M | 4.5 GB | 0.14 GB | 5.2 GB | 5.4 GB | 128K | 48 | Runs great |
| Ling 3.0 Tiny 7.9B-A1.3B | 7.9B MoE | Q4_K_M | 4.4 GB | 0.05 GB | 5.1 GB | 5.5 GB | 128K | 115 | Runs great |
| DeepSeek-R1-Distill-Qwen 7B | 7.62B | Q4_K_M | 4.3 GB | 0.44 GB | 5.3 GB | 5.3 GB | 104K | 51 | Runs great |
| Qwen2.5-Coder 7B | 7.62B | Q4_K_M | 4.3 GB | 0.44 GB | 5.3 GB | 5.3 GB | 104K | 51 | Runs great |
| Olmo 3 7B Instruct | 7.3B | Q4_K_M | 4.1 GB | 2.50 GB | 7.2 GB | 3.4 GB | 35K | 53 | Runs great |
| Mistral 7B Instruct v0.3 | 7.25B | Q4_K_M | 4.1 GB | 1.00 GB | 5.7 GB | 4.9 GB | 32K | 53 | Runs great |
| Gemma 4 E2B | 5.1B | Q4_K_M | 2.9 GB | 0.07 GB | 3.5 GB | 7.1 GB | 128K | 76 | Runs great |
| Qwen3.5 4B | 4.66B | Q4_K_M | 2.6 GB | 0.25 GB | 3.5 GB | 7.1 GB | 236K | 83 | Runs great |
| Gemma 3 4B | 4.3B | Q4_K_M | 2.4 GB | 0.30 GB | 3.3 GB | 7.3 GB | 128K | 90 | Runs great |
| Qwen3 4B | 4.02B | Q4_K_M | 2.3 GB | 1.13 GB | 4.0 GB | 6.6 GB | 32K | 96 | Runs great |
| Ministral 3 3B | 3.85B | Q4_K_M | 2.2 GB | 0.81 GB | 3.6 GB | 7.0 GB | 77K | 101 | Runs great |
| Phi-4-mini 3.8B | 3.84B | Q4_K_M | 2.2 GB | 1.00 GB | 3.8 GB | 6.8 GB | 62K | 101 | Runs great |
| Granite 4.1 3B | 3.4B | Q4_K_M | 1.9 GB | 0.63 GB | 3.1 GB | 7.5 GB | 103K | 114 | Runs great |
| Llama 3.2 3B Instruct | 3.21B | Q4_K_M | 1.8 GB | 0.88 GB | 3.3 GB | 7.3 GB | 74K | 121 | Runs great |
| LFM2.5 2.6B | 2.7B | Q4_K_M | 1.5 GB | 0.13 GB | 2.2 GB | 8.4 GB | 128K | 144 | Runs great |
| Qwen3.5 2B | 2.27B | Q4_K_M | 1.3 GB | 0.09 GB | 2.0 GB | 8.6 GB | 256K | 171 | Runs great |
| Qwen3 1.7B | 1.72B | Q4_K_M | 1.0 GB | 0.88 GB | 2.4 GB | 8.2 GB | 32K | 225 | Runs great |
| Llama 3.2 1B Instruct | 1.24B | Q4_K_M | 0.7 GB | 0.25 GB | 1.5 GB | 9.1 GB | 128K | 313 | Runs great |
| Gemma 3 1B | 1.0B | Q4_K_M | 0.6 GB | 0.04 GB | 1.2 GB | 9.4 GB | 32K | 388 | Runs great |
| Qwen3.5 0.8B | 0.87B | Q4_K_M | 0.5 GB | 0.09 GB | 1.2 GB | 9.4 GB | 256K | 445 | Runs great |
| Qwen3 0.6B | 0.6B | Q4_K_M | 0.3 GB | 0.88 GB | 1.8 GB | 8.8 GB | 32K | 646 | Runs great |
| Qwen3 14B | 14.8B | Q4_K_M | 8.3 GB | 1.25 GB | 10.2 GB | 0.4 GB | 10K | 26 | Tight |
| DeepSeek-R1-Distill-Qwen 14B | 14.8B | Q4_K_M | 8.3 GB | 1.50 GB | 10.4 GB | 0.2 GB | 8K | 26 | Tight |
| Qwen2.5-Coder 14B | 14.8B | Q4_K_M | 8.3 GB | 1.50 GB | 10.4 GB | 0.2 GB | 8K | 26 | Tight |
| Phi-4 14B | 14.7B | Q4_K_M | 8.3 GB | 1.56 GB | 10.4 GB | 0.2 GB | 8K | 26 | Tight |
| Ministral 3 14B | 13.9B | Q4_K_M | 7.8 GB | 1.25 GB | 9.7 GB | 0.9 GB | 13K | 28 | Tight |
Just out of reach
These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.
| Model | Params | Total @ Q4_K_M | Over budget | Tok/s est., offloaded | Needs |
|---|---|---|---|---|---|
| Qwen3.6 35B-A3B | 35.9B MoE | 20.9 GB | +10.3 GB | ~13 | 32 GB card |
| Ornith 1.5 35B-A3B | 35.9B MoE | 20.9 GB | +10.3 GB | ~13 | 32 GB card |
| LLM-jp 4 33B Thinking | 33.2B | 21.3 GB | +10.7 GB | ~3.0 | 32 GB card |
| Qwen3 32B | 32.8B | 21.0 GB | +10.4 GB | ~3.1 | 32 GB card |
| DeepSeek-R1-Distill-Qwen 32B | 32.8B | 21.0 GB | +10.4 GB | ~3.1 | 32 GB card |
| Qwen2.5-Coder 32B | 32.8B | 21.0 GB | +10.4 GB | ~3.1 | 32 GB card |
Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 10.6 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.