Best LLM for 32 GB VRAM · 2026
Best LLM for 32 GB VRAM: what fits, and what to run
A 32 GB card hands a runtime about 30.4 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 58 of 80 models in the catalogue fit — 58 with headroom, 0 tightly. The pick for most people is Qwen3.8 27B: Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Speeds are estimated for a GeForce RTX 5090; the fit verdicts are the same for every card in the class.
Which one should I run?
One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.
| Recommendation | Model | Why | Quant · total | Tok/s est. | |
|---|---|---|---|---|---|
| Best overall | Qwen3.8 27B Alibaba · Apache 2.0 |
Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. | Q4_K_M · 16.7 GB | 69 | Runs great |
| Best for coding | Qwen3.8 27B Alibaba · Apache 2.0 |
Terminal-Bench 73, DeepSWE 42 — a generation ahead of anything else that fits 24 GB. | Q4_K_M · 16.7 GB | 69 | Runs great |
| Best reasoning | Gemma 4 31B Google · Apache 2.0 |
89% AIME — the strongest maths of any model under 32B. | Q4_K_M · 20.2 GB | 62 | Runs great |
| Best for writing | Gemma 4 31B Google · Apache 2.0 |
The cleanest, least verbose prose of the 2026 24–32 GB class. | Q4_K_M · 20.2 GB | 62 | Runs great |
| Best vision | Qwen3.8 27B Alibaba · Apache 2.0 |
Image and video in, OSWorld 84 — the strongest local vision-language model at 24 GB. | Q4_K_M · 16.7 GB | 69 | Runs great |
| Best for agents | Qwen3.8 27B Alibaba · Apache 2.0 |
Computer use and tool calling are what 3.8 was trained for (OSWorld 84). | Q4_K_M · 16.7 GB | 69 | Runs great |
| Best translation | Qwen3.8 27B Alibaba · Apache 2.0 |
119 languages, and Qwen translations read as idiomatic rather than literal. | Q4_K_M · 16.7 GB | 69 | Runs great |
| Fastest good model | Qwen3.6 35B-A3B Alibaba · Apache 2.0 |
3.3B active per token: the fastest model that still competes with dense 27Bs. | Q4_K_M · 20.9 GB | 225 | Runs great |
| Best long context | Qwen3.8 27B Alibaba · Apache 2.0 |
262K native, and only 16 of 64 blocks keep a KV cache — long context is cheap here. | Q4_K_M · 24.2 GB at 128K context |
69 | Runs great |
The long-context row is judged at 128K: Qwen3.8 27B holds that window on 32 GB at Q4_K_M with 8.00 GB of KV cache — that is why it can differ from the best overall pick.
Everything that fits 32 GB
Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.
| Model | Params | Quant | Weights | +KV 8K | Total | Headroom | Max context | Tok/s est. | |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.6 35B-A3B | 35.9B MoE | Q4_K_M | 20.2 GB | 0.16 GB | 20.9 GB | 9.5 GB | 256K | 225 | Runs great |
| Ornith 1.5 35B-A3B | 35.9B MoE | Q4_K_M | 20.2 GB | 0.16 GB | 20.9 GB | 9.5 GB | 256K | 225 | Runs great |
| LLM-jp 4 33B Thinking | 33.2B | Q4_K_M | 18.7 GB | 2.00 GB | 21.3 GB | 9.1 GB | 44K | 58 | Runs great |
| Qwen3 32B | 32.8B | Q4_K_M | 18.4 GB | 2.00 GB | 21.0 GB | 9.4 GB | 45K | 59 | Runs great |
| DeepSeek-R1-Distill-Qwen 32B | 32.8B | Q4_K_M | 18.4 GB | 2.00 GB | 21.0 GB | 9.4 GB | 45K | 59 | Runs great |
| Qwen2.5-Coder 32B | 32.8B | Q4_K_M | 18.4 GB | 2.00 GB | 21.0 GB | 9.4 GB | 45K | 59 | Runs great |
| Olmo 3.1 32B Instruct | 32.2B | Q4_K_M | 18.1 GB | 1.25 GB | 20.0 GB | 10.4 GB | 64K | 60 | Runs great |
| Nemotron 3.5 Lightning 30B-A3B | 31.6B MoE | Q4_K_M | 17.8 GB | 0.05 GB | 18.4 GB | 12.0 GB | 256K | 232 | Runs great |
| Gemma 4 31B | 31.3B | Q4_K_M | 17.6 GB | 2.03 GB | 20.2 GB | 10.2 GB | 73K | 62 | Runs great |
| GLM-4.7-Flash 30B-A3B | 31.2B MoE | Q4_K_M | 17.5 GB | 0.41 GB | 18.6 GB | 11.8 GB | 198K | 247 | Runs great |
| Qwen3 30B-A3B | 30.5B MoE | Q4_K_M | 17.1 GB | 0.75 GB | 18.5 GB | 11.9 GB | 128K | 225 | Runs great |
| Qwen3 Coder 30B-A3B | 30.5B MoE | Q4_K_M | 17.1 GB | 0.75 GB | 18.5 GB | 11.9 GB | 134K | 225 | Runs great |
| Muse Glimmer 30B | 29.8B | Q4_K_M | 16.8 GB | 0.18 GB | 17.5 GB | 12.9 GB | 128K | 65 | Runs great |
| Granite 4.1 30B | 28.9B | Q4_K_M | 16.3 GB | 2.00 GB | 18.9 GB | 11.5 GB | 54K | 67 | Runs great |
| Qwen3.8 27B | 27.8B | Q4_K_M | 15.6 GB | 0.50 GB | 16.7 GB | 13.7 GB | 226K | 69 | Runs great |
| Qwen3.6 27B | 27.8B | Q4_K_M | 15.6 GB | 0.50 GB | 16.7 GB | 13.7 GB | 226K | 69 | Runs great |
| Gemma 3 27B | 27.4B | Q4_K_M | 15.4 GB | 1.03 GB | 17.0 GB | 13.4 GB | 128K | 70 | Runs great |
| Gemma 4 26B-A4B | 26.5B MoE | Q4_K_M | 14.9 GB | 0.51 GB | 16.0 GB | 14.4 GB | 256K | 195 | Runs great |
| Devstral Small 2 24B | 24B | Q4_K_M | 13.5 GB | 1.25 GB | 15.3 GB | 15.1 GB | 104K | 80 | Runs great |
| Mistral Small 3.2 24B | 23.6B | Q4_K_M | 13.3 GB | 1.25 GB | 15.1 GB | 15.3 GB | 105K | 82 | Runs great |
| gpt-oss 20B | 20.9B MoE | MXFP4 | 10.8 GB | 0.19 GB | 11.6 GB | 18.8 GB | 128K | 224 | Runs great |
| Qwen3 14B | 14.8B | Q4_K_M | 8.3 GB | 1.25 GB | 10.2 GB | 20.2 GB | 128K | 130 | Runs great |
| DeepSeek-R1-Distill-Qwen 14B | 14.8B | Q4_K_M | 8.3 GB | 1.50 GB | 10.4 GB | 20.0 GB | 114K | 130 | Runs great |
| Qwen2.5-Coder 14B | 14.8B | Q4_K_M | 8.3 GB | 1.50 GB | 10.4 GB | 20.0 GB | 114K | 130 | Runs great |
| Phi-4 14B | 14.7B | Q4_K_M | 8.3 GB | 1.56 GB | 10.4 GB | 20.0 GB | 16K | 131 | Runs great |
| Ministral 3 14B | 13.9B | Q4_K_M | 7.8 GB | 1.25 GB | 9.7 GB | 20.7 GB | 140K | 139 | Runs great |
| Gemma 3 12B | 12.2B | Q4_K_M | 6.9 GB | 0.81 GB | 8.3 GB | 22.1 GB | 128K | 158 | Runs great |
| Mistral NeMo 12B | 12.2B | Q4_K_M | 6.9 GB | 1.25 GB | 8.7 GB | 21.7 GB | 128K | 158 | Runs great |
| Gemma 4 12B | 12B | Q4_K_M | 6.7 GB | 0.81 GB | 8.2 GB | 22.2 GB | 256K | 161 | Runs great |
| Qwen3.5 9B | 9.65B | Q4_K_M | 5.4 GB | 0.25 GB | 6.3 GB | 24.1 GB | 256K | 200 | Runs great |
| Ornith 1.5 9B | 9.41B | Q4_K_M | 5.3 GB | 0.25 GB | 6.1 GB | 24.3 GB | 256K | 205 | Runs great |
| Ministral 3 8B | 8.92B | Q4_K_M | 5.0 GB | 1.06 GB | 6.7 GB | 23.7 GB | 186K | 216 | Runs great |
| Granite 4.1 8B | 8.79B | Q4_K_M | 4.9 GB | 1.25 GB | 6.8 GB | 23.6 GB | 128K | 219 | Runs great |
| LFM2.5 8B-A1B | 8.47B MoE | Q4_K_M | 4.8 GB | 0.09 GB | 5.5 GB | 24.9 GB | 125K | 495 | Runs great |
| Fara 7B | 8.29B | Q4_K_M | 4.7 GB | 0.44 GB | 5.7 GB | 24.7 GB | 125K | 233 | Runs great |
| Qwen3 8B | 8.19B | Q4_K_M | 4.6 GB | 1.13 GB | 6.3 GB | 24.1 GB | 128K | 236 | Runs great |
| Llama 3.1 8B Instruct | 8.03B | Q4_K_M | 4.5 GB | 1.00 GB | 6.1 GB | 24.3 GB | 128K | 240 | Runs great |
| Gemma 4 E4B | 8.0B | Q4_K_M | 4.5 GB | 0.14 GB | 5.2 GB | 25.2 GB | 128K | 241 | Runs great |
| Ling 3.0 Tiny 7.9B-A1.3B | 7.9B MoE | Q4_K_M | 4.4 GB | 0.05 GB | 5.1 GB | 25.3 GB | 128K | 571 | Runs great |
| DeepSeek-R1-Distill-Qwen 7B | 7.62B | Q4_K_M | 4.3 GB | 0.44 GB | 5.3 GB | 25.1 GB | 128K | 253 | Runs great |
| Qwen2.5-Coder 7B | 7.62B | Q4_K_M | 4.3 GB | 0.44 GB | 5.3 GB | 25.1 GB | 128K | 253 | Runs great |
| Olmo 3 7B Instruct | 7.3B | Q4_K_M | 4.1 GB | 2.50 GB | 7.2 GB | 23.2 GB | 64K | 264 | Runs great |
| Mistral 7B Instruct v0.3 | 7.25B | Q4_K_M | 4.1 GB | 1.00 GB | 5.7 GB | 24.7 GB | 32K | 266 | Runs great |
| Gemma 4 E2B | 5.1B | Q4_K_M | 2.9 GB | 0.07 GB | 3.5 GB | 26.9 GB | 128K | 378 | Runs great |
| Qwen3.5 4B | 4.66B | Q4_K_M | 2.6 GB | 0.25 GB | 3.5 GB | 26.9 GB | 256K | 414 | Runs great |
| Gemma 3 4B | 4.3B | Q4_K_M | 2.4 GB | 0.30 GB | 3.3 GB | 27.1 GB | 128K | 449 | Runs great |
| Qwen3 4B | 4.02B | Q4_K_M | 2.3 GB | 1.13 GB | 4.0 GB | 26.4 GB | 32K | 480 | Runs great |
| Ministral 3 3B | 3.85B | Q4_K_M | 2.2 GB | 0.81 GB | 3.6 GB | 26.8 GB | 256K | 501 | Runs great |
| Phi-4-mini 3.8B | 3.84B | Q4_K_M | 2.2 GB | 1.00 GB | 3.8 GB | 26.6 GB | 128K | 502 | Runs great |
| Granite 4.1 3B | 3.4B | Q4_K_M | 1.9 GB | 0.63 GB | 3.1 GB | 27.3 GB | 128K | 567 | Runs great |
| Llama 3.2 3B Instruct | 3.21B | Q4_K_M | 1.8 GB | 0.88 GB | 3.3 GB | 27.1 GB | 128K | 601 | Runs great |
| LFM2.5 2.6B | 2.7B | Q4_K_M | 1.5 GB | 0.13 GB | 2.2 GB | 28.2 GB | 128K | 715 | Runs great |
| Qwen3.5 2B | 2.27B | Q4_K_M | 1.3 GB | 0.09 GB | 2.0 GB | 28.4 GB | 256K | 850 | Runs great |
| Qwen3 1.7B | 1.72B | Q4_K_M | 1.0 GB | 0.88 GB | 2.4 GB | 28.0 GB | 32K | 1122 | Runs great |
| Llama 3.2 1B Instruct | 1.24B | Q4_K_M | 0.7 GB | 0.25 GB | 1.5 GB | 28.9 GB | 128K | 1556 | Runs great |
| Gemma 3 1B | 1.0B | Q4_K_M | 0.6 GB | 0.04 GB | 1.2 GB | 29.2 GB | 32K | 1929 | Runs great |
| Qwen3.5 0.8B | 0.87B | Q4_K_M | 0.5 GB | 0.09 GB | 1.2 GB | 29.2 GB | 256K | 2218 | Runs great |
| Qwen3 0.6B | 0.6B | Q4_K_M | 0.3 GB | 0.88 GB | 1.8 GB | 28.6 GB | 32K | 3215 | Runs great |
Just out of reach
These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.
| Model | Params | Total @ Q4_K_M | Over budget | Tok/s est., offloaded | Needs |
|---|---|---|---|---|---|
| Llama 3.3 70B Instruct | 70.6B | 42.8 GB | +12.4 GB | ~2.7 | 64 GB card |
| DeepSeek-R1-Distill-Llama 70B | 70.6B | 42.8 GB | +12.4 GB | ~2.7 | 64 GB card |
Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 30.4 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.