Best LLM for 32 GB VRAM · 2026

Best LLM for 32 GB VRAM: what fits, and what to run

Updated 8 Oct 2026 1 new this month

A 32 GB card hands a runtime about 30.4 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 58 of 80 models in the catalogue fit — 58 with headroom, 0 tightly. The pick for most people is Qwen3.8 27B: Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Speeds are estimated for a GeForce RTX 5090; the fit verdicts are the same for every card in the class.

Cards in this class RTX 5090RTX 5000 AdaPro W7800

Which one should I run?

One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.

RecommendationModelWhyQuant · totalTok/s est.
Best overall Qwen3.8 27B
Alibaba · Apache 2.0
Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Q4_K_M · 16.7 GB 69 Runs great
Best for coding Qwen3.8 27B
Alibaba · Apache 2.0
Terminal-Bench 73, DeepSWE 42 — a generation ahead of anything else that fits 24 GB. Q4_K_M · 16.7 GB 69 Runs great
Best reasoning Gemma 4 31B
Google · Apache 2.0
89% AIME — the strongest maths of any model under 32B. Q4_K_M · 20.2 GB 62 Runs great
Best for writing Gemma 4 31B
Google · Apache 2.0
The cleanest, least verbose prose of the 2026 24–32 GB class. Q4_K_M · 20.2 GB 62 Runs great
Best vision Qwen3.8 27B
Alibaba · Apache 2.0
Image and video in, OSWorld 84 — the strongest local vision-language model at 24 GB. Q4_K_M · 16.7 GB 69 Runs great
Best for agents Qwen3.8 27B
Alibaba · Apache 2.0
Computer use and tool calling are what 3.8 was trained for (OSWorld 84). Q4_K_M · 16.7 GB 69 Runs great
Best translation Qwen3.8 27B
Alibaba · Apache 2.0
119 languages, and Qwen translations read as idiomatic rather than literal. Q4_K_M · 16.7 GB 69 Runs great
Fastest good model Qwen3.6 35B-A3B
Alibaba · Apache 2.0
3.3B active per token: the fastest model that still competes with dense 27Bs. Q4_K_M · 20.9 GB 225 Runs great
Best long context Qwen3.8 27B
Alibaba · Apache 2.0
262K native, and only 16 of 64 blocks keep a KV cache — long context is cheap here. Q4_K_M · 24.2 GB
at 128K context
69 Runs great

The long-context row is judged at 128K: Qwen3.8 27B holds that window on 32 GB at Q4_K_M with 8.00 GB of KV cache — that is why it can differ from the best overall pick.

Everything that fits 32 GB

Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.

ModelParamsQuantWeights+KV 8KTotalHeadroomMax contextTok/s est.
Qwen3.6 35B-A3B 35.9B MoE Q4_K_M 20.2 GB 0.16 GB 20.9 GB 9.5 GB 256K 225 Runs great
Ornith 1.5 35B-A3B 35.9B MoE Q4_K_M 20.2 GB 0.16 GB 20.9 GB 9.5 GB 256K 225 Runs great
LLM-jp 4 33B Thinking 33.2B Q4_K_M 18.7 GB 2.00 GB 21.3 GB 9.1 GB 44K 58 Runs great
Qwen3 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 9.4 GB 45K 59 Runs great
DeepSeek-R1-Distill-Qwen 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 9.4 GB 45K 59 Runs great
Qwen2.5-Coder 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 9.4 GB 45K 59 Runs great
Olmo 3.1 32B Instruct 32.2B Q4_K_M 18.1 GB 1.25 GB 20.0 GB 10.4 GB 64K 60 Runs great
Nemotron 3.5 Lightning 30B-A3B 31.6B MoE Q4_K_M 17.8 GB 0.05 GB 18.4 GB 12.0 GB 256K 232 Runs great
Gemma 4 31B 31.3B Q4_K_M 17.6 GB 2.03 GB 20.2 GB 10.2 GB 73K 62 Runs great
GLM-4.7-Flash 30B-A3B 31.2B MoE Q4_K_M 17.5 GB 0.41 GB 18.6 GB 11.8 GB 198K 247 Runs great
Qwen3 30B-A3B 30.5B MoE Q4_K_M 17.1 GB 0.75 GB 18.5 GB 11.9 GB 128K 225 Runs great
Qwen3 Coder 30B-A3B 30.5B MoE Q4_K_M 17.1 GB 0.75 GB 18.5 GB 11.9 GB 134K 225 Runs great
Muse Glimmer 30B 29.8B Q4_K_M 16.8 GB 0.18 GB 17.5 GB 12.9 GB 128K 65 Runs great
Granite 4.1 30B 28.9B Q4_K_M 16.3 GB 2.00 GB 18.9 GB 11.5 GB 54K 67 Runs great
Qwen3.8 27B 27.8B Q4_K_M 15.6 GB 0.50 GB 16.7 GB 13.7 GB 226K 69 Runs great
Qwen3.6 27B 27.8B Q4_K_M 15.6 GB 0.50 GB 16.7 GB 13.7 GB 226K 69 Runs great
Gemma 3 27B 27.4B Q4_K_M 15.4 GB 1.03 GB 17.0 GB 13.4 GB 128K 70 Runs great
Gemma 4 26B-A4B 26.5B MoE Q4_K_M 14.9 GB 0.51 GB 16.0 GB 14.4 GB 256K 195 Runs great
Devstral Small 2 24B 24B Q4_K_M 13.5 GB 1.25 GB 15.3 GB 15.1 GB 104K 80 Runs great
Mistral Small 3.2 24B 23.6B Q4_K_M 13.3 GB 1.25 GB 15.1 GB 15.3 GB 105K 82 Runs great
gpt-oss 20B 20.9B MoE MXFP4 10.8 GB 0.19 GB 11.6 GB 18.8 GB 128K 224 Runs great
Qwen3 14B 14.8B Q4_K_M 8.3 GB 1.25 GB 10.2 GB 20.2 GB 128K 130 Runs great
DeepSeek-R1-Distill-Qwen 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 20.0 GB 114K 130 Runs great
Qwen2.5-Coder 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 20.0 GB 114K 130 Runs great
Phi-4 14B 14.7B Q4_K_M 8.3 GB 1.56 GB 10.4 GB 20.0 GB 16K 131 Runs great
Ministral 3 14B 13.9B Q4_K_M 7.8 GB 1.25 GB 9.7 GB 20.7 GB 140K 139 Runs great
Gemma 3 12B 12.2B Q4_K_M 6.9 GB 0.81 GB 8.3 GB 22.1 GB 128K 158 Runs great
Mistral NeMo 12B 12.2B Q4_K_M 6.9 GB 1.25 GB 8.7 GB 21.7 GB 128K 158 Runs great
Gemma 4 12B 12B Q4_K_M 6.7 GB 0.81 GB 8.2 GB 22.2 GB 256K 161 Runs great
Qwen3.5 9B 9.65B Q4_K_M 5.4 GB 0.25 GB 6.3 GB 24.1 GB 256K 200 Runs great
Ornith 1.5 9B 9.41B Q4_K_M 5.3 GB 0.25 GB 6.1 GB 24.3 GB 256K 205 Runs great
Ministral 3 8B 8.92B Q4_K_M 5.0 GB 1.06 GB 6.7 GB 23.7 GB 186K 216 Runs great
Granite 4.1 8B 8.79B Q4_K_M 4.9 GB 1.25 GB 6.8 GB 23.6 GB 128K 219 Runs great
LFM2.5 8B-A1B 8.47B MoE Q4_K_M 4.8 GB 0.09 GB 5.5 GB 24.9 GB 125K 495 Runs great
Fara 7B 8.29B Q4_K_M 4.7 GB 0.44 GB 5.7 GB 24.7 GB 125K 233 Runs great
Qwen3 8B 8.19B Q4_K_M 4.6 GB 1.13 GB 6.3 GB 24.1 GB 128K 236 Runs great
Llama 3.1 8B Instruct 8.03B Q4_K_M 4.5 GB 1.00 GB 6.1 GB 24.3 GB 128K 240 Runs great
Gemma 4 E4B 8.0B Q4_K_M 4.5 GB 0.14 GB 5.2 GB 25.2 GB 128K 241 Runs great
Ling 3.0 Tiny 7.9B-A1.3B 7.9B MoE Q4_K_M 4.4 GB 0.05 GB 5.1 GB 25.3 GB 128K 571 Runs great
DeepSeek-R1-Distill-Qwen 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 25.1 GB 128K 253 Runs great
Qwen2.5-Coder 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 25.1 GB 128K 253 Runs great
Olmo 3 7B Instruct 7.3B Q4_K_M 4.1 GB 2.50 GB 7.2 GB 23.2 GB 64K 264 Runs great
Mistral 7B Instruct v0.3 7.25B Q4_K_M 4.1 GB 1.00 GB 5.7 GB 24.7 GB 32K 266 Runs great
Gemma 4 E2B 5.1B Q4_K_M 2.9 GB 0.07 GB 3.5 GB 26.9 GB 128K 378 Runs great
Qwen3.5 4B 4.66B Q4_K_M 2.6 GB 0.25 GB 3.5 GB 26.9 GB 256K 414 Runs great
Gemma 3 4B 4.3B Q4_K_M 2.4 GB 0.30 GB 3.3 GB 27.1 GB 128K 449 Runs great
Qwen3 4B 4.02B Q4_K_M 2.3 GB 1.13 GB 4.0 GB 26.4 GB 32K 480 Runs great
Ministral 3 3B 3.85B Q4_K_M 2.2 GB 0.81 GB 3.6 GB 26.8 GB 256K 501 Runs great
Phi-4-mini 3.8B 3.84B Q4_K_M 2.2 GB 1.00 GB 3.8 GB 26.6 GB 128K 502 Runs great
Granite 4.1 3B 3.4B Q4_K_M 1.9 GB 0.63 GB 3.1 GB 27.3 GB 128K 567 Runs great
Llama 3.2 3B Instruct 3.21B Q4_K_M 1.8 GB 0.88 GB 3.3 GB 27.1 GB 128K 601 Runs great
LFM2.5 2.6B 2.7B Q4_K_M 1.5 GB 0.13 GB 2.2 GB 28.2 GB 128K 715 Runs great
Qwen3.5 2B 2.27B Q4_K_M 1.3 GB 0.09 GB 2.0 GB 28.4 GB 256K 850 Runs great
Qwen3 1.7B 1.72B Q4_K_M 1.0 GB 0.88 GB 2.4 GB 28.0 GB 32K 1122 Runs great
Llama 3.2 1B Instruct 1.24B Q4_K_M 0.7 GB 0.25 GB 1.5 GB 28.9 GB 128K 1556 Runs great
Gemma 3 1B 1.0B Q4_K_M 0.6 GB 0.04 GB 1.2 GB 29.2 GB 32K 1929 Runs great
Qwen3.5 0.8B 0.87B Q4_K_M 0.5 GB 0.09 GB 1.2 GB 29.2 GB 256K 2218 Runs great
Qwen3 0.6B 0.6B Q4_K_M 0.3 GB 0.88 GB 1.8 GB 28.6 GB 32K 3215 Runs great

Just out of reach

These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.

ModelParamsTotal @ Q4_K_MOver budgetTok/s est., offloadedNeeds
Llama 3.3 70B Instruct 70.6B 42.8 GB +12.4 GB ~2.7 64 GB card
DeepSeek-R1-Distill-Llama 70B 70.6B 42.8 GB +12.4 GB ~2.7 64 GB card

← 24 GB All VRAM classes 48 GB → Adjust context, quant or cache →

Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 30.4 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.