Best LLM for 24 GB VRAM · 2026

Best LLM for 24 GB VRAM: what fits, and what to run

Updated 8 Oct 2026 1 new this month

A 24 GB card hands a runtime about 22.4 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 58 of 80 models in the catalogue fit — 50 with headroom, 8 tightly. The pick for most people is Qwen3.8 27B: Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Speeds are estimated for a GeForce RTX 4090; the fit verdicts are the same for every card in the class.

Which one should I run?

One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.

RecommendationModelWhyQuant · totalTok/s est.
Best overall Qwen3.8 27B
Alibaba · Apache 2.0
Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Q4_K_M · 16.7 GB 39 Runs great
Best for coding Qwen3.8 27B
Alibaba · Apache 2.0
Terminal-Bench 73, DeepSWE 42 — a generation ahead of anything else that fits 24 GB. Q4_K_M · 16.7 GB 39 Runs great
Best reasoning Qwen3.8 27B
Alibaba · Apache 2.0
Thinking mode plus the best agentic reasoning at 24 GB. Q4_K_M · 16.7 GB 39 Runs great
Best for writing Gemma 4 26B-A4B
Google · Apache 2.0
Gemma 4 prose at MoE speed, with room for a long draft in context. Q4_K_M · 16.0 GB 110 Runs great
Best vision Qwen3.8 27B
Alibaba · Apache 2.0
Image and video in, OSWorld 84 — the strongest local vision-language model at 24 GB. Q4_K_M · 16.7 GB 39 Runs great
Best for agents Qwen3.8 27B
Alibaba · Apache 2.0
Computer use and tool calling are what 3.8 was trained for (OSWorld 84). Q4_K_M · 16.7 GB 39 Runs great
Best translation Qwen3.8 27B
Alibaba · Apache 2.0
119 languages, and Qwen translations read as idiomatic rather than literal. Q4_K_M · 16.7 GB 39 Runs great
Fastest good model Gemma 4 26B-A4B
Google · Apache 2.0
3.8B active and a small file — the quickest Gemma 4 with vision. Q4_K_M · 16.0 GB 110 Runs great
Best long context Nemotron 3.5 Lightning 30B-A3B
NVIDIA · OpenMDW-1.1
262K, and a Mamba hybrid whose cache barely grows. Q4_K_M · 19.1 GB
at 128K context
130 Tight fit

The long-context row is judged at 128K: Nemotron 3.5 Lightning 30B-A3B holds that window on 24 GB at Q4_K_M with 0.75 GB of KV cache — that is why it can differ from the best overall pick.

Everything that fits 24 GB

Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.

ModelParamsQuantWeights+KV 8KTotalHeadroomMax contextTok/s est.
Nemotron 3.5 Lightning 30B-A3B 31.6B MoE Q4_K_M 17.8 GB 0.05 GB 18.4 GB 4.0 GB 256K 130 Runs great
GLM-4.7-Flash 30B-A3B 31.2B MoE Q4_K_M 17.5 GB 0.41 GB 18.6 GB 3.8 GB 82K 139 Runs great
Qwen3 30B-A3B 30.5B MoE Q4_K_M 17.1 GB 0.75 GB 18.5 GB 3.9 GB 49K 126 Runs great
Qwen3 Coder 30B-A3B 30.5B MoE Q4_K_M 17.1 GB 0.75 GB 18.5 GB 3.9 GB 49K 126 Runs great
Muse Glimmer 30B 29.8B Q4_K_M 16.8 GB 0.18 GB 17.5 GB 4.9 GB 128K 36 Runs great
Granite 4.1 30B 28.9B Q4_K_M 16.3 GB 2.00 GB 18.9 GB 3.5 GB 22K 38 Runs great
Qwen3.8 27B 27.8B Q4_K_M 15.6 GB 0.50 GB 16.7 GB 5.7 GB 98K 39 Runs great
Qwen3.6 27B 27.8B Q4_K_M 15.6 GB 0.50 GB 16.7 GB 5.7 GB 98K 39 Runs great
Gemma 3 27B 27.4B Q4_K_M 15.4 GB 1.03 GB 17.0 GB 5.4 GB 76K 40 Runs great
Gemma 4 26B-A4B 26.5B MoE Q4_K_M 14.9 GB 0.51 GB 16.0 GB 6.4 GB 171K 110 Runs great
Devstral Small 2 24B 24B Q4_K_M 13.5 GB 1.25 GB 15.3 GB 7.1 GB 53K 45 Runs great
Mistral Small 3.2 24B 23.6B Q4_K_M 13.3 GB 1.25 GB 15.1 GB 7.3 GB 54K 46 Runs great
gpt-oss 20B 20.9B MoE MXFP4 10.8 GB 0.19 GB 11.6 GB 10.8 GB 128K 126 Runs great
Qwen3 14B 14.8B Q4_K_M 8.3 GB 1.25 GB 10.2 GB 12.2 GB 86K 73 Runs great
DeepSeek-R1-Distill-Qwen 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 12.0 GB 71K 73 Runs great
Qwen2.5-Coder 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 12.0 GB 71K 73 Runs great
Phi-4 14B 14.7B Q4_K_M 8.3 GB 1.56 GB 10.4 GB 12.0 GB 16K 74 Runs great
Ministral 3 14B 13.9B Q4_K_M 7.8 GB 1.25 GB 9.7 GB 12.7 GB 89K 78 Runs great
Gemma 3 12B 12.2B Q4_K_M 6.9 GB 0.81 GB 8.3 GB 14.1 GB 128K 89 Runs great
Mistral NeMo 12B 12.2B Q4_K_M 6.9 GB 1.25 GB 8.7 GB 13.7 GB 95K 89 Runs great
Gemma 4 12B 12B Q4_K_M 6.7 GB 0.81 GB 8.2 GB 14.2 GB 235K 90 Runs great
Qwen3.5 9B 9.65B Q4_K_M 5.4 GB 0.25 GB 6.3 GB 16.1 GB 256K 112 Runs great
Ornith 1.5 9B 9.41B Q4_K_M 5.3 GB 0.25 GB 6.1 GB 16.3 GB 256K 115 Runs great
Ministral 3 8B 8.92B Q4_K_M 5.0 GB 1.06 GB 6.7 GB 15.7 GB 126K 122 Runs great
Granite 4.1 8B 8.79B Q4_K_M 4.9 GB 1.25 GB 6.8 GB 15.6 GB 107K 123 Runs great
LFM2.5 8B-A1B 8.47B MoE Q4_K_M 4.8 GB 0.09 GB 5.5 GB 16.9 GB 125K 278 Runs great
Fara 7B 8.29B Q4_K_M 4.7 GB 0.44 GB 5.7 GB 16.7 GB 125K 131 Runs great
Qwen3 8B 8.19B Q4_K_M 4.6 GB 1.13 GB 6.3 GB 16.1 GB 122K 133 Runs great
Llama 3.1 8B Instruct 8.03B Q4_K_M 4.5 GB 1.00 GB 6.1 GB 16.3 GB 128K 135 Runs great
Gemma 4 E4B 8.0B Q4_K_M 4.5 GB 0.14 GB 5.2 GB 17.2 GB 128K 136 Runs great
Ling 3.0 Tiny 7.9B-A1.3B 7.9B MoE Q4_K_M 4.4 GB 0.05 GB 5.1 GB 17.3 GB 128K 321 Runs great
DeepSeek-R1-Distill-Qwen 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 17.1 GB 128K 142 Runs great
Qwen2.5-Coder 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 17.1 GB 128K 142 Runs great
Olmo 3 7B Instruct 7.3B Q4_K_M 4.1 GB 2.50 GB 7.2 GB 15.2 GB 64K 149 Runs great
Mistral 7B Instruct v0.3 7.25B Q4_K_M 4.1 GB 1.00 GB 5.7 GB 16.7 GB 32K 150 Runs great
Gemma 4 E2B 5.1B Q4_K_M 2.9 GB 0.07 GB 3.5 GB 18.9 GB 128K 213 Runs great
Qwen3.5 4B 4.66B Q4_K_M 2.6 GB 0.25 GB 3.5 GB 18.9 GB 256K 233 Runs great
Gemma 3 4B 4.3B Q4_K_M 2.4 GB 0.30 GB 3.3 GB 19.1 GB 128K 252 Runs great
Qwen3 4B 4.02B Q4_K_M 2.3 GB 1.13 GB 4.0 GB 18.4 GB 32K 270 Runs great
Ministral 3 3B 3.85B Q4_K_M 2.2 GB 0.81 GB 3.6 GB 18.8 GB 193K 282 Runs great
Phi-4-mini 3.8B 3.84B Q4_K_M 2.2 GB 1.00 GB 3.8 GB 18.6 GB 128K 283 Runs great
Granite 4.1 3B 3.4B Q4_K_M 1.9 GB 0.63 GB 3.1 GB 19.3 GB 128K 319 Runs great
Llama 3.2 3B Instruct 3.21B Q4_K_M 1.8 GB 0.88 GB 3.3 GB 19.1 GB 128K 338 Runs great
LFM2.5 2.6B 2.7B Q4_K_M 1.5 GB 0.13 GB 2.2 GB 20.2 GB 128K 402 Runs great
Qwen3.5 2B 2.27B Q4_K_M 1.3 GB 0.09 GB 2.0 GB 20.4 GB 256K 478 Runs great
Qwen3 1.7B 1.72B Q4_K_M 1.0 GB 0.88 GB 2.4 GB 20.0 GB 32K 631 Runs great
Llama 3.2 1B Instruct 1.24B Q4_K_M 0.7 GB 0.25 GB 1.5 GB 20.9 GB 128K 875 Runs great
Gemma 3 1B 1.0B Q4_K_M 0.6 GB 0.04 GB 1.2 GB 21.2 GB 32K 1085 Runs great
Qwen3.5 0.8B 0.87B Q4_K_M 0.5 GB 0.09 GB 1.2 GB 21.2 GB 256K 1247 Runs great
Qwen3 0.6B 0.6B Q4_K_M 0.3 GB 0.88 GB 1.8 GB 20.6 GB 32K 1809 Runs great
Qwen3.6 35B-A3B 35.9B MoE Q4_K_M 20.2 GB 0.16 GB 20.9 GB 1.5 GB 82K 126 Tight
Ornith 1.5 35B-A3B 35.9B MoE Q4_K_M 20.2 GB 0.16 GB 20.9 GB 1.5 GB 82K 126 Tight
LLM-jp 4 33B Thinking 33.2B Q4_K_M 18.7 GB 2.00 GB 21.3 GB 1.1 GB 12K 33 Tight
Qwen3 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 1.4 GB 13K 33 Tight
DeepSeek-R1-Distill-Qwen 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 1.4 GB 13K 33 Tight
Qwen2.5-Coder 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 1.4 GB 13K 33 Tight
Olmo 3.1 32B Instruct 32.2B Q4_K_M 18.1 GB 1.25 GB 20.0 GB 2.4 GB 47K 34 Tight
Gemma 4 31B 31.3B Q4_K_M 17.6 GB 2.03 GB 20.2 GB 2.2 GB 21K 35 Tight

Just out of reach

These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.

ModelParamsTotal @ Q4_K_MOver budgetTok/s est., offloadedNeeds
Llama 3.3 70B Instruct 70.6B 42.8 GB +20.4 GB ~1.7 64 GB card
DeepSeek-R1-Distill-Llama 70B 70.6B 42.8 GB +20.4 GB ~1.7 64 GB card

← 16 GB All VRAM classes 32 GB → Adjust context, quant or cache →

Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 22.4 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.