Best LLM for 48 GB VRAM · 2026

Best LLM for 48 GB VRAM: what fits, and what to run

Updated 8 Oct 2026 1 new this month

A 48 GB card hands a runtime about 46.4 GB once the display and driver have taken their share. At Q4_K_M with an 8K context, 60 of 80 models in the catalogue fit — 58 with headroom, 2 tightly. The pick for most people is Qwen3.8 27B: Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Speeds are estimated for a RTX 6000 Ada; the fit verdicts are the same for every card in the class.

Which one should I run?

One pick per job, from the editorial shortlist, checked to fit at Q4_K_M and 8K. How picks are chosen.

RecommendationModelWhyQuant · totalTok/s est.
Best overall Qwen3.8 27B
Alibaba · Apache 2.0
Best capability per gigabyte: a current-generation dense 27B with vision and 262K context. Q4_K_M · 16.7 GB 37 Runs great
Best for coding Qwen3.8 27B
Alibaba · Apache 2.0
Terminal-Bench 73, DeepSWE 42 — a generation ahead of anything else that fits 24 GB. Q4_K_M · 16.7 GB 37 Runs great
Best reasoning Gemma 4 31B
Google · Apache 2.0
89% AIME — the strongest maths of any model under 32B. Q4_K_M · 20.2 GB 33 Runs great
Best for writing Gemma 4 31B
Google · Apache 2.0
The cleanest, least verbose prose of the 2026 24–32 GB class. Q4_K_M · 20.2 GB 33 Runs great
Best vision Qwen3.8 27B
Alibaba · Apache 2.0
Image and video in, OSWorld 84 — the strongest local vision-language model at 24 GB. Q4_K_M · 16.7 GB 37 Runs great
Best for agents Qwen3.8 27B
Alibaba · Apache 2.0
Computer use and tool calling are what 3.8 was trained for (OSWorld 84). Q4_K_M · 16.7 GB 37 Runs great
Best translation Qwen3.8 27B
Alibaba · Apache 2.0
119 languages, and Qwen translations read as idiomatic rather than literal. Q4_K_M · 16.7 GB 37 Runs great
Fastest good model Qwen3.6 35B-A3B
Alibaba · Apache 2.0
3.3B active per token: the fastest model that still competes with dense 27Bs. Q4_K_M · 20.9 GB 120 Runs great
Best long context Qwen3.8 27B
Alibaba · Apache 2.0
262K native, and only 16 of 64 blocks keep a KV cache — long context is cheap here. Q4_K_M · 24.2 GB
at 128K context
37 Runs great

The long-context row is judged at 128K: Qwen3.8 27B holds that window on 48 GB at Q4_K_M with 8.00 GB of KV cache — that is why it can differ from the best overall pick.

Everything that fits 48 GB

Largest first. "Max context" is the longest window the card holds at that quantisation with an f16 cache; a q8_0 cache roughly doubles it.

ModelParamsQuantWeights+KV 8KTotalHeadroomMax contextTok/s est.
Qwen3.6 35B-A3B 35.9B MoE Q4_K_M 20.2 GB 0.16 GB 20.9 GB 25.5 GB 256K 120 Runs great
Ornith 1.5 35B-A3B 35.9B MoE Q4_K_M 20.2 GB 0.16 GB 20.9 GB 25.5 GB 256K 120 Runs great
LLM-jp 4 33B Thinking 33.2B Q4_K_M 18.7 GB 2.00 GB 21.3 GB 25.1 GB 64K 31 Runs great
Qwen3 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 25.4 GB 109K 32 Runs great
DeepSeek-R1-Distill-Qwen 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 25.4 GB 109K 32 Runs great
Qwen2.5-Coder 32B 32.8B Q4_K_M 18.4 GB 2.00 GB 21.0 GB 25.4 GB 109K 32 Runs great
Olmo 3.1 32B Instruct 32.2B Q4_K_M 18.1 GB 1.25 GB 20.0 GB 26.4 GB 64K 32 Runs great
Nemotron 3.5 Lightning 30B-A3B 31.6B MoE Q4_K_M 17.8 GB 0.05 GB 18.4 GB 28.0 GB 256K 124 Runs great
Gemma 4 31B 31.3B Q4_K_M 17.6 GB 2.03 GB 20.2 GB 26.2 GB 175K 33 Runs great
GLM-4.7-Flash 30B-A3B 31.2B MoE Q4_K_M 17.5 GB 0.41 GB 18.6 GB 27.8 GB 198K 133 Runs great
Qwen3 30B-A3B 30.5B MoE Q4_K_M 17.1 GB 0.75 GB 18.5 GB 27.9 GB 128K 120 Runs great
Qwen3 Coder 30B-A3B 30.5B MoE Q4_K_M 17.1 GB 0.75 GB 18.5 GB 27.9 GB 256K 120 Runs great
Muse Glimmer 30B 29.8B Q4_K_M 16.8 GB 0.18 GB 17.5 GB 28.9 GB 128K 35 Runs great
Granite 4.1 30B 28.9B Q4_K_M 16.3 GB 2.00 GB 18.9 GB 27.5 GB 118K 36 Runs great
Qwen3.8 27B 27.8B Q4_K_M 15.6 GB 0.50 GB 16.7 GB 29.7 GB 256K 37 Runs great
Qwen3.6 27B 27.8B Q4_K_M 15.6 GB 0.50 GB 16.7 GB 29.7 GB 256K 37 Runs great
Gemma 3 27B 27.4B Q4_K_M 15.4 GB 1.03 GB 17.0 GB 29.4 GB 128K 38 Runs great
Gemma 4 26B-A4B 26.5B MoE Q4_K_M 14.9 GB 0.51 GB 16.0 GB 30.4 GB 256K 105 Runs great
Devstral Small 2 24B 24B Q4_K_M 13.5 GB 1.25 GB 15.3 GB 31.1 GB 206K 43 Runs great
Mistral Small 3.2 24B 23.6B Q4_K_M 13.3 GB 1.25 GB 15.1 GB 31.3 GB 128K 44 Runs great
gpt-oss 20B 20.9B MoE MXFP4 10.8 GB 0.19 GB 11.6 GB 34.8 GB 128K 120 Runs great
Qwen3 14B 14.8B Q4_K_M 8.3 GB 1.25 GB 10.2 GB 36.2 GB 128K 70 Runs great
DeepSeek-R1-Distill-Qwen 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 36.0 GB 128K 70 Runs great
Qwen2.5-Coder 14B 14.8B Q4_K_M 8.3 GB 1.50 GB 10.4 GB 36.0 GB 128K 70 Runs great
Phi-4 14B 14.7B Q4_K_M 8.3 GB 1.56 GB 10.4 GB 36.0 GB 16K 70 Runs great
Ministral 3 14B 13.9B Q4_K_M 7.8 GB 1.25 GB 9.7 GB 36.7 GB 243K 74 Runs great
Gemma 3 12B 12.2B Q4_K_M 6.9 GB 0.81 GB 8.3 GB 38.1 GB 128K 85 Runs great
Mistral NeMo 12B 12.2B Q4_K_M 6.9 GB 1.25 GB 8.7 GB 37.7 GB 128K 85 Runs great
Gemma 4 12B 12B Q4_K_M 6.7 GB 0.81 GB 8.2 GB 38.2 GB 256K 86 Runs great
Qwen3.5 9B 9.65B Q4_K_M 5.4 GB 0.25 GB 6.3 GB 40.1 GB 256K 107 Runs great
Ornith 1.5 9B 9.41B Q4_K_M 5.3 GB 0.25 GB 6.1 GB 40.3 GB 256K 110 Runs great
Ministral 3 8B 8.92B Q4_K_M 5.0 GB 1.06 GB 6.7 GB 39.7 GB 256K 116 Runs great
Granite 4.1 8B 8.79B Q4_K_M 4.9 GB 1.25 GB 6.8 GB 39.6 GB 128K 118 Runs great
LFM2.5 8B-A1B 8.47B MoE Q4_K_M 4.8 GB 0.09 GB 5.5 GB 40.9 GB 125K 265 Runs great
Fara 7B 8.29B Q4_K_M 4.7 GB 0.44 GB 5.7 GB 40.7 GB 125K 125 Runs great
Qwen3 8B 8.19B Q4_K_M 4.6 GB 1.13 GB 6.3 GB 40.1 GB 128K 126 Runs great
Llama 3.1 8B Instruct 8.03B Q4_K_M 4.5 GB 1.00 GB 6.1 GB 40.3 GB 128K 129 Runs great
Gemma 4 E4B 8.0B Q4_K_M 4.5 GB 0.14 GB 5.2 GB 41.2 GB 128K 129 Runs great
Ling 3.0 Tiny 7.9B-A1.3B 7.9B MoE Q4_K_M 4.4 GB 0.05 GB 5.1 GB 41.3 GB 128K 306 Runs great
DeepSeek-R1-Distill-Qwen 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 41.1 GB 128K 136 Runs great
Qwen2.5-Coder 7B 7.62B Q4_K_M 4.3 GB 0.44 GB 5.3 GB 41.1 GB 128K 136 Runs great
Olmo 3 7B Instruct 7.3B Q4_K_M 4.1 GB 2.50 GB 7.2 GB 39.2 GB 64K 142 Runs great
Mistral 7B Instruct v0.3 7.25B Q4_K_M 4.1 GB 1.00 GB 5.7 GB 40.7 GB 32K 143 Runs great
Gemma 4 E2B 5.1B Q4_K_M 2.9 GB 0.07 GB 3.5 GB 42.9 GB 128K 203 Runs great
Qwen3.5 4B 4.66B Q4_K_M 2.6 GB 0.25 GB 3.5 GB 42.9 GB 256K 222 Runs great
Gemma 3 4B 4.3B Q4_K_M 2.4 GB 0.30 GB 3.3 GB 43.1 GB 128K 240 Runs great
Qwen3 4B 4.02B Q4_K_M 2.3 GB 1.13 GB 4.0 GB 42.4 GB 32K 257 Runs great
Ministral 3 3B 3.85B Q4_K_M 2.2 GB 0.81 GB 3.6 GB 42.8 GB 256K 268 Runs great
Phi-4-mini 3.8B 3.84B Q4_K_M 2.2 GB 1.00 GB 3.8 GB 42.6 GB 128K 269 Runs great
Granite 4.1 3B 3.4B Q4_K_M 1.9 GB 0.63 GB 3.1 GB 43.3 GB 128K 304 Runs great
Llama 3.2 3B Instruct 3.21B Q4_K_M 1.8 GB 0.88 GB 3.3 GB 43.1 GB 128K 322 Runs great
LFM2.5 2.6B 2.7B Q4_K_M 1.5 GB 0.13 GB 2.2 GB 44.2 GB 128K 383 Runs great
Qwen3.5 2B 2.27B Q4_K_M 1.3 GB 0.09 GB 2.0 GB 44.4 GB 256K 455 Runs great
Qwen3 1.7B 1.72B Q4_K_M 1.0 GB 0.88 GB 2.4 GB 44.0 GB 32K 601 Runs great
Llama 3.2 1B Instruct 1.24B Q4_K_M 0.7 GB 0.25 GB 1.5 GB 44.9 GB 128K 834 Runs great
Gemma 3 1B 1.0B Q4_K_M 0.6 GB 0.04 GB 1.2 GB 45.2 GB 32K 1034 Runs great
Qwen3.5 0.8B 0.87B Q4_K_M 0.5 GB 0.09 GB 1.2 GB 45.2 GB 256K 1188 Runs great
Qwen3 0.6B 0.6B Q4_K_M 0.3 GB 0.88 GB 1.8 GB 44.6 GB 32K 1723 Runs great
Llama 3.3 70B Instruct 70.6B Q4_K_M 39.7 GB 2.50 GB 42.8 GB 3.6 GB 19K 15 Tight
DeepSeek-R1-Distill-Llama 70B 70.6B Q4_K_M 39.7 GB 2.50 GB 42.8 GB 3.6 GB 19K 15 Tight

Just out of reach

These run with part of the weights in system RAM (32 GB assumed), at a few tokens per second. Each needs a bigger card to run properly — the link says which.

ModelParamsTotal @ Q4_K_MOver budgetTok/s est., offloadedNeeds
Qwen3.5 122B-A10B 125B MoE 71.1 GB +24.7 GB ~6.3 141 GB card
Nemotron 3 Super 120B-A12B 124B MoE 70.4 GB +24.0 GB ~5.4 141 GB card
Ling 3.0 Flash 124B-A5B 124B MoE 70.4 GB +24.0 GB ~13 141 GB card
Mistral Small 4 119B-A6B 119B MoE 67.7 GB +21.3 GB ~11 141 GB card
gpt-oss 120B 117B MoE 61.4 GB +15.0 GB ~18 80 GB card
Llama 4 Scout 109B-A17B 109B MoE 63.4 GB +17.0 GB ~4.5 80 GB card

← 32 GB All VRAM classes Adjust context, quant or cache →

Every total is quantised weights + f16 KV cache at 8K + 0.6 GB runtime overhead, against 46.4 GB usable. Tokens per second are estimated from memory bandwidth and never measured. The method.