Hardware requirements

What hardware do I need to run Llama 4 Scout 109B-A17B?

109B MoE · 17B active 1024K context Llama 4 Community

At Q4_K_M the weights are 61.3 GB; with an 8K KV cache and runtime overhead that is 63.4 GB, so it wants a 80 GB card to run with headroom — in practice 80 GB VRAM: H100 SXM and 2 others. Every figure below is computed from the model’s published shape against each device’s usable memory; tokens per second are estimates. The method.

Minimum practical 64 GB VRAM

Instinct MI210 — Q3_K_M, 51.7 GB of 62.4 GB, ~49 tok/s, up to 235K context.

the smallest card that holds it at all, at Q3_K_M — the lowest quantisation worth running
Recommended 80 GB VRAM

H100 SXM — Q4_K_M, 63.4 GB of 78.4 GB, ~82 tok/s, up to 328K context.

runs the recommended quantisation with headroom at 8K context
High quality 141 GB VRAM

H200 SXM — Q8_0, 110.0 GB of 139.4 GB, ~66 tok/s, up to 636K context.

near-lossless Q8_0 with headroom
Long context 141 GB VRAM

H200 SXM — Q4_K_M, 69.0 GB of 139.4 GB, ~117 tok/s at 128K.

128K tokens (or the model’s maximum) at the recommended quantisation
Apple Silicon 128 GB unified

M1 Ultra · 128 GB — Q4_K_M, 63.4 GB of 96.0 GB, ~22 tok/s, up to 703K context.

smallest Mac that runs the recommended quantisation with headroom
CPU only 256 GB RAM

CPU only · DDR5 8-channel server — Q8_0, 110.0 GB of 204.8 GB, ~3.4 tok/s, up to 1024K context.

no GPU — weights stream from system RAM

How much VRAM at each quantisation

QuantWeights+KV 8K+KV 32K+KV 128KTotal @ 8KNeedsQuality
Q8_0107.9 GB1.50 GB2.63 GB7.1 GB 110.0 GB141 GB card−0.1% ppl
Q6_K83.2 GB1.50 GB2.63 GB7.1 GB 85.3 GB141 GB card−0.4% ppl
Q5_K_M71.9 GB1.50 GB2.63 GB7.1 GB 74.0 GB141 GB card−0.8% ppl
Q4_K_M61.3 GB1.50 GB2.63 GB7.1 GB 63.4 GB80 GB card−1.9% ppl
Q3_K_M49.6 GB1.50 GB2.63 GB7.1 GB 51.7 GB64 GB card−5.4% ppl
Q2_K42.5 GB1.50 GB2.63 GB7.1 GB 44.6 GB64 GB card−15% ppl

Totals add 0.6 GB runtime overhead and an f16 KV cache; "needs" is the smallest discrete card class whose usable memory (after display and driver reserve) leaves 15% headroom. A q8_0 cache roughly halves the KV columns.

Every device, checked

System RAM for offload:

NVIDIA · GeForce

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
GeForce RTX 5090 32 GB no no Check
GeForce RTX 5080 16 GB no no Check
GeForce RTX 5070 Ti 16 GB no no Check
GeForce RTX 5070 12 GB no no Check
GeForce RTX 5060 Ti 16 GB 16 GB no no Check
GeForce RTX 5060 8 GB no no Check
GeForce RTX 4090 24 GB no no Check
GeForce RTX 4080 Super 16 GB no no Check
GeForce RTX 4080 16 GB no no Check
GeForce RTX 4070 Ti Super 16 GB no no Check
GeForce RTX 4070 Ti 12 GB no no Check
GeForce RTX 4070 Super 12 GB no no Check
GeForce RTX 4070 12 GB no no Check
GeForce RTX 4060 Ti 16 GB 16 GB no no Check
GeForce RTX 4060 Ti 8 GB no no Check
GeForce RTX 4060 8 GB no no Check
GeForce RTX 3090 Ti 24 GB no no Check
GeForce RTX 3090 24 GB no no Check
GeForce RTX 3080 Ti 12 GB no no Check
GeForce RTX 3080 12 GB 12 GB no no Check
GeForce RTX 3080 10 GB no no Check
GeForce RTX 3070 Ti 8 GB no no Check
GeForce RTX 3070 8 GB no no Check
GeForce RTX 3060 Ti 8 GB no no Check
GeForce RTX 3060 12 GB 12 GB no no Check
GeForce RTX 2080 Ti 11 GB no no Check
GeForce RTX 2060 12 GB 12 GB no no Check
GeForce GTX 1080 Ti 11 GB no no Check

NVIDIA · GeForce laptop

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
GeForce RTX 5090 Laptop 24 GB no no Check
GeForce RTX 4090 Laptop 16 GB no no Check
GeForce RTX 4080 Laptop 12 GB no no Check
GeForce RTX 4070 Laptop 8 GB no no Check

NVIDIA · Workstation

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
RTX 6000 Ada 48 GB offload ~11 no Check
RTX 5000 Ada 32 GB no no Check
RTX 4000 Ada 20 GB no no Check
RTX 2000 Ada 16 GB no no Check
RTX A6000 48 GB offload ~10 no Check
RTX A5000 24 GB no no Check
RTX A4000 16 GB no no Check

NVIDIA · Data centre

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
L40S 48 GB offload ~11 no Check
L4 24 GB no no Check
A10 24 GB no no Check
A100 40 GB 40 GB offload ~6.1 no Check
A100 80 GB 80 GB Q4_K_M Q5_K_M 328K 50 tight Check
H100 PCIe 80 GB Q4_K_M Q5_K_M 328K 49 tight Check
H100 SXM 80 GB Q4_K_M Q5_K_M 328K 82 tight Check
H200 SXM 141 GB Q8_0 Q8_0 1024K 117 yes Check
Tesla P40 24 GB no no Check

AMD · Radeon

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Radeon RX 9070 XT 16 GB no no Check
Radeon RX 9070 16 GB no no Check
Radeon RX 7900 XTX 24 GB no no Check
Radeon RX 7900 XT 20 GB no no Check
Radeon RX 7900 GRE 16 GB no no Check
Radeon RX 7800 XT 16 GB no no Check
Radeon RX 7700 XT 12 GB no no Check
Radeon RX 7600 XT 16 GB no no Check
Radeon RX 6900 XT 16 GB no no Check
Radeon RX 6800 XT 16 GB no no Check
Radeon RX 6700 XT 12 GB no no Check

AMD · Radeon Pro

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Radeon Pro W7900 48 GB offload ~11 no Check
Radeon Pro W7800 32 GB no no Check

AMD · Instinct

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Instinct MI210 64 GB Q3_K_M Q3_K_M no Check
Instinct MI300X 192 GB Q8_0 Q8_0 1024K 129 yes Check

AMD · Ryzen AI Max

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Ryzen AI Max+ 395 · 128 GB 128 GB Q5_K_M Q6_K 703K 7.0 yes Check
Ryzen AI Max+ 395 · 64 GB 64 GB no no Check

Apple · Apple Silicon

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
M1 · 16 GB 16 GB no no Check
M1 Pro · 32 GB 32 GB no no Check
M1 Max · 64 GB 64 GB no no Check
M1 Ultra · 128 GB 128 GB Q5_K_M Q6_K 703K 22 yes Check
M2 · 24 GB 24 GB no no Check
M2 Pro · 32 GB 32 GB no no Check
M2 Max · 96 GB 96 GB Q3_K_M Q4_K_M 191K 11 tight Check
M2 Ultra · 192 GB 192 GB Q8_0 Q8_0 1024K 22 yes Check
M3 · 24 GB 24 GB no no Check
M3 Pro · 36 GB 36 GB no no Check
M3 Max · 64 GB 64 GB no no Check
M3 Max · 128 GB 128 GB Q5_K_M Q6_K 703K 11 yes Check
M3 Ultra · 256 GB 256 GB Q8_0 Q8_0 1024K 22 yes Check
M3 Ultra · 512 GB 512 GB Q8_0 Q8_0 1024K 22 yes Check
M4 · 32 GB 32 GB no no Check
M4 Pro · 48 GB 48 GB no no Check
M4 Pro · 64 GB 64 GB no no Check
M4 Max · 64 GB 64 GB no no Check
M4 Max · 128 GB 128 GB Q5_K_M Q6_K 703K 15 yes Check

Intel · Arc

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Arc B580 12 GB no no Check
Arc B570 10 GB no no Check
Arc A770 16 GB 16 GB no no Check
Arc A750 8 GB no no Check

CPU · CPU + system RAM

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
CPU only · DDR4 dual-channel 32 GB no no Check
CPU only · DDR5 dual-channel 64 GB no no Check
CPU only · DDR5 8-channel server 256 GB Q8_0 Q8_0 1024K 6.0 yes Check