Hardware requirements
What hardware do I need to run Llama 3.1 8B Instruct?
At Q4_K_M the weights are 4.5 GB; with an 8K KV cache and runtime overhead that is 6.1 GB, so it wants a 10 GB card to run with headroom — in practice 10 GB VRAM: GeForce RTX 3080 and 1 other. Every figure below is computed from the model’s published shape against each device’s usable memory; tokens per second are estimates. The method.
GeForce RTX 3070 Ti — Q5_K_M, 6.9 GB of 7.0 GB, ~69 tok/s, up to 8K context.
GeForce RTX 3080 — Q4_K_M, 6.1 GB of 8.8 GB, ~102 tok/s, up to 29K context.
GeForce RTX 5080 — Q8_0, 9.5 GB of 14.4 GB, ~73 tok/s, up to 46K context.
GeForce RTX 5090 — Q4_K_M, 21.1 GB of 30.4 GB, ~240 tok/s at 128K.
M1 · 16 GB — Q4_K_M, 6.1 GB of 10.7 GB, ~8.4 tok/s, up to 44K context.
CPU only · DDR4 dual-channel — Q8_0, 9.5 GB of 25.6 GB, ~2.7 tok/s, up to 128K context.
How much VRAM at each quantisation
| Quant | Weights | +KV 8K | +KV 32K | +KV 128K | Total @ 8K | Needs | Quality |
|---|---|---|---|---|---|---|---|
| F16 | 15.0 GB | 1.00 GB | 4.00 GB | 16.0 GB | 16.6 GB | 24 GB card | Reference |
| Q8_0 | 7.9 GB | 1.00 GB | 4.00 GB | 16.0 GB | 9.5 GB | 16 GB card | −0.1% ppl |
| Q6_K | 6.1 GB | 1.00 GB | 4.00 GB | 16.0 GB | 7.7 GB | 11 GB card | −0.4% ppl |
| Q5_K_M | 5.3 GB | 1.00 GB | 4.00 GB | 16.0 GB | 6.9 GB | 10 GB card | −0.8% ppl |
| Q4_K_M | 4.5 GB | 1.00 GB | 4.00 GB | 16.0 GB | 6.1 GB | 10 GB card | −1.9% ppl |
| Q3_K_M | 3.7 GB | 1.00 GB | 4.00 GB | 16.0 GB | 5.3 GB | 8 GB card | −5.4% ppl |
| Q2_K | 3.1 GB | 1.00 GB | 4.00 GB | 16.0 GB | 4.7 GB | 8 GB card | −15% ppl |
Totals add 0.6 GB runtime overhead and an f16 KV cache; "needs" is the smallest discrete card class whose usable memory (after display and driver reserve) leaves 15% headroom. A q8_0 cache roughly halves the KV columns.
NVIDIA · GeForce
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| GeForce RTX 5090 | 32 GB | Q8_0 | Q8_0 | 128K | 240 | yes | Check |
| GeForce RTX 5080 | 16 GB | Q8_0 | Q8_0 | 74K | 129 | no | Check |
| GeForce RTX 5070 Ti | 16 GB | Q8_0 | Q8_0 | 74K | 120 | no | Check |
| GeForce RTX 5070 | 12 GB | Q6_K | Q8_0 | 43K | 90 | no | Check |
| GeForce RTX 5060 Ti 16 GB | 16 GB | Q8_0 | Q8_0 | 74K | 60 | no | Check |
| GeForce RTX 5060 | 8 GB | Q3_K_M | Q5_K_M | 15K | 60 | no | Check |
| GeForce RTX 4090 | 24 GB | Q8_0 | Q8_0 | 128K | 135 | tight | Check |
| GeForce RTX 4080 Super | 16 GB | Q8_0 | Q8_0 | 74K | 99 | no | Check |
| GeForce RTX 4080 | 16 GB | Q8_0 | Q8_0 | 74K | 96 | no | Check |
| GeForce RTX 4070 Ti Super | 16 GB | Q8_0 | Q8_0 | 74K | 90 | no | Check |
| GeForce RTX 4070 Ti | 12 GB | Q6_K | Q8_0 | 43K | 68 | no | Check |
| GeForce RTX 4070 Super | 12 GB | Q6_K | Q8_0 | 43K | 68 | no | Check |
| GeForce RTX 4070 | 12 GB | Q6_K | Q8_0 | 43K | 68 | no | Check |
| GeForce RTX 4060 Ti 16 GB | 16 GB | Q8_0 | Q8_0 | 74K | 39 | no | Check |
| GeForce RTX 4060 Ti | 8 GB | Q3_K_M | Q5_K_M | 15K | 39 | no | Check |
| GeForce RTX 4060 | 8 GB | Q3_K_M | Q5_K_M | 15K | 36 | no | Check |
| GeForce RTX 3090 Ti | 24 GB | Q8_0 | Q8_0 | 128K | 135 | tight | Check |
| GeForce RTX 3090 | 24 GB | Q8_0 | Q8_0 | 128K | 125 | tight | Check |
| GeForce RTX 3080 Ti | 12 GB | Q6_K | Q8_0 | 43K | 122 | no | Check |
| GeForce RTX 3080 12 GB | 12 GB | Q6_K | Q8_0 | 43K | 122 | no | Check |
| GeForce RTX 3080 | 10 GB | Q5_K_M | Q6_K | 29K | 102 | no | Check |
| GeForce RTX 3070 Ti | 8 GB | Q3_K_M | Q5_K_M | 15K | 82 | no | Check |
| GeForce RTX 3070 | 8 GB | Q3_K_M | Q5_K_M | 15K | 60 | no | Check |
| GeForce RTX 3060 Ti | 8 GB | Q3_K_M | Q5_K_M | 15K | 60 | no | Check |
| GeForce RTX 3060 12 GB | 12 GB | Q6_K | Q8_0 | 43K | 48 | no | Check |
| GeForce RTX 2080 Ti | 11 GB | Q6_K | Q8_0 | 36K | 83 | no | Check |
| GeForce RTX 2060 12 GB | 12 GB | Q6_K | Q8_0 | 43K | 45 | no | Check |
| GeForce GTX 1080 Ti | 11 GB | Q6_K | Q8_0 | 36K | 65 | no | Check |
NVIDIA · GeForce laptop
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| GeForce RTX 5090 Laptop | 24 GB | Q8_0 | Q8_0 | 128K | 120 | tight | Check |
| GeForce RTX 4090 Laptop | 16 GB | Q8_0 | Q8_0 | 74K | 77 | no | Check |
| GeForce RTX 4080 Laptop | 12 GB | Q6_K | Q8_0 | 43K | 58 | no | Check |
| GeForce RTX 4070 Laptop | 8 GB | Q3_K_M | Q5_K_M | 15K | 34 | no | Check |
NVIDIA · Workstation
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| RTX 6000 Ada | 48 GB | Q8_0 | Q8_0 | 128K | 129 | yes | Check |
| RTX 5000 Ada | 32 GB | Q8_0 | Q8_0 | 128K | 77 | yes | Check |
| RTX 4000 Ada | 20 GB | Q8_0 | Q8_0 | 106K | 48 | no | Check |
| RTX 2000 Ada | 16 GB | Q8_0 | Q8_0 | 74K | 30 | no | Check |
| RTX A6000 | 48 GB | Q8_0 | Q8_0 | 128K | 103 | yes | Check |
| RTX A5000 | 24 GB | Q8_0 | Q8_0 | 128K | 103 | tight | Check |
| RTX A4000 | 16 GB | Q8_0 | Q8_0 | 74K | 60 | no | Check |
NVIDIA · Data centre
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| L40S | 48 GB | Q8_0 | Q8_0 | 128K | 116 | yes | Check |
| L4 | 24 GB | Q8_0 | Q8_0 | 128K | 40 | tight | Check |
| A10 | 24 GB | Q8_0 | Q8_0 | 128K | 80 | tight | Check |
| A100 40 GB | 40 GB | Q8_0 | Q8_0 | 128K | 208 | yes | Check |
| A100 80 GB | 80 GB | Q8_0 | Q8_0 | 128K | 273 | yes | Check |
| H100 PCIe | 80 GB | Q8_0 | Q8_0 | 128K | 268 | yes | Check |
| H100 SXM | 80 GB | Q8_0 | Q8_0 | 128K | 449 | yes | Check |
| H200 SXM | 141 GB | Q8_0 | Q8_0 | 128K | 644 | yes | Check |
| Tesla P40 | 24 GB | Q8_0 | Q8_0 | 128K | 46 | tight | Check |
AMD · Radeon
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| Radeon RX 9070 XT | 16 GB | Q8_0 | Q8_0 | 74K | 86 | no | Check |
| Radeon RX 9070 | 16 GB | Q8_0 | Q8_0 | 74K | 86 | no | Check |
| Radeon RX 7900 XTX | 24 GB | Q8_0 | Q8_0 | 128K | 129 | tight | Check |
| Radeon RX 7900 XT | 20 GB | Q8_0 | Q8_0 | 106K | 107 | no | Check |
| Radeon RX 7900 GRE | 16 GB | Q8_0 | Q8_0 | 74K | 77 | no | Check |
| Radeon RX 7800 XT | 16 GB | Q8_0 | Q8_0 | 74K | 84 | no | Check |
| Radeon RX 7700 XT | 12 GB | Q6_K | Q8_0 | 43K | 58 | no | Check |
| Radeon RX 7600 XT | 16 GB | Q8_0 | Q8_0 | 74K | 39 | no | Check |
| Radeon RX 6900 XT | 16 GB | Q8_0 | Q8_0 | 74K | 69 | no | Check |
| Radeon RX 6800 XT | 16 GB | Q8_0 | Q8_0 | 74K | 69 | no | Check |
| Radeon RX 6700 XT | 12 GB | Q6_K | Q8_0 | 43K | 51 | no | Check |
AMD · Radeon Pro
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| Radeon Pro W7900 | 48 GB | Q8_0 | Q8_0 | 128K | 116 | yes | Check |
| Radeon Pro W7800 | 32 GB | Q8_0 | Q8_0 | 128K | 77 | yes | Check |
AMD · Instinct
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| Instinct MI210 | 64 GB | Q8_0 | Q8_0 | 128K | 220 | yes | Check |
| Instinct MI300X | 192 GB | Q8_0 | Q8_0 | 128K | 711 | yes | Check |
AMD · Ryzen AI Max
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| Ryzen AI Max+ 395 · 128 GB | 128 GB | Q8_0 | Q8_0 | 128K | 32 | yes | Check |
| Ryzen AI Max+ 395 · 64 GB | 64 GB | Q8_0 | Q8_0 | 128K | 32 | yes | Check |
Apple · Apple Silicon
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| M1 · 16 GB | 16 GB | Q6_K | Q8_0 | 44K | 8.4 | no | Check |
| M1 Pro · 32 GB | 32 GB | Q8_0 | Q8_0 | 128K | 25 | tight | Check |
| M1 Max · 64 GB | 64 GB | Q8_0 | Q8_0 | 128K | 50 | yes | Check |
| M1 Ultra · 128 GB | 128 GB | Q8_0 | Q8_0 | 128K | 99 | yes | Check |
| M2 · 24 GB | 24 GB | Q8_0 | Q8_0 | 103K | 12 | no | Check |
| M2 Pro · 32 GB | 32 GB | Q8_0 | Q8_0 | 128K | 25 | tight | Check |
| M2 Max · 96 GB | 96 GB | Q8_0 | Q8_0 | 128K | 50 | yes | Check |
| M2 Ultra · 192 GB | 192 GB | Q8_0 | Q8_0 | 128K | 99 | yes | Check |
| M3 · 24 GB | 24 GB | Q8_0 | Q8_0 | 103K | 12 | no | Check |
| M3 Pro · 36 GB | 36 GB | Q8_0 | Q8_0 | 128K | 19 | yes | Check |
| M3 Max · 64 GB | 64 GB | Q8_0 | Q8_0 | 128K | 50 | yes | Check |
| M3 Max · 128 GB | 128 GB | Q8_0 | Q8_0 | 128K | 50 | yes | Check |
| M3 Ultra · 256 GB | 256 GB | Q8_0 | Q8_0 | 128K | 99 | yes | Check |
| M3 Ultra · 512 GB | 512 GB | Q8_0 | Q8_0 | 128K | 99 | yes | Check |
| M4 · 32 GB | 32 GB | Q8_0 | Q8_0 | 128K | 15 | tight | Check |
| M4 Pro · 48 GB | 48 GB | Q8_0 | Q8_0 | 128K | 34 | yes | Check |
| M4 Pro · 64 GB | 64 GB | Q8_0 | Q8_0 | 128K | 34 | yes | Check |
| M4 Max · 64 GB | 64 GB | Q8_0 | Q8_0 | 128K | 51 | yes | Check |
| M4 Max · 128 GB | 128 GB | Q8_0 | Q8_0 | 128K | 68 | yes | Check |
Intel · Arc
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| Arc B580 | 12 GB | Q6_K | Q8_0 | 43K | 61 | no | Check |
| Arc B570 | 10 GB | Q5_K_M | Q6_K | 29K | 51 | no | Check |
| Arc A770 16 GB | 16 GB | Q8_0 | Q8_0 | 74K | 75 | no | Check |
| Arc A750 | 8 GB | Q3_K_M | Q5_K_M | 15K | 69 | no | Check |
CPU · CPU + system RAM
| Device | Memory | Best quant with headroom | Fits at all | Max context @ Q4_K_M | Tok/s est. | 128K | |
|---|---|---|---|---|---|---|---|
| CPU only · DDR4 dual-channel | 32 GB | Q8_0 | Q8_0 | 128K | 4.7 | yes | Check |
| CPU only · DDR5 dual-channel | 64 GB | Q8_0 | Q8_0 | 128K | 8.4 | yes | Check |
| CPU only · DDR5 8-channel server | 256 GB | Q8_0 | Q8_0 | 128K | 28 | yes | Check |