Hardware requirements

What hardware do I need to run Qwen3 0.6B?

0.6B 32K context Apache 2.0

At Q4_K_M the weights are 0.3 GB; with an 8K KV cache and runtime overhead that is 1.8 GB, so it wants a 8 GB card to run with headroom — in practice 8 GB VRAM: GeForce RTX 3070 Ti and 7 others. Every figure below is computed from the model’s published shape against each device’s usable memory; tokens per second are estimates. The method.

Minimum practical 8 GB VRAM

GeForce RTX 3070 Ti — Q8_0, 2.1 GB of 7.0 GB, ~620 tok/s, up to 32K context.

the smallest card that holds it at all, at Q3_K_M — the lowest quantisation worth running
Recommended 8 GB VRAM

GeForce RTX 3070 Ti — Q4_K_M, 1.8 GB of 7.0 GB, ~1091 tok/s, up to 32K context.

runs the recommended quantisation with headroom at 8K context
High quality 8 GB VRAM

GeForce RTX 3070 Ti — Q8_0, 2.1 GB of 7.0 GB, ~620 tok/s, up to 32K context.

near-lossless Q8_0 with headroom
Long context 8 GB VRAM

GeForce RTX 3070 Ti — Q4_K_M, 4.4 GB of 7.0 GB, ~1091 tok/s at 32K.

128K tokens (or the model’s maximum) at the recommended quantisation
Apple Silicon 16 GB unified

M1 · 16 GB — Q4_K_M, 1.8 GB of 10.7 GB, ~113 tok/s, up to 32K context.

smallest Mac that runs the recommended quantisation with headroom
CPU only 32 GB RAM

CPU only · DDR4 dual-channel — Q8_0, 2.1 GB of 25.6 GB, ~36 tok/s, up to 32K context.

no GPU — weights stream from system RAM

How much VRAM at each quantisation

QuantWeights+KV 8K+KV 32K+KV 128KTotal @ 8KNeedsQuality
F161.1 GB0.88 GB3.50 GB3.5 GB 2.6 GB8 GB cardReference
Q8_00.6 GB0.88 GB3.50 GB3.5 GB 2.1 GB8 GB card−0.1% ppl
Q6_K0.5 GB0.88 GB3.50 GB3.5 GB 1.9 GB8 GB card−0.4% ppl
Q5_K_M0.4 GB0.88 GB3.50 GB3.5 GB 1.9 GB8 GB card−0.8% ppl
Q4_K_M0.3 GB0.88 GB3.50 GB3.5 GB 1.8 GB8 GB card−1.9% ppl
Q3_K_M0.3 GB0.88 GB3.50 GB3.5 GB 1.7 GB8 GB card−5.4% ppl
Q2_K0.2 GB0.88 GB3.50 GB3.5 GB 1.7 GB8 GB card−15% ppl

Totals add 0.6 GB runtime overhead and an f16 KV cache; "needs" is the smallest discrete card class whose usable memory (after display and driver reserve) leaves 15% headroom. A q8_0 cache roughly halves the KV columns.

Every device, checked

System RAM for offload:

NVIDIA · GeForce

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
GeForce RTX 5090 32 GB Q8_0 Q8_0 32K 3215 yes Check
GeForce RTX 5080 16 GB Q8_0 Q8_0 32K 1723 yes Check
GeForce RTX 5070 Ti 16 GB Q8_0 Q8_0 32K 1608 yes Check
GeForce RTX 5070 12 GB Q8_0 Q8_0 32K 1206 yes Check
GeForce RTX 5060 Ti 16 GB 16 GB Q8_0 Q8_0 32K 804 yes Check
GeForce RTX 5060 8 GB Q8_0 Q8_0 32K 804 yes Check
GeForce RTX 4090 24 GB Q8_0 Q8_0 32K 1809 yes Check
GeForce RTX 4080 Super 16 GB Q8_0 Q8_0 32K 1321 yes Check
GeForce RTX 4080 16 GB Q8_0 Q8_0 32K 1287 yes Check
GeForce RTX 4070 Ti Super 16 GB Q8_0 Q8_0 32K 1206 yes Check
GeForce RTX 4070 Ti 12 GB Q8_0 Q8_0 32K 904 yes Check
GeForce RTX 4070 Super 12 GB Q8_0 Q8_0 32K 904 yes Check
GeForce RTX 4070 12 GB Q8_0 Q8_0 32K 904 yes Check
GeForce RTX 4060 Ti 16 GB 16 GB Q8_0 Q8_0 32K 517 yes Check
GeForce RTX 4060 Ti 8 GB Q8_0 Q8_0 32K 517 yes Check
GeForce RTX 4060 8 GB Q8_0 Q8_0 32K 488 yes Check
GeForce RTX 3090 Ti 24 GB Q8_0 Q8_0 32K 1809 yes Check
GeForce RTX 3090 24 GB Q8_0 Q8_0 32K 1680 yes Check
GeForce RTX 3080 Ti 12 GB Q8_0 Q8_0 32K 1636 yes Check
GeForce RTX 3080 12 GB 12 GB Q8_0 Q8_0 32K 1636 yes Check
GeForce RTX 3080 10 GB Q8_0 Q8_0 32K 1364 yes Check
GeForce RTX 3070 Ti 8 GB Q8_0 Q8_0 32K 1091 yes Check
GeForce RTX 3070 8 GB Q8_0 Q8_0 32K 804 yes Check
GeForce RTX 3060 Ti 8 GB Q8_0 Q8_0 32K 804 yes Check
GeForce RTX 3060 12 GB 12 GB Q8_0 Q8_0 32K 646 yes Check
GeForce RTX 2080 Ti 11 GB Q8_0 Q8_0 32K 1105 yes Check
GeForce RTX 2060 12 GB 12 GB Q8_0 Q8_0 32K 603 yes Check
GeForce GTX 1080 Ti 11 GB Q8_0 Q8_0 32K 868 yes Check

NVIDIA · GeForce laptop

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
GeForce RTX 5090 Laptop 24 GB Q8_0 Q8_0 32K 1608 yes Check
GeForce RTX 4090 Laptop 16 GB Q8_0 Q8_0 32K 1034 yes Check
GeForce RTX 4080 Laptop 12 GB Q8_0 Q8_0 32K 775 yes Check
GeForce RTX 4070 Laptop 8 GB Q8_0 Q8_0 32K 459 yes Check

NVIDIA · Workstation

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
RTX 6000 Ada 48 GB Q8_0 Q8_0 32K 1723 yes Check
RTX 5000 Ada 32 GB Q8_0 Q8_0 32K 1034 yes Check
RTX 4000 Ada 20 GB Q8_0 Q8_0 32K 646 yes Check
RTX 2000 Ada 16 GB Q8_0 Q8_0 32K 402 yes Check
RTX A6000 48 GB Q8_0 Q8_0 32K 1378 yes Check
RTX A5000 24 GB Q8_0 Q8_0 32K 1378 yes Check
RTX A4000 16 GB Q8_0 Q8_0 32K 804 yes Check

NVIDIA · Data centre

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
L40S 48 GB Q8_0 Q8_0 32K 1550 yes Check
L4 24 GB Q8_0 Q8_0 32K 538 yes Check
A10 24 GB Q8_0 Q8_0 32K 1077 yes Check
A100 40 GB 40 GB Q8_0 Q8_0 32K 2790 yes Check
A100 80 GB 80 GB Q8_0 Q8_0 32K 3659 yes Check
H100 PCIe 80 GB Q8_0 Q8_0 32K 3589 yes Check
H100 SXM 80 GB Q8_0 Q8_0 32K 6011 yes Check
H200 SXM 141 GB Q8_0 Q8_0 32K 8613 yes Check
Tesla P40 24 GB Q8_0 Q8_0 32K 621 yes Check

AMD · Radeon

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Radeon RX 9070 XT 16 GB Q8_0 Q8_0 32K 1157 yes Check
Radeon RX 9070 16 GB Q8_0 Q8_0 32K 1157 yes Check
Radeon RX 7900 XTX 24 GB Q8_0 Q8_0 32K 1723 yes Check
Radeon RX 7900 XT 20 GB Q8_0 Q8_0 32K 1435 yes Check
Radeon RX 7900 GRE 16 GB Q8_0 Q8_0 32K 1034 yes Check
Radeon RX 7800 XT 16 GB Q8_0 Q8_0 32K 1120 yes Check
Radeon RX 7700 XT 12 GB Q8_0 Q8_0 32K 775 yes Check
Radeon RX 7600 XT 16 GB Q8_0 Q8_0 32K 517 yes Check
Radeon RX 6900 XT 16 GB Q8_0 Q8_0 32K 919 yes Check
Radeon RX 6800 XT 16 GB Q8_0 Q8_0 32K 919 yes Check
Radeon RX 6700 XT 12 GB Q8_0 Q8_0 32K 689 yes Check

AMD · Radeon Pro

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Radeon Pro W7900 48 GB Q8_0 Q8_0 32K 1550 yes Check
Radeon Pro W7800 32 GB Q8_0 Q8_0 32K 1034 yes Check

AMD · Instinct

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Instinct MI210 64 GB Q8_0 Q8_0 32K 2939 yes Check
Instinct MI300X 192 GB Q8_0 Q8_0 32K 9510 yes Check

AMD · Ryzen AI Max

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Ryzen AI Max+ 395 · 128 GB 128 GB Q8_0 Q8_0 32K 424 yes Check
Ryzen AI Max+ 395 · 64 GB 64 GB Q8_0 Q8_0 32K 424 yes Check

Apple · Apple Silicon

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
M1 · 16 GB 16 GB Q8_0 Q8_0 32K 113 yes Check
M1 Pro · 32 GB 32 GB Q8_0 Q8_0 32K 331 yes Check
M1 Max · 64 GB 64 GB Q8_0 Q8_0 32K 663 yes Check
M1 Ultra · 128 GB 128 GB Q8_0 Q8_0 32K 1325 yes Check
M2 · 24 GB 24 GB Q8_0 Q8_0 32K 166 yes Check
M2 Pro · 32 GB 32 GB Q8_0 Q8_0 32K 331 yes Check
M2 Max · 96 GB 96 GB Q8_0 Q8_0 32K 663 yes Check
M2 Ultra · 192 GB 192 GB Q8_0 Q8_0 32K 1325 yes Check
M3 · 24 GB 24 GB Q8_0 Q8_0 32K 166 yes Check
M3 Pro · 36 GB 36 GB Q8_0 Q8_0 32K 248 yes Check
M3 Max · 64 GB 64 GB Q8_0 Q8_0 32K 663 yes Check
M3 Max · 128 GB 128 GB Q8_0 Q8_0 32K 663 yes Check
M3 Ultra · 256 GB 256 GB Q8_0 Q8_0 32K 1325 yes Check
M3 Ultra · 512 GB 512 GB Q8_0 Q8_0 32K 1325 yes Check
M4 · 32 GB 32 GB Q8_0 Q8_0 32K 199 yes Check
M4 Pro · 48 GB 48 GB Q8_0 Q8_0 32K 452 yes Check
M4 Pro · 64 GB 64 GB Q8_0 Q8_0 32K 452 yes Check
M4 Max · 64 GB 64 GB Q8_0 Q8_0 32K 679 yes Check
M4 Max · 128 GB 128 GB Q8_0 Q8_0 32K 904 yes Check

Intel · Arc

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
Arc B580 12 GB Q8_0 Q8_0 32K 818 yes Check
Arc B570 10 GB Q8_0 Q8_0 32K 682 yes Check
Arc A770 16 GB 16 GB Q8_0 Q8_0 32K 1005 yes Check
Arc A750 8 GB Q8_0 Q8_0 32K 919 yes Check

CPU · CPU + system RAM

DeviceMemoryBest quant with headroomFits at allMax context @ Q4_K_MTok/s est.128K
CPU only · DDR4 dual-channel 32 GB Q8_0 Q8_0 32K 63 yes Check
CPU only · DDR5 dual-channel 64 GB Q8_0 Q8_0 32K 112 yes Check
CPU only · DDR5 8-channel server 256 GB Q8_0 Q8_0 32K 381 yes Check