Qwen3.6 35B A3B

Qwen3.6 35B A3B braucht mit der Variante Q4_K_M rund 23,5 GB Speicher und läuft auf 142 von 414 geführten Geräten flüssig.

Mit dem wenigsten Speicher schafft es: Framework Desktop (2025), Ryzen AI Max 385 mit Radeon 8050S, 32 GB.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.

Anbieter
Alibaba (Qwen)
Parameter
34,7 Mrd., davon 3 Mrd. aktiv
Längster Kontext
262.144 Token
Lizenz
apache-2.0

So starten Sie es mit Ollama:

$ ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M

Geräte, auf denen es flüssig läuft

Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.

GerätUrteilTempoSpeicher
Framework Desktop (2025), Ryzen AI Max 385 mit Radeon 8050S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
HP ZBook Ultra G1a (2025), Ryzen AI Max PRO 390 mit Radeon 8050S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
HP ZBook Ultra G1a (2025), Ryzen AI Max PRO 385 mit Radeon 8050S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
HP Z2 Mini G1a (2025), Ryzen AI Max PRO 390 mit Radeon 8050S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
ASUS ROG Flow Z13 (2025), Ryzen AI Max+ 395 mit Radeon 8060S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
ASUS ProArt PX13 (2026), Ryzen AI Max+ 388 mit Radeon 8060S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
ASUS TUF Gaming A14 (2026), Ryzen AI Max+ 392 mit Radeon 8060S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
Lenovo Legion 7a Gen 11 (2026), Ryzen AI Max+ 388 mit Radeon 8060S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
Lenovo Yoga Pro 7a Gen 11 (2026), Ryzen AI Max+ 388 mit Radeon 8060S, 32 GBLäuft gut51 bis 86 Token/s32 GB
davon 24,0 GB nutzbar
Apple MacBook Pro 14 Zoll (2026), M5 Max mit 32-Kern-GPU, 36 GBLäuft gut75 bis 110 Token/s36 GB
davon 24,0 GB nutzbar

und 132 weitere

Grafikkarten, in die es ganz passt

GrafikkarteUrteilTempoSpeicher
NVIDIA GeForce RTX 5090, 32 GBLäuft gut245 bis 367 Token/s32 GB
davon 31,2 GB nutzbar
AMD Radeon AI PRO R9700, 32 GBLäuft gut173 bis 302 Token/s *32 GB
davon 31,2 GB nutzbar
AMD Radeon PRO W7800, 32 GBLäuft gut157 bis 273 Token/s *32 GB
davon 31,2 GB nutzbar
NVIDIA RTX PRO 4500 Blackwell, 32 GBLäuft gut169 bis 253 Token/s32 GB
davon 31,2 GB nutzbar
NVIDIA RTX 5000 Ada Generation, 32 GBLäuft gut126 bis 188 Token/s32 GB
davon 31,2 GB nutzbar
AMD Radeon PRO W7900, 48 GBLäuft gut224 bis 390 Token/s *48 GB
davon 47,2 GB nutzbar
NVIDIA RTX PRO 5000 Blackwell, 48 GBLäuft gut213 bis 319 Token/s48 GB
davon 47,2 GB nutzbar
NVIDIA RTX 6000 Ada Generation, 48 GBLäuft gut176 bis 264 Token/s48 GB
davon 47,2 GB nutzbar
NVIDIA RTX A6000, 48 GBLäuft gut153 bis 229 Token/s48 GB
davon 47,2 GB nutzbar
NVIDIA RTX PRO 6000 Blackwell, 96 GBLäuft gut245 bis 367 Token/s96 GB
davon 95,2 GB nutzbar

Alle Geräte und Grafikkarten für Qwen3.6 35B A3B

Varianten

VarianteDateiSpeicherbedarfStartbefehl
Q3_K_M16,6 GB17,8 GBollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q3_K_M
Q4_K_M22,1 GB23,5 GBollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M
Q5_K_M26,5 GB27,9 GBollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q5_K_M
Q6_K29,3 GB30,8 GBollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q6_K
Q8_036,9 GB38,5 GBollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:Q8_0
BF1669,4 GB71,6 GBollama run qwen3.6:35b-a3b-bf16

Quelle: https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF