Qwen3-Coder 30B A3B
Qwen3-Coder 30B A3B braucht mit der Variante Q4_K_M rund 20,1 GB Speicher und läuft auf 198 von 414 geführten Geräten flüssig.
Mit dem wenigsten Speicher schafft es: ASUS ROG Strix SCAR 16 (2025), GeForce RTX 5090 Laptop GPU, 32 GB.
Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten Messungen abgeglichen, aber nicht auf diesem Gerät gemessen.
- Anbieter
- Alibaba (Qwen)
- Parameter
- 30,5 Mrd., davon 3,3 Mrd. aktiv
- Längster Kontext
- 262.144 Token
- Lizenz
- apache-2.0
So starten Sie es mit Ollama:
$ ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_MGeräte, auf denen es flüssig läuft
Alle Tempowerte sind berechnet und an veröffentlichten Messungen abgeglichen, nicht auf dem Gerät gemessen. Mit * markierte Werte sind nicht abgeglichen und deshalb unsicher.
und 188 weitere
Grafikkarten, in die es ganz passt
| Grafikkarte | Urteil | Tempo | Speicher |
|---|---|---|---|
| AMD Radeon RX 7900 XTX, 24 GB | Läuft gut | 219 bis 380 Token/s * | 24 GB davon 23,2 GB nutzbar |
| NVIDIA GeForce RTX 4090, 24 GB | Läuft gut | 163 bis 244 Token/s | 24 GB davon 23,2 GB nutzbar |
| NVIDIA GeForce RTX 3090 Ti, 24 GB | Läuft gut | 163 bis 244 Token/s | 24 GB davon 23,2 GB nutzbar |
| NVIDIA GeForce RTX 3090, 24 GB | Läuft gut | 155 bis 233 Token/s | 24 GB davon 23,2 GB nutzbar |
| NVIDIA RTX A5000, 24 GB | Läuft gut | 137 bis 205 Token/s | 24 GB davon 23,2 GB nutzbar |
| NVIDIA RTX PRO 4000 Blackwell, 24 GB | Läuft gut | 125 bis 188 Token/s | 24 GB davon 23,2 GB nutzbar |
| NVIDIA RTX 4500 Ada Generation, 24 GB | Läuft gut | 90 bis 135 Token/s | 24 GB davon 23,2 GB nutzbar |
| NVIDIA GeForce RTX 5090, 32 GB | Läuft gut | 220 bis 330 Token/s | 32 GB davon 31,2 GB nutzbar |
| AMD Radeon AI PRO R9700, 32 GB | Läuft gut | 154 bis 268 Token/s * | 32 GB davon 31,2 GB nutzbar |
| AMD Radeon PRO W7800, 32 GB | Läuft gut | 139 bis 242 Token/s * | 32 GB davon 31,2 GB nutzbar |
und 7 weitere
Alle Geräte und Grafikkarten für Qwen3-Coder 30B A3B
Varianten
| Variante | Datei | Speicherbedarf | Startbefehl |
|---|---|---|---|
| Q3_K_M | 14,7 GB | 16,2 GB | ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q3_K_M |
| Q4_0 | 17,4 GB | 18,9 GB | ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_0 |
| Q4_K_M | 18,6 GB | 20,1 GB | ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_M |
| Q5_K_M | 21,7 GB | 23,4 GB | ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q5_K_M |
| Q6_K | 25,1 GB | 26,8 GB | ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q6_K |
| Q8_0 | 32,5 GB | 34,3 GB | ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q8_0 |
| BF16 | 61,1 GB | 63,5 GB | ollama run qwen3-coder:30b-a3b-fp16 |
Quelle: https://huggingface.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF