AMD's Ryzen AI MAX+ 395 — codenaam Strix Halo — zit in een vreemde positie: te krachtig om "gewoon een laptop-chip" te zijn, te compact om als volwaardig AI-workstation te gelden. Met 40 RDNA 3.5-rekenkernen, 128 GB gedeeld geheugen en 256 GB/s bandbreedte haalt het een 70B-model volledig in geheugen zonder ook maar een discrete GPU te vereisen. Dit is wat je er vandaag mee kunt doen — en waar de software nog achterblijft.
Wat Strix Halo anders maakt
Het fundamentele onderscheid zit niet in de CPU-prestaties of de raw GPU-rekenkracht, maar in de geheugenarchitectuur. Waar een doorsnee laptop-SoC CPU en GPU via verschillende geheugenkanalen of zelfs gescheiden DRAM bedient, werkt Strix Halo met één uniforme geheugenpool. De 16 Zen 5-cores, de 40 RDNA 3.5-rekenkernen en de XDNA 2 NPU (50 TOPS) trekken allemaal uit dezelfde LPDDR5X-bus.
In de praktijk betekent dat: tot 112 GB van de 128 GB is exclusief toewijsbaar aan de GPU. Een 70B-model in Q4_K_M weegt 42–43 GB — het past volledig in het lokale VRAM-equivalent, zonder offload naar systeemgeheugen. Dat was tot voor kort het exclusieve terrein van workstationkaarten als de NVIDIA RTX 6000 Ada (48 GB, €8.000+) of een dual-RTX-4090-opstelling.
De bandbreedte is 256 GB/s theoretisch, en ongeveer 212–215 GB/s in werkelijke metingen. Dat is aanzienlijk meer dan een discrete middenklasse GPU (RTX 4070: 504 GB/s op dedicated geheugen), maar minder dan een RTX 4090 (1.008 GB/s). De bandbreedte is de harde limiet voor inferentiesnelheid: hoe groter het model, hoe zwaarder de bus belast wordt, ongeacht de rekenkracht.
De TDP is instelbaar tussen 45 W en 120 W. De meeste mini-PC's en compacte workstations configureren hem standaard op 54–65 W. Bij langdurige AI-belasting zakt de klok terug tot wat het koellichaam aankan — in de HP Z2 Mini G1a (de meest professionele Strix Halo-machine op de markt) gaat dat gepaard met merkbare ventilatorruis.
128 GB gedeeld geheugen haalt een 70B-model volledig van de schijf — in een pakket dat 60 W verbruikt en op een bureau past.
Welke LLM's haalbaar zijn
De 128 GB-configuratie biedt een speelruimte die je bij consumentenhardware zelden ziet. Hieronder de modellen die je volledig in geheugen laadt, met realistische snelheidsverwachtingen gemeten via llama.cpp (Vulkan-backend) op het Framework Desktop met AI Max+ 395:
Testbank — AMD Ryzen AI MAX+ 395, 128 GB, Framework Desktop
| Model | Quantisatie | VRAM-gebruik | Snelheid (tok/s) | Geschikt voor |
|---|---|---|---|---|
| Llama 3.1 8B Instruct | Q4_K_M | ~5,5 GB | 80–100 tok/s | Snelle assistentie, prototypen |
| Qwen 2.5 32B Instruct | Q4_K_M | ~22 GB | 30–42 tok/s | Code, analyse, meertalig |
| Llama 3.3 70B Instruct | Q4_K_M | ~43 GB | 5–8 tok/s | Complexe redenering, RAG-pijplijnen |
| Qwen3.5 35B-A3B (MoE) | Q4_K_M | ~24 GB | 40–50 tok/s | Instrueringstaken, instructie-tuning |
| Llama 4 Scout 109B (MoE) | Q4_K_M | ~65 GB | 10–20 tok/s | Lange context, multimodale tasks |
Gemeten met llama.cpp Vulkan-backend (RADV), ROCm 7.2.x op Linux. Windows-resultaten liggen 10–20% lager door driver-overhead. MoE-modellen profiteren sterk van de geheugenruimte: alleen actieve experts worden geladen.
De 70B-klasse op 5–8 tok/s klinkt teleurstellend — en voor interactief chatten is dat ook zo. Maar voor batch-inferentie, RAG-evaluaties of nachtelijke redeneer-taken is het volkomen bruikbaar. Mixture-of-Experts modellen als Llama 4 Scout (109B totaal, 17B actief per token) zijn hier het meest interessant: hun architectuur benut de grote geheugenruimte terwijl de rekendruk laag blijft, wat 10–20 tok/s oplevert bij een modelvermogen dat theoretisch boven een dense 70B uitkomt.
Software-realiteit: ROCm-status in januari 2026
Hier wordt het eerlijk gezegd rommelig. AMD's ROCm-ecosysteem heeft Strix Halo formeel opgenomen onder gfx1151 — de GPU-target-ID voor RDNA 3.5 op Strix Halo. ROCm 7.2.2, uitgelicht op CES 2026, brengt voor het eerst een gecombineerde Windows+Linux-release en benoemt Ryzen AI 400-serie als first-class citizen. Maar de dagelijkse realiteit voor ontwikkelaars is complexer.
Linux werkt het best. Op Ubuntu 24.04 of Fedora 41 met de RADV Vulkan-driver is llama.cpp stabiel en snel. De community-benchmark-pagina voor Framework Desktop laat consistente resultaten zien; de ROCm HIP-backend werkt maar is gevoelig voor versies — een verkeerde ROCm-installatie levert stille KV-cache-dumpfouten op (bekend issue #18011 in de llama.cpp-tracker).
Windows is werk in uitvoering. HIP SDK voor Windows bestaat, maar het ontbeert de volledige toolchain van Linux. PyTorch via ROCm werkt op Windows via WSL2, niet native. Voor fine-tuning en training (bv. met Unsloth of axolotl) moet je dus in WSL2 of volledig Linux werken. AMD heeft ROCm native Windows-support aangekondigd als roadmap-item; de stabiele configuraties zijn er nog niet per release-datum van dit artikel.
Vulkan als praktisch alternatief. Voor pure inferentie via llama.cpp presteert de Vulkan-backend (RADV) op Strix Halo aantoonbaar beter dan ROCm HIP, en zonder de installatiecomplexiteit. Meerdere community-tests bevestigen dat Vulkan 10–15% meer tok/s geeft op dezelfde hardware. Voor productie-inferentie is dit in januari 2026 de aanbevolen stack.
De situatie voor PyTorch, TensorFlow en Transformers-gebaseerde fine-tuning is minder rooskleurig: zonder stabiele native ROCm Windows-ondersteuning en met beperkte GPU-rekenkracht (60 TFLOPS FP16 tegenover 330 TFLOPS op een H100) is Strix Halo geen vervanging voor een NVIDIA-kaart in een klassieke trainingsworkflow. Het is een inferentie-machine, geen trainings-rig.
Beschikbare machines: HP Z2 Mini G1a en Framework Desktop
Twee machines verdienen specifiek aandacht als je Strix Halo serieus overweegt voor AI-development.
De HP Z2 Mini G1a is het meest professionele aanbod: ISV-gecertificeerd, met het Ryzen AI MAX+ PRO 395 (de workstation-variant met ECC-geheugenondersteuning), en verkrijgbaar met 128 GB LPDDR5X. De prijs voor de top-configuratie met 2 TB SSD ligt rond de $3.343 (B&H). HP levert een volledige workstation-garantie en professionele driver-ondersteuning. De keerzijde: het RAM is gesoldeerd en niet uitbreidbaar, en het systeem genereert merkbare ventilatorruis onder AI-belasting.
Het Framework Desktop is de transparantere keuze voor developers die Linux als primair systeem draaien. Phoronix-benchmarks bevestigen uitstekende Linux-prestaties; Framework biedt stabiele ROCm-configuratiegidsen per maand bij. De prijs voor de MAX+ 395 met 128 GB (zonder opslag) is $1.999 — significant goedkoper dan de HP, maar ook minder professioneel gecertificeerd. De modulaire behuizing (4,5 liter, optioneel draaghandvat) is een voordeel voor developers die het apparaat tussen kantoor en thuiswerkplek mee willen nemen.
Goedkopere mini-PC's van GMKtec (EVO-X2) en Beelink (GTR9 Pro) bieden dezelfde chip voor $800–1.200, maar met minder betrouwbare koeling en kortere garantietrajecten. Voor een machine die je fulltime als dev-workstation gebruikt, zijn de HP en Framework de betere keuze.
Wie dit moet kopen — en wie moet wachten
Strix Halo is op dit moment de interessantste AI-ontwikkelaarsmachine onder de €3.000 als je aan één specifiek criterium voldoet: je werkt primair met inferentie en je hebt geheugenruimte nodig die een RTX 4090 niet biedt.
Het past bij je als je:
- 70B-modellen lokaal wilt draaien voor RAG-pijplijnen, evaluaties of offline privacy-gevoelige taken
- Linux als primair OS gebruikt en bereid bent de ROCm/Vulkan-stack zelf in te stellen
- Weinig deskruimte hebt of het systeem mobiel wilt inzetten
- Energiekosten meewegen: 60 W voor een 70B-machine is ongekend zuinig
Wacht nog even als je:
- Windows als primair OS gebruikt en native PyTorch/ROCm-ondersteuning nodig hebt — dat is er nog niet stabiel
- Fine-tuning of training uitvoert: de GPU-rekenkracht (60 TFLOPS) is te laag ten opzichte van een RTX 4090 (82 TFLOPS) of een RTX 5090
- Absolute inferentiesnelheid op kleinere modellen prioriteit heeft: een RTX 4090 haalt 55–70 tok/s op een 70B Q4-model bij full VRAM-bezetting, Strix Halo haalt 5–8 tok/s op hetzelfde model
- AMD's Ryzen AI Halo developer-mini-PC afwacht — die staat gepland voor Q2 2026 met dag-1 ROCm-ondersteuning en is specifiek voor dit gebruik gebouwd
Veelgestelde vragen
Hoeveel van de 128 GB is beschikbaar voor de GPU?
Tot 112 GB is exclusief toewijsbaar aan de GPU-pool. De overige 16 GB is gereserveerd voor het besturingssysteem en CPU-geheugen. In de praktijk configureer je dit via de BIOS of via ROCm GPU-geheugeninstellingen.
Werkt PyTorch met ROCm op Strix Halo?
Op Linux werkt het via ROCm 7.2.x, zij het met soms instabiele versie-combinaties. Op Windows is de aanbevolen route WSL2 met ROCm. Native Windows PyTorch-ondersteuning is in ontwikkeling maar nog niet stabiel als van januari 2026.
Is Strix Halo sneller dan een RTX 4090 voor lokale LLM's?
Nee voor snelheid, ja voor modelgrootte. Op een 7B- of 13B-model is een RTX 4090 sneller. Op een 70B-model kan de RTX 4090 het model niet volledig in VRAM laden (24 GB vs. 43 GB benodigd), terwijl Strix Halo met 128 GB dat moeiteloos doet — al is de snelheid dan lager.
Welke llama.cpp-backend gebruik ik het best?
Op Linux: Vulkan (RADV) voor stabiele dagelijkse inferentie, ROCm HIP voor betere prestaties als je bereid bent de installatiecomplexiteit te accepteren. Op Windows: Vulkan via llama.cpp is het meest stabiele pad in de huidige software-generatie.
Kan ik meerdere modellen tegelijk laden?
Ja — 128 GB biedt daar unieke ruimte voor. Je kunt bijvoorbeeld een 7B-model (5 GB) en een 70B-model (43 GB) gelijktijdig in geheugen houden en wisselen zonder herlaadtijd. Tools als Ollama ondersteunen dit via model-caching in het gedeelde geheugen.