Die Strix-Halo-Maschine steht bei mir als AI-Lab auf dem Schreibtisch. Was ein Token dort kostet, habe ich auf einem Bierdeckel durchgespielt. Die Szenarien sind Überschlagswerte für diese Rechnung und nicht mein reales Nutzungsprofil.
Der Anschaffungspreis liegt heute bei etwa 3.700 bis 4.000 Euro, zum Beispiel für den Bosgame M5 mit Ryzen AI Max+ 395. Mann sind die teuer geworden. Beim Strom nehme ich den SWM-Grundversorgungstarif in München mit 32,44 Cent pro kWh, die Watt-Zahlen sind Kalkulationsannahmen pro Modell.
| Profil | Strom im Monat |
|---|---|
| 8 h eingeschaltet, davon 2 h Inferenz, nachts aus | 2,62–3,22 € |
| 24/7 erreichbar, 2 h Inferenz pro Tag | 4,83–5,43 € |
| 24 h ununterbrochene Inferenz | 18,95–26,05 € |
Der Strom bleibt auf jedem Profil eine kleine Zahl. Interessanter ist, wie viel die Maschine dafür produziert. Die Geschwindigkeiten habe ich selbst am Ryzen AI Max+ 395 ermittelt. Es sind Decode-Obergrenzen, die Prompt-Verarbeitung kommt obendrauf:
| Modell | Tempo | Decode-Obergrenze |
|---|---|---|
| Qwen3-30B-A3B | 70 tok/s | 6,05 Mio Output/Tag |
| Gemma 4 26B A4B | 50 tok/s | 4,32 Mio Output/Tag |
| Qwen3.5-9B | 30 tok/s | 2,59 Mio Output/Tag |
| Qwen3-32B Dense | 10 tok/s | 0,86 Mio Output/Tag |
Jetzt der Vergleich mit einer gemeinsamen Rate je Million Token. Bei der Cloud lege ich die OpenRouter-Preise vom Oktober 2026 zugrunde, Modellkennungen exakt wie in der Tabelle, ohne Cache- und Batch-Rabatte. Für das Verhältnis von Input zu Output nehme ich 3:1, dasselbe Verhältnis, mit dem Artificial Analysis API-Vergleiche rechnet; deren aktuelle Methodik bepreist Cache-Hits zusätzlich separat und drückt die Cloud-Sätze damit weiter. Lokal zählt der Strom-Anteil, die Prompt-Verarbeitung kostet dabei zusätzlich rund 30 Prozent der Decode-Zeit. Die Abschreibung kommt als zweiter lokaler Anteil dazu, einmal über drei, einmal über sechs Jahre.
| Modell | Cloud (Mix 3:1) | Lokal: Strom | Vollkosten, 3 Jahre | Vollkosten, 6 Jahre |
|---|---|---|---|---|
| Qwen3-30B-A3B | 0,233 € | 0,042 € | 0,887 € | 0,464 € |
| Gemma 4 26B A4B | 0,094 € | 0,059 € | 0,903 € | 0,481 € |
| Qwen3.5-9B | 0,100 € | 0,078 € | 0,923 € | 0,500 € |
| Qwen3-32B Dense | 0,141 € | 0,322 € | 1,167 € | 0,744 € |
Die Vollkosten gelten für eine Million Output-Token am Tag, im Mix also vier Millionen Token insgesamt. Bei Qwen3-30B-A3B sind das rund fünf Stunden Verarbeitung pro Tag, bei Qwen3.5-9B rund zwölf. Beim Dense-Modell ist die Tagesmenge auf der Maschine nicht erreichbar: Eine Million Output-Token wären bei 10 tok/s allein 27,8 Stunden Generierung, dazu käme die Prompt-Verarbeitung.
Der Blick auf längere Laufzeiten verändert die Rechnung deutlich. Rechenzentren fahren ihre GPUs fünf, sechs Jahre, eine A100 läuft dort nicht nach drei Jahren aus dem Dienst. Bei 3.700 Euro Anschaffung fällt die monatliche Last damit von 103 auf 62 Euro bei fünf Jahren und auf 51 Euro bei sechs Jahren. Diese Rechnung hält API-Preise, Modellwahl und Menge über die gesamte Laufzeit konstant; sinkende API-Preise schieben den Break-even nach hinten, besser laufende lokale Modelle nach vorn:
| Modell | 3 Jahre | 5 Jahre | 6 Jahre | Machbar mit der Maschine? |
|---|---|---|---|---|
| Qwen3-30B-A3B | 4,43 Mio Output/Tag | 2,66 Mio | 2,22 Mio | Ja |
| Gemma 4 26B A4B | 24,1 Mio | 14,5 Mio | 12,1 Mio | Über der Decode-Kapazität |
| Qwen3.5-9B | 38,5 Mio | 23,1 Mio | 19,2 Mio | Über der Decode-Kapazität |
| Qwen3-32B Dense | keiner | keiner | keiner | Cloud je Token günstiger |
Der Sechsjahreswert von 2,22 Millionen Output-Token pro Tag bedeutet rund 8,8 Stunden Generierung plus 2,6 Stunden Prompt-Verarbeitung, zusammen knapp elfeinhalb Stunden an jedem Tag des Jahres.
Der Bierdeckel endet mit einer klaren Lesart. Bei einer Million Output-Token am Tag und den OpenRouter-Tarifen vom Oktober 2026 ist die API günstiger als ein heutiger Neukauf, die Abschreibung dominiert die lokalen Kosten. Qwen3-30B-A3B ist das einzige der vier Modelle, das die Anschaffung überhaupt zurückzahlen kann; nach sechs Jahren verlangt es rund 2,2 Millionen Output-Token an jedem Tag des Jahres, zusammen knapp elfeinhalb Stunden Verarbeitung. Wer Dauerlast dieser Größenordnung fährt, kann mit der Maschine rechnen. Für alles darunter bleibt die Cloud der günstigere Weg, und die Maschine zahlt sich über Kontrolle ab: eigene Daten, keine fremden Kontingente, Laborbetrieb ohne laufende Token-Abrechnung. Der Strom ist dabei der kleinste Posten, beim Dense-Modell entscheidet er sogar allein gegen lokal.