Strix Halo gegen die Cloud: die Bierdeckel-Rechnung

2026-10-08

Die Strix-Halo-Maschine steht bei mir als AI-Lab auf dem Schreibtisch. Was ein Token dort kostet, habe ich auf einem Bierdeckel durchgespielt. Die Szenarien sind Überschlagswerte für diese Rechnung und nicht mein reales Nutzungsprofil.

Der Anschaffungspreis liegt heute bei etwa 3.700 bis 4.000 Euro, zum Beispiel für den Bosgame M5 mit Ryzen AI Max+ 395. Mann sind die teuer geworden. Beim Strom nehme ich den SWM-Grundversorgungstarif in München mit 32,44 Cent pro kWh, die Watt-Zahlen sind Kalkulationsannahmen pro Modell.

ProfilStrom im Monat
8 h eingeschaltet, davon 2 h Inferenz, nachts aus2,62–3,22 €
24/7 erreichbar, 2 h Inferenz pro Tag4,83–5,43 €
24 h ununterbrochene Inferenz18,95–26,05 €

Der Strom bleibt auf jedem Profil eine kleine Zahl. Interessanter ist, wie viel die Maschine dafür produziert. Die Geschwindigkeiten habe ich selbst am Ryzen AI Max+ 395 ermittelt. Es sind Decode-Obergrenzen, die Prompt-Verarbeitung kommt obendrauf:

ModellTempoDecode-Obergrenze
Qwen3-30B-A3B70 tok/s6,05 Mio Output/Tag
Gemma 4 26B A4B50 tok/s4,32 Mio Output/Tag
Qwen3.5-9B30 tok/s2,59 Mio Output/Tag
Qwen3-32B Dense10 tok/s0,86 Mio Output/Tag

Jetzt der Vergleich mit einer gemeinsamen Rate je Million Token. Bei der Cloud lege ich die OpenRouter-Preise vom Oktober 2026 zugrunde, Modellkennungen exakt wie in der Tabelle, ohne Cache- und Batch-Rabatte. Für das Verhältnis von Input zu Output nehme ich 3:1, dasselbe Verhältnis, mit dem Artificial Analysis API-Vergleiche rechnet; deren aktuelle Methodik bepreist Cache-Hits zusätzlich separat und drückt die Cloud-Sätze damit weiter. Lokal zählt der Strom-Anteil, die Prompt-Verarbeitung kostet dabei zusätzlich rund 30 Prozent der Decode-Zeit. Die Abschreibung kommt als zweiter lokaler Anteil dazu, einmal über drei, einmal über sechs Jahre.

ModellCloud (Mix 3:1)Lokal: StromVollkosten, 3 JahreVollkosten, 6 Jahre
Qwen3-30B-A3B0,233 €0,042 €0,887 €0,464 €
Gemma 4 26B A4B0,094 €0,059 €0,903 €0,481 €
Qwen3.5-9B0,100 €0,078 €0,923 €0,500 €
Qwen3-32B Dense0,141 €0,322 €1,167 €0,744 €

Die Vollkosten gelten für eine Million Output-Token am Tag, im Mix also vier Millionen Token insgesamt. Bei Qwen3-30B-A3B sind das rund fünf Stunden Verarbeitung pro Tag, bei Qwen3.5-9B rund zwölf. Beim Dense-Modell ist die Tagesmenge auf der Maschine nicht erreichbar: Eine Million Output-Token wären bei 10 tok/s allein 27,8 Stunden Generierung, dazu käme die Prompt-Verarbeitung.

Der Blick auf längere Laufzeiten verändert die Rechnung deutlich. Rechenzentren fahren ihre GPUs fünf, sechs Jahre, eine A100 läuft dort nicht nach drei Jahren aus dem Dienst. Bei 3.700 Euro Anschaffung fällt die monatliche Last damit von 103 auf 62 Euro bei fünf Jahren und auf 51 Euro bei sechs Jahren. Diese Rechnung hält API-Preise, Modellwahl und Menge über die gesamte Laufzeit konstant; sinkende API-Preise schieben den Break-even nach hinten, besser laufende lokale Modelle nach vorn:

Modell3 Jahre5 Jahre6 JahreMachbar mit der Maschine?
Qwen3-30B-A3B4,43 Mio Output/Tag2,66 Mio2,22 MioJa
Gemma 4 26B A4B24,1 Mio14,5 Mio12,1 MioÜber der Decode-Kapazität
Qwen3.5-9B38,5 Mio23,1 Mio19,2 MioÜber der Decode-Kapazität
Qwen3-32B DensekeinerkeinerkeinerCloud je Token günstiger

Der Sechsjahreswert von 2,22 Millionen Output-Token pro Tag bedeutet rund 8,8 Stunden Generierung plus 2,6 Stunden Prompt-Verarbeitung, zusammen knapp elfeinhalb Stunden an jedem Tag des Jahres.

Der Bierdeckel endet mit einer klaren Lesart. Bei einer Million Output-Token am Tag und den OpenRouter-Tarifen vom Oktober 2026 ist die API günstiger als ein heutiger Neukauf, die Abschreibung dominiert die lokalen Kosten. Qwen3-30B-A3B ist das einzige der vier Modelle, das die Anschaffung überhaupt zurückzahlen kann; nach sechs Jahren verlangt es rund 2,2 Millionen Output-Token an jedem Tag des Jahres, zusammen knapp elfeinhalb Stunden Verarbeitung. Wer Dauerlast dieser Größenordnung fährt, kann mit der Maschine rechnen. Für alles darunter bleibt die Cloud der günstigere Weg, und die Maschine zahlt sich über Kontrolle ab: eigene Daten, keine fremden Kontingente, Laborbetrieb ohne laufende Token-Abrechnung. Der Strom ist dabei der kleinste Posten, beim Dense-Modell entscheidet er sogar allein gegen lokal.

← Zurück zur Übersicht