Was ein lokaler KI-Server wirklich kostet
Ein Server mit einer 96-GB-Karte kostet so viel wie ein Kleinwagen, und die Rechnung dazu passt auf eine Serviette: einmal zahlen statt jeden Monat. Diese Serviette ist falsch. Hier steht, was tatsächlich anfällt und ab welchem Volumen sich eigene Hardware trägt.
Die kurze Antwort
- Gegen ein EU-gehostetes offenes Modell rechnet sich eigene Hardware im Mittelstand fast nie.
- Gegen ein Premium-Modell liegt die Schwelle bei rund 64 Millionen Token im Monat.
- Den Ausschlag gibt selten der Preis, sondern Datenschutz, Unabhängigkeit oder Betrieb ohne Netz.
- Im Rechner unten setzt ihr eure eigenen Zahlen ein.
Die Rechnung, die im Angebot fehlt
In Foren wie r/LocalLLM steht seit Monaten dieselbe Sorte Beitrag oben: jemand bekommt ein sehr großes Modell auf einer einzelnen Consumer-Karte zum Laufen und rechnet die eingesparten API-Kosten hoch. Die Messungen sind meistens echt, die Rechnung daneben selten. Sie vergleicht mit dem teuersten Modell am Markt und nimmt die Maschine als voll ausgelastet an. Beides trifft in einem Betrieb mit Bürozeiten nicht zu.
Wie groß der Unterschied ist, zeigt eine Messung, die beide Zahlen trennt: LLMKube kommt auf Consumer-Karten bei 32,7 Prozent Auslastung auf 0,13 US-Dollar je Million Token Vollkosten, aber nur 0,010 US-Dollar reine Stromkosten. Faktor 13, und die Maschine war dabei ein Drittel der Zeit beschäftigt. In einem normalen Büro liegt dieser Wert weit unter einem Prozent.
Was wirklich anfällt
Neben der Anschaffung stehen vier Posten, die in Angeboten selten auftauchen. Betreuung: Treiber, Modellwechsel, Updates, ein defekter Lüfter, ein bis drei Stunden im Monat. Leerlaufstrom: dazu gleich mehr, es ist der größte Einzelposten neben der Abschreibung. Ausfallreserve: entweder eine zweite Maschine oder ein Fallback auf eine API, sonst steht der Assistent an dem Tag still, an dem das Netzteil stirbt. Wechselkosten: alle sechs bis neun Monate erscheint ein Modell, das nicht mehr in euren Speicher passt.
Einen Posten gibt es zugunsten des Kaufs: den Restwert. Gebrauchte GPUs halten ihren Preis derzeit ungewöhnlich gut, eine RTX 3090 liegt sechs Jahre nach Erscheinen noch bei 800 bis 1.300 US-Dollar (Preisverlauf).
Fünf Wege zu einem lokalen Modell
Die Hardwarefrage ist in Wahrheit eine Speicherfrage: Ein Modell muss in den Speicher passen, sonst bestimmt nicht mehr die Grafikkarte das Tempo.
Hardware für lokale Modelle, Stand August 2026
Durchsatz gemessen auf einem 30B-Modell mit vLLM bei hoher Parallelität, nicht im Einzelchat.
| System | Speicher | Preis | Durchsatz | Wofür |
|---|---|---|---|---|
| Gebrauchte RTX 3090 | 24 GB | 800 bis 1.300 $ | nicht vergleichbar gemessen | günstigster Einstieg |
| RTX 5090 | 32 GB | ca. 4.330 $ | 4.570 Tok/s | bestes Preis-Leistungs-Verhältnis |
| RTX PRO 6000 Blackwell | 96 GB | 8.000 bis 9.400 $ | 8.425 Tok/s | 120B-Modelle ohne Auslagerung |
| DGX Spark | 128 GB gemeinsam | ab 4.800 € | für Einzelnutzer | große Modelle, langsam |
| Framework Desktop, Strix Halo | 128 GB gemeinsam | ab 1.999 $ | für Einzelnutzer | sparsam und leise |
| Hetzner GEX131, Miete | 96 GB | 889 € im Monat | 8.425 Tok/s | ohne Kapitalbindung |
Preise in US-Dollar sind Straßenpreise, keine Listenpreise. Systeme mit gemeinsamem Speicher werden nicht in Token pro Sekunde verglichen, weil ihre Bandbreite für parallele Anfragen nicht ausgelegt ist.
Fünf Wege zu einem lokalen Modell
Nicht die schnellste Maschine gewinnt, sondern die, deren Speicher zum Modell passt und deren Preis zum Volumen. Wähle eine Klasse und vergleiche, was sie kostet, verbraucht und aushält.
Die RTX PRO 6000 Blackwell ist die einzige Einzelkarte, auf der ein 120B-Modell ohne Auslagerung läuft. Sie ist auch die Karte, deren Listenpreis sich in sechzehn Monaten um mehr als die Hälfte erhöht hat, weil GDDR7 knapp ist.
- Speicher für Modelle
- 96 GB GDDR7 mit ECC
- Passt dazu
- Dichte Modelle bis 70B in FP8, MoE-Modelle jenseits von 200B in 4 Bit
- Leistungsaufnahme
- 95 W im Leerlauf, bis 600 W unter Last
- Durchsatz
- rund 8.400 Token pro Sekunde auf einem 30B-Modell mit vLLM, etwa das 1,8-fache einer RTX 5090
Dafür Ein Gerät, ein Stromanschluss, ECC-Speicher, Platz für das nächstgrößere Modell.
Dagegen Preis pro Gigabyte deutlich über den Consumer-Karten, und der Markt ist volatil. Was heute 9.000 Euro kostet, kann im Quartal darauf 13.000 kosten.
Zwei Zahlen daraus sind bemerkenswert. Der Listenpreis der RTX PRO 6000 Blackwell ist in sechzehn Monaten von 8.565 auf 13.250 US-Dollar gestiegen, weil GDDR7 knapp ist (Wccftech, Preisübersicht). Dieselbe Karte steckt bei Hetzner in einem Server für 889 Euro im Monat, inklusive Strom und Ersatz bei Defekt. Die Karte allein zu kaufen kostet also etwa ein Jahr Miete. Stundenweise geht es bei Scaleway ab 0,79 Euro, ebenfalls mit Rechenzentrum in der EU.
Leerlauf und Token-Preise
Ein Server mit Profikarte zieht im Leerlauf rund 95 Watt. Läuft er durch, sind das beim aktuellen Gewerbestrompreis von etwa 27 Cent je Kilowattstunde (Strom-Report, wattline) rund 225 Euro im Jahr, ohne dass eine einzige Anfrage beantwortet wurde. Die Rechenzeit selbst fällt daneben nicht ins Gewicht: Zwölf Millionen Ausgabe-Token, etwa 30.000 ordentliche Antworten, beschäftigen die Karte bei gemessenen 8.425 Token pro Sekunde (GPU-Benchmark 2026) knapp 24 Minuten. Nicht am Tag, im Monat.
Auf der anderen Seite fallen die Preise seit zwei Jahren. Zwischen dem günstigsten und dem teuersten brauchbaren Modell liegt der Faktor 170, und das ist der größte Hebel in der ganzen Rechnung. Die ehrliche Vergleichsgröße für eigene Hardware steht in der Mitte: offene Modelle, gehostet in der EU, etwa im IONOS AI Model Hub in Berlin (Überblick) oder bei Mistral.
Preise je Million Token, Stand August 2026
Dieselbe Aufgabe, vier Größenordnungen Unterschied. Die hervorgehobene Zeile ist die Vergleichsgröße im Rechner weiter unten.
| Modell | Betrieb | Eingabe | Ausgabe |
|---|---|---|---|
| Qwen Flash | global | 0,03 $ | 0,13 $ |
| DeepSeek V4 Flash | China | 0,14 $ | 0,28 $ |
| DeepSeek V4 Pro | China | 0,44 $ | 0,87 $ |
| Qwen 3.5 9B über IONOS | Berlin | 0,10 € | 0,15 € |
| Mistral Small 24B über IONOS | Berlin | 0,10 € | 0,30 € |
| GPT-OSS 120B über IONOS | Berlin | 0,15 € | 0,65 € |
| Qwen 3.5 Plus | global | 0,40 $ | 2,40 $ |
| GPT-5.3 Codex | USA | 1,75 $ | 14,00 $ |
| Claude Opus 4.6 | USA | 5,00 $ | 25,00 $ |
Quellen: Preislisten der Anbieter sowie die Übersichten von BenchLM, ai-prices.eu und ki-praxisbeispiele.de, alle unten verlinkt. Preise mit Prompt-Caching liegen bei Cache-Treffern deutlich darunter, bei DeepSeek bei einem Fünfzigstel des Eingabepreises.
Der Rechner
Alle Größen zusammengesetzt, mit euren Werten. Die Voreinstellung entspricht einem Betrieb mit rund 30 aktiven Nutzern.
Break-even-Rechner: eigener Server gegen API
Vier Zahlen entscheiden, ob sich eigene Hardware rechnet: euer Tokenvolumen, die Maschine, der Strompreis und der Aufwand, den jemand mit dem Betrieb hat. Stell sie auf eure Werte und lies unten ab, nach wie vielen Monaten der Kauf wieder drin ist.
Entspricht rund 1.435 Anfragen pro Arbeitstag mit je etwa 1.500 Token Kontext und 400 Token Antwort.
Eigene Maschine
516 €/Monat
- Abschreibung (36 Mon.)
- 347 €
- Strom
- 19 €
- Betreuung
- 150 €
8,60 € je Mio. Token
EU-gehostet, offenes Modell
15 €/Monat
- Eingabe (48 Mio.)
- 7 €
- Ausgabe (12 Mio.)
- 8 €
- Hardware
- 0 €
0,25 € je Mio. Token
Schon die laufenden Kosten liegen über der Cloud-Rechnung. Die Anschaffung amortisiert sich in dieser Konstellation nie.
Ausgelastet ist die Maschine dabei zu 0,05 %. Die restliche Zeit heizt sie den Serverraum. Genau daran scheitern die meisten Rechnungen.
Gerechnet mit 80 Prozent Eingabe- und 20 Prozent Ausgabe-Token, einer Nutzungsdauer von 36 Monaten, Dauerbetrieb rund um die Uhr und den in den Quellen verlinkten Listenpreisen (Stand August 2026, USD mit 0,90 Euro umgerechnet, alle Beträge netto). Der Durchsatz stammt aus veröffentlichten vLLM-Messungen bei hoher Parallelität, nicht aus einem Einzelchat.
Das Ergebnis in der Voreinstellung: 516 Euro im Monat für die eigene Maschine, 15 Euro für dasselbe Volumen bei einem EU-gehosteten offenen Modell. Vom Strom entfallen 18,71 von 18,80 Euro auf den Leerlauf.
Monatliche Kosten nach Volumen
Eigene Maschine: 12.500 Euro auf 36 Monate, 27 Cent je Kilowattstunde, 150 Euro Betreuung.
| Tokenvolumen | Eigene Maschine | EU, offenes Modell | Günstiges Frontier | Premium-Modell |
|---|---|---|---|---|
| 10 Mio., ca. 5 Nutzer | 516 € | 3 € | 2 € | 81 € |
| 60 Mio., ca. 30 Nutzer | 516 € | 15 € | 9 € | 486 € |
| 600 Mio., ca. 300 Nutzer | 517 € | 150 € | 91 € | 4.860 € |
Der Betrag für die eigene Maschine ändert sich über den ganzen Bereich um weniger als einen Euro: 99,95 Prozent der Betriebszeit sind Leerlauf. Break-even gegen das Premium-Modell liegt bei rund 64 Millionen Token, gegen das EU-gehostete offene Modell erst bei rund zwei Milliarden.
Wichtig ist nur, dass die eingesetzten Zahlen gemessen sind. Vier Wochen über einen Proxy wie LiteLLM mitschreiben kostet nichts und beantwortet nebenbei, welche Abteilung überhaupt wie viel nutzt.
Was nicht in Euro steht
Damit sieht es entschieden aus. Ist es nicht, denn die stärksten Gründe für eigene Hardware stehen in keiner Kostenzeile: Daten, die das Haus nicht verlassen dürfen, etwa Personalakten oder Mandantenakten, sparen den Aufwand für Anbieterprüfung und Auftragsverarbeitung. Unabhängigkeit, weil ein lokales Modell sich in zwei Jahren noch genauso verhält. Und Betrieb ohne Netz, in Werkstatt, Halle oder auf der Baustelle.
Steuerlich hilft der Kauf zusätzlich: Computerhardware darf mit einer Nutzungsdauer von einem Jahr angesetzt werden (Einordnung). Das ist ein Liquiditätsvorteil, kein Kostenvorteil, das Geld ist trotzdem ausgegeben. Dagegen steht ein Punkt, der selten genannt wird: Ihr kauft nicht nur eine Karte, sondern eine Zuständigkeit. Ein sauber gebauter MCP-Server lässt sich in zehn Minuten auf ein anderes Modell umhängen, eine Maschine im Keller nicht.
Vor dem Angebot
Diese sieben Punkte verhindern, dass die Entscheidung auf Annahmen beruht.
Sieben Fragen, die vor dem Angebot beantwortet sein müssen
Fazit
Für die meisten mittelständischen Betriebe rechnet sich ein eigener KI-Server 2026 nicht über die Token. Wer trotzdem kauft, kauft Datenhoheit, Unabhängigkeit oder Offline-Betrieb, und das sind gute Gründe. Sie sollten nur ausgesprochen werden, statt sich hinter einer ROI-Folie zu verstecken.
Der Weg dahin: vier Wochen messen, die eigenen Zahlen in den Rechner eintragen, und bei knappem Ergebnis erst sechs Monate mieten. Damit die Anwendung beide Wege bedienen kann, gehört sie an eine OpenAI-kompatible Schnittstelle, wie Ollama, vLLM und llama.cpp sie alle anbieten. Der Wechsel zwischen lokal und Cloud ist dann eine Umgebungsvariable. Wie das im Alltag aussieht, zeigen unsere Case Studies.
- LLMKube: Kosten je Million Token auf Consumer-GPUs, mit Methodik
- GPU-Benchmark 2026: RTX PRO 6000, RTX 5090 und H100 im Vergleich
- Durchsatzoptimierung für Qwen3 Coder auf RTX 5090 und PRO 6000
- Hetzner: dedizierte GPU-Server, Übersicht
- Test der Hetzner-GEX-Server mit konkreten Monatspreisen
- Scaleway: GPU-Instanzen und Stundenpreise
- Preisentwicklung der RTX PRO 6000 Blackwell
- Preisverlauf RTX 5090, neu und gebraucht
- Preisverlauf RTX 3090, neu und gebraucht
- Framework Desktop mit Strix Halo im Test
- BenchLM: Preisvergleich aller gängigen Modell-APIs
- ai-prices.eu: Preisübersicht mit europäischem Fokus
- LLM-Preisvergleich auf Deutsch, in Euro
- IONOS AI Model Hub: Modelle und Preise
- LiteLLM-Proxy: Verbrauch pro Anfrage mitschreiben
- Gewerbestrompreise 2026 im Überblick
- Sofortabschreibung für Computerhardware: rechtliche Einordnung
- r/LocalLLM: wo diese Debatte täglich geführt wird