Kosten / Beitrag / Stand 22.9.2026
Was ein KI-Vorgang wirklich kostet
Was kostet ein Vorgang, und warum explodieren Rechnungen trotzdem?
Die Tokenangst ist der häufigste Einwand in Gesprächen mit Verwaltungen, und sie ist berechtigt. Ein Beigeordneter einer Großstadt sagte 2026 öffentlich, man werde angefüttert, abhängig gemacht, und dann werde die Preisschraube angezogen. Ein Landkreis berichtete, sein Tokenverbrauch habe sich im Test verdreifacht. Beides stimmt, und beides hat eine Ursache, die sich vermeiden lässt.
Die Abrechnungseinheit
Sprachmodelle werden je Million Token abgerechnet, getrennt nach Eingabe (was das Modell liest) und Ausgabe (was es schreibt). Ein Token ist grob ein Wortteil; eine deutsche Textseite hat etwa 700 bis 1.000 Token. Listenpreise eines europäischen Anbieters, abgerufen am 22.09.2026:
| Modell | Eingabe je Mio. Token | Ausgabe je Mio. Token |
|---|---|---|
| Mistral Small 4 | 0,15 USD | 0,60 USD |
| Mistral Large 3 | 0,50 USD | 1,50 USD |
| Mistral Medium 3.5 | 1,50 USD | 7,50 USD |
Andere Anbieter liegen in ähnlichen Größenordnungen; Preise ändern sich, deshalb steht hier das Abrufdatum. Beim Betrieb im eigenen Rechenzentrum entfallen die Token-Preise, dafür fallen Hardware und Betrieb an, was bei geringer Auslastung teurer sein kann.
Rechenbeispiel: ein geprüfter Antrag
Annahmen: Antrag 12 Seiten, Nachweise 20 Seiten, zusammen rund 30.000 Token. Dazu die passenden Rechtsquellen aus der Wissensbasis, rund 15.000 Token, und eine Systemanweisung von 3.000 Token. Eingabe insgesamt 48.000 Token. Das Modell schreibt Nachforderungsliste und Entwurf, rund 2.000 Token Ausgabe.
| Schritt | Modell | Rechnung | Kosten |
|---|---|---|---|
| Vollständigkeit und Entwurf | Mistral Small 4 | 48.000 × 0,15 USD/Mio. + 2.000 × 0,60 USD/Mio. | 0,0072 + 0,0012 = 0,0084 USD |
| Dieselbe Aufgabe | Mistral Large 3 | 48.000 × 0,50 USD/Mio. + 2.000 × 1,50 USD/Mio. | 0,024 + 0,003 = 0,027 USD |
Ein Vorgang mit drei Modellschritten kostet mit dem kleinen Modell also rund 2,5 Cent, mit dem großen rund 8 Cent. Bei 1.000 Wohngeldanträgen im Monat sind das 25 bis 80 USD. Das ist keine Explosion. Eingang, Zuständigkeit und Übergabe brauchen gar kein Modell; sie laufen regelbasiert und kosten null Token.
Wo die Explosion entsteht
Die Rechnungen, über die Verwaltungen klagen, entstehen nicht durch Vorgänge, sondern durch Chats mit Grundlast. Wenn ein Assistent bei jeder Nachricht den gesamten Dokumentenbestand des Mandanten mitschickt, etwa 500.000 Token, kostet jede einzelne Nachricht:
| Modell | 500.000 Token Eingabe je Nachricht | 1.000 Nachrichten am Tag |
|---|---|---|
| Mistral Small 4 | 0,075 USD | 75 USD |
| Mistral Large 3 | 0,25 USD | 250 USD |
| Mistral Medium 3.5 | 0,75 USD | 750 USD |
Dieselbe Frage, die als Vorgang unter einem Cent kostet, kostet als Chat mit Grundlast bis zu 75 Cent. Zwei Ursachen: Es wird alles mitgeschickt statt nur das Passende (kein Retrieval), und es wird nichts zwischengespeichert (kein Caching). Ein zweiter Treiber ist Fehlnutzung in der Fläche; ein Beigeordneter formulierte es als Bild von 23.000 Beschäftigten, die den Speiseplan bei der KI abfragen.
Pro Kopf oder pro Vorgang
Eine Mittelstadt mit 1.400 Beschäftigten rechnete im Gespräch vor: Bei 10 bis 25 Euro Lizenz je Kopf und Monat zahle sie 14.000 bis 35.000 Euro monatlich, ohne zu wissen, ob es genutzt werde. Die Alternative, Preis je Vorgang, kostet nur, was bearbeitet wird, und lässt sich der Kämmerei je Vorgang ausweisen. Sie setzt aber voraus, dass der Verbrauch tatsächlich gemessen wird (Metering). Ohne Messung ist jede Kostenaussage eine Schätzung, auch die auf dieser Seite.
Vier Regeln gegen die Explosion
- Vorgänge statt offener Chats: Jeder Schritt bekommt nur die Daten, die er braucht.
- Kleines Modell zuerst, großes nur, wenn Software es je Aufgabe entscheidet.
- Regelbasierte Schritte kosten null: Eingang, Routing, Fristen, Plausibilität.
- Kostendeckel mit Frühwarnung, damit der Monat nie überrascht. Mehr dazu unter Kostendeckel.
Kurz gefragt
Wie viele Token hat eine Seite?
Eine deutsche DIN-A4-Seite Fließtext entspricht grob 700 bis 1.000 Token. Tabellen und Formulare liegen darüber, weil Struktur zusätzliche Zeichen kostet.
Warum kostet der Chat mehr als der Vorgang?
Ein Vorgang schickt nur die Akte und die passenden Rechtsquellen ans Modell. Ein Chat, der bei jeder Nachricht den gesamten Dokumentenbestand des Mandanten mitgibt, zahlt diese Grundlast jedes Mal neu.
Sind kleine Modelle gut genug?
Für Vollständigkeitsprüfung, Klassifikation und Entwürfe mit Wissensbasis in der Regel ja. Auf der AI4GOV-Konferenz 2026 wurde geschätzt, dass rund 98 Prozent der Anwendungsfälle mit kleineren Modellen genauso gut gehen. Die Entscheidung sollte Software je Aufgabe treffen, nicht ein Pauschalabo.
Quellen
- Mistral AI, API-Preisliste, abgerufen am 22.09.2026 , Listenpreise in US-Dollar je Million Token, Stand des Abrufs
- Gespräche mit Kommunen in Nordrhein-Westfalen, September 2026, eigene Mitschriften, anonymisiert
- Keynote und Podium AI4GOV Köln, 17.09.2026, eigene Mitschrift