fiege.ai

Kosten / Beitrag / Stand 22.9.2026

Was ein KI-Vorgang wirklich kostet

Was kostet ein Vorgang, und warum explodieren Rechnungen trotzdem?

Die Tokenangst ist der häufigste Einwand in Gesprächen mit Verwaltungen, und sie ist berechtigt. Ein Beigeordneter einer Großstadt sagte 2026 öffentlich, man werde angefüttert, abhängig gemacht, und dann werde die Preisschraube angezogen. Ein Landkreis berichtete, sein Tokenverbrauch habe sich im Test verdreifacht. Beides stimmt, und beides hat eine Ursache, die sich vermeiden lässt.

Die Abrechnungseinheit

Sprachmodelle werden je Million Token abgerechnet, getrennt nach Eingabe (was das Modell liest) und Ausgabe (was es schreibt). Ein Token ist grob ein Wortteil; eine deutsche Textseite hat etwa 700 bis 1.000 Token. Listenpreise eines europäischen Anbieters, abgerufen am 22.09.2026:

Modell Eingabe je Mio. Token Ausgabe je Mio. Token
Mistral Small 4 0,15 USD 0,60 USD
Mistral Large 3 0,50 USD 1,50 USD
Mistral Medium 3.5 1,50 USD 7,50 USD

Andere Anbieter liegen in ähnlichen Größenordnungen; Preise ändern sich, deshalb steht hier das Abrufdatum. Beim Betrieb im eigenen Rechenzentrum entfallen die Token-Preise, dafür fallen Hardware und Betrieb an, was bei geringer Auslastung teurer sein kann.

Rechenbeispiel: ein geprüfter Antrag

Annahmen: Antrag 12 Seiten, Nachweise 20 Seiten, zusammen rund 30.000 Token. Dazu die passenden Rechtsquellen aus der Wissensbasis, rund 15.000 Token, und eine Systemanweisung von 3.000 Token. Eingabe insgesamt 48.000 Token. Das Modell schreibt Nachforderungsliste und Entwurf, rund 2.000 Token Ausgabe.

Schritt Modell Rechnung Kosten
Vollständigkeit und Entwurf Mistral Small 4 48.000 × 0,15 USD/Mio. + 2.000 × 0,60 USD/Mio. 0,0072 + 0,0012 = 0,0084 USD
Dieselbe Aufgabe Mistral Large 3 48.000 × 0,50 USD/Mio. + 2.000 × 1,50 USD/Mio. 0,024 + 0,003 = 0,027 USD

Ein Vorgang mit drei Modellschritten kostet mit dem kleinen Modell also rund 2,5 Cent, mit dem großen rund 8 Cent. Bei 1.000 Wohngeldanträgen im Monat sind das 25 bis 80 USD. Das ist keine Explosion. Eingang, Zuständigkeit und Übergabe brauchen gar kein Modell; sie laufen regelbasiert und kosten null Token.

Wo die Explosion entsteht

Die Rechnungen, über die Verwaltungen klagen, entstehen nicht durch Vorgänge, sondern durch Chats mit Grundlast. Wenn ein Assistent bei jeder Nachricht den gesamten Dokumentenbestand des Mandanten mitschickt, etwa 500.000 Token, kostet jede einzelne Nachricht:

Modell 500.000 Token Eingabe je Nachricht 1.000 Nachrichten am Tag
Mistral Small 4 0,075 USD 75 USD
Mistral Large 3 0,25 USD 250 USD
Mistral Medium 3.5 0,75 USD 750 USD

Dieselbe Frage, die als Vorgang unter einem Cent kostet, kostet als Chat mit Grundlast bis zu 75 Cent. Zwei Ursachen: Es wird alles mitgeschickt statt nur das Passende (kein Retrieval), und es wird nichts zwischengespeichert (kein Caching). Ein zweiter Treiber ist Fehlnutzung in der Fläche; ein Beigeordneter formulierte es als Bild von 23.000 Beschäftigten, die den Speiseplan bei der KI abfragen.

Pro Kopf oder pro Vorgang

Eine Mittelstadt mit 1.400 Beschäftigten rechnete im Gespräch vor: Bei 10 bis 25 Euro Lizenz je Kopf und Monat zahle sie 14.000 bis 35.000 Euro monatlich, ohne zu wissen, ob es genutzt werde. Die Alternative, Preis je Vorgang, kostet nur, was bearbeitet wird, und lässt sich der Kämmerei je Vorgang ausweisen. Sie setzt aber voraus, dass der Verbrauch tatsächlich gemessen wird (Metering). Ohne Messung ist jede Kostenaussage eine Schätzung, auch die auf dieser Seite.

Vier Regeln gegen die Explosion

  1. Vorgänge statt offener Chats: Jeder Schritt bekommt nur die Daten, die er braucht.
  2. Kleines Modell zuerst, großes nur, wenn Software es je Aufgabe entscheidet.
  3. Regelbasierte Schritte kosten null: Eingang, Routing, Fristen, Plausibilität.
  4. Kostendeckel mit Frühwarnung, damit der Monat nie überrascht. Mehr dazu unter Kostendeckel.

Kurz gefragt

Wie viele Token hat eine Seite?

Eine deutsche DIN-A4-Seite Fließtext entspricht grob 700 bis 1.000 Token. Tabellen und Formulare liegen darüber, weil Struktur zusätzliche Zeichen kostet.

Warum kostet der Chat mehr als der Vorgang?

Ein Vorgang schickt nur die Akte und die passenden Rechtsquellen ans Modell. Ein Chat, der bei jeder Nachricht den gesamten Dokumentenbestand des Mandanten mitgibt, zahlt diese Grundlast jedes Mal neu.

Sind kleine Modelle gut genug?

Für Vollständigkeitsprüfung, Klassifikation und Entwürfe mit Wissensbasis in der Regel ja. Auf der AI4GOV-Konferenz 2026 wurde geschätzt, dass rund 98 Prozent der Anwendungsfälle mit kleineren Modellen genauso gut gehen. Die Entscheidung sollte Software je Aufgabe treffen, nicht ein Pauschalabo.

Quellen

Stand 22.9.2026 · fiege.ai