fiege.ai

Research / Beitrag / Stand 22.9.2026

Vom Papierantrag zur Prüfung: fünf Verfahren im Vergleich

Wie kommt ein handschriftlich ausgefüllter Antrag technisch von der Poststelle in die Sachbearbeitung?

Die Strecke sieht in jedem Haus gleich aus: Der Umschlag kommt an, wird geöffnet, gescannt, und danach tippt jemand ab. Wer KI einsetzen will, muss zuerst wissen, welcher Schritt welche Technik braucht. Die meisten brauchen keine.

Die sechs Schritte

Schritt Was passiert Technik Sprachmodell nötig?
1 Eingang Umschlag öffnen, scannen, Posteingang anlegen Scanner, Dokumentenmanagement nein
2 Klassifikation Welcher Vordruck, welche Anlagen, wie viele Seiten? Regeln auf Barcode, Seitenzahl, Kopfzeile; sonst Modell nur ohne Barcode
3 Feldextraktion Werte aus den Feldern lesen hier entscheidet sich alles ja
4 Prüfung Vollständig? Plausibel? Prüfziffer korrekt? Regeln, kein Modell nein
5 Nachforderung Was fehlt, in einem Satz je Position Textbaustein plus Modell ja, klein
6 Übergabe Strukturierter Datensatz ins Fachverfahren Schnittstelle oder vorbereiteter Eintrag nein

Vier von sechs Schritten kosten keine Token. Wer eine Antragsstrecke als „ein großer KI-Aufruf" baut, zahlt für Arbeit, die ein if erledigt. Siehe Was ein Vorgang kostet.

Die fünf Verfahren für Schritt 3

Verfahren Trefferquote (Handschrift) s/Seite Braucht Stärke Schwäche
Klassisches OCR (Tesseract) 21 % 0,3 nichts extrem schnell, läuft überall, kostenlos liest Handschrift praktisch nicht, erkennt keine Ankreuzkästchen
Reines OCR-Modell (1 Mrd.) 68 % 41 GPU oder Dienst liest Handschrift grob, klein und günstig nimmt keine Feldliste an, liefert Rohtext ohne Zuordnung
Layout-OCR plus Sprachmodell 89 % 75 zwei Komponenten sehr gut bei gedruckten Anlagen, reiner Textpfad Fehler der OCR sind unsichtbar, das Modell glättet sie plausibel weg; hoher Tokenverbrauch
Vision-Modell, Vollseite 88 % 26 Vision-Modell kein registriertes Formular nötig, schnellster guter Weg Seitenbild kostet Eingabe-Token
Vision-Modell, Feldzuschnitt 89 % 87 bekannte Feldkoordinaten bestes Ergebnis, Konfidenz je Feld nur bei registrierten Vordrucken, viele Einzelaufrufe

Zahlen aus dem Handschrift-Benchmark 09/2026.

Welches Verfahren wofür

Gedruckte Anlagen (Mietvertrag, Gehaltsnachweis, Bescheid einer anderen Behörde): klassisches OCR oder Layout-OCR. Schnell, billig, zuverlässig. Ein Vision-Modell ist hier Verschwendung.

Handschriftlicher Vordruck, viele Fälle, gleiches Formular: Feldzuschnitt. Der Aufwand, die Koordinaten einmal festzulegen, rechnet sich ab einigen tausend Fällen im Jahr, und man bekommt je Feld eine Konfidenz.

Handschriftlicher Vordruck, wechselnde Formulare: Vision-Modell auf der Vollseite. Kein Registrieren, kein Nachpflegen bei Formularänderungen.

Freie Anschreiben und Widersprüche: Vision-Modell auf der Vollseite, danach Klassifikation. Zuschnitt scheidet aus, weil es keine Felder gibt.

Ohne Netz, im eigenen Haus: lokales Vision-Modell für Schritt 2 und 5, Schritt 3 nur als Vorschlag mit Sichtprüfung.

Die Prüfschicht, die den Unterschied macht

Die Fehler der Modelle sind vorhersehbar: Ziffern ohne Kontext, also Beträge, IBAN, Telefonnummern, auf schlechten Scans. Genau dort greifen Regeln, die kein Modell brauchen:

Regel Fängt ab
IBAN-Prüfziffer nach ISO 13616 rechnen fast jeden IBAN-Lesefehler
BIC-Format prüfen (8 oder 11 Zeichen, Positionen) Verwechslung 8 gegen B, 0 gegen O
Betrag gegen Plausibilitätsband (Miete 100 bis 3.000 Euro) 1.181,50 gelesen als 14.000,00
Summenzeile gegen Einzelpositionen rechnen stumm verlorene oder erfundene Zeilen
Datum auf Gültigkeit und Reihenfolge prüfen Zahlendreher im Geburtsdatum
Postleitzahl gegen Ortsverzeichnis 08523 gelesen als 08525

Diese Schicht ist wichtiger als die Modellwahl. Die Selbsteinschätzung der Modelle ist als Filter unbrauchbar: Nur eines der getesteten Modelle erkannte bei einer Schwelle von 0,90 überhaupt Fehler, die anderen waren durchgehend überzeugt, auch wenn sie falsch lagen.

Was zuerst zu verbessern ist

  1. Scanqualität. 300 dpi, gerade eingelegt, Kontrast geprüft. Zwischen guten und schlechten Scans liegen 12 bis 17 Prozentpunkte, quer über alle Verfahren. Ein Einzugsscanner kostet weniger als ein Monat Modellbetrieb.
  2. Vorverarbeitung. Geraderichten und Kontrastanpassung vor der Erkennung, nicht danach.
  3. Prüfregeln. Siehe oben. Billig, deterministisch, in jedem Audit erklärbar.
  4. Zuschnitt des Vorgangs. Nicht „der Antrag wird gelesen", sondern „das System sagt, was fehlt". Die Vollständigkeitserkennung liegt bei 99 bis 100 Prozent und ist rechtlich unkritisch, weil kein Verwaltungsakt entsteht. Siehe Vollautomatisierung.
  5. Dann erst Modellwahl. Und dort das mittlere Modell, nicht das größte: Im Test lag ein Modell mit 397 Milliarden Parametern unter einem mit 27 Milliarden, bei vierfacher Laufzeit.

Kurz gefragt

Braucht man für die Antragsverarbeitung überhaupt ein Sprachmodell?

Nur für zwei der sechs Schritte: Felder auslesen und Fehlendes benennen. Eingang, Klassifikation nach Vordruck, Prüfregeln und Übergabe laufen regelbasiert und kosten keine Token.

Was ist der Unterschied zwischen OCR und einem Vision-Sprachmodell?

OCR erkennt Zeichen und gibt Text zurück, ohne zu verstehen, welches Feld gemeint ist. Ein Vision-Sprachmodell bekommt die Feldliste mit und ordnet die erkannten Werte direkt zu. Bei Handschrift ist der Unterschied dramatisch: 21 gegenüber 88 Prozent.

Lohnt sich die Vorverarbeitung der Scans?

Ja, und zwar mehr als ein Modellwechsel. Geraderichten (Deskew), Kontrastanpassung und eine Mindestauflösung von 300 dpi heben die Trefferquote stärker als der Sprung von einem 9-Milliarden- auf ein 397-Milliarden-Modell.

Kann die Verarbeitung lokal im Haus laufen?

Für die Vorprüfung ja. Ein 8-Milliarden-Modell auf einem gewöhnlichen Notebook erreichte 83 Prozent gegenüber 89 Prozent bei einem gehosteten Modell. Für die Übernahme von Beträgen und IBAN ist das nicht genug, für die Frage "was fehlt" schon.

Quellen

Stand 22.9.2026 · fiege.ai