fiege.ai

Research / Beitrag / Stand 22.9.2026

fiege.ai Handschrift-Benchmark 09/2026: Wie gut lesen Sprachmodelle einen handschriftlichen Antrag?

Welches Modell liest einen eingescannten, handschriftlich ausgefüllten Antrag zuverlässig genug für die Sachbearbeitung?

Die Frage kommt in jedem Gespräch über Antragsverarbeitung: 90 Prozent der Anträge kommen auf Papier, überwiegend handschriftlich, oft schlecht gescannt. Kann ein Sprachmodell das lesen? Diese Messung beantwortet das mit Zahlen statt mit Anbieterangaben.

Aufbau

  • Formular: ein amtliches Wohngeld-Antragsformular eines Bundeslandes, 13 Seiten. Genutzt wurden die Seiten Antragsteller, Wohnung und Miete, Haushaltsmitglieder und Einkünfte, Bankverbindung.
  • Korpus: 20 synthetische Anträge à 4 Seiten, also 80 Seiten mit 1.080 Feldinstanzen (29 Textfelder und 25 Ankreuzkästchen je Antrag). Gefüllt mit acht Handschrift-Schriftarten, je Wort leichte Drehung und Grundlinienversatz, blaue und schwarze Tinte, Kreuz oder Haken. Rund 20 Prozent der Textfelder bewusst leer.
  • Scan-Simulation: gut (300 dpi, kaum schief), mittel (200 dpi, leichte Schieflage, Rauschen), schlecht (150 dpi, 1 bis 2 Grad schief, Unschärfe, Speckle, Kontrastverlust, starke JPEG-Kompression). Verteilung 10 / 30 / 60 Prozent.
  • Zwei Betriebsarten: Vollseite (ganze Seite als Bild, Feldliste im Auftrag, Antwort als JSON) und Zuschnitt (je Feld ein Ausschnitt mit bekannten Koordinaten).
  • Wertung: exakt heißt zeichengleich, normalisiert nach Kleinschreibung, Umlautauflösung und Entfernen von Leer- und Satzzeichen; bei Beträgen und IBAN zählen nur Ziffern.

Ergebnisse

Normalisierte Trefferquote über alle Textfelder, dazu die Erkennung der Ankreuzkästchen und der Zeitbedarf.

Verfahren Betriebsart Text normalisiert Kästchen gut mittel schlecht s/Seite
Vision-Modell 27 Mrd. (gehostet, DE) Zuschnitt 89 % 100 % 96 % 97 % 85 % 87
Layout-OCR + großes Sprachmodell Vollantrag 89 % 100 % 98 % 96 % 84 % 75
Vision-Modell 27 Mrd. (gehostet, DE) Vollseite 88 % 100 % 100 % 94 % 83 % 26
Vision-Modell 9 Mrd. (gehostet, DE) Zuschnitt 88 % 94 % 94 % 94 % 83 % 70
Vision-Modell 9 Mrd. (gehostet, DE) Vollseite 87 % 97 % 100 % 92 % 82 % 29
Vision-Modell 397 Mrd. (gehostet, DE) Zuschnitt 87 % 97 % 100 % 100 % 83 % 121
Vision-Modell 8 Mrd. (lokal, Notebook) Vollseite 83 % 99 % 98 % 91 % 76 % 42
Vision-Modell 7 Mrd. (lokal, Notebook) Vollseite 81 % 96 % 98 % 87 % 76 % 40
Reines OCR-Modell 1 Mrd. Zuschnitt 68 % 73 % 74 % 79 % 61 % 41
Tesseract 5, deutsch Zuschnitt 21 % 16 % 10 % 28 % 0,3

Fünf Beobachtungen:

  1. Der Sprung liegt zwischen klassischem OCR und Vision-Modellen, nicht zwischen mittleren und großen Modellen. Tesseract, seit Jahrzehnten der Standard für gedruckten Text, liest Handschrift praktisch nicht.
  2. Größer ist nicht besser. Das 397-Milliarden-Modell lag unter dem 27-Milliarden-Modell, brauchte aber die vierfache Zeit. Wer die Modellwahl über Parameterzahl entscheidet, zahlt für nichts.
  3. Zuschnitt schlägt Vollseite leicht, kostet aber ein Vielfaches an Zeit und setzt ein registriertes Formular mit bekannten Feldkoordinaten voraus. Für freie Anschreiben scheidet der Zuschnitt aus.
  4. Lokal auf einem Notebook ist erstaunlich nah dran: 83 Prozent gegenüber 89 Prozent. Für eine Vorprüfung ohne Netz ist das brauchbar, für die Übernahme von Beträgen nicht.
  5. Die Scanqualität dominiert alles. Zwischen guten und schlechten Scans liegen bei jedem Verfahren 12 bis 17 Prozentpunkte. Ein besserer Scanner ist billiger als ein größeres Modell.

Wo die Fehler sitzen

Trefferquote je Feldtyp beim besten Verfahren, schlechte Scans:

Feldtyp gut mittel schlecht
Name 100 % 97 % 87 %
Adresse, Ort 100 % 92 % 92 %
Datum 100 % 100 % 97 %
Betrag, Fläche 100 % 100 % 72 %
IBAN, BIC, Telefon 83 % 94 % 78 %
Freitext 88 % 96 % 90 %
Ankreuzkästchen 100 % 100 % 100 %

Die Fehler sind nicht zufällig verteilt. Sie konzentrieren sich auf Ziffernfolgen ohne semantischen Kontext. Typische Verwechslungen aus dem Protokoll: 1181,50 wird zu 1471,00, 1744,17 zu 4366,43, DE03 1271 4768 2813 1233 51 zu DE05 1275 4768 2913 1235 41, WELADE8LXXX zu WELADED1XXX. Immer 1 gegen 4, 3 gegen 5, 8 gegen B, 0 gegen O.

Das ist eine gute Nachricht, denn genau diese Felder sind maschinell prüfbar: Die IBAN hat eine Prüfziffer nach ISO 13616, der BIC ein festes Format, Beträge lassen sich gegen Plausibilitätsgrenzen und gegen die Summenzeile prüfen. Ein Verfahren, das die Prüfziffer rechnet, fängt den größten Fehlerblock ab, bevor ein Mensch hinschaut.

Was heute schon zuverlässig ist

Aufgabe Ergebnis Einsatzreif?
Erkennen, ob ein Feld ausgefüllt ist Precision 100 %, Recall 100 % ja, trägt die Vollständigkeitsprüfung
Ankreuzkästchen lesen 100 % ja
Namen, Adressen, Daten übernehmen 87 bis 97 % als Vorschlag mit Sichtprüfung
Beträge und IBAN übernehmen 72 bis 78 % auf schlechten Scans nein, nur mit Prüfziffer und Vier-Augen-Blick

Daraus folgt der Zuschnitt des ersten Vorgangs: Nicht „die KI liest den Antrag", sondern „die KI sagt, was fehlt". Die Vollständigkeitsprüfung mit Nachforderungsliste ist die Aufgabe, die heute rechtlich unkritisch (kein Verwaltungsakt) und technisch gelöst ist. Siehe Fachverfahren und Verfahren der Antragsstrecke.

Taugt die Konfidenz als Filter?

Die Modelle liefern zu jedem Feld eine Selbsteinschätzung. Wenn man alle Felder unter einer Schwelle zur Nachprüfung markiert, ergibt sich:

Verfahren Fehler gesamt markiert unter 0,90 davon Fehler erwischt markiert unter 0,95 davon Fehler erwischt
Vision 27 Mrd. 53 7 % 45 % 18 % 72 %
Vision 397 Mrd. 14 2 % 21 % 13 % 50 %
Vision 9 Mrd. 54 0 % 0 % 2 % 6 %
Vision 7 Mrd. lokal 146 0 % 0 % 0 % 1 %

Nur ein Modell liefert eine Konfidenz, die überhaupt etwas trennt. Die anderen sind durchgehend überzeugt, auch wenn sie falsch liegen. Wer ein Prüfkonzept auf Modellkonfidenz baut, baut auf Sand. Fachliche Regeln sind die Alternative.

Grenzen dieser Messung

Alle Zahlen sind obere Schranken:

  • Synthetische Handschrift ist gleichmäßiger als echte. Es gab keine Durchstreichungen, Korrekturen, Randnotizen oder Kaffeeflecken.
  • Im Zuschnitt-Modus waren die Feldkoordinaten bekannt, was einem registrierten Formular entspricht. Bei unbekannten Vordrucken fällt dieser Vorteil weg.
  • Ein Formular, ein Bundesland, vier Seiten. Andere Vordrucke können anders ausfallen.
  • Gemessen wurde die Erkennung, nicht die fachliche Richtigkeit der daraus abgeleiteten Entscheidung.

Nachrechnen

Der vollständige Aufbau liegt öffentlich auf GitHub: fiege-ai-werkstatt / handschrift-benchmark. Dort stehen der Korpusgenerator, die Scan-Simulation, die Extraktionsläufe für lokale und gehostete Modelle, das Auswertungsskript und die Ergebnisdateien als CSV. Wer einen eigenen Vordruck einsetzt, tauscht das Leerformular und die Feldliste in gen.py aus; alles Weitere läuft unverändert. Code unter MIT, Messergebnisse unter CC BY 4.0.

Nächste Ausgabe

Der Benchmark wird monatlich wiederholt, weil sich die Modelle schneller bewegen als die Beschaffung. Ausgabe 10/2026 erscheint Ende Oktober und ergänzt: echte, anonymisierte Handschriftproben statt synthetischer Schriftarten, zwei weitere Vordrucke, und die Frage, ob eine Prüfziffernregel die Betragsfehler tatsächlich abfängt. Wer einen Vordruck beisteuern möchte, dessen Felder wir gegen Sollwerte prüfen dürfen: Kontakt über den Newsletter.

Kurz gefragt

Welches Modell liest handschriftliche Anträge am besten?

Im Test der Ausgabe 09/2026 lagen ein Vision-Modell mit 27 Milliarden Parametern und eine Kombination aus Layout-OCR und einem großen Sprachmodell gleichauf bei 89 Prozent normalisierter Trefferquote. Kleinere Modelle mit 8 bis 9 Milliarden Parametern erreichten 83 bis 88 Prozent.

Reicht Tesseract für handschriftliche Formulare?

Nein. Tesseract erreichte 21 Prozent normalisierte Trefferquote und erkannte kein einziges Ankreuzkästchen. Tesseract ist für gedruckten Text gebaut, nicht für Handschrift.

Bringt ein größeres Modell bessere Erkennung?

In diesem Test nicht. Ein Modell mit 397 Milliarden Parametern lag bei 87 Prozent und damit unter dem 27-Milliarden-Modell mit 89 Prozent, bei vierfacher Laufzeit. Oberhalb einer mittleren Größe entscheidet die Scanqualität, nicht die Modellgröße.

Kann man die Konfidenzangabe des Modells nutzen, um unsichere Felder zur Prüfung zu markieren?

Nur eingeschränkt. Beim besten Modell fing eine Schwelle von 0,90 immerhin 45 Prozent der Fehler bei 7 Prozent markierter Felder ein; bei anderen Modellen lag die Ausbeute bei null. Verlässlicher sind fachliche Plausibilitätsregeln, etwa IBAN-Prüfziffer und Betragsgrenzen.

Sind die Zahlen auf echte Anträge übertragbar?

Nur als obere Schranke. Synthetische Handschrift ist gleichmäßiger als echte, es gab keine Durchstreichungen, Korrekturen oder Randnotizen, und die Feldkoordinaten waren im Zuschnitt-Modus bekannt. Auf echten Anträgen ist mit niedrigeren Werten zu rechnen.

Quellen

Stand 22.9.2026 · fiege.ai