WZ-IT Logo

Vision-Language-Modelle für OCR lokal: Rechnungen und Scans auslesen

Timo Wevelsiep
Timo Wevelsiep
•
#OCR #VisionLanguageModel #Dokumentenverarbeitung #LokaleKI #Qwen #olmOCR

Hinweis zum Inhalt: Die Informationen in diesem Artikel wurden nach bestem Wissen zum Zeitpunkt der Veröffentlichung zusammengestellt. Technische Details, Preise, Versionen, Lizenzmodelle und externe Inhalte können sich ändern. Bitte prüfen Sie die genannten Angaben eigenständig, insbesondere vor geschäftskritischen oder sicherheitsrelevanten Entscheidungen. Dieser Artikel ersetzt keine individuelle Fach-, Rechts- oder Steuerberatung.

Vision-Language-Modelle für OCR lokal: Rechnungen und Scans auslesen

Belege lokal auslesen statt an einen externen KI-Dienst schicken? WZ-IT baut die Auslesestrecke mit offenen Modellen und Prüfregeln auf Ihrer Infrastruktur, siehe KI-Dokumentenverarbeitung im KI-Hub. Termin vereinbaren

Seit 2025 ist eine neue Gruppe offener Modelle erschienen, die Dokumentseiten als Bild lesen und als Text, Markdown oder JSON ausgeben: olmOCR, PaddleOCR-VL, GLM-OCR, DeepSeek-OCR, LightOnOCR und allgemeine Vision-Language-Modelle wie Qwen3.8. Fast alle laufen auf einer einzelnen GPU, viele stehen unter Apache 2.0 oder MIT. Für Rechnungen, Lieferscheine und gescannte Briefe ist das eine echte Alternative zu Cloud-Diensten, bei der kein Beleg das eigene Netz verlassen muss.

Dieser Beitrag vergleicht die Modelle aus Betreibersicht: was sie leisten, unter welcher Lizenz sie stehen, wie die Benchmark-Werte auf den Modellkarten zu lesen sind, welche Hardware sie brauchen und wie sich das Risiko erfundener Zahlen begrenzen lässt. Den Gesamtprozess mit E-Rechnung, Prüfregeln, Freigabe und GoBD behandelt der Beitrag Dokumente automatisch auslesen und prüfen. Alle Angaben haben den Stand September 2026.

Inhaltsverzeichnis

  1. Drei Werkzeugklassen: OCR, OCR-VLM, allgemeines VLM
  2. Offene Modelle im Überblick, Stand September 2026
  3. Lizenzen: nicht jedes Modell ist kommerziell nutzbar
  4. Benchmarks richtig lesen
  5. Das Zahlenproblem: plausibel ist nicht gelesen
  6. Pipeline-Muster für Rechnungen und Scans
  7. Hardware: 24 GB, 96 GB oder AI Cube
  8. Deutsche Belege: Sprache, Zahlenformat, Vorlagenqualität
  9. Unser Vorgehen bei WZ-IT
  10. Weiterführende Guides

Drei Werkzeugklassen: OCR, OCR-VLM, allgemeines VLM

Klasse Beispiele Eingabe Ausgabe Typischer Fehler
Klassisches OCR Tesseract, PaddleOCR (PP-OCR), OCRmyPDF Bild, Scan Zeichen mit Positionen, Textebene im PDF sichtbare Zeichenfehler, zerrissene Tabellen
OCR-VLM, auf Dokumente spezialisiert olmOCR 2, PaddleOCR-VL, GLM-OCR, LightOnOCR-2, DeepSeek-OCR-2, granite-docling Seitenbild Markdown, HTML, Tabellen, teils JSON ausgelassene oder ergänzte Passagen, fließender Text statt Lücke
Allgemeines VLM Qwen3.8-27B, Qwen3-VL Seitenbild plus Anweisung freie Antwort oder JSON nach Schema plausible, aber nicht gelesene Werte

Klassisches OCR liest Zeichen, versteht aber keine Struktur. Für ein Feld wie „Rechnungsnummer" braucht es danach Regeln oder Vorlagen. OCR-VLMs sind kleine Modelle, meist zwischen 0,3 und 8 Mrd. Parametern, die darauf trainiert sind, eine Seite vollständig und in Leserichtung zu transkribieren, inklusive Tabellen. Allgemeine VLMs sind große multimodale Sprachmodelle, die Bild und Anweisung verarbeiten. Sie können gezielt Felder extrahieren, sind aber langsamer und anfälliger dafür, Lücken mit Plausiblem zu füllen.

Docling gehört in keine der drei Klassen, sondern verbindet sie: Das MIT-lizenzierte Projekt der LF AI & Data Foundation erkennt Layout, Leserichtung und Tabellenstruktur, bindet klassisches OCR für Scans ein und kann wahlweise ein VLM wie granite-docling verwenden (docling --pipeline vlm). Aktuell ist Version 2.131.0 vom 29. September 2026 (Docling Releases).

Offene Modelle im Überblick, Stand September 2026

Modell Hersteller Parameter Lizenz Veröffentlicht Basis Ausgabe
Qwen3.8-27B Alibaba Qwen 27 Mrd. Apache 2.0 August 2026 eigene Architektur, nativ multimodal freie Antwort, JSON
olmOCR-2-7B-1025 Allen Institute for AI 7 Mrd. (Basis) Apache 2.0 Oktober 2025 Qwen2.5-VL-7B-Instruct Markdown
PaddleOCR-VL-1.6 Baidu PaddlePaddle 0,9 Mrd. Apache 2.0 28. Mai 2026 ERNIE 4.5 0.3B Markdown, JSON mit Layout
GLM-OCR Z.ai 0,9 Mrd. MIT Januar 2026 GLM-V, Decoder GLM-0.5B Markdown, JSON nach Schema
LightOnOCR-2-1B LightOn 1 Mrd. Apache 2.0 Januar 2026 eigene Architektur Text in Leserichtung
DeepSeek-OCR-2 DeepSeek rund 3 Mrd. Apache 2.0 Januar 2026 eigene Architektur Markdown
granite-docling-258M IBM Research 258 Mio. Apache 2.0 17. September 2025 Idefics3, Granite 165M DocTags für Docling

Einordnung der Kandidaten:

  • Qwen3.8-27B ist kein OCR-Spezialmodell, sondern ein allgemeines Sprachmodell mit Bildverständnis. Die Modellkarte nennt ausdrücklich Dokumente als Einsatzbereich, eine Kontextlänge von 262.144 Token und einen Denkmodus, der pro Anfrage abschaltbar ist. Für die Extraktion einzelner Felder ist das Abschalten sinnvoll, weil lange Denkketten die Antwortzeit verlängern. Eine FP8-Variante stellt Qwen selbst bereit (Qwen3.8-27B-FP8).
  • olmOCR 2 ist auf die Umwandlung ganzer PDF-Seiten in Text ausgelegt und wird über das olmOCR-Toolkit mit vLLM betrieben, das Seiten rendert, dreht und bei Fehlern erneut verarbeitet. Allen AI empfiehlt die FP8-Variante für den Betrieb (Modellkarte). Das Training belohnt bestandene Unit-Tests auf Dokumenten (olmOCR 2, arXiv 2510.19817).
  • PaddleOCR-VL-1.6 ist zur Version 1.5 architekturgleich und damit ohne Anpassung austauschbar. Die erste Version nannte 109 unterstützte Sprachen (PaddleOCR-VL), Version 1.5 ergänzte Stempel- und Siegelerkennung (PaddleOCR-VL-1.5).
  • GLM-OCR kombiniert eine Layout-Analyse (PP-DocLayout-V3) mit paralleler Erkennung und unterstützt neben der Transkription eine Informationsextraktion, bei der der Prompt ein JSON-Schema vorgibt. Es läuft unter vLLM, SGLang und Ollama.
  • LightOnOCR-2-1B listet Deutsch ausdrücklich unter den unterstützten Sprachen und wird direkt mit vllm serve betrieben.
  • granite-docling-258M ist das kleinste Modell der Liste und für die Docling-Pipeline gebaut. Die Modellkarte nennt Englisch als Sprache.

Lizenzen: nicht jedes Modell ist kommerziell nutzbar

Auf Hugging Face stehen weitere OCR-Modelle mit guten Benchmark-Werten, deren Lizenz den Betrieb im Unternehmen ausschließt oder offenlässt. Zwei Beispiele:

Modell Lizenz laut Modellkarte Folge für Unternehmen
Chandra OCR 2 angepasste OpenRAIL-M Nutzung ausgeschlossen bei mehr als 2 Mio. US-Dollar Vorjahresumsatz oder mehr als 2 Mio. US-Dollar Finanzierung, außer privat oder für Forschung; kommerzielle Lizenz beim Hersteller (LICENSE, Attachment A)
Nanonets-OCR2-3B keine Angabe Basismodell Qwen2.5-VL-3B-Instruct steht unter der Qwen Research License, die nur nicht-kommerzielle Nutzung erlaubt (Lizenztext)

Drei Regeln für die Prüfung:

  1. Modelllizenz und Code-Lizenz trennen. Bei Chandra ist der Code Apache 2.0, die Gewichte nicht. Entscheidend für den Betrieb sind die Gewichte.
  2. Basismodell prüfen. Ein Fine-Tune erbt die Bedingungen seines Basismodells. olmOCR 2 baut auf Qwen2.5-VL-7B auf, das unter Apache 2.0 steht. Bei der 3B-Variante desselben Basismodells wäre das nicht so.
  3. Pipeline-Bestandteile einzeln prüfen. Docling selbst ist MIT, für die eingebundenen Modelle gelten deren eigene Lizenzen, wie das Projekt ausdrücklich festhält.

Eine ausführliche Einordnung der Lizenzmodelle offener Sprachmodelle bietet der Artikel LLM-Lizenzen für die kommerzielle Nutzung. Das ist eine technische Einordnung, keine Rechtsberatung.

Benchmarks richtig lesen

Jede Modellkarte nennt Bestwerte. Die Zahlen stammen von den Herstellern selbst und beziehen sich auf unterschiedliche Benchmarks und Versionen.

Modell Benchmark Wert laut Hersteller
PaddleOCR-VL-1.6 OmniDocBench v1.6 96,33
GLM-OCR OmniDocBench v1.5 94,62
PaddleOCR-VL-1.5 OmniDocBench v1.5 94,5
Qwen3.8-27B OmniDocBench 1.5 91,1
Chandra OCR 2 olmOCR-Bench 85,8
olmOCR-2-7B-1025-FP8 olmOCR-Bench, Toolkit v0.4.0 82,4 ± 1,1

Quellen: Modellkarten von PaddleOCR-VL-1.6, GLM-OCR, PaddleOCR-VL-1.5, Qwen3.8-27B, Chandra OCR 2 und olmOCR 2.

Was die Tabelle nicht zeigt:

  • Versionen sind nicht vergleichbar. OmniDocBench wurde im April 2026 auf v1.6 aktualisiert, mit 296 zusätzlichen, schwierigeren Seiten und einem neuen Abgleichverfahren, kurz danach auf v1.7. Ein Wert aus v1.5 und einer aus v1.6 messen nicht dasselbe.
  • Der Gesamtwert enthält Formeln. Der Overall-Wert von OmniDocBench ist der Mittelwert aus Textgenauigkeit, Tabellenstruktur (TEDS) und Formelerkennung (CDM). Für Rechnungen sind Formeln bedeutungslos, für wissenschaftliche Artikel zentral.
  • Die Dokumente sind nicht Ihre. OmniDocBench umfasst in der Basisversion 1.651 Seiten aus zehn Dokumenttypen wie Fachartikeln, Finanzberichten, Zeitungen und Lehrbüchern, mit englischen, chinesischen und gemischten Seiten. olmOCR-Bench testet unter anderem arXiv-Artikel, alte Scans, Tabellen und Kopf- und Fußzeilen. Deutsche Lieferscheine mit Stempel, Durchschlag und Kugelschreiber-Notiz sind in beiden nicht gezielt vertreten.
  • Gemessen wird Transkription, nicht Extraktion. Beide Benchmarks bewerten, ob die Seite richtig in Text umgewandelt wird. Ob ein Modell aus diesem Text die richtige Rechnungsnummer und den richtigen Bruttobetrag zuordnet, ist eine zweite Frage.

Die Benchmarks helfen bei der Vorauswahl. Die Entscheidung fällt an einer Stichprobe eigener Belege, feldgenau ausgewertet.

Das Zahlenproblem: plausibel ist nicht gelesen

Klassisches OCR macht sichtbare Fehler: Aus „8" wird „B", eine Tabellenzeile zerfällt. Ein VLM macht unsichtbare Fehler. Es erzeugt Text wie ein Sprachmodell, und wo die Vorlage unleserlich ist, entsteht ein Wert, der zum Kontext passt.

Zwei Untersuchungen belegen das:

Studie Befund
KIE-HVQA, arXiv 2506.20168 Bei beschädigten Vorlagen (Ausweise, Rechnungen mit simulierten Scanfehlern) stützen sich multimodale Modelle auf sprachliche Wahrscheinlichkeiten und erzeugen Halluzinationen, besonders wenn eine präzise Antwort nicht möglich ist.
Visual Merit or Linguistic Crutch, arXiv 2601.03714 Ohne sprachlichen Zusammenhang fiel die Leistung von DeepSeek-OCR von etwa 90 auf 20 Prozent. Klassische Pipeline-OCR war gegenüber solchen Störungen deutlich robuster als End-to-End-Modelle. Weniger visuelle Token gingen mit stärkerer Abhängigkeit von Sprachwissen einher.

Für Rechnungen ist das der kritische Punkt. Eine IBAN, eine Rechnungsnummer oder ein Betrag hat keinen sprachlichen Zusammenhang, aus dem sich die richtige Ziffer erschließen ließe. Genau dort ist ein plausibler Wert am gefährlichsten.

Gegenmaßnahmen im Überblick:

Maßnahme Wirkung
Strukturierte Ausgabe nach JSON-Schema Das Modell kann nur definierte Felder und Typen liefern; vLLM (Structured Outputs) und Ollama (Structured Outputs) erzwingen das Schema bei der Erzeugung.
Leeres Feld erlauben Das Schema lässt null zu, die Anweisung verlangt null statt einer Schätzung bei Unleserlichkeit.
Rechenregeln Netto plus Steuer gleich Brutto, Positionssumme gleich Gesamtsumme. Ein Widerspruch zeigt einen Lesefehler an.
Prüfziffern IBAN (MOD 97), USt-IdNr. über VIES, Format der Rechnungsnummer je Lieferant.
Zweiter Leseweg Den Betrag zusätzlich aus der PDF-Textebene oder per Tesseract lesen; bei Abweichung manuelle Prüfung.
Stammdatenabgleich Bankverbindung und Lieferant gegen den Lieferantenstamm, Bestellnummer gegen das ERP.

Die Prüfregeln im Detail, inklusive VIES, eVatR und IBAN, beschreibt der Beitrag Dokumente automatisch auslesen und prüfen. Wichtig ist hier nur der Grundsatz: Das Modell liefert Kandidaten, die Regeln entscheiden.

Pipeline-Muster für Rechnungen und Scans

Vor jedem Modell steht eine Weiche: Was kommt überhaupt als Bild an?

Eingang Weg Modell nötig
XRechnung, ZUGFeRD XML parsen und validieren nein
Digitales PDF mit Textebene Text und Positionen direkt auslesen, z. B. mit Docling für die Feldzuordnung eventuell
Scan, Foto, PDF ohne Textebene OCR oder VLM ja

Für den dritten Fall haben sich drei Muster etabliert:

Muster A: Transkription, dann Extraktion. Ein kleines OCR-VLM (PaddleOCR-VL, GLM-OCR, olmOCR) wandelt die Seite in Markdown mit Tabellen. Ein Sprachmodell extrahiert daraus die Felder als JSON. Vorteil: Die Transkription ist nachvollziehbar und archivierbar, die beiden Schritte lassen sich getrennt testen. Nachteil: zwei Modelle im Betrieb.

Muster B: Direkte Extraktion. Ein allgemeines VLM wie Qwen3.8-27B erhält das Seitenbild und ein JSON-Schema und liefert die Felder direkt. Vorteil: ein Modell, Zugriff auf die visuelle Anordnung, etwa welcher Betrag in der Summenzeile steht. Nachteil: größeres Modell, keine Zwischenstufe, an der sich ein Fehler zuordnen lässt.

Muster C: Docling-Pipeline mit Extraktion. Docling übernimmt Layout, Tabellen und OCR, ein Sprachmodell oder VLM extrahiert aus dem strukturierten Dokument. Das passt, wenn neben Belegen auch Verträge, Handbücher oder Berichte verarbeitet werden, etwa für eine RAG-Anwendung.

In allen drei Mustern folgen danach dieselben Prüfregeln und dieselbe Freigabe. Welches Muster passt, hängt von der Belegmenge, der Vorlagenqualität und der vorhandenen Hardware ab und wird im Test mit eigenen Belegen entschieden, nicht am Benchmark.

Hardware: 24 GB, 96 GB oder AI Cube

Für den Grafikspeicher zählen zuerst die Modellgewichte: Parameterzahl mal Byte pro Parameter, also 2 Byte in BF16, 1 Byte in FP8 und etwa 0,5 Byte bei 4-Bit-Quantisierung. Dazu kommen KV-Cache, Bild-Token und Laufzeit-Overhead. Die folgenden Werte sind diese Rechnung für die Gewichte, keine Messung.

Modell Gewichte BF16 Gewichte FP8 24 GB (RTX PRO 4000 Blackwell) 96 GB (RTX PRO 6000 Blackwell Max-Q) AI Cube, 128 GB Unified Memory
granite-docling-258M rund 0,5 GB - ja ja ja
PaddleOCR-VL-1.6, GLM-OCR, LightOnOCR-2-1B rund 2 GB - ja ja ja
DeepSeek-OCR-2 rund 7 GB - ja ja ja
olmOCR-2-7B-1025 rund 17 GB rund 9 GB ja, FP8; Projekt nennt mindestens 12 GB ja ja
Qwen3.8-27B rund 55 GB rund 28 GB nur 4-Bit-quantisiert ja, FP8 oder BF16 ja

Daraus ergeben sich zwei typische Aufteilungen. Ein OCR-VLM um 1 Mrd. Parameter läuft auf einer 24-GB-GPU mit viel Reserve für parallele Seiten, und ein mittelgroßes Sprachmodell für die Extraktion kann daneben laufen. Wer Qwen3.8-27B ohne starke Quantisierung für die direkte Extraktion einsetzen will, braucht 96 GB oder den AI Cube. Wie sich Quantisierung auf Qualität und Speicher auswirkt, erklärt der Artikel zur LLM-Quantisierung, die Rechnung inklusive KV-Cache steht in der VRAM-Dimensionierung.

Bei WZ-IT gibt es dafür zwei Betriebswege. Der Managed GPU Server läuft in einem deutschen Rechenzentrum, als GPU Server 24 mit NVIDIA RTX PRO 4000 Blackwell (24 GB GDDR7 ECC) ab 699 € netto/Monat oder als GPU Server 96 mit RTX PRO 6000 Blackwell Max-Q (96 GB GDDR7 ECC) für 1.799 € netto/Monat, jeweils zuzüglich Einrichtung. Der AI Cube steht als Appliance im eigenen Netz, kostet 6.490 € netto plus AI Cube Care für 349,90 € netto/Monat und eignet sich, wenn Belege das Gebäude nicht verlassen sollen. Für die Wahl der Inferenz-Software hilft der Vergleich vLLM, Ollama oder llama.cpp.

Deutsche Belege: Sprache, Zahlenformat, Vorlagenqualität

Die Sprachangaben auf den Modellkarten unterscheiden sich deutlich:

Modell Sprachangabe laut Modellkarte
GLM-OCR u. a. Deutsch, Englisch, Französisch, Spanisch
LightOnOCR-2-1B u. a. Deutsch, Englisch, Französisch, Italienisch, Niederländisch
PaddleOCR-VL 109 Sprachen (erste Version), danach „multilingual"
DeepSeek-OCR-2 „multilingual"
olmOCR-2-7B-1025 Englisch
granite-docling-258M Englisch

Eine fehlende Sprachangabe heißt nicht, dass ein Modell kein Deutsch liest; lateinische Schrift mit Umlauten wird von vielen Modellen erkannt. Sie heißt, dass der Hersteller es nicht zusagt und es im Test geprüft werden muss.

Drei Eigenheiten deutscher Belege gehören in jede Teststichprobe:

  • Zahlenformat. 1.234,56 statt 1,234.56. Ein Modell, das überwiegend englische Dokumente gesehen hat, kann Tausender- und Dezimaltrenner vertauschen. Die Normalisierung gehört in den Code nach dem Modell, und die Rechenregel deckt verbliebene Fehler auf.
  • Umlaute und ß in Firmennamen und Anschriften, die für den Abgleich mit dem Lieferantenstamm exakt stimmen müssen.
  • Vorlagenqualität. Faxe, Durchschläge, schräg fotografierte Lieferscheine, Stempel über dem Betrag. Genau hier steigt das Risiko plausibler statt gelesener Werte. PaddleOCR-VL-1.5 wurde ausdrücklich für Schräglage, Verzerrung, Bildschirmfotos und ungünstige Beleuchtung weiterentwickelt, ein eigener Test ersetzt das nicht.

Handschrift bleibt der schwierigste Fall. Einige Modellkarten werben damit, belastbare Werte für deutsche Handschrift auf Belegen liefert keiner der genannten Benchmarks.

Unser Vorgehen bei WZ-IT

  1. Stichprobe festlegen. Ein Belegtyp, 50 bis 100 repräsentative Belege einschließlich schlechter Scans, je Beleg die richtigen Werte als Referenz.
  2. Weiche bauen. E-Rechnungen und digitale PDF mit Textebene getrennt behandeln, nur Bilder und Scans gehen an ein Modell.
  3. Zwei bis drei Kandidaten testen. Zum Beispiel ein OCR-VLM mit nachgelagerter Extraktion gegen ein allgemeines VLM mit direkter Extraktion, Lizenz vorab geprüft, auf der Zielhardware.
  4. Feldgenau auswerten. Je Feld der Anteil korrekter Werte, dazu der Anteil der Belege ohne jede Korrektur. Erfundene Werte werden gesondert gezählt.
  5. Prüfregeln und Freigabe. Strukturierte Ausgabe, Rechenregeln, Prüfziffern, zweiter Leseweg, Stammdatenabgleich, Freigabe für alles, was eine Regel nicht besteht.
  6. Betrieb. Modellversion festhalten, Regressionstest mit der Stichprobe vor jedem Modellwechsel, Support, Beratung und Implementierung durch WZ-IT.

Der Dokumentenverarbeitung Pilot umfasst eine Dokumentklasse mit bis zu 20 Zielfeldern und beginnt ab 17.900 € netto. Ist noch offen, welcher Prozess zuerst automatisiert werden soll, ordnet der KI-Prozesscheck Belegarten und Mengen ein. Den Betrieb von Ollama und vLLM übernimmt WZ-IT auch einzeln, siehe Ollama und vLLM.

Weiterführende Guides

Welches Modell liest Ihre Belege am zuverlässigsten? Wir testen Kandidaten mit einer Stichprobe Ihrer Belege auf Ihrer Hardware und werten feldgenau aus, bevor eine Strecke gebaut wird. Termin vereinbaren

Quellen

Anfrage

Modellwahl für Ihre Belege prüfen

Wir testen OCR- und Vision-Language-Modelle mit einer Stichprobe Ihrer Belege auf Ihrer Infrastruktur und messen, welche Felder ohne Korrektur stimmen.

Worum geht es bei Ihnen?

Wie sollen wir antworten?

Häufig gestellte Fragen

Antworten auf wichtige Fragen zu diesem Thema

Klassisches OCR wie Tesseract erkennt Zeichen und liefert Text mit Positionen. Ein Vision-Language-Modell (VLM) verarbeitet die Seite als Bild und erzeugt Text, Markdown oder JSON wie ein Sprachmodell. Es erkennt Tabellen, Leserichtung und Felder ohne Vorlage, kann aber auch Werte erzeugen, die so nicht auf der Seite stehen.

Spezialisierte OCR-Modelle wie olmOCR-2-7B-1025, PaddleOCR-VL-1.6, GLM-OCR, LightOnOCR-2-1B und DeepSeek-OCR-2 wandeln Seiten in Text oder Markdown. Allgemeine VLMs wie Qwen3.8-27B lesen zusätzlich gezielt Felder aus und folgen einer Anweisung. Docling verbindet Layout-Erkennung, OCR und VLM in einer Pipeline. Alle genannten Modelle stehen unter Apache 2.0 oder MIT.

Nein. Chandra OCR 2 steht unter einer angepassten OpenRAIL-M-Lizenz, die die Nutzung für Unternehmen mit mehr als 2 Millionen US-Dollar Jahresumsatz ausschließt, außer für private oder Forschungszwecke. Nanonets-OCR2-3B nennt auf der Modellkarte keine Lizenz und baut auf Qwen2.5-VL-3B auf, das unter der nicht-kommerziellen Qwen Research License steht. Die Lizenz ist je Modell und je Basismodell zu prüfen.

Nur eingeschränkt. OmniDocBench enthält englische, chinesische und gemischte Seiten aus Fachartikeln, Berichten, Zeitungen und Lehrbüchern, und der Gesamtwert mittelt Text, Tabellen und Formeln. olmOCR-Bench ist ebenfalls englischsprachig geprägt. Deutsche Rechnungen mit Dezimalkomma, Stempeln und schlechten Scans kommen in keinem der beiden Benchmarks gezielt vor. Die Werte sind Herstellerangaben und ersetzen keinen Test mit eigenen Belegen.

Das Risiko ist belegt. Bei unscharfen oder beschädigten Vorlagen greifen Modelle auf sprachliche Wahrscheinlichkeiten zurück und geben plausible statt gelesener Werte aus, wie die Studie zum Benchmark KIE-HVQA mit Rechnungen und Ausweisen zeigt. Eine Untersuchung zu DeepSeek-OCR fand, dass die Erkennungsleistung ohne sprachlichen Kontext von etwa 90 auf 20 Prozent fiel. Beträge, IBAN und Rechnungsnummern brauchen deshalb Prüfregeln außerhalb des Modells.

Nein. Klassische Pipelines erwiesen sich in der Untersuchung zu DeepSeek-OCR als robuster gegenüber sinnentstellten Texten als End-to-End-Modelle. Tesseract und die Textebene eines digitalen PDF bleiben als zweiter, unabhängiger Leseweg nützlich: Weicht der vom VLM gelieferte Betrag von der OCR-Zeichenfolge ab, geht der Beleg in die Prüfung.

Modelle um 1 Mrd. Parameter wie PaddleOCR-VL oder GLM-OCR belegen in BF16 rund 2 GB für die Gewichte und laufen auf einer 24-GB-GPU mit viel Reserve. olmOCR 2 verlangt laut Projekt mindestens 12 GB GPU-Speicher. Qwen3.8-27B braucht in BF16 rund 55 GB, in FP8 rund 28 GB für die Gewichte und passt damit auf eine 96-GB-GPU oder den AI Cube mit 128 GB Unified Memory, auf 24 GB nur mit 4-Bit-Quantisierung.

Nein. XRechnung und das XML einer ZUGFeRD-Rechnung werden geparst und gegen die EN-16931-Regeln validiert, nicht gelesen. Bei ZUGFeRD ist der strukturierte Teil führend. OCR und VLM betreffen Papier, Scans, Fotos und PDF-Dateien ohne strukturierten Teil. Den Prozess mit E-Rechnung, Prüfregeln und GoBD beschreibt der Beitrag zur Dokumentenverarbeitung.

Nein. Die Modellkarten der hier genannten OCR-VLMs beschreiben keinen kalibrierten Konfidenzwert je Feld, und eine vom Modell selbst formulierte Sicherheit ist keine gemessene Trefferquote. Belastbar sind Rechenregeln, Formatprüfungen wie die IBAN-Prüfziffer, der Abgleich mit Stammdaten und der Vergleich mit einem zweiten Leseweg.

Timo Wevelsiep

Geschrieben von

Timo Wevelsiep

Co-Founder & CEO

Co-Founder von WZ-IT. Spezialisiert auf Cloud-Infrastruktur, Open-Source-Plattformen und Managed Services für KMUs und Enterprise-Kunden weltweit.

LinkedIn

Lassen Sie uns über Ihre Idee sprechen

Ob konkrete IT-Herausforderung oder einfach eine Idee - wir freuen uns auf den Austausch. In einem kurzen Gespräch prüfen wir gemeinsam, ob und wie Ihr Projekt zu WZ-IT passt.

Rückruf vereinbaren

Rückruf

Rückruf vereinbaren

Nummer hinterlassen, wir rufen zurück — spätestens am nächsten Werktag.

Für ein ausführliches Gespräch können Sie alternativ einen Termin buchen.

Unternehmen weltweit vertrauen WZ-IT

  • ml&s
  • Rekorder
  • Keymate
  • Führerscheinmacher
  • SolidProof
  • ARGE
  • Boese VA
  • nextGYM
  • SweetConnect GmbH
  • Golem.de
  • Millenium
  • Paritel
  • Yonju
  • EVADXB
  • Mr. Clipart
  • Aphy AG
  • Negosh
  • ABCO Water Systems
1/3 - Themenauswahl33%

Worum geht es bei Ihrer Anfrage?

Wählen Sie zuerst den Leistungsbereich, der am besten zu Ihrem Vorhaben passt.