PDF ist eine Ansicht; Daten brauchen eine Struktur
Von Oliver Schmalzl · Ausgearbeitet: · Archiv-Funddatum:
23.04.2026 · Archivdatum
Ein PDF kann auf dem Bildschirm völlig eindeutig aussehen. Zwei Spalten, eine Überschrift und eine kleine Tabelle sind sofort zu erkennen. Für eine automatische Auswertung sind das jedoch verschiedene Aufgaben: Zeichen erkennen, ihre Reihenfolge bestimmen und Beziehungen zwischen den Inhalten erhalten.
Besonders deutlich wird das an einem selbst erzeugten Beispielblatt. Links steht eine Beschreibung, rechts eine Materialliste, darunter eine Tabelle mit drei erfundenen Papiergrößen.
Richtig erkannte Wörter können falsch zusammenkommen
Wenn die Wörter zeilenweise quer über beide Spalten gelesen werden, entsteht ein Text, den niemand so gemeint hat. Auch eine Tabelle verliert Bedeutung, wenn Zahlen nicht mehr zu ihren Spaltenüberschriften gehören.
Bei einer gescannten Seite kommt die Erkennung der Zeichen hinzu. Ein schlecht erkanntes „1“ kann eine Maßangabe verändern. Deshalb ist es sinnvoll, Fehler in Zeichen, Reihenfolge und Struktur getrennt festzuhalten.
OpenDataLoader PDF beschreibt die Ausgabe strukturierter Dokumentelemente. Der Fund ist interessant, weil neben Text auch dessen Position und Ordnung berücksichtigt werden können. Daraus wird hier kein unabhängiger Qualitätsvergleich mit anderen Werkzeugen abgeleitet.
Ein kleiner Test lässt sich nachprüfen
Für das Beispielblatt steht die gewünschte Lesereihenfolge vorher fest. Nach der Verarbeitung werden Überschriften, Absätze und Tabellenwerte einzeln verglichen. Zusätzlich sollte sichtbar bleiben, auf welche Seite eine Aussage zurückgeht.
Eine spätere KI-Zusammenfassung kann nur mit der erhaltenen Struktur arbeiten. Wenn die Materialmenge bereits einer falschen Zeile zugeordnet wurde, macht ein schöner Antwortsatz den Fehler nicht besser. Das wichtigste Ergebnis der Übung ist deshalb eine nachvollziehbare Verbindung zwischen Originalansicht und extrahierten Daten.
Ursprüngliche Funde
Diese Links waren der Ausgangspunkt für den Beitrag. Die Einordnung im Text stammt von mir; die verlinkten Beiträge sind keine eigenen Tests.
- German-OCR-3 und Nano für lokale Erkennung deutscher Dokumente; Qualitäts- und Datenschutzbehauptungen prüfen.
- OpenDataLoader PDF mit strukturierten Elementen und Positionsangaben; Benchmark-Behauptungen prüfen.
- GOCR als kompakte lokale deutsche OCR für Text und Positionen; Benchmarkangaben prüfen.
- PixelRAG verarbeitet visuelle Seitendarstellungen statt rein extrahiertem Text; Originalpaper und Benchmarks prüfen.
Zum Datum: Dieser Beitrag wurde am 11. Oktober 2026 ausgearbeitet. Das Archivdatum entspricht dem frühesten zugehörigen Fund in der Sammlung, nicht einer damaligen Veröffentlichung. Technische Einordnungen und nachträglich ergänzte Quellen beziehen sich auf die Ausarbeitung.