gast@schmalzl.tirol — PDF ist eine Ansicht; Daten brauchen eine Struktur
Stil
?
PS gast@schmalzl ~C:\Users\gast/blog/2026-04-23-pdf-text-struktur-lesereihenfolge

PDF ist eine Ansicht; Daten brauchen eine Struktur

Von · Ausgearbeitet: · Archiv-Funddatum:

#PDF #Daten #KI

23.04.2026 · Archivdatum

Ein PDF kann auf dem Bildschirm völlig eindeutig aussehen. Zwei Spalten, eine Überschrift und eine kleine Tabelle sind sofort zu erkennen. Für eine automatische Auswertung sind das jedoch verschiedene Aufgaben: Zeichen erkennen, ihre Reihenfolge bestimmen und Beziehungen zwischen den Inhalten erhalten.

Besonders deutlich wird das an einem selbst erzeugten Beispielblatt. Links steht eine Beschreibung, rechts eine Materialliste, darunter eine Tabelle mit drei erfundenen Papiergrößen.

Richtig erkannte Wörter können falsch zusammenkommen

Wenn die Wörter zeilenweise quer über beide Spalten gelesen werden, entsteht ein Text, den niemand so gemeint hat. Auch eine Tabelle verliert Bedeutung, wenn Zahlen nicht mehr zu ihren Spaltenüberschriften gehören.

Bei einer gescannten Seite kommt die Erkennung der Zeichen hinzu. Ein schlecht erkanntes „1“ kann eine Maßangabe verändern. Deshalb ist es sinnvoll, Fehler in Zeichen, Reihenfolge und Struktur getrennt festzuhalten.

OpenDataLoader PDF beschreibt die Ausgabe strukturierter Dokumentelemente. Der Fund ist interessant, weil neben Text auch dessen Position und Ordnung berücksichtigt werden können. Daraus wird hier kein unabhängiger Qualitätsvergleich mit anderen Werkzeugen abgeleitet.

Ein kleiner Test lässt sich nachprüfen

Für das Beispielblatt steht die gewünschte Lesereihenfolge vorher fest. Nach der Verarbeitung werden Überschriften, Absätze und Tabellenwerte einzeln verglichen. Zusätzlich sollte sichtbar bleiben, auf welche Seite eine Aussage zurückgeht.

Eine spätere KI-Zusammenfassung kann nur mit der erhaltenen Struktur arbeiten. Wenn die Materialmenge bereits einer falschen Zeile zugeordnet wurde, macht ein schöner Antwortsatz den Fehler nicht besser. Das wichtigste Ergebnis der Übung ist deshalb eine nachvollziehbare Verbindung zwischen Originalansicht und extrahierten Daten.

Ursprüngliche Funde

Diese Links waren der Ausgangspunkt für den Beitrag. Die Einordnung im Text stammt von mir; die verlinkten Beiträge sind keine eigenen Tests.

Zum Datum: Dieser Beitrag wurde am 11. Oktober 2026 ausgearbeitet. Das Archivdatum entspricht dem frühesten zugehörigen Fund in der Sammlung, nicht einer damaligen Veröffentlichung. Technische Einordnungen und nachträglich ergänzte Quellen beziehen sich auf die Ausarbeitung.