Warum liest die KI eine Tabelle in meinem PDF falsch?
Eine PDF-Tabelle kann perfekt aussehen und trotzdem in der falschen Reihenfolge extrahiert werden. Was schiefgeht, wo OCR hilft und wie Sie Zahlen prüfen.
Sie stellen einer KI eine Frage zu einer Tabelle in einem PDF. Sie antwortet selbstsicher, aber eine Zahl gehört plötzlich zum falschen Monat. Oder die Summe wirkt richtig, obwohl eine Zeile fehlt. Das PDF sieht normal aus. Der Fehler entstand bei der Extraktion.
Das passiert, weil eine PDF-Tabelle meist ein visuelles Layout und keine Tabellenkalkulation ist. Die Seite zeigt Ihren Augen Zeilen und Spalten. Die Textebene kann dieselben Wörter als lose Folge positionierter Fragmente speichern.
Für Sie ist die Tabelle strukturiert, für den Extraktor nicht unbedingt
Beim Erstellen eines PDFs erhält jedes Textstück eine Position auf der Seite. Eine Überschrift, ein Zellwert und eine Fußnote können getrennte Objekte sein. Die Datei kann sich merken, wo sie gezeichnet wurden, ohne zu speichern, dass eines zur dritten Spalte und siebten Zeile gehört.
Ein Textextraktor muss diese Beziehung aus Koordinaten rekonstruieren. Liegen zwei Spalten nahe beieinander, bricht eine Zeile um oder wiederholt sich eine Überschrift auf der nächsten Seite, kann sich die Lesereihenfolge ändern. Das Ergebnis bleibt für Menschen lesbar, ist aber keine verlässliche Tabelle mehr.
Vier typische Arten, wie eine Tabelle falsch gelesen wird
- Spalten laufen zusammen. Werte aus zwei benachbarten Spalten erscheinen als ein gemeinsamer Textstrom.
- Zeilen umbrechen unerwartet. Eine lange Bezeichnung schiebt den Wert in die nächste Zeile, und die KI ordnet ihn der falschen Zeile zu.
- Überschriften wiederholen sich ohne Kontext. Ein Seitenumbruch fügt eine weitere Überschrift hinzu, aber der extrahierte Text zeigt die Grenze nicht deutlich.
- Notizen sehen wie Daten aus. Eine Fußnote oder Zwischensumme kann wie ein weiterer Datensatz wirken, besonders bei gleicher Schrift und Ausrichtung.
Gescannte Tabellen bringen ein weiteres Problem. Es gibt möglicherweise keine Textebene, also muss OCR Zeichen und Positionen erraten, bevor die KI das Dokument überhaupt sieht.
Warum OCR nicht jede Tabelle rettet
OCR hilft, wenn ein PDF nur aus einem Seitenbild besteht. Es macht sichtbare Buchstaben zu auswählbarem Text, was eine große Verbesserung ist. OCR ist aber nicht dasselbe wie der Aufbau einer Tabellenkalkulation. Rahmen, verbundene Zellen, leere Zellen, Hochstellungen und mehrzeilige Überschriften können ihre Bedeutung trotzdem verlieren.
Deshalb kann ein OCR-Ergebnis für die Suche gut genug und für eine Berechnung trotzdem unsicher sein. Wenn die Frage von einer genauen Summe abhängt, vergleichen Sie die Antwort mit der gerenderten Seite.
Eine praktische Prüfung vor dem Vertrauen
- Bitten Sie die KI, für jede wichtige Zahl Seite und Zeile zu nennen.
- Öffnen Sie die Seite und verfolgen Sie die ganze Zeile, nicht nur den Wert.
- Berechnen Sie Summen selbst nach, wenn Geld, Compliance oder eine Entscheidung betroffen ist.
- Versuchen Sie eine zweite Extraktion, wenn die Reihenfolge seltsam wirkt oder Spalten verschmelzen.
Die Textebene können Sie lokal mit PDF zu Markdownprüfen. Das Werkzeug kann OCR für gescannte Seiten hinzufügen, aber auch das Ergebnis bleibt eine Extraktion. Betrachten Sie es als Arbeitskopie, nicht als Beweis, dass die Tabellenstruktur perfekt erhalten blieb.
Tokens können das Problem verbergen
Eine beschädigte Tabelle kann eine völlig normale Tokenzahl haben. Die Wörter sind noch da, daher kann der PDF-Token-Zähler eine plausible Zahl anzeigen. Die Tokenzahl zeigt, wie viel Text die KI erhalten kann. Sie zeigt nicht, ob die Spalten richtig zugeordnet sind.
Dasselbe gilt für die Kosten. Der Token-Kostenrechnerschätzt, wie viel das Senden des extrahierten PDFs kostet. Eine kleinere Rechnung macht eine beschädigte Tabelle aber nicht zuverlässiger.
Kurzfassung
Eine KI kann eine Tabelle übersehen, obwohl das PDF perfekt aussieht, weil visuelles Layout und Textreihenfolge verschiedene Dinge sind. Extrahieren Sie den Text, prüfen Sie die Zeilen, vergleichen Sie wichtige Zahlen mit der Seite und verwenden Sie OCR als hilfreichen Schritt, nicht als Garantie. Bei wichtigen Tabellen bleibt die letzte Prüfung menschliche Arbeit.