Daten aus PDFs als CSV extrahieren
Tabellenkalkulationen steuern nach wie vor Finanzen, Logistik und Betrieb, weshalb so viele Workflows mit derselben Bitte enden: dieses PDF in eine CSV umwandeln, die sich in Excel öffnen oder in eine Datenbank laden lässt. Das Problem ist, dass ein PDF keine Zeilen hat. Es enthält Textzeilen, die auf einer Seite positioniert sind, und eine Tabelle in einem PDF ist lediglich Tinte, die zufällig fluchtet. Ein Kontoauszug von Wells Fargo, eine Packliste eines Spediteurs, eine Zahlungsavis mit vierzig Positionen und eine Mietaufstellung für ein Gebäude mit 120 Einheiten sehen für einen Menschen wie Tabellen aus, für einen Parser jedoch wie loser Text. Kopieren und Einfügen übersteht diesen Weg selten: Spalten verschmelzen, mehrzeilige Zellen brechen auseinander, und die Summenzeile landet an der falschen Stelle. Talonic liest die Struktur hinter dem Layout und liefert saubere CSV-Daten. Jede erkannte Tabelle wird zu Zeilen mit einheitlichen Spalten, einer Kopfzeile und einem Wert pro Zelle, sodass ein 3-seitiger Auszug in eine einzige übersichtliche Datei zusammenfällt. Zahlen kommen als Zahlen zurück, Datumsangaben werden auf ISO 8601 normalisiert, und ein Wert wie 2026-04-30 oder $4,812.00 behält seine Bedeutung, statt zu Freitext zu werden. Wiederholte Kopf- und Fußzeilen werden entfernt, damit sie nicht als Phantomzeilen erscheinen. Jede Zelle trägt außerdem einen Konfidenzwert und einen Verweis auf den Bereich des Quell-PDFs, aus dem sie stammt, sodass ein Finanzteam jede Zahl prüfen kann, bevor sie ins Hauptbuch gelangt. Benötigt ein Workflow verschachtelte Daten statt flacher Zeilen, steht dieselbe Extraktion als JSON über die API zur Verfügung.
Was aus PDFs als CSV extrahiert wird
So funktioniert die Extraktion für PDFs als CSV
Vorlagenbasierte Tabellenextraktion versagt, sobald sich eine Spalte verschiebt, deshalb verwendet Talonic keine festen Vorlagen. Jedes PDF wird klassifiziert und einem versionierten Schema in der Field Registry zugeordnet, das die Spalten und ihre Typen benennt. Tabellen, die sich über mehrere Seiten erstrecken, werden zu einer durchgehenden Zeilenfolge zusammengefügt, und die Kopfzeile wird einmal erkannt statt wiederholt. Mehrzeilige Zellen bleiben in einem einzigen Feld erhalten, statt in neue Zeilen überzulaufen, und numerische Spalten werden typisiert, sodass Summen gegen ihre Einzelposten geprüft werden können. Gescannte PDFs werden zunächst per OCR gelesen, bevor dieselbe Zuordnung läuft. Jede Zelle wird mit einem Konfidenzwert und einem Pixel-Regionsverweis zurückgegeben, konform mit DIN SPEC 91491, sodass eine Zelle mit niedriger Konfidenz gegen die Quellseite geprüft werden kann, bevor die CSV irgendwo geladen wird.
Beispielextraktion
Ein 3-seitiger Wells Fargo Kontoauszug, Transaktionstabelle
{
"columns": [
"date",
"description",
"amount",
"balance"
],
"rows": [
[
"2026-04-03",
"ACH CREDIT STRIPE PAYOUT",
2450,
14930.55
],
[
"2026-04-05",
"CHECK 2174 ABC SUPPLIES",
-842.16,
14088.39
],
[
"2026-04-15",
"WIRE OUT VENDOR PAYMENT",
-5000,
9088.39
]
]
}Häufig gestellte Fragen
Werden mehrseitige Tabellen als eine CSV ausgegeben?
Ja. Tabellen, die sich über mehrere Seiten fortsetzen, werden zu einer einzigen Zeilenfolge mit einer Kopfzeile zusammengefügt. Seitenumbrüche, wiederholte Kopfzeilen und Fußzeilen aus dem ursprünglichen PDF werden entfernt, sodass sie nicht als zusätzliche Zeilen erscheinen.
Bleiben Zahlen und Datumsangaben typisiert, oder werden sie zu Text?
Zahlen werden als Zahlen zurückgegeben, und Datumsangaben werden auf ISO 8601 normalisiert, sodass sowohl 04/30/26 als auch 30 Apr 2026 zu 2026-04-30 werden. Das bedeutet, eine in Excel oder eine Datenbank geladene CSV sortiert und summiert korrekt, statt Werte als Zeichenketten zu behandeln.
Was ist mit gescannten PDFs oder Fotos eines Dokuments?
Sie werden zunächst per OCR gelesen und dann denselben Spalten zugeordnet. Jede Zelle trägt einen Konfidenzwert und einen Regionsverweis, sodass jeder Wert, bei dem sich das Modell unsicher ist, gegen das Quellbild geprüft werden kann.
Kann ich auch JSON statt CSV erhalten?
Ja. Dieselbe Extraktion liefert JSON über die API, wenn Sie verschachtelte Strukturen wie Einzelposten innerhalb einer Rechnung benötigen. CSV wird über einen Query-Parameter ausgewählt, für Tabellenkalkulations- und Datenbankladevorgänge.
Bereit, Daten aus Ihrem eigenen PDFs als CSV zu extrahieren?
Autorenhinweis
Geprüft von Talonic engineering, API review · zuletzt geprüft am 2026-06-20