Daten aus PDFs als JSON extrahieren
Ein PDF ist ein Layoutformat, kein Datenformat. Es beschreibt, wo Tinte auf einer Seite sitzt, nicht was die Werte bedeuten, weshalb sauberes JSON aus einem PDF zu ziehen schwerer ist, als es aussieht. Eine Lieferantenrechnung von Stripe, ein dreiseitiger Kontoauszug von JPMorgan Chase, eine Packliste eines Spediteurs in Rotterdam und eine unterzeichnete Auftragsbestätigung tragen alle dieselben zugrunde liegenden Fakten, die ein nachgelagertes System benötigt, doch jedes stellt sie in einer anderen visuellen Anordnung dar. Entwickler, die JSON wollen, greifen meist zu einer OCR-Bibliothek, erhalten eine Textwand zurück und verbringen dann Tage damit, brüchige reguläre Ausdrücke zu schreiben, um die Rechnungsnummer, die Positionen und die Summen zu finden. Sobald ein Lieferant seine Vorlage ändert, bricht der Parser. Talonic verwandelt jedes PDF in strukturiertes JSON, ohne diese Brüchigkeit. Laden Sie ein Dokument über das Dashboard oder die API hoch, und die Antwort ist ein typisiertes JSON-Objekt: skalare Felder wie issue_date im ISO-8601-Format und total_amount als Zahl, verschachtelte Arrays für Positionen und konsistente Schlüssel über jede Variation des Quelllayouts hinweg. Ein Auszug vom 2026-04-30 und ein Auszug vom 2025-11-02 von zwei verschiedenen Banken liefern dieselbe Struktur. Jeder Wert kommt mit einem Konfidenzwert zwischen 0 und 1 und einem Pixelbereich, der auf die genaue Stelle auf der Seite zurückweist, aus der er stammt, sodass eine Zahl wie $18,902.11 in Sekunden bis zu ihrer Quelle zurückverfolgt werden kann. Die Ausgabe fließt direkt in eine Datenbank, ein ERP oder einen KI-Agenten, und sie exportiert auch nach CSV, wenn eine Tabellenkalkulation das Ziel ist.
Was aus PDFs als JSON extrahiert wird
So funktioniert die Extraktion für PDFs als JSON
Talonic verlässt sich nicht auf Regeln pro Vorlage, daher erfordert ein neues PDF-Layout keine neue Konfiguration. Jedes Dokument wird klassifiziert und gegen ein versioniertes Schema in der Field Registry abgeglichen, das die Schlüssel, Typen und Validierungsregeln festlegt, die das JSON erfüllen muss. Bei gescannten PDFs wird der Text per OCR erfasst und anschließend normalisiert: Daten werden zu ISO-8601-Strings, Währungsbeträge werden zu Zahlen in einer einheitlichen Vorzeichenkonvention, und wiederkehrende Kopf- und Fußzeilen werden entfernt, damit sie nie als Daten erscheinen. Felder, die die Validierung nicht bestehen, etwa eine Summe, die nicht der Summe ihrer Positionen entspricht, werden markiert statt stillschweigend zurückgegeben. Jede Zelle trägt gemäß DIN SPEC 91491 einen Konfidenzwert und einen Pixelregion-Zeiger, sodass Werte mit niedriger Konfidenz gegen die Quellseite geprüft werden können, bevor das JSON weiterverarbeitet wird.
Beispielextraktion
Eine zweiseitige Lieferantenrechnung als PDF (Stripe, April 2026)
{
"invoice_number": "INV-2043",
"issue_date": "2026-04-30",
"vendor": "Stripe, Inc.",
"currency": "USD",
"line_items": [
{
"description": "Platform fee",
"quantity": 1,
"unit_price": 299,
"amount": 299
},
{
"description": "Additional usage",
"quantity": 1240,
"unit_price": 0.02,
"amount": 24.8
}
],
"subtotal": 323.8,
"tax": 0,
"total_amount": 323.8
}Häufig gestellte Fragen
Wie unterscheidet sich das von einer PDF-Verarbeitung durch eine OCR-Bibliothek?
OCR liefert Text, keine strukturierten Daten. Sie müssen jeden Wert weiterhin selbst finden und beschriften. Talonic liefert ein typisiertes JSON-Objekt mit benannten Schlüsseln, verschachtelten Positionen und einem Konfidenzwert pro Feld, sodass keine Regex-Ebene geschrieben oder gepflegt werden muss, wenn sich ein Layout ändert.
Kann ich das JSON über eine API erhalten?
Ja. Senden Sie das Dokument an den Extraktions-Endpunkt und fragen Sie das Ergebnis per Polling ab, oder erhalten Sie es per Webhook. Die Antwort ist JSON, und dieselben Daten lassen sich mit einem Query-Parameter als CSV exportieren. Das Node SDK kapselt die Aufrufe, falls Sie typisierte Methoden statt rohem HTTP bevorzugen.
Was passiert bei gescannten oder fotografierten PDFs?
Gescannte PDFs durchlaufen zunächst OCR und danach dasselbe Schema. Jeder Wert kommt mit einem Konfidenzwert und einer Pixelregion zurück, sodass alles, bei dem sich das Modell unsicher ist, anhand des Originalbilds geprüft werden kann, statt blind vertraut zu werden.
Bleibt die JSON-Struktur über verschiedene Dokumentlayouts hinweg gleich?
Ja. Das Schema legt Schlüssel und Typen fest, sodass eine Rechnung von einem Anbieter und eine Rechnung von einem anderen dieselbe Struktur zurückgeben. Diese Stabilität ermöglicht es, die Ausgabe einmal in eine Datenbank oder ein ERP zu übernehmen und danach nicht mehr anfassen zu müssen.
Bereit, Daten aus Ihrem eigenen PDFs als JSON zu extrahieren?
Autorenhinweis
Geprüft von Talonic engineering, API review · zuletzt geprüft am 2026-06-20