Zum Hauptinhalt springen

Daten aus Rechnungen extrahieren

Rechnungen sind der Kern des B2B-Handels. Jedes Accounts-Payable-Team bearbeitet Tausende davon: die monatliche Abo-Rechnung eines SaaS-Anbieters, eine einmalige Positionsrechnung einer Marketingagentur, eine mehrseitige Handelsrechnung mit 200 SKUs von einem Bekleidungslieferanten aus Vietnam. Die Semantik bleibt stabil. Das Format nie. Lieferanten verwenden, welche Vorlage auch immer ihr Abrechnungssystem erzeugt, und das Ergebnis landet als PDF im Posteingang, das sich ohne manuelle Neuerfassung nicht in NetSuite, QuickBooks oder SAP importieren lässt. Die Kosten dieser Neuerfassung summieren sich: verpasste Skonti, Verzugsstrafen, Rückstände beim Dreiwegeabgleich, Rückstellungen, die bei der Prüfung durchfallen, weil Positionen bei der Dateneingabe verloren gingen, und ein DSO, der steigt, weil Rechnungen in einer manuellen Warteschlange liegen bleiben. Die schwierigen Teile sind nicht die einfachen Felder. Rechnungsnummer, Lieferantenname, Gesamtbetrag, Fälligkeitsdatum: Die meisten Extraktoren erfassen diese korrekt. Was bei Skalierung bricht, ist die Positionstabelle. Mehrseitige Rechnungen, bei denen sich die Tabelle über Seiten mit wiederholten Kopfzeilen fortsetzt. Rabatte, die auf einzelne Positionen statt auf die Zwischensumme angewendet werden. Versand- und Bearbeitungskosten, die als eigene Position erscheinen, teils steuerpflichtig, teils nicht. Rechnungen mit gemischten Währungen, bei denen eine Position in USD und eine andere in EUR steht (selten, aber real bei internationalen Dienstleistern). Mehrwertsteuer oder Sales Tax, die nach Gerichtsbarkeit aufgeschlüsselt werden muss. Zahlungsadressen des Lieferanten, die vom Namen der Rechtseinheit im Rechnungskopf abweichen. Bestellnummern, die einmal im Kopf und erneut pro Position erscheinen. Zahlungsbedingungen, ausgedrückt als Net 30, 2/10 Net 30 oder ein konkretes Fälligkeitsdatum. Talonic liefert die vollständige Rechnungsstruktur als JSON oder CSV: Positionen als strukturiertes Array mit Beschreibung, Menge, Einzelpreis, Positionssumme und etwaiger Steuer oder Rabatt pro Position; Kopffelder wie Rechnungsnummer, Daten, Lieferant, Käufer, Währung und Summen einmal erfasst; Zahlungsbedingungen als Strings erhalten statt in starre Felder geparst, da die Variation zu groß für eine Standardisierung ist. Jede extrahierte Zelle trägt einen Konfidenzwert und einen Pixel-Bereichsverweis, sodass jeder strittige Betrag vor der Freigabe gegen das Quell-PDF geprüft werden kann.

Was aus Rechnungen extrahiert wird

RechnungsnummerINV-2026-00471
Rechnungsdatum2026-04-08
Fälligkeitsdatum2026-05-08
LieferantAcme Software, Inc.Aussteller / Verkäufer
KäuferGlobex Logistics LLCRechnungsempfänger
WährungUSDISO-4217-Code
Rechnungssumme$8,420.00
PositionenArray of 12 rows: description, quantity, unit price, line totalEnthält Rabatte und Steuern pro Position
BestellnummerPO-2026-01102
ZahlungsbedingungenNet 30, 2% if paid within 10 days

So funktioniert die Extraktion für Rechnungen

Rechnungen kommen als PDFs, Scans oder Bilder an, das Format hängt vollständig von der Abrechnungssoftware des Lieferanten ab. Talonic klassifiziert jede Rechnung und verarbeitet sie über das Invoice-Schema in der Field Registry, das sowohl die Kopffelder als auch die Positionstabelle ohne vorlagenspezifische Konfiguration abbildet. Mehrseitige Positionstabellen werden zusammengefügt, wiederholte Kopfzeilen werden herausgefiltert; Rabatte und Versandkosten werden als markierte Positionen erfasst statt in ein generisches Notizfeld zu fallen. Die Währung wird auf ISO-4217-Codes normalisiert. Steuern pro Position werden aufgeschlüsselt, wenn sie in der Quelle so ausgewiesen sind. Konfidenz auf Zellenebene und Pixel-Bereichsherkunft folgen der DIN SPEC 91491-Konformität, sodass AP-Teams jeden strittigen Betrag vor der Zahlungsfreigabe prüfen können.

Beispielextraktion

Eine zweiseitige Handelsrechnung in USD mit drei Positionen

{
  "invoice_number": "INV-2026-00471",
  "invoice_date": "2026-04-08",
  "due_date": "2026-05-08",
  "vendor": "Acme Software, Inc.",
  "buyer": "Globex Logistics LLC",
  "currency": "USD",
  "purchase_order_number": "PO-2026-01102",
  "line_items": [
    {
      "description": "Annual subscription, Pro plan",
      "quantity": 5,
      "unit_price": 1200,
      "line_total": 6000
    },
    {
      "description": "Onboarding services, 8 hours",
      "quantity": 8,
      "unit_price": 250,
      "line_total": 2000
    },
    {
      "description": "Volume discount",
      "quantity": 1,
      "unit_price": -250,
      "line_total": -250
    }
  ],
  "totals": {
    "subtotal": 7750,
    "tax": 670,
    "total": 8420
  },
  "payment_terms": "Net 30, 2% if paid within 10 days"
}

Häufig gestellte Fragen

Kann Talonic Positionstabellen verarbeiten, die sich über mehrere Seiten erstrecken?

Ja. Mehrseitige Rechnungen liefern ein einziges, geordnetes Array von Positionen. Wiederholte Tabellenkopfzeilen auf Seite 2 und folgenden werden automatisch herausgefiltert. Zwischensumme, Steuer und Gesamtsumme werden gegen die Summe der Positionssummen abgeglichen; Abweichungen lösen eine Validierungswarnung aus.

Wie werden Rabatte und Versandkosten behandelt?

Rabatte und Versandkosten erscheinen als eigene Positionen im Array, mit einem Vorzeichen, das ihrer Wirkung auf die Gesamtsumme entspricht (Rabatte negativ, Versand positiv). Mehrwertsteuer oder Sales Tax pro Position bleibt auf der Position erhalten, wenn sie in der Quelle so ausgewiesen ist; andernfalls steht die Gesamtsteuer im Summenblock.

Verarbeitet Talonic Rechnungen in nicht-lateinischen Schriften oder in von rechts nach links geschriebenen Sprachen?

Ja. Talonic verarbeitet Rechnungen auf Arabisch, Hebräisch, Chinesisch, Japanisch, Koreanisch, Kyrillisch und in den meisten anderen Schriften. Die Feldsemantik bleibt gleich; nur der Quelltext unterscheidet sich. Währungscodes werden unabhängig von der Schrift auf ISO 4217 normalisiert.

Wie verhält es sich mit gescannten Rechnungen im Vergleich zu digitalen PDFs?

Beide funktionieren. Gescannte Rechnungen werden per OCR erfasst und durchlaufen dasselbe Schema, wobei für jede Zelle ein Konfidenzwert zurückgegeben wird. Digitale PDFs werden mit höherer Konfidenz extrahiert, da die Textebene bereits vorhanden ist. Gefaxte Rechnungen und Fotos von Papierrechnungen werden ebenfalls unterstützt.

Ist die Ausgabe bereit für QuickBooks, NetSuite oder SAP?

Die strukturierte Ausgabe lässt sich für Tabellenkalkulationen sauber als CSV und für AP-Automatisierung, ERP-Systeme und Analysen als JSON exportieren. Positionen bilden ein flaches Array von Zeilen; Kopfdatenfelder erscheinen nur einmal. Die Zuordnung zum Kontenplan des Zielsystems erfolgt nach der Extraktion.

Autorenhinweis

Geprüft von Talonic engineering, schema review · zuletzt geprüft am 2026-05-11