Zum Hauptinhalt springen

Daten aus Lebensläufe extrahieren

Ein Lebenslauf ist das Dokument mit dem chaotischsten Format in jeder Recruiting-Pipeline. Für eine einzelne Stelle als Senior Backend Engineer kann ein Recruiting-Team in einem Unternehmen mit 600 Mitarbeitenden innerhalb einer Woche 400 Bewerbungen erhalten: einspaltige PDFs aus LinkedIn-Exporten, zweispaltige Designer-Vorlagen mit Fähigkeiten in einer Seitenleiste, akademische Lebensläufe mit neun Seiten und Publikationsliste sowie Lebensläufe im US-Bundesbehörden-Stil, die jede Aufgabe in vollständigen Sätzen ausformulieren. Die Daten, die ein Recruiter oder ein Bewerbermanagementsystem tatsächlich benötigt, sind bei allen gleich: Name der Kandidatin oder des Kandidaten, E-Mail, Telefon, Standort, eine kurze Zusammenfassung, die Liste der Stationen mit Arbeitgeber, Position und Zeitraum, der Ausbildungsweg und die Fähigkeiten. Die Schwierigkeit liegt im Layout, nicht im Inhalt. Zweispaltige Lebensläufe verwirren einfache Textextraktion, weil die Lesereihenfolge die Seitenleiste mit dem Hauptteil vermischt, sodass "Python" mitten in einer Stellenbeschreibung landet. Daten erscheinen als "Jan 2022 bis heute", "2019 bis 2021" oder "06/2020 bis 09/2023", und die Betriebszugehörigkeit muss einheitlich berechnet werden. Arbeitgebernamen tragen Zusätze (Stripe, Inc. gegenüber Stripe), die auf eine Entität abgeglichen werden müssen. Eine Kandidatin, die von 2018 bis 2022 bei Google und danach bei einem während ihrer Anstellung übernommenen Startup gearbeitet hat, sollte trotzdem eine saubere Historie mit zwei Stationen zeigen. Fähigkeiten verteilen sich auf eine Kopfzeilenliste, die Zusammenfassung und die Aufzählungspunkte unter jeder Station. Talonic liest den Lebenslauf unabhängig vom Spaltenlayout und liefert ein strukturiertes Profil zurück. Kontaktdaten werden vom Fließtext getrennt. Die Berufserfahrung wird als geordnetes Array von Stationen mit Arbeitgeber, Position, Start- und Enddatum sowie normalisierter Betriebszugehörigkeit erfasst. Ausbildung und Fähigkeiten kommen als separate Listen zurück, sodass ein Bewerbermanagementsystem Kandidaten abgleichen kann, ohne dass ein Recruiter etwas neu eintippen muss. Für eine Senior-Backend-Engineer-Stelle sichtet ein Recruiter Lebensläufe mit Angaben zur Betriebszugehörigkeit bei Acme Robotics vom 2018-06-01 bis 2022-03-15, einem Abschluss am 2016-05-20, Arbeitserlaubnis für die USA und die EU sowie Fähigkeiten, die die Bewerbermanagement-API übernimmt; das geparste PDF, ein CSV-Export und die OCR-Konfidenz werden allesamt an das ERP übertragen.

Was aus Lebensläufe extrahiert wird

Vollständiger NameDaniel Okafor
E-Maildaniel.okafor@example.com
Telefon+1 415 555 0182
StandortAustin, TX
ZusammenfassungBackend engineer, 7 years, distributed systems
BerufserfahrungStripe, Inc., Software Engineer, 2020-06 to present
AusbildungBS Computer Science, University of Texas, 2016
FähigkeitenPython, Go, PostgreSQL, Kubernetes

So funktioniert die Extraktion für Lebensläufe

Lebensläufe treffen als PDFs, DOCX-Exporte und Scans über Jobbörsen, Empfehlungspostfächer und Bewerbermanagementsysteme ein, ohne gemeinsames Layout. Talonic erkennt zunächst die Spaltenstruktur, damit die Lesereihenfolge bei zweispaltigen Vorlagen und Seitenleisten korrekt ist, und führt das Dokument dann durch das Lebenslauf-Schema in der Field Registry, das Kontaktdaten, Zusammenfassung, Berufserfahrung, Ausbildung und Fähigkeiten erfasst. Beschäftigungsdaten in gemischten Formaten (Jan 2022, 06/2020, 2019 bis 2021) werden auf ISO-Monatsgenauigkeit normalisiert, und die Betriebszugehörigkeit wird pro Station berechnet. Arbeitgeber-Namensvarianten wie Stripe und Stripe, Inc. werden auf eine einzelne Entität abgeglichen. Jedes Feld liefert einen Konfidenzwert und Pixel-Bereich-Herkunftsnachweis gemäß DIN SPEC 91491, sodass ein Recruiter eine erkannte Position oder ein Datum gegen den Original-Lebenslauf prüfen kann, bevor die Kandidatin oder der Kandidat weiterkommt.

Beispielextraktion

Ein zweispaltiger, zweiseitiger Lebenslauf als PDF exportiert

{
  "full_name": "Daniel Okafor",
  "email": "daniel.okafor@example.com",
  "phone": "+1 415 555 0182",
  "location": "Austin, TX",
  "summary": "Backend engineer with 7 years in distributed systems",
  "work_experience": [
    {
      "employer": "Stripe, Inc.",
      "title": "Software Engineer",
      "start": "2020-06",
      "end": "present"
    },
    {
      "employer": "Google",
      "title": "Software Engineer",
      "start": "2018-01",
      "end": "2020-05"
    }
  ],
  "education": [
    {
      "degree": "BS Computer Science",
      "institution": "University of Texas",
      "year": 2016
    }
  ],
  "skills": [
    "Python",
    "Go",
    "PostgreSQL",
    "Kubernetes"
  ]
}

Häufig gestellte Fragen

Werden zweispaltige Lebensläufe und Layouts mit Seitenleiste unterstützt?

Ja. Die Spaltenerkennung läuft vor der Feldextraktion, sodass eine Seitenleiste mit Fähigkeiten nicht in eine Stellenbeschreibung eingemischt wird. Die Lesereihenfolge wird aus dem visuellen Layout rekonstruiert, was bei Designer-Vorlagen der häufigste Fehlerpunkt für einfache Textextraktion ist.

Wie werden Beschäftigungsdaten normalisiert?

Gemischte Formate wie "Jan 2022", "06/2020" und "2019 bis 2021" werden auf ISO-Monatsgenauigkeit umgerechnet, und die Betriebszugehörigkeit wird pro Station berechnet. Eine laufende Station, die als "Present" markiert ist, behält ein offenes Enddatum, sodass nachgelagerte Filter sie als aktuell behandeln können.

Können auch akademische Lebensläufe und US-Bundesbehörden-Lebensläufe geparst werden?

Ja. Längere Formate mit Publikationen, Stipendien oder detaillierten Verantwortungsbeschreibungen durchlaufen dasselbe Schema. Abschnitte ohne strukturiertes Ziel, etwa eine Publikationsliste, werden als beschriftete Textblöcke zurückgegeben statt verworfen.

Autorenhinweis

Geprüft von Talonic engineering, resume schema review · zuletzt geprüft am 2026-06-11