Document Extraction API - Jeder Anbieter gewinnt seine eigene Demo

Wichtigste Erkenntnisse:

  • Eine Dokumenten-Extraktions-API liefert Ihnen beschriftete Felder, Tabellen und Positionen aus einem PDF, einem Scan oder einer E-Mail. OCR liefert Ihnen nur Zeichen und überlässt Ihnen die Interpretation.
  • Vorlagenbasierte (Template) und KI-gesteuerte Extraktion sind unterschiedliche Produkte. Vorlagen zerbrechen, wenn ein Lieferant den Gesamtbetrag verschiebt, KI-Extraktion liest Layouts, die sie noch nie zuvor gesehen hat.
  • Bewerten Sie Anbieter anhand der Genauigkeit auf Feldebene bei Ihren eigenen Dokumenten. Die Zahl auf dem Datenblatt wurde auf deren Dokumenten gemessen.
  • Parseur liefert eine Entwickler-API und eine Web-App, die Ihr Operations-Team bedienen kann, sodass niemand das Überprüfungs-Tool selbst bauen muss.
  • Parseur wird in der EU gehostet, die Daten werden in der Europäischen Union verarbeitet und gespeichert und niemals zum Trainieren von KI-Modellen verwendet.

Eine Dokumenten-Extraktions-API ist ein Dienst, der eine Datei wie ein PDF, ein gescanntes Bild oder eine E-Mail aufnimmt und strukturierte Daten wie JSON oder CSV zurückgibt. Im Gegensatz zu reiner OCR, die einfachen Text zurückgibt und es Ihnen überlässt, die Bedeutung darin zu finden, identifiziert und bewahrt eine Dokumenten-Extraktions-API die Struktur: Schlüssel-Wert-Paare, Tabellen, Positionen und beschriftete Felder.

Drei Nachbarn werden oft damit verwechselt. Öffentliche Daten-APIs liefern Ihnen einen Datensatz, den jemand anderes bereits zusammengestellt hat. Web-Scraping-APIs holen sich das, was auf einer Webseite steht. OCR-Engines? Zeichen, keine Struktur. Eine Dokumenten-Extraktions-API arbeitet mit Ihren Dokumenten, die bereits in einem Posteingang liegen, und verwandelt sie in Daten, auf die ein System reagieren kann. Einige Anbieter verkaufen dasselbe unter dem Namen Document Understanding API oder liefern es als Document Extraction SDK. Anderes Etikett, gleicher Job. Sind Sie noch dabei herauszufinden, welches Problem Sie haben? Wir haben Dokumenten-Parsing und Web-Scraping direkt gegenübergestellt.

Laut Research and Markets wird der Markt für intelligentes Dokumenten-Processing, zu dem auch Dokumenten-Extraktions-APIs gehören, auf etwa 3,01 Milliarden Dollar geschätzt und soll mit einer CAGR von 31,7 % wachsen. Diese Zahl ist im Grunde eine Zählung von Rechnungen, Kontoauszügen und Formularen, und jedes einzelne davon muss von etwas gelesen werden. In vielen Unternehmen ist dieses Etwas immer noch eine Person mit einem zweiten Monitor und einem Ziffernblock.

Kurze Beispiele:

  • PDF-Rechnung → JSON mit Kopfzeilenfeldern und einem Array für Positionen
  • Onboarding-Formular → Beschriftete Schlüssel-Wert-Paare (Name, Adresse, Unterschrift)
  • Kontoauszug → Transaktionstabelle als CSV exportiert

Fünf Arten von Anbietern unter demselben Label

Suchen Sie nach "Document Extraction API" und Sie finden ein Dutzend Anbieter, die sich eine Kategorie teilen, aber sonst fast nichts miteinander gemeinsam haben. Sie konkurrieren nicht wirklich miteinander, da sie für fünf verschiedene Aufgaben gebaut wurden. Jeder von ihnen wird in seiner eigenen Demo überzeugen, daher ist die Kategorie (die Zeile) wichtiger als das Verkaufsgespräch. Finden Sie heraus, in welcher Zeile Sie sich befinden, bevor Sie ein einziges Telefonat buchen.

Art des Anbieters Beispiele Entwickelt für Was Sie noch selbst bauen müssen
Cloud-Bausteine Google Document AI, Azure Document Intelligence, AWS Textract Teams, die bereits auf diese Cloud standardisiert sind und Extraktion als einen Dienst unter vielen möchten Aufnahme, Überprüfungsbildschirme, Ausnahmebehandlung, Wiederholungsversuche, ERP-Verbuchung
Kreditoren-Automatisierungsplattformen (AP) Rossum, Nanonets Finanzteams, die den gesamten Rechnungs-Workflow möchten, nicht nur die Felder Wenig, wenn der Workflow Ihrem ähnlich genug ist
Entwicklerorientierte Parsing-APIs Mindee, Veryfi, Parseur Entwickler, die den Workflow verantworten und sauberes JSON als Ausgabe möchten Variiert je nach Anbieter. Parseur liefert die Überprüfungs-App mit
KI-native Dokumenten-Parser LlamaParse, Reducto RAG- und Agenten-Pipelines, die mehr Wert auf originalgetreue Struktur als auf Geschäftsfelder legen Feldzuordnung, Validierung, alles Workflow-Spezifische
Enterprise-IDP-Suiten ABBYY, Hyperscience, UiPath Regulierte, hochvolumige Betriebe mit manueller Überprüfung und Legacy-Systemen Wenig zu bauen. Die Arbeit verlagert sich auf Konfiguration und Einführung

Zwei Vorbehalte zu dieser Tabelle. Erstens: Die Zeilen verschwimmen, einige Anbieter sitzen in zweien. Zweitens: Parseur befindet sich in Zeile drei, da es genau dafür gebaut ist – E-Mails und operative Dokumente in strukturiertes JSON zu verwandeln, inklusive einer App, die Ihr Ops-Team tatsächlich bedienen kann. Wenn Ihre Dokumente technische Zeichnungen sind, passt Zeile vier besser als wir, und wir sagen Ihnen das lieber jetzt als während einer Testphase.

Vorlagenbasierte vs. KI-gesteuerte Extraktion (Nur eine davon skaliert)

Eine vorlagenbasierte Extraktion findet ein Feld durch seine Position auf der Seite. Eine KI-gesteuerte Extraktion findet es durch seine Bedeutung. Das ist der ganze Unterschied, und er entscheidet darüber, wie viel Arbeit Sie sich aufhalsen.

Eine Vorlage besagt: Die Rechnungsnummer befindet sich 40 mm von oben, 120 mm von links. Schnell, deterministisch, wunderbar. Es hält genau bis zu dem Morgen, an dem ein Lieferant seine Rechnung neu gestaltet; ab diesem Zeitpunkt wird der falsche Wert oder gar nichts zurückgegeben, und jemand öffnet ein Ticket. Zweihundert Lieferanten, zweihundert Vorlagen, ein Ingenieur, der sie versteht.

Eine KI-gesteuerte Extraktion liest das Dokument so, wie es ein Mensch tut. Sie findet den Gesamtbetrag, weil er unter einer Zeile namens "Fälliger Betrag" steht, unten rechts, als Währung formatiert ist und der Summe darüber entspricht. Verschieben Sie ihn, ändern Sie den Stil, übersetzen Sie die gesamte Rechnung ins Deutsche. Er bleibt auffindbar.

Parseur betreibt zwei KI-Engines und keine Vorlagen: die Text AI-Engine für E-Mails und Textdokumente, die Vision AI-Engine für PDFs, Scans und Bilder. Sie beschreiben die gewünschten Felder und die Extraktion passt sich pro Dokument statt pro Layout an. Das Setup besteht also aus Minuten der Felddefinition anstatt Wochen der Vorlagenerstellung.

Der Kompromiss ist real. KI-Extraktion ist probabilistisch, während eine Vorlage deterministisch ist. Deshalb existieren Konfidenzwerte, und deshalb verbringt der Evaluierungsabschnitt weiter unten mehr Zeit mit der Ausnahmebehandlung als mit reinen Genauigkeitsbehauptungen.

Wie eine Dokumenten-Extraktions-API funktioniert, in fünf Phasen

Anbieter unterscheiden sich in den Details, aber die Dokumenten-Extraktions-Pipeline hat überall die gleiche Form.

Warum dies nicht mehr optional ist: das Volumen. Dream Factory zitiert die weithin bekannte Prognose, dass die globalen Daten bis 2025 auf 175 Zettabyte anwachsen würden – ein Datum, das nun hinter uns liegt –, und der Anteil der Daten, die als Dokumente statt als Datenbankzeilen eintreffen, ist nicht geschrumpft. Manuelle Dateneingabe skaliert in diese Volumina nicht hinein. Genauso wenig tut es eine Wand aus Vorlagen.

Schritt 1: Aufnahme (Ingestion)

Wie auch immer der Anbieter es nennt, dies ist die Dokumenten-Ingestion-API: Upload über HTTP, E-Mail-Weiterleitung oder ein Webhook aus einem anderen System. E-Mail ist hierbei wichtiger, als es klingt. Ein großer Teil der Geschäftsdokumente berührt niemals einen Dateiauswahldialog; sie kommen als Anhänge von einem Lieferanten an, der noch nie von Ihrem Portal gehört hat.

Schritt 2: KI-OCR & Layout-Analyse

KI-OCR wandelt Bilder und gescannte Inhalte in maschinenlesbaren Text um. Die Layout-Analyse ermittelt dann die Lesereihenfolge, Textblöcke, Zeilen, Wörter und deren Position auf der Seite. Dies ist der Schritt, der eine moderne Engine von einer aus dem Jahr 2010 unterscheidet: Sie erzeugt eine Strukturkarte, nicht nur Zeichen.

Schritt 3: Parsing

  • Schlüssel-Wert-Paare: Etiketten, die Werten zugeordnet sind, wie z. B. "Rechnungsnummer: 12345".
  • Tabellen und Positionen: Rekonstruierte Zeilen und Zellen, einschließlich verbundener Zellen, Spannen und Tabellen, die sich über einen Seitenumbruch hinaus fortsetzen.
  • Klassifizierung: Herausfinden, um was für ein Dokument es sich handelt, bevor entschieden wird, nach welchen Feldern gesucht werden soll.

Schritt 4: Nachbearbeitung

Daten, Währungen und Lieferantennamen werden in einheitliche Formate normalisiert. Das Ergebnis wird gegen ein JSON Schema oder Pydantic-Modell validiert, sodass ein fehlerhafter Payload niemals Ihr ERP erreicht.

Schritt 5: Auslieferung

Die API gibt das Ergebnis synchron bei kleinen Dateien zurück oder asynchron mit einem Webhook-Callback bei allem Größeren. Wiederholungsversuche und Idempotenz sorgen dafür, dass dies bei großen Volumina zuverlässig bleibt. Fragen Sie nach beidem, bevor Sie unterschreiben, nicht nach der ersten lautlosen Freitagnacht.

Zeigen Sie mir das JSON

Anbieter-Seiten sprechen von "strukturierter Ausgabe", ohne jemals eine zu zeigen. Hier ist die Form, in der eine Lieferantenrechnung zurückkommen sollte, und die Form, auf deren Einhaltung man bei jedem Anbieter bestehen sollte:

{
  "document_type": "invoice",
  "supplier": { "name": "", "tax_id": "", "supplier_id": "" },
  "invoice": {
    "invoice_number": "",
    "invoice_date": "",
    "due_date": "",
    "currency": "",
    "po_number": ""
  },
  "amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
  "line_items": [
    {
      "description": "",
      "sku": "",
      "quantity": 0,
      "unit_price": 0,
      "line_total": 0
    }
  ],
  "confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}

Zwei Dinge darin erledigen die meiste Arbeit. line_items ist ein Array und kein Textblock, was einen Zwei- und Drei-Wege-Abgleich erst möglich macht. confidence wird pro Feld angegeben, wodurch Sie automatisch entscheiden können, ob ein Mensch sich das ansehen muss.

Wie man eine Dokumenten-Extraktions-API auswählt, ohne der Demo zu vertrauen

Checklist for evaluating a document extraction API on your own documents
Document Extraction API Checklist

Jeder Anbieter überzeugt in seiner eigenen Demo, weil jeder Anbieter die Dokumente darin selbst ausgewählt hat. Die einzige Bewertung, die für Ihre Produktion aussagekräftig ist, ist diejenige, die Sie mit Ihren eigenen Dokumenten durchführen.

1. Erstellen Sie das Test-Set, bevor Sie mit jemandem sprechen

Ziehen Sie 200 bis 500 echte Dokumente aus den letzten drei Monaten heran, und gewichten Sie sie so, wie Ihr Posteingang tatsächlich aussieht:

  • ~70% Ihre gängigen Lieferantenformate
  • ~20% seltene Lieferanten (Long-Tail), die Sie einmal im Quartal sehen
  • ~10% die Dokumente, die alles kaputt machen: schlechte Scans, handschriftliche Notizen, mehrseitige Tabellen, Gutschriften, Fremdwährungen, zwei Bestellungen auf einer Rechnung

Lassen Sie exakt dieses Set von jedem Kandidaten verarbeiten. Lassen Sie niemals einen Anbieter die Stichprobe auswählen.

2. Bewerten Sie Felder, nicht Dokumente

Die Genauigkeit auf Dokumentenebene verbirgt die Fehler, die Sie Geld kosten. Bewerten Sie jedes Feld separat und gewichten Sie es danach, wie sehr ein Fehler schmerzt:

Feld Warum es wichtig ist
Rechnungsnummer, Lieferanten-ID Duplikaterkennung und Abgleich scheitern ohne sie
Gesamtbetrag, Steuern, Währung Fehler hier bedeuten falsche Zahlungen
Bestellnummer (PO) Der Anker für den Zwei- und Drei-Wege-Abgleich
Positionsmenge und Einzelpreis Hier scheitern die meisten Engines tatsächlich
Daten (Dates) Günstig zu beheben, teuer zu übersehen

3. Die wichtigste Kennzahl ist die Dunkelverarbeitung (Straight-Through Processing)

Zählen Sie die Dokumente, die von der Ankunft bis zur Verbuchung durchlaufen, ohne dass jemand sie anfasst. Bei 5.000 Dokumenten im Monat bedeutet der Unterschied zwischen 90 % und 96 % Dunkelverarbeitung 300 Dokumente, die jemand händisch öffnen muss. Das ist keine Kennzahl, das ist eine Stellenbeschreibung.

4. Bei den Positionen scheitert es meistens

Kopfzeilenfelder sind einfach. Jede Engine auf der Shortlist wird die Rechnungsnummer finden. Werfen Sie der Engine mehrseitige Tabellen, wiederkehrende Kopfzeilen, umbrochene Beschreibungen, Fracht- und Rabattzeilen, Steuern pro Position, negative Gutschriften und gemischte Einheiten vor, bevor Sie auch nur einer einzigen Zahl glauben.

5. Fragen Sie, wer die Ausnahmen bereinigt

Dateigrößenlimits, asynchrone Verarbeitung, Webhook-Wiederholungsversuche, Idempotenz, Ratenlimits, SDK-Abdeckung und was passiert, wenn ein Feld eine geringe Konfidenz aufweist. Und dann fragen Sie, wer die Ausnahmen überprüft. Wenn die Antwort lautet: "Ihre Ingenieure, in einem Tool, das Sie selbst bauen", dann ist der Preis auf dem Datenblatt nicht der tatsächliche Preis. Die Zahlen von Parseur für diese Liste finden Sie in der API-Dokumentation, und die Antwort auf die letzte Frage lautet: in der Web-App, nicht in Ihrem Sprint.

Was eine Dokumenten-Extraktions-API wirklich kostet

Preismodelle unterscheiden sich stärker, als das Marketing suggeriert, und die Struktur ist wichtiger als der pure Preis.

  • Pro Seite: am günstigsten bei kurzen Dokumenten, strafend bei langen. Ein 40-seitiger Vertrag kostet das 40-fache eines einseitigen Belegs für ein und dieselbe Reihe von Feldern.
  • Pro Dokument: vorhersehbar pro Datei, aber Premiumfunktionen wie benutzerdefinierte Modelle, Handschrift oder abfragebasierte Extraktion werden oft obendrauf berechnet.
  • Abonnement nach Volumen: ein pauschaler monatlicher Tarif für ein Dokumentenkontingent, unabhängig von der Seitenzahl.

Parseur verwendet das dritte Modell. Ein langes PDF und eine kurze E-Mail kosten dasselbe, was die Rechnung planbar hält, wenn Ihr Dokumenten-Mix es nicht ist. Aktuelle Tarife finden Sie auf der Preisseite.

Die Kosten, die niemand nennt, sind die Engineering-Aufwände rund um die API: Post-Processing-Logik, ein Review-Interface, Retry-Handling, Monitoring auf Extraktions-Abweichungen (Drift). Diese Rechnung ist normalerweise höher als die API-Rechnung selbst, und genau diesen Teil soll die Parseur-Web-App eliminieren.

Schritt-für-Schritt: Ein PDF in JSON mit der Parseur API parsen

Five steps from PDF upload to parsed JSON on your webhook
Parsing PDFs Using Parseur API

Der gesamte Weg der PDF-Extraktions-API, vom Upload bis zum Webhook, in fünf Schritten.

Basis-URL: https://api.parseur.com/

1. Authentifizieren

Sie finden Ihren API-Schlüssel im API-Bereich Ihres Parseur-Kontos. Senden Sie ihn bei jeder Anfrage im Authorization-Header:

Authorization: <YOUR_API_KEY>

Alle Details finden Sie im Authentifizierungs-Guide.

2. Mailbox finden oder erstellen

Eine Mailbox ist der Container, der Ihre Dokumente und die zu extrahierenden Felder enthält. Erstellen Sie eine in der App, und rufen Sie dann die Liste Ihrer Mailboxen ab, um die ID zu erhalten:

curl -X GET "https://api.parseur.com/parser" \
  -H "Authorization: <YOUR_API_KEY>" \
  --compressed

Die Mailbox-ID erscheint auch in der Mailbox-URL in der App und im id-Feld der Antwort bei der Mailbox-Erstellung.

3. Dokument hochladen

cURL:

curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
  -H "Authorization: <YOUR_API_KEY>" \
  -F "file=@./invoice.pdf" \
  --compressed

Python:

import requests

url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<YOUR_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}

response = requests.post(url, headers=headers, files=files)
print(response.json())

Node.js:

import fetch from "node-fetch"
import fs from "fs"

const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<YOUR_API_KEY>" }

const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))

const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())

Dokumente können auch per E-Mail-Weiterleitung statt per Upload eingehen. Siehe E-Mails und Dokumente hochladen für beide Wege.

4. Extrahierte Daten abrufen

Konfigurieren Sie einen Webhook in der Mailbox, und das geparste JSON landet auf Ihrem Endpunkt, sobald die Verarbeitung abgeschlossen ist. In der Produktion ist dies der richtige Standard: kein Polling, kein Cron, keine verlorenen Dokumente zwischen den Abfragen.

Alternativen, wenn ein Webhook keine Option ist:

  • Automatisierungsplattformen: Zapier, Make, n8n oder Power Automate.
  • Polling: GET /document/{id} für das geparste JSON.
  • Exporte: CSV-, JSON- oder Excel-Downloads direkt aus der Mailbox.

5. Validieren und optimieren

Das Parseur-Dashboard zeigt Dokumenten- und Webhook-Logs an, sodass Sie genau sehen können, was extrahiert und was geliefert wurde. Wenn ein Feld falsch zurückkommt, beheben Sie es dort, anstatt in Ihrer Codebasis darum herumzuprogrammieren.

Was Parseur extrahiert und was es noch nicht kann

Parseur ist eine Dokumenten-Extraktions-API, die um eine Idee herum aufgebaut ist: Das Dokument sollte nicht vorbereitet werden müssen, bevor die Software es lesen kann. Es hat seit 2016 mehr als 100 Millionen Dokumente verarbeitet.

  • Schlüssel-Wert-Paare und Formulare: Namen, Adressen, Summen, Rechnungsnummern und Referenz-IDs in beschrifteten Feldern.
  • Tabellen und Positionen: Rechnungszeilen, Kontoauszugstransaktionen, Versandmanifeste, einschließlich Tabellen, die sich über mehrere Seiten erstrecken. KI-Tabellenextraktion behandelt, wie das funktioniert.
  • Scans und Fotos: Die Vision AI-Engine liest gescannte und fotografierte Dokumente direkt, nicht nur digitale PDFs.
  • E-Mails und Anhänge: Eine Parseur-Spezialität. Die E-Mail selbst ist ein Dokument, ebenso wie alles, was daran angehängt ist.
  • Layout-Elemente: Überschriften, Absätze und Auswahlmarkierungen, wo Sie sie benötigen.

Wo es noch immer schwierig ist: dichte Handschrift und Unterschriften. Diese sind in der gesamten Kategorie ungelöst, und jeder Anbieter, der etwas anderes behauptet, sollte nach dem Benchmark gefragt werden.

Die meiste Dokumenten-Extraktions-Software endet an der API und überlässt den Rest Ihnen. Parseur liefert beide Hälften: die API für Ihre Seite und eine Web-App, in der das Operations-Team Felder definiert, Dokumente überprüft und Ergebnisse korrigiert, ohne ein Ticket zu eröffnen oder auf einen Sprint zu warten.

Typische Anwendungsfälle für Parseur

  • Kreditorenbuchhaltung - Rechnungen, Belege und Bestellungen als strukturiertes JSON und dann direkt ins ERP.
  • Finanz-Prozesse - Kontoauszüge und Transaktionsberichte als CSV oder JSON für den Abgleich.
  • Betrieb und Logistik - Lieferscheine, Frachtbriefe und Versandpapiere.
  • E-Mail-Automatisierung - Empfang der Nachricht und ihrer Anhänge, Extraktion und Auslieferung per Webhook.

Sicherheit, DSGVO und EU-Datenresidenz

Parseur ist EU-gehostet: Kundendaten werden in der Europäischen Union verarbeitet und gespeichert, und das Hosting-Rechenzentrum ist ISO 27001 zertifiziert. Das ist eine Verpflichtung zur Datenresidenz, was etwas anderes und Stärkeres ist als ein einfaches DSGVO-Compliance-Siegel.

Parseur ist mit der EU-DSGVO, der UK-DSGVO, der kalifornischen CCPA/CPRA und der PDPA aus Singapur abgestimmt. Kundendokumente werden niemals wiederverwendet, um die KI-Modelle von Parseur zu trainieren, und werden niemals verkauft. Die Aufbewahrung ist konfigurierbar, sodass Dokumente automatisch nach einem von Ihnen festgelegten Zeitfenster gelöscht werden können. SOC 2 Type II- und HIPAA-Compliance-Programme sind in Arbeit, was bedeutet, dass keines von beiden heute zertifiziert ist.

Wenn Residenz eine harte Anforderung ist, akzeptieren Sie niemals ein "EU-gehostet", ohne zu fragen, wo vier spezifische Dinge passieren: Inferenz, temporärer Cache, Backups und Logs, die Dokumenteninhalte enthalten. Eine EU-Datenbank, die vor einem US-Inferenzendpunkt sitzt, ist keine EU-Residenz, aber ein häufiges Muster. Unsere 12 Fragen, die eine Behauptung "kein Training" testen, führen dieselbe Übung für das Modelltraining durch.

Dokumenten-Extraktions-APIs und LLMs: Übergeben Sie niemals das rohe PDF

Sprachmodelle sind außergewöhnlich gut im logischen Denken und unzuverlässig beim Lesen eines PDFs. Wenn Sie eines auf eine gescannte Rechnung richten, wird es mit perfekter Gelassenheit eine Summe zurückgeben, die gar nicht auf der Seite steht. Eine Dokumenten-Extraktions-API liefert die Basis (Ground Truth). Das Modell arbeitet dann darauf aufbauend.

Die Arbeitsteilung, die funktioniert: Die API extrahiert Rechnungsnummer, Daten, Summen und Positionen mit Konfidenzwerten, dann übernimmt das Modell die Dinge, in denen Modelle gut sind: Es wandelt "01/03/25" in 2025-03-01 um, markiert den Dokumententyp oder mappt Felder in Ihre interne Taxonomie. Die Schema-Validierung sitzt unter beiden und fängt ab, was keiner von beiden allein bemerkt.

Ein KI-Agent benötigt dieselbe Disziplin. Er ist nur so gut wie die Daten, die ihm übergeben werden, und eine halluzinierte Position wird zu einer echten Bestellung mit einer echten Zahlung dahinter. Für das größere Bild ist der komplette Leitfaden zu Data Extraction APIs der Anker, unter dem diese Seite steht.

Gehen Sie nun und testen Sie die Anbieter

Die beste Dokumenten-Extraktions-API ist nicht diejenige mit der längsten Feature-Liste, sondern diejenige, die die unschönsten 10 % Ihrer Dokumente übersteht, ohne dass ein Mensch eingreifen muss. Erstellen Sie das Test-Set, bewerten Sie die Felder, die Geld kosten, wenn sie falsch sind, und zählen Sie, wie viele Dokumente am anderen Ende unberührt herauskommen. Testen Sie das gerne auch gegen uns, in welcher Reihenfolge auch immer Sie möchten.

Alles andere ist nur ein Datenblatt.

[call_to_action:de]

Zuletzt aktualisiert am

Jetzt starten

Bereit, Ihre Datenextraktion
aus Dokumenten zu automatisieren?

Kostenlos in wenigen Minuten starten und sehen, wie Parseur in Ihren Workflow passt.

Kein Modelltraining nötig
Automatisiert die Dateneingabe aus jedem Dokument
Von der Web-App bis zur API. Wächst mit Ihnen.

Häufig gestellte Fragen

Die Fragen, die Ingenieure tatsächlich zwischen dem ersten API-Aufruf und der Einführung in die Produktion stellen.

Eine typische Pipeline hat fünf Phasen: Aufnahme (Ingestion), KI-OCR und Layout-Analyse, das Parsen von Schlüssel-Wert-Paaren und Tabellen, Nachbearbeitung zur Normalisierung und Validierung sowie die strukturierte Auslieferung per Webhook oder Export. Moderne APIs führen alle fünf Schritte automatisch aus, ohne dass zuvor eine Vorlage (Template) erstellt werden muss.

Eine vorlagenbasierte Extraktion gleicht Felder anhand ihrer Position ab, was so lange funktioniert, bis ein Lieferant den Gesamtbetrag zwei Zentimeter nach links verschiebt. Eine KI-gesteuerte Extraktion liest das Dokument so, wie es ein Mensch tun würde, und identifiziert den Gesamtbetrag anhand seiner Umgebung und nicht anhand seiner genauen Position. Der praktische Unterschied zeigt sich im Long-Tail: Vorlagen erfordern eine Einrichtung pro Layout, während die KI-Extraktion Layouts verarbeitet, die sie noch nie zuvor gesehen hat.

Stellen Sie 200 bis 500 Ihrer echten Dokumente zusammen und gewichten Sie sie so, wie Ihr Posteingang tatsächlich aussieht: etwa 70 % gängige Formate, 20 % seltene Lieferanten (Long-Tail) und 10 % wirklich unschöne Randfälle. Führen Sie dasselbe Set durch jeden Kandidaten und bewerten Sie Feld für Feld, nicht Dokument für Dokument. Lassen Sie niemals einen Anbieter die Stichprobe auswählen.

Bauen Sie ihn selbst, wenn Ihre Dokumente wenige, stabil und maschinengeneriert sind. Kaufen Sie ihn in dem Moment, in dem die Layouts variieren, denn die Kosten entstehen nie beim Parser selbst, sondern bei der Wartung. Jedes neue Lieferantenformat wird zu einem Ticket, und der Ingenieur, der es geschrieben hat, wird zur einzigen Person, die es reparieren kann.

Der erste erfolgreiche API-Aufruf ist an einem Nachmittag erledigt. Die Produktion umfasst alles drumherum: das Feldschema, den Ausnahme-Pfad bei geringer Konfidenz und die Person, die sich um den Webhook kümmert, wenn er um 2 Uhr nachts fehlschlägt. Vorlagenbasierte Tools fügen dem noch eine Einrichtung pro Layout hinzu, was ein zweiwöchiges Projekt in ein halbjähriges verwandelt. Bitten Sie jeden Anbieter um einen Zeitplan, der den Überprüfungsschritt einschließt, und nicht nur die erste 200er-Antwort.

Ja. Asynchrone Verarbeitung, Webhooks, Wiederholungsversuche und Batch-Operationen machen die Verarbeitung von Tausenden von Dokumenten am Tag zur Routine. Der Engpass bei der Skalierung ist selten der Durchsatz, sondern die Fehlerrate, und das ist eher eine Personalfrage als eine Infrastrukturfrage.

Die Extraktions-API liefert die strukturierte Basis (Ground Truth), und das LLM zieht daraus Schlüsse. Einem Sprachmodell ein rohes PDF zu füttern, provoziert Layout-Verwirrung und erfundene Werte. Extrahieren Sie zuerst die strukturierten Felder, lassen Sie das Modell diese dann normalisieren, klassifizieren oder anreichern, und schon hat ein Agent etwas Zuverlässiges, auf dem er aufbauen kann.

Fragen Sie danach, und fragen Sie besonders nach den Ausnahmen. Parseur verwendet niemals Kundendaten wieder, um seine Modelle zu trainieren, und verkauft sie niemals. Viele Richtlinien versprechen zwar kein Training, behalten sich aber das Recht vor, mit anonymisierten oder aggregierten Versionen derselben Dokumente zu trainieren – lassen Sie diese Ausnahme also benennen und im Vertrag ausschließen.

OCR beantwortet die Frage "Welche Zeichen befinden sich auf dieser Seite?". Eine Dokumenten-Extraktions-API beantwortet "Welche Werte sind wichtig und wie hängen sie zusammen?". OCR liefert Ihnen eine Textwand ohne Struktur, sodass Sie immer noch die Logik schreiben müssen, die die Rechnungsnummer findet. Eine Extraktions-API liefert beschriftete Felder, Positions-Arrays und Tabellen, die Sie direkt in eine Datenbank schreiben können.

Gute APIs tun das, und das ist wichtiger als eine hohe Gesamtgenauigkeitsrate auf dem Papier. Ein Konfidenzwert auf Feldebene ermöglicht es Ihnen, die 90 %, die sicher sind, automatisch freizugeben und den Rest an einen Menschen weiterzuleiten. Ein Anbieter mit 92 % Genauigkeit und gut kalibrierter Konfidenz ist in der Produktion sicherer als einer, der 97 % verspricht, aber stillschweigend Fehler macht.

Hier scheitern die meisten, also testen Sie das zuerst. Für eine mehrseitige Tabelle muss die API eine wiederholte Kopfzeile erkennen, die Spaltenzuordnung über die Seitengrenze hinweg beibehalten und darf eine Zwischensumme nicht als weitere Position behandeln. Kopfzeilenfelder wie Rechnungsnummer und Gesamtbetrag sind im Vergleich dazu einfach; eine Anbieter-Demo, die nur diese zeigt, sagt Ihnen also nichts.

Es dominieren drei Modelle: pro Seite, pro Dokument und ein Pauschal-Abonnement nach Volumen. Eine Preisgestaltung pro Seite sieht am günstigsten aus, bis ein 40-seitiger Vertrag eintrifft, und Premiumfunktionen wie benutzerdefinierte Modelle oder abfragebasierte Extraktion werden oft separat in Rechnung gestellt. Parseur berechnet ein Abonnement basierend auf dem Dokumentenvolumen, sodass ein langes PDF genauso viel kostet wie ein kurzes.

Jede API, die echtes Volumen verarbeitet, sollte dies tun. Große Dateien werden in eine Warteschlange gestellt und asynchron verarbeitet, und das Ergebnis wird an Ihren Endpunkt gepusht, anstatt es abzufragen (Polling). Fragen Sie gezielt nach dem Verhalten bei Wiederholungsversuchen und Idempotenz, denn ein Webhook, der einmal feuert und dann aufgibt, wird im Stillen Dokumente verlieren.

Die Kreditorenbuchhaltung führt vom Volumen her und deckt Rechnungen, Quittungen und Bestellungen ab. Finanzoperationen folgen mit Kontoauszügen und Transaktionsberichten, dann Logistik mit Lieferscheinen und Frachtbriefen, und schließlich jeder Workflow, bei dem das Dokument als E-Mail-Anhang ankommt und in einem System landen muss.

Einige können das, und es lohnt sich, dies von einer allgemeinen DSGVO-Behauptung zu trennen. Parseur wird in der EU gehostet: Daten werden in der Europäischen Union verarbeitet und gespeichert, und das Hosting-Rechenzentrum ist ISO 27001 zertifiziert. Verlangen Sie von jedem Anbieter das Gleiche schriftlich und schließen Sie Inferenz, Cache, Backups und Logs mit ein, denn eine EU-Datenbank vor einem US-Inferenzendpunkt bedeutet keine EU-Datenresidenz.

Ein JSON-Schema ist der Vertrag zwischen der Extraktions-API und allen nachgelagerten Systemen. Es validiert Typen, fängt ein Datum ab, das als String ankam, und verhindert, dass ein fehlerhafter Payload Ihr ERP erreicht. Definieren Sie das benötigte Schema, bevor Sie mit Anbietern sprechen, und bitten Sie dann jeden, genau dieses zurückzugeben.