要点まとめ:
- ドキュメント抽出APIは、PDF、スキャン、またはメールからラベル付きのフィールド、テーブル、明細行を提供します。OCRは文字を提供するだけで、意味付けはあなたに委ねられます。
- テンプレートベースとAI駆動の抽出は異なる製品です。サプライヤーが合計金額の位置を移動するとテンプレートは壊れますが、AI抽出は見たことのないレイアウトも読み取ります。
- 自身のドキュメントに対するフィールドレベルの精度でベンダーを判断してください。データシートの数字は彼らのドキュメントで測定されたものです。
- Parseurは開発者向けAPIと、運用チームが実行できるWebアプリを提供するため、誰もレビューツールを構築する必要がありません。
- ParseurはEUホスト型であり、データは欧州連合内で処理および保存され、AIモデルのトレーニングに使用されることはありません。
ドキュメント抽出APIは、PDFやスキャン画像、メールなどのファイルをJSONやCSVなどの構造化データへ変換するサービスです。プレーンテキストのみを返し、意味付けはユーザーに委ねる生のOCRとは異なり、ドキュメント抽出APIは構造を識別して保持します:キーバリューペア、テーブル、明細行、ラベル付きフィールドです。
3つの類似ツールがよく混同されます。パブリックデータAPIは、誰かがすでに組み立てたデータセットを渡します。WebスクレイピングAPIは、Webページ上にあるものを取得しに行きます。OCRエンジンは、文字だけで構造はありません。ドキュメント抽出APIは、受信トレイにすでにある_あなたの_ドキュメントを対象とし、システムが処理できるデータに変換します。一部のベンダーは、同じものをドキュメント理解APIという名前で販売したり、ドキュメント抽出SDKとして提供したりしています。ラベルは違っても、役割は同じです。まだ自分がどの問題を抱えているか見極めている段階ですか?ドキュメントのパースとWebスクレイピングを比較しています。
Research and Marketsによると、ドキュメント抽出APIを含むインテリジェントドキュメントプロセッシング市場は、約30億1千万ドルと評価され、年平均成長率(CAGR)31.7%で成長すると予測されています。 この数字は実際には請求書、明細書、フォームの数であり、そのすべてを「何か」が読み取る必要があります。多くの企業において、その「何か」は依然として、セカンドモニターとテンキーを持つ人間なのです。
クイック例:
- PDFの請求書 → ヘッダーフィールドと明細行配列を含むJSON
- オンボーディングフォーム → ラベル付きのキーバリューペア(氏名、住所、署名)
- 銀行明細 → CSVにエクスポートされた取引テーブル
同じラベルを付けた5種類のベンダー
「ドキュメント抽出API」を検索すると、カテゴリを共有しているだけで他にほとんど共通点のない十数社のベンダーが見つかります。彼らは5つの異なるジョブのために構築されているため、実際には競合していません。どのベンダーも独自のデモで勝利を収めるため、ピッチよりもどの列に属しているかの方が重要です。電話予約をする前に、自分がどの列にいるかを見極めてください。
| ベンダーの種類 | 例 | 対象者 | 自社で構築する必要があるもの |
|---|---|---|---|
| クラウドの構成要素 | Google Document AI, Azure Document Intelligence, AWS Textract | すでにそのクラウドを標準化しており、多くのサービスの一つとして抽出を行いたいチーム | 取り込み、レビュー画面、例外処理、リトライ、ERPへの投稿 |
| 買掛金(AP)自動化プラットフォーム | Rossum, Nanonets | フィールドだけでなく請求書ワークフロー全体を求めている財務チーム | 彼らのワークフローが自社のものと十分に近ければ、構築するものは少ない |
| 開発者ファーストのパースAPI | Mindee, Veryfi, Parseur | ワークフローを所有し、クリーンなJSONを求めているエンジニア | ベンダーによる。Parseurはレビューアプリを提供 |
| AIネイティブのドキュメントパーサー | LlamaParse, Reducto | ビジネスフィールドよりも忠実な構造を必要とするRAGやエージェントパイプライン | フィールドマッピング、検証、ワークフローの形をしたあらゆるもの |
| エンタープライズIDPスイート | ABBYY, Hyperscience, UiPath | 人間によるレビューとレガシーシステムを伴う、規制の厳しい大規模オペレーション | 構築するものは少ない。作業は設定と展開に移行する |
この表には2つの注意点があります。第一に、行の境界は曖昧です:いくつかのベンダーは2つの行にまたがっています。第二に、Parseurは3行目に位置しています。なぜなら、それがParseurの構築された目的であり、メールや業務ドキュメントを構造化されたJSONに変換し、運用チームが実際に実行できるアプリを提供するからです。もしあなたのドキュメントが設計図面であるなら、私たちよりも4行目のほうが適しています。私たちは、トライアル中ではなく今の段階でそれをお伝えしたいのです。
テンプレートベースとAI駆動の抽出(スケールするのはどちらか一方だけ)
テンプレートベースの抽出はページ上の位置によってフィールドを見つけます。AI駆動の抽出はその意味によって見つけます。 違いはそれだけであり、あなたがどれだけの作業を背負い込むかを決定します。
テンプレートはこう言います:請求書番号は上から40mm、左から120mmにあります。高速で、確定的で、素晴らしいです。これはサプライヤーが請求書を再設計する朝までは持ちこたえますが、その時点で間違った値を返すか、何も返さなくなり、誰かがチケットを起票することになります。200のサプライヤー、200のテンプレート、そしてそれらを理解しているエンジニアが1人。
AI駆動の抽出は、人が読むのと同じようにドキュメントを読み取ります。右下の「Amount due」という行の下にあり、通貨としてフォーマットされ、その上の合計と等しいため、合計金額を見つけ出します。移動させても、スタイルを変更しても、請求書全体をドイツ語に翻訳しても、依然として見つけることができます。
Parseurはテンプレートなしで2つのAIエンジンを実行します。メールやテキストドキュメント向けのText AIエンジンと、PDF、スキャン、画像向けのVision AIエンジンです。必要なフィールドを記述すれば、レイアウトごとではなくドキュメントごとに抽出が適応するため、セットアップは数週間のテンプレート構築ではなく、数分間のフィールド定義で済みます。
トレードオフは実在します。テンプレートが確定的であるのに対し、AI抽出は確率的です。これが信頼度スコアが存在する理由であり、以下の評価セクションが精度の主張よりも例外処理に多くの時間を費やしている理由です。
ドキュメント抽出APIの基本パイプライン(5つの段階)
ベンダーごとに詳細は異なりますが、ドキュメント抽出パイプラインの構造はどこも同じです。
なぜこれがオプションではなくなったのか:ボリュームのせいです。Dream Factoryは、世界のデータ量が2025年までに175ゼタバイトに達するという広く引用されている予測を挙げていますが、その年はすでに過ぎ去り、データベースの行ではなくドキュメントとして到着するデータの割合は縮小していません。手作業による入力はこれにスケールしません。テンプレートの壁も同様です。
ステップ1:取り込み
ベンダーが何と呼ぼうとも、これはドキュメント取り込みAPIです:HTTP経由のアップロード、メール転送、または別システムからのWebhook。メールは想像以上に重要です。ビジネス文書の大部分はファイルピッカーに触れることはなく、自社ポータルなど聞いたこともないサプライヤーから添付ファイルとして到着します。
ステップ2:AI OCRとレイアウト解析
AI OCRは画像やスキャンコンテンツを機械可読なテキストに変換します。その後、レイアウト解析によって読み取り順序、テキストブロック、行、単語、およびそれぞれのページ上の位置が算出されます。これが最新のエンジンと2010年のエンジンを分けるステップです。単なる文字だけでなく、構造マップを生成するのです。
ステップ3:パース処理
- キーバリューペア(KVP):"請求書番号: 12345" のように、ラベルを値に一致させる。
- テーブルと明細行:結合されたセル、スパン、改ページをまたいで続くテーブルを含め、行とセルを再構築する。
- 分類:どのフィールドを探すか決定する前に、そのドキュメントが何であるかを判断する。
ステップ4:後処理
日付、通貨、業者名は一貫したフォーマットに正規化されます。結果はJSONスキーマやPydanticモデルと照らし合わせて検証されるため、不正な形式のペイロードがERPに到達することはありません。
ステップ5:配信
APIは小規模なファイルに対しては同期的に結果を返し、大規模なファイルに対してはWebhookコールバックで非同期的に結果を返します。リトライと冪等性こそが、大量処理時における信頼性を保つものです。最初の静かな金曜日の夜を迎える後ではなく、契約する前に両方について尋ねてください。
JSONを見せてください
ベンダーのページは「構造化された出力」について語りますが、実際にそれを見せることはありません。ここでは、サプライヤーの請求書が返ってくるべき形式と、すべてのベンダーに一致させる価値のある形式を紹介します:
{
"document_type": "invoice",
"supplier": { "name": "", "tax_id": "", "supplier_id": "" },
"invoice": {
"invoice_number": "",
"invoice_date": "",
"due_date": "",
"currency": "",
"po_number": ""
},
"amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
"line_items": [
{
"description": "",
"sku": "",
"quantity": 0,
"unit_price": 0,
"line_total": 0
}
],
"confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}
ここにある2つの要素がほとんどの作業をこなします。line_itemsはテキストの塊ではなく配列であり、これによって2ウェイおよび3ウェイのマッチングが可能になります。confidenceはフィールドごとになっており、これによって人間が確認する必要があるかどうかを自動的に判断できます。
デモを信じずにドキュメント抽出APIを選ぶ方法

どのベンダーも独自のデモで勝利を収めます。なぜなら、どのベンダーもそこにあるドキュメントを自ら選んだからです。本番環境を予測できる唯一の評価は、あなた自身のドキュメントで実行する評価です。
1. 誰かと話す前にテストセットを構築する
過去3ヶ月の中から200〜500件の実際のドキュメントを抽出し、実際の受信トレイと同じ比率で重み付けします:
- 約70% 一般的なサプライヤーのフォーマット
- 約20% 四半期に一度目にするロングテールのサプライヤー
- 約10% 問題を起こすもの:画質の悪いスキャン、手書きのメモ、複数ページのテーブル、クレジット、外貨、1枚の請求書に2つの注文書
すべての候補にまったく同じセットを実行します。決してベンダーにサンプルを選ばせてはいけません。
2. ドキュメントではなく、フィールドをスコアリングする
ドキュメントレベルの精度は、金銭的損失をもたらす失敗を隠してしまいます。各フィールドを個別にスコアリングし、ミスによる被害の大きさに応じて重み付けします:
| フィールド | なぜ重要なのか |
|---|---|
| 請求書番号、サプライヤーID | これらがないと重複検出とマッチングが破綻する |
| 合計、税金、通貨 | ここでの間違いは間違った支払いを意味する |
| 注文書(PO)番号 | 2ウェイおよび3ウェイマッチングのためのフック |
| 明細行の数量と単価 | 多くのエンジンが実際に失敗する箇所 |
| 日付 | 修正は安価だが、見逃すと高くつく |
3. 追跡すべき数字はストレートスループロセッシング(自動処理)率
到着から投稿まで、誰も手を触れずに進むドキュメントの数を数えます。月に5,000件のドキュメントがある場合、90%と96%のストレートスルー率の差は、誰かが手動で開く300件のドキュメントになります。これは指標ではなく、職務記述書です。
4. 明細行こそが壊れる場所
ヘッダーフィールドは簡単です。候補リストにあるどのエンジンも請求書番号を見つけるでしょう。数字を一つでも信じる前に、複数ページのテーブル、繰り返されるヘッダー、折り返された説明、運賃や割引の行、行ごとの税金、マイナスのクレジット、混在する単位を投げかけてみてください。
5. 誰が例外処理のクリーンアップをするか尋ねる
ファイルサイズ制限、非同期処理、Webhookのリトライ、冪等性、レート制限、SDKのカバレッジ、そして信頼度の低いフィールドがどうなるか。次に、誰がその例外をレビューするのか尋ねてください。もし答えが「あなたのエンジニアが、あなたが構築したツールで」であれば、データシートの価格は本当の価格ではありません。このリストに対するParseur自身の数字はAPIドキュメントにあり、最後の質問に対する答えはあなたのスプリントではなく、Webアプリです。
ドキュメント抽出APIの本当のコスト
価格設定の形態はマーケティングが示唆する以上に異なっており、料金そのものよりもその形態が重要です。
- ページ単位: 短いドキュメントでは最も安いですが、長いドキュメントでは負担になります。40ページの契約書は、まったく同じ1セットのフィールドに対して、1ページの領収書の40倍のコストがかかります。
- ドキュメント単位: ファイルごとの予測は可能ですが、カスタムモデル、手書き文字、クエリベースの抽出などのプレミアム機能は別途請求されることがよくあります。
- ボリュームに応じたサブスクリプション: ページ数に関係なく、ドキュメント許容量に対する定額の月額料金。
Parseurは3つ目を使用しています。長いPDFも短いメールも同じコストであるため、ドキュメントの構成が一定でない場合でも請求額を予測可能に保ちます。現在の階層は料金ページにあります。
誰も見積もらないコストは、API周辺のエンジニアリングです:後処理ロジック、レビューインターフェース、リトライ処理、抽出のズレを監視すること。その請求額は通常APIの請求額よりも大きく、これこそがParseurのWebアプリが排除するために存在している部分です。
Parseur APIでPDFをJSONに変換する手順

アップロードからWebhookまでのPDF抽出APIのパス全体を5つのステップで紹介します。
ベースURL: https://api.parseur.com/
1. 認証
ParseurアカウントのAPIセクションでAPIキーを見つけ、すべてのリクエストのAuthorizationヘッダーで送信します:
Authorization: <YOUR_API_KEY>
詳細は認証ガイドをご覧ください。
2. メールボックスの作成または取得
メールボックスは、ドキュメントと抽出したいフィールドを保持するコンテナです。アプリ内で作成し、メールボックスを一覧表示してIDを取得します:
curl -X GET "https://api.parseur.com/parser" \
-H "Authorization: <YOUR_API_KEY>" \
--compressed
メールボックスIDは、アプリ内のメールボックスURL、およびcreate-mailboxレスポンスのidフィールドにも表示されます。
3. Upload a document
cURL:
curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
-H "Authorization: <YOUR_API_KEY>" \
-F "file=@./invoice.pdf" \
--compressed
Python:
import requests
url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<YOUR_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}
response = requests.post(url, headers=headers, files=files)
print(response.json())
Node.js:
import fetch from "node-fetch"
import fs from "fs"
const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<YOUR_API_KEY>" }
const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))
const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())
ドキュメントはアップロードではなく、メール転送で届くこともあります。両方のルートについてはメールとドキュメントのアップロードを参照してください。
4. 抽出データの受け取り
メールボックスにWebhookを設定すれば、処理が完了した瞬間に解析されたJSONがエンドポイントに届きます。本番環境ではこれが正しいデフォルト設定です:ポーリングなし、cronなし、チェックの間にドキュメントが失われることもありません。
Webhookが利用できない場合の代替手段:
- オートメーションプラットフォーム: Zapier、Make、n8n、Power Automateなど。
- ポーリング: 解析済みJSONを取得するための
GET /document/{id}。 - エクスポート: メールボックスからCSV、JSON、またはExcelのダウンロード。
5. 検証と最適化
ParseurダッシュボードにはドキュメントとWebhookのログが表示されるため、何が抽出され、何が配信されたかを正確に確認できます。フィールドが間違って返ってきた場合は、コードベースでパッチを当てるのではなく、そこで修正してください。
Parseurで抽出できるもの、まだできないもの
Parseurは、「ソフトウェアが読み取る前にドキュメントを準備する必要はない」という1つのアイデアを中心に構築されたドキュメント抽出APIです。2016年以来、1億件以上のドキュメントを処理してきました。
- キーバリューペア(KVP)とフォーム:氏名、住所、合計、請求書番号、参照IDをラベル付きフィールドへ抽出。
- テーブルと明細行:請求書の明細、銀行明細の取引、船荷目録など、複数ページにまたがるテーブルを含みます。AIテーブル抽出でその仕組みを解説しています。
- スキャンと写真:Vision AIエンジンは、デジタルPDFだけでなく、スキャンや撮影されたドキュメントを直接読み取ります。
- メールと添付ファイル:Parseurの専門分野です。メール自体がドキュメントであり、添付されているすべてのものも同様です。
- レイアウト要素:必要な場所にある見出し、段落、選択マーク。
依然として難しい領域:密集した手書き文字や署名。これらはカテゴリ全体で未解決であり、そうでないと主張するベンダーにはベンチマークを求めるべきです。
ほとんどのドキュメント抽出ソフトウェアはAPIで止まり、残りはあなたに任せます。Parseurは両方の半分を提供します:あなたの側のためのAPIと、運用チームがチケットを起票したりスプリントを待つことなく、フィールドを定義し、ドキュメントをレビューし、結果を修正できるWebアプリです。
主なユースケース
- 経理・支払業務(買掛金) - 請求書、領収書、注文書を構造化JSONにし、直接ERPへ。
- 金融業務 - 銀行明細や取引レポートを照合用のCSVまたはJSONへ。
- 業務・物流オペレーション - 梱包明細書、船荷証券、納品書。
- メール自動化 - メッセージとその添付ファイルを取り込み、抽出し、Webhookで配信。
セキュリティ、GDPR、EUデータレジデンシー
ParseurはEUホスト型です:顧客データは欧州連合内で処理および保存され、ホスティングデータセンターはISO 27001認証を受けています。 これはデータレジデンシーのコミットメントであり、GDPR準拠のバッジとは異なる、より強力なものです。
Parseurは、EU GDPR、英国GDPR、カリフォルニア州CCPA/CPRA、およびシンガポールPDPAに準拠しています。顧客のドキュメントがParseurのAIモデルのトレーニングに再利用されることはなく、販売されることも決してありません。保持期間は設定可能であるため、設定した期間でドキュメントを自動的に削除できます。SOC 2 Type IIおよびHIPAAコンプライアンスプログラムは進行中であり、現時点ではどちらも認証されていません。
もしレジデンシー(データ保存地)が絶対条件であるなら、推論、一時キャッシュ、バックアップ、そしてドキュメントのコンテンツを含むログという4つの特定の事柄がどこで行われるかを尋ねずに、「EUホスト型」という言葉を決して受け入れないでください。米国の推論エンドポイントの前にあるEUのデータベースはEUレジデンシーではなく、よくある形です。私たちの「トレーニングなし」の主張をテストする12の質問では、モデルトレーニングについて同じ検証を行っています。
ドキュメント抽出APIとLLM連携:生のPDFを決して渡さない
言語モデルは推論においては並外れていますが、PDFを読み取ることにおいては信頼できません。スキャンした請求書に向けさせれば、ページにはない合計金額を、完璧に落ち着き払って返してきます。ドキュメント抽出APIはグラウンドトゥルース(正解データ)を生成します。モデルはその上で機能するのです。
うまくいく分業とは:APIが請求書番号、日付、合計、明細行を信頼度スコア付きで抽出し、その後、モデルが得意なことを行います。"01/03/25"を2025-03-01に変換したり、ドキュメントタイプをタグ付けしたり、内部の分類体系にフィールドをマッピングしたりします。スキーマの検証は両方の下に位置し、単独ではどちらも気付かないものを捉えます。
AIエージェントにも同じ規律が必要です。渡されたデータが良くなければ機能せず、ハルシネーション(幻覚)による明細行は、実際の支払いを伴う本物の発注書になってしまいます。より広い視点については、このページが属する柱であるデータ抽出APIの完全ガイドをご覧ください。
さあ、ベンダーを打ち負かしに行こう
最高のドキュメント抽出APIとは、最も長い機能リストを持つものではなく、あなたの最も厄介な10%のドキュメントを、人間を介在させることなく生き残るものです。テストセットを構築し、間違えるとコストがかかるフィールドをスコアリングし、反対側から手付かずで出てくるドキュメントの数を数えてください。好きな順序で構いませんので、私たちに対しても実行してみてください。
それ以外はすべてデータシートに過ぎません。
最終更新日




