主なポイント
- ユーティリティ請求書OCRとは、光学式文字認識(OCR)とAIを組み合わせて、電気、ガス、水道、通信などの請求書から構造化データを自動で抽出する技術であり、生のテキストではなく名前付きのフィールドを返します。
- 重要なフィールドは、一般的なインボイス(請求書)にあるフィールドではありません。メーター番号、メーター検針値、単位付きの消費量、kW単位の需要、料金プラン、供給料金と配送料金の内訳などこそが、ユーティリティ請求書OCRと一般的なインボイスOCRを分ける要素です。
- 対象サービスごとに扱いが異なります。電気には需要と時間帯別料金があり、ガスにはサーモやCCF、発熱量があり、水道にはメーター検針値と下水道料金があり、通信には回線の繰り返しのテーブルがあります。
- 手作業での入力には1件あたり8~12分の時間と1~3ドルのコストがかかり、エラー率は1~5%です。月に数千枚の請求書がある場合、誰もやりたがらないフルタイムの仕事になります。
- テンプレート不要のAI抽出は、初期設定なしで新しいプロバイダや変更されたレイアウトに対応できるため、ポートフォリオ規模の処理における最大の問題を解決します。
ユーティリティ請求書OCRとは?
ユーティリティ請求書OCRとは、電気、ガス、水道、通信などの請求書から構造化データを自動で抽出する仕組みのことです。光学式文字認識(OCR)とAIを組み合わせることで、単なるテキストの羅列ではなく、名前が付けられたデータフィールドとして返します。一般的なOCRはページを読み取ってテキストを返すだけですが、AI OCRはページを読み取ってフィールドを返します。どの会計システムも単なるテキストの塊は求めていないため、この点が非常に重要です。
請求書はPDF、スキャン画像、メールの添付ファイルとして届きますが、情報がどこに記載されているかはプロバイダによって異なります。あるプロバイダはメーターの数値をサイドバーに印刷し、別のプロバイダは3ページ目の表の中に埋め込んでいます。また、別のプロバイダは供給料金と配送料金を2ページに分けて記載し、それを親切だと思っています。人間なら一瞬でこれらすべてを理解できますが、テンプレート方式では機能しなくなります。
月に1枚の請求書なら問題にはなりません。しかし、400の拠点がある場合、それは人間が途中に挟まれたデータパイプラインになってしまいます。
ユーティリティ請求書から抽出できるフィールド(項目)とは?
すべて抽出可能です。より重要な質問は「どのフィールドを要求すべきか」です。なぜなら、ユーティリティ請求書を特徴づけるフィールドは、一般的なインボイスには決して現れないからです。
| グループ | 抽出フィールド |
|---|---|
| アカウント・サービス情報 | 口座番号、顧客または名義人名、サービス住所、請求先住所、プロバイダ名、メーター番号またはデバイスID |
| 請求期間 | 請求日、支払期日、サービス期間(開始および終了)、インボイスまたは明細番号、前回残高、今回請求額 |
| 使用量・料金明細 | 今回および前回のメーター検針値、検針日、単位付き消費量(kWh、サーモ、CCF、ガロン、MMBtu)、kW単位の需要、単価、料金プラン、供給料金と配送料金の内訳、各行の明細説明、税金・手数料・追加料金、クレジットおよび調整額 |
| 支払情報 | 請求総額、支払方法、遅延損害金、参照番号 |
3行目のグループにこそ、コスト削減のヒントが隠されています。口座番号と請求総額は、経理部門にいくら支払うべきかを伝えます。しかし、メーター検針値、消費量、需要、料金プランは、運営部門に対して、その請求がそもそも正しいのか、どの拠点で異常が起きているのか、そしてESGレポートに何と記載されることになるのかを教えてくれます。一般的なインボイスツールは上2つのグループだけを読み取って終了しますが、ユーティリティ請求書パーサーはさらに先まで読み取ります。

電気、ガス、水道、通信はそれぞれ異なる課題を持つ
これら4つをすべて同じように扱ってしまうと、ユーティリティ請求書解析プロジェクトは中途半端な結果に終わることがよくあります。共通するフィールドは同じですが、重要なフィールドはそれぞれ異なります。
電気。 kWh単位の消費量に加え、エネルギーそのものよりも高額になることが多いkW単位の最大需要値(ピークデマンド)。時間帯別料金プランでは、使用量をピーク、オフピーク、ショルダー(中間)の時間帯に分割します。自由化された市場では、供給料金と配送料金が1枚の紙の上で異なる2つの会社から請求されますが、交渉可能なのはそのうちの1つだけです。
ガス。 地域によってサーモ、CCF、またはMMBtuなどの単位で表される容量。エネルギー単位で報告する必要がある場合、通常は請求書のどこかに印刷されている換算係数が必要になります。季節による変動が大きいため、前年同期比のみが意味のある比較となります。
水道。 ここではメーター検針値が重要な役割を果たします。下水道料金は実際の測定ではなく、水量から計算されることが多く、灌漑(農業用水など)は別途メーターが設置されることもあります。急激な増加は水漏れを意味し、地面を掘って水漏れを見つけるよりも、データから見つける方がはるかに簡単です。
通信。 実際には1つの請求書ではありません。回線、番号、または回線ごとのプラン料金、使用量、超過料金、税金が記載されたテーブルです。これらを単一の合計金額に平坦化してしまうと、2024年以降誰も使っていない12台の電話機を見つけるための唯一のデータを捨ててしまうことになります。
ユーティリティ請求書のデータ入力にかかる実際のコスト
このコストは明細項目として現れることがないため、見過ごされがちです。調査によるコストの実態は以下の通りです。
- 1通あたりの時間: Resolveによると、複雑さにもよりますが、手作業による入力には8〜12分かかります。その周辺の請求書ワークフロー全体を含めると、さらに長くなります。
- 1通あたりのコスト: ERP Software Blogによると、単純なデータ入力の人件費だけで1〜3ドルかかります。承認、照合、例外処理が加わると、コストはさらに上昇します。
- エラー率: Fluxygenによると、構造化された入力項目では一般的に1〜5%であり、複雑な複数フィールドのドキュメントではさらに高くなります。請求データの数パーセントが密かに間違っていることになり、手作業のプロセスではそれを見つける仕組みがありません。
- 自動化による変化: Rampの報告によると、請求書および請求ワークフロー全体において、手作業の手法と比較して最大で約80%の時間短縮が見込まれます。
- 期待できる精度: Gartnerの報告によると、ドキュメントの品質と人間による検証が適用されるかどうかにより、ドキュメント解析の抽出精度は90〜99%になります。
これらの数字を月間3,000枚の請求書に当てはめると、すぐに恐ろしい計算結果になります。入力作業に400〜600時間かかることになり、これは2人の従業員が別の仕事に使えるはずの時間です。また、月に30〜150枚の請求書にエラーが含まれ、四半期の締めくくりで表面化するか、あるいは全く気付かれないままになります。
ユーティリティ請求書が一般的なインボイスよりも処理が難しい理由

ユーティリティ請求書とサプライヤーからの一般的なインボイスを分ける要素は4つあります。まず、各プロバイダが独自の請求書をデザインし、その後もデザインを変更するため、4つのサービスタイプと数十のプロバイダを組み合わせると、誰かの都合で頻繁に変更されるターゲットを追うことになります。また、これらの請求書の多くは、暗い場所で斜めから撮影された紙の写真として届きます。これは、非構造化データの中でも最も扱いづらく、テンプレート照合が機能しなくなる典型的な例です。
さらに、その数値が何に使われるかという問題もあります。ユーティリティ請求書は住所証明としてだけでなく、税金やESG報告の記録としても使用されるため、間違った数値はそのまま広まってしまいます。そして月に数千枚の請求書を処理する場合、2%のエラー率は単なる誤差ではなく、毎月発生するインシデントとなります。
テンプレート不要でユーティリティ請求書からデータを抽出する方法
Parseurは、大量のドキュメントデータ抽出のために構築されたテンプレート不要のAIパーサーです。請求書は専用のメールボックス、API、または監視対象のフォルダから届きます。Vision AIエンジンはPDF、スキャン画像、写真を読み取ります。Text AIエンジンはメールやテキスト形式の請求書を読み取ります。どちらも事前学習済みであるため、これまで処理したことのないプロバイダであっても設定は一切不要です。
必要なフィールドを一度リストアップするだけです。その後は、どのようなレイアウトで届いた請求書であっても、そのフィールドにマッピングされます。
- テンプレート不要。 デザインが変更されても壊れることはありません。そもそも壊れるようなレイアウト設定が存在しないからです。
- あらゆる対象サービス。 電気、ガス、水道、通信、その他ポートフォリオに含まれるあらゆるサービスに対応します。
- テーブルはテーブルのまま。 通信費の行レベルの料金は、平坦化された1つの合計金額ではなく、個別に割り当て可能な行として出力されます。
1日に数千枚の請求書を処理し、受信と同時にパース(解析)します。GDPRにも準拠しており、取り込むすべてのドキュメントに誰かの名前、自宅の住所、口座番号が含まれていることを考慮すると、これは決して小さな詳細ではありません。
しかし、これらの説明だけではテストになりません。本当のテストは、あなた自身が受け取っているメールです。フォルダの中で最も状態の悪い請求書、たとえば3月にレイアウトを変更したプロバイダからのしわくちゃのスキャン画像を最初に入力してみてください。候補に挙げているどのツールも、きれいなPDFであれば完璧なデモを見せてくれるはずです。
AIモデルのトレーニングは必要ですか?
いいえ。トレーニングセットも、ラベル付けされたサンプル請求書のフォルダも、メーターの検針値がどのようなものかをソフトウェアに教えるための週末の作業も必要ありません。
Parseurは事前学習済みのAIドキュメント抽出エンジンであり、100番目のプロバイダを追加する手間は1番目のプロバイダを追加する手間と同じ、つまり「何もしなくてよい」ということです。
メールボックスを作成し、そこに請求書を送信するだけで、AIエンジンが到着と同時に非構造化ドキュメントを構造化データに変換します。
抽出したデータフィールドの出力先
必要な場所にどこへでも出力できます。分析用のExcelやGoogle Sheets、支払い用の会計・ERPシステム、レポート作成用のエネルギー・ESGプラットフォーム、そしてZapier、Make、n8n、または通常のWebhookを通じたあらゆるシステムに連携可能です。各請求書は解析された瞬間に配信されるため、月次のエクスポートを待つ必要はありません。
ワークフローの全体像については、AIによるユーティリティ請求書からのデータ抽出のユースケース、またはポートフォリオ全体でどのように機能するかを解説したユーティリティ請求書抽出ソリューションのページをご覧ください。
あなたの現在の請求書ボリュームは、すでに何らかのコストを発生させています。唯一の疑問は、それがどこかに数字として表れているかどうかです。
ご自身の処理件数をコストシミュレーターに入力してみてください
最終更新日




