帳票AIを業務で使える水準にする「人に回す設計」:商社・製造・会計の3事例
この記事の要点
- AIの出力を確信度などの連続値で返し、閾値で自動処理と人の確認に振り分ける
- 「根拠の抽出」と「業務上の判定」を分けると、誤りの原因が特定でき、人も検証しやすくなる
- 税額計算やマスタの制約のように答えが決まる処理はAIに任せず、従来のプログラムで担う
AI OCRが行き詰まる業務には、共通点がある
AI OCRは、決まった位置に決まった項目がある書類には強い。行き詰まるのは、次のような業務だ。
- 取引先や拠点ごとにフォーマットが違い、テンプレートを定義しきれない
- 必要な情報が、表や図面の中にある
- 文字を読むだけでは足りず、意味の照合が要る。たとえば「試験項目として記載されている」と「その性能を有している」は、似た表現でも意味が違う
こうした業務では、画像と文章をあわせて理解できるVLM(Vision Language Model)が有力な選択肢になる。ただし、業務を回すにはモデルの周りの設計が要る。3つの事例で効いたのも、その設計だった。
3つの事例は、業務も書類も違うが、この流れを共有している。

事例A|大手総合商社 経理部門:約700拠点の在庫証明書の突合
課題:国内約700拠点の倉庫から届く在庫証明書(PDF)と、社内の取引履歴(Excel)を四半期ごとに突合している。経理部門の15〜20名が、四半期末に約1〜2か月をかけていた。在庫証明書の形式は倉庫ごとに違い、従来のAI OCRでは対応できなかった。
判断と設計:テンプレートを定義せず、項目の意味を解釈して抽出するVLMの構成を採った。照合結果は「照合率」という連続値で返す。照合率が閾値以上なら自動で通し、未満のものだけを人が確認する。進め方にも工夫をした。受注前に実データで簡易的なマッチングを試し、精度の見通しを顧客と共有してから本格検討に入った。
現在の状態:技術検証を終え、本開発に向けた要件定義を進めている。削減効果は今後の本開発で確かめる段階にある。
事例B|大手製造業 品質・調達部門:納入仕様書のチェック自動化
課題:メーカーや部品ごとに形式の違う納入仕様書と図面を、38種類のチェックシートと照らし合わせている。表や図面、表現の揺れが多く、単純なOCRや固定ルールでは意味の照合ができない。
判断と設計:チェック項目ごとに、テキスト検索型のRAG、画像を直接読むVision、AIが自ら読む範囲を決めるAgentic Visionを切り替える構成にした。まず全ページを低解像度で見て関連ページを広く拾い、次に対象ページだけを高解像度で読み込む。判定は二段階に分けた。先に仕様書から根拠となる記載を抜き出し、その後でチェック条件と照合する。誤りは「読み取り」「対応づけ」「検索」「判定」のどこで起きたかに分類し、改善箇所を特定できるようにした。
担当者向けの画面には、AIの判定に加えて確信度、根拠の文、参照ページを表示する。担当者はそれを見て修正し、そのままExcelに出力できる。
結果:10組の実資料による技術検証で、正答率は約80%に達した。この結果と業務適合性の検証をもとに、顧客は本開発への移行を決めた。
事例C|税理士事務所:記帳代行を担う会計AIエージェントの製品化
課題:証憑から仕訳を起こす記帳代行にAIを使いたい。ただし、用途ごとのモデル選定、誤生成のリスク、監査への対応が整理されていなかった。会計ソフトの標準機能だけでは、顧客企業ごとの仕訳の癖にも対応できない。
判断と設計:処理を役割で分け、それぞれに合うモデルを割り当てた。証憑の読み取りと書類の分類、会計上の判断、類似取引の検索で、別々のモデルを使う。顧客ごとに過去の取引履歴をベクトル化し、似た取引で選ばれた勘定科目や税区分を参照させることで、その企業固有の仕訳傾向を反映させた。
構成は三層にした。非構造な証憑の読み取りはAI、税額計算やマスタの制約は従来のプログラム、最終判断は人が担う。AIにすべてを任せないことで、自動化率と会計品質を両立させた。
結果:主要79項目のシステムテストをすべて通過し、顧客の自社サービスとして製品化された。
3つの事例に共通する4つの設計原則
| 原則 | 内容 | 事例 |
| 判定を連続値で返す | 確信度や照合率を出し、閾値で自動処理と人の確認に振り分ける | A・B |
| 根拠と判定を分ける | 根拠となる記載を先に抜き出し、その後に業務条件と照合する。人も根拠を見て検証できる | B・C |
| 答えが決まる処理はAIに任せない | 計算、マスタ照合、形式チェックは従来のプログラムで担い、AIは非構造な部分に集中させる | C |
| 誤りを段階ごとに分類する | 読み取り・対応づけ・検索・判定のどこで誤ったかを記録し、改善の入口を決める | B・C |
正答率80%でも、本開発に進める理由
「80%では使えない」と感じる人は多いだろう。ここで見るべきは、業務全体のコストだ。全件を人が見直す運用なら、80%でも95%でもコストはほとんど変わらない。逆に、AIが確信を持てるものは自動で通し、迷ったものだけを人に回せば、人の作業は大きく減る。そのとき人は、根拠と参照ページを見ながら判断できる。さらに、人が修正した結果は評価データとして蓄積され、次の改善に使える。
帳票AIの価値を決めるのは、100%でなくても業務が回る設計を最初から組み込めるかどうかだ。