AIが成果に変わらないのは、業務が「人間が全部確認する前提」のままだからだ
生成AIを使う企業は増えた。しかし、成果を出している企業はまだ少ない。差を生むのはモデルの性能ではなく、AIを前提に業務を組み替えたかどうかだ。本稿では、AIの経済性を左右する「人のレビュー率」に注目し、業務を再設計する具体的な方法を示す。
この記事の要点
- PwCの調査対象の87%が生成AIを活用・推進している。一方、期待を大きく上回る効果を得た企業は9%にとどまる
- AIの総コストを決めるのは推論の料金ではない。人が確認する割合と、誤りが生むコストである
- この2つを下げるには、判断の単位まで業務を分解し、例外だけを人に回す設計が要る
活用率87%、期待超えの効果は9%
PwC Japanが2026年2月に実施した調査(売上高500億円以上の企業に勤める課長職以上932名)では、回答者の87%が所属企業で生成AIを活用・推進していると答えた。米国(90%)や英国(89%)とほぼ同じ水準だ。ところが「期待を大きく上回る効果」を得た企業は、日本が9%、米国が38%、英国が32%だった(出典)。
使っている割合は変わらない。差がついているのは、使い方だ。
私たちは、AX(AI Transformation:業務・組織・システム・意思決定をAI前提で再設計し、成果と自走までつなげる変革)を支援している。その現場で繰り返し見るのは、次の状態だ。AIは業務の一工程に「部品」として差し込まれ、その前後は、人がすべてを確認する前提のまま残っている。
電化の教訓:動力を替えても、工場を変えなければ生産性は上がらない
20世紀初頭、工場は蒸気機関を電動機に置き換えた。だが多くの工場は、中央の動力源からシャフトとベルトで各機械に力を配る配置をそのまま残した。生産性が大きく伸びたのは、機械ごとにモーターを置き、工程の流れに合わせて工場を設計し直してからだ。経済史家ポール・デイヴィッドが「ダイナモとコンピュータ」で示した構図である。
生成AIも同じ局面にある。動力は入れ替わった。しかし業務の「配置」は、まだ人間を中心に組まれている。
AIの経済性を決めるのは、推論コストではない
AIの費用対効果は、API料金やライセンス費で議論されることが多い。だが業務1件あたりの総コストは、おおむね次の式で表せる。
C = c_inf + r × c_rev + e × c_errc_infは1件の推論コスト、rは人が確認する割合、c_revは1件の確認にかかる人件費、eは確認を経ても残る誤りの割合、c_errは誤り1件が生む損失だ。
多くの業務では、推論コストは人の確認コストより桁で小さい。つまり総コストを決めるのは、rとeである。ここから、導入が成果に変わらない理由が説明できる。
- 全件を人が確認する業務(r = 1)のままだと、AIの精度が上がっても総コストはほとんど下がらない
- rを下げようとすると、eとc_errが問題になる。誤りが取り消せない業務では、確認を減らせない
- だから、「どの案件を人が見るか」を設計し、誤りの影響を小さくする業務の組み替えが必要になる
モデルの精度向上は、eを下げる手段の一つにすぎない。rを下げるのは業務設計だ。
業務をAI前提に組み替える3つの設計
1. 判断の単位まで分解し、自動化の境界を引く
業務を「入力→判断→出力→例外」の単位まで分解する。そのうえで、判断ごとに3つを問う。正解は定義できるか。正解データはあるか。誤ったときに取り消せるか。私たちはこの進め方をAI Agent First BPRと呼んでいる。
| 判断の性質 | 例 | 設計 |
| 正解が明確で、取り消せる | 帳票からの項目転記 | AIが処理し、人は抜き取りで確認する |
| 正解はあるが、揺れや例外が多い | 問い合わせの一次回答、書類の照合 | AIが処理し、確信度の低いものだけ人に回す |
| 正解が文脈に依存し、取り消せない | 与信、契約の判断 | AIは材料と論点をそろえ、人が決める |
2. 例外処理を業務の主役にする
rを下げるには、人の仕事を「全件の確認」から「例外の判断」へ移す。AIの確信度、業務ルールとの照合、金額などの閾値で件を振り分け、人には判断が必要なものだけを回す。
このとき大事なのは、人が下した判断をデータとして回収することだ。修正内容とその理由がたまれば、評価データにも改善の材料にもなる。運用するほどrが下がる構造を、最初から組み込む。
3. 評価を業務の数字につなぐ
正答率や検索精度は、途中の数字だ。ここだけを追うと、「精度は上がったが、業務にどう効くかは分からない」で止まる。自己解決率、処理時間、手戻り率など、業務側の指標までつなげて初めて、投資の判断ができる。
そのためPoCの主成果物は、動くデモではなく評価の仕組みに置く。実際の業務データから、正解と根拠が付いた評価セット(たとえば150〜300問)を作る。方式やモデルだけを差し替えて、同じ基準で点数を出す。これがあれば、どの案で本番に進むかを、感覚ではなく数字で決められる。
最後は、組織の話になる
業務を組み替えると、必ず組織の問いに行き当たる。AIが処理した件の責任は誰が持つのか。全件確認をやめた担当者を、何で評価するのか。評価データやナレッジは、誰が更新するのか。
これらは情報システム部門だけでは決められない。人事と経営を巻き込んで、責任体制と評価制度を変えて初めて、現場はrを下げることを受け入れられる。
経営層が確認すべき5つの問い
- AI施策ごとに、追うべき業務KPIと、人が確認する割合の目標が決まっているか
- PoCを始める前に、評価セットと合格基準を用意したか
- AIに任せる判断と、人が最終責任を持つ判断を、文書で分けたか
- 人の判断をデータとして回収し、改善に戻す仕組みがあるか
- 支援が終わった後も、自社で改善を続ける担当者がいるか
Acrosstudioの考え方
私たちは、導入だけをしない。設計し直す。効果検証だけで終わらせない。成果を出すところまでやりきる。そして、自社で回せる状態を残す。
そのために、コンサルタント・AIエンジニア・PMが同じチームで顧客の現場に入るFDE(Forward Deployed Engineering:顧客組織に入り込み、課題発見から実装・運用改善までを分断せずに進める協働方式)の形をとる。業務の設計と実装を同じチームが担うから、rとeを同時に下げる設計ができる。