試作品が動くことと、業務で使えることは違う
数件の質問に自然な文章で答えられても、業務で必要な根拠、権限、再現性、確認時間を満たすとは限りません。PoCではモデルの印象ではなく、実際の利用場面と失敗時の影響を評価します。
経済産業省のAI事業者ガイドラインは、AIの便益とリスクを理解し、関係者、データ、運用を含むガバナンスを継続的に見直す考え方を示しています。
要因1:解決したい業務課題が曖昧
「生成AIを使う」ではなく、規程を探す時間を減らす、回答案の初稿を作る、確認漏れを防ぐなど、対象者と変えたい行動を定義します。
利用頻度が低い、既存検索で十分、確認負担が増える場合は、生成AIを使わない選択肢も比較します。
要因2:成功条件と中止条件がない
正答率だけでなく、根拠提示、重大な欠落、権限外回答、修正時間、利用者が回答を採用できる割合を確認します。測定方法と合格ラインは試作前に決めます。
重大な誤り、機密情報の不適切な利用、確認負担が許容範囲を超える場合など、縮小・停止条件も合意します。
要因3:評価データが実務を代表していない
簡単な質問だけでなく、曖昧、複数条件、情報なし、古い情報、権限外、誤記を含む質問を用意します。期待回答と根拠文書を人が確認します。
モデルや検索設定を変更したときに同じ評価セットを再利用すると、改善と劣化を比較できます。
| 種類 | 目的 | 確認結果 |
|---|---|---|
| 頻出質問 | 日常業務の有用性 | 回答・根拠・確認時間 |
| 複数条件 | 重要条件の欠落確認 | 条件ごとの網羅性 |
| 情報なし | 不明時の挙動 | 断定せず保留できるか |
| 権限外 | アクセス制御 | 回答を拒否できるか |
| 古い・矛盾 | 版管理 | 有効な情報を選べるか |
要因4:参照情報の品質と更新責任が不明
重複文書、旧版、所有者不明の資料を検索対象にすると、回答の前提が崩れます。正本、責任者、更新日、有効期限、アクセス権を整理します。
生成AI導入が止まる原因が、実際には文書管理や業務ルールの問題であることもあります。PoCの成果として情報整理を残します。
要因5:機密区分と利用権限が未整理
入力可能な情報、検索対象、会話履歴、ログ、保存期間、外部送信、学習利用の設定を確認します。利用者の権限を検索前に適用できるかが重要です。
管理者なら閲覧できるという理由だけで、全利用者へ同じ検索結果を返さないようにします。
要因6:人の確認範囲と責任が曖昧
回答案を誰が、何を見て、いつまでに確認するかを業務フローへ組み込みます。参照元、必須条件、禁止表現、対外送信前の承認をチェック項目にします。
AIが作った文章を人が全面的に再調査するなら、削減効果が出ない場合があります。確認時間も評価対象にします。
要因7:本番後の運用責任と停止手順がない
文書更新、評価データ追加、利用者教育、問い合わせ、障害、モデル変更、費用監視の責任者を決めます。誤回答の報告を改善へつなげる流れを用意します。
PoCの最終成果物はデモだけではありません。継続・修正・中止の判断、残課題、運用責任、次回評価日を記録します。