AI活用2026.10.01·7 min read·Nortiq Labs

AIチャットボットの誤回答|責任分担と運用体制

AIチャットボットの誤回答は誰の責任になる?

誤回答の責任を一律に定めた公的基準はありません。契約での合意が分かれ目になります。

「AIが間違えたらベンダの責任」と考えて発注すると、後で困ります。公的なガイドラインは、責任の持ち主を決めてくれません。決めているのは別のことです。

公的なガイドラインが決めていること

総務省と経済産業省は共同で「AI事業者ガイドライン」を作成しています。AIの開発・提供・利用に必要な基本原則を示すものです。

このガイドラインは、事業者が自主的に取り組むための参考という位置づけです。法令のような拘束力は持ちません。従来の3つのガイドラインを統合・改訂したもので、第1.0版は令和6年に公表されました。出典: 総務省「AI事業者ガイドライン案に関する意見募集の結果及びガイドラインの公表」。

契約面では、経済産業省が2018年6月15日に「AI・データの利用に関する契約ガイドライン」を公表しています。民間事業者が契約を結ぶときの参考資料です。「データ編」と「AI編」に分かれています。

AI編は、大企業から中小企業までを契約当事者として想定しています。AIソフトウェアの開発契約とAI技術の利用契約を解説しています。出典: 経済産業省「AI・データの利用に関する契約ガイドライン」。

決めていないこと

これらの資料を読んでも、「誤回答が出たら誰が責任を負うか」は出てきません。一律に定めた公的な基準は確認できていません。

確認できるのは、次の3つの枠組みまでです。

  1. 性能保証を契約でどう定めるか
  2. 段階を分けて合意するという進め方
  3. 品質をどの軸で評価するか

つまり、責任の線は御社とベンダが引くことになります。引かなければ、誤回答が出た後に揉めます。

当社がAIチャットボットを構築する側として見ても、ここを曖昧にしたまま公開する案件は後で止まります。「誰が気づき、誰が直すか」を決めていないと、誤回答は放置されます。

次のセクションでは、なぜ性能を保証できないのかを整理します。ここを理解すると、契約に書くべきことが変わります。

なぜ性能を保証できないのか?

統計的な機械学習を使う以上、原理的に性能の保証が難しい場面があるとされています。これはベンダの怠慢ではなく、技術の性質です。

ここを理解しないまま「100%正しく答えること」を求めると、契約が成立しません。あるいは、形だけの保証条項が入って実態と合わなくなります。

未知の入力で起きること

機械学習は、学習したデータの分布をもとに答えを出します。母集団から離れた外れ値のような入力が来たとき、予想外の動きをすることは性質として当然とされています。

出典: 経済産業省の契約ガイドラインの策定に関わった実務家による解説。業界では常識とされる一方、一般には理解されていない点として挙げられています。

AIチャットボットで言えば、次のような入力が未知のデータに当たります。

  1. 想定していない言い回しや略語での質問
  2. 2つ以上の質問が1文に混ざった問い合わせ
  3. 自社に存在しないサービス名を前提にした質問
  4. 公開後に追加された制度や料金に関する質問

4番目は、時間が経つほど増えます。学習や参照元を更新しなければ、古い情報を自信をもって答え続けます。

技術的な性質と契約のリスク分配は別

保証が難しいことと、契約で何も決められないことは別の話です。技術的な性質と契約上のリスク分配は別の問題であり、当事者間の合意によって性能保証を定めることは可能という整理が示されています。出典: 同解説。

したがって、契約の作り方は2段構えになります。

決めること 内容の例
どこまでを保証に含めるか 想定質問の一覧に対する正答率、対象外の入力の扱い
保証できない部分をどう扱うか 誤回答が出た場合の修正の責任と期限、免責の範囲

「保証する、しない」の二択ではありません。保証の範囲を狭く定め、その外側を運用で拾う形にします。

当社がAIチャットボットを構築する場合も、想定質問の一覧を作り、その範囲での動作を確認する形を取ります。一覧の外側は、運用で見つけて直す対象として扱います。契約に落とす項目は次のセクションで整理します。

契約で決めておく項目は?

誤回答の定義、直すまでの時間、直す責任の持ち主、再発時の扱いの4点を契約に落とします。この4点が決まっていれば、公開後の揉め事はほぼ防げます。

逆に、よくある「誠実に対応する」という一文だけでは何も決まっていません。誰がいつまでに何をするかが書かれていないためです。

段階を分けて合意する

経済産業省の契約ガイドラインAI編は、段階を分けて合意する進め方を示しています。学習済みモデルの内容と性能が契約の時点では確定しないためです。

示されているのは、アセスメント段階、PoC段階 (概念実証)、開発段階の3段階です。出典: 同ガイドラインの実務解説。契約を1本にまとめず、段階ごとに合意する形になります。

この考え方は、公開後の運用にも使えます。段階ごとに決める項目を整理します。

段階 決めること
公開前 想定質問の一覧と、その範囲での動作確認の基準
公開直後 人が回答を確認する期間と頻度
定常運用 誤回答を直す責任の持ち主と、着手までの時間
変更時 制度や料金の改定を誰がいつ反映するか

PoCと本開発の契約の分け方そのものは、当社の「AI開発の外注、PoCと本開発を分ける契約の決め方」で解説しています。

品質をどの軸で見るか

品質の評価軸として参照できるのが、QA4AIコンソーシアムの「AIプロダクト品質保証ガイドライン」です。5つの軸を示しています。

  1. Data Integrity (データがきちんとしているか)
  2. Model Robustness (精度が高く頑健性が確保されたモデルか)
  3. System Quality (システム全体として品質が確保できているか)
  4. Process Agility (開発プロセスが機動的か)
  5. Customer Expectation (顧客の期待)

初版は2019年6月で、その後改訂が重ねられています。出典: QA4AIガイドラインの解説記事。産業技術総合研究所の「機械学習品質マネジメントガイドライン」も同種の参照先として挙げられています。

誤回答の文脈で効くのは、5番目のCustomer Expectationです。顧客の期待が高いまま公開すると、同じ誤回答でも苦情の重さが変わります。回答の冒頭にAIが答えていると明示するかどうかも、この軸の話になります。

契約に落とすときは、1番から4番を開発側の責任範囲、5番を発注側が決める表示と告知の責任として分けると整理しやすくなります。

誤回答を見つける運用体制はどう作る?

人が目を通す場所を1か所に決め、そこを必ず通す形にします。全件確認は続きません。

最初の1週間は全件を見られます。1か月後には誰も見ていません。これは担当者の怠慢ではなく、全件確認という設計が続かないだけです。

どこに人を挟むか

当社はAIによる記事生成パイプラインを自社運用していますが、自動公開は実装していません。公開の引き金は、人が実際に記事を読んで承認することだけです。生成物はすべて承認待ちで止まります。

加えてフェイルセーフを置いています。公開予定時刻から72時間を超えて承認されなかった記事は、自動で保留に戻します。出典: 当社パイプラインの運用設定 (公開予定時刻起点)。担当者が不在のときに新規公開がゼロになるのが正しい挙動、という考え方です。

品質判定も単一のAIに委ねていません。2系統で判定し、食い違った場合は自動棄却も自動通過もさせません。不一致フラグを付けて人の判断に上げます。出典: 当社パイプラインの実装。

AIチャットボットに置き換えると、次の形になります。

  1. 想定質問の一覧の外側に当たる入力を機械で検出し、人の確認待ちに回す (所要時間の目安: 設計で半日、実装で1日から2日)
  2. 回答に自信度の低い印が付いたものを、翌営業日までに1人が確認する (つまずきやすい点: 確認する人を複数にすると誰も見なくなります)
  3. 判定が分かれる質問は自動で返さず、問い合わせフォームへ誘導する

実装者視点で言うと、ハマりやすいのは2番です。確認の担当を「気づいた人」にすると機能しません。曜日と人を固定してください。

記録を残して再発を見る

誤回答を直しても、記録が残っていなければ再発に気づけません。残すのは質問文、返した回答、参照した元の情報、直した内容の4点です。

当社のパイプラインでも、設定変更は影響度で3階層に分け、重い変更ほど人の承認を必須にしています。出典: 当社パイプラインの実装。チャットボットの回答元の差し替えも、同じ考え方で扱えます。

無人化で難しいのは、自動化する部分の実装ではありません。人がどこで必ず介在するかを決め、その介在が抜けたときにシステムが安全側に倒れるようにすることです。

誤回答が出たときの対応手順は?

止める、記録する、原因を切り分ける、直す、再発を確認するの順で進めます。順番を飛ばすと、同じ誤回答が戻ってきます。

まず決めておくのは「止める基準」です。基準が無いと、止める判断そのものに時間がかかります。

公開を止める判断

全ての誤回答で止める必要はありません。止める基準を先に決めてください。

  1. 料金、契約条件、法令に関する誤回答が出た場合は、該当する質問への応答を止める (所要時間の目安: 設定で30分以内)
  2. 言い回しのぶれや、情報が古いだけの場合は、止めずに修正の順番待ちに入れる
  3. 同じ誤回答が3件以上続いた場合は、原因が参照元にあるとみなして止める

つまずきやすい点は1番です。チャットボット全体を止める作りしかないと、軽い誤回答でも全停止になります。質問の種類ごとに応答を切れるかどうかを、発注時に確認してください。

原因の切り分け

直す前に、どこで間違えたのかを分けます。切り分けの順番は次のとおりです。

確認する場所 判断
参照元の情報 元の情報自体が古い、または誤っている
検索と抽出 正しい情報があるのに、別の箇所を引いている
回答の生成 正しい情報を引いているのに、表現で誤りが生じている
想定質問の範囲 一覧の外側の質問で、答えるべきでなかった

参照元が原因なら、直すのは御社の情報です。検索と抽出が原因なら、直すのは実装側です。この切り分けができていないと、責任の話が前に進みません。

実装者視点で言うと、1番目を疑う前に実装を疑う案件が多いです。公開から半年が経ったチャットボットの誤回答は、参照元が古いことが原因である場合が目立ちます。料金改定や制度改正の反映が止まっているケースです。

直した後は、同じ質問文で再現しないことを確認します。あわせて、言い回しを変えた質問でも再現しないかを見てください。1つの表現だけ直しても、別の言い方で同じ誤回答が出ることがあります。

発注前に確認すること と 当社の支援範囲

運用を誰が担うかを決めずに発注すると、誤回答が放置されます。公開は始まりで、終わりではありません。

ここまでの内容を、発注前の確認項目としてまとめます。

発注前のチェック項目

  1. 想定質問の一覧を、御社とベンダのどちらが作るのか (つまずきやすい点: 「ベンダが作る」としたまま進むと、業務の実態と合わない一覧になります)
  2. 質問の種類ごとに応答を止められる作りになっているか
  3. 回答の履歴と参照元を、後から追える形で残せるか
  4. 参照元の情報を更新する担当と頻度を決めてあるか
  5. 誤回答を直すまでの時間を、契約に書いてあるか
  6. 制度や料金の改定を反映する作業が、保守の範囲に入っているか

6番は見積もりに影響します。保守に含まれていない場合、改定のたびに追加費用が発生します。

4番は御社側の作業です。参照元が古くなる速さは業種によって違います。料金や制度が動く事業なら、月に1回の見直しを前提にしてください。

当社が支援できる範囲

当社のAIチャットボット導入では、業種別に応答を最適化し、24時間の一次対応を実現します。出典: 当社のAIチャットボット構築の知見。

構築は100,000円からの料金体系です。業務システムの開発は500,000円から、Webサイトの制作は300,000円からとなっています。

当社がお請けするときは、想定質問の一覧を御社と一緒に作ります。問い合わせの履歴がある場合は、そこから実際に来ている質問を抜き出します。想像で作った一覧は、公開後に外れるためです。

誤回答の扱いについても、公開前に文書で決めます。止める基準、直すまでの時間、参照元の更新担当を書き出し、保守の範囲に入れるかどうかを分けます。ここを曖昧にしたまま納品する形は取りません。

どこまで自社で運用できるかを含めて相談したい場合は、無料診断からお問い合わせください。

よくある質問

AIチャットボットの誤回答と責任分担について、相談でよく出る質問をまとめます。

誤回答で顧客に損害が出た場合、ベンダに賠償を求められますか?

契約の定め方によります。誤回答の責任を一律に定めた公的な基準は確認できていません。賠償の範囲は、契約の責任条項と免責条項で決まります。公開前に、損害の範囲と上限を書面で確認してください。

契約書に精度の数値を書いてもらうことはできますか?

書くこと自体は可能です。技術的な性質と契約上のリスク分配は別の問題であり、当事者間の合意によって性能保証を定めることは可能という整理が示されています。出典: 経済産業省の契約ガイドラインの策定に関わった実務家による解説。

ただし、対象を限定しない数値は実務で機能しません。想定質問の一覧に対する正答率のように、測れる形にしてください。

誤回答を見つけるために全件を確認する必要がありますか?

必要ありません。全件確認は続かないため、確認する場所を絞ります。自信度の低い回答と、想定質問の一覧の外側に当たる入力に限って人が見る形が現実的です。

回答の履歴はどのくらい保存しておくべきですか?

本記事で参照した公的資料に、保存期間を定めた記述はありません。実務では、制度や料金の改定の周期に合わせて決める形になります。改定の反映漏れを後から追えるだけの期間を残してください。

AI事業者ガイドラインに従わないと罰則がありますか?

罰則の定めはありません。総務省と経済産業省が作成したこのガイドラインは、事業者が自主的に取り組むための参考という位置づけで、法令のような拘束力は持ちません。出典: 総務省「AI事業者ガイドライン案に関する意見募集の結果及びガイドラインの公表」。

ただし、拘束力が無いことと、何もしなくてよいことは別です。誤回答で顧客との関係が壊れる損失は、罰則の有無とは関係なく発生します。

公開後にAIが答えていると表示する必要はありますか?

表示の義務を定めた公的な基準は、本記事で参照した資料では確認できていません。一方で、QA4AIの品質軸にはCustomer Expectation (顧客の期待) が含まれます。AIが答えていると明示すると、同じ誤回答でも受け取られ方が変わります。出典: QA4AIガイドラインの解説記事。

関連リンク

監修: 株式会社ノーティックラボ 代表(AIエンジニア)
本記事はAIを活用して制作しています

こうした観点をベースに、
貴社の DX を一緒に考えませんか。

ホームページ無料診断

営業日 24時間以内に担当者よりご返信します。

初回相談無料 · 営業日24h以内にご返信