AI活用2026.09.30·9 min read·Nortiq Labs

AI開発の外注 精度の合格ラインの決め方

何から始めますか。合格ラインは業務の許容範囲から逆算します

最初に決めるのは、その業務で誤りが出たときに誰が何をするかです。ここから許容できる誤りの量が決まります。精度の合格ラインは、その逆算として置きます。

順序を逆にすると決められません。「正解率は何%あればよいか」から考え始めても、比べる基準がないためです。

先に決めるのは指標ではなく、誤ったときの後処理

AIの出力が誤ったとき、業務側では次のどれかが起きます。

  • 誤りに気づいた人が手で直します。
  • 誤りに気づかず、後工程で問題になります。
  • 誤りが顧客や取引先に届きます。

3つのうちどれが起きるかで、許せる誤りの量は大きく変わります。人が全件を目で確認する運用なら、誤りは手戻りの時間として現れます。確認せずに通す運用なら、誤りはそのまま外に出ます。

御社の運用がどれに当たるかを、要件の最初に書いてください。ここが決まっていない状態で外注すると、提案された数値が妥当かどうかを判断できません。

許容範囲から合格ラインへ落とす手順

次の順で進めます。紙の上だけで進められる作業です。

  1. 対象の業務で1か月に処理する件数を数えます(目安1時間)。件数が分からないと、割合を件数に換算できません。
  2. 誤りを人が直す場合、1件あたりの手戻り時間を出します(目安1時間)。つまずきやすい点は、担当者の感覚ではなく実測に近い値を使うことです。
  3. 1か月に許せる手戻り時間の上限を決めます(目安半日)。ここは経営側の判断になります。現場だけでは決まりません。
  4. 上限を件数に換算し、全件に対する割合を出します(目安30分)。これが許容できる誤り率です。
  5. 誤り率の裏返しとして、合格ラインの候補を置きます(目安30分)。

例として、月1,000件を処理し、1件の手戻りが10分かかるとします。許せる手戻りが月500分なら、誤りは50件までです。全件に対する割合は5%になります。合格ラインの候補は95%です。

この計算は御社の件数と時間で行ってください。ここに挙げた数字は計算の手順を示すための仮の値で、業界の水準ではありません。

ただし、この5%をどう分けるかがまだ残っています。50件の誤りが「見逃し」なのか「誤検知」なのかで、業務への影響は変わります。次のセクションで扱います。

精度の合格ラインを1つの数値で置いてよいのですか

1つの数値では足りません。正解率のような単一の指標は、見逃しと誤検知のどちらが起きているかを隠します。合格ラインは、少なくとも2つの指標で置いてください。

理由は単純です。同じ正解率95%でも、内訳は大きく変わります。100件の誤りのうち、見逃しが90件のときと、誤検知が90件のときでは、業務への影響が別物になります。

見逃しと誤検知のどちらを許すかを先に決める

2つの誤りは、次のように性質が違います。

誤りの種類 起きること 業務への影響
見逃し(本来拾うべきものを拾わない) 対象が処理されずに通過します 気づかないまま後工程や顧客へ流れます
誤検知(拾わなくてよいものを拾う) 人が確認して差し戻します 確認の手間が増えますが、外には出ません

多くの業務では、見逃しのほうが痛手になります。人が気づけないためです。この場合、合格ラインは見逃しの少なさを主に置き、誤検知は上限を別に定めます。

一方、確認の人手が足りない業務では判断が変わります。誤検知が多すぎると、確認そのものが回らなくなります。どちらを主に置くかは、御社の運用で決めてください。

要件書には、次の形で書きます。

  • 主に置く指標と、その合格ライン(例: 見逃しの割合を3%以下にする)
  • もう一方の指標の上限(例: 誤検知の割合は20%以下にとどめる)
  • 2つが両立しない場合、どちらを優先するか

3点目を書いておかないと、開発側は片方だけを追い込みます。片方を上げると他方が下がる関係にあるためです。

単一の指標で置いたときに起きること

正解率だけで合格ラインを置くと、対象が少ない業務で数値が機能しなくなります。全体の1%しか該当しないものを探す業務では、すべて「該当なし」と答えるだけで正解率99%になります。この場合、合格ラインを満たしても業務では何も拾えません。

品質を複数の観点で見る考え方は、公的な資料でも示されています。総務省と経済産業省は「AI事業者ガイドライン(第1.2版)」を令和8年3月31日付で公表しており、AIの開発と利用に関わる事業者が満たすべき観点を整理しています(出典: 総務省・経済産業省「AI事業者ガイドライン(第1.2版)」)。また、AIプロダクト品質保証コンソーシアム(QA4AI)は2018年4月1日に設立され、AIプロダクトの品質を複数の軸で評価するガイドラインを公開しています(出典: QA4AI公式サイト)。評価の軸の中身は次のセクションで扱います。

公的な基準で決まっている水準はありますか

正解率を何%とするといった水準を定めた公的な基準はありません。国内で参照できるのは、水準そのものではなく決め方の枠組みを示す資料です。用途によって外し方の重みが変わるため、一律の数値は置けないという整理になっています。

参照できる資料は主に3つです。

資料 示しているもの
経済産業省「AI・データの利用に関する契約ガイドライン (AI編)」 開発を段階に分けて進める契約の考え方
QA4AI「AIプロダクト品質保証ガイドライン」 品質を評価するときの軸
産業技術総合研究所「機械学習品質マネジメントガイドライン」 ライフサイクル全体の品質マネジメント

経済産業省の契約ガイドラインが示す段階の分け方

経済産業省は「AI・データの利用に関する契約ガイドライン」を策定しています。その (AI編) は、契約の時点で成果の内容や性能が確定しにくいというAI技術の特性を踏まえ、探索的段階型と呼ばれる開発方式を示しています。段階はアセスメント、PoC、開発、追加学習の4段階です(出典: 経済産業省「AI・データの利用に関する契約ガイドライン (AI編)」平成30年6月)。

発注側から見ると、最初の契約で最終的な精度を約束させない前提が置かれています。この段階の使い方は後述します。

QA4AIガイドラインの評価の軸

AIプロダクト品質保証コンソーシアム(QA4AI)は、2018年4月1日に設立された産学の団体です。同コンソーシアムのガイドラインは、AIプロダクトの品質保証を構築し評価する際の軸として5軸を挙げています(出典: QA4AI公式サイト)。

5軸は、データの整合性、モデルの頑健性、システムの品質、プロセスの機敏性、顧客の期待です。合格ラインをモデルの数値だけで置かず、学習データの整合性や運用時のシステムの品質、顧客が何を期待しているかと合わせて考える枠組みになっています。

最新版は2025.04版で、2025年4月10日に公開されました(出典: QA4AI公式サイト)。本体はPDFで無償公開されています。御社が読むべきは、5軸のうちどれを契約で確認するかを決める部分です。

産総研の機械学習品質マネジメントガイドライン

国立研究開発法人産業技術総合研究所は「機械学習品質マネジメントガイドライン」を公開しています。第4版は2023年12月12日付で公開されました(出典: 産業技術総合研究所 デジタルアーキテクチャ研究センター)。

機械学習を利用するシステムのライフサイクル全体にわたる品質マネジメントを体系的に扱い、品質要求を満たすための取組みと点検項目を整理しています。発注側にとっては、何を品質として並べるかの一覧として使えます。

3つの資料はいずれも水準を示しません。数値は御社の業務から決め、これらは決め方と観点の抜けを確認する道具として使ってください。

契約のどの時点で合格ラインを確定させますか

最初の契約では確定させません。手元のデータで達成できる水準が分かった段階で確定させます。具体的にはPoCの結果を見た時点です。

前のセクションで触れたとおり、経済産業省の契約ガイドライン (AI編) は開発をアセスメント、PoC、開発、追加学習の4段階に分ける探索的段階型を示しています(出典: 経済産業省「AI・データの利用に関する契約ガイドライン (AI編)」平成30年6月)。段階を分ける理由の1つが、精度を約束できる時点が後ろにあることです。

段階ごとに何を決め、何を先送りにするか

段階ごとの分担は次のようになります。

段階 合格ラインについて決めること
アセスメント 目標とする水準の候補を仮に置きます。約束はしません
PoC 手元のデータで到達できる水準を測ります。ここで合格ラインを確定させます
開発 確定した合格ラインを検収条件として扱います
追加学習 運用データで再学習したときの維持水準を別に決めます

先送りにしてよいのは水準の数値だけです。次の3つは最初の契約で決めてください。

  1. どの指標で測るかです(見逃しの割合、誤検知の割合など)。指標が動くと、後から比較ができません。
  2. 誰が評価データを用意するかです。発注側が用意する場合、件数と収集期間も決めます。
  3. PoCの結果が目標に届かなかった場合に、次へ進むかどうかをどう判断するかです。

3点目を決めていないと、届かなかったときに交渉ごとになります。「届かなければ開発へ進まない」と書いておけば、判断は自動で済みます。

確定した合格ラインを契約書へ書くときの書き方

数値だけを書いても検証できません。次の4点を揃えて書きます。

  • 指標の名称と定義(何を分母に、何を分子にするか)
  • 合格ラインの値
  • 測定に使うデータ(件数、期間、収集元)
  • 測定の手順と、測定を誰が行うか

つまずきやすいのは1点目です。同じ「精度」という言葉でも、定義が違えば値が変わります。定義を文章で書き、計算式も併記してください。

なお、AIプロダクト品質保証コンソーシアム(QA4AI)のガイドラインは、品質を5軸で評価する枠組みを示しています。最新版は2025.04版で、2025年4月10日に公開されました(出典: QA4AI公式サイト)。契約書に書くのは主に予測の精度ですが、データの整合性や運用時のシステムの品質は別の条項で押さえる形になります。産業技術総合研究所「機械学習品質マネジメントガイドライン」第4版(2023年12月12日公開)の点検項目は、この抜けを確認する材料として使えます(出典: 産業技術総合研究所 デジタルアーキテクチャ研究センター)。

合格ラインを満たしたのに使えない、という事態はなぜ起きますか

評価に使ったデータが本番のデータと違う場合に起きます。数値そのものは正しく測られていても、測った相手が違えば運用では再現しません。当社も、攻撃検出の分類器で同じ失敗をしています。

当社が過学習で数値を信用できなくなった事例

当社はVetoNetという、AIエージェント向けの攻撃検出の仕組みを自社開発しています。その分類器を訓練していたとき、学習パターンを増やすほど評価の数値が上がり続ける状態になりました。

しかし、学習パターンが4,000パターン前後になったあたりで過学習が観測されました(出典: 当社VetoNetの分類器訓練ログ)。手元の評価では良い数値が出るのに、少し言い換えただけの未知の攻撃文を通してしまう状態です。

起きていたのは次のことです。

  • 学習データと評価データに、同じ言い回しの派生が混ざっていました。
  • 分類器は攻撃の意図ではなく、特定の語の並びを覚えていました。
  • そのため、語を入れ替えた攻撃文には反応しませんでした。

この状態で「合格ラインを満たした」と判断していれば、運用では防げないものを防げると誤解したまま進んでいました。セキュリティ用途では、この誤解がそのまま事故になります。

御社のAI開発でも同じ形の失敗は起こります。過去データから学習し、過去データで評価すれば、数値は良く出ます。運用で入ってくるのは、それとは少し違うデータです。

評価データの条件を要件に書く

防ぐには、評価データの条件を発注側が指定します。要件に書くのは次の4点です。

  1. 学習に使わないデータで評価することです。分割の方法まで書いてください。似た事例が両方に入る形の分割では意味がありません。
  2. 評価データの収集期間を、学習データより後ろにすることです。時間の前後を混ぜると、実際より良い数値が出ます。
  3. 運用で想定される変化を、評価データに含めることです。言い換え、表記ゆれ、新しい取引先、季節の違いなどが該当します。
  4. 評価データを開発側に全部渡さないことです。一部を発注側で保持し、検収時にそのデータで測ります。

4点目は嫌がられることがありますが、当社は発注側の立場として妥当だと考えています。開発側が評価データを見ながら調整すれば、そのデータに合わせた作り込みが起こります。当社が自社開発で踏んだのは、まさにその形の失敗です。

つまずきやすいのは3点目です。「想定される変化」を列挙する作業は、業務を知っている御社側しかできません。ここを開発側に任せると、想定が狭くなります。

検収の場で何を確認するかは、次のセクションで扱います。

検収のときに何を確認しますか

確認するのは数値そのものではなく、その数値がどのデータで、どの条件で測られたかです。再現の手順が渡されていなければ、数値は検証できません。

検収の場で「合格ラインを満たしました」という報告だけを受け取ると、後から確かめる手段が残りません。手元で測り直せる状態にしてから受け取ってください。

受け取る成果物のリスト

精度に関わる成果物として、次を受け取ります。

成果物 何のために必要か
評価結果の一覧(件数と内訳) 見逃しと誤検知の件数を分けて確認します
評価に使ったデータの説明書 件数、期間、収集元が合意どおりかを確認します
測定の手順書または実行スクリプト 御社の手元で測り直すために使います
学習と評価の分割方法の記録 似た事例が両方に入っていないかを確認します
誤った事例の一覧 何を外しているかを業務側の目で見ます

最後の1つは軽視されがちですが、業務側が見て初めて分かることがあります。数値が同じでも、外している事例の種類によって使えるかどうかが変わります。

確認の手順は次のとおりです。

  1. 御社が保持していた評価データで測り直します(目安半日)。つまずきやすい点は、実行環境が揃っていないと動かないことです。手順書に必要な環境を書かせてください。
  2. 報告された数値と、測り直した数値を突き合わせます(目安1時間)。差が出た場合は原因を説明させます。
  3. 誤った事例の一覧を業務担当者が読みます(目安半日)。ここで運用に耐えるかを判断します。

運用開始後に精度が落ちた場合の扱い

運用を始めると、入ってくるデータは少しずつ変わります。精度は下がる前提で契約を組んでください。

決めておくのは次の3点です。

  • 精度を定期的に測る頻度と、測る担当です。月次か四半期かを決めます。
  • どの水準まで下がったら対応するかの下限です。合格ラインとは別に置きます。
  • 下限を割った場合の対応の内容と、その費用の扱いです。再学習が保守契約に含まれるのか、別費用になるのかを明記します。

3点目が曖昧なままだと、下がったときに交渉から始まります。当社の実装経験では、再学習の作業量はデータの集め直しの手間で決まります。どちらが集めるかも書いておくと、後の判断が速くなります。

なお、検収を通ったあとに数値が落ちること自体は、不具合ではない場合があります。前提としていたデータの傾向が変わったのであれば、契約不適合ではなく運用の変化です。この線引きも検収条件と併せて決めておいてください。

AI開発の受け入れ基準づくりからご相談いただけます

当社は自社でAIを実装しており、合格ラインの置き方から検収の設計までお手伝いできます。数値を提示する側ではなく、御社が数値を検証できる状態を作る側で関わります。

AI開発の外注でつらいのは、提示された数値の妥当性を判断できない点です。正解率90%と言われても、比べる基準を持っていなければ高いのか低いのかが分かりません。判断できないまま契約すると、検収の場で困ります。

原因は、合格ラインが業務から切り離されて決まることにあります。先に業務側の許容範囲を数字にしておけば、提示された数値と比べられます。この順序を作るのが最初の仕事です。

当社の代表はAIエンジニアとして、RAG、Fine-tuning、Computer Visionを自ら実装しています。自社開発のVetoNetでは、分類器が過学習して数値が信用できなくなる状態も経験しました。作る側で踏んだ失敗を、発注側の確認項目として提供できます。

対応できる範囲は次のとおりです。

  • 業務の許容範囲から合格ラインを逆算する作業の支援
  • 指標の定義と、評価データの条件の要件化
  • 提案書と見積もりに書かれた精度の妥当性の確認
  • 検収時に受け取る成果物のリストづくりと、手元での測り直し
  • 運用開始後の測定頻度と、精度が下がった場合の対応の設計

外注先が決まっている段階でも、決まっていない段階でもお手伝いできます。費用と期間は、対象の業務とデータの量によって変わるため、案件ごとのお見積りになります。

いまの業務で何を許容範囲とすべきか迷われている場合は、無料診断で業務の流れを伺い、合格ラインの置き方を整理してお返しします。AI導入の費用に補助金を使えるかは補助金のご案内をご覧ください。

よくあるご質問

この記事に関して多い質問と回答をまとめます。

AI開発の精度は、契約書に何%と書いてもらえますか

書けますが、書く時点が後ろになります。手元のデータで何が達成できるかは、試してみないと分からないためです。経済産業省の契約ガイドライン (AI編) も、開発をアセスメント、PoC、開発、追加学習の段階に分けて進める方式を示しています。最初の契約では指標と評価データの条件を決め、数値はPoCの結果を見て確定させる形が現実的です。

正解率90%という提案は、高いのでしょうか

その数値だけでは判断できません。対象が全体の何%を占めるかによって意味が変わります。全体の5%しか該当しないものを探す業務なら、すべて「該当なし」と答えるだけで95%になります。見逃しの割合と誤検知の割合を分けて聞いてください。

PoCの結果が期待より低かった場合、契約はどうなりますか

最初の契約で決めておく事項です。「目標に届かなければ開発段階へ進まない」と書いておけば、判断で揉めません。決めていない場合は交渉になります。PoCの費用をどう扱うかも、併せて書いておいてください。

運用を始めてから精度が落ちた場合、誰の責任になりますか

原因によって変わります。前提としていたデータの傾向が変わったのであれば、不具合ではなく運用の変化です。一方、検収時の測定条件に問題があった場合は開発側の話になります。線引きを検収条件と一緒に決めておくことをお勧めします。あわせて、測定の頻度、対応が必要になる下限、下限を割った場合の費用の扱いを契約に書いてください。

精度を測るためのデータは、発注側が用意する必要がありますか

業務データを使う場合は、御社が用意することになります。誰が用意するかは最初の契約で決めてください。加えて、評価データの一部を御社側で保持しておくことをお勧めします。開発側が全部を見ながら調整すると、そのデータに合わせた作り込みが起こるためです。

評価の観点は、精度だけを見ればよいのですか

精度だけでは足りません。AIプロダクト品質保証コンソーシアム(QA4AI)のガイドラインは、品質を評価する軸として、データの整合性、モデルの頑健性、システムの品質、プロセスの機敏性、顧客の期待の5つを挙げています。契約書で数値にするのは主に精度ですが、残りの観点は別の条項や運用の取り決めで押さえる形になります。

関連リンク

監修: 株式会社ノーティックラボ 代表(AIエンジニア)
本記事はAIを活用して制作しています

こうした観点をベースに、
貴社の DX を一緒に考えませんか。

ホームページ無料診断

営業日 24時間以内に担当者よりご返信します。

初回相談無料 · 営業日24h以内にご返信