AIの答えがぶれる原因はデータの品質|先に測る6つの物差し

データの品質を測る物差しは、すでに国際規格として整理されています。2008年に定められたISO/IEC 25012は、データの品質を正確性・完全性・一貫性・最新性・精度など15の特性に分けて定義しました。生成AIが広まるよりずっと前に作られたものですが、いま起きている問題の多くはこの15の中に収まります。——「同じ質問をしたはずなのに、日によって違う答えが返ってきます」「AIが出した数字が、社内の集計と合いませんでした」。社内の情報をAIに参照させ始めた現場から、決まって上がる声です。原因をモデルの側に探しても、たいていは見つかりません。ぶれているのはAIではなく、渡している側のデータです。この記事では、渡す前に測っておく6つの物差しと、合格の線の引き方を整理します。
カメ先生AIの答えがぶれるとね、まずAIの側を疑いたくなるものなんだ。でも同じ質問で答えが変わるときは、参照している元の情報が場所によって食い違っている、ということのほうがずっと多いんだよ。
カメ子元の情報が食い違っていると、答えも食い違うということでしょうか。
カメ先生そうなるね。しかも困るのは、食い違っていることをAIが教えてくれない点だ。どちらか一方を選んで、それらしい文章にして返してくる。だから渡す前に測っておく必要があるんだよ。
カメ子品質を測るというのは、正しいかどうかを1件ずつ確かめることとは違うのでしょうか。
- 測る前に決めるのは、対象の範囲・数える単位・分母の3つ。決めないと割合が比べられない
- 物差しは欠け・重複・鮮度・整合・粒度・正確さの6つ。合格の線は用途ごとに引き直す
- 基準を満たさなくても出力は止まらない。人が確かめる範囲を先に決めておく
データ分析にAIを活かす第一歩、まずは導入から始めませんか?
デボノはアカウント開設・初期設定など「そもそものAI導入」から社内定着まで伴走支援。マーケティング活用など一歩進んだご相談にも対応します。
答えがぶれたとき、モデルより先に見る場所
答えが安定しないという相談は、たいてい設定の話から始まります。別のモデルに変えるべきか、指示の書き方を変えるべきか、という具合です。ところが原因を追っていくと、同じことを書いた資料が複数あって、参照するたびに違うほうが選ばれていたという場面によく行き当たります。これはモデルの問題ではありません。
典型的な場面を1つ置いてみます。問い合わせへの返信の下書きをAIに作らせている会社があるとします。返品の可否を尋ねる問い合わせに、ある日は「14日以内なら可能」と書き、別の日は「30日以内なら可能」と書く。調べると、社内の案内文が更新されたときに古いほうが消されずに残っていて、新旧2つの案内文が、どちらも同じように参照できる状態になっていました。
このとき、AIの側にできることはありません。2つの値のどちらが正しいかは、データの外側にしかない情報です。片方を選んで返してくるのは、モデルが優秀でないからではなく、選ぶための材料が渡されていないからです。答えのぶれは、渡したデータのぶれがそのまま出てきたものだと考えると、手を打つ場所がはっきりします。
品質の物差しは、すでに規格として整理されている
データの品質という言葉は漠然としていますが、中身は規格として分解されています。ISO/IEC 25012が挙げる15の特性は、正確性、完全性、一貫性、信憑性、最新性、アクセシビリティ、標準適合性、機密性、効率性、精度、追跡可能性、理解性、可用性、移植性、回復性です。
15を一度に測ろうとすると手が止まります。実務で先に測るべきものを選ぶと、6つに絞れます。欠け(完全性)、重複、鮮度(最新性)、整合(一貫性)、粒度(精度)、正確さ(正確性)です。このうち重複だけは15の特性に単独では立っていませんが、実際に事故を起こす頻度が高いので独立させて測ります。
残りの9特性を軽んじてよいわけではありません。機密性やアクセシビリティは、AIに渡してよい範囲を決めるときに効きます。追跡可能性は、誤りが見つかったときにどこから来た値かをたどるために要ります。ただしこれらは測って直すというより、仕組みとして持つかどうかの話なので、日々の点検の対象からは外して考えます。
測り方は、公表されている手引きを下敷きにできる
物差しと点検の手順を一から作る必要はありません。公的機関が公表している手引きがいくつかあり、そのまま社内の点検票の下敷きに使えます。2023年9月に内閣府が公表した「データ連携基盤を通して提供されるデータの品質管理ガイドブック」は、組織をまたいでデータをやり取りする場面を想定して、品質をどう管理するかを整理したものです。
AIに渡すデータに絞ったものとしては、AIセーフティ・インスティテュートが公表している「データ品質マネジメントガイドブック」があります。副題は「データとAIの価値を最大化する」で、ISOやIECといったデータ品質に関する標準を、実装しやすい形に整理したと説明されています。英語の原文に加えて、理解を補助するための日本語参考訳も第1.02版として公開されています。
こうした手引きを読むときの姿勢は1つで、全部を取り込まないことです。網羅された一覧をそのまま社内の点検票にすると、項目が多すぎて1回も回りません。自社の用途で先に効く物差しだけを抜き出し、残りは読んだ記録として置いておくのが現実的な使い方になります。
もう1つ知っておきたいのは、規格も手引きも、測り方までは示してくれても、合格の線までは決めてくれないという点です。線は業種によっても用途によっても変わるので、外から与えられるものではありません。借りてくるのは物差しまで、線は自社で引く——この分け方をしておくと、手引きを読んで満足して終わる、という典型的な止まり方を避けられます。
国内では、独立行政法人情報処理推進機構も「AIのためのデータ環境整備」という形で、AIに使うデータをどう整えるかの情報を公開しています。公的な機関が相次いで手引きを出しているのは、AIの精度の問題として語られてきたことの多くが、実際には渡す側の整備の問題だと分かってきたからでしょう。もっとも、手引きを読み比べる時間より、自社のデータを1回測ってみる時間のほうが先に効きます。どの物差しで詰まっているかが分かっていれば、手引きの中で読むべき箇所も自然に絞り込めますし、社内で説明するときの順番も決まります。
測る前に決める3つのこと
品質を測るという話は、たいてい「欠けが何パーセント」という数字から始まります。ところがその数字は、測り方を決めずに出すと比べられません。先月と今月で分母が違えば、改善したのか悪化したのかも分かりません。測る前に決めることが3つあります。
1つ目は対象の範囲です。全部を測るのではなく、その用途で実際に使う範囲だけを測ります。返信の下書きに使うなら、参照させる案内文の集まりだけが対象です。2つ目は数える単位で、行を数えるのか、項目を数えるのかを決めます。1行に1つでも欠けがあれば不合格とするのか、欠けている項目の数で測るのかで、出てくる数字は大きく変わります。
3つ目が分母です。対象期間の全行なのか、実際に参照された行だけなのか。分母を先に書いておかないと、次に測ったときに同じ数字が出ません。測り方を文章で1行残しておくだけで、翌月の比較ができるようになります。
- 対象の範囲:その用途で実際に参照される範囲だけに絞る
- 数える単位:行で数えるか、項目で数えるか。混ぜない
- 分母:全行か、参照された行か。測るたびに変えない
- 測った日:同じ日に測り直せるよう、いつ時点の数字かを残す
物差し1・欠け——使う項目が空いていないか
欠けは最も測りやすい物差しです。対象の範囲を決め、その用途で使う項目を挙げ、空欄の行を数えます。ここで大事なのは、全項目の空欄率ではなく、使う項目に絞った空欄率を見ることです。使わない項目が空いていても、出力には何の影響もありません。
先ほどの返信の下書きの場面なら、案内文に返品の期間と条件と例外が書かれているかを見ます。期間だけ書かれていて例外が抜けている案内文が混ざっていると、例外に当たる問い合わせに対して、例外を知らない答えが返ります。欠けているという事実は出力に現れず、言い切った文章だけが返ってくるのが厄介なところです。
測ったあとの線の引き方も、項目ごとに変えます。返品の期間が欠けている行は1件も許容できませんが、担当者名が欠けている行は多少あってもかまいません。項目ごとに許容の度合いを書き分けておくと、直す順番がそのまま決まります。全項目を同じ線で測ると、直さなくてよいところに手間がかかります。
数える前にもう1つ決めておきたいのが、何を空欄とみなすかです。実務のデータには、空欄ではなく「不明」「未定」「該当なし」「未記入」といった文字が入っている行が必ず混じります。これらを空欄として数えないと、欠けの数字は実態よりずっと小さく出ます。空欄とみなす値の一覧を先に作り、その一覧で数えるのが確実です。一覧は測るたびに変えず、値を足したときは記録を残します。
物差し2・重複——同じ1件が何度出てくるか
重複は、数え方を決めるところでつまずきます。完全に同じ行が2つあるのは見つけやすいのですが、実務で問題になるのは、中身が少しだけ違う重複のほうです。表記が違う、片方に新しい項目が足されている、片方の日付だけが新しい。こうした行は、単純な照合では同じものとして数えられません。
ここでは測ることに絞ります。まず「何をもって同じ1件とみなすか」を1つ決め、その決め方で重なっている行の数を数えます。どの項目を突き合わせて同じと判定するかというルールの作り方そのものは、名寄せの話として別に整理されるべきものなので、ここでは触れません。測る側は、決めたルールで何件重なったかという数字だけを持ちます。
重複が出力に与える影響は、数が合わなくなることと、同じ内容が二重に根拠として並ぶことの2つです。同じ内容が2件見つかると、AIはそれを「複数の資料が一致している」と受け取ります。実際には1件の写しが2つあるだけなのに、確からしさが上がったように見えてしまうのです。
物差し3・鮮度——いつ時点の値なのか
鮮度は、6つのうち最も事故につながりやすい物差しです。理由は単純で、古い値でも文章としては完全に成立してしまうからです。欠けていれば答えが曖昧になり、食い違っていれば日によって変わるので気づけますが、古い値は一貫してもっともらしい答えを返し続けます。
測り方は、最終更新からの経過日数を行ごとに出し、その用途で許される日数を超えた行の割合を見ます。許される日数は、元の情報がどれくらいの周期で変わるかから決めます。価格や在庫なら日単位、組織や体制なら月単位、規程なら年単位です。更新の周期の2倍を超えていたら疑う、という置き方が出発点として使いやすいでしょう。
もう1つ、更新日時そのものを信用しすぎない注意も要ります。書式を直しただけでも日時は動きますし、別の場所に写した瞬間にも動きます。ファイルが触られた日と、中身が変わった日は別のものです。中身が変わった日を別に持っていない場合は、鮮度の数字に幅を持たせて読みます。
期限を超えた行の扱いは、外すか残すかの二択にしないほうが動きます。すべて外すと答えられる範囲が急に狭くなり、現場から「前は答えられたのに」という声が返ってきます。参照はさせるが、いつ時点のものかを回答に添えさせるという中間の段階を1つ置くと、使える範囲を保ったまま誤読を減らせます。ただし価格や在庫のように、間違えるとそのまま実害が出る項目については、中間を置かずに外します。
物差し4・整合——別の場所と食い違っていないか
整合は、1つの場所を見ているだけでは測れない唯一の物差しです。同じ項目を持っている別の場所と突き合わせて、値が違う行を数えます。顧客の名称、案件の金額、契約の開始日といった、複数の場所に写されやすい項目が対象になります。
測るときは、突き合わせた行数を分母にします。全行を分母にすると、突き合わせられなかった行が「食い違っていない」に数えられてしまいます。突き合わせられた行が全体の何割だったかも、あわせて記録しておきます。この割合が低いまま食い違い率だけを見ると、実態より良い数字が出ます。
食い違いが見つかったときに、どちらが正しいかを機械に決めさせないことが肝心です。新しいほうが正しいとは限りません。どちらの場所を正とするかを、項目ごとに人が先に決めておきます。決めていない項目については、食い違っている事実だけを記録し、AIに渡す対象からいったん外すのが安全です。
この物差しは、AIの答えがぶれるという症状と最も直結します。参照のたびに違うほうが選ばれれば、答えは日によって変わります。逆に言えば、答えがぶれているという報告が上がってきたときは、まず整合から測ると原因に早く届きます。
物差し5・粒度——どこまで細かく持っているか
粒度は、1行が何を1件として表しているかの細かさです。規格の言葉では精度にあたります。月ごとにまとめられた数字しか持っていないのに、週ごとの傾向を聞かれる。製品の分類ごとの数字しかないのに、個別の品目について聞かれる。こうしたときに起きるのが、粒度の不足です。
測り方は、使いたい単位より粗い行がどれだけあるかを数えます。粒度は足りないと後から細かくできない、という点で他の5つと性質が違います。欠けは埋められますし、重複は落とせますが、まとめてしまった数字を元に戻すことはできません。だから線は「粗い行が0であること」に置き、満たせないなら用途のほうを変えます。
粒度が足りないまま渡したときに出力側に出るのは、平均で埋めた答えです。個別の事情が平均に吸収され、例外が消えた答えが返ってきます。しかも文章としては自然なので、読んだ側は「そういうものか」と受け取ります。細かい判断に使う場面ほど、この物差しを先に確かめておく必要があります。
物差し6・正確さ——現実と合っているか
正確さは、6つのうち唯一、データの中だけでは測れない物差しです。書かれている値が現実と合っているかどうかは、現実の側を見に行かないと分かりません。だから測り方も他の5つとは違い、全件ではなく抜き取りで測ります。
手順は、対象の範囲から一定の件数を無作為に抜き出し、1件ずつ現物と照らします。契約金額なら契約書と、担当者なら名簿と、住所なら送付先の記録と。抜き取る件数を先に決め、抜き取り方を記録しておくことが要点です。目についた行だけを見ると、見やすい行ばかりが選ばれて、実態より良い数字が出ます。
正確さが低いまま渡したときの影響は、誤りが根拠として引用され、その引用がまた別の資料に写っていくことです。一度AIの回答に取り込まれた誤りは、出どころが分からないまま社内に広がります。だからこそ、AIには必ずどの資料を根拠にしたかを書かせ、人が根拠まで戻れる形にしておきます。
抜き取る件数は、対象の大きさに比例させる必要はありません。全体が1万行でも10万行でも、先に決めた件数を抜くだけで傾向はつかめます。むしろ気をつけたいのは、誤りが1件も出なかったからといって、線を満たしていると断じないことです。抜き取りで分かるのは、その件数で見つかる程度の誤りがあったかどうかだけだからです。1件も出なかったときは、件数を増やすか、別の切り口で抜き直して確かめます。
6つの物差しを1枚に並べる
6つを別々に説明してきましたが、実際の点検では1枚に並べて使います。下の表は、何を数えるか、何を分母にするか、最初にどこへ線を置くかをまとめたものです。線の数値はいずれも統計ではなく、出発点として置く目安です。用途ごとに引き直す前提で読んでください。
| 物差し | 何を数えるか | 分母 | 最初に置く線の例 |
|---|---|---|---|
| 欠け | 使う項目が空いている行の数 | 対象期間の全行 | 主要な項目の欠けが3パーセント以下 |
| 重複 | 決めたルールで重なっている行の数 | 対象期間の全行 | 1パーセント以下 |
| 鮮度 | 許される日数を超えている行の数 | 対象期間の全行 | 超過した行が1割以下 |
| 整合 | 別の場所と値が食い違う行の数 | 突き合わせられた行 | 食い違いが1パーセント以下 |
| 粒度 | 使いたい単位より粗い行の数 | 対象期間の全行 | 粗い行が0 |
| 正確さ | 現物と照らして誤っていた件数 | 抜き取った件数 | 誤りが1パーセント以下 |
表を作ったら、測った日と測り方を1行添えて残します。翌月に同じ表を作り、数字を横に並べれば、直した効果が見えます。1回だけ測った数字は、良いのか悪いのかを判断できません。2回目からが本番だと考えておくと、初回の数字に一喜一憂せずに済みます。
合格の線は用途ごとに引き直す
同じデータでも、何に使うかで合格の線は変わります。ここは一律の基準を作りたくなるところですが、一律にすると必ずどちらかが不幸になります。厳しすぎれば使えるデータがなくなり、緩すぎれば事故が通り抜けます。
3つの場面で考えてみます。1つ目は問い合わせへの返信の下書き。ここでは鮮度と整合の線を最も厳しくします。古い条件や食い違った条件をそのまま客に伝えることになるからです。欠けは、欠けている項目について答えさせなければ許容できます。
2つ目は社内の資料を探す用途。ここでは欠けの線が緩くてかまいません。多少項目が抜けていても、人が資料を開いて確かめるからです。代わりに重複の線を厳しくします。同じ資料が何通りも並ぶと、どれを開けばよいか分からなくなるためです。
3つ目は数字の集計を任せる用途。ここでは粒度と重複と正確さが効きます。重複が1パーセントあれば、合計は1パーセント多く出ます。線の引き方は、その出力が間違っていたときに誰が困るかから逆算するのが分かりやすい方法です。客が困るなら厳しく、社内の下調べで済むなら緩く、という順に決めていきます。
線を決めるときに一緒に決めておくのが、下回ったときに何をするかです。使わせないのか、使う範囲を狭めるのか、注記を添えたうえで使わせるのか。行動まで決めていない線は、下回っても誰も動きません。報告の場で「線を下回っています」と読み上げられ、翌月も同じ数字が読み上げられる、という状態になります。線と行動は必ず一組にして書いておきます。
基準を満たさないまま渡すと、出力側にこう出る
品質の話が後回しになりやすいのは、基準を満たさなくても処理が止まらないからです。表計算の集計なら、欠けた欄はエラーとして表示されます。ところが生成AIは、足りないまま、止まらずに、文章として整った答えを返します。これが、品質の不備が見つかりにくい最大の理由です。
どの物差しが欠けたときに、出力側にどんな型で現れるかを知っておくと、症状から原因に戻れます。答えが曖昧なら欠け、数が合わないなら重複、日によって変わるなら整合、というように当たりをつけられるようになります。
- 欠けたまま渡す:不足を告げずに、一般論で埋めた答えが返る
- 重複したまま渡す:件数と合計が実際より多く出る。同じ内容が複数の根拠に見える
- 古いまま渡す:古い前提のまま、言い切った答えが返る。もっともらしいので気づきにくい
- 食い違ったまま渡す:同じ問いでも、日によって別の答えになる
- 粗いまま渡す:平均で埋められ、個別の例外が消えた答えになる
- 誤りを含んだまま渡す:誤りが根拠として引用され、次の資料に写っていく
この一覧は、症状から原因を引くためのものです。答えがぶれるという1つの症状に、原因は6通りあると分かっていれば、モデルの設定を触る前に測るという順番が自然に取れます。
測った後の直し方には順番がある
測ると、直すべきところが一度に何十件も出てきます。ここで手当たり次第に直し始めると、直したそばから同じ問題が増えていきます。順番を決めておくと、同じ手間をかけても残る成果が変わります。
原則は、増えるのを止めてから、たまっているものを直すことです。入口を締めずに中を掃除すると、掃除が終わるころには新しい分がたまっています。入口を締めるのは面倒に見えますが、これをやらないと点検が永久に終わりません。
新しく入ってくるところで、必須の項目が空欄のものを受け付けないようにします。まず止めるのは、線がいちばん厳しい項目だけにします。
全項目を埋めようとせず、その用途で使う項目に絞ります。埋められない行は、埋めるのではなく参照の対象から外すという選択も残しておきます。
単位、日付の書き方、区分の名前を揃えます。ここを飛ばして重複を落とすと、表記違いの重複が残ります。
決めたルールで重なっている行を、どちらを残すか人が決めた基準にしたがって整理します。落とした記録は残しておきます。
直す前と同じ測り方で測り直します。測り方を変えて数字が良くなっても、それは改善ではありません。
AIに任せてよい範囲と、人が決める線
品質の点検そのものをAIに手伝わせることはできます。表記の揺れの候補を挙げる、欠けている項目を一覧にする、食い違っている行を並べる——このあたりは向いています。共通しているのは、データの中を見れば答えが出る作業だという点です。
反対に、任せてはいけないのは判定です。どちらの値が正しいか、この行を落としてよいか、この線で合格としてよいか。これらはデータの外側の事情で決まるので、機械が決めると理由のない判断が静かに入り込みます。候補を出させるところまでを任せ、決めるところは人が持つのが境目になります。
手伝わせるときは、必ず根拠を書かせます。どの行のどの項目を見てそう判断したのかを一覧で出させれば、人は結論だけでなく過程を見て確かめられます。根拠のない一覧を受け取ると、正しいかどうかを確かめる手間が、自分で調べる手間と変わらなくなります。
そのうえで、人が確認する範囲を先に決めておきます。落とす行は全件を人が見る、埋めた値は抜き取りで見る、表記の統一は結果だけ見る、という具合です。範囲を決めずに始めると、確認は「気づいた人がやる」状態になり、忙しい時期に最初に抜けます。
この記事に出てきた言葉
データ品質の話には、日常であまり使わない言葉が混じります。会議で認識がずれやすいところなので、この記事での意味を短くまとめておきます。厳密な定義は規格の側にありますが、社内で話を進めるにはこの程度の共通理解で足ります。
| 言葉 | この記事での意味 |
|---|---|
| 欠損 | 本来あるはずの値が空になっている状態。空欄と未入力を区別しない |
| 一意性 | 同じものを指す行が1つしかない状態。重複の裏返しにあたる |
| 鮮度 | その値がいつ時点のものかという性質。規格では最新性と呼ばれる |
| 整合 | 別々の場所にある同じ項目が食い違っていない状態。規格では一貫性 |
| 粒度 | 1行が何を1件として表しているかの細かさ。規格では精度に近い |
| 抜き取り | 全部を確かめる代わりに一部を無作為に抜き出して確かめるやり方 |
言葉をそろえておくと、点検の結果を報告するときに話が早く進みます。「品質が悪い」ではなく「鮮度が線を超えている行が2割ある」と言えるかどうかで、次の一手が決まるまでの時間がまるで変わります。
まとめ
AIの答えがぶれるとき、原因はモデルではなく渡しているデータにあることがほとんどです。同じことを書いた資料が複数あれば、参照するたびに違うほうが選ばれます。どちらが正しいかという情報はデータの外側にしかないので、AIの側に解決を求めても届きません。
測る物差しは6つです。欠け、重複、鮮度、整合、粒度、正確さ。測る前に対象の範囲と数える単位と分母を決め、測り方を1行残しておきます。線は用途ごとに引き直し、その出力が間違ったときに誰が困るかから逆算して決めます。1回目の数字は基準にならず、2回目から意味が出てきます。
直すときは、増えるのを止めてから、たまっている分に手を付けます。点検の候補出しはAIに任せてかまいませんが、どちらが正しいかの判定は人が持ち、必ず根拠を書かせます。そして人が確認する範囲を先に決めておくこと。基準を満たさないままでも出力は止まらず、整った文章で返ってくるからこそ、渡す前の物差しが効いてきます。
※本記事にはAIが活用されています。編集者が確認・編集し、可能な限り正確で最新の情報を提供するよう努めておりますが、情報の完全性、正確性、最新性、有用性等について保証するものではありません。本記事の内容に基づいて行動を取る場合は、読者ご自身の責任で行っていただくようお願いいたします。
データ分析にAIを活かす第一歩、まずは導入から始めませんか?
デボノはアカウント開設・初期設定など「そもそものAI導入」から社内定着まで伴走支援。マーケティング活用など一歩進んだご相談にも対応します。
