LLM-as-a-Judgeとは何か?|AIの採点をAIに任せる線

「社内でAIに書かせる文章が月に何百本と出るようになって、人の確認が完全に追いつかなくなりました」「採点もAIにやらせてみたら、それらしい点数は返ってくるのですが、この点を信じてよいのかが誰にも分かりません」——AIを一部門から全社に広げた会社が、半年ほど経つとほぼ同じ場所で足を止めます。ここでよく起きるのが、採点役のAIを入れれば人が見る作業はなくなる、という受け取り方です。そうはなりません。採点役のAIは人の確認をなくす道具ではなく、人が確認する場所を絞り込むための道具です。この記事では、採点役のAIに何を渡すのか、返ってきた点をどこまで信じてよいのか、信じられる状態をどう保つのかを、導入の順番に沿って整理していきます。
カメ先生AIの出力をAIに採点させると聞くと、丸投げに見えるよね。実際は逆で、採点の基準を人が言葉にして書き切らないと何も動かない仕組みなんだ。基準があいまいなまま渡すと、返ってくるのはどの出力にも付きそうな似た点数になる。
カメ子点が返ってきているのに、中身を見ていないことがあるということですか。
カメ先生そうなんだ。採点役は基準に書かれたことしか見ていないからね。だから点そのものより先に、その点と人の判断がどれくらい合っているかを測る。合っているかどうかを確かめていない点をいくら並べても、増えるのは数字の量だけなんだ。
カメ子点を使い始める前に、その点が当たっているかを確かめる工程がいる、ということでしょうか。
- 採点役のAIは人の確認を置き換えない。人が見る範囲を絞り込むために使い、絞り込んだ先は人が見る
- 渡すのは採点の基準と比べる相手と出力そのものの3つ。基準を観察できる言葉に割れていないと、点は出るのに直す場所が出てこない
- 点を使い始める前に、人の採点と突き合わせて一致度を測る。ずれ始めたことに気づく見方も、運用に移す前に決めておく
AI活用を戦略に落とす前に、まずは導入・定着から始めませんか?
デボノはアカウント開設・初期設定など「そもそものAI導入」から社内定着まで伴走支援。マーケティング活用など一歩進んだご相談にも対応します。
「人が全部見る」は、本数が増えた時点で終わっている
AIの出力を人が全部確認する体制は、たいてい3か月で壊れます。壊れ方には決まった順番があります。最初の月は全文を読みます。2か月目は本数が倍になり、見出しと冒頭だけを読むようになります。3か月目には、明らかにおかしいものだけを拾う形になり、4か月目には誰も開かなくなります。体制が変わったのではなく、確認する側の時間だけが変わらなかった結果です。
この負荷は実際に企業の課題として表に出ています。帝国データバンクが2026年3月17日から31日にかけて実施した企業の動向調査(有効回答10,312社)では、生成AIを活用していると答えた企業が34.5%あり、活用上の課題として最も多く挙がったのが「情報の正確性」で50.4%でした。使う企業が増えたぶん、出てきたものが正しいかどうかを誰がどう見るのかという問題が、そのまま残っています。
採点役のAIの話が出てくるのは、この場所です。ただし入れる目的を取り違えると、入れた後に状況が悪くなります。目的は確認をなくすことではなく、人が見る対象を選べる状態にすることです。1,000本のうち人が見られるのが50本なら、その50本をどう選ぶかが問題であって、1,000本を無人で処理することが問題ではありません。以降の章は、この選び方をどう機械に手伝わせるかの話になります。
採点役のAIとは、何をさせる仕組みなのか
仕組みそのものは単純です。あらかじめ人が書いた採点の基準と、採点される出力を渡し、基準に照らした点や可否と、その点を付けた理由を書かせます。主要なクラウドの評価機能でも作りは同じで、出力を作る側のモデルと、採点する側のモデルを別々に指定する形になっています。組み込みの評価項目から選ぶこともでき、自社の業務に合わせた独自の評価項目を定義することもできます。
採点のさせ方には3通りあります。1つ目は1件ごとに点を付けさせる形。2つ目は2つの出力を並べてどちらがよいかを選ばせる形。3つ目は基準の項目ごとに満たすか満たさないかを返させる形です。実務でいちばんぶれにくいのは2つ目です。点の絶対値は採点役の気分の幅に埋もれやすいのに対して、2つのどちらがよいかという問いは、答えが2択しかないぶん揺れが小さいからです。
向く仕事と向かない仕事もはっきりしています。向くのは、社外に出る文章の下読み、問い合わせ応答の抜き取り、社内文書の形式の確認、大量の候補の並べ替えです。向かないのは、書かれている内容が事実かどうかの最終判定です。採点役は、その事実を確かめる材料を持っていません。材料を持っていない相手に判定を頼めば、根拠のない合格が返ってきます。返ってきた合格は、確認したという記録の代わりにもなりません。
採点役に渡すものは3つある
採点がうまくいかない相談を受けると、原因はほぼ渡し忘れです。渡すものは3つあり、どれが欠けても症状が違います。次の表は、3つの中身と、渡さなかったときに現場で何が起きるかを並べたものです。自分たちの設定がどれを欠いているかは、症状の側から逆に引けます。
| 採点役に渡すもの | 具体的に何を渡すか | 渡さないと現場で何が起きるか |
|---|---|---|
| 採点の基準 | 観察できる言葉に割った項目の一覧と、項目ごとの満たす条件 | 点は返るが、どの出力にも似た点が付き、直す場所が最後まで出てこない |
| 比べる相手 | 人が合格を出した見本、確定した過去の回答、または直前の版 | 点の高低が採点役の揺れに埋もれ、良くなったのか悪くなったのか読めない |
| 採点される出力そのもの | 出力の本文と、その出力を作ったときの指示と材料 | 指示から外れた出力を、文章としてよくできているという理由で高く採点する |
3つ目は見落とされがちです。出力だけを渡して「よい文章かどうか」を採点させると、採点役は文章の形だけを見ます。その結果、指示されていない内容を勝手に足した出力ほど高い点が付くという逆転が起きます。指示と材料を一緒に渡し、指示に答えているかを基準の1項目に入れておくと、この逆転は消えます。
体制の話としては、基準を誰が書くかを先に決めてください。現場の担当者が書くと細かすぎて運用に乗らず、管理側が書くと抽象的すぎて点が寄ります。実務では、現場が下書きを書き、管理側が項目数を削る形が回ります。削る役を置かないと、基準は毎月増えて誰も全体を把握できなくなります。
基準は「良い文章か」ではなく、観察できる言葉に割る
採点役に渡す基準で最もよくある失敗は、「分かりやすいか」「丁寧か」「顧客目線か」といった言葉のまま渡すことです。これらは人でも判定がばらつく言葉で、機械に渡せば当然ばらつきます。しかも返ってくる点は、ばらついた結果ではなく、どの出力にも似たような中くらいの点が付くという形で現れます。点が出ているので動いているように見え、動いていないことに気づくまでに数か月かかります。
割り方は難しくありません。問い合わせへの返信文を採点する場合なら、こう割ります。相手の質問に直接答えている文が本文の最初にあるか。社内で決めた言い回しから外れた表現がないか。価格と納期に踏み込んでいないか。次にしてほしい行動が1つだけ書かれているか。どれも読めば数えられる形になっているのが条件です。数えられない項目は、採点役に渡しても数えられません。
項目に割ったあとで、ひとつ確かめてください。人が2人、同じ基準で同じ10件を採点して、結論がそろうかどうかです。そろわないなら、機械に渡す以前に基準の書き方の問題です。なお、どの点数から合格にするかという線の決め方は、発注先との検収の話になるので別の記事の領分です。ここで決めるのは、点を付けるための項目だけです。
比べる相手をどう用意するか
2つ目に渡す「比べる相手」は、正解がある場合とない場合で用意の仕方が変わります。正解がある場合は簡単で、確定した過去の回答や、規程の条文そのものを渡します。社内規程についての質問に答えさせる仕組みなら、条文が正解です。この形では採点役の仕事は照合に近くなり、点のばらつきが最も小さくなるため、導入の最初の対象に向きます。
正解がない場合、たとえば提案書の下書きや告知文のように、正しい答えが1つに決まらないものでは、見本を置きます。人が合格を出した過去の成果物を10件から30件ほど選び、これと比べさせる形です。件数を増やしても効果は頭打ちになるので、選ぶ手間は件数ではなく、ばらつきの幅を覆うことに使うほうが効きます。よくできた見本だけを集めると、平均的な出力の判定がゆるくなります。
見本は古びます。商品が変わり、言い回しの社内基準が変わり、規制が変わるためです。半年に1度、見本を見直す日を先に決めてください。見直す人も決めます。決めないと、2年前の言い回しに近い出力ほど高い点が付く状態が、誰にも気づかれないまま続きます。現場の実感と点が食い違い始めたとき、最初に疑うべきはここです。
採点役に出やすい4つのくせと、その気づき方
採点役のAIには、人の評価者とは違う独特の偏りが出ます。2024年に公表された、採点役の偏りを体系的に数えた研究では12種類の偏りが整理されており、高性能なモデルでも特定の仕事では偏りが残ることが報告されています。実務で効いてくるのは、そのうち次の4つです。表の3列目は、自分たちの設定で偏りが出ているかを確かめる手順です。
| 採点役に出やすいくせ | 点にどう現れるか | 出ているかの確かめ方 | 現場での手当て |
|---|---|---|---|
| 並び順で、先に置いたほうを高く見る | 2つを比べさせると、どちらを先に置いたかで結論が入れ替わる | 同じ2件を順番だけ入れ替えて2回採点させ、結論が変わった件数を数える | 順番を入れ替えて2回採点し、両方で同じ結論になった件だけを採用する |
| 長い答えを高く見る | 中身が同じでも、説明を足したほうの点が上がる | 字数と点を並べて、右肩上がりの関係になっていないかを見る | 基準に「長さは評価しない」と書き、必要な項目があるかどうかだけを見させる |
| 自分と同じ系統の出力を高く見る | 生成に使ったのと同じ系統の採点役だと、点が全体に甘くなる | 別の系統の採点役にも同じ件を採点させ、点の差の大きさを見る | 生成する側と採点する側を別の系統にし、定期的に入れ替えて差を確かめる |
| 基準が抽象的だと点が寄る | ほとんどの件が上から2段階に集まり、差が出なくなる | 点の分布を出し、上位2段階に全体の何割が入っているかを数える | 基準を数え上げられる項目に割り、項目ごとに満たすかどうかを返させる |
偏りがあるから使えない、という話ではありません。2023年に公表された、複数回のやり取りを含む対話の評価を提案した研究では、強力な大規模言語モデルの採点が人の評価者と8割ほど一致し、これは人の評価者どうしの一致率と同程度だったと報告されています。問題は精度そのものではなく、どの方向に外れるかが分かっていないまま使うことです。方向が分かっていれば、外れる分を織り込んで読めます。
偏りを減らす手当ては、どれも地味な作業になる
手当ての基本は4つで、どれも仕組みを足す話ではなく、採点の回し方を変える話です。1つ目は順番の入れ替えです。2つを比べさせる形では、順番を入れ替えて2回採点させ、両方で同じ結論になった件だけを採用します。結論が入れ替わった件は「判定できなかった」として人に回します。判定できなかったという結果を残せる形にしておくことが、無理に点を付けさせないための最も簡単な手当てです。
2つ目は、点ではなく2つの比較にすること。3つ目は、基準を数え上げられる項目に割り、項目ごとに満たすかどうかを返させること。4つ目は、生成する側と採点する側のモデルの系統を分けることです。同じ系統のまま運用すると、点が全体に甘くなるうえ、甘いことに気づく手掛かりが社内に残りません。系統を分けるのは設定を変えるだけで済むので、最初にやっておく価値があります。
ただし、手当てを重ねても偏りは消え切りません。2026年に入ってからの複数の検証でも、順番の入れ替えや採点表の細分化といった手当てを組み合わせても偏りが完全には残らなくなるわけではないこと、書式の変更や言い換えといった単純な揺さぶりで採点が崩れる場合があることが報告されています。消し切れない前提で、人が見る範囲を残す設計にしておくのが実務の落としどころです。
採点役を入れる前に、機械で測れるものを先に落とす
採点役のAIを入れる相談で、最初に確認するのはここです。いま人が見ている確認項目のうち、機械的に判定できるものがどれだけ混ざっているかを数えてください。字数の上限、禁止語が入っていないか、必須の項目がそろっているか、日付の形式、社名の表記ゆれ、行き先のない参照。これらは採点役を使わなくても判定できる項目で、判定は速く、安く、何度やっても同じ結果になります。
実務の手引きでも、まず決まった規則で測れる検査を前段に置き、採点役はそこでは測れない部分だけに回す形が推奨されています。順番を守ると、採点役に回る件数が減ります。件数が減れば費用も下がり、採点役が間違える機会そのものも減ります。逆に、字数の確認まで採点役にやらせると、確実に測れたはずの項目に、わざわざ揺れを持ち込むことになります。
組み方の全体像は3段です。決まった規則の検査、採点役のAI、人の抜き取り。1段目で落ちたものは2段目に進まず、2段目で基準を満たさなかったものが3段目に優先的に回ります。この形にしておくと、本数が10倍になっても3段目の負荷は比例して増えません。増えないように設計しておくことが、確認の体制が3か月で壊れない唯一の条件です。
採点役の点が信用できるかは、人の採点と突き合わせて測る
ここがこの記事でいちばん飛ばされやすい工程です。採点役を設定したら、すぐ運用に乗せたくなります。その前に、返ってきた点が人の判断とどれくらい合っているかを1度測ってください。手順は決まっています。本番で実際に出た出力を100件から300件抜き、2人から3人が、採点役に渡したのと同じ基準で採点し、両者の結論を突き合わせます。
突き合わせた結果は一致度として数字にします。実務の手引きで共有されている目安では、一致度の指標としてカッパ係数が使われ、0.4を下回るなら採点役ではなく基準の書き方があいまいだと見なして書き直し、0.6以上なら実務で使える水準、0.8以上なら強い一致とされています。この数字を出さないまま運用に乗せると、後から点が動いたときに、何が変わったのかを誰も説明できません。
一致しなかったときに疑う順番も決めておきます。最初に疑うのは基準です。次が比べる相手、次が渡している材料、最後が採点役のモデルです。現場では逆から疑われがちで、モデルを替える作業に時間が溶けます。人どうしの結論もそろわない基準は、機械を替えてもそろいません。
人の抜き取りは、何割を、いつ見るかを先に書く
採点役を入れても、人が見る範囲はなくなりません。なくすと、基準に書き忘れた種類の誤りが永久に見つからなくなるからです。ここで決めるのは、なくすかどうかではなく、どこを見るかです。決め方は単純で、社外に出るものは全件、社内に閉じるものは週に何件、と種類で書き分けます。割合で書くと、本数が増えた月に必ず溶けます。
- 抜き取る件数ではなく、抜き取る対象の種類を先に決める。社外に出るものは全件、社内向けは週に何件、と書き分ける
- 点が低かった件だけを見ると、基準に書き忘れた種類の誤りが永久に見つからない。点の高い件も一定数混ぜる
- 見る人は、基準を書いた人と別にする。書いた本人が見ると、基準の抜けが見えない
- 見た結果は、その場の直し指示ではなく基準の修正案として残す。同じ指摘が3回出たら基準を書き換える
- 抜き取りにかかる時間を、月ごとの工数に行として立てる。空いた時間でやる作業にすると続かない
2つ目は特に効きます。点が低い件だけを見る運用にすると、採点役が見落とした誤りは、点が高いまま通過して誰の目にも触れません。点の高い件を毎週3件だけ読む、という決めごとを足すだけで、基準の抜けが月単位で見つかるようになります。手間としては1人で30分程度です。
点が現場の感覚とずれ始めたときに気づく仕組み
採点役の点は、設定した日を過ぎると静かにずれます。理由は3つあり、使っているモデルの版が上がること、扱う題材の種類が変わること、基準の言葉の解釈が現場で変わることです。どれも1日では起きないので、気づいたときには半年分の点が使えなくなっています。なお、変更のたびに動作が壊れていないかを確かめる回帰テストとは目的が別で、そちらは別の記事で扱っています。ここで見るのは出力の側ではなく、採点役の点と人の判断の開きだけです。
気づき方は3つ置きます。1つ目は、点の分布を月に1度そのまま眺めること。平均が上がり続けている、あるいは上から2段階に集まっていく動きが出たら、中身ではなく採点の側を疑います。2つ目は、人との突き合わせを四半期に1度繰り返し、一致度の数字を前回と比べること。3つ目は、現場から「この点はおかしい」を戻せる窓口を1つ置くことです。
3つ目は仕組みとしては最も安くて、いちばん効きます。ただし、戻した意見がどうなったかが返ってこないと、2か月で誰も戻さなくなります。戻ってきた指摘を、基準を書き換えたかどうかまで含めて月に1度共有する。この往復があるかどうかで、採点役が使い続けられるか、1年で誰も見ない数字になるかが分かれます。
採点役に任せてよい範囲と、任せてはいけない判断
線の引き方は、材料を持っているかどうかで決まります。任せてよいのは、人が見る候補を絞ること、形式の確認、出力の並べ替え、点を付けた理由の下書きを書かせることです。これらはすべて、渡した基準と出力の中だけで完結します。渡した材料の範囲で答えが出る仕事は、任せても結果が検証できます。
任せてはいけないのは3つです。書かれている内容が事実かどうかの最終判定、その出力を社外に出してよいという判断、そして人の仕事の評価に点を転用することです。1つ目と2つ目は、判定に必要な材料が採点役の手元にありません。3つ目は、材料の問題ではなく、点の性質の問題です。採点役の点は基準に書いたことしか見ておらず、仕事の良し悪しを測るようには作られていません。
あわせて、運用の側で2つ決めてください。1つは、点だけでなく、その点を付けた理由を必ず書かせること。理由が基準の言葉で書かれていない件は、点が高くても採用しない、という扱いにします。もう1つは、人が確認する範囲を、本数が増える前に紙に書いておくことです。増えてから決めると、決める頃には誰も見ていません。
導入は、この順番でやると止まらない
最後に、入れる順番をまとめます。全社の全業務に一度に広げる進め方は、ほぼ確実に途中で止まります。止まる場所は決まっていて、基準を書く段で現場の合意が取れなくなるか、突き合わせをせずに運用に乗せて点が信用されなくなるかのどちらかです。1つの業務に絞って、次の5段で進めてください。全体で1か月ほどです。
対象の業務で、月に何件の出力が出て、そのうち人が実際に何件開いているかを数えます。数えると、たいてい想定の半分以下です。この数字が、後で効果を説明するときの出発点になります。
現場が下書きを書き、管理側が項目を削ります。項目は5つから8つに収めます。書いたら、人が2人で同じ10件を採点し、結論がそろうかを確かめます。そろわない項目は、この時点で書き直します。
本番で実際に出た出力を抜き、2人から3人が同じ基準で採点します。採点役の結論と突き合わせて一致度を出し、目安を下回ったら基準に戻ります。ここを飛ばすと、後の工程がすべて無駄になります。
字数・禁止語・必須項目・形式の確認は、採点役の手前で落とします。前段で落ちた件は採点役に渡しません。渡す件数が減るので、費用も、採点役が誤る機会も同時に減ります。
社外に出るものは全件、社内向けは週に何件、点の高い件も毎週何件、と種類で書きます。あわせて、点の分布を見る日と、人との突き合わせを繰り返す時期を先に決めます。
2つ目の業務に広げるのは、1つ目で一致度の数字が出てからにしてください。広げるときに持っていくのは設定ではなく、基準の書き方と突き合わせの手順のほうです。設定を複製しても、業務が違えば基準は書き直しになります。手順を持っていけば、2つ目は2週間ほどで立ち上がります。
これをやると、点は出るのに何も決まらない
ここまでの裏返しとして、点が出ているのに現場では何も変わらない状態を作る進め方を5つ挙げます。どれも悪意なく起きますし、実際によく見ます。心当たりがあるものから1つずつ外してください。
- 採点の基準を「分かりやすいか」「丁寧か」だけで書く:どの出力にも似た点が付き、直す場所が最後まで出てこない
- 生成に使ったのと同じ系統の採点役に、そのまま採点させて済ませる:点が全体に甘くなり、甘いことに気づく手掛かりも社内に残らない
- 人の採点と突き合わせないまま、点の平均を月次の会議に出す:数字が動いた理由を誰も説明できず、報告のたびに解釈が変わる
- 字数や禁止語の確認まで採点役にやらせる:確実に測れたはずの項目に、費用と揺れをわざわざ持ち込むことになる
- 基準を満たした件は人が一切見ない、と決める:基準に書き忘れた種類の誤りが、点が高いまま社外に出ていく
3つ目は、経営への報告で特に起きます。点の平均は数字として見栄えがよく、前月と比べやすいためです。ところが一致度を測っていないと、平均が上がったときに、出力が良くなったのか採点役が甘くなったのかを区別できません。報告に点を出すなら、一致度を最後に測った日も併せて書いてください。1行足すだけで、その数字の賞味期限が伝わります。
5つ目は、導入の効果を示したい時期ほど起きます。人が見る件数が減ったことを成果として出したくなるからです。ただし、基準に書き忘れた誤りは点に現れないので、人が見るのをやめた瞬間に発見の経路が消えます。点の高い件を毎週数件だけ読む、という最小の抜き取りだけは残してください。
よくある質問
採点役は、生成に使ったのと同じAIでよいですか
同じにすると、自分と同じ系統の出力を高く見るくせが働き、点が全体に甘くなります。別の系統にするのが基本です。事情があって同じになる場合は、月に1度、別の系統の採点役にも同じ件を採点させ、点の差が広がっていないかを見てください。差が一定を超えたら、そのときに切り替えを検討すれば間に合います。
点が高ければ、人の確認は省いてよいですか
省けません。採点役は基準に書かれたことしか見ていないので、基準に書き忘れた種類の誤りは、点が高いまま通過します。省いてよいのは、点が高い件を全部見るという運用のほうです。点の高い件から毎週数件を抜き取って読む形に変えれば、手間は大きく減り、基準の抜けを見つける経路は残ります。
基準は何項目くらいが適切ですか
1つの業務あたり5つから8つに収めてください。それ以上になると、人が同じ基準で採点する突き合わせの工程が現実的な時間で終わらなくなります。項目を増やしたくなったら、既存の項目のどれかが実際には使われていないはずなので、まず点の分布を見て、常に同じ結果しか出ていない項目を外してから足します。
採点役を入れると、費用はどれくらい増えますか
金額は扱う本数と使うモデルで変わるので一概には言えませんが、費用を左右するのは件数です。決まった規則で測れる検査を前段に置いて件数を絞ると、採点役に回る件数は現場の実感で半分以下になります。見積もりを取るときは、月の総本数ではなく、前段で落とした後の件数で出してもらってください。
まとめ
AIの出力をAIに採点させる仕組みは、人の確認を消す道具ではありません。人が見られる件数は変わらないという前提の上で、その件数をどこに使うかを選ぶための道具です。渡すものは、観察できる言葉に割った基準と、比べる相手と、出力そのものの3つ。返ってきた点は、人の採点と突き合わせて一致度を測るまで使い始めない。並び順・長さ・系統・抽象度の4つのくせは消えないので、消えない前提で人が見る範囲を残す。この4つを守れば、本数が増えても確認の体制は壊れません。手を付ける順番も決まっています。まず、いま月に何件出ていて、そのうち何件を人が開いているかを数えてください。この数字が出た時点で、採点役に何をさせるべきかは自動的に決まります。
※本記事にはAIが活用されています。編集者が確認・編集し、可能な限り正確で最新の情報を提供するよう努めておりますが、情報の完全性、正確性、最新性、有用性等について保証するものではありません。本記事の内容に基づいて行動を取る場合は、読者ご自身の責任で行っていただくようお願いいたします。
AI活用を戦略に落とす前に、まずは導入・定着から始めませんか?
デボノはアカウント開設・初期設定など「そもそものAI導入」から社内定着まで伴走支援。マーケティング活用など一歩進んだご相談にも対応します。
