Media > AI活用ユースケース > 人事 > 面接の評価シートの点数とコメントを毎月集計し、面接官ごとの甘辛と評価のぶれ、根拠の薄いコメントを拾って評価会議と面接官研修の資料にする

面接の評価シートの点数とコメントを毎月集計し、面接官ごとの甘辛と評価のぶれ、根拠の薄いコメントを拾って評価会議と面接官研修の資料にする

実装ステータス:構成例 技術的に実現可能な構成として設計したもの。自社未検証

面接の評価シートを月末にまとめ、面接官ごとの甘辛と評価のぶれを数字で出し、根拠の薄いコメントを拾います。結果を、面接官の評価をすり合わせる会議の資料と、面接官研修の事例集の下書きにします。

サマリー
生成AI
ChatGPT/Claude/Gemini
連携・自動化
Google Apps Script/Make/Power Automate/Python
対象業界
IT・SaaS/人材/製造/金融
対象部門
人事/採用
対象業務
内容確認・チェック/集計・分析
主な課題
判断に時間がかかる/属人化している/確認ミスが多い
AIで行う処理
判定
主な効果
判断支援/品質標準化/教育コスト削減
導入難易度
★★☆☆☆
実装レベル
半自動化
費用感
API連携(中)
人間の確認
条件付き
現在工数
18h/月
AI導入後
6h/月
想定削減
67%
年間削減
144h
モデル条件による試算値です。実在企業の実績ではありません。

01導入前 / 導入後の業務フロー

導入前(Before)
  1. 月末に、評価シートの回答のスプレッドシートを開き、その月の分を絞り込む
  2. 面接官ごとに点を並べ、平均点と「次へ進める」の割合を出す
  3. 二次面接で2名が見た候補者について、2名の点を横に並べて差を見る
  4. コメントを1件ずつ読み、印象だけのコメントや点と合わないコメントに印を付ける
  5. 印の付いたコメントから、会議で見せる例を選ぶ
  6. 面接官ごとの数字と例を、会議用の資料にまとめる
  7. 研修の時期には、良い例・悪い例を選び直して事例集にする
導入後(After)
  1. 人面接官が面接の後に評価シートをフォームで出す(今までどおり)
  2. 自動毎月1日の朝、スクリプトが前月の評価シートを取り出し、採用管理の仕組みの選考結果と候補者IDでつなぐ
  3. 自動候補者の氏名や前職の会社名など、判定に要らない情報を伏せる
  4. 自動評価シートを1枚ずつ Claude API に送り、項目ごとのコメントの根拠の種類と、点との食い違いを判定させる
  5. 自動同じ候補者を見た面接官どうしの点の差から、面接官ごとの甘辛とぶれを計算する
  6. 自動件数の足りない面接官は、直近3か月分で計算し直し、それでも足りなければ数字を出さない
  7. 自動面接官ごとの表と、根拠の薄いコメントの率、事例の候補を一覧のシートに書く
  8. 人採用担当が一覧を確かめ、会議で示す数字と事例を選ぶ
  9. 人評価会議で面接官と数字を見ながら話し、研修の時期には事例集を直す
各工程の詳しい説明を読む
  1. 月末に、評価シートの回答のスプレッドシートを開き、その月の分を絞り込む
  2. 面接官ごとに点を並べ、平均点と「次へ進める」の割合を出す
  3. 二次面接で2名が見た候補者について、2名の点を横に並べて差を見る
  4. コメントを1件ずつ読み、印象だけのコメントや点と合わないコメントに印を付ける
  5. 印の付いたコメントから、会議で見せる例を選ぶ
  6. 面接官ごとの数字と例を、会議用の資料にまとめる
  7. 研修の時期には、良い例・悪い例を選び直して事例集にする

(a)平均点で甘辛を語ってしまう。 2番目で出す平均点は、担当する職種や応募者の層で大きく変わります。採用の難しい職種の面接官は、応募者の層が厳しいだけで「辛い」と言われます。 3番目の差の比較は手間がかかるので、件数の多い面接官だけで終わります。

(b)コメントを読み切れない。 360枚に5項目ずつのコメントがあり、総数は1,800件です。採用担当3名で分けても、月末の数日で読み切れません。 結局、目に付いたものに印を付け、残りは読まずに終わります。

(c)印の付け方が人によって違う。 「論理的に話せる」は印象か根拠か。担当者によって判断が分かれ、ある面接官の「根拠の薄いコメント」の数が、読んだ担当者で変わります。 会議で示しても、数字の信頼が揺らぎます。

(d)研修の事例が古いまま。 新しい事例を選ぶには、1,800件の中から良い例と悪い例を探す必要があります。毎月の資料づくりで手一杯で、事例集は更新されません。 面接官は同じ事例を何度も見ています。

  1. 【人】 面接官が面接の後に評価シートをフォームで出す(今までどおり)
  2. 【自動】 毎月1日の朝、スクリプトが前月の評価シートを取り出し、採用管理の仕組みの選考結果と候補者IDでつなぐ
  3. 【自動】 候補者の氏名や前職の会社名など、判定に要らない情報を伏せる
  4. 【自動】 評価シートを1枚ずつ Claude API に送り、項目ごとのコメントの根拠の種類と、点との食い違いを判定させる
  5. 【自動】 同じ候補者を見た面接官どうしの点の差から、面接官ごとの甘辛とぶれを計算する
  6. 【自動】 件数の足りない面接官は、直近3か月分で計算し直し、それでも足りなければ数字を出さない
  7. 【自動】 面接官ごとの表と、根拠の薄いコメントの率、事例の候補を一覧のシートに書く
  8. 【人】 採用担当が一覧を確かめ、会議で示す数字と事例を選ぶ
  9. 【人】 評価会議で面接官と数字を見ながら話し、研修の時期には事例集を直す

8番目と9番目が、人の仕事として残る部分です。 数字をどう伝えるかは、面接官との関係を知っている採用担当が決めます。事例も、AIが選んだ候補から人が選びます。 候補者が特定されるような事例を研修で見せないためです。

5番目と6番目を式に置いているのは、面接官に説明するためです。 「二次面接でBさんと一緒に見た12名について、Aさんの総合の点はBさんより平均0.7高い」と言えば、Aさんは自分の記憶と照らせます。AIの印象で「甘い」と言われても、本人は納得しません。

02今回想定するシステム構成

構成図
Google フォーム(面接の評価シート)
   ▼ 回答のスプレッドシート
採用管理の仕組み ── 選考結果の CSV(共有ドライブ)
   ▼
【トリガー】時間主導型(毎月1日の朝)
Google Apps Script
   ├──▶ 前月分の取り出し、候補者IDで選考結果とつなぐ、伏せ字
   ▼
Claude API(構造化出力)
   │   項目ごとのコメントの根拠の種類/点との食い違い/事例の候補
   ▼
Google Apps Script ── 甘辛とぶれの計算、件数の確認、一覧のシートへ書き出し
   ▼
【採用担当が数字と事例を選び、評価会議と研修で使う】
役割想定する製品代替候補
実行環境Google Apps ScriptPower Automate、Make、Python
生成AIClaude API(構造化出力)Gemini API、OpenAI API
シートGoogle スプレッドシート(評価シートの回答・面接官の一覧・結果の一覧)Microsoft 365 のブック
選考結果採用管理の仕組みが出す CSV採用管理の仕組みの API(使える場合)

新しく足すのは、スクリプトと Claude API の契約だけです。 評価シートのフォームも、採用管理の仕組みも、今あるものを使います。採用管理の仕組みには書き込みません。 選考結果は CSV を読むだけで、スクリプトが書くのは結果の一覧のシートだけです。

土台になるのは、Google Apps Script の時間主導型のトリガーです。 毎分から毎月までの間隔で関数を動かせ、インストール型トリガーは作成した人のアカウントで実行されます。 評価シートの回答は候補者の個人の情報を含むので、採用担当のアカウントで作り、他の人の権限で動かないようにします。

スクリプトの実行時間には上限があります。 1回の実行は6分まで、トリガーの合計の実行時間は Google Workspace のアカウントで1日6時間まで、外部へのURLの呼び出しは1日100,000回までとされています。360枚を1枚ずつ Claude API に送ると6分を超えるので、どこまで送ったかを記録し、続きのトリガーで再開します。

構造化出力は Claude API の output_config.format で指定します。 type を json_schema にしてスキーマを渡し、すべてのオブジェクトに additionalProperties: false を付けます。 根拠の種類などの選択肢は enum で列挙できます。一方、minimum・maximum のような数値の制約は使えないので、点数の範囲はスキーマではなくスクリプトで確かめます。

03どうやって実装するのか

Step1

処理の起点を決める

時間主導型のトリガーを、毎月1日の朝6時台に1つ置きます。 前月末の面接の評価シートは、翌日に出されることもあります。1日の朝ではまだ出ていないシートがあるため、月末の最終日の面接は翌月の集計に回します。 「面接日が前月の25日まで」を前月分とし、26日以降は翌月分に入れます。

処理は3つの段に分けます。 1段目で取り出し・選考結果とのつなぎ・伏せ字、2段目でコメントの判定、3段目で甘辛とぶれの計算と一覧への書き出しです。2段目の途中で6分に近づいたら、どのシートまで送ったかをスクリプト プロパティに残して止まり、 同じ朝の15分後から15分おきに置いた続きのトリガーで再開します。

会議の日程に合わせて、手で動かすこともできるようにします。 会議が月の半ばにある場合は、前月分を早めに出したいことがあります。手で動かすときは、対象の期間を設定のシートに書いてから実行します。

判定は同じシートについて二度行いません。 判定の結果を書いたシートには judged の印を付け、期間を変えて手で動かしても、判定済みのシートは送らずに結果を読むだけにします。

Step2

入力データを集める

データ中身取得元
評価シート面接日、選考段階、職種、候補者ID、面接官、5項目の点とコメント、総合の点、意見回答のスプレッドシート
選考結果候補者ID、各段階の合否、最終の結果(内定・辞退・見送り)採用管理の仕組みの CSV
面接官の一覧面接官の社員番号、氏名、所属、面接官になった時期、研修の受講歴面接官の一覧のシート
評価の基準5項目それぞれの点の目安(1〜5で何ができていればその点か)と、行動の記述の例評価の基準のシート
前月までの結果面接官ごとの甘辛・ぶれ・根拠の薄いコメントの率結果の一覧のシート

AIに渡すのは、評価シート1枚の点とコメントと、その職種の評価の基準だけです。 面接官の名前も、候補者の合否の結果も渡しません。面接官の名前を渡すと、前月までの判定に引っ張られます。 合否を渡すと、見送った候補者のコメントを厳しく判定するようになります。

評価の基準のシートが、判定の質を決めます。 「主体性が4」とは、どういう行動を話した人か。基準が点ごとの行動で書かれていれば、AIはコメントが基準のどの行動に当たるかを見て、点との食い違いを判定できます。 基準が「主体性がある」だけなら、食い違いは判定できません。

Step3

データの取得方法を決める

評価シートの回答は、スプレッドシートの範囲をまとめて読み、面接日で前月分を絞り込みます。甘辛の計算には直近3か月分も読みます。 件数の少ない面接官の計算に使うためです。

取るものどこから何に使うか
前月と直近3か月の評価シート回答のスプレッドシート判定の対象と、甘辛の計算
選考結果共有ドライブの CSV次の段階での結果との照合
面接官の所属と研修の受講歴面接官の一覧一覧の表の列
評価の基準評価の基準のシートプロンプトに埋め込む
前月までの結果結果の一覧のシート前月との比較

選考結果の CSV は、採用管理の仕組みから月末に採用担当が出して共有ドライブに置きます。 採用管理の仕組みの API が使えれば自動で取れますが、使えるかは仕組みによります。CSV の置き忘れに備え、ファイルの更新日が前月末より前なら処理を止めて知らせます。

Claude API は UrlFetchApp で呼び、鍵はスクリプト プロパティに置きます。 プロパティはキーと値の文字列で保存されます。muteHttpExceptions を true にして、失敗の状態コードでも応答を受け取り、送り直すかを決めます。

Step4

AIへ渡す前に整形する

  1. 期間の絞り込み … 面接日で前月分(26日〜25日)を取り出します
  2. 選考結果とのつなぎ … 候補者IDで選考結果をつなぎます。つながらないシートは「ID不一致」として数え、判定はしますが甘辛の計算には入れません
  3. 伏せ字 … コメントの中の候補者の氏名、前職・現職の会社名、学校名を [伏せ字] に置き換えます。氏名は採用管理の仕組みの CSV の氏名と照らし、会社名と学校名は応募書類の項目と照らします
  4. 点数の確認 … 5項目と総合の点が1〜5の整数かを確かめ、外れていれば「点数不正」としてそのシートを外します
  5. 同席の組の作成 … 同じ候補者・同じ段階を2名で見たシートを組にします
  6. 空欄のコメントの扱い … コメントが空欄の項目は、AIに送らず empty として数えます

3番目を省かないでください。 評価のコメントには「△△社でのプロジェクトで」と前職が書かれることがよくあります。判定に会社名は要らず、研修の事例に使うときには必ず消す必要があります。 AIに渡す前に消しておけば、事例の候補にも残りません。

6番目で空欄をAIに送らないのは、空欄に何かを判定させないためです。 空欄を送ると、AIは「記述がないため根拠なし」と書くだけでなく、点から推して「おそらく〜と評価した」と補うことがあります。 空欄は空欄として数えます。

Step5

AIに処理させる

させるのは、評価シート1枚について、項目ごとのコメントの根拠の種類と、点との食い違いを判定し、研修の事例に向くかの印を付けることです。

させること中身判断できないときの扱い
根拠の種類behavior(候補者が話した行動・事実の記述)/impression(印象・形容だけ)/hearsay(書類の転記だけ)混ざっていれば主な方。迷えば impression にしない(unclear)
点との食い違いコメントの内容が、その職種の基準で何点の行動に当たるかを見て、付けた点と2点以上離れていれば inconsistent基準と照らせなければ unclear
根拠にした語句判定に使った語句をコメントからそのまま写す—
事例の候補good_example(行動の記述が具体的)/training_example(印象だけで点が高い・低い)どちらでもなければ付けない

根拠の種類で迷ったときに impression にしないのは、面接官に対して公平にするためです。 印象と判定されたコメントの率は、評価会議で面接官ごとに示されます。迷ったものを印象に寄せると、短く書く癖のある面接官の率が実際より高く出ます。 迷ったものは unclear にして、率の計算から外します。

させないこと理由
面接官の甘辛やぶれの判定同席の組の点の差から式で出す。AIに言わせない
面接官の良し悪しの評価すり合わせの材料で、人事評価ではない
候補者の合否や点の付け直し面接の場にいたのは面接官だけ
コメントに書かれていない根拠の補い書かれていないことを書かれたことにしない
研修の事例を書き換えて作ること事例は実際のコメントから選び、伏せ字だけを足す

いちばん起きやすい失敗は、4行目です。 「主体性が高い」とだけ書かれた欄に、AIは「プロジェクトを自ら推進した経験から」と補って behavior と判定することがあります。補った根拠で判定すると、印象だけのコメントが行動の記述として数えられ、その面接官の率が下がります。 根拠にした語句をコメントからそのまま写させ、写した語句がコメントの中に本当にあるかをスクリプトで確かめます。

Step6

指示内容を固定する

あなたは人事部の採用担当で、面接官が書いた評価シートのコメントを点検する立場です。
面接官の良し悪しや、候補者の合否を判断する立場ではありません。

【この職種の評価の基準】{criteria}
(5項目それぞれについて、1〜5の点ごとに、どういう行動を話した人がその点かの目安)

【根拠の種類(項目ごとに1つ)】
- behavior .. 候補者が面接で話した行動・事実・数字の記述がある
              例:「前のチームで障害が続いた月に、自分から週次の振り返りを始めた」
- impression  印象や形容だけで、行動の記述がない
              例:「主体性を感じた」「論理的」「感じが良い」
- hearsay ... 応募書類の内容を写しただけで、面接で確かめた記述がない
- unclear ... 上のどれと決めきれない

【点との食い違い(項目ごとに1つ)】
- consistent ... コメントの行動が、付けた点の基準とおおむね合う
- inconsistent . コメントの行動が、基準で2点以上離れた点に当たる
- unclear ...... コメントだけでは基準と照らせない

【厳守事項】
- コメントに書かれていない行動や事実を補わないでください。
- evidence には、判定に使った語句をコメントからそのまま写してください。
  コメントに無い言葉を evidence に書かないでください。
- 迷ったときは impression ではなく unclear を選んでください。
- 点数を付け直したり、候補者の合否を判断したりしないでください。
- 面接官の評価の癖や良し悪しを書かないでください。
- [伏せ字]の中身を推測しないでください。
- 項目の id をそのまま返し、項目を増やしたり減らしたりしないでください。

【評価シート(項目の id、項目名、点、コメント)】{sheet}

「迷ったら unclear」と「evidence はコメントからそのまま」が、この指示の2本の柱です。 前者は面接官ごとの率を公平にするため、後者は書かれていない根拠を補わせないためです。どちらも、面接官本人に数字を見せたときに「それは自分のコメントのどこから言っているのか」と聞かれて答えられるようにする仕掛けです。

評価の基準を毎回のプロンプトに入れるのは、職種ごとに基準が違うからです。 エンジニアの「専門性4」と営業の「専門性4」は別の行動です。基準を渡さずに食い違いを判定させると、AIは一般的な感覚で点を当てます。

Step7

出力形式を固定する

次の形のJSONで受け取ります。 output_config.format の type を json_schema にし、evidence_type と consistency と example_tag を enum で列挙します。

{
  "sheet_id": "EV-2026-09-0217",
  "items": [
    {
      "item_id": "initiative",
      "evidence_type": "behavior",
      "consistency": "consistent",
      "evidence": "障害が続いた月に自分から週次の振り返りを始めた",
      "example_tag": "good_example"
    }
  ]
}

1つ目の理由は、evidence をスクリプトで照合できることです。 evidence の文字列が、伏せ字済みのコメントの中にそのまま含まれるかを確かめます。含まれなければ、AIが補った根拠です。 その項目の判定を unclear に置き換え、「根拠不一致」として記録します。

2つ目は、項目ごとの判定を面接官ごとに数えられることです。 evidence_type が impression の率、consistency が inconsistent の率を、面接官ごとにスクリプトが数えます。AIは1枚ずつしか見ていないので、面接官の癖を言うことはできません。 癖は数えた結果から人が読みます。

3つ目は、出力を確かめる手順がはっきりすることです。 公式の説明では、stop_reason が refusal のときは出力がスキーマに合わないことがあり、max_tokens のときはJSONが途中で切れるとされています。end_turn 以外の応答は使わず、そのシートを送り直しの待ちに入れます。

一覧のシートには、面接官ごとに次の列を並べます。 甘辛とぶれはスクリプトの計算です。

列中身計算の仕方
件数前月の評価シートの枚数、同席の組の数数える
甘辛同席の相手との総合の点の差の平均(+は甘い)組ごとの差を平均。組が8に満たなければ直近3か月で計算
ぶれ同席の相手との差のばらつき(標準偏差)同上
次の段階との一致「次へ進める」とした候補者が次の段階でも通った割合選考結果とつないで数える
印象だけのコメントの率impression ÷(判定した項目 − unclear)数える
点と食い違うコメントの率inconsistent ÷(判定した項目 − unclear)数える
件数の注意直近3か月でも組が8に満たない数字を出さず「件数不足」
Step8

システムへ連携する

つなぎ先方式内容
回答のスプレッドシート読み取りのみ評価シート
共有ドライブの CSV読み取りのみ選考結果
面接官の一覧・評価の基準読み取りのみ所属、受講歴、職種ごとの基準
Claude APIUrlFetchApp で呼び出し項目ごとの判定
結果の一覧のシート書き込み面接官ごとの表、項目ごとの判定、事例の候補

評価シートの回答には書き込みません。 判定済みの印は、結果の一覧のシートの側に sheet_id と並べて持ちます。面接官が出した評価そのものに手を入れる経路を作らないためです。

結果の一覧のシートは、採用担当だけが開けるようにします。 面接官ごとの数字が入ったシートを面接官全員に共有すると、会議での伝え方を決める前に数字だけが広まります。 会議では、採用担当が選んだ数字と事例だけを資料に写します。

Step9

人が確認する

  1. 件数不足と ID 不一致を先に見る … 数字が出ていない面接官と、選考結果とつながらないシートを確かめます
  2. 甘辛の大きい面接官の組を見る … 差が大きい面接官について、どの組で差が出ているかを1組ずつ見ます。 相手の面接官が極端なだけ、ということがあります
  3. 根拠不一致の項目を見る … AIが補った根拠を出した項目です。判定を直すかを決めます
  4. 事例の候補から選ぶ … 研修や会議で見せる事例を選び、伏せ字が十分か、候補者が特定されないかを読みます
  5. 伝え方を決める … 面接官ごとの数字を、会議で全員に見せるか、本人に個別に伝えるかを決めます

2番目を省かないでください。 甘辛は相手との差なので、相手の面接官が辛ければ、こちらが甘く見えます。 組の相手が偏っていないかを見てから、本人に伝えます。

目標は、360枚をならして1枚1分です。 人が見るのは甘辛の大きい面接官の組と、根拠不一致の項目と、事例の候補で、残りは一覧を流し見る、という想定です。

Step10

例外に対処する

起きること対応
候補者IDが選考結果とつながらない「ID不一致」として判定はするが、甘辛と次の段階との一致の計算から外す
選考結果の CSV が古い処理を止め、採用担当に CSV の置き直しを知らせる
点数が1〜5の整数でない「点数不正」としてそのシートを外し、面接官に直してもらう
同席の組が8に満たない直近3か月で計算し直し、それでも足りなければ「件数不足」
stop_reason が end_turn 以外そのシートを送り直しの待ちに入れ、2回続けば人へ
evidence がコメントに含まれないその項目を unclear に置き換え、「根拠不一致」として記録
返ってきた項目の数が合わないそのシートを送り直す
6分に近づいたどこまで送ったかを記録し、続きのトリガーで再開
評価の基準が職種で用意されていない食い違いの判定をせず、根拠の種類だけを判定する

いちばん多いのは、1行目と4行目です。 候補者IDの書き間違いと、二次面接の件数の少ない面接官です。どちらもAIの問題ではなく、フォームの作りと面接の組み方の問題です。 候補者IDを選択式にし、同じ面接官どうしが固定で組まないように面接を割り振るほうが、甘辛の数字が早く安定します。

Step11

記録を残す

  • 処理した期間、評価シートの枚数、判定したシートの数、外したシートの数と理由
  • 項目ごとの判定(evidence_type、consistency、evidence、example_tag)と、根拠不一致の記録
  • 面接官ごとの甘辛・ぶれ・率と、計算に使った組の候補者IDの一覧
  • そのとき使った評価の基準の版と、プロンプトの版
  • 会議で示した数字と事例、伝え方(全体か個別か)
  • 研修を受けた面接官の、受講の前後の数字

3つ目で組の候補者IDを残すのは、面接官から「どの候補者のことか」と聞かれたときに答えるためです。 数字だけを示して根拠をたどれないと、すり合わせの会議が数字の信頼の話で終わります。

最後の行は、研修の効果を見る材料です。 研修の後に印象だけのコメントの率が下がったか、同席の相手との差が縮んだか。ただし件数が少ないうちは、上下は偶然の範囲に収まります。 3か月以上並べてから読みます。

04実装レベルの3段階

最小構成:同席の組を手で数え、コメントだけAIの画面で判定させる / 試しの判定と、基準の詰め
半自動化:上記+毎月1日にスクリプトが全シートの判定と、面接官ごとの甘辛・ぶれ・率の計算まで行い、一覧に書く / 月次の集計と判定、事例の候補
本格構成:上記+研修の前後の数字の比較と、面接の割り振りで同じ組が続かないようにする案を出す / 研修の効果の確認と、面接の組み方まで

本記事が想定するのは半自動化です。 数字の伝え方と事例の選択は採用担当が行います。1枚3分が1分になるのはこの段階です。 本格構成に進むのは、半年ほど数字がたまってからにしてください。 研修の前後を比べるには、研修の前に十分な件数が要ります。件数が少ないまま効果を言うと、偶然の上下を研修の成果と読み違えます。

05工数削減シミュレーション

前提値(モデル条件)
対象人数
3 名
月間件数
360 件
1件あたり現在時間
3 分
1件あたり導入後時間
1 分
現在  360件 × 3分 ÷ 60 = 18 時間/月
導入後 360件 × 1分 ÷ 60 = 6 時間/月
月間削減時間
12h
削減率
67%
年間削減時間
144h
年間金額換算(時間単価4,000円)
58万円
モデル条件による試算であり、実際の効果は業務内容・運用方法によって異なります。

自社条件で導入効果を整理したい方へ

このユースケースを自社に当てはめた場合の前提値と削減見込みを、業務ヒアリングをもとに整理します。

AI活用について相談する

06向いている企業・向いていない企業

向いている
  1. 中途採用を通年で行い、現場の社員が面接官を務める会社で、面接官が20名以上いて、評価の甘い人・辛い人がいるという声が出ている場合。評価シートを Google フォームやスプレッドシートで集めており、二次面接などで2名の面接官が同じ候補者を見る場面がある場合。採用担当が毎月または四半期ごとに面接官の評価をすり合わせる会議や研修を開いているが、資料づくりに時間がかかっている場合。
向いていない
  1. 面接官が数名で、採用担当が全員の評価の癖を把握できている場合。面接が月に数件で、面接官ごとの数字を出しても件数が足りず、甘辛を言えない場合。評価シートを紙や自由な文書で集めていて、点数の項目がそろっていない場合。面接官の人事評価や処遇にこの数字を使いたい場合(この構成は評価のすり合わせと研修のためのものです)。

07最小構成で試す方法

  1. 前月の二次面接の評価シートから、同席の組を20組(40枚)選ぶ
  2. 2名の総合の点を横に並べ、面接官ごとに差を手で数える
  3. 40枚のコメントの氏名・会社名を手で伏せる
  4. 社内で使ってよいAIサービスの画面に、評価の基準と40枚を貼り、「項目ごとに、候補者の行動の記述があるか、印象だけかを判定し、根拠の語句をコメントからそのまま写してください。迷ったら unclear にしてください」と指示する
  5. AIの判定を、採用担当2名が同じ40枚に付けた判定と突き合わせる

ここで確かめたいのは、根拠の種類の判定が採用担当の感覚と合うかです。 甘辛の計算は式なので、手で数えれば試せます。

出てきた内容判断
採用担当の判定とおおむね同じスクリプトでの自動化に進む
採用担当2名どうしが割れた項目で、AIも揺れる基準と根拠の種類の例を書き足す。 構成は有効
AIがコメントに無い根拠を写すevidence の照合で止められる。構成は有効

2行目は、これまで担当者によって印の付け方が違っていた項目です。 基準の文章を直せば、AIを入れる前から会議の数字が安定します。

08実装時につまずきやすいポイント

問題対策
平均点で甘辛を言ってしまう同席の組の差で測る。 平均点は職種と応募者の層で動く
件数の少ない面接官に数字を出す組が8に満たなければ3か月で計算し、足りなければ出さない
相手の面接官が極端で甘く見える組ごとの差を人が1組ずつ見る
AIがコメントに無い根拠を補うevidence がコメントに含まれるかをスクリプトで照合する
迷ったコメントを印象に寄せる迷ったら unclear。 率の計算から外す
評価の基準が無く食い違いを判定できない基準の無い職種は根拠の種類だけを判定する
面接官の名前や合否を渡して判定が寄るAIに渡すのは点とコメントと基準だけ
研修の事例で候補者が特定される伏せ字に加え、人が事例を読んでから使う
一覧のシートを面接官全員に共有する採用担当だけが開ける。会議では選んだ数字だけを見せる
数字を人事評価に使う使わない。 すり合わせと研修のためと決めておく

上の3行は、甘辛の数字を面接官に信じてもらえるかを決めます。 平均点で「甘い」と言われ、件数3件で「ぶれが大きい」と言われた面接官は、次の会議から数字を見なくなります。 式は単純でも、組の差で測り、件数を確かめてから出します。

09セキュリティ・AIガバナンス上の注意点

この構成で扱うデータ: 候補者についての面接官の評価(点とコメント)、候補者ID、選考の結果、面接官の氏名と所属です。候補者にとっても面接官にとっても、外に出てはならない情報です。

  1. 候補者の情報を最小にして渡す … AIに渡すのは伏せ字済みのコメントと点だけです。氏名、前職、学校名は渡す前に消し、合否の結果も渡しません
  2. API の利用条件を確かめる … 候補者の評価という個人の情報を外部の API に送るので、契約の前に API のデータの扱いを確かめ、自社の個人情報の取り扱いの規程で外部への提供・委託に当たるかを決めておきます
  3. 面接官の人事評価に使わない … この数字は、評価のすり合わせと研修のためのものです。人事評価に使うと、面接官は同席の相手に点を合わせるようになり、甘辛は消えても評価の中身が失われます
  4. 評価の基準を適性と能力に置く … 厚生労働省は、採用選考を応募者の適性・能力に基づいた基準で行うことを基本としています。この構成で判定するのも、職務に必要な適性・能力に照らした評価の基準です。「当社との相性」のような項目は、基準を行動で書き、職務と関係のない事柄で点が決まらないようにします
  5. 研修の事例を外に出さない … 事例は実際のコメントから作るので、伏せ字をしても、社内で読めば候補者の見当がつくことがあります。研修の資料は面接官だけに配り、終わったら回収するか、閲覧の期限を付けます

誤りが起きた場合のリスクは、面接官を不当に「甘い」「根拠が薄い」と言ってしまうことと、候補者の情報が研修の資料から漏れることの2つです。 前者は件数の確認と unclear と組の確認で、後者は伏せ字と人の読みで防ぎます。

10まず何から始めるか

1週目:評価の基準を行動で書く

採用の多い職種から2つ選び、5項目それぞれについて1〜5の点ごとに、どういう行動を話した人がその点かを書きます。面接官の数名に読んでもらい、自分の付け方と合うかを聞きます。

2週目:同席の20組で試す

前月の二次面接から20組を選び、総合の点の差を手で数えます。コメントは伏せ字をしてから、社内で使ってよいAIサービスで根拠の種類を判定させ、採用担当の判定と並べます。

3週目:フォームと数字の扱いを決める

候補者IDを選択式にし、数字を出す件数の線(組8)と、数字を誰にどう見せるかを、人事の責任者と決めます。 面接官に、数字を人事評価に使わないことを伝えます。

4週目:スクリプトで判定と計算までをつなぐ

毎月1日に動くトリガーを置き、判定と甘辛・ぶれの計算を一覧のシートに書くところまで作ります。この時点では会議に出さず、採用担当の中で数字を確かめます。

2か月目: 評価会議で、採用担当が選んだ数字と事例を使い始めます。3か月目以降: 研修の事例集を新しい事例で作り直し、1枚3分が何分になったかを実測します。会議で甘辛が数字と組の根拠で話されるようになった時点で、この構成は完成です。


11関連ユースケース

12この仕組みを理解するための記事

13技術仕様の確認日・参考情報

技術仕様確認日:2026-10-07/最終更新:2026-10-07
確認した内容情報源確認日
時間主導型のトリガーが毎分から毎月までの間隔で動かせること。インストール型トリガーは作成した人のアカウントで実行されることGoogle: Installable triggers2026-10-07
1回の実行が6分まで、トリガーの合計実行時間が Workspace のアカウントで1日6時間、URLの呼び出しが1日100,000回であることGoogle: Quotas for Google Services2026-10-07
UrlFetchApp の fetch、muteHttpExceptions を true にすると失敗の応答でも例外にならず応答が返ることGoogle: Class UrlFetchApp2026-10-07
プロパティがキーと値の文字列で保存され、スクリプト プロパティがアプリ全体の設定に使われることGoogle: Properties Service2026-10-07
構造化出力を output_config.format(type に json_schema)で指定すること。すべてのオブジェクトに additionalProperties: false が要り、minimum・maximum などは使えないこと。enum が使えること。stop_reason が refusal ではスキーマに合わないことがあり、max_tokens ではJSONが途中で切れることClaude API Docs: Structured outputs2026-10-07
採用選考を、応募者の基本的人権を尊重し、応募者の適性・能力に基づいた基準により行うことを基本とすること厚生労働省: 公正な採用選考の基本2026-10-07

数字を出す件数の線と、面接官への伝え方は、自社の人事で決めてください。 本記事は公式ページで確認できた範囲だけを扱っています。

実装ステータス:構成例。 公開仕様に基づいて設計した構成であり、当社で実際に構築・検証したものではありません。工数の数値はモデル条件による試算です。

自社の業務に使えるAI活用候補を整理します

このユースケース(UC-0785)についてのご相談はこちらから。

AI活用について相談する
目次