データエンリッチメントとは?|リード情報をAIで補う線

データエンリッチメントとは?|リード情報をAIで補う線

「データエンリッチメントを入れれば、空欄だらけのリードが一気に埋まるのでは」「AIに会社名を渡せば、業種も従業員数も書いてくれるはず」。こうした期待を聞くたびに、少し立ち止まって考えたくなります。空欄が減ること自体は、成果ではないからです。データエンリッチメントは、欄を埋める作業ではありません。本当は、どの値がどこから来て、いつ確かめたものかを残したまま、使い道のある属性だけを足す作業です。この記事では、データエンリッチメントの意味、付け足す材料の出どころと確かさの違い、推測の値と確かめた値を分けて持つ設計、補った属性の使い方と更新の周期、AIに任せてよい範囲を手順に沿って整理します。


カメ先生カメ先生

データエンリッチメントは、すでに集めたリードに、後から会社の情報や属性を書き足すことを指すんだ。フォームで聞けなかった業種や規模を、別の材料から補うわけだね。


カメ子カメ子

空いている欄を全部埋めれば、それで完成になるのでしょうか。


カメ先生カメ先生

そこが落とし穴でね。材料によって確かさがまるで違うし、生成AIは分からない値でももっともらしく書いてしまう。だから値ごとに出どころと取得日を残し、推測で埋めた値は区別して持つ。AIには表記の正規化や候補出しまでを任せて、根拠を書かせる。使ってよいかは人が決めるんだ。


カメ子カメ子

埋めた量ではなく、値の素性が分かることが大事なのですね。


この記事のポイント
  • データエンリッチメントは、集めたリードに業種・規模・所在地などの属性を後から足すこと。欄を埋めること自体は目的ではない
  • 材料は法人番号の公表データ・公開情報・有償の企業データベース・MAやCRMの付与機能の4種類で、確かさが違う
  • 値ごとに出どころと取得日を列で残し、推測の値と確かめた値を分ける。AIに分からない値を推測で埋めさせない

リード獲得・育成の打ち手として、ウェビナーの集客と運営でお困りですか?

企画・集客・運営までデボノが伴走支援。外部リスト頼みにしない「自社の集客力」を育てます。

目次

データエンリッチメントとは、集めた後に属性を足すこと

データエンリッチメントとは、手元にある顧客や見込み客のデータに、別の材料から得た情報を後から付け足して、データを使える状態にすることです。法人向けのマーケティングでは、フォームや名刺、展示会の来場記録で集めたリードに、業種・従業員の規模・本社の所在地・法人番号・部署や役職の区分といった企業の情報や属性を足す作業を指すのが一般的です。

なぜ後から足す必要があるのでしょうか。理由は、入口で聞ける項目に限りがあるからです。資料請求のフォームに項目を増やすほど、送信する人は減ります。そのため多くの会社は、会社名・氏名・メールアドレスといった最小限の項目だけを入口で聞き、残りの属性を後から補う形を取ります。入口の項目を軽くする代わりに、後工程で情報を足すという役割分担です。

ここで押さえておきたいのは、足す対象が大きく二つに分かれることです。一つは会社に付く情報で、業種や規模、所在地など、同じ会社のリードなら誰でも同じ値になります。もう一つは人に付く情報で、部署や役職の区分がこれに当たります。会社に付く情報は公的な材料で確かめやすく、人に付く情報は確かめにくいという差があり、この差が後で説明する設計の前提になります。

「足せば足すほど良い」は誤解である

データエンリッチメントについてよくある誤解は、項目を多く足すほどデータの価値が上がるという考え方です。実際には、使い道の決まっていない項目は、足した瞬間から手入れの負担だけを生みます。値は時間とともに古くなり、古い値が残っていると、それを信じた配信や振り分けが外れます。

もう一つの誤解は、空欄は悪で、何かしらの値が入っている方が良いという考え方です。これは逆で、確かめられない値を推測で入れるくらいなら、空欄のまま「未確認」と分かる状態の方が安全です。空欄は「分からない」という正しい情報を伝えていますが、推測で埋めた値は、分からないことを分かったように見せてしまうからです。

三つ目の誤解は、一度足せば終わりという考え方です。会社は移転し、社名を変え、合併し、人は異動します。足した属性にはそれぞれ古び方の速さがあり、更新の周期を決めずに足すと、半年後には誰も信用しない列が増えるだけになります。この記事の手順は、使い道から項目を決め、素性を残し、更新まで決めてから足すという順番で組んでいます。

属性の補完と、似た作業との違い

データエンリッチメントと混同されやすい作業がいくつかあります。一つ目はリストの整備で、重複した会社をまとめる名寄せ、社名や住所の表記をそろえる表記統一、古い情報を直す鮮度の維持がこれに当たります。これらは今ある値を正しく整える作業で、無い値を新しく足すデータエンリッチメントとは目的が違います。リスト整備の5つの工程は、リードリスト整備を扱った記事で詳しく整理しています。

二つ目は、行動から買う気を読むインテントデータです。どんな資料を読んだか、どんな言葉で調べたかといった行動の兆しは、その会社が今どのくらい検討を進めているかを示します。一方でデータエンリッチメントが足すのは、業種や規模のように行動と関係なく決まっている属性です。属性は「どんな会社か」を、行動の兆しは「今どう動いているか」を表すもので、両者は別物として扱います。

三つ目は、数値の欠けを統計的に埋める補完です。売上や来店数のような数値の抜けを、周りの値から推し量って埋める手法がありますが、これは分析の途中で使う技術で、リードの属性を確かな材料で足す作業とは考え方が逆です。データエンリッチメントでは、推し量った値を確かな値と同じ列に入れないのが原則になります。

付け足す材料の出どころは4種類

付け足す材料は、出どころで大きく4種類に分けられます。法人番号の公表データなどの公的な情報、相手の会社の自社サイトや公開されている資料、有償の企業データベース、そしてMAやCRMに備わっている付与の機能です。出どころによって、確かさ・費用・更新のされ方が大きく違います。

出どころ得やすい属性確かさ注意点
法人番号の公表データ・国の法人情報サイト法人番号・正式な社名・本店の所在地・資本金や従業員数(登録がある会社)高い(公的な登録に基づく)項目が登録されていない会社がある。支店や部署は分からない
相手の自社サイト・公開資料事業の内容・拠点・従業員数の記載中程度(会社の自己申告・時点が古いことがある)いつの情報かを必ず控える。読み取りの誤りが入りやすい
有償の企業データベース業種・規模・売上の区分・部署の情報など提供元の調査方法による契約の範囲で使う。取得の経緯と更新の頻度を確かめる
MA・CRMの付与機能接続元の情報から推した会社名や業種など推測を含むことがある推した値か、登録に基づく値かを見分けられる形で取り込む

表で見ると分かるとおり、確かさが最も高いのは公的な材料ですが、得られる項目は限られます。一方で有償のデータベースや付与の機能は項目が豊富な代わりに、値がどう作られたかが見えにくいことがあります。どれか一つで全部をまかなうのではなく、項目ごとにどの材料を優先するかを決めるのが実務的です。

もう一つ見落とされがちなのが、同じ出どころの中でも値の作られ方が混ざっている点です。例えば付与の機能では、登録情報に基づく会社名と、アクセス元から推した会社名が同じ列に入ることがあります。取り込む前に、提供元の説明でその値が登録によるものか推測によるものかを確かめておきます。有償のデータベースを使うかどうかの目安は、リスト整備の記事の該当箇所も参考になります。

法人番号の公表データで確かにできること

公的な材料の中心になるのが、国税庁の法人番号公表サイトです。ここでは、法人番号・商号または名称・本店または主たる事務所の所在地の3つの情報が公表されています。社名の表記がばらばらでも、法人番号にたどり着ければ、正式な社名と本店の所在地を確かな値として持てます。

さらに属性を足したいときに使えるのが、経済産業省の法人情報サイト「ジービズインフォ」です。法人番号公表サイトの基本情報に、各府省が持つ補助金・調達・表彰・届出や認定・特許・財務・職場の情報などを合わせて公開しています。項目には資本金や従業員数、業種の区分、設立年などがありますが、すべての会社に全項目が登録されているわけではない点に注意が要ります。外部から機械で取り出す窓口も用意されており、使うには事前の利用申請が必要です。

公的な材料で分からないことも、先に知っておきます。法人番号は会社ごとの番号なので、支店や営業所、部署の単位は分かりません。業種も、登録された区分が営業の区分と合うとは限りません。業種の区分をどの粒度で持つかは、業種分類でリストを切る方法を扱った記事で詳しく整理しています。公的な材料は「確かな骨組み」を作るものと位置づけ、足りない部分を他の材料で補う順番にすると、全体の確かさが保てます。

推測の値と確かめた値を分けて持つ設計

データエンリッチメントの設計で最も大切なのが、値の素性を残す仕組みです。具体的には、足した属性ごとに値そのもの・出どころ・取得日・確かさの区分の4つを持たせます。例えば従業員規模なら、「従業員規模」「従業員規模の出どころ」「従業員規模の取得日」「従業員規模の確かさ」という列を並べる形です。

確かさの区分は、細かくしすぎないのが続けるコツです。例えば「確認済み(公的な材料や相手の申告で確かめた)」「出典あり(公開資料から読み取った)」「推測(付与の機能や類推による)」の3段階にしておけば、使う側が判断しやすくなります。相手がフォームで自分で答えた値は、確認済みとして扱ってよいでしょう。

この設計の効き目は、使う場面ではっきり出ます。配信の分岐や営業への振り分けで、確認済みの値だけを使う条件と、推測の値も含めてよい条件を分けられるからです。広告のおおまかな出し分けなら推測の値でも役に立ちますが、営業の担当割りや見積もりの前提に推測の値を使うと、外れたときの手戻りが大きくなります。

列の持ち方の例(従業員規模の場合)
  • 値:「100〜299人」のように区分で持つ(細かい数を持つと更新が追いつかない)
  • 出どころ:「国の法人情報サイト」「相手の自社サイト」「有償データベース」「本人の回答」など
  • 取得日:値を得た日。更新の周期の判断に使う
  • 確かさ:「確認済み」「出典あり」「推測」の3段階

データエンリッチメントを進める6つの工程

ここからは、データエンリッチメントを仕組みとして進める手順です。全体は6つの工程に分かれます。どの工程でも、AIに手伝わせる作業と人が決める作業を分けて書いておきます。

STEP1
使い道から足す項目を決める

振り分け・配信・スコアリングのどこで使うかを先に書き、使い道の無い項目は足しません。

STEP2
照合の手がかりをそろえる

社名の表記を整え、できるだけ法人番号にたどり着ける状態にします。

STEP3
材料を当てる順番を決める

項目ごとに、公的な材料・公開資料・有償データベースのどれを優先するかを決めます。

STEP4
素性の列と一緒に取り込む

値・出どころ・取得日・確かさの4つをそろえて入れます。埋まらない値は空欄のまま残します。

STEP5
抜き取りで確かめる

取り込んだ値の一部を人が原典と突き合わせ、誤りの傾向をつかみます。

STEP6
更新の周期を決めて回す

項目ごとに古び方の速さに合わせて、見直しの時期を決めます。

工程を分けておく理由は、うまくいかなかったときに直す場所を見つけやすくするためです。例えば業種の値がよく外れるなら、材料の優先順位(工程3)か、照合の手がかり(工程2)のどちらかに原因があります。全部を一度に流して結果だけを見ると、どこで崩れたかが分かりません。

最初から全リードに当てる必要もありません。直近三か月の資料請求など、件数の限られた範囲で試し、取り込んだ値を人が確かめてから範囲を広げると、材料ごとの当たり外れが早く見えてきます。

工程1と2 使い道から項目を決め、照合の手がかりをそろえる

工程1では、足す項目の候補を並べ、それぞれがどこで使われるかを一行ずつ書きます。例えば「業種:業種別のメール配信の分岐に使う」「従業員規模:営業部門と中小企業向け窓口の振り分けに使う」「本社の所在地:地域担当の割り当てに使う」のようにです。使い道の欄が書けない項目は、今回は足さないと決めます。

使い道を書くと、必要な細かさも決まります。振り分けに使う従業員規模なら「300人以上か未満か」が分かれば十分で、正確な人数は要りません。細かい値を持つほど更新の手間が増えるので、使い道が求める粒度で持つのが原則です。業種も同じで、配信の分岐が5つなら、5つの区分に寄せられれば足ります。

工程2の照合の手がかりは、材料を当てるための鍵です。社名だけで材料を探すと、似た名前の別会社を拾う誤りが起きます。社名の株式会社の位置や全角と半角の違いをそろえ、所在地やメールアドレスのドメインも手がかりに加えて、できるだけ法人番号にたどり着ける状態にします。法人番号を軸にした突合の詳しい手順は、法人番号で取引先情報を整える方法の記事にまとめています。

工程3と4 材料を当てる順番と、埋まらない値の扱い

工程3では、項目ごとに材料の優先順位を決めます。例えば本社の所在地と正式な社名は法人番号の公表データを第一に、従業員数は国の法人情報サイトを第一にして、登録が無ければ相手の自社サイトの記載、それも無ければ有償データベース、という順です。上位の材料で値が取れたら、下位の材料の値で上書きしないと決めておくと、確かな値が後から崩されずに済みます。

相手の自社サイトの情報を使うときは、その情報がいつのものかを控えます。会社概要の従業員数は、数年前のまま更新されていないことがあります。ページに更新日や「〇年〇月現在」と書かれていればそれを取得日の横に残し、書かれていなければ確かさを「出典あり」にとどめます。

工程4で大切なのは、埋まらない値の扱いです。どの材料でも取れなかった値は、空欄のまま、「未確認」と分かる状態で残すのが正解です。推測で埋めたくなる気持ちは分かりますが、ここで埋めた値は、後で誰も見分けられなくなります。どうしても推測の値を使いたい場合は、確かさを「推測」にして、確かめた値とは列の区分で分けて持ちます。

AIに任せてよい3つの作業

データエンリッチメントでAIが役に立つのは、主に三つの作業です。一つ目は表記ゆれの正規化で、「(株)」「株式会社」「カブシキガイシャ」の混在や、住所の丁目や番地の書き方の違いを、決めた規則にそろえる下書きを作らせます。規則は人が書き、AIには規則に沿った変換案を出させて、変換の前と後を並べた表で人が確かめる形にします。

二つ目は業種区分の候補出しです。相手の事業の説明文を渡し、自社の業種区分の一覧から当てはまりそうなものを選ばせます。このとき、候補を一つに決めさせるのではなく、候補を二つまで挙げさせ、それぞれ説明文のどの部分を根拠にしたかを一文で書かせます。根拠が弱いものや、二つの候補が離れているものは人が決めます。

三つ目は公開情報からの下書き抽出です。相手の会社概要のページの文章から、従業員数・設立年・拠点といった項目を抜き出させる使い方です。抜き出した値には、元の文章のどこから取ったかを必ず添えさせます。元の文章に書かれていない値は「記載なし」と返させる指示を入れておくと、読み取りの範囲を超えた書き足しを防ぎやすくなります。

  • 表記の規則と業種区分の一覧は人が作り、AIには規則に沿った案を出させる
  • AIの出力には必ず根拠(元の文章の該当箇所)を書かせる
  • 根拠が無い値・根拠が弱い値は取り込まず、人が確かめる

AIに分からない値を推測で埋めさせてはいけない理由

生成AIに会社名だけを渡して、業種や従業員数、売上の規模を答えさせる使い方は避けます。理由は、生成AIが知らない会社についても、もっともらしい値を作ってしまうからです。有名な会社なら当たることもありますが、中小の会社や社名の似た会社では、別の会社の情報が混ざったり、それらしい数字がそのまま書かれたりします。

しかも、推測で作られた値は見た目が確かな値と区別できません。「従業員数:約150名」と書かれていれば、人はそれを事実として読んでしまいます。一度リストに入った値は、配信の分岐や営業の担当割りに使われ、外れていたと分かるのはずっと後です。

  • 会社名だけを渡して、業種・従業員数・売上をAIに答えさせる
  • AIが出した値を、出どころを残さずに確かな値と同じ列に入れる
  • 空欄を減らすことを目標にして、分からない値まで埋めさせる
  • AIの付けた業種区分を、人が確かめずに配信の分岐に使う

線を引く場所ははっきりしています。AIに判断させない、根拠の文章があるものだけを抜き出させて根拠を書かせる、取り込む前に人が確認する範囲を先に決める。この三つを守れば、AIは表記の整理や読み取りの手間を減らす道具として安全に使えます。付与した値を配信や営業の判断に使ってよいかどうかも、最後は人が決めます。

補った属性をスコアリング・振り分け・配信にどう使うか

足した属性の使い道は、主に三つです。一つ目はスコアリングで、自社の顧客に多い業種や規模に当てはまるリードに点を足します。ここでは確かさの区分が効きます。確認済みの値には満点、推測の値には半分の点というように、確かさで点の重みを変えれば、推測の値が外れたときの影響を小さくできます。

二つ目は営業への振り分けです。従業員規模で大手向けの担当と中小向けの窓口に分ける、所在地で地域の担当に割り当てる、といった使い方です。振り分けは人の時間に直結するので、振り分けの条件には確認済みの値だけを使うのが安全です。推測の値しかないリードは、振り分けの前に確かめる担当に回す流れを作っておきます。

三つ目は配信の分岐です。業種ごとに事例を変えたメールを送る、規模ごとにセミナーの案内を変える、といった使い方では、推測の値を含めても大きな問題にはなりにくいでしょう。外れても、少し合わない事例が届くだけだからです。ただし、分岐に使った値の確かさを配信の記録に残しておくと、反応の差が値の誤りによるものかどうかを後から確かめられます。

どの使い道でも、足した属性が実際に役立っているかを確かめます。例えば業種で分岐した配信の開封やクリックが、分岐しない配信と比べて変わらないなら、その業種の区分は細かすぎるか、使い道として弱い可能性があります。使われない列は次の更新から外すと決めておくと、データが膨らみ続けるのを防げます。

更新の周期は、項目ごとに古び方が違う

足した属性は、項目によって古び方の速さが違います。そのため、全項目を同じ周期で見直すのではなく、項目ごとに周期を決めます。取得日の列を持っていれば、「取得日から一定の期間が過ぎた値」を機械的に抜き出して、見直しの対象にできます。

項目古び方見直しの目安の考え方
法人番号変わらない(会社が続く限り同じ)見直し不要。合併や清算の情報で確かめる
正式な社名・本店の所在地社名変更・移転で変わる法人番号の公表データの変更情報で定期的に確かめる
業種・従業員規模事業の転換や採用でゆっくり変わる年に一度程度の見直しを基本に、商談の場で確かめる
部署・役職の区分異動や退職で早く変わる配信の不達や本人の申告を手がかりに随時直す

特に注意したいのが、人に付く情報です。部署や役職は、年度の変わり目に大きく動きます。これらは外部の材料で確かめるのが難しいため、メールが届かなくなった、署名が変わったといった手がかりで直す仕組みにしておくのが現実的です。営業の担当者が商談の中で聞いた情報を、取得日と一緒に書き戻す流れも作っておきます。

更新のたびに、値が変わった件数を記録しておくと、周期が適切かどうかが見えてきます。一年たっても値がほとんど変わらない項目は周期を延ばし、半年で多くが変わる項目は周期を縮めます。周期は最初に決めて終わりではなく、変わった件数を見て調整するものです。

個人情報の扱いで確かめておくこと

会社に付く属性は個人情報に当たりにくい一方で、リードは担当者の氏名やメールアドレスと結びついています。そこに部署や役職を足せば、特定の個人に関する情報が増えることになります。ここでは、個人情報保護委員会の公表資料で確かめられた範囲だけを整理します。

まず、第三者から個人データの提供を受ける場合です。個人情報保護委員会のガイドライン(第三者提供時の確認・記録義務編)では、受け取る側は、提供する者の氏名または名称と住所、法人なら代表者の氏名、そしてその個人データを取得した経緯を確認し、記録を作って保存することになっています。記録の保存期間は、作り方によって1年または3年とされています。有償のデータベースから人に関する情報を受け取る場合は、この確認が関わってきます。

次に、個人関連情報です。個人情報保護委員会のよくある質問では、個人関連情報を、生存する個人に関する情報で個人情報・仮名加工情報・匿名加工情報のいずれにも当たらないものとし、例として職業などの属性、閲覧の履歴、位置の情報を挙げています。提供先で個人データとして取得されることが想定される場合は、本人の同意が得られていることの確認が求められるとされています。付与の機能で閲覧の情報と会社名を結びつける場合は、この点を確かめておきます。

  • 本稿の説明は一般的な内容で、個別の判断は個人情報保護委員会の資料や専門家に確かめる
  • 有償データベースの契約では、取得の経緯と利用できる範囲を書面で確かめる
  • 外部のAIに担当者の氏名やメールアドレスを渡すかどうかは、社内の規程に沿って人が決める

よくある質問

データエンリッチメントは、ツールを入れないとできませんか?

小さな規模なら、ツールが無くても始められます。法人番号の公表データや国の法人情報サイトで社名と所在地を確かめ、表計算のシートに値・出どころ・取得日・確かさの列を足すだけでも、素性の分かるデータになります。件数が増えて手作業が追いつかなくなった時点で、付与の機能や有償データベースを検討すれば十分です。

有償の企業データベースの値は、確認済みとして扱ってよいですか?

提供元がどう値を集めているかによります。登録情報や調査に基づく値と、推計による値が混ざっていることもあるので、契約前に項目ごとの作り方と更新の頻度を確かめます。説明が得られない項目は、確かさを「出典あり」や「推測」にとどめておくのが安全です。

フォームの項目を増やして直接聞く方が確実ではありませんか?

確かさでは本人の回答が勝ります。ただし項目を増やすほど送信が減るので、すべてを入口で聞くのは現実的ではありません。業種や規模のように外部の材料で確かめやすい項目は後から足し、部署や検討の時期のように本人しか分からない項目だけを入口で聞く、という分け方が実務的です。

まず何から始めればよいですか?

今あるリードの列を一覧にして、それぞれが何に使われているかを書き出すところから始めます。使われていない列と、使いたいのに空欄が多い列が見えてきます。空欄が多い列のうち、振り分けや配信に直結するものを一つか二つ選び、公的な材料で埋められる範囲から、素性の列と一緒に足していくのが確実です。

まとめ

データエンリッチメントとは、フォームや名刺で集めたリードに、業種・従業員規模・所在地・法人番号・部署や役職の区分などの属性を後から足すことです。材料は法人番号の公表データなどの公的な情報、相手の自社サイトや公開資料、有償の企業データベース、MAやCRMの付与機能の4種類で、確かさが違います。足すときは、使い道から項目と粒度を決め、値ごとに出どころ・取得日・確かさを残し、推測の値と確かめた値を分けて持ちます。埋まらない値は空欄のまま残し、振り分けには確認済みの値だけを使います。項目ごとに古び方が違うので、更新の周期も項目ごとに決め、変わった件数を見て調整します。AIに任せるのは表記の正規化・業種区分の候補出し・公開情報からの下書き抽出までで、分からない値を推測で埋めさせず、根拠を書かせ、使ってよいかは人が決めます。まずは今あるリードの列と、その使い道を書き出してみてください。

※本記事にはAIが活用されています。編集者が確認・編集し、可能な限り正確で最新の情報を提供するよう努めておりますが、情報の完全性、正確性、最新性、有用性等について保証するものではありません。本記事の内容に基づいて行動を取る場合は、読者ご自身の責任で行っていただくようお願いいたします。

リード獲得・育成の打ち手として、ウェビナーの集客と運営でお困りですか?

企画・集客・運営までデボノが伴走支援。外部リスト頼みにしない「自社の集客力」を育てます。

運営会社:株式会社デボノ

目次