SNS分析にAIの投稿が混ざる原因と対策|施策に使う前の除き方

SNS分析にAIの投稿が混ざる原因と対策|施策に使う前の除き方

「SNSの声を集計したら、新商品への好意的な投稿が急に倍になっていた。喜んでよいのか分からない」「話題の順位の上位に、見覚えのない宣伝の言い回しばかりが並んでいる」。ソーシャルリスニングを施策に使い始めた担当者から、こうした戸惑いを聞くことが増えました。数字が動いたのに手応えがない、という違和感は、たいてい正しい勘です。米国の研究者が短文投稿のSNSのおよそ50億件の投稿を調べた2025年の研究では、話題の平均で利用者のおよそ2割がボットと判定され、選挙の話題では4割を超えました。集めた声がそのまま人の声である、という前提はもう置けません。ただ、これはボットを完全に見抜く技術の話ではありません。本当は、除く基準を人が先に決め、除く前と後の数字を並べて報告するという、集計の作法の話です。この記事では、AIの投稿や自動投稿が混ざる原因、見分けの手がかり、除き方の手順と報告の書き方を整理します。


カメ先生カメ先生

ソーシャルリスニングのデータには、人の声のほかに、自動で投稿するアカウントや、生成AIで量産された宣伝の投稿が混ざっているんだ。混ざると、声の量も、好意と不満の比率も、話題の順位もずれてしまう。


カメ子カメ子

それなら、AIに「これはAIが書いた投稿か」を判定させて、まとめて消せば済むのではないですか。


カメ先生カメ先生

そこが一番の落とし穴だよ。AIが書いた文かどうかの判定は外れが多くて、人の投稿まで消してしまう。AIに任せるのは、よく似た文を束ねることと、怪しい投稿の候補を出すところまで。除くかどうかの基準と最終判断は人が決めて、除いた理由を記録に残すんだ。


カメ子カメ子

消し方より先に、何を根拠に除いたかを残す仕組みが要るということですね。


この記事のポイント
  • AIの投稿や自動投稿が混ざると、声の量・感情の比率・話題の順位の3つがずれ、施策の判断を誤らせる
  • 見分けは文面の判定ではなく、同文の連続・投稿時刻・アカウントの作成時期と投稿量・外部リンクの偏りで行う
  • 除く前の件数を残し、除いた理由を記録し、除く前と後の数字を並べて報告する

広告・SNS・動画にAIを活かす第一歩、まずは導入から始めませんか?

デボノはアカウント開設・初期設定など「そもそものAI導入」から社内定着まで伴走支援。マーケティング活用など一歩進んだご相談にも対応します。

目次

混ざると何がずれるのか 量・比率・順位の3つ

ソーシャルリスニングの集計でずれるのは、大きく3つです。1つ目は声の量です。ある商品名を含む投稿の件数が先月の2倍になっても、増えた分が同じ文面の宣伝投稿なら、関心が2倍になったわけではありません。件数の増減は、施策の効果を語るときに最初に引用される数字なので、ここがずれると報告全体が崩れます。

2つ目は感情の比率です。好意的な投稿と不満の投稿の割合は、自動投稿が混ざると大きく動きます。懸賞に応募するための定型の投稿は、たいてい「欲しい」「楽しみ」といった前向きな語を含みます。こうした投稿が大量に入ると、好意の比率が実態より高く出ます。逆に、競合を貶める目的の量産投稿が入れば、不満の比率が膨らみます。感情の判定そのものの当たり外れとは別に、分母に入る投稿の中身が変わると、判定が正しくても比率は狂うのです。

3つ目は話題の順位です。よく出てくる語や話題を並べると、同じ文面を繰り返す投稿ほど上位に来ます。人が一度ずつ書いた多様な声は、表現がばらけるぶん、集計の上では目立ちません。結果として、順位表の上位を宣伝文の言い回しが占め、本当に多くの人が気にしている話題が埋もれることが起こります。企画会議でこの順位表を見て題材を決めると、誰も求めていない話題に予算を使うことになります。

調査の数字は「何を数えたか」で読み分ける

自動化の割合を示す数字は、出どころによって数えているものがまったく違います。よく引用されるのは、米国のセキュリティ企業インパーバが2025年4月に公表した報告書です。2024年のウェブ全体の通信のうち、自動化された通信が51%を占め、人による通信を初めて上回ったとしています。悪意のあるボットの通信は37%で、前年の32%から増えたとされます。

ただし、これは同社の網を通るウェブサイトへの通信の話で、SNSの投稿のうちボットが書いたものの割合ではありません。検索エンジンの巡回や、商品を買い占める自動の購入なども含まれます。ウェブの通信の数字を、SNSの声の混入率として引用しないことが、報告の信頼を守る第一歩です。

SNSの投稿については、米カーネギーメロン大学の研究者が2025年3月に、英科学誌ネイチャーの系列の学術誌で発表した研究があります。2018年から2021年までの短文投稿のSNSのおよそ50億件の投稿、約2億人の利用者を対象に、機械学習による判定で確率0.7を超えたアカウントをボットと見なしました。平均でおよそ2割がボットと判定され、2020年の米大統領選挙の話題では43%に達したと報告されています。

この数字にも読み方の注意があります。判定は一つの仕組みに頼っており、研究者自身も、生成AIの発達でボットの見かけが変わり、判定が追いつかなくなるおそれを限界として挙げています。対象も、選挙や世界的な出来事のような大きな話題です。法人向けの商材のように投稿の件数が少ない領域では、数十件の量産投稿だけで割合が大きく動くので、他の研究の割合を自社の補正値として使うことはできません。自社のデータで、自社の基準で数えるしかありません。

生成AIで何が変わったか 文面では見分けにくくなった

かつての自動投稿は、同じ定型文を繰り返したり、不自然な日本語だったりして、目で見れば分かることが多くありました。生成AIが加わると、投稿ごとに言い回しを変え、自然な文で返信までこなせるようになります。米インディアナ大学の研究者は2023年、短文投稿のSNSで、対話型AIで文章を作るボット網を報告しました。少なくとも1,140のアカウントが互いにフォローし合い、暗号資産の話題の投稿と、怪しいサイトへのリンクを流していました。

このボット網が見つかったきっかけは、文面の巧拙ではありませんでした。AIが依頼を断るときの「AIの言語モデルとして」という決まり文句を、そのまま投稿してしまった例を研究者が検索したことです。研究では、既存のボット判定の道具はこのアカウント群をほとんど拾えず、他人の写真を盗用したプロフィールも使われていたと報告されています。見つかったのは、運用側のうっかりと、アカウント同士の不自然なつながりからでした。

ここから分かるのは、文面だけを見て「AIが書いたか」を判定するやり方には限界があるということです。AIが生成した文章を判定する道具には、人が丁寧に書いた文までAI製と判定する誤りが知られています(判定の道具の限界は別の記事で扱っています)。リスニングの集計で見分けたいのは、AIが書いたかどうかではなく、人の自発的な声として数えてよいかどうかです。人がAIの手を借りて書いた感想は人の声ですし、人が手で打った定型の懸賞投稿は、評価の声としては数えないほうがよい場合があります。

原因1 収集の条件が広すぎる

混入の原因で一番多いのは、集め方そのものです。商品名や社名の一語だけを条件にすると、その語を含む投稿はすべて入ってきます。社名が一般的な言葉と同じだったり、商品名が他の業界の言葉と重なったりすると、無関係な投稿と一緒に、その語を狙った宣伝のアカウントまで集まります。

自動投稿のアカウントは、話題になっている語や、よく検索される語を投稿に詰め込む傾向があります。先ほどの研究でも、ボットは人より多くのハッシュタグを使うと報告されています。条件の語が話題になるほど、その語を借りる宣伝の投稿も増えるので、新商品の発表の直後やイベントの期間中は、とくに混入が増えやすくなります。

対策は、条件の語に「一緒に出てくるはずの語」を組み合わせることです。たとえば業務用の製品なら、製品名と一緒に「導入」「使ってみた」「サポート」といった利用の文脈の語を条件に加えます。逆に、懸賞や副業の勧誘で使われがちな語を除外の条件に入れます。除外の語を足した日と語の一覧は記録しておきます。条件を変えると件数が変わるので、条件を変えた日を知らずに前月と比べると、自然な増減と見分けがつかないからです。

原因2 拡散の連鎖で同じ声を何度も数える

二つ目の原因は、拡散の連鎖です。一つの投稿がそのまま転載される、少しだけ言葉を足して引用される、という動きが重なると、元は一人の声が何百件にも増えて見えます。これ自体は人の行動でも起きますが、自動投稿のアカウントは転載を大量に行います。先ほどの研究では、ボットは返信や引用より転載を中心に動き、人は返信や引用でやり取りする傾向があると報告されています。

集計の段階で転載を含めるかどうかを決めていないと、同じ声が重複して数えられます。「投稿の件数」と「声を上げた人の数」と「元になった投稿の数」は、別の数字として分けて持つのが基本です。施策の判断に使うのは、多くの場合、元になった投稿の数と、声を上げた人の数のほうです。

拡散の広がり自体は、関心の強さを示す大事な情報でもあります。消してしまうのではなく、元の投稿に束ねて「この投稿が何件転載されたか」という属性として残します。そうすれば、よく広がった声と、広げたアカウントの顔ぶれを後から確かめられます。転載した側のアカウントが、同じ時刻に同じ投稿ばかり転載しているなら、それは後で述べる見分けの手がかりにもなります。

原因3 懸賞とキャンペーンの応募投稿

三つ目は、懸賞やキャンペーンへの応募の投稿です。「フォローと転載で抽選」といった企画を自社や他社が行うと、応募のための投稿が短い期間に集中します。応募の条件として決まった文言やハッシュタグを入れさせる企画では、ほぼ同じ文面が数百、数千と並びます。懸賞に応募するためだけに使われているように見えるアカウントも少なくありません。

自社の企画による投稿なら、どの期間に、どの文言で投稿されるかが分かっています。キャンペーンの期間と指定の文言を、リスニングの担当に事前に共有する決まりを作るだけで、集計の混乱はかなり減ります。やっかいなのは他社の企画で、自社の商品が景品に使われると、突然好意的な投稿が増えます。好意の比率が急に上がった週は、まず懸賞の企画がなかったかを確かめます。

応募の投稿は、除くというより区分を分けて扱うのが実際的です。キャンペーンの届き方を測る目的なら、応募の件数は大事な数字です。一方で、商品への評価や不満を読み取る目的なら、応募の投稿は分母から外します。同じ投稿でも、何を知りたいかで数えるか外すかが変わるので、目的ごとに集計の区分を決めておきます。

原因4 生成AIによる口コミと宣伝の量産

四つ目が、生成AIによる口コミや宣伝の量産です。言い回しを少しずつ変えた感想風の投稿を、複数のアカウントから流す手間は、生成AIで大きく下がりました。先ほどのセキュリティ企業の報告書も、生成AIが技術力の低い攻撃者の参入の壁を下げ、単純なボットによる攻撃を増やしていると指摘しています。これはウェブの通信についての指摘ですが、SNSの投稿でも同じ構図が起きうると考えておくのが無難です。

量産された投稿は、自社を持ち上げるものとは限りません。競合の評判を下げる投稿や、自社の名前を使って怪しいサイトへ誘う投稿もあります。自社を持ち上げる量産投稿が見つかったときは、集計の問題にとどまらず、誰が関与しているかの確認が要ることがあります。事業者が関与した宣伝を口コミに見せる投稿は、国内ではステルスマーケティングとして景品表示法の規制の対象になる場合があります(規制の中身は別の記事で扱っています)。

量産の投稿は、一件ずつ読むと人の感想と区別がつかないことが多いのが特徴です。だからこそ、一件の文面ではなく、束で見ます。似た主張が、似た時間帯に、作られて日の浅いアカウントの群れから出ていないか。次の節からは、こうした束で見る手がかりを順に取り上げます。どの手がかりも、それだけで決め手になるものではなく、重ね合わせて使うものだという点を先に押さえておいてください。

見分けの手がかり1 同文と近似文の連続

最も確かな手がかりは、同じ文や、ほとんど同じ文が短い間隔で続くことです。完全に同じ文は、表で並べ替えればすぐに見つかります。難しいのは、語順を入れ替えたり、語尾を変えたりした近似文です。生成AIで量産された投稿は、この近似文の形をとることが多くなります。

近似文を束ねる作業は、AIが得意とするところです。投稿の一覧を渡し、主張が同じものを束にして、束ごとに件数と代表の文を出させます。AIに頼むのは「似ているものを束ねること」までで、束を除くかどうかは人が決めます。人の自発的な声でも、多くの人が同じ感想を持てば、似た文が並ぶのは自然なことだからです。

束を見るときは、中身の具体性に注目します。人の感想には、使った場面や困った点など、その人にしか書けない細部が入りやすいものです。一方、量産の投稿は、商品の特長を説明文のように並べるだけで、使った場面が出てこない傾向があります。ただし、これも傾向にすぎず、短い感想しか書かない人もいます。具体性の薄さだけで除かず、他の手がかりと重なったときに候補にするのが安全です。

見分けの手がかり2 投稿時刻の偏り

二つ目の手がかりは、投稿の時刻です。人の投稿は、通勤や昼休み、夜の時間帯に増え、深夜は減るという生活の波があります。自動投稿のアカウントは、一定の間隔で投稿したり、深夜も昼も同じ量で投稿したりします。先ほどの研究でも、ボットは人より1時間あたりの投稿数が多いと報告されています。

確かめ方は、束ねた投稿の時刻を1時間ごとに数えて並べることです。ある束の投稿が、数分のうちに何十件も集中していたり、ちょうど同じ分に複数のアカウントから投稿されていたりすれば、自動で流された疑いが強まります。一件の時刻ではなく、束の時刻の分布を見ることがこつです。

注意したいのは、テレビ番組や発表会の直後など、人の投稿も一斉に増える場面です。こうした時刻の集中は、関心の高まりそのものです。時刻の偏りを見るときは、自社や業界の出来事の予定表と突き合わせるようにします。出来事がないのに集中が起きているときだけ、次の手がかりに進みます。予定表には、自社の発表だけでなく、競合の新製品の発表や業界の展示会の日程も入れておくと、読み違いが減ります。

見分けの手がかり3 アカウントの作成時期・投稿量・外部リンク

三つ目は、投稿したアカウントの側の特徴です。作られて日が浅いのに投稿の量が極端に多い、プロフィールの写真や自己紹介がない、あるいは他人の写真を使っている、といったアカウントは、量産の担い手であることが少なくありません。先の研究でも、ボットは人より自分の属性を示す割合が低く、画像や動画を含む投稿も少ないと報告されています。

外部リンクの偏りも有力な手がかりです。同じサイトへのリンクばかりを貼るアカウントが束になっている場合、そのサイトへ人を誘うための投稿である可能性が高くなります。先に紹介したボット網も、特定のいくつかのサイトへのリンクを流していました。リンク先のサイトを集計して、特定のサイトに偏っていないかを見るだけでも、宣伝目的の束が浮かび上がります。

アカウントの情報を見るときは、個人の特定に踏み込まないことも大切です。見るのは作成時期、投稿の量、リンクの傾向といった集計の上の特徴までにします。一人ひとりの素性を調べる必要はありませんし、集めたアカウントの一覧を目的の外で使うこともしません。そのうえで、手がかりは一つだけで判断せず、二つ以上が重なったものを候補にする、と基準に書いておきます。

除く基準と記録の欄を先に決める

手がかりがそろったら、除く前に基準を文書にします。基準がないまま担当者の目で除いていくと、月ごとに除き方が変わり、前月との比較ができなくなります。報告を受けた側から「なぜこの投稿を除いたのか」と聞かれたときにも答えられません。次の表は、基準と記録の欄の例です。

手がかり候補にする目安扱い記録する理由
同文・近似文同じ主張の束が短い間に続く束ごとに人が読み、除くか残すかを決める束の番号と「近似文の連続」
投稿時刻出来事がないのに数分に集中する他の手がかりと重なれば候補にする集中した時間帯と件数
アカウント作成が新しく、投稿量が極端に多い他の手がかりと重なれば候補にする作成時期と投稿量の目安
外部リンク同じサイトへのリンクばかり宣伝目的として区分を分けるリンク先のサイト名
懸賞の応募指定の文言やハッシュタグを含む評価の集計から外し、応募の件数として別に数える企画名と期間

表の「候補にする目安」の具体的な数字は、自社のデータで決めます。何分に何件なら集中と見るかは、商材や投稿の件数で大きく違います。最初の月は目安をゆるめに置き、候補に挙がった投稿を人が読んで、除くべきだったものの割合を見てから締めていきます。基準は月の途中で変えず、変えるときは変更日を記録することで、月ごとの比較が保てます。

除き方の手順 消さずに印を付ける

基準を決めたら、次の順で除いていきます。大事なのは、データを消すのではなく、印を付けて区分を分けることです。元のデータを消してしまうと、除き過ぎに気づいても戻せません。

STEP1
除く前の数字を残す

集めたままの投稿の件数、声を上げた人の数、感情の比率、話題の順位を、除く前の数字として保存します。

STEP2
候補を出す

近似文の束ね、時刻の集計、リンク先の集計を行い、基準に当てはまる投稿に候補の印を付けます。束ねる作業にはAIを使ってかまいません。

STEP3
人が束ごとに原文を読む

候補の束から数件ずつ原文を読み、人の自発的な声が混ざっていないかを確かめ、除くか残すかを決めます。

STEP4
除いた理由を記録する

除いた束ごとに、当てはまった手がかりと基準、判断した人と日付を記録します。

STEP5
除き過ぎを確かめる

除いた投稿から無作為に抜き出して読み直し、人の声が含まれていた割合を確かめます。

3つ目の工程で原文を読むのは手間がかかりますが、ここを省くと、除く判断をAIの印に任せたことになります。束ごとに数件読むだけでも、明らかな人の声が混ざっていれば、その束は残すか、基準を見直すきっかけになります。除くかどうかの最終判断は、原文を読んだ人が下すという線は、件数が増えても動かしません。

除き過ぎを確かめる 不満の声を消さない

混入を減らそうとするほど、人の声まで除いてしまう危険が増えます。とくに気をつけたいのは、少数派の声や、強い不満の声です。怒っている人は短い間に何度も投稿したり、同じ訴えを繰り返したりすることがあり、時刻の集中や近似文の連続という手がかりに当てはまりやすいからです。不満の声を自動投稿と見なして除くと、対処すべき問題を自分たちで見えなくすることになります。

確かめ方は、除いた投稿から無作為に数十件を抜き出し、除く判断をしていない別の人が読むことです。人の自発的な声だと判断されたものが目立つなら、基準がきつすぎます。抜き出した中に不満の投稿が多く含まれていたら、その束の扱いを見直し、必要なら不満の束だけは除かずに別の区分で残します。

もう一つの確かめ方は、除いた後の数字が、他の情報源と大きく食い違っていないかを見ることです。問い合わせの窓口に届いた声や、営業が聞いた顧客の反応と比べて、除いた後のほうが実感に近いかを確かめます。除いた後の数字が、社内の誰の実感とも合わなくなったら除き過ぎを疑う、と決めておくと、基準の締め過ぎに早く気づけます。

報告は除く前と後の数字を並べる

報告では、除いた後の数字だけを出さないようにします。除く前の数字と後の数字を並べ、その差が何件で、どの理由で除いたかを添えます。こうしておけば、受け取った側は、数字の変化が声の変化なのか、除き方の変化なのかを自分で確かめられます。報告に入れる欄は次のとおりです。

報告の欄書く内容
集めた条件条件の語と除外の語、変更した日
除く前の数字投稿の件数、声を上げた人の数、好意と不満の比率、話題の上位
除いた内訳理由ごとの件数(近似文の連続、懸賞の応募、宣伝のリンクなど)
除いた後の数字除く前と同じ項目を、同じ並びで
除き過ぎの確認抜き出して読み直した件数と、そのうち人の声だった件数
読み方の注意件数が少ない項目、基準を変えた項目

除いた後の数字には、推定であることを明記するようにします。どれだけ丁寧に除いても、見逃した自動投稿や、誤って除いた人の声が残ります。数字を施策の根拠として使う会議では、この留保を最初に伝えておくほうが、後で数字が揺れたときに信頼を失いません。

月次の報告では、除いた割合の推移も並べておくと役に立ちます。除いた割合が急に増えた月は、宣伝の量産や懸賞の企画など、何かが起きた合図です。除いた割合の推移そのものが、自社の名前を使った宣伝の動きを知る手がかりにもなります。

AIの使いどころと、任せない判断

この作業でAIに任せるのは、近似文を束ねることと、基準に当てはまりそうな投稿の候補を出すことです。何千件もの投稿を人が一件ずつ読み比べるのは現実的でないので、束ねる作業にAIを使う意味は大きいです。次のように、根拠を書かせる形で頼みます。

次の投稿一覧を、主張が同じものごとに束ねてください。
束ごとに、束の番号・件数・代表の投稿・束ねた理由(一文)を書いてください。
「AIが書いた投稿かどうか」は判定しないでください。
束ねる理由が書けないものは「単独」とし、無理に束ねないでください。

頼み方で大切なのは、AIに「AIが書いたかどうか」を判定させないと明記することです。判定を求めると、AIはそれらしい理由を付けて答えてしまい、その答えが除く根拠として一人歩きします。束ねた理由を一文で書かせておけば、人が束を読むときに、束ね方が正しいかを確かめられます。

  • AIの判定だけで投稿を消す:人の丁寧な感想や強い不満まで消え、戻せない
  • 元のデータを削除して集計し直す:除き過ぎに気づいても元に戻せない
  • 基準を月ごとに担当者の目で変える:前月との比較ができなくなる
  • 除いた後の数字だけを報告する:数字の変化が声の変化か、除き方の変化か分からない
  • 他の研究の混入率で自社の数字を補正する:自社の商材の混入の度合いとは関係がない

人が確認する範囲も先に決めておきます。除く基準を決めること、束ごとに原文を読んで除くかを決めること、除き過ぎを確かめること、報告に留保を書くことの4つは人の仕事です。AIに判断させない範囲を先に決め、人が確認する範囲を先に決めておくことで、件数が増えても作業の質を保てます。

ミニ用語解説 この記事に出てきた言葉

最後に、この記事で使った言葉を短くまとめます。社内で報告を共有するときに、言葉の意味がそろっていないと、同じ数字を別の意味で読んでしまうことがあります。報告書の末尾に付けておくのも一つの方法です。

  • ソーシャルリスニング:SNSなどに書かれた声を集めて読み、施策や製品の改善に使う取り組み
  • ボット:人の操作なしに、決められた手順で投稿や転載を行うアカウントや仕組み
  • 近似文:語順や語尾を変えただけで、主張がほぼ同じ文。生成AIで量産された投稿に多い形
  • 転載と引用:他人の投稿をそのまま広げるのが転載、言葉を添えて広げるのが引用
  • 分母:比率を出すときに全体として数える投稿の範囲。何を入れるかで比率が変わる
  • 除外の語:集める条件から外すために指定する語。足した日を記録しておく

このうち、分母という考え方が、この記事の全体を貫いています。混入の問題は、突き詰めると、何を分母に入れて数えるかの問題です。分母の決め方を文書にして共有しておけば、担当者が替わっても、同じ物差しで数字を読み続けられます。

まとめ

ソーシャルリスニングのデータには、生成AIで書かれた投稿、自動投稿のアカウント、宣伝目的の量産投稿が混ざり、声の量・感情の比率・話題の順位がずれます。混ざる原因は、収集の条件の広さ、拡散の連鎖、懸賞やキャンペーンの応募、生成AIによる口コミの量産です。見分けは、文面からAIが書いたかを判定するのではなく、同文や近似文の連続、投稿時刻の偏り、アカウントの作成時期と投稿量、外部リンクの偏りを束で見て、二つ以上が重なったものを候補にします。除くときは元のデータを消さずに印を付け、除く前の数字を残し、除いた理由を記録し、除き過ぎを確かめます。報告では除く前と後の数字を並べ、推定であることを明記します。AIに任せるのは近似文の束ねと候補出しまでで、基準と最終判断は人が決めます。まずは今月の集計で、除く前の数字を保存するところから始めてみてください。

※本記事にはAIが活用されています。編集者が確認・編集し、可能な限り正確で最新の情報を提供するよう努めておりますが、情報の完全性、正確性、最新性、有用性等について保証するものではありません。本記事の内容に基づいて行動を取る場合は、読者ご自身の責任で行っていただくようお願いいたします。

広告・SNS・動画にAIを活かす第一歩、まずは導入から始めませんか?

デボノはアカウント開設・初期設定など「そもそものAI導入」から社内定着まで伴走支援。マーケティング活用など一歩進んだご相談にも対応します。

運営会社:株式会社デボノ

目次