テキストマイニングのやり方|頻出語で止めると順番を間違える

事業者向け | 市場・レビュー分析レポート
観点言及254,060件で、3つの並び順を比べる

テキストマイニングは頻出語で止めると打ち手の順番を間違える

形態素解析・頻出語・ワードクラウドまでは無料ツールで出せます。問題はその次です。同じデータでも「よく語られる順」「不満が多い順」「影響が大きい順」は別の並びになり、どれを使うかで着手する論点が変わります。この記事は実データで3つを並べて比べます。

観点言及 254,060件 14データセット・収録946商品 2026年6〜7月時点 レビュー原文は非掲載
比べる並び 3種類 実証データ 美容家電デバイス14データセット 観点言及 254,060件(10テーマ集約分) 収録商品 946点 出所 TrendViewer(HALDATA)

先に結論:テキストマイニングのやり方は「頻出語 → 好評率 → 掛け算」まで進める

  1. 頻出順は「問題の順」ではない ── 操作・使いやすさは頻出2位(N=48,714)だが好評率81.8%。よく語られるのは満足しているからで、直す必要は薄い。
  2. 好評率の低い順も順番にならない ── 最も低い静音性44.3%は言及N=1,535件しかなく、影響量では9位
  3. 使うのは掛け算 ── 影響量 = 言及数 ×(1 − 好評率)= 好評でない言及の実数。安全性は好評率60.6%でも約31,286件で1位になる。
  4. 語は決め打ちしない ── 全観点言及337,226件のうち83,166件(24.7%)は汎用10テーマでは拾えないカテゴリ固有の論点だった。

工程の詳細は 口コミ分析の方法(4ステップ)、材料となる声の選び方は VOC分析の方法 にまとめています。

テキストマイニングとは:無料ツールで出せるところまでを先に押さえる

テキストマイニングとは、文章を単語に分解し(形態素解析)、出現回数や語と語の共起関係を数えて傾向を見る手法です。無料ツールでも、次のところまでは十分に出せます。

工程出るもの無料ツールで可能か
形態素解析文章 → 単語の列(品詞つき)できる
頻出語の集計語 × 出現回数。ワードクラウドできる
共起ネットワーク一緒に出てくる語の結びつきできる
語を論点(観点)に束ねる「音が」「うるさい」「静か」→ 静音性手作業になる
論点ごとの好評/中立/不満の判定観点 × 好評率難しい(1文に複数論点が混ざる)
比較対象との突き合わせ観点 × カテゴリ平均との差(pt)できない(競合データが要る)

つまり無料ツールで止まる位置は「語 × 出現回数」です。ここから先に進まないと、次に何を直すかが決まりません。

ワードクラウドは「何が話題か」を示す図で、「何が問題か」を示す図ではありません。字の大きさは満足・不満を区別していません。

同じデータで、並び順が3通りに変わる

美容家電デバイス14データセット・収録946商品を横断集計し、汎用10テーマに集約した観点言及254,060件で、3つの並べ方を比べます。

テーマ言及数好評率好評でない言及①頻出順②率の低い順③影響量順
安全性79,40560.6%31,286131
効果実感45,40779.4%9,354382
操作・使いやすさ48,71481.8%8,866293
価格・コスパ26,45075.1%6,586474
お手入れ・清潔21,97172.3%6,086565
バッテリー・電源15,33962.1%5,813656
連続使用・持続4,06360.8%1,593847
サイズ・携帯9,62286.3%1,3187108
静音性1,53544.3%8551019
耐久・故障1,55449.6%7839210

好評でない言及 = 言及数 ×(1 − 好評率)。集計対象:美容家電デバイス14データセット・収録946商品、汎用10テーマに集約した観点言及254,060件(全観点言及337,226件のうち75.3%)/2026年6〜7月時点スナップショット/出所:TrendViewer(HALDATA)、楽天市場・Amazon.co.jpの購入者レビューを独自集計。

図1|影響量(好評でない言及の実数)で並べ直すと、率の順位とは逆転する

静音性は好評率では1位(最悪)だが影響量では9位。安全性は率3位でも影響量1位

安全性31,286率60.6%
効果実感9,354率79.4%
操作・使いやすさ8,866率81.8%
価格・コスパ6,586率75.1%
お手入れ・清潔6,086率72.3%
バッテリー・電源5,813率62.1%
連続使用・持続1,593率60.8%
サイズ・携帯1,318率86.3%
静音性855率44.3%
耐久・故障783率49.6%

棒の長さは好評でない言及の実数(最大値=安全性31,286件を100%とした相対表示)。作図:HALDATA Analytics 編集部。

📊
レビュー解析ツール TV Analytics購入者レビューを観点別に解析し、御社の商品の強みと弱点を定量化するBtoBツールです。

2つの読み違いが、実際にどう効くか

頻出語で選ぶと「満足されている論点」を最優先にする

操作・使いやすさは言及N=48,714件で頻出2位です。ワードクラウドなら大きく表示される論点です。ところが好評率は81.8%で、10テーマ中9番目に高い(=満足されている)論点でした。ここを最優先で改良しても、動く数字はほとんどありません。

「よく語られる」は「うまくいっていない」ではありません。むしろ満足したから書かれていることが多く、頻出語の大きさと不満の量は別物です。

率で選ぶと「小さい問題」を最優先にする

静音性は好評率44.3%で10テーマ中もっとも低く、耐久・故障が49.6%で2番目です。率だけを見ればここから着手することになります。

しかし言及数はそれぞれN=1,535件・N=1,554件で、好評でない言及の実数は約855件・約783件。影響量では9位と10位、つまり最後の2つです。安全性の約31,286件とは36.6倍の差があります。率で並べると、影響量で最下位の論点を先頭に持ってくることになります。

頻出順と率の順は、どちらも単独では順番になりません。掛け合わせた「好評でない言及の実数」で並べたときに、はじめて着手順になります。

この表を自社商品と競合商品で並べて作るところまでを自動でやるのがTrendViewerです。商品コード単位で観点別の好評率・不満率・言及数と、その月ごとの推移が出ます。

自社商品の観点別分析を見る(TrendViewer)

レビュー原文は掲載していません。観点ごとに要約した集計値をお見せしています。

テキストマイニングのやり方:頻出語のあとに足す3工程

無料ツールで頻出語まで出したあと、順番を出すには次の3つが必要です。各工程の詳しい手順は 口コミ分析の方法(4ステップ) に実データつきでまとめています。

  • 語を論点に束ねる ── 「音が」「うるさい」「静か」「深夜」を静音性へまとめる。この束ね方は文章の側から作る。あらかじめ用意した分類に当てはめると、実データでは24.7%の論点が落ちた
  • 論点ごとに好評/中立/不満を判定する ── 1本のレビューは通常2〜4の論点にまたがるので、レビュー単位ではなく言及単位で数える。中立を不満に寄せないこと(中立が厚いのは説明不足のサインで、打ち手が別になる)
  • 言及数と掛け合わせて並べる ── 影響量 = 言及数 ×(1 − 好評率)。これが着手順になる

エクセルでやる場合、どこで止まるか

頻出語の集計までなら表計算ソフトでも十分できます。止まるのは次の2点です。

ひとつは1文に複数の論点が混ざっている場合の切り分けです。行=レビューのまま数えると、「効果は満足だが音が気になる」という1行を、効果と静音性のどちらに数えるか決められません。論点別の比率を出すには、行=言及に開き直す必要があります。

もうひとつは継続して比較する場合です。観点の定義を人が都度決めると担当者ごとにぶれ、翌月と比べたときに市場が変わったのか集計が揺れたのか区別できなくなります。1回だけの調査なら手作業で足りますが、毎月追うなら定義を固定して回せる仕組みが要ります。

💬
レビュー接客AI TV chatこの分析データをそのまま学習させたAIを、御社のECサイトに設置できます。お客様の質問に接客のように答えます。
チャットを見る →

つまずきやすい3点

  • ワードクラウドを成果物にしてしまう ── 図はできるが、次の一手が決まらない。成果物は「観点名・好評率・言及数」の3列の表
  • 言及の少ない論点で結論を出す ── 実務では1観点あたりN=30件未満は判断に使わない。数件を傾向として扱うと優先順位を誤る
  • 自社データだけで判断する ── 「静音性50%」が高いのか低いのかは、比較対象がないと決まらない。カテゴリ平均との落差で読む

よくある質問

テキストマイニングとは何ですか?何ができますか?

文章を単語に分解し(形態素解析)、出現回数や語の共起関係を数えて傾向を見る手法です。無料ツールでも頻出語・ワードクラウド・共起ネットワークまでは出せます。ただし出るのは「よく語られている語」で、「不満が多い論点」とは別です。順番を決めるには、論点ごとに好評・中立・不満を判定し、言及数と掛け合わせる工程が要ります。

ワードクラウドや頻出語だけでは足りないのですか?

足りません。頻出順は「よく語られる順」で、満足しているから語られていることも多いためです。実データでは操作・使いやすさは頻出2位(N=48,714)でしたが好評率81.8%で、直す必要は薄い論点でした。

好評率が低い順に手を打てばよいのですか?

それも順番を誤ります。最も低い静音性44.3%は言及がN=1,535件で、好評でない言及は約855件(影響量9位)。安全性は好評率60.6%でも言及N=79,405件・好評でない言及約31,286件で影響量1位です。差は36.6倍あります。

テキストマイニングはエクセルでできますか?

頻出語の集計まではできます。難しいのは、1文に複数の論点が混ざる場合の切り分けと、論点ごとの好評・中立・不満の判定です。また観点定義を人が都度決めると担当者ごとにぶれ、月次比較で市場の変化か集計の揺れか区別できなくなります。

分析する語はあらかじめ決めておくべきですか?

決め打ちすると商品固有の論点が落ちます。観点言及337,226件のうち汎用10テーマに集約できたのは254,060件(75.3%)で、残る83,166件(24.7%)はカテゴリ固有でした。語は文章の側から作り、あとから命名してください。

データの定義

観点(論点)購入者が評価している軸。静音性・耐久・効果実感など
観点言及1本のレビューの中で1つの観点に触れている記述。1レビューは通常2〜4観点にまたがる
好評率その観点の好評言及数 ÷ その観点の全言及数(好評+中立+不満)
好評でない言及言及数 ×(1 − 好評率)。中立と不満の合計にあたる実数
集計対象美容家電デバイス14データセット・収録946商品。汎用10テーマに集約した観点言及254,060件(全観点言及337,226件の75.3%)/2026年6〜7月時点スナップショット
出所TrendViewer(HALDATA)。楽天市場・Amazon.co.jpの購入者レビューを独自集計。レビュー原文は掲載していません

あわせて読みたい

この記事について

執筆・分析:HALDATA Analytics 編集部

数値はすべて TrendViewer(HALDATA)の集計値です。レビュー原文は掲載せず、観点ごとに要約した集計値のみを掲載しています。

編集方針 | 運営者情報

メーカー・EC事業者の方へ

あなたの商品は、どの観点で「賛否」が割れていますか?

この記事と同じ分析を、御社の商品で。TrendViewerは購入者レビューを観点別の好評率・不満率に分解し、自社・競合の「強み」と「後から効く弱点」を定量的に可視化します。

  • 観点別センチメント分解
  • 競合との横断比較
  • 購入後3〜6ヶ月の不満予兆

観点別の賛否分解は、商品改良・LP訴求・レビュー対策の優先順位づけに直接使えます。

↓ 見つけた弱点を、そのまま接客へ
TV Analytics
御社の商品の弱点を数字で
見てみる →