テキストマイニングは頻出語で止めると打ち手の順番を間違える
形態素解析・頻出語・ワードクラウドまでは無料ツールで出せます。問題はその次です。同じデータでも「よく語られる順」「不満が多い順」「影響が大きい順」は別の並びになり、どれを使うかで着手する論点が変わります。この記事は実データで3つを並べて比べます。
先に結論:テキストマイニングのやり方は「頻出語 → 好評率 → 掛け算」まで進める
- 頻出順は「問題の順」ではない ── 操作・使いやすさは頻出2位(N=48,714)だが好評率81.8%。よく語られるのは満足しているからで、直す必要は薄い。
- 好評率の低い順も順番にならない ── 最も低い静音性44.3%は言及N=1,535件しかなく、影響量では9位。
- 使うのは掛け算 ── 影響量 = 言及数 ×(1 − 好評率)= 好評でない言及の実数。安全性は好評率60.6%でも約31,286件で1位になる。
- 語は決め打ちしない ── 全観点言及337,226件のうち83,166件(24.7%)は汎用10テーマでは拾えないカテゴリ固有の論点だった。
工程の詳細は 口コミ分析の方法(4ステップ)、材料となる声の選び方は VOC分析の方法 にまとめています。
テキストマイニングとは:無料ツールで出せるところまでを先に押さえる
テキストマイニングとは、文章を単語に分解し(形態素解析)、出現回数や語と語の共起関係を数えて傾向を見る手法です。無料ツールでも、次のところまでは十分に出せます。
| 工程 | 出るもの | 無料ツールで可能か |
|---|---|---|
| 形態素解析 | 文章 → 単語の列(品詞つき) | できる |
| 頻出語の集計 | 語 × 出現回数。ワードクラウド | できる |
| 共起ネットワーク | 一緒に出てくる語の結びつき | できる |
| 語を論点(観点)に束ねる | 「音が」「うるさい」「静か」→ 静音性 | 手作業になる |
| 論点ごとの好評/中立/不満の判定 | 観点 × 好評率 | 難しい(1文に複数論点が混ざる) |
| 比較対象との突き合わせ | 観点 × カテゴリ平均との差(pt) | できない(競合データが要る) |
つまり無料ツールで止まる位置は「語 × 出現回数」です。ここから先に進まないと、次に何を直すかが決まりません。
同じデータで、並び順が3通りに変わる
美容家電デバイス14データセット・収録946商品を横断集計し、汎用10テーマに集約した観点言及254,060件で、3つの並べ方を比べます。
| テーマ | 言及数 | 好評率 | 好評でない言及 | ①頻出順 | ②率の低い順 | ③影響量順 |
|---|---|---|---|---|---|---|
| 安全性 | 79,405 | 60.6% | 31,286 | 1 | 3 | 1 |
| 効果実感 | 45,407 | 79.4% | 9,354 | 3 | 8 | 2 |
| 操作・使いやすさ | 48,714 | 81.8% | 8,866 | 2 | 9 | 3 |
| 価格・コスパ | 26,450 | 75.1% | 6,586 | 4 | 7 | 4 |
| お手入れ・清潔 | 21,971 | 72.3% | 6,086 | 5 | 6 | 5 |
| バッテリー・電源 | 15,339 | 62.1% | 5,813 | 6 | 5 | 6 |
| 連続使用・持続 | 4,063 | 60.8% | 1,593 | 8 | 4 | 7 |
| サイズ・携帯 | 9,622 | 86.3% | 1,318 | 7 | 10 | 8 |
| 静音性 | 1,535 | 44.3% | 855 | 10 | 1 | 9 |
| 耐久・故障 | 1,554 | 49.6% | 783 | 9 | 2 | 10 |
好評でない言及 = 言及数 ×(1 − 好評率)。集計対象:美容家電デバイス14データセット・収録946商品、汎用10テーマに集約した観点言及254,060件(全観点言及337,226件のうち75.3%)/2026年6〜7月時点スナップショット/出所:TrendViewer(HALDATA)、楽天市場・Amazon.co.jpの購入者レビューを独自集計。
図1|影響量(好評でない言及の実数)で並べ直すと、率の順位とは逆転する
静音性は好評率では1位(最悪)だが影響量では9位。安全性は率3位でも影響量1位
棒の長さは好評でない言及の実数(最大値=安全性31,286件を100%とした相対表示)。作図:HALDATA Analytics 編集部。
2つの読み違いが、実際にどう効くか
頻出語で選ぶと「満足されている論点」を最優先にする
操作・使いやすさは言及N=48,714件で頻出2位です。ワードクラウドなら大きく表示される論点です。ところが好評率は81.8%で、10テーマ中9番目に高い(=満足されている)論点でした。ここを最優先で改良しても、動く数字はほとんどありません。
「よく語られる」は「うまくいっていない」ではありません。むしろ満足したから書かれていることが多く、頻出語の大きさと不満の量は別物です。
率で選ぶと「小さい問題」を最優先にする
静音性は好評率44.3%で10テーマ中もっとも低く、耐久・故障が49.6%で2番目です。率だけを見ればここから着手することになります。
しかし言及数はそれぞれN=1,535件・N=1,554件で、好評でない言及の実数は約855件・約783件。影響量では9位と10位、つまり最後の2つです。安全性の約31,286件とは36.6倍の差があります。率で並べると、影響量で最下位の論点を先頭に持ってくることになります。
この表を自社商品と競合商品で並べて作るところまでを自動でやるのがTrendViewerです。商品コード単位で観点別の好評率・不満率・言及数と、その月ごとの推移が出ます。
自社商品の観点別分析を見る(TrendViewer)レビュー原文は掲載していません。観点ごとに要約した集計値をお見せしています。
テキストマイニングのやり方:頻出語のあとに足す3工程
無料ツールで頻出語まで出したあと、順番を出すには次の3つが必要です。各工程の詳しい手順は 口コミ分析の方法(4ステップ) に実データつきでまとめています。
- 語を論点に束ねる ── 「音が」「うるさい」「静か」「深夜」を静音性へまとめる。この束ね方は文章の側から作る。あらかじめ用意した分類に当てはめると、実データでは24.7%の論点が落ちた
- 論点ごとに好評/中立/不満を判定する ── 1本のレビューは通常2〜4の論点にまたがるので、レビュー単位ではなく言及単位で数える。中立を不満に寄せないこと(中立が厚いのは説明不足のサインで、打ち手が別になる)
- 言及数と掛け合わせて並べる ── 影響量 = 言及数 ×(1 − 好評率)。これが着手順になる
エクセルでやる場合、どこで止まるか
頻出語の集計までなら表計算ソフトでも十分できます。止まるのは次の2点です。
ひとつは1文に複数の論点が混ざっている場合の切り分けです。行=レビューのまま数えると、「効果は満足だが音が気になる」という1行を、効果と静音性のどちらに数えるか決められません。論点別の比率を出すには、行=言及に開き直す必要があります。
もうひとつは継続して比較する場合です。観点の定義を人が都度決めると担当者ごとにぶれ、翌月と比べたときに市場が変わったのか集計が揺れたのか区別できなくなります。1回だけの調査なら手作業で足りますが、毎月追うなら定義を固定して回せる仕組みが要ります。
つまずきやすい3点
- ワードクラウドを成果物にしてしまう ── 図はできるが、次の一手が決まらない。成果物は「観点名・好評率・言及数」の3列の表
- 言及の少ない論点で結論を出す ── 実務では1観点あたりN=30件未満は判断に使わない。数件を傾向として扱うと優先順位を誤る
- 自社データだけで判断する ── 「静音性50%」が高いのか低いのかは、比較対象がないと決まらない。カテゴリ平均との落差で読む
よくある質問
テキストマイニングとは何ですか?何ができますか?
文章を単語に分解し(形態素解析)、出現回数や語の共起関係を数えて傾向を見る手法です。無料ツールでも頻出語・ワードクラウド・共起ネットワークまでは出せます。ただし出るのは「よく語られている語」で、「不満が多い論点」とは別です。順番を決めるには、論点ごとに好評・中立・不満を判定し、言及数と掛け合わせる工程が要ります。
ワードクラウドや頻出語だけでは足りないのですか?
足りません。頻出順は「よく語られる順」で、満足しているから語られていることも多いためです。実データでは操作・使いやすさは頻出2位(N=48,714)でしたが好評率81.8%で、直す必要は薄い論点でした。
好評率が低い順に手を打てばよいのですか?
それも順番を誤ります。最も低い静音性44.3%は言及がN=1,535件で、好評でない言及は約855件(影響量9位)。安全性は好評率60.6%でも言及N=79,405件・好評でない言及約31,286件で影響量1位です。差は36.6倍あります。
テキストマイニングはエクセルでできますか?
頻出語の集計まではできます。難しいのは、1文に複数の論点が混ざる場合の切り分けと、論点ごとの好評・中立・不満の判定です。また観点定義を人が都度決めると担当者ごとにぶれ、月次比較で市場の変化か集計の揺れか区別できなくなります。
分析する語はあらかじめ決めておくべきですか?
決め打ちすると商品固有の論点が落ちます。観点言及337,226件のうち汎用10テーマに集約できたのは254,060件(75.3%)で、残る83,166件(24.7%)はカテゴリ固有でした。語は文章の側から作り、あとから命名してください。
データの定義
| 観点(論点) | 購入者が評価している軸。静音性・耐久・効果実感など |
|---|---|
| 観点言及 | 1本のレビューの中で1つの観点に触れている記述。1レビューは通常2〜4観点にまたがる |
| 好評率 | その観点の好評言及数 ÷ その観点の全言及数(好評+中立+不満) |
| 好評でない言及 | 言及数 ×(1 − 好評率)。中立と不満の合計にあたる実数 |
| 集計対象 | 美容家電デバイス14データセット・収録946商品。汎用10テーマに集約した観点言及254,060件(全観点言及337,226件の75.3%)/2026年6〜7月時点スナップショット |
| 出所 | TrendViewer(HALDATA)。楽天市場・Amazon.co.jpの購入者レビューを独自集計。レビュー原文は掲載していません |
あわせて読みたい
あなたの商品は、どの観点で「賛否」が割れていますか?
この記事と同じ分析を、御社の商品で。TrendViewerは購入者レビューを観点別の好評率・不満率に分解し、自社・競合の「強み」と「後から効く弱点」を定量的に可視化します。
- 観点別センチメント分解
- 競合との横断比較
- 購入後3〜6ヶ月の不満予兆
観点別の賛否分解は、商品改良・LP訴求・レビュー対策の優先順位づけに直接使えます。