シルギア

文字・単語の出現頻度カウントの使い方|単語・文字・N-gramの違いと日本語での見方

公開日:2026年9月7日 更新日:2026年9月1日 運営:シルギア(Analyzegear, Inc.) 対象ツール:文字・単語の出現頻度カウント

文章を書いたり読んだりしていると、「この語をつい何度も使っていないか」「テキスト全体でどの語が目立つのか」を客観的に確かめたくなることがあります。このツールは、貼り付けたテキストの中で各項目が何回出てくるかを数え、出現回数の多い順にランキングします。集計方法は単語・文字・N-gramの3モードから選べ、対象の言語や目的に合わせて使い分けられます。処理はすべてブラウザ内で完結し、入力した文章はどこにも送信されません。この記事では、3モードの違いと使いどころ、日本語での見方、割合や異なり数の意味を、実装に沿って具体的に整理します。

3つの集計モードの違い

まず、それぞれのモードが「何を1つの単位として数えるか」を押さえておくと、結果の読み方が一気にわかりやすくなります。

  • 単語モード:空白や記号で区切られた「文字・数字の連なり」を1語として数えます。英語のように語が空白で区切られる文章に向いています。
  • 文字モード:テキストを1文字ずつに分けて数えます。空白で区切られない日本語でも確実に集計できます。
  • N-gramモード:空白や改行をまたがずに、連続するN文字(2または3文字)を切り出して数えます。辞書なしで語のクセをつかむ簡易手段です。

同じテキストでも、どのモードを選ぶかで「何が上位に来るか」はまったく変わります。目的(語の偏りを見たいのか、文字の癖を見たいのか)と対象言語で選ぶのがコツです。

単語モードの仕組みと使いどころ

単語モードは、文字・数字が連続している部分を1語として取り出します。語の途中のアポストロフィ(don't の「'」など)は語の一部として連結されますが、それ以外の記号やスペースはすべて区切りとして扱われます。たとえば「aa bb aa cc aa」を単語モードで数えると、aa=3回、bb=1回、cc=1回、総単語数は5になります。

単語モードには2つのオプションがあります。ひとつは大文字・小文字を区別しない(初期状態でオン)で、Apple と apple をまとめて数えます。別々に数えたいときはオフにします。もうひとつは英語のストップワード除外で、the・a・is・of といった内容の薄い一般語を集計から外し、名詞や動詞など内容を表す語を上位に出しやすくします。たとえば「the cat and the dog」で除外をオンにすると、the と and が消えて cat=1、dog=1 だけが残ります。校正で重複表現を探すときや、英文の頻出キーワードを見たいときに便利です。

なぜ日本語は単語モードで正確に分けられないのか

単語モードは「空白で区切る」ことを前提にしています。ところが日本語は、英語のように語と語の間へ空白を入れません。「今日は良い天気です」を空白で区切ろうとしても、文全体がひとかたまりになってしまい、「今日」「天気」といった語には分かれないのです。

語をきちんと切り出すには、本来は辞書を使った形態素解析が必要です。このツールは誠実さを優先し、辞書ベースの解析はあえて行いません。中途半端な自動分割で「それらしいが実は不正確な結果」を出すより、何を数えているかが明確な方法に絞る、という考え方です。そのため日本語を単語モードに入れると、注記で文字モードやN-gramモードを案内します。

文字モードとN-gramで日本語のクセをつかむ

日本語では、文字モードとN-gramモードが役立ちます。文字モードは1文字ずつ数えるので、どの文字(漢字・かな)が多いかがそのままわかります。たとえば「ababc」を文字モードで数えると、a=2、b=2、c=1、総文字数は5です。空白・改行・タブは初期状態で除外されます。文章では空白が最も多くなりがちで、それが上位を占めると内容の傾向が見えにくいためです。空白の量そのものを調べたいときだけオフにします。

N-gramモードは、連続するN文字の並びを数えます。たとえば「あいあい」を2-gram(バイグラム)で数えると、切り出されるのは『あい』『いあ』『あい』の3つで、あい=2、いあ=1 となります。頻出する2〜3文字の並びから、辞書がなくてもよく使うフレーズや語の手がかりをつかめます。Nは2または3を選べ、区切りの空白や改行をまたぐことはありません。

総数・異なり数・割合の見方

結果の上部には3つの数値が並びます。総数は数えた項目の延べ件数(モードにより総単語数・総文字数・総N-gram数)、異なり数は重複を除いたユニークな項目の数、入力文字数は入力全体の文字数です。総数に対して異なり数が小さいほど、同じ語や文字を繰り返し使っている(語彙の偏りが強い)と読めます。

各項目の割合(%)は「その項目の回数 ÷ そのモードの総数 × 100」で計算します。先ほどの「aa bb aa cc aa」なら、aa は 3 ÷ 5 × 100 = 60.00% です。ここで大切なのは、表示件数を上位20件などに絞っても、割合の分母は常に全体の総数だという点です。だから絞り込んでも、上位項目が全体に占める本当の比率がわかります。ランキングは回数の降順、同数のときはキーの昇順で安定的に並びます。

よくある使い方と注意点

SEOや校正では、同じ言い回しを無意識に多用していないかのチェックに使えます。文字モードやN-gramで特定の語尾(「〜します」など)が突出していれば、単調さのサインかもしれません。結果はテキスト(タブ区切り)またはCSVでコピーでき、表計算ソフトに貼り付けて並べ替えやグラフ化にそのまま使えます。ただしコピーされるのは画面に表示中の上位N件のみなので、全件が必要なときは表示件数を「すべて表示」にしてからコピーしてください。

注意点として、N-gramの結果は「意味のある語」ではなく「連続する文字列」である点を忘れないでください。あくまで語の傾向をつかむ簡易手段であり、正確な単語頻度ではありません。また日本語を単語モードで数えても、思うように分かれないのは仕様どおりです。対象言語と目的にモードを合わせることが、有益な結果を得る一番の近道です。

「文字・単語の出現頻度カウント」を使ってみる →

ほかの記事

シーザー暗号・ROT13のしくみと使い方|ずらす・戻す・総当たりで解く 点字変換の使い方と六点点字の仕組み|五十音の規則を検算で理解 タイピング速度テスト|CPM・WPM・正確率の測り方と上達のコツ 改行コード・空白変換の使い方|LF/CRLFの違いと整形の順序 原稿用紙の枚数の数え方|400字詰めの基本と2つの換算方式 電話で聞き間違いを防ぐ通話表|NATOコードと和文通話表の使い方

記事一覧をすべて見る →