Worthäufigkeit

Zählt, wie oft jedes Wort vorkommt. Eine Folge aus Chinesisch, Japanisch oder Koreanisch bleibt ein Token, bis Sie sie teilen.

Welche Wörter, wie oft

Ein Zähler sagt, wie lang der Text ist. Diese Seite sagt, welche Tokens sich wiederholen. Die erste Zeile ist die Summe. Danach Wort, Tabulator, Anzahl, die häufigsten zuerst. Länge und Sätze bleiben beim Wortzähler.

So benutzen Sie die Seite

  1. Text einfügen. Groß- und Kleinschreibung ignorieren ist an, also teilen sich To und to eine Zeile.
  2. CJK-Zeichen einzeln zählen ist aus. 北京 ist ein Token. An gezählt werden 北 und 京 getrennt. Hiragana, Katakana und Hangul folgen demselben Schalter.
  3. Mindestlänge lässt kürzere Tokens weg. Vorgabe ist 1.
  4. Beispiel lädt To be, or not to be. und Paris Paris London. Mit den Vorgaben sind to und be 2, paris ist 2.

Was ein Wort ist

Lateinische Wörter sind Buchstaben und Ziffern. Ein Apostroph im Wort bleibt, don't ist ein Token. Satzzeichen und Leerzeichen trennen. Eine Folge aus Han, Kana oder Hangul ist ein Token bis zu einem Leerzeichen oder einer anderen Schrift, außer Sie teilen CJK. Ignorieren speichert die kleingeschriebene Form. Sortiert wird nach Anzahl, dann nach dem Wort. Tokens unter der Mindestlänge fehlen in Liste und Summe. Ein ideographisches Leerzeichen trennt ebenfalls.

Wofür

  • Vor dem Kürzen sehen, welche Wörter dominieren.
  • Prüfen, dass ein Ortsname zweimal steht, als ein Token und nicht als zwei Zeichen.
  • Die Mindestlänge anheben, damit Einbuchstaben wegfallen.

Fragen

北京 war eine Zeile.

Das ist die Vorgabe. Schalten Sie CJK-Zeichen einzeln zählen ein, wenn Sie pro Zeichen zählen wollen.

The und the sind zusammen.

Ignorieren ist an. Aus trennt die Großschreibung in eine eigene Zeile.