Zählt, wie oft jedes Wort vorkommt. Eine Folge aus Chinesisch, Japanisch oder Koreanisch bleibt ein Token, bis Sie sie teilen.
Ein Zähler sagt, wie lang der Text ist. Diese Seite sagt, welche Tokens sich wiederholen. Die erste Zeile ist die Summe. Danach Wort, Tabulator, Anzahl, die häufigsten zuerst. Länge und Sätze bleiben beim Wortzähler.
To und to eine Zeile.北京 ist ein Token. An gezählt werden 北 und 京 getrennt. Hiragana, Katakana und Hangul folgen demselben Schalter.To be, or not to be. und Paris Paris London. Mit den Vorgaben sind to und be 2, paris ist 2.Lateinische Wörter sind Buchstaben und Ziffern. Ein Apostroph im Wort bleibt, don't ist ein Token. Satzzeichen und Leerzeichen trennen. Eine Folge aus Han, Kana oder Hangul ist ein Token bis zu einem Leerzeichen oder einer anderen Schrift, außer Sie teilen CJK. Ignorieren speichert die kleingeschriebene Form. Sortiert wird nach Anzahl, dann nach dem Wort. Tokens unter der Mindestlänge fehlen in Liste und Summe. Ein ideographisches Leerzeichen trennt ebenfalls.
Das ist die Vorgabe. Schalten Sie CJK-Zeichen einzeln zählen ein, wenn Sie pro Zeichen zählen wollen.
Ignorieren ist an. Aus trennt die Großschreibung in eine eigene Zeile.