Conta quantas vezes cada palavra aparece. Uma sequência de chinês, japonês ou coreano continua sendo um token, a menos que você a separe.
Um contador diz o tamanho do texto. Esta página diz quais palavras se repetem. A primeira linha é o total. Cada linha seguinte é uma palavra, um tabulador e um número, as mais frequentes primeiro. Tamanho e frases continuam em contador de palavras.
To e to compartilham uma linha.北京 é um token. Ligado, 北 e 京 se separam. Hiragana, katakana e hangul seguem o mesmo interruptor.To be, or not to be. e Paris Paris London. No padrão, to e be são 2, e paris é 2.Palavras latinas são letras e dígitos. Um apóstrofo dentro da palavra fica, então don't é um token. Pontuação e espaços cortam. Uma sequência de han, kana ou hangul é um token até um espaço ou outra escrita, salvo se você separar o CJK. Ignorar maiúsculas mostra a forma minúscula. A ordem é a contagem e depois a palavra. O que for mais curto que o mínimo sai da lista e do total. Um espaço ideográfico também corta.
É o padrão. Ligue Contar cada caractere CJK se quiser a conta por caractere.
Ignorar maiúsculas está ligado. Desligue para manter a maiúscula em outra linha.