Frequenza delle parole

Conta quante volte compare ogni parola. Una sequenza di cinese, giapponese o coreano resta un solo token, salvo che tu la separi.

Quali parole e quante volte

Un contatore dice quanto è lungo il testo. Questa pagina dice quali parole si ripetono. La prima riga è il totale. Ogni riga dopo è una parola, un tabulatore e un numero, le più frequenti prima. Lunghezza e frasi restano su contatore di parole.

Come usarla

  1. Incolla il testo. Ignora maiuscole e minuscole è attivo, quindi To e to condividono una riga.
  2. Conta ogni carattere CJK è spento. 北京 è un token. Acceso, 北 e 京 si separano. Hiragana, katakana e hangul seguono lo stesso interruttore.
  3. Lunghezza minima lascia fuori ciò che è più corto. Il valore è 1.
  4. L’esempio carica To be, or not to be. e Paris Paris London. Di base, to e be sono 2, e paris è 2.

Che cosa conta come parola

Le parole latine sono lettere e cifre. Un apostrofo dentro la parola resta, quindi don't è un token. Punteggiatura e spazi tagliano. Una sequenza di han, kana o hangul è un token fino a uno spazio o a un’altra scrittura, salvo che separi il CJK. Ignorare le maiuscole mostra la forma minuscola. L’ordine è il conteggio e poi la parola. Ciò che è più corto del minimo esce dall’elenco e dal totale. Anche uno spazio ideografico taglia.

Quando serve

  • Vedere quali parole dominano un paragrafo prima di riscriverlo.
  • Controllare che un toponimo cinese sia stato incollato due volte, come un token e non come due caratteri.
  • Alzare la lunghezza minima per lasciare fuori le lettere isolate.

Domande

北京 è uscito su una sola riga.

È l’impostazione di partenza. Attiva Conta ogni carattere CJK se vuoi il conto per carattere.

The e the si sono uniti.

Ignora maiuscole e minuscole è attivo. Spegnilo per tenere la maiuscola su un’altra riga.