Частотность слов

Считает, сколько раз встречается каждое слово. Подряд идущие китайские, японские или корейские знаки остаются одним словом, пока вы их не разделите.

Какие слова и сколько раз

Счётчик говорит, какой длины текст. Эта страница говорит, какие слова повторяются. Первая строка — итог. Дальше слово, табуляция и число, самые частые сверху. Длина и предложения остаются на счётчике слов.

Как пользоваться

  1. Вставьте текст. «Не учитывать регистр» включено, поэтому To и to в одной строке.
  2. «Считать каждый знак CJK отдельно» выключено. 北京 — одно слово. Включённое делит 北 и 京. Хирагана, катакана и хангыль следуют тому же переключателю.
  3. Минимальная длина отбрасывает более короткие. Значение — 1.
  4. Пример загружает To be, or not to be. и Paris Paris London. По умолчанию to и be по 2, paris — 2.

Что считается словом

Латинские слова — это буквы и цифры. Апостроф внутри слова остаётся, don't — одно слово. Знаки препинания и пробелы режут. Непрерывный ряд иероглифов, каны или хангыля — одно слово до пробела или другой письменности, пока вы не разделите CJK. Без регистра показывается строчная форма. Сортировка — по числу, затем по слову. Короче минимума не попадает ни в список, ни в итог. Идеографический пробел тоже режет. Кириллица считается буквами, как латиница: Москва Москва даст одну строку с числом 2, если регистр не учитывается.

Когда нужно

  • Перед правкой увидеть, какие слова доминируют.
  • Проверить, что китайское название вставлено дважды как одно слово, а не как два знака.
  • Поднять минимальную длину, чтобы отсеять одиночные буквы.

Вопросы

北京 вышло одной строкой.

Так и задумано. Включите подсчёт каждого знака CJK, если нужна цифра на символ.

The и the слились.

Регистр не учитывается. Выключите опцию, чтобы заглавная форма была отдельной строкой.