01
Три способа выразить частотность
Абсолютное количество отвечает на простой вопрос: сколько раз слово встретилось. Процент делит это количество на число анализируемых слов. Частота на 1 000 выражает ту же долю в более удобном масштабе.
Для одного документа эти показатели описывают одну закономерность. Нормализация становится особенно полезной при сравнении короткого черновика с длинной опубликованной страницей.
(количество термина ÷ слов в анализе) × 100(количество термина ÷ слов в анализе) × 1 00002
Пример расчёта
В тексте из 500 анализируемых слов термин «анализ» встретился 8 раз. Его доля равна 8 ÷ 500 = 0,016, то есть 1,6%. Нормализованная частота составляет 16 вхождений на 1 000 слов.
Если в другом тексте из 1 200 слов тот же термин встретился 12 раз, абсолютное количество выше, но доля ниже: 1% или 10 на 1 000. Именно поэтому сравнение только количества может вводить в заблуждение.
8 из 500 = 1,6% = 16 на 1 000; 12 из 1 200 = 1% = 10 на 1 000.
03
Токенизация и стоп-слова меняют знаменатель
До подсчёта нужно определить, что считается словом. Инструмент приводит регистр к единому виду, удаляет HTML и пунктуацию, не учитывает числовые токены и при необходимости исключает редактируемые стоп-слова.
Сравнивайте результаты только при одинаковых правилах. Если в одном тексте стоп-слова исключены, а в другом оставлены, проценты используют разные знаменатели.
- Одинаковый язык обработки
- Одинаковый список стоп-слов
- Одинаковое правило для чисел и пунктуации
- Одинаковый уровень анализа: слова или фразы
04
Как интерпретировать частотность
Высокая частота показывает, что термин занимает заметную часть словаря. Она может отражать тему, особенности жанра, шаблонные блоки или неестественный повтор. Низкая частота не означает, что слово нужно автоматически добавить.
Частотность не является оценкой качества или ранжирования. Используйте её как проверяемое свидетельство вместе с интентом, фактической точностью, структурой и читаемостью.
БЕСПЛАТНО · БЕЗ РЕГИСТРАЦИИ
Посчитайте полный словарь
Вставьте текст или публичный URL, настройте стоп-слова, найдите нужный термин и экспортируйте все строки.
Открыть счётчик частотности →