01
Точна формула TF-IDF
TF — частка терміна серед проаналізованих слів документа. df — кількість документів, що містять термін. N — загальна кількість документів.
Згладжування додає одиницю до N і df, а зовнішня одиниця зберігає додатну вагу термінів у всьому корпусі.
count(t,d) ÷ tokenCount(d)ln((N + 1) ÷ (df(t) + 1)) + 1TF(t,d) × IDF(t)02
Приклад для трьох документів
«Банан» є в усіх трьох документах: df=3, тому IDF=1. «Яблуко» є лише в одному: df=1, тому IDF≈1,693.
Якщо в першому документі 3 слова й «яблуко» трапилося двічі, TF=2/3, а TF-IDF≈1,129.
Рідкісний у корпусі термін отримує більший IDF, але підсумкова вага залежить і від його частки в документі.
03
Чому склад корпусу змінює результат
IDF — відносна характеристика. Якщо додати документи з «яблуком», його документна частота зросте, а вага знизиться.
Корпус має відповідати завданню: сторінки одного типу, набір для класифікації або версії матеріалів, які потрібно розрізняти.
- Однакова токенізація
- Фіксовані мова й стоп-слова
- Не порівнюйте ваги з різних корпусів
- Зберігайте налаштування з експортом
04
Коли TF-IDF корисний і чого не доводить
TF-IDF корисний для прозорих ознак класифікації, пошуку, кластеризації та косинусної подібності.
Висока вага означає відносну частоту в документі й рідкість у корпусі, а не загальну важливість або SEO-цінність.
БЕЗКОШТОВНО · БЕЗ РЕЄСТРАЦІЇ
Перевірте формулу на своїх документах
Додайте від 2 до 10 текстів або URL і перегляньте зважені таблиці та спільний IDF.
Розрахувати TF-IDF →