01

Точна формула TF-IDF

TF — частка терміна серед проаналізованих слів документа. df — кількість документів, що містять термін. N — загальна кількість документів.

Згладжування додає одиницю до N і df, а зовнішня одиниця зберігає додатну вагу термінів у всьому корпусі.

TF(t,d)count(t,d) ÷ tokenCount(d)
IDF(t)ln((N + 1) ÷ (df(t) + 1)) + 1
TF-IDF(t,d)TF(t,d) × IDF(t)

02

Приклад для трьох документів

«Банан» є в усіх трьох документах: df=3, тому IDF=1. «Яблуко» є лише в одному: df=1, тому IDF≈1,693.

Якщо в першому документі 3 слова й «яблуко» трапилося двічі, TF=2/3, а TF-IDF≈1,129.

Що показує приклад

Рідкісний у корпусі термін отримує більший IDF, але підсумкова вага залежить і від його частки в документі.

03

Чому склад корпусу змінює результат

IDF — відносна характеристика. Якщо додати документи з «яблуком», його документна частота зросте, а вага знизиться.

Корпус має відповідати завданню: сторінки одного типу, набір для класифікації або версії матеріалів, які потрібно розрізняти.

  • Однакова токенізація
  • Фіксовані мова й стоп-слова
  • Не порівнюйте ваги з різних корпусів
  • Зберігайте налаштування з експортом

04

Коли TF-IDF корисний і чого не доводить

TF-IDF корисний для прозорих ознак класифікації, пошуку, кластеризації та косинусної подібності.

Висока вага означає відносну частоту в документі й рідкість у корпусі, а не загальну важливість або SEO-цінність.

БЕЗКОШТОВНО · БЕЗ РЕЄСТРАЦІЇ

Перевірте формулу на своїх документах

Додайте від 2 до 10 текстів або URL і перегляньте зважені таблиці та спільний IDF.

Розрахувати TF-IDF