ЯК ПРАЦЮЄ TF-IDF
Частота й рідкість об’єднуються в одній вазі
TF-IDF поєднує частоту терміна в документі з оберненою документною частотою в усьому корпусі. Терміни, що трапляються всюди, отримують меншу вагу; терміни в меншій кількості документів — більшу.
Усі документи використовують однакову попередню обробку, тому IDF розраховується за порівнюваним словником.
частота терміна ÷ слів у документіln((N + 1) ÷ (df + 1)) + 1СПІЛЬНИЙ КОРПУС
Перевіряйте кожен документ в одній моделі ваг
Корпус
Додайте від 2 до 10 текстів або URL і застосуйте спільні налаштування.
Сильні терміни
Обмежте таблицю відтворюваною кількістю термінів із найбільшою вагою.
Глобальний IDF
Перегляньте, які терміни краще розрізняють документи корпусу.
Експорт
Збережіть вектори всіх документів і спільні метадані розрахунку.
ОБМЕЖЕННЯ
Вага залежить від вибраного корпусу
Той самий термін отримує інший IDF при зміні складу корпусу. Висока вага означає рідкість у цих документах, а не загальну важливість чи пошукову цінність.