КАК РАБОТАЕТ TF-IDF
Частота и редкость объединяются в одном весе
TF-IDF сочетает частоту термина внутри документа с обратной документной частотой во всём выбранном корпусе. Термины, встречающиеся повсеместно, получают меньший вес; термины, сосредоточенные в меньшем числе документов, — больший.
Все документы используют единую предварительную обработку, поэтому IDF рассчитывается по сопоставимому словарю.
частота термина ÷ слов в документеln((N + 1) ÷ (df + 1)) + 1ОБЩИЙ КОРПУС
Проверяйте каждый документ в одной модели весов
Корпус
Добавьте от 2 до 10 текстов или публичных URL и примените общие настройки.
Сильные термины
Ограничьте таблицу воспроизводимым числом терминов с наибольшим весом.
Глобальный IDF
Посмотрите, какие термины лучше различают документы корпуса.
Экспорт
Сохраните векторы всех документов и общие метаданные расчёта.
ОГРАНИЧЕНИЯ
Вес зависит от выбранного корпуса
Тот же термин получает другой IDF при изменении состава корпуса. Высокий вес означает редкость в этих документах, а не общую важность, качество или поисковую ценность слова.