01
Формула косинусного сходства
Сначала оба документа представляются в одном словаре. Каждому термину соответствует вес — исходная частота Bag of Words или TF-IDF. Затем вычисляется скалярное произведение и делится на произведение длин векторов.
Нормализация уменьшает влияние общего масштаба: два документа могут иметь разное число слов, но похожее распределение терминов.
Σ(aᵢ × bᵢ) ÷ (√Σaᵢ² × √Σbᵢ²)aᵢ × bᵢ02
Простой пример векторов
Пусть A=[1,1,0], а B=[1,0,1]. Скалярное произведение равно 1. Длина каждого вектора равна √2. Косинус равен 1 ÷ (√2 × √2) = 0,5.
Один общий признак создаёт половинное сходство в этом симметричном примере. Таблица вклада показывает, какой именно термин дал ненулевое произведение.
0,5 — геометрическое сходство распределений весов, а не утверждение, что половина предложений одинакова.
03
Bag of Words или TF-IDF
BoW-режим показывает прямое лексическое пересечение. Частые служебные или общетематические слова могут сильнее влиять на оценку, особенно если стоп-слова сохранены.
TF-IDF уменьшает вес терминов, присутствующих в обоих документах, и подчёркивает более характерное пересечение. Для двух документов эффект корпуса ограничен, но метод остаётся полезным для проверки причины оценки.
- BoW — для прозрачного исходного пересечения
- TF-IDF — для пересечения с учётом редкости
- Таблица вклада — для объяснения результата
- Одинаковая обработка — обязательна для обоих источников
04
Как интерпретировать и где остановиться
Более высокая оценка означает более похожее направление векторов, а не автоматически одинаковый смысл. Два текста могут повторять одни слова в разных утверждениях или передавать одну идею разными словами.
Используйте метрику для проверки редакций, первичного поиска дубликатов и фильтрации кандидатов перед ручной оценкой. Не применяйте единый порог без проверки на данных своей задачи.
БЕСПЛАТНО · БЕЗ РЕГИСТРАЦИИ
Посмотрите не только оценку, но и её причину
Сравните два текста или URL в режимах BoW и TF-IDF и изучите вклад каждого общего термина.
Измерить сходство текстов →