01

Формула косинусного сходства

Сначала оба документа представляются в одном словаре. Каждому термину соответствует вес — исходная частота Bag of Words или TF-IDF. Затем вычисляется скалярное произведение и делится на произведение длин векторов.

Нормализация уменьшает влияние общего масштаба: два документа могут иметь разное число слов, но похожее распределение терминов.

cos(A,B)Σ(aᵢ × bᵢ) ÷ (√Σaᵢ² × √Σbᵢ²)
Вклад термина iaᵢ × bᵢ

02

Простой пример векторов

Пусть A=[1,1,0], а B=[1,0,1]. Скалярное произведение равно 1. Длина каждого вектора равна √2. Косинус равен 1 ÷ (√2 × √2) = 0,5.

Один общий признак создаёт половинное сходство в этом симметричном примере. Таблица вклада показывает, какой именно термин дал ненулевое произведение.

Оценка не является процентом совпавшего текста

0,5 — геометрическое сходство распределений весов, а не утверждение, что половина предложений одинакова.

03

Bag of Words или TF-IDF

BoW-режим показывает прямое лексическое пересечение. Частые служебные или общетематические слова могут сильнее влиять на оценку, особенно если стоп-слова сохранены.

TF-IDF уменьшает вес терминов, присутствующих в обоих документах, и подчёркивает более характерное пересечение. Для двух документов эффект корпуса ограничен, но метод остаётся полезным для проверки причины оценки.

  • BoW — для прозрачного исходного пересечения
  • TF-IDF — для пересечения с учётом редкости
  • Таблица вклада — для объяснения результата
  • Одинаковая обработка — обязательна для обоих источников

04

Как интерпретировать и где остановиться

Более высокая оценка означает более похожее направление векторов, а не автоматически одинаковый смысл. Два текста могут повторять одни слова в разных утверждениях или передавать одну идею разными словами.

Используйте метрику для проверки редакций, первичного поиска дубликатов и фильтрации кандидатов перед ручной оценкой. Не применяйте единый порог без проверки на данных своей задачи.

БЕСПЛАТНО · БЕЗ РЕГИСТРАЦИИ

Посмотрите не только оценку, но и её причину

Сравните два текста или URL в режимах BoW и TF-IDF и изучите вклад каждого общего термина.

Измерить сходство текстов