01
Формула косинусної подібності
Обидва документи подаються в одному словнику з вагами BoW або TF-IDF. Скалярний добуток ділиться на добуток довжин векторів.
Нормалізація зменшує вплив масштабу: документи можуть мати різну кількість слів, але подібний розподіл.
Σ(aᵢ × bᵢ) ÷ (√Σaᵢ² × √Σbᵢ²)aᵢ × bᵢ02
Простий приклад
Нехай A=[1,1,0], B=[1,0,1]. Скалярний добуток дорівнює 1, довжина кожного вектора — √2, а косинус — 0,5.
Одна спільна ознака створює половинну подібність у цьому симетричному прикладі.
0,5 — геометрична подібність розподілів ваг, а не твердження про половину однакових речень.
03
Bag of Words або TF-IDF
BoW показує прямий лексичний перетин. TF-IDF зменшує вагу термінів, спільних для документів, і підкреслює характерніший перетин.
- BoW — початковий перетин
- TF-IDF — перетин з урахуванням рідкості
- Таблиця внеску пояснює результат
- Обробка має бути однаковою
04
Як тлумачити результат
Вища оцінка означає подібніший напрямок векторів, але не обов’язково однаковий зміст.
Використовуйте метрику для перевірки редакцій і первинного пошуку дублікатів. Не задавайте один поріг без перевірки на даних своєї задачі.
БЕЗКОШТОВНО · БЕЗ РЕЄСТРАЦІЇ
Перегляньте не лише оцінку, а й причину
Порівняйте два тексти або URL у режимах BoW і TF-IDF та перегляньте внесок термінів.
Виміряти подібність текстів →