01
Що представляє кожен метод
Bag of Words створює спільний словник, а документ записує кількістю або вагою кожного терміна. Вектор зазвичай великий і розріджений.
Word2Vec навчає для кожного слова щільний вектор фіксованої довжини. Його координати не відповідають видимим термінам, зате контекстно пов’язані слова можуть бути близькими.
- BoW: одна ознака на термін словника
- Word2Vec: навчений вектор на слово
- BoW: документ представлено безпосередньо
- Word2Vec: вектори слів треба додатково об’єднати
02
Семантика та порядок слів
Класичний уніграмний BoW не розрізняє фрази з однаковим набором слів у різному порядку. Біграми й триграми частково зберігають локальні послідовності.
Word2Vec використовує контекст корпусу та може зближувати пов’язані слова, але не створює готового подання речення й не гарантує розуміння багатозначності.
Continuous Bag of Words — архітектура навчання Word2Vec, а не частотний вектор документа.
03
Інтерпретованість, дані та вартість
BoW не потребує навчання ембедингів: достатньо токенізації та словника. Кожну координату можна пояснити конкретним терміном.
Word2Vec потребує відповідного корпусу або готових ембедингів. Він компактніший, але окремі виміри важко пояснити.
- BoW — для прозорих частот і базових моделей
- TF-IDF — коли спільні слова мають важити менше
- Word2Vec — коли важлива близькість слів
- Перевіряйте домен і мову навчальних даних
04
Як вибрати метод
Для аналізу словника, повторів і пояснюваної класифікації почніть із BoW або TF-IDF.
Коли синоніми й контекст важливіші за точні збіги, Word2Vec може дати корисніші ознаки. Порівнюйте методи на валідаційному наборі.
БЕЗКОШТОВНО · БЕЗ РЕЄСТРАЦІЇ
Почніть із прозорого вектора
Побудуйте повний вектор термінів, перегляньте частоти й експортуйте дані.
Побудувати вектор Bag of Words →