01

¿Qué es el modelo Bag of Words?

Bag of Words, o BoW, representa un documento mediante los términos que contiene y la frecuencia de cada uno. Conserva qué palabras aparecen y cuántas veces, pero no la gramática ni el orden original.

La metáfora es literal: si colocas las palabras en una bolsa puedes contarlas, pero no reconstruir la oración. Esa pérdida de sintaxis permite una representación sencilla y verificable.

Definición breve

Bag of Words convierte texto en un vector de cantidades o pesos. Cada posición corresponde a un término del vocabulario.

02

Cómo funciona Bag of Words

El proceso estándar tiene cuatro pasos. Los detalles pueden variar, pero la lógica se mantiene.

1

Tokenización

Divide cada documento en palabras u otras unidades significativas.

2

Normalización

Unifica mayúsculas y, si procede, elimina puntuación o palabras vacías.

3

Vocabulario

Crea una lista común de términos únicos para el corpus.

4

Vectores

Cuenta cada término del vocabulario en cada documento.

El resultado suele ser disperso: la mayoría de las posiciones valen cero porque un documento usa solo una parte del vocabulario global.

03

Tokenización y representación vectorial

Considera dos documentos: «SEO tools analyze text» y «SEO tools compare text». Tras normalizar, el vocabulario común es:

[analyze, compare, seo, text, tools]
Documentoanalyzecompareseotexttools
A10111
B01111

Los documentos comparten tres términos y se diferencian en un verbo. La tokenización elegida afecta directamente el resultado: sin lematización, «analizar» y «análisis» son características distintas.

04

Frecuencias, N-gramas y pesos

Presencia

Indica si un término aparece al menos una vez.

Frecuencia

Guarda cantidad, porcentaje o apariciones por 1.000 palabras.

N-gramas

Añade frases como «análisis de texto» para conservar algo de orden local.

TF-IDF

Reduce el peso de términos comunes en todo el corpus.

Las cuatro variantes siguen usando un espacio fijo de características visibles; cambia cómo se calcula el valor de cada una.

05

Ventajas y limitaciones

VENTAJAS

Por qué sigue siendo útil

  • Fácil de implementar y explicar
  • Rápido en colecciones pequeñas y medianas
  • Cada característica se puede auditar
  • Buena línea base para clasificación

LIMITACIONES

Qué no comprende

  • Pierde gran parte del orden y la gramática
  • No modela el significado ni el contexto
  • Separa sinónimos en características distintas
  • Puede crear vocabularios muy grandes

«El perro persigue al gato» y «el gato persigue al perro» contienen las mismas palabras, por lo que un BoW de unigramas puede representarlas igual aunque su sentido difiera.

06

Bag of Words frente a Word2Vec

BoW crea cantidades visibles sin entrenar embeddings. Word2Vec aprende vectores densos a partir del contexto de las palabras en un corpus y puede acercar términos relacionados.

CaracterísticaBag of WordsWord2Vec
Representación

Cantidad o peso por término

Vector denso aprendido

Semántica

No modela similitud

Captura relaciones del corpus

Interpretación

Alta: dimensiones visibles

Menor: dimensiones aprendidas

Entrenamiento

No necesita embeddings

Necesita un corpus adecuado

Distinción importante

Continuous Bag of Words (CBOW) es una arquitectura para entrenar Word2Vec; no es el modelo clásico de recuentos descrito aquí.

07

Usos prácticos de Bag of Words

BoW permite revisar qué vocabulario domina una página, comparar versiones, encontrar frases repetidas y crear características explicables para modelos sencillos.

  • ¿Qué palabras dominan después de excluir palabras vacías?
  • ¿Qué cambió entre un borrador y la versión publicada?
  • ¿Qué bigramas describen mejor el tema?
  • ¿Una plantilla repetida distorsiona el vocabulario?

La frecuencia no demuestra relevancia ni calidad. Interpreta los datos junto con intención, utilidad, estructura, originalidad y legibilidad.

GRATIS · SIN REGISTRO

Prueba el analizador Bag of Words

Pega texto o una URL, edita las palabras vacías, controla frases, revisa porcentajes y compara A con B.

Abrir el analizador gratuito