01
¿Qué es el modelo Bag of Words?
Bag of Words, o BoW, representa un documento mediante los términos que contiene y la frecuencia de cada uno. Conserva qué palabras aparecen y cuántas veces, pero no la gramática ni el orden original.
La metáfora es literal: si colocas las palabras en una bolsa puedes contarlas, pero no reconstruir la oración. Esa pérdida de sintaxis permite una representación sencilla y verificable.
Bag of Words convierte texto en un vector de cantidades o pesos. Cada posición corresponde a un término del vocabulario.
02
Cómo funciona Bag of Words
El proceso estándar tiene cuatro pasos. Los detalles pueden variar, pero la lógica se mantiene.
Tokenización
Divide cada documento en palabras u otras unidades significativas.
Normalización
Unifica mayúsculas y, si procede, elimina puntuación o palabras vacías.
Vocabulario
Crea una lista común de términos únicos para el corpus.
Vectores
Cuenta cada término del vocabulario en cada documento.
El resultado suele ser disperso: la mayoría de las posiciones valen cero porque un documento usa solo una parte del vocabulario global.
03
Tokenización y representación vectorial
Considera dos documentos: «SEO tools analyze text» y «SEO tools compare text». Tras normalizar, el vocabulario común es:
[analyze, compare, seo, text, tools]Los documentos comparten tres términos y se diferencian en un verbo. La tokenización elegida afecta directamente el resultado: sin lematización, «analizar» y «análisis» son características distintas.
04
Frecuencias, N-gramas y pesos
Presencia
Indica si un término aparece al menos una vez.
Frecuencia
Guarda cantidad, porcentaje o apariciones por 1.000 palabras.
N-gramas
Añade frases como «análisis de texto» para conservar algo de orden local.
TF-IDF
Reduce el peso de términos comunes en todo el corpus.
Las cuatro variantes siguen usando un espacio fijo de características visibles; cambia cómo se calcula el valor de cada una.
05
Ventajas y limitaciones
VENTAJAS
Por qué sigue siendo útil
- Fácil de implementar y explicar
- Rápido en colecciones pequeñas y medianas
- Cada característica se puede auditar
- Buena línea base para clasificación
LIMITACIONES
Qué no comprende
- Pierde gran parte del orden y la gramática
- No modela el significado ni el contexto
- Separa sinónimos en características distintas
- Puede crear vocabularios muy grandes
«El perro persigue al gato» y «el gato persigue al perro» contienen las mismas palabras, por lo que un BoW de unigramas puede representarlas igual aunque su sentido difiera.
06
Bag of Words frente a Word2Vec
BoW crea cantidades visibles sin entrenar embeddings. Word2Vec aprende vectores densos a partir del contexto de las palabras en un corpus y puede acercar términos relacionados.
Cantidad o peso por término
Vector denso aprendido
No modela similitud
Captura relaciones del corpus
Alta: dimensiones visibles
Menor: dimensiones aprendidas
No necesita embeddings
Necesita un corpus adecuado
Continuous Bag of Words (CBOW) es una arquitectura para entrenar Word2Vec; no es el modelo clásico de recuentos descrito aquí.
07
Usos prácticos de Bag of Words
BoW permite revisar qué vocabulario domina una página, comparar versiones, encontrar frases repetidas y crear características explicables para modelos sencillos.
- ¿Qué palabras dominan después de excluir palabras vacías?
- ¿Qué cambió entre un borrador y la versión publicada?
- ¿Qué bigramas describen mejor el tema?
- ¿Una plantilla repetida distorsiona el vocabulario?
La frecuencia no demuestra relevancia ni calidad. Interpreta los datos junto con intención, utilidad, estructura, originalidad y legibilidad.
GRATIS · SIN REGISTRO
Prueba el analizador Bag of Words
Pega texto o una URL, edita las palabras vacías, controla frases, revisa porcentajes y compara A con B.
Abrir el analizador gratuito →