≡En resumen
- El topic modeling encuentra temas en un conjunto de textos sin que nadie le diga antes cuáles son.
- LDA trata cada documento como una mezcla de temas y cada tema como una lista de palabras con probabilidades.
- BERTopic usa embeddings de modelos de lenguaje y funciona mejor con textos cortos y en varios idiomas.
- En SEO sirve para auditar un blog, detectar huecos de contenido y resumir reseñas o búsquedas; no sustituye al keyword clustering por SERP.
- Los temas que devuelve siempre necesitan interpretación humana: el algoritmo agrupa, no entiende.
01 ¿Qué es el topic modeling?
La idea nace en la recuperación de información. El análisis semántico latente (LSA), descrito por Deerwester y otros en 1990, ya reducía textos a «conceptos» mediante álgebra lineal. En 1999 Thomas Hofmann le dio una base probabilística (pLSA), y en 2003 David Blei, Andrew Ng y Michael Jordan publicaron la asignación latente de Dirichlet (LDA), el modelo que popularizó el término. Desde 2022, enfoques como BERTopic aplican los modelos de lenguaje modernos al mismo problema.
| Técnica | ¿Necesita etiquetas? | Qué obtienes |
|---|---|---|
| Topic modeling | No | Temas descubiertos y su peso en cada documento |
| Clasificación de textos | Sí, categorías definidas de antemano | Cada documento asignado a una categoría conocida |
| Keyword clustering | No | Grupos de palabras clave que puede posicionar una misma URL |
| Extracción de entidades | No (usa modelos entrenados) | Personas, marcas, lugares y conceptos mencionados |
02 Cómo funciona LDA, el modelo clásico
LDA es un modelo generativo: imagina que cada documento se escribió eligiendo primero una mezcla de temas (por ejemplo, 70 % viajes y 30 % gastronomía) y después, palabra a palabra, eligiendo un tema según esa mezcla y una palabra según ese tema. El algoritmo hace el camino inverso: a partir de los textos reales, estima qué temas y qué mezclas explican mejor las palabras observadas.
-
1
Preparar los textos
Tokenizar, pasar a minúsculas, eliminar stop words y, a menudo, lematizar para que «hoteles» y «hotel» cuenten igual.
-
2
Construir la bolsa de palabras
Cada documento se representa como un recuento de palabras; el orden se pierde.
-
3
Fijar el número de temas
LDA necesita que le digas cuántos temas buscar (k). Se prueban varios valores y se comparan.
-
4
Entrenar el modelo
El algoritmo ajusta, por inferencia variacional o muestreo, las probabilidades palabra-tema y tema-documento.
-
5
Interpretar y nombrar
Revisas las palabras más probables de cada tema y le pones un nombre legible.
Tema 1: anuncios, campaña, puja, presupuesto, conversión → publicidad de pago.
Tema 2: google, posicionamiento, enlaces, palabras, búsqueda → SEO.
Tema 3: instagram, seguidores, publicaciones, reels, contenido → redes sociales.
Un artículo sobre «cómo anunciarse en Instagram» saldría como una mezcla de los temas 1 y 3.
03 BERTopic y otras técnicas de topic modeling
BERTopic, presentado por Maarten Grootendorst en 2022, cambia el planteamiento. Primero convierte cada documento en un vector (embedding) con un modelo de lenguaje; después reduce la dimensión (por defecto con UMAP), agrupa los vectores parecidos (por defecto con HDBSCAN) y, por último, describe cada grupo con una variante de TF-IDF calculada por clases. Su documentación ofrece un modelo multilingüe para más de 50 idiomas, lo que lo hace práctico para textos en español.
| Técnica | Cómo representa el texto | Número de temas | Mejor para |
|---|---|---|---|
| LSA | Matriz de términos reducida con SVD | Fijo | Búsqueda y similitud, más que temas legibles |
| LDA | Bolsa de palabras con modelo probabilístico | Fijo (k) | Documentos largos y corpus grandes |
| NMF | Factorización de una matriz TF-IDF | Fijo | Resultados rápidos y temas nítidos |
| BERTopic | Embeddings de un modelo de lenguaje | Lo decide el clustering | Textos cortos (reseñas, búsquedas, tuits), varios idiomas |
| Con LLM | Un modelo generativo resume y etiqueta grupos | Flexible | Poner nombres legibles a los temas; más caro |
04 Usos del topic modeling en SEO y marketing de contenidos
Auditar un blog
Descubre de qué habla realmente tu web, qué temas están sobrerrepresentados y dónde hay artículos que compiten entre sí.
Detectar huecos de contenido
Compara los temas de tus páginas con los de las que posicionan en tu sector y encuentra lo que no cubres.
Agrupar búsquedas
Da una primera agrupación semántica de miles de keywords antes de validarla con la SERP.
Analizar reseñas y tickets
Resume qué elogian y qué critican los clientes, y alimenta preguntas frecuentes y textos de venta.
Planificar clústeres temáticos
Ayuda a diseñar páginas pilar y artículos satélite para ganar autoridad en un tema.
Para decidir qué palabras clave van en la misma URL, el método más fiable sigue siendo comparar resultados de búsqueda, como explicamos en keyword clustering; el topic modeling es un buen primer filtro semántico. Para ir más allá de las palabras sueltas, combínalo con un extractor de entidades, que identifica marcas, lugares y conceptos concretos, y revisa el campo semántico de cada tema al redactar.
Convertir ese análisis en una arquitectura de contenidos que atraiga tráfico cualificado es el núcleo de un buen trabajo de posicionamiento web.
05 Cómo hacer topic modeling paso a paso
-
1
Reúne el corpus
Exporta los textos: artículos del blog, títulos y descripciones de la competencia, reseñas o consultas de Search Console.
-
2
Limpia los datos
Quita duplicados, plantillas repetidas (menús, avisos legales) y textos demasiado cortos o vacíos.
-
3
Elige la herramienta
En Python, gensim o scikit-learn para LDA y NMF, y la librería bertopic para BERTopic; para español, usa un modelo de embeddings multilingüe.
-
4
Entrena y ajusta
Prueba distintos números de temas o tamaños mínimos de grupo y compara la coherencia de los resultados.
-
5
Nombra los temas
Revisa palabras y documentos representativos de cada tema y dales un nombre; puedes apoyarte en un modelo generativo.
-
6
Convierte los temas en decisiones
Cruza cada tema con tráfico, conversiones o volumen de búsqueda para priorizar qué crear, fusionar o mejorar.
Si no quieres programar, algunas herramientas SEO ya agrupan palabras clave o contenidos por temas. Y si el volumen de textos es grande y quieres automatizar el análisis de reseñas o de consultas de clientes, es un proyecto típico de automatización con inteligencia artificial.
06 Limitaciones y errores frecuentes
- ✓Tomar las listas de palabras como verdades: un tema es un patrón estadístico que hay que interpretar.
- ✓Elegir el número de temas a ojo en LDA, sin comparar varios valores ni medir la coherencia.
- ✓No eliminar stop words ni texto repetido de plantillas, que acaban formando temas vacíos.
- ✓Usar LDA con textos muy cortos, como búsquedas o tuits, donde apenas hay palabras que relacionar.
- ✓Aplicar un modelo de embeddings solo en inglés a textos en español.
- ✓No revisar los documentos marcados como ruido o fuera de tema en BERTopic.
Preguntas frecuentes sobre Topic modeling
Es una técnica de procesamiento del lenguaje natural que descubre automáticamente los temas de una colección de textos a partir de las palabras que aparecen juntas, sin necesidad de etiquetas previas.
La asignación latente de Dirichlet es un modelo probabilístico, publicado por Blei, Ng y Jordan en 2003, que representa cada documento como una mezcla de temas y cada tema como una distribución de palabras.
LDA trabaja con recuentos de palabras y un número fijo de temas. BERTopic usa embeddings de modelos de lenguaje y clustering, capta mejor los sinónimos y funciona mejor con textos cortos y multilingües.
Para auditar de qué habla una web, encontrar huecos frente a la competencia, agrupar búsquedas de forma preliminar y resumir reseñas o preguntas de clientes.
No. El topic modeling agrupa textos por temas; el keyword clustering agrupa palabras clave que puede posicionar una misma página, normalmente comparando resultados de búsqueda.
En Python, gensim y scikit-learn para LDA y NMF, y la librería bertopic para BERTopic. También hay herramientas SEO que agrupan contenidos por temas sin programar.
Sí, siempre que prepares los textos para el español (stop words y lematización) o uses un modelo de embeddings multilingüe, como los que ofrece BERTopic.
Fuentes consultadas
Sobre el autor
Raúl Aránega Segura
CEO y especialista SEO en appyweb
Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.
Ver perfil en LinkedIn ↗