≡En resumen
- Las técnicas de expansión se dividen en globales (no dependen de los resultados) y locales (usan los documentos recuperados).
- Rocchio mueve la consulta hacia los documentos marcados como relevantes y la aleja de los irrelevantes.
- La pseudo-retroalimentación automatiza ese proceso asumiendo que los primeros resultados son relevantes, con riesgo de deriva.
- Los modelos de lenguaje reescriben consultas o generan documentos hipotéticos para buscar por significado.
- El query fan-out de Google divide una pregunta en subconsultas: para tu contenido, cada subtema cuenta.
01 ¿Qué es una técnica de query expansion?
El concepto general, qué es expandir una consulta y por qué lo hacen los buscadores, está en la ficha de query expansion. Aquí nos centramos en el catálogo de técnicas: cómo funciona cada una, cuándo conviene y qué riesgos tiene. La clasificación clásica viene del manual Introduction to Information Retrieval (Manning, Raghavan y Schütze, 2008), que separa métodos globales y locales; a ella se suman hoy las técnicas neuronales y las basadas en modelos de lenguaje.
02 Catálogo de técnicas de expansión de consultas
| Técnica | Tipo | Cómo amplía la consulta | Riesgo principal |
|---|---|---|---|
| Tesauro manual (WordNet, vocabularios médicos) | Global | Añade sinónimos y términos relacionados definidos por personas | Coste de mantenimiento y ambigüedad |
| Tesauro automático por coocurrencia | Global | Relaciona palabras que aparecen juntas en la colección | Relaciones espurias |
| Normalización morfológica y ortográfica | Global | Stemming, lematización y corrección de errores | Unir palabras con significados distintos |
| Retroalimentación de relevancia (Rocchio) | Local | Recalcula la consulta con documentos que el usuario marca como relevantes | Exige esfuerzo del usuario |
| Pseudo-retroalimentación | Local | Asume que los primeros resultados son relevantes y extrae términos de ellos | Deriva de la consulta |
| Registros de búsqueda y sugerencias | Global | Propone reformulaciones que otros usuarios hicieron | Sesgo hacia lo popular |
| Embeddings | Neural | Busca términos o documentos cercanos en un espacio vectorial | Cercanía semántica no siempre es relevancia |
| Reescritura con LLM (HyDE, query2doc) | Generativa | Genera una reformulación o un documento hipotético que se usa para buscar | Alucinaciones y coste por consulta |
| Query fan-out | Generativa | Divide la pregunta en subconsultas que se lanzan en paralelo | Coste computacional; respuestas que mezclan fuentes |
03 Técnicas clásicas: tesauros y normalización
Tesauro controlado
Un vocabulario mantenido por expertos. Es la técnica más común de expansión global según Manning et al. PubMed la aplica de forma automática en búsquedas biomédicas.
Tesauro generado automáticamente
Se construye analizando qué palabras aparecen en contextos parecidos dentro de la colección. Barato, pero menos fiable.
Stemming y lematización
No añaden sinónimos, pero unen variantes («abogado», «abogados») para que cuenten como la misma consulta.
Corrección ortográfica
Convierte «inglish» en «inglés». Google la cita como el primer paso de su sistema para entender consultas.
En un buscador interno, estas técnicas se configuran en el analizador de texto. Elasticsearch, por ejemplo, ofrece filtros de stemming por idioma y filtros de sinónimos que puedes alimentar con el vocabulario de tu catálogo.
04 Retroalimentación de relevancia: Rocchio y pseudo-relevancia
El algoritmo de Rocchio (1971) trata la consulta como un vector y la desplaza hacia el centro de los documentos relevantes y lejos de los no relevantes. La consulta modificada es: q' = α·q + β·(media de los relevantes) − γ·(media de los no relevantes). Manning et al. proponen como valores razonables α = 1, β = 0,75 y γ = 0,15, y señalan que la retroalimentación positiva vale mucho más que la negativa; muchos sistemas usan γ = 0.
-
1
Búsqueda inicial
El sistema devuelve resultados para la consulta original.
-
2
Selección de relevantes
En Rocchio, el usuario marca los buenos; en la pseudo-retroalimentación, se asume que lo son los primeros k resultados.
-
3
Extracción de términos
Se toman los términos más representativos de esos documentos.
-
4
Nueva búsqueda
La consulta ampliada y reponderada se lanza de nuevo.
05 Técnicas neuronales y con modelos de lenguaje
Embeddings
Representan palabras, consultas y documentos como vectores. La expansión consiste en añadir términos cercanos o buscar directamente por similitud vectorial.
HyDE
Propuesta en diciembre de 2022 (Gao et al.): un LLM escribe un documento hipotético que respondería a la consulta y se busca por similitud con ese documento.
query2doc
Publicada en marzo de 2023 (Wang et al.): genera un pseudodocumento con un LLM y lo concatena a la consulta original para mejorar la recuperación.
Multi-consulta en RAG
En sistemas de generación aumentada por recuperación, un modelo reescribe la pregunta en varias versiones y se combinan los resultados de todas.
06 Query fan-out: la técnica de AI Overviews y el Modo IA
Google describe el query fan-out como la técnica que usan AI Overviews y el Modo IA: emitir varias búsquedas relacionadas sobre subtemas y fuentes de datos para elaborar una respuesta. Al presentar el Modo IA en mayo de 2025 explicó que divide la pregunta en subtemas y lanza una multitud de consultas simultáneas en nombre del usuario; Deep Search usa la misma técnica llevada más allá y puede emitir cientos de búsquedas.
«¿Qué CRM me conviene para una clínica de fisioterapia con tres sedes?» puede convertirse en subconsultas sobre CRM específicos para clínicas, gestión multisede, precios, cumplimiento de protección de datos sanitarios y opiniones. Una página que resuelva de forma clara uno de esos subtemas puede acabar citada aunque no posicione para la pregunta completa. Lo desarrollamos en nuestra guía de SEO para IA.
07 Cómo elegir técnica y qué implica para tu contenido
| Situación | Técnica recomendable |
|---|---|
| Tienda online con catálogo técnico | Sinónimos propios del catálogo y stemming ligero |
| Base documental especializada (legal, médica) | Tesauro controlado del sector |
| Colección grande sin datos de usuario | Pseudo-retroalimentación con pocos términos añadidos |
| Chatbot o asistente con RAG | Reescritura con LLM y multi-consulta, medida con un conjunto de preguntas de prueba |
- ✓Prepara un conjunto de consultas reales con sus documentos correctos antes de tocar nada.
- ✓Mide precisión y exhaustividad con y sin la técnica: si sube una y se hunde la otra, ajusta cuántos términos añades.
- ✓Da menos peso a los términos añadidos que a los originales de la consulta.
- ✓Revisa a mano las consultas ambiguas, que son las que más sufren la deriva.
- ✓Controla latencia y coste: una reescritura con LLM añade una llamada al modelo en cada búsqueda.
Si eres quien publica el contenido y no quien construye el buscador, la lección es otra: los sistemas expanden tu consulta objetivo hacia sinónimos y subtemas, así que una página completa y bien estructurada gana. Es la base para posicionar tu web en Google y para aparecer en las respuestas de la IA.
Preguntas frecuentes sobre Query expansion technique
Las principales son los tesauros (manuales o automáticos), la normalización morfológica y ortográfica, la retroalimentación de relevancia de Rocchio, la pseudo-retroalimentación, los embeddings, la reescritura con LLM y el query fan-out.
Es una técnica de 1971 que modifica el vector de la consulta acercándolo a los documentos marcados como relevantes y alejándolo de los no relevantes.
Es la versión automática de Rocchio: asume que los primeros resultados son relevantes, extrae sus términos y relanza la búsqueda sin intervención del usuario.
Las globales amplían la consulta sin mirar los resultados, por ejemplo con un tesauro; las locales usan los documentos que devuelve la primera búsqueda.
Reescribiendo la pregunta en varias formulaciones o generando un documento hipotético que la respondería, como proponen HyDE y query2doc, y buscando con ese texto.
Es la técnica que Google describe para AI Overviews y el Modo IA: dividir una pregunta en subtemas y lanzar varias búsquedas relacionadas para componer la respuesta.
Query expansion es el concepto general de ampliar una consulta; una query expansion technique es cada método concreto para hacerlo, como Rocchio o la reescritura con LLM.
Normalmente una combinación de stemming ligero y una lista de sinónimos propia del catálogo, configuradas en el motor de búsqueda. Las técnicas con LLM se reservan para buscadores conversacionales o con mucho tráfico.
Fuentes consultadas
Sobre el autor
Raúl Aránega Segura
CEO y especialista SEO en appyweb
Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.
Ver perfil en LinkedIn ↗