≡En resumen
- Crawling significa rastreo: un bot descarga tus páginas y sigue sus enlaces para descubrir otras nuevas.
- Rastrear no es indexar: Google puede visitar una URL y decidir no guardarla en su índice.
- El crawl budget solo preocupa de verdad en webs grandes o que cambian a diario; en una pyme el problema suele ser técnico, no de presupuesto.
- robots.txt bloquea el rastreo, pero no garantiza que una URL deje de aparecer en Google: para eso se usa noindex.
- Los bots de IA también rastrean: OAI-SearchBot decide si tu web puede salir en las búsquedas de ChatGPT.
01 ¿Qué es el crawling? Significado en SEO
La palabra viene del verbo inglés to crawl, «arrastrarse» o «gatear». La metáfora es la de una araña que avanza por su tela: por eso a estos programas también se les llama arañas web o spiders, y a la propia web, World Wide Web, «telaraña mundial». Cuando alguien busca «qué es crawl» en un contexto digital, casi siempre se refiere a este rastreo.
En SEO, el crawling es la puerta de entrada a todo lo demás. Si un bot no puede llegar a una página, o se encuentra un error al pedirla, esa página no existe para el buscador. Por eso cualquier trabajo de posicionamiento SEO empieza comprobando que Google rastrea bien la web.
| Contexto | Significado | Ejemplo |
|---|---|---|
| SEO y buscadores | Rastreo automático de páginas web por un bot | Googlebot hace crawling de tu tienda online |
| Web scraping | Recorrer muchas URL para extraer datos | Un crawler recoge precios de la competencia |
| Natación | Estilo libre; en español se escribe «crol» | Nadar 100 metros a crol |
| Inglés general | Arrastrarse, gatear o avanzar muy despacio | The baby is crawling (el bebé gatea) |
| Videojuegos | Dungeon crawler: juego de explorar mazmorras | Diablo es un dungeon crawler |
02 Cómo funciona el crawling de Google paso a paso
Google describe la Búsqueda en tres fases: rastreo, indexación y publicación de resultados. El crawling es la primera y la hace su rastreador principal, Googlebot. Así funciona el proceso:
-
1
Descubrimiento de URL
Google encuentra direcciones nuevas en páginas que ya conoce (enlaces), en los sitemaps que le envías y en las URL que ya visitó antes.
-
2
Cola de rastreo
Un algoritmo decide qué URL visitar, con qué frecuencia y cuántas páginas pedir a cada sitio sin saturar el servidor.
-
3
Consulta a robots.txt
Antes de pedir una página, el bot lee el archivo robots.txt del dominio para saber qué zonas tiene permitidas.
-
4
Descarga
Googlebot solicita la URL al servidor y recibe un código de respuesta (200, 301, 404, 500…) y el contenido.
-
5
Renderizado
Google ejecuta el JavaScript con una versión reciente de Chrome para ver la página como la vería un usuario.
-
6
Extracción de enlaces
Los enlaces encontrados vuelven a la cola, y la página pasa a la fase de indexación.
03 Crawling, indexación y ranking: diferencias
Son tres conceptos que se confunden a menudo. Rastrear es visitar; indexar es guardar y entender; posicionar es ordenar. Una URL rastreada no tiene por qué indexarse, y una URL indexada no tiene por qué posicionar. Lo explicamos a fondo en nuestra ficha sobre la indexación.
| Fase | Qué ocurre | Qué la bloquea | Dónde se comprueba |
|---|---|---|---|
| Crawling (rastreo) | El bot descarga la URL y sigue sus enlaces | robots.txt, errores 5xx, páginas huérfanas, login | Informe de estadísticas de rastreo de Search Console y logs del servidor |
| Indexación | Google analiza el contenido y lo guarda en su índice | noindex, canonical a otra URL, contenido duplicado o pobre | Informe de indexación de páginas e inspección de URL |
| Ranking | Google ordena las páginas indexadas para cada búsqueda | Poca relevancia, poca autoridad, mala experiencia | Informe de rendimiento de Search Console |
04 Crawl budget: el presupuesto de rastreo
El crawl budget es el tiempo y los recursos que Google dedica a rastrear un sitio. Google lo define como la combinación de dos factores: el límite de capacidad de rastreo (cuántas conexiones y durante cuánto tiempo aguanta tu servidor sin resentirse) y la demanda de rastreo (cuánto interés tiene Google en tus URL según su popularidad, su frecuencia de cambio y su calidad).
Webs muy grandes
Más de un millón de páginas con contenido que cambia cada semana. Aquí el presupuesto sí limita.
Webs medianas muy dinámicas
Más de 10.000 páginas que cambian a diario, como medios o marketplaces.
Muchas URL «descubiertas»
Sitios con gran parte de sus URL en el estado «Descubierta: actualmente sin indexar» de Search Console.
El resto de webs
Según Google, si no estás en esos casos, basta con mantener el sitemap al día y revisar la indexación.
05 Cómo mejorar el rastreo de tu web
- ✓Enlaza cada página importante desde otras páginas del sitio: sin enlaces internos, una URL queda huérfana.
- ✓Mantén un sitemap XML con solo URL canónicas que devuelvan 200 y envíalo en Search Console.
- ✓Revisa que robots.txt no bloquee CSS, JavaScript ni secciones que quieres posicionar.
- ✓Corrige errores 404 enlazados internamente y evita cadenas de más de una redirección.
- ✓Controla las URL con parámetros y los filtros de las tiendas online con canonical, noindex o bloqueo según el caso.
- ✓Sirve el contenido principal en el HTML inicial o asegúrate de que se renderiza sin errores.
- ✓Vigila el tiempo de respuesta del servidor y los picos de errores 5xx.
Para ver cómo te rastrea Google de verdad, combina el informe de estadísticas de rastreo de Search Console con el análisis de los logs del servidor y un rastreo propio con una herramienta como Screaming Frog. Es el núcleo de cualquier auditoría SEO técnica: detecta páginas que Google no visita, zonas donde malgasta peticiones y errores que tus usuarios no ven.
06 Tipos de crawlers: de Googlebot a los bots de IA
No solo Google rastrea tu web. Cada buscador, cada herramienta SEO y, cada vez más, cada empresa de inteligencia artificial tiene sus propios crawlers, y cada uno se identifica con un user agent distinto que puedes permitir o bloquear en robots.txt.
| Crawler | Empresa | Para qué rastrea |
|---|---|---|
| Googlebot (smartphone y ordenador) | Indexar páginas para la Búsqueda de Google | |
| Bingbot | Microsoft | Indexar para Bing (y los servicios que usan su índice) |
| YandexBot | Yandex | Indexar para el buscador ruso Yandex |
| OAI-SearchBot | OpenAI | Mostrar webs en las búsquedas de ChatGPT |
| GPTBot | OpenAI | Recoger contenido para entrenar sus modelos |
| Rastreadores SEO (AhrefsBot, SemrushBot…) | Herramientas SEO | Construir índices de enlaces y palabras clave |
07 Ejemplo práctico de problemas de crawling
Una tienda online de moda tiene 400 productos, pero sus filtros de talla, color y precio generan combinaciones infinitas de URL con parámetros. En las estadísticas de rastreo vemos que Googlebot dedica la mayor parte de sus peticiones a esas combinaciones y visita los productos nuevos con semanas de retraso.
La solución pasa por enlazar solo los filtros con demanda de búsqueda, marcar el resto con canonical o noindex, sacar del sitemap las URL que no deben posicionar y reforzar los enlaces internos hacia las categorías. Resultado esperable: los productos nuevos se rastrean antes y el presupuesto se concentra en las páginas que venden.
Si quieres profundizar en qué hace Google después del rastreo, te recomendamos esta explicación sobre cómo funciona el algoritmo de Google. Y si tu web tiene páginas que Google ignora, revisa también tu robots.txt: es la causa más frecuente de rastreos bloqueados por error.
Preguntas frecuentes sobre Crawling
Crawling significa rastreo. En SEO es el proceso por el que un bot, como Googlebot, visita las páginas de una web, descarga su contenido y sigue sus enlaces para descubrir nuevas URL.
Crawl es el verbo inglés «rastrear». Decir que Google ha hecho crawl de una URL significa que su bot la ha visitado y descargado. En natación, crawl es el estilo que en español se escribe «crol».
El crawling es la visita del bot a la página; la indexación es el análisis y almacenamiento de esa página en el índice del buscador. Una URL puede rastrearse y no indexarse, por ejemplo si tiene noindex o contenido duplicado.
Es el programa que hace el rastreo, también llamado araña, spider o bot. Googlebot, Bingbot y OAI-SearchBot son crawlers.
En Google Search Console, abre Ajustes y el informe de estadísticas de rastreo, o usa la inspección de URLs para ver la fecha del último rastreo. Los logs del servidor muestran cada visita de Googlebot.
Enlaza las páginas nuevas desde otras ya conocidas, mantén el sitemap XML actualizado, solicita la indexación en la inspección de URLs y asegúrate de que el servidor responde rápido y sin errores.
No necesariamente. robots.txt impide el rastreo, pero la URL puede seguir indexada si otras páginas la enlazan. Para eliminarla del índice hay que permitir el rastreo y usar la etiqueta noindex.
Fuentes consultadas
Sobre el autor
Raúl Aránega Segura
CEO y especialista SEO en appyweb
Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.
Ver perfil en LinkedIn ↗