DICCIONARIO · C

Crawling

El crawling (rastreo) es el proceso por el que un programa automático, llamado crawler, araña o bot, recorre la web siguiendo enlaces y descargando páginas para que un buscador o una IA pueda analizarlas. Es el primer paso del SEO: si Google no puede rastrear una URL, no la indexará ni la mostrará en sus resultados.

Raúl Aránega Segura Escrito por Raúl Aránega Segura 7 min de lectura
Ficha rápida
Traducción
Rastreo (del inglés to crawl, «arrastrarse, gatear»)
Quién lo hace
Crawlers o bots: Googlebot, Bingbot, OAI-SearchBot, GPTBot…
Fases de Google
Rastreo, indexación y publicación de resultados
Límite de Googlebot
Primeros 2 MB de cada archivo compatible y 64 MB de los PDF (Google Search Central)
Cómo se controla
robots.txt, enlaces internos, sitemap XML y códigos de respuesta del servidor

≡En resumen

  • Crawling significa rastreo: un bot descarga tus páginas y sigue sus enlaces para descubrir otras nuevas.
  • Rastrear no es indexar: Google puede visitar una URL y decidir no guardarla en su índice.
  • El crawl budget solo preocupa de verdad en webs grandes o que cambian a diario; en una pyme el problema suele ser técnico, no de presupuesto.
  • robots.txt bloquea el rastreo, pero no garantiza que una URL deje de aparecer en Google: para eso se usa noindex.
  • Los bots de IA también rastrean: OAI-SearchBot decide si tu web puede salir en las búsquedas de ChatGPT.

01 ¿Qué es el crawling? Significado en SEO

La palabra viene del verbo inglés to crawl, «arrastrarse» o «gatear». La metáfora es la de una araña que avanza por su tela: por eso a estos programas también se les llama arañas web o spiders, y a la propia web, World Wide Web, «telaraña mundial». Cuando alguien busca «qué es crawl» en un contexto digital, casi siempre se refiere a este rastreo.

En SEO, el crawling es la puerta de entrada a todo lo demás. Si un bot no puede llegar a una página, o se encuentra un error al pedirla, esa página no existe para el buscador. Por eso cualquier trabajo de posicionamiento SEO empieza comprobando que Google rastrea bien la web.

Contexto Significado Ejemplo
SEO y buscadores Rastreo automático de páginas web por un bot Googlebot hace crawling de tu tienda online
Web scraping Recorrer muchas URL para extraer datos Un crawler recoge precios de la competencia
Natación Estilo libre; en español se escribe «crol» Nadar 100 metros a crol
Inglés general Arrastrarse, gatear o avanzar muy despacio The baby is crawling (el bebé gatea)
Videojuegos Dungeon crawler: juego de explorar mazmorras Diablo es un dungeon crawler
Otros significados de crawl y crawling

02 Cómo funciona el crawling de Google paso a paso

Google describe la Búsqueda en tres fases: rastreo, indexación y publicación de resultados. El crawling es la primera y la hace su rastreador principal, Googlebot. Así funciona el proceso:

  1. 1

    Descubrimiento de URL

    Google encuentra direcciones nuevas en páginas que ya conoce (enlaces), en los sitemaps que le envías y en las URL que ya visitó antes.

  2. 2

    Cola de rastreo

    Un algoritmo decide qué URL visitar, con qué frecuencia y cuántas páginas pedir a cada sitio sin saturar el servidor.

  3. 3

    Consulta a robots.txt

    Antes de pedir una página, el bot lee el archivo robots.txt del dominio para saber qué zonas tiene permitidas.

  4. 4

    Descarga

    Googlebot solicita la URL al servidor y recibe un código de respuesta (200, 301, 404, 500…) y el contenido.

  5. 5

    Renderizado

    Google ejecuta el JavaScript con una versión reciente de Chrome para ver la página como la vería un usuario.

  6. 6

    Extracción de enlaces

    Los enlaces encontrados vuelven a la cola, y la página pasa a la fase de indexación.

03 Crawling, indexación y ranking: diferencias

Son tres conceptos que se confunden a menudo. Rastrear es visitar; indexar es guardar y entender; posicionar es ordenar. Una URL rastreada no tiene por qué indexarse, y una URL indexada no tiene por qué posicionar. Lo explicamos a fondo en nuestra ficha sobre la indexación.

Fase Qué ocurre Qué la bloquea Dónde se comprueba
Crawling (rastreo) El bot descarga la URL y sigue sus enlaces robots.txt, errores 5xx, páginas huérfanas, login Informe de estadísticas de rastreo de Search Console y logs del servidor
Indexación Google analiza el contenido y lo guarda en su índice noindex, canonical a otra URL, contenido duplicado o pobre Informe de indexación de páginas e inspección de URL
Ranking Google ordena las páginas indexadas para cada búsqueda Poca relevancia, poca autoridad, mala experiencia Informe de rendimiento de Search Console
Crawling vs indexación vs ranking

04 Crawl budget: el presupuesto de rastreo

El crawl budget es el tiempo y los recursos que Google dedica a rastrear un sitio. Google lo define como la combinación de dos factores: el límite de capacidad de rastreo (cuántas conexiones y durante cuánto tiempo aguanta tu servidor sin resentirse) y la demanda de rastreo (cuánto interés tiene Google en tus URL según su popularidad, su frecuencia de cambio y su calidad).

01

Webs muy grandes

Más de un millón de páginas con contenido que cambia cada semana. Aquí el presupuesto sí limita.

02

Webs medianas muy dinámicas

Más de 10.000 páginas que cambian a diario, como medios o marketplaces.

03

Muchas URL «descubiertas»

Sitios con gran parte de sus URL en el estado «Descubierta: actualmente sin indexar» de Search Console.

04

El resto de webs

Según Google, si no estás en esos casos, basta con mantener el sitemap al día y revisar la indexación.

05 Cómo mejorar el rastreo de tu web

  • ✓Enlaza cada página importante desde otras páginas del sitio: sin enlaces internos, una URL queda huérfana.
  • ✓Mantén un sitemap XML con solo URL canónicas que devuelvan 200 y envíalo en Search Console.
  • ✓Revisa que robots.txt no bloquee CSS, JavaScript ni secciones que quieres posicionar.
  • ✓Corrige errores 404 enlazados internamente y evita cadenas de más de una redirección.
  • ✓Controla las URL con parámetros y los filtros de las tiendas online con canonical, noindex o bloqueo según el caso.
  • ✓Sirve el contenido principal en el HTML inicial o asegúrate de que se renderiza sin errores.
  • ✓Vigila el tiempo de respuesta del servidor y los picos de errores 5xx.

Para ver cómo te rastrea Google de verdad, combina el informe de estadísticas de rastreo de Search Console con el análisis de los logs del servidor y un rastreo propio con una herramienta como Screaming Frog. Es el núcleo de cualquier auditoría SEO técnica: detecta páginas que Google no visita, zonas donde malgasta peticiones y errores que tus usuarios no ven.

06 Tipos de crawlers: de Googlebot a los bots de IA

No solo Google rastrea tu web. Cada buscador, cada herramienta SEO y, cada vez más, cada empresa de inteligencia artificial tiene sus propios crawlers, y cada uno se identifica con un user agent distinto que puedes permitir o bloquear en robots.txt.

Crawler Empresa Para qué rastrea
Googlebot (smartphone y ordenador) Google Indexar páginas para la Búsqueda de Google
Bingbot Microsoft Indexar para Bing (y los servicios que usan su índice)
YandexBot Yandex Indexar para el buscador ruso Yandex
OAI-SearchBot OpenAI Mostrar webs en las búsquedas de ChatGPT
GPTBot OpenAI Recoger contenido para entrenar sus modelos
Rastreadores SEO (AhrefsBot, SemrushBot…) Herramientas SEO Construir índices de enlaces y palabras clave
Crawlers habituales y para qué sirven

07 Ejemplo práctico de problemas de crawling

Ejemplo · Una tienda con 400 productos y 60.000 URL rastreadas

Una tienda online de moda tiene 400 productos, pero sus filtros de talla, color y precio generan combinaciones infinitas de URL con parámetros. En las estadísticas de rastreo vemos que Googlebot dedica la mayor parte de sus peticiones a esas combinaciones y visita los productos nuevos con semanas de retraso.

La solución pasa por enlazar solo los filtros con demanda de búsqueda, marcar el resto con canonical o noindex, sacar del sitemap las URL que no deben posicionar y reforzar los enlaces internos hacia las categorías. Resultado esperable: los productos nuevos se rastrean antes y el presupuesto se concentra en las páginas que venden.

Si quieres profundizar en qué hace Google después del rastreo, te recomendamos esta explicación sobre cómo funciona el algoritmo de Google. Y si tu web tiene páginas que Google ignora, revisa también tu robots.txt: es la causa más frecuente de rastreos bloqueados por error.

Preguntas frecuentes sobre Crawling

Crawling significa rastreo. En SEO es el proceso por el que un bot, como Googlebot, visita las páginas de una web, descarga su contenido y sigue sus enlaces para descubrir nuevas URL.

Crawl es el verbo inglés «rastrear». Decir que Google ha hecho crawl de una URL significa que su bot la ha visitado y descargado. En natación, crawl es el estilo que en español se escribe «crol».

El crawling es la visita del bot a la página; la indexación es el análisis y almacenamiento de esa página en el índice del buscador. Una URL puede rastrearse y no indexarse, por ejemplo si tiene noindex o contenido duplicado.

Es el programa que hace el rastreo, también llamado araña, spider o bot. Googlebot, Bingbot y OAI-SearchBot son crawlers.

En Google Search Console, abre Ajustes y el informe de estadísticas de rastreo, o usa la inspección de URLs para ver la fecha del último rastreo. Los logs del servidor muestran cada visita de Googlebot.

Enlaza las páginas nuevas desde otras ya conocidas, mantén el sitemap XML actualizado, solicita la indexación en la inspección de URLs y asegúrate de que el servidor responde rápido y sin errores.

No necesariamente. robots.txt impide el rastreo, pero la URL puede seguir indexada si otras páginas la enlazan. Para eliminarla del índice hay que permitir el rastreo y usar la etiqueta noindex.

Fuentes consultadas

Raúl Aránega Segura

Sobre el autor

Raúl Aránega Segura

CEO y especialista SEO en appyweb

Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.

Ver perfil en LinkedIn ↗

Términos relacionados

Ver todos los términos →
C Crawlers Un crawler (rastreador, araña o bot) es un programa que recorre la web de forma automática, descarga páginas y sigue sus enlaces para alimentar un buscador, una herramienta SEO o un modelo de inteligencia artificial. Cada crawler se identifica con un user agent, y conocerlos te permite decidir quién rastrea tu web y para qué. C Crawl Budget El crawl budget (presupuesto de rastreo) es el conjunto de URLs que Googlebot puede y quiere rastrear de un sitio web en un periodo, según la capacidad del servidor y el interés que Google tiene en su contenido. Solo preocupa en webs grandes o que cambian a diario: si se desperdicia, las páginas nuevas tardan en indexarse. G Googlebot Googlebot es el nombre genérico del rastreador web de Google Search: el programa que descarga páginas de internet para que Google pueda indexarlas y mostrarlas en sus resultados. Tiene dos variantes, smartphone y ordenador, y lo que no rastrea no puede posicionar, por eso es la base de cualquier estrategia SEO. I Indexación La indexación es el proceso por el que un buscador como Google analiza una página que ya ha rastreado y guarda su información en su índice, una enorme base de datos. Solo las páginas indexadas pueden aparecer en los resultados de búsqueda: si una URL no está en el índice, no existe para Google. R Robots txt El robots.txt es un archivo de texto plano, situado en la raíz de un dominio, que indica a los rastreadores qué rutas pueden o no pueden rastrear. Sigue el Robots Exclusion Protocol, estandarizado en el RFC 9309 de 2022. Sirve para gestionar el rastreo, incluidos los bots de IA, pero no impide que una URL se indexe. S Sitemap XML Un sitemap XML es un archivo en formato XML que, siguiendo el protocolo sitemaps.org (versión 0.9), lista las URL de un sitio que quieres que los buscadores conozcan, con metadatos opcionales como la fecha de última modificación. Admite extensiones para imágenes, vídeos, noticias e idiomas y es la forma estándar de ayudar a Google y Bing a descubrir contenido.

Cuéntanos tu proyecto. Te respondemos en 48 h.

Auditoría gratuita de IA, campañas, web y SEO, con prioridades y cifras reales de tu negocio.

✓ Sin compromiso ✓ Respuesta en 48 h laborables ✓ Un consultor senior, no un bot
WA WhatsApp