DICCIONARIO · C

Crawl Budget

El crawl budget (presupuesto de rastreo) es el conjunto de URLs que Googlebot puede y quiere rastrear de un sitio web en un periodo, según la capacidad del servidor y el interés que Google tiene en su contenido. Solo preocupa en webs grandes o que cambian a diario: si se desperdicia, las páginas nuevas tardan en indexarse.

Raúl Aránega Segura Escrito por Raúl Aránega Segura 5 min de lectura
Ficha rápida
También llamado
Presupuesto de rastreo o presupuesto de crawling
Componentes
Límite de capacidad de rastreo + demanda de rastreo (Google Search Central)
Cuándo importa
Sitios de más de 1 millón de páginas que cambian cada semana o de más de 10.000 que cambian a diario (estimación de Google)
Dónde se ve
Informe «Estadísticas de rastreo» de Google Search Console, en Ajustes
¿Factor de ranking?
No: Google afirma que rastrear más no mejora las posiciones (Gary Illyes, 2017)

≡En resumen

  • El crawl budget es cuántas URLs de tu web puede y quiere rastrear Google, no un tiempo ni una cifra fija.
  • Depende del límite de capacidad (lo que aguanta tu servidor) y de la demanda (lo popular y cambiante que es tu contenido).
  • Una web de unos pocos miles de URLs casi nunca tiene problemas de presupuesto de rastreo.
  • Se desperdicia en filtros facetados, parámetros, duplicados, errores soft 404 y cadenas de redirecciones.
  • Se mide en el informe de Estadísticas de rastreo de Search Console y en los logs del servidor.

01 ¿Qué es el crawl budget o presupuesto de rastreo?

Para entenderlo necesitas saber qué es el crawling o rastreo: el proceso en el que Googlebot recorre la web descargando páginas. El crawl budget es la parte de ese rastreo que le toca a tu sitio. Si se gasta en URLs inútiles, las importantes se rastrean menos o más tarde, y lo que no se rastrea no se indexa ni puede posicionar.

02 Cómo calcula Google el crawl budget: capacidad y demanda

01

Límite de capacidad de rastreo

Cuántas conexiones simultáneas y con qué frecuencia puede usar Googlebot sin saturar tu servidor. Sube si el sitio responde rápido y estable; baja si aumenta la latencia o aparecen errores 5xx.

02

Demanda de rastreo

Cuánto quiere Google rastrear tu sitio. Depende del inventario de URLs que percibe, de la popularidad de cada URL y de cada cuánto cambia su contenido.

El presupuesto final es la combinación de ambos: aunque tu servidor aguante mucho, Google no rastreará más de lo que le interesa; y aunque le interese mucho, no forzará un servidor lento. Por eso las dos palancas son distintas: la velocidad y estabilidad del servidor amplían la capacidad; la calidad y la limpieza del inventario de URLs orientan la demanda.

03 ¿A qué webs les afecta el crawl budget?

Tipo de sitio ¿Debe preocuparte?
Web corporativa o blog con unos pocos miles de URLs No: según Google, en la mayoría de los casos se rastrea de forma eficiente
Más de 10.000 páginas únicas que cambian a diario (medios, clasificados) Sí, conviene vigilarlo
Más de 1 millón de páginas únicas que cambian cada semana (grandes ecommerce, portales) Sí, es prioritario
Muchas URLs en «Descubierta: actualmente sin indexar» en Search Console Sí, es una señal de problema de rastreo
Cuándo preocuparte por el presupuesto de rastreo según Google

04 Cómo ver tu crawl budget en Google Search Console

  1. 1

    Abre el informe

    En Search Console, ve a Ajustes y abre «Estadísticas de rastreo». Solo está disponible para propiedades de nivel raíz (dominio o prefijo de URL raíz).

  2. 2

    Revisa las tendencias

    Mira el total de solicitudes de rastreo, el tamaño de descarga y el tiempo medio de respuesta. Un tiempo de respuesta que sube suele venir antes de una caída del rastreo.

  3. 3

    Comprueba el estado del host

    Verás si hubo problemas con robots.txt, la resolución DNS o la conectividad del servidor.

  4. 4

    Analiza el desglose

    Solicitudes por código de respuesta, tipo de archivo, finalidad (descubrimiento o actualización) y tipo de Googlebot. Muchos 404, redirecciones o recursos pesados indican presupuesto desperdiciado.

Completa el informe con el de indexación de páginas de Search Console y, en webs grandes, con los logs del servidor: son la única fuente que muestra cada visita real de Googlebot, URL por URL.

05 Qué desperdicia el presupuesto de rastreo

Problema Ejemplo Solución
Navegación facetada ?color=rojo&talla=m&orden=precio Bloquear combinaciones sin valor en robots.txt y enlazar solo las que tienen demanda
Parámetros de sesión o seguimiento ?sessionid=…, ?utm_source=… No enlazarlos internamente; usar canonical a la URL limpia
Contenido duplicado Versiones con y sin barra final, http y https Redirecciones 301 y una única URL canónica
Errores soft 404 Páginas vacías que responden 200 Devolver 404 o 410 si el contenido ya no existe
Cadenas de redirecciones A → B → C → D Redirigir directamente a la URL final
Espacios infinitos Calendarios o buscadores internos sin límite Bloquear en robots.txt
Causas habituales y solución

06 Cómo optimizar el crawl budget

  • ✓Mantén los sitemaps XML actualizados, solo con URLs canónicas que respondan 200, e incluye la etiqueta lastmod.
  • ✓Devuelve 404 o 410 en páginas eliminadas para siempre y corrige los soft 404.
  • ✓Evita cadenas de redirecciones y actualiza los enlaces internos para que apunten a la URL final.
  • ✓Bloquea en robots.txt las URLs sin valor (filtros infinitos, carritos, buscador interno).
  • ✓Mejora el tiempo de respuesta del servidor y el peso de los recursos: más velocidad, más capacidad de rastreo.
  • ✓Admite respuestas HTTP 304 (Not Modified) para que Google reutilice lo que no ha cambiado.
  • ✓Enlaza internamente las páginas importantes desde páginas populares y con pocos clics desde la portada.

La velocidad del servidor influye directamente en el límite de capacidad, por eso un trabajo de WPO suele notarse también en el rastreo. Si migras URLs, revisa cómo hacer una redirección 301 sin encadenar saltos. Y en webs de miles de URLs, una auditoría SEO técnica con análisis de logs es la forma más rápida de ver dónde se va el rastreo.

07 Mitos sobre el crawl budget

01

«Más rastreo, mejores posiciones»

Falso. Google afirma que rastrear más no implica mejores posiciones: el rastreo es necesario para aparecer, pero no es una señal de ranking.

02

«Con crawl-delay controlo a Googlebot»

Falso. Googlebot no procesa la regla no estándar crawl-delay de robots.txt.

03

«CSS, JavaScript y AMP no cuentan»

Falso. Según Google, las URLs alternativas (AMP, hreflang) y los recursos incrustados (CSS, JavaScript, llamadas XHR) también consumen presupuesto.

04

«nofollow ahorra presupuesto»

Depende. Una URL marcada nofollow se rastreará igual si otra página, tuya o externa, la enlaza sin nofollow.

Los bots de IA (GPTBot, ClaudeBot, PerplexityBot…) no consumen el presupuesto de Googlebot, pero sí capacidad de tu servidor. Si el servidor se satura y responde lento, Google bajará su límite de rastreo. Para profundizar en la parte práctica, IEBS tiene una buena guía de optimización del crawl budget para SEO, y si prefieres que lo revise un equipo, nuestra agencia SEO incluye el rastreo en el trabajo técnico mensual.

Preguntas frecuentes sobre Crawl Budget

Es el conjunto de URLs de tu web que Google puede y quiere rastrear en un periodo. Depende de la capacidad de tu servidor y del interés que Google tiene en tu contenido.

Google no da una cifra, pero puedes ver cuántas solicitudes hace Googlebot al día en el informe «Estadísticas de rastreo» de Search Console, dentro de Ajustes, y compararlo con el número de URLs que quieres indexar.

Casi nunca. Google indica que los sitios con menos de unos pocos miles de URLs suelen rastrearse de forma eficiente; si tus páginas nuevas se indexan en uno o dos días, no tienes que preocuparte.

No. Google afirma que un mayor ritmo de rastreo no implica mejores posiciones, aunque una página que no se rastrea no puede indexarse ni posicionar.

El crawl budget determina qué URLs visita Googlebot; la indexación decide cuáles de las visitadas se guardan en el índice. Una URL rastreada puede no indexarse si Google la considera duplicada o de poca calidad.

Mejorando la velocidad y estabilidad del servidor, eliminando URLs duplicadas o inútiles, manteniendo sitemaps limpios y reforzando el enlazado interno hacia las páginas importantes.

Sí, a largo plazo: las URLs bloqueadas no se rastrean y Google puede dedicar ese esfuerzo a otras. Pero Google advierte que no sirve para reasignar presupuesto de forma temporal, salvo que tu sitio esté llegando a su límite de capacidad.

Fuentes consultadas

Raúl Aránega Segura

Sobre el autor

Raúl Aránega Segura

CEO y especialista SEO en appyweb

Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.

Ver perfil en LinkedIn ↗

Términos relacionados

Ver todos los términos →
C Crawling El crawling (rastreo) es el proceso por el que un programa automático, llamado crawler, araña o bot, recorre la web siguiendo enlaces y descargando páginas para que un buscador o una IA pueda analizarlas. Es el primer paso del SEO: si Google no puede rastrear una URL, no la indexará ni la mostrará en sus resultados. C Crawlers Un crawler (rastreador, araña o bot) es un programa que recorre la web de forma automática, descarga páginas y sigue sus enlaces para alimentar un buscador, una herramienta SEO o un modelo de inteligencia artificial. Cada crawler se identifica con un user agent, y conocerlos te permite decidir quién rastrea tu web y para qué. I Indexación La indexación es el proceso por el que un buscador como Google analiza una página que ya ha rastreado y guarda su información en su índice, una enorme base de datos. Solo las páginas indexadas pueden aparecer en los resultados de búsqueda: si una URL no está en el índice, no existe para Google. S Search Console Search Console es la herramienta gratuita de Google que muestra cómo ve, rastrea e indexa Google tu web y con qué búsquedas apareces: clics, impresiones, CTR y posición media. Sirve para detectar errores técnicos, enviar sitemaps y medir el SEO con datos del propio Google, incluidos AI Overviews y el Modo IA. R Robots txt El robots.txt es un archivo de texto plano, situado en la raíz de un dominio, que indica a los rastreadores qué rutas pueden o no pueden rastrear. Sigue el Robots Exclusion Protocol, estandarizado en el RFC 9309 de 2022. Sirve para gestionar el rastreo, incluidos los bots de IA, pero no impide que una URL se indexe. G Googlebot Googlebot es el nombre genérico del rastreador web de Google Search: el programa que descarga páginas de internet para que Google pueda indexarlas y mostrarlas en sus resultados. Tiene dos variantes, smartphone y ordenador, y lo que no rastrea no puede posicionar, por eso es la base de cualquier estrategia SEO.

Cuéntanos tu proyecto. Te respondemos en 48 h.

Auditoría gratuita de IA, campañas, web y SEO, con prioridades y cifras reales de tu negocio.

✓ Sin compromiso ✓ Respuesta en 48 h laborables ✓ Un consultor senior, no un bot
WA WhatsApp