DICCIONARIO · X

X-Robots-Tag

X-Robots-Tag es una cabecera de respuesta HTTP que da a los buscadores las mismas instrucciones de indexación que la etiqueta meta robots, como noindex o nofollow, pero desde el servidor. Permite controlar archivos sin HTML, como PDF o imágenes, y aplicar reglas a grupos enteros de archivos o a un entorno de pruebas completo.

Raúl Aránega Segura Escrito por Raúl Aránega Segura 6 min de lectura
Ficha rápida
Tipo
Cabecera de respuesta HTTP con reglas de indexación para rastreadores
Ejemplo
X-Robots-Tag: noindex, nofollow
Presentada por Google
Julio de 2007, en su serie sobre el protocolo de exclusión de robots
Reglas admitidas
Las mismas que la meta robots: noindex, nofollow, none, nosnippet, max-image-preview, unavailable_after…
Condición
La URL debe poder rastrearse: si robots.txt la bloquea, Google no ve la cabecera

≡En resumen

  • X-Robots-Tag lleva las reglas de la meta robots a la cabecera HTTP, así que funciona con cualquier tipo de archivo.
  • Se configura en el servidor (Apache, Nginx, IIS), en la aplicación (PHP, Laravel, WordPress) o en la CDN.
  • Su gran ventaja es aplicar una regla a muchos archivos a la vez con un patrón: todos los PDF, todas las imágenes, un subdominio.
  • Si una URL está bloqueada en robots.txt, Google no puede leer su X-Robots-Tag.
  • Un X-Robots-Tag olvidado en el servidor tras una migración puede desindexar una web entera.

01 ¿Qué es X-Robots-Tag?

Google la presentó en julio de 2007 para dar a los webmasters control sobre documentos PDF, Word, vídeos y otros formatos que no admiten etiquetas meta. El prefijo «X-» era la convención de la época para cabeceras no estándar. Hoy la documentan Google y otros buscadores como Bing.

Esta ficha se centra en la parte técnica: sintaxis, implementación en servidores y verificación. Para la lista completa de reglas y cuándo aplicar cada una, consulta la ficha de la etiqueta robots; para decidir qué páginas no deben indexarse, la de la directiva noindex.

02 Sintaxis de X-Robots-Tag según Google

Ejemplo · Formas válidas de la cabecera

Una regla:
X-Robots-Tag: noindex

Varias reglas en la misma cabecera:
X-Robots-Tag: noindex, nofollow

Varias cabeceras en la misma respuesta:
X-Robots-Tag: noimageindex
X-Robots-Tag: unavailable_after: 2026-12-31

Solo para un rastreador:
X-Robots-Tag: googlebot: nofollow
X-Robots-Tag: otherbot: noindex, nofollow

Regla Efecto Caso típico
noindex No mostrar la URL en los resultados PDF duplicados, feeds, archivos internos
nofollow No seguir los enlaces del archivo Documentos con enlaces que no controlas
none Equivale a noindex, nofollow Entornos de pruebas
nosnippet No mostrar fragmento de texto Documentos de pago o con contenido sensible
noimageindex No indexar las imágenes de la página Imágenes con derechos restringidos
unavailable_after: [fecha] Dejar de mostrar la URL después de esa fecha Bases de promociones, eventos
Reglas más usadas en X-Robots-Tag

03 Cómo configurar X-Robots-Tag en Apache (.htaccess)

En Apache se usa la directiva Header del módulo mod_headers, que debe estar activo. Puedes ponerla en la configuración del virtual host o, en hosting compartido, en el archivo .htaccess, el mismo que usas para configurar una redirección 301 en htaccess y Nginx.

Ejemplo · Ejemplos para Apache

Todos los PDF sin indexar ni seguir enlaces (ejemplo de Google):
<Files ~ "\.pdf$">
  Header set X-Robots-Tag "noindex, nofollow"
</Files>

Imágenes PNG, JPG y GIF sin indexar:
<Files ~ "\.(png|jpe?g|gif)$">
  Header set X-Robots-Tag "noindex"
</Files>

Un archivo concreto:
<Files "tarifas-2026.pdf">
  Header set X-Robots-Tag "noindex"
</Files>

Todo un subdominio de pruebas (Apache 2.4):
<If "%{HTTP_HOST} == 'staging.ejemplo.com'">
  Header set X-Robots-Tag "noindex, nofollow"
</If>

04 Cómo configurar X-Robots-Tag en Nginx

Ejemplo · Ejemplos para Nginx

Todos los PDF (ejemplo de Google):
location ~* \.pdf$ {
  add_header X-Robots-Tag "noindex, nofollow";
}

Imágenes:
location ~* \.(png|jpe?g|gif)$ {
  add_header X-Robots-Tag "noindex";
}

Todo un servidor de pruebas, también en respuestas de error:
server {
  server_name staging.ejemplo.com;
  add_header X-Robots-Tag "noindex, nofollow" always;
}

05 X-Robots-Tag desde PHP, WordPress, Laravel o la CDN

01

PHP

header('X-Robots-Tag: noindex', true); antes de enviar cualquier salida. Útil para descargas generadas o respuestas de API.

02

WordPress

Para páginas, lo habitual es la meta robots que gestionan Yoast o Rank Math. Para archivos de la biblioteca de medios, configura la cabecera en el servidor, porque WordPress no los sirve con PHP.

03

Laravel y otros frameworks

Un middleware que añada la cabecera a las respuestas de un grupo de rutas, por ejemplo zonas privadas o endpoints de API.

04

CDN

Reglas de modificación de cabeceras de respuesta de tu CDN, útiles cuando no puedes tocar el servidor de origen.

Contenido Mejor opción Motivo
Páginas HTML sueltas Meta robots Se gestiona desde el CMS, página a página
PDF, DOC, XLS X-Robots-Tag No tienen head donde poner la etiqueta
Imágenes y vídeos X-Robots-Tag Mismo motivo, y se aplica por extensión
Entorno de pruebas completo X-Robots-Tag (y contraseña) Una sola regla cubre todas las URL
Respuestas JSON o XML X-Robots-Tag Evita que endpoints o feeds aparezcan en resultados
Dónde usar X-Robots-Tag y dónde la meta robots

06 Cómo comprobar que X-Robots-Tag funciona

  1. 1

    Consulta la cabecera con curl

    curl -I https://ejemplo.com/catalogo.pdf muestra las cabeceras de la respuesta; busca la línea x-robots-tag.

  2. 2

    Revisa la pestaña Red del navegador

    En las herramientas de desarrollo, selecciona el archivo y mira las cabeceras de respuesta.

  3. 3

    Usa la inspección de URLs

    La inspección de URLs de Search Console indica si la indexación está permitida y si ha detectado noindex en la cabecera X-Robots-Tag.

  4. 4

    Comprueba robots.txt

    Asegúrate de que esas URL no están bloqueadas: si Google no puede rastrearlas, no leerá la regla.

  5. 5

    Vigila el informe de indexación

    Las URL afectadas aparecerán como excluidas por noindex a medida que Google vuelva a rastrearlas.

La relación con el robots.txt es la fuente de errores más común: bloquear el rastreo de una carpeta de PDF y además ponerles noindex no sirve, porque Google nunca llega a leer la cabecera. Primero deja que se rastreen y se desindexen; después decide si quieres bloquearlas.

07 Errores frecuentes con X-Robots-Tag

  • ✓Pasar a producción con el X-Robots-Tag: noindex del entorno de pruebas todavía en la configuración del servidor.
  • ✓Un patrón demasiado amplio, como aplicar noindex a todas las respuestas en lugar de solo a los PDF.
  • ✓Poner noindex a imágenes que sí te interesa que aparezcan en Google Imágenes.
  • ✓Bloquear en robots.txt las mismas URL a las que aplicas la cabecera.
  • ✓Olvidar que la CDN o un proxy puede añadir o eliminar cabeceras y no comprobar la respuesta final.
  • ✓Combinar noindex con una etiqueta canonical hacia otra URL, que envía señales contradictorias.

Revisar cabeceras, directivas de indexación y rastreo forma parte de nuestro servicio de auditoría SEO. Y mantener esa configuración alineada con el contenido que quieres posicionar es trabajo diario de una agencia SEO.

Preguntas frecuentes sobre X-Robots-Tag

Es una cabecera HTTP que indica a los buscadores si pueden indexar una URL, seguir sus enlaces o mostrar fragmentos. Admite las mismas reglas que la etiqueta meta robots.

Las reglas son las mismas. La meta robots va en el head del HTML; X-Robots-Tag va en la cabecera HTTP, por lo que sirve para PDF, imágenes y cualquier archivo, y permite aplicar reglas por patrón.

En Apache, con un bloque Files que aplique Header set X-Robots-Tag "noindex" a los archivos .pdf; en Nginx, con un location para .pdf y add_header X-Robots-Tag "noindex".

No. Si Google no puede rastrear la URL, no ve la cabecera y la regla se ignora. La URL debe poder rastrearse.

Con curl -I seguido de la URL, en la pestaña Red de las herramientas del navegador o con la inspección de URLs de Search Console.

Sí. Escribe el nombre del rastreador antes de la regla, por ejemplo X-Robots-Tag: googlebot: noindex.

Sí, Bing también admite reglas de indexación en la cabecera X-Robots-Tag, aunque cada buscador puede no admitir todas las reglas de Google.

Sí. Funciona con cualquier respuesta, también con páginas HTML. Es útil cuando quieres aplicar la regla desde el servidor a un grupo de páginas o cuando no puedes editar la plantilla.

Fuentes consultadas

Raúl Aránega Segura

Sobre el autor

Raúl Aránega Segura

CEO y especialista SEO en appyweb

Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.

Ver perfil en LinkedIn ↗

Términos relacionados

Ver todos los términos →
E Etiqueta robots La etiqueta robots (meta robots) es una etiqueta meta del HTML que indica a los buscadores si pueden indexar una página, seguir sus enlaces o mostrar fragmentos de ella en los resultados. Su equivalente para PDF y otros archivos es la cabecera HTTP X-Robots-Tag. Controla la indexación página a página, algo que robots.txt no hace. N Noindex Noindex es una directiva que indica a los buscadores que no incluyan una página o archivo en su índice, de modo que no aparezca en los resultados de búsqueda. Se aplica con la etiqueta meta robots o con la cabecera HTTP X-Robots-Tag, y solo funciona si el buscador puede rastrear la URL y leer la instrucción. R Robots txt El robots.txt es un archivo de texto plano, situado en la raíz de un dominio, que indica a los rastreadores qué rutas pueden o no pueden rastrear. Sigue el Robots Exclusion Protocol, estandarizado en el RFC 9309 de 2022. Sirve para gestionar el rastreo, incluidos los bots de IA, pero no impide que una URL se indexe. I Indexación La indexación es el proceso por el que un buscador como Google analiza una página que ya ha rastreado y guarda su información en su índice, una enorme base de datos. Solo las páginas indexadas pueden aparecer en los resultados de búsqueda: si una URL no está en el índice, no existe para Google. G Googlebot Googlebot es el nombre genérico del rastreador web de Google Search: el programa que descarga páginas de internet para que Google pueda indexarlas y mostrarlas en sus resultados. Tiene dos variantes, smartphone y ordenador, y lo que no rastrea no puede posicionar, por eso es la base de cualquier estrategia SEO. G Google Search Console Google Search Console es el panel gratuito de Google en el que el propietario de una web verifica su sitio y consulta cómo lo rastrea, indexa y muestra el buscador. Configurarlo bien el primer día (propiedad de dominio, sitemap, usuarios y vínculo con Analytics) y revisarlo cada semana permite detectar caídas y errores antes de que cuesten tráfico.

Cuéntanos tu proyecto. Te respondemos en 48 h.

Auditoría gratuita de IA, campañas, web y SEO, con prioridades y cifras reales de tu negocio.

✓ Sin compromiso ✓ Respuesta en 48 h laborables ✓ Un consultor senior, no un bot
WA WhatsApp