DICCIONARIO · N

Número de páginas reales del sitio web

El número de páginas reales de un sitio web es la cantidad de URL únicas, accesibles y canónicas que el propietario quiere que se indexen. Compararlo con las URL que Google tiene indexadas es un diagnóstico SEO básico: revela páginas valiosas que faltan en el índice y URL sobrantes, como duplicados o parámetros, que sobran.

Raúl Aránega Segura Escrito por Raúl Aránega Segura 6 min de lectura
Ficha rápida
Tipo
Métrica de diagnóstico de SEO técnico
Fuente fiable de indexación
Informe de indexación de páginas de Google Search Console
Operador site:
Solo es una estimación: Google avisa de que no devuelve todas las URL indexadas
Límite de un sitemap
50.000 URL o 50 MB sin comprimir por archivo
Umbral de «sitio pequeño» para Google
Unas 500 páginas o menos

≡En resumen

  • Las páginas reales son las URL que quieres posicionar: responden 200, son canónicas, no tienen noindex y están enlazadas.
  • El operador site: da una cifra aproximada y Google advierte que no muestra todas las URL indexadas.
  • El dato fiable de indexación está en el informe de indexación de páginas de Search Console.
  • Hay que cuadrar cuatro cifras: URL del CMS, URL del sitemap, URL indexables del rastreo y URL indexadas.
  • Ni el 100 % de indexación es obligatorio ni tener más URL indexadas que páginas reales es buena señal.

01 ¿Qué es el número de páginas reales de un sitio web?

El concepto nace de una pregunta muy común en SEO: «¿cuántas páginas tiene mi web y cuántas conoce Google?». La respuesta no es un solo número, porque cada herramienta cuenta cosas distintas. Tu CMS cuenta registros en la base de datos, un rastreador cuenta URL enlazadas y Google cuenta lo que ha decidido guardar en su índice tras la indexación. El número de páginas reales es la referencia contra la que comparas todo lo demás.

02 ¿Para qué sirve conocerlo?

01

Detectar páginas que faltan

Productos, servicios o artículos que no están en el índice y, por tanto, no pueden recibir tráfico orgánico.

02

Detectar URL sobrantes

Duplicados, parámetros o archivos vacíos que inflan el índice y diluyen la calidad percibida del sitio.

03

Priorizar el rastreo

En webs grandes, saber qué URL sobran ayuda a que Google dedique su tiempo a las que importan.

04

Medir migraciones

Antes y después de un rediseño, el número de páginas reales e indexadas debe cuadrar.

Por eso este recuento es uno de los primeros pasos de una auditoría SEO profesional: sin saber cuántas páginas deberían existir, no puedes saber si Google ve demasiadas o demasiado pocas.

03 Por qué el operador site: no te dice cuántas páginas tienes

Buscar site:tudominio.com en Google es el método más popular y el menos fiable. La propia documentación de Google Search Central explica que el operador site: no devuelve necesariamente todas las URL indexadas bajo ese dominio y que los sitios grandes no deben esperar ver todas sus URL en los resultados. Además, la cifra «Aproximadamente X resultados» es una estimación que cambia entre consultas y centros de datos.

04 Search Console: la cifra fiable de páginas indexadas

El dato que Google considera autorizado está en el informe de indexación de Google Search Console (Indexación > Páginas). Muestra cuántas URL conocidas están indexadas y cuántas no, con el motivo de cada exclusión: noindex, redirección, 404, duplicada sin canónica seleccionada por el usuario, rastreada pero no indexada, descubierta pero no indexada, etc.

Vista o filtro Qué muestra Para qué la usas
Todas las páginas conocidas Todas las URL que Google ha encontrado, por cualquier vía Detectar URL sobrantes que no deberían existir
Todas las páginas enviadas Solo las URL de tus sitemaps Medir qué parte de tus páginas reales está indexada
Páginas no enviadas URL que Google conoce y no están en tus sitemaps Encontrar parámetros, filtros y duplicados
Un sitemap concreto Las URL de ese archivo Comparar secciones: productos, blog, categorías
Qué te dice cada vista del informe de indexación

1.000

filas como máximo en las listas de ejemplo de cada motivo del informe

Fuente: Ayuda de Search Console

500

páginas: por debajo, Google dice que probablemente no necesitas este informe

Fuente: Ayuda de Search Console

05 Cómo calcular el número de páginas reales paso a paso

  1. 1

    Cuenta lo que existe en tu CMS

    Exporta productos, categorías, entradas y páginas publicadas. Es la cifra teórica (A).

  2. 2

    Revisa tus sitemaps

    Suma las URL de tu sitemap XML (B). Deberían ser solo URL canónicas, indexables y con código 200.

  3. 3

    Rastrea la web

    Pasa un rastreador y filtra las URL HTML con código 200, sin noindex y con canónica a sí mismas (C).

  4. 4

    Consulta Search Console

    Anota las páginas indexadas totales y las indexadas del filtro «Todas las páginas enviadas» (D).

  5. 5

    Cuadra las cifras

    A, B y C deberían parecerse mucho. D debería acercarse a C. Cada diferencia grande es una lista de URL a investigar.

Para el paso de rastreo puedes usar un rastreador como Screaming Frog u otra herramienta de la lista de herramientas SEO gratis y de pago. Recuerda que un rastreador solo encuentra lo que está enlazado: las páginas huérfanas aparecen en el CMS y en el sitemap, pero no en el rastreo. Esa diferencia también es un hallazgo.

06 Cómo interpretar las diferencias

Situación Causas probables Qué hacer
Indexadas muy por debajo de las reales Páginas nuevas, contenido pobre, mala estructura de enlaces, noindex por error, bloqueo en robots.txt Revisar motivos en Search Console, reforzar enlaces internos y mejorar el contenido
Indexadas muy por encima de las reales Parámetros, filtros y facetas, etiquetas, paginaciones, versiones http/https o con www y sin www Canonicalizar, redirigir, aplicar noindex o bloquear el rastreo de patrones inútiles
Cifras parecidas pero URL distintas Google indexa variantes en lugar de las canónicas Revisar canonicals, enlaces internos y redirecciones
Muchas «descubiertas: actualmente sin indexar» Google no ha llegado a rastrearlas, típico de sitios grandes Priorizar enlaces internos y reducir URL sobrantes
Escenarios típicos al comparar páginas reales e indexadas

Cuando las indexadas superan con mucho a las reales, casi siempre hay URL duplicadas generadas por el propio sistema. En tiendas online grandes, esas URL también consumen presupuesto de rastreo que deberían recibir tus productos.

07 ¿Cuántas páginas debe tener una web?

No hay un mínimo ni un máximo técnico. Una web corporativa sencilla puede funcionar con cinco o seis páginas (inicio, servicios, sobre nosotros, contacto, textos legales) y una tienda puede tener decenas de miles. La pregunta útil no es cuántas, sino si cada página responde a una búsqueda o necesidad distinta. Más páginas no significa más tráfico: páginas que no aportan nada restan calidad al conjunto.

  • ✓Cada página real tiene una intención de búsqueda o una función clara.
  • ✓No hay dos páginas que compitan por la misma keyword.
  • ✓Todas las páginas reales están en el sitemap y reciben enlaces internos.
  • ✓Las URL técnicas (filtros, parámetros, búsquedas internas) no se indexan.
  • ✓Las páginas eliminadas redirigen o devuelven 404/410, según corresponda.

Si quieres convertir este diagnóstico en tráfico, el siguiente paso es un plan para mejorar el posicionamiento en buscadores de las páginas que sí cuentan.

Preguntas frecuentes sobre Número de páginas reales del sitio web

Cuenta las páginas publicadas en tu CMS y compáralas con las URL de tu sitemap y con un rastreo de la web filtrado por páginas indexables. Las tres cifras deberían parecerse.

Mira el informe de indexación de páginas de Google Search Console. Es la cifra fiable; el operador site: solo da una estimación incompleta.

Porque site: no devuelve necesariamente todas las URL indexadas y su recuento es aproximado. Google lo documenta así y recomienda otras herramientas para verificar la indexación.

Suele indicar URL duplicadas o técnicas indexadas, como filtros o parámetros. No es una penalización, pero diluye la calidad del sitio y desperdicia rastreo.

No. Google avisa de que no todas las URL se indexarán. Lo importante es que estén indexadas las páginas que quieres posicionar.

Que Google conoce la URL pero todavía no la ha rastreado, a menudo porque ha aplazado el rastreo para no sobrecargar el servidor. Si afecta a muchas páginas reales, refuerza sus enlaces internos y reduce las URL sobrantes que compiten por el rastreo.

Hasta 50.000 URL o 50 MB sin comprimir por archivo. Si tienes más, divide en varios sitemaps y agrúpalos en un índice de sitemaps.

Una vez al mes en webs estables y justo después de cualquier migración, rediseño o carga masiva de productos.

Fuentes consultadas

Raúl Aránega Segura

Sobre el autor

Raúl Aránega Segura

CEO y especialista SEO en appyweb

Fundador de appyweb. Más de una década posicionando webs y tiendas online en Google y, ahora, en las respuestas de la IA.

Ver perfil en LinkedIn ↗

Términos relacionados

Ver todos los términos →
G Google Search Console Google Search Console es el panel gratuito de Google en el que el propietario de una web verifica su sitio y consulta cómo lo rastrea, indexa y muestra el buscador. Configurarlo bien el primer día (propiedad de dominio, sitemap, usuarios y vínculo con Analytics) y revisarlo cada semana permite detectar caídas y errores antes de que cuesten tráfico. I Indexación La indexación es el proceso por el que un buscador como Google analiza una página que ya ha rastreado y guarda su información en su índice, una enorme base de datos. Solo las páginas indexadas pueden aparecer en los resultados de búsqueda: si una URL no está en el índice, no existe para Google. S Sitemap XML Un sitemap XML es un archivo en formato XML que, siguiendo el protocolo sitemaps.org (versión 0.9), lista las URL de un sitio que quieres que los buscadores conozcan, con metadatos opcionales como la fecha de última modificación. Admite extensiones para imágenes, vídeos, noticias e idiomas y es la forma estándar de ayudar a Google y Bing a descubrir contenido. C Crawl Budget El crawl budget (presupuesto de rastreo) es el conjunto de URLs que Googlebot puede y quiere rastrear de un sitio web en un periodo, según la capacidad del servidor y el interés que Google tiene en su contenido. Solo preocupa en webs grandes o que cambian a diario: si se desperdicia, las páginas nuevas tardan en indexarse. C Contenido duplicado El contenido duplicado es un texto idéntico o muy parecido que se puede ver en más de una URL, dentro de la misma web o en webs distintas. Google no lo sanciona por sí mismo, pero elige una sola versión para mostrar y reparte señales entre las copias, lo que puede dejar fuera la página que querías posicionar. S Screaming Frog Screaming Frog SEO Spider es un rastreador web de escritorio que recorre un sitio como lo haría un buscador y lista cada URL con su código de respuesta, títulos, metadatos, enlaces, directivas y otros datos técnicos. Lo desarrolla la empresa británica Screaming Frog; es gratis hasta 500 URLs y la licencia anual quita el límite.

Cuéntanos tu proyecto. Te respondemos en 48 h.

Auditoría gratuita de IA, campañas, web y SEO, con prioridades y cifras reales de tu negocio.

✓ Sin compromiso ✓ Respuesta en 48 h laborables ✓ Un consultor senior, no un bot
WA WhatsApp