< BACK Análisis de Archivos de Registro para Presupuesto de Rastreo en Sitios de 50K Páginas -- ilustración de arte lineal

Análisis de Archivos de Registro para Presupuesto de Rastreo en Sitios de 50K Páginas

Allá por 2021 heredé un cliente, un minorista de comercio electrónico en Birmingham con alrededor de 52,000 URLs indexadas, que no podía entender por qué aproximadamente 18,000 de sus páginas de producto no habían sido rastreadas en más de tres meses. Su equipo de desarrollo había estado adivinando. Agregando sitemaps XML. Pingueando Google Search Console. Nada funcionaba. Luego extraje sus registros de servidor sin procesar y en unos cuarenta minutos la respuesta era completamente obvia: Googlebot estaba consumiendo su asignación diaria de rastreo en URLs de filtros paginados, parámetros de sesión, y una faceta de búsqueda interna rota que generaba algo como 4,000 URLs únicas pero inútiles por semana. Desperdicio total. Completo disparate.

Conclusión clave: Los registros del servidor muestran exactamente qué páginas lee Googlebot en un sitio de 50.000 páginas; el análisis de registros es la única verdad absoluta para las decisiones sobre presupuesto de rastreo.

Eso es para lo que el análisis de archivos de registro sirve realmente, no para métricas de vanidad, no para diapositivas de sala de juntas, sino para averiguar exactamente qué está haciendo un rastreador en tu sitio en cualquier martes dado y cortar la grasa sin piedad.

Por Qué el Presupuesto de Rastreo Realmente Importa a Escala

Aquí está lo que la mayoría de la gente entiende mal. El presupuesto de rastreo no es una preocupación para un sitio folleto de 200 páginas. Googlebot lo barrería en minutos. Pero una vez que pasas, digamos, 20,000 URLs, y definitivamente cuando estás en 50,000 o más, el rastreador de Google toma decisiones explícitas sobre qué priorizar. La propia documentación de Google llama a esto "presupuesto de rastreo" y lo divide en dos componentes: límite de velocidad de rastreo (qué tan rápido rastrea Googlebot sin saturar tu servidor) y demanda de rastreo (cuánto quiere rastrear Google realmente en función de señales de popularidad y frescura).

Ambos pueden ser manipulados. Pero no puedes manipular lo que no puedes medir. Y no puedes medirlo adecuadamente sin los registros.

Las herramientas de análisis como Google Search Console te ofrecen un informe de estadísticas de rastreo. Está bien como punto de partida. Pero está agregado, retrasado, y no te dice qué URLs específicas están consumiendo el presupuesto. Los registros del servidor sí. Muestran cada solicitud que Googlebot hizo, a qué URL, a qué hora, y qué código de estado HTTP recibió a cambio. Ese es el material bruto.

Obtener los Registros

Suena obvio pero aquí es donde la mayoría de la gente se atasca. Dependiendo de tu configuración de hosting, los registros viven en lugares diferentes.

En un host WordPress gestionado como WP Engine o Kinsta, puedes extraer registros de acceso sin procesar desde el panel o vía SFTP, busca en el directorio /logs/. En un VPS con Nginx, tu registro de acceso típicamente está en /var/log/nginx/access.log. Apache lo pone en /var/log/apache2/access.log. Si estás en un CDN como Cloudflare, necesitarás Cloudflare Logpush (nivel empresa) o solo verás solicitudes de borde de CDN, no de origen, distinción importante.

Para ese cliente de Birmingham, estaban en un servidor administrado de Kinsta. Extraje 30 días de registros, que sumaban aproximadamente 4,2GB de archivos comprimidos .gz. Ese es un tamaño normal para un sitio ocupado de 50.000 páginas.

Parsear Registros Brutos Sin Perder la Cordura

Tienes dos opciones reales aquí:

  1. Screaming Frog Log File Analyser, esto es lo que uso el 90% del tiempo. Importas los archivos de registro directamente, filtras por el agente de usuario Googlebot, y te da un desglose clasificable de URLs rastreadas, frecuencia de rastreo, códigos de estado y tiempos de respuesta. Honestamente, para la mayoría del trabajo de agencia es la herramienta correcta. El analizador de registros de Screaming Frog maneja archivos de hasta varios GB sin fallar, lo que importa.
  2. ELK Stack (Elasticsearch, Logstash, Kibana), Más configuración, significativamente más potencia. Si tienes necesidades de monitoreo continuo para un cliente grande o un contrato empresarial, vale la pena la inversión. Seahawk tiene un par de clientes donde canalizamos registros directamente a un panel de Kibana. Tiempo real, hermoso, y puedes configurar alertas cuando la frecuencia de rastreo de Googlebot cae de repente.

Para una auditoría puntual, Screaming Frog Log File Analyser está bien. Para cualquier cosa continua, construye el stack ELK o al menos considera GoAccess, es de código abierto, se ejecuta en la terminal, y procesa archivos de registro grandes más rápido que casi cualquier otra cosa que haya probado.

Qué buscar realmente

Una vez que tienes los datos cargados, la mayoría de la gente se queda mirándolos sin saber qué preguntas hacer. Esto es lo que yo realmente busco en una auditoría de logs:

Distribución de frecuencia de rastreo

Ordena tus URLs por frecuencia de rastreo, cuántas veces Googlebot visitó cada URL en la ventana de 30 días. Casi siempre encontrarás una distribución bimodal. Un grupo de URLs importantes siendo rastreadas frecuentemente (bien) y una cola larga de URLs basura que también están siendo rastreadas frecuentemente (muy mal). Esa cola de basura es tu problema.

En ese sitio de Birmingham, las 500 URLs más rastreadas incluían 340 combinaciones de filtros/facetas. Ninguna estaba indexada. Ninguna tenía volumen de búsqueda. Googlebot visitaba ?colour=red&size=M&sort=price_asc más a menudo que visitaba las páginas de categoría reales. Increíble.

Desglose de códigos de estado

Filtra todo lo que no sea un 200. Específicamente:

  • 404s siendo rastreados repetidamente, estos son una hemorragia de presupuesto de rastreo. Arréglalos con redirecciones 301 o repara los enlaces internos que apuntan a ellos.
  • Cadenas 301, Una redirección que va A → B → C son dos saltos desperdiciados. Googlebot las sigue pero cuesta presupuesto y PageRank se filtra en cada salto.
  • Errores 500, Si Googlebot está golpeando páginas que devuelven 500 y luego las reintenta, estás desperdiciando presupuesto Y dañando tu puntuación de rastreabilidad con Google con el tiempo.
  • 304 No Modificado, En realidad está bien. Significa que Google está comprobando la actualización y tus encabezados de caché funcionan correctamente.

Picos en el Tiempo de Respuesta

Google ha dicho públicamente que los tiempos lentos de respuesta del servidor hacen que Googlebot rastrée menos agresivamente. Si tus registros muestran tiempos de respuesta promedio por encima de 500ms para URLs rastreadas, particularmente en páginas de categoría o producto, esa es una señal para arreglar tu caché del lado del servidor antes que nada.

Identificando los Asesinos del Presupuesto

Te voy a dar una lista de las cosas que veo consumiendo presupuesto de rastreo en sitios grandes, en orden aproximado de qué tan frecuente las encuentro:

  1. Navegación facetada sin noindex o disallow, Filtros, selectores de color, selectores de tamaño, órdenes de clasificación. Estos multiplican tu recuento de URLs geométricamente. Una categoría de producto con 10 opciones de filtro y 5 órdenes de clasificación genera 50+ variantes de URL duplicadas. En un sitio de 50K páginas, eso son potencialmente cientos de miles de URLs.
  2. Archivos paginados rastreados infinitamente, /page/2, /page/3.../page/847. Si el contenido en la página 200 de tu archivo de blog tiene cero valor de búsqueda orgánica, necesitas o bien aplicar noindex o disallow a la ruta de paginación en robots.txt.
  3. IDs de sesión en URLs, Plataformas CMS antiguas (y algunas configuraciones legadas de WooCommerce) añaden tokens de sesión como ?sessionid=abc123def456 a las URLs. Cada sesión genera una URL única. Googlebot rastrea todas ellas. Esta es una fuga de presupuesto catastrófica en sitios más antiguos.
  4. Contenido duplicado a través de parámetros de URL, ?utm_source=email en enlaces internos, parámetros de seguimiento filtrándose en URLs rastreables, ?ref=homepage añadido por plugins de afiliados. Corrige en la herramienta de parámetro de URL de Google Search Console y canonicaliza a nivel HTML.
  5. Páginas huérfanas sin enlaces internos pero aún en el sitemap, Googlebot las encuentra a través del sitemap, las rastrea, no encuentra señal interna, las desdeprioriza con el tiempo. Pero aún consumen presupuesto en rastreos de descubrimiento.
  6. Páginas soft 404 devolviendo estado 200, Páginas de búsqueda sin resultados, páginas de categoría vacías, páginas de perfil de usuario para cuentas eliminadas. Google desperdicia tiempo rastreando estas y a veces las indexa.

Arreglando Lo Que Encuentras

Honestamente, el análisis es la parte más fácil. La implementación es donde los proyectos se vuelven políticos.

Este es mi flujo de trabajo real cuando termino una auditoría de logs y necesito presentar recomendaciones:

  • Robots.txt desautoriza patrones de URL que nunca deben rastrearse, parámetros de sesión, combinaciones de filtros, URLs de resultados de búsqueda interna. Uso reglas comodín como Disallow: /*?sessionid=style. Prueba cada regla en la herramienta de prueba de robots.txt de Google Search Console antes de implementarla.
  • Noindex + nofollow en páginas paginadas más allá de la página 2 o 3, dependiendo de la frescura del contenido. No desactives la paginación por completo o romperás la capacidad de Googlebot para descubrir contenido enlazado.
  • Etiquetas canónicas en todas las variantes de URL parametrizadas apuntando a la URL canónica limpia. Esto es redundancia junto con robots.txt.
  • Corrige los errores 404 en la fuente. O actualiza los enlaces internos o implementa redirecciones 301. Uso el rastreador principal de Screaming Frog junto con los datos de registro para encontrar qué páginas enlazan a URLs muertas.
  • Higiene de mapa del sitio XML. Elimina del mapa del sitio cualquier URL que devuelva un código diferente a 200, esté marcada como noindexada o sea una redirección. Tu mapa del sitio debe ser una lista seleccionada de páginas que deseas indexar, nada más.

Seahawk tuvo un cliente fintech el año pasado, alrededor de 65,000 páginas, mayormente contenido dinámico, donde simplemente corregir el robots.txt para bloquear patrones de URLs de búsqueda interna redujo el rastreo de URLs basura por Googlebot en un 61% en seis semanas. El 39% restante del presupuesto de rastreo se desplazó hacia páginas de producto y categoría. La indexación de contenido nuevo pasó de un promedio de 23 días a 6 días. Este es el impacto real.

Configurar el Monitoreo Continuo

Un audit de logs es una instantánea. La buena gestión del presupuesto de rastreo es continua. ¿Qué aspecto tiene realmente en la práctica?

Como mínimo, recomiendo extraer y analizar registros mensualmente para cualquier sitio con más de 30,000 páginas. Observa la tendencia de frecuencia de rastreo de tus 100 URLs que generan más ingresos. Si la frecuencia de visitas de Googlebot a esas páginas está disminuyendo, algo ha cambiado: nuevas fugas de presupuesto de rastreo, problemas de rendimiento del servidor, o una caída en la señal de PageRank.

Si quieres ser más sofisticado, configura GoAccess como un trabajo cron para procesar snapshots de logs diarios y enviar un reporte de resumen por correo. Toma aproximadamente dos horas configurarlo y te ahorra de perderte la erosión lenta del presupuesto de rastreo entre audits trimestrales.

FAQ

¿Importa el presupuesto de rastreo si ya estoy completamente indexado?

De cierta forma. La indexación completa hoy no significa que se mantenga así. Si publicas contenido nuevo regularmente, nuevos productos, nuevas publicaciones de blog, nuevas páginas de destino, el presupuesto de rastreo determina con qué rapidez se descubre ese contenido fresco. Un sitio con un presupuesto de rastreo deficiente puede tener páginas nuevas sin inspeccionar durante semanas. Eso es una verdadera desventaja competitiva si estás en un nicho que se mueve rápidamente.

¿Debo bloquear a Googlebot completamente de ciertas subcarpetas usando robots.txt?

Sí, en casos específicos. Áreas de administrador, rutas de preparación, resultados de búsqueda interna y URLs de filtros pesadas en parámetros son candidatos razonables para reglas Disallow. Lo único que te recomendaría es que no bloquees archivos JavaScript o CSS; Googlebot los necesita para renderizar tus páginas correctamente. Muchos consejos de SEO antiguos dicen que bloquees JS; ignóralo.

¿Cuántos datos de logs debo analizar?

30 días es el punto de equilibrio para la mayoría de sitios. Menos que eso y no verás patrones de rastreo de baja frecuencia. Más que eso y los tamaños de archivo se vuelven difíciles de manejar a menos que estés ejecutando un stack ELK apropiado. Para sitios de e-commerce estacional, a veces miro 60 días abarcando un período de pico para entender el comportamiento de rastreo bajo carga de tráfico.

¿Y si mi servidor no proporciona acceso a registros sin procesar?

Presiona a tu proveedor de hosting; la mayoría de los hosts administrados tienen esto disponible aunque no esté destacado en el panel de control. Si realmente no puedes obtener registros brutos, el análisis de bots de Cloudflare puede darte una imagen parcial para sitios detrás del proxy de Cloudflare, aunque es un sustituto pálido para datos de registro reales. Considera cambiar de proveedor si esto es un obstáculo recurrente en una cuenta de cliente grande.

¿Son suficientes las estadísticas de rastreo de Google Search Console?

Para un sitio pequeño, discutiblemente sí. Para algo con más de 20K páginas, no. Las estadísticas de rastreo de GSC se agregan por día y no muestran datos a nivel de URL. Puedes ver que Googlebot rastreó 12,000 páginas un martes pero no cuáles fueron esas 12,000 páginas. Los archivos de registro te dan esa resolución. Ambas herramientas juntas, esa es la imagen completa.

---

Mira, la mayoría de SEOs saltan el análisis de archivos de registro porque se siente como territorio de DevOps. No es glamoroso. Estás buscando en gigabytes de marcas de tiempo y cadenas de agente de usuario. Pero en sitios grandes, es la diferencia entre adivinar dónde va tu presupuesto de rastreo y saber realmente. Y saber, en mi experiencia, siempre vale las dos horas que toma extraer los datos.

Lecturas relacionadas: Investigación de palabras clave con IA en 2026: qué es, por qué es importante la búsqueda tradicional, búsqueda con IA y SEO multilingüe.

< BACK