Mejoras en la detección y marcado de posibles crawlers en tus datos de tráfico

El panel de administración ahora puede identificar el tráfico probable de rastreadores (crawlers): bots y raspadores automatizados que utilizan JavaScript de navegador real pero que no son visitantes humanos — y separar esas visualizaciones de página de tus métricas de tráfico genuino.

En este tema, compartiremos cómo hemos abordado la identificación de este tráfico y cómo puedes activar esta función hoy mismo.

:microscope: Qué ha cambiado

Discourse siempre ha filtrado los Crawlers que se identifican mediante agentes de usuario estándar de bots (por ejemplo, Googlebot) en una categoría separada de los datos de tráfico del sitio. Pero el tráfico automatizado moderno es más escurridizo: ejecuta un navegador completo, ejecuta JavaScript y se mezcla con tus datos de visualizaciones de página como si fuera una visita real. Los administradores veían picos de tráfico en las visualizaciones de página de Anónimos que resultaban ser raspadores, o recuentos de visitantes inflados por bots de IA, sin forma de distinguirlos del tráfico humano anónimo genuino (es decir, no iniciado sesión).

Esta actualización añade una categoría Likely Crawlers (Rastreadores probables) a los datos de tráfico de tu sitio. Cuando la detección mejorada de rastreadores está habilitada, las visualizaciones de página que nuestras heurísticas marcan como probablemente automatizadas se separan en una categoría distinta, de modo que tus cifras de tráfico humano sean más precisas.

Cómo funciona la detección

El sistema puntúa cada visualización de página del navegador utilizando un conjunto de señales de comportamiento:

  • Agente de usuario de automatización — el UA nombra explícitamente un navegador sin interfaz (headless) o una herramienta de automatización (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
  • ASN de rastreador verificado — el número de sistema autónomo de la IP pertenece a una red de rastreadores conocida (Baidu, Ahrefs, Yandex, Internet Archive, etc.)
  • ASN de centro de datos — la IP está en el espacio de direcciones de un proveedor mayor de nube o alojamiento
  • Velocidad — la IP + agente de usuario genera un número inusualmente alto de visualizaciones de página por hora
  • Navegación rápida — la mediana de la diferencia entre visualizaciones de página es inferior a 5 segundos
  • Rotación de sesiones — muchas sesiones cortas (en su mayoría de una sola página) desde la misma IP + agente de usuario
  • Falta de interacción — no se registra ninguna interacción similar a la humana (movimiento del ratón, pulsaciones de teclas, desplazamiento) para una sesión y sus vecinas
  • Relación de referencias deficiente — la mayoría de las visualizaciones de página llegan sin referencia o con una externa, lo que sugiere acceso directo a la URL en lugar de navegación a través del sitio
  • Solicitud directa única — una única visualización de página sin interacción y sin referencia; puntúa más alto si la URL lleva un parámetro de idioma
  • Rotación rápida de IP — múltiples IPs utilizadas dentro de una única sesión, cambiando más rápido de lo que lo haría un humano
  • Chromium obsoleto — una versión desactualizada de Chrome sin señales de interacción

Las puntuaciones de varias señales se acumulan; cuando una visualización de página tiene una cantidad determinada de las señales anteriores, la clasificamos como likely crawler (rastreador probable).

:gear: Cómo activar la detección mejorada de rastreadores en tu comunidad

Por ahora, esto se considera un cambio experimental. Aún estamos ajustando las heurísticas de detección y agradecemos las opiniones.

Para activarlo, ve a la página Upcoming changes en tu área de administración y busca el elemento Improved crawler detection (Detección mejorada de rastreadores). Actualiza el campo Enabled for… (Habilitado para…) para optar por incluir tu sitio.

Una vez habilitado, la sección de Tráfico del Sitio en tu panel de administración mostrará los rastreadores probables como una categoría separada.

:warning: Notas importantes:

  • Esto no es una ciencia perfecta y continuaremos perfeccionando nuestras heurísticas con el tiempo. Sin embargo, no retroalimentaremos (backfill) los datos a medida que actualicemos estos cálculos.
  • Clasificar una visualización de página como rastreador probable no deniega ni limita por tasa la solicitud.
  • Las visualizaciones de página de rastreadores probables están excluidas de las referencias, países y otras desglosaciones de tráfico, de la misma manera en que se manejan hoy los rastreadores conocidos.

:mega: ¿Qué opinas?

Nos encantaría recibir tus comentarios, especialmente de las comunidades que han notado patrones de tráfico inusuales o picos inexplicados. ¿Las cifras se ven correctas para tu sitio? ¿Hay visitas marcadas que te parecen de usuarios reales? Comparte lo que estás viendo en este tema.

1 me gusta

Suena bien, ¿también analiza a los usuarios conectados para esas señales?

1 me gusta

¿Seguirán contándose los likely crawlers hacia el límite mensual de visualizaciones de página? :slightly_smiling_face: