Melhorando a detecção e sinalização de possíveis crawlers em seus dados de tráfego

O painel de administração agora é capaz de identificar tráfego provável de crawlers — bots automatizados e scrapers que usam JavaScript de navegador real, mas não são visitantes humanos — e separar essas visualizações de páginas dos seus números de tráfego genuíno.

Neste tópico, compartilharemos como abordamos a identificação desse tráfego e como você pode ativar esse recurso hoje.

:microscope: O que mudou

O Discourse sempre filtrou Crawlers que se identificam com user agents padrão de bots (como o Googlebot, por exemplo) para uma categoria separada dos dados de tráfego do site. Mas o tráfego automatizado moderno é mais disfarçado: ele executa um navegador completo, roda JavaScript e se mistura aos seus dados de visualização de páginas como se fosse uma visita real. Os administradores viam picos de tráfego nas visualizações de páginas Anonymous que se revelavam ser scrapers, ou contagens de visitantes inflacionadas por bots de IA — sem nenhuma maneira de distinguir esses acessos do tráfego humano anônimo verdadeiro (ou seja, não logado).

Esta atualização adiciona uma categoria Likely Crawlers aos seus dados de tráfego do site. Quando a detecção aprimorada de crawlers está ativada, as visualizações de páginas que nossas heurísticas marcam como provavelmente automatizadas são separadas, tornando seus números de tráfego humano mais precisos.

Como a detecção funciona

O sistema pontua cada visualização de página do navegador usando um conjunto de sinais comportamentais:

  • User agent de automação — o UA nomeia explicitamente um navegador headless ou ferramenta de automação (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
  • ASN de crawler verificado — o número de sistema autônomo (ASN) do IP pertence a uma rede de crawler conhecida (Baidu, Ahrefs, Yandex, Internet Archive, etc.)
  • ASN de datacenter — o IP está no espaço de endereços de um grande provedor de nuvem ou hospedagem
  • Velocidade — o IP + user agent gera um número incomum de visualizações de páginas por hora
  • Navegação rápida — o intervalo mediano entre visualizações de páginas é inferior a 5 segundos
  • Alta rotatividade de sessões — muitas sessões curtas (em sua maioria com uma página cada) vindas do mesmo IP + user agent
  • Falta de engajamento — nenhuma interação registrada que pareça humana (movimento do mouse, teclas pressionadas, rolagem) para a sessão e suas vizinhas
  • Proporção ruim de referrer — a maioria das visualizações chega sem referrer ou com um externo, sugerindo acesso direto à URL em vez de navegação pelo site
  • Requisição direta única — uma única visualização de página sem engajamento e sem referrer; pontua mais alto se a URL carregar um parâmetro de idioma (locale)
  • Rotação rápida de IP — múltiplos IPs usados dentro de uma única sessão, alternando mais rápido do que um humano faria
  • Chromium desatualizado — uma versão antiga do Chrome sem sinais de engajamento

As pontuações de vários sinais se acumulam; quando uma visualização de página possui uma certa quantidade dos sinais acima, classificamos-a como likely crawler (provável crawler).

:gear: Ativando a detecção aprimorada de crawlers na sua comunidade

Por enquanto, isso é considerado uma mudança experimental. Ainda estamos ajustando as heurísticas de detecção e aguardamos feedback.

Para ativar, acesse a página Mudanças futuras na área de administração e localize o item Detecção aprimorada de crawlers. Atualize o campo Ativado para… para incluir seu site.

Uma vez ativado, a seção de Tráfego do Site no seu painel de administração mostrará crawlers prováveis como uma categoria separada.

:warning: Notas importantes:

  • Esta não é uma ciência exata e continuaremos a refinar nossas heurísticas ao longo do tempo. No entanto, não faremos retroalimentação (backfill) à medida que atualizarmos esses cálculos.
  • Classificar uma visualização de página como crawler provável não nega nem aplica limite de taxa (rate-limit) à solicitação.
  • Visualizações de páginas de crawlers prováveis são excluídas de referrers, países e outras subdivisões de tráfego — da mesma forma que crawlers conhecidos são tratados hoje.

:mega: O que você acha?

Adoraríamos seu feedback — especialmente de comunidades que notaram padrões de tráfego incomuns ou picos inexplicados. Os números parecem corretos para o seu site? Há visitas sendo marcadas que parecem ser de usuários reais para você? Compartilhe o que está vendo neste tópico.

1 curtida

Soa bom, mas ele também considera os usuários conectados para esses sinais?

1 curtida

Os likely crawlers ainda serão contados no limite mensal de visualizações de página? :slightly_smiling_face: