Migliorare il rilevamento e la segnalazione dei crawler probabili nei dati di traffico

Il dashboard di amministrazione può ora identificare il traffico di crawler probabile — bot automatizzati e scraper che utilizzano JavaScript di browser reali ma non sono visitatori umani — e separare queste visualizzazioni di pagina dai tuoi dati di traffico genuino.

In questo argomento, condivideremo come abbiamo affrontato l’identificazione di questo traffico e come puoi attivare questa funzione oggi stesso.

:microscope: Cosa è cambiato

Discourse ha sempre filtrato i Crawlers che si identificano con user agent di bot standard (ad esempio Googlebot) in una categoria separata dei dati di traffico del sito. Ma il traffico automatizzato moderno è più subdolo: esegue un browser completo, esegue JavaScript e si mescola ai tuoi dati di visualizzazione di pagina come se fosse una visita reale. Gli amministratori vedevano picchi di traffico nelle visualizzazioni di pagina Anonime che si rivelavano essere scraper, o conteggi di visitatori gonfiati da bot AI — senza modo di distinguere tra questi e il vero traffico umano anonimo (cioè non registrato).

Questo aggiornamento aggiunge una categoria Crawler Probabili ai tuoi dati di traffico del sito. Quando il rilevamento migliorato dei crawler è abilitato, le visualizzazioni di pagina che le nostre euristiche segnalano come probabilmente automatizzate vengono separate, in modo che i tuoi dati di traffico umano siano più accurati.

Come funziona il rilevamento

Il sistema assegna un punteggio a ogni visualizzazione di pagina del browser utilizzando un insieme di segnali comportamentali:

  • User agent di automazione — l’UA nomina esplicitamente un browser headless o uno strumento di automazione (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
  • ASN di crawler verificato — il numero di sistema autonomo dell’IP è una rete di crawler nota (Baidu, Ahrefs, Yandex, Internet Archive, ecc.)
  • ASN di data center — l’IP si trova nello spazio di indirizzi di un importante provider cloud o di hosting
  • Velocità — l’IP + user agent genera un numero insolitamente elevato di visualizzazioni di pagina all’ora
  • Navigazione rapida — l’intervallo mediano tra le visualizzazioni di pagina è inferiore a 5 secondi
  • Rotazione delle sessioni — molte sessioni brevi (per lo più di una sola pagina ciascuna) dallo stesso IP + user agent
  • Mancanza di coinvolgimento — nessuna interazione registrata simile a quella umana (movimento del mouse, battitura, scorrimento) per una sessione e le sue vicine
  • Rapporto di referrer scadente — la maggior parte delle visualizzazioni di pagina arriva senza referrer o con uno esterno, suggerendo l’accesso diretto all’URL piuttosto che la navigazione attraverso il sito
  • Richiesta diretta singola — una singola visualizzazione di pagina non coinvolta senza referrer; il punteggio è più alto se l’URL contiene un parametro di localizzazione
  • Rotazione rapida degli IP — più IP utilizzati all’interno di una singola sessione, che cambiano più velocemente di quanto farebbe un umano
  • Chromium obsoleto — una versione di Chrome datata senza segnali di coinvolgimento

I punteggi derivanti da più segnali si sommano; quando una visualizzazione di pagina presenta una certa quantità dei segnali sopra elencati, la classifichiamo come crawler probabile.

:gear: Attivare il rilevamento migliorato dei crawler nella tua community

Per il momento, questo è considerato un cambiamento sperimentale. Stiamo ancora regolando le euristiche di rilevamento e accogliamo il feedback.

Per attivarlo, vai alla pagina Cambiamenti in arrivo nella tua area di amministrazione e trova l’elemento Rilevamento migliorato dei crawler. Aggiorna il campo Abilitato per… per iscrivere il tuo sito.

Una volta abilitato, la sezione Traffico del Sito del tuo dashboard di amministrazione mostrerà i crawler probabili come categoria separata.

:warning: Note importanti:

  • Questa non è una scienza perfetta e continueremo a affinare le nostre euristiche nel tempo. Tuttavia, non retroattiveremo i dati man mano che aggiorniamo questi calcoli.
  • Classificare una visualizzazione di pagina come crawler probabile non rifiuta né limita la velocità della richiesta.
  • Le visualizzazioni di pagina dei crawler probabili sono escluse da referrer, paesi e altre ripartizioni del traffico — nello stesso modo in cui i crawler noti sono gestiti oggi.

:mega: Cosa ne pensi?

Apprezziamo molto il tuo feedback — soprattutto da parte di community che hanno notato modelli di traffico insoliti o picchi inspiegati. I numeri sembrano corretti per il tuo sito? Ci sono visite segnalate che ti sembrano di utenti reali? Condividi ciò che stai osservando in questo argomento.

1 Mi Piace

Suona bene, ma considera anche gli utenti connessi per quei segnali?

1 Mi Piace

I crawler probabili verranno ancora conteggiati nel limite mensile di visualizzazioni di pagina? :slightly_smiling_face: