Il dashboard di amministrazione può ora identificare il traffico di crawler probabile — bot automatizzati e scraper che utilizzano JavaScript di browser reali ma non sono visitatori umani — e separare queste visualizzazioni di pagina dai tuoi dati di traffico genuino.
In questo argomento, condivideremo come abbiamo affrontato l’identificazione di questo traffico e come puoi attivare questa funzione oggi stesso.
Cosa è cambiato
Discourse ha sempre filtrato i Crawlers che si identificano con user agent di bot standard (ad esempio Googlebot) in una categoria separata dei dati di traffico del sito. Ma il traffico automatizzato moderno è più subdolo: esegue un browser completo, esegue JavaScript e si mescola ai tuoi dati di visualizzazione di pagina come se fosse una visita reale. Gli amministratori vedevano picchi di traffico nelle visualizzazioni di pagina Anonime che si rivelavano essere scraper, o conteggi di visitatori gonfiati da bot AI — senza modo di distinguere tra questi e il vero traffico umano anonimo (cioè non registrato).
Questo aggiornamento aggiunge una categoria Crawler Probabili ai tuoi dati di traffico del sito. Quando il rilevamento migliorato dei crawler è abilitato, le visualizzazioni di pagina che le nostre euristiche segnalano come probabilmente automatizzate vengono separate, in modo che i tuoi dati di traffico umano siano più accurati.
Come funziona il rilevamento
Il sistema assegna un punteggio a ogni visualizzazione di pagina del browser utilizzando un insieme di segnali comportamentali:
- User agent di automazione — l’UA nomina esplicitamente un browser headless o uno strumento di automazione (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
- ASN di crawler verificato — il numero di sistema autonomo dell’IP è una rete di crawler nota (Baidu, Ahrefs, Yandex, Internet Archive, ecc.)
- ASN di data center — l’IP si trova nello spazio di indirizzi di un importante provider cloud o di hosting
- Velocità — l’IP + user agent genera un numero insolitamente elevato di visualizzazioni di pagina all’ora
- Navigazione rapida — l’intervallo mediano tra le visualizzazioni di pagina è inferiore a 5 secondi
- Rotazione delle sessioni — molte sessioni brevi (per lo più di una sola pagina ciascuna) dallo stesso IP + user agent
- Mancanza di coinvolgimento — nessuna interazione registrata simile a quella umana (movimento del mouse, battitura, scorrimento) per una sessione e le sue vicine
- Rapporto di referrer scadente — la maggior parte delle visualizzazioni di pagina arriva senza referrer o con uno esterno, suggerendo l’accesso diretto all’URL piuttosto che la navigazione attraverso il sito
- Richiesta diretta singola — una singola visualizzazione di pagina non coinvolta senza referrer; il punteggio è più alto se l’URL contiene un parametro di localizzazione
- Rotazione rapida degli IP — più IP utilizzati all’interno di una singola sessione, che cambiano più velocemente di quanto farebbe un umano
- Chromium obsoleto — una versione di Chrome datata senza segnali di coinvolgimento
I punteggi derivanti da più segnali si sommano; quando una visualizzazione di pagina presenta una certa quantità dei segnali sopra elencati, la classifichiamo come crawler probabile.
Attivare il rilevamento migliorato dei crawler nella tua community
Per il momento, questo è considerato un cambiamento sperimentale. Stiamo ancora regolando le euristiche di rilevamento e accogliamo il feedback.
Per attivarlo, vai alla pagina Cambiamenti in arrivo nella tua area di amministrazione e trova l’elemento Rilevamento migliorato dei crawler. Aggiorna il campo Abilitato per… per iscrivere il tuo sito.
Una volta abilitato, la sezione Traffico del Sito del tuo dashboard di amministrazione mostrerà i crawler probabili come categoria separata.
Note importanti:
- Questa non è una scienza perfetta e continueremo a affinare le nostre euristiche nel tempo. Tuttavia, non retroattiveremo i dati man mano che aggiorniamo questi calcoli.
- Classificare una visualizzazione di pagina come crawler probabile non rifiuta né limita la velocità della richiesta.
- Le visualizzazioni di pagina dei crawler probabili sono escluse da referrer, paesi e altre ripartizioni del traffico — nello stesso modo in cui i crawler noti sono gestiti oggi.
Cosa ne pensi?
Apprezziamo molto il tuo feedback — soprattutto da parte di community che hanno notato modelli di traffico insoliti o picchi inspiegati. I numeri sembrano corretti per il tuo sito? Ci sono visite segnalate che ti sembrano di utenti reali? Condividi ciò che stai osservando in questo argomento.

