Migliorare il rilevamento e la segnalazione dei crawler probabili nei dati di traffico

Il dashboard di amministrazione può ora identificare il traffico di crawler probabile — bot automatizzati e scraper che utilizzano JavaScript di browser reali ma non sono visitatori umani — e separare queste visualizzazioni di pagina dai tuoi dati di traffico genuino.

In questo argomento, condivideremo come abbiamo affrontato l’identificazione di questo traffico e come puoi attivare questa funzione oggi stesso.

:microscope: Cosa è cambiato

Discourse ha sempre filtrato i Crawlers che si identificano con user agent di bot standard (ad esempio Googlebot) in una categoria separata dei dati di traffico del sito. Ma il traffico automatizzato moderno è più subdolo: esegue un browser completo, esegue JavaScript e si mescola ai tuoi dati di visualizzazione di pagina come se fosse una visita reale. Gli amministratori vedevano picchi di traffico nelle visualizzazioni di pagina Anonime che si rivelavano essere scraper, o conteggi di visitatori gonfiati da bot AI — senza modo di distinguere tra questi e il vero traffico umano anonimo (cioè non registrato).

Questo aggiornamento aggiunge una categoria Crawler Probabili ai tuoi dati di traffico del sito. Quando il rilevamento migliorato dei crawler è abilitato, le visualizzazioni di pagina che le nostre euristiche segnalano come probabilmente automatizzate vengono separate, in modo che i tuoi dati di traffico umano siano più accurati.

Come funziona il rilevamento

Il sistema assegna un punteggio a ogni visualizzazione di pagina del browser utilizzando un insieme di segnali comportamentali:

  • User agent di automazione — l’UA nomina esplicitamente un browser headless o uno strumento di automazione (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
  • ASN di crawler verificato — il numero di sistema autonomo dell’IP è una rete di crawler nota (Baidu, Ahrefs, Yandex, Internet Archive, ecc.)
  • ASN di data center — l’IP si trova nello spazio di indirizzi di un importante provider cloud o di hosting
  • Velocità — l’IP + user agent genera un numero insolitamente elevato di visualizzazioni di pagina all’ora
  • Navigazione rapida — l’intervallo mediano tra le visualizzazioni di pagina è inferiore a 5 secondi
  • Rotazione delle sessioni — molte sessioni brevi (per lo più di una sola pagina ciascuna) dallo stesso IP + user agent
  • Mancanza di coinvolgimento — nessuna interazione registrata simile a quella umana (movimento del mouse, battitura, scorrimento) per una sessione e le sue vicine
  • Rapporto di referrer scadente — la maggior parte delle visualizzazioni di pagina arriva senza referrer o con uno esterno, suggerendo l’accesso diretto all’URL piuttosto che la navigazione attraverso il sito
  • Richiesta diretta singola — una singola visualizzazione di pagina non coinvolta senza referrer; il punteggio è più alto se l’URL contiene un parametro di localizzazione
  • Rotazione rapida degli IP — più IP utilizzati all’interno di una singola sessione, che cambiano più velocemente di quanto farebbe un umano
  • Chromium obsoleto — una versione di Chrome datata senza segnali di coinvolgimento

I punteggi derivanti da più segnali si sommano; quando una visualizzazione di pagina presenta una certa quantità dei segnali sopra elencati, la classifichiamo come crawler probabile.

:gear: Attivare il rilevamento migliorato dei crawler nella tua community

Per il momento, questo è considerato un cambiamento sperimentale. Stiamo ancora regolando le euristiche di rilevamento e accogliamo il feedback.

Per attivarlo, vai alla pagina Cambiamenti in arrivo nella tua area di amministrazione e trova l’elemento Rilevamento migliorato dei crawler. Aggiorna il campo Abilitato per… per iscrivere il tuo sito.

Una volta abilitato, la sezione Traffico del Sito del tuo dashboard di amministrazione mostrerà i crawler probabili come categoria separata.

:warning: Note importanti:

  • Questa non è una scienza perfetta e continueremo a affinare le nostre euristiche nel tempo. Tuttavia, non retroattiveremo i dati man mano che aggiorniamo questi calcoli.
  • Classificare una visualizzazione di pagina come crawler probabile non rifiuta né limita la velocità della richiesta.
  • Le visualizzazioni di pagina dei crawler probabili sono escluse da referrer, paesi e altre ripartizioni del traffico — nello stesso modo in cui i crawler noti sono gestiti oggi.

:mega: Cosa ne pensi?

Apprezziamo molto il tuo feedback — soprattutto da parte di community che hanno notato modelli di traffico insoliti o picchi inspiegati. I numeri sembrano corretti per il tuo sito? Ci sono visite segnalate che ti sembrano di utenti reali? Condividi ciò che stai osservando in questo argomento.

20 Mi Piace

Suona bene, ma considera anche gli utenti connessi per quei segnali?

1 Mi Piace

I crawler probabili verranno ancora conteggiati nel limite mensile di visualizzazioni di pagina? :slightly_smiling_face:

1 Mi Piace

Ho dimenticato di modificare l’URL di qualcosa che ho incollato mentre utilizzavo un modello, e su un forum in costruzione ho registrato un picco del 35.000%.

Ho ancora il compito in sospeso di installare un piccolo modello locale per ripulire eventuali riferimenti reali a ciò su cui sto lavorando.

È fantastico avere questa opzione come secondo filtro. Grazie per averla creata.

È una buona domanda, e una su cui non abbiamo ancora preso una decisione: prevediamo di dover affinare i nostri modelli di rilevamento dei crawler e, poiché questa è pensata come una facoltativa, non sappiamo ancora se e in che modo avrà un impatto sui limiti di visualizzazione.

Prenderemo in considerazione la questione internamente e ti aggiornerò!

3 Mi Piace

Grazie per lo sforzo profuso. È probabile che la possibilità di intraprendere un’azione correttiva una volta soddisfatti dell’algoritmo di rilevamento sia inclusa nella roadmap?

2 Mi Piace

Sarebbe ottimo se potessimo ottenere un elenco degli user agent identificati, o considerati probabili bot/crawler.

Ciò sarebbe utile per poterli aggiungere ai gruppi di blocco o di limitazione della frequenza.

2 Mi Piace

Sì, cerchiamo anche di rilevare le automazioni da parte di utenti connessi. Su Meta, abbiamo trovato alcuni “utenti” con livello di fiducia 0 che stavano scansionando il sito.

1 Mi Piace

La sfida è che i “probabili crawler” utilizzano spesso user agent legittimi. A volte, la versione del browser sembra piuttosto vecchia, ma non è un segnale abbastanza forte da considerarla un probabile bot. È per questo che raccogliamo così tante metriche e cerchiamo di combinarle per stimare la probabilità.

Quando il crawler si presenta onestamente tramite un user agent come Bingbot o Googlebot, finisce direttamente nella categoria “crawler”.

1 Mi Piace

Infatti. Con le statistiche che il team di discourse poteva estrarre dal backend, tendeva a trattarsi di user agent più oscuri, spesso con un aumento a breve termine dei pattern di accesso, il che ci permetteva di eliminarne alcuni dall’elenco senza impattare sugli utenti.

Non è una scienza esatta. La possibilità di mappare questi dati su specifiche aree geografiche migliorerebbe probabilmente la risoluzione nella loro gestione.

2 Mi Piace