Verbesserung der Erkennung und Kennzeichnung wahrscheinlicher Crawler in Ihren Traffic-Daten

Das Admin-Dashboard kann nun wahrscheinlich Crawler-Traffic identifizieren – automatisierte Bots und Scraper, die echtes Browser-JavaScript verwenden, aber keine menschlichen Besucher sind – und trennt diese Seitenaufrufe von deinen echten Traffic-Zahlen.

In diesem Thema erklären wir, wie wir die Identifizierung dieses Traffics angegangen sind und wie du diese Funktion heute aktivieren kannst.

:microscope: Was sich geändert hat

Discourse hat immer Crawlers, die sich mit standardmäßigen Bot-User-Agents (z. B. Googlebot) identifizieren, in eine separate Kategorie der Site-Traffic-Daten gefiltert. Moderner automatisierter Traffic ist jedoch listiger: Er führt einen vollständigen Browser aus, führt JavaScript aus und mischt sich in deine Seitenaufruf-Daten ein, als wäre es ein echter Besuch. Admins sahen Traffic-Spitzen in Anonymen Seitenaufrufen, die sich als Scraper herausstellten, oder Besucherzahlen, die durch KI-Bots aufgebläht waren – ohne Möglichkeit, den Unterschied zwischen ihnen und echtem anonymem (d. h. nicht angemeldetem) menschlichem Traffic zu erkennen.

Dieses Update fügt deiner Site-Traffic-Daten eine Kategorie Vermutliche Crawler hinzu. Wenn die verbesserte Crawler-Erkennung aktiviert ist, werden Seitenaufrufe, die von unseren Heuristiken als wahrscheinlich automatisiert markiert werden, separat ausgewiesen, sodass deine menschlichen Traffic-Zahlen genauer sind.

So funktioniert die Erkennung

Das System bewertet jeden Browser-Seitenaufruf anhand eines Satzes von Verhaltenssignalen:

  • Automatisierungs-User-Agent – Der UA benennt ausdrücklich einen Headless-Browser oder ein Automatisierungstool (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
  • Verifiziertes Crawler-ASN – Die Autonome Systemnummer (ASN) der IP gehört zu einem bekannten Crawler-Netzwerk (Baidu, Ahrefs, Yandex, Internet Archive usw.)
  • Datacenter-ASN – Die IP liegt im Adressraum eines großen Cloud- oder Hosting-Anbieters
  • Geschwindigkeit – Die IP + User-Agent-Kombination erzeugt ungewöhnlich viele Seitenaufrufe pro Stunde
  • Schnelle Navigation – Der Medianabstand zwischen Seitenaufrufen liegt unter 5 Sekunden
  • Session-Churn – Viele kurze Sitzungen (meistens nur eine Seite) von derselben IP + User-Agent-Kombination
  • Fehlende Interaktion – Keine aufgezeichnete menschenähnliche Interaktion (Mausbewegung, Tastatureingaben, Scrollen) für eine Sitzung und deren Nachbarn
  • Schlechtes Referrer-Verhältnis – Die meisten Seitenaufrufe kommen ohne Referrer oder mit einem externen Referrer, was auf direkten URL-Zugriff statt auf Navigation durch die Site hindeutet
  • Einzelner direkter Request – Ein einzelner, nicht interagierender Seitenaufruf ohne Referrer; wird höher bewertet, wenn die URL einen Locale-Parameter enthält
  • Schnelle IP-Rotation – Mehrere IPs werden innerhalb einer einzelnen Sitzung verwendet, im schnelleren Wechsel als ein Mensch es würde
  • Veraltetes Chromium – Eine veraltete Chrome-Version ohne Interaktionssignale

Punkte aus mehreren Signalen addieren sich; wenn ein Seitenaufruf eine bestimmte Menge der oben genannten Signale aufweist, klassifizieren wir ihn als vermutlicher Crawler.

:gear: Verbesserte Crawler-Erkennung in deiner Community aktivieren

Dies wird derzeit als experimentelle Änderung betrachtet. Wir stimmen die Erkennungsheuristiken noch ab und freuen uns über Feedback.

Zum Aktivieren gehst du in deinem Admin-Bereich zur Seite Anstehende Änderungen und suchst den Eintrag Verbesserte Crawler-Erkennung. Aktualisiere das Feld Aktiviert für…, um deine Site dafür anzumelden.

Sobald aktiviert, zeigt der Bereich „Site-Traffic“ in deinem Admin-Dashboard vermutliche Crawler als separate Kategorie an.

:warning: Wichtige Hinweise:

  • Dies ist keine exakte Wissenschaft und wir werden unsere Heuristiken im Laufe der Zeit weiter verfeinern. Wir werden jedoch keine rückwirkenden Daten aktualisieren, wenn wir diese Berechnungen ändern.
  • Die Klassifizierung eines Seitenaufrufs als vermutlicher Crawler lehnt den Request nicht ab und drosselt ihn nicht.
  • Seitenaufrufe von vermutlichen Crawlern werden von Referrern, Ländern und anderen Traffic-Aufschlüsselungen ausgeschlossen – genau so, wie bekannte Crawler heute behandelt werden.

:mega: Was hältst du davon?

Wir freuen uns über dein Feedback – insbesondere von Communities, die ungewöhnliche Traffic-Muster oder unerklärliche Spitzen bemerkt haben. Stimmen die Zahlen für deine Site? Gibt es Besuche, die als solche markiert werden, die sich für dich wie echte Nutzer anfühlen? Teile mit uns, was du in diesem Thema siehst.

20 „Gefällt mir“

Klingt gut. Berücksichtigt es bei diesen Signalen auch eingeloggte Nutzer?

1 „Gefällt mir“

Zählen likely crawlers noch auf das monatliche Pageview-Limit? :slightly_smiling_face:

1 „Gefällt mir“

Ich habe vergessen, die URL von etwas zu bearbeiten, das ich beim Einsatz eines Modells eingefügt habe, und auf einem Forum im Bau ist ein Anstieg von 35.000 % aufgetreten.

Ich habe noch die ausstehende Aufgabe, ein kleines lokales Modell zu installieren, um echte Verweise auf das, woran ich arbeite, zu bereinigen.

Es ist großartig, diese Option als zweiten Filter zu haben. Danke, dass ihr das gebaut habt.

Das ist eine gute Frage, zu der wir uns noch nicht entschieden haben – wir gehen davon aus, dass wir unsere Crawler-Erkennungsmodelle noch feinjustieren müssen. Da es sich um eine optionale Funktion handelt, wissen wir noch nicht, ob und inwiefern sich dies auf die Pageview-Limits auswirken wird.

Wir werden das intern besprechen und melde mich dann mit einer Rückmeldung bei dir!

3 „Gefällt mir“

Danke für die Bemühungen. Ist ein wahrscheinlicher Punkt im Roadmap, dass man Maßnahmen gegen sie ergreifen kann, sobald man mit dem Erkennungsalgorithmus zufrieden ist?

2 „Gefällt mir“

Es wäre großartig, wenn wir eine Liste der User Agents erhalten könnten, die das System identifiziert hat oder für wahrscheinlich als Bots/Crawler hält.

Das ist hilfreich, damit sie den blockierten oder rate-limitierten Gruppen hinzugefügt werden können.

2 „Gefällt mir“

Ja, wir versuchen auch, Automatisierungen bei angemeldeten Benutzern zu erkennen. Auf Meta haben wir einige „Benutzer“ mit Vertrauensstufe 0 gefunden, die die Seite gescannt haben.

1 „Gefällt mir“

Die Herausforderung besteht darin, dass „wahrscheinliche Crawler“ häufig legitime User Agents verwenden. Manchmal sieht die Browserversion ziemlich alt aus, aber das ist kein stark genug Signal, um sie als wahrscheinlichen Bot einzuordnen. Deshalb erheben wir so viele Metriken und versuchen, sie zu kombinieren, um die Wahrscheinlichkeit besser einzuschätzen.

Wenn sich ein Crawler ehrlich über einen User Agent wie Bingbot oder Googlebot zu erkennen gibt, landet er direkt in der Kategorie „Crawler“.

1 „Gefällt mir“

Tatsächlich. Mithilfe der Statistiken, die das Team discourse aus dem Backend ziehen konnte, handelte es sich eher um unübliche User-Agents, die oft kurzfristige Anstiege in den Zugriffsmustern aufwiesen, sodass wir einige davon von der Liste streichen konnten, ohne die Benutzer zu beeinträchtigen.

Kein exakter Wissenschaftszweig. Die Möglichkeit, dies auf bestimmte Regionen abzubilden, würde wahrscheinlich auch eine genauere Auflösung bei deren Verwaltung ermöglichen.

2 „Gefällt mir“