Verbesserung der Erkennung und Kennzeichnung wahrscheinlicher Crawler in Ihren Traffic-Daten

Das Admin-Dashboard kann nun wahrscheinlich Crawler-Traffic identifizieren – automatisierte Bots und Scraper, die echtes Browser-JavaScript verwenden, aber keine menschlichen Besucher sind – und trennt diese Seitenaufrufe von deinen echten Traffic-Zahlen.

In diesem Thema erklären wir, wie wir die Identifizierung dieses Traffics angegangen sind und wie du diese Funktion heute aktivieren kannst.

:microscope: Was sich geändert hat

Discourse hat immer Crawlers, die sich mit standardmäßigen Bot-User-Agents (z. B. Googlebot) identifizieren, in eine separate Kategorie der Site-Traffic-Daten gefiltert. Moderner automatisierter Traffic ist jedoch listiger: Er führt einen vollständigen Browser aus, führt JavaScript aus und mischt sich in deine Seitenaufruf-Daten ein, als wäre es ein echter Besuch. Admins sahen Traffic-Spitzen in Anonymen Seitenaufrufen, die sich als Scraper herausstellten, oder Besucherzahlen, die durch KI-Bots aufgebläht waren – ohne Möglichkeit, den Unterschied zwischen ihnen und echtem anonymem (d. h. nicht angemeldetem) menschlichem Traffic zu erkennen.

Dieses Update fügt deiner Site-Traffic-Daten eine Kategorie Vermutliche Crawler hinzu. Wenn die verbesserte Crawler-Erkennung aktiviert ist, werden Seitenaufrufe, die von unseren Heuristiken als wahrscheinlich automatisiert markiert werden, separat ausgewiesen, sodass deine menschlichen Traffic-Zahlen genauer sind.

So funktioniert die Erkennung

Das System bewertet jeden Browser-Seitenaufruf anhand eines Satzes von Verhaltenssignalen:

  • Automatisierungs-User-Agent – Der UA benennt ausdrücklich einen Headless-Browser oder ein Automatisierungstool (HeadlessChrome, Playwright, Puppeteer, Selenium, PhantomJS, jsdom)
  • Verifiziertes Crawler-ASN – Die Autonome Systemnummer (ASN) der IP gehört zu einem bekannten Crawler-Netzwerk (Baidu, Ahrefs, Yandex, Internet Archive usw.)
  • Datacenter-ASN – Die IP liegt im Adressraum eines großen Cloud- oder Hosting-Anbieters
  • Geschwindigkeit – Die IP + User-Agent-Kombination erzeugt ungewöhnlich viele Seitenaufrufe pro Stunde
  • Schnelle Navigation – Der Medianabstand zwischen Seitenaufrufen liegt unter 5 Sekunden
  • Session-Churn – Viele kurze Sitzungen (meistens nur eine Seite) von derselben IP + User-Agent-Kombination
  • Fehlende Interaktion – Keine aufgezeichnete menschenähnliche Interaktion (Mausbewegung, Tastatureingaben, Scrollen) für eine Sitzung und deren Nachbarn
  • Schlechtes Referrer-Verhältnis – Die meisten Seitenaufrufe kommen ohne Referrer oder mit einem externen Referrer, was auf direkten URL-Zugriff statt auf Navigation durch die Site hindeutet
  • Einzelner direkter Request – Ein einzelner, nicht interagierender Seitenaufruf ohne Referrer; wird höher bewertet, wenn die URL einen Locale-Parameter enthält
  • Schnelle IP-Rotation – Mehrere IPs werden innerhalb einer einzelnen Sitzung verwendet, im schnelleren Wechsel als ein Mensch es würde
  • Veraltetes Chromium – Eine veraltete Chrome-Version ohne Interaktionssignale

Punkte aus mehreren Signalen addieren sich; wenn ein Seitenaufruf eine bestimmte Menge der oben genannten Signale aufweist, klassifizieren wir ihn als vermutlicher Crawler.

:gear: Verbesserte Crawler-Erkennung in deiner Community aktivieren

Dies wird derzeit als experimentelle Änderung betrachtet. Wir stimmen die Erkennungsheuristiken noch ab und freuen uns über Feedback.

Zum Aktivieren gehst du in deinem Admin-Bereich zur Seite Anstehende Änderungen und suchst den Eintrag Verbesserte Crawler-Erkennung. Aktualisiere das Feld Aktiviert für…, um deine Site dafür anzumelden.

Sobald aktiviert, zeigt der Bereich „Site-Traffic“ in deinem Admin-Dashboard vermutliche Crawler als separate Kategorie an.

:warning: Wichtige Hinweise:

  • Dies ist keine exakte Wissenschaft und wir werden unsere Heuristiken im Laufe der Zeit weiter verfeinern. Wir werden jedoch keine rückwirkenden Daten aktualisieren, wenn wir diese Berechnungen ändern.
  • Die Klassifizierung eines Seitenaufrufs als vermutlicher Crawler lehnt den Request nicht ab und drosselt ihn nicht.
  • Seitenaufrufe von vermutlichen Crawlern werden von Referrern, Ländern und anderen Traffic-Aufschlüsselungen ausgeschlossen – genau so, wie bekannte Crawler heute behandelt werden.

:mega: Was hältst du davon?

Wir freuen uns über dein Feedback – insbesondere von Communities, die ungewöhnliche Traffic-Muster oder unerklärliche Spitzen bemerkt haben. Stimmen die Zahlen für deine Site? Gibt es Besuche, die als solche markiert werden, die sich für dich wie echte Nutzer anfühlen? Teile mit uns, was du in diesem Thema siehst.

1 „Gefällt mir“

Klingt gut. Berücksichtigt es bei diesen Signalen auch eingeloggte Nutzer?

1 „Gefällt mir“

Zählen likely crawlers noch auf das monatliche Pageview-Limit? :slightly_smiling_face: