Die Herausforderung besteht darin, dass „wahrscheinliche Crawler“ häufig legitime User Agents verwenden. Manchmal sieht die Browserversion ziemlich alt aus, aber das ist kein stark genug Signal, um sie als wahrscheinlichen Bot einzuordnen. Deshalb erheben wir so viele Metriken und versuchen, sie zu kombinieren, um die Wahrscheinlichkeit besser einzuschätzen.
Wenn sich ein Crawler ehrlich über einen User Agent wie Bingbot oder Googlebot zu erkennen gibt, landet er direkt in der Kategorie „Crawler“.