AI 크롤러가 가장 빈번하게 인덱싱/크롤링하는 특정 주제가 무엇인지 파악하여, 가장 많이 인용되는 콘텐츠가 LLM 환각(hallucination)을 유발하는 원인이 되지 않도록 방지하고자 합니다. Data Explorer를 사용하여 크롤러 히트를 개별 주제 ID에 귀속시키는 방법이 있을까요?
틀린 말이 아니겠지만, Discourse가 카테고리나 토픽 수준에서 웹 크롤러 트래픽을 추적한다고 생각하지 않습니다. (수식 같은 것을 적용해 수치를 도출할 수 있을까요?
)
대부분의 AI 크롤러 활동은 사용자 에이전트를 통해 자신을 식별하지 않습니다. 일반적으로 이들은 구형 Chrome 버전을 주장합니다. 이를 식별할 수 있는 유일한 방법은, 이들이 단일 페이지만 방문하고 사이트 내에 머물러 두 번째 페이지를 방문하지 않는다는 사실입니다. 이들은 주로 데이터 센터에 위치하지만, 모바일 및 주거용 IP를 통한 단일 페이지 트래픽도 많이 목격했으며, 이는 침해된 장치를 통해 이루어진 것으로 추정됩니다.
대부분의 AI 크롤러는 사용자 에이전트를 알려줍니다. 말씀하신 것은 SEO 봇/크롤러 및 기타 악의적/남용/원치 않는 비인간 행위자입니다.