페이지뷰 처리 방식과 이 중요한 데이터를 여러분께 제시하는 방법에 있어 상당한 개선이 이루어졌음을 기쁘게 알려드립니다. 새로운 사이트 트래픽 보고서는 커뮤니티의 참여도에 대해 더 포괄적이고 정확한 인사이트를 제공합니다. 무엇이 새로워졌으며, 이것이 여러분에게 어떤 이점을 주는지 자세히 살펴보겠습니다.
호스팅 고객에게 새로운 페이지뷰 추적을 순차적으로 배포하는 중이므로, 모든 사이트가 즉시 전환되지는 않습니다.
변경 사항
페이지뷰 추적 및 보고 방식을 개편하여 더 신뢰할 수 있고 실행 가능한 데이터를 제공하도록 했습니다. 이제 개별 페이지뷰의 출처를 모니터링하며, 해당 트래픽이 실제 브라우저에서 왔는지 크롤러에서 왔는지를 감지할 수 있습니다.
새로운 사이트 트래픽 보고서는 다양한 출처의 데이터를 결합하여 사이트 트래픽에 대한 전체적인 시각을 제공합니다.
방금 이 문제를 알게 되었는데, 페이지뷰 통계가 완전히 깨져서 전체 조회수가 약 5분의 1에서 6분의 1 정도 줄어든 것으로 표시됩니다. 이 문제를 버그로 보고해야 하나요?
@JonahAragon1님과@darkpixlz님도 지적했듯이, 포럼 시작 이후의 총 조회수를 포함한 수년간의 페이지뷰 통계를 잃어버렸습니다. 이 데이터를 복구할 수 있을까요? 아니면 초기 운영 문제를 해결할 때까지 기존 시스템을 계속 사용할 수 있는 옵션을 제공해 주실 수 없을까요? 대안으로 제공하거나, 새로운 시스템과 함께 병행하는 방식도 가능합니다.
제가 이해한 바로는, 구버전과 신버전의 차이는 실제 익명 사용자와 크롤러 에이전트를 더 정확하게 구분할 수 있게 되었다는 것입니다. 그런데 왜 로그인 사용자로 분류된 페이지뷰 수가 감소한 것일까요? 또한, 같은 날 검색을 통한 방문이 1,600회 있었는데, 그 1,600회의 방문이 겨우 1,800회의 페이지뷰만 발생시켰다는 것은 다소 이해하기 어렵습니다. "기타 트래픽"이 비인간(non-human)에서 비롯된 것이라는 확신에 대해 얼마나 자신감이 있으신지 궁금합니다.
그리고 LLM 크롤러는 "알려진 크롤러"에 포함되나요, 아니면 "기타 트래픽"에 포함되나요? 크롤러 에이전트 보고서에서는 LLM 크롤러를 찾아볼 수 없는데, 아마도 내 robots.txt 설정을 준수하고 있기 때문일 수도 있겠네요.[1]
현재는 "기타 트래픽"이 무엇인지 보여줄 수 있는 더 세분화된 데이터가 없습니다. 로그인 상태이거나 익명 상태인 경우를 불문하고, 알려진 크롤러가 아닌 “실제/사람/브라우저” 페이지 뷰가 아닌 모든 것을 의미합니다.
상당히 확신하고 있지만, 요즘에는 잘못된 행동을 하는 봇과 크롤러를 사이트의 합법적인 사용자들과 구별하는 것이 쉽지 않은 싸움입니다. 향후 시스템에 추가적인 조정을 가해야 할 수도 있습니다. 현재로서는 전체 Ember 앱이 부팅되는 경우를 "실제"로 간주하며, 이는 실제 브라우저 밖에서 재현하기가 어렵습니다.
상황에 따라 다릅니다… 때로는 robots.txt를 준수하고 크롤러로 자신을 식별하지만, 그렇지 않은 경우도 있습니다. 이것이 페이지 뷰가 과도하게 부풀려진 원인 중 하나였으며, 이 새로운 시스템으로 전환한 이유이기도 합니다.
현재 저희가 알고 있는 크롤러 목록은 User-Agent를 기반으로 합니다:
또한 특정 크롤러/봇, 주로 AI 관련 봇에 대해 속도 제한(rate limit)을 적용하고 있습니다: