Google Analytics를 사용하여 의심되는 봇 트래픽 조사
이 가이드는 의심되는 봇 활동을 식별하고 조사하는 데 Google Analytics 4(GA4)를 사용하는 단계별 프로세스를 제공합니다.
1. GA4의 기본 봇 필터링 이해
GA4는 기본적으로 알려진 봇과 스파이더의 트래픽을 자동으로 제외합니다.[1] 이 필터링은 Google의 연구와 IAB의 International Spiders & Bots List를 기반으로 합니다.
이 가이드의 단계는 이러한 목록에 없는 더 정교하거나 알려지지 않은 봇을 식별하는 데 도움이 되도록 설계되었습니다.
2. 비정상적인 패턴을 가진 트래픽 분석
봇은 종종 일반적인 사용자 패턴에서 현저히 벗어난 트래픽을 생성합니다.
단계:
-
실시간 리포트 확인:
- 리포트 > 실시간 페이지로 이동합니다. "최근 30분 활성 사용자"에서 갑작스럽고 설명할 수 없는 급증을 찾습니다. 이는 활성 봇 증가의 첫 번째 징후일 수 있습니다.
사이트가 스팸 공격을 받고 있다고 생각되면, Immediate actions you can take during a spam attack 의 스팸 공격 중 취할 수 있는 즉각적 조치 가이드를 사용하세요. -
지리적 위치 조사:
-
리포트 > 인구 통계 > 사용자 > 사용자 속성 > 인구 통계 세부 정보로 이동합니다.
-
기본적으로 표시되는 그래프는 인구 통계 세부 정보: 국가여야 합니다. 타겟으로 삼지 않는 국가, 비즈니스拠점이 없는 국가, 또는 일반적으로 트래픽이 많지 않았던 국가에서 사용자가 많은지 확인합니다. 단일 예상치 못한 위치에서 갑자기 급증하는 것은 주요 경고 신호입니다.
-
-
추천 스팸을 위한 트래픽 소스 분석:
-
리포트 > 획득 > 트래픽 획득으로 이동합니다.
-
리포트는 기본적으로 "세션 기본 채널 그룹"으로 설정됩니다. 기본 차원 옆의 드롭다운 화살표를 클릭하여 세션 소스 / 매개변수를 선택합니다. 의심스럽거나 의미 없는 추천 소스(예:
"free-traffic-seo.com,""buttons-for-your-website.com")를 스캔합니다. 이들은 추천 스팸의 전형적인 징후입니다.[2]
-
3. 사용자 행동 지표 면밀히 검토
행동 지표는 인간 사용자와 봇을 분리하는 GA4의 가장 강력한 도구일 수 있습니다.
단계:
-
낮은 참여 시간 찾기:
- 리포트 > 참여 > 페이지 및 화면으로 이동합니다.
GA4에서 **참여율(Engagement rate)**은 10초 이상 지속된 세션, 전환 이벤트가 발생한 세션, 또는 최소 2회의 페이지뷰가 발생한 세션의 백분율입니다. 이는 이전의 ‘바운스율’ 측정보다 세션에 대한 더 세분화된 관점을 제공합니다.-
평균 참여 시간 지표는 사용자의 사이트가 포그라운드에 있던 시간을 보여줍니다. 봇은 일반적으로 페이지에 아주 적은 시간을 씁니다. “평균 참여 시간”(오름차순)으로 테이블을 정렬하여 상당한 뷰 수에도 불구하고 비정상적으로 낮은 참여를 보이는 페이지를 찾습니다.
-
"뷰"는 높지만 "참여율"이 매우 낮은 페이지를 찾습니다. 이는 사용자가 페이지에 도착한 후 즉시 떠나고 있음을 나타내며, 이는 일반적인 봇 행동입니다.
“참여율” 열이 보이지 않으면 추가해야 합니다. 오른쪽 위 모서리의 연필 아이콘(리포트 사용자 지정)을 클릭하고 "지표"를 선택한 후 리포트에 "참여율"을 추가합니다. 변경 사항을 저장하는 것을 잊지 마세요. -
랜딩 페이지 확인:
-
리포트 > 참여 > 랜딩 페이지로 이동합니다.
-
왼쪽 탐색 창에서 리포트 > 참여 > 랜딩 페이지로 이동합니다. 새 사용자 수는 많지만 평균 참여 시간이 극도로 낮은 페이지를 찾습니다. 이 패턴은 자동화 트래픽이 사이트의 특정 진입점을 타격하고 즉시 떠나고 있음을 시사합니다.
-
4. Google Analytics가 알려주지 못하는 것 
- IP 주소: Google Search Console과 마찬가지로 Google Analytics는 사용자 IP 주소를 보고하지 않습니다. 이 정보는 서버 로그에서만 찾을 수 있습니다. 악성 IP를 차단하려면 서버 로그 분석이 필수적입니다.
결론
Google Analytics는 의심스러운 트래픽 패턴을 식별하는 데 도움이 될 수 있지만, Discourse 포럼에서 원치 않는 크롤러를 늦추거나 차단하려면 관리자 > 설정 > 보안에서 찾을 수 있는 크롤러 설정 중 일부를 조정해야 합니다.
Discourse는 기본적으로 차단된 크롤러 사용자 에이전트 설정을 통해 몇 가지 공격적인 크롤러(mauibot, semrushbot, ahrefsbot, blexbot, seo spider)를 차단합니다. 완전히 차단하려는 추가 봇이 있으면 해당 사용자 에이전트를 이 목록에 추가하세요.
공격성은 낮지만 여전히 리소스를 많이 사용하는 봇의 경우, 크롤러 사용자 에이전트 감속에 추가하여 완전히 차단하지 않고 크롤링 속도를 줄일 수 있습니다. 기본적으로 이 설정은 일반적인 AI 봇(gptbot, claudebot, anthropic-ai, brightbot)의 속도를 제한합니다. 크롤러 감속 비율 사이트 설정을 통해 감속 속도를 관리할 수 있으며, 이는 허용된 요청 사이의 초수를 제어합니다(기본값: 60초).
또한 허용된 크롤러 사용자 에이전트 설정도 있으며, 이는 엄격한 허용 목록(allowlist) 역할을 합니다. 이 목록에 사용자 에이전트를 추가하면 모든 다른 크롤러가 차단됩니다. 사이트를 특정 크롤러 집합으로 제한하려는 경우에만 이 설정을 사용하세요.
이러한 설정을 조정할 때 매우 주의하세요. 예를 들어, 일부 사이트 소유자가 이 설정을 잘못 구성하여 합법적인 검색 엔진의 모든 트래픽을 실수로 차단한 사례가 있습니다.
마지막으로, 이러한 조치가 완벽하지 않다는 점을 기억하세요. 크롤러는 지속적으로 진화하며 잘 행동하지 않을 수 있습니다. 이러한 제한을 우회하기 위해 사용자 에이전트 문자열을 변경하거나 여러 IP 주소에 걸쳐 요청을 분산시킬 수 있습니다. 따라서 이러한 설정이 강력한 첫 번째 방어선을 제공할 수 있지만, 새로운 또는 비정상적인 패턴을 계속 모니터링하기 위해 분석 및 서버 로그를 지속적으로 확인해야 합니다.