2024년 8월, 내 웹사이트로의 트래픽이 95%까지 감소했음을 인지했습니다. 하지만 게시물을 충분히 하지 않았을 뿐이라고 생각하며 무시했습니다.
그러나 오늘, Google에서 어떤 검색어를 사용하든 검색 범위를 내 사이트로만 제한할 때: ***site:BathindaHelper.com jobs in bathinda***, 결과는 0건이었습니다 (내 사이트에서 표시되는 유일한 결과는 실제로 내 사이트에서 이 결과를 표시하도록 Google 광고를 생성하라는 제안일 뿐이며, 이는 내 사이트가 실제로 인덱싱되었음을 의미합니다):
하지만 AFAIK(제 생각에는) Discourse는 대부분의 사이트에서 볼 수 있는 일반적인 robots.txt 파일을 사용하지 않습니다. 대신 어떤 이상한 ruby-thingy(루비 기반의 처리 방식)로 처리되며, 관리자가 조정할 수 있는 설정도 많지 않습니다. 위에서 언급한 두 가지 설정과 봇 속도 저하 기능 정도만 가능합니다.
알겠습니다.
즉, 모든 디스코urs 사용자는 (보통) ‘Robots.txt’ 파일을 지정하거나 제공해야 한다는 뜻이네요.
내일 이 파일에 무엇이 어떻게 포함되어야 하는지에 대한 해당 주제를 자세히 읽어보겠습니다.
두 번째로, 설명이 너무 복잡하지 않다면, 디스코urs 관리자 패널에서 몇 가지 설정을 조정하면서 동시에 구글이 이제 제 사이트를 자유롭게 접근(그리고 색인)할 수 있는지, 아니면 여전히 ‘Access Forbidden - 403’ 오류를 겪고 있는지 실시간으로 확인할 수 있는 간단한 방법이 있는지 알려주실 수 있을까요?!
어제 실험으로 이 두 도메인인 google과 google.com을 여기에 입력했습니다. 이것이 'Blocked Crawler User Agents’보다 우선순위가 높은지, 아니면 이것이 제 문제를 해결했는지(구글이 크롤링/인덱싱 요청을 큐에 넣었다고 하며, 최대 2~3일이 걸릴 수 있다고 함)는 알지 못합니다:
하지만 이 메타 토픽의 첫 번째 게시물에서 제가 설명한 바와 같이, Google 인덱싱에 영향을 미치는 다른 (작은) 문제들이 여전히 남아 있어, 이 토픽을 열어 두겠습니다.
또한, blocked Crawler User Agents에서 특정 사이트의 Crawler-1을 차단하고, 동시에 Allowed Crawler User Agents에서 같은 크롤러를 허용할 경우 어떻게 되는지 알려주시면 감사하겠습니다.
그리고 Allowed...에서 허용했지만 Robots.txt를 통해 차단한 경우는 어떻게 되는지, 정확히 어떤 설정이 우선순위가 있는지 궁금합니다.
드디어!!! 메인/홈페이지와 개별 주제에서 ‘forbidden’ 오류를 해결한 것 같습니다. 90%는 여러분 쪽의 도움, 10%는 제 실험 덕분이었습니다. 정말 감사합니다.
‘Blocked Crawlers’ 목록에서 'Compatible’을 제거한 후, 다른 설정 아래에 있는 주의를 발견했는데, 제가 멍청하게도 무시했던 그 주의사항은 'Allowed Crawler User Agents’에 값을 입력하지 말라고, 정말 자신이 있을 때만 입력하라고 사실상 경고하고 있었습니다. 바로 그거였죠! 대문자로 쓰인 경고를 무시한 것이 구글이 제 사이트를 무시하게 만든 수개월의 고통과 수많은 문제를 초래했습니다: