Google Search Console가 잘못된 구조(또는 사이트 관리 오류)로 인해 보고하는 문제들

초기 패닉(거의 반 년 동안 구글이 자신의 웹사이트에 전혀 관심을 보이지 않았다는 사실을 알게 된 사람이 겪을 수 있는)가 가라앉은 후,

여기서는 Discourse 코드와 관련된, 즉 구글이나 저(제가 아는 한)가 수정할 수 없고 Discourse 팀만이 수정할 수 있는 원인들만 나열해 보겠습니다.

'비디오 인덱싱 보고서’를 클릭하면:

그리고 ‘Enhancements> Videos’ 링크를 클릭하면:

도움 부탁드립니다.

이전에는 문제를 우연히 발견했을 때 (이 모든 내용은 건너뛸 수 있습니다)::

몇 달 동안 사용자를 잃어온 끝에, 오늘 내 웹사이트가 Google에서 차단/거부되고 있음을 발견했습니다!!!

더 이전으로 거슬러 올라가, 문제를 어떻게 발견했는지 (모든 내용은 건너뛸 수 있습니다):

질문하기 전에 이 메타 토픽의 거의 모든 내용을 읽었습니다.

2024년 8월, 내 웹사이트로의 트래픽이 95%까지 감소했음을 인지했습니다. 하지만 게시물을 충분히 하지 않았을 뿐이라고 생각하며 무시했습니다.

그러나 오늘, Google에서 어떤 검색어를 사용하든 검색 범위를 내 사이트로만 제한할 때: ***site:BathindaHelper.com jobs in bathinda***, 결과는 0건이었습니다 (내 사이트에서 표시되는 유일한 결과는 실제로 내 사이트에서 이 결과를 표시하도록 Google 광고를 생성하라는 제안일 뿐이며, 이는 내 사이트가 실제로 인덱싱되었음을 의미합니다):


마지막으로 Google Analytics(이제는 Google Events로 이름이 변경되었을 수 있음)도 확인해 보았으며, 2024년 6월 17일부터 Google이 더 이상 내 사이트로 트래픽을 보내지 않는 것이 명확히 표시되고 있습니다.

사이트를 만들 때 강제 로그인을 적용했거나, TL0+ 이상의 주제 표시를 중단하셨나요? 구글은 사이트가 전 세계에 공개되어 있을 때만 사이트를 활용할 수 있습니다. 또는 구글의 사용자 에이전트를 차단하고 계실 수도 있습니다.

이것이 DNS 문제를 겪고 계신 것과 같은 포럼인가요?

Site does not appear in google searches - #2 by Bathinda 이 질문 때문에 묻는 건가요? 아래 답변이 OP의 질문에 답하고 있다고 생각합니다.

저는 'force(강제)'라는 단어를 잘못 사용했습니다. (원래 말하고 싶었던 것은 제 사이트인 BathindaHelper.com에서 검색 결과를 나오도록 Google 검색을 강제했다는 것이었습니다.)

  • 제 사이트는 비정상적이거나 강제적인 방법으로 제작하지 않았습니다.
  • TL0+ 또는 이와 관련된 부분에 대해 의도적으로 뭔가를 조작하지 않았습니다.
  • 지난 30분 동안 (몇 가지 다른 작은 문제들과 함께) robots.txt 파일이 문제의 원인임을 발견했지만, 아직 이 문제를 해결하는 방법을 찾지 못했습니다.
  • DNS 문제가 있었다고 기억나지 않습니다. (너무 오래된 일을 말씀하시는 건가요?) 제 사이트는 잘 작동하고 있지만, /admin에서 브라우저를 강제 새로고침할 때 가끔은 열리는데 거의 30~50초가 걸리기도 합니다. 하지만 그 후에는 정상적으로 작동합니다.

답변해 주셔서 감사합니다.

수정:
robots 파일 옵션을 '해제’했습니다:

하지만 Google 검색 콘솔에서 현재 모든 것이 정상이라고 보고하고 있는지, 아니면 그렇지 않은지 단정할 수 없습니다:

네, 제가 순서를 완전히 놓쳤어요. 그리고 이제 이런 일이 일어날 수 있다는 걸 직접 보여주게 됐네요.

  • 오래된 주제에 답글을 남긴 경우
  • 주제와 무관한 내용
  • 사용자가 주제를 읽지 않은 경우 :joy:

네, 제 실수예요.

다음 설정을 확인해 보세요:

  • 허용된 크롤러 사용자 에이전트
  • 차단된 크롤러 사용자 에이전트

하지만 AFAIK(제 생각에는) Discourse는 대부분의 사이트에서 볼 수 있는 일반적인 robots.txt 파일을 사용하지 않습니다. 대신 어떤 이상한 ruby-thingy(루비 기반의 처리 방식)로 처리되며, 관리자가 조정할 수 있는 설정도 많지 않습니다. 위에서 언급한 두 가지 설정과 봇 속도 저하 기능 정도만 가능합니다.

그건 제 손이 너무 빨라서 생긴 실수였습니다 :man_facepalming:

지금 막 비활성화했나요, 아니면 인덱싱이 중단되기 전에 그랬나요?

robots.txt에 이 사이트가 웹 검색 엔진에 의해 인덱싱되는 것이 허용됨을 지정하십시오.

검색 엔진이 사이트를 인덱싱하도록 허용하지 않는다면, 검색 엔진이 인덱싱하지 않는 것은 놀라운 일이 아닙니다.

그렇게 해서 보고드리겠습니다.

이 문제를 제기한 지 약 30분 전에 비활성화했습니다. 하지만 이 문제는 3개월째 지속되고 있습니다. 또한 이 '해제’가 ‘구글 인덱싱’ 오류를 실제로 해결할 수 있는지 여부를 독립적으로 검증하지는 못했습니다.

Robots.txt를 통해 사이트를 비활성화/차단하지 않으면 모든 사이트가 허용되는 건지, 아니면 반대로 Robots.txt를 통해 사이트를 활성화하지 않으면 모든 사이트가 인덱싱에서 차단되는 건지 의문이 듭니다.

그걸 완전히 잊고 있었네요. 선택해 두셔야 합니다. 해당 옵션을 사용하지 않는다면, 봇이 원하는 대로 안내되도록 robots.txt 파일을 수동으로 확인하고 편집해야 합니다.

하지만 Google을 차단하는 요소가 있는지 확인해 보시는 것도 좋습니다.

알겠습니다.
즉, 모든 디스코urs 사용자는 (보통) ‘Robots.txt’ 파일을 지정하거나 제공해야 한다는 뜻이네요.
내일 이 파일에 무엇이 어떻게 포함되어야 하는지에 대한 해당 주제를 자세히 읽어보겠습니다.

두 번째로, 설명이 너무 복잡하지 않다면, 디스코urs 관리자 패널에서 몇 가지 설정을 조정하면서 동시에 구글이 이제 제 사이트를 자유롭게 접근(그리고 색인)할 수 있는지, 아니면 여전히 ‘Access Forbidden - 403’ 오류를 겪고 있는지 실시간으로 확인할 수 있는 간단한 방법이 있는지 알려주실 수 있을까요?!

수정: 저는 지금 또는 나중에 구글에서 유사한 자료를 직접 찾아보려고 합니다.

아니요, 아닙니다. 이는 보통 관리자가 수동으로 설정을 건드릴 필요가 없도록 robots.txt를 활성화해 두는 것을 의미합니다. :wink: 하지만 차단된 봇 목록 등은 관리자가 수정하고 싶어 하는 부분입니다.

blocked_crawler_user_agents 설정이 무엇인지 확인해 주시겠어요?

  1. 이 설정은 다음과 같습니다 (아무것도 변경하지 않았습니다):

  2. 어제 실험으로 이 두 도메인인 google과 google.com을 여기에 입력했습니다. 이것이 'Blocked Crawler User Agents’보다 우선순위가 높은지, 아니면 이것이 제 문제를 해결했는지(구글이 크롤링/인덱싱 요청을 큐에 넣었다고 하며, 최대 2~3일이 걸릴 수 있다고 함)는 알지 못합니다:

  3. 그리고 제 'Robots.txt’는 여기에서 찾을 수 있습니다.

세 가지 모두 상반된 설정을 가지고 있을 때, 어느 쪽이 우선순위가 있는지 알려주실 수 있을까요?

Google은 크롤링에 "Googlebot"과 그 변형들을 사용하므로, 이것이 영향을 미치지 않아야 합니다:

사실 그게 가장 큰 영향을 미쳤습니다!!

모두 감사합니다. 이 설정을 사용하여 가장 큰 문제를 해결해 주셔서 정말 감사합니다:

하지만 이 메타 토픽의 첫 번째 게시물에서 제가 설명한 바와 같이, Google 인덱싱에 영향을 미치는 다른 (작은) 문제들이 여전히 남아 있어, 이 토픽을 열어 두겠습니다.

또한, blocked Crawler User Agents에서 특정 사이트의 Crawler-1을 차단하고, 동시에 Allowed Crawler User Agents에서 같은 크롤러를 허용할 경우 어떻게 되는지 알려주시면 감사하겠습니다.
그리고 Allowed...에서 허용했지만 Robots.txt를 통해 차단한 경우는 어떻게 되는지, 정확히 어떤 설정이 우선순위가 있는지 궁금합니다.

**compatible**를 반드시 제거해야 합니다. 이 단어는 googlebot을 포함한 거의 모든 봇을 차단하기 때문입니다. 그 이유는 다음과 같습니다:

Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)

페이스북에서 주제를 공유하는 경우, facebook을 차단하는 것도 좋은 아이디어가 아닙니다.

블록리스트에 사용하는 모든 단어는 그 단어가 포함된 사용자 에이전트 문자열을 가진 모든 봇을 차단합니다. 그러므로 주의하세요.

아, 그래서 구글 검색 콘솔을 통해 홈페이지를 제외한 모든 주제를 크롤링/인덱싱하려고 하면 계속 오류가 나는 건가 봅니다:

그런데 왜 (`compatible’이 차단된 상태에서도) 구글 검색 콘솔에서는 아래에 표시된 것처럼 홈페이지만 접근 가능한 걸까요?

방금 'Compatible’을 제거했으니 결과를 다시 보고하겠습니다.

드디어!!! 메인/홈페이지와 개별 주제에서 ‘forbidden’ 오류를 해결한 것 같습니다. 90%는 여러분 쪽의 도움, 10%는 제 실험 덕분이었습니다. 정말 감사합니다.

‘Blocked Crawlers’ 목록에서 'Compatible’을 제거한 후, 다른 설정 아래에 있는 주의를 발견했는데, 제가 멍청하게도 무시했던 그 주의사항은 'Allowed Crawler User Agents’에 값을 입력하지 말라고, 정말 자신이 있을 때만 입력하라고 사실상 경고하고 있었습니다. 바로 그거였죠! 대문자로 쓰인 경고를 무시한 것이 구글이 제 사이트를 무시하게 만든 수개월의 고통과 수많은 문제를 초래했습니다:


구글 검색 콘솔에서 Access Forbidden-403 오류를 겪고 이 주제에 온 분들을 위해:

  • 제 문제를 해결한 주요 사항은 두 가지인데, 하나는 'Blocked Crawlers List’에서 'Compatible’을 제거한 것이고,
  • ‘Allowed User Crawler Agents’ 설정을 비워두는 것입니다(기본값 상태).

이 주제는 다른 구글 검색 관련 문제(이처럼 치명적인 문제는 아니더라도)를 위해 열려 있을 것입니다.