# MegaIndex 봇이 하루 동안 약 4,000회 페이지뷰 기록

**URL:** https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824
**Category:** Community Building
**Created:** [2월 10, 2022, 10:35오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824 "2022-02-10T22:35:19Z")
**Posts on this page:** 20
**Page:** 1

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [2월 10, 2022, 10:35오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/1 "2022-02-10T22:35:19Z")

</div>

참고

자신의 사이트 페이지뷰를 꾸준히 모니터링하는 분들을 위해 공유드립니다. 2022년 7월 2일에 MegaIndex.ru라는 봇에서 약 4,000회의 페이지뷰가 발생했습니다. 확실히 눈에 띄는 수치였습니다.

 ![image](https://global.discourse-cdn.com/meta/original/3X/1/a/1a91f5c2b1c3020d9cfac5abeaa98479f9b2496a.png)

---

<div class="post-metadata">

### Author: ![IAmGav](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/iamgav/32/235598_2.png) [@IAmGav](https://meta.discourse.org/u/IAmGav)
#### Post date: [2월 10, 2022, 10:59오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/2 "2022-02-10T22:59:49Z")

</div>

차단하거나 속도를 늦출 수 있습니다

 ![image](https://global.discourse-cdn.com/meta/original/3X/e/8/e8e25d7bfa350fe2d2c4850ac9358a7e9dd181e0.png)

---

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [2월 11, 2022, 1:05오전 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/3 "2022-02-11T01:05:17Z")

</div>

> [@IAmGav](#):
>
> 차단하거나 속도를 늦출 수 있습니다

정보 주셔서 감사합니다.

저는 질문을 드린 것이 아니라, 다른 분들에게 주의를 기울이도록 알리고 싶었습니다. 시간 분산 없이 한꺼번에 요청을 보내는 새로운 크롤러인 것 같습니다. 아마도 이 사이트가 처음 발견되어 모든 페이지를 한꺼번에 크롤링한 것일 수 있지만, 이런 식으로 하루에 대량의 요청이 계속된다면 더 자세히 조사해 보겠습니다.

---

<div class="post-metadata">

### Author: ![codinghorror](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/codinghorror/32/110067_2.png) [@codinghorror](https://meta.discourse.org/u/codinghorror)
#### Post date: [2월 11, 2022, 1:43오전 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/4 "2022-02-11T01:43:09Z")

</div>

알려줘서 고마워. 이렇게 엉망으로 작성된 봇/웹 인덱서/웹 스파이더는 정말 서버를 무너뜨릴 수 있어!

---

<div class="post-metadata">

### Author: ![Mr.X\_Mr.X](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/mr.x_mr.x/32/126610_2.png) [@Mr.X\_Mr.X](https://meta.discourse.org/u/Mr.X_Mr.X)
#### Post date: [2월 11, 2022, 5:06오전 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/5 "2022-02-11T05:06:55Z")

</div>

저도 그걸 알아챘습니다. 제 인스턴스에서 가장 많은 페이지뷰를 기록하는 건 바로 그 봇이고, 그 뒤를 이어 Seekport(하루 35K 페이지뷰)와 mj12bot이 있습니다. 이 봇들 때문에 가끔 DOS(서비스 거부) 현상이 발생하고 있습니다. Cloudflare의 안티봇 기능을 사용하면 모니터링을 거의 하지 않아도 대부분의 봇을 제한할 수 있었습니다.

---

<div class="post-metadata">

### Author: ![Jonathan5](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jonathan5/32/197134_2.png) [@Jonathan5](https://meta.discourse.org/u/Jonathan5)
#### Post date: [2월 11, 2022, 8:21오전 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/6 "2022-02-11T08:21:07Z")

</div>

> [@IAmGav](#):
>
> 속도를 늦추자

_모든_ 크롤러의 속도를 늦출 수 있을까요? – 즉, robots.txt에 `crawl-delay`를 추가하는 것과 같은 효과를 내는 것이 가능한가요?

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [2월 12, 2022, 7:36오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/7 "2022-02-12T19:36:06Z")

</div>

아니요. robots.txt를 따르는 크롤러는 극소수이고, 지연 설정을 준수하는 경우는 그보다도 더 적습니다.

---

<div class="post-metadata">

### Author: ![Jonathan5](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jonathan5/32/197134_2.png) [@Jonathan5](https://meta.discourse.org/u/Jonathan5)
#### Post date: [2월 12, 2022, 7:50오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/8 "2022-02-12T19:50:43Z")

</div>

> [@Jagster](#):
>
> 아니요.

아쉬운 일입니다. 이는 Discourse에 좋은 기능이 될 수 있었을 텐데요.

참고로, 기존 시스템(모든 크롤러를 _차단_하되, 유한한 목록에 대해서만 크롤 _지연_을 추가할 수 있도록 하는 방식)은 robots.txt의 `disallow`와 `crawl-delay`를 통해 작동하나요?

> [@Jagster](#):
>
> robots.txt를 따르는 곳은 매우 적으며, 지연을 준수하는 곳은 더 적습니다.

그것은 전혀 별개의 문제입니다. 다만 개인적으로는 다른 사이트에서 `crawl-delay`가 효과적이었다는 경험을 한 적이 있습니다.

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [2월 12, 2022, 7:56오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/9 "2022-02-12T19:56:21Z")

</div>

> [@Jonathan5](#):
>
> 개인적으로 다른 사이트에서 `crawl-delay`가 효과적이라는 것을 발견했습니다.

화이트햇 봇에 대해서만 해당되며, 그런 봇은 그리 많지 않습니다. 나머지는 좋은 봇과 나쁜 봇의 비율이 대략 1:100 정도이며, robots.txt에 무엇을 넣었든 상관없이 무시합니다. 가장 악질적인 봇들은 시스템 관리자나 웹마스터가 원하지 않는 곳을 찾기 위해 robots.txt를 확인하고, 즉시 그 지시를 따릅니다.

(참고로, \< grin \>은 HTML 태그로 작동하는 것 같습니다 🤔 제 생각에는 Discourse가 이를 위해 단순히 \< \>를 사용해서는 안 됩니다)

SEO 봇들은 정말로 행실이 나쁜 편입니다. 하지만 그 중 다수는 스크립트 키디들이 만든 가짜 사용자 에이전트를 보고 있습니다.

많은 봇을 완전히 차단할 수는 있지만, 이는 앱 레벨이 아니라 서버 레벨에서 수행해야 합니다.

---

<div class="post-metadata">

### Author: ![Jonathan5](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jonathan5/32/197134_2.png) [@Jonathan5](https://meta.discourse.org/u/Jonathan5)
#### Post date: [2월 12, 2022, 8:00오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/10 "2022-02-12T20:00:46Z")

</div>

그건 이제 중요하지 않습니다. 제 경험은 달랐고, Discourse에서 개별 크롤러를 지정하지 않아도 crawl-delay를 설정할 수 있도록 해 주셨으면 합니다.

---

<div class="post-metadata">

### Author: ![Canapin](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/canapin/32/119591_2.png) [@Canapin](https://meta.discourse.org/u/Canapin)
#### Post date: [3월 2, 2022, 2:05오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/11 "2022-03-02T14:05:02Z")

</div>

저도 크롤러가 갑자기 급증하는 현상을 겪고 있습니다.

 ![image](https://global.discourse-cdn.com/meta/original/3X/7/5/7503c1ee8af7aee69ebf9acd214f9465047d3f45.png)

페이지 뷰를 악용하고 있는 크롤러가 어떤 것인지 어떻게 식별할 수 있을까요?

---

<div class="post-metadata">

### Author: ![codinghorror](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/codinghorror/32/110067_2.png) [@codinghorror](https://meta.discourse.org/u/codinghorror)
#### Post date: [3월 2, 2022, 10:04오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/12 "2022-03-02T22:04:51Z")

</div>

이것은 보고서 페이지의 내장 보고서 중 하나입니다.

---

<div class="post-metadata">

### Author: ![Canapin](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/canapin/32/119591_2.png) [@Canapin](https://meta.discourse.org/u/Canapin)
#### Post date: [3월 2, 2022, 10:49오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/13 "2022-03-02T22:49:03Z")

</div>

고맙습니다. 찾았어요.

| ​ 사용자 에이전트 | ​ 페이지뷰 |
| --- | --- |
| Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/98.0.4758.102 Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) | 5514 |
| Mozilla/5.0 (compatible; MJ12bot/v1.4.8; [http://mj12bot.com/](http://mj12bot.com/)) | 5212 |
| Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) | 1427 |
| Mozilla/5.0 (Linux; Android 7.0;) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; PetalBot;+https://webmaster.petalsearch.com/site/petalbot) | 872 |

nginx 로그에서 IP를 확인해 본 결과, 이 피크는 MJ12bot과 Nexus 5X Build(정통 구글 봇)에서 발생한 것입니다.

이들이 왜 이런 페이지뷰를 생성하는지 아이디어가 있을까요? MJ12bot도 정통인 것 같습니다(적어도 제 구글 검색 결과로는 그렇게 나와요…). 참고로 포럼은 온라인 상태이지만, 콘텐츠를 보려면 로그인이 필요합니다. 며칠 후에는 대중에 공개될 예정입니다.

때때로 포럼에서 크롤러 피크를 보지만, 보통 1~2일 정도 지속된 후 오랫동안 사라집니다.

예시:

 ![image](https://global.discourse-cdn.com/meta/original/3X/a/3/a325eac9bb476b50f8146528d57dd5c6d1355e58.png)

 ![image](https://global.discourse-cdn.com/meta/original/3X/8/0/80a1a03ca486a10cd08b0a771473aea0acc11ad7.png)

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [3월 2, 2022, 11:25오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/14 "2022-03-02T23:25:04Z")

</div>

> [@Canapin](#):
>
> MJ12bot도 꽤 legit해 보입니다.

IP를 확인해 보세요. 이 봇도 가장 많이 사용되는 가짜 봇 중 하나입니다. 게다가 소위 SEO 봇들과 마찬가지로 당신에게 전혀 쓸모없는 봇이기도 합니다.

---

<div class="post-metadata">

### Author: ![Canapin](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/canapin/32/119591_2.png) [@Canapin](https://meta.discourse.org/u/Canapin)
#### Post date: [3월 4, 2022, 1:08오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/15 "2022-03-04T13:08:16Z")

</div>

크롤러에 대해 잘 모르겠습니다. 공식 Google 크롤러가 SEO에 도움이 되지 않나요? 주제에서 벗어난 것 같아 죄송합니다.

---

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [3월 5, 2022, 8:19오전 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/16 "2022-03-05T08:19:59Z")

</div>

> [@Canapin](#):
>
> 오프토픽이 되는 것 같아 죄송합니다.

주제를 시작한 사람이 저이기 때문에, 당신의 질문을 오프토픽으로 보지 않습니다. 제 게시글은 참고용(FYI)이었을 뿐이며, 당신은 단순히 정보의 세부 내용을 더 잘 이해하려고 하는 것뿐입니다.

> [@Canapin](#):
>
> 공식적인 구글 크롤러는 SEO에 유용하지 않나요?

저는 [SEO](https://en.wikipedia.org/wiki/Search_engine_optimization) 전문가가 아니지만, 사람들이 검색 엔진을 통해 당신의 사이트를 찾길 원한다면 검색 엔진 크롤러가 웹사이트를 크롤링하여 인덱스를 구축하고 업데이트할 수 있도록 허용해야 합니다.

문제는 일부 크롤러가 사용자를 사이트로 유도하지 않는다는 점입니다. 만약 그런 경우라면 과도한 페이지 히트를 원치 않는다면 [robots.txt](https://en.wikipedia.org/wiki/Robots_exclusion_standard)를 사용하여 해당 크롤러가 사이트를 크롤링하지 않도록 요청할 수 있습니다. 하지만 불량 검색 엔진은 robots.txt를 무시하므로, 그 경우엔 방화벽 규칙 등을 사용해야 합니다. 그러면 오래된 문제로 돌아가게 되는데, 로그인 없이 접근 가능한 공개 사이트에서 누군가가 접근을 시도할 경우 매번 신원을 바꾸기 때문에 차단하기가 어렵다는 것입니다. 로그인을 필수로 설정하면 가입자 수가 줄어드는 경우가 많습니다.

원래 게시글에 대해 말씀드리자면, 보고된 이상치 이후로 MeagIndex나 다른 크롤러로 인해 하루 만에 페이지뷰가 대량으로 증가한 경우는 아직 확인되지 않았습니다.

---

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [8월 13, 2022, 12:21오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/17 "2022-08-13T12:21:49Z")

</div>

업데이트: 2022/08/13

봇이 2022/08/04에 다시 우리 사이트를 방문했습니다 ([크롤러 사이트](https://www.megaindex.ru/))

보고서: 통합 페이지뷰

 ![image](https://global.discourse-cdn.com/meta/original/4X/3/3/c/33c22e2fc60368bbf2ec5e1c4e1ed909fa08fec6.png)

보고서: 웹 크롤러 사용자 에이전트

 ![image](https://global.discourse-cdn.com/meta/original/4X/9/f/5/9f56b11f9857b1fe8f5a4c57c8830eeec8e56dad.png)

보고서: 주요 트래픽 출처

 ![image](https://global.discourse-cdn.com/meta/original/4X/2/2/9/2296ded0a06cffae1f9bc6dc2dfbdb221aaa422a.png)

[MegaIndex.ru/2.0](http://MegaIndex.ru/2.0) 봇이 사이트를 인덱싱하도록 허용하는 것이 사이트 트래픽을 생성하는 것으로 보이지 않습니다.  
참고: AFAIK(제 생각에는) yandex.ru와 Megaindex.ru는 다릅니다.

* * *

크롤러를 차단하려면 [robots.txt](https://developers.google.com/search/docs/advanced/robots/intro)를 사용할 수 있으며, 이는 다음과 같이 언급되었습니다.

> [@How to disable indexing by crawlers](https://meta.discourse.org/t/how-to-disable-indexing-by-crawlers/39267/3?u=ericgt):
>
> There is a boolean site setting for this, search for “index” or “robots”.

https://\<Discourse 사이트\>/admin/customize/robots

하지만 모든 크롤러가 robots.txt를 준수하지는 않습니다. 🙁

* * *

[IAmGav](https://meta.discourse.org/u/IAmGav) 님이 [위에서](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/2?u=ericgt) 언급했듯이 다른 크롤러 설정도 있습니다.

 ![image](https://global.discourse-cdn.com/meta/original/4X/0/8/5/0854a520c416f6cf0b42b528dfd230c1e15e98bd.png)

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [8월 14, 2022, 5:10오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/18 "2022-08-14T17:10:33Z")

</div>

robots.txt는 봇을 차단하기 위한 것이 아닙니다. 이는 잘 행동하는 봇을 위한 가이드라인일 뿐입니다. 봇의 차단은 서버 레벨에서 이루어져야 합니다. 이것이 제 디스커스가 리버스 프록시 뒤에 있는 가장 큰 이유 중 하나입니다.

---

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [1월 11, 2023, 8:51오전 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/19 "2023-01-11T08:51:38Z")

</div>

2022년 12월 22일, 저에게는 낯선 새로운 봇인 [https://bot.seekport.com](https://bot.seekport.com) 이 비정상적으로 많은 페이지뷰를 기록했습니다

 ![image](https://global.discourse-cdn.com/meta/original/4X/e/4/7/e47583744b3db1a477c11a31f0b890ef3a03b38b.png)

 ![image](https://global.discourse-cdn.com/meta/original/4X/2/e/6/2e660066cee699deaca0329ec1d731eab9107efe.png)

---

<div class="post-metadata">

### Author: ![kinetiksoft](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kinetiksoft/32/229578_2.png) [@kinetiksoft](https://meta.discourse.org/u/kinetiksoft)
#### Post date: [1월 11, 2023, 12:16오후 UTC](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824/20 "2023-01-11T12:16:22Z")

</div>

반정규 크롤러 활동의 급증은 흔한 일입니다. 저희는 이를 다음과 같이 구분합니다.

- 정당한 검색 엔진에 의한 정규 크롤러
- 신규/커스텀 검색 엔진에 의한 비정규 크롤러
- 경쟁사나 기타 "연구자

[다음 페이지](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824.md?page=2)
