# Видел ли кто-нибудь, как веб-краулер OpenAI GPTBot посещал ваш сайт?

**URL:** https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370
**Category:** Community Building
**Created:** [08.Август.2023 16:07:50 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370 "2023-08-08T16:07:50Z")
**Posts on this page:** 12
**Page:** 1

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [08.Август.2023 16:07:50 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/1 "2023-08-08T16:07:50Z")

</div>

OpenAI создала [веб-краулер](https://en.wikipedia.org/wiki/Web_crawler) под названием [GPTBot](https://platform.openai.com/docs/gptbot).

Администратор Discourse проверил отчёт по веб-краулерам в разделе /admin/reports/web\_crawlers, но пока не обнаружил его.

Интересно, видели ли его кто-то ещё в реальной работе.

---

<div class="post-metadata">

### Author: ![marianord](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/marianord/32/90502_2.png) [@marianord](https://meta.discourse.org/u/marianord)
#### Post date: [08.Август.2023 16:19:26 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/2 "2023-08-08T16:19:26Z")

</div>

У меня есть (и я только что его заблокировал).

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [09.Август.2023 05:54:20 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/3 "2023-08-09T05:54:20Z")

</div>

Примечание… Я заметил распространённое заблуждение:

> Просто заблокируйте это

> Это односторонние отношения

Мне кажется, здесь упущен один важный момент. То, что OpenAI индексирует [meta.discourse.org](http://meta.discourse.org), принесло CDCK огромную пользу. Когда вы задаёте GPT 4 вопросы о Discourse, у него хотя бы есть шанс дать правильный ответ.

Это двусторонние отношения:

Вы предоставляете OpenAI доступ к данным.  
OpenAI тратит огромные ресурсы на обучение LLM на ваших данных, что может принести вам пользу.

Также по теме: [How to prevent community content from being used to train LLMs like ChatGPT?](https://meta.discourse.org/t/how-to-prevent-community-content-from-being-used-to-train-llms-like-chatgpt/264907)

Мы наблюдаем некоторую активность GPTBot в наших сетях, но трафик примерно в 20–40 раз меньше, чем от Googlebot.

Если кто-то недоволен этим, можно напрямую заблокировать бота через интерфейс Discourse, но этот бот ведёт себя гораздо лучше, чем некоторые другие, с которыми нам приходилось сталкиваться.

---

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [09.Август.2023 07:32:15 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/4 "2023-08-09T07:32:15Z")

</div>

> [@sam](#):
>
> мы видели плохие.

Для тех, кто хочет идентифицировать некоторые из плохих, по мере того как некоторые из нас их находят, мы отмечаем их в этом посте.

> [@MegaIndex bot did about 4,000 pageviews on one day](https://meta.discourse.org/t/megaindex-bot-did-about-4-000-pageviews-on-one-day/217824):
>
> FYI For those that keep an eye on their sites pageviews, on 02/07/2022 our site saw about 4,000 pageview from the bot [MegaIndex.ru](http://MegaIndex.ru). It definitely stood out. [image]

---

<div class="post-metadata">

### Author: ![agemo](https://avatars.discourse-cdn.com/v4/letter/a/ac91a4/32.png) [@agemo](https://meta.discourse.org/u/agemo)
#### Post date: [19.Август.2023 19:43:30 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/5 "2023-08-19T19:43:30Z")

</div>

Да, это первый раз, когда я использую отчёт о краулинге, и вот оно. Оно было здесь.

Мое мнение: оно появилось в августе, и это самый крупный краулер среди всех.

Вот пример за 24 часа и примерное соотношение:

**#1 ChatGPT — 18 тыс. просмотров страниц**  
#2 mj12bot — 1,8 тыс. просмотров страниц  
…  
#4 Google — 1,7 тыс. просмотров страниц

Это развёртывание Discourse было специально настроено на long\_required, чтобы полностью заблокировать доступ краулера к контенту, так что он, должно быть, попадает только на страницу login\_required, чтобы набрать такие показатели, верно?

Может ли он использовать учётную запись пользователя?

Я предполагаю, что технически это возможно, но маловероятно. Если бы это было так, я бы ожидал, что у такого пользователя внезапно будет очень высокий счётчик прочитанных постов.

Сейчас показатели близки к 100 тыс. просмотров страниц, что значительно превышает следующий по величине показатель — примерно менее половины от этого.

Краулер chapgpt — это настоящий монстр.

---

<div class="post-metadata">

### Author: ![JimPas](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jimpas/32/148179_2.png) [@JimPas](https://meta.discourse.org/u/JimPas)
#### Post date: [21.Август.2023 23:28:32 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/6 "2023-08-21T23:28:32Z")

</div>

У вас тоже #3 неопознанный? У меня тоже такой. В списке он отображается только как «—». У меня он тоже на третьем месте, но на моем частном форуме, требующем входа, просмотров от ботов значительно меньше. 😅

---

<div class="post-metadata">

### Author: ![agemo](https://avatars.discourse-cdn.com/v4/letter/a/ac91a4/32.png) [@agemo](https://meta.discourse.org/u/agemo)
#### Post date: [22.Август.2023 13:30:49 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/7 "2023-08-22T13:30:49Z")

</div>

Нет, ну да, в общем, я не смог прочитать его, так как текст был обрезан, но, кажется, это краулер **AppleWebKit**. Мне нужно экспортировать данные, чтобы прочитать полную запись.

С тех пор я заблокировал практически всех краулеров, хотя ситуация у меня такая же, как у вас: это закрытый форум с требованием входа в систему. Количество краулеров сегодня упало до 20, тогда как несколько дней назад было почти 14 000!

---

<div class="post-metadata">

### Author: ![JimPas](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jimpas/32/148179_2.png) [@JimPas](https://meta.discourse.org/u/JimPas)
#### Post date: [22.Август.2023 19:50:26 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/8 "2023-08-22T19:50:26Z")

</div>

На вашей панели управления: `admin/reports/web_crawlers` покажет веб-краулеров за последние 30 дней. Наведение курсора на каждого краулера временно отображает полное описание для каждого без необходимости экспортировать список. Измените период просмотра на последние сутки с помощью календаря в правом верхнем углу и нажмите «Обновить».

За последние 24 часа у меня было 3 краулера (первый — худший):  
PetalBot — [petalsearch.com/bot/petalbot](http://petalsearch.com/bot/petalbot) — 4 просмотра  
GPTBot — [openai.com/gptbot](http://openai.com/gptbot) — 3 просмотра  
— — (нет описания) — 1 просмотр

За последние 30 дней PetalBot сканирует чаще всего, за ним следует Yandex.

---

<div class="post-metadata">

### Author: ![agemo](https://avatars.discourse-cdn.com/v4/letter/a/ac91a4/32.png) [@agemo](https://meta.discourse.org/u/agemo)
#### Post date: [22.Август.2023 20:49:18 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/9 "2023-08-22T20:49:18Z")

</div>

Я вижу это сейчас, это примерно на 15 строк ниже. Я добавил «—» в список блокировок как ползучего бота; это очень низко по сравнению с самыми вопиющими, но посмотрим, что произойдёт 😉

У меня почти 50 записей с января, но удивительно, что ChatGPT за чуть менее двух недель превзошёл более чем вдвое второго по популярности бота за весь период с января по сегодня. При такой скорости ChatGPT мог бы обеспечить почти 3 миллиона просмотров страниц за целый год, если бы темп сохранился — около 7–8 тысяч в день.

Только что добавил Grammarly в список блокировок!

---

<div class="post-metadata">

### Author: ![JimPas](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jimpas/32/148179_2.png) [@JimPas](https://meta.discourse.org/u/JimPas)
#### Post date: [27.Август.2023 19:03:57 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/10 "2023-08-27T19:03:57Z")

</div>

Если кому-то интересно, вот диапазон IP-адресов, которые использует GPTBot (OpenAI), опубликованный на их сайте. В списке указано 9 IP-адресов.

[https://openai.com/gptbot-ranges.txt](https://openai.com/gptbot-ranges.txt)

---

<div class="post-metadata">

### Author: ![eisammy](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/eisammy/32/528804_2.png) [@eisammy](https://meta.discourse.org/u/eisammy)
#### Post date: [23.Июнь.2025 15:52:20 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/12 "2025-06-23T15:52:20Z")

</div>

У меня были те же ощущения в прошлом месяце. Я разрешил GPTBot, DeepSeek и Perplexity с задержкой и заметил, что эти источники медленно растут и привлекают новых участников.

Совет: Ограничения скорости Cloudflare могут помочь избежать высокой нагрузки запросов и перерасхода трафика.

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [23.Июнь.2025 19:59:24 UTC](https://meta.discourse.org/t/has-anyone-seen-the-openai-web-crawler-gptbot-visit-their-site/274370/13 "2025-06-23T19:59:24Z")

</div>

OpenAI не следует задержкам, насколько мне известно. Именно поэтому я заблокировал их обучающего бота: он был слишком прилежным (хотя были и другие причины, как и в случае с блокировкой всех SEO/маркетинговых ботов: я не оплачиваю чужой бизнес)
