# ChatGPT 같은 LLM 학습에 커뮤니티 콘텐츠가 사용되지 않도록 막는 방법?

**URL:** https://meta.discourse.org/t/how-to-prevent-community-content-from-being-used-to-train-llms-like-chatgpt/264907
**Category:** Community Building
**Created:** [5월 13, 2023, 6:58오후 UTC](https://meta.discourse.org/t/how-to-prevent-community-content-from-being-used-to-train-llms-like-chatgpt/264907 "2023-05-13T18:58:35Z")
**Posts on this page:** 1
**Showing post:** 65

<div class="post-metadata">

### Author: ![simon](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/simon/32/339122_2.png) [@simon](https://meta.discourse.org/u/simon)
#### Post date: [7월 7, 2023, 5:31오후 UTC](https://meta.discourse.org/t/how-to-prevent-community-content-from-being-used-to-train-llms-like-chatgpt/264907/65 "2023-07-07T17:31:15Z")

</div>

> [@StephaneFe](#):
>
> 왜가 아니라 어떻게에 초점을 맞출 수 있을까요?

OpenAI는 모델 학습에 몇 가지 데이터셋을 활용했습니다. Discourse 콘텐츠가 포함될 가능성이 가장 높은 데이터셋은 [Common Crawl 데이터셋](https://commoncrawl.org/)의 필터링된 버전인 것으로 보입니다. 자세한 내용은 이 문서의 2.2절을 참고하세요: [https://arxiv.org/pdf/2005.14165.pdf](https://arxiv.org/pdf/2005.14165.pdf). Common Crawl은 사이트를 크롤링할 때 CCBot/2.0 사용자 에이전트 문자열을 사용합니다.

Discourse 사이트를 공개적으로 접근 가능하게 유지하되, _향후_ Common Crawl 데이터셋에 그 콘텐츠가 추가되는 것을 방지하려면, Discourse 사이트의 `blocked crawler user agents`(차단할 크롤러 사용자 에이전트) 설정에 `CCBot`을 추가할 수 있습니다. Common Crawl 사용자 에이전트를 차단하는 것에는 단점이 있을 수 있다는 점을 유의하세요 ([How to Block OpenAI ChatGPT From Using Your Website Content](https://www.searchenginejournal.com/how-to-block-chatgpt-from-using-your-website-content/478384/)):

> “Common Crawl을 포함한 많은 데이터셋은 URL을 필터링하고 분류하여 광고를 표적할 웹사이트 목록을 만드는 회사들에 의해 사용될 수 있습니다.”

Discourse에서 `blocked crawler user agents` 설정을 사용하는 방법은 여기에서 확인할 수 있습니다: [discourse/lib/crawler\_detection.rb at main · discourse/discourse · GitHub](https://github.com/discourse/discourse/blob/main/lib/crawler_detection.rb#L66).

Common Crawl은 `robots.txt` 파일의 규칙을 따르므로, 해당 파일에 다음 규칙을 추가하여 차단할 수도 있습니다:

```plaintext
User-agent: CCBot
Disallow: /

```

ChatGPT 플러그인은 사용자를 대신하여 요청을 보낼 때 `ChatGPT-User` 사용자 에이전트를 사용합니다. 이 사용자 에이전트는 학습 데이터셋을 생성하기 위해 웹을 크롤링하는 데 _사용되지_ 않습니다: [https://platform.openai.com/docs/plugins/bot](https://platform.openai.com/docs/plugins/bot). 이 사용자 에이전트도 `blocked crawler user agents` 설정에 추가하거나(또는 `robots.txt` 파일에 `Disallow` 규칙을 추가하여) 차단할 수 있습니다.

다른 사람들이 지적했듯이, 사이트가 LLM 학습에 사용되지 않도록 하는 가장 확실한 방법은 `login required`(로그인 필수) 사이트 설정을 활성화하여 사이트에 대한 익명 접근을 방지하는 것입니다. 사이트를 더 강화하기 위해, 사이트의 사용자가 봇이 아니라 인간일 가능성을 높이기 위한 조치를 취할 수 있습니다. 이를 위한 하나의 가능한 접근 방식은 [Gitcoin Passport](https://passport.gitcoin.co/)와 같은 서비스를 사이트의 인증 시스템과 통합하는 것입니다. Discourse용 오픈소스 [Gitcoin Passport 플러그인](https://meta.discourse.org/t/10k-bounty-gitcoin-passport-plug-in-for-discourse/269861)이 곧 개발될 것이라고 생각합니다.

사이트의 사용자가 인간일 가능성을 높이는 덜 기술적인 다른 방법들도 있을 수 있습니다. 예를 들어, 사이트를 `invite only`(초대 전용)으로 설정하고, 인간이라고 믿을 만한 이유만 있는 사용자에게만 초대장을 보내도록 조치를 취할 수 있습니다.

이 모든 것 뒤에 숨겨진 철학은 매우 흥미롭다고 생각하지만, 이 주제에서는 이에 대해 깊이 다루지 않겠습니다.

---

_[View the full topic](https://meta.discourse.org/t/how-to-prevent-community-content-from-being-used-to-train-llms-like-chatgpt/264907)._
