AI 콘텐츠가 금지된 포럼들… 어떻게 되나요?

대부분의, 아니 거의 모든 AI 생성 텍스트는 그냥 읽어보면 쉽게 감지할 수 있습니다. 구글의 SynthID는 AI 이미지 감지를 위한 멋진 기술이며, 제미나이(Gemini)로만 작성된 텍스트도 감지할 수 있다고 주장합니다. 오픈AI도 이 표준을 지원하고 있습니다. 제가 직접 텍스트를 감지하는 능력은 아마도 익힌 기술일 수 있지만, 현재 AI 이미지나 텍스트를 감지하지 못하는 위기 상황에 대응하기 위해 이루어지고 있는 노력에는 감사의 뜻을 전합니다.

제 생각에는 여전히 음소거/정지가 올바른 방법입니다. 특히 계정이 새로운 경우라면요. 만약 누군가 제 사이트에 가입한 지 얼마 안 된 새로운 계정이 갑자기 AI 생성된 주제를 게시한다면, 그 계정을 정지하고 차단해야 할 이유가 없다고 봅니다.

스크래핑 딜레마에 관해서는: 제 사이트는 현재 작은 회사 내부의 소통 및 문서화를 위해 사용되고 있으며, 궁극적으로 블로그용 백엔드로 활용할 계획입니다. 제 도메인의 robotstxt 파일을 무시하려는 크롤러를 막기 위해 honeypot을 설정하는 것은 어렵지 않았습니다.

이 하나의 전술만으로 두 주간의 기간 동안 약 600만 건의 요청(도메인당 초당 약 6회)을 유발했습니다:

AI 크롤러가 해당 사이트를 방문할 때마다, 약 7,000개의 가짜 단어 데이터셋, 어색한 HTML, 무작위 단어, 그리고 8B Llama로 생성된 가짜 뉴스가 포함된 무한한 스팸 미로로 유도됩니다. 이는 iocaine 프로젝트를 자체 호스팅하여 구현한 것입니다.

물론 이것은 핵무기 같은 “가라” 전술이며 모든 사람에게 적합하지는 않지만, LLM이 제 코드나 텍스트 콘텐츠를 가져가는 것을 막는다는 제 목표에 있어서는 매우 효과적이었습니다. Anthropic이 LLM 오염에 대해 수행한 사례 연구를 읽은 기억이 나지만 더 이상 그 기사를 찾을 수 없어 여기에 첨부하지는 않겠지만, 아마도 그들이 봇이 최근 제 도메인에 무려 500만 건의 요청을 보냈다는 것을 깨달았을 때 제 도메인을 차단해야 할 필요가 있을 것입니다.

9개의 좋아요