제가 관리를 돕고 있는 포럼에서 최근 몇 달간 봇 계정 등록이 폭주하고 있습니다. 대부분 AI 봇일 가능성이 매우 높습니다. 이들은 가입 양식(대부분 체크박스 선택)을 채우고, hCaptcha를 풀며, 인증 이메일까지 처리할 수 있고 심지어 사용자 프로필 정보까지 작성합니다. 우리는 몇 가지 기준(예: 게시물 읽은 시간이 0, 이름/이메일 주소를 둘러싼 미묘한 특징, 명백하게 가짜인 사용자 정보 등)을 바탕으로 가짜 계정을 추측할 수는 있지만, 쉬운 일은 아닙니다(예: 대부분 실제 Gmail 주소입니다). 그러나 이 방식은 지속 가능하지 않습니다. 하루에 가짜 계정이 10개씩 들어오기도 하고, 제한된 처리 능력으로 인해 실수를 할 가능성이 매우 높기 때문입니다.
캡차(Captcha)를 추가하면 가짜 가입이 줄기는 했지만, 승인해야 할 사용자 대기열이 여전히 방대하여 신규 사용자가 가입할 때까지 1~2주가 걸리는 경우가 많습니다. 신규 사용자를 위한 텍스트 기반 설문지를 도입하는 것도 고려해 보았지만, 현실적으로 우리는 수많은 질문을 읽고 그것이 AI가 생성한 것인지 아닌지를 추측할 만한 역량이 부족합니다(그리고 이 문제는 점점 더 어려워질 것입니다).
한 가지 옵션은 이 사용자들이 가입하도록 허용한 뒤, 명백히 스팸인 게시물을 올리면 그때 플래그를 치는 것입니다. 하지만 우리는 이 문을 열기 망설여집니다. 이는 단순히 프로세스의 위치를 한 곳(가입 단계)에서 다른 곳(플래그된 게시물)으로 옮기는 것에 불과하기 때문입니다. 그리고 이 문제는 되돌릴 수 없습니다. 잠재적인 AI 사용자 100명이 수개월에 걸쳐 서서히 게시물을 올리기 시작하면 포럼이 완전히 망가질 수 있습니다.
이 문제를 해결하는 데 도움이 되는 전략을 알고 계신 분이 있을까요? 우리는 상대적으로 규모가 작지만, 우리만이 이런 문제를 겪고 있다고는 생각하지 않습니다…
Discourse에서 제가 발견한 문제 중 하나는 CloudFlare Turnstile을 네이티브로 사용할 수 있는 기능이 무시되고 있다는 점입니다. 솔직히 제가 찾은 캡차 솔루션 중 가장 좋은 것 중 하나라고 생각하는데, 저는 이를 사용하는 유료 포럼 스크립트를 운영 중인데 새 사용자 가입이 많음에도 불구하고 스팸이 거의 들어오지 않습니다. 대부분의 불필요한 계정들은 Turnstile에 의해 차단됩니다.
왜 이렇게 오랜 시간이 지나도록 Discourse가 시장에 나와 있는 이러한 옵션들을 코어에 아직까지 활성화하지 않는지 정말 이해가 되지 않습니다.
우리가 대량의 트래픽에 시달렸을 때, AI 계정이 실제 신규 사용자 계수보다 10배나 많아서 게시판 관리 작업의 상당 부분이 매우 비현실적이 되었습니다. 관리자들과 모더레이터들은 현재로서는 그저 잠복해 있을 뿐이지만, 사용자의 상당 부분 또는 다수가 AI/스팸봇인 포럼이 미래에 실질적인 피해를 초래할 가능성이 있다는 점에서 메타 수준의 우려를 가지고 있었습니다. 예를 들어, 1년 뒤 수백 명의 가짜 사용자가 모두 그럴듯하지만 쓸모없는 게시글을 올리게 된다면, 우리가 이를 따라잡는 능력을 쉽게 압도하여 게시판 전체가 거의 쓸모없어질 수 있다고 상상했습니다.
새로운 가입자 관련 상황은 조금 나아졌지만, 가능하면 이 같은 잠복 사용자 문제를 피하고 싶어 하는 것이 모두의 바람입니다. 우리 게시판은 이미 AI 학습을 위해 공격적으로 스크래핑되어 왔기 때문입니다(니치 분야이므로, 적어도 구형 GPT 버전에서는 올바른 질문을 하면 포럼 게시글의 거의 원문인 인용구를 GPT가 반복할 수 있었습니다). 그래서 모두가 이 부분에 대해 약간 불쾌해하고 있습니다.