AI 스팸 봇은 스팸이 아니라고 하지만 스캔 로그에는 스팸으로 표시됨

포럼에서 Discourse AI 스팸 처리 기능을 활성화했습니다. Claude Sonnet 4를 API 키와 함께 설정하고 스팸 감지자(Spam detector) 페르소나를 선택했습니다.

분명히 스팸인 테스트 게시글을 작성해 보았습니다. 은근한 부분이 전혀 없었습니다.

하지만 게시글은 차단되지 않고 즉시 게시되었습니다.

테스트 기능을 사용하여 게시글 URL을 스팸 봇에 전달했을 때 결과는 '스팸이 아닙니다(Not spam)'라고 나왔지만, 스캔 로그(Scan log)에는 '스팸 - 이는 명백한 홍보성 광고입니다…(SPAM - This is a clear promotional advertisement…)'라고 표시되어 있습니다.

제 기대치로는 결과가 스팸(Scan log의 스팸 판정과 일치하게)으로 나와야 하고, 그 결과로 게시글이 관리자 및 모더레이터의 검토 대기열에 올라가야 한다고 생각합니다.

혹시 제가 놓치고 있는 부분이 있을까요? 전문가가 아니므로 어떤 조언이든 환영합니다!

감사합니다!

게시물을 작성한 사용자의 신뢰 수준은 무엇인가요? AI 스팸은 TL2+ 사용자의 게시물을 건너뜁니다.

테스트에 관해서는, 테스트 코드에 버그가 있으며 "spam"이라고 나와야 합니다. 수정 작업을 진행하겠습니다.

4개의 좋아요

답변해 주셔서 감사합니다!

제가 게시물을 올릴 때 사용했던 사용자는 **신규 사용자(Trust Level new user)**였습니다.

해당 게시물이 승인된 이유에 대해 어떤 생각이 있으신가요?

도와주셔서 감사합니다!

이 변경으로 테스트와 게시물의 플래그 지정 문제가 모두 해결됩니다:

스팸 감지기 Persona 시스템 프롬프트가 Claude 모델에 혼란을 주고 있었습니다. 이번 변경으로 예상 응답 형식에 대한 지시 사항이 더 명확해졌습니다.

4개의 좋아요

아, 훌륭합니다! 테스트 기능이 예상대로 작동하고 있네요.

AI 스팸 기능이 여전히 스팸성 게시글이 즉시 게시되는 것을 차단하지 못하는 이유가 무엇인지 궁금합니다. 해당 게시글을 AI 스팸 테스트에 보내니 스팸으로 표시되긴 했는데, 실제로는 게시가 되어버렸거든요.

혹시 제가 놓치고 있는 연결 부분이 있을까요? 이 문제로 도움을 주셔서 정말 감사합니다!

1개의 좋아요

관리자이거나 더 높은 권한(TL)을 가진 사용자인가요? 그렇다면, 대신 낮은 권한(TL)의 테스트 사용자를 사용해 보시는 것이 좋을 수 있습니다.

1개의 좋아요

다음 조건에 해당하는 게시물은 건너뜁니다:

  • 작성자의 신뢰 수준이 TL1보다 높을 때.
  • 게시물이 개인 메시지(PM) 주제에 속할 때.
  • 작성자가 봇일 때.
  • 작성자가 스태프(모더레이터/관리자)일 때.
  • 작성자가 이미 일반(비-PM) 주제에서 3개 이상의 게시물을 작성했을 때.
  • 게시물이 이미 3회 이상 스캔되었을 때.

테스트가 정상적으로 작동하고 있다면, 위 조건 중 하나에 해당하기 때문일 것이라고 확신합니다.

1개의 좋아요

아하, 맞아요! 인내심 있고 도움되는 답변에 감사드립니다!

신뢰 수준 0 계정이 아닌 관리자 계정으로 게시글을 올렸습니다. :woman_facepalming:

잘 작동합니다! discourse_ai_spam 사용자가 게시글을 신고하고 목록에서 제거한 사용자로 표시되는 방식을 정말 좋아합니다.

이 문제에 대해 신속하고 후하게 도움을 주셔서 다시 한번 감사드립니다!

3개의 좋아요