Discourse AI 스팸 감지 플래그가 거부되어도 게시글과 계정이 항상 복구되지 않음

,

우선순위/심각도:

높음

플랫폼

운영체제

Windows 11

브라우저

Google Chrome 131.0.6778.265

Discourse

c1a46995a7b87982557eeba297d4460169c77bba

Discourse AI

61758ff8a6ea98e4502d0bdc9a8abe635aa35666

설명:

게시글이 Discourse AI 플러그인의 스팸 감지 기능에 의해 스팸으로 감지되면 다음 조치들이 수행됩니다:

  • 게시글이 숨겨집니다.
  • 게시글 작성자의 계정이 무음 처리(silenced)됩니다.
  • 플래그가 생성됩니다.

이후 포럼 관리자가 해당 플래그를 검토합니다. 스팸 감지가 오탐(false positive)인 경우, 관리자는 플래그 검토 인터페이스에서 “아니요, 게시글 복구” 버튼을 클릭합니다.

:bug: 플래그 검토자가 “아니요, 게시글 복구” 버튼을 클릭해도 게시글과 계정이 항상 복구되지 않습니다. 게시글은 숨겨진 상태로 남아있고, 게시글 작성자의 계정은 부당하게 무음 처리된 상태로 유지됩니다.

재현 단계:

이 결함을 안정적으로 재현하는 방법을 알지 못하지만, 결함이 발생할 때 수행되는 단계는 다음과 같습니다:

  1. Discourse AI 스팸 감지 시스템에 의해 플래그가 생성된 게시글을 기다립니다.
  2. 플래그 검토 인터페이스에서 “아니요, 게시글 복구” 버튼을 클릭합니다.
  3. 플래그가 생성된 게시글을 확인합니다.
    :bug: 게시글이 여전히 숨겨져 있을 수 있습니다.
  4. 플래그가 생성된 게시글을 작성한 사용자의 관리자 페이지를 확인합니다.
    :bug: 사용자의 계정이 여전히 무음 처리되어 있을 수 있습니다.

추가 정보

다음 조건에서 발생하는 것으로 보입니다:

  • 플래그가 생성된 게시글이 토픽의 첫 번째 게시글이 아닙니다.
  • 플래그가 생성된 게시글의 작성자가 해당 토픽을 생성한 사용자입니다.

이 버그로 인해 플래그가 기각되었음에도 계정이 무음 처리된 상태로 남은 사용자들의 사용자 노트를 확인해 보면, 다음과 같은 형식의 동일한 두 개의 노트가 있음을 발견했습니다:

system 19m

@discourse_ai_spam 이 계정을 3025년 1월 13일까지 무음 처리했습니다. 이유: Discourse AI에 의해 사용자가 자동으로 무음 처리됨

두 노트의 타임스탬프 사이에는 몇 분의 차이가 있습니다. 두 노트 모두 동일한 게시글과 관련되어 있으며, 해당 게시글에는 플래그가 하나만 생성되었습니다.

게시글에 플래그가 생성되었으나 플래그 기각 후 계정이 올바르게 복구된 사용자들의 사용자 노트를 확인해 보면, 이러한 노트는 하나만 표시됩니다.


조사에 도움이 될 수 있을지 모르겠지만, 이 문제가 발생하고 있는 포럼은 다음과 같습니다:

4개의 좋아요

여기서 이 문제를 수정했습니다:

기존 메커니즘보다 마법이 덜하고 스팸러에게 덜 가혹하지만, 추가된 안전성과 명확성은 가치가 있다고 생각합니다.

부연하자면, Arduino에서 오탐(false positive)이 발생하는 패턴을 발견하여 커스텀 지시를 조금 조정하여 이를 수정할 예정입니다(배포 대기 중).

3개의 좋아요

버그 수정과 AI 스팸 탐지 지침 개선에 정말 감사합니다.

역시 Discourse 팀은 놀라울 정도로 빠른 대응을 보여주고 있습니다!

감사합니다, Per

4개의 좋아요

이 주제는 4일 후 자동으로 닫혔습니다. 더 이상 새 답변을 작성할 수 없습니다.

불행히도 잠재적 수정 사항이 포함된 버전으로 포럼이 업데이트된 후에도 문제가 여전히 발생하고 있음을 확인했습니다.

지난 1주일 동안, “아니요, 게시글 복원” 버튼을 클릭했음에도 불구하고 플래그가 지정된 게시글이 숨겨진 상태로 남아 있고 사용자의 계정이 침묵 상태(silenced)로 유지된 사례가 3건 있었습니다:

이 문제는 다음과 같은 환경에서 발생했습니다:

  • Discourse AI 플러그인 버전 4784e7fe43ff25c44df986a56f70c0c1c017a51a
  • Discourse 버전 d3a7b996992e721dd9caab60095414eaf1fc832f
2개의 좋아요

Pert 씨, 감사합니다. 이번 주에 확인해서 원인을 찾아보겠습니다.

여기 조사해보니 몇 가지 흥미로운 사례들이 있습니다.

다음 사례의 경우:

해당 사용자가 AI에 의해 여러 번 침묵 조치(silenced)를 받은 것을 확인할 수 있습니다.

어떤 식으로든 다음과 같은 순서를 목격했습니다:

  • 시스템이 플래그를 부여
  • 플래그 기각
  • 사용자가 게시물을 수정
  • 스팸 시스템이 다시 감지
  • "중복"이 되므로 플래그가 생성되지 않았고, 시스템은 아무런 조치도 취하지 않음(투명하게 무시됨)

이 문제를 어떻게 적절히 해결할 수 있을지 직원 경험 팀과 논의해 보겠습니다.

스패머는 매우 교묘할 수 있으므로, 처음에 문제가 없었다고 해서 영원히 문제가 없는 것은 아니기 때문에 AI가 재플래그(re-flag)할 수 있도록 허용해야 합니다.

Pert,

이것은 꽤 복잡한 엣지 케이스로 보입니다. 문제를 디버깅하고 견고한 해결책을 찾는 데 조금만 시간을 주십시오.

더블 플래깅은 매우 복잡한 문제입니다.

샘, 감사합니다.

전적으로 동의합니다. 게시물에 추가 플래그가 붙는 것에 전혀 문제가 없습니다.

네, 스팸 시스템이 게시물이 수정된 후 다시 평가하는 것은 정말 좋은 점입니다!


해당 문제가 추가로 발생했습니다:

해당 문제에 대한 추가 예시가 유용하다면 말씀해 주십시오. 발견되는 대로 여기에 계속 제공하겠습니다. (해당 버그로 인해 숨겨진 게시물과 음소거된 사용자를 확인하기 위해 주기적으로 Data Explorer 쿼리를 실행하고 있습니다.) 필요하지 않다면 불필요한 "노이즈"를 만들지 않기 위해 자제하겠습니다.

1개의 좋아요

문제 재현이 잘 되어서 좋은 것 같습니다. @martin이 이 문제를 리스트에 올려놓고 다음 주에 확인해 볼 예정입니다.

"naive"한 해치(hatchet) 방식의 즉각적인 수정 방법도 생각해 볼 수 있지만, 조금 더 깔끔하게 처리할 수 있는 방법이 있는지 먼저 파악해 보고 싶습니다. (예: 플래그가 처리된 경우, 다른 플래그를 추가할 수 있도록 해당 플래그를 게시글에서 수동으로 분리하는 것)

이 문제를 보고해 주셔서 정말 감사합니다.

Pert님, 안녕하세요.

Martin입니다. 이 문제를 확인하기 위해 배정받았습니다. AI가 이미 처리된 스팸 게시물을 다시 플래그를 지정하려다 실패한 후에도 사용자를 차단하고 게시물을 숨기는 문제를 수정했습니다. 수정 사항을 해당 사이트에 배포했습니다.

AI가 항목을 스팸으로 다시 플래그 지정해야 하는 근본적인 필요성은 여전히 존재하지만, 적어도 사용자가 차단되고 게시물이 숨겨지는 혼란스러운 동작은 더 이상 보이지 않을 것입니다.

추가로 문제가 발생하면 알려 주세요.

3개의 좋아요

마틴, 고마워!

1개의 좋아요

이 주제는 11일 후 자동으로 닫혔습니다. 더 이상 새 답변을 게시할 수 없습니다.