커뮤니티에 NSFW 감지 설정하기

:bookmark: 이 가이드는 Discourse AI 자동화를 사용하여 커뮤니티에서 NSFW(작업장에서 부적절한) 콘텐츠 감지를 설정하는 방법을 안내합니다. 이를 통해 부적절한 이미지와 텍스트를 식별하고 관리할 수 있습니다.

:person_raising_hand: 필요한 사용자 권한: 관리자

커뮤니티에서 NSFW 감지 설정하기

AI 기반 자동화를 사용하여 Discourse 커뮤니티에서 NSFW(Not Safe for Work) 콘텐츠를 자동으로 감지하고 관리합니다. 이 가이드는 부적절한 이미지와 텍스트 콘텐츠에 대한 자동 감지를 구성하는 데 도움이 되며, 최소한의 수동 개입으로 커뮤니티 기준을 유지할 수 있도록 합니다.

요약

이 문서는 Discourse AI의 AI를 사용한 게시물 분류(Triage posts using AI) 자동화를 구성하는 방법을 다루며, 다음을 수행합니다:

  • 비전(이미지 인식) 기능이 있는 AI 모델을 사용하여 NSFW 이미지 감지
  • 부적절한 텍스트 콘텐츠 및 언어 식별
  • 문제 있는 게시물의 자동 플래깅, 분류 및 관리
  • 사용자 정의 응답 및 관리 작업 설정

이 자동화는 대규모 언어 모델(LLM)을 사용하여 게시물 콘텐츠를 분석하고 NSFW 재료가 감지될 때 미리 정의된 작업을 실행합니다.

사전 요구 사항

NSFW 감지를 설정하기 전에 다음 항목이 활성화되어 있는지 확인하십시오:

  • Discourse AI 플러그인 - 핵심 AI 기능 플러그인
  • Discourse Automation 플러그인: 자동화 규칙 생성에 필요
  • 에이전트: NSFW 콘텐츠의 기준을 정의하는 시스템 프롬프트를 가진 에이전트. 혼란을 피하기 위해 긍정적 및 부정적 분류를 위한 명확히 구분되는 언어를 사용하십시오.
  • 비전 지원 LLM: 이미지 감지에만 필요합니다. 텍스트만 감지하려면 표준 LLM으로 충분합니다. LLM 모델과 에이전트 모두에서 "Vision enabled(비전 활성화)"가 켜져 있는지 확인하십시오.
    • Discourse 호스팅 고객은 에이전트를 구성할 때 CDCK Hosted Small LLM을 선택할 수 있습니다.
    • 자체 호스팅 Discourse 사용자는 제3자 LLM을 구성해야 합니다.

예시 프롬프트:

이미지 감지를 위한:

You are a bot specializing in image classification. Respond only with either NSFW or SAFE, and nothing else. NSFW is porn or gore, and SAFE is everything else. When in doubt reply with SAFE.

텍스트 감지를 위한:

You are an advanced AI content moderation system designed to triage user-generated posts. Your task is to detect and flag any content that includes bad language, inappropriate terms, or NSFW (Not Safe for Work) content.

NSFW content includes explicit sexual content, violence, hate speech, graphic language, discrimination, self-harm references, or illegal activity.

Respond with exactly one word:
* "SAFE": The post is appropriate and doesn't contain bad or NSFW content
* "NSFW": If bad, inappropriate, or NSFW content is detected

Be context-aware and avoid false positives.

구성 단계

필요한 플러그인 활성화

  1. 사이트의 관리자 패널로 이동
  2. 플러그인(Plugins) > **설치된 플러그인(Installed Plugins)**으로 이동
  3. Discourse AIAutomation 플러그인 모두 활성화

자동화 규칙 생성

  1. 관리자 패널에서 플러그인(Plugins) > Automation으로 이동
  2. 새 자동화 규칙 생성을 시작하려면 + Create(생성) 클릭
  3. AI를 사용한 게시물 분류(Triage Posts Using AI) 선택
  4. 설명적인 이름 설정 (예: “NSFW Content Detection”)

트리거 및 제한 사항 구성

트리거 설정:

  • 새 또는 편집된 게시물을 스캔하기 위한 트리거로 게시물 생성/편집(Post created/edited) 선택
  • 또는, 지정된 시간 동안 답글이 없었던 주제를 분류하기 위해 정체된 주제(Stalled topic) 선택
  • 자동화 범위를 제한하려면 Action type, Categories, Tags, Groups, Trust Levels 또는 Post features를 선택적으로 지정
  • 사이트 전체에 자동화를 적용하려면 필드를 비워 두십시오

선택적 제한 사항 (Post created/edited 트리거):
자동화 범위를 더 제한하기 위해 추가 설정을 구성하십시오:

  • 새 주제만 대상으로 하려면 첫 번째 게시물만(First post only) 또는 원본 게시물만(Original post only)
  • 사용자의 첫 번째 주제만 대상으로 하려면 첫 번째 주제만(First topic only)
  • 이미지, 링크, 코드 또는 업로드가 포함된 게시물로 제한하려면 게시물 기능(Post features) — 이미지 기반 NSFW 감지에 유용
  • 일반 주제, 공개 주제 또는 개인 메시지로 제한하려면 제한된 아키타입(Restricted archetype)

AI 분류 구성

:spiral_notepad: 시스템 프롬프트 필드는 에이전트를 위해 비활성화되었습니다. 이 변경 사항 이전에 AI 자동화를 사용했다면, 관련 시스템 프롬프트를 가진 새 에이전트가 자동으로 생성됩니다.

에이전트:
NSFW 감지 자동화에 대해 정의된 에이전트를 선택하십시오.

검색 텍스트:
자동화 작업을 트리거하는 프롬프트의 정확한 출력을 입력하십시오. 위의 예시를 사용한다면 NSFW를 입력하십시오.

고급 옵션:

  • 최대 게시물 토큰(Max Post Tokens): LLM으로 전송되는 게시물의 토큰 수 제한
  • 최대 출력 토큰(Max output tokens): 모델이 생성할 수 있는 토큰 수의 상한선 설정
  • 중지 시퀀스(Stop Sequences): 특정 값을 만나면 모델이 생성을 중단하도록 지시

관리 작업 설정

분류 및 태그 지정:

  • 플래그된 게시물을 이동할 카테고리 정의
  • 식별된 NSFW 콘텐츠에 추가될 태그 지정

플래깅 옵션:

  • 플래깅을 활성화하려면 **게시물 플래그(Flag post)**를 활성화한 후 플래그 유형을 선택하십시오:
    • 게시물을 검토 큐에 추가(Add post to review queue) — 게시물을 수동 관리자 검토를 위해 검토 큐로 전송
    • 게시물을 검토 큐에 추가 및 게시물 숨기기(Add post to review queue and hide post) — 검토 큐 + 게시물을 즉시 숨김
    • 게시물을 검토 큐에 추가 및 게시물 삭제(Add post to review queue and delete post) — 검토 큐 + 게시물을 소프트 삭제
    • 게시물을 검토 큐에 추가, 게시물 삭제 및 사용자 침묵(Add post to review queue, delete post and silence user) — 검토 큐 + 게시물을 소프트 삭제 + 작성자를 침묵 상태로 설정
    • 스팸으로 플래그 및 게시물 숨기기(Flag as spam and hide post) — 게시물을 스팸으로 플래그 (자동 숨김)
    • 스팸으로 플래그, 게시물 숨기기 및 사용자 침묵(Flag as spam, hide post and silence user) — 스팸 플래그 + 작성자를 침묵 상태로 설정
  • 전체 주제를 자동으로 숨기려면 주제 숨기기(Hide Topic) 활성화

자동 응답:

  • 게시물이 플래그된 이유를 설명하는 고정된 메시지를 게시하려면 응답 사용자(Reply User)응답(Reply) (고정 응답)을 설정
  • 동적 응답을 생성하기 위해 별도의 AI 에이전트를 사용하려면 **응답 에이전트(Reply Agent)**를 선택 (이는 고정 응답보다 우선순위가 높음)
  • 응답이 스태프에게만 보이도록 하려면 Whisper로 응답(Reply as Whisper) 활성화

작성자 알림:

  • 콘텐츠가 플래그될 때 게시물 작성자에게 개인 메시지를 보내려면 PM으로 작성자에게 알림(Notify author via PM) 활성화
  • PM 발신자(PM sender) 사용자 설정 (기본값은 system) 및 선택적으로 사용자 정의 PM 콘텐츠(PM content) 제공

기타 옵션:

  • 개인 메시지도 스캔 및 분류하려면 개인 메시지 포함(Include personal messages) 활성화

주의 사항

  • LLM 호출은 비싸질 수 있습니다. 분류기를 적용할 때 비용을 모니터링하고 항상 작은 하위 집합에서만 실행하도록 고려하십시오.
  • 더 나은 성능을 내는 모델, 즉 GPT-4o 등은 더 나은 결과를 가져올 수 있지만, 비용이 더 높을 수 있습니다. 그러나 LLM이 점점 더 좋아지고 저렴해지면서 시간이 지남에 따라 비용이 감소하는 것을 목격했습니다.

기타 용도

프롬프트를 사용자 정의하여 PII 노출 및 스팸 감지와 같은 다양한 감지를 수행할 수 있습니다. 이 자동화를 커뮤니티의 이익을 위해 어떻게 활용하고 계신지 듣고 싶습니다!

8개의 좋아요

게시글이 새 주제로 분리되었습니다: LLM 및 NSFW 콘텐츠 감지 지연