모더레이션 API 플러그인

:information_source: 요약 Discourse Moderation API 플러그인은 자동화된 관리 기능을 통해 Discourse 포럼을 강화합니다. 검증된 Moderation API의 감지 엔진을 활용하고, 관리 효율성을 10배 높이는 개선된 관리 대시보드를 포함합니다.
:hammer_and_wrench: 리포지토리 링크 https://github.com/moderation-api/discourse-moderation-api
:open_book: 설치 가이드 Discourse에서 플러그인 설치 방법

:hammer_and_wrench: 주요 기능

Moderation API는 풀스택 관리 솔루션입니다.

자동화된 관리 작업

  • 댓글과 주제를 자동으로 플래깅합니다.
  • 일반적인 사용 사례를 위한 20개 이상의 사전 구축된 모델 중 선택하거나, 직접 모델을 구축할 수 있습니다.
  • 독성, NSFW 콘텐츠, PII, 스팸, 자기 홍보, 불법 활동 등을 감지합니다.
  • 자동 플래깅을 위한 사용자 정의 임계값을 설정합니다.

LLM 기반 감지

  • 커뮤니티 가이드라인을 AI 에이전트에 통합합니다.
  • AI를 1차 방어선 또는 댓글을 플래깅하는 신뢰할 수 있는 관리자로 활용합니다.

사용자 정의 모델 학습

  • 가장 높은 정확도의 관리를 위해 자체 AI 모델을 개발합니다.
  • 관리자의 작업을 피드백으로 사용하여 모델을 학습하고 개선합니다.
  • 기계 학습을 통해 자동 플래깅을 지속적으로 강화합니다.

향상된 검토 대기열

  • 원할 경우 Moderation API의 검토 대기열을 사용하여 빠르고 현대적인 관리 경험을 제공합니다.
  • 언어, 카테고리 또는 특정 목적에 맞게 여러 검토 대기열을 생성합니다.
  • 콘텐츠 에스컬레이션을 위한 관리 워크플로를 개발합니다.
  • 효율적인 관리를 위해 관리자를 특정 검토 대기열에 배정합니다.

대시보드 분석

  • Moderation API 대시보드를 통해 AI 활동과 결과를 모니터링합니다.
  • 일반적인 문제에 대한 통찰력을 얻고 개선 영역을 식별합니다.

무결성 통합

  • 기존 Discourse 워크플로와 사용자 역할과 쉽게 통합됩니다.
  • Discourse 검토 대기열 또는 Moderation API 검토 대기열 중 선택할 수 있습니다.
  • Discourse의 내장 관리 작업을 활용합니다.

:rocket: 구성

다음 단계를 따라 Moderation API 플러그인을 구성하세요:

Moderation API에서 프로젝트 생성

  • Moderation API 대시보드로 이동합니다.
  • 새 프로젝트를 생성하고 감지하려는 라벨을 선택합니다.

(선택) 임계값 테스트 및 조정

  • 임계값 슬라이더를 사용하여 관리의 엄격도를 결정합니다.
  • 플레이그라운드에서 API 응답을 테스트합니다.

API 키 설정

  • 프로젝트 대시보드의 Integrate 섹션에서 API 키를 찾습니다.
  • Discourse 관리 패널에서 설정 > Moderation API로 이동합니다.
  • API 키를 Moderation API Key 필드에 붙여 넣습니다.
  • 변경 사항을 저장합니다.

플러그인 활성화

  • 플래깅 동작을 선택합니다(아래 옵션 참조). "nothing"으로 시작하여 작업을 수행하지 않고 플러그인을 테스트할 수 있습니다.
  • 플러그인 활성화 버튼을 눌러 새 게시물 분석을 시작합니다. 이 플러그인은 기존 콘텐츠를 분석하지 않습니다.

(선택) 커뮤니티 가이드라인 추가

  • Moderation API의 Model Studio로 이동합니다.
  • 새 AI 에이전트를 생성합니다.
  • 가이드라인을 에이전트의 규칙으로 통합합니다. 방대한 가이드라인이 있다면 여러 에이전트를 생성하는 것을 고려하세요.
  • 에이전트를 프로젝트에 추가합니다.


:triangular_flag: 플래깅 동작

이 플러그인은 Moderation API가 댓글을 플래깅할 때 수행되는 작업을 결정하는 네 가지 다른 플래깅 동작을 제공합니다.

1. 플래깅 (기본 동작)

플러그인 봇은 Discourse 구성에 따라 댓글에 Inappropriate(부적절) 플래그를 추가합니다. 일반적으로 이는 댓글이 검토 대기열에 표시되지만, 관리자가 승인하거나 추가 사용자가 댓글을 플래깅할 때까지 즉시 숨겨지지 않을 수 있음을 의미합니다. 사용자 정의를 위해 Discourse의 플래그 관련 설정을 검토하세요.

2. 검토 대기열 등록

댓글은 즉시 숨겨지고 관리자가 승인하거나 거부할 수 있도록 검토 대기열에 추가됩니다.

3. 게시물 차단

댓글은 게시되지 않습니다. 작성자에게 자동화 관리 시스템에 의해 댓글이 차단되었음을 알리는 오류 메시지가 표시됩니다. (오류 메시지를 사용자 정의할 수 있습니다.)

4. 아무것도 하지 않음

즉각적인 작업이 수행되지 않습니다. 댓글은 분석되며 플래깅되면 Moderation API 대시보드에 표시됩니다. 이 옵션은 플러그인을 완전히 활성화하기 전에 Moderation API를 테스트하는 데 유용합니다.


:white_check_mark: 할 일

  • Moderation API의 검토 대기열에서 Discourse에서 콘텐츠를 제거하는 작업을 활성화합니다.
  • Discourse의 검토 대기열 작업을 Moderation API의 검토 대기열과 동기화합니다.
  • 다른 카테고리에 대한 별도의 관리 프로젝트를 허용합니다.
  • 선택된 Discourse 플래깅 카테고리를 사용하여 콘텐츠를 플래깅합니다. (현재 Inappropriate 사용 중).

:wrench: 설정

아래는 Moderation API 플러그인의 사용 가능한 설정 및 그 설명입니다:

설정 설명
Moderation API 활성화 플러그인이 활성인지 여부를 제어합니다.
기본값: 비활성화
플래깅 동작 콘텐츠가 플래깅될 때 발생하는 일:
• 검토 대기열 등록
• 게시물 플래깅
• 게시물 차단
• 아무것도 하지 않음
기본값: 게시물 플래깅
차단 메시지 사용자의 게시물이 차단될 때 표시되는 메시지.
기본값: “Your post has been blocked by our moderation system.”
게시물 대기열 알림 게시물이 검토 대기열에 등록될 때 알림을 보냅니다.
기본값: 활성화됨
개인 메시지 확인 개인 메시지에 관리를 적용합니다.
기본값: 비활성화
건너뛰기 그룹 관리 확인을 우회하는 사용자 그룹.
기본값: 없음
건너뛰기 카테고리 관리 확인을 우회하는 포럼 카테고리.
기본값: 없음
API 키 Moderation API 인증 키.
기본값: 없음

:credit_card: 구독

플러그인을 즉시 설치하여 무료 플랜 또는 30일 체험을 활용할 수 있습니다. 확장된 기능과 더 높은 사용 한도를 위해 구독 옵션을 확인해 보세요.


:books: 문서


:hammer_and_wrench: 지원



면책 조항: Discourse Moderation API 플러그인은 관리 기능을 크게 강화하지만, 자동화 관리의 영향을 검토하고 이해하는 것이 중요합니다. 항상 커뮤니티와 관리 프로세스에서 AI 사용에 대한 투명성을 유지하세요.

개인정보 보호 참고 사항: 이 플러그인은 관리 규칙을 시행하기 위해 사용자가 생성한 콘텐츠를 처리합니다. 개인정보 보호 정책 준수 및 데이터 처리 관행에 대한 사용자 알림을 확인하세요.


10개의 좋아요

GitHub 저장소의 README에서:

플러그인을 바로 설치하여 무료 플랜 또는 30일 무료 체험을 사용할 수 있습니다.

웹사이트나 API 문서에서 무료 플랜에 대한 정보를 찾을 수 없었습니다. 어떤 제한 사항이 있나요?

또한, 사용량이 유료 플랜의 할당량을 초과할 때만 종량제(pay-as-you-go) 플랜이 제공되나요?

2개의 좋아요

무료 플랜은 취미 프로젝트에 사용할 수 있습니다. 설정을 위해 편하게 메시지를 보내 주세요.

맞습니다. PAYG는 유료 플랜에서 포함된 할당량을 초과할 때 선택적으로 가입할 수 있는 방식입니다.

3개의 좋아요

AI 모더레이션 도구가 더 많이 도입되었으면 좋겠습니다! Discourse의 AI 트리아지가 제공하지 않는 것이 무엇인지 설명해 주시겠어요? 감사합니다!

1개의 좋아요

네, 물론입니다. 원본 게시물에서 이 부분을 더 명확하게 설명했어야 했는데 죄송합니다.

먼저, Moderation API는 감지 엔진이 그 일부일 뿐인 완전한 모더레이션 플랫폼에 대한 접근 권한을 제공합니다. 본질적으로 콘텐츠 모더레이션 문제를 해결하는 데 수년간의 경험을 쌓은 기업과 파트너십을 맺는 것과 같습니다.

하지만 감지/트리아지 기능에만 초점을 맞춰 설명하자면 다음과 같습니다:

  1. 더 높은 정확도: 가장 일반적인 사용 사례를 처리하기 위해 20개 이상의 사전 구축된 분류기(Classifier)를 선택할 수 있습니다. 이를 통해 시작하기가 매우 쉬우며, 우리는 모델을 지속적으로 개선하고 있으므로 최신 기술 추이를 직접 걱정할 필요가 없습니다.
    프롬프트 엔지니어링을 거친 LLM(대형 언어 모델)보다 잘 학습된 분류기를 사용하는 것이 일반적으로 더 우수하고 견고한 결과를 제공합니다.

  2. 맥락 인식: Moderation API의 감지 엔진은 스레드 내의 이전 메시지나 작성자의 이력을 분석하여 더 정확한 분석을 제공합니다. 내장된 트리아지 기능과 비교할 때 이는 큰 개선이라고 생각합니다.

  3. 전문화된 LLM: Discourse에서는 gpt-4o와 claude 등 몇 가지 모델 중에서 선택할 수 있는 반면, Moderation API는 Llama-guard와 같이 콘텐츠 모더레이션에 특화되어 학습된 LLM을 지원하며, 향후 더 많은 모델이 추가될 예정입니다. 또한 우리의 LLM은 데이터에 기반한 최적의 성능을 발휘하도록 사전에 프롬프트가 설정되어 있습니다.

  4. 커스텀 모델 학습: Moderation API에 연결되면 사용자의 특정 데이터로 자체 모델을 학습시킬 수도 있습니다.

  5. 컴플라이언스(규정 준수): 모델은 자체 서버에서 호스팅되며, 규정 준수와 규제 준수가 우선시되는 기업을 위해 맞춤형 DPA(데이터 처리 계약)를 제공할 수 있습니다. 경우에 따라 온프레미스(On-premise) 솔루션을 제공할 수도 있습니다.

  6. 비용: 가장 큰 장점은 대량 처리 시 더 저렴한 비용으로 서비스를 제공할 수 있다는 점이며, 어떤 경우에도 예측 가능한 비용을 위해 고정 요금제를 제공합니다.

이 설명이 더 명확해지길 바랍니다. 프로젝트를 구성하면 프롬프트를 작성하는 것만으로는 얻을 수 없는 다양한 옵션과 유연성을 제공하므로, 훨씬 더 강력하고 전문적인 솔루션이라고 할 수 있습니다.

2개의 좋아요

플러그인을 설치한 후 앱을 다시 빌드하면 빌드 과정에서 다음 오류가 발생합니다:

Gem::LoadError: can’t activate faraday-2.12.2, already activated faraday-2.13.4
… /plugins/discourse-moderation-api/plugin.rb:11:in `activate!’

전체 로그: er-js/faker-10.0.0 * [new branch] dependabot/npm_and_yarn/fortawesome - Pastebin.com

Daniel님, 플러그인을 사용해 주셔서 감사합니다.

지금 확인 중입니다. 그 동안 support@moderationapi.com으로 문의해 주시면 도움을 드리는 데 조금 더 수월할 것입니다.

이 문제는 플러그인의 최신 버전에서 수정되었습니다. 이제 앱을 다시 빌드하면 될 것 같습니다.