우리는 GitHub - unitaryai/detoxify: Trained models & code to predict toxic comments on all 3 Jigsaw Toxic Comment Challenges. Built using ⚡ Pytorch Lightning and 🤗 Transformers. For access to our API, please email us at contact@unitary.ai. · GitHub 모델을 통합하여 게시물의 독성(toxicity)을 자동으로 분류하고, 설정 가능한 임계값을 초과할 때 자동으로 플래깅(flagging)하는 기능을 구현했습니다.
조사 결과, 인스턴스에 대한 독성 허용도가 '제로’인 경우(예: 더 ‘브랜드’ 중심의 인스턴스)에는 이 기능이 매우 잘 작동하지만, 커뮤니티 중심의 다른 Discourse 인스턴스에서는 독성 모델이 너무 엄격하여 더 관대한 인스턴스에서 과도한 플래그를 생성하는 문제가 발생했습니다.
이러한 이유로, 현재 계획은 독성 기능 비활성화하고 이 기능을 AI Triage 플러그인으로 이동하는 것입니다. 이 플러그인에서는 관리자가 자신의 인스턴스에서 허용되는 수준에 맞게 자동 독성 감지를 조정할 수 있도록 사용자 정의 프롬프트를 제공합니다.
또한, https://ai.google.dev/gemma/docs/shieldgemma 또는 https://arxiv.org/abs/2312.06674와 유사한 호스팅된 모더레이션 LLM을 고객에게 제공할 계획입니다. 이 모델들은 Detoxify가 탄생하게 된 원동력이 된 Jigsaw Kaggle 대회에서 사용된 동일한 데이터셋에 대한 내부 평가에서 매우 뛰어난 성능을 보였습니다.