Discourse AI — Токсичность

Мы интегрировали модели GitHub - unitaryai/detoxify: Trained models & code to predict toxic comments on all 3 Jigsaw Toxic Comment Challenges. Built using ⚡ Pytorch Lightning and 🤗 Transformers. For access to our API, please email us at contact@unitary.ai. · GitHub для автоматической классификации токсичности постов и автоматического флага при превышении настраиваемого порога.

Мы обнаружили, что, хотя это отлично работает, если у вас нулевая терпимость к типичной токсичности на ваших инстансах, как это бывает у более «брендовых» инстансов, для других более ориентированных на сообщество инстансов Discourse модели токсичности были слишком строгими, генерируя слишком много флагов в более либеральных инстансах.

Из-за этого наш текущий план — отказаться от токсичности и перенести эту функцию в наш плагин AI Triage, где мы предоставляем настраиваемый промпт для администраторов, чтобы адаптировать автоматическое обнаружение токсичности к уровням, допустимым на их инстансе.

Мы также планируем предложить нашим клиентам размещенную модель LLM для модерации, подобную https://ai.google.dev/gemma/docs/shieldgemma или [2312.06674] Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations, которая показала очень хорошие результаты в наших внутренних оценках на том же наборе данных, что и в оригинальном конкурсе Jigsaw Kaggle, породившем Detoxify.

4 лайка