私が普段やっていることと似たようなことを、このフォーラムの関連トピックでどこかに投稿しました。
AIが生成・処理した投稿には、それがAIによるものであると見抜ける特徴が必ずあります。
信頼度が低いユーザーからの新規トピック投稿は、AIによるものかどうかをフラグ付けするエージェントに通します。ユーザーにはボットから、その理由を説明し、対応策を提案する丁寧なメッセージが届き、私たちモデレーターはフラグを無視するか、投稿を削除するかのいずれかを選択できます。
この仕組みは機能していますが、現実には、会話のテキストをそのまま切り貼りしてフォーラムに貼り付けてくる人々が押し寄せている状況です。これは望ましくないことです。
結果として、AIによって要約された言葉の壁が生まれ、人間がAIの代行者(プロキシ)になってしまうだけです。
ゼロトレランス(容赦しない)ポリシーを採用する方が良いでしょう。例外は言語の問題ですが、自動翻訳がある以上、それももう不要です。ポリシーは目に見える形で示す必要があります。このモデレーションが裏側で行われるだけだと、ユーザーの認識が薄れてしまいます。