我做的差不多就是这些,之前在相关话题里也发过。
AI生成或处理过的帖子总有一些特征会暴露其身份。
我们会通过一个代理程序来解析来自低信任度用户的新主题帖,并标记其是否可能由AI生成。用户会收到机器人发送的礼貌消息,解释原因并建议他们该如何处理,而我们则可以选择不标记该帖子或直接将其删除。
这套机制是有效的,但现实情况是,有一波人只是把对话内容直接复制粘贴到论坛里,这是不被允许的。
结果就是,一大段文字被AI总结,人类反而成了代理。
更好的做法是采取零容忍政策,语言问题除外——不过有了自动翻译,这已经不再是必要的例外了。政策也需要公开透明,如果这种审核都在幕后进行,用户就会失去对它的认知。