数学与逻辑……IMO,“两个不同答案”话题的一个令人费解的方面,谢谢
请考虑……
我想在线购买一个产品,我看到有三个卖家提供相同的产品——都有客户评价:
- 第一个有 10 条评价,全部是正面的
- 第二个有 50 条评价,48 条是正面的
- 第三个有 200 条评价,186 条是正面的
使用标准的概率原理,我应该从哪个卖家购买:1、2 还是 3?
根据 3Blue1Brown 的参考资料,答案应该是卖家 2。(二项分布 | 概率的概率。)
GPT 3.5 (OpenAI 浏览器 GUI):
“如果您同时优先考虑高概率和较大的样本量,您可能会考虑第二个卖家
,因为它具有较高的正面评价概率,并且样本量相对较大。”
Gemini 1.5 Pro (Google AI Studio):
“您应该最倾向于从卖家 3
购买,他提供了最统计上可靠的数据。”
Claude 3 Sonnet (Anthropic 浏览器 GUI):
“根据标准的概率和统计原理,较大的样本量通常能更可靠地估计真实总体比例。选择卖家 3
会更合理。”
我的自定义 Discourse AI 角色 (Gemini Pro):
“您可能应该选择产品 3
。”
我的自定义 Discourse AI 角色 (GPT4o):
“第二个
卖家(50 条评价中的 96%)可能是高概率和足够评价数量之间的平衡选择。”
这些 LLM 所提出的某些“逻辑”确实可笑!……而且它们似乎都没有抓住真正的统计细微差别……
考虑到 LLM 游戏中有如此多的变量,看来全面的“现场”测试框架将是未来不可或缺的功能(插件?
)
因素:
- LLM 模型发布/版本(它们似乎经常微调)
- 各个级别的提示结构
- 各种类型的上下文学习内容
- 数学和逻辑方面
- 审查护栏
- 辅助工具(js、python、julia 等)
- 等等。等等。
