是的。早期的模型在简单的数学/简单逻辑方面表现尤其糟糕,例如这个简单的谜题:
我住在一栋电梯坏了的公寓楼里。
如果我进入电梯并按下偶数楼层的按钮,它会去那个楼层,但不会开门,然后回到我开始的地方。
所以,如果我从 1 楼进入电梯并按下 4 楼的按钮……当它停下来时,我走出来,再爬三层楼梯,我会到达几楼?
最佳答案:4 楼
我所有的基于 gpt4o 的 Discourse AI 角色都能正确回答(除了只有本地/RAG 上下文的那个……因为没有相关上下文……)
但我刚刚在 OpenAI 的 GUI 中运行了这个测试,它回复说……
我们一步一步来分析:
- 你从 1 楼进入电梯并按下 4 楼的按钮。
- 电梯会上升到 4 楼但不会开门,然后它会回到你开始的地方(1 楼)。
- 你从 4 楼走出电梯,然后徒步爬了三层楼梯。
因为你从 1 楼开始,又爬了三层楼梯,所以你会到达 7 楼。
而且奇怪的是……在浏览器 GUI 中的 Gemini 1.5 Pro……询问关于毛巾晾干的问题……
……有 10 条毛巾时,每条毛巾暴露在阳光和空气中的表面积更大,可以更快地晾干。有 15 条毛巾时,有些毛巾可能会堆叠在一起或重叠,从而减小了每条毛巾的有效晾干表面积。
因此,晾干 50% 更多的毛巾,所需时间不会仅仅是 50%(30 分钟的 1.5 倍)。它可能需要更长的时间,但不一定是正好增加 1.5 倍。
估算:
一个合理的估算可能在 45 分钟到 1 小时之间。这考虑到了毛巾数量增加时晾干效率的降低,但避免了假设晾干时间和毛巾数量之间存在完全线性的关系。
……太可怕了! : )