GPT4o给出的两个不同答案——一个正确,一个错误..!?

是的。早期的模型在简单的数学/简单逻辑方面表现尤其糟糕,例如这个简单的谜题:

我住在一栋电梯坏了的公寓楼里。

如果我进入电梯并按下偶数楼层的按钮,它会去那个楼层,但不会开门,然后回到我开始的地方。

所以,如果我从 1 楼进入电梯并按下 4 楼的按钮……当它停下来时,我走出来,再爬三层楼梯,我会到达几楼?

最佳答案:4 楼

我所有的基于 gpt4o 的 Discourse AI 角色都能正确回答(除了只有本地/RAG 上下文的那个……因为没有相关上下文……)

但我刚刚在 OpenAI 的 GUI 中运行了这个测试,它回复说……

我们一步一步来分析:

  1. 你从 1 楼进入电梯并按下 4 楼的按钮。
  2. 电梯会上升到 4 楼但不会开门,然后它会回到你开始的地方(1 楼)。
  3. 你从 4 楼走出电梯,然后徒步爬了三层楼梯。

因为你从 1 楼开始,又爬了三层楼梯,所以你会到达 7 楼。

而且奇怪的是……在浏览器 GUI 中的 Gemini 1.5 Pro……询问关于毛巾晾干的问题……

……有 10 条毛巾时,每条毛巾暴露在阳光和空气中的表面积更大,可以更快地晾干。有 15 条毛巾时,有些毛巾可能会堆叠在一起或重叠,从而减小了每条毛巾的有效晾干表面积。

因此,晾干 50% 更多的毛巾,所需时间不会仅仅是 50%(30 分钟的 1.5 倍)。它可能需要更长的时间,但不一定是正好增加 1.5 倍。

估算:

一个合理的估算可能在 45 分钟到 1 小时之间。这考虑到了毛巾数量增加时晾干效率的降低,但避免了假设晾干时间和毛巾数量之间存在完全线性的关系。

……太可怕了! : )