gpt4oから2つの異なる回答 - 1つは正解、1つは不正解!?

数学と論理.. IMOの「2つの異なる答えのトピック」の心を曲げる側面、ありがとう

ご検討ください…

オンラインで商品を購入したいのですが、同じ商品を3人の出品者が提供しており、すべてにカスタマーレビューがあります。

  • 1人目は10件のレビューがあり、すべて肯定的です。
  • 2人目は50件のレビューがあり、48件が肯定的です。
  • 3人目は200件のレビューがあり、186件が肯定的です。

標準的な確率の原則を使用して、どの出品者から購入すべきですか? 1、2、または3?

3Blue1Brownの参考資料によると、答えは出品者2であるべきです。(二項分布 | 確率の確率。(https://www.youtube.com/watch?v=8idr1WZ1A7Q))

GPT 3.5 (OpenAIブラウザGUI):
「高い確率とより大きなサンプルサイズの両方を優先する場合、2番目の出品者:github_check:を検討するかもしれません。これは、比較的大きなサンプルサイズで肯定的なレビューの高い確率を持っています。」

Gemini 1.5 Pro (Google AI Studio):
「最も統計的に信頼性の高いデータを提供する出品者3:x:から購入することに最も傾倒すべきです。」

Claude 3 Sonnet (AnthropicブラウザGUI):
「標準的な確率と統計の原則によれば、より大きなサンプルサイズは、真の母集団の割合のより信頼性の高い推定値を提供します。出品者3:x:を選択するのが最も合理的でしょう。」

私のカスタムDiscourse AIペルソナ (Gemini Pro):
「おそらく商品3:x:を選ぶべきです。」

私のカスタムDiscourse AIペルソナ (GPT4o):
「2番目の:github_check:出品者(50件のレビューで96%)は、高い確率と十分なレビュー数のバランスの取れた選択肢かもしれません。」

これらのLLMが提示する「論理」のいくつかは本当に笑えます!..そして、彼らのどれも真の統計的なニュアンスを理解していないようです..

LLMゲームには多くの変数があることを考えると、包括的な「インサイチュ」テストフレームワークが将来的に必須の機能になる(プラグイン?:slightly_smiling_face:)ように思われます。

要因:

  • LLMモデルのリリース/バージョン(ファインチューニングは定期的に調整されているようです)
  • さまざまなレベルでのプロンプト構造
  • さまざまな種類のコンテキスト内学習コンテンツ
  • 数学と論理の側面
  • 検閲ガードレール
  • 付随ツール(js、python、juliaなど)
  • その他、その他。