إجابتان مختلفتان من gpt4o - واحدة صحيحة، والأخرى خطأ.. !?

الرياضيات مقابل المنطق .. جانب مربك للعقل لموضوع “إجابتين مختلفتين” في رأيي، شكرًا

يرجى النظر في…

أريد شراء منتج عبر الإنترنت وأرى ثلاثة بائعين يقدمون نفس المنتج - جميعهم لديهم تقييمات العملاء:

  • الأول لديه 10 تقييمات، كلها إيجابية
  • الثاني لديه 50 تقييمًا، 48 منها إيجابية
  • الثالث لديه 200 تقييم، 186 منها إيجابية.

باستخدام المبادئ القياسية للاحتمالات، من أي بائع يجب أن أشتري: 1، 2، أم 3؟

وفقًا للمواد المرجعية لـ 3Blue1Brown، يجب أن تكون الإجابة البائع 2. (التوزيعات الثنائية | احتمالات الاحتمالات.)

GPT 3.5 (واجهة المستخدم الرسومية لمتصفح OpenAI):
“إذا كنت تعطي الأولوية لكل من الاحتمالية العالية وحجم العينة الأكبر، فقد تفكر في البائع الثاني :github_check:، حيث أن لديه احتمالية عالية للتقييمات الإيجابية مع حجم عينة أكبر نسبيًا”

Gemini 1.5 Pro (Google AI Studio):
“يجب أن تكون أكثر ميلًا للشراء من البائع 3 :x:، الذي يقدم البيانات الأكثر موثوقية إحصائيًا.”

Claude 3 Sonnet (واجهة المستخدم الرسومية لمتصفح Anthropic):
“وفقًا للمبادئ القياسية للاحتمالات والإحصاء، يوفر حجم العينة الأكبر بشكل عام تقديرًا أكثر موثوقية لنسبة السكان الحقيقية. سيكون من الأكثر منطقية اختيار البائع 3” :x:.

شخصيتي الخاصة في الذكاء الاصطناعي على Discourse (Gemini Pro):
“يجب أن تذهب على الأرجح مع المنتج 3” :x:.

شخصيتي الخاصة في الذكاء الاصطناعي على Discourse (GPT4o):
“قد يكون البائع الثاني :github_check: (96% مع 50 تقييمًا) خيارًا متوازنًا بين الاحتمالية العالية وحجم المراجعات الكافي.”

بعض “المنطق” الذي تطرحه هذه النماذج اللغوية الكبيرة مثير للسخرية حقًا! .. ولم يبدو أن أيًا منها قد استوعب الفروق الإحصائية الحقيقية ..

بالنظر إلى عدد المتغيرات الموجودة في لعبة النماذج اللغوية الكبيرة، يبدو أن أطر الاختبار الشاملة “في الموقع” ستكون ميزة غير اختيارية للمضي قدمًا (ملحق؟ :slightly_smiling_face:)

العوامل:

  • إصدار/إصدار نموذج LLM (يبدو أنهم يقومون بضبط دقيق بانتظام)
  • هيكل المطالبة على مستويات مختلفة
  • محتوى التعلم في السياق بأنواعه المختلفة
  • جوانب الرياضيات والمنطق
  • حواجز الرقابة
  • الأدوات المساعدة (js، python، julia، إلخ)
  • إلخ. إلخ.