Два разных ответа от gpt4o — один верный, один неверный.. !?

Математика против логики… один из самых запутанных аспектов темы «два разных ответа», на мой взгляд. Спасибо.

Пожалуйста, рассмотрите следующее:

Я хочу купить товар онлайн и вижу, что три продавца предлагают один и тот же товар — у всех есть отзывы покупателей:

  • У первого 10 отзывов, все положительные
  • У второго 50 отзывов, 48 положительных
  • У третьего 200 отзывов, 186 положительных.

Согласно стандартным принципам теории вероятности, у какого продавца следует покупать: у 1, 2 или 3?

Согласно материалам от 3Blue1Brown, правильный ответ — продавец 2. (Биномиальные распределения | Вероятности вероятностей.)

GPT 3.5 (веб-интерфейс OpenAI):
«Если вы ставите во главу угла как высокую вероятность, так и большой размер выборки, стоит рассмотреть второго продавца :github_check:, так как у него высокая доля положительных отзывов при относительно большом объёме выборки».

Gemini 1.5 Pro (Google AI Studio):
«Вам следует с наибольшей вероятностью выбрать продавца 3 :x:, который предоставляет наиболее статистически надёжные данные».

Claude 3 Sonnet (веб-интерфейс Anthropic):
«Согласно стандартным принципам теории вероятности и статистики, больший размер выборки обычно обеспечивает более надёжную оценку истинной доли генеральной совокупности. Наиболее разумным будет выбрать продавца 3» :x:.

Моя кастомная AI-персона в Discourse (Gemini Pro):
«Скорее всего, стоит выбрать товар 3» :x:.

Моя кастомная AI-персона в Discourse (GPT4o):
«Второй :github_check: продавец (96% положительных отзывов при 50 отзывах) может стать сбалансированным выбором между высокой вероятностью и достаточным объёмом отзывов».

Некоторые из «логических» рассуждений, приводимых этими LLM, поистине смехотворны! .. и ни одна из них, похоже, не уловила реальных статистических нюансов..

Учитывая, сколько переменных существует в игре с LLM, кажется, что всесторонние фреймворки тестирования «in situ» станут обязательной функцией в будущем (плагин? :slightly_smiling_face:)

Факторы:

  • Версия/релиз модели LLM (они, похоже, регулярно корректируют дообучение)
  • Структура промпта на различных уровнях
  • Контент для обучения в контексте различных типов
  • Математические и логические аспекты
  • Ограничения цензуры
  • Вспомогательные инструменты (js, python, julia и др.)
  • И так далее.