Dos respuestas diferentes de gpt4o - ¡una correcta, una incorrecta.. !?

Matemáticas vs. lógica… un aspecto alucinante del “tema de las dos respuestas diferentes” en mi opinión, gracias

Por favor, considera…

Quiero comprar un producto en línea y veo que tres vendedores ofrecen el mismo producto, todos con reseñas de clientes:

  • El primero tiene 10 reseñas, todas positivas
  • El segundo tiene 50 reseñas, 48 positivas
  • El tercero tiene 200 reseñas, 186 positivas.

Usando los principios estándar de probabilidad, ¿de qué vendedor debería comprar: 1, 2 o 3?

Según el material de referencia de 3Blue1Brown, la respuesta debería ser Vendedor 2. (Distribuciones binomiales | Probabilidades de probabilidades.)

GPT 3.5 (GUI del navegador de OpenAI):
“Si priorizas tanto la alta probabilidad como un tamaño de muestra mayor, podrías considerar al segundo vendedor :github_check:, ya que tiene una alta probabilidad de reseñas positivas con un tamaño de muestra relativamente mayor.”

Gemini 1.5 Pro (Google AI Studio):
“Deberías estar más inclinado a comprarle al vendedor 3 :x:, que ofrece los datos estadísticamente más fiables.”

Claude 3 Sonnet (GUI del navegador de Anthropic):
“Según los principios estándar de probabilidad y estadística, un tamaño de muestra mayor generalmente proporciona una estimación más fiable de la proporción real de la población. Sería más razonable elegir al Vendedor 3” :x:.

Mi persona de IA de Discourse personalizada (Gemini Pro):
“Probablemente deberías ir con el producto 3” :x:.

Mi persona de IA de Discourse personalizada (GPT4o):
“El segundo vendedor :github_check: (96% con 50 reseñas) podría ser una opción equilibrada entre alta probabilidad y volumen de reseñas suficiente.”

¡Parte de la ‘lógica’ expuesta por estos LLM es verdaderamente ridícula! … y ninguno de ellos pareció captar los matices estadísticos reales…

Considerando cuántas variables hay en el juego de los LLM, parecería que los marcos de prueba integrales ‘in situ’ serán una característica no opcional en el futuro (¿un plugin? :slightly_smiling_face:)

Factores:

  • Versión/lanzamiento del modelo LLM (parecen ajustar el ajuste fino regularmente)
  • Estructura del prompt en varios niveles
  • Contenido de aprendizaje en contexto de varios tipos
  • Aspectos de matemáticas y lógica
  • Barreras de seguridad de censura
  • Herramientas auxiliares (js, python, julia, etc.)
  • Etc. Etc.