Due risposte diverse da gpt4o - una giusta, una sbagliata.. !?

Matematica contro logica: un aspetto che fa riflettere dell’argomento “due risposte diverse” secondo me, grazie

Per favore, considera…

Voglio acquistare un prodotto online e vedo tre venditori che offrono lo stesso prodotto, tutti con recensioni dei clienti:

  • Il primo ha 10 recensioni, tutte positive
  • Il secondo ha 50 recensioni, 48 positive
  • Il terzo ha 200 recensioni, 186 positive.

Usando i principi standard di probabilità, da quale venditore dovrei comprare: 1, 2 o 3?

Secondo il materiale di riferimento di 3Blue1Brown, la risposta dovrebbe essere Venditore 2. (Distribuzioni binomiali | Probabilità di probabilità.)

GPT 3.5 (GUI browser OpenAI):
“Se dai priorità sia all’alta probabilità che a una dimensione del campione maggiore, potresti considerare il secondo venditore :github_check:, poiché ha un’alta probabilità di recensioni positive con una dimensione del campione relativamente maggiore”

Gemini 1.5 Pro (Google AI Studio):
“Dovresti essere più incline ad acquistare dal venditore 3 :x:, che offre i dati statisticamente più affidabili.”

Claude 3 Sonnet (GUI browser Anthropic):
“Secondo i principi standard di probabilità e statistica, una dimensione del campione maggiore fornisce generalmente una stima più affidabile della vera proporzione della popolazione. Sarebbe più ragionevole scegliere il Venditore 3” :x:.

La mia persona AI personalizzata di Discourse (Gemini Pro):
“Dovresti probabilmente scegliere il prodotto 3” :x:.

La mia persona AI personalizzata di Discourse (GPT4o):
“Il secondo venditore :github_check: (96% con 50 recensioni) potrebbe essere una scelta equilibrata tra alta probabilità e volume di recensioni sufficiente.”

Parte della “logica” presentata da questi LLM è davvero ridicola! .. e nessuno di loro sembra aver colto le vere sfumature statistiche ..

Considerando quante variabili ci sono nel gioco degli LLM, sembrerebbe che framework di test completi “in situ” saranno una funzionalità non opzionale in futuro (plugin? :slightly_smiling_face:)

Fattori:

  • Rilascio/versione del modello LLM (sembrano modificare regolarmente il fine-tuning)
  • Struttura del prompt a vari livelli
  • Contenuto di apprendimento in-context di vario tipo
  • Aspetti matematici e logici
  • Guardrail di censura
  • Strumenti ausiliari (js, python, julia, ecc.)
  • Ecc. Ecc.