Math vs logic .. un aspect déroutant du sujet des « deux réponses différentes » selon moi, merci
Veuillez considérer…
Je veux acheter un produit en ligne et je vois trois vendeurs proposer le même produit – tous ont des avis clients :
- Le premier a 10 avis, tous positifs
- Le second a 50 avis, 48 positifs
- Le troisième a 200 avis, 186 positifs.
En utilisant les principes standards de probabilité, de quel vendeur devrais-je acheter : 1, 2 ou 3 ?
Selon le matériel de référence de 3Blue1Brown, la réponse devrait être Vendeur 2. (Distributions binomiales | Probabilités de probabilités.)
GPT 3.5 (GUI navigateur OpenAI) :
« Si vous privilégiez à la fois une forte probabilité et une taille d’échantillon plus importante, vous pourriez envisager le deuxième vendeur
, car il a une forte probabilité d’avis positifs avec une taille d’échantillon relativement plus grande »
Gemini 1.5 Pro (Google AI Studio) :
« Vous devriez être le plus enclin à acheter auprès du vendeur 3
, qui offre les données les plus statistiquement fiables. »
Claude 3 Sonnet (GUI navigateur Anthropic) :
« Selon les principes standards de probabilité et de statistiques, une taille d’échantillon plus grande fournit généralement une estimation plus fiable de la proportion réelle de la population. Il serait plus raisonnable de choisir le Vendeur 3 »
.
Ma persona IA Discourse personnalisée (Gemini Pro) :
« Vous devriez probablement opter pour le produit 3 »
.
Ma persona IA Discourse personnalisée (GPT4o) :
« Le deuxième vendeur
(96 % avec 50 avis) pourrait être un choix équilibré entre une forte probabilité et un volume d’avis suffisant. »
Une partie de la « logique » avancée par ces LLM est vraiment risible ! .. et aucun d’entre eux ne semble avoir saisi les véritables nuances statistiques ..
Compte tenu du nombre de variables dans le jeu des LLM, il semblerait que des cadres de test complets « in situ » seront une fonctionnalité non optionnelle à l’avenir (plugin ?
)
Facteurs :
- Version/version du modèle LLM (ils semblent ajuster le réglage fin régulièrement)
- Structure du prompt à différents niveaux
- Contenu d’apprentissage en contexte de divers types
- Aspects mathématiques et logiques
- Garde-fous de censure
- Outils auxiliaires (js, python, julia, etc.)
- Etc. Etc.
