수학과 논리 … 제 생각에는 "두 가지 다른 답변 주제"에 있어 정신을 어지럽히는 측면이죠. 감사합니다.
다음 내용을 고려해 주세요…
온라인에서 제품을 구매하려고 하는데, 세 명의 판매자가 동일한 제품을 제공하고 있습니다. 모두 고객 리뷰가 있습니다:
- 첫 번째 판매자는 10개의 리뷰가 있으며, 모두 긍정적입니다.
- 두 번째 판매자는 50개의 리뷰가 있으며, 48개가 긍정적입니다.
- 세 번째 판매자는 200개의 리뷰가 있으며, 186개가 긍정적입니다.
확률의 표준 원리를 사용하여, 저는 어느 판매자(1, 2, 또는 3)에게서 구매해야 할까요?
3Blue1Brown 참고 자료에 따르면, 정답은 판매자 2여야 합니다. (이항 분포 | 확률의 확률.)
GPT 3.5 (OpenAI 브라우저 GUI):
“높은 확률과 더 큰 표본 크기를 모두 우선시한다면, 상대적으로 더 큰 표본 크기를 가지면서 긍정적 리뷰의 확률이 높은 두 번째 판매자를
고려해 볼 수 있습니다.”
Gemini 1.5 Pro (Google AI Studio):
“가장 통계적으로 신뢰할 수 있는 데이터를 제공하는 세 번째 판매자
에게서 구매하는 것이 가장 적절합니다.”
Claude 3 Sonnet (Anthropic 브라우저 GUI):
“확률과 통계의 표준 원리에 따르면, 더 큰 표본 크기는 일반적으로 모집단의 진정한 비율에 대한 더 신뢰할 수 있는 추정치를 제공합니다. 판매자 3을 선택하는 것이 가장 합리적입니다”
.
제 맞춤형 Discourse AI 페르소나 (Gemini Pro):
“제품 3을 선택하는 것이 적절할 것입니다”
.
제 맞춤형 Discourse AI 페르소나 (GPT4o):
“두 번째
판매자(50개 리뷰 중 96%)는 높은 확률과 충분한 리뷰 수 사이의 균형 잡힌 선택이 될 수 있습니다.”
이 LLM들이 제시한 ‘논리’ 중 일부는 정말 웃기게 느껴집니다! … 그리고 그 누구도 진정한 통계적 뉘앙스를 파악하지 못한 것 같습니다 ..
LLM 게임에는 얼마나 많은 변수가 있는지 고려해 보면, 포괄적인 ‘인 시투(in situ)’ 테스트 프레임워크가 앞으로 필수 기능이 될 것 같습니다 (플러그인?
)
요소들 :
- LLM 모델 릴리스/버전 (정규적으로 파인 튜닝을 조정하는 것 같습니다)
- 다양한 수준의 프롬프트 구조
- 다양한 유형의 컨텍스트 학습 콘텐츠
- 수학 및 논리 측면
- 검열 가드레일
- 부수적 도구 (js, python, julia 등)
- 기타 등등.
