gpt4o에서 두 가지 다른 답변 - 하나는 맞고, 하나는 틀림.. !?

포럼 헬퍼 봇(gpt4o)에게 다음 질문을 했더니 잘못된 답변을 받았습니다.

:grey_question: 햇볕에 10개의 젖은 수건을 말리는 데 30분이 걸린다면, 15개의 젖은 수건을 말리는 데 얼마나 걸릴까요?

포럼 봇의 답변:

:x: “같은 조건에서 15개의 젖은 수건을 말리는 데 45분이 걸립니다.”

하지만 OpenAI 브라우저 인터페이스를 통해 gpt4o에게 같은 질문을 했을 때:

:github_check: “마찬가지로 펼쳐 놓고 햇볕을 충분히 쬐게 한다면 15개의 젖은 수건을 말리는 데도 30분이 걸릴 것입니다.”

혹시 포럼 버전의 gpt4o에서 temperature 설정이 너무 높은 건가요?

포럼 헬퍼는 기존 포럼 콘텐츠로 RAG(검색 증강 생성)를 적용해 조정되어 있지만, 질문한 내용은 그와 전혀 관련이 없습니다. 이 경우 ‘창의적’ 페르소나, 즉 기본 LLM이 더 적합합니다.

정말 일리 있는 말이네요.! .. 감사합니다

Creative Bot: “겹치지 않도록 펼칠 수 있는 수건 수를 초과하거나 공간이 좁아져 햇빛에 노출되는 시간이 줄어든다면, 더 오래 걸릴 수 있습니다. 조건이 최적 상태로 유지되고 10개의 수건을 말리는 경우와 유사하다면, 건조 시간은 동일하게 30분으로 유지되어야 합니다.”

참고로, LLM에는 temperature와 top p를 사용하여 설정되는 무작위성이라는 측면이 있습니다.

더 예측 가능하고 무작위성이 적은 결과를 원한다면, 무작위성이 감소된 페르소나를 생성하세요.

참조: AI bot - Agents

다양한 오픈소스 및 상용 LLM을 표준 AI 봇 페르소나와 사용자 정의 페르소나로 자유롭게 조합하여 설정하는 데 좋은 성과를 얻고 있습니다. 각 에이전트가 자체적인 RAG 컨텍스트, 카테고리, 그룹 등을 가질 수 있다는 아이디어는 정말 멋지네요. 수많은 사용 사례를 열어줄 것 같습니다!

정말 놀랍습니다! 이는 많은 주요 앱들이 어떤 이유로든 달성하지 못하는 디스커스(Discourse) 플랫폼의 놀라운 '재해석’입니다. 디스커스 팀 여러분, bravo! 앞으로 나아가죠.

그리고 하나의 보편적 진실이 있습니다: 언어 모델은 수학 계산과는 다른 것이며, 외부 도구가 없으면 모델은 수학에서 악명 높게 약합니다.

네. 이전 모델들은 심지어 간단한 수학이나 단순한 논리에서도 특히 부진합니다. 예를 들어, 이 간단한 퍼즐을 보면:

나는 엘리베이터가 고장 난 아파트에 살고 있습니다.

짝수 번호인 층의 버튼을 누르면 엘리베이터는 그 층으로 올라가지만, 문은 열리지 않고 다시 내가 출발한 곳으로 돌아갑니다.

만약 1층에서 엘리베이터에 올라타 4층 버튼을 누르고, 엘리베이터가 멈추면 내리고 나서 계단으로 3층을 더 올라간다면, 결국 몇 층에 도달하게 될까요?

정답: 4층

제 Discourse AI 페르소나 중 gpt4o 기반 모델들은 이 문제를 모두 정확히 풀었습니다. (로컬/RAG 컨텍스트만 가진 페르소나는 관련 컨텍스트가 없어서 제외하구요.)

하지만 방금 OpenAI GUI에서 gpt 3.5로 이 문제를 돌려봤더니 다음과 같이 답했습니다.

단계별로 나눠서 살펴보겠습니다:

  1. 1층에서 엘리베이터에 올라타 4층 버튼을 누릅니다.
  2. 엘리베이터는 4층까지 올라가지만 문이 열리지 않고, 다시 출발한 곳(1층)으로 돌아갑니다.
  3. 4층에서 엘리베이터에서 내려 계단으로 3층을 더 올라갑니다.

1층에서 시작해서 계단으로 3층을 더 올라갔으므로, 결국 7층에 도달하게 됩니다.

그리고 묘하게도… 브라우저 GUI에서 Gemini 1.5 Pro를 사용해 수건 건조에 대해 물어보니…

… 10개의 수건이라면, 각 수건에 더 많은 표면적이 햇빛과 공기 중에 노출되어 더 빨리 마를 수 있습니다. 15개의 수건이라면, 일부 수건이 뭉치거나 겹쳐서 수건당 실제 건조 표면적이 줄어들 수 있습니다.

따라서 50% 더 많은 수건(30분의 1.5배)을 말리는 데 단순히 50% 더 많은 시간이 걸리는 것은 아닙니다. 더 많은 시간이 걸리긴 하겠지만, 정확히 1.5배는 아닐 가능성이 큽니다.

추정:

합리적인 추정치는 약 45분에서 1시간 정도입니다. 이는 수건이 많아지면 건조 효율이 낮아진다는 점을 고려하되, 건조 시간과 수건 수 사이의 완벽한 선형 관계를 가정하지 않기 때문입니다.

… 무서운 일이죠! : )

결론적으로 LLM은 수학 연산을 제대로 수행하지 못합니다. 하지만 JavaScript에 대한 접근 권한을 제공한다면… 이야기가 완전히 달라집니다:

하지만 여기서는 그게 문제가 아니지 않나요?

문제는 추론에 있습니다.

LLM에게 계산기 접근 권한을 주는 것은 분명 도움이 되지만(Chatbot은 이미 오래전부터 그 권한을 가지고 있었습니다), 이는 나쁜 논리나 추론을 보완하지는 못합니다. 잘못된 계산을 “올바르게” 수행하는 것은 다른 잘못된 계산을 하는 것과 마찬가지로 나쁘다고 할 수 있습니다. 사실 전자(잘못된 계산을 올바르게 수행하는 것)는 오히려 오류를 더 설득력 있게 만들어 오류를 발견하기 더 어렵게 만들 수도 있습니다.

수학과 논리 … 제 생각에는 "두 가지 다른 답변 주제"에 있어 정신을 어지럽히는 측면이죠. 감사합니다.

다음 내용을 고려해 주세요…

온라인에서 제품을 구매하려고 하는데, 세 명의 판매자가 동일한 제품을 제공하고 있습니다. 모두 고객 리뷰가 있습니다:

  • 첫 번째 판매자는 10개의 리뷰가 있으며, 모두 긍정적입니다.
  • 두 번째 판매자는 50개의 리뷰가 있으며, 48개가 긍정적입니다.
  • 세 번째 판매자는 200개의 리뷰가 있으며, 186개가 긍정적입니다.

확률의 표준 원리를 사용하여, 저는 어느 판매자(1, 2, 또는 3)에게서 구매해야 할까요?

3Blue1Brown 참고 자료에 따르면, 정답은 판매자 2여야 합니다. (이항 분포 | 확률의 확률.)

GPT 3.5 (OpenAI 브라우저 GUI):
“높은 확률과 더 큰 표본 크기를 모두 우선시한다면, 상대적으로 더 큰 표본 크기를 가지면서 긍정적 리뷰의 확률이 높은 두 번째 판매자를 :github_check: 고려해 볼 수 있습니다.”

Gemini 1.5 Pro (Google AI Studio):
“가장 통계적으로 신뢰할 수 있는 데이터를 제공하는 세 번째 판매자 :x:에게서 구매하는 것이 가장 적절합니다.”

Claude 3 Sonnet (Anthropic 브라우저 GUI):
“확률과 통계의 표준 원리에 따르면, 더 큰 표본 크기는 일반적으로 모집단의 진정한 비율에 대한 더 신뢰할 수 있는 추정치를 제공합니다. 판매자 3을 선택하는 것이 가장 합리적입니다” :x: .

제 맞춤형 Discourse AI 페르소나 (Gemini Pro):
“제품 3을 선택하는 것이 적절할 것입니다” :x: .

제 맞춤형 Discourse AI 페르소나 (GPT4o):
“두 번째 :github_check: 판매자(50개 리뷰 중 96%)는 높은 확률과 충분한 리뷰 수 사이의 균형 잡힌 선택이 될 수 있습니다.”

이 LLM들이 제시한 ‘논리’ 중 일부는 정말 웃기게 느껴집니다! … 그리고 그 누구도 진정한 통계적 뉘앙스를 파악하지 못한 것 같습니다 ..

LLM 게임에는 얼마나 많은 변수가 있는지 고려해 보면, 포괄적인 ‘인 시투(in situ)’ 테스트 프레임워크가 앞으로 필수 기능이 될 것 같습니다 (플러그인? :slightly_smiling_face:)

요소들 :

  • LLM 모델 릴리스/버전 (정규적으로 파인 튜닝을 조정하는 것 같습니다)
  • 다양한 수준의 프롬프트 구조
  • 다양한 유형의 컨텍스트 학습 콘텐츠
  • 수학 및 논리 측면
  • 검열 가드레일
  • 부수적 도구 (js, python, julia 등)
  • 기타 등등.

각주..

평범한 걸 두고 괜히 더 파고드는 성격이라.. Discourse AI 봇(기반이 Gemini)이 ‘틀린’ 답을 내린 것에 대해 라플라스 확률 이론에 대한 맥락을 추가로 주었어.

맥락에서 그 이론을 학습했음에도 불구하고 여전히 틀린 답을 내놨지.

그 다음에 라플라스에 대한 지식을 적용해 보라고 물었어.. ! ? 드디어 '정답’이 나왔네..

.. 일반적인 결론: 봇들은 그저 이상해.. 사람들처럼 말이야.. 하지만 사람들처럼 봇들도 매우 흥미로운 방식으로 학습해. 결국 봇들은 그 본질이 거대한 확률적 언어 추론의 확률적 웹에 불과하지만.. 봇들은 수학, 논리, 통계 문제를 해결하는 데 도움을 주며, 이는 디스코 파티 테이블에서 그들의 자리를 정당화하기에 충분해.. :smile: :coffee:

그들은 배우지 못합니다. OpenAI 모델에 대해서는 그렇다고 할 수 있고, 다른 모델에 대해서는 잘 모르겠습니다. 봇은 토큰, 알고리즘, 그리고 몇 가지 신비로운 요소에 따라 주어진 정보를 사용할 수도 있고 사용할 수도 없습니다.

하지만 우리는 올바른 방향으로 이끌어줄 수 있습니다. 그런데도 다섯 번쯤 답변을 주고받으면 그걸 잊어버립니다.

네, 맞는 말씀이네요.. 실제로 인간처럼 학습하지는 않거든요!

이 스레드에서는 전통적인 인간의 장기 학습이 아니라 컨텍스트 학습과 관련된 방법론에 대해 이야기하고 있는 것 같습니다. 비록 일시적이긴 하지만, 최신 모델들이 달성하고 있는 엄청나게 큰 컨텍스트 크기(예: 100만 토큰 이상) 덕분에 컨텍스트 학습은 정말로 흥미로워지고 있습니다.

예를 들어.. 특정 모델이 라플라스 확률 원지에 대한 지식이 필요한 질문에 더 안정적으로 답변하도록 하려면, 컨텍스트/프롬프팅 접근 방식을 통해 하드코딩된 시스템 프롬프트나 벡터 DB 검색 등을 사용하여 해당 컨텍스트를 입력할 수 있습니다.

라플라스 지식이 담긴 작은 문서(약 1,000단어)를 업로드하여 수행한 실험 예시는 다음과 같습니다.

가정:

  • 봇은 라플라스에 대해 사전 학습되지 않았습니다(위 실패 사례 참조)..
  • 특정 지식에 대해 봇은 해당 Discourse 인스턴스에 있는 내용으로 제한됩니다

커스텀 페르소나 설정
(플러그인 전문가분들, 필요시 수정해 주세요!)


AI

활성화? 예
우선순위? 예
채팅 허용? 예
멘션 허용? 예

이름: AlphaBot
설명: 라플라스 지식을 가진 확률 퍼즐 봇
기본 언어 모델: GeminiPro

활성화 명령어: 검색, 카테고리, 읽기

시스템 프롬프트:

라플라스 확률 비교 방법을 설명하는 로컬에서 제공된 컨텍스트를 사용하여 질문에 답변하세요. 가능한 한 철저하고 포괄적으로 답변하되, 웹이나 외부 출처를 검색하지 마세요. 로컬 컨텍스트만 사용하고 라플라스 기법을 사용하는 데 집중하세요.

업로드: Laplace-tutorial.txt


지시문에 이미 포함되어 있기 때문에 라플라스를 언급할 필요가 없다는 점을 주목하세요: