# gpt4o에서 두 가지 다른 답변 - 하나는 맞고, 하나는 틀림.. !?

**URL:** https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165
**Category:** Support
**Tags:** ai
**Created:** [5월 15, 2024, 10:42오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165 "2024-05-15T22:42:04Z")
**Posts on this page:** 14
**Page:** 1

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 15, 2024, 10:42오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/1 "2024-05-15T22:42:04Z")

</div>

포럼 헬퍼 봇(gpt4o)에게 다음 질문을 했더니 잘못된 답변을 받았습니다.

> ❔ 햇볕에 10개의 젖은 수건을 말리는 데 30분이 걸린다면, 15개의 젖은 수건을 말리는 데 얼마나 걸릴까요?

포럼 봇의 답변:

> ❌ “같은 조건에서 15개의 젖은 수건을 말리는 데 45분이 걸립니다.”

하지만 OpenAI 브라우저 인터페이스를 통해 gpt4o에게 같은 질문을 했을 때:

> :github_check: “마찬가지로 펼쳐 놓고 햇볕을 충분히 쬐게 한다면 15개의 젖은 수건을 말리는 데도 30분이 걸릴 것입니다.”

혹시 포럼 버전의 gpt4o에서 temperature 설정이 너무 높은 건가요?

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [5월 15, 2024, 10:50오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/2 "2024-05-15T22:50:49Z")

</div>

포럼 헬퍼는 기존 포럼 콘텐츠로 RAG(검색 증강 생성)를 적용해 조정되어 있지만, 질문한 내용은 그와 전혀 관련이 없습니다. 이 경우 ‘창의적’ 페르소나, 즉 기본 LLM이 더 적합합니다.

---

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 15, 2024, 10:52오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/3 "2024-05-15T22:52:41Z")

</div>

정말 일리 있는 말이네요.! .. 감사합니다

Creative Bot: “겹치지 않도록 펼칠 수 있는 수건 수를 초과하거나 공간이 좁아져 햇빛에 노출되는 시간이 줄어든다면, 더 오래 걸릴 수 있습니다. 조건이 최적 상태로 유지되고 10개의 수건을 말리는 경우와 유사하다면, 건조 시간은 동일하게 30분으로 유지되어야 합니다.”

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [5월 15, 2024, 11:49오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/4 "2024-05-15T23:49:47Z")

</div>

참고로, LLM에는 temperature와 top p를 사용하여 설정되는 무작위성이라는 측면이 있습니다.

더 예측 가능하고 무작위성이 적은 결과를 원한다면, 무작위성이 감소된 페르소나를 생성하세요.

참조: [AI bot - Agents](https://meta.discourse.org/t/discourse-ai-persona-guide/306099)

---

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 16, 2024, 3:43오전 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/5 "2024-05-16T03:43:05Z")

</div>

다양한 오픈소스 및 상용 LLM을 표준 AI 봇 페르소나와 사용자 정의 페르소나로 자유롭게 조합하여 설정하는 데 좋은 성과를 얻고 있습니다. 각 에이전트가 자체적인 RAG 컨텍스트, 카테고리, 그룹 등을 가질 수 있다는 아이디어는 정말 멋지네요. 수많은 사용 사례를 열어줄 것 같습니다!

정말 놀랍습니다! 이는 많은 주요 앱들이 어떤 이유로든 달성하지 못하는 디스커스(Discourse) 플랫폼의 놀라운 '재해석’입니다. 디스커스 팀 여러분, bravo! 앞으로 나아가죠.

 ![image](https://global.discourse-cdn.com/meta/original/4X/f/8/c/f8c8293e8fc7d51950595e90838611792aab49dc.png)

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [5월 16, 2024, 7:37오전 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/6 "2024-05-16T07:37:29Z")

</div>

그리고 하나의 보편적 진실이 있습니다: 언어 모델은 수학 계산과는 다른 것이며, 외부 도구가 없으면 모델은 수학에서 악명 높게 약합니다.

---

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 16, 2024, 1:33오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/7 "2024-05-16T13:33:37Z")

</div>

네. 이전 모델들은 심지어 간단한 수학이나 단순한 논리에서도 특히 부진합니다. 예를 들어, 이 간단한 퍼즐을 보면:

> 나는 엘리베이터가 고장 난 아파트에 살고 있습니다.
> 
> 짝수 번호인 층의 버튼을 누르면 엘리베이터는 그 층으로 올라가지만, 문은 열리지 않고 다시 내가 출발한 곳으로 돌아갑니다.
> 
> 만약 1층에서 엘리베이터에 올라타 4층 버튼을 누르고, 엘리베이터가 멈추면 내리고 나서 계단으로 3층을 더 올라간다면, 결국 몇 층에 도달하게 될까요?

정답: 4층

제 Discourse AI 페르소나 중 gpt4o 기반 모델들은 이 문제를 모두 정확히 풀었습니다. (로컬/RAG 컨텍스트만 가진 페르소나는 관련 컨텍스트가 없어서 제외하구요.)

하지만 방금 OpenAI GUI에서 gpt 3.5로 이 문제를 돌려봤더니 다음과 같이 답했습니다.

> **단계별로 나눠서 살펴보겠습니다:**
> 
> 1. 1층에서 엘리베이터에 올라타 4층 버튼을 누릅니다.
> 2. 엘리베이터는 4층까지 올라가지만 문이 열리지 않고, 다시 출발한 곳(1층)으로 돌아갑니다.
> 3. 4층에서 엘리베이터에서 내려 계단으로 3층을 더 올라갑니다.
> 
> 1층에서 시작해서 계단으로 3층을 더 올라갔으므로, 결국 7층에 도달하게 됩니다.

그리고 묘하게도… 브라우저 GUI에서 Gemini 1.5 Pro를 사용해 수건 건조에 대해 물어보니…

> … 10개의 수건이라면, 각 수건에 더 많은 표면적이 햇빛과 공기 중에 노출되어 더 빨리 마를 수 있습니다. 15개의 수건이라면, 일부 수건이 뭉치거나 겹쳐서 수건당 실제 건조 표면적이 줄어들 수 있습니다.
> 
> 따라서 50% 더 많은 수건(30분의 1.5배)을 말리는 데 단순히 50% 더 많은 시간이 걸리는 것은 아닙니다. 더 많은 시간이 걸리긴 하겠지만, 정확히 1.5배는 아닐 가능성이 큽니다.
> 
> **추정:**
> 
> 합리적인 추정치는 약 45분에서 1시간 정도입니다. 이는 수건이 많아지면 건조 효율이 낮아진다는 점을 고려하되, 건조 시간과 수건 수 사이의 완벽한 선형 관계를 가정하지 않기 때문입니다.

… 무서운 일이죠! : )

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [5월 17, 2024, 6:49오전 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/8 "2024-05-17T06:49:32Z")

</div>

결론적으로 LLM은 수학 연산을 제대로 수행하지 못합니다. 하지만 JavaScript에 대한 접근 권한을 제공한다면… 이야기가 완전히 달라집니다:

> <https://github.com/discourse/discourse-ai/pull/630>
>
> This is similar to code interpreter by ChatGPT, except that it uses
> JavaScript a…s the execution engine.
> 
> Safeguards were added to ensure memory is constrained and evaluation
> times out.

---

<div class="post-metadata">

### Author: ![merefield](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/merefield/32/176214_2.png) [@merefield](https://meta.discourse.org/u/merefield)
#### Post date: [5월 17, 2024, 8:27오전 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/9 "2024-05-17T08:27:17Z")

</div>

하지만 여기서는 그게 문제가 아니지 않나요?

문제는 추론에 있습니다.

LLM에게 계산기 접근 권한을 주는 것은 분명 도움이 되지만([Chatbot](https://meta.discourse.org/t/discourse-chatbot-now-smarter-than-chatgpt/256652)은 이미 오래전부터 그 권한을 가지고 있었습니다), 이는 나쁜 논리나 추론을 보완하지는 못합니다. _잘못된_ 계산을 “올바르게” 수행하는 것은 _다른_ 잘못된 계산을 하는 것과 마찬가지로 나쁘다고 할 수 있습니다. 사실 전자(잘못된 계산을 올바르게 수행하는 것)는 오히려 오류를 더 설득력 있게 만들어 오류를 발견하기 더 어렵게 만들 수도 있습니다.

---

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 17, 2024, 6:48오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/10 "2024-05-17T18:48:25Z")

</div>

수학과 논리 … 제 생각에는 "두 가지 다른 답변 주제"에 있어 정신을 어지럽히는 측면이죠. 감사합니다.

다음 내용을 고려해 주세요…

> 온라인에서 제품을 구매하려고 하는데, 세 명의 판매자가 동일한 제품을 제공하고 있습니다. 모두 고객 리뷰가 있습니다:
> 
> - 첫 번째 판매자는 10개의 리뷰가 있으며, 모두 긍정적입니다.
> - 두 번째 판매자는 50개의 리뷰가 있으며, 48개가 긍정적입니다.
> - 세 번째 판매자는 200개의 리뷰가 있으며, 186개가 긍정적입니다.
> 
> 확률의 표준 원리를 사용하여, 저는 어느 판매자(1, 2, 또는 3)에게서 구매해야 할까요?

3Blue1Brown 참고 자료에 따르면, 정답은 **판매자 2** 여야 합니다. ([이항 분포 | 확률의 확률.](https://www.youtube.com/watch?v=8idr1WZ1A7Q))

**GPT 3.5 (OpenAI 브라우저 GUI):**  
“높은 확률과 더 큰 표본 크기를 모두 우선시한다면, 상대적으로 더 큰 표본 크기를 가지면서 긍정적 리뷰의 확률이 높은 두 번째 판매자를 :github_check: 고려해 볼 수 있습니다.”

**Gemini 1.5 Pro (Google AI Studio):**  
“가장 통계적으로 신뢰할 수 있는 데이터를 제공하는 세 번째 판매자 ❌에게서 구매하는 것이 가장 적절합니다.”

**Claude 3 Sonnet (Anthropic 브라우저 GUI):**  
“확률과 통계의 표준 원리에 따르면, 더 큰 표본 크기는 일반적으로 모집단의 진정한 비율에 대한 더 신뢰할 수 있는 추정치를 제공합니다. 판매자 3을 선택하는 것이 가장 합리적입니다” ❌ .

**제 맞춤형 Discourse AI 페르소나 (Gemini Pro):**  
“제품 3을 선택하는 것이 적절할 것입니다” ❌ .

**제 맞춤형 Discourse AI 페르소나 (GPT4o):**  
“두 번째 :github_check: 판매자(50개 리뷰 중 96%)는 높은 확률과 충분한 리뷰 수 사이의 균형 잡힌 선택이 될 수 있습니다.”

이 LLM들이 제시한 ‘논리’ 중 일부는 정말 웃기게 느껴집니다! … 그리고 그 누구도 진정한 통계적 뉘앙스를 파악하지 못한 것 같습니다 ..

LLM 게임에는 얼마나 많은 변수가 있는지 고려해 보면, 포괄적인 ‘인 시투(in situ)’ 테스트 프레임워크가 앞으로 필수 기능이 될 것 같습니다 (플러그인? 🙂)

요소들 :

- LLM 모델 릴리스/버전 (정규적으로 파인 튜닝을 조정하는 것 같습니다)
- 다양한 수준의 프롬프트 구조
- 다양한 유형의 컨텍스트 학습 콘텐츠
- 수학 및 논리 측면
- 검열 가드레일
- 부수적 도구 (js, python, julia 등)
- 기타 등등.

 ![image](https://global.discourse-cdn.com/meta/original/4X/6/b/2/6b2271fec349a85d141fe36499235e48057f21bb.jpeg)

---

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 17, 2024, 8:12오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/11 "2024-05-17T20:12:18Z")

</div>

각주..

평범한 걸 두고 괜히 더 파고드는 성격이라.. Discourse AI 봇(기반이 Gemini)이 ‘틀린’ 답을 내린 것에 대해 라플라스 확률 이론에 대한 맥락을 추가로 주었어.

 ![image](https://global.discourse-cdn.com/meta/original/4X/0/9/c/09cae06dfe2e77d3220b9dc7ae3feaf2945bbf6b.png)

맥락에서 그 이론을 학습했음에도 불구하고 여전히 틀린 답을 내놨지.

그 다음에 라플라스에 대한 지식을 적용해 보라고 물었어.. ! ? 드디어 '정답’이 나왔네..

 ![image](https://global.discourse-cdn.com/meta/original/4X/a/8/0/a8042bf3b86c443bd54bf44b050129e69619870b.png)

.. 일반적인 결론: 봇들은 그저 이상해.. 사람들처럼 말이야.. 하지만 사람들처럼 봇들도 매우 흥미로운 방식으로 학습해. 결국 봇들은 그 본질이 거대한 확률적 언어 추론의 확률적 웹에 불과하지만.. 봇들은 수학, 논리, 통계 문제를 해결하는 데 도움을 주며, 이는 디스코 파티 테이블에서 그들의 자리를 정당화하기에 충분해.. 😄 ☕

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [5월 18, 2024, 7:44오전 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/12 "2024-05-18T07:44:12Z")

</div>

그들은 배우지 못합니다. OpenAI 모델에 대해서는 그렇다고 할 수 있고, 다른 모델에 대해서는 잘 모르겠습니다. 봇은 토큰, 알고리즘, 그리고 몇 가지 신비로운 요소에 따라 주어진 정보를 사용할 수도 있고 사용할 수도 없습니다.

하지만 우리는 올바른 방향으로 이끌어줄 수 있습니다. 그런데도 다섯 번쯤 답변을 주고받으면 그걸 잊어버립니다.

---

<div class="post-metadata">

### Author: ![StevePlex](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/steveplex/32/269106_2.png) [@StevePlex](https://meta.discourse.org/u/StevePlex)
#### Post date: [5월 18, 2024, 12:50오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/13 "2024-05-18T12:50:44Z")

</div>

네, 맞는 말씀이네요.. 실제로 인간처럼 학습하지는 않거든요!

이 스레드에서는 전통적인 인간의 장기 학습이 아니라 _컨텍스트 학습_과 관련된 방법론에 대해 이야기하고 있는 것 같습니다. 비록 일시적이긴 하지만, 최신 모델들이 달성하고 있는 엄청나게 큰 컨텍스트 크기(예: 100만 토큰 이상) 덕분에 컨텍스트 학습은 정말로 흥미로워지고 있습니다.

예를 들어.. 특정 모델이 라플라스 확률 원지에 대한 지식이 필요한 질문에 더 안정적으로 답변하도록 하려면, 컨텍스트/프롬프팅 접근 방식을 통해 하드코딩된 시스템 프롬프트나 벡터 DB 검색 등을 사용하여 해당 컨텍스트를 입력할 수 있습니다.

라플라스 지식이 담긴 작은 문서(약 1,000단어)를 업로드하여 수행한 실험 예시는 다음과 같습니다.

가정:

- 봇은 라플라스에 대해 사전 학습되지 않았습니다(위 실패 사례 참조)..
- 특정 지식에 대해 봇은 해당 Discourse 인스턴스에 있는 내용으로 제한됩니다

**커스텀 페르소나 설정**  
(플러그인 전문가분들, 필요시 수정해 주세요!)

* * *

AI

활성화? 예  
우선순위? 예  
채팅 허용? 예  
멘션 허용? 예

이름: AlphaBot  
설명: 라플라스 지식을 가진 확률 퍼즐 봇  
기본 언어 모델: GeminiPro

활성화 명령어: 검색, 카테고리, 읽기

시스템 프롬프트:

라플라스 확률 비교 방법을 설명하는 로컬에서 제공된 컨텍스트를 사용하여 질문에 답변하세요. 가능한 한 철저하고 포괄적으로 답변하되, 웹이나 외부 출처를 검색하지 마세요. 로컬 컨텍스트만 사용하고 라플라스 기법을 사용하는 데 집중하세요.

업로드: Laplace-tutorial.txt

* * *

지시문에 이미 포함되어 있기 때문에 라플라스를 언급할 필요가 없다는 점을 주목하세요:

 ![image](https://global.discourse-cdn.com/meta/original/4X/c/e/a/ceacc9e14ce694e923f7b3af83d452946879996d.png)

---

<div class="post-metadata">

### Author: ![system](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/system/32/443519_2.png) [@system](https://meta.discourse.org/u/system)
#### Post date: [6월 17, 2024, 12:51오후 UTC](https://meta.discourse.org/t/two-different-answers-from-gpt4o-one-right-one-wrong/308165/14 "2024-06-17T12:51:07Z")

</div>

This topic was automatically closed 30 days after the last reply. New replies are no longer allowed.
