기본 로케일 감지 에이전트에 충돌하는 지시가 있습니다

이 문제가 실제로 발생한 적은 없지만, 정리하는 것이 좋을 것 같습니다:

텍스트 조각이 주어지며, 해당 텍스트의 로케일(언어)을 감지하여 특정 JSON 형식으로 반환하는 것이 과제입니다.

응답은 언어 코드만 포함해야 하며, 그 외의 내용은 포함할 수 없습니다. 응답을 따옴표나 기타 다른 문자로 감싸지 마세요.

1개의 좋아요

제가 시도해 본 특정 모델에서 이를 확인할 수 있습니다. 항상 실패한 것은 아니었지만, 특정 텍스트에서 실패했습니다.

제안해 주신 조정 사항을 시도해 보겠습니다. 공유해 주셔서 감사합니다!

1개의 좋아요

비언어 로케일 관련 사항과 혼동되는 문제를 발견했습니다. 예를 들어, 저는 스페인어를 사용하며 멕시코 CDMX에 거주하고, 멕시코 페소(Mex$)를 사용하며, 소수점 구분자로 쉼표를 선호합니다.

현재 다음과 같은 프롬프트를 시험 적용하고 있습니다:

텍스트 조각이 주어지면, 해당 텍스트의 언어를 판별하는 것이 당신의 임무입니다.

이 작업을 완료하려면 다음 단계를 따르세요:

1. 제공된 텍스트를 주의 깊게 읽고 분석하세요.
2. 어휘, 문법, 문장 구조 등의 특성을 바탕으로 텍스트의 언어를 판별하세요.
3. 텍스트 내 링크나 프로그래밍 코드를 사용하여 로케일을 감지하지 마세요.
4. 감지된 언어에 해당하는 적절한 언어 코드를 식별하세요.

참고용 일반적인 언어 코드 목록은 다음과 같습니다:
- 영어: en
- 스페인어: es
- 프랑스어: fr
- 독일어: de
- 이탈리아어: it
- 브라질 포르투갈어: pt-BR
- 러시아어: ru
- 간체 중국어: zh-CN
- 일본어: ja
- 한국어: ko

언어가 이 목록에 없다면, 적절한 IETF 언어 태그 코드를 사용하세요.

5. `und`의 사용을 피하고, 지역 변형인 `en-US` 또는 `en-GB`보다는 `en`을 선호하세요.

중요: 분석은 제공된 텍스트에만 기반해야 합니다. 외부 정보를 사용하거나 텍스트의 출처나 맥락에 대한 추측을 하지 마세요. 지명이나 언어 이름에 혼동되지 마세요. 이는 텍스트가 다루는 내용이 아니라, 텍스트 자체의 언어에 관한 것입니다.

응답은 언어 코드만 포함되어야 하며, 그 외 다른 내용은 포함하지 마세요. 응답을 따옴표나 기타 문자로 감싸지 마세요.

마지막 줄에 대한 배경 정보는 여기에 있으며, 이는 LLM이 응답에서 지시문에서 찾은 따옴표나 백틱을 사용하지 않도록 방지합니다.

문제는 일부 LLM이 이를 너무 문자 그대로 해석했다는 것입니다.

 5. 텍스트가 특정 지역 변형을 명시적으로 나타내지 않는 한, `und` 사용은 피하고 `en-US` 또는 `en-GB`보다 `en`을 우선하세요.

          두 가지 예시 시나리오:
          입력: "Can you tell me what '私の世界で一番好きな食べ物はちらし丼です' means?"
          출력: "en"

그리고 다음과 같이 응답했습니다.

"en"

또는

`en`

다음과 같이 응답해야 하는데,

en