L'agente predefinito di rilevamento della lingua ha istruzioni in conflitto

Non ho mai visto questo causare problemi, ma sembra che sarebbe una buona idea sistemarlo:

Ti verrà fornito un frammento di testo e il tuo compito è rilevare la lingua del testo e restituirlo in un formato JSON specifico.

La tua risposta deve essere un codice lingua e nient’altro. Non racchiudere la risposta tra virgolette o altri caratteri.

1 Mi Piace

Posso confermarlo su alcuni modelli specifici che ho provato; non ha sempre fallito, ma ha dato errore su determinati testi.

Proverò la tua modifica. Grazie per averla condivisa!

1 Mi Piace

Sto notando che il sistema si confonde con elementi locali non legati alla lingua. Ad esempio, parlo spagnolo, vivo a Città del Messico (Messico), uso il dollaro messicano (Mex$) e preferisco utilizzare la virgola come separatore decimale.

Stiamo attualmente testando un prompt simile al seguente:

Ti verrà fornito un frammento di testo e il tuo compito è determinarne la lingua.

Per completare questo compito, segui questi passaggi:

1. Leggi e analizza attentamente il testo fornito.
2. Determina la lingua del testo in base alle sue caratteristiche, come vocabolario, grammatica e struttura delle frasi.
3. Non utilizzare link o codice di programmazione presenti nel testo per rilevare la localizzazione.
4. Identifica il codice di lingua appropriato per la lingua rilevata.

Ecco un elenco di codici di lingua comuni per riferimento:
- Inglese: en
- Spagnolo: es
- Francese: fr
- Tedesco: de
- Italiano: it
- Portoghese brasiliano: pt-BR
- Russo: ru
- Cinese semplificato: zh-CN
- Giapponese: ja
- Coreano: ko

Se la lingua non è presente in questo elenco, utilizza il codice del tag di lingua IETF appropriato.

5. Evita di utilizzare `und` e preferisci `en` rispetto alle varianti regionali `en-US` o `en-GB`.

Importante: basa la tua analisi esclusivamente sul testo fornito. Non utilizzare informazioni esterne né fare assunzioni sull'origine o sul contesto del testo. Non lasciarti confondere dai nomi di luoghi o lingue; si tratta della lingua del testo stesso, non di ciò di cui parla.

La tua risposta deve essere un codice di lingua, e nient'altro. Non racchiudere la risposta tra virgolette o altri caratteri.

Alcuni dettagli su quella riga finale si trovano qui; serve a evitare che l’LLM utilizzi virgolette o backtick trovati nelle istruzioni all’interno della sua risposta.

Ciò che stava accadendo era che alcuni LLM stavano interpretando questa indicazione in modo troppo letterale

 5. Evitare di usare `und` e preferire `en` rispetto a `en-US` o `en-GB`, a meno che il testo non indichi specificamente una variante regionale.

          Due esempi di scenario:
          Input: "Can you tell me what '私の世界で一番好きな食べ物はちらし丼です' means?"
          Output: "en"

e rispondevano con

"en"

o

`en`

invece di

en
1 Mi Piace

Sì, capisco l’ultima riga. È la prima riga che è in contraddizione con essa:

restituiscilo in un formato JSON specifico.

Sospetto anche che l’enfasi su locale e region stia causando confusione quando si parla di regioni e località.