Ich habe noch nie erlebt, dass dies Probleme verursacht, aber es scheint sinnvoll, das hier aufzuräumen:
Dir wird ein Textabschnitt vorgelegt, und deine Aufgabe besteht darin, das Sprachgebiet (die Sprache) des Textes zu erkennen und es in einem bestimmten JSON-Format zurückzugeben.
…
Deine Antwort muss ein Sprachcode sein und nichts anderes. Umgebe deine Antwort nicht in Anführungszeichen oder andere Zeichen.
Ich habe festgestellt, dass das System bei der Erkennung von nicht sprachlichen Lokaletiketten durcheinandergerät. Zum Beispiel spreche ich Spanisch, lebe in Mexiko-Stadt (Mexiko), nutze das mexikanische Peso (Mex$) und ziehe es vor, Kommas als Dezimaltrennzeichen zu verwenden.
Wir testen derzeit einen Prompt in dieser Art:
Dir wird ein Textausschnitt vorgelegt, und deine Aufgabe besteht darin, seine Sprache zu bestimmen.
Führe zur Erfüllung dieser Aufgabe die folgenden Schritte aus:
1. Lies und analysiere den bereitgestellten Text sorgfältig.
2. Bestimme die Sprache des Textes anhand seiner Merkmale, wie z. B. Vokabular, Grammatik und Satzbau.
3. Verwende keine Links oder Programmcode im Text, um das Locale zu erkennen.
4. Identifiziere den passenden Sprachcode für die erkannte Sprache.
Hier ist eine Liste gängiger Sprachcodes zur Orientierung:
- Englisch: en
- Spanisch: es
- Französisch: fr
- Deutsch: de
- Italienisch: it
- Brasilianisches Portugiesisch: pt-BR
- Russisch: ru
- Vereinfachtes Chinesisch: zh-CN
- Japanisch: ja
- Koreanisch: ko
Falls die Sprache nicht in dieser Liste enthalten ist, verwende den passenden IETF-Sprachtag.
5. Vermeide die Verwendung von `und` und bevorzuge `en` gegenüber den regionalen Varianten `en-US` oder `en-GB`.
Wichtig: Basiere deine Analyse ausschließlich auf dem bereitgestellten Text. Verwende keine externen Informationen und treffe keine Annahmen über den Ursprung oder den Kontext des Textes. Lass dich nicht von Orts- oder Sprachnamen verwirren; es geht hier um die Sprache des Textes selbst, nicht darum, worüber er handelt.
Deine Antwort muss ein Sprachcode sein und nichts anderes. Umklammere deine Antwort nicht in Anführungszeichen oder andere Zeichen.
Einige Hintergrundinformationen zu dieser letzten Zeile findest du hier. Sie verhindert, dass das LLM in seiner Antwort Anführungszeichen oder Backticks verwendet, die es in der Anweisung gefunden hat.
Das Problem war, dass einige LLMs dies zu wörtlich nahmen:
5. Avoid using `und` and prefer `en` over `en-US` or `en-GB` unless the text specifically indicates a regional variant.
Two example scenarios:
Input: "Can you tell me what '私の世界で一番好きな食べ物はちらし丼です' means?"
Output: "en"