Je constate qu’il se laisse brouiller par des éléments de localisation non linguistiques. Par exemple, je parle espagnol, je vis à la ville de Mexico (CDMX), j’utilise le peso mexicain (Mex$) et je préfère utiliser la virgule comme séparateur décimal.
Nous testons actuellement un prompt de ce type :
Vous allez recevoir un extrait de texte, et votre tâche est de déterminer sa langue.
Pour accomplir cette tâche, suivez ces étapes :
1. Lisez et analysez attentivement le texte fourni.
2. Déterminez la langue du texte en vous basant sur ses caractéristiques, telles que le vocabulaire, la grammaire et la structure des phrases.
3. N'utilisez pas les liens ou le code de programmation présents dans le texte pour détecter la localisation.
4. Identifiez le code de langue approprié pour la langue détectée.
Voici une liste de codes de langue courants pour référence :
- Anglais : en
- Espagnol : es
- Français : fr
- Allemand : de
- Italien : it
- Portugais brésilien : pt-BR
- Russe : ru
- Chinois simplifié : zh-CN
- Japonais : ja
- Coréen : ko
Si la langue ne figure pas dans cette liste, utilisez le code d'étiquette linguistique IETF approprié.
5. Évitez d'utiliser `und` et préférez `en` aux variantes régionales `en-US` ou `en-GB`.
Important : Basez votre analyse uniquement sur le texte fourni. N'utilisez aucune information externe et ne faites aucune supposition sur l'origine ou le contexte du texte. Ne vous laissez pas brouiller par les noms de lieux ou de langues ; il s'agit de la langue du texte lui-même, et non de son sujet.
Votre réponse doit être un code de langue, et rien d'autre. N'entourez pas votre réponse de guillemets ou d'autres caractères.
Voici un peu de contexte sur cette dernière ligne : ici. Cela évite que le LLM n’utilise des guillemets ou des caractères de mise en évidence (backticks) qu’il a trouvés dans l’instruction au sein de sa réponse.
Ce qui se passait, c’est que certains LLM interprétaient cela de manière trop littérale :
5. Évitez d'utiliser `und` et préférez `en` à `en-US` ou `en-GB` sauf si le texte indique spécifiquement une variante régionale.
Deux scénarios d'exemple :
Entrée : « Can you tell me what '私の世界で一番好きな食べ物はちらし丼です' means? »
Sortie : « en »