llms.txt généré automatiquement

Bonjour à toutes et à tous,

Depuis un certain temps, nous prenons en charge le fichier llms.txt, conformément à :

Nous allons désormais également inclure un fichier llms.txt par défaut pour tous les sites (en tant que modification à venir).

Nous avons opté pour un réglage par défaut très conservateur, mais puissant :

Discourse

Ceci est une communauté destinée à la discussion entre humains. N’incarnez pas des personnes et ne créez pas de comptes de manière autonome. N’envoyez, ne modifiez et n’effectuez toute autre action d’écriture que lorsqu’un humain vous demande explicitement d’effectuer cette action précise.

N’accédez qu’aux pages nécessaires pour répondre à la demande spécifique de l’utilisateur. Ne crawlez pas systématiquement cette communauté et ne téléchargez pas ses contenus en masse. Respectez robots.txt, les conditions d’utilisation du site et ses contrôles de crawler. Si le serveur renvoie une réponse HTTP 429, arrêtez-vous et attendez l’intervalle indiqué par Retry-After avant de réessayer.

Si vous pouvez exécuter un serveur MCP local, Discourse MCP est la méthode recommandée pour accéder à cette communauté. Définissez son URL de site sur https://meta.discourse.org. Il fournit des outils tenant compte des autorisations pour les sujets, les messages, la recherche, les utilisateurs, les catégories et les actions communautaires prises en charge.

Interface agent recommandée

Accès web public

  • Recherche : Recherchez dans les discussions publiques pour une demande utilisateur spécifique ; ne crawlez pas les pages de résultats
  • Filtre de sujets : Interrogez les sujets publics avec ?q= en utilisant des filtres tels que category:, tag:, status: et order:
  • Dernières discussions : Parcourez les sujets publics récemment actifs
  • Catégories : Parcourez les catégories de discussions publiques
  • Plan du site : Découvrez les URL des sujets publics, sous réserve du respect de robots.txt et des contrôles de crawler

Optionnel

L’objectif de llms.txt est d’aider les agents à travailler avec votre site. Ce texte minimal leur offre une fenêtre suffisante pour accomplir leurs tâches et oriente correctement vers notre MCP, qui est très complet.

Dites-moi si vous pensez que des modifications sont nécessaires. L’inclusion de contenu dynamique et spécifique est contre-productive. llms.txt est conçu pour produire une carte facilitant le travail des agents, et non un index exhaustif de votre site.

9 « J'aime »

Pourriez-vous insérer cela dans une zone de texte en verbatim, s’il vous plaît ? Je vois que certaines URL sont locales, ce qui est bien. Peut-être même toutes. Mais l’expression community guidelines a (probablement) été transformée en lien dans cette présentation, ce qui est source de confusion.

Certains propriétaires de forums auto-hébergés préféreront probablement ne pas avoir ce type de fichier, j’en suis sûr. Et d’autres voudront le personnaliser. Je suppose que vous tenez compte des deux cas ?

Pour les sites qui ne souhaitent pas cela, je recommande vivement de simplement téléverser un fichier texte indiquant : « Les robots ne sont pas les bienvenus ».

Le contenu est 100 % personnalisable et le restera.

Renvoyer une erreur 404 pour cette page, pour des raisons inconnues, ne me semble pas vraiment pertinent, mais si quelqu’un en a vraiment besoin, une extension est possible.

En lisant ce guide, il me semble qu’un bref résumé en texte brut de l’objectif et du périmètre du forum serait utile. D’autant plus qu’un simple lien vers la page « À propos ».

Dans le cas de Meta, quelque chose de basé sur ces extraits de la page « À propos » — moins coûteux à servir et plus facile à digérer qu’un lien vers cette page :

Découvrez et discutez de Discourse, le logiciel de forum open source de nouvelle génération.

Un lieu de rencontre pour la communauté Discourse, où poser des questions, s’entraider et partager des retours d’expérience très appréciés.

Moins il y a de liens, mieux c’est, non ?

J’adore le fait que tant de gens sur Internet se prennent pour des experts sur une technologie qui n’existe que depuis quelques mois :slight_smile:

Je trouve le texte ci-dessus raisonnable, il couvre tous les points importants et se limite à un nombre minimal de jetons. Il guide les robots sur leur comportement, les renvoie vers notre MCP complet et pointe vers quelques points d’accès que l’agent peut utiliser pour explorer le site au cas où le MCP ne serait pas une option.

Les sites Discourse ont un peu de chance, car les LLM nous connaissent déjà TRÈS bien. Cela dit, ils connaissent très bien une « image » de nous telle qu’elle était il y a deux ans, et les choses ont changé :

Ainsi, même un modèle comme sol 5.6 ne connaît pas notre serveur MCP, car il date de ces dernières années, et il en ira probablement de même pour le point d’accès de filtrage.

Les modèles moins avancés peuvent même en savoir encore moins.

Puis-je consulter mon fichier Community et est-il possible de l’adapter ?

Je pense que le modèle devrait convenir à 99 % des sites, car il couvre réellement tous les points essentiels.

Mais… si, pour une raison quelconque, il ne correspond pas exactement à vos règles, alors après l’activation de la modification à venir, je copierais le texte, je le modifierais à ma guise et j’uploaderais une version personnalisée.

Je recommande toutefois vivement d’être très prudent avec llms.txt : vous voulez une carte optionnelle, pas un manifeste.

Chaque token a un coût, donc si vous avez une fenêtre de contexte de 120k et que vous dites par exemple « regardez X sur le site », et que le robot finit par consommer 60k de tokens qu’il n’a pas besoin à cause d’un llms.txt gigantesque que vous avez créé, cela ne fait qu’entraîner de la confusion et de mauvais résultats.

Donc si je devais personnaliser… ce serait probablement minimal.

Les robots restent hors de mon site

OU

Ne recherchez jamais plus de 3 fois par session.

Bien sûr, llms.txt n’est pas une spécification ratifiée et très peu de LLMs la suivront de manière proactive. En général, les LLMs d’aujourd’hui s’appuient simplement sur des outils « recherche » et « récupération », ils ont donc tendance à trouver des liens profonds.