Há muito tempo temos suporte a llms.txt, conforme descrito em:
Agora, passaremos a fornecer também um llms.txt padrão para todos os sites (como uma mudança iminente).
Optamos por um padrão muito conservador, porém poderoso:
Discourse
Esta é uma comunidade para discussão entre humanos. Não se passe por pessoas nem crie contas de forma autônoma. Publique, edite ou execute outra ação de escrita apenas quando um humano pedir explicitamente que você execute essa ação específica.
Busque apenas as páginas necessárias para a solicitação específica do usuário. Não realize rastreamento sistemático nem download em massa desta comunidade. Respeite o robots.txt, os termos do site e seus controles de rastreamento. Se o servidor responder com HTTP 429, pare e aguarde o intervalo definido em Retry-After antes de tentar novamente.
Se você puder executar um servidor MCP local, o Discourse MCP é a maneira preferida de acessar esta comunidade. Defina a URL do site como https://meta.discourse.org. Ele fornece ferramentas com controle de permissões para tópicos, publicações, pesquisa, usuários, categorias e ações de comunidade suportadas.
A intenção do LLMs.txt é ajudar os agentes a trabalhar com seu site; este texto minimalista oferece a eles uma janela suficiente para realizar suas tarefas e aponta corretamente para nosso MCP, que é muito abrangente.
Me avisem se acharem que são necessárias alguma alteração. Incluir conteúdo dinâmico e específico é contraproducente. O llms.txt foi projetado para gerar um mapa que facilite o trabalho dos agentes, não para ser um índice exaustivo do seu site.
Você poderia colocar isso em uma caixa de texto verbatim, por favor? Vejo que algumas das URLs são locais, o que é bom. Talvez todas sejam. Mas a frase community guidelines foi (provavelmente) convertida em URL nesta apresentação, o que é confuso.
Alguns proprietários de fóruns auto-hospedados provavelmente preferirão não ter esse arquivo, tenho certeza. E alguns quererão personalizá-lo. Confio que vocês atendem a ambos os casos?
Ao ler este guia, me parece que um breve resumo em texto simples sobre o propósito e o escopo do fórum seria útil. Mais do que apenas linkar a página Sobre.
No caso do Meta, algo baseado nessas frases da página Sobre — mais barato de servir e mais fácil de digerir do que um link para a página Sobre:
Conheça e discuta sobre o Discourse, o software de fórum open-source de próxima geração.
Um lugar para a comunidade do Discourse se reunir, fazer perguntas, oferecer suporte uns aos outros e compartilhar feedback muito apreciado.
Adoro como tantas pessoas na internet são especialistas em uma tecnologia que existe há apenas alguns meses
Acho o texto acima razoável, pois cobre todos os pontos importantes e se mantém em um número mínimo de tokens. Ele orienta os robôs sobre como se comportar, aponta para nosso MCP abrangente e indica alguns endpoints que o agente pode usar para explorar o site, caso o MCP não seja uma opção.
Os sites Discourse têm sorte, porque os LLMs já nos conhecem MUITO bem. Dito isso, eles conhecem muito bem uma “imagem” de como éramos há 2 anos, e as coisas mudaram:
Portanto, até mesmo um modelo como o sol 5.6 não sabe sobre nosso servidor MCP, pois é algo recente, e o mesmo provavelmente vale para o endpoint de filtro.
Os modelos menos avançados podem saber ainda menos.
Acho que o template deve ser bom para 99% dos sites, pois realmente atinge todos os pontos críticos.
Mas… se, por algum motivo, ele não se adequar exatamente às suas regras, então, após ativar a mudança que está por vir, eu copiaria o texto, editaria a gosto e enviaria um personalizado.
No entanto, recomendo fortemente ter muito cuidado com o llms.txt. Você quer um mapa opcional, não um manifesto.
Cada token tem um custo, então, se você tiver uma janela de contexto de 120k e disser “veja X no site”, e o robô acabar usando 60k de tokens que não precisa, porque você criou um llms.txt gigante, isso só leva à confusão e a resultados ruins.
Então, se eu estivesse personalizando… provavelmente seria minimalista.
Fiquem fora do meu site, robôs
OU
Nunca pesquise mais de 3 vezes por sessão.
Claro, o llms.txt não é uma especificação ratificada e muito poucas LLMs o seguirão proativamente. Em geral, as LLMs de hoje em dia simplesmente usam as ferramentas “search” e “fetch”, então tendem a encontrar links profundos.