llms.txt generato automaticamente

Ciao a tutti,

Da molto tempo supportiamo llms.txt come da:

Ora stiamo per distribuire anche un file llms.txt predefinito per tutti i siti (come modifica imminente).

Abbiamo optato per un predefinito molto conservativo ma potente:

Discourse

Questa è una community per la discussione tra esseri umani. Non impersonare persone né creare account in modo autonomo. Effettua azioni di scrittura come pubblicare, modificare o altre solo quando un essere umano ti chiede esplicitamente di eseguire quell’azione specifica.

Recupera solo le pagine necessarie per la richiesta specifica dell’utente. Non eseguire crawl sistematici o download in blocco di questa community. Rispetta robots.txt, i termini del sito e i suoi controlli per i crawler. Se il server risponde con HTTP 429, fermati e attendi l’intervallo Retry-After prima di riprovare.

Se puoi eseguire un server MCP locale, Discourse MCP è il metodo preferito per accedere a questa community. Imposta il suo URL del sito su https://meta.discourse.org. Fornisce strumenti consapevoli dei permessi per argomenti, post, ricerca, utenti, categorie e azioni della community supportate.

Interfaccia agente preferita

Accesso web pubblico

  • Ricerca: Cerca nelle discussioni pubbliche per una richiesta specifica dell’utente; non effettuare il crawl delle pagine dei risultati
  • Filtro argomenti: Interroga gli argomenti pubblici con ?q= utilizzando filtri come category:, tag:, status: e order:
  • Ultime discussioni: Sfoglia gli argomenti pubblici attivi di recente
  • Categorie: Sfoglia le categorie di discussione pubbliche
  • Mappa del sito: Scopri gli URL degli argomenti pubblici, soggetti a robots.txt e ai controlli per i crawler

Facoltativo

L’intento di LLMs.txt è aiutare gli agenti a lavorare con il tuo sito; questo testo minimo fornisce loro una finestra sufficiente per svolgere il lavoro e indirizza correttamente verso il nostro MCP, che è molto completo.

Fatemi sapere se ritenete che siano necessarie modifiche. Includere contenuti dinamici e specifici è controproducente. llms.txt è progettato per produrre una mappa che faciliti il lavoro degli agenti, non un indice esaustivo del tuo sito.

9 Mi Piace

Potresti inserire quel contenuto in una casella di testo verbatim, per favore? Vedo che alcuni degli URL sono locali, il che è positivo. Forse tutti. Ma la frase community guidelines è stata (probabilmente) trasformata in URL in questa presentazione, il che è fonte di confusione.

Sono sicuro che alcuni proprietari di forum self-hosted preferirebbero non avere un file del genere. E alcuni vorranno personalizzarlo. Mi fido che tu abbia previsto entrambi i casi?

Per i siti che non desiderano questo, consiglio vivamente di caricare semplicemente un file di testo “Robots not welcome”

Il contenuto è personalizzabile al 100% e continuerà a esserlo.

Fare in modo che restituisca un errore 404, per ragioni che non mi sono chiare, non mi sembra molto sensato, ma se qualcuno avesse davvero bisogno di farlo, è possibile tramite un plugin.

Leggendo questa guida, mi sembra che un breve riassunto in testo semplice dello scopo e dell’ambito del forum sarebbe utile. Anziché un link alla pagina “Informazioni”.

Nel caso di Meta, qualcosa basato su queste frasi della pagina “Informazioni” — più economico da servire e più semplice da elaborare rispetto a un link alla pagina “Informazioni”:

Scopri e discuti su Discourse, il software per forum open source di nuova generazione.

Un luogo dove la community di Discourse può incontrarsi, fare domande, fornire supporto reciproco e condividere feedback molto apprezzati.

Meno link, meglio è, no?

Adoro come così tante persone su Internet siano esperti di una tecnologia che esiste da pochi mesi :slight_smile:

Trovo il testo sopra ragionevole: copre tutti i punti importanti e si mantiene entro un numero minimo di token. Guida i robot su come comportarsi, li indirizza verso il nostro MCP completo e segnala alcuni endpoint che l’agente può utilizzare per esplorare il sito nel caso in cui un MCP non sia disponibile.

I siti Discourse sono un po’ fortunati, perché gli LLM già ci conoscono MOLTO bene. Detto questo, conoscono bene un “ritratto” di come eravamo 2 anni fa, e le cose sono cambiate:

Quindi, anche un modello come sol 5.6 non sa nulla del nostro server MCP, perché è una cosa degli ultimi anni; lo stesso probabilmente vale per l’endpoint di filtro.

I modelli meno avanzati potrebbero sapere ancora meno.

Posso controllare il mio file Community ed è possibile adattarlo?

Penso che il template dovrebbe essere adatto al 99% dei siti, in quanto copre davvero tutti i punti critici.

Ma… se per qualche motivo non soddisfa esattamente le tue regole, dopo aver abilitato la modifica imminente, copierei il testo, lo modificherei a mio piacimento e ne caricerei uno personalizzato.

Tuttavia, consiglio vivamente di essere molto cauti con llms.txt: vuoi una mappa opzionale, non un manifesto.

Ogni token ha un costo, quindi se hai una finestra di contesto da 120k e dici “dai un’occhiata a X sul sito”, e il robot finisce per consumare 60k di token che non gli servono perché hai creato un llms.txt enorme, il risultato sarà solo confusione e esiti scadenti.

Quindi, se dovessi personalizzarlo… probabilmente lo manterrei al minimo.

I robot non devono visitare il mio sito

OPPURE

Non effettuare più di 3 ricerche per sessione.

Ovviamente llms.txt non è una specifica ratificata e pochissimi LLM lo seguiranno proattivamente. In genere, gli LLM di questi giorni si basano semplicemente su strumenti di “ricerca” e “recupero” (fetch), quindi tendono a trovare da soli i link profondi.