Automatisch generierte llms.txt

Hallo zusammen,

schon seit Längerem unterstützen wir llms.txt gemäß:

Wir werden nun auch eine **Standard-**llms.txt für alle Sites bereitstellen (als kommende Änderung).

Wir haben uns für ein sehr konservatives, aber leistungsfähiges Standardverhalten entschieden:

Discourse

Dies ist eine Community für menschliche Diskussionen. Verkleiden Sie sich nicht als Menschen und erstellen Sie keine Konten autonom. Führen Sie Schreibaktionen wie das Posten, Bearbeiten oder andere ähnliche Vorgänge nur durch, wenn ein Mensch Sie ausdrücklich darum bittet, genau diese Aktion auszuführen.

Rufen Sie nur die Seiten ab, die für die spezifische Anfrage des Nutzers erforderlich sind. Crawlen Sie diese Community nicht systematisch und laden Sie keine Inhalte im Bulk herunter. Beachten Sie robots.txt, die Nutzungsbedingungen der Site und deren Crawler-Steuerungen. Wenn der Server mit HTTP 429 antwortet, stoppen Sie den Vorgang und warten Sie das in Retry-After angegebene Intervall ab, bevor Sie erneut versuchen.

Wenn Sie einen lokalen MCP-Server betreiben können, ist Discourse MCP der bevorzugte Weg, um auf diese Community zuzugreifen. Setzen Sie dessen Site-URL auf https://meta.discourse.org. Es bietet berechtigungsbewusste Tools für Themen, Beiträge, Suche, Benutzer, Kategorien und unterstützte Community-Aktionen.

Bevorzugte Agent-Schnittstelle

  • Discourse MCP Setup: Installieren Sie den lokalen Server und verbinden Sie ihn mit einem MCP-kompatiblen Client

Öffentlicher Web-Zugang

  • Suche: Suchen Sie in öffentlichen Diskussionen nach einer spezifischen Nutzeranfrage; crawlen Sie keine Ergebnis-Seiten
  • Themenfilter: Fragen Sie öffentliche Themen mit ?q= ab, unter Verwendung von Filtern wie category:, tag:, status: und order:
  • Neueste Diskussionen: Stöbern Sie in kürzlich aktiven öffentlichen Themen
  • Kategorien: Stöbern Sie in öffentlichen Diskussionskategorien
  • Sitemap: Entdecken Sie öffentliche Themen-URLs unter Beachtung von robots.txt und Crawler-Steuerungen

Optional

Das Ziel von LLMs.txt ist es, Agenten bei der Arbeit mit Ihrer Site zu unterstützen. Dieser minimale Text gibt ihnen genug Einblick, um Aufgaben zu erledigen, und verweist korrekt auf unser MCP, das sehr umfassend ist.

Sagt Bescheid, wenn ihr denkt, dass Änderungen nötig sind. Die Einbeziehung von dynamischen, spezifischen Inhalten ist kontraproduktiv. llms.txt ist so konzipiert, dass es eine Karte erstellt, die es Agenten erleichtert, zu arbeiten, und keine erschöpfende Indexierung Ihrer Site darstellt.

9 „Gefällt mir“

Könntest du das bitte in ein verbatim-Textfeld einfügen? Ich sehe, dass einige der URLs lokal sind, was gut ist. Vielleicht sind es sogar alle. Aber der Ausdruck community guidelines wurde in dieser Präsentation (wahrscheinlich) zu einer URL umgewandelt, was verwirrend ist.

Einige Betreiber selbst gehosteter Foren werden sicher vorziehen, keine solche Datei zu haben. Und andere möchten sie anpassen. Ich gehe davon aus, dass du beide Fälle abdeckst?

Für Websites, die dies nicht möchten, empfehle ich dringend, einfach eine Textdatei mit dem Inhalt „Robots not welcome“ hochzuladen.

Der Inhalt ist zu 100 % anpassbar und wird es auch in Zukunft bleiben.

Dass man dafür einen 404-Fehler auslöst, ergibt für mich aus welchen Gründen auch immer wenig Sinn, aber falls es jemand wirklich tun muss, ist ein Plugin möglich.

Wer diesen Leitfaden liest, bekommt den Eindruck, dass eine kurze Zusammenfassung des Forum-Zwecks und -Umfangs in Klartext hilfreich wäre. Das wäre sogar noch besser als ein Link zur About-Seite.

Im Fall von Meta könnte man sich auf diese Sätze aus der About-Seite stützen – günstiger in der Bereitstellung und leichter zu verarbeiten als ein Link zur About-Seite:

Erfahre mehr über Discourse, die Forum-Software der nächsten Generation mit Open-Source-Code, und diskutiere darüber.

Ein Ort, an dem sich die Discourse-Community trifft, um Fragen zu stellen, sich gegenseitig zu unterstützen und wertvolles Feedback zu teilen.

Je weniger Links, desto besser, oder?

Ich finde es großartig, dass so viele Menschen im Internet Experten für eine Technologie sind, die erst seit wenigen Monaten existiert :slight_smile:

Ich halte den obigen Text für angemessen. Er behandelt alle wichtigen Punkte und bleibt dabei bei einer minimalen Token-Anzahl. Er gibt Robotern vor, wie sie sich verhalten sollen, verweist auf unser umfassendes MCP und zeigt einige Endpunkte, die der Agent nutzen kann, um die Seite zu erkunden, falls kein MCP verfügbar ist.

Discourse-Sites haben es ziemlich gut, da LLMs uns bereits SEHR gut kennen. Das heißt allerdings auch, dass sie ein „Bild“ von uns von vor zwei Jahren sehr gut kennen, und sich seitdem einiges geändert hat:

Deshalb weiß selbst ein Modell wie sol 5.6 nichts von unserem MCP-Server, da dieser erst seit wenigen Jahren existiert. Ähnliches dürfte für den Filter-Endpoint gelten.

Weniger fortgeschrittene Modelle wissen wahrscheinlich noch weniger darüber.

Kann ich meine Community-Datei einsehen und ist es möglich, sie anzupassen?

Ich denke, die Vorlage sollte für 99 % der Websites gut funktionieren, da wirklich alle entscheidenden Punkte abgedeckt sind.

Aber … falls sie aus irgendeinem Grund nicht exakt deinen Regeln entspricht, würde ich nach der Aktivierung der anstehenden Änderung den Text kopieren, nach Belieben bearbeiten und eine eigene Version hochladen.

Ich empfehle jedoch dringend, bei llms.txt sehr vorsichtig zu sein: Du möchtest eine optionale Karte, keine Manifestation.

Jedes Token kostet etwas. Wenn du also ein Kontextfenster von 120k hast und dann sagst: „Schau dir X auf der Seite an“, und der Roboter am Ende mit 60k Tokens dasteht, die er nicht braucht, weil du eine riesige llms.txt erstellt hast, führt das nur zu Verwirrung und schlechten Ergebnissen.

Wenn ich also selbst etwas anpassen würde, würde ich es wahrscheinlich minimal halten.

Robots stay off my site

ODER

Never search more than 3 times per session.

Natürlich ist llms.txt keine ratifizierte Spezifikation, und nur sehr wenige LLMs werden sie proaktiv befolgen. In der Regel setzen sich LLMs heutzutage einfach auf ein „search“- und ein „fetch“-Tool, sodass sie eher auf Tiefenlinks stoßen.