sam
(Sam Saffron)
1
大家好,
长期以来,我们一直按照以下规范支持 llms.txt:
我们现在将为所有站点提供一份默认的 llms.txt(这是一项即将推出的变更)。
我们选择了一种非常保守但功能强大的默认配置:
Discourse
这是一个供人类交流的社区。请勿冒充他人或自主创建账户。仅在人类明确要求执行特定操作时,才执行发布、编辑或其他写入操作。
仅获取满足用户特定请求所需的页面。请勿系统性爬取或批量下载本社区内容。请遵守 robots.txt、站点条款及其爬虫控制设置。如果服务器返回 HTTP 429 状态码,请停止操作,并等待 Retry-After 指定的间隔后再重试。
如果你可以运行本地 MCP 服务器,Discourse MCP 是访问本社区的推荐方式。请将其站点 URL 设置为 https://meta.discourse.org。它提供了针对主题、帖子、搜索、用户、分类以及受支持的社区操作的权限感知工具。
推荐的代理接口
公共网页访问
- 搜索:针对特定用户请求搜索公开讨论;请勿爬取搜索结果页面
- 主题筛选:使用
?q= 查询公开主题,支持 category:、tag:、status: 和 order: 等筛选器
- 最新讨论:浏览最近活跃的公开主题
- 分类:浏览公开讨论分类
- 站点地图:在遵守
robots.txt 和爬虫控制的前提下发现公开主题 URL
可选
llms.txt 的意图是帮助代理(agents)处理你的站点。这段极简文本为它们提供了足够的窗口来完成工作,并正确指向我们非常全面的 MCP 服务。
如果你认为需要任何修改,请告诉我。包含动态或特定内容适得其反。llms.txt 旨在生成一份地图,使代理更轻松地工作,而不是你站点的详尽索引。
9 个赞
Ed_S
(Ed S)
2
麻烦您把这个放到一个逐字文本框里,好吗?我注意到其中一些 URL 是本地路径,这很好。也许它们全部都是本地路径。不过,短语 community guidelines 在这个展示中(可能)被转换成了 URL,这有点让人困惑。
我相信,有些自托管论坛的站长不希望有这样的文件,而另一些人则想要对其进行自定义。请问您是否兼顾了这两种情况?
sam
(Sam Saffron)
3
对于不希望使用此功能的网站,我强烈建议直接上传一个内容为“Robots not welcome”的文本文件。
其内容100%可自定义,并且未来也将保持这一点。
因为某些原因而将其设置为404,我觉得这并没有多大意义,但如果有人确实需要这样做,通过插件是可以实现的。
Ed_S
(Ed S)
4
阅读这份指南后,我认为提供一个关于论坛目的和范围的简短纯文本摘要会很有帮助,这比直接链接到“关于”页面更有用。
以 Meta 为例,可以基于“关于”页面中的以下句子来编写——这比提供一个指向“关于”页面的链接更易于提供,也更容易被理解:
了解并讨论 Discourse,下一代开源论坛软件。
这里是 Discourse 社区成员交流、提问、互相提供支持和分享宝贵反馈的地方。
链接越少越好,不是吗?
sam
(Sam Saffron)
5
我真的很爱看网上那么多人在一项才出现几个月的技术上充当专家的样子 
我觉得上面的文本很合理,它涵盖了所有重要要点,并且将 token 数量控制在最低限度。它指导机器人如何行为,指向我们全面的 MCP,并指向一些端点,以便在 MCP 不可用的情况下,智能体可以使用这些端点来探索网站。
Discourse 站点还算幸运,因为 LLM 已经非常了解我们了。话虽如此,它们对“两年前的我们”的了解非常深入,但情况已经发生了变化:
所以,即使是像 sol 5.6 这样的模型,也不了解我们的 MCP 服务器,因为这是最近几年的事情,filter 端点可能也是如此。
较不先进的模型可能了解得更少。
sam
(Sam Saffron)
7
我认为这个模板对 99% 的网站来说都足够好了,基本上涵盖了所有关键点。
但是……如果出于某种原因它不符合你的具体规则,那么在启用即将推出的更改后,我会复制文本,按需编辑,然后上传一个自定义版本。
不过,我强烈建议在使用 llms.txt 时要非常谨慎。你需要的是一张可选的地图,而不是一份详尽的清单。
每个 token 都有成本。如果你的上下文窗口是 120k,然后你说“去查看网站上的 X”,结果机器人因为读取了你创建的巨大 llms.txt 而消耗了 60k 个它根本不需要 token,这只会导致混淆和糟糕的结果。
所以,如果我要进行自定义……它可能只会非常精简。
机器人请勿访问我的网站
或者
每次会话最多搜索 3 次。
当然,llms.txt 并不是一个已批准的规范,而且很少有 LLM 会主动遵循它。如今,LLM 通常只是依赖“搜索”和“获取”工具,因此它们往往能找到深层链接。