Автоматически сгенерированный llms.txt

Всем привет,

Уже долгое время мы поддерживаем llms.txt в соответствии с документацией:

Теперь мы также будем поставлять по умолчанию файл llms.txt для всех сайтов (это предстоящее изменение).

Мы выбрали очень консервативный, но при этом мощный вариант по умолчанию:

Discourse

Это сообщество для обсуждения людьми. Не выдавайте себя за людей и не создавайте аккаунты автономно. Публикуйте, редактируйте или выполняйте другие действия с записью только в том случае, если человек явно попросил вас выполнить именно это действие.

Загружайте только те страницы, которые необходимы для конкретного запроса пользователя. Не выполняйте систематическое сканирование или массовую загрузку этого сообщества. Соблюдайте robots.txt, условия использования сайта и настройки управления сканерами. Если сервер отвечает кодом HTTP 429, прекратите работу и дождитесь интервала, указанного в заголовке Retry-After, перед повторной попыткой.

Если вы можете запустить локальный MCP-сервер, то Discourse MCP — это предпочтительный способ доступа к этому сообществу. Установите его URL сайта как https://meta.discourse.org. Он предоставляет инструменты с учетом разрешений для работы с темами, постами, поиском, пользователями, категориями и поддерживаемыми действиями сообщества.

Предпочтительный интерфейс для агентов

  • Настройка Discourse MCP: Установите локальный сервер и подключите его к клиенту, совместимому с MCP

Публичный веб-доступ

  • Поиск: Поиск по публичным обсуждениям для конкретного запроса пользователя; не сканируйте страницы результатов
  • Фильтр тем: Запрос к публичным темам с использованием ?q= и фильтров, таких как category:, tag:, status: и order:
  • Последние обсуждения: Просмотр недавно активных публичных тем
  • Категории: Просмотр публичных категорий обсуждений
  • Карта сайта: Поиск URL-адресов публичных тем с учетом robots.txt и настроек управления сканерами

Необязательное

Цель llms.txt — помочь агентам работать с вашим сайтом. Этот минимальный текст дает им достаточно информации для выполнения задач и правильно указывает на наш MCP, который является очень комплексным.

Дайте мне знать, если вы считаете, что необходимы какие-либо изменения. Включение динамического, специфического контрпродуктивно. llms.txt предназначен для создания карты, которая облегчает работу агентов, а не для исчерпывающего индекса вашего сайта.

9 лайков

Можете, пожалуйста, поместить это в текстовое поле с дословным текстом? Я заметил, что некоторые URL-адреса локальные, что хорошо. Возможно, все они такие. Но фраза community guidelines, вероятно, была преобразована в URL в этом представлении, что вызывает путаницу.

Я уверен, что некоторые владельцы самодостаточных форумов предпочтут не иметь такого файла. А некоторые захотят его настроить. Надеюсь, вы учитываете оба случая?

Для сайтов, которые не хотят этого, я настоятельно рекомендую просто загрузить текстовый файл с надписью «Роботы нежелательны».

Содержимое на 100% настраивается, и так будет и впредь.

Приводить это к ошибке 404 «по какой-то причине» мне не совсем понятно, но если кому-то действительно нужно это сделать, можно использовать плагин.

Читая это руководство, я прихожу к выводу, что краткое текстовое резюме о назначении и охвате форума было бы полезнее, чем ссылка на страницу «О нас».

В случае с Meta можно было бы использовать что-то на основе этих предложений со страницы «О нас» — это дешевле в обслуживании и проще для восприятия, чем ссылка на эту страницу:

Изучите и обсудите Discourse, форумное программное обеспечение нового поколения с открытым исходным кодом.

Место, где сообщество Discourse может собираться, задавать вопросы, оказывать друг другу поддержку и делиться ценной обратной связью.

Чем меньше ссылок, тем лучше, верно?

Мне нравится, что так много людей в интернете считают себя экспертами в технологиях, которые существуют всего несколько месяцев :slight_smile:

Я считаю, что приведённый выше текст вполне разумен: он охватывает все важные моменты и содержит минимальное количество токенов. Он направляет роботов, как им следует себя вести, указывает на наш всеобъемлющий MCP и предлагает несколько конечных точек (endpoints), которые агент может использовать для изучения сайта, если MCP недоступен.

Сайты на Discourse в каком-то смысле везунчики, потому что LLM уже знают нас ОЧЕНЬ хорошо. Сказав это, стоит отметить, что они хорошо знают наш «образ» двухлетней давности, а с тех пор многое изменилось:

Так что даже такая модель, как sol 5.6, не знает о нашем MCP-сервере, потому что это новшество последних лет; то же самое, вероятно, касается и конечной точки фильтрации.

Менее продвинутые модели могут знать ещё меньше.

Можно ли мне проверить мой файл Community и возможно ли его адаптировать?

Я считаю, что этот шаблон подойдёт для 99% сайтов, ведь он покрывает все ключевые моменты.

Но… если по какой-то причине он не соответствует вашим конкретным правилам, то после включения предстоящего изменения я бы скопировал текст, отредактировал его по своему усмотрению и загрузил собственный вариант.

При этом я настоятельно рекомендую быть очень осторожным с llms.txt: вам нужна необязательная карта, а не манифест.

Каждый токен имеет свою цену, поэтому если у вас есть контекстное окно на 120k токенов, а вы пишете «посмотри на X на сайте», и в результате робот тратит 60k токенов на то, что ему не нужно из-за гигантского llms.txt, это приведёт лишь к путанице и плохим результатам.

Поэтому, если бы я настраивал это самостоятельно, я бы сделал это, вероятно, минимально.

Роботы, держитесь подальше от моего сайта

ИЛИ

Никогда не выполняйте более 3 поисковых запросов за сессию.

Конечно, llms.txt не является утверждённой спецификацией, и очень немногие LLM будут активно следовать ему. Как правило, современные LLM просто используют инструменты «поиск» и «получение данных», поэтому они склонны находить прямые ссылки.