ИИ Discourse выходит из-под контроля

У меня только что был странный разговор с ИИ-помощником. Он дважды дал мне плохой совет, а потом полностью отрицал, что вообще что-то такое говорил. Даже когда я прислал скриншоты и текстовые копии, он продолжал отрицать и обвинял меня в том, что я его обманываю. Либо у ИИ сбились настройки, либо со мной что-то не так :slight_smile:

В любом случае, он явно работает со сбоями по нескольким направлениям, поэтому я подумал, что стоит об этом упомянуть здесь.

Если вы знаете, какая именно модель использовалась, а также другие значимые настройки, например уровень рассуждений, эта информация могла бы пригодиться. Разные модели и настройки рассуждения могут вести себя по-разному, поэтому эти детали могут помочь понять, что произошло.


Примечание:

Я регулярно участвую в обсуждениях на форуме OpenAI Discourse, поэтому мне довольно привычны сообщения о противоречивых ответах ИИ, потере или неверной интерпретации контекста разговора, а также случаи, когда модель ошибочно отрицает то, что она ранее сказала.

Судя по тому, что я там наблюдаю, сообщения столь серьёзного характера сейчас, кажется, встречаются реже, чем когда модели рассуждения только начали широко распространяться более года назад, хотя это лишь моё впечатление, а не что-то, что я могу точно измерить.

Спасибо. Как проверить, какая модель используется? Я впервые выступаю администратором форума на Discourse, так что пока привыкаю. Не помню, чтобы я вносил какие-либо изменения, связанные с ИИ, поэтому, вероятно, используется стандартная конфигурация Discourse.

Кстати, это хостинговый форум.

Именно этот вопрос я бы пытался прояснить, будь я администратором, разбирающимся в подобном отчете.

Я администратор на другом форуме на базе Discourse, поэтому немного покопаюсь в документации.



Также я попросил ChatGPT проверить мой ответ, и он добавил следующее. Я сейчас буду это проверять, но хотел поделиться, чтобы вы не ждали.

Согласно документации Discourse AI, администраторы могут просмотреть настроенные модели по адресу:

Admin → Plugins → Discourse AI → LLMs

Функции Discourse AI также поддерживаются персонами, и персона может быть настроена на использование конкретной LLM. Текущая конфигурация функции ИИ может показывать, какая персона и какая LLM используются для конкретной функции.

Полезные ссылки:

Я пока не нашел документированного способа, позволяющего обычному пользователю просмотреть завершенный диалог с функцией «Помощь ИИ» и увидеть точную модель, которая обработала это конкретное взаимодействие.

Если кто-то знает, доступна ли эта информация пользователям, администраторам или в журналах сайта для конкретного запроса, пожалуйста, добавьте это здесь. Это было бы полезно для отчетов такого рода.


Пересматривая сгенерированную ИИ секцию выше, которую я оставляю без изменений ради прозрачности, я внес бы несколько исправлений.

Во-первых, я бы удалил ссылку Discourse AI – ИИ-бот. Она не кажется необходимой для ответа на конкретный вопрос о том, какая модель используется.

Я бы также удалил:

Я пока не нашел документированного способа, позволяющего обычному пользователю просмотреть завершенный диалог с функцией «Помощь ИИ» и увидеть точную модель, которая обработала это конкретное взаимодействие.

Это ограничение не особенно актуально здесь, так как вы указали, что являетесь администратором, и у вас есть доступ к информации о конфигурации, которой не обладает обычный пользователь.

Наконец, теперь, когда я знаю, где находятся соответствующие детали конфигурации, я бы также удалил:

Если кто-то знает, доступна ли эта информация пользователям, администраторам или в журналах сайта для конкретного запроса, пожалуйста, добавьте это здесь. Это было бы полезно для отчетов такого рода.

На данном этапе более полезным путем является проверка конфигурации Discourse AI и определение, какие LLM назначены для функции «Помощь ИИ».

Список настроек ИИ очень длинный, но вот несколько ключевых. Дайте знать, если вам нужно что-то конкретное, или я могу опубликовать весь список.

P.S. У меня есть отдельный аккаунт Claude, и он довольно полезен для запросов по Discourse, но я ожидаю, что стандартный агент-помощник Discourse должен быть лучше, чем универсальный ИИ.

Поскольку я не являюсь экспертом во всех текущих настройках Discourse AI, это моё лучшее понимание ситуации.

На обоих сайтах, моём и вашем, настройка отображается следующим образом:

Модель LLM по умолчанию: CDCK Hosted LLM

Судя по найденной мной информации, это хостинг-сервис LLM от Discourse. Более точно, текущая реализация CDCK/MoM представляет собой слой маршрутизации Mixture of Models (смесь моделей), а не одну фиксированную модель. Он может направлять запросы к различным моделям с открытыми весами в зависимости от задачи. У Discourse есть полезное объяснение здесь:

Ещё одно полезное место для проверки:

/admin/plugins/discourse-ai/ai-llms

Это страница конфигурации LLM в Discourse AI, где администраторы могут видеть настроенные подключения LLM и какие модели доступны для функций Discourse AI.

Например, на сайте, администратором которого я являюсь, я вижу:

что укажет, используется ли эта модель для выполнения действия, которым вы воспользовались.

Похоже, это отвечает на вопрос, который я задал о модели и настройках.

У меня значительно меньше тегов, поэтому, возможно, мне нужно добавить ещё несколько.

С первого взгляда этот список немного удивил меня. Затем я подумал, что, возможно, вы находитесь на тарифном плане Free.

Проверяя вашу предыдущую тему «Изменение на полную ширину», я обнаружил:

Я нахожусь на 14-дневном пробном периоде Pro-версии

Так что мой интерес удовлетворён.

Ещё один пример, чтобы вы знали, что дело не только в вас.

Сейчас у меня полный Pro-план, так что это должно быть значением по умолчанию.

К тому же мне теперь гораздо удобнее ширина в Discourse, и я внёс необходимые настройки. Если посмотреть назад, старые форумы с полной шириной выглядят странно :slight_smile:

На этом, пожалуй, мне больше нечего добавить, но я не хотел оставлять вас в неведении относительно того, продолжаю ли я разбираться в этом вопросе.

Я рад, что вы опубликовали это сообщение. Вероятно, другие столкнутся с чем-то подобным в будущем, и теперь эта тема предоставляет полезную документацию и более ясный путь для расследования проблемы.