Мне пришлось прибегнуть к некоторым хакерским трюкам с LiteLLM, чтобы заставить определённые модели работать в Discourse AI.
Вы пробовали использовать разные модели рассуждений? Некоторые LLM работают только при включённом режиме рассуждений, а другие — при его низком уровне (не минимальном) или всегда по умолчанию; обычно это создаёт большую нагрузку.