При включении thinking проблема возвращается к регрессионному багу, о котором я сообщал в прошлом году. Похоже, мне нужно жёстко прописать количество токенов, используемых для размышлений, и система не принимает 0 или -1, а также не принимает пустое значение, хотя в документации указано, что этот параметр необязательный.
Похоже, это влияет только на модель Flash Lite, но не на Flash (которая работает без проблем, даже если токены размышлений не указаны и режим размышлений не включен).
Модель Pro полностью сломана: после обновления я вообще не могу её запустить — получаю ошибку внутреннего сервера.
Потому что это обновление, Сэм. Не успеваешь за темпом, с которым Gemini выпускает новые модели и API. Идея состоит в том, чтобы Discourse оставался стабильным и работоспособным, используя то, что уже работает, с минимальными изменениями.
Я не вижу, чтобы Google отключал конечные точки «устаревших» моделей в ближайшие годы: слишком много приложений и систем их используют. И, как и любая корпорация, когда что-то уже внедрено в продакшн, его не удаляют в течение нескольких месяцев. Аналогичным образом я ожидаю, что то, что работает в Discourse, будет продолжать работать (пока сам Discourse не удалит это). Если конечные точки моделей поддерживаются в Discourse, то они должны продолжать работать так же, как и до обновления.
Кроме того, я обратил внимание на то, что идентификатор модели latest не поддерживается конечными точками взаимодействия — само по себе это большая проблема, которая создает значительную административную нагрузку.
Допустим, я настроил систему на использование конечной точки 3.5, а через полгода Google её закрывает. Кто мне сообщит, что 3.5 больше не поддерживается? Discourse — нет, и Gemini тоже (потому что он работает через Discourse). В итоге однажды все внезапно перестает работать, и нам приходится выяснять, что произошло.