Regressão - Gemini flash lite com thinking quebrado após atualização para 2026.8.0

Após atualizar o Discourse para a v2026.8.0, o LLM usando Gemini Flash Lite com o modo de raciocínio (thinking) ativado gera um erro 400.

Aqui está a configuração (que funcionava antes da atualização):

Agora, ao executá-lo, ele retorna:

Non-streaming request failed: { “error”: { “code”: 400, “message”: “Request contains an invalid argument.”, “status”: “INVALID_ARGUMENT” } }

Se eu desativar o thinking, funciona normalmente.

Ao ativar o thinking, o problema retorna ao bug de regressão que eu havia relatado no ano passado. Parece que preciso definir manualmente (hardcode) o número de tokens usados para o raciocínio, e ele não aceita 0 nem -1, e também não aceita deixar em branco, mesmo que a documentação indique que é opcional.

Parece afetar apenas o modelo Flash Lite, mas não o modelo Flash (que funciona perfeitamente, mesmo sem tokens de raciocínio especificados e sem o raciocínio ativado).

O modelo Pro está completamente quebrado; não consigo fazê-lo funcionar de jeito nenhum após a atualização, e recebo um erro interno do servidor.

Por que você está usando a API legada? Você pode trocar para a API não legada e usar: gemini-3.5-flash-lite ?

Porque é uma atualização, Sam. Não dá para acompanhar o ritmo com que a Gemini está lançando modelos e APIs. A ideia é manter o Discourse estável e funcionando com o que já funciona e com mudanças mínimas.

Não vejo a Google desativando os endpoints de modelos “legados” nos próximos anos. Há muitos aplicativos e sistemas que os utilizam e, como qualquer corporação, uma vez que algo está em produção, você não o deprecia em poucos meses. Da mesma forma, eu esperaria que as coisas que funcionam no Discourse continuassem funcionando (até que o Discourse as elimine). Se os endpoints do modelo são suportados no Discourse, eles devem continuar funcionando como faziam antes da atualização.

Além disso, notei o ponto sobre o id do modelo latest não ser suportado pelos endpoints de interação — isso por si só é um grande problema e introduz uma sobrecarga administrativa significativa.
Digamos que eu configure para usar o endpoint 3.5 e, seis meses depois, a Google o descontinue. Quem me informa que o 3.5 foi descontinuado? O Discourse não — e a Gemini também não (porque ela está operando através do Discourse). O resultado final é que, de repente, um dia tudo para de funcionar e agora estamos tentando descobrir o que aconteceu.