구조화된 출력(structured outputs)을 사용하다 보니, 많은 소형 모델들이 번역 과정에서 무한 루프에 빠지기 쉬웠기 때문에 max_tokens를 제한해야 했습니다.
OpenAI Responses API의 최신 버전에서는 max_tokens를 적용할 때 생각 토큰(thinking tokens)을 제외하고 계산한다고 하며, 이는 이 문제를 해결합니다.
구조화된 출력(structured outputs)을 사용하다 보니, 많은 소형 모델들이 번역 과정에서 무한 루프에 빠지기 쉬웠기 때문에 max_tokens를 제한해야 했습니다.
OpenAI Responses API의 최신 버전에서는 max_tokens를 적용할 때 생각 토큰(thinking tokens)을 제외하고 계산한다고 하며, 이는 이 문제를 해결합니다.