AI가 LLM 토큰 한도를 예측할 수 없게 초과함

참고로, 문제는 처음에 번역 서비스가 멈추고 토큰이 소진되면서 시작되었습니다:

DiscourseAi::Completions::Endpoints::OpenAi: status: 429 - body: {“error”:{“message”:“Rate limit reached for model openai/gpt-oss-120b in organization org_01kccx1be8fffaz5sbe17 service tier on_demand on tokens per day (TPD): Limit 200000, Used 193487, Requested 7464. Please try again in 6m50.832s. Need more tokens? Upgrade to Dev Tier today at https://console.groq.com/settings/billing",“type”:“tokens”,“code”:"rate_limit_exceeded”}}

그 후 일일 사용량 한도가 초기화되도록 서비스를 24시간 동안 일시 중지했습니다. 다시 시작한 후 다음과 같은 오류를 발견했습니다:

DiscourseAi::Completions::Endpoints::OpenAi: status: 413 - body: {“error”:{“message”:“Request too large for model openai/gpt-oss-120b in organization org_01kccx1be8fffaz5sbe17 service tier on_demand on tokens per minute (TPM): Limit 8000, Requested 8102, please reduce your message size and try again. Need more tokens? Upgrade to Dev Tier today at https://console.groq.com/settings/billing",“type”:“tokens”,“code”:"rate_limit_exceeded”}}

이후 LLM 설정에서 최대 출력 토큰을 7000에서 6800으로 줄였더니 다시 작동하기 시작했습니다.

제가 놓치고 있는 것이 있나요? 맥락 윈도우(context window)와 관련이 있고 최대 출력 토큰과는 무관하다는 것을 제안하시는 건가요? Groq/모델 한도와 Discourse LLM 설정의 수치를 어떻게 일치시켜야 하는지 파악하려고 합니다.