Discourse AI에서 임베딩 시 `input must have less than 8192 tokens` 경고 발생

입력 텍스트를 청크로 나누는 도구가 있을까요?
아니면 8192개 토큰 이상을 지원하는 임베딩 API가 있을까요?
현재 Qwen/Qwen3-Embedding-0.6B를 사용하고 있습니다.

Message (15 copies reported)

OpenAI Embeddings failed with status: 413 body: {"code":20042,"message":"input must have less than 8192 tokens","data":null}

Backtrace

/var/www/discourse/vendor/bundle/ruby/3.3.0/gems/activesupport-8.0.3/lib/active_support/broadcast_logger.rb:218:in `block in dispatch'
/var/www/discourse/vendor/bundle/ruby/3.3.0/gems/activesupport-8.0.3/lib/active_support/broadcast_logger.rb:217:in `map'
/var/www/discourse/vendor/bundle/ruby/3.3.0/gems/activesupport-8.0.3/lib/active_support/broadcast_logger.rb:217:in `dispatch'
/var/www/discourse/vendor/bundle/ruby/3.3.0/gems/activesupport-8.0.3/lib/active_support/broadcast_logger.rb:129:in `warn'
/var/www/discourse/plugins/discourse-ai/lib/inference/open_ai_embeddings.rb:34:in `perform!'
/var/www/discourse/plugins/discourse-ai/lib/embeddings/vector.rb:45:in `block (2 levels) in gen_bulk_reprensentations'
/var/www/discourse/lib/scheduler/thread_pool.rb:118:in `block (2 levels) in wrap_block'
/var/www/discourse/vendor/bundle/ruby/3.3.0/gems/rails_multisite-7.0.0/lib/rails_multisite/connection_management/null_instance.rb:49:in `with_connection'
/var/www/discourse/vendor/bundle/ruby/3.3.0/gems/rails_multisite-7.0.0/lib/rails_multisite/connection_management.rb:17:in `with_connection'
/var/www/discourse/lib/scheduler/thread_pool.rb:118:in `block in wrap_block'
/var/www/discourse/lib/scheduler/thread_pool.rb:163:in `thread_loop'
/var/www/discourse/lib/scheduler/thread_pool.rb:174:in `block in spawn_thread'

같은 모델을 자체 호스팅(self-host)하는 경우 최대 32k 토큰까지 사용할 수 있습니다. 현재 저희가 호스팅 환경에서 실제로 사용하고 있는 설정이기도 합니다.

이것이 불가능하다면, 임베딩(embeddings) 모델을 설정하여 입력을 해당 프로바이더가 허용하는 최대 길이로 제한해야 합니다. 이렇게 하면 저희 AI 봇 RAG는 업로드된 파일을 청크(chunk)로 분할하고, 관련 주제/검색 기능은 각 주제당 처음 8192개의 토큰만 가져오게 됩니다.

임베딩 모델을 어떻게 설정하나요? Discourse에서 설정하나요, 아니면 모델 제공업체에서 설정하나요?

저는 Qwen/Qwen3-Embedding-0.6B 모델이 최대 32k 토큰을 지원한다고 확신합니다.
그리고 시퀀스 길이를 32k로 설정해 두었습니다.

하지만 여전히 임베딩 관련 오류가 많이 발생합니다.

API 제공업체가 허용한다면 가능합니다.

API 제공업체가 8192로 제한하고 있다면, 그들의 규칙을 따라야 합니다.

네, API 제공업체에 문의하고 있습니다.