관련 주제(Related Topics)와 AI 검색은 LLM을 사용하지 않습니다.
대량 임베딩은 주제당 1회 요청이므로, 대부분의 사이트는 Gemini 무료 티어와 같은 것을 사용하여 처리할 수 있습니다.
검색은 검색당 1회 요청이며, 아마도 무료 티어 내에서 처리할 수 있을 것입니다.
이것은 단순히 임베딩 모델이므로, https://huggingface.co/Qwen/Qwen3-Embedding-0.6B를 https://github.com/huggingface/text-embeddings-inference를 사용하여 기본적인 2 vCPU / 4GB RAM 환경에서 쉽게 셀프 호스팅할 수 있습니다.
물론 GPU가 있는 서버에서 더 빠르지만, GPU가 없는 환경에서도 문제없이 실행됩니다.