관련 콘텐츠 및 검색용 Discourse AI 활성화 비용 산정

클라우드 기반 LLM을 사용하여 Discourse AI를 활성화할 때 발생하는 일회성 비용(대량 임베딩)과 지속적 비용(임베딩 및 검색)을 이해하는 데 도움이 되는 비용 벤치마크나 기준, 또는 추정 공식이 있을까요?

자체 호스팅 LLM의 경우, 일반적으로 필요한 서버 구성/비용은 어떻게 되나요?

자체 호스팅을 원하신다면 GPU가 필요합니다 GPU를 사용하는 것이 더 좋습니다. Ollama 같은 도구를 확인해 보세요.

또한 다음 링크도 참고하세요:

관련 주제(Related Topics)와 AI 검색은 LLM을 사용하지 않습니다.

대량 임베딩은 주제당 1회 요청이므로, 대부분의 사이트는 Gemini 무료 티어와 같은 것을 사용하여 처리할 수 있습니다.

검색은 검색당 1회 요청이며, 아마도 무료 티어 내에서 처리할 수 있을 것입니다.

이것은 단순히 임베딩 모델이므로, https://huggingface.co/Qwen/Qwen3-Embedding-0.6B를 https://github.com/huggingface/text-embeddings-inference를 사용하여 기본적인 2 vCPU / 4GB RAM 환경에서 쉽게 셀프 호스팅할 수 있습니다.

물론 GPU가 있는 서버에서 더 빠르지만, GPU가 없는 환경에서도 문제없이 실행됩니다.