# HuggingFace TGI와 OpenAI API 엔드포인트 비용 비교

**URL:** https://meta.discourse.org/t/huggingface-tgi-vs-openai-api-endpoint-costs/347106
**Category:** Support
**Tags:** ai
**Created:** [1월 14, 2025, 5:24오후 UTC](https://meta.discourse.org/t/huggingface-tgi-vs-openai-api-endpoint-costs/347106 "2025-01-14T17:24:41Z")
**Posts on this page:** 3
**Page:** 1

<div class="post-metadata">

### Author: ![oppman](https://avatars.discourse-cdn.com/v4/letter/o/aca169/32.png) [@oppman](https://meta.discourse.org/u/oppman)
#### Post date: [1월 14, 2025, 5:24오후 UTC](https://meta.discourse.org/t/huggingface-tgi-vs-openai-api-endpoint-costs/347106/1 "2025-01-14T17:24:41Z")

</div>

인턴이 DigitalOcean에서 OpenAI를 사용하여 Discourse 사이트를 배포했습니다. 이때 API 엔드포인트가 Discourse AI 플러그인에 연결되어 있습니다. 사이트는 훌륭하게 작동하고 있습니다. 인턴은 HuggingFace TGI를 검토해 보라고 제안했습니다. 저는 HuggingFace 관련 방향이 올바른지 확인하기 위해 인턴에게 지침을 제공하려고 합니다. 인턴은 비용을 절감하기 위해 자체 호스팅 HuggingFace TGI를 제안하는 것으로 보입니다. 하지만 호스팅 GPU 비용을 살펴보면 비싸게 느껴집니다.

인턴에게 구체적인 서비스와 비용을 제안하도록 요청할 수도 있지만, 저는 전략적인 지침을 제공하려고 노력하고 있습니다. 대안으로는 인턴이 OpenAI, Anthropic, Gemini를 계속 테스트하는 것입니다.

인턴에게 어떤 과제를 부여해야 하는지에 대한 조언이 있을까요?

기본 아이디어는 프로덕션 환경의 Discourse 배포에 Discourse AI를 구현한 후, 커뮤니티를 후원하는 고객(고객사)에게 AI 유지보수 및 신규 기능 홍보를 위해 추가 서비스 비용을 청구하는 것입니다.

인턴 과제와 관련하여, Hugging Face Inference API를 검토하도록 할 수도 있습니다. OpenAI API를 사용하는 것보다 저렴한가요?

구체적으로 Google Cloud, AWS, Azure의 특정 서비스를 사용하여 TGI를 호스팅하는 분이 계신가요?

예를 들어, AWS의 경우 `g4dn.xlarge`와 `g5.xlarge` 중 어떤 것을 고려해야 하나요?

GCP의 경우 T4 GPU가 권장되는 경로인가요?

비용을 계산하는 방법에 대한 조언이 있을까요?

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [1월 15, 2025, 3:24오후 UTC](https://meta.discourse.org/t/huggingface-tgi-vs-openai-api-endpoint-costs/347106/2 "2025-01-15T15:24:11Z")

</div>

단일 인스턴스 기준, API 가격 경쟁력을 넘어서기는 어렵습니다. API는 호출당 과금되는 반면, TGI를 실행하는 경우 서버가 가동되는 시간당 비용이 발생하기 때문입니다.

예를 들어 `g6.xlarge` 인스턴스에서 Llama 3.1 8B를 실행한다고 가정해 보겠습니다. 이 경우 월 약 600달러의 비용이 발생합니다. 이 비용으로 Anthropic Claude 3.5 Haiku 기준 약 450M 토큰을 처리할 수 있습니다.

개인정보 보호가 필요하거나 대규모 처리가 요구될 때 자체 LLM을 실행하는 것이 합리적입니다.

---

<div class="post-metadata">

### Author: ![oppman](https://avatars.discourse-cdn.com/v4/letter/o/aca169/32.png) [@oppman](https://meta.discourse.org/u/oppman)
#### Post date: [1월 15, 2025, 4:29오후 UTC](https://meta.discourse.org/t/huggingface-tgi-vs-openai-api-endpoint-costs/347106/3 "2025-01-15T16:29:21Z")

</div>

> [@Falco](#):
>
> 프라이시나 규모 중 어느 쪽이 필요할 때 자체 LLM을 운영하는 것이 합리적입니다.

답변해 주셔서 감사합니다. `g6.xlarge` 인스턴스에서 Llama 3.1 8B를 실행하는 데 월 600달러라면 합리적인 비용이지만, 말씀해 주신 대로 API 비용을 사용하는 것이 더 저렴할 것입니다. 따라서 우리는 아마도 OpenAI 및 기타 API 비용을 선택할 가능성이 높습니다. 그렇다면 프라이버시 관련 우려 사항은 무엇인가요?

HuggingFace TGI로 실험하는 목적을 위해, 월 600달러보다 저렴한 테스트용 옵션이 있을까요? 예를 들어, 인턴이 업무를 하지 않을 때 GPU 인스턴스를 종료할 수 있을까요? 그들에게 무엇을 추천해야 할지 고민하고 있습니다. GPU가 활성화된 컨테이너의 비용 구조가 다소 혼란스럽고, 비용 추천의 부담을 인턴에게 전가하고 싶지 않습니다. 컨테이너 구매 과정에서 실수를 하면 인턴이 죄책감을 느낄 수 있기 때문입니다.

제가 원하는 것은 자원을 구매해 준 뒤, 제가 구매한 그 자원에서 HuggingFace TGI를 테스트해 보라고 지시하는 것입니다. 그러면 그들은 성능이나 결과 최적화 측면에서의 차이를 보고할 수 있을 것입니다.
