# Comment ajouter un nouveau Chat Bot connecté à un LLM auto-hébergé?

**URL:** https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791
**Category:** Development
**Tags:** ai, ai-bot
**Created:** [Mars 6, 2024, 11:18 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791 "2024-03-06T23:18:40Z")
**Posts on this page:** 12
**Page:** 1

<div class="post-metadata">

### Author: ![Nadeem](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/nadeem/32/368707_2.png) [@Nadeem](https://meta.discourse.org/u/Nadeem)
#### Post date: [Mars 6, 2024, 11:18 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/1 "2024-03-06T23:18:40Z")

</div>

Je souhaite ajouter un nouveau « Chat Bot » et le lier à un LLM auto-hébergé.  
J’ai essayé d’utiliser le champ « ai hugging face model display name » et cela ne semble apparaître nulle part. Peut-être dois-je y faire référence dans les prompts associés à un persona ?  
J’ai également essayé de « créer » un nouveau bot via le menu déroulant « ai bot enable chat bots », et tout ce que je crée apparaît dans le menu déroulant des chatbots sous la forme « [en.discourse\_ai.ai\_bot.bot\_names.XXXX] » où XXXX est le nom que j’ai fourni.  
Tout conseil sur la documentation ou un guide pour faire cela serait apprécié.

---

<div class="post-metadata">

### Author: ![Nadeem](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/nadeem/32/368707_2.png) [@Nadeem](https://meta.discourse.org/u/Nadeem)
#### Post date: [Avril 24, 2024, 10:25 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/2 "2024-04-24T22:25:03Z")

</div>

Quelqu’un peut-il proposer des suggestions ou s’agit-il d’une limitation connue ?

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [Avril 24, 2024, 10:35 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/3 "2024-04-24T22:35:32Z")

</div>

@Roman travaille à la refonte de cette section, attendez-vous à plus d’informations dans les semaines à venir.

---

<div class="post-metadata">

### Author: ![Isambard](https://avatars.discourse-cdn.com/v4/letter/i/858c86/32.png) [@Isambard](https://meta.discourse.org/u/Isambard)
#### Post date: [Juin 2, 2024, 11:02 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/4 "2024-06-02T11:02:19Z")

</div>

Je ne suis pas sûr d’interpréter correctement que pour le moment, il n’est pas possible d’utiliser un LLM auto-hébergé, mais que cela va bientôt changer ?

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [Juin 3, 2024, 2:11 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/5 "2024-06-03T02:11:55Z")

</div>

Ce n’est pas possible pour le moment, mais j’espère que dans une semaine ou deux, cela fonctionnera.

---

<div class="post-metadata">

### Author: ![Isambard](https://avatars.discourse-cdn.com/v4/letter/i/858c86/32.png) [@Isambard](https://meta.discourse.org/u/Isambard)
#### Post date: [Juin 3, 2024, 8:23 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/6 "2024-06-03T08:23:40Z")

</div>

Merci. J’ai été surpris que cela ne fonctionne pas car OpenAI est pris en charge. Je pense que beaucoup de gens exécutent leurs propres LLM avec un point de terminaison compatible avec OpenAI. J’attends avec impatience la mise à jour dans 2 semaines 🙂

---

<div class="post-metadata">

### Author: ![merefield](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/merefield/32/176214_2.png) [@merefield](https://meta.discourse.org/u/merefield)
#### Post date: [Juin 3, 2024, 8:37 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/7 "2024-06-03T08:37:24Z")

</div>

Juste par curiosité @Isambard, quelle est votre estimation du coût mensuel (équivalent en dollars) pour héberger un LLM local suffisamment puissant ?

---

<div class="post-metadata">

### Author: ![Isambard](https://avatars.discourse-cdn.com/v4/letter/i/858c86/32.png) [@Isambard](https://meta.discourse.org/u/Isambard)
#### Post date: [Juin 3, 2024, 5:06 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/8 "2024-06-03T17:06:52Z")

</div>

Environ 5 $ supplémentaires par mois en coûts d’électricité pour le GPU au ralenti - bien qu’en réalité, le coût supplémentaire pour Discourse soit nul puisque j’exécute déjà le LLM à d’autres fins.

Mais il serait certainement plus économique pour les petits forums et une faible utilisation d’utiliser un LLM en tant que service. Bien que pour l’échelle de l’offre hébergée de Discourse, je soupçonne qu’il pourrait être judicieux d’héberger en interne (et aussi de développer des connaissances dans ce domaine qui sera probablement important).

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [Juin 4, 2024, 12:12 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/9 "2024-06-04T00:12:49Z")

</div>

> [@Isambard](#):
>
> pour le GPU au repos

Et 15 000 pour l’A100 ?

Quel modèle exécutez-vous particulièrement localement ?

---

<div class="post-metadata">

### Author: ![Isambard](https://avatars.discourse-cdn.com/v4/letter/i/858c86/32.png) [@Isambard](https://meta.discourse.org/u/Isambard)
#### Post date: [Juin 4, 2024, 7:42 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/10 "2024-06-04T19:42:09Z")

</div>

J’exécute plusieurs choses différentes. Pour les aspects liés à Discourse, j’utiliserai un modèle 7B basé sur Mistral et affiné pour les tâches. J’examine divers modèles de type BERT pour les tâches de classification et je ne suis pas encore décidé pour les embeddings. Cela fonctionne sur une 3090 Ti d’occasion que j’ai achetée pour 700 $.

J’aimerais beaucoup avoir une A100, mais au lieu de cela, j’ai construit un système séparé à 4 GPU « à bas prix » pour seulement 1 000 $ qui exécute Llama 3 70Bq4 à plus de 20 tok/s.

Il est certain que dans de nombreux cas, il serait judicieux de passer par un fournisseur, cependant, cela pourrait être judicieux de le faire soi-même si :

- Vous voulez apprendre
- Vous voulez avoir un contrôle certain sur vos modèles (pour ne pas perdre l’accès à ceux-ci, ou dépendre d’une entreprise pour utiliser ses embeddings non publics)
- Vous avez beaucoup de traitement en masse à effectuer, ce qui serait moins cher à faire en interne
- Vous souhaitez une capacité réservée et fiable (il y a des limites sur les requêtes et les jetons disponibles auprès des fournisseurs) pour le traitement en masse

---

<div class="post-metadata">

### Author: ![Isambard](https://avatars.discourse-cdn.com/v4/letter/i/858c86/32.png) [@Isambard](https://meta.discourse.org/u/Isambard)
#### Post date: [Juin 5, 2024, 11:49 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/11 "2024-06-05T11:49:01Z")

</div>

J’ai effectué des tests comparatifs sur la 3090 et j’ai obtenu un débit soutenu maximal d’environ 2600 tokens par seconde en exécutant Llama 3 - 8B FP16. Je vis dans une région où l’électricité est chère, mais en fonctionnant en continu avec une limite de puissance de 285W, cela coûterait environ 0,007 par million de tokens de sortie. Ou environ 0,01 par million de tokens si vous amortissez entièrement le coût de l’équipement sur 3 ans.

Cela se compare très favorablement à Claude Haiku à condition d’avoir un taux d’utilisation raisonnable.

---

<div class="post-metadata">

### Author: ![Isambard](https://avatars.discourse-cdn.com/v4/letter/i/858c86/32.png) [@Isambard](https://meta.discourse.org/u/Isambard)
#### Post date: [Août 12, 2024, 10:19 UTC](https://meta.discourse.org/t/how-to-add-a-new-chat-bot-connected-to-a-self-hosted-llm/299791/12 "2024-08-12T22:19:55Z")

</div>

J’ai fait une découverte intéressante : le serveur web sur lequel j’héberge mon forum a suffisamment de puissance pour faire tourner un petit LLM à des vitesses modestes (6 tok/s sans batching) même sans GPU. Cela sera utile pour les tâches hors ligne/en arrière-plan.
