# Como usar modelos de IA com tokenizadores customizados

**URL:** https://meta.discourse.org/t/how-to-use-ai-models-with-custom-tokenizers/391238
**Category:** Support
**Tags:** ai
**Created:** [13 Dezembro , 2025 22:41 UTC](https://meta.discourse.org/t/how-to-use-ai-models-with-custom-tokenizers/391238 "2025-12-13T22:41:28Z")
**Posts on this page:** 4
**Page:** 1

<div class="post-metadata">

### Author: ![RBoy](https://avatars.discourse-cdn.com/v4/letter/r/2bfe46/32.png) [@RBoy](https://meta.discourse.org/u/RBoy)
#### Post date: [13 Dezembro , 2025 22:41 UTC](https://meta.discourse.org/t/how-to-use-ai-models-with-custom-tokenizers/391238/1 "2025-12-13T22:41:28Z")

</div>

Estou tentando usar o modelo `moonshotai/kimi-k2-instruct` do Groq. De acordo com a documentação em [moonshotai/Kimi-K2-Instruct · Hugging Face](https://huggingface.co/moonshotai/Kimi-K2-Instruct), este modelo não é compatível com tokenizadores OpenAI ou Gemini e parece usar seu próprio tokenizador personalizado.

É possível configurar o Discourse para usar um tokenizador personalizado para este modelo? Se sim, como? Não vejo nenhuma opção sob o modelo LLM para usar um tokenizador personalizado.

Este modelo parece ser muito superior ao GPT-5, então estou muito interessado em usá-lo com o BOT do Discourse para ver o quão eficaz ele pode ser. (Supera o GPT-5 em raciocínio; MMLU multilíngue: 89%; HLE multilíngue: 85%)

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [14 Dezembro , 2025 00:02 UTC](https://meta.discourse.org/t/how-to-use-ai-models-with-custom-tokenizers/391238/2 "2025-12-14T00:02:19Z")

</div>

TL;DR escolha o tokenizador mais próximo e defina o contexto máximo para alguns milhares a menos para permitir que a diferença não o afete.

---

<div class="post-metadata">

### Author: ![RBoy](https://avatars.discourse-cdn.com/v4/letter/r/2bfe46/32.png) [@RBoy](https://meta.discourse.org/u/RBoy)
#### Post date: [14 Dezembro , 2025 12:08 UTC](https://meta.discourse.org/t/how-to-use-ai-models-with-custom-tokenizers/391238/3 "2025-12-14T12:08:49Z")

</div>

Obrigado. Então decidi contratar os serviços do ChatGPT, Gemini e Grok para me ajudar a decidir qual tokenizador usar; qual seria a correspondência mais próxima do tokenizador Kimi Instruct TikToken/BPE para gerar a saída mais precisa do modelo.

Devo dizer que os modelos de IA modernos são bastante representativos da sociedade humana. Todos eles raciocinaram sobre qual tokenizador seria o mais adequado e apresentaram suas descobertas, discordaram sobre alguns fatos e cada um tinha suas próprias opiniões sobre qual é o melhor - meio que seguindo a mesma direção, mas não um consenso, muito parecido com uma equipe de projeto humana - hilário!!! 🤣

A propósito, o Gemini recomendou o Qwen (pela relação entre os fundadores chineses), o Grok recomendou o Llama3 (com base em sua semelhança com o cl100k\_base e eficiência geral), enquanto o ChatGPT disse Qwen ou Llama3 - 😂

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [2 Março , 2026 04:10 UTC](https://meta.discourse.org/t/how-to-use-ai-models-with-custom-tokenizers/391238/4 "2026-03-02T04:10:15Z")

</div>

Também vale a pena notar… a maioria dos agentes de codificação hoje em dia nem sequer se preocupa com um tokenizador preciso como o Discourse. Eles apenas estimam em 4 letras por token.

O cl100k será mais do que suficiente para a grande maioria dos casos de uso em LLMs com tokenizadores ligeiramente diferentes.
