# 隆重推出 Discourse AI

**URL:** https://meta.discourse.org/t/introducing-discourse-ai/262744
**Category:** Blog
**Created:** [2023年四月24日 19:39 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744 "2023-04-24T19:39:09Z")
**Posts on this page:** 7
**Page:** 2

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [2023年五月3日 09:57 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/25 "2023-05-03T09:57:11Z")

</div>

> [@sam](#):
>
> 向量数据库

给那些想知道什么是向量数据库的人

> **[What is a Vector Database & How Does it Work? Use Cases + Examples |...](https://www.pinecone.io/learn/vector-database/#what-is-a-vector-database)**
>
> Discover Vector Databases: How They Work, Examples, Use Cases, Pros & Cons, Selection and Implementation. They have combined capabilities of traditional databases and standalone vector indexes while specializing for vector embeddings.

注意：这来自一家商业向量数据库供应商，但它仍然是我所知的最佳入门介绍，并且是OpenAI使用的相同向量数据库。

要理解关于 Transformer 模型，向量意味着什么，请观看这个技术 YouTube 视频

![](https://cdck-file-uploads-global.s3.dualstack.us-west-2.amazonaws.com/meta/optimized/4X/7/9/a/79a05c35b9ace9a39a09b8199702ddd939165ea0_2_690x388.jpeg)https://www.youtube.com/embed/kCc8FmEb1nY?feature=oembed&wmode=opaque

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [2023年五月3日 10:01 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/26 "2023-05-03T10:01:13Z")

</div>

> [@EricGT](#):
>
> 与 OpenAI 使用的相同的向量数据库。

我们在 discourse-ai 中使用 [https://github.com/pgvector/pgvector，但从长远来看，我们也在考虑其他想法，例如](https://github.com/pgvector/pgvector%EF%BC%8C%E4%BD%86%E4%BB%8E%E9%95%BF%E8%BF%9C%E6%9D%A5%E7%9C%8B%EF%BC%8C%E6%88%91%E4%BB%AC%E4%B9%9F%E5%9C%A8%E8%80%83%E8%99%91%E5%85%B6%E4%BB%96%E6%83%B3%E6%B3%95%EF%BC%8C%E4%BE%8B%E5%A6%82) weaviate / elastic / milvus。

Pinecone 是 Discourse 的用户 🤗 [https://community.pinecone.io/](https://community.pinecone.io/)

---

<div class="post-metadata">

### Author: ![gkogan](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/gkogan/32/305160_2.png) [@gkogan](https://meta.discourse.org/u/gkogan)
#### Post date: [2023年五月3日 12:51 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/27 "2023-05-03T12:51:28Z")

</div>

嘿 @sam，是的，我们确实是快乐的 Discourse 用户，而且正如你提到的，GPT-4 最常见的搭配之一就是用于你所说的确切用例——请参阅[我们主页](https://www.pinecone.io)上的徽标+引言。我们可以帮你做一个 POC 吗？

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [2023年五月3日 22:53 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/28 "2023-05-03T22:53:18Z")

</div>

> [@gkogan](#):
>
> 我们能帮你做一个 POC 吗？

当然，我将把你和 @Falco 连接起来，你们可以讨论一下。

我认为 `discourse-ai` 也附带一个 pinecone 适配器会很棒，这可以大大减少我们平台自助托管者的摩擦。

---

<div class="post-metadata">

### Author: ![Fabio\_Machado\_de\_Oli](https://avatars.discourse-cdn.com/v4/letter/f/48db29/32.png) [@Fabio\_Machado\_de\_Oli](https://meta.discourse.org/u/Fabio_Machado_de_Oli)
#### Post date: [2023年五月4日 18:22 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/29 "2023-05-04T18:22:07Z")

</div>

> [@jordan-violet](#):
>
> 培训可能非常非常昂贵。就我而言，根据我们的培训计算，仅 OpenAI 推荐的最低培训费用，我们就需要花费近 200,000 美元来培训单个用例。

看来您已经对培训成本进行了研究，但我想根据 OpenAI 的微调指南分享我的理解。如果我正确理解了 [https://platform.openai.com/docs/guides/fine-tuning，他们建议将](https://platform.openai.com/docs/guides/fine-tuning%EF%BC%8C%E4%BB%96%E4%BB%AC%E5%BB%BA%E8%AE%AE%E5%B0%86) Ada 用于分类任务，并为每个类别提供 100 个示例。在这种情况下，我们将总共有 200 个示例（垃圾邮件和非垃圾邮件）。假设平均示例包含 500 个 token，那么在 Ada 上培训的总 token 数为 500 \* 200 = 100,000 个 token，培训费用为 0.04 美元。如果您改用 Davinci，费用将为 3.00 美元。

我猜想定价可能是针对单步或单轮培训的，但我在他们的网站上找不到更详细的信息。如果您有任何见解或我有所误解，请告诉我。

---

<div class="post-metadata">

### Author: ![jordan-violet](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jordan-violet/32/281428_2.png) [@jordan-violet](https://meta.discourse.org/u/jordan-violet)
#### Post date: [2023年五月4日 18:47 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/30 "2023-05-04T18:47:16Z")

</div>

正如我之前提到的，那些成本是针对我业务的_我的_用例。我的训练和使用是 Davinci，而不是 Ada，所以在那里成本要高出 75 倍。我们还在实际使用中最大化每个请求的 token 数量。

我不确定 Sam/Falco 在他们的用例中具体会考虑什么——只是笼统地说，大规模微调可能会很昂贵！

---

<div class="post-metadata">

### Author: ![byronvoorbach](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/byronvoorbach/32/305495_2.png) [@byronvoorbach](https://meta.discourse.org/u/byronvoorbach)
#### Post date: [2023年五月4日 19:00 UTC](https://meta.discourse.org/t/introducing-discourse-ai/262744/31 "2023-05-04T19:00:25Z")

</div>

祝贺 @sam 和 @Falco 发布！

我很乐意支持 Discourse 对 Weaviate 的评估！👏

[上一頁](https://meta.discourse.org/t/introducing-discourse-ai/262744.md?page=1)
