# Возможно ли сделать семантический поиск поиском по умолчанию на сайте? Сколько стоят такие запросы?

**URL:** https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953
**Category:** Feature
**Tags:** ai, ai-search
**Created:** [20.Август.2023 21:11:51 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953 "2023-08-20T21:11:51Z")
**Posts on this page:** 8
**Page:** 1

<div class="post-metadata">

### Author: ![kuaza](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kuaza/32/264151_2.png) [@kuaza](https://meta.discourse.org/u/kuaza)
#### Post date: [20.Август.2023 21:11:51 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/1 "2023-08-20T21:11:51Z")

</div>

> [@AI Search for finding non-exact matches](https://meta.discourse.org/t/ai-search-for-finding-non-exact-matches/275569):
>
> We use our site as a knowledge-base and discussion forum for a university department. So for example, I can imagine people wanting to ask things like: when will MSc grades be available? what is the pass mark for MPsych students? how many weeks leave can I book in one go? what happens if my tutee fails a stage 1 module? what does the university require that I do if my tutee is self harming? how much do we pay research participants? how do I get promoted? what sources of phd funding are availabl…

Семантический поиск работает действительно хорошо и даёт лучшие результаты, чем обычный поиск. Мы можем использовать эту систему поиска на всём сайте, но по умолчанию она не включена. Её нужно выбирать вручную при выполнении поиска.

 ![image](https://global.discourse-cdn.com/meta/original/4X/a/6/a/a6a3411302177d7ecb630eb1cf11e1a7aa838ecd.png)

Возможно ли сделать этот поиск по умолчанию? И есть ли у этого запроса какая-либо стоимость?

---

<div class="post-metadata">

### Author: ![denvergeeks](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/denvergeeks/32/327671_2.png) [@denvergeeks](https://meta.discourse.org/u/denvergeeks)
#### Post date: [20.Август.2023 21:51:45 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/2 "2023-08-20T21:51:45Z")

</div>

Вы можете ознакомиться с плагином Algolia для Discourse. Я уже успешно настроил его на нескольких своих сайтах:

[https://meta.discourse.org/search?q=algolia](https://meta.discourse.org/search?q=algolia)

> **[Semantic search: the next big thing in search engine technology](https://www.algolia.com/blog/product/semantic-search-the-next-big-thing-in-search-engine-technology)**
>
> Why is semantic search technology superior to traditional SEO-based search, and how can it help sites provide excellent, Google-like user experiences?

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [20.Август.2023 22:23:28 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/3 "2023-08-20T22:23:28Z")

</div>

Мы обновляем работу семантического поиска, и его результаты будут отображаться вместе с результатами поиска по умолчанию, что должно полностью удовлетворить ваши потребности. Обновление должно быть выпущено через пару недель.

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [05.Сентябрь.2023 15:58:29 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/4 "2023-09-05T15:58:29Z")

</div>

> [@kuaza](#):
>
> Семантический поиск действительно отлично работает и даёт лучшие результаты, чем обычный поиск. Мы можем использовать эту систему поиска на всём сайте, но по умолчанию она не включена. Её нужно выбирать при поиске.

Мы только что выпустили семантический поиск, интегрированный в обычный поиск в Discourse AI. Теперь он использует HyDE для достижения лучших результатов, поэтому дайте знать, как у вас получится. Одно большое изменение: у вас должны быть настроены как модуль эмбеддингов, так и LLM-сервис (либо OpenAI, Anthropic или Llama2).

Вы можете протестировать это здесь, на Meta.

---

<div class="post-metadata">

### Author: ![kuaza](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kuaza/32/264151_2.png) [@kuaza](https://meta.discourse.org/u/kuaza)
#### Post date: [06.Сентябрь.2023 19:09:18 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/5 "2023-09-06T19:09:18Z")

</div>

Выглядит отлично. Я с нетерпением жду, когда смогу начать пользоваться этим. Вы все замечательные.

---

<div class="post-metadata">

### Author: ![bigfudge](https://avatars.discourse-cdn.com/v4/letter/b/6de8d8/32.png) [@bigfudge](https://meta.discourse.org/u/bigfudge)
#### Post date: [08.Сентябрь.2023 08:35:29 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/6 "2023-09-08T08:35:29Z")

</div>

Поиграв с этим немного, я сделал несколько наблюдений:

- Результаты отличаются от обычного поиска. Не всегда лучше, потому что иногда поиск по ключевым словам/релевантности действительно дает наилучший результат, когда вы знаете, какие ключевые слова искать, но…
- Он возвращает более широкий набор результатов, и они иногда действительно полезны.
- Сейчас это работает у меня очень медленно. Я понимаю, что это в какой-то степени неизбежно, так как перед извлечением есть этап генерации LLM, так что не уверен, что это можно исправить, но стоит иметь это в виду. Кажется, это работает медленнее, чем короткий вызов gpt-3.5…

Несколько замечаний по интерфейсу:

- Не всегда очевидно в возвращаемых результатах, какая часть релевантна. В приложении, над которым я работаю, я разбиваю документы на довольно маленькие части перед созданием эмбеддингов (предложения/абзацы), и это означает, что при поиске/извлечении можно раскрасить каждое предложение в соответствии с семантической схожестью. Это было бы немного похоже на выделение ключевых слов из поиска, но выглядело бы как тепловая карта, где семантически похожие части окрашены в «горячие» цвета, а непохожие — в «холодные».
- Надоедает необходимость нажимать, чтобы развернуть семантические результаты.
- Думали ли вы о способах объединения результатов по ключевым словам и семантических результатов? Было бы возможно выбрать «схожесть» или «релевантность» как порядок сортировки набора результатов? Таким образом, если вы выберете «схожесть», вы могли бы начать с представления результатов на основе ключевых слов и вставлять документы, полученные с помощью HYDE, в список по мере их поступления.
- Было бы действительно интересно (по крайней мере, для меня) увидеть гипотетический документ, использованный для сопоставления схожести. Я могу представить, что иногда хочется отредактировать этот документ… и поскольку косинусная схожесть относительно недорогая (по сравнению с вызовом генерации LLM), обновление результатов в интерфейсе при обновлении пользователем своего запроса/гипотетического документа все равно было бы довольно быстрым.

В целом — это действительно круто, спасибо! Будет здорово, когда это будет реализовано так, чтобы чат-бот мог использовать результаты.

Б

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [08.Сентябрь.2023 17:52:26 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/7 "2023-09-08T17:52:26Z")

</div>

> [@bigfudge](#):
>
> Сейчас для меня это работает очень медленно. Я понимаю, что это в какой-то степени неизбежно, так как перед поиском стоит этап генерации LLM, поэтому не уверен, что это можно исправить, но стоит знать об этом. Кажется, что это работает медленнее, чем короткий вызов gpt-3.5…

На этой неделе нам удалось сократить время с 45 секунд до 7 секунд благодаря нескольким хитрым оптимизациям, и мы используем это для заполнения кэша, поэтому повторные запросы выполняются мгновенно.

> [@bigfudge](#):
>
> Не всегда очевидно в возвращаемых результатах, какая часть релевантна. В приложении, над которым я работаю, я разбиваю документы на довольно мелкие части (предложения/абзацы) перед созданием эмбеддингов, и это означает, что при поиске/извлечении можно раскрасить каждое предложение в зависимости от семантического сходства. Это было бы похоже на выделение ключевых слов из запроса, но выглядело бы как тепловая карта, где семантически похожие части окрашены в «горячие» цвета, а непохожие — в «холодные».

В настоящее время мы создаем один эмбеддинг на тему. Мы планируем перейти на создание эмбеддингов для каждого поста, что в будущем сделает этот поиск еще лучше.

> [@bigfudge](#):
>
> Раздражает необходимость нажимать, чтобы развернуть семантические результаты.

Текущий интерфейс временный и был создан не нашей дизайн-командой. Наша цель состояла в том, чтобы запустить его и дать нашему сообществу возможность протестировать его, чтобы собрать отзывы о функциональных аспектах функции. Надлежащий интерфейс появится в ближайшее время.

> [@bigfudge](#):
>
> Таким образом, если вы выберете «сходство», вы можете начать с отображения результатов на основе ключевых слов и вставлять извлеченные документы Hyde в список по мере их поступления.

Это заставит результаты двигаться, пока вы их просматриваете, что в UX является большим запретом. Наша главная цель — найти способ представить оба типа результатов так, чтобы они были полезны и улучшали процесс поиска, не вызывая раздражения.

> [@bigfudge](#):
>
> Вы думали о способах объединения результатов на основе ключевых слов и семантических результатов?

Да, именно поэтому мы перенесли оба типа результатов на один экран и объединили их в единое поле ввода, в отличие от того, что было у нас раньше. Дальнейшая интеграция обоих типов зависит от парадигмы интерфейса, которую мы выберем для этого экрана.

> [@bigfudge](#):
>
> Было бы очень интересно (по крайней мере, для меня) иметь возможность увидеть гипотетический документ, использованный для сопоставления сходства.

На вашем собственном экземпляре вы можете запросить `ai_api_audit_logs` для получения этой информации. Например, недавний поиск по запросу `Discourse app freezing on iOS` привел к следующему гипотетическому посту:

> Тема: Приложение Discourse зависает на iOS
> 
> Всем привет, я уже несколько месяцев использую приложение Discourse на своем iPhone, и в последнее время оно довольно часто зависает. Приложение просто блокируется и перестает отвечать, обычно когда я пытаюсь загрузить новые посты или перемещаться между категориями. Это происходит чаще, когда у меня открыто несколько тем одновременно, и я переключаюсь между ними. Индикаторы загрузки крутятся бесконечно, а нажатие кнопок не дает никакого результата. В конце концов оно перезагружается, но это становится довольно раздражающим. У меня установлена последняя версия iOS 13.3 на iPhone 8 Plus. Кто-нибудь еще сталкивался с этой проблемой в последнее время? Сами форумы загружаются нормально в мобильном браузере, проблема только в специальном приложении. Я пробовал несколько раз принудительно закрывать и снова открывать приложение, но это, кажется, не помогает. Есть ли у других пользователей мобильных устройств Discourse какие-либо предложения по решению этих проблем с зависанием? Я бы не хотел отказываться от использования приложения, если оно продолжит блокироваться. Заранее спасибо за любую помощь или совет!

Поскольку мы внесли несколько изменений в промпт, я невероятно впечатлен результатами.

> [@bigfudge](#):
>
> Я могу представить, что иногда хочется отредактировать этот документ… и поскольку косинусное сходство относительно недорого (по сравнению с вызовом генерации LLM), обновление результатов в интерфейсе при изменении пользователем своего запроса/гипотетического документа все равно будет довольно быстрым.

Это интересное предложение, но довольно сложно объяснить этот процесс обычному пользователю. Тем не менее, мне очень нравится то, что Shopify сделал для своего административного интерфейса: они позволяют переопределять некоторые рекомендации по продуктам, предложенные ИИ. В конечном итоге мы можем сделать то же самое здесь.

> [@bigfudge](#):
>
> Будет здорово, когда это будет реализовано так, чтобы чат-бот мог использовать результаты.

Это уже так с двух дней назад. ИИ-бот использует этот метод для получения 1/4 своих внутренних результатов поиска.

---

<div class="post-metadata">

### Author: ![system](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/system/32/443519_2.png) [@system](https://meta.discourse.org/u/system)
#### Post date: [08.Октябрь.2023 17:52:27 UTC](https://meta.discourse.org/t/is-it-possible-to-make-the-default-search-semantic-search-on-the-site-how-much-do-these-calls-cost/275953/8 "2023-10-08T17:52:27Z")

</div>

This topic was automatically closed 30 days after the last reply. New replies are no longer allowed.
