# Оценка промптов LLM — полезно знать

**URL:** https://meta.discourse.org/t/llm-prompt-evals-nice-to-know/345867
**Category:** Community Building
**Tags:** ai
**Created:** [06.Январь.2025 20:32:54 UTC](https://meta.discourse.org/t/llm-prompt-evals-nice-to-know/345867 "2025-01-06T20:32:54Z")
**Posts on this page:** 1
**Page:** 1

<div class="post-metadata">

### Author: ![EricGT](https://avatars.discourse-cdn.com/v4/letter/e/f1d935/32.png) [@EricGT](https://meta.discourse.org/u/EricGT)
#### Post date: [06.Январь.2025 20:32:54 UTC](https://meta.discourse.org/t/llm-prompt-evals-nice-to-know/345867/1 "2025-01-06T20:32:54Z")

</div>

Для тех из нас, кто создаёт [промпты](https://en.wikipedia.org/wiki/Prompt_engineering) для больших языковых моделей (LLM), понимание эффективности этих промптов имеет ключевое значение.

В терминологии LLM это называется `evals` (сокращение от evaluations — оценки). Для тех, кто привык к [модульному тестированию](https://en.wikipedia.org/wiki/Unit_testing) в программировании, сходство настолько велико, что я часто мысленно приравниваю эти два понятия.

В ходе «12 дней OpenAI» был задан следующий вопрос:

> Что мы, как разработчики, не делаем в той мере, в которой, по вашему мнению, должны? Что бы вы хотели, чтобы мы делали иначе, чаще или реже?

Мишель Покрасс из OpenAI [ответила](https://community.openai.com/t/ama-on-the-17th-of-december-with-openais-api-team-post-your-questions-here/1057527/203?u=ericgt):

> Одна из главных вещей — это evals! Я вижу множество разработчиков, которые вообще не используют evals и полагаются на интуицию при внедрении изменений в продакшн. Настоятельно рекомендую создать простые evals с помощью нашего продукта для оценок (или решений с открытым исходным кодом), чтобы вы могли обновляться с уверенностью при выпуске новых моделей.

В Twitter Аманда Аскелл (@AnthropicAI) [отметила](https://x.com/amandaaskell/status/1866207266761760812):

> Скучный, но критически важный секрет хороших системных промптов — это разработка через тестирование (TDD). Вы не пишете системный промпт и затем ищете способы его протестировать. Вы сначала пишете тесты, а затем находите системный промпт, который их проходит.

Многие не знают, но сейчас инструменты, помогающие конечным пользователям оценивать свои промпты, начинают набирать популярность среди создателей моделей LLM.

OpenAI playground:

> **[Working with evals | OpenAI API](https://developers.openai.com/api/docs/guides/evals)**
>
> Learn how to test and improve AI model outputs through evaluations.

Примечание: Это новое решение в OpenAI playground, и оно отличается от тех evals, которые мы годами видели в репозитории OpenAI на GitHub ([evals](https://github.com/openai/evals)).

Anthropic console:

> **[Evaluate prompts in the developer console | Claude](https://claude.com/blog/evaluate-prompts)**
>
> Generate, test, and evaluate prompts directly in the Anthropic Console with automatic test case generation and side-by-side output comparison. When building AI-powered applications, prompt quality significantly impacts results.

Microsoft .Net framework на Azure:

> **[Quickstart - Evaluate the quality of a model's response - .NET](https://learn.microsoft.com/en-us/dotnet/ai/tutorials/llm-eval)**
>
> Learn how to create an MSTest app to evaluate the AI chat response of a language model.

Раскрытие информации: Я не использовал ни одну из этих автоматизированных систем оценки, но проводил множество более простых оценок вручную, пробуя разные промпты. Эти инструменты просто сделают процесс проще.

* * *

Для получения более подробной информации о методе, при котором другой (в идеале более крупный или мощный) модель анализирует результаты вместо сравнения вывода модели с результатом, созданным человеком, рекомендую этот урок от Колина Джарвиса.

[Урок 6: Метапромптинг с o1](https://learn.deeplearning.ai/courses/reasoning-with-o1/lesson/7/meta-prompting)  
в рамках курса DeepLearning.AI: [Reasoning with o1 - DeepLearning.AI](https://www.deeplearning.ai/short-courses/reasoning-with-o1/)

* * *

FYI

Хотел добавить тег `evals`, но у меня нет прав для его создания.
