me_edu
Инженерия GenAI-приложений: RAG, агенты и оценка качестваШаг 17 из 19 · 0% пройдено
Оценка качества и эксплуатация

Evals как тесты продукта

Шаг 17 из 1911 минТеория
Цель

Понять основной механизм темы «Evals как тесты продукта» без заучивания отдельных терминов.

Как работать

Прочитайте блок один раз целиком, затем вернитесь к схеме или примеру и перескажите идею своими словами.

Критерий

Сформулированное правило, пример применения и одно ограничение метода.

DATA PLOT · MEASUREMENT SERIES-1012345-1-0.40.20.81.42P1P2P3P4xymeasured pointslinear trendapprox.: y = 0.07x + 0.55
Качество RAG отслеживают по наборам вопросов: изменение должно улучшать метрики, а не только ощущение
Опорная идея

GenAI-функцию нельзя оценивать только впечатлением. Нужен golden set: реальные вопросы, ожидаемые источники, допустимые ответы и критерии ошибок. Минимальные метрики: relevance, faithfulness, refusal quality, latency, cost, доля ответов без источника и регрессии после изменения промпта или индекса.

Evals не делают модель идеальной, но превращают улучшение в инженерный процесс: было 72% правильных ответов, стало 84%, но latency выросла на 30%. Теперь можно принимать решение, а не спорить вкусами.

Назад

Обсуждение

Войдите, чтобы участвовать в обсуждении.

Пока нет сообщений.