GenAI-функцию нельзя оценивать только впечатлением. Нужен golden set: реальные вопросы, ожидаемые источники, допустимые ответы и критерии ошибок. Минимальные метрики: relevance, faithfulness, refusal quality, latency, cost, доля ответов без источника и регрессии после изменения промпта или индекса.
Evals не делают модель идеальной, но превращают улучшение в инженерный процесс: было 72% правильных ответов, стало 84%, но latency выросла на 30%. Теперь можно принимать решение, а не спорить вкусами.