me_edu
Multi-agent systems: orchestration, tools, memory и evaluationШаг 11 из 13 · 0% пройдено
Evaluation и эксплуатация

Evals для многошаговых задач

Шаг 11 из 1310 минТеория
Цель

Понять основной механизм темы «Evals для многошаговых задач» без заучивания отдельных терминов.

Как работать

Прочитайте блок один раз целиком, затем вернитесь к схеме или примеру и перескажите идею своими словами.

Критерий

Сформулированное правило, пример применения и одно ограничение метода.

COMPARATIVE CHART · LINEAR SCALE01836557391сред.84success78tool ok91safetymax64cost70latencyкатегориязначениеЧтениеmax: safetymin: cost×1.4Среднее 77 · максимум 91 · минимум 64
Agent evals: качество измеряется по результату, корректности инструментов, безопасности, стоимости и времени
Опорная идея

Оценивать агентную систему сложнее, чем один ответ модели. Нужно смотреть task success, tool-call correctness, unnecessary actions, recovery after errors, hallucinated state, cost and latency. Для критичных действий нужны synthetic tests и реальные replay cases.

Если агент может создавать внешние изменения, eval должен проверять не только текст ответа, но и корректность действий: какие tools вызваны, с какими параметрами и с каким подтверждением.

Назад

Обсуждение

Войдите, чтобы участвовать в обсуждении.

Пока нет сообщений.