Оценивать агентную систему сложнее, чем один ответ модели. Нужно смотреть task success, tool-call correctness, unnecessary actions, recovery after errors, hallucinated state, cost and latency. Для критичных действий нужны synthetic tests и реальные replay cases.
Если агент может создавать внешние изменения, eval должен проверять не только текст ответа, но и корректность действий: какие tools вызваны, с какими параметрами и с каким подтверждением.