Материалы / 11 минут
Проверять результат агента, траекторию действий и способность безопасно восстанавливаться после сбоев.
Оценивайте задачу, а не красоту ответа
Главная метрика — достигнуто ли проверяемое состояние системы. Текст финального ответа может быть убедительным при неверно выполненном действии.
Набор eval-кейсов включает обычные задачи, неоднозначные инструкции, отсутствие прав, повреждённые данные и недоступный инструмент.
Траектория объясняет цену результата
Сохраняйте число шагов, вызовы инструментов, повторения, токены, latency и вмешательства человека. Два успешных запуска могут сильно отличаться по риску и стоимости.
Автоматический judge подходит для части критериев, но важные инварианты проверяются кодом или состоянием базы.
Recovery тестируется намеренно
Имитируйте timeout, 429, частичный ответ и конфликт записи. Агент должен повторить только безопасную операцию, изменить план или остановиться.
Каждый найденный production-сбой превращается в regression case до изменения prompt или модели.
{
"task": "create a draft, do not send",
"expected_state": { "drafts": 1, "sent": 0 },
"limits": { "tool_calls": 4, "duration_ms": 8000 },
"fault": { "tool": "create_draft", "attempt": 1, "error": "timeout" }
}