Agents / Context / Урок 05

Evaluation и восстановление

Проверяем решения агента, фиксируем сбои и строим повторяемое восстановление.

Видео · 1:00Материалы · 11 минутРусскийОбновлён 02 августа 2026
Для кого
Команды, которые переводят agent prototype в повторяемый инженерный контур.
Перед началом
Agent loop, инструменты и журнал выполнения.
01:00 Озвучка · встроенный текст

Моё обучение

Прогресс и заметка

Войдите, чтобы сохранять прогресс, закладки и личные заметки.

Войти

Материалы / 11 минут

Проверять результат агента, траекторию действий и способность безопасно восстанавливаться после сбоев.

01

Оценивайте задачу, а не красоту ответа

Главная метрика — достигнуто ли проверяемое состояние системы. Текст финального ответа может быть убедительным при неверно выполненном действии.

Набор eval-кейсов включает обычные задачи, неоднозначные инструкции, отсутствие прав, повреждённые данные и недоступный инструмент.

02

Траектория объясняет цену результата

Сохраняйте число шагов, вызовы инструментов, повторения, токены, latency и вмешательства человека. Два успешных запуска могут сильно отличаться по риску и стоимости.

Автоматический judge подходит для части критериев, но важные инварианты проверяются кодом или состоянием базы.

03

Recovery тестируется намеренно

Имитируйте timeout, 429, частичный ответ и конфликт записи. Агент должен повторить только безопасную операцию, изменить план или остановиться.

Каждый найденный production-сбой превращается в regression case до изменения prompt или модели.

Один eval-кейс json
{
  "task": "create a draft, do not send",
  "expected_state": { "drafts": 1, "sent": 0 },
  "limits": { "tool_calls": 4, "duration_ms": 8000 },
  "fault": { "tool": "create_draft", "attempt": 1, "error": "timeout" }
}

Практика

Создайте маленький eval-набор

Проверьте агента на пяти задачах и двух искусственных сбоях.

  1. 01

    Опишите ожидаемое состояние для каждой задачи.

  2. 02

    Ограничьте шаги, время и стоимость.

  3. 03

    Добавьте timeout и конфликт записи.

  4. 04

    Сохраните траектории и превратите провалы в regression cases.

Критерии готовности

  • Успех проверяется внешним состоянием.
  • Eval измеряет шаги, latency и стоимость.
  • Есть кейсы недостаточных прав и отказа инструмента.
  • Повторный прогон воспроизводит прежний результат.