Материалы / 14 минут
Развернуть agent worker с очередью, checkpoint, политиками и наблюдаемостью каждого задания.
Долгая задача становится job
HTTP-запрос создаёт job и быстро возвращает идентификатор. Worker забирает задачу, продлевает lease и сохраняет checkpoint после значимого шага.
Повторная доставка является нормой. Side effect защищается idempotency key, а job не считается завершённым до проверки результата.
Состояние должно переживать рестарт
Prompt, tool results и статус не могут существовать только в памяти процесса. После рестарта worker продолжает с подтверждённого checkpoint или безопасно начинает шаг заново.
Отмена пользователя переводит job в cancelling, останавливает активные вызовы и не допускает новых действий.
Наблюдаемость связывает весь путь
Используйте общий job ID и trace ID в логах, метриках и вызовах инструментов. Минимальные метрики: queue wait, run duration, tool errors, retries, human escalations и стоимость.
Новая модель или prompt сначала проходит eval, затем небольшой процент трафика. Возможность быстро вернуть предыдущую версию важнее автоматического полного rollout.
queued -> running -> verifying -> completed
| |-> failed
|-> waiting_for_approval
|-> retry_scheduled
|-> cancelling -> cancelled