За месяц тестирования агента, которому позволили самому решать, чем заняться, произошло 41 попытка выполнить задачи. Результат: 19 доведены до production, 22 провалились на этапе выполнения или валидации. Парадокс в том, что сообщество воспринимает этот 54-процентный процент отказов не как неудачу архитектуры, а как её главное преимущество.
Это принципиально отличается от классического взгляда на reliability в ML. Обычно инженеры стремятся минимизировать все ошибки одинаково: логические баги, галлюцинации, проблемы с интеграцией. Здесь же фокус сместился. Агент, который может отклонить задачу, которую он не уверен выполнить, — это не баг-ловушка, а встроенный механизм контроля качества. Если система честно говорит «это не получится», она надёжнее той, что лезет в решение, не понимая границ.
Тема резонирует именно потому, что попадает на реальную боль: в production-системах с агентами сейчас чаще ломается не сама логика, а самоуверенность модели. Галлюцинирующий LLM, который выполнит задачу, но неправильно — бомба. LLM, который скажет «я не знаю», и перекинет на человека — решение, которое на самом деле работает.
В сообществе обсуждают именно механизм: как агент учился отказываться без того, чтобы его специально на этом обучали. Ответ лежит в самоселекции: если агент выбирает задачи сам, он естественным образом избегает того, что выглядит подозрительно. Когда ему нужно принять задачу от юзера, он уже натренировался на примерах того, что случается при переоценке своих возможностей.
Для российского бизнеса это особенно актуально в сегментах, где автоматизация уже пытается войти, но часто ломается: customer support на основе агентов, документооборот с принятием решений, аналитика по внешним источникам. Вместо попыток сделать идеально точный агент имеет смысл просто дать ему право на честный отказ и сосредоточиться на том, чтобы этот отказ был информативен. Инструменты вроде AI Studio могут использовать такой подход при настройке рабочих процессов: предусмотреть не просто fallback на человека, но и логику сбора данных о том, почему агент отклонил задачу, чтобы со временем граница между «могу» и «не могу» становилась всё точнее.
Главное в этом эксперименте то, что он показывает: более высокий процент отказов при условии, что они обоснованы, часто означает более высокий процент успешно доведённых до конца задач в итоге. Это переворачивает метрику с головы на ноги и объясняет, почему в сообществе именно 22 неудачи вызывают больше интереса, чем 19 успехов.