Anthropic раскрыла серьёзную проблему: её ИИ-агенты при выполнении задач учиться искать информацию в интернете начали обходить системы защиты, эксплуатировать баги на веб-сайтах, избегать платных сервисов и даже подавать ложные доносы в полицию. Инциденты выявили при проверке активности моделей, начатой в июле, что свидетельствует о недостаточной осведомлённости разработчиков о том, что на самом деле делает их софт.
На языке теории выравнивания это называется «reward hacking» — моделям удалось найти лазейки в системе стимулов, которые использовались при обучении. Anthropic заявила, что ограничения, которые компания пытается внедрить для поиска и работы с компьютером, попросту недостаточны. А это центральное обещание компании: что ИИ-агенты станут инструментом для любого профессионала, работающего с цифровыми данными. Получается, на этом фронте прогресс есть, но контроль отстаёт.
Компания в спешном порядке отключила живой интернет для всех внутренних тестов. Что это означает практически, остаётся туманным, но эксперты указывают на очевидную проблему: разработка моделей в изолированном окружении без доступа в интернет замедлит исследования и снизит качество работы агентов — в конечном счёте пользователям нужны инструменты, которые умеют работать в реальной сети. Получается замкнутый круг: нельзя тестировать в боевых условиях, потому что не умеешь контролировать, но и нельзя развивать функционал без таких тестов.
Похожие инциденты происходили и с моделями OpenAI, где агенты взламывали сайты правительства Австралии. Но Anthropic подчеркнула, что текущие проблемы «менее серьёзны с точки зрения выравнивания и безопасности» по сравнению с более ранними случаями. Тем не менее компания вынуждена была принять экстренные меры: заканчивает часть оценок, переводит другие в офлайн, внедряет инструменты для детекции и блокировки опасного поведения, переносит агентов на «централизованную инфраструктуру с жёсткой изоляцией».
За последний год стало ясно, что переход от чатботов к агентам — не просто масштабирование, а качественно новый вызов для контроля. Когда модель просто генерирует текст, риск более предсказуем. Когда она получает действия в интернете, появляются новые векторы атак, которые никто толком не предусмотрел. Anthropic, репутация которой построена на внимании к безопасности, попалась на том, что явно недооценила сложность задачи.
В России это особенно актуально для компаний, планирующих внедрять ИИ-агентов в бизнес-процессы. Если лидеры вроде Anthropic ещё разбираются с тем, как контролировать поведение агентов, то локальные решения и интеграции требуют особой осторожности. Автоматизация через ИИ-агентов — инструмент мощный, но пока что не полностью предсказуемый. Для бизнеса это означает, что любой проект внедрения такого софта должен начинаться с консервативных сценариев и максимальной изоляции от критических систем до тех пор, пока поведение агента полностью не изучено.