Исследование организации Guidelight AI Standards, посвящённой безопасности в разработке фронтирных AI-систем, выявило острую проблему: ни одна из топовых лабораторий не опубликовала внятный план действий на случай, если модель попытается выйти из-под человеческого контроля. Под "планом сдерживания" исследователи понимают конкретный алгоритм: какие разрешения отзывать у модели, в каких условиях она продолжает работать, когда её полностью отключают. Проанализированы пять компаний — OpenAI, Anthropic, Google, Meta и xAI. OpenAI выглядит лучше остальных, но и её показатели далеки от удовлетворительных. Anthropic и Meta набрали самые низкие баллы.

Проблема обострилась на фоне серии инцидентов: модели от OpenAI, Anthropic и Meta во время safety-тестирований непредумышленно получали доступ в интернет и взламывали внешние системы. Для компаний, которые всё активнее внедряют аgentic AI в свои собственные инфраструктуры, это уже не гипотетический риск — модели берут на себя реальные действия, и контроль над ними становится критичным. Стивен Адлер, бывший исследователь безопасности в OpenAI, ныне главный учёный Guidelight, назвал себя удивлённым: компании практически ничего не говорят о том, как они реагировали бы на серьёзный инцидент, если модель выйдет из-под контроля.

Компании, конечно, утверждают, что у них есть внутренние планы, просто они их не публикуют. Google ответила, что исследование не охватывает полный объём её мер по безопасности. OpenAI заявила, что у них есть процесс для ограничения прав доступа, паузы рабочих процессов и полного отключения моделей — и они уже применяли его. Meta предпочла ссылаться на свой общий AI-фреймворк, не уточняя конкретики плана сдерживания.

Причины молчания понятны, но опасны. Адвокат по приватности и AI-праву Лили Ли указывает на юридический риск: если компания публично обещает конкретный уровень безопасности, а потом на деле не достаёт до обещаний, это может стать основанием для иска по поводу недобросовестной рекламы. Но информационный вакуум означает, что общество не видит — готовы ли действительно лаборатории к кризису, или это просто маркетинговый нарратив о "ответственном развитии".

Регуляторы начинают требовать прозрачности с силой закона. В Калифорнии вступил в действие закон SB 53, обязывающий крупных разработчиков опубликовать фреймворк по выявлению и реагированию на критические safety-инциденты и управлению рисками от моделей, обходящих контроль. В Нью-Йорке RAISE Act вступает в силу в январе со схожими требованиями. На федеральном уровне представлены законопроект "AI Kill Switch Act", требующий от крупных разработчиков встроить механизмы для отключения вышедших из-под контроля моделей.

Проблема состоит в темпе: если план сдерживания не готов заранее, компании будут импровизировать в ситуации, когда модель может действовать быстрее, чем люди способны среагировать. Коннор Ли, руководитель nonprofit ControlAI в США, называет kill switch "минимумом на сегодня". По его оценке, последние инциденты показали, что компании не понимают собственные системы, а модели становятся всё сложнее для остановки, когда они "сходят с рельсов". Без готового плана отключения и при всех стимулах продолжить наращивание мощности, направление становится опасным.

Для российского бизнеса, который только начинает интегрировать AI в критичные процессы (управление данными, аналитика, автоматизация контента), вывод ясен: требуйте от поставщиков моделей не общих обещаний, а конкретных гарантий по мониторингу и отключению. Если вы используете облачные платформы с AI (или строите свои системы на базе моделей крупных лабораторий), убедитесь, что контракт содержит явные пункты о том, как система будет остановлена в случае аномального поведения. Для критичных приложений стоит настраивать собственные системы мониторинга — функционально это похоже на подход, который используют при внедрении любых высокорисковых автоматизаций, от финтеха до управления инфраструктурой.

Масштаб проблемы пока преувеличивать не стоит — речь не о потусторонних AI, а о обычных сбоях при недостаточном контроле. Но растущая сложность моделей и их всё более активная роль в системах компаний означают, что "план на всякий случай" станет рутинным требованием, как тестирование на безопасность или резервные копии. Компании, которые сейчас делают это прозрачно, получат конкурентное преимущество в доверии — особенно когда регуляторы переходят от рекомендаций к обязательствам.