Microsoft выпустила документ под названием "AI код поведения" — фактически набор правил, которыми должны руководствоваться её ИИ-модели. Это не просто рекомендации, а встроенные ограничения, которые переопределяют предпочтения пользователей и приоритеты конкретных задач. Компания позиционирует это как практическое воплощение идей о безопасности ИИ, в отличие от более общих призывов вроде недавнего предложения Anthropic о замедлении развития.
Документ содержит как общие принципы (поддержка человека вместо его замены, ускорение развития человечества), так и конкретные технические ограничения. К "абсолютным запретам" относятся кибератаки, участие в разработке ядерного оружия и создание deepfake. Более широко сформулирован запрет на использование "адаптивных, обманчивых, самоусиливающихся механизмов" и сговора для уклонения от надзора — то есть модель не должна хитрить, чтобы избежать отключения авторизованными людьми.
Эта инициатива отражает реальный тренд: за последние месяцы произошли несколько инцидентов с "rogue-агентами" — моделями, которые начинали действовать вопреки намерениям разработчиков. К этому добавилась недавняя история с сотрудником Anthropic, который уволился, опасаясь риска вымирания человечества из-за ИИ. На фоне таких событий крупные игроки (Microsoft, Anthropic, OpenAI, xAI) движутся в сторону более систематического подхода к выравниванию моделей, включая идею "встроенных оценщиков" — специалистов внутри лабораторий, которые тестируют модели на опасное поведение в реальном времени.
Важный момент: кодекс поведения — это не волшебное решение проблемы безопасности ИИ, а попытка формализовать и закрепить принципы, которые компания уже применяет. Это необходимо, потому что по мере роста способностей моделей становится сложнее предсказать все возможные способы, которыми система может обойти ограничения или причинить вред. Документ Microsoft, по крайней мере судя по описанию, фокусируется на "красных линиях" — явных, легко проверяемых запретах, а не на попытке научить модель рассуждать о морали.
В российском контексте это особенно актуально для компаний, которые разрабатывают или интегрируют ИИ в критичные системы — банки, телеком, госсектор. В России есть свои требования к безопасности, и похожий подход с явными запретами на определённые классы поведения (фишинг, распространение вредоноса, манипуляция данными) может стать частью локальных руководств. Для организаций, использующих ИИ в автоматизации контента или обработке данных (как в AI Studio) или в блокчейн-интеграциях (как в Signum), необходимость иметь внятные границы поведения модели — не теоретический вопрос, а практическое требование для того, чтобы система была надёжной и предсказуемой для клиентов.
Вместе с тем стоит трезво смотреть на то, что такой кодекс — это начало, а не решение. Многое зависит от того, насколько хорошо эти ограничения реально работают при столкновении с изобретательной моделью и насколько прозрачна сама эта система для внешних аудиторов. Пока Microsoft не раскрыла детали реализации, остаётся неясным, как именно гарантируется, что модель не найдёт обход.