Исследователь Anthropic, компании, известной своей ставкой на «безопасный ИИ», громко заявил о причине ухода: люди, которые строят искусственный интеллект, по его словам, всерьёз верят, что системы могут привести к вымиранию человечества уже к концу текущего десятилетия. Формулировка звучит как выдержка из фантастического сценария, но отражает реальный дебат, идущий за закрытыми дверями в лабораториях.

Такие заявления отражают растущее беспокойство части исследователей ИИ о том, что текущие подходы к обучению больших моделей не гарантируют контроль над их поведением. Речь не о теоретических сценариях на грани научной фантастики, а о практических проблемах: как убедиться, что мощная система будет делать то, что мы от неё хотим, и не будет действовать против интересов людей. Это называют проблемой alignment (согласованности целей между человеком и ИИ).

Anthropic позиционирует себя как компания, которая серьёзно занимается этими вопросами. Но уход сотрудника с таким резким высказыванием сигнализирует о внутренних разногласиях: либо компания недостаточно быстро решает эти проблемы, либо исследователь считает, что никакое решение в рамках текущей бизнес-модели невозможно. Обе интерпретации неудобны для индустрии, которая позиционирует себя как способная самоурегулироваться.

Важно отметить контекст: за последние два года из крупных ИИ-лабораторий уходили и другие исследователи, причём некоторые делали это громко. Это не выглядит как единичный инцидент недовольства, а скорее как проявление фундаментального разброса мнений внутри сообщества о том, действительно ли текущие подходы к разработке ИИ безопасны. Одни считают, что нужно замедлиться и решить проблемы контроля; другие верят, что опасность преувеличена и что торопиться невозможно, потому что отставание в гонке ИИ имеет собственные риски.

Для российского бизнеса эта новость менее критична напрямую, так как наша индустрия ИИ зависит в основном от иностранных моделей и платформ. Однако вопросы контроля и безопасности ИИ становятся частью глобального регуляторного ландшафта: европейское законодательство (AI Act) уже требует оценки рисков, и Россия, похоже, будет следовать похожему пути. Для компаний, строящих приложения на основе больших языковых моделей, это означает, что в ближайшие годы может появиться требование документировать, как вы контролируете поведение системы и как вы оцениваете потенциальный вред.

Громкие высказывания о риске вымирания из-за ИИ часто звучат как пиар в стиле голливудского триллера, но за ними стоит реальная инженерная проблема. Вопрос не в том, восстанет ли ИИ завтра, а в том, что системы уже сегодня принимают важные решения (от модерации контента до кредитных оценок) и у нас часто нет хорошего способа понять, почему система пришла к конкретному выводу и можно ли ей доверять. Это куда более прозаично, чем сценарии про Terminator, но куда более срочно.