Anthropic опубликовала статью «Automated Researchers Can Reliably Mitigate Alignment Failures», в которой описала систему, способную самостоятельно улучшать поведение моделей ИИ на основе тестов выравнивания. Речь идёт об одном из любимых сценариев всех разработчиков последние пару лет — когда ИИ сам обучает ИИ. На этот раз исследователи под руководством Chen Yueh-Han (fellow программы Anthropic) показали, что это может работать не только в теории.

Система, названная Automated Alignment Researcher (AAR), действует как настоящий исследователь: изучает научную литературу, предлагает методы улучшения, обучает модель в течение 30 минут, затем анализирует результаты и повторяет цикл. Когда AAR тестировали на 10 различных бенчмарках неправильного поведения, система улучшила показатели по каждому из них, не потеряв общую производительность. Звучит как очередная маркетинговая заявка, но числа действительно впечатляют: лучший результат AAR за шесть часов превосходит то, что предлагают опытные человеческие исследователи Anthropic.

Цены ещё более красноречивы — $4 за час работы автоматизированной системы против $150, которые платят человеческим исследователям. Авторы явно не скрывают подтекст: машина не просто быстрее, но и дешевле, и эффективнее. Это прямой намёк на то, что AAR потенциально может заменить часть работы по выравниванию ИИ, которая до сих пор требует ручного труда специалистов.

Важно понимать контекст: это не про то, что ИИ вот-вот получит сознание и начнёт совершенствоваться в космосе. AAR работает в очень узком коридоре — улучшение поведения на известных тестах выравнивания, которые люди написали и определили как важные. Система неплохо справляется именно потому, что задача чётко ограничена. Авторы честно отметили и ограничения: система зависит от качества самих бенчмарков, а литература, которую она изучает, требует постоянного обновления и расширения. Если бенчмарк плохой или неполный, AAR будет оптимизировать под иллюзию выравнивания, а не реальное улучшение безопасности.

Что это означает для индустрии: автоматизация исследований выравнивания — это реальный шаг в направлении того, что специалисты называют recursive self-improvement. Если ИИ может автоматизировать улучшение собственного выравнивания, вопрос в том, насколько расширяемо это до других задач. OpenAI, Google и другие лаборатории давно работают над похожими подходами, так что это не прорыв Anthropic, а скорее подтверждение тренда. Но Anthropic первой опубликовала детальный результат с числами.

Для российского бизнеса это пока имеет опосредованное значение. Автоматизация исследований выравнивания актуальна для компаний, которые обучают собственные большие языковые модели или системы, критичные по надёжности. В России это нишевая область — обычно берут готовые API от иностранных лабораторий. Однако для команд, которые адаптируют ИИ-модели под локальные задачи (финтех, контент, кастомная автоматизация), такие подходы могут стать актуальны лет в пять-десять, когда затраты на «доводку» безопасности станут заметной частью бюджета. Сейчас это лишь подтверждает, что рутинные исследовательские работы будут постепенно передаваться машинам — а специалистам нужно двигаться выше по иерархии принятия решений.