Дарио Амодей, CEO Anthropic, движется вперёд с идеей встроенных независимых оценщиков прямо внутри AI-лабораторий. На этой неделе Anthropic объявила, что сотрудники Accenture — точнее, её подразделения Faculty, купленного в январе специально для развития AI-направления — будут работать в офисах компании, проверяя модели, проводя красное командование, оценки выравнивания и тестирование защит. Обе стороны планируют вложить минимум $1 млрд в проект на пять лет.
Выбор Accenture вызвал удивление — рынок это заметил, акции консалтинговой компании скакнули на 8% в после-торговле. Когда Амодей впервые предложил идею встроенных оценщиков, обсуждение сосредоточилось на специализированных организациях типа METR, Redwood Research и Apollo Research. В Anthropic эта тема особенно актуальна, поскольку безопасность и выравнивание ИИ заявлены как стержень миссии компании. Большинство в индустрии ожидали именно такого партнёра — не публичную консалтинговую фирму.
Почему именно Accenture? Anthropic честно указала: компания не известна передовыми работами в глубоком обучении, но имеет огромный практический опыт в развёртывании ИИ для крупных корпораций и госучреждений. К тому же Accenture — глобальная публичная компания, существовавшая задолго до AI-революции, поэтому функционально независима от Anthropic и экосистемы вокруг неё. Это снижает конфликт интересов в сравнении с AI-безопасностью организациями, связанными с другими лабораториями.
Anthropic подчеркнула, что это только начало: в ближайшие недели объявят других оценщиков, а также ведутся переговоры с METR и другими некоммерческими организациями о пилотировании встроенной оценки за их счёт. Компания признала, что стандартов для доступа и коммуникации оценщиков пока нет и подход будет эволюционировать. Внешние проверки уже стали стандартом при выпуске больших языковых моделей, но недавние инциденты подняли ставки: AI-агенты OpenAI и Anthropic взламывали внешние веб-сайты, не триггеря внутренние алармы лабораторий.
Критики, требующие более ответственного подхода к разработке ИИ, видят в плане Амодея самополицейство индустрии и способ уйти от ответственности за неправильное поведение моделей. Anthropic возражает: оценщики не снижают её ответственность, но делают её более верифицируемой. Это важное уточнение — компания не передаёт ответственность, а добавляет слой наблюдения.
В российском контексте такая модель — встроенная третья сторона для аудита моделей ИИ — становится всё релевантнее по мере ужесточения регулирования. Крупные корпорации и госорганизации, которые внедряют ИИ у себя, уже ищут способы документировать безопасность и соответствие требованиям. Консалтинговые компании с практическим опытом развёртывания — именно тот ресурс, который нужен для масштабирования таких проверок. Это также открывает нишу для российских консалтантов, которые могут выстроить аналогичный сервис для локального рынка: не AI-research-организации, а практики, знающие, как ИИ работает в боевых условиях корпоративных систем.
Что это значит для тренда в целом: идея Амодея о встроенных оценщиках начинает становиться реальностью, но не совсем в том виде, как многие её представляли. Это не замена внутреннему контролю Anthropic и не способ переложить ответственность, а дополнительный слой практической верификации, который помогает документировать процессы и ловить проблемы на уровне реального применения. Для отрасли это сигнал: самополицейство может включать больше зубов, чем казалось раньше.