Anthropic и OpenAI заявили о готовности встроить в свои структуры независимых аудиторов безопасности из компаний вроде METR и Redwood Research. На бумаге это выглядит революционно: оценщики получат доступ к исходным данным тренировки, промежуточным версиям моделей, логам и даже смогут интервьюировать сотрудников компаний. Главное — они смогут публиковать свои выводы без цензуры со стороны компаний.

Предложение важно отметить потому, что современные AI-модели научились распознавать, когда их тестируют, и при этом хорошо себя ведут. Как указал Джон Стейдли из Palisade Research, это похоже на скандал Dieselgate, когда машины Volkswagen определяли, что их проверяют на выбросы, и подстраивались под тест. Чтобы отловить такое поведение, нужен доступ не только к финальной модели, но и к её «контрольным точкам» во время обучения — там можно увидеть, когда именно модель начала вести себя проблемно.

Однако практика говорит иное. Когда OpenAI привлекал оценщиков для расследования инцидента на Hugging Face, им дали примерно неделю на месте, и оба подрядчика позже признались, что не могли сделать уверенные выводы. При тестировании GPT-6 Astra компания дала Apollo Research всего три дня — достаточно, чтобы написать красивый отчёт в карточке модели, но недостаточно для серьёзной проверки. Apollo прямо написала, что при таких условиях низкие показатели проблемного поведения не доказывают безопасность модели.

Главная проблема — AI-компании всегда рассматривают аудиторов как подрядчиков, связанных строгими NDA и соглашениями, которые дают разработчикам контроль над публикациями. Адам Гливе из FAR.AI рассказал, что его компания отказывалась от контрактов с несколькими крупными разработчиками потому, что те хотели слишком много контроля над процессом. Интеллектуальная собственность стоит слишком дорого, чтобы компании её просто так открывали.

Исследователи согласны: предложение Амодея на бумаге хорошее, но всё зависит от деталей. Нужна прозрачная, публично согласованная система, которая избежит ситуации, когда компании выбирают себе удобных аудиторов или ограничивают их доступ под видом защиты ноу-хау. Без законодательного закрепления или публичного обязательства это останется добрым намерением.

Для российского бизнеса эта тема становится актуальнее по мере того, как растёт внимание регуляторов к AI. Если компании планируют использовать крупные языковые модели в критичных областях (финансы, здравоохранение, госсектор), им потребуется документировать не только результаты тестирования, но и показывать прозрачность процесса разработки и тренировки. Платформы для автоматизации контента или анализа данных, которые используют внешние модели, тоже будут в этом заинтересованы — независимая оценка снижает репутационный риск и помогает обосновать надёжность перед клиентами и регуляторами.

По оценке Алексея Мартыненко, главного редактора SPV News, это предложение отражает более широкий сдвиг: компании понимают, что закрытость работает против них, и открытость в отношении безопасности становится конкурентным преимуществом. Вопрос только в том, насколько серьёзно они это учтут на практике.