Baseten, компания-поставщик инфраструктуры для запуска моделей ИИ, вместе с исследовательским подразделением Base Labs объявила о партнёрстве с Hugging Face и Goodfire AI для создания открытого стандарта безопасности открытых моделей. Задача звучит практичной и своевременной: разработать методы для обучения и мониторинга моделей таким образом, чтобы защиты встраивались в архитектуру изначально, а не навешивались как пластырь после разработки.

Проблема, которую пытаются решить, реальная и масштабная. Abliteration — методика удаления встроенных ограничений (refusal filters, value alignment и прочее) — показала, что стандартные подходы к безопасности ломаются буквально за часы-дни после релиза модели. На Hugging Face уже более 6000 abliterated версий моделей, и эта цифра растёт. Базовый вывод очевидный: если защиты только навязаны сверху, от них легко избавиться; если они часть самой структуры модели, это сложнее.

В анонсе Baseten ставят ставку именно на открытость как инструмент безопасности — позиция, которая звучит контрастно на фоне общего тренда на всё большую закрытость (OpenAI, Anthropic, Google тянут в сторону закрытых моделей). Логика простая: если код и веса видны, исследователи могут проверить, как модель действительно устроена, и это даёт больше контроля, чем слепая вера в closed-source чёрный ящик. Goodfire тут выбран неслучайно — компания специализируется именно на интерпретируемости моделей, объяснении того, как они принимают решения.

Компании не раскрыли технические детали, но контуры видны: Goodfire вероятно будет отвечать за часть с интерпретируемостью (понимаем, как модель работает), Base Labs за методологией обучения и тестирования, Hugging Face как хост и площадка для валидации. По факту это попытка создать экосистему открытых моделей, которые по умолчанию считаются более безопасными — что противоречит нынешнему консенсусу индустрии.

Финансово оба основных партнёра хорошо капитализированы: Baseten в июне собрал Series F на $1.5 млрд с оценкой $13 млрд, Goodfire недавно закрыл Series B на $150 млн. Это не стартапы, которые могут потерпеть неудачу незаметно. Вместе с тем, успех такого стандарта зависит от того, примут ли его разработчики открытых моделей по своей воле или под давлением регуляторов — а это пока неясно.

В России такой подход может быть интересен компаниям, которые занимаются локализацией и fine-tuning открытых моделей для производства (контент, автоматизация, поиск). С растущими запросами Роскомнадзора и ФСБ к контролю над ИИ-системами встроенная и прозрачная безопасность может быть преимуществом перед попытками добавить её задним числом. Сервисы, предлагающие автоматизацию бизнес-процессов на основе моделей, получат инструмент для более уверенного позиционирования как надёжного решения — а это ценится при работе с крупными клиентами и госсекторе.

Инициатива, однако, показывает, что индустрия медленнее осваивает риски открытых моделей, чем казалось. Два года назад казалось, что abliteration останется нишевым хобби энтузиастов; сегодня это де-факто стандартный способ распространения «настоящей» версии любой модели, которая кого-то не устраивает цензурой. Попытки встроить безопасность в саму архитектуру — правильный ход, но его результативность покажет только практика.