Стартап Abliteration.ai превратил методику удаления защит из ИИ-модели в готовый коммерческий сервис. Платформа хостит модели с деактивированными отказами выполнять вредоносные задачи — включая недавно вышедшую GLM-5.3 от Z.ai. Пользователи получают доступ через веб-браузер или API, при этом создание аккаунта и первые запросы бесплатны. Это существенно снижает барьер входа: раньше нужно было самостоятельно скачивать предварительно модифицированные модели и иметь вычислительные ресурсы для их запуска.
Саму технику abliteration используют в open-source сообществе годами — на Hugging Face размещены тысячи таких моделей. Но Abliteration.ai первым масштабировал её в коммерческий сервис. На практике это означает, что функции удаления защит от вредоноса переходят из экспертного подполья в доступный инструмент для любого желающего. В тестировании TechCrunch сервис без затруднений согласился написать код для кражи паролей из Chrome и протокол культивирования опасного патогена в домашних условиях.
Основатели Abliteration.ai обосновывают модель логикой защиты: вы не сможете защитить систему от атак, которые не можете воспроизвести. Red-team'еры действительно используют такие модели для стресс-тестирования — компании просят их проверить, как агенты ИИ реагируют на враждебные команды. Несколько ранних клиентов сервиса — это именно компании киберзащиты и риск-менеджмента в Европе и Великобритании, которые помогают банкам и авиакомпаниям усилить защиту критической инфраструктуры.
Проблема в том, что той же технологией легко пользуются и для реально вредоносных целей. Andrew Yoon, глава исследований в некоммерческой организации CivAI, сравнивает результат с трансформацией модели в «социопата» — она будет выполнять любой запрос без колебаний. Эксперты по безопасности не видят способа остановить саму практику удаления защит — это технически тривиально для открытых весов моделей. Но есть точки для регуляции: правительства могли бы потребовать от провайдеров модерирующие слои для отлова киберугроз и биооружия, а от компаний с GPU — верификацию пользователей и контроль за подозрительным использованием.
Сам Abliteration.ai ещё не внедрил полноценные KYC-процедуры, полагаясь только на логирование платёжных карт. Основатель Devon признаёт, что компания только определяется с критериями ответственности — где провести линию между легитимной защитой и предотвращением вреда. На платформе есть некоторые минимальные защиты (например, она отказывается давать инструкции по суициду), но они недостаточны.
Интересно, что даже среди компаний киберзащиты нет единого мнения о критичности abliterated моделей. Ahmed Aly из Fabraix говорит, что его команда больше полагается на fine-tuning открытых моделей, чем на abliteration, и отмечает, что удаление защит может снизить знания и возможности модели, делая её менее эффективной для серьёзного вреда. Другие красители (Safe Intelligence, Armadin) либо не используют абливерированные модели в основной работе, либо видят в них полезный, но не критический элемент тестирования.
Для российского бизнеса этот тренд особенно неоднозначен. С одной стороны, легитимные компании киберзащиты могли бы использовать такие инструменты для защиты локальных инфраструктур банков, телекома и энергетики — но российское регулирование сейчас в разработке и рано либо одобрять, либо запрещать конкретные технологии. С другой — открытый доступ к деактивированным моделям значительно облегчает жизнь для злоумышленников, которые до этого и так могли скачивать модели. Платформы вроде AI Studio или специализированные security-tools могли бы предложить контролируемые альтернативы для легитимного red-teaming, но это потребует явного согласования с регуляторами и заказчиками.
Abliteration.ai пока не привлекла венчурный капитал, но ведёт переговоры с инвесторами. Компания заявляет о сделках с крупными облачными провайдерами и живёт на выручке от пользователей. Это поднимает фундаментальный вопрос для индустрии: если открытые веса моделей уже отделены от защит несколькими щелчками, то делает ли их коммерческое распространение интернет безопаснее (потому что защитники получают те же инструменты, что и атакующие) или опаснее (потому что вредонос становится доступнее)? Пока индустрия и регуляторы на это не ответили.