Проблема контроля над AI-агентами в корпоративной среде становится острой ровно в момент, когда эти системы становятся полезнее. Банки, больницы и государственные структуры сегодня не отказывают AI в деплойменте из-за недостаточной «умности» модели — отказывают потому, что не могут гарантировать поведение системы своим клиентам и регуляторам. Это классическая дилемма: мощный инструмент требует надёжной верификации перед использованием на критичных операциях.
Рune Кvист, ранний сотрудник Anthropic, и Rajiv Dattani, бывший COO исследовательской организации METR, учли эту потребность и создали стартап Artificial Intelligence Underwriting Company (AIUC). Идея простая, но действенная: применить проверенную модель кибербезопасности к рискам AI-агентов. Компания разработала стандарт AIUC-1 и услугу тестирования, которая пропускает агент через набор около 5 тысяч сценариев — попытки джейлбрейка, галлюцинации, утечки данных. На выходе клиент получает 100-страничный отчёт, чётко указывающий, где система надёжна, а где нет.
Инвесторы оценили подход: в четверг AIUC объявила о привлечении $40 млн Series A от Ribbit Capital при участии First Harmonic. Это добавилось к $15 млн seed-раунда от Nat Friedman (NFDG фонд), Emergence, Terrain и Ben Mann (соучредитель Anthropic), в сумме дав стартапу $55 млн. Среди первых клиентов — Cursor, Lovable, Harvey и ElevenLabs, то есть компании, которые реально деплоят агентов в production.
Интересно, что AIUC сам использует AI-агентов для проведения тестов и анализа данных, но финальную верификацию делают люди. Это не случайно: стартап собрал консорциум из примерно 250 специалистов по безопасности и рискам (то есть фактических покупателей агентов) и спросил их просто — что вы хотите видеть в отчёте при покупке AI-системы? Какие вопросы нужно задать? Этот feedback стал основой для набора тестов. Подход напоминает классический SOC 2 в кибербезопасности, который стал стандартом де-факто для аудита облачных сервисов.
Параллельно с этим фундамент для такого решения закладывают сами крупные лаборатории. Dario Amodei, CEO Anthropic, недавно призвал отрасль замедлить разработку frontier-моделей, ссылаясь на растущее количество инцидентов с неожиданным поведением AI. Он даже предложил требовать от frontier labs встроить независимых наблюдателей третьей стороны — и упомянул METR как один из возможных вариантов. AIUC не планирует физически размещаться в офисах клиентов, но суть та же: дать enterprises независимую оценку безопасности агентов перед покупкой.
Для российского рынка это направление пока остаётся нишевым, но уже начинает проявляться: крупные компании, внедряющие AI-агентов для автоматизации процессов (например, в обработке документов, аналитике или контент-генерации), сталкиваются с теми же вопросами контроля. Регуляторные требования в области ИИ ужесточаются, и клиенты спрашивают о гарантиях. В этом контексте третьесторонняя сертификация становится бизнес-требованием, а не опцией. На рынке уже действуют локальные игроки, предлагающие услуги аудита и тестирования AI-решений, но пока это разрозненно и без единого стандарта.
Что реально важно в AIUC — это не маркетинг вокруг слова «safety», а практический инструмент. Пять тысяч тестовых сценариев, на которых реально может сломаться production-система, — это не философия и не PR-ход. Это то, что enterprises уже спрашивают друг у друга на конфиденциалиях: «А ты как проверяешь поведение своих агентов?» AIUC просто первая, кто предложил масштабируемый, повторяемый ответ на этот вопрос. И тот факт, что компании вроде Cursor и Lovable (бывшие в фокусе как инновационные, но достаточно взрослые проекты) уже ей доверяют, говорит о реальной потребности, а не о надуманной проблеме.