Snorkel AI закрыла раунд Series E объёмом $350 млн при оценке $3,5 млрд — утроив стоимость компании со времени предыдущего раунда в апреле 2025 года, когда она привлекала $100 млн при оценке $1,3 млрд. Раунд возглавили Insight Partners и S32, в нём также участвовали существующие инвесторы Addition, Lightspeed, Greylock, GV и Wells Fargo. Это отражает перегрев рынка вокруг любого стартапа, связанного с подготовкой данных для больших языковых моделей.

Компания позиционирует себя как поставщик готовых датасетов и симуляционных окружений для reinforcement learning — по сути, перешла от чистого SaaS для разметки данных к модели data-as-a-service. Гибридный подход Snorkel сочетает синтетическую генерацию данных с участием экспертов в предметной области. Компания утверждает, что её annualized revenue run-rate составляет $375 млн — рост в 18 раз за год. Однако стоит понимать контекст: это валовая выручка, и значительная часть идёт на оплату труда экспертов. У конкурентов, например Mercor (валовая выручка $2 млрд) и Handshake ($1 млрд), 60-70% топовой выручки уходит именно на платежи исполнителям, что существенно снижает реальный нетто.

Снорkel выделяет, что в отличие от платформ-маркетплейсов труда, её выплаты экспертам — это часть себестоимости товара, а не отдельная статья расходов. Это скорее маркетинговый трюк для красивых цифр, чем фундаментальное отличие в экономике. Реально важнее то, что AI-лаборатории действительно озабочены качеством тренировочных данных на фоне плато в улучшении моделей на уже доступных публичных датасетах — и готовы платить премиум за специализированные данные.

Компания была основана в 2019 году на основе четырёхлетнего исследования Алекса Ратнера (CEO) и его команды из Stanford AI Lab. Траектория Snorkel типична для волны data-centric AI: стартовала как инструмент для разметки, быстро поняла, что живые деньги в готовых продуктах и сервисах, переориентировалась. Вопрос в том, насколько эта модель масштабируется, когда количество нужных экспертов конечно и возникает конкуренция за таланты в специализированных доменах.

Контекст рынка важен: рост Snorkel совпадает с волной инвестиций в специализированные ИИ-модели для вертикалей, где нужны данные высокого качества. OpenAI, Anthropic и другие лаборатории действительно напряженно ищут пути за пределы scaling laws — синтетические данные, reinforcement learning, специализированные датасеты становятся критическим ингредиентом. Раздув в оценках здесь реален: лаборатории только начинают понимать, сколько именно данных им нужно, и на чём они будут экономить.

Для российского бизнеса эта новость главным образом сигнализирует о спросе на экспертизу в специализированных доменах — юридические данные, медицинские изображения, технические описания на русском. Компании, которые хотят обучить ИИ-модели под свои задачи, могут использовать готовые датасеты, если они найдут релевантные, или заказывать синтетические данные через платформы типа Snorkel. В России пока нет прямых аналогов такого масштаба, но спрос на специалистов для разметки данных и синтеза тренировочных примеров растёт. Если у вас есть экспертиза в конкретной вертикали (финансы, право, IT), можно рассматривать это как источник дополнительного дохода через такие платформы.

Раунд Snorkel показывает, что венчурный рынок продолжает массивно финансировать компании на периферии ИИ-стека, хотя есть скепсис по поводу того, стоят ли такие оценки реального гроша. Заявленные $375 млн выручки — это внушительно, но валовая выручка маскирует реальную маржинальность. Для инвесторов это всё ещё ставка на то, что данные будут критическим узким местом ещё много лет, и тот, кто контролирует поток качественных данных, извлечёт значительную ренту.