Arena, изначально стартовавшая в 2023 году как исследовательский проект UC Berkeley, за год набрала достаточно инерции, чтобы привлечь $200 млн Series B при оценке $3,1 млрд. Это вторая значительная инвестиция подряд: в январе компания закрыла $150 млн Series A с оценкой $1,7 млрд. То есть за 10 месяцев капитализация практически удвоилась, а годовой ревю вырос с $30 млн до $100 млн. Такая траектория редкая даже для ИИ-стартапов, которые обычно привлекают деньги на волне хайпа, а не на реальных показателях.
Причина успеха простая и логичная: Arena предложила инструмент, который рынок реально ждал. До недавнего времени тестирование моделей опиралось на статические бенчмарки — фиксированные наборы задач. Но в 2024-2025 годах выяснилось, что модели и их создатели научились эти тесты игнорировать: оптимизировать под конкретные задачи бенчмарков, получая хорошие оценки без реального улучшения качества. Тем же временем корпоративным клиентам надоело полагаться на абстрактные рейтинги — им нужно было понять, какая модель работает конкретно в их задачах и среде.
Arena решает обе проблемы через краудсорсинг: бесплатная платформа позволяет пользователям вводить промпты, выбирать результаты лучших моделей и тем самым создавать живой, постоянно обновляемый рейтинг. По заявлениям компании, ежемесячно платформу посещают десятки миллионов человек. В сентябре 2024-го Arena запустила коммерческий продукт AI Evaluations — сервис, который предоставляет лабораториям и компаниям детальную аналитику по производительности моделей на основе этого краудсорсингового датасета. Предложение пришлось кстати: клиенты готовы платить за независимый взгляд.
Обновление платформы добавило ещё один вектор — новую категорию рейтинга под названием alignment. Здесь Arena оценивает, насколько безопасны и согласованы модели на практике: ловит несанкционированные действия, ложное авторство и откровенный обман (когда модель делает вид, что выполнила задачу, а на деле — нет). В текущих рейтингах лидируют модели OpenAI, Claude Opus 5.5 от Anthropic занимает шестое место. Это показатель: компании, выпускающие модели, начали рассматривать alignment не как маркетинговый ход, а как реальный конкурентный фактор.
В редакции уже год работаем с различными моделями для автоматизации контента и анализа. Когда нужна объективная метрика, полагаться только на официальные бенчмарки действительно стало неудобно — каждый лаб скажет, что его модель лучшая. Платформы вроде Arena заполняют этот зазор. Инвесторы в раунде (Lightspeed, Khosla, Salesforce Ventures, a16z и другие) явно решили, что это не отдельный инструмент, а инфраструктура, которая будет разрастаться параллельно рынку моделей.
Для российского бизнеса, работающего с ИИ, такая платформа становится полезнее по мере её развития. Если вы выбираете модель для своего продукта или сервиса (будь то генерация контента, обработка данных или что-то ещё), краудсорсинговая оценка помогает избежать манипуляций со стороны вендоров. Для компаний, использующих Signum/SIGNA или AI Studio в своих процессах, важно знать, что лежит под капотом — и Arena предоставляет этот взгляд со стороны.
Долгосрочный вопрос для Arena — сможет ли она остаться независимой, если вокруг неё на миллиарды начнут жать интересы крупных ИИ-лабораторий. Пока компания позиционирует себя как нейтральную третью сторону. Рынок в это верит, иначе бы инвесторы не удваивали оценку. Но чем больше становится Arena, тем более громкими будут голоса, требующие от неё отрегулировать результаты в пользу или во вред той или иной модели. Это классическая история про то, кто контролирует измеритель, контролирует нарратив.