Бенчмарки давно стали инструментом маркетинга для AI-компаний: хорошие метрики = хороший пиар. Но индустрия успела придумать способы «завалить» экзамены — обучить модели прямо на публичных тестах. Vals, основанный в 2024 году, утверждает, что решает ровно эту проблему. За полтора года стартап вырос настолько, что в августе привлёк $40 млн в Series A от Andreessen Horowitz. До этого было $14 млн в seed от 8VC и Bloomberg Beta.

Сооснователь Rayan Krishnan (ему 25) заметил, что академические бенчмарки просто не успевают за темпом выхода новых моделей. Валидные метрики нужны не для галочки — они должны проверять, действительно ли модель делает то, что компания обещает. Вместо абстрактных тестов на общие знания (вроде сдачи экзамена на адвоката) Vals тестирует способность выполнять сложную реальную работу в конкретных сферах: праве, финансах, коде, кибербезопасности, даже применении Женевской конвенции. Важно — тесты не публичны, иначе это снова превратится в exam cramming.

Идея звучит парадоксально: почему компания платит за плохие новости о своей модели? Ответ прост — хорошая метрика помогает найти узкие места и доделать продукт. Krishnan сравнивает это с SAT: студент платит College Board за возможность проверить уровень перед поступлением. Результаты этих оценок уже становятся критичным фактором при выборе моделей на покупку.

Цифры роста впечатляют. Выручка выросла в восемь раз за год. Команда раздулась с восьми человек в начале года до 25 (и планируют ещё 10—15). Vals заключила контракт с федеральными агентствами США на оценку моделей. Это не просто стартап в тренде — это становится инфраструктурой.

В более широком контексте Vals попадает в тренд на «верификацию», который назревал. Когда OpenAI, Anthropic и другие компании идут в public, инвесторы и регуляторы захотят понимать, что стоит за заявленными способностями моделей. Стандартизированная система оценок будет ценна всем: компаниям для доказательства качества, аудиторам для контроля, рынку для сравнения. Это не маркетинг, это настоящая инфраструктура.

Для российского бизнеса модель Vals может быть полезна несколько позже, когда большие компании начнут собственные ИИ-проекты. Сегодня спрос на independentной оценку моделей в России невысок, но если крупные компании начнут строить или адаптировать LLM и другие модели для локального рынка, потребность появится. Платформы для автоматизации (как наш AI Studio) и блокчейн-системы для верификации (как Signum) могут дополнять независимую оценку, но сама система проверки качества моделей — это отдельная задача, для которой специализированный инструмент будет критичнее, чем встроенные инструменты.

Главное: Vals решает реальную проблему, а не придумывает её. Когда модели встроены в критичную инфраструктуру (финансы, право, медицина), нужно знать не только, что модель умная в абстрактном смысле, но что она не сломает реальный процесс. Это не sexy, но это необходимо. И деньги a16z в этом случае попали в сговор с логикой.