Стартап Vals, основанный в 2024 году, привлек $40 млн в раунде Series A под руководством Andreessen Horowitz. Посевной раунд ранее возглавили 8VC и Bloomberg Beta. Компания занимается независимой оценкой ИИ-моделей — бенчмарками, которые проверяют, насколько хорошо модель справляется с реальными задачами в конкретных отраслях.
Проблема, которую решает Vals, известна в индустрии. Многие устоявшиеся бенчмарки создавались годами ранее и не рассчитаны на современные модели. Более того, если тестовые задания находятся в открытом доступе, компания может натренировать модель специально под них — и получить высокий балл, не подтвержденный реальными навыками. Сооснователь Vals Райан Кришнан, ранее стажировавшийся в Palantir и работавший в Microsoft и Стэнфордской лаборатории ИИ, говорит, что академические бенчмарки не успевают за быстрым выходом новых моделей.
| Параметр | Данные |
|---|---|
| Год основания | 2024 |
| Раунд Series A | $40 млн, Andreessen Horowitz |
| Посевной раунд | 8VC, Bloomberg Beta |
| Рост выручки | в 8 раз за год |
| Штат | с 8 до 25 человек, план +10–15 |
| Отрасли оценки | юриспруденция, финансы, программирование, кибербезопасность, биобезопасность, психическое здоровье |
Vals строит систему иначе. Компания не раскрывает свои тестовые материалы, а оценивает модели не на абстрактные знания, а на способность выполнять сложные задачи в юриспруденции, финансах и программировании. Кришнан формулирует это так: «Мы смотрим, каковы реальные последствия работы моделей. Могут ли они выполнять работу такого же качества, как человек, в каждой предметной области?» Проверяются не только положительные результаты, но и отрицательные — например, что произойдет, если модель начнет действовать бесконтрольно.

Спектр оцениваемых тем расширяется. Помимо традиционных отраслей, Vals работает над бенчмарком для рекурсивного самоулучшения ИИ, а также в области психического здоровья, кибербезопасности, биобезопасности и даже права вооруженных конфликтов — в частности, применения Женевской конвенции к моделям. Компании платят Vals за тестирование своих моделей. Кришнан сравнивает эту модель с оплатой SAT: студент платит College Board, чтобы узнать свой результат. Для разработчиков это способ найти слабые места и улучшить продукт, а для покупателей ИИ-решений — ориентир при выборе модели.
Финансовые показатели стартапа растут. Выручка Vals сейчас в восемь раз выше, чем год назад. Штат увеличился с восьми человек в начале года до 25, и компания планирует нанять еще 10–15 сотрудников, а также переехать в более просторный офис. Недавно Vals запустила программу оценки моделей для федеральных агентств.
Кришнан видит будущее бенчмарков в контексте выхода ИИ-компаний на публичный рынок. Он упоминает, что SpaceX стал публичным, Anthropic планирует размещение позднее в этом году, а OpenAI, вероятно, последует за ними. По его мнению, по мере интеграции ИИ в экономику именно такие оценки будут определять использование моделей и станут частью публичных отчетов и инвестиционных решений.
Остается неясным, насколько методика Vals защищена от копирования и сможет ли она стать отраслевым стандартом. Andreessen Horowitz делает ставку на то, что независимая экспертиза в оценке ИИ окажется востребованной и коммерчески устойчивой.



