Стартап Vals, основанный в 2024 году, привлек $40 млн в раунде Series A под руководством Andreessen Horowitz. Посевной раунд ранее возглавили 8VC и Bloomberg Beta. Компания занимается независимой оценкой ИИ-моделей — бенчмарками, которые проверяют, насколько хорошо модель справляется с реальными задачами в конкретных отраслях.

Проблема, которую решает Vals, известна в индустрии. Многие устоявшиеся бенчмарки создавались годами ранее и не рассчитаны на современные модели. Более того, если тестовые задания находятся в открытом доступе, компания может натренировать модель специально под них — и получить высокий балл, не подтвержденный реальными навыками. Сооснователь Vals Райан Кришнан, ранее стажировавшийся в Palantir и работавший в Microsoft и Стэнфордской лаборатории ИИ, говорит, что академические бенчмарки не успевают за быстрым выходом новых моделей.

ПараметрДанные
Год основания2024
Раунд Series A$40 млн, Andreessen Horowitz
Посевной раунд8VC, Bloomberg Beta
Рост выручкив 8 раз за год
Штатс 8 до 25 человек, план +10–15
Отрасли оценкиюриспруденция, финансы, программирование, кибербезопасность, биобезопасность, психическое здоровье

Vals строит систему иначе. Компания не раскрывает свои тестовые материалы, а оценивает модели не на абстрактные знания, а на способность выполнять сложные задачи в юриспруденции, финансах и программировании. Кришнан формулирует это так: «Мы смотрим, каковы реальные последствия работы моделей. Могут ли они выполнять работу такого же качества, как человек, в каждой предметной области?» Проверяются не только положительные результаты, но и отрицательные — например, что произойдет, если модель начнет действовать бесконтрольно.

Image Credits:Vals
Image Credits:Vals · Источник: TechCrunch AI

Спектр оцениваемых тем расширяется. Помимо традиционных отраслей, Vals работает над бенчмарком для рекурсивного самоулучшения ИИ, а также в области психического здоровья, кибербезопасности, биобезопасности и даже права вооруженных конфликтов — в частности, применения Женевской конвенции к моделям. Компании платят Vals за тестирование своих моделей. Кришнан сравнивает эту модель с оплатой SAT: студент платит College Board, чтобы узнать свой результат. Для разработчиков это способ найти слабые места и улучшить продукт, а для покупателей ИИ-решений — ориентир при выборе модели.

Финансовые показатели стартапа растут. Выручка Vals сейчас в восемь раз выше, чем год назад. Штат увеличился с восьми человек в начале года до 25, и компания планирует нанять еще 10–15 сотрудников, а также переехать в более просторный офис. Недавно Vals запустила программу оценки моделей для федеральных агентств.

Кришнан видит будущее бенчмарков в контексте выхода ИИ-компаний на публичный рынок. Он упоминает, что SpaceX стал публичным, Anthropic планирует размещение позднее в этом году, а OpenAI, вероятно, последует за ними. По его мнению, по мере интеграции ИИ в экономику именно такие оценки будут определять использование моделей и станут частью публичных отчетов и инвестиционных решений.

Остается неясным, насколько методика Vals защищена от копирования и сможет ли она стать отраслевым стандартом. Andreessen Horowitz делает ставку на то, что независимая экспертиза в оценке ИИ окажется востребованной и коммерчески устойчивой.