Основатель Harvey Уинстон Вайнберг выступил на мероприятии Sequoia Capital, где портфельные компании фонда делились опытом создания собственных ИИ-моделей. Он заявил, что стартапы уровня application layer могут конкурировать с ведущими лабораториями вроде OpenAI и Anthropic, если используют современную экосистему open-source моделей и инструментов постобучения. Вайнберг сравнил подход с методологией Moneyball, где ограниченный бюджет компенсируется умным использованием данных и аналитики.

Harvey — это ИИ-платформа для юристов, основанная четыре года назад. Тогда инфраструктуры для обучения и запуска моделей практически не существовало, поэтому компания сосредоточилась на продукте и go-to-market. Сегодня ситуация изменилась: появились сильные open-source модели, инструменты для постобучения и готовые инфраструктурные решения. Это позволяет application layer стартапам создавать собственные модели в своей профильной области без строительства полноценной лаборатории.

Подход Harvey состоит из трех этапов. Первый — создание бенчмарков для оценки моделей. Компания разработала Legal Agent Bench, включающий задачи юристов из крупных фирм: подготовка документов для создания фонда, поиск судебных решений. Также были созданы датасеты для работы с договорами и для проверки компаний перед покупкой. Второй этап — постобучение модели на собранных данных. Третий — подключение модели к продукту через внешнего инфраструктурного провайдера.

Компания разработала бенчмарк Legal Agent Bench для оценки моделей на юридических задачах.

Ключевая проблема, с которой столкнулась Harvey, — конфиденциальность данных клиентов. Юридические документы защищены адвокатской тайной, поэтому использовать их для обучения моделей нельзя. Решение — генерация синтетических документов для вымышленных сделок. Юристы Harvey задают, какие ошибки должна найти модель, а ИИ создает полный комплект документов, в который заложены эти ошибки. Затем документы дорабатывают, чтобы они были похожи на реальные материалы.

Такой подход позволяет Harvey обучать модели без доступа к конфиденциальным данным, что актуально не только для юридической отрасли, но и для медицины, финансов и других сфер. Вайнберг уверен, что любой стартап может последовать этому примеру, используя доступные инструменты и синтетические данные. Однако остается открытым вопрос, насколько качество таких моделей сравнимо с моделями, обученными на реальных данных, и как это повлияет на доверие клиентов.