Разрыв в производительности между передовыми закрытыми ИИ-моделями американских компаний и лучшими открытыми моделями из Китая сократился до 4,4 месяца. Об этом говорится в отчёте Mozilla «State of Open Source ИИ», опубликованном 15 сентября. При этом стоимость выполнения задач у открытых моделей примерно в пять раз ниже, чем у закрытых. Иными словами, платить за закрытую модель имеет смысл только тогда, когда четырёхмесячная фора критична.

Открытые модели с открытыми весами позволяют скачать основные компоненты и запускать их на своих компьютерах, но разработчики обычно не раскрывают обучающие данные, пайплайн и код обучения. Закрытые модели от Anthropic и OpenAI полностью проприетарны и требуют оплаты за доступ. Как пояснил технический директор Mozilla Раффи Крикорян, организации платят за закрытые модели, потому что те работают «из коробки» и поставляются с пакетом соответствия, поддержкой и ответственностью. Многим компаниям не хватает персонала, чтобы хорошо запускать открытые модели.

МодельТипИндекс Artificial AnalysisСтоимость за задачу
Kimi K3 (Moonshot AI)ОткрытаяНа 3 балла ниже Fable 530% от цены Fable 5
Fable 5 (Anthropic)ЗакрытаяБазовый уровень100%
GLM 5.2 (Z.ai)ОткрытаяВ пределах 1 балла от Claude Opus 4.7/4.8В 5 раз дешевле
Claude Opus 4.7/4.8 (Anthropic)ЗакрытаяБазовый уровеньВ 5 раз дороже GLM 5.2

Тем не менее разрыв сокращается. Согласно отчёту, открытая модель Kimi K3 от Moonshot ИИ отстаёт от закрытой Fable 5 от Anthropic всего на три балла в композитном индексе Artificial Analysis, но стоит 30% от её цены. DoorDash уже использует Kimi для рутинных задач, оставляя Fable для сложных, которые заняли бы у эксперта много времени.

METR измеряет разрыв через «горизонт задач»: лучшая закрытая модель надёжно выполняет задачи в 1,7 раза длиннее, чем лучшая открытая.

Listing image for first story in Most Read: This Atlantic hurricane season is about to do something that hasn't happened in 175 years
Listing image for first story in Most Read: This Atlantic hurricane season is about to do something that hasn't happened in 175 years · Источник: Ars Technica

Для измерения разрыва исследовательская некоммерческая организация METR ввела понятие «горизонт задач» — это длина задач (измеряемая временем, которое нужно эксперту-человеку), которые модель может выполнить с надёжностью 50%. Сейчас лучшая закрытая модель справляется с задачей в 1,7 раза длиннее, чем лучшая открытая. Крикорян приводит пример: если открытая модель может выполнить семичасовую задачу, то закрытая — двенадцатичасовую. Через четыре месяца открытая модель осилит двенадцатичасовую, а закрытая — примерно двадцатичасовую.

По словам Крикоряна, задачи длительностью от восьми до двенадцати часов — это как раз та зона, где закрытые модели пока незаменимы. Задачи короче восьми часов могут выполнять оба типа моделей, и их дешевле передать открытым. Задачи длиннее двенадцати часов надёжно не выполняет ни одна модель.

Сравнения осложняются тем, что закрытые модели часто поставляются с собственным harness — программным слоем, который помогает модели обращаться к инструментам и памяти для агентных действий. Harness, созданный лабораторией под свою модель, может улучшать результаты, тогда как со сторонними harness модель работает хуже. Чтобы уравнять условия, компания Vals ИИ тестирует модели на собственном нейтральном harness. В оценке Terminal-Bench 2.1 открытая модель GLM 5.2 от китайской Z.ai (Zhipu ИИ) отстала от Anthropic Claude Opus 4.7 и 4.8 менее чем на балл, но обошлась примерно в пять раз дешевле за выполненную задачу.

Крикорян советует платить за закрытые модели только тогда, когда фора стоит того — например, если дедлайн наступает раньше, чем открытые модели догонят. Для рутинной работы, которая продолжится и в следующем квартале, платить не стоит: через некоторое время её можно будет выполнить за пятую часть цены, и модель не будет узким местом.

Отчёт также отмечает, что с момента публикации первого выпуска State of Open Source ИИ 14 июля использование открытых моделей ускорилось. Это отражает общую тенденцию: компании всё чаще выбирают открытые модели по умолчанию для большинства задач, оставляя закрытые для узкого круга сценариев.