В августе 2026 года автор решил открыть собственную OpenAI и посчитал реальные расходы: от $5,576 млн на обучение DeepSeek-V3 до $34 млрд годовых трат настоящей OpenAI, где половина уходит Microsoft за облако.

Идея кажется простой: китайская DeepSeek обучила модель V3 за 5,576 миллиона долларов, о чем прямо написала в техническом отчете. Значит, нам нужно примерно столько же плюс аренда офиса. Но автор, который вкладывать свои деньги не готов, проверил арифметику злее обычного и выяснил: купить модель — не то же самое, что купить компанию, которая умеет делать модели.

Строка20252024
Выручка$13,07 млрд$3,7 млрд
Исследования и разработка$19,18 млрд
Себестоимость выручки (инференс)$7,5 млрд
Продажи и маркетинг$5,73 млрд$1,11 млрд
Административные расходы$1,57 млрд
Расходы всего$34 млрд
Операционный убыток$20,92 млрд

Начнем с обучения. Цифра 5,576 миллиона долларов существует и взята из техотчета DeepSeek-V3. Разбивка такая: претрейн 2664 тысячи GPU-часов, расширение контекста 119 тысяч, пост-трейн 5 тысяч. Итого 2,788 млн часов H800, умноженные на $2 за GPU-час. Но в отчете есть оговорка, которую не пережил ни один пересказ в прессе: стоимость включает только официальное обучение, исключая расходы на предварительные исследования и абляционные эксперименты по архитектурам, алгоритмам и данным. То есть в цифру не входят исследования, неудачные прогоны, сбор и очистка данных, зарплаты 197 человек из авторского списка, покупка самих карт, сеть, здание и электричество сверх гипотетической ставки аренды. Сама ставка $2 — допущение авторов, а не счет, который им кто-то выставил: кластер у компании свой.

Отчет OpenAI за 2025 год: выручка $13,07 млрд, расходы $34 млрд, операционный убыток $20,92 млрд.

Ai2, выкладывая Olmo 3, написала про эту практику прямо в разделе про стоимость: стоимость обучения больших моделей часто сообщается как одна цифра в долларах, обычно конвертацией GPU-часов по рыночным ставкам, например $5,576 млн в H800-часах для DeepSeek V3. Сами они вместо доллара дали wall-clock: около 56 суток на 1024 картах H100 от старта до оценки чекпоинта, из них 47 на претрейн и 9 на пост-трейн. И тут же оговорились, что рецепт отрабатывали на моделях 7B и меньше, а стоимость этой отработки в 56 суток не входит.

Сколько входит в реальную смету, не публикует никто. Отраслевого коэффициента «финальный прогон умножить на N» не существует, и если тебе такой назовут, спроси источник. Косвенных замеров ровно три, и все неприятные. Hugging Face в плейбуке по SmolLM3 назвала абляции, калибровку и дебаг: 161 тысяча GPU-часов против 276 тысяч основного рана. Это больше половины сверху. Сбер в статье про GigaChat 3.5 сообщает, что за релизом стоит более 1500 экспериментов. Цену этих экспериментов не называет. Он же по GigaChat 3: только на подготовку данных держали отдельный CPU-кластер на 10 000 ядер и 5 ПБ хранилища и прогнали 179 экспериментов с составом корпуса. 1500 экспериментов — вот это и есть настоящая стоимость обучения, а 5,576 миллиона это стоимость последнего из них.

Теперь о компании. Есть документ, который отвечает на вопрос лучше любых оценок: отчет о прибылях и убытках настоящей OpenAI за 2025 год. Аудированные цифры, опубликованные Эдом Зитроном и независимо подтвержденные Financial Times. Компания их сама не публиковала и, скорее всего, предпочла бы, чтобы мы на них не смотрели. Выручка $13,07 млрд против $3,7 млрд в 2024-м. Расходы всего $34 млрд, операционный убыток $20,92 млрд. Отдельная строка, за которую стоит подержаться: из этих 34 миллиардов 17,2 миллиарда ушли одному вендору, Microsoft. 10,5 в R&D, 6 в себестоимость, полмиллиарда почему-то в маркетинг. Половина расходов компании — это счет за облако.

Чистый убыток в тех же документах стоит как 38,53 миллиарда, и вот эту цифру таскают по заголовкам зря: 41,55 миллиарда там составляет разовая неденежная переоценка конвертируемых инструментов при превращении в коммерческую структуру. Сожженные деньги — это операционные 20,92. Теперь смотри на структуру. Из 34 миллиардов расходов на «сделать модель» в чистом виде не уходит ни одна строка целиком. R&D в 19,18 миллиарда — это компьют экспериментов вперемешку с зарплатами. Себестоимость в 7,5 миллиарда — это раздача уже готовой модели пользователям. Маркетинг в 5,73 миллиардов почти равен половине всей выручки года. Мы шли покупать модель. Покупать придется компанию.

Для тех, кто впервые слышит о таких вещах: обучение большой языковой модели — это не один прогон, а серия экспериментов, где инженеры подбирают архитектуру, данные и гиперпараметры. Каждый эксперимент требует вычислительных мощностей, которые арендуют или покупают. Поэтому смета лаборатории складывается из R&D, себестоимости инференса и маркетинга, а не только из обучения. Инференс — это когда модель уже обучена и отвечает пользователям; для OpenAI это отдельная статья расходов в $7,5 млрд.

Автор приходит к выводу: даже если бы у нас было $5,6 млн на финальный прогон, реальные расходы на лабораторию в разы выше. А если мы хотим повторять успех OpenAI, нужно быть готовым к $34 млрд в год, из которых половина уходит облачному провайдеру. Так что открыть свою OpenAI — задача не для двоих, а для корпорации с бюджетом уровня Microsoft.