В 2026 году в математических статьях начала появляться формулировка «internal model at OpenAI». 31 марта группа математиков опубликовала работу с решениями трёх задач Эрдёша, где в abstract прямо указано: «in each case, the proof is due entirely to an internal model at OpenAI». Это не единичный случай: в феврале внутренняя модель OpenAI построила новое решение задачи Эрдёша, Нешетрила и Рёдля, в апреле вышла ещё одна работа с пятью доказательствами, а затем модель нашла контрпример к гипотезе Эрдёша о unit distances, открытой около восьмидесяти лет. Доказательство проверили внешние математики. В сопутствующей статье указано, что первоначальный результат был сгенерирован в один проход внутренней моделью, после чего люди переработали изложение через Codex. W. T. Gowers написал, что если бы такое доказательство прислал человек, он без колебаний рекомендовал бы его к публикации в Annals of Mathematics. Mehtaab Sawhney сформулировал это так: «the solution was found by an internal model at OpenAI», а Kevin Weil, тогда один из руководителей OpenAI, репостнул с комментарием, что ИИ решает всё больше открытых задач и доказательства становятся элегантнее по мере улучшения моделей.
Существование моделей, которыми компания пользуется внутри задолго до публичного релиза, перестало быть спекуляцией. Фронтиер-лаборатория создаёт не одну нейросеть, а фабрику моделей: research-чекпоинты, экспериментальные модели, reward-модели, модели-учителя, модели для генерации синтетических данных, модели-evaluators, дистиллированные студенты и production-модели. Наружу попадает только последний элемент цепочки. Модель, которой пользуются исследователи, и модель, которую продают через API, не обязаны быть одной и той же. Research-модель максимизирует возможности, а production-модель одновременно вытягивают по intelligence, latency, стоимости GPU, throughput, reliability и safety. Это разные функции оптимизации.
| Компания | Учитель | Студент | Результат |
|---|---|---|---|
| Apple | внутренний Mixture-of-Experts | on-device foundation model | небольшая модель для устройств |
| Gemini | EmbeddingGemma | модель эмбеддингов | |
| Meta | Llama 3.1 8B и 70B | Llama 3.2 1B и 3B | маленькие модели |
| Microsoft | GPT-4 | ранние Phi | дистилляция возможностей |
| DeepSeek | R1 | дистиллированные модели от 1.5B до 70B | линейка моделей |
Дистилляция знаний — ключевой механизм этой фабрики. Допустим, обучена чудовищно дорогая модель, которая хорошо рассуждает, пишет код и решает математику, но каждый запрос к ней стоит огромных вычислений. Для исследователя внутри компании это рабочий инструмент, и он того стоит, если на кону триллионные рынки. Для продукта со 100 млн пользователей масштабировать доступ к таким моделям выгодно, поэтому вместо того чтобы гонять её на каждом запросе, её делают учителем: она генерирует качественные ответы, решения, траектории ризонинга, синтетические данные, иногда сами распределения вероятностей, а на этом поведении обучается студент поменьше. Студенту не нужно воспроизводить учителя целиком, достаточно перенести нужные возможности. OpenAI прямо предоставляет разработчикам официальный Model Distillation workflow: брать ответы более сильной модели, например GPT-4o или o1-preview, и обучать на них модель дешевле. Формулировка самой OpenAI точная: взять продвинутую модель и получить сопоставимое качество на конкретной задаче при существенно меньшей стоимости.
Фронтиер-лаборатория создаёт фабрику моделей: research-чекпоинты, reward-модели, модели-учителя и дистиллированные студенты для продакшена.
Публичных примеров такой схемы за последние два года накопилось много. Apple описывала внутреннего Mixture-of-Experts учителя, которого использовала при обучении своей небольшой on-device foundation model. Google обучала EmbeddingGemma с помощью более мощного учителя Gemini. Meta использовала логиты Llama 3.1 8B и 70B при создании маленьких Llama 3.2 1B и 3B. Microsoft прямо писала, что ранние Phi в значительной степени дистиллировали возможности GPT-4. DeepSeek после обучения R1 выпустила линейку дистиллированных моделей от 1.5B до 70B. Схема «сильный учитель — дешёвый студент» реальна и хорошо задокументирована.
Отсюда не следует, что любая публичная модель является урезанной версией секретной супермодели. Иногда учитель вообще публичный: Meta использовала публичные Llama 3.1, DeepSeek выложила и большую R1, и дистиллированные из неё модели. Студент иногда обходит своего учителя на конкретном бенче или узкой задаче за счёт специализации и пост-трейнинга. Неверно утверждать, что весь open source — специально ухудшенная дистилляция секретных моделей. Но более слабое утверждение подтверждается: публичный каталог моделей почти наверняка не показывает весь фронтиер возможностей конкретной лаборатории.
Несколько месяцев спустя Noam Brown из OpenAI рассказывал эту историю иначе, чем её обычно пересказывают: компания просто обучила новую внутреннюю модель. Детали остаются нераскрытыми. Что именно представляет собой эта модель, как она соотносится с публичными GPT-4o или o1-preview, будет ли она когда-либо выпущена — неизвестно. Но сам факт её существования и результаты в математике показывают: разрыв между внутренними и публичными моделями — не конспирология, а инженерная необходимость, продиктованная экономикой вычислений и требованиями к продакшену.

