NVIDIA объявила о приобретении платформы Hugging Face за $12 930 300 000. Сделку анонсировал Дженсен Хуанг. Hugging Face — это хаб, где разработчики выкладывают модели, датасеты и приложения: сегодня там более 3 млн моделей, 500 тыс. датасетов и 1 млн приложений, а аудитория превышает 18 млн человек и 200 тыс. компаний. Формально NVIDIA получает не просто репозиторий, а точку входа в рабочий процесс большинства команд, которые обучают и дообучают модели.
Компания обещает, что платформа останется открытой: разработчики смогут выбирать любые модели, фреймворки и облака, а вычисления NVIDIA не станут обязательным условием. Это важное уточнение, потому что вокруг сделки сразу возник вопрос — не превратится ли нейтральный хаб в витрину одного вендора. Пока NVIDIA формулирует обязательства, но не раскрывает детали управления и монетизации. Именно здесь остаётся главная неопределённость: как будет устроена экономика платформы после закрытия сделки и сохранят ли независимые команды прежние условия.
| Модель | Разработчик | Ключевые параметры | Цена (вход/выход за 1 млн токенов) |
|---|---|---|---|
| Gemini 3.8 Flash | Третье обновление за три месяца, обходит крупные модели на DeepSWE v1.1 | — | |
| Qwen3.8-Max-0902 | Alibaba | Первое место в Code Arena WebDev 2 сентября, к 7 сентября — четвёртое | $2 / $6 |
| DeepSeek V4.1-Flash | DeepSeek | MoE 552 млрд параметров, 8 млрд активных на входе, 16 млрд на выходе | — |
| GPT-6 Astra | OpenAI | FrontierMath Tier 4 — 97,6%, GPQA Diamond — 96,0%, ARC-AGI-1 — 98,5% | — |
| Claude Fable 5.1 Max | Anthropic | 1896 очков в Code Arena WebDev к 7 сентября | — |
Параллельно NVIDIA запустила PAIR (Personal ИИ Router) — open-source роутер для домашней сети, который задействует простаивающие Mac и PC для обработки запросов ИИ-агентов вроде NemoClaw, OpenClaw или Hermes через субагентов. PAIR не объединяет GPU в единый ускоритель и не делит один запрос на несколько машин — он отправляет отдельные запросы на подходящий свободный узел через уже установленные Ollama или LM Studio. Поддерживаются Mac на M4+ и GeForce RTX 20xx+. В тесте с двумя PC на RTX 5090 и моделью Qwen3.6 35B A3B пять субагентов ускорили работу примерно в 1,6 раза. Это скорее эксперимент, чем продукт, но он показывает, куда NVIDIA смотрит: распределённые вычисления на уже имеющемся железе.
Google переиспользует DDR4 из списанных серверов: высокопроизводительная память — около 75% стоимости комплектующих ИИ-сервера.
Google столкнулась с обратной стороной роста. Нихил Чериан, старший директор по инфраструктуре цепочки поставок Google, признал на форуме: индустрия за считаные месяцы перешла от дефицита вычислений к дефициту памяти. Высокопроизводительная память сейчас составляет около 75% стоимости комплектующих типового ИИ-сервера. Компания начала вытаскивать модули DDR4 из списанных серверов и переиспользовать их в новых ИИ-машинах, спроектировала специальные адаптеры для подключения устаревшей памяти к новому поколению серверов и выстроила внутреннюю цепочку рециклинга. Параллельно Google оптимизирует архитектуру моделей и сжатие KV-кеша. Это не разовая мера, а признак того, что узкое место сместилось с чипов на память.
На этом фоне выходят новые модели. DeepSeek представила V4.1-Flash с нативной мультимодальностью и анонсировала поэтапный вывод V4-Pro. Это самая компактная модель в новом семействе — MoE на 552 млрд параметров с архитектурой causal encoder-decoder, где на вход активно 8 млрд параметров, на выход — 16. DeepSeek заявляет, что новинка превосходит V4-Pro по скорости и стоимости. Требования к KV-кешу снижены: модели нужна лишь четверть HBM-памяти и одна восьмая SSD-хранилища по сравнению с прошлым поколением. С 14 сентября все запросы к deepseek-v4-pro автоматически переключат на V4.1-Flash.
OpenAI представила GPT-6 Astra — первую модель компании, получившую наивысший уровень риска. За день до релиза компания подтвердила: Astra получила статус «критического» риска в кибербезопасности. Это первый случай, когда модель OpenAI получает наивысший уровень угрозы хоть в одной из трёх отслеживаемых областей. Из бенчмарков: FrontierMath Tier 4 (v2) — 97,6%, GPQA Diamond — 96,0%, ARC-AGI-1 — 98,5%. На Humanity’s Last Exam с инструментами модель уступила Fable 5.1 от Anthropic, вышедшей парой дней ранее. OpenAI называет Astra «самой умной и согласованной», но именно сочетание рекордных результатов и критического статуса риска делает релиз спорным.
Google выкатила Gemini 3.8 Flash — третье обновление линейки за три месяца, ровно через три недели после 3.7 Flash. Модель выполняет больше шагов рассуждений и чаще вызывает инструменты, тратя больше токенов ради результата. На DeepSWE v1.1, тесте на автономное решение сложных инженерных задач, 3.8 Flash обходит большинство более крупных фронтир-моделей за долю их стоимости. Alibaba 2 сентября выпустила Qwen3.8-Max-0902, которая вышла на первое место в рейтинге Code Arena WebDev, обогнав Claude Opus 5 Max на три балла при той же цене в $2 за миллион входных и $6 за миллион выходных токенов. К 7 сентября таблица перестроилась: Claude Fable 5.1 Max набрал 1896 очков, GPT-6 Astra Max — 1860, Claude Opus 5 Max — 1766, а Qwen3.8-Max-0902 скатился на четвёртое место с пометкой «предварительно».
OpenAI также представила ChatGPT Images 2.5. Компания заявляет о снижении задержки генерации наполовину, а главное практическое улучшение — точечное редактирование: модель меняет только то, что попросили, не затрагивая остальную композицию. Для тех, кто просил поменять фон и получал взамен другое лицо на фото, это заметный сдвиг.
Общая картина недели: инфраструктура дорожает и консолидируется, память становится дефицитом, а модели выходят быстрее, чем лидерборды успевают фиксировать результаты. Сделка NVIDIA и Hugging Face задаёт масштаб — $12,93 млрд за платформу, которая остаётся открытой лишь на словах. Что будет с условиями для независимых разработчиков после закрытия, пока неясно.

