На выставке IFA 2026 NVIDIA, Microsoft и партнеры объявили о комплексе мер по ускорению локального ИИ. Ключевые анонсы включают новые компактные ПК NVIDIA RTX Spark, которые появятся в октябре, а также оптимизации для популярных инструментов инференса, повышающие скорость до 1.9 раза. Эти шаги направлены на то, чтобы сделать запуск ИИ-агентов на локальном оборудовании проще и быстрее.

Локальный ИИ — это выполнение моделей машинного обучения непосредственно на устройстве пользователя, а не в облаке. Это обеспечивает конфиденциальность, снижает задержки и позволяет работать без постоянного интернет-соединения. Однако до сих пор настройка локальных агентов требовала значительных усилий: выбора модели, совместимого сервера инференса, настройки квантования и постоянного обновления. Новые инициативы NVIDIA и Microsoft призваны устранить эти барьеры.

МодельПараметрыНазначение
Nemotron 3.5 Lightning30 млрдУниверсальная
GLM-5.3-FlashMoEАгентный ИИ
Qwen3.8-Flash-NextMoEМультимодальная
Qwen3.8-27B27 млрдКодинг и агенты
Muse Glimmer30 млрдКодинг и агенты
DeepSeek v4 Flash284 млрд (13 активных)Универсальная

Одним из центральных анонсов стал инструмент NVIDIA PAIR (Personal ИИ Router), который интеллектуально распределяет задачи ИИ между ПК в локальной сети пользователя. Это позволяет эффективно использовать ресурсы нескольких устройств, ускоряя выполнение сложных задач. Кроме того, упрощенная поддержка локального ИИ появится в таких приложениях, как Hermes Agent, OpenClaw и Perplexity Portable Computer, что снизит порог входа для разработчиков и энтузиастов.

Оптимизации llama.cpp и vLLM повышают скорость локального инференса до 1.9 раза, доступны через LM Studio и Ollama.

Оптимизации llama.cpp и vLLM, доступные уже сейчас через LM Studio и Ollama, обеспечивают до 1.9 раза более быстрый локальный инференс. Это значительное улучшение для тех, кто работает с большими языковыми моделями на собственном оборудовании. Новые ПК RTX Spark от Lenovo и Acer, выходящие в октябре, предоставят пользователям дополнительные возможности для запуска производительных агентов локально и безопасно.

Август также был насыщенным для локального ИИ. NVIDIA выпустила модель Nemotron 3.5 Lightning с 30 миллиардами параметров, которая работает на RTX ПК, RTX PRO Workstations, DGX Spark и Jetson. Z.ai представила GLM-5.3-Flash — мультимодальную модель на основе смеси экспертов (MoE), адаптированную для DGX Station. Qwen выпустила Qwen3.8-Flash-Next, открытую мультимодальную MoE-модель, и Qwen3.8-27B, оптимизированную для локальных агентных и кодовых задач. LTX представила LTX 2.5 для генерации видео, а MiniMax-H3 — модель с синхронизированным аудио. Meta выпустила Muse Glimmer, 30-миллиардную модель для кодинга и агентных задач. DeepSeek v4 Flash, с 284 миллиардами параметров, может работать на кластере из двух DGX Spark.

Эти анонсы отражают растущий тренд на децентрализацию ИИ: вместо того чтобы полагаться исключительно на облачные сервисы, пользователи все чаще запускают модели на собственном оборудовании. Это особенно важно для задач, требующих конфиденциальности, таких как обработка финансовых документов или медицинских данных. Например, Perplexity Portable Computer позволяет выполнять рабочие процессы локально, без расхода кредитов, и запрашивает разрешение перед отправкой данных в облако. Это дает пользователям контроль над своими данными, что становится все более критичным в условиях ужесточения регуляций.

Для разработчиков и компаний эти изменения означают снижение затрат на инфраструктуру и повышение гибкости. Возможность запускать мощные модели локально открывает новые сценарии использования, от автоматизации рутинных задач до создания персонализированных ИИ-ассистентов. В то же время, конкуренция между облачными и локальными решениями будет стимулировать инновации в обеих сферах, что в конечном итоге выгодно конечным пользователям.