11 августа NVIDIA расширила семейство Nemotron 3, выпустив открытую модель Nemotron 3.5 Lightning с 30 млрд параметров. Модель построена на архитектуре mixture-of-experts (MoE) и ориентирована на постоянные агентные задачи, выполняемые локально. По заявлению компании, она генерирует токены до 4 раз быстрее и завершает задачи на 30% быстрее по сравнению с открытыми моделями того же класса.
Nemotron 3.5 Lightning имеет открытые веса, что позволяет разработчикам и энтузиастам дообучать модель на собственных примерах. Это дает возможность адаптировать её под конкретные сценарии: например, научить писать в определённом стиле, разбираться в профессиональной лексике (фотография, игры, 3D-дизайн) или следовать принятым в команде соглашениям по коду. В сочетании с доступом к приложениям и файлам такие модели могут питать персонализированных локальных агентов — от помощника по почте и календарю до умного дома или кодового компаньона.
Для локального развертывания NVIDIA сотрудничает с vLLM, Ollama, llama.cpp и LM Studio, предлагая модели в форматах NVFP4 и GGUF. Unsloth обеспечивает поддержку с первого дня, предоставляя оптимизированные и квантованные версии для эффективного запуска через Unsloth Studio. Модель работает на RTX-ПК, DGX Spark, системах OEM GB10, Jetson, а также масштабируется до RTX PRO рабочих станций, DGX Station и серверов GB300, дата-центров и облаков.
Модель можно запускать локально на RTX-ПК, DGX Spark, Jetson и других системах, включая облачные среды.
Параллельно NVIDIA представила NeMo Switchyard — открытую библиотеку маршрутизации, которая автоматически направляет каждый шаг агентного рабочего процесса к наиболее подходящей модели по точности, скорости и стоимости. Это позволяет разработчикам комбинировать модели от разных провайдеров. Внутренние бенчмарки показывают, что Switchyard сохраняет уровень выполнения задач, сравнимый с frontier-моделями, снижая стоимость примерно до трети от стоимости использования Opus 4.8 в одиночку. Библиотека доступна на GitHub.
Выпуск Nemotron 3.5 Lightning и NeMo Switchyard отражает общий тренд на локализацию ИИ: компании стремятся снизить затраты на токены и повысить конфиденциальность, запуская модели на собственном оборудовании. Открытые веса и поддержка популярных инструментов делают модель доступной для широкого круга разработчиков, от любителей до корпоративных команд. Nemotron 3.5 Lightning также доступна через OpenRouter, build.nvidia.com в виде NIM-микросервиса и у облачных партнеров NVIDIA.



