Nvidia выпустила Nemotron 3.5 Lightning — первую модель в новой линейке Nemotron 3.5. Это компактная модель с открытыми весами, которая напрямую наследует архитектуру Nemotron 3 Nano 30B A3B, сочетающую Mamba и Transformer. Общее число параметров — 31,6 млрд, но в каждый момент времени активируются лишь 3,6 млрд. Такой подход позволяет снизить вычислительные затраты, сохраняя высокое качество ответов.
По данным независимой платформы Artificial Analysis, модель набирает 24 балла в индексе интеллекта — на девять пунктов больше, чем у предшественника (15). Это ставит Lightning на один уровень с OpenAI gpt-oss-120b (24) и лишь немного уступает более крупной Nvidia Nemotron 3 Super (26), которая примерно в четыре раза больше. При этом более умные малые модели, такие как Qwen3.6 35B A3B (32) и Meta Muse Glimmer (35), по-прежнему опережают Lightning.
| Модель | Индекс интеллекта | Скорость (токенов/с) |
|---|---|---|
| Nemotron 3.5 Lightning | 24 | ~670 |
| gpt-oss-120b | 24 | — |
| Gemini 3.5 Flash-Lite | 37 | 386 |
| Qwen3.6 35B A3B | 32 | — |
| Nemotron 3 Super | 26 | — |
Главный козырь Lightning — скорость. В предрелизных тестах с финальными весами NVFP4 модель достигает почти 670 токенов в секунду — это самый высокий показатель среди всех сравниваемых моделей, почти вдвое быстрее, чем у Google Gemini 3.5 Flash-Lite (386 токенов/с). Задача из индекса интеллекта решается примерно за 0,5 минуты, тогда как Qwen3.6 35B A3B тратит около 3,5 минут, а Gemma 4 31B — примерно 5,8 минут.
Модель достигает 669 токенов в секунду — самый высокий показатель среди сравнимых моделей, почти вдвое быстрее Gemini 3.5 Flash-Lite.

Наибольший прирост заметен в агентных бенчмарках. На GDPval-AA v2 Lightning достигает рейтинга Elo 824 — на 334 пункта выше, чем у Nemotron 3 Nano. Это превосходит и gpt-oss-120b (800), и более крупную Nemotron 3 Super (698). На Terminal-Bench v2.1 результат вырос с 7% до 24,3%, почти сравнявшись с gpt-oss-120b (26,2%).
Nvidia распространяет модель под лицензией OpenMDW-1.1, что позволяет свободно использовать её в коммерческих продуктах. Компания позиционирует Lightning как высокопроизводительный инструмент для агентных пайплайнов. Artificial Analysis сообщает, что Nvidia сотрудничала с партнёрами, включая CodeRabbit и Harvey, для дообучения модели под конкретные домены.
Модель доступна в двух вариантах весов: BF16 и NVFP4. Версия NVFP4 также набирает 24 балла в индексе интеллекта, демонстрируя минимальную потерю качества по сравнению с более точной версией. Lightning обрабатывает только текст и поддерживает контекстное окно в один миллион токенов. Веса уже доступны, а серверный инференс предлагают DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius и Crusoe.
Стремление Nvidia к эффективности за счёт размера не ново. В прошлом году исследователи компании опубликовали работу, где утверждалось, что модели с менее чем 10 млрд параметров могут справляться с большинством агентных задач не хуже моделей с 70–175 млрд параметров, при затратах в 10–30 раз ниже. Nemotron 3.5 Lightning — самое наглядное подтверждение этой идеи на уровне продукта: при 31,6 млрд параметров и 3,6 млрд активных он обходит более крупные модели на агентных тестах и показывает рекордную скорость.



