NVIDIA представила открытую модель Nemotron 3.5 Lightning, которая теперь доступна в Amazon SageMaker JumpStart. Модель предназначена для высоконагруженных агентных рабочих нагрузок — задач, где ИИ-агенты непрерывно выполняют множество шагов, таких как классификация событий, извлечение данных из документов или проверка соответствия политикам. По заявлению NVIDIA, Lightning — самая быстрая открытая модель в своем классе для постоянно работающих агентов, обеспечивающая до 4x более высокую пропускную способность и на 30% более быстрое выполнение задач.

Nemotron 3.5 Lightning использует гибридную архитектуру Mixture-of-Experts (MoE) с 30B параметров, из которых активны только 3B на каждом шаге. Это позволяет модели работать на одном GPU, снижая требования к инфраструктуре. Контекстное окно до 1M токенов позволяет агенту сохранять состояние в течение длительных сессий без повторного перезапуска. Модель дистиллирована из флагманской Nemotron 3 Ultra и разработана инициативы Nemotron Coalition. Она обучена на открытых наборах данных и выпущена как открытая модель, что позволяет пользователям кастомизировать её, владеть весами и развертывать в любом окружении.

BenchmarkBF16NVFP4
MMLU Pro81.9481.62
GPQA Diamond75.4475.57
SWE-bench Verified51.5652.80
PinchBench85.3783.43
IFBench71.8872.88
AA-LCR52.0049.19

Ключевая идея Lightning — не каждый шаг агента требует frontier-модели. Планирование сложных рабочих процессов или оркестрация субагентов может требовать высокого уровня рассуждений, но такие задачи, как классификация алертов, извлечение полей из форм или проверка записей, часто могут быть выполнены меньшей специализированной моделью. Эти задачи могут составлять значительную долю вызовов. Запуск всех шагов через одну большую модель добавляет затраты и задержку. Подход с системой моделей маршрутизирует каждый шаг к подходящей модели. Lightning создана для высоконагруженного сегмента такой системы.

Обеспечивает до 4x более высокую пропускную способность и на 30% более быстрое выполнение задач для агентных рабочих нагрузок.

SageMaker JumpStart search results listing the Nemotron 3.5 Lightning model
SageMaker JumpStart search results listing the Nemotron 3.5 Lightning model · Источник: AWS Machine Learning Blog

NVIDIA публикует результаты бенчмарков для BF16 и NVFP4 вариантов модели. Например, MMLU Pro: 81.94 (BF16) и 81.62 (NVFP4); GPQA Diamond: 75.44 и 75.57; SWE-bench Verified: 51.56 и 52.80; PinchBench: 85.37 и 83.43; IFBench: 71.88 и 72.88; AA-LCR: 52.00 и 49.19. Результаты показывают, что квантизация NVFP4 сохраняет точность, близкую к BF16, на многих задачах. NVIDIA отмечает, что рецепты оценки опубликованы в NeMo Gym, и результаты могут отличаться от данных других вендоров.

Модель доступна для кастомизации с помощью NVIDIA NeMo для доменных инструментов, рабочих процессов и политик. Однако в SageMaker JumpStart кастомизация через модель карточки не поддерживается. Пользователи могут развернуть модель из JumpStart без настройки серверной инфраструктуры, что упрощает начало работы.

Enterprise-сценарии использования включают персональных агентов для email, календаря и проектов; финансовые услуги для извлечения данных из документов и проверки политик; кибербезопасность для обогащения алертов и классификации инцидентов; телеком для триажа сетевых алермов и оптимизации конфигураций; розничную торговлю для обогащения каталогов и разрешения вопросов инвентаризации. Lightning подходит для специализированных высокочастотных задач внутри агентных рабочих процессов, где важны скорость и точность.

Для разработчиков, знакомых с агентными системами, появление Lightning в SageMaker JumpStart означает возможность быстро развернуть открытую модель, оптимизированную для агентных нагрузок, без необходимости самостоятельно настраивать инфраструктуру. Это снижает барьер входа для экспериментов и production-развертываний. Модель может быть полезна тем, кто строит системы с маршрутизацией задач, например, с использованием NVIDIA NeMo Switchyard, который может направлять отдельные шаги рабочего процесса в выбранный пул моделей.