NVIDIA представила Nemotron 3.5 Lightning — открытую модель с 30 миллиардами параметров, построенную на архитектуре mixture-of-experts. Она предназначена для длительных агентных рабочих нагрузок и, по заявлению компании, является самой эффективной в своем классе. Одновременно выпущена библиотека NeMo Switchyard с открытым исходным кодом, которая автоматически направляет запросы к наиболее подходящей модели агентного рабочего процесса.
Агентный ИИ — это системы, которые не просто отвечают на запросы, а выполняют многошаговые задачи: анализируют код, мониторят безопасность, обрабатывают заявки. Такие системы часто строятся как ансамбли моделей, где одна модель планирует, а другие выполняют специализированные функции. Nemotron 3.5 Lightning создана для роли исполнителя: она берет на себя высокочастотные задачи, требующие быстрого ответа, в то время как более крупные модели, такие как Nemotron 3 Ultra, занимаются планированием.
| Параметр | Значение |
|---|---|
| Количество параметров | 30 млрд |
| Архитектура | Mixture-of-experts |
| Ускорение генерации | до 4x |
| Ускорение выполнения задач | 30% |
| Бенчмарк | PinchBench |
По данным NVIDIA, модель обеспечивает до 4 раз более высокую скорость генерации по сравнению с аналогами, что приводит к 30% ускорению выполнения агентных задач. Эти результаты подтверждены бенчмарками PinchBench, которые оценивают скорость и точность выполнения агентных сценариев. При этом модель сохраняет точность на уровне frontier-моделей, что делает ее привлекательной для коммерческого использования.
NeMo Switchyard — библиотека с открытым исходным кодом для автоматической маршрутизации запросов к наиболее подходящей модели.
Ключевая особенность Nemotron 3.5 Lightning — открытость и возможность кастомизации. С помощью платформы NeMo организации могут дообучать модель на собственных данных, инструментах и рабочих процессах, повышая точность для специфических задач. Уже несколько компаний адаптировали модель: CrowdStrike использует ее для кибербезопасности, Harvey — для юридических услуг, CodeRabbit — для ревью кода, а Lila Sciences — для научных исследований. Fastino Labs сообщает о высокой точности в разработке ПО, финансах и здравоохранении.
Модель можно развертывать локально на устройствах NVIDIA RTX, DGX Spark, DGX Station и Jetson, что дает контроль над приватностью и позволяет использовать существующую инфраструктуру. Также поддерживается масштабирование от edge-устройств до дата-центров и облака. NVIDIA публикует данные обучения и методы, насколько это позволяют лицензии, обеспечивая прослеживаемость и возможность обучения других моделей.
NeMo Switchyard решает проблему выбора модели: если использовать одну универсальную модель, можно переплачивать или терять качество, а ручная маршрутизация требует интеграционных усилий. Switchyard автоматически определяет, какая модель лучше всего подходит для каждого шага агентного рабочего процесса, и может быть настроена под конкретные нужды разработчика. Это упрощает создание эффективных агентных приложений без переписывания кода.
Вместе эти два релиза дают предприятиям больше контроля над тем, где и как работает ИИ, и как эффективно он использует вычислительные ресурсы. Это особенно актуально в условиях растущего спроса на агентные системы, которые требуют баланса между производительностью, стоимостью и приватностью.



