NVIDIA выпустила модель для более дешёвых ИИ-агентов

NVIDIA представила Nemotron 3.5 Lightning — открытую модель на 30 млрд параметров — и NeMo Switchyard, библиотеку для автоматического выбора модели внутри ИИ-агентов. Анонс опубликован 11 августа 2026 года.
Что выпустила NVIDIA
Nemotron 3.5 Lightning рассчитана не на роль единственного универсального «мозга», а на специализированные шаги в многоагентных системах: работу с инструментами, проверку кода, мониторинг предупреждений безопасности и ответы на типовые вопросы. NVIDIA описывает модель как mixture-of-experts и указывает, что она может запускаться на RTX-ПК, DGX Spark, DGX Station и Jetson, а также в дата-центрах и облаке.
Второй компонент — NeMo Switchyard. Это open-source библиотека, которая направляет отдельные запросы к наиболее подходящей модели из набора: от локальной или открытой до более дорогой проприетарной. Идея проста: сложные шаги получает сильная модель, а рутинные не занимают её вычислительный бюджет.
Модель уже заявлена для Hugging Face, ModelScope, OpenRouter и build.nvidia.com. Код Switchyard опубликован на GitHub, партнёрские интеграции должны появиться позже.
Что это меняет
Если такая схема работает стабильно, разработчикам не нужно отправлять весь агентский сценарий в самую дорогую модель. Небольшая модель может закрывать большую часть повторяющихся операций локально или на более дешёвом сервере, а маршрутизатор — переключать систему на frontier-модель только там, где это действительно необходимо. Для бизнеса это означает потенциально меньшую стоимость запросов, больше контроля над данными и возможность запускать часть цепочки на собственном железе.
NVIDIA заявляет до четырёхкратного роста скорости генерации и до 30% более быстрое завершение агентных задач по сравнению с моделями своего класса. Это результаты внутренних сравнений NVIDIA, а не независимый отраслевой тест. Компания также приводит внутренние оценки Switchyard, в которых стоимость выполнения задач снижается до примерно трети от сценария на одном Opus 4.8; эти цифры тоже требуют самостоятельной проверки на конкретных нагрузках.
Главное
Релиз важен не только как новая open-weight модель. NVIDIA продвигает «смешанную» архитектуру: локальные и открытые модели выполняют массовую работу, а дорогие модели подключаются точечно. Если этот подход закрепится, конкуренция будет идти не только за лучший ответ, но и за самый экономичный способ собрать из нескольких моделей полезного агента.