NVIDIA розробила модель на 30 млрд параметрів для дешевших ШІ-агентів
Nemotron 3.5 Lightning — компактніша в роботі, але потужна за можливостями мовна модель NVIDIA. Її архітектура дає змогу залучати значно менше обчислювальних ресурсів для обробки кожного токена, не втрачаючи переваг великої нейромережі. Модель орієнтована на автоматизацію типових операцій, роботу з агентами та локальне розгортання.
Архітектура та продуктивність
Загальний обсяг моделі становить 30 мільярдів параметрів. Водночас завдяки підходу Mixture-of-Experts для обробки конкретного токена активуються лише близько 3 мільярдів параметрів.
Такий принцип роботи дає змогу поєднати можливості великої мовної моделі з витратами на обчислення, характерними для значно компактніших систем. Це особливо важливо під час запуску ШІ в середовищах із обмеженими ресурсами або при масштабуванні великої кількості запитів.
Ключові характеристики Nemotron 3.5 Lightning:
- генерує відповіді приблизно вчетверо швидше за моделі аналогічного розміру;
- демонструє точність до 86% у тесті PinchBench;
- виконує 10 000 завдань на 30% швидше, ніж Qwen3.6 35B;
- підтримує speculative decoding — метод, що прискорює перевірку та формування токенів;
- використовує формат квантування NVFP4, оптимізований для чипів Blackwell, Hopper і Ampere.
Speculative decoding дає змогу спочатку швидко спрогнозувати кілька токенів, а потім перевірити їх точнішою частиною системи. У результаті зменшується затримка під час генерації тексту без помітного погіршення якості відповідей.
Розподіл завдань між моделями
Nemotron 3.5 Lightning розрахована не лише на автономну роботу. Її можна використовувати як частину системи з кількох моделей, де кожна нейромережа виконує завдання відповідно до своєї спеціалізації.
Потужніша Nemotron 3 Ultra у такій конфігурації відповідає за планування, аналіз складних запитів і ухвалення рішень. Lightning бере на себе більш передбачувані операції: перевіряє результати, запускає команди та приводить дані до потрібного формату.
Для автоматичного розподілу запитів NVIDIA представила бібліотеку NeMo Switchyard. Вона оцінює складність інструкції й за потреби передає прості завдання меншій моделі, не залучаючи потужнішу систему без необхідності.
Такий підхід допомагає скоротити витрати на обчислення, зменшити затримки та ефективніше використовувати дорогі графічні прискорювачі.
Навчання, налаштування та програмна екосистема
Nemotron 3.5 Lightning оптимізована для середовищ OpenClaw і Hermes Agent, а також підтримує безпековий стек NVIDIA NemoClaw. Це спрощує її інтеграцію в агентні системи, які можуть самостійно виконувати послідовність дій, працювати з інструментами та взаємодіяти з локальними сервісами.
Розробники можуть швидше й дешевше донавчати модель за допомогою інструментів NeMo Automodel і NeMo Megatron Bridge. Вони призначені для підготовки моделі до спеціалізованих сценаріїв — наприклад, програмування, роботи з корпоративними даними або автоматизації технічних процесів.
До комплекту також входить відкритий датасет Nemotron-RL Agentic Terminal Pivot. Його можна використовувати для навчання ШІ-моделей, здатних виконувати завдання в терміналі та працювати як кодинг-агенти.
Де можна запускати модель
Nemotron 3.5 Lightning підтримує локальне розгортання на різних типах обладнання. Зокрема, модель можна запускати на таких платформах:
- DGX Spark;
- Jetson;
- персональні комп’ютери з відеокартами GeForce RTX 5090.
Код моделі, її ваги та навчальні датасети відкриті за ліцензією OpenMDW-1.1. Це дає розробникам змогу самостійно розгортати систему, адаптувати її під власні продукти та досліджувати принципи її роботи.
У підсумку Nemotron 3.5 Lightning поєднує велику кількість параметрів із вибірковою активацією, високою швидкістю та підтримкою локального запуску. Її основне призначення — швидко виконувати повторювані операції в агентних системах, залишаючи складне планування потужнішим моделям.