Meta представила ШІ-модель на 30 млрд параметрів для ноутбуків
Як побудована Muse Glimmer
Muse Glimmer створювали як компактнішу модель для тривалих агентних сценаріїв: вона має бути достатньо продуктивною для складних завдань, але не вимагати серверного обсягу пам’яті. Основою розробки стала дистиляція знань із флагманської моделі-вчителя Muse Spark.
Під час дистиляції менша модель переймає не лише готові відповіді, а й закономірності, за якими більша система обирає рішення. Це дає змогу зберегти частину її можливостей у значно компактнішій конфігурації.
Три етапи навчання
- Pre-Training. На першому етапі модель навчали на даних Muse Spark, використовуючи дистиляцію логітів — передавання розподілу ймовірностей, який формує модель-вчитель.
- Mid-Training. Далі Glimmer тренували на спеціалізованих наборах даних із довгим контекстом і складними послідовностями міркувань.
- Post-Training. Фінальний етап поєднав тонке налаштування та навчання з підкріпленням. Основну увагу приділили програмуванню, логічним завданням і взаємодії із зовнішніми інструментами.
Для яких завдань підходить модель
Muse Glimmer орієнтована не лише на одноразові запити, а й на довгі робочі процеси, у яких ШІ самостійно виконує кілька пов’язаних дій. Такий підхід дає змогу використовувати модель як персонального цифрового помічника.
- планування та керування розкладом;
- написання й аналіз програмного коду;
- робота з файлами;
- оброблення та інтерпретація даних;
- виконання послідовностей дій через підключені інструменти.
Основні функції
Надійна робота з інструментами. Модель уміє викликати функції за заданими схемами й підтримувати багатокрокові процеси. Це важливо для агентів, які мають не просто сформувати відповідь, а виконати конкретну операцію в іншій програмі чи сервісі.
Відновлення після помилок. Якщо під час виклику інструмента виникає збій, Glimmer може проаналізувати причину, скоригувати дію та повторити спробу замість негайного завершення сценарію.
Підтримка тексту й зображень. Окремий модуль сприйняття дає змогу аналізувати текстову інформацію разом зі скріншотами, графіками та документами. Це розширює перелік завдань — від розбору таблиць до пояснення вмісту інтерфейсу.
Багатомовність. Модель заявлена як така, що підтримує понад 100 мов, тому її можна застосовувати в міжнародних і багатомовних робочих процесах.
Інтеграція з агентними фреймворками. Muse Glimmer сумісна з OpenClaw та іншими оркестраторами, які використовують для побудови систем зі ШІ-агентами.
Як Muse Glimmer запускається на звичайних пристроях
Модель має близько 30 мільярдів параметрів. У режимі повної точності їй потрібно понад 55 ГБ відеопам’яті, що робить запуск складним для більшості домашніх комп’ютерів. Тому розробники оптимізували її для споживчого обладнання.
| Технологія | Що вона дає |
|---|---|
| 4-бітове квантування K-Quant | Зменшує розмір моделі до менш ніж 20 ГБ, завдяки чому її можна запускати в системах із 24 або 32 ГБ пам’яті з урахуванням KV-кешу та додаткових модулів. |
| Спекулятивне декодування DFlash | Допоміжна компактна мережа заздалегідь пропонує блоки токенів, прискорюючи генерацію відповіді. |
Квантування скорочує вимоги до пам’яті, хоча в окремих сценаріях може впливати на точність. Натомість спекулятивне декодування оптимізує швидкість: основна модель перевіряє підготовлені допоміжною мережею фрагменти, а не генерує кожен токен окремо.
За даними розробників, DFlash може помітно пришвидшити роботу Muse Glimmer на пристроях із чипами Apple M4/M5 Max, а також на відеокартах рівня RTX 5090.
Підтримка програмного забезпечення
Найближчим часом модель планують інтегрувати в Ollama, LM Studio та Unsloth. Також заявлена підтримка рушіїв Llama.cpp, ExecuTorch, MLX, vLLM і SGLang.
Це означає, що Muse Glimmer зможуть використовувати не лише розробники серверних рішень, а й власники потужних персональних комп’ютерів, Mac та локальних робочих станцій.
Muse Glimmer поєднує агентні можливості, мультимодальність і підтримку інструментів із підходом до локального запуску. Завдяки дистиляції, квантуванню та прискореному декодуванню модель орієнтована на складні багатокрокові завдання без обов’язкової залежності від потужної серверної інфраструктури.