Meta представила ШІ-модель на 30 млрд параметрів для ноутбуків


        30 мільярдів параметрів на звичайному ноутбуці: Meta показала нову ШІ-модель

Як побудована Muse Glimmer

Muse Glimmer створювали як компактнішу модель для тривалих агентних сценаріїв: вона має бути достатньо продуктивною для складних завдань, але не вимагати серверного обсягу пам’яті. Основою розробки стала дистиляція знань із флагманської моделі-вчителя Muse Spark.

Під час дистиляції менша модель переймає не лише готові відповіді, а й закономірності, за якими більша система обирає рішення. Це дає змогу зберегти частину її можливостей у значно компактнішій конфігурації.

Три етапи навчання

  1. Pre-Training. На першому етапі модель навчали на даних Muse Spark, використовуючи дистиляцію логітів — передавання розподілу ймовірностей, який формує модель-вчитель.
  2. Mid-Training. Далі Glimmer тренували на спеціалізованих наборах даних із довгим контекстом і складними послідовностями міркувань.
  3. Post-Training. Фінальний етап поєднав тонке налаштування та навчання з підкріпленням. Основну увагу приділили програмуванню, логічним завданням і взаємодії із зовнішніми інструментами.

Для яких завдань підходить модель

Muse Glimmer орієнтована не лише на одноразові запити, а й на довгі робочі процеси, у яких ШІ самостійно виконує кілька пов’язаних дій. Такий підхід дає змогу використовувати модель як персонального цифрового помічника.

  • планування та керування розкладом;
  • написання й аналіз програмного коду;
  • робота з файлами;
  • оброблення та інтерпретація даних;
  • виконання послідовностей дій через підключені інструменти.

Основні функції

Надійна робота з інструментами. Модель уміє викликати функції за заданими схемами й підтримувати багатокрокові процеси. Це важливо для агентів, які мають не просто сформувати відповідь, а виконати конкретну операцію в іншій програмі чи сервісі.

Відновлення після помилок. Якщо під час виклику інструмента виникає збій, Glimmer може проаналізувати причину, скоригувати дію та повторити спробу замість негайного завершення сценарію.

Підтримка тексту й зображень. Окремий модуль сприйняття дає змогу аналізувати текстову інформацію разом зі скріншотами, графіками та документами. Це розширює перелік завдань — від розбору таблиць до пояснення вмісту інтерфейсу.

Багатомовність. Модель заявлена як така, що підтримує понад 100 мов, тому її можна застосовувати в міжнародних і багатомовних робочих процесах.

Інтеграція з агентними фреймворками. Muse Glimmer сумісна з OpenClaw та іншими оркестраторами, які використовують для побудови систем зі ШІ-агентами.

Як Muse Glimmer запускається на звичайних пристроях

Модель має близько 30 мільярдів параметрів. У режимі повної точності їй потрібно понад 55 ГБ відеопам’яті, що робить запуск складним для більшості домашніх комп’ютерів. Тому розробники оптимізували її для споживчого обладнання.

Читайте також:  Google переведе мільйони Android-пристроїв з Assistant на Gemini
Технологія Що вона дає
4-бітове квантування K-Quant Зменшує розмір моделі до менш ніж 20 ГБ, завдяки чому її можна запускати в системах із 24 або 32 ГБ пам’яті з урахуванням KV-кешу та додаткових модулів.
Спекулятивне декодування DFlash Допоміжна компактна мережа заздалегідь пропонує блоки токенів, прискорюючи генерацію відповіді.

Квантування скорочує вимоги до пам’яті, хоча в окремих сценаріях може впливати на точність. Натомість спекулятивне декодування оптимізує швидкість: основна модель перевіряє підготовлені допоміжною мережею фрагменти, а не генерує кожен токен окремо.

За даними розробників, DFlash може помітно пришвидшити роботу Muse Glimmer на пристроях із чипами Apple M4/M5 Max, а також на відеокартах рівня RTX 5090.

Підтримка програмного забезпечення

Найближчим часом модель планують інтегрувати в Ollama, LM Studio та Unsloth. Також заявлена підтримка рушіїв Llama.cpp, ExecuTorch, MLX, vLLM і SGLang.

Це означає, що Muse Glimmer зможуть використовувати не лише розробники серверних рішень, а й власники потужних персональних комп’ютерів, Mac та локальних робочих станцій.

Muse Glimmer поєднує агентні можливості, мультимодальність і підтримку інструментів із підходом до локального запуску. Завдяки дистиляції, квантуванню та прискореному декодуванню модель орієнтована на складні багатокрокові завдання без обов’язкової залежності від потужної серверної інфраструктури.