Meta відкриває код новою моделлю ШІ Muse Glimmer

Компанія Meta представила Muse Glimmer – модель зі 30 мільярдами параметрів, розроблену для запуску автономних ШІ-агентів безпосередньо на споживчих пристроях. Це дозволяє перенести обчислювальні завдання, які зазвичай потребують хмарної інфраструктури, на потужні Mac та ПК.
Ліцензування моделі також заслуговує на увагу. Glimmer випускається під гнучкою ліцензією Apache 2.0, що є галузевим стандартом. Це перший повністю відкритий реліз компанії з часів випуску закритої моделі Llama, яка була замінена на пропрієтарну Muse Spark у квітні.
Muse Glimmer отримує більш дозвільну ліцензію, ніж будь-коли мала Llama. Спеціалізована ліцензія Llama спільноти викликала багато критики через обмеження, такі як відсічення 700 мільйонів користувачів на місяць. Apache 2.0 не має таких обмежень і дозволяє необмежене комерційне використання, модифікацію та розповсюдження.
Ваги моделі вже доступні на Hugging Face. Підтримка буде розгортатися цього тижня через Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI та OpenRouter. Найближчими днями очікуються оптимізовані інтеграції llama.cpp, MLX та ExecuTorch. Meta також співпрацює з AMD, Arm, Dell, Intel та Nvidia для оптимізації продуктивності на різних пристроях і опублікувала документацію для розробників, що охоплює кастомні каркаси для агентів.
«Сьогодні ми також відкриваємо ваги для Muse Glimmer, чудової щільної моделі з 30 мільярдами параметрів, яка може працювати локально», — написав співзасновник і генеральний директор Meta Марк Цукерберг у своєму дописі на X (під його давнім нікнеймом @finkd). «Незабаром ми також випустимо ваги для Muse Spark 1.2, нашої найновішої базової моделі. Meta є сильним прихильником відкритого програмного забезпечення, і я пишаюся цими релізами».
Обіцяний випуск Muse Spark 1.2 стане ще більшим кроком: це передова модель, що лежить в основі Muse Code, термінального кодинг-агента, який Meta випустила лише п’ять днів тому. До сьогодні вся родина Muse була пропрієтарною. Цукерберг натякнув під час запуску, що «незабаром буде більше інформації» щодо відкритого програмного забезпечення. Тепер ми знаємо, що він мав на увазі.
Для розробників і компаній локальне виконання має практичні переваги, що виходять за рамки того, де відбуваються обчислення. Агент, який працює з файлами, скріншотами, середовищами розробки та іншим чутливим контекстом, може виконувати ці робочі процеси, не надсилаючи постійно цю інформацію до віддаленого сервісу. Локальне розгортання також усуває залежність від мережі та оплату за кожен токен API — хоча організації все одно несуть витрати на обладнання, електроенергію, розгортання та управління.
30B модель, побудована навколо циклу роботи агента
Замість того, щоб позиціонувати Glimmer переважно як загальний чат-бот, Meta навчила її працювати з послідовністю операцій, які виконує автономний агент: формування плану, виклик інструментів, інтерпретація результатів, продовження роботи та відновлення після помилок.
«Як і набагато більші моделі, Muse Glimmer може функціонувати як повноцінний агент через планування, виклики інструментів, перевірку власних результатів і відновлення після збоїв», — написав у потоці X Олександер Ван, головний ШІ-директор Meta, оголошуючи про реліз. Він додав, що модель «може працювати з 24 ГБ VRAM без втрати надійності роботи агента».
Згідно з картою моделі на Hugging Face, Glimmer — це щільний причинно-наслідковий трансформер приблизно з 29,6 мільярдами параметрів у 52 шарах, включаючи виділений модуль сприйняття ViT-G/14 об’ємом ~1,8 мільярда параметрів. Вона приймає перемішаний текст та зображення, генерує текст, підтримує понад 100 мов і має заявлену довжину контексту 131 072 токени або більше, з відсіченням знань на 4 січня 2026 року.
Це поєднання дозволяє агенту інтерпретувати скріншоти, діаграми та документи, одночасно аналізуючи текст і викликаючи зовнішні інструменти. Glimmer пропонує низькі, середні, високі та надвисокі налаштування аналізу (які встановлюються через системний запит), що дозволяє програмам регулювати зусилля аналізу залежно від завдання. Meta стверджує, що вона працює з каркасами агентів, такими як OpenClaw і Hermes Agent.
Модель є дистиляцією більшої флагманської моделі Meta. Згідно з технічним блогом компанії, Glimmer пройшла попереднє навчання на виходах Muse Spark з використанням дистиляції логітів, середнє навчання на даних з довшим контекстом та інтенсивним використанням агентів з багатшими відстеженнями аналізу, а потім пост-навчання за допомогою керованого тонкого налаштування, дистиляції за політикою та навчання з підкріпленням у загальних, аналітичних, кодингових та агентських доменах.
Meta продемонструвала результат за допомогою локального робочого процесу Home Assistant. У демонстраційному відео Glimmer автономно виявляє екземпляр Home Assistant у мережі через виклики інструментів, запитує API пристроїв, створює з нуля адаптивний дашборд на HTML/CSS/JavaScript та розгортає локальний сервер для перевірки своєї роботи. Це ближче до реальної роботи агентських розгортань підприємств, ніж до окремих тестів на відповіді на запитання. Модель повинна підтримувати план під час взаємодії із зовнішніми системами, а потім перевіряти, чи її дії призвели до очікуваного результату.
Стиснення агента до 24 ГБ
Історія з обладнанням є центральною для цього релізу.
При повній точності, за словами Meta, 30-мільярдна модель потребує понад 55 ГБ пам’яті, що перевищує можливості будь-якого окремого споживчого GPU.
Тому компанія розробила приблизно 4-бітні квантовані версії, які зменшують ваги мовної моделі до менш ніж 20 ГБ, залишаючи місце для компонентів, які також потрібні працюючому агенту в пам’яті: KV-кеш, модуль сприйняття та супутня модель спекулятивного декодування. Все це вміщується в межах 24 ГБ або 32 ГБ.
Практично це означає, що квантовані збірки працюють на споживчих машинах — хоча й на їхньому верхньому рівні. Конфігурація K-Quant-17GB, розрахована на 24 ГБ, вміщується на одному висококласному споживчому графічному процесорі, такому як Nvidia RTX 3090 або RTX 4090 (обидва з 24 ГБ VRAM), тоді як версія K-Quant-Dynamic, розрахована на 32 ГБ, відповідає новішому RTX 5090 з 32 ГБ. На стороні Mac уніфікована пам’ять Apple Silicon відіграє роль VRAM, тому MacBook Pro або Mac Studio з 32 ГБ або більше пам’яті можуть вмістити повний стек. Meta проводила власні тести швидкості на M4 Max і M5 Max MacBook Pro. Однак типовий ноутбук з 8 ГБ або 16 ГБ залишається недосяжним, а повна точність BF16, яку Meta оцінює в 64 ГБ, залишається в зоні дії дата-центрових GPU та Mac Studio найвищої конфігурації.
Meta повідомляє про середню деградацію точності лише 0,2% за 15 бенчмарками для версії K-Quant-Dynamic, призначеної для 32 ГБ обладнання, і 1% для конфігурації K-Quant-17GB, призначеної для 24 ГБ обладнання. Ці цифри є власними вимірюваннями Meta, а не незалежними оцінками.
Meta також використовує спекулятивне декодування DFlash для вирішення іншої великої проблеми локальних агентів — затримки. Замість того, щоб генерувати кожен токен послідовно, менша модель-«драфтер» DFlash пропонує блоки з 16 токенів, які основна модель перевіряє паралельно, забезпечуючи ідентичний вивід швидше.
Meta повідомляє, що це збільшує середню швидкість генерації на Nvidia RTX 5090 з 74,9 токенів на секунду до 233,4 (у 3,1 раза), на Apple M5 Max — з 26,6 до 50,2 токенів на секунду (у 1,8 раза), а на M4 Max — з 23,7 до 37,8 (у 1,5 раза). Тести використовували пакетний розмір один і жадібне декодування, з вимірюваннями на системах Apple через ExecuTorch та на RTX 5090 через llama.cpp.
Для агентських програм ці множники мають більше значення, ніж для чату: один запит користувача може викликати багато обертів моделі, викликів інструментів та кроків перевірки, а затримка, що накопичується на кожному етапі, може швидко зробити навіть здатного агента непрактичним.
Glimmer виходить на все більш конкурентний ринок локальних моделей
Meta не входить на порожнє поле. Розробники вже мають потужні відкриті моделі цього розмірного класу, найвідомішими з яких є сімейство Gemma 4 від Google та Qwen3.6-27B від Alibaba. Обидві моделі позиціонуються навколо аналізу, мультимодального розуміння та агентських завдань. Таблиця бенчмарків Meta безпосередньо порівнює Glimmer з ними.

Glimmer лідирує в порівнянні з цими двома моделями за кількома агентськими тестами, включаючи MCP Atlas (75,5), DeepSearch QA (74,6), τ³-Banking (23,5), WildClawBench (47,6) та GAIA2 (43,3). За результатами оцінки Meta, вона набрала 51,2 бали в SWE-Bench Pro, порівняно з 36,9 балами для Gemma4-31B та 50,2 балами для Qwen3.6-27B.
Однак Glimmer не виграє в усіх категоріях. Qwen лідирує у власному порівнянні Meta в OSWorld-Verified (75,6 проти 65,9 у Glimmer), TerminalBench 2.1 (60,7 проти 51,7), SkillsBench, GDPval-AA (1141 проти 953) і в більшості мультимодальних бенчмарків. У SWE-Bench Verified показник Glimmer 76,0 трохи поступається показникові Qwen 77,2. Gemma лідирує в GPQA Diamond та Humanity’s Last Exam.
Якщо чесно оцінювати результати, Glimmer виглядає цікавішою як спеціалізована модель для локальних агентів, а не як свідчення універсальної переваги в продуктивності. Для корпоративних розробників практичне питання полягає в тому, чи її поєднання надійності агента, якості квантування, сумісності інструментів та швидкості декодування перетвориться з бенчмарків на стабільні реальні робочі процеси.
|
Модель |
Розробник / походження |
Оцінка AA |
Параметри / контекст |
Найнижча відстежена ціна API |
Доступ |
Ліцензія |
Найсильніші випадки використання |
|
Kimi K3 |
Moonshot AI; Китай |
60 |
2,8 трлн загалом / 104 млрд активних; 1 млн |
3,00 доларів США (вхід) / 15,00 доларів США (вихід) через Kimi, Fireworks або Modal |
Ваги Kimi API |
Користувацька ліцензія Kimi K3. Оператори великих моделей як сервісу з доходом понад 20 мільйонів доларів за 12 місяців потребують окремої угоди. Великі продукти можуть потребувати відображення «Kimi K3». |
Передове кодування тривалого горизонту Мультимодальні дослідження та складні агенти, керовані інструментами |
|
GLM-5.2 |
Z.ai / Zhipu AI; Китай |
53 |
753 млрд / 40 млрд активних; 1 млн |
0,75 доларів США / 2,40 доларів США через DeepInfra FP4 |
Ваги Z.ai API |
MIT |
Кодування тривалого горизонту та агенти Аналіз мільйона токенів з регульованим аналізом |
|
DeepSeek V4 Flash 0731 |
DeepSeek; Китай |
52 |
284 млрд / 13 млрд активних; 1 млн |
0,09 доларів США / 0,18 доларів США через DeepInfra |
Ваги DeepSeek API |
MIT |
• Надзвичайно економічний аналіз • Кодинг-агенти, термінальна робота та використання інструментів |
|
MiniMax-M3 |
MiniMax; Китай |
45 |
428 млрд / 23 млрд активних; 1 млн |
0,23 доларів США / 0,96 доларів США через CoreWeave |
Ваги ; MiniMax API |
Ліцензія MiniMax Community. Вимагається комерційне зазначення авторства; компанії з доходом понад 20 мільйонів доларів на рік потребують дозволу. Включає умови забороненого використання. |
• Нативна робота з текстом, зображеннями та відео • Довгоконтекстне кодування та агенти «співпраці» |
|
MiMo-V2.5-Pro |
Xiaomi; Китай |
43 |
1,02 трлн / 42 млрд активних; 1 млн |
0,35 доларів США / 0,70 доларів США через GMI |
Ваги Xiaomi API |
MIT |
Складне програмне забезпечення Агенти, що охоплюють тисячі викликів інструментів |
|
Inkling |
Thinking Machines Lab; США |
42 |
975 млрд / 41 млрд активних; 1 млн у вагах |
0,95 доларів США / 4,05 доларів США через DeepInfra FP8 |
Ваги Tinker |
Apache 2.0 |
Настроювана основа для тексту, зображень та аудіо Тонко налаштовані системи для кодування, RAG та використання інструментів |
|
Nemotron 3 Ultra 550B A55B |
NVIDIA; США |
38 |
550 млрд / 55 млрд активних; до 1 млн у вагах |
0,37 доларів США / 1,08 доларів США через Blackbox AI |
Ваги |
OpenMDW-1.1; дозвільні комерційні права та права на похідні моделі |
Складні агенти та довгоконтекстний аналіз Високоточні RAG, код, математика та наука |
|
Mistral Medium 3.5 |
Mistral AI; Франція |
30 |
128 млрд щільних; 256 тис. |
1,50 доларів США / 7,50 доларів США через Mistral |
Ваги Mistral API |
Модифікована MIT. Компанії з консолідованим щомісячним доходом понад 20 мільйонів доларів повинні отримати комерційну ліцензію або використовувати послуги Mistral. |
Кодинг-агенти та виклик функцій Мультимодальне слідування інструкціям |
|
Gemma 4 31B |
Google DeepMind; США |
30 |
30,7 млрд щільних; 256 тис. |
Безкоштовно в обмеженому рівні Google AI Studio; платний низький тариф 0,10 доларів США / 0,34 доларів США через CoreWeave |
Ваги Google AI Studio |
Apache 2.0 |
Компактний мультимодальний аналіз та кодування Керовані локальні або приватні серверні розгортання |
|
gpt-oss-120b |
OpenAI; США |
24 |
117 млрд / 5,1 млрд активних; 131 тис. |
0,03 доларів США / 0,17 доларів США через CoreWeave |
Ваги Численні сторонні API |
Apache 2.0 |
Аналіз Структурований вивід та інструменти Тонке налаштування та розгортання на одному GPU 80 ГБ |
|
Command A+ |
Cohere; Канада |
23 |
218 млрд / 25 млрд активних; 128 тис. вхідних |
Безкоштовно на відстежуваному кінцевому точці Cohere |
Ваги Cohere |
Apache 2.0 |
Корпоративні RAG та обґрунтовані цитати • Багатомовні агенти та обробка документів |
|
Muse Glimmer 30B |
Meta; США |
Ще не оцінено |
29,6 млрд щільних, включаючи візуальний кодер; 131 тис.+ |
У день запуску публічна ціна за використання не знайдена |
Ваги Сторінка моделі Meta |
Apache 2.0 для повних ваг, квантованих версій, драфтера та модуля сприйняття |
Постійно працюючі локальні агенти на системах 24–32 ГБ Використання інструментів, відновлення, кодування та розуміння екрана/документів |
Meta Glimmer додає до ще невеликого списку справді відкритих моделей передового класу від американських компаній.
Протягом останніх двох років китайські компанії задавали темп у відкритому ШІ, випускаючи на ринок передові відкриті моделі від DeepSeek, команди Qwen від Alibaba, Moonshot AI Kimi, Zhipu GLM та MiniMax під ліцензіями MIT та Apache 2.0 з частотою, яку західні лабораторії не могли повторити.
Дані про використання це відображають: до травня 2026 року китайські моделі з відкритими вагами становили приблизно 61% усіх токенів, спожитих на OpenRouter, причому чотири з п’яти найпопулярніших моделей надходили від китайських лабораторій — тоді як Llama від Meta, попередній лідер відкритого програмного забезпечення, взагалі вибув з рейтингу.
Контрприклади зі США все ще можна порахувати на пальцях однієї руки: gpt-oss-120b та gpt-oss-20b від OpenAI, випущені під Apache 2.0 у серпні 2025 року як перші відкриті ваги компанії з часів GPT-2; сімейство Gemma від Google, яке є відкритим за вагами, але випускається під власною, більш обмежувальною власною ліцензією Google, а не під ліцензією, схваленою OSI; і Inkling від Thinking Machines.
Glimmer запрошує до найпрямішого порівняння з gpt-oss: обидві моделі мають ліцензію Apache 2.0, обидві пропонують регульовані зусилля аналізу, і обидві націлені на розгортання з самостійним хостингом.
Але моделі gpt-oss є лише текстовими, розрідженими моделями «суміш експертів», створеними в основному для аналізу та використання інструментів — gpt-oss-20b вміщується приблизно в 16 ГБ пам’яті, тоді як gpt-oss-120b націлений на один GPU дата-центру об’ємом 80 ГБ.
Glimmer займає іншу нішу: щільна модель з нативним вхідним зображенням, навчена наскрізно навколо циклу роботи агента, яка поставляється з власними квантованими варіантами та драфтером спекулятивного декодування, оптимізованим для споживчих машин з 24 ГБ.
І якщо Цукерберг дотримається обіцянки відкрити ваги Muse Spark 1.2, Meta поставить справжню американську флагманську модель передового рівня у відкритий обіг — чого жодна американська лабораторія не робила на такому рівні.
Безпека залишається частиною архітектури розгортання
Надання локальній моделі доступу до інструментів створює іншу проблему безпеки, ніж розгортання локального чат-бота — і власні показники безпеки Meta показують, що Glimmer не є однозначно сильнішою за своїх конкурентів.
У CI Memories, бенчмарку конфіденційності, де кращими є нижчі показники порушень, Glimmer показує 26,4 проти 12,1 у Gemma та 53,4 у Qwen. У Siren AgentDojo, тесті на ін’єкцію промптів, Glimmer демонструє 28,4% успішних атак порівняно з 25,6% у Gemma та 40,3% у Qwen — при цьому показуючи найвищий показник корисності з трьох — 94,2.
Meta стверджує, що оцінила Glimmer за своєю розширеною системою масштабування ШІ (Advanced AI Scaling Framework) і визначила, що модель не відповідає визначенню «Frontier AI» через свою загальну меншу потужність порівняно з Muse Spark. Її Команда підготовленості оцінила Glimmer як таку, що становить помірний або нижчий ризик у категоріях хімічних/біологічних загроз, кіберзагроз та втрати контролю — останні дві категорії виведені з того факту, що Glimmer загалом слабша за Muse Spark 1.0, яка отримала такі ж позначки.
Незважаючи на це, компанія рекомендує розгортати Glimmer як частину ширшої системи із захисними бар’єрами, включаючи людський контроль для незворотних дій. Це застереження особливо важливе для локальних агентів: зберігання даних на пристрої зменшує ризик доступу до хмарної інфраструктури, але локальне виконання само по собі не вирішує проблеми ін’єкції промптів, надмірних дозволів або ненавмисних дій агента.
Ваги Apache 2.0 та швидкозростаюча екосистема середовищ виконання
Meta випускає повні ваги BF16, обидва 4-бітні квантовані варіанти, драфтер DFlash та модуль сприйняття — усі під ліцензією Apache 2.0. Для завантажуваної моделі немає ціни API від Meta, тому загальна вартість залежить від локального обладнання або будь-яких сторонніх хостингів, які виберуть розробники. Важливий нюанс для закупівельних відділів: як і у випадку з більшістю релізів моделей «відкритого програмного забезпечення», відкритими є саме ваги — Meta не випустила дані або код для навчання.
Ширше значення полягає в тому, що Meta розглядає робочу станцію розробника як реалістичну ціль для розгортання автономних агентів, а не лише як місце для експериментів з меншими мовними моделями. Розмір Glimmer у 30 мільярдів параметрів та цільовий показник у 24 ГБ роблять це можливим для висококласного споживчого обладнання, тоді як ліцензія Apache 2.0 надає розробникам — і їхнім юридичним відділам — незвичайну свободу для модифікації та розгортання.
Наступним випробуванням буде те, чи переживуть її переваги в бенчмарках в більш складних умовах реальних репозиторіїв програмного забезпечення, корпоративних інструментів та тривалих сесій агентів. Якщо так, то найбільш значущою частиною Glimmer може стати не черговий набір показників бенчмарків — це може бути те, що клас агентів, який раніше очікувався за хмарним API, все частіше зможе жити та працювати на машині, що стоїть під столом розробника.
Джерело новини: venturebeat.com
