PrismML прагне змінити використання ШІ своїм мініатюрним LLM
Компанія PrismML, хоч і не встигла ще зібрати значні кошти (лише $22,25 млн на початковому етапі), заслуговує на вашу увагу завдяки висококваліфікованим фахівцям, які стоять за нею, та розроблюваній технології, що може змінити індустрію.
PrismML робить ставку на те, що потужні, високопродуктивні мовні моделі, здатні до міркувань, насправді не обов’язково мають бути великими.
Вони створюють моделі для міркувань настільки малі, що їх можна встановлювати на комп’ютери та смартфони. (Навіть подейкують про переговори з Apple, хоча генеральний директор Бабак Хассібі відмовився коментувати це для TechCrunch).
У четвер PrismML представила Bonsai 2 27B, найновішу модель у своїй лінійці. Вона стискає Qwen3.8 27B, широко використовувану відкриту модель від Alibaba, до 5,9 ГБ. Це достатньо мало, щоб вміститися на ПК і, можливо, на смартфоні високого класу. Обсяг пам’яті зменшено в 9-10 разів порівняно з оригіналом.
PrismML була заснована групою дослідників Калтеху і очолюється Хассібі, професором Калтеху та експертом з технологій стиснення. Серед радників стартапу також є Йон Стоїка — співзасновник Databricks (та інших компаній) і директор відомої Sky Computing Lab у Берклі, яка дала життя багатьом технологіям та стартапам, від Letta до SGLang.
PrismML також підтримується інвесторами Khosla Ventures, Cerberus Capital та Калтехом.
Цей стартап, безумовно, не єдина компанія, що працює над технологіями стиснення LLM. Multiverse Computing, заснована відомим професором з Міжнародного центру фізики Доностіа в Іспанії, є ще одним прикладом. (І Multiverse Computing вже зібрала чимало коштів).
Проте Хассібі стверджує, що технологія стиснення PrismML унікальна, оскільки їхні LLM майже не втратили продуктивності порівняно з оригіналами. Bonsai 2 досягає 98% від сукупних показників Qwen у бенчмарках. Це покращення порівняно з першою версією Bonsai, випущеною кілька місяців тому в березні, яка досягала 95%. Першу модель вже завантажили понад 11 мільйонів разів, а ще менші моделі PrismML — додатково 2,6 мільйона разів, зазначає компанія.
Це свідчить про те, що результати стиснення PrismML покращуються від релізу до релізу. Чи зможуть вони колись досягти 100% паритету продуктивності в бенчмарках — це питання, яке ще належить з’ясувати. Хассібі вважає, що стиснення, ймовірно, завжди матиме певний вплив.
Проте, ідеальний паритет у бенчмарках є досить академічним. LLM не настільки точні у своєму нестисненому вигляді, а бенчмарки не настільки повно відображають реальні завдання, щоб 2% деградації суттєво вплинули на роботу моделі в реальному використанні. (До того ж, оточуюче програмне забезпечення — “обгортка”, в якій працює модель — також має велике значення для точності).
PrismML заявляє, що досягає цього шляхом зменшення “ваг”, що складають модель. Ваги — це, по суті, інформація, яку модель вивчає та зберігає під час тренування. Зазвичай кожна вага потребує 16 бітів. Підхід PrismML, який називається “трійчасті” ваги, спрощує це до трьох значень: +1, −1 або 0. З набагато меншими значеннями для зберігання кожної ваги, модель займає значно менше місця. (Для глибшого ознайомлення з технікою стиснення, ось сторінка проєкту на Hugging Face).
Наступною метою стартапу є застосування цієї техніки стиснення до ще більших моделей. “Наступні моделі, які ми випустимо, сподіваємося, протягом кількох місяців, будуть у діапазоні кількох сотень мільярдів параметрів, і я очікую, що буде легше зберегти інтелект у них”, — повідомив Хассібі TechCrunch.
Він додав, що зі зростанням розміру моделі “з’являється більше простору для стиснення без втрати інтелекту. Тож я б просто сказав, як загальну тенденцію, що для більших моделей легше досягти 100%”.
Стоїка зазначає, що він захоплений цією технологією, оскільки вона дозволяє передовим моделям працювати безпосередньо на пристроях користувачів. “Ви отримаєте інтелект на кінчиках пальців, і він буде безкоштовним, тому що він працюватиме на пристрої, який ви вже купили. Це також буде приватно, оскільки ви не надсилатимете дані в хмару”.
Подробиці можна знайти на сайті: techcrunch.com
