Thinking Machines презентує Inkling: відкриту ШІ-модель, що поступається попереднику лише розміром

Лише через два тижні після випуску Thinking Machines своєї першої мовної моделі зі штучним інтелектом з відкритим кодом Inkling, стартап, який отримав значне фінансування і очолюється колишнім технічним директором OpenAI Мірою Мураті, сьогодні представив Inkling-Small. Нова модель вражає тим, що не лише зберегла майже всю продуктивність свого попередника, але й перевершила його за декількома показниками.
Inkling Small – це мультимодальна модель для міркувань з 276 мільярдами параметрів і дозвільною ліцензією Apache 2.0. Вона майже не поступається своєму старшому аналогу (оригінальний Inkling має 975 мільярдів параметрів згідно внутрішніх налаштувань моделі) за результатами третьої сторони Artificial Analysis Intelligence Index, набравши на один бал менше. Модель приймає текстові, зображувальні та аудіовходи, генерує текст і підтримує контекстне вікно до одного мільйона токенів.
Inkling Small використовує 12 мільярдів активних параметрів на токен, тоді як Inkling – 41 мільярд. При цьому вона зберегла значну частину можливостей флагманської моделі в кодуванні, міркуванні та мультимодальній обробці.
Для підприємств привабливість полягає не лише в меншому розмірі Inkling-Small. Розробники отримали модель, яка потребує значно менше обчислювальних ресурсів, коштує дешевше в експлуатації та займає менше місця для розгортання, втративши при цьому відносно небагато функціональності.
Модель все ще занадто велика для ноутбука чи звичайного робочого комп’ютера, але її значно легше використовувати, ніж її на 3.5 рази більший аналог. Це робить її добрим вибором для компаній, які мають певні, але не надмірні, власні графічні процесори (GPU).
Thinking Machines випустила повні вагові коефіцієнти моделі на Hugging Face та додала підтримку доналаштування через API свого додатку для тренування моделей Tinker.
На момент запуску компанія пропонує обмежену за часом знижку 50%. Це знижує ціну API для стандартної моделі Inkling-Small з контекстом 64K до $0.58 за мільйон вхідних токенів (prefill), $1.44 за мільйон вихідних токенів (sampled) та $1.73 за мільйон тренувальних токенів. Запити з кешованим prefill коштують $0.116 за мільйон токенів. Також доступний варіант з контекстом 256K за вищими тарифами.
Майже той самий результат при чверті розміру
Artificial Analysis оцінила Inkling-Small у 40 балів за своїм Індексом інтелекту, тоді як Inkling отримала 41 бал.
Цей результат є помітним, адже Inkling-Small має 276 мільярдів загальних параметрів і 12 мільярдів активних, тоді як Inkling має 975 мільярдів загальних параметрів та 41 мільярд активних.
Artificial Analysis також повідомила, що жодна модель з відкритими ваговими коефіцієнтами такого ж або меншого розміру, як Inkling-Small, не отримала вищого балу за цим індексом.
Модель не просто наближається до загального результату флагманської моделі. Вона перевершує Inkling за декількома оцінками.
Thinking Machines повідомляє, що Inkling-Small отримує 80.2% за SWE-bench Verified (порівняно з 77.6% у Inkling) та 64.7% за Terminal Bench 2.1 (порівняно з 63.8% у більшої моделі). Вона також випереджає Inkling у тестах SciCode, Humanity’s Last Exam, GPQA Diamond та CritPt.
Однак ці переваги не є універсальними. Inkling зберігає явну перевагу у фактичних знаннях та деяких агентивних завданнях. Inkling-Small отримує 15.5% за τ³-Banking (порівняно з 23.7% у Inkling), а її показник AA Omniscience є негативним, що свідчить про слабше покриття фактичної інформації, хоча рівень галюцинацій у неї дещо нижчий.
Цей компроміс важливий для підприємств. Inkling-Small може бути привабливою для помічників з кодування, систем використання інструментів, генерації з доповненою інформацією (RAG), аналізу документів та мультимодальних робочих процесів. Однак організаціям, які використовують її для завдань, що вимагають високої точності фактичної інформації, все одно знадобиться доповнення, перевірка та людський контроль.
Як 276-мільярдна модель використовує лише 12 мільярдів параметрів за раз
Inkling-Small – це розріджена модель Mixture-of-Experts. Згідно з карткою моделі, опублікованою Thinking Machines, її 42-шаровий декодер спрямовує кожен токен до шести з 256 спеціалізованих експертів, а також до двох спільних експертів, які залишаються активними для кожного токена.
Ця архітектура пояснює різницю між 276 мільярдами загальних параметрів моделі та 12 мільярдами активних. Система зберігає великий пул вивчених можливостей, але активує лише частину з них під час кожного кроку виведення.
Вона також є нативно мультимодальною. Зображення, аудіо та текст проектуються у спільне представлення і обробляються декодером спільно, а не через повністю окремі зовнішні системи. Thinking Machines вказує на помічників з кодування, агентивні програми, чат-ботів, системи RAG та інші мультимодальні програми серед її призначень.
Компанія також підтримує змінний рівень міркувань, дозволяючи розробникам збільшувати або зменшувати обчислювальні ресурси моделі під час виконання залежно від складності завдання. Це дає командам інженерів прямий спосіб збалансувати якість, затримку та вартість для різних робочих навантажень.
На жаль, “Small” не означає, що модель працюватиме на ноутбуці
Незважаючи на назву, Inkling-Small не є моделлю споживчого масштабу.
За даними Thinking Machines, стандартний контрольний пункт BF16 потребує щонайменше 600 ГБ сукупної пам’яті GPU. Компанія вказує дві підтримувані конфігурації: 4x NVIDIA B300 GPU або 8x NVIDIA H200 GPU.
Квантований контрольний пункт NVFP4 знижує вимоги приблизно до 180 ГБ сукупної VRAM. Thinking Machines стверджує, що ця версія може працювати в режимі W4A4 на одному NVIDIA B300 або в режимі W4A16 на двох GPU H200.
Це виключає звичайні ноутбуки, MacBook, настільні ігрові ПК та більшість робочих станцій розробників. Навіть потужні локальні системи, як правило, значно не досягають необхідної пам’яті.
Практичні цілі розгортання – це корпоративні сервери GPU, хмарні кластери та спеціалізовані провайдери інференсу. Таким чином, мітка “Small” є відносною до Inkling, а не до ширшого кола локальних моделей.
Проте, зменшення є значущим. Модель, яка наближається до продуктивності Inkling, потребуючи значно менше сукупної пам’яті, може знизити витрати на хостинг, полегшити планування потужностей та розширити коло організацій, здатних самостійно її розміщувати.
Для компаній, які прагнуть контролю над даними, поведінкою моделі та доналаштуванням, цей менший розмір може бути важливішим, ніж прагнення до найвищого можливого показника в бенчмарках.
І, звичайно, оскільки модель є з відкритим кодом, вона, без сумніву, буде швидко квантована (зменшена точність, але менше обчислень) і, ймовірно, буде поєднана з іншими моделями, щоб стати ще меншою для обладнання споживчого класу.
Apache 2.0 – золотий стандарт для корпоративних моделей з відкритим кодом
Ліцензування може бути не менш важливим, ніж бенчмарки.
Inkling-Small випущена під ліцензією Apache 2.0 – однією з найвідоміших дозвільних ліцензій у програмній індустрії. Вона, як правило, дозволяє організаціям використовувати, модифікувати, доналаштовувати, розповсюджувати та комерціалізувати модель, у тому числі в пропрієтарних продуктах, за умови дотримання вимог ліцензії щодо повідомлень та атрибуції.
Це надає підприємствам значно більше юридичної гнучкості, ніж багато спеціалізованих “відкритих” ліцензій на ШІ, які можуть включати порогові значення доходу, зобов’язання щодо брендингу, обмеження використання або окремі умови для масштабного комерційного розгортання.
Ця відмінність стає все більш актуальною, оскільки все більше компаній, що займаються ШІ, публікують вагові коефіцієнти моделей, не використовуючи традиційну ліцензію відкритого програмного забезпечення.
Наприклад, китайська компанія Moonshot, що спеціалізується на ШІ, минулого тижня надала доступ до вагових коефіцієнтів своєї передової моделі Kimi K3 за спеціальною “відкритою” ліцензією, яка містить додаткові комерційні умови, на відміну від порівняно простих умов Apache 2.0.
Для юридичних, закупівельних та платформенних команд ця різниця може суттєво спростити впровадження. Apache 2.0 не усуває необхідність перегляду політик прийнятного використання, походження даних, регуляторних ризиків або зобов’язань щодо подальшої безпеки. Але вона надає організаціям чіткішу відправну точку для створення внутрішніх систем, випуску комерційних продуктів та підтримки модифікованих версій моделі.
Більш повторюваний конвеєр розробки моделей
Inkling-Small також демонструє, наскільки швидко Thinking Machines перетворила випуск своєї першої великої моделі на повторюваний інженерний процес.
Дослідник Thinking Machines Горас Хе порівняв два запуски в дописі на X:
“Якщо випуск Inkling, на мою думку, потребував зусиль цілого села, то випуск Inkling-Small був набагато більш звичним 😆 Ми просто взяли конвеєр, використаний для Inkling, передали йому меншу модель, і вуаля – нова модель! Inkling Small отримала значну користь порівняно з Inkling від деяких незначних покращень, але в резерві ще так багато можливостей…”
Цей коментар свідчить про те, що компанія більше не розглядає кожну модель як окремий дослідницький проєкт. Натомість вона створює багаторазовий конвеєр для попереднього тренування, пост-тренування, навчання з підкріпленням, оцінки та випуску.
Thinking Machines повідомляє, що Inkling-Small отримала переваги завдяки покращеному набору даних для попереднього тренування, змінам у рецептурі машинного навчання та дистиляції за правилами за допомогою Inkling як вчителя. Потім команда продовжила двотижневе навчання з підкріпленням для агентивного кодування.
Міра Мураті наголосила на тому ж самому пункті у своєму дописі, описуючи Inkling-Small як порівнянну з Inkling при чверті розміру та підкреслюючи, що вагові коефіцієнти були відкритими та одразу ж доступними для доналаштування на Tinker.
Як підприємства та розробники ШІ повинні ставитися до Inkling Small
Компанія також розповсюджує повні контрольні точки BF16 та NVFP4 і підтримує розгортання через SGLang, vLLM, TokenSpeed, Unsloth та інструментарій Hugging Face.
Ця комбінація надає розробникам кілька шляхів розгортання: використання API, доналаштування через Tinker, покладання на стороннього провайдера інференсу або експлуатація моделі на приватній інфраструктурі.
Inkling-Small – це не модель, яку більшість користувачів завантажуватиме та запускатиме локально. Але для бізнесів, які обирають між дуже великою флагманською моделлю та більш керованою системою з відкритими ваговими коефіцієнтами, вона пропонує переконливий компроміс: майже такий самий виміряний інтелект, кращі результати за кількома завданнями кодування та міркування, нижчу ціну за токен, менший апаратний слід та ліцензію, яка дозволяє широку комерційну розробку.
Ширший сигнал може бути ще важливішим. Thinking Machines показує, що Inkling не була одноразовим випуском. Компанія вже оптимізує своє сімейство моделей, вдосконалює свій конвеєр навчання і рухається до темпу, коли мультимодальні системи з відкритими ваговими коефіцієнтами можуть випускатися, покращуватися та розгортатися більш регулярно.
Оригінал статті: venturebeat.com
