Qwen3.8-27B: потужні ШІ-агенти для кодування та міркувань працюють локально

Qwen3.8-27B: потужні ШІ-агенти для кодування та міркувань працюють локально 2

Найбільший реліз моделі штучного інтелекту за останні кілька днів, принаймні серед розробників та ентузіастів ШІ в соціальних мережах, — це не передова хмарна модель від OpenAI, Anthropic чи Google.

Це 27-мільярдна модель від Alibaba: Qwen3.8-27B з’явилася на Hugging Face у п’ятницю під ліцензією Apache 2.0, що є дружньою до підприємств та відкритою, надаючи розробникам завантажувані ваги для щільної мультимодальної моделі.

Але Qwen3.8-27B — це не звичайна невелика локальна модель: вона включає нативне розуміння зображень та відео, вікно контексту на 262 144 токени, конфігуроване мислення та підтримку кодування і агентних робочих процесів — «компактна, зручна для розгортання» версія можливостей, розроблених для її покоління Qwen3.8.

Такий незвично малий розмір апаратного забезпечення є значною частиною привабливості Qwen3.8-27B. Запуск моделі з повною 16-бітною точністю вимагає приблизно 56 ГБ пам’яті GPU, тоді як версія FP8 потребує близько 28 ГБ. Але 4-бітна квантизація скорочує саму модель приблизно до 17 ГБ, що робить її доступною для потужних споживчих машин, таких як високопродуктивні ігрові настільні комп’ютери або добре оснащені ноутбуки.

Знаходимо ідеальний баланс між можливостями та розміром

Надмірна реакція серед розробників зумовлена динамічним поєднанням її можливостей та розміру.

Власні бенчмарки Alibaba, опубліковані під час запуску, одразу ж викликали першу хвилю захоплення. Компанія повідомила 61,7 бала на SWE-bench Pro, 90,3 на LiveCodeBench v6, 70,7 на своєму бенчмарку офісної роботи CoWorkBench та 84,3 на OSWorld-Verified.

У опублікованій Alibaba порівняльній таблиці 27B модель навіть перевершує зазначений результат Claude Opus 4.6 Max на SWE-bench Pro та LiveCodeBench, хоча Opus залишається попереду на Terminal-Bench, GPQA Diamond та Humanity’s Last Exam.

Деякі з оцінок Alibaba є внутрішніми, а набори для бенчмаркінгу не ідентичні в кожному порівнянні, тому ці цифри є поганою основою для оголошення універсального переможця.

Сторонні результати показують потужну локальну модель з продуктивністю, еквівалентною пропрієтарним моделям місячної давності

Розмови змінилися в понеділок, коли почали надходити сторонні результати.

Стороння організація з бенчмаркінгу ШІ Artificial Analysis надала Qwen3.8-27B оцінку 52 за своїм Індексом Інтелекту, що є сукупністю дев’яти оцінок, які охоплюють кодування, науку, мислення та професійні завдання. Це випадково та ж оцінка, яку Artificial Analysis наразі присвоює найнижчій моделі OpenAI GPT-5.6 Luna в її максимальному режимі мислення — пропрієтарному рішенні, доступному лише через хмару.

Як зазначив агент з відкритим кодом Cline в X: «Це перший випадок, коли локальна модель досягла рівня передової моделі. Ми не очікували такого темпу локального прогресу так скоро».

У Індексі Агентності Artificial Analysis, що вимірює продуктивність моделі в агентних завданнях, Qwen3.8-27B отримала 51 бал, випередивши Claude Opus 4.8 на максимальному зусиллі мислення — передову модель, яку Anthropic випустив менше трьох місяців тому.

Це не означає, що ці моделі еквівалентні, але це допомагає пояснити, чому розробники та ентузіасти ШІ звернули увагу. Як написав розробник та подкастер/ютубер з ШІ Sero (@0xSero в X, справжнє ім’я Шеріф Черф) в X: «Модель, що працює на обладнанні за 3 тис. доларів, перевершує все, що було 4 місяці тому. Включно з Opus. Постійний нижчий клас скасовано».

Розробник Джошуа «Xenova» Лохнер, відомий тим, що впроваджує моделі машинного навчання в веб-браузери, у понеділок висвітлив цей результат у X поряд з експериментом запуску Qwen3.8-27B з кастомними ядрами WebGPU. Його реакція — «Який чудовий час жити!» — передає значну частину настрою: модель, що отримує оцінку, близьку до пропрієтарних передових систем, можна завантажити, модифікувати та запускати локально, замість того, щоб отримувати доступ лише через API постачальника.

Привабливість стає зрозумілішою, коли модель стискається. Розробник та письменник з ШІ Саймон Віллісон протестував приблизно 17 ГБ квантизації Q4_K_M на MacBook Pro M5 Max та Nvidia DGX Spark.

Він виявив, що вона може писати код, інтерпретувати зображення та керувати циклом кодування-агента через фреймворк агента Pi. В одному експерименті модель навігувала кодовою базою, щоб пояснити, як працює автентифікація; в іншому — написала та протестувала Python-утиліту, яка була потрібна Віллісону для перетворення транскрипції агента з JSONL на Markdown.

«Той факт, що файл розміром 17 ГБ може робити все це на моїх домашніх машинах, — це диво», — написав Віллісон. Його ширший висновок резонує з досвідченими користувачами: можливості, які нещодавно здавалися невіддільними від дорогих хмарних моделей, переходять у файли, достатньо малі, щоб зберігати їх на робочій станції.

Реакція також проявляється у використанні. Cybernews повідомив у понеділок, що Qwen3.8-27B набрала 3 мільйони завантажень на Hugging Face за перші три дні, тоді як квантовані версії швидко з’явилися для інструментів локального виведення.

Спільнота LocalLLaMA на Reddit створила спеціальну тему для консолідації потоку бенчмарків, квантизацій, порад щодо конфігурації та порівнянь. Один користувач, демонструючи локально згенеровану гру, описав модель як «іншого звіра».

Надмірне обмірковування є проблемою

Ця метушня супроводжується важливою застереженням: Qwen3.8-27B, здається, досягає своєї якості, багато думаючи.

Artificial Analysis стверджує, що модель згенерувала 160 мільйонів вихідних токенів під час тестування Індексу Інтелекту, порівняно з медіаною 43 мільйонів для порівнянних відкритих моделей.

Віллісон зіткнувся з екстремальною версією такої ж поведінки, оскільки Qwen за замовчуванням використовує високий режим мислення. Запит на створення SVG пелікана, що їде на велосипеді, зайняв 21 хвилину і спожив понад 22 000 токенів мислення перед тим, як дати відповідь. Він рекомендує починати з низького або нульового рівня мислення для звичайного локального використання.

Інвестор і розробник Томаш Тунгуз виявив подібний компроміс у невеликому тесті з дев’яти завдань проти DeepSeek V4 Flash: з увімкненим мисленням Qwen випередив за якістю у його агентному стеку, але він повідомив, що він був приблизно у 30 разів повільніший і у 4,5 рази дорожчий. Він явно застеріг, що дев’ять завдань недостатньо для остаточного вердикту.

Програмне забезпечення для виведення може зменшити цей розрив. Qwen3.8-27B включає Multi-Token Prediction (MTP), і Віллісон повідомив про приблизно 72% покращення продуктивності на своєму DGX Spark після увімкнення MTP через llama.cpp порівняно з його стандартною конфігурацією LM Studio.

Навіть тоді його звичайні запуски LM Studio генерували лише близько 15-30 токенів на секунду — значно нижче чутливості багатьох хмарних моделей.

Саме ця напруга робить Qwen3.8-27B важливішою, ніж чергове місце в рейтингу.

Що підприємства повинні зрозуміти з Qwen3.8-27B

Для підприємств відповідним порівнянням є не просто те, чи «перевершує» 27B модель Claude чи GPT за бенчмарком. Це питання, чи може модель, достатньо мала, щоб працювати всередині власної інфраструктури організації, виконувати достатньо роботи з кодування, аналізу документів, обробки зображень та роботи агентів, щоб замінити виклики API для значних класів завдань.

Це припущення змінює розрахунки конфіденційності, розгортання та витрат. Ваги Apache 2.0 можна перевіряти, модифікувати та розміщувати під власним контролем компанії, тоді як Alibaba вже документує сумісність з фреймворками обслуговування, включаючи vLLM, SGLang та TokenSpeed. Alibaba повідомляє, що пізніше з’явиться керована версія Qwen Cloud з контекстом за замовчуванням на 1 мільйон токенів та вбудованими інструментами.

Невеликий розмір та доступні вимоги до обладнання означають, що підприємства, незалежні розробники та навіть допитливі споживачі можуть легко розгортати модель локально, не турбуючись про те, що їхні дані залишаться поза межами їхньої машини — забезпечуючи більшу конфіденційність, безпеку інформації, управління та контроль.

Є ширша причина, чому досвідчені користувачі звертають увагу. Дані Hugging Face, повідомлені Business Insider цього тижня, показують, що фактичне використання моделей значно зміщується в бік менших моделей, навіть коли величезні передові релізи домінують у заголовках; моделі понад 70 мільярдів параметрів становили лише невелику частку завантажень 2026 року.

Стратегія Alibaba з публікації моделей Qwen у різних практичних розмірах допомогла зробити сімейство постійною частиною робочих процесів локального розгортання розробників.

Qwen3.8-27B розширює цю логіку. Її результати бенчмарків ще потребують незалежної перевірки, її стандартна поведінка мислення може бути болісно неефективною, і жодний окремий рейтинг не встановлює паритету з передовими моделями.

Але через три дні після випуску розробники вже реагують не в першу чергу на таблицю бенчмарків Alibaba. Вони реагують на досвід розміщення порівняно невеликого файлу на контрольованому ними обладнанні та спостереження за тим, як він виконує завдання, які ще недавно здавалися приналежними виключно найбільшим пропрієтарним системам.

Для певних розробників, ентузіастів ШІ — і, так, навіть для корпоративних розгортань — це і є найважливіший бенчмарк.

Джерело новини: venturebeat.com

Поділитися новиною:TelegramViberFacebook
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *