Qwen3.8-Max кидає виклик GPT-5.6 Sol Max та Fable 5 у використанні ШІ-агентів

Qwen3.8-Max кидає виклик GPT-5.6 Sol Max та Fable 5 у використанні ШІ-агентів 3

Команда розробників штучного інтелекту Qwen від китайського гіганта електронної комерції та хмарних технологій Alibaba минулої ночі представила Qwen3.8-Max — нову флагманську мультимодальну велику мовну модель (LLM) на 2.4 трильйона параметрів, яка працює за архітектурою “суміш експертів” (MoE). Вона націлена на один із найконкурентніших сегментів ринку передових ШІ-систем: автономну розробку програмного забезпечення та довгострокові корпоративні завдання.

Якщо опубліковані компанією бенчмарки підтвердяться під час ширших незалежних випробувань, Qwen3.8-Max не просто конкуруватиме з провідними пропрієтарними моделями сьогодення, а й перевершить декілька з них за ключовими показниками в галузі агентних обчислень.

Найбільш примітно, що Qwen повідомляє, ніби Qwen3.8-Max набрала 86.1 бала за бенчмарком OSWorld-Verified, який вимірює здатність агентів використовувати операційну систему та програми на ній. Це вище, ніж у GPT-5.6 Sol Max (83.2) та Fable 5 (85.0).

Модель також показала найвищий результат у PaperBench — бенчмарку від OpenAI, який оцінює, наскільки добре агенти можуть відтворювати наукові дослідження на основі експериментальних даних. Крім того, вона посіла провідні позиції або залишилася конкурентоспроможною в тестах з розробки програмного забезпечення, відтворення досліджень, мультимодального мислення та розробки веб-сайтів з візуальним інтерфейсом.

Випуск моделі також сигналізує про потенційно значний стратегічний зсув для Alibaba: компанія заявила, що наступного тижня будуть випущені відкриті ваги для Qwen3.8-Max, а також для Qwen3.8-27B.

Якщо це станеться під дозвільною ліцензією, це буде вперше, коли модель класу Max від Qwen стане доступною для самостійного розгортання. Такий крок може суттєво змінити підходи до корпоративного використання.

Однак залишається важливий нюанс: Alibaba ще не розкрила умови ліцензування, залишаючи можливість, що випуск буде використовувати більш обмежувальну власну ліцензію, як це сталося нещодавно з відкритою моделлю Kimi K3 від китайського конкурента Moonshot, а не загальнодоступну, як Apache 2.0.

Інше визначення “передовий”

Минулого року конкурентний ландшафт базових моделей ставав дедалі більш спеціалізованим.

OpenAI значною мірою зосередила свою серію GPT на загальному мисленні, мультимодальній взаємодії та корпоративній продуктивності.

Серія Claude від Anthropic робила акцент на кодуванні та надійному довготривалому мисленні.

Google продовжує просувати Gemini до мультимодальної продуктивності та веб-орієнтованих робочих процесів.

Kimi K3 від Moonshot AI нещодавно увійшла до дискусії, поєднуючи передову продуктивність з випуском відкритих ваг.

Qwen3.8-Max намагається об’єднати багато з цих сильних сторін в одній моделі, націленій виключно на корпоративну автоматизацію.

Замість акценту на розмовний інтелект, Alibaba позиціонує модель як автономного колегу, здатного виконувати проєкти, що тривають дні, а не хвилини.

За даними компанії, Qwen3.8-Max може самостійно завершувати проєкти з розробки програмного забезпечення, що тривають понад 10 днів, відтворювати наукові статті, що містять тисячі рядків коду, виконувати ітераційну оптимізацію дизайну мікросхем та постійно коригувати плани, використовуючи мультимодальні петлі зворотного зв’язку.

Ці демонстрації залишаються створеними компанією і ще не були широко відтворені незалежними оцінювачами. Тим не менш, вони ілюструють зростаючу тенденцію в галузі: передові моделі все частіше конкурують своєю здатністю завершувати цілі робочі процеси, а не відповідати на окремі запити.

Бенчмарки дедалі більше винагороджують автономне виконання

Набір бенчмарків, випущений разом із Qwen3.8-Max, відображає цей зсув.

Замість того, щоб зосереджуватися виключно на традиційних тестах на мислення чи завданнях з кодування, багато виділених оцінок вимірюють довготривале виконання.

У OSWorld-Verified, який оцінює агентів, що взаємодіють з комп’ютерними середовищами, Qwen3.8-Max демонструє результат 86.1, випереджаючи GPT-5.6 Sol Max (83.2), Fable 5 (85.0) та Gemini 3.1 Pro (76.2).

Qwen3.8-Max кидає виклик GPT-5.6 Sol Max та Fable 5 у використанні ШІ-агентів 4

Модель також лідирує за показниками:

  • PaperBench: 93.0

  • TerminalBench 2.1: 86.6

  • Vision2Web: 69.0

  • LVBench: 81.8

  • ERQA: 77.8

В інших категоріях вона залишається конкурентоспроможною з провідними пропрієтарними рішеннями, хоча й відстає в деяких.

Наприклад, у бенчмарку професійної розробки програмного забезпечення SWE-Pro модель OpenAI демонструє найвищий результат, тоді як Opus 4.8 продовжує лідирувати за певними показниками розробки програмного забезпечення та в тесті Agents’ Last Exam.

Замість того, щоб домінувати в усіх бенчмарках, Qwen, схоже, пропонує один із найширших збалансованих профілів продуктивності, доступних наразі.

Цей баланс може виявитися більш важливим для корпоративних покупців, ніж окремі перемоги в бенчмарках.

Багато організацій все частіше оцінюють моделі за їхньою здатністю надійно виконувати неоднорідні робочі процеси — написання коду, читання документів, навігація по інтерфейсах, генерація звітів, аналіз зображень та координація кількох підзавдань — замість оптимізації однієї вузької можливості.

Де Qwen3.8-Max виглядає найсильнішою

Якщо припустити, що опубліковані результати Alibaba знайдуть своє відображення в реальних розгортаннях, кілька корпоративних завдань виділяються як особливо добре придатні для Qwen3.8-Max.

1. Довгострокова розробка програмного забезпечення

Основна демонстрація Alibaba включає автономну розробку програмного забезпечення, що триває понад десять днів.

Хоча підприємствам слід ставитися до цих демонстрацій як до заяв постачальника до незалежного відтворення, вони відповідають зростаючому інтересу до постійних агентів для кодування, які працюють безперервно, а не в інтерактивному режимі.

Організації, які експериментують з автономними командами розробників, автоматизацією CI/CD, обслуговуванням репозиторіїв, регресійним тестуванням або впровадженням нових функцій, можуть знайти Qwen особливо привабливою, якщо її агентська продуктивність виявиться стабільною поза лабораторними умовами.

2. Агенти для роботи з комп’ютером

Найсильнішою відмінністю може стати можливість роботи з комп’ютером.

OSWorld швидко став одним із найбільш уважно відстежуваних бенчмарків у галузі, оскільки він вимірює здатність моделі взаємодіяти з операційними системами, а не просто генерувати текст.

Моделі, здатні надійно працювати з настільним програмним забезпеченням, можуть автоматизувати незліченну кількість повторюваних бізнес-процесів, включаючи обробку документів, інтеграцію корпоративного програмного забезпечення, внутрішні операції та застарілі робочі процеси, де можуть бути відсутні API.

Лідерство в OSWorld, отже, може трансформуватися в реальні операційні переваги, якщо продуктивність на бенчмарках пошириться на робочі середовища.

3. Автоматизація досліджень

Лідерство Qwen у PaperBench свідчить про значний потенціал для організацій, які займаються науковими обчисленнями, оглядом літератури, відтворенням експериментів та технічним аналізом.

Науково-дослідні установи, фармацевтичні компанії та команди промислових R&D все частіше використовують LLM не тільки для узагальнення, а й для виконання відтворюваних обчислювальних робочих процесів. Моделі, здатні підтримувати контекст протягом тривалих сесій, стають дедалі ціннішими в таких середовищах.

4. Мультимодальні промислові робочі процеси

На відміну від попередніх мультимодальних систем, які переважно аналізували завантажені зображення, Qwen описує візуальне сприйняття як безперервний механізм зворотного зв’язку, інтегрований у планування та виконання.

Така архітектура може бути особливо корисною у виробництві, логістиці, промислових інспекціях та аналізі дизайну, де візуальні дані постійно інформують операційні рішення, а не служать окремими запитами.

Економіка може виявитися такою ж важливою

Мабуть, найбільший конкурентний тиск створюють не показники бенчмарків, а ціни через програмний інтерфейс (API) Qwen на QwenCloud (розташованому в Китаї):

Qwen3.8-Max коштує 2 долари за мільйон вхідних токенів і 6 доларів за мільйон вихідних токенів. Це модель середньої ціни, але вона значно дешевша за провідні американські пропрієтарні пропозиції, з якими вона порівнюється за бенчмарками. Ціна менша, ніж 1/3 від комбінованої ціни Claude Opus 5 (вхідні + вихідні) і менша, ніж 1/4 від ціни GPT-5.6 Sol Max.

Модель

Вхідні ($/1M)

Вихідні ($/1M)

Загалом ($/1M)

Джерело

MiMo-V2.5 Flash

$0.10

$0.30

$0.40

Xiaomi

deepseek-v4-flash

$0.14

$0.28

$0.42

DeepSeek

deepseek-v4-pro

$0.435

$0.87

$1.305

DeepSeek

GPT-5.6 Luna

$0.20

$1.20

$1.40

OpenAI

MiniMax-M3

$0.30

$1.20

$1.50

MiniMax

LongCat-2.0 — тимчасова акція

$0.30

$1.20

$1.50

LongCat

Gemini 3.1 Flash-Lite

$0.25

$1.50

$1.75

Google

Qwen3.7-Plus

$0.40

$1.60

$2.00

Alibaba Cloud

MiMo-V2.5

$0.40

$2.00

$2.40

Xiaomi

Gemini 3.5 Flash-Lite

$0.30

$2.50

$2.80

Google

LongCat-2.0 — стандарт

$0.75

$2.95

$3.70

LongCat

MiMo-V2.5 Pro (≤256K)

$1.00

$3.00

$4.00

Xiaomi

GLM-5.2

$1.40

$4.40

$5.80

Z.ai

Grok 4.5

$2.00

$6.00

$8.00

xAI

MiMo-V2.5 Pro (>256K)

$2.00

$6.00

$8.00

Xiaomi

Qwen3.8-Max

$2.00

$6.00

$8.00

QwenCloud

Gemini 3.6 Flash

$1.50

$7.50

$9.00

Google

Qwen3.7-Max

$2.50

$7.50

$10.00

Alibaba Cloud

Gemini 3.5 Flash

$1.50

$9.00

$10.50

Google

Gemini 3.1 Pro Preview (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.6 Terra

$2.00

$12.00

$14.00

OpenAI

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Kimi K3

$3.00

$15.00

$18.00

Moonshot AI

Gemini 3.1 Pro Preview (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 5

$5.00

$25.00

$30.00

Anthropic

GPT-5.5

$5.00

$30.00

$35.00

OpenAI

GPT-5.5 Instant (chat-latest)

$5.00

$30.00

$35.00

OpenAI

Sakana Fugu Ultra (≤272K)

$5.00

$30.00

$35.00

Sakana AI

GPT-5.6 Sol — Standard mode

$5.00

$30.00

$35.00

OpenAI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

GPT-5.6 Sol — Fast mode

$10.00

$60.00

$70.00

OpenAI

Нижчі витрати на виведення інформації стають дедалі важливішими, оскільки агентні системи споживають значно більше токенів, ніж звичайні чат-боти. Це, ймовірно, врахувалося в рішенні OpenAI минулого тижня знизити ціни на API для своїх моделей середнього та нижнього рівня GPT-5.6 (Terra та Luna) на 20% та 80% відповідно.

Дійсно, як можуть підтвердити ті, хто використовує ці системи, автономні робочі процеси тривалістю в кілька годин, ітеративне планування та безперервне самокоригування можуть генерувати мільйони токенів під час виконання одного завдання.

Для підприємств, які розгортають сотні або тисячі агентів одночасно, витрати на виведення інформації часто стають одними з найбільших операційних витрат. Невеликі зниження ціни за токен, отже, швидко накопичуються.

Як вона порівнюється з американськими передовими моделями

Незважаючи на порівняння показників у бенчмарках, Qwen3.8-Max не слід розглядати як повну заміну провідних американських моделей.

Натомість її сильні сторони вказують на різні стратегії розгортання.

Сімейство GPT від OpenAI продовжує відмінно працювати як універсальна корпоративна платформа для мислення з розвиненими інструментами, інтеграцією в екосистеми та широким комерційним розгортанням. Організації, які вже інвестували в екосистеми Microsoft або корпоративні пропозиції OpenAI, можуть продовжувати цінувати ці операційні переваги, навіть якщо Qwen лідирує за окремими агентськими бенчмарками.

Claude Opus від Anthropic залишається широко визнаним одним із найпотужніших помічників з кодування, особливо для ретельної розробки програмного забезпечення та довготривалого мислення. Деякі підприємства можуть все ще віддавати перевагу Claude для розробки з участю людини, де надійність та передбачувана поведінка переважають над сирою автономією.

Google Gemini продовжує диференціюватися завдяки глибокій інтеграції з Workspace, мультимодальним можливостям та сервісам Google Cloud, що робить його привабливим для організацій, які вже стандартизувалися на корпоративному стеку Google.

Qwen виглядає найбільш переконливою для підприємств, які надають пріоритет автономному виконанню, розширеним горизонтам планування та сприятливій економіці виведення інформації без шкоди для передової продуктивності.

Питання відкритих ваг залишається невирішеним

Найбільша невідомість навколо Qwen3.8-Max мало пов’язана з бенчмарками.

Alibaba заявляє, що відкриті ваги з’являться наступного тижня. Однак ні в оголошенні, ні в наданій документації не вказано ліцензію, яка регулюватиме ці ваги.

Ця відмінність може виявитися вирішальною.

Дозвільна ліцензія, така як Apache 2.0, значно розширила б корпоративне використання, дозволивши організаціям самостійно розгортати, доналаштовувати та інтегрувати модель у пропрієтарні продукти з відносно невеликими обмеженнями.

Власна ліцензія — подібна до підходів, використаних у кількох останніх релізах передових моделей — може накласти обмеження на комерційне розгортання, перерозподіл, сферу використання або модифікацію моделі. Такі обмеження зменшили б привабливість для підприємств, які шукають довгострокові інвестиції в інфраструктуру, незалежно від технічної продуктивності моделі.

Нещодавній випуск Kimi K3 від Moonshot AI ілюструє, чому ця відмінність має значення. Хоча Kimi K3 зробила свої ваги загальнодоступними для всіх, умови її ліцензування включали конкретні пункти, зокрема вимогу щодо розкриття інформації та комерційної ліцензії для тих, хто пропонує її як “Модель як послугу”.

Доки Alibaba не опублікує ліцензію Qwen3.8-Max, організації, які розглядають можливість самостійного розгортання, повинні ставитися до оголошення про відкриті ваги як до перспективного, але незавершеного.

Дедалі більш переповнений фронт

Qwen3.8-Max з’являється в один із найшвидших періодів в історії базових моделей.

Протягом тижнів розробники стали свідками значних випусків від Moonshot AI, OpenAI, Anthropic та інших, кожен з яких підкреслював різні сильні сторони: мислення, кодування, мультимодальність, автономні агенти чи економіка.

Внесок Alibaba є помітним, оскільки він поєднує конкурентну продуктивність на бенчмарках, агресивне ціноутворення, вікно контексту на мільйон токенів та заявлену відданість випуску ваг для своєї флагманської моделі.

Чи стане вона кращою платформою для корпоративних автономних агентів, зрештою, залежатиме менше від позицій у таблицях лідерів, ніж від ширшої незалежної валідації, надійності в робочому середовищі та умов ліцензування, що супроводжують майбутній випуск ваг.

Ці фактори — а не лише графіки бенчмарків — визначатимуть, чи стане Qwen3.8-Max справжньою альтернативою провідним американським пропрієтарним моделям, чи просто ще одним вражаючим учасником в дедалі більш насиченій гонці передових ШІ.

Дізнатися більше на: venturebeat.com

Поділитися новиною:TelegramViberFacebook
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *