GLM-5.3: Новий ШІ вже знаходить серйозні вразливості в Cursor

Китайський стартап Z.ai, відомий у світі завдяки зростаючій лінійці потужних, переважно відкритих мовних моделей серії GLM, сьогодні представив GLM-5.3. Нова версія демонструє значні успіхи в роботі з довгими кодовими послідовностями та помітний — і потенційно чутливий — стрибок у можливостях кібербезпеки.
За словами представника Z.ai Лу, вже виявлено «потенційно серйозну вразливість у Cursor», стартапі зі штучного інтелекту для кодування, нещодавно придбаному SpaceX. VentureBeat також звернувся до Cursor для підтвердження цієї інформації через X і очікує відповіді.
GLM-5.3 наразі доступна *лише* в рамках плану GLM Coding Plan та середовища кодування ZCode. Доступ до API та відкриті ваги будуть надані пізніше, «після завершення оцінки безпеки та зміцнення захисту», — повідомили в компанії.
Z.ai планує випустити ваги приблизно через два тижні після запуску.
Для розробників корпоративного рівня ключовим аспектом випуску є не просто чергове покращення показників у бенчмарках. Z.ai стверджує, що GLM-5.3 використовує ту саму базову модель, що й GLM-5.2, а покращення досягнуті виключно завдяки масштабуванню пост-тренування на більшій кількості середовищ, різноманітніших завдань та додаткових обчислювальних ресурсів для навчання з підкріпленням.
Це робить GLM-5.3 своєрідним тестом того, наскільки далеко можна розтягнути базову модель передового рівня без нового дорогого циклу попереднього навчання.
«Ми зробили лише масштабування пост-тренування для GLM-5.3», — зазначено в технічному анонсі Z.ai.
Результати свідчать про значний потенціал. Однак вони також створили незвичайну проблему для розробника відкритих моделей: за даними Z.ai, можливості кібербезпеки розвивалися швидше, ніж очікувалося, під час масштабування навчання, особливо коли завдання переходили від ідентифікації вразливостей до створення повних ланцюжків експлуатації.
Reuters повідомило в п’ятницю, що Z.ai також впроваджує засоби контролю для деяких передових можливостей моделі, зокрема підхід «довіреного доступу» для чутливих функцій.
Значний стрибок у кодуванні без нової базової моделі
GLM-5.3 базується на базовій моделі масштабу 743 мільярди параметрів, що стоїть за GLM-5.2, а не замінює її. Натомість Z.ai розширив систему пост-тренування, яку вже мав, навколо навчання з підкріпленням для довгих послідовностей.
Ці середовища все більше нагадують повні інженерні завдання, а не ізольовані вправи з програмування.
Z.ai описує сценарії, в яких агент отримує доступ до кодових баз, документації, обчислювальних кластерів, систем зберігання даних та експериментальних результатів, а потім повинен діагностувати проблеми, модифікувати системи, проводити експерименти та демонструвати вимірне покращення, зберігаючи при цьому правильність. Деякі завдання розроблені так, щоб наблизитись до кількох днів роботи досвідченого інженера.
Такий підхід призвів до значних покращень від версії до версії у звітах Z.ai.
GLM-5.3 стрибнула з 4.6 до 28.3 за Terminal-Bench 3.0, з 46.2 до 66.9 за DeepSWE v1.1, та з 26.2 до 48.2 за AutomationBench. На Agents’ Last Exam CLI показник покращився з 23.8 до 28.5.
Модель не домінує над усіма конкурентами. Таблиця бенчмарків Z.ai показує GPT-5.6 Sol на рівні 34.6, а Claude Fable 5 — 33.7 за Terminal-Bench 3.0, порівняно з 28.3 у GLM-5.3. На DeepSWE v1.1 GLM-5.3 набирає 66.9 балів, порівняно з 72.7 для GPT-5.6 Sol та 69.7 для Fable 5.
Проте Z.ai також наголошує на ефективності, а не лише на позиції в рейтингу.
На власному приватному бенчмарку Z.ai Code Bench, GLM-5.3 досягає 34.5% результату в режимі максимального міркування, споживаючи приблизно 75 000 токенів виводу за завдання. GLM-5.2 досягає 23.4%, споживаючи близько 96 000. У режимі високих зусиль GLM-5.3 досягає 31.4%, споживаючи приблизно 50 000 токенів виводу, порівняно з 29.5%, як повідомляє Z.ai, для Claude Opus 4.8, що використовує 120 000.
Оскільки Code Bench є власною приватною оцінкою Z.ai, ці порівняння слід розглядати як результати, надані компанією, а не як незалежні вимірювання. Тим не менш, зменшення споживання токенів при покращенні виконання завдань є операційно важливим для підприємств, що впроваджують кодувальні агенти, де тривалі цикли можуть швидко збільшувати вартість та затримку виводу.
Можливості кібербезпеки розвинулися швидше, ніж очікувало Z.ai
Більш незвичайною подією стала кібербезпека.
Z.ai включив середовища для виявлення вразливостей до набору завдань пост-тренування GLM-5.3, очікуючи, що модель покращиться у пошуку програмних помилок. Натомість компанія стверджує, що можливості почали розвиватися далі по ланцюжку експлуатації.
«Зі збільшенням масштабу пост-тренування, можливості кібербезпеки розвивалися швидше, ніж ми очікували», — написали в Z.ai.

На CyberGym, який тестує виявлення та валідацію вразливостей на вихідному коді, GLM-5.3 набирає 84.5%, порівняно з 77.2% у GLM-5.2. Це також перевершує показники GPT-5.6 Sol (83.6%) та Mythos 5 (83.8%), надані Z.ai.
Перевага не поширюється на весь стек експлуатації. GLM-5.3 набирає 54.4% на ExploitBench, що більш ніж удвічі перевищує 24.4% у GLM-5.2, але все ще значно відстає від 76.5%, заявлених Z.ai для GPT-5.6 Sol, та 78% для Mythos 5.
Аналогічно, на ExploitGym, GLM-5.3 виконує 105 завдань за нормалізованого бюджету в дві години та 130 — за шість годин, порівняно з 29 та 39 для GLM-5.2. Fable 5 досягає 181 та 247, тоді як GPT-5.6 Sol — 216 та 293.
Напрямок розвитку може бути важливішим за позицію в рейтингу.
Z.ai стверджує, що робота з командами безпеки в Китаї призвела до 2 436 знайдених вразливостей у 269 проєктах після експертного огляду, відбору та дедуплікації. У реєстрі розкриттів зазначено 1 097 як критичні або високої серйозності, з 53 публічно розкритими та 2 383, що залишаються під ембарго на момент випуску.
Це створює напругу, з якою все частіше стикаються постачальники передових моделей: ті самі можливості агентів для довгих послідовностей, які роблять моделі кориснішими для програмної інженерії, також можуть зробити їх більш кваліфікованими дослідниками безпеки — і потенційно більш ефективними противниками.
GLM-5.3 також вимагає від розробників зміни способу виклику моделі
Розробникам, які мігрують існуючі застосунки GLM, слід звернути увагу на зміну поведінки API.
GLM-5.3 підтримує три рівні міркувань — низький, високий та максимальний, причому максимальний є типовим і рекомендованим Z.ai для кодування. Але, на відміну від попередніх версій, вимкнення міркувань неможливе.
Застосунки, які зараз надсилають `thinking.type: “disabled”`, повинні змінити значення на `enabled` і вказати рівень міркувань перед перемиканням ідентифікатора моделі на GLM-5.3. В іншому випадку, як стверджує Z.ai, запит буде неуспішним.
Це робить GLM-5.3 реальною міграцією, а не просто заміною назви моделі для деяких виробничих застосунків.
Від GLM-4.5 до GLM-5.3: стрімкий рух Z.ai до інженерії на основі агентів
GLM-5.3 — це останній крок у швидкій трансформації Z.ai (раніше відомої як Zhipu AI) у напрямку кодувальних агентів та довготривалих автономних інженерних завдань.
GLM-4.5, випущена в липні 2025 року, значною мірою визначила цей напрямок. Модель типу «суміш експертів» з 355 мільярдами параметрів була розроблена для поєднання міркувань, кодування та можливостей агентів, тоді як менша GLM-4.5-Air мала 106 мільярдів загальних параметрів. Z.ai випустив моделі з відкритими вагами та наголосив на інтеграції з фреймворками для агентів.
GLM-4.6, що вийшла у вересні, розширила контекст зі 128 000 до 200 000 токенів і була спрямована на кодування, використання інструментів та робочі процеси агентів у таких середовищах, як Claude Code, Cline, Roo Code та Kilo Code. Z.ai також почала приділяти більше уваги ефективності токенів у реальних оцінках кодування, а не лише продуктивності в бенчмарках.
Більш архітектурний стрибок відбувся з GLM-5 у лютому 2026 року. Z.ai масштабував модель з 355 мільярдів параметрів GLM-4.5 до 744 мільярдів, з 40 мільярдами активних параметрів, і збільшив обсяг даних попереднього навчання до 28.5 трильйонів токенів. Також було впроваджено інфраструктуру асинхронного навчання з підкріпленням «slime» та чітко перепозиціоновано сімейство GLM навколо «інженерії на основі агентів» та завдань з довгим горизонтом.
До червня GLM-5.2 перетворила цю стратегію на більш пряму пропозицію для підприємств. Модель з 753 мільярдами параметрів отримала стабільне вікно контексту на 1 мільйон токенів, відкриті ваги під ліцензією MIT та підтримку понад 20 середовищ кодування. Також було представлено IndexShare, який повторно використовує індексатор у шарах розрідженої уваги для зменшення обчислювального навантаження дуже довгих контекстів.
GLM-5.2 коштувала $1.40 за мільйон вхідних токенів API та $4.40 за мільйон вихідних токенів, причому кешований вхід був значно дешевшим, що позиціонувало Z.ai як технічного та цінового конкурента для пропрієтарних передових лабораторій.
Амбіції Z.ai розширюються і за межі розробки моделей. Reuters повідомило минулого місяця, що Zhipu AI залучила близько 31.4 мільярда гонконгських доларів, або приблизно 4 мільярди доларів, через продаж акцій у Гонконгу. Кошти призначені для таких сфер, як дослідження та розробки, обчислювальна інфраструктура, таланти та розширення бізнесу.
Загалом, випуски демонструють послідовний прогрес: GLM-4.5 об’єднала міркування, кодування та агентів; GLM-5 суттєво масштабувала базову модель; GLM-5.2 зосередилася на довгому контексті та довгостроковій інженерії; а GLM-5.3 тепер намагається витягти значно більше можливостей з тієї самої основи шляхом пост-тренування.
Ціни, ZCode та доступність
GLM-5.3 доступна вже зараз через GLM Coding Plan від Z.ai та ZCode.
ZCode — це власне середовище кодувального агента компанії, яке підтримує довготривалі завдання «Goal», що планують, реалізують, тестують і перевіряють роботу. Воно також пропонує дистанційне керування запущеними завданнями та доступне на macOS, Windows та Linux.
Індивідуальні плани GLM Coding Plan наразі починаються з промоційної ціни 12.60 доларів США на місяць за тариф Lite з 10 000 кредитами на тиждень. Pro коштує 56 доларів США на місяць з шестиразовим використанням Lite, тоді як Max — 117.60 доларів США на місяць з чотирнадцятиразовим використанням Lite. Місця Team Standard та Premium коштують 88 та 188 доларів США на користувача на місяць відповідно.
Z.ai також перевела Coding Plan на систему квот на основі балів, яка окремо враховує вхідні, кешовані вхідні та вихідні токени. Запити поза піковим періодом компанії в будні дні споживають 50% від нормальної кількості балів.
Компанія ще не надала загальні ціни на API GLM-5.3 в наданих матеріалах про запуск, тому загальна вартість виробничих API важко порівнюється безпосередньо з GLM-5.2 або конкуруючими передовими моделями до надходження поетапного доступу до API.
Цей поетапний випуск може виявитися найважливішою частиною GLM-5.3.
Z.ai провів минулий рік, просуваючи стратегію відкритих моделей, зосереджену на дозвільних вагах, низькій вартості виводу та сумісності з існуючими екосистемами кодувальних агентів. GLM-5.3 демонструє, що відбувається, коли ця стратегія, можливо, надто успішно, працює в одній чутливій галузі: краща автономна інженерія також означає краще автономне дослідження безпеки.
Результатом є модель, яка просуває інженерні амбіції Z.ai, одночасно змушуючи компанію зіткнутися з тим самим компромісом між можливостями та доступом, який стоїть перед найбільшими закритими передовими лабораторіями.
Для розробників корпоративного рівня GLM-5.3 варто уважно стежити з двох причин. Її результати в кодуванні дають ще одне свідчення того, що все більш потужні агенти можуть з’являтися завдяки кращому пост-тренуванню та середовищам без постійного перероблення базової моделі. Її результати в кібербезпеці показують, чому вибір способів розповсюдження цих агентів може стати таким же важливим, як і вибір методів їх навчання.
Подробиці можна знайти на сайті: venturebeat.com
