Gemini 3.6 Flash: Знижує витрати на штучний інтелект до 65% для інженерних завдань

Google DeepMind презентувала три нові пропрієтарні моделі штучного інтелекту, які, за їхніми словами, є одними з найефективніших за кількістю токенів на сьогодні: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite та Gemini 3.5 Flash Cyber.
Ці моделі покликані зробити ШІ-агентів швидшими, розумнішими та дешевшими в масштабуванні. Google встановила ціну на Gemini 3.6 Flash на рівні $1.50 за мільйон вхідних токенів та $7.50 за мільйон вихідних токенів через програмний інтерфейс застосунків (API). Gemini 3.5 Flash-Lite коштує вражаюче дешево — $0.30/$2.50 за мільйон токенів відповідно.
Порівняйте це з цінами $1.50/$9.00 за 1 мільйон токенів для Gemini 3.5 Flash та $2/$12 для Gemini 3.1 Pro Preview, і економія стає значною. Однак, попередня версія Gemini 3.1 Flash-Lite від Google залишається “найбільш економічно вигідною” моделлю компанії за ціною $0.25/$1.50 за 1 мільйон токенів. Попри це, вона все ще працює вдвічі повільніше за нову, дорожчу Gemini 3.5 Flash-Lite, що надає підприємствам, які цінують швидкість, більше “віддачі” за свої кошти.
Порівняльна таблиця цін API моделей VB Frontier AI (Короткий список, кінець липня 2026 року)
|
Модель |
Вхідні ($/1 млн) |
Вихідні ($/1 млн) |
Загалом ($/1 млн) |
Джерело |
|
MiMo-V2.5 Flash |
$0.10 |
$0.30 |
$0.40 |
Xiaomi |
|
deepseek-v4-flash |
$0.14 |
$0.28 |
$0.42 |
DeepSeek |
|
deepseek-v4-pro |
$0.435 |
$0.87 |
$1.305 |
DeepSeek |
|
MiniMax-M3 |
$0.30 |
$1.20 |
$1.50 |
MiniMax |
|
LongCat-2.0 — обмежена пропозиція |
$0.30 |
$1.20 |
$1.50 |
LongCat |
|
Gemini 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
Qwen3.7-Plus |
$0.40 |
$1.60 |
$2.00 |
Alibaba Cloud |
|
MiMo-V2.5 |
$0.40 |
$2.00 |
$2.40 |
Xiaomi |
|
Gemini 3.5 Flash-Lite |
$0.30 |
$2.50 |
$2.80 |
|
|
LongCat-2.0 — стандарт |
$0.75 |
$2.95 |
$3.70 |
LongCat |
|
MiMo-V2.5 Pro (≤256K) |
$1.00 |
$3.00 |
$4.00 |
Xiaomi |
|
GLM-5.2 |
$1.40 |
$4.40 |
$5.80 |
Z.ai |
|
GPT-5.6 Luna |
$1.00 |
$6.00 |
$7.00 |
OpenAI |
|
Grok 4.5 |
$2.00 |
$6.00 |
$8.00 |
xAI |
|
MiMo-V2.5 Pro (>256K) |
$2.00 |
$6.00 |
$8.00 |
Xiaomi |
|
Gemini 3.6 Flash |
$1.50 |
$7.50 |
$9.00 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
Alibaba Cloud |
|
Gemini 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Gemini 3.1 Pro Preview (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.6 Terra |
$2.50 |
$15.00 |
$17.50 |
OpenAI |
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
OpenAI |
|
Kimi K3 |
$3.00 |
$15.00 |
$18.00 |
Moonshot AI |
|
Gemini 3.1 Pro Preview (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Claude Opus 4.8 |
$5.00 |
$25.00 |
$30.00 |
Anthropic |
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
GPT-5.5 Instant (chat-latest) |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
Sakana Fugu Ultra (≤272K) |
$5.00 |
$30.00 |
$35.00 |
Sakana AI |
|
GPT-5.6 Sol |
$5.00 |
$30.00 |
$35.00 |
OpenAI |
|
Claude Fable 5 / Claude Mythos 5 |
$10.00 |
$50.00 |
$60.00 |
Anthropic |
Ціна на спеціалізовану модель Gemini 3.5 Flash Cyber, призначену для дослідників кібербезпеки та red teamer’ів для виправлення помилок, поки що не вказана.
Хоча ціни є одними з найнижчих серед усіх провідних ШІ-моделей у світі, той факт, що Google розробив їх для використання меншої кількості токенів, також має знизити витрати для підприємств понад те, що показує ціна (оскільки загальна кількість токенів все одно буде меншою).
Gemini 3.6 Flash та Gemini 3.5 Flash-Lite доступні негайно через Gemini API в Google AI Studio та Android Studio, а також у споживчому застосунку Gemini та Google Пошуку. Згідно з окремим блогом Google, Gemini 3.5 Flash Cyber буде “ексклюзивно доступний урядам і довіреним партнерам через CodeMender незабаром” — CodeMender є пропрієтарним агентом Google для виправлення помилок у коді за допомогою ШІ, випущеним минулого року.
Як і попередні моделі Gemini, усі ці моделі є пропрієтарними та “закритим кодом”. Тому їх можна отримати лише через офіційний API Google та його партнерів, на відміну від ліцензій з відкритим кодом, таких як MIT або Apache 2.0.
Одна помітна відсутність, на яку звернули увагу розробники в X та соціальних мережах: де велика, потужніша флагманська модель Gemini 3.5 Pro, про яку Google раніше згадував як про випуск цього літа? Зрештою, Gemini 3.1 Pro, попередній флагман, дебютував ще в лютому 2026 року, а конкуренти OpenAI та Anthropic з того часу випустили кілька новіших поколінь флагманських оновлень, значно потужніших за рішення Google.
Співробітник Google Логан Кілпатрік відповів на одне з таких запитань у X, написавши: “Gemini 3.5 Pro наразі проходить тестування з партнерами, і ми плануємо зробити його широко доступним, як тільки він буде готовий”.
Випуск Google свідчить про те, що найближче майбутнє ШІ полягає в агентних можливостях — системах, що працюють автономно протягом тривалого часу.
Якщо перші великі мовні моделі подібні до величезних, ненажерливих вантажних потягів, здатних перевозити неймовірні вантажі за величезну ціну, то нова серія Flash представляє собою флот спритних, гіпер-ефективних гібридних фургонів доставки.
Ефективність зменшення токенів від 17% до 65% для сильних результатів на сторонніх бенчмарках
Під капотом Gemini 3.6 Flash досягає значного підвищення ефективності. За даними Artificial Analysis Index, який підтримується незалежною сторонньою групою з бенчмаркінгу ШІ, модель зменшує використання вихідних токенів на 17% порівняно з її попередником, Gemini 3.5 Flash.
У специфічних бенчмарках довгострокового програмного інжинірингу, таких як DeepSWE, який вимірює, наскільки добре агенти виконують багатоетапні інженерні завдання з нуля, економія токенів сягає до 65%.
Це зменшення означає, що моделі потрібно менше кроків міркувань і викликів інструментів для виконання того самого багатоетапного робочого процесу. Уявіть ефективність токенів як витрату палива автомобіля.
Коли ШІ-модель обирає складний шлях для вирішення проблеми, вона витрачає більше обчислювального “палива”, що збільшує кінцеву вартість для розробника. Оптимізувавши свою внутрішню логіку, Gemini 3.6 Flash швидше та дешевше досягає правильної відповіді.
Хоча в матеріалах Google не було вказано точних архітектурних чи алгоритмічних змін, використаних для досягнення такої ефективності токенів, компанія зазначила, що модель “здійснює менше кроків міркувань та викликів інструментів для виконання багатоетапних робочих процесів” та демонструє знижену “багатослівність”.
Офіційні картки моделі, випущені Google, показують, що як Gemini 3.6 Flash, так і Gemini 3.5 Flash-Lite мають вікно контексту введення на 1 мільйон токенів, максимальне обмеження виведення — 64 000 токенів, а обидві моделі мають однакову дату зрізу знань — березень 2026 року.
Гідні результати бенчмарків за низької вартості
Технологічні покращення поширюються на конкретні можливості. Gemini 3.6 Flash набирає 49% у бенчмарку DeepSWE, що є значним зростанням порівняно з 37% попередньої версії 3.5.
Вона також підвищує продуктивність машинного навчання, набираючи 63.9% у MLE-Bench порівняно з попередніми 49.7%. Крім того, Google інтегрує використання комп’ютера як вбудований клієнтський інструмент через Gemini API та Gemini Enterprise, що відображається в оцінці OSWorld-Verified 83.0%, порівняно з 78.4%.

Модель також підвищує ефективність роботи з документами, демонструючи результат 1421 у бенчмарку GDPval-AA v2 порівняно з 1349 у попередньої версії.
Для забезпечення безпеки, поряд з покращенням можливостей, Google впроваджує посилені засоби захисту Frontier Safety. Ці заходи посилюють модель проти спроб обійти обмеження (jailbreak) та знижують ризики у сферах хімічної, біологічної, радіологічної та ядерної зброї, а також у випадках зловживання кіберзахистом.
Інженерна команда тренує модель, щоб мінімізувати відмови у відповідях для корисних завдань, досягаючи необхідного балансу між суворою безпекою та практичною корисністю.
Моделі для бюджетного кодування, агентних завдань та кібербезпеки відповідно
Google розділив свої нові пропозиції на три окремі продукти, розроблені для різних операційних потреб.
Gemini 3.6 Flash служить потужним робочим інструментом тріо. Вона обробляє складне кодування, складну роботу з даними та мультимодальну обробку з підвищеною точністю. Корпоративні клієнти використовують її для таких вимогливих завдань, як розбір складних документів, детальний аналіз діаграм і даних, а також для створення довгострокових звітів.
Модель виконує складні міграції коду за допомогою мультиагентних оркестраційних фреймворків з меншою затримкою та вищою якістю, ніж попередні версії. Крім того, 3.6 Flash допомагає розробляти екстрактори фотографічної текстури для 3D-робочих процесів за допомогою інтерфейсів полотна.
Gemini 3.5 Flash-Lite призначена для середовищ, де висока пропускна здатність і мінімальна затримка є обов’язковими. Google визначає її як найшвидшу модель у серії 3.5.
За вимірами Artificial Analysis, модель обробляє 350 вихідних токенів за секунду, що робить її високоефективною для агентного пошуку та масової обробки документів. Artificial Analysis зазначає, що це приблизно вдвічі швидше, ніж попередня версія моделі Gemini 3.1 Flash-Lite.
Розробники можуть налаштувати 3.5 Flash-Lite для пріоритезації виконання з низькою затримкою для завдань з великим обсягом даних з мінімальними рівнями міркувань, або ж задіяти вищі рівні міркувань для обробки складних багатоетапних підзавдань агентів.
Незважаючи на позначку “Lite”, вона перевершує стандартну Gemini 3 Flash у кількох ключових агентних та кодувальних оцінках, зокрема SWE-Bench Pro, де вона набирає 54.2% порівняно з 49.6%, та OSWorld-Verified, набираючи 74.0% проти 65.1%.

Модель витягує характеристики продуктів із величезних наборів даних, генерує інтерактивні концепції веб-дизайну та легко масштабує переклад чеків.
Третій продукт, Gemini 3.5 Flash Cyber, є високоспеціалізованим розгортанням. Google доопрацював цю модель спеціально для пошуку та виправлення вразливостей у сфері кібербезпеки. Вона інтегрується безпосередньо з агентом Google CodeMender.
На практиці, кілька агентів 3.5 Flash Cyber працюють одночасно для створення єдиного, вичерпного звіту про вразливості, демонструючи конкурентну продуктивність на рівні передових рішень у бенчмарку CyberGym, досягаючи навіть показників, близьких до широко розрекламованої моделі Mythos від Anthropic.

Google не вказав точну числову вартість для 3.5 Flash Cyber, зазначивши лише, що вона доопрацьована “за нижчою ціною за токен, ніж у більших моделей”.
Лише комерційне ліцензування
Ліцензійна політика щодо нових моделей Gemini має глибокі наслідки для розробників та корпоративних користувачів. Google розгортає Gemini 3.6 Flash та 3.5 Flash-Lite під пропрієтарною комерційною моделлю API. На відміну від програмного забезпечення з відкритим кодом, яке регулюється ліцензіями, такими як MIT License або GNU General Public License, розробники не отримують доступу до базових ваг моделі, тренувальних даних чи вихідного коду.
Ліцензія MIT або GPL надає користувачам свободу завантажувати кодову базу, модифікувати внутрішню архітектуру, самостійно розміщувати розгортання та незалежно поширювати програмну інфраструктуру. На противагу цьому, підхід Google API означає, що розробники фактично орендують доступ до інтелекту на основі суворої лічильної системи. Кожен запит та згенерована відповідь проходять через керовані сервери Google, що тягне за собою витрати, засновані на чіткій структурі ціноутворення — $1.50 за мільйон вхідних токенів для 3.6 Flash.
Це комерційне обмеження зменшує гнучкість розгортання. Підприємства не можуть повністю ізолювати моделі на власному локальному захищеному обладнанні без укладання спеціалізованих угод найвищого рівня з Google Cloud. Розробники залишаються зв’язаними політиками допустимого використання Google, довільними обмеженнями швидкості та мережевими вимогами, створюючи постійну залежність від працездатності інфраструктури Google та її умов надання послуг.
Ліцензування Gemini 3.5 Flash Cyber виявляється ще більш обмежувальним. Визнаючи подвійне призначення ШІ для кібербезпеки — яке зловмисники можуть використовувати так само ефективно, як і захисники для виправлення систем — Google поки що робить модель доступною лише через пілотну програму обмеженого доступу, подібно до тенденції, започаткованої моделлю Mythos від Anthropic з її програмою Project Glasswing, і продовженої OpenAI з поступовим розгортанням GPT-5.6.
У цьому випадку Google робить 3.5 Flash Cyber ексклюзивно доступною для урядів та довірених партнерів. Такий суворий контроль запобігає відкритому доступу, віддаючи пріоритет системній безпеці над широким розмаїттям розробницьких інновацій.
Погляд у майбутнє
Google DeepMind продовжує швидко розвиватися, але розрив у її продуктовому лінійці залишається очевидним. У той час як серія Flash виділяється швидкістю та економічністю, галузь з нетерпінням очікує розгортання Gemini 3.5 Pro, щоб оцінити абсолютні передові можливості Google.
Водночас компанія підтверджує, що попереднє тренування Gemini 4 вже розпочалося.
Доки не з’явиться наступний великий флагманський реліз, розробники повинні оптимізувати свої системи, використовуючи високоефективну, але навмисно обмежену, архітектуру Flash.
Порада від INFBusiness:
Нові моделі Gemini 3.6 Flash та 3.5 Flash-Lite від Google DeepMind пропонують значну оптимізацію витрат і продуктивності. Вони стануть чудовим вибором для розробників та компаній, які прагнуть ефективно використовувати ресурси ШІ для завдань, що потребують швидкості та економічності, особливо в галузях кодування, обробки даних та створення контенту. Для фахівців з кібербезпеки, Gemini 3.5 Flash Cyber відкриває нові можливості для виявлення та усунення вразливостей, хоч і з обмеженим доступом.
Джерело новини: venturebeat.com
