Gemini 3.7 Flash: прискорення кодингу та агентів зі знижкою 50%

Gemini 3.7 Flash: прискорення кодингу та агентів зі знижкою 50% 4

Компанія Google впроваджує Gemini 3.7 Flash — нову версію своєї основної моделі штучного інтелекту, яка зосереджується на кодуванні, агентових робочих процесах та інтелектуальній праці, тимчасово знизивши ціни на API вдвічі.

Випуск відбувся лише через три тижні після релізу Gemini 3.6 Flash — незвично короткий термін, який Google пояснює відгуками розробників та вдосконаленнями алгоритмів.

Для розробників корпоративного рівня ще вагомішою новиною може стати поєднання цих покращень інтелекту зі зниженими витратами на інференс: до кінця 2026 року Gemini 3.7 Flash коштуватиме 0,75 долара за мільйон вхідних токенів та 3,75 долара за мільйон вихідних токенів.

Gemini 3.7 Flash: прискорення кодингу та агентів зі знижкою 50% 5

З 1 січня 2027 року ціни зростуть до 1,50 долара за мільйон вхідних токенів та 7,50 долара за мільйон вихідних токенів. Це означає, що поточна знижка є тимчасовою, але вона дає командам, які розгортають кодові та бізнес-агенти з високим обсягом трафіку, кілька місяців для оцінки того, чи зменшення повторних спроб та ручного контролю, про які заявляє Google, призведе до зниження загальних операційних витрат.

Цей реліз також підкреслює швидку ітерацію Google своєї лінійки Flash, тоді як наступна флагманська модель Pro залишається відсутньою. За повідомленнями Reuters, Google не надала дату випуску Gemini 3.5 Pro разом з анонсом у четвер, незважаючи на те, що модель раніше проходила тестування з партнерами. Axios також зазначила, що 3.7 Flash з’являється перед очікуваним випуском Pro.

Оновлення за три тижні, зосереджене на виконанні завдань

Google описує Gemini 3.7 Flash як свою “найінтелектуальнішу робочу модель для кодування та агентів”. Компанія стверджує, що модель краще адаптується, коли стикається з перешкодами, уточнює наміри за потреби та з більшою точністю дотримується інструкцій.

Ці покращення мають значення поза рамками показників тестів. У корпоративному кодовому агенті модель, яка робить менше непотрібних змін, відновлюється після помилок і надійніше виконує багатоетапні плани, може зменшити кількість людських втручань, необхідних для завершення завдання. Той самий принцип застосовується до бізнес-агентів, які працюють з документами та додатками, де неправильний виклик інструменту або погано інтерпретована інструкція може зірвати корисний робочий процес.

Google стверджує, що 3.7 Flash “думає більш ретельно”, докладаючи більше зусиль до багатоетапного планування та викликів інструментів. Її заявлена мета — більш дисципліноване виконання з меншою кількістю повторних спроб та меншим ручним наглядом.

Це являє собою цікаву еволюцію порівняно з Gemini 3.6 Flash. Документація для розробників Google описувала 3.6 як модель, що зменшує етапи міркувань, діалогові повороти та виклики інструментів порівняно з попередніми моделями, намагаючись обмежити спіральне зростання циклу виконання. З 3.7 акцент зміщується на докладання достатніх зусиль до планування при покращенні якості виконання — потенційно більш корисна оптимізація, ніж просто зменшення кількості кроків, які робить агент.

Google DeepMind повідомила у дописі, що супроводжує реліз, що 3.7 Flash демонструє досягнення у відлагодженні та вирішенні проблем, генерує більш функціональні веб-макети та додатки за меншу кількість запитів, а також покращує міркування та точність у реальних бізнес-робочих процесах.

Покращення кодування значні, але не універсальні

Тести Google показують велике покращення нового покоління в кількох тестах з розробки програмного забезпечення.

На FrontierCode 1.1 Main, який вимірює якість виробничого коду, Gemini 3.7 Flash набирає 43,6%, порівняно з 34,4% для Gemini 3.6 Flash. Це також трохи перевищує 42,7% для Claude Sonnet 5 та 41,3% для GPT-5.6 Terra, які повідомляє Google.

На DeepSWE v1.1, довготривалій оцінці розробки програмного забезпечення, 3.7 Flash досягає 65,3%, порівняно з 49,0% у свого попередника. GPT-5.6 Terra залишається попереду з 69,6% у таблиці Google.

Веб-розробка показує ще одне помітне покращення. Gemini 3.7 Flash отримує Elo-оцінку 1588 на Code Arena, проти 1538 для 3.6 Flash, 1541 для Claude Sonnet 5 та 1523 для GPT-5.6 Terra. Google стверджує, що нова модель може створювати більш функціональні макети та завершені додатки за меншу кількість запитів, а також точніше відтворювати еталонні скріншоти, зображення та дизайн-системи.

Ширша таблиця тестів є більш неоднозначною, що важливо для підприємств, які оцінюють модель на конкретних робочих навантаженнях, а не шукають єдину “найкращу” модель.

Gemini 3.7 Flash набирає 85,8% на Terminal-bench 2.1, порівняно з 87,4% для GPT-5.6 Terra. Terra також лідирує в порівняннях Google на Terminal-bench 3.0 та OSWorld-2.0. Claude Sonnet 5 лідирує в завданнях на мультимодальні завдання робочого столу та операційної системи Agent’s Last Exam з коефіцієнтом успіху 33,3%, проти 26,3% для Gemini 3.7 Flash.

Іншими словами, власні результати Google не показують, що 3.7 Flash універсально витісняє дорожчих конкурентів. Натомість вони вказують на модель, яка стала значно конкурентоспроможнішою у завданнях кодування та агентів, займаючи при цьому нижчий ціновий сегмент.

Корпоративні робочі процеси, можливо, є важливішим тестом

Покращення виходять за межі розробки програмного забезпечення.

Gemini 3.7 Flash: прискорення кодингу та агентів зі знижкою 50% 6

На AutomationBench, який, за описом Google, вимірює автоматизацію корпоративних робочих процесів, Gemini 3.7 Flash набирає 30,4%, що значно вище за 17,0% для 3.6 Flash. У таблиці Google Claude Sonnet 5 має 10,7%, а GPT-5.6 Terra — 23,6%.

Модель також досягає 34,0% на GDP.PDF, оцінці складного розуміння PDF, порівняно з 22,0% для 3.6 Flash, 28,0% для Claude Sonnet 5 та 24,7% для GPT-5.6 Terra.

Це поєднання актуальне для корпоративних агентів, оскільки багато практичних розгортань вимагають більше, ніж просто генерації тексту або коду. Агент може потребувати інтерпретації довгого звіту, виявлення релевантної інформації, вибору інструменту для виклику, оновлення іншої системи та створення документа для перегляду людиною. Надійність у всьому цьому ланцюжку може бути важливішою за продуктивність на ізольованому тесті міркувань.

Google втілює цю тезу на практиці з Gemini Spark. Підписники Google AI Pro та Ultra можуть використовувати 3.7 Flash у Spark, персональному AI-агенті компанії. Google стверджує, що оновлення покращує роботу Spark з знаннями та використання інструментів у додатках Google Workspace, включаючи робочі процеси, які консолідують файли, створюють чернетки електронних листів та оновлюють документи зі статусом.

Для підприємств 3.7 Flash також доступний через Gemini Enterprise Agent Platform та Gemini Enterprise.

Ціна стає частиною конкуренції моделей

Початкова ціна Gemini 3.7 Flash є помітною спробою вбудувати модель у корпоративні робочі процеси.

До 31 грудня розробники платитимуть 0,75 долара за мільйон вхідних токенів та 3,75 долара за мільйон вихідних токенів. Кешування контексту коштуватиме 0,075 долара за мільйон токенів протягом початкового періоду. Google стверджує, що стандартні ціни подвояться 1 січня 2027 року до 1,50 долара за вхідні та 7,50 долара за вихідні, а кешування контексту зросте до 0,15 долара.

Для порівняння, стандартна ціна API Gemini 3.6 Flash становить 1,50 долара за мільйон вхідних токенів та 7,50 долара за мільйон вихідних токенів. У таблиці тестів Google Claude Sonnet 5 вказано за 2 та 10 доларів відповідно, тоді як GPT-5.6 Terra — за 2 та 12 доларів.

Економіка стає більш вираженою для автономних агентів, оскільки один запит користувача може призвести до довгої послідовності викликів моделі, токенів міркувань та взаємодій з інструментами. Модель, яка коштує менше за токен, але вимагає значно більше повторних спроб, може зрештою не бути дешевшою.

Навпаки, поєднання нижчої початкової ціни за токен та заявлених покращень точності з першого разу від Google може суттєво змінити вартість запуску кодових або документообробних агентів з високим обсягом трафіку, якщо ці покращення перенесуться на виробництво.

Це метрика, яку корпоративні команди зрештою повинні будуть протестувати: не ціна за мільйон токенів ізольовано, а вартість за успішно завершене завдання.

Перетасовка AI від Google підвищує ставки для Gemini

Gemini 3.7 Flash з’являється на тлі ширших дебатів щодо того, чи втрачає Google позиції на передовій AI. Компанія не випустила Gemini 3.5 Pro, незважаючи на те, що у травні заявила, що флагманська модель з’явиться наступного місяця.

До липня Google повідомила, що модель все ще проходить тестування з партнерами і стане загальнодоступною, коли буде готова; анонс у четвер не надав подальшого графіку. Таким чином, остання загальнодоступна модель Pro від Google залишається Gemini 3.1 Pro, представлена в лютому.

Reuters у липні повідомив, що Gemini 3.5 Pro не досягла своєї початкової мети після того, як не виправдала внутрішні цілі, особливо в кодуванні, навіть незважаючи на те, що Google почала тренувати модель, яку вона називає своєю найамбіційнішою моделлю — Gemini 4.

Затримка збігається з великим реорганізацією керівництва AI Google, оголошеною минулого тижня.

Співзасновник Google DeepMind і лауреат Нобелівської премії Деміс Хассабіс відмовився від повсякденного контролю над відомим підрозділом AI DeepMind, щоб стати його головою і, одночасно, обійняти посаду головного наукового співробітника Alphabet.

Тим часом колишній технічний директор DeepMind Корай Кавукчуоглу тепер очолює підрозділ як старший віце-президент, підзвітний безпосередньо генеральному директору Сундару Пічаї.

Кавукчуоглу контролює розробку моделей Gemini, передові дослідження, додаток Gemini та команди розробників — фактично об’єднуючи весь ланцюжок Gemini під керівництвом більш орієнтованого на продукт оператора.

Головний науковий співробітник Джефф Дін, співкерівник Gemini Оріол Віньяльс, Куок Ле та Санджай Гемават пішли, щоб заснувати стартап Discovery Loop.

Ці відходи послідували за переходом співкерівника Gemini Ноама Шазіра до OpenAI та відходом лауреата Нобелівської премії з AlphaFold Джона Джампера до Anthropic. Reuters повідомив, що внутрішні розбіжності, обмеженість обчислювальних ресурсів та бюрократія Google сприяли повільнішим релізам та слабкості в кодуванні.

Зовнішні інтерпретації варіюються від організаційного ремонту до більш фундаментального відступу.

SemiAnalysis стверджувала, що Google все більше пріоритезує високоприбутковий бізнес постачання хмарної інфраструктури компаніям AI — включно з конкурентами Gemini — замість того, щоб утримувати власні моделі на абсолютній передовій. Цей аналіз також стверджував, що Google фактично скасувала 3.5 Pro, хоча Google це не підтвердила і продовжує називати модель відкладеною.

The Verge запропонував більш зважену оцінку: відходи та затримки з моделями є серйозними, але Google зберігає величезні переваги завдяки Пошуку, Workspace, Android, Cloud, власним AI-чіпам та розповсюдженню споживачів. Google стверджує, що додаток Gemini перевищив 950 мільйонів щомісячних користувачів, що надає йому охоплення, яке не залежить виключно від володіння моделлю з найвищим рейтингом.

Поточні тести також зображують компанію, яка відстає від загальних лідерів, але все ще залишається міцно конкурентоспроможною. Artificial Analysis ставить Claude Opus 5 на 63 місце в своєму загальному Індексі інтелекту моделей, тоді як Google повідомляє про 56 балів для Gemini 3.7 Flash — покращення порівняно з 52 для 3.6 Flash, але не повернення на вершину.

Ранні результати людських переваг Arena є більш сприятливими, тимчасово розміщуючи 3.7 Flash на дев’ятому місці загалом і на восьмому — для веб-розробки.

Отримана картина полягає не в тому, що Google відмовилася від передового AI, а в тому, що вона стала сильнішою в швидкому випуску ефективних моделей Flash, водночас маючи проблеми з постачанням преміального флагмана, необхідного для повернення загального лідерства. Gemini 4 тепер служитиме найчіткішим випробуванням того, чи реорганізація керівництва виправить цей розрив у виконанні.

Доступно зараз у всьому стеку розробника Google

Розробники можуть отримати доступ до Gemini 3.7 Flash через Gemini API у Google AI Studio та Android Studio, а також у середовищі Antigravity від Google. Підприємства можуть розгортати його через Gemini Enterprise Agent Platform та Gemini Enterprise, тоді як споживачі з підписками Google AI Pro або Ultra можуть отримати доступ до моделі через Spark у підтримуваних країнах.

Google також впроваджує оновлені захисні механізми, що охоплюють ризики, пов’язані з хімічною, біологічною, радіологічною та ядерною зброєю, а також зловживання кібер-наступальними засобами, згідно з повідомленням компанії.

Незвичайно швидкий стрибок від Gemini 3.6 Flash до 3.7 Flash вказує на цикл розробки моделі, в якому алгоритмічні вдосконалення можуть досягти виробничих продуктів без очікування нового флагманського покоління. Ars Technica також підкреслила тритижневий інтервал між двома релізами, тоді як Google стверджує, що методи, що лежать в основі оновлення, будуть враховані в майбутніх моделях.

Для розробників такий швидший темп створює власне операційне питання. Моделі можуть швидко вдосконалюватися, але виробничі команди все ще повинні тестувати нові версії проти своїх власних репозиторіїв, запитів, схем інструментів та режимів збоїв перед зміною розгортання.

Gemini 3.7 Flash дає цим командам особливо сильний стимул для проведення такої оцінки. Власні дані Google показують значні покращення у виробничому кодуванні, веб-розробці, розумінні документів та автоматизації робочих процесів, не претендуючи на лідерство скрізь. За початковою ціною Google фактично робить ставку на те, що розробники цінуватимуть модель, яка є достатньо конкурентоспроможною з дорожчими системами, будучи при цьому достатньо дешевою для багаторазового запуску в агентах.

Чи збережеться ця перевага після повернення до повних цін у січні, залежатиме менше від позицій у таблицях лідерів, ніж від того, наскільки надійно 3.7 Flash завершуватиме реальну роботу.

Подробиці можна знайти на сайті: venturebeat.com

Поділитися новиною:TelegramViberFacebook
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *