FLUX 3 від Black Forest Labs: генеруйте зображення та відео з аудіо вже зараз

Black Forest Labs (BFL) розширює сімейство своїх розробкових рішень FLUX, виходячи за межі генерації зображень. Сьогодні компанія анонсувала FLUX 3 – передову мультимодальну модель, навчену розуміти та генерувати зображення, а також аудіо/відео кліпи тривалістю до 20 секунд за одним запитом. Крім того, ця ж базова архітектура може бути застосована для робототехнічного зору та дій.
Штаб-квартира BFL розташована у Фрайбурзі, Німеччина. Компанія зазначає, що FLUX 3 тренувалася одночасно на різних модальностях, а не шляхом об’єднання окремих моделей зображень, відео та аудіо під спільним інтерфейсом.
Ця відмінність є ключовою у пропозиції BFL: компанія прагне, щоб підприємства розглядали генерацію контенту, симуляцію, комп’ютерне використання та робототехніку як взаємопов’язані застосунки єдиної спроможності, яку вони називають “візуальним інтелектом” — моделями, що “здатні сприймати, прогнозувати та діяти у фізичному та цифровому середовищі”. Цей реліз знаменує собою перший публічний випуск BFL моделі для генерації відео.
FLUX 3 буде пропонуватися через чотири продуктові лінії: FLUX 3 Video, FLUX 3 Image, FLUX 3 Action та майбутній реліз з відкритим кодом FLUX 3 Dev. FLUX 3 Video (з опціональною нативною генерацією аудіо) та FLUX 3 Action вже доступні для участі в програмі “Ранній доступ” (Early Access), на яку може подати заявку будь-хто, але яка потребує схвалення від BFL.
Наразі відсутній публічний доступ через програмний інтерфейс застосунків (API) BFL або їхніх партнерів. Проте компанія повідомляє, що FLUX 3 Image з’явиться протягом найближчих тижнів, за яким послідує загальна доступність. Обмежений початковий випуск відповідає стратегіям запуску нових моделей від інших провідних лабораторій США, таких як Anthropic та OpenAI, хоча там це, як стверджувалося, було пов’язано з міркуваннями безпеки та запитами уряду.
Компанія поки не оголосила ціноутворення, гарантії рівня обслуговування (SLA), методологію оцінки, розміри вибірок, кількість рецензентів чи будь-які бенчмарки для порівняння з іншими моделями. Тому корпоративні покупці не можуть розрахувати загальну вартість володіння або самостійно перевірити відео порівняння.
Ще одна помітна відсутність: FLUX 3 *не* випускається з доступними для завантаження вагами (weights) або ліцензією з відкритим кодом. BFL обіцяє, що швидші версії з відкритими вагами з’являться пізніше цього року. Їхній технічний блог називає FLUX 3 Dev “відкритим доступом до мультимодального ядра для створення контенту (відео, аудіо та зображення) та прогнозування дій” — це значно ширше зобов’язання, ніж будь-який попередній реліз FLUX Dev, який охоплював лише зображення.
Проте, він з’явиться останнім у послідовності. Розробники, звиклі отримувати локально розгортану версію FLUX одночасно або незабаром після анонсу великої моделі, муситимуть зачекати. Ця затримка не скасовує зобов’язань компанії, але є розчаровуючим фактором, враховуючи роль, яку відкриті ваги відіграли у поширенні FLUX досі.
Flux 3 показує вищі результати, але відсутність ціноутворення та детальних бенчмарків може сповільнити корпоративне впровадження
BFL опублікувала кілька порівняльних бенчмарків, але вони мають кваліфікацію “попередні” – повні результати та методологія будуть опубліковані пізніше, під час загальної доступності.
За результатами попереднього тестування переваг користувачів на 10-секундних відеокліпах 720p з аудіо, згенерованих за текстовим запитом, BFL стверджує, що FLUX 3 перевершила Luma Ray 3.2 у 93% порівнянь, Runway Gen-4.5 – у 77%, Grok Imagine Video – у 69%, Kling v3 Pro – у 60%, Happy Horse v1 – у 59%, Happy Horse 1.1 – у 57%, а також Seedance 2.0 та Gemini Omni Flash від Google – у 52%.

Кожен з цих показників супроводжується важливим застереженням від BFL. Діаграма з результатами позначена як “попереднє оцінювання раннього кандидата FLUX 3”, що означає, що цифри описують стан моделі перед випуском, а не ту версію, що зараз проходить ранній доступ. Це може працювати в обидва боки: версія, що надійде в продаж, може працювати краще, але жодні опубліковані сьогодні дані не відображають реальні можливості для клієнтів.
Luma Ray 3.2 та Runway Gen-4.5, проти яких FLUX 3 показала 93% та 77% відповідно, є найменш конкурентоспроможними порівняннями у списку – це усталені продукти, але не ті моделі, що зараз задають тон у незалежних відеорейтингах. Це справжні перемоги, і саме вони найменш ймовірно вплинуть на вибір корпоративних клієнтів.
Seedance 2.0, з показником 52%, є статистичним “підкиданням монетки” проти моделі, яку більшість західних компаній наразі не можуть придбати. ByteDance безстроково відклала міжнародний запуск Seedance 2.0 після юридичних погроз від Netflix, Warner Bros., Disney, Paramount та Sony через звинувачення у системному порушенні авторських прав, і це призупинення досі чинне. Рівність із замороженим продуктом не є ані сильною, ані слабкою заявою.
Gemini Omni Flash, також з 52%, має значно більшу вагу. Omni є найближчим аналогом від великої платформи до того, що намагається досягти FLUX 3 – мультимодальний вхід, створення контенту з урахуванням відео та аудіо, розмовне редагування. За власними вимірюваннями BFL, ці дві моделі не відрізняються за якістю 10-секундного тексту до відео.
Перевага Google у цьому протистоянні полягає в тому, що Omni загальнодоступний через API Google Gemini за $0.10 за секунду згенерованого відео 720p, або приблизно за $1.00 за 10-секундний кліп.
Один регіональний нюанс важливий для домашнього ринку німецької компанії. Редагування *завантажених* відео недоступне для користувачів Omni Flash у Європейській економічній зоні, Швейцарії та Великій Британії, хоча редагування відео, згенерованого самою моделлю, дозволено. Європейське підприємство, яке хоче обробити свої існуючі відеоматеріали за допомогою генеративного редагування, наразі не може цього зробити за допомогою Omni Flash.
Ось приблизний огляд для підприємств, які розглядають, яким відеомоделям довіряти:
|
Модель |
Максимальна тривалість однієї генерації |
Максимальна роздільна здатність |
Ключові обмеження |
Ціна за 10-секундний кліп (720p) |
Ціна за 10-секундний кліп (1080p) |
Ціна за 10-секундний кліп (4K) |
|
FLUX 3 Video |
20 секунд |
Не зазначено; оцінки проводилися в 720p |
Ранній доступ; немає опублікованих SLA чи ціноутворення |
Не оголошено |
Не оголошено |
Не оголошено |
|
HappyHorse 1.1 |
15 секунд |
1080p |
Немає 4K; закриті ваги |
Не опубліковано (ціна перепродажу v1.0 становить ~$1.82) |
Не опубліковано (ціна перепродажу v1.0 становить ~$3.12) |
н/д |
|
Veo 3.1 |
Білінг за секунду |
4K |
Підтримка розширення кліпу; попередній перегляд |
$4.00 |
$4.00 |
$6.00 |
|
Veo 3.1 Fast |
Білінг за секунду |
4K |
Попередній перегляд |
$1.00 |
$1.20 |
$3.00 |
|
Veo 3.1 Lite |
Білінг за секунду |
1080p |
Немає 4K, немає розширення кліпу; попередній перегляд |
$0.50 |
$0.80 |
н/д |
|
Gemini Omni Flash |
10 секунд (мінімум 3с) |
720p при 24 FPS |
Попередній перегляд і відсутність доступу в ЄС |
$1.00 |
н/д |
н/д |
Єдина архітектура для медіагенерації та фізичних дій
FLUX 3 побудована на основі Self-Flow – методу BFL для узгодження мультимодального розуміння та генерації в межах однієї архітектури, про який було оголошено у березні 2026 року.
Компанія стверджує, що значно масштабувала обчислювальні потужності та обсяги даних для одночасного тренування відео, зображень та аудіо. Тестування показало, що генерація відео та прогнозування дій не потребують окремих баз – та сама архітектура може бути розширена на прогнозування дій без шкоди для вивченого з відео.
“Ми ставимо зір у центр нашого підходу, оскільки це найбільш інформативне джерело фізичного світу. Зображення передають структуру, зображення та відео навчають просторових відносин, відео навчає динаміці, а дії виявляють причинно-наслідкові зв’язки. Але сам по собі зір не дає повної картини”, – зазначив Робін Ромбах, співзасновник і генеральний директор BFL, у попередній заяві, наданій VentureBeat. “Справжній інтелект означає сприйняття світу: прогнозування змін, вчинення дій та навчання на результатах. Спільне тренування в рамках єдиної уніфікованої архітектури – це те, що приведе нас до мети, оскільки кожна тренувальна модальність посилює інші. Аудіо передає ритм, інтонацію та фізичні події, які недоступні зору. Мова передає цілі, абстракції та інструкції, які пікселі не можуть легко висловити”.
Він висловився ще прямолінійніше в іншому місці анонсу: “Ви не можете обдурити реальність. Модель, яка навчається лише на зображеннях, може лише генерувати зображення. Але світ не складається з нерухомих кадрів. Він рухається, звучить, змінюється та реагує”.
BFL повідомляє, що FLUX 3 орієнтована на творчі інструменти, медіа, дизайн, електронну комерцію та фізичний ШІ, підтримуючи генерацію відео із синхронізованим аудіо, точне редагування зображень, консистентність продуктів та матеріалів під час руху, багатомовну генерацію та прогнозування дій роботів. Вже зараз вона тестується компаніями Canva, Burda, Magnific (раніше Freepik), Krea та Picsart.
Для компаній, що створюють програмне забезпечення для творчих завдань, привабливим є консолідація. Єдина основа потенційно може підтримувати створення раскадровок, редагування зображень, рендеринг продуктів, створення варіантів відео та локалізацію без необхідності постійно перекладати активи та інструкції між роз’єднаними моделями.
Для команд, що займаються робототехнікою, потенційна цінність полягає в ефективності використання даних. Моделі, які вже кодують рух, поведінку об’єктів та фізичні зміни, можуть потребувати менше специфічного для завдань тренування робота, ніж системи, що починають з сирих демонстрацій.
Що вміє FLUX 3 Video
Відео-компонент є найбільш детально описаною частиною запуску, і він вирішує питання, що циркулювало як чутка: FLUX 3 генерує кліпи тривалістю до 20 секунд з аудіо за один прохід.
Кожен відео вивід супроводжується нативним аудіо. Для порівняння, HappyHorse 1.0 досягає максимум 15 секунд 1080p із синхронізованим аудіо. Хоча BFL не вказала роздільну здатність для своїх 20-секундних кліпів, а її опубліковані оцінки проводилися в 720p. Тим не менш, 20-секундний кліп з одного запиту є одним з найдовших досягнутих на даний момент, що відповідає припиненій моделі OpenAI Sora.
Список можливостей, опублікований BFL, охоплює:
-
Генерація відео за текстом.
-
Генерація відео із зображення, анімація з початкового кадру або використання зображень як візуальних референсів.
-
Генерація відео з відео на основі референсного кліпу, перенесення елементів, таких як конкретний персонаж, у нову сцену чи контекст.
-
Генерація аудіо-відео продовження на основі існуючого відео та аудіо входу.
-
Генерація відео від ключових кадрів для контрольованих переходів між визначеними моментами.
-
Багатомовний діалог.
-
Широкий діапазон візуальних стилів та співвідношень сторін, від аматорської відеоплівки до анімації та кінематографії.
-
Генерація типографіки та анімованого дизайну.
-
Агентне з’єднання окремих кліпів у довші, багатокадрові послідовності.
Останній пункт є тим, на що командам, які займаються корпоративним відео, варто звернути найбільшу увагу. BFL стверджує, що ці можливості в сукупності дозволяють створювати послідовності тривалістю кілька хвилин, з візуальними референсами, що зберігають консистентність персонажів між сценами. Якщо це підтвердиться в умовах реального виробництва, це вирішить обмеження, яке не дозволяло генеративному відео потрапити до більшості комерційних конвеєрів: не якість кліпу, а безперервність між кадрами.
Це також та сфера, де конкуренція найбільш пряма. Головним оновленням HappyHorse 1.1 є R2V, або Reference-to-Video, який приймає кілька референсних зображень персонажів для збереження ідентичності в згенерованому відео – та сама проблема, але вирішена на рівні вхідних даних, а не через агентне з’єднання кліпів. Alibaba також стверджує про синхронізацію губ без дрейфу і спеціально націлена на артефакти, які видають комерційне ШІ-відео як штучне, включаючи жирність обличчя та надмірну різкість. Саме тут, у консистентності персонажів, розгортається боротьба в цій категорії, і обидві компанії це розуміють.
BFL стверджує, що FLUX 3 Video вже демонструє високу ефективність у передачі виразів обличчя людей, асоціації звуків з фізичними подіями та багатомовного виводу. З боку зображень, компанія зазначає, що попередні оцінки, проведені під час середнього етапу тренування, показують значне покращення порівняно з попередніми версіями FLUX у обробці складних запитів та генерації тексту, включаючи високоточний текст багатьма мовами. Бенчмарки або показники виграшу для зображень не були опубліковані.
FLUX-mimic перевіряє, чи можуть відеомоделі стати моделями для роботів
BFL застосовує свою тезу про уніфіковану архітектуру через FLUX-mimic – модель відео-дій, побудовану на базі FLUX 3 і розроблену спільно зі швейцарською компанією Mimic Robotics, одним з перших партнерів, що отримав ранній доступ.
Технічний блог описує два чіткі шляхи до прогнозування дій: інтеграція нативного прогнозування дій безпосередньо в FLUX 3, масштабуючи початкову роботу Self-Flow; та використання попередньо навченого відео-ядра як основи, що розуміє динаміку, з якої можна тонко налаштувати спеціалізовані моделі дій з обмеженими, специфічними для завдання даними. FLUX-mimic є другим шляхом – ядро FLUX 3 у поєднанні з досвідом Mimic у навчанні роботів та промисловому розгортанні для точних маніпуляцій.
FLUX-mimic розроблена для загальнопризначених роботизованих маніпуляцій: допомагає роботам розуміти візуальну сцену, прогнозувати наслідки дії та адаптуватися до нових завдань з набагато меншою кількістю специфічних для завдання даних.
BFL та Mimic Robotics стверджують, що залежно від складності завдання, модель може бути тонко налаштована для конкретного маніпуляційного завдання лише за 30 хвилин даних, отриманих від робота, тоді як попередні підходи вимагали 30 або більше годин.
“Найскладніша частина робототехніки – це дані”, – зазначив Елвіс Нава, технічний директор Mimic Robotics, у заяві, наданій VentureBeat. “Кожне нове завдання зазвичай вимагає години повторень роботом. Оскільки FLUX-mimic побудована на основі передових відеомоделей, які вже розуміють, як поводиться фізичний світ, вона опановує нове завдання за хвилини, а не дні. Таким чином, ми можемо перестрибнути поточний стан справ у навчанні роботів”.
BFL стверджує, що модель, навчена лише на зображеннях, не може зрозуміти світ, який “рухається, звучить, змінюється та реагує”, і що фізичне розуміння є основою для створення переконливого згенерованого відео. Google робить майже ідентичну заяву щодо Gemini Omni.
Документація для розробників цитує “знання світу”, яке поєднує “розуміння фізики” зі знанням історії, науки та культурного контексту Gemini. Їхній маркетинг ще більш прямолінійний: “Більшість ШІ-моделей просто прогнозують наступний піксель, щоб побудувати розповідь чи зображення. Gemini Omni відрізняється”, – повідомила компанія в червні, приписуючи моделі “інтуїтивне розуміння таких сил, як гравітація, кінетична енергія та гідродинаміка для більш реалістичних рухів, що відповідають логіці реального світу”.
Практичним наслідком для корпоративних покупців є те, що мова про “світову модель” не є диференціюючим фактором. Дві з трьох провідних відеосистем зараз позиціонують фізичне розуміння як свою головну перевагу, і жодна з них не опублікувала бенчмарк, який би його вимірював.
Не існує стандартного тесту, який би визначав, чи згенерована вода поводиться як вода, чи падаючий об’єкт падає з правдоподібною швидкістю, чи звук надходить одночасно з ударом. Рейтинги переваг користувачів опосередковано враховують деякі з цих аспектів. Ніщо інше з запропонованого взагалі цього не охоплює.
Відкриті ваги допомогли FLUX стати галузевим стандартом
BFL офіційно запустилася влітку 2024 року і за два роки здобула ім’я в галузі ШІ завдяки своїй прихильності до відкриття високоякісних моделей ШІ для зображень, які любили розробники, креативні спеціалісти та підприємства.
Засновники компанії, включаючи Ромбаха, Андреаса Блатманна та Патріка Ессера, раніше допомогли створити VQGAN, latent diffusion та Stable Diffusion. Останній є технологією з відкритим кодом, яка започаткувала широкі можливості ШІ-генерації для мас і наразі використовується багатьма генераторами зображень та компаніями, що працюють зі ШІ.
Це охоплення призвело до комерційного розповсюдження. Моделі FLUX зараз лежать в основі генеративних функцій у таких платформах, як Adobe Photoshop, Picsart та Hermes Agent від Nous Research, серед інших. Компанія називає режисера Мартіна Скорсезе серед професійних користувачів.
Журнал *Wired* описав Black Forest Labs як відносно невелику компанію, яка, тим не менш, стала провідним конкурентом найбільших лабораторій ШІ Кремнієвої долини. Моделі FLUX займають верхні позиції в бенчмарках зображень і є одними з найбільш завантажуваних моделей тексту до зображення на платформі спільного доступу до коду ШІ Hugging Face. Компанія стверджує, що зараз її команда налічує 100 осіб у Фрайбурзі та Сан-Франциско.
FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev та пов’язані з ними контрольні моделі, випущені незабаром після запуску фірми, надали дослідникам та розробникам інструментів для творчості доступ до завантажуваних чекпоінтів, локального висновку та інтеграцій з такими фреймворками, як Hugging Face Diffusers та ComfyUI. Наприклад, FLUX.1 Kontext Dev був випущений як модель з відкритими вагами для досліджень та некомерційного використання, з дозволом на комерційне використання згенерованих виводів відповідно до застосовної ліцензії.
Компанія продовжила цю практику з FLUX.2 Dev наприкінці 2025 року – модель з 32 мільярдами параметрів та відкритими вагами, що поєднує генерацію та редагування за кількома референсами. Black Forest Labs назвала її найпотужнішою моделлю для генерації та редагування зображень з відкритими вагами на момент випуску та надала ваги, референсний код для висновку та оптимізовані реалізації для споживчих GPU Nvidia.
FLUX 3 Dev підвищує ставки щодо цієї оцінки. Попередні релізи Dev були моделями для зображень. Цей же описється як мультимодальне ядро, що охоплює прогнозування відео, аудіо, зображень та дій. Це означає, що одна ліцензія регулюватиме, чи може компанія локально розгортати модель, яка стосується як виробництва контенту, так і фізичного обладнання. BFL ще не надала інформацію про свою ліцензію, кількість параметрів, квантизації або вимоги до обладнання.
Компанія розглядає відкриті ваги як функцію для корпоративних клієнтів, а не як жест спільноті, стверджуючи, що вони забезпечують безпечне локальне розгортання з низькою затримкою для таких програм, як системи керування роботами, і дозволяють командам адаптувати FLUX 3 до власних даних, продуктів та робочих процесів.
Фінансове підґрунтя FLUX 3 також варто відзначити поряд з технічними заявами. Оціночна вартість Black Forest Labs становить 3,25 мільярда доларів США, і компанія залучила понад 450 мільйонів доларів від інвесторів, включаючи a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva та T.Capital Deutsche Telekom.
Порада від INFBusiness:
FLUX 3 відкриває нові горизонти для створення контенту та автоматизації завдяки своїй мультимодальності та здатності до прогнозування дій. Якщо ваша компанія працює у сферах медіа, дизайну, реклами чи робототехніки, варто придивитися до можливостей FLUX 3 Video та FLUX 3 Action, особливо якщо вам потрібні довші відеокліпи або інтеграція з фізичними системами. Незважаючи на відсутність повної інформації про ціни та бенчмарки, ранній доступ та майбутні релізи з відкритими вагами свідчать про потенціал для інновацій та ефективності.
Інформація підготовлена на основі матеріалів: venturebeat.com
