FLUX 3: что известно о мультимодальной модели в раннем доступе
Black Forest Labs открыла ранний доступ к FLUX 3: одна мультимодальная модель для видео со звуком до 20 секунд, изображений и предсказания действий.
Black Forest Labs 23 июля открыла ранний доступ к FLUX 3. Это первая модель лаборатории, которая выходит за пределы картинок: изображения, видео, звук и предсказание действий живут внутри одной архитектуры.
Логика простая. Изображение показывает структуру сцены, видео добавляет время и физику, звук выдаёт связь между ударом и его последствием. Модель, обученная на всём сразу, получает более цельное представление о мире, чем три отдельные модели под общим интерфейсом.
Что умеет FLUX 3 Video
Ролик до 20 секунд за одну генерацию, всегда с нативным звуком. Официальный список возможностей:
- текст в видео и изображение в видео: анимация стартового кадра или картинки как визуальные референсы;
- видео в видео с переносом персонажа или ключевых элементов исходного ролика в новую сцену;
- продолжение видео вместе со звуком;
- генерация по ключевым кадрам для управляемых переходов;
- многоязычные диалоги;
- широкий диапазон стилей и пропорций кадра, от любительской съёмки до анимации и кино;
- генерация типографики и анимированных надписей;
- агентная сборка отдельных клипов в многосценные последовательности.
Последний пункт важнее остальных. Именно склейка сцен с узнаваемым персонажем держала генеративное видео вне продакшена, и BFL обещает последовательности длиной в несколько минут за счёт визуальных референсов.
Картинки и роботы
FLUX 3 Image получит ранний доступ в ближайшие недели. По внутренним замерам на середине обучения модель заметно лучше прежних версий FLUX справляется со сложными промптами и точно рисует текст на разных языках, но бенчмарков по картинкам не опубликовано.
Третье направление — роботы. Вместе со швейцарской компанией mimic robotics вышла модель FLUX-mimic, которая управляет роботизированной рукой. Собрана она на той же основе, что генерирует видео.
Расчёт такой: модель, которая насмотрелась видео, уже представляет, как ведут себя предметы: что падает, что катится, что выскользнет из захвата. Это понимание нужно и роботу, поэтому его не учат физике заново, а только показывают конкретную работу.
Обычно новое движение приходится показывать роботу сотни раз, и на одну операцию уходит 30 часов записей и больше. По заявлению компаний, FLUX-mimic хватает получаса. Данные всегда были самым дорогим местом в робототехнике, поэтому цифра важная. Независимых проверок пока нет.
Что стоит держать в голове
Сравнения предварительные: 10-секундные ролики в 720p с аудио. FLUX 3 предпочли перед Luma Ray 3.2 в 93% случаев, Runway Gen-4.5 в 77%, Grok Imagine Video в 69%, Kling v3 Pro в 60%, Happy Horse v1 в 59%, Seedance 2.0 и Gemini Omni Flash в 52%. Сам график подписан как оценка раннего кандидата, то есть проверялась не та сборка, которая уходит в ранний доступ.
Нет цен, публичного API, обязательств по уровню сервиса и открытых весов. FLUX 3 Dev как открытый мультимодальный бэкбон обещают позже. Доступ пока по заявке, которую одобряет сама BFL.
По теме
Если вы уже строите видеопроизводство на генеративных моделях, ранний доступ к FLUX 3 стоит подать хотя бы ради теста склейки сцен. Тем, кто планирует бюджет, лучше дождаться цен и открытых весов.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.