pimenov.ai

FLUX 3: что известно о мультимодальной модели в раннем доступе

Black Forest Labs открыла ранний доступ к FLUX 3: одна мультимодальная модель для видео со звуком до 20 секунд, изображений и предсказания действий.

ОбзорИнструменты

Black Forest Labs 23 июля открыла ранний доступ к FLUX 3. Это первая модель лаборатории, которая выходит за пределы картинок: изображения, видео, звук и предсказание действий живут внутри одной архитектуры.

Логика простая. Изображение показывает структуру сцены, видео добавляет время и физику, звук выдаёт связь между ударом и его последствием. Модель, обученная на всём сразу, получает более цельное представление о мире, чем три отдельные модели под общим интерфейсом.

Что умеет FLUX 3 Video

Ролик до 20 секунд за одну генерацию, всегда с нативным звуком. Официальный список возможностей:

  • текст в видео и изображение в видео: анимация стартового кадра или картинки как визуальные референсы;
  • видео в видео с переносом персонажа или ключевых элементов исходного ролика в новую сцену;
  • продолжение видео вместе со звуком;
  • генерация по ключевым кадрам для управляемых переходов;
  • многоязычные диалоги;
  • широкий диапазон стилей и пропорций кадра, от любительской съёмки до анимации и кино;
  • генерация типографики и анимированных надписей;
  • агентная сборка отдельных клипов в многосценные последовательности.

Последний пункт важнее остальных. Именно склейка сцен с узнаваемым персонажем держала генеративное видео вне продакшена, и BFL обещает последовательности длиной в несколько минут за счёт визуальных референсов.

Картинки и роботы

FLUX 3 Image получит ранний доступ в ближайшие недели. По внутренним замерам на середине обучения модель заметно лучше прежних версий FLUX справляется со сложными промптами и точно рисует текст на разных языках, но бенчмарков по картинкам не опубликовано.

Третье направление — роботы. Вместе со швейцарской компанией mimic robotics вышла модель FLUX-mimic, которая управляет роботизированной рукой. Собрана она на той же основе, что генерирует видео.

Расчёт такой: модель, которая насмотрелась видео, уже представляет, как ведут себя предметы: что падает, что катится, что выскользнет из захвата. Это понимание нужно и роботу, поэтому его не учат физике заново, а только показывают конкретную работу.

Обычно новое движение приходится показывать роботу сотни раз, и на одну операцию уходит 30 часов записей и больше. По заявлению компаний, FLUX-mimic хватает получаса. Данные всегда были самым дорогим местом в робототехнике, поэтому цифра важная. Независимых проверок пока нет.

Что стоит держать в голове

Сравнения предварительные: 10-секундные ролики в 720p с аудио. FLUX 3 предпочли перед Luma Ray 3.2 в 93% случаев, Runway Gen-4.5 в 77%, Grok Imagine Video в 69%, Kling v3 Pro в 60%, Happy Horse v1 в 59%, Seedance 2.0 и Gemini Omni Flash в 52%. Сам график подписан как оценка раннего кандидата, то есть проверялась не та сборка, которая уходит в ранний доступ.

Нет цен, публичного API, обязательств по уровню сервиса и открытых весов. FLUX 3 Dev как открытый мультимодальный бэкбон обещают позже. Доступ пока по заявке, которую одобряет сама BFL.

По теме

Если вы уже строите видеопроизводство на генеративных моделях, ранний доступ к FLUX 3 стоит подать хотя бы ради теста склейки сцен. Тем, кто планирует бюджет, лучше дождаться цен и открытых весов.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov