Модель FLUX 3 научили управлять роботами: её уже тестируют на заводах Audi
Создатели FLUX доказали: модель, которая генерирует видео, понимает физику мира достаточно, чтобы управлять роботом. Разбираем, как FLUX-mimic дообучается на новую задачу за 30 минут и уже работает на конвейере Audi.
Новости TprogerЕсли вы следите за робототехникой, знайте: видеогенеративные модели добрались до заводского конвейера. Black Forest Labs (BFL), создатели генератора изображений FLUX, 23 июля 2026 года представили мультимодальную модель FLUX 3 — и её ранняя версия уже управляет роботами на производстве Audi.
Вместе со швейцарской компанией mimic robotics BFL построила FLUX-mimic — видео-экшен-модель (video-action model) поверх бэкбона FLUX 3. Идея в том, что модель, которая учится генерировать реалистичное видео, вынуждена понимать физику мира: контакт, вес, движение, причину и следствие. А раз физика уже «внутри» — из внутреннего представления модели можно напрямую декодировать действия робота.
Ключевые выводы
BFL представила FLUX 3 — единую модель, обученную сразу на изображениях, видео и аудио; на предсказание видео ушло более 95% вычислительных затрат.
FLUX-mimic — видео-экшен-модель для роботов на бэкбоне FLUX 3, разработанная с mimic robotics и развёрнутая на производстве Audi.
Новая задача манипуляции требует всего от 30 минут робот-данных против 30 и более часов у прежних подходов.
Бэкбон работает менее чем за 80 мс на одной RTX 5090, а полное время реакции робота — 101 мс, что сопоставимо с человеческой зрительной реакцией.
Что показали BFL и mimic
FLUX-mimic решает задачи, которые десятилетиями оставались ручными даже на сверхавтоматизированных производствах: комплектация деталей в лотки, установка электронных блоков управления в тугие крепления, сборка компонентов и работа с мягкими материалами — уплотнителями и кабелями. Робот при этом сам восстанавливается после ошибок: промахнулся мимо детали — поправился и взял снова, хотя такого сценария не было в обучающих данных.

Ключевой эксперимент: когда в обучение FLUX 3 добавили предсказание действий, качество видеогенерации временно просело на 10%, но уже через 3500 шагов полностью восстановилось — при том что модель научилась новой модальности. По версии BFL, генерация видео и управление роботом не требуют разных фундаментов: один бэкбон несёт обе задачи.
Мы видели, как эти роботы решают сложные задачи манипуляции мягкими объектами, которые были просто невозможны для традиционной робототехники. Это может серьёзно помочь нашим сотрудникам, повысить эффективность и расширить гибкую автоматизацию производства и логистики.
Почему это важно
Главная боль робототехники — данные: обучение робота новой задаче обычно требует десятки часов демонстраций. FLUX-mimic, по данным компаний, дообучается на новую манипуляцию примерно за 30 минут робот-данных, а в экспериментах на базе метода Self-Flow и работы mimic-video показывает до 10-кратной эффективности по данным в сравнении с классическими vision-language-action моделями. На бенчмарках декодер действий обошёл прежние VLA-модели даже с полностью замороженным бэкбоном — режим, в котором конкуренты вообще не справляются.
Сам FLUX 3 при этом остаётся генеративной моделью: он создаёт видео до 20 секунд с синхронным звуком и в ранних тестах BFL обошёл Runway Gen-4.5 в 77% сравнений. Ранний доступ к FLUX 3 Video и FLUX 3 Action уже открыт, генерация изображений выйдет в ближайшие недели, а открытые веса FLUX 3 Dev обещают позже в 2026 году.
Часто задаваемые вопросы
Что такое FLUX-mimic?
Видео-экшен-модель для роботов, построенная Black Forest Labs и mimic robotics поверх мультимодальной модели FLUX 3. Она декодирует действия робота из внутреннего представления мира, которое FLUX 3 выучила при обучении видеогенерации.
Где уже применяется модель?
FLUX-mimic тестируется и развёртывается на производстве Audi: комплектация деталей, установка электронных блоков, сборка и работа с мягкими материалами вроде уплотнителей и кабелей.
Сколько данных нужно для новой задачи?
По данным компаний, дообучение на конкретную задачу манипуляции занимает от 30 минут робот-данных — раньше для этого требовалось 30 и более часов демонстраций.
На каком железе работает система?
Бэкбон FLUX-mimic обсчитывает сцену менее чем за 80 мс на одной NVIDIA RTX 5090, а полное время реакции робота — 101 мс.
Вывод. BFL делает ставку на то, что «модель мира», выученная ради видеогенерации, — это и есть фундамент для физического ИИ. Показательно, что первым проверенным в бою применением стала не демка, а реальный конвейер Audi. Подробности — в блоге Black Forest Labs и в пресс-релизе.