이미지·영상·오디오 통합 FLUX 3 공개, 로봇 액션 모델 FLUX-mimic까지
Black Forest Labs가 7/23 이미지·비디오·오디오를 단일 아키텍처로 함께 학습하는 멀티모달 파운데이션 모델(multimodal foundation model) FLUX 3를 Early Access로 공개했습니다. 네이티브 오디오가 포함된 최대 20초 영상을 text-to-video로 생성하고 Runway Gen-4.5 대비 77% 비교에서 우세했습니다. 같은 날 mimic robotics와 만든 로봇 video-action 모델 FLUX-mimic도 Audi 공장에 실제 배포했는데, 기존 30시간+가 필요하던 조작 태스크를 단 30분 데이터로 파인튜닝하고 RTX 5090 단일 GPU에서 backbone <80ms(엔드투엔드 101ms)로 구동합니다.
💡생성형 AI 랩이 로봇 액션까지 단일 백본으로 확장했습니다. 30분 데이터·단일 GPU 온프레미스 구동이라 생성 AI와 물리 AI(physical AI)의 경계가 좁혀지는 지점을 직접 확인할 수 있습니다.
- 누가
- Black Forest Labs (로봇 부문은 mimic robotics 공동, Audi 공장 배포)
- 무엇을
- 이미지·비디오·오디오를 통합 학습하는 멀티모달 파운데이션 모델 FLUX 3 와 그 위에 세운 로봇 video-action 모델 FLUX-mimic 공개
- 언제
- 2026-07-23 (Early Access 공개)
- 왜
- 이미지 생성 전문 랩이 단일 통합 아키텍처로 비디오·오디오·로봇 액션까지 확장하고, world model 기반 물리 AI(physical AI)로 진출하기 위해
#multimodal#video-generation#robotics#flux#physical-ai