이미지·영상·오디오 통합 FLUX 3 공개, 로봇 액션 모델 FLUX-mimic까지
#Black Forest Labs가 7/23 이미지·비디오·오디오를 단일 아키텍처로 함께 학습하는 멀티모달 파운데이션 모델(multimodal foundation model) FLUX 3를 Early Access로 공개했습니다. 네이티브 오디오가 포함된 최대 20초 영상을 text-to-video로 생성하고 Runway Gen-4.5 대비 77% 비교에서 우세했습니다. 같은 날 mimic robotics와 만든 로봇 video-action 모델 FLUX-mimic도 Audi 공장에 실제 배포했는데, 기존 30시간+가 필요하던 조작 태스크를 단 30분 데이터로 파인튜닝하고 RTX 5090 단일 GPU에서 backbone <80ms(엔드투엔드 101ms)로 구동합니다.
💡생성형 AI 랩이 로봇 액션까지 단일 백본으로 확장했습니다. 30분 데이터·단일 GPU 온프레미스 구동이라 생성 AI와 물리 AI(physical AI)의 경계가 좁혀지는 지점을 직접 확인할 수 있습니다.