FLUX 3의 핵심: 멀티모달 기반의 비디오-액션 모델 아키텍처 분석
95%의 연산량을 비디오 예측에 할애하여 물리 법칙을 학습하도록 설계된 FLUX 3의 기술적 배경과 로봇 제어 가능성을 분석함.
요약
BFL은 차세대 멀티모달 파운데이션 모델인 FLUX 3를 공개하고, 이를 로봇 기업 mimic robotics와 협업하여 로봇 제어 모델인 FLUX-mimic으로 발전시켰다. 기존 FLUX 1과 2가 이미지 생성에 집중했다면, FLUX 3는 이미지, 비디오, 오디오를 통합 학습하여 물리 세계의 인과관계와 상호작용을 이해하는 세계 모델로 진화했다. 특히 전체 연산 비용의 95% 이상을 차지하는 비디오 예측 학습을 통해 로봇이 물리적 접촉, 무게, 동작 등을 정밀하게 제어할 수 있도록 설계되었다. 실제로 FLUX-mimic은 아우디(Audi) 공장에 배치된 로봇에 적용되어 실증을 마친 상태다. 이 모델은 단순히 콘텐츠 생성에 그치지 않고 물리적 세계의 거동을 학습함으로써 로봇 제어와 같은 실질적인 자동화 기술의 핵심 기반으로 활용될 전망이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Flux 3 X Mimic: The Next Generation of Video-Action Models
원문 보기 ↗