FLUX 3 x mimic: 로봇을 위한 차세대 비디오-액션 모델
요약
FLUX 3와 mimic을 결합하여 비디오 생성 모델의 세계 표상 능력을 로봇 제어에 활용하는 차세대 비디오-액션 모델을 소개합니다. 동영상 생성 모델의 규모 확장이 로봇 훈련의 새로운 경로가 될 수 있음을 시사합니다.
핵심 포인트
- 멀티모달 동영상 모델 내부의 세계 표상을 로봇에 적용 가능
- 동영상 생성 역량을 활용한 로봇 훈련 사업 경로 제시
- 특수 장비 없이도 학습 가능한 모델의 잠재력 언급
- 비디오 생성 기술과 로봇 공학의 융합 트렌드
잘 훈련된 멀티모달 동영상 생성 모델 내부에는 세계 표상 모델이 형성되며, 이를 추출해 로봇에 적용해도 잘 작동하는 것으로 보임
동영상 모델이 물질과 빛, 세계를 이해한다는 발상은 새롭지 않지만, 동영상 연구소가 로봇 연구소로 전환한 경우는 드물었음. 동영상 생성으로 규모를 키운 뒤 그 역량으로 로봇을 훈련하는 사업 경로가 될 수 있음
장갑 안에 여러 장치를 숨긴 듯한 BFL의 손도 흥미로움. Xiami의 Robotics-1은 일반적인 그리퍼와 그리퍼형 장갑으로 훈련 영상을 만들지만, BFL 모델은 그런 장비가 필요 없어 보임. 하드웨어가 어려운 분야인 만큼 앞으로의 접근이 궁금함
“세계 이해가 필요한 작업에는 덜 분리된 표상이 덜 유용하다”는 설명에서, ‘더 얽힌’이라는 개념을 굳이 덜 분리된 표상으로 표현한 문장이 우스움. 현실 세계를 설명하면서 개념 자체도 더 얽히게 만드는 건 LLM다운 표현처럼 보임
이제는 근거 없이 문장마다 LLM의 흔적을 찾는 수준임. 모든 글이 어느 정도 LLM의 도움을 받았다고 가정하고 결과물의 품질만 평가할 때가 됐음
사람도 어색한 문장을 자주 씀. 오히려 그런 표현은 훈련 데이터에 드물어서 LLM이 만들 가능성이 사람보다 낮을 수도 있음
농담이었음
원문의 대시도 분명 LLM이 이 댓글을 썼다는 증거임 /s
기술은 이토록 발전했는데 영화는 어느 때보다 나빠진 듯해 슬픔. 괜찮은 작품을 찾으려고 수십 년 전 영화를 보곤 하는데, 우스꽝스러운 인형을 쓰고도 이야기 구성은 1,000배 뛰어났음
아무도 기억하지 않는 형편없는 옛 영화는 보지 않기 때문에 생기는 생존자 편향일 수 있음
Robin Rombach가 영화 제작을 모른다는 이유로 BFL 투자를 거절할 것인가? Sora는 끝났으며, Bill Peebles가 영화 제작을 모른다고 공개적으로 말할 용기 있는 사람을 찾기도 어려움
이는 벤처캐피털만의 문제가 아니며 이른바 Hollywood No와 연결됨. 반대로 Hollywood No 자체가 문제일 수도 있고, 게임 업계에서는 이를 독성 긍정주의라고 불러왔음
유럽 스타트업 간 협력을 보니 반가움
Flux는 Meta에 인수되지 않았나?
이것은 미래이면서 이미 현재임. 소프트웨어 개발·엔지니어링 바깥에 있는 지인에게도 이 내용을 공유해 주길 바람
생산수단을 소유하지 않은 인간의 가치가 더욱 낮아지는 위기를 향해 정면으로 달려가고 있음. 암울한 시기가 다가올 것으로 보임
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기