핵심 요약
AWS가 합성 데이터 없이 단안 영상에서 3D 장면 의미론을 추출하는 FRANTZ로 로봇 월드 모델을 학습하는 방법을 제시했습니다.
구현 방법
- MiDaS로 단안 깊이를 추정하고 intrinsics로 역투영해 프레임별 3D 포인트를 생성합니다(핸드 가시 시 10프레임마다, 움직임 없으면 20프레임마다).
- YOLO+MOG2로 손 등 변형 영역을 제외하고 Lucas-Kanade로 전역 카메라 모션을 추정해 배경을 안정화합니다.
- ORB 매칭으로 희소 포인트를 삼각측량하고 COLMAP 형식으로 내보내 3D 구조를 생성합니다.
- HSV 차이로 시퀀스 컷을 감지해 새 뷰를 생성하고 3d_structures.npz에 포인트/객체/평면/손궤적을 저장합니다.
- SDMA로 메타데이터와 출처를 관리하고, Graviton+COOL에서 OpenCV를 가속해 대규모 배치를 처리합니다.
- 향후 JEPA 스타일의 학습형 월드 모델로 확장하는 방향을 제시합니다.
주요 결과
- 단일 영상에서 3D 구조를 추출하고 3D 포인트 클라우드(수만~50만 점)와 손 궤적, 어포던스, 평면 정보를 얻습니다.
- COLMAP 내보내기와 어포던스 라이브러리 생성을 지원하는 3D 시맨틱 출력 파일을 제공합니다.



