Simulating everything, sort of: The promise and limits of world models
개요
월드 모델(World Models)은 물리적 세계를 시뮬레이션하거나 근사적으로 이해하는 AI 시스템 구축을 목표로 하며, LLM의 한계를 극복하고 로보틱스, 연구, 콘텐츠 생성 등 다양한 분야에 적용될 가능성을 보여주고 있다.
주요 내용
* LLM의 한계와 월드 모델의 부상: LLM이 언어 이해 및 생성에 집중하는 반면, 월드 모델은 물리적 세계와의 상호작용 및 시뮬레이션에 초점을 맞춰 AI의 다음 프론티어로 주목받고 있다. Yann LeCun, Fei-Fei Li 등 AI 전문가들은 LLM의 한계를 지적하며 월드 모델의 중요성을 강조하고 있다.
* 월드 모델의 정의와 특성: 월드 모델은 입력된 상호작용을 바탕으로 환경에서 다음에 일어날 일을 시뮬레이션할 수 있는 모델이다. 물리적, 기하학적 일관성을 갖추고 멀티모달하며, 입력 행동에 따라 다음 상태를 출력할 수 있는 것으로 정의된다. LLM과는 달리 순차적인 텍스트 응답이 아닌, 공간적이고 연속적인 이해를 바탕으로 실시간 상호작용이 가능하다.
* 주요 기업들의 월드 모델 개발: Google DeepMind의 Genie 3, World Labs의 Marble, Runway의 GWM-1 등 다양한 기업들이 월드 모델 개발에 뛰어들고 있으며, 상당한 규모의 투자를 유치하고 있다. 이러한 노력은 AGI 또는 초지능 구축의 기반 마련이라는 장기적인 목표와 함께 로보틱스 훈련, 3D 에셋 생성, 과학 시뮬레이션 등 실용적인 애플리케이션을 목표로 한다.
* 비디오 생성을 기반으로 한 월드 모델: 현재 많은 월드 모델은 비디오 생성을 핵심 기능으로 삼고 있다. Runway의 GWM-1과 같은 모델은 기존 비디오 생성 기술을 확장하여 카메라 제어 및 환경 탐색과 유사한 경험을 제공한다. 이를 위해 기존의 동시 프레임 생성 방식 대신, 사용자 입력에 따라 프레임을 순차적으로 생성하는 autoregressive diffusion 방식을 활용한다.
* "쓰디쓴 교훈"과 스케일링의 중요성: 월드 모델 개발은 '쓰디쓴 교훈(the bitter lesson)' 원칙에 따라, 인공적인 지식 주입보다는 대규모 컴퓨팅 파워와 데이터 기반 학습을 통해 스스로 세상의 구조를 학습하는 방식에 집중하고 있다. 명시적인 3D 표현이나 물리 법칙을 모델 설계에 직접적으로 넣기보다, 비디오 데이터로부터 3D 공간 및 물리적 상호작용을 잠재 공간(latent space)에서 학습하도록 하는 접근 방식이 주를 이룬다.
* 다양한 접근 방식과 출력 형태: 월드 모델은 비디오 생성 외에도 다양한 형태로 발전하고 있다. 일부 모델은 로보틱스 훈련이나 연구를 위해 비디오를 직접 출력하지 않고, 다른 모델은 비디오와 함께 3D 에셋(meshes, Gaussian splats 등)을 생성하기도 한다. Yann LeCun의 JEPA는 픽셀 단위 생성 대신 장면의 추상적 상태 예측에 초점을 맞춘다. World Labs는 NeRF와 Gaussian splats를 활용하여 3D 구조를 추론하고 실제 3D 워크플로우에 통합 가능한 에셋을 제공한다.
* 동적인 세계 시뮬레이션의 과제: 현재 많은 월드 모델은 정적인 환경 시뮬레이션에 머물러 있으며, 실제 세계처럼 움직이는 동적인 요소를 생성하고 상호작용을 시뮬레이션하는 것은 여전히 큰 과제이다. World Labs는 3D 에셋 출력을 통해 즉각적인 사용 가능성을 높였지만, 동적인 요소 구현을 연구 중이다. Runway는 동적 시뮬레이션에 강점을 보이나, 아직 일반 사용자에게 공개되지 않았다.
* 로보틱스 훈련 데이터 문제 해결 가능성: 월드 모델은 로보틱스, 특히 복잡한 환경에서의 훈련 데이터 부족 문제를 해결할 잠재력을 지닌다. 실제 로봇을 통한 데이터 수집은 비용이 많이 들고 위험할 수 있으나, 월드 모델은 시뮬레이션을 통해 안전하고 다양하며 대규모의 훈련 데이터를 생성하여 로봇의 학습을 도울 수 있다.
* 물리 법칙에 대한 잠재적 이해: 월드 모델은 명시적인 물리 법칙에 기반하지 않더라도, 비디오 예측을 통해 객체의 움직임, 환경과의 상호작용 등 물리적 세계에 대한 유용한 근사치를 잠재 공간에서 학습할 수 있다는 것이 전문가들의 견해이다.
시사점
월드 모델은 LLM의 한계를 넘어 물리적 세계를 이해하고 시뮬레이션하는 AI의 새로운 지평을 열며, 로보틱스, 콘텐츠 생성, 과학 연구 등 다양한 산업 분야에서 혁신을 가속화할 것으로 기대된다.
댓글
GitHub Discussions