WAIC 2026 세계 모델 토론: 6개 로봇 팀이 물리, 표현, 촉각 센싱 및 배치를 논의하다
세계 모델은 구현 지능 분야에서 가장 활발한 연구 방향 중 하나가 되었지만, 해당 분야는 여전히 통일된 정의가 부족합니다. 연구자들은 여러 문제에 대해 의견이 분분합니다: 세계 모델은 무엇을 표현해야 하는가? 물리 모델링의 정밀도 요구는 어느 정도인가? 미래 상태는 픽셀 공간에서 생성되어야 하는가, 잠재 공간에서 생성되어야 하는가? 로봇은 행동하기 전에 얼마나 많은 예측을 수행해야 하는가? 어떤 데이터 모달리티가 가장 중요한가? 심지어 진행 상황을 어떻게 측정할지에 대해서도 의견이 갈립니다. WAIC 2026에서는 이러한 합의 부족이 특히 두드러졌습니다. 7월 19일, 한 토론이

WAIC 2026 세계 모델: 6개 임베디드 지능 기업의 의견 차이와 공통점
서론
세계 모델은 임베디드 지능 분야에서 가장 활발한 연구 방향 중 하나가 되었지만, 해당 분야는 여전히 통일된 정의가 부족합니다.
연구자들은 세계 모델이 무엇을 표현해야 하는지, 물리 모델링이 어느 정도까지 정밀해야 하는지, 미래 상태를 픽셀 공간에서 생성할지 잠재 공간에서 생성할지, 로봇이 행동하기 전에 얼마나 많은 예측을 수행해야 하는지, 어떤 데이터 모달리티가 가장 중요한지, 심지어 연구 진행 상황을 어떻게 측정할지에 대해 의견이 갈리고 있습니다.
이러한 공감대의 부재는 WAIC 2026에서 특히 두드러지게 나타났습니다.
7월 19일, 6개 중국 임베디드 지능 기업이 주최한 포럼에는 다양한 로봇 세계 모델 기술 경로를 대표하는 기술 리더들이 모였습니다:
- 사회자: 하이대청, ACE 로보틱스 수석 과학자
- 셴쉐쥔, 앤트그룹 Roboyant 팀 수석 과학자
- 주정, GigaAI 공동 창업자 겸 수석 과학자
- 샤중푸, 무제동력 공동 창업자 겸 공동 CTO
- 런광후이, AgiBot AI 알고리즘 총괄
- 왕하오, X Square Robot 공동 창업자 겸 CTO
이 토론의 가치는 바로 발언자들이 단일한 기술 솔루션에 도달하지 않았다는 점에 있습니다.
어떤 이들은 세계 모델이 기하학, 운동, 역학을 점점 더 정확하게 표현하기를 바랍니다. 다른 이들은 모델이 성공적인 동작을 선택하기에 충분한 물리적 구조를 예측할 수 있는지에 더 관심을 둡니다.
어떤 이들은 장기적 시간 영역 일관성이 중요하다고 생각합니다. 다른 이들은 예측이 로봇의 의사 결정 창을 너무 많이 소모할 때 오히려 역효과를 낼 수 있다고 주장합니다.
어떤 이들은 해당 분야가 어떤 공유 표현을 중심으로 합의에 도달할 것으로 예상합니다. 다른 이들은 혼합 아키텍처, 촉각 감각 또는 표준화된 벤치마크가 먼저 합의의 출발점이 될 것이라고 생각합니다.
이러한 의견 차이 뒤에는 더 실용적인 문제가 있습니다:
세계 모델이 데모 시나리오를 넘어 실제 가치를 발휘하려면 어떤 능력을 갖춰야 할까요?

세 가지 주요 기술 경로
이 6개 기업은 완전히 동일한 아키텍처를 사용하지는 않지만, 모델이 세계를 예측하는 방식에 따라 원탁 토론을 대략 세 가지 기술 경로로 요약할 수 있습니다.
| 경로 | 대표적 방법 | 핵심 개념 |
|---|---|---|
| 픽셀 공간 생성 | GigaAI | 미래 시각 상태를 직접 예측하거나 생성적 시각 표현을 통해 예측 |
| 잠재 공간 예측 | 무제동력의 JEPA 방향 | 전체 픽셀이 아닌 압축된 내부 표현 예측 |
| 혼합 또는 통합 아키텍처 | ACE 로보틱스, Roboyant, X Square Robot, AgiBot | 생성, 잠재 공간 예측, 명시적 공간 추론, VLA 제어 또는 시뮬레이션 기반 모델 결합 |
이러한 분류는 참고 가치가 있지만, 영구적인 업계 분류 기준으로 간주되어서는 안 됩니다.
이 중 몇몇 기업은 이미 여러 메커니즘을 통합하고 있습니다. 더 중요한 차이는 각 팀이 유용한 세계 모델이 유지해야 한다고 생각하는 능력에 있습니다.
어떤 능력이 가장 중요한가?
첫 번째 주요 차이는 세계 모델이 물리학과 연결되는 방식에 관한 것입니다.
관점 1: 물리적 상태 예측은 정밀해야 한다
샤중푸는 평가에 기하학적 상태, 운동 궤적, 역학적 작용 및 관련 물리량 예측의 정확성이 포함되어야 한다고 생각합니다.
이 관점은 세계 모델을 부분적으로 물리적 상태의 구조화된 예측기로 간주합니다.
밀고, 잡고, 들어 올리고, 탐색하거나 물체를 조작해야 하는 로봇의 경우 관련 질문은 다음과 같을 수 있습니다:
- 물체는 어디로 이동할까?
- 다른 물체와 충돌할까?
- 방향은 어떻게 변할까?
- 얼마나 많은 힘을 가해야 할까?
- 잡기가 안정적으로 유지될까?
- 동작 완료 후 환경은 어떤 상태일까?
암시적 표현은 명시적 물리 추정을 더 매력적으로 만듭니다. 모델이 이러한 양을 추정하기 전에 모든 미래 픽셀을 렌더링할 필요가 없기 때문입니다.
장점은 정확성과 제어 가능성입니다.
어려움은 물리적 세계에 마찰력, 숨겨진 질량 분포, 유연성, 접촉 상태 및 재료 속성과 같이 직접 관찰하거나 추론하기 어려운 변수가 포함된다는 점입니다.
따라서 모델은 완전한 시뮬레이터가 되지 않으면서도 물리적 구조화 특성을 가질 수 있습니다.
관점 2: 물리적 합리성이 정밀한 물리보다 더 중요할 수 있다
셴위쥔은 다른 기준을 제시했습니다.
로봇이 반드시 물리적 시스템의 모든 매개변수를 재현할 필요는 없지만, 곧 수행할 동작에 중요한 차이점은 이해해야 합니다.
예를 들어, 두 가지 재료가 던져지고, 압축되고, 끌리거나 잡힐 때, 로봇은 각 계수를 미리 추정할 필요 없이 다른 반응을 인식해야 할 수 있습니다.
이는 완전한 물리 시뮬레이션보다 동작 관련 물리 이해에 더 가깝습니다.
두 가지의 차이는 다음과 같이 요약할 수 있습니다:
정밀한 물리 시뮬레이션:
가능한 한 정확하게 세계의 상세한 상태를 예측합니다.
동작 관련 물리 추론:
안전하고 효과적인 동작을 선택하는 데 충분한 세계 상태를 예측합니다.
두 번째 목표는 계산 비용이 더 낮고 많은 실제 로봇 작업에 충분합니다.
이는 또한 모든 잠재적 물리 변수를 명시적으로 드러내지 않더라도 어떤 미래 시각 표현이 합리적인지 자연스럽게 학습하는 비디오 생성 모델에서 비롯된 시스템 설계 철학과 일치합니다.
핵심 문제: 어떤 오류가 행동을 바꾸는가?
전문가 패널의 의견 차이는 더 실용적인 평가 기준을 가리킵니다:
예측 오류가 로봇의 의사 결정을 변경할 때 그 오류가 가장 중요합니다.
로봇이 테이블의 정확한 마찰 계수를 추정하지 않고도 컵을 성공적으로 놓을 수 있다면 해당 값의 누락은 중요하지 않을 수 있습니다.
그러나 이러한 물리 이해의 부족으로 컵이 떨어진다면 이 오류는 매우 중요합니다.
따라서 필요한 물리적 충실도는 다음에 따라 달라집니다:
- 구체적인 작업
- 안전 마진
- 로봇 본체 설계
- 동작 시간 범위
- 실패 비용
- 추론에 사용 가능한 시간
장기적 일관성인가 빠른 의사 결정인가?
두 번째 차이는 세계 모델이 미래를 얼마나 멀리 예측해야 하는지에 관한 것입니다.
지위안 로봇:
장기 물리적 일관성이 중요하다
지위안 로봇은 시뮬레이션과 세계 모델 기반 평가에 많은 자원을 투자했습니다.
공개된 지위안 디지털 월드 프레임워크는 고충실도 시뮬레이션 환경, 자동 생성된 전문가 궤적 및 모델 평가 도구를 제공합니다.
지위안 로봇은 이후 EVAC 세계 모델 프레임워크와 EWMBench를 출시하여 동작 조건 생성적 시뮬레이션 개념을 더욱 확장했습니다.
시뮬레이터로 사용되는 세계 모델의 경우 장기적 일관성이 중요합니다.
다음과 같은 경우 시뮬레이션의 가치는 크게 줄어듭니다:
- 물체의 정체가 점차 변함
- 기하학적 구조가 표류함
- 로봇이 이전 상호작용을 잊어버림
- 긴 시퀀스가 물리적 상태를 위반함
- 다중 시점 출력 결과가 일관되지 않음
따라서 세계 모델은 의미 있는 시간 범위 내에서 일관된 상태를 유지해야 합니다.
X Square Robot: 장기 추론이 잘못된 목표가 될 수 있다
왕하오는 "더 긴 예측이 항상 더 좋다"는 가정에 의문을 제기했습니다.
X Square Robot은 인식, 추론, 세계 모델링 및 동작 생성을 긴밀하게 결합한 엔드 투 엔드 임베디드 모델 경로를 채택합니다.
공개 자료에서 WALL 시리즈는 세계 예측과 로봇 제어를 고립된 시스템으로 취급하지 않고 통합된 물리 세계 모델을 향한 것으로 설명됩니다.
이러한 시스템에서 세계 모델은 단순한 시뮬레이터가 아닙니다. 예측 자체가 제어 루프의 일부입니다.
따라서 더 긴 추론은 다음과 같은 비용을 발생시킵니다:
예측하는 미래가 더 멀수록
→ 추론량 증가
→ 지연 시간 증가
→ 행동에 사용 가능한 시간 감소
로봇이 있는 환경의 변화 속도가 모델이 추론을 완료하는 속도보다 빠르다면, 완벽하게 일관된 장기 예측은 운영 측면에서 전혀 쓸모가 없을 수 있습니다.
제어 측면에서는 적시에 도착하는 짧은 예측이 너무 늦게 도착하는 긴 예측보다 훨씬 더 가치 있을 수 있습니다.
예측 시간 영역은 제어 시간 영역과 일치해야 한다
이는 유일하게 최적의 예측 길이가 존재하지 않음을 시사합니다.
창고 시뮬레이터는 긴 시퀀스 예측이 필요할 수 있습니다.
물체 균형 작업을 수행하는 로봇은 매우 빠른 단기 예측이 필요할 수 있습니다.
다단계 작업을 처리하는 모바일 매니퓰레이터는 다음을 모두 필요로 할 수 있습니다:
- 장기 계획
- 단기 물리 예측
- 빠른 폐쇄 루프 수정
따라서 합리적인 설계는 단일한 전체 길이 세계 모델보다 여러 시간 영역을 포함할 수 있습니다.

현재 공개된 시스템은 이러한 차별화된 초점을 반영하고 있습니다
포럼에서 제시된 의견 차이는 각사의 공개 기술 시스템에서 이미 드러나고 있습니다.
시대적 임베디드 인텔리전스: 이해, 예측, 행동의 통합
WAIC 2026에서 시대적 임베디드 인텔리전스는 행동 중심의 임베디드 세계 모델인 Kairos 3.1을 발표했습니다.
공개된 발표 자료는 이해, 세계 추론, 행동, 반성을 연결하도록 설계된 하이브리드 트랜스포머 아키텍처를 설명합니다.
시대적 임베디드 인텔리전스는 또한 자사의 80억 파라미터 Kairos 3.1 모델이 NVIDIA 플랫폼에서 125밀리초의 추론 지연 시간을 기록했다고 보고했습니다.
Jetson Thor는 BF16 정밀도를 사용합니다. 이 사양은 회사가 이 모델을 단순한 오프라인 비디오 생성기가 아닌 로봇 행동을 위한 엣지 시스템으로 명확히 포지셔닝했기 때문에 매우 중요합니다.
Ant Group / Robbyant: 대화형 세계 시뮬레이션에서 임베디드 네이티브 모델로
Robbyant가 오픈소스로 공개한 LingBot-World는 생성형 비디오 방향에서 시작되었습니다. 공식 코드 저장소 설명은 다음과 같습니다: 고충실도 상호작용 환경, 장기 시간적 일관성, 실시간 사용자 제어, 서브초 단위 상호작용 지연 시간, Fast 버전에서 초당 16프레임의 실시간 생성 능력. Ant Group은 이후 LingBot-World-Fast를 Lingguang 모바일 제품에 통합하여 사용자가 단일 이미지를 탐험 가능한 생성형 세계로 변환할 수 있도록 했습니다. 동시에 Robbyant는 VLA 및 임베디드 모델 연구 분야로 확장하여 단일 세계 모델 패러다임 팀에 국한되지 않는 대표적인 사례가 되었습니다.
GigaAI: 픽셀 생성과 GigaWorld 플랫폼
GigaAI는 세 가지 계층으로 구축된 임베디드 인텔리전스 및 범용 로봇 공학 회사로自称합니다: GigaWorld(세계 모델 플랫폼), GigaBrain(범용 임베디드 인텔리전스 시스템), Maker(로봇 임베디드 캐리어). 이 회사의 세계 모델 작업은 데이터 생성, 훈련 및 테스트를 가속화하는 데 있어 생성형 물리적 환경의 핵심 역할을 강조합니다. 세계 모델이 시각적으로 풍부한 시뮬레이터로 사용될 때 픽셀 공간 생성이 특히 중요해집니다.
Zhiyuan Robot: 생성형 시뮬레이터로서의 세계 모델
Zhiyuan Robot의 공개 작업은 특히 시뮬레이터 사용 시나리오를 명확히 보여줍니다. AgiBot Digital World는 3D 자산, 물리 시뮬레이션, 전문가 궤적 생성, 도메인 무작위화, 데이터 생성 및 모델 평가를 통합합니다. 후속 EVAC 프레임워크는 로봇의 행동 시퀀스를 기반으로 미래의 시각적 상태를 생성할 수 있습니다. 이러한 응용 분야에서는 시간적 일관성과 행동-환경 상호작용의 정확한 재현이 매우 중요합니다.
Xingdong epoch: 세계 모델과 VLA의 융합
Xingdong epoch의 공식 개발 과정에 따르면, 자사의 WALL-A 아키텍처는 VLA 모델과 세계 모델을 심층적으로 통합합니다. 2026년의 WALL-B 방향은 회사가 세계 통합 모델 아키텍처라고 부르는 방향으로 더 나아갑니다. 기술적 목표는 세계 모델이 독립적으로 예측하고, 이후 독립적인 정책이 예측 결과를 행동으로 변환하는 파이프라인 방식을 피하고, 예측과 제어 프로세스를 통합된 엔드투엔드 시스템으로 결합하는 것입니다.
Muljoe Power: 임베디드 네이티브 세계 모델과 잠재 공간 예측
Muljoe Power의 공개 자료에 따르면, 회사는 로봇의 "범용 두뇌"와 세계 모델 기반의 임베디드 네이티브 멀티모달 기초 모델 시스템을 구축하고 있습니다. Xia Zhongpu는 2026년 3월에 Li Auto에서 엔드투엔드 자율 주행을 주도한 후 이 회사에 합류했습니다. 이 회사의 연구 방향은 잠재 공간 예측, 물리량 및 JEPA 스타일 사고를 강조합니다. 현재 세계 모델에 대한 상세한 공개 기술 문서가 여전히 제한적이기 때문에, 정확한 아키텍처에 대한 주장은 완전히 문서화된 공개 모델이 아닌 경영진이 설명한 기술 방향으로 간주되어야 합니다.
가장 먼저 합의에 도달할 가능성이 가장 높은 것은 무엇입니까?
다음 질문은 어떤 아키텍처가 결국 승리할 것인가가 아닙니다.
오히려:
이 분야의 어떤 부분이 가장 먼저 합의에 도달할 것인가?
답은 상당히 다양합니다.
후보 1: 통합 표현
Ren Guanghui와 Xia Zhongpu는 모두 표현의 중요성을 강조했습니다.
대규모 언어 모델은 결국 토큰화된 시퀀스 표현을 중심으로 수렴하여 다양한 작업이 하나의 아키텍처와 호환될 수 있게 되었습니다.
임베디드 인텔리전스는 여전히 동일한 수준의 범용 기본 단위가 부족합니다.
로봇의 작업은 다음을 포함합니다:
- 이미지
- 비디오
- 언어
- 관절 위치
- 속도
- 힘
- 촉각 신호
- 3D 기하학
- 행동
- 보상
- 환경 상태
이러한 양식이 서로 고립되어 있다면, 각 시스템은 그들 사이에 복잡한 다리를 구축해야 합니다.
통합 표현을 통해 모델은 동일한 공유 공간 내에서 지각, 상태, 예측 및 행동에 대한 추론을 수행할 수 있습니다.
도전 과제는 물리적 신호가 본질적으로 상호 교환 가능하지 않다는 점에 있습니다.
촉각 펄스, 카메라 프레임, 그리퍼 명령은 각각 다른 속도로 작동하고 다른 정보를 전달합니다.
따라서 "로봇 토큰"은 텍스트 토큰보다 정의하기 훨씬 어려울 수 있습니다.
후보 2: 하이브리드 아키텍처
Wang Hao의 예측은 아키텍처 융합입니다.
이 관점에서 볼 때, 서로 다른 세계 모델 접근 방식은 각각 문제의 일부를 해결합니다:
- 비디오 생성은 시각적 미래 예측에 탁월합니다.
- 잠재 예측은 추론에 효율적입니다.
- 명시적 3D 모델은 공간 기억을 제공합니다.
- VLA 모델은 지각과 행동을 연결합니다.
- 고전적 제어는 결정론적 하위 수준 안정성을 제공할 수 있습니다.
최종 아키텍처는 하나를 선택하고 나머지를 버리기보다 이러한 메커니즘을 결합할 가능성이 높습니다.
이러한 패턴은 AI 분야에서 흔히 볼 수 있습니다.
처음에 경쟁했던 기술들은 장단점이 명확해지면 종종 더 큰 시스템의 구성 요소가 됩니다.
후보 3: 촉각 인식
Shen Yujun은 촉각 정보가 산업이 가장 먼저 합의에 도달할 수 있는 분야 중 하나가 될 수 있다고 생각합니다.
현재 대부분의 대규모 세계 모델은 주로 시각 및 언어 데이터로 훈련됩니다.
로봇은 접촉을 통해 조작합니다.
다음을 감지해야 합니다:
- 물체가 미끄러지고 있는지 여부
- 표면이 단단한지 부드러운지
- 그립이 안정적인지 여부
- 얼마나 많은 힘이 가해졌는지
- 변형 가능한 물체의 모양이 변경되었는지 여부
- 시야가 가려져도 접촉이 발생했는지 여부
조작 작업의 경우, 촉각이 가장 유용한 순간에 시각이 모호해질 수 있습니다.
이는 촉각 인식이 모델 훈련 후 추가되는 선택적 센서가 아닌 기본 양식으로 존재해야 한다는 강력한 주장입니다.
Robbyant의 연구 방향은 또한 디지털 비디오 기반 모델에서 임베디드 제어를 중심으로 설계된 모델로의 광범위한 전환을 반영합니다.
중요한 차이점은 다음과 같습니다:
비디오 모델의 목표는 그럴듯한 미래를 생성하는 것입니다.
임베디드 세계 모델의 목표는 성공적인 행동을 지원하는 것입니다.
이 두 목표는 겹치지만 동일하지는 않습니다.
후보 4: 공유 벤치마크
Tao Dacheng은 다른 답변을 제시합니다: 수렴은 아키텍처가 아닌 평가에서 먼저 발생할 수 있습니다.
이에 대한 역사적 선례가 있습니다.
컴퓨터 비전은 연구자들이 사전에 하나의 표현에 합의했기 때문에 수렴된 것이 아닙니다. ImageNet과 같은 공유 데이터 세트와 벤치마크는 경쟁 시스템에 공통적인 측정 목표를 제공했습니다. 모든 시스템이 동일한 척도로 평가되면, 약한 아이디어는 더 빨리 사라지고 유용한 아이디어는 아키텍처 경계를 넘어 확산될 수 있습니다. 이것이 바로 포럼에서 물리 지능 지수가 공개된 배경에 있는 논리입니다.
물리 지능 지수: 임베디드 인텔리전스를 위한 통일된 척도
물리 지능 지수는 2026 세계 인공지능 컨퍼런스에서 임베디드 물리 지능을 위한 통일된 벤치마크로 도입되었습니다. 공개된 정보에 따르면, 이 이니셔티브는 다음 기관이 공동으로 시작했습니다:
- 상하이 인공지능 협회
- 선전 순환 경제 연구원
- 중국 정보 통신 연구원 화동 지부
20개 이상의 대학 및 산업 기관이 참여하고 있습니다. 이 플랫폼은 다음 차원에서 서로 다른 시스템을 비교하는 것을 목표로 합니다:
- 다양한 로봇 형태
- 다양한 실제 세계 시나리오
- 다양한 작업 범주
- 통일된 평가 프로토콜

해당 이미지는 문서에서 소개된 '6대 용' 원탁 토론 내용과 관련되어 있으며, 토론 참가자들을 시각적으로 보여줍니다.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/c242a920-2b42-4966-92ce-2e70518c2ac6-7fb4c60a-1a46-46c3-9743-2b5a5a5a322e.jpeg)
유용한 물리 지능 벤치마크는 단순히 생성된 영상이 사실적으로 보이는지 여부에만 의존해서는 안 됩니다. 다음 질문을 제기해야 합니다.
- 로봇이 작업을 완료했는가?
- 동작이 물리적으로 유효한가?
- 예상치 못한 상황으로부터 회복하는가?
- 얼마나 많은 개입이 필요한가?
- 행동이 안전한가?
- 전략이 새로운 환경으로 전이되는가?
- 물체와 형태에 걸쳐 얼마나 일반화가 잘 되는가?
- 각 결정에 얼마나 많은 시간과 계산이 필요한가?
물리 지능의 구체적인 방법론은 지속적으로 공개 문서화되고 널리 채택되어야 진정한 업계 표준이 될 수 있습니다. 그럼에도 불구하고, 이 방향은 실제 문제를 해결합니다. 현재 다양한 세계 모델에 대한 주장들은 비교하기 어려운데, 한 회사는 비디오 품질을 보고하고, 다른 회사는 작업 성공률을, 세 번째 회사는 물리 상태 오차를, 네 번째 회사는 시뮬레이터 일관성을 보고할 수 있기 때문입니다. 통일된 척도가 없으면 각 시스템은 자체적으로 최적화된 지표에서 가장 강력해 보일 수 있습니다.
시각적 사실성이 곧 물리적 이해는 아니다
물리 지능에 대한 논의는 생성형 비디오 분야의 더 광범위한 연구 문제를 반영합니다. Google DeepMind 연구원들은 비디오 모델이 물리 원리를 실제로 이해하는지 평가하기 위해 물리 지능이라는 독립적인 벤치마크를 도입했습니다. 이 연구는 시각적 사실성과 물리적 정확성이 분리될 수 있음을 발견했습니다. 생성된 비디오는 설득력 있어 보일 수 있지만, 다음을 위반할 수 있습니다.
- 고체 역학
- 유체 거동
- 광학
- 열역학
- 자기학
이러한 구분은 로봇 세계 모델에 매우 중요합니다. 시각적으로 그럴듯한 미래 예측은 행동에 필요한 속성을 유지할 때만 유용합니다. 동시에 로봇은 행동하기 전에 물리학 교과서 전체를 풀어낼 필요는 없습니다. 실용적인 기준은 두 극단 사이에 있습니다.
불충분함:
사실적으로 보이지만, 잘못된 결과를 예측합니다.
과잉 가능성:
행동에 필요하지 않더라도 모든 물리적 변수를 계산합니다.
유용한 예측은 로봇의 의사 결정을 바꾸는 물리적 차이를 포착합니다.
이 중간 지점이 바로 현재 연구가 분기되는 지점입니다.
데모에서 배포까지
모델 아키텍처에 대한 의견 차이가 있음에도 불구하고, 논의가 모델에서 실제 로봇으로 옮겨갈수록 전문가들의 의견은 더욱 일치해집니다.
최종 기준은 간단합니다.
로봇이 물리적 세계에서 작업을 안정적으로 완료할 수 있는가?
다른 발표자들은 이를 다양한 언어로 표현했습니다.
- 샤중푸는 최종 의사 결정의 유효성을 강조했습니다.
- 런광후이는 세계 모델이 하류 정책을 얼마나 향상시키는지에 주목했습니다.
- 주정은 실제 로봇에서의 다중 작업 성공률을 강조했습니다.
용어는 다르지만, 운영상의 질문은 일치합니다.
세계 모델은 로봇의 실제 행동을 개선할 수 있을 때만 의미가 있습니다.
왜 99%의 데모도 여전히 나쁜 제품일 수 있는가
데모는 거의 무한히 최적화될 수 있습니다.
팀은 다음과 같은 작업을 할 수 있습니다.
- 환경을 리셋합니다.
- 유리한 물체를 선택합니다.
- 경로를 미리 정의합니다.
- 실패한 시도를 반복합니다.
- 단일 시나리오에 몇 주간 조정합니다.
- 엔지니어가 현장 대기합니다.
- 드문 에지 케이스를 제거합니다.
배포는 이러한 보호 장치를 제거합니다.
슈퍼마켓, 호텔, 창고 또는 가정에서는 매일 예측할 수 없는 사건이 발생합니다.
왕하오는 비용 곡선이 강한 비선형성을 띤다고 설명했습니다.
시스템을 다음으로 전환할 때:
90% → 99%
들인 노력이 반드시 다음과 같지는 않습니다.
99% → 99.9%
남은 실패는 종종 해결하기 어려운 롱테일 사례입니다.
1%의 실패율은 실험실에서는 작게 들립니다.
로봇이 매일 10,000회 동작을 수행한다면, 1%는 100회의 실패를 의미합니다.
99.9%의 신뢰성에 도달하더라도 작업량이 충분히 많으면 여전히 빈번한 수동 개입이 발생합니다.
비즈니스 영향에는 다음이 포함됩니다.
- 수동 개입.
- 재작업.
- 가동 중단.
- 고객 불만.
- 안전 위험.
- 유지보수 비용.
- 처리량 손실.
- 추가 감독 인력.
이것이 배포가 모델 품질의 의미를 바꾸는 이유입니다.
무작위 사건은 현실 세계에서 정상이다
셴위쥔은 소매업의 예를 들었습니다.
로봇이 야채 한 팩을 찾아야 할 수도 있습니다.
상품은 일반적으로 한 곳에 보관되지만, 고객이 집어서 다른 냉장고에 둘 수도 있습니다.
정교하게 계획된 데이터 세트의 관점에서 보면 이것은 이상 현상처럼 보입니다.
하지만 수천 명의 고객에게 서비스를 제공하는 로봇의 관점에서 보면 이상이 오히려 정상이 됩니다.
따라서 세계 모델은 다음을 처리해야 합니다.
- 예상치 못한 위치의 물체.
- 재고 부재.
- 사람이 경로를 막는 경우.
- 갑작스러운 재배치.
- 부분 관찰.
- 조명 변화.
- 새로운 유형의 물체 조합.
- 작업 초기에 발생한 잘못된 가정.
이것이 일반화 능력이 암기된 데모를 재현하는 것보다 더 중요한 이유입니다.
에지 추론은 배포 요구 사항이다
타오다청은 또 다른 실제적 제약 조건인 지연 시간을 강조했습니다.
많은 고급 모델이 클라우드에서 실행됩니다.
로봇이 항상 클라우드 왕복을 기다릴 시간이 있는 것은 아닙니다.
의사 결정 창은 밀리초 단위에 불과할 수 있습니다.
수십 또는 수백 밀리초.
네트워크는 또한 다음과 같은 문제가 있을 수 있습니다.
- 혼잡
- 사용 불가
- 신뢰할 수 없음
- 비용이 너무 높음
- 개인정보 보호 또는 보안 요구 사항으로 제한됨
이것이 ACE Robotics가 Kairos 3.1의 에지 성능을 강조하는 이유입니다.
능력이 약간 떨어지더라도 제어 시간 제약 내에서 응답할 수 있는 모델이, 행동 창이 지난 후에 도착하는 더 강력한 모델보다 더 유용할 수 있습니다.
배포를 위해 지능은 다음과 같아야 합니다.
- 충분히 저렴하고
- 충분히 빠르고
- 충분히 신뢰할 수 있고
- 충분히 로컬화되고
- 충분히 예측 가능해야 합니다.
이는 유용한 구분으로 이어집니다.
데모는 능력의 상한선을 보여주고, 배포는 능력의 하한선을 드러냅니다.
2년 후, 무엇이 옳았는가?
논의의 마지막 부분에서는 발표자들이 2028년을 돌아보는 상상을 해보도록 요청했습니다.
2026년에 이루어진 어떤 투자가 옳았다고 증명될까요?
어떤 것이 오해를 불러일으켰을까요?
답변은 각 팀이 무엇을 지속적인 가치로 보는지 다시 한번 드러냈습니다.
모델 능력과 가시적 모델 출력
셴위쥔은 두 가지 개념을 구분했습니다.
기본 능력
예시는 다음과 같습니다.
- 일반화 효율성
- 상호작용성
- 표현 품질
- 행동 조건화
- 데이터 효율성
- 인과 일관성
가시적 출력
예시는 다음과 같습니다.
- 시각적으로 인상적인 생성 비디오
- 정교한 데모
- 단일 성공적인 장기 작업
- 높은 심미적 품질
모델은 기본 능력이 향상될 수 있지만, 즉시 가장 인상적인 데모를 생성하지는 않습니다.
반대로, 시스템은 일반적인 물리 지능에 필요한 능력을 향상시키지 않으면서 가시적 출력을 중심으로 크게 최적화될 수 있습니다.
이것이 업계에 더 나은 평가가 필요한 이유 중 하나입니다.
데이터 인프라는 여전히 가치가 있을 수 있음
셴은 또한 데이터 파이프라인에 투입된 작업이 유용하게 유지될 가능성이 높다고 생각했습니다.
아키텍처가 변경되더라도 구현된 지능은 여전히 다음을 필요로 합니다.
- 실제 세계 궤적
- 촉각 데이터
- 실패 사례
- 수동 수정
- 로봇 동작
- 센서 동기화
- 시뮬레이션 데이터
- 품질 필터링
- 평가 데이터 세트
불확실성은 데이터가 중요한지 여부에 있는 것이 아닙니다.
오늘날 수집된 데이터가 미래 모델에서 사용되는 표현 및 훈련 방법과 여전히 일치할지 여부에 있습니다.
다음과 같은 경우 데이터 세트의 유용성이 줄어들 수 있습니다.
- 센서 구성이 변경됨
- 동작 공간이 변경됨
- 레이블이 구식 가정을 인코딩함
- 데이터에 필요한 양식이 누락됨
- 수집 전략이 지나치게 좁음
- 새 모델이 다른 시간 해상도를 필요로 함
따라서 고정된 데이터 세트를 최적화하는 것보다 유연한 데이터 파이프라인을 구축하는 것이 더 지속적인 가치를 가질 수 있습니다.
기초 모델을 너무 일찍 간섭하지 말라
주정은 업계가 기초 모델 자체가 안정화되기 전에 너무 많은 상업적 시나리오를 탐색할 수 있다고 경고했습니다.
이는 익숙한 스타트업 딜레마입니다.
상업적 배포는 다음을 제공합니다.
- 수익
- 데이터
- 고객 피드백
- 실제 제약 조건
하지만 모델 팀을 다음과 같은 방향으로 끌 수도 있습니다.
- 일회성 통합
- 맞춤형 워크플로우
- 고객별 규칙
- 하드웨어 적응
- 지원 및 운영
기본 아키텍처가 여전히 빠르게 변화하고 있다면, 조기
전문화는 기초 연구 진행을 늦출 수 있습니다.
모델 연구와 상업적 배포 간의 균형은 회사마다 다릅니다.
모든 경우에 적용되는 단일 정답은 없습니다.
구현 원시 아키텍처가 부상할 수 있음
런광후이는 세계 모델이 점점 구현 원시적이 될 것이라고 예측했습니다.
이는 모델이 처음부터 물리적 상호작용을 중심으로 설계되고, 나중에 인터넷 비디오나 이미지 생성 작업에서 개조되는 것이 아님을 의미합니다.
구현 원시 훈련에는 다음이 포함될 수 있습니다.
- 로봇 동작.
- 고유 감각.
- 힘.
- 촉각 데이터.
- 일인칭 비디오.
- 다중 시점 관찰.
- 3차원 상태.
- 도구 피드백.
- 개입 데이터.
- 작업 성공 및 실패.
아키텍처 자체도 제어 루프를 중심으로 설계될 수 있습니다.
핵심 문제는 모델이 로봇이 동작을 실행하는 데 필요한 변수를 표현하는지 여부이며, 내부 구조가 미디어 생성 모델과 유사한지 여부가 아니다.
차이점이야말로 가장 큰 기회
이 논의는 모두가 동의하는 단일 아키텍처로 끝나지 않았다.
이는 이 분야가 아직 초기 단계에 있음을 의미할 수 있으며, 교착 상태에 빠진 것은 아니다.
여전히 해결되지 않은 주요 영역이 여러 개 있다:
| 문제 | 다른 관점 |
|---|---|
| 모델은 무엇을 예측해야 하는가? | 픽셀, 잠재 상태, 명시적 기하, 또는 혼합 방식 |
| 물리적 정밀도는 어느 수준이 필요한가? | 정확한 상태 추정 vs. 동작 관련 합리성 |
| 예측 범위는 어디까지여야 하는가? | 장기 일관성 vs. 저지연 단기 제어 |
| 무엇이 이 분야를 통합할 것인가? | 표현, 아키텍처, 촉각 데이터, 또는 벤치마크 |
| 추론은 어디서 실행되어야 하는가? | 클라우드, 엣지, 또는 혼합 배포 |
| 진정한 성공 지표는 무엇인가? | 시뮬레이션 품질, 물리 예측, 정책 향상, 또는 실제 작업 성공률 |
| 어떤 데이터가 가장 중요한가? | 비디오, 로봇 궤적, 힘, 촉각, 시뮬레이션, 또는 혼합 데이터 |
성숙한 분야에서는 아키텍처가 비슷해지는 경향이 있다.
반면 신생 분야에서는 차이점이 아직 정복되지 않은 가장 큰 기회를 드러낸다.
현재 논쟁 중인 가설 중 하나를 증명할 수 있다면, 팀은 업계 합의가 이루어지기 전에 기술적 우위를 확보할 수 있다.
로봇 세계 모델 평가를 위한 실용적 프레임워크
개발자와 로봇 팀에게 이 논의는 더 구체적인 평가 체크리스트로 전환될 수 있다.
1. 예측 대상
모델이 예측하는 내용을 명확히 한다:
- 픽셀.
- 잠재 상태.
- 기하.
- 동작.
- 힘.
- 미래 관측.
- 위 요소들의 조합.
출력은 하위 제어 문제와 일치해야 한다.
2. 예측 범위
다음 수준에서 성능을 측정한다:
- 바로 다음 단계.
- 단기 주기.
- 수초 단위 주기.
- 긴 작업 주기.
모델이 가장 잘 수행하는 예측 범위에 대해서만 평가하지 않는다.
3. 지연 시간
대상 배포 하드웨어에서 실제 추론 시간을 측정한다.
제어 시간 제약을 충족하지 못하는 모델은 예측 정확도로 만점을 받아서는 안 된다.
4. 물리적 타당성
테스트 항목:
- 충돌.
- 접촉.
- 균형.
- 변형.
- 마찰에 민감한 동작.
- 객체 항상성.
- 다중 시점 일관성.
5. 정책 개선
가장 실용적인 질문은 아마도:
세계 모델을 추가하면 실제 작업 성공률이 향상되는가?
세계 모델이 있을 때와 없을 때의 하위 정책 성능을 비교한다——
세계 모델 구성 요소를 포함한 정책과 포함하지 않은 정책.
6. 일반화 능력
새로운 항목 테스트:
- 객체
- 배치
- 로봇 본체
- 조명
- 재질
- 인간 행동
- 작업 조합
7. 복구 능력
첫 번째 오류 발생 후 상황을 측정한다.
배포 시스템은 오류를 감지하고, 상태를 업데이트하며, 다른 방법을 시도할 수 있어야 한다.
8. 엣지 및 클라우드 동작
정상 및 저하된 네트워크 상태를 모두 테스트한다.
원격 추론이 불가능할 때 로봇은 안전하게 실패할 수 있어야 한다.
9. 개입률
다음 단위로 인간 지원을 추적한다:
- 시간당
- 작업당
- 100회 동작당
- 1000회 동작당
이는 단일 성공률보다 배포 품질을 더 잘 드러내는 경우가 많다.
10. 성공적인 작업당 비용
포함:
- 모델 추론
- 하드웨어
- 네트워크
- 인간 개입
- 재작업
- 유지보수
- 에너지 소비
- 다운타임
최고의 세계 모델은 반드시 벤치마크 점수가 가장 높은 모델이 아니다.
로봇 시스템 전체를 더 잘 작동하게 만드는 모델이다.
자주 묻는 질문
구현 AI에서 세계 모델이란 무엇인가?
세계 모델은 환경이 시간, 로봇 동작 또는 기타 이벤트에 따라 어떻게 변화하는지 표현하거나 예측할 수 있는 모델이다. 로봇 공학에서 계획, 시뮬레이션, 동작 선택, 훈련 데이터 생성 또는 정책 개선을 지원할 수 있다.
WAIC 2026에서 논의된 주요 세계 모델 접근 방식은 무엇인가?
논의는 픽셀 공간 생성, 잠재 공간 예측(JEPA 스타일 접근법 등), 그리고 세계 예측을 VLA 제어, 3D 추론 또는 다른 표현과 결합한 하이브리드 또는 통합 시스템을 광범위하게 다루었다. 여러 회사가 다양한 기술을 사용했기 때문에 이러한 범주는 중복된다.
로봇 세계 모델은 정확한 물리 시뮬레이터가 필요한가?
반드시 그렇지는 않다. 일부 연구자는 기하, 움직임 및 힘의 정확한 예측을 주장하는 반면, 다른 연구자는 올바른 동작을 선택하기에 충분한 물리 추론을 우선시한다. 필요한 정밀도는 작업과 실패 비용에 따라 달라진다.
장기 시간 일관성이 논쟁의 대상이 되는 이유는 무엇인가?
긴 시퀀스 전개는 시뮬레이션과 장기 계획에 유용하지만 추론 비용을 증가시키고 실시간 제어를 느리게 할 수 있다. 물리 로봇은 즉각적인 동작을 위한 짧고 빠른 예측과 함께 장기 계획을 위한 다른 메커니즘을 필요로 할 수 있다.
PHYSICAL IQ란 무엇인가?
PHYSICAL IQ는 WAIC 2026 기간 동안 시작된 구현 물리 지능 벤치마크 이니셔티브이다. 다양한 로봇 본체, 시나리오 및 작업을 위한 공통 평가 프로토콜을 제공하는 것을 목표로 한다.
PHYSICAL IQ와 Google DeepMind의 Physics-IQ는 같은 것인가?
아니다. 서로 다른 프로젝트이다. PHYSICAL IQ는 WAIC 2026에서 출시된 구현 로봇 평가 플랫폼이며, Physics-IQ는 생성형 비디오 모델이 물리학을 이해하는지 테스트하기 위한 연구 벤치마크이다.
촉각 센싱이 세계 모델에 중요한 이유는 무엇인가?
시각만으로는 접촉력, 미끄러짐, 압력, 유연성 및 일부 재료 특성을 완전히 드러낼 수 없다. 촉각 및 힘 신호는 로봇에게 물리적 상호작용에 대한 직접적인 정보를 제공하며, 조작 중심의 세계 모델에 점점 더 중요해질 수 있다.
좋은 로봇 시연보다 더 중요한 것은 무엇인가?
배포
신뢰성. 팀은 선택된 시연 사례뿐만 아니라 다양한 환경에서 실제 작업 성공률, 지연 시간, 개입률, 예상치 못한 사건으로부터의 복구 능력, 안전성, 비용 및 성능을 측정해야 한다.
관련 도구
- Hugging Face의 Kairos 3.1: ACE Robotics의 행동 지향 구현 세계 모델 작업을 위한 공개 컬렉션.
- LingBot-World: Robbyant의 오픈소스 대화형 세계 시뮬레이터로, 코드, 모델 및 기술 문서 포함.
- AgiBot 디지털 월드: AgiBot의 데이터 생성, 훈련 및 구현 모델 평가를 위한 공식 시뮬레이션 프레임워크.
- GigaAI: GigaWorld, GigaBrain 및 회사의 구현 AI 플랫폼 공식 웹사이트.
- X제곱 로봇: WALL 구현 기초 모델 제품군 및 세계 모델/VLA 통합을 설명하는 공식 웹사이트.
- Physics-IQ: 생성형 비디오 모델의 물리 이해를 평가하기 위한 독립적인 연구 벤치마크.
- NVIDIA Isaac Sim: 합성 데이터 생성 및 로봇 시스템 테스트를 위한 로봇 시뮬레이션 플랫폼.
관련 링크
- ACE Robotics Kairos 3.1 컬렉션: Kairos 3.1 및 관련 구현 시스템을 위한 공개 모델 리소스.
- ACE Robotics WAIC 2026 발표: Kairos 3.1 및 PHYSICAL IQ 계획을 다루는 회사 보도 자료.
- [앤트 그룹 링광 세계 모델 발표](https://www.
antgroup.com/en/news-media/press-releases/1777280400000):앤트그룹 공식 발표, LingBot-World-Fast를 LingGuang에 통합하는 내용 설명.
- LingBot-World GitHub 저장소:Robbyant의 오픈소스 코드, 설치 설명, 가중치 및 논문 링크.
- AgiBot 디지털 세계:AgiBot 시뮬레이션 및 체화 데이터 프레임워크 공식 소개.
- AgiBot EVAC 및 EWMBench:AgiBot 공식, 행동 조건부 세계 모델 및 평가 관련 연구.
- X 제곱 로봇:WALL 모델군 및 엔드투엔드 체화 지능에 대한 공식 정보.
요약
WAIC 2026 세계 모델 원탁 회의는 체화 지능 분야에서 아직 세계 모델의 정의, 표현 또는 아키텍처에 대한 합의가 이루어지지 않았음을 시사합니다. 주요 이견은 물리적 정밀도, 예측 범위, 표현 방식, 촉각 인식, 그리고 세계 모델링과 행동 간의 관계에 있습니다.
가장 강력한 합의는 기술 스택의 후반부에서 나타납니다. 세계 모델은 궁극적으로 실제 로봇을 더욱 신뢰할 수 있게 만들어야 합니다: 더 높은 작업 성공률, 더 적은 개입, 더 빠른 의사 결정, 더 안전한 복구, 그리고 더 낮은 배포 비용.
PHYSICAL IQ는 공통 평가 계층을 생성하는 것을 목표로 하며, 그 이전에
아키텍처 자체는 융합되는 경향을 보입니다. 이 벤치마크가 널리 채택될지는 지켜봐야 하지만, 비교 가능한 물리적 지능 측정 방법에 대한 필요성은 분명합니다.
해당 분야의 현재 논쟁은 약점이 아니라, 차세대 체화 인공지능의 발전 방향을 정의할 해결되지 않은 문제들의 지도입니다.