2026년, 인공지능(AI) 기술은 눈부신 발전을 거듭하고 있지만, 우리 주변의 로봇들은 여전히 특정 작업에만 특화된 채 답보 상태인 듯 보입니다.
대규모 언어 모델(LLM)이 방대한 데이터로 '범용성'의 길을 활짝 열었듯이, 로봇 분야에서도 진정한 범용 지능을 향한 답을 찾아 나서는 움직임이 그 어느 때보다 활발한데요.
오늘 저는 인공지능 로봇의 미래를 재정의할지도 모르는 혁신적인 시도, 바로 X 스퀘어 로봇(X Square Robot)의 독특한 접근 방식을 깊이 있게 들여다볼까 합니다.
이들은 단순히 하드웨어를 넘어, 로봇이 스스로 학습하고 세상을 이해하는 완전히 새로운 '기반 스택(Foundation Stack)'을 제안하고 있더라.
과연 이들의 기술이 로봇 시대를 어떻게 변화시킬지 함께 살펴보시죠.
로봇 학습의 판도를 바꾸는 '고품질 데이터'의 비밀
현재까지 범용 로봇 개발의 가장 큰 난관은 바로 ‘데이터’였답니다. 방대한 양의 로봇 학습 데이터는 비싸고, 그 품질마저 들쑥날쑥하기 일쑤였죠.
X 스퀘어 로봇은 이 문제에 정면으로 도전합니다. 이들은 로봇을 직접 조종하는 대신, 사람들이 웨어러블 장비를 착용하고 시연하는 방식으로 고품질 데이터를 수집하는 UMI(Universal Manipulation Interface) 시스템을 개발했어요.
가장 인상적인 점은 '물리적 재생'이라는 독특한 품질 관리 방식입니다. 수집된 동작 데이터를 실제 로봇에 재연해보고, 오직 성공한 동작만을 유효한 데이터로 분류하는 거죠.
이는 데이터의 양보다 질이 중요하다는 확고한 철학을 보여줍니다. 그리퍼가 아주 미세하게 일찍 닫혀 물체를 밀쳐낸다 해도, 데이터상으로는 ‘잡기’로 기록될 수 있거든요. 이런 오류를 실제 물리적 재생으로 걸러내니, 훨씬 적은 비용으로도 깨끗하고 신뢰성 높은 데이터를 확보할 수 있었던 듯합니다.
작고 깨끗한 데이터셋이 크고 잡음 섞인 데이터셋보다 훨씬 가치 있다는 걸 증명한 셈이죠.
세상을 '사건'으로 이해하는 월드 모델: WALL-WM
로봇이 복잡한 환경에서 유연하게 작동하려면, 주변 세상을 제대로 '이해'해야 합니다. 대부분의 로봇 모델은 고정된 시간 단위로 행동을 예측하는데요.
X 스퀘어 로봇은 이와 다른 접근법을 취했습니다. 이들의 월드 모델인 WALL-WM은 ‘사건(Event)’을 학습 단위로 삼는답니다. 물건에 닿는 것, 잡는 것, 놓는 것 등 의미 있는 행동의 시작과 끝을 기준으로 세상을 파악하는 식이죠.
이러한 사건 기반 학습 덕분에 로봇은 "테이블을 치워라" 같은 장기적인 목표를 훨씬 더 효율적으로 계획하고 실행할 수 있게 되는 듯합니다.
WALL-WM은 장기적 추론을 위한 '이벤트 모드'와 실시간 제어를 위한 '고정 길이 모드'를 모두 제공하여, 로봇의 지능과 행동을 동시에 최적화하는 모습이네요. 마치 뇌의 인지 기능과 운동 제어 기능이 유기적으로 연결된 것만 같습니다.
즉시 실행 가능한 '액션 레이어'와 진정한 범용성
진정한 범용 로봇이라면 특정 작업을 위해 매번 새롭게 학습시키거나 미세 조정할 필요가 없어야겠죠?
X 스퀘어 로봇의 액션 레이어, Wall-OSS-0.5는 '미세 조정 없이 즉시 배포 가능'하다는 원칙을 내세웁니다. 사전 학습된 모델이 이미 일반적인 로봇의 움직임을 충분히 숙지하고 있어야 한다는 의미죠.
또한, X-Tokenizer는 로봇의 연속적인 동작을 언어 모델이 해석할 수 있는 의미 있는 '액션 토큰'으로 변환해줍니다. 이를 통해 로봇은 어떤 상황에서도 의도를 안정적으로 유지하며 동작을 실행할 수 있으며, 나아가 다양한 로봇 플랫폼에 범용성을 가지고 적용될 수 있다고 해요.
이는 하나의 기술이 여러 로봇에 두루 사용될 수 있다는 점에서, 개발 비용 절감과 함께 로봇 기술의 대중화를 이끌 중요한 열쇠가 될 것으로 보입니다.
자주 묻는 질문 (Q&A)
Q1: X 스퀘어 로봇은 왜 데이터 품질에 그렇게 집착하는 걸까요?
A1: 로봇 데이터의 오류는 언어 데이터보다 훨씬 치명적이라고 합니다. 예를 들어, 그리퍼가 조금만 일찍 닫혀 물건을 밀쳐내도, 데이터상으로는 ‘잡기’로 기록될 수 있다는 거죠. 이런 모호한 데이터는 로봇이 제대로 된 기술을 배우기 어렵게 만듭니다. 그래서 물리적 재생을 통해 실제 성공한 동작만을 유효한 데이터로 인정하는 것이랍니다.
Q2: 로봇을 원격 조종하는 대신 웨어러블 장비를 사용하는 이유는 무엇인가요?
A2: 기존의 로봇 원격 조종 방식은 사람에게 로봇의 움직임 제약을 강요하기 때문에, 느리고 부자연스러운 동작 데이터가 생성될 수 있다고 해요. 반면 웨어러블 장비는 인간의 숙련된 기술과 섬세한 움직임을 직접 포착하여, 로봇의 운동학적 제약을 넘어 더욱 풍부하고 다양한 데이터를 얻을 수 있다는 장점이 있답니다.
Q3: '미세 조정 없이 배포 가능'하다는 기준이 왜 중요한가요?
A3: 사전 학습만으로도 로봇이 기본적인 조작 능력(접근, 잡기, 장애물 회피 등)을 갖춰야 진정한 '기반 모델'이라고 볼 수 있다는 생각인 듯합니다. 가정이나 직장에서 로봇이 매번 새로운 데이터를 학습할 필요 없이, 다양한 작업을 수행할 수 있는 최소한의 기준을 제시하는 것이겠죠. 이는 로봇의 실용성과 신뢰성을 극대화하는 핵심 요소가 될 것입니다.
마치며
X 스퀘어 로봇의 접근 방식은 단순히 한 기업의 기술 발전을 넘어, 2026년 이후 범용 로봇이 우리 삶에 얼마나 깊숙이 들어올 수 있을지를 가늠하게 하는 중요한 이정표가 될 듯합니다.
특히 고품질 데이터 확보, 사건 기반 월드 모델, 그리고 즉시 배포 가능한 액션 레이어의 결합은 로봇이 실험실을 넘어 실제 세상에서 더욱 안정적이고 유용하게 작동할 수 있는 기반을 다지는 것으로 보입니다.
이들의 오픈소스 전략이 더 많은 연구자와 개발자들의 참여를 이끌어내, 진정한 인공지능 로봇 시대의 개화를 앞당기기를 기대해 봅니다. 조만간 우리 집 거실에서 로봇이 빨래를 개고 요리를 하는 모습을 마주할 날이 머지않았다는 희망을 품게 되네요.