본문 바로가기
Study/논문 리뷰

Mobile ALOHA: 이동형 양팔 조작과 데이터 수집

by 강렬한 스포트라이트 2026. 7. 3.

1. 논문 정보

  • 논문명: Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation
  • 저자: Zipeng Fu, Tony Z. Zhao, Chelsea Finn
  • 소속: Stanford University
  • 공개: arXiv 2024년 1월
  • 학회: Conference on Robot Learning, CoRL 2024 / PMLR proceedings 2025
  • 분야: Robot Learning, Mobile Manipulation, Bimanual Manipulation, Imitation Learning, Teleoperation
  • 키워드: Mobile ALOHA, Whole-Body Teleoperation, Bimanual Mobile Manipulation, Low-Cost Hardware, Co-training, ACT, Diffusion Policy

2. 한 줄 요약

 

Mobile ALOHA는 저비용 양팔 로봇 ALOHA에 모바일 베이스를 결합해, 사람이 로봇 전체 몸체를 원격 조작하면서 이동형 양팔 조작 데이터를 수집하고, 그 데이터로 복잡한 가정형 mobile manipulation task를 imitation learning으로 학습할 수 있음을 보인 논문이다.

 

기존 ALOHA가 테이블 위에서 양팔로 지퍼백 열기, 배터리 끼우기, 컵 열기 같은 fine-grained manipulation을 다뤘다면, Mobile ALOHA는 로봇이 직접 이동하면서 요리, 청소, 수납, 엘리베이터 호출 같은 더 긴 작업을 수행하도록 확장한다.

 

즉, ALOHA/ACT의 질문이 다음과 같았다면,

“저비용 양팔 로봇으로 섬세한 테이블 위 조작을 학습할 수 있을까?”

 

Mobile ALOHA의 질문은 다음과 같다.

“저비용 양팔 로봇이 이동 능력까지 갖추면, 실제 집이나 사무실 같은 환경에서 긴 작업을 학습할 수 있을까?”

3. 왜 이 논문을 읽었는가?

이 논문은 로봇 학습에서 중요한 병목 중 하나인 “실제 환경 데이터 수집” 문제를 다룬다.

로봇이 가정이나 사무실에서 유용하게 쓰이려면 단순히 테이블 위 물체를 집는 것만으로는 부족하다. 로봇은 이동해야 하고, 양팔을 함께 써야 하며, 주변 환경과 접촉하면서 긴 순서의 작업을 수행해야 한다. 예를 들어 냄비를 양손으로 들어 찬장에 넣거나, 싱크대까지 이동해 팬을 헹구거나, 엘리베이터 버튼을 누르고 안으로 들어가는 작업은 이동, 조작, 시각 피드백, whole-body coordination을 모두 요구한다. 논문도 많은 실제 일상 작업이 단순 이동이나 단일 팔 조작이 아니라, 이동성과 양팔 조작을 함께 필요로 한다고 설명한다.

Mobile ALOHA가 중요한 이유는 단순히 로봇에 바퀴를 붙였기 때문이 아니다. 이 논문은 사람이 로봇의 양팔과 베이스를 동시에 자연스럽게 조작할 수 있는 데이터 수집 인터페이스를 만들고, 그 데이터로 실제 long-horizon mobile manipulation task를 학습했다는 점에서 의미가 크다.

4. 기존 방식의 한계

기존 로봇 imitation learning 연구는 대부분 tabletop manipulation에 집중되어 있었다. ALOHA도 강력한 저비용 양팔 플랫폼이었지만, 기본적으로 고정된 테이블 앞에서 작업하는 구조였다. 이 경우 로봇의 workspace는 팔이 닿는 범위로 제한된다.

하지만 실제 환경에서는 물체가 항상 로봇 앞에 놓여 있지 않다. 로봇은 냉장고, 싱크대, 식탁, 찬장, 엘리베이터 앞까지 이동해야 한다. 또한 큰 물체를 다루거나 문을 여는 경우에는 팔만 움직이는 것이 아니라 베이스가 함께 움직여야 한다.

논문은 mobile bimanual manipulation이 널리 쓰이지 못한 이유로 두 가지를 지적한다. 첫째, whole-body teleoperation을 위한 접근 가능한 하드웨어가 부족하다. PR2나 TIAGo 같은 상용 모바일 매니퓰레이터는 20만 달러 이상일 수 있고, teleoperation을 위해 추가 장비와 보정이 필요할 수 있다. 둘째, 복잡한 이동형 양팔 조작 task에서 높은 성능을 보인 robot learning 결과가 아직 충분하지 않았다.

또 다른 문제는 이동 베이스가 추가되면 action space와 error source가 함께 늘어난다는 점이다. 베이스 위치가 조금만 틀어져도 팔 끝 위치는 크게 달라질 수 있고, 이동 중에는 조명, 배경, 관측 시점도 계속 바뀐다. 따라서 단순히 고정형 ALOHA의 policy를 그대로 쓰기는 어렵다.

5. Mobile ALOHA의 핵심 아이디어

Mobile ALOHA의 핵심은 ALOHA의 양팔 teleoperation 구조를 유지하면서, 모바일 베이스와 whole-body teleoperation 인터페이스를 추가한 것이다.

시스템은 기존 ALOHA의 leader-follower 방식으로 양팔을 조작한다. 사용자는 양손으로 leader arm을 움직여 follower arm을 제어한다. 문제는 두 손이 이미 팔 조작에 쓰이고 있기 때문에, 모바일 베이스를 어떻게 제어할 것인가이다.

Mobile ALOHA는 매우 단순한 방법을 선택한다. 사용자의 허리를 로봇 베이스에 물리적으로 연결하고, 사용자가 직접 로봇을 밀거나 끌면서 베이스를 움직인다. 논문은 operator가 시스템에 물리적으로 tethered되어 있고, 바퀴를 backdrive하여 base movement를 만든다고 설명한다. 이렇게 하면 양손은 계속 양팔 조작에 사용하면서도, 몸 전체 움직임으로 베이스를 동시에 제어할 수 있다.

이 방식의 장점은 다음과 같다.

첫째, 사람이 자연스럽게 whole-body coordination을 demonstration에 담을 수 있다. 예를 들어 찬장 문을 열 때 사람은 손잡이를 잡은 상태로 몸을 뒤로 빼면서 문을 연다. Mobile ALOHA는 이 동작을 팔 action과 base action이 동시에 기록되는 데이터로 수집할 수 있다.

둘째, 별도의 VR 장비, motion capture, 복잡한 retargeting 없이도 mobile manipulation 데이터를 수집할 수 있다.

셋째, 사용자가 로봇과 물리적으로 연결되어 있기 때문에 로봇이 물체에 부딪히거나 힘을 받는 상황을 어느 정도 몸으로 느낄 수 있다. 논문은 이를 coarse haptic feedback으로 설명한다.

즉, Mobile ALOHA의 novelty는 “이동형 양팔 로봇” 자체보다 “이동형 양팔 로봇 데이터를 싸고 쉽게 수집하는 whole-body teleoperation pipeline”에 있다.

6. 하드웨어 구성

 

Mobile ALOHA는 원래 ALOHA 시스템에 AgileX Tracer 모바일 베이스를 결합한다. 논문은 Tracer를 선택한 이유로 사람 보행 속도에 가까운 이동 속도, 안정성, 높은 payload, 접근 가능한 가격을 든다. Tracer는 최대 약 1.6m/s로 이동할 수 있고, 최대 payload는 100kg이며, 미국 기준 약 7,000달러라고 설명된다.

시스템은 onboard power와 compute도 갖춘다. 베이스에는 1.26kWh 배터리가 들어가며, 이 배터리는 전원 공급뿐 아니라 무게추 역할도 해서 tipping을 줄인다. 연산은 Nvidia 3070 Ti GPU와 Intel i7-12800H가 탑재된 consumer-grade laptop에서 수행된다. 카메라는 Logitech C922x RGB webcam 3대를 사용하며, 두 대는 wrist camera, 한 대는 팔 사이 전방을 보는 egocentric camera로 사용된다. 각 카메라는 480×640 RGB image를 50Hz로 스트리밍한다.

Mobile ALOHA의 action과 observation도 whole-body 형태로 확장된다. 팔 action은 기존 ALOHA처럼 두 팔의 joint target position으로 표현된다. 여기에 모바일 베이스의 linear velocity와 angular velocity가 추가된다. 논문은 ALOHA의 14-DoF joint position과 모바일 베이스의 선속도·각속도를 연결해 총 16차원 action vector를 만든다고 설명한다.

전체 시스템 비용은 onboard power와 compute를 포함해 32,000달러 이하이다. 논문은 이 비용이 Franka Emika Panda 같은 단일 산업용 협동로봇과 비슷한 수준이라고 설명한다. 또한 Mobile ALOHA는 지면 기준 65cm에서 200cm 높이까지 reach할 수 있고, 베이스에서 100cm까지 팔을 뻗을 수 있으며, 1.5kg 물체를 들고 1.5m 높이에서 100N의 pulling force를 낼 수 있다고 보고한다.

정리하면 Mobile ALOHA의 하드웨어 설계 목표는 네 가지이다.

첫째, 사람 보행 속도에 가까운 mobility.

둘째, 냄비나 찬장 같은 무거운 household object를 다룰 수 있는 stability.

셋째, 양팔과 베이스를 동시에 제어할 수 있는 whole-body teleoperation.

넷째, onboard power와 compute를 갖춘 untethered operation이다.

7. 학습 방법: Co-training with Static ALOHA Data

Mobile ALOHA

 

Mobile ALOHA의 학습 방법에서 가장 중요한 아이디어는 static ALOHA data와 co-training하는 것이다.

일반적인 imitation learning에서는 특정 task에 대해 그 task demonstration만 수집해 policy를 학습한다. 그러나 mobile manipulation task는 데이터 수집이 오래 걸리고, long-horizon task는 실패 가능성도 높다. 또한 task별 데이터가 적으면 조명 변화, 물체 위치 변화, 배경 변화에 쉽게 overfitting될 수 있다.

Mobile ALOHA는 이 문제를 해결하기 위해 기존 static ALOHA dataset을 함께 사용한다. 논문에 따르면 static ALOHA dataset은 총 825개의 demonstration으로 구성되어 있으며, 지퍼백 밀봉, 포크 집기, 종이타월 찢기, 플라스틱 컵 열기, 커피머신 사용, 벨크로 조이기, 배터리 끼우기 등 다양한 고정형 양팔 조작 task를 포함한다.

흥미로운 점은 static ALOHA 데이터와 Mobile ALOHA 데이터의 환경이 꽤 다르다는 점이다. Static ALOHA는 검은 테이블 위에서 두 팔이 서로 마주 보는 구조로 수집되었고, Mobile ALOHA는 이동하는 베이스 위에서 두 팔이 정면을 향하는 구조로 수집된다. 그런데도 논문은 별도의 특별한 RGB 처리나 bimanual action 처리 없이 co-training을 수행했다고 설명한다.

구체적으로 Mobile ALOHA policy의 action은 두 팔의 target joint position과 base velocity로 구성된다. Static ALOHA 데이터에는 base action이 없기 때문에, base action 부분은 zero-padding한다. 관측은 두 wrist camera image, 하나의 egocentric camera image, arm joint position으로 구성된다. 학습 시에는 static ALOHA data와 Mobile ALOHA task data를 섞어 mini-batch를 만들고, action prediction loss로 supervised behavior cloning을 수행한다.

이 co-training의 의미는 매우 중요하다.

Mobile ALOHA가 새롭게 수집한 데이터는 이동형 task에 특화되어 있지만 양이 적다. 반면 static ALOHA 데이터는 이동은 없지만, 다양한 양팔 조작 motion prior를 포함한다. Mobile ALOHA는 이 둘을 함께 학습함으로써, 이동형 task에서도 grasping, approaching, manipulating 같은 기본 양팔 조작 능력을 재사용하려 한다.

8. 실험 결과

논문은 실제 환경에서 7개의 mobile manipulation task를 평가한다.

첫째, Wipe Wine이다. 로봇이 수건을 가져와 테이블 위에 흘린 와인을 닦고, 와인잔을 들어 잔 아래까지 닦는 작업이다. 이 task는 이동과 양팔 조작이 모두 필요하다.

둘째, Cook Shrimp이다. 로봇이 새우를 팬에 올리고, 뒤집고, 그릇에 담는 작업이다. 한 팔은 팬을 기울이고 다른 팔은 spatula를 사용해야 하므로 양팔 협응과 접촉 dynamics가 중요하다.

셋째, Rinse Pan이다. 더러운 팬을 집어 수도꼭지 아래에서 헹군 뒤 건조대에 놓는 작업이다. 특히 수도꼭지 손잡이는 길이 약 4cm, 지름 약 0.7cm의 작은 반짝이는 금속 물체라서 perception과 precise control이 모두 어렵다. 논문은 cm 단위 오차도 실패로 이어질 수 있다고 설명한다.

넷째, Use Cabinet이다. 로봇이 양문형 찬장을 열고, 무거운 냄비를 집어 안에 넣은 뒤 문을 닫는 작업이다. 실험에서 가장 무거운 냄비는 1.4kg이며, 이는 단일 팔 payload 750g을 넘지만 두 팔을 함께 쓰면 다룰 수 있는 범위이다.

다섯째, Call Elevator이다. 로봇이 약 15m 떨어진 위치에서 출발해 엘리베이터 버튼을 누르고, 문이 열리면 안으로 들어간다. 버튼은 약 2cm × 2cm 크기이고, 로봇의 가장 넓은 부분과 엘리베이터 문 사이 clearance가 약 30cm밖에 없어 navigation과 precise manipulation이 모두 필요하다.

여섯째, Push Chairs이다. 로봇이 긴 책상 앞의 의자 5개를 밀어 넣는 작업이다. 이 task에서는 처음 3개 의자에 대해서만 demonstration을 수집하고, 4번째와 5번째 의자는 OOD extrapolation으로 평가한다.

일곱째, High Five이다. 로봇이 주방 아일랜드를 돌아 이동하다가 사람이 앞에서 다가오면 멈추고 하이파이브를 한 뒤, 사람이 비켜나면 다시 이동한다. 이 task는 정밀 조작보다는 human-robot interaction 가능성을 보여주는 예시이다.

성능 결과에서 가장 중요한 결론은 co-training이 Mobile ALOHA의 성능과 데이터 효율성을 크게 높였다는 점이다. ACT를 기준으로 co-training을 적용했을 때 Wipe Wine 95%, Call Elevator 95%, Use Cabinet 85%, High Five 85%, Rinse Pan 80%, Push Chairs 80% 성공률을 얻었다. 이 task들은 대부분 50개의 in-domain demonstration만 사용했고, High Five는 20개 demonstration만 사용했다. Cook Shrimp는 20개 demonstration으로 40% 성공률을 보였으며, 논문은 새우 뒤집기와 낮은 contrast의 흰 그릇에 새우를 담는 과정이 주요 실패 원인이라고 분석한다.

Co-training의 효과는 특히 정밀 조작이 병목인 sub-task에서 크게 나타났다. 예를 들어 Rinse Pan의 Turn On Faucet, Call Elevator의 Press Button, Cook Shrimp의 Flip Shrimp 같은 단계는 base velocity control의 stochasticity와 rich contact 때문에 error가 누적되기 쉬운데, static ALOHA 데이터가 제공하는 motion prior가 도움이 된 것으로 해석된다.

또한 Mobile ALOHA는 ACT뿐 아니라 Diffusion Policy, VINN + Chunking과도 결합 가능함을 보였다. Wipe Wine과 Push Chairs에서 ACT, Diffusion Policy, VINN을 비교했으며, co-training은 ACT와 Diffusion Policy에서 전반적으로 성능을 높였다. 특히 Push Chairs에서는 Diffusion Policy와 ACT가 co-training 적용 시 100% 성공률을 보였다.

Ablation에서도 co-training의 데이터 효율성이 확인된다. Wipe Wine task에서 ACT를 학습할 때, co-training을 사용하면 35개 in-domain demonstration만으로도 no co-training 50개 demonstration보다 높은 성능을 냈다. 구체적으로 35개 co-training policy가 70%, 50개 no co-training policy가 50%로 보고된다.

9. 로봇을 공부하는 입장에서 본 의미

Mobile ALOHA의 가장 큰 의미는 “로봇 데이터 수집의 범위가 테이블 위 조작에서 실제 생활 공간으로 확장되었다”는 점이다.

ALOHA는 저비용 양팔 조작 데이터를 수집하는 강력한 플랫폼이었다. 하지만 팔이 고정되어 있기 때문에, task는 기본적으로 로봇 앞 작업 공간 안에서만 이루어졌다. Mobile ALOHA는 여기에 이동성을 추가해 로봇이 냉장고, 싱크대, 찬장, 엘리베이터, 책상 사이를 움직이며 작업하도록 만들었다.

이 논문은 로봇 학습에서 hardware와 algorithm이 함께 설계되어야 함을 잘 보여준다. 단순히 더 큰 neural network를 쓰는 것이 아니라, 사람이 고품질 demonstration을 쉽게 줄 수 있는 하드웨어 인터페이스를 만들고, 그 데이터로 policy를 학습한다. 즉, Mobile ALOHA의 핵심 기여는 “저비용 하드웨어 + whole-body teleoperation + imitation learning + static dataset co-training”이 하나의 pipeline으로 연결된 점이다.

ACT, Diffusion Policy와 비교하면 Mobile ALOHA의 위치가 더 명확해진다.

ACT는 action chunking으로 양팔 조작 policy를 안정적으로 학습하는 방법이다.

Diffusion Policy는 action sequence를 diffusion process로 생성하는 방법이다.

Mobile ALOHA는 이 둘 중 하나의 새로운 policy architecture를 제안하기보다는, 이동형 양팔 조작 데이터를 수집하고 기존 imitation learning 방법들이 이 환경에서 작동하도록 만든 시스템 논문에 가깝다.

VIMA와도 관점이 다르다. VIMA는 task를 multimodal prompt로 표현하는 연구이고, Mobile ALOHA는 실제 robot embodiment에서 long-horizon mobile manipulation을 수집하고 학습하는 연구이다. 즉, VIMA가 “로봇에게 일을 어떻게 지시할 것인가?”에 가깝다면, Mobile ALOHA는 “로봇이 실제 환경에서 배울 데이터를 어떻게 만들고, 어떻게 학습할 것인가?”에 가깝다.

특히 데이터 수집 관점에서 Mobile ALOHA는 이후 household robot learning, embodied AI, mobile manipulation dataset 연구에 중요한 기준점이 된다. 로봇 foundation model을 만들려면 결국 실제 세계의 다양한 demonstration이 필요하고, Mobile ALOHA는 그 데이터를 상대적으로 저렴하고 재현 가능한 방식으로 모으는 예시를 보여준다.

10. 한계점

Mobile ALOHA에도 한계는 있다.

첫째, 여전히 task-specific imitation learning이다. 논문은 policy learning 결과가 single-task imitation learning에 제한된다고 명시한다. 즉, 하나의 범용 policy가 모든 task를 자연어 지시로 수행하는 형태는 아니다. 새로운 task를 위해서는 해당 task demonstration을 다시 수집하고 학습해야 한다.

둘째, 로봇이 스스로 exploration하면서 새로운 지식을 얻는 구조는 아니다. Mobile ALOHA는 사람이 제공한 demonstration을 기반으로 supervised behavior cloning을 수행한다. 따라서 demonstration에 없는 상황이나 크게 다른 환경에서는 일반화가 제한될 수 있다.

셋째, 하드웨어 footprint가 크다. 논문은 현재 Mobile ALOHA의 footprint가 90cm × 135cm이며, 좁은 통로에서는 문제가 될 수 있다고 설명한다. 또한 follower arm 높이가 고정되어 있어 낮은 찬장, 오븐, 식기세척기 같은 위치를 다루기 어렵다고 언급한다.

넷째, demonstration은 두 명의 expert operator가 수집했다. 논문은 향후 연구로 suboptimal하고 heterogeneous한 dataset으로부터 imitation learning하는 문제를 남겨둔다고 설명한다. 이는 실제 대규모 데이터 수집에서는 매우 중요한 한계이다.

다섯째, long-horizon task에서는 여전히 데이터 부족과 perception 문제가 크다. Cook Shrimp의 낮은 성공률은 75초짜리 긴 작업에 대해 20개 demonstration만 수집했기 때문일 가능성이 있고, 흰 테이블 위 흰 그릇처럼 contrast가 낮은 장면에서 perception이 어려웠다고 논문은 분석한다.

여섯째, 이동 베이스의 velocity control 오차가 중요한 실패 원인이 될 수 있다. 논문은 open-loop replay가 whole-task success 0%를 보였고, 1m 반경으로 180도 회전하는 base action을 replay할 때 평균 10cm 이상의 오차가 관찰되었다고 설명한다. 따라서 Mobile ALOHA의 성공은 open-loop trajectory replay가 아니라, closed-loop visual policy가 계속 error를 보정하기 때문에 가능하다.

결론적으로 Mobile ALOHA는 ALOHA를 이동형 양팔 로봇으로 확장하고, whole-body teleoperation을 통해 실제 환경의 복잡한 mobile manipulation 데이터를 수집한 연구이다. 이 논문의 핵심은 새로운 신경망 구조 하나가 아니라, “로봇이 실제 생활 공간에서 움직이고 조작하는 데이터를 어떻게 저렴하게 만들고, 기존 imitation learning 방법으로 어떻게 학습할 수 있는가”를 보여준 데 있다.

 

논문 링크

[2401.02117] Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation

반응형
SMALL