본문 바로가기
Study/논문 리뷰

Gemini Robotics: Gemini 기반 VLA generalist robot model

by 강렬한 스포트라이트 2026. 7. 10.

1. 논문 정보

  • 논문명: Gemini Robotics: Bringing AI into the Physical World
  • 저자: Gemini Robotics Team, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Konstantinos Bousmalis, Anthony Brohan, Chelsea Finn, Sergey Levine, Ted Xiao 외
  • 기관: Google DeepMind
  • 공개: 2025년 3월 arXiv 공개
  • 분야: Robot Learning, Vision-Language-Action Model, Embodied AI, Generalist Robot
  • 키워드: Gemini Robotics, Gemini Robotics-ER, VLA, Embodied Reasoning, ALOHA 2, Robot Foundation Model, Generalist Robot, Safety

2. 한 줄 요약

 

Gemini Robotics는 Gemini 2.0을 기반으로 만든 Vision-Language-Action generalist robot model이며, 이미지와 언어 명령을 이해하고 이를 실제 로봇 action으로 변환해 다양한 조작 task를 수행하도록 만든 모델이다.

조금 더 풀어서 말하면, 이 논문은 두 가지 모델을 제안한다.

Gemini Robotics-ER
→ 물리 세계를 이해하는 embodied reasoning VLM

Gemini Robotics
→ Gemini Robotics-ER 기반의 action-generating VLA model

 

Gemini Robotics-ER은 물체 인식, pointing, trajectory prediction, grasp prediction, multi-view correspondence, 3D bounding box prediction처럼 로봇이 물리 세계를 이해하는 데 필요한 능력을 강화한 모델이다. Gemini Robotics는 여기에 robot action data를 학습시켜 실제 로봇을 직접 제어할 수 있도록 만든 VLA 모델이다. 

핵심 흐름은 다음과 같다.

이미지 observation
+ 자연어 instruction
→ Gemini 기반 embodied reasoning
→ VLA backbone
→ local action decoder
→ action chunk 생성
→ 실제 로봇 제어

3. 왜 이 논문을 읽었는가?

이 논문은 로봇 foundation model 흐름에서 매우 중요한 위치에 있다.

OpenVLA는 공개 VLA 모델과 fine-tuning 가능성을 보여주었고, π₀는 flow matching 기반 continuous action generation을 제안했으며, RDT-1B와 GR00T N1은 diffusion 기반 양팔/휴머노이드 조작을 강조했다. Gemini Robotics는 이 흐름에서 “강력한 범용 multimodal model인 Gemini를 실제 물리 세계의 robot action으로 어떻게 연결할 것인가?”라는 질문에 답하려는 연구다.

즉, 이 논문이 다루는 핵심 질문은 다음과 같다.

“디지털 세계에서 뛰어난 reasoning 능력을 보이는 Gemini 같은 multimodal model을 실제 로봇 제어에 사용할 수 있을까?”

논문은 로봇이 현실 세계에서 유용하게 동작하려면 단순히 이미지를 인식하는 것만으로는 부족하고, 공간 관계, 물체 affordance, 동작 가능성, 시간적 변화, 안전성까지 이해해야 한다고 본다. 이를 위해 Gemini Robotics-ER로 embodied reasoning을 강화하고, Gemini Robotics로 이를 실제 action generation에 연결한다.

4. 기존 VLA / 로봇 학습 방식의 한계

기존 VLA 모델은 이미지와 언어 명령을 입력받아 로봇 action을 생성한다는 점에서 강력하지만, 실제 환경에서는 몇 가지 한계가 있다.

첫째, 물리 세계에 대한 reasoning이 부족할 수 있다. 로봇은 단순히 “컵을 집어라”라는 명령을 이해하는 것뿐 아니라, 어느 부분을 잡아야 하는지, 어떤 경로로 움직여야 하는지, 물체가 어떻게 놓여 있는지, 사람에게 위험하지 않은지까지 판단해야 한다. 논문은 이를 embodied reasoning이라고 부른다.

둘째, VLM은 reasoning에는 강하지만 직접 로봇 제어에는 느리고 부적합할 수 있다. 큰 VLM은 inference latency가 길기 때문에, 로봇이 실시간으로 부드럽게 움직이는 데 필요한 control frequency를 맞추기 어렵다. Gemini Robotics는 이 문제를 해결하기 위해 cloud 기반 VLA backbone과 로봇 onboard computer에서 실행되는 local action decoder를 분리한다.

셋째, 기존 로봇 policy는 task나 robot embodiment가 바뀌면 성능이 급격히 떨어질 수 있다. Gemini Robotics는 다양한 robot action data와 non-robot multimodal data를 함께 활용해, 새로운 물체, 새로운 환경, 다양한 instruction, 새로운 robot embodiment에 대한 일반화를 목표로 한다.

5. Gemini Robotics의 핵심 아이디어

Gemini Robotics의 핵심 아이디어는 크게 세 가지다.

첫째, Gemini 2.0의 multimodal reasoning 능력을 물리 세계로 확장한다. 이를 위해 논문은 Gemini Robotics-ER이라는 embodied reasoning model을 제안한다. 이 모델은 물체 탐지, 2D pointing, trajectory prediction, top-down grasp prediction, multi-view correspondence, 3D bounding box prediction 등을 수행할 수 있다.

둘째, embodied reasoning을 실제 robot action generation과 연결한다. Gemini Robotics는 Gemini Robotics-ER의 능력을 기반으로 하되, robot action data를 학습해 action chunk를 직접 출력하는 VLA model로 구성된다. 즉, Gemini Robotics-ER이 “물리 세계를 이해하는 모델”이라면, Gemini Robotics는 “이해한 내용을 바탕으로 실제 로봇을 움직이는 모델”이다. 

셋째, low-latency robot control을 위해 backbone과 decoder를 나눈다. Gemini Robotics backbone은 cloud에서 실행되고, local action decoder는 로봇의 onboard computer에서 실행된다. 논문에 따르면 backbone latency는 seconds 수준에서 160ms 이하로 최적화되었고, 전체 end-to-end latency는 약 250ms이며, action chunking을 통해 effective control frequency는 50Hz 수준이다. 

간단히 정리하면 다음과 같다.

Gemini 2.0
→ embodied reasoning 강화
→ Gemini Robotics-ER

Gemini Robotics-ER
+ robot action data
→ Gemini Robotics VLA

cloud VLA backbone
+ local action decoder
→ 실시간에 가까운 robot control

6. Gemini Robotics 아키텍처 개요

Gemini Robotics는 크게 두 부분으로 구성된다.

VLA backbone
+ local action decoder

VLA backbone은 Gemini Robotics-ER에서 distillation된 Gemini 기반 모델이다. 이 backbone은 현재 장면의 이미지들과 자연어 instruction을 입력받아 task를 이해하고, 로봇이 수행해야 할 행동에 필요한 latent representation을 만든다. 

local action decoder는 로봇 onboard computer에서 실행된다. 이 decoder는 backbone의 출력을 받아 실제 로봇이 실행할 low-level action chunk를 생성한다. 이 구조 덕분에 큰 Gemini 기반 model의 reasoning 능력을 유지하면서도, 로봇 제어에 필요한 부드럽고 반응적인 action을 만들 수 있다. 

전체 구조는 다음과 같이 볼 수 있다.

현재 장면 이미지들
+ 자연어 instruction
→ Gemini Robotics backbone
→ task/context representation

robot observation
+ backbone output
→ local action decoder
→ low-level action chunks
→ ALOHA 2 등 실제 로봇 실행

 

이 구조는 π₀나 GR00T N1처럼 VLM의 reasoning 능력과 action generation 모듈을 결합한다는 점에서 비슷하지만, Gemini Robotics는 특히 Gemini 2.0 기반 embodied reasoning과 cloud-backbone/local-decoder 분리를 강조한다.

7. 데이터셋과 평가 환경

Gemini Robotics는 ALOHA 2 로봇 fleet에서 12개월 동안 수집한 대규모 teleoperated robot action dataset으로 학습되었다. 논문은 이 데이터셋이 수천 시간 규모의 real-world expert demonstration을 포함하며, 수천 개의 다양한 task, object, manipulation skill, episode horizon, dexterity requirement를 포함한다고 설명한다.

평가는 크게 세 방향으로 진행된다.

첫째, short-horizon dexterous task에서 out-of-the-box 성능을 평가한다. 예를 들어 안경 케이스 열기, 콩류 따르기, 파일 폴더 열기, 헤드폰 줄 감기 같은 섬세한 조작 task가 포함된다.

둘째, generalization benchmark를 통해 visual generalization, instruction generalization, action generalization을 평가한다. 이 benchmark는 총 85개 task로 구성되며, 그중 20%는 training distribution, 28%는 visual generalization, 28%는 instruction generalization, 24%는 action generalization을 평가한다.

셋째, fine-tuning을 통해 새로운 task와 새로운 embodiment에 적응할 수 있는지 평가한다. 논문은 origami fox 접기, 카드 게임, lunch-box task 같은 long-horizon dexterous task와, bi-arm Franka 및 Apptronik Apollo humanoid 같은 새로운 robot embodiment에 대한 adaptation을 실험한다.

8. 실험 결과

Gemini Robotics의 핵심 결과는 기존 VLA 및 diffusion baseline보다 다양한 real-world manipulation task에서 더 강한 일반화와 dexterity를 보였다는 점이다.

첫째, short-horizon dexterous task에서 Gemini Robotics는 baseline보다 높은 성능을 보였다. 논문은 20개 task를 대상으로 out-of-the-box 평가를 수행했고, 특히 fold cloth, wrap headphone wire, open folder, insert block처럼 deformable object나 정밀 조작이 필요한 task에서 Gemini Robotics가 강점을 보였다고 설명한다. 일부 어려운 task에서는 Gemini Robotics만 non-zero success를 보였다.

둘째, generalization benchmark에서도 Gemini Robotics가 baseline보다 일관되게 좋은 성능을 보였다. Google DeepMind 공식 소개에 따르면 Gemini Robotics는 종합 generalization benchmark에서 기존 state-of-the-art VLA 모델 대비 평균적으로 2배 이상의 성능을 보였다. 이 benchmark는 새로운 object, 새로운 background, 다른 조명, typo가 포함된 instruction, 다른 언어 instruction, 새로운 object 위치와 shape 변화 등을 포함한다.

셋째, fine-tuning을 통해 새로운 task를 빠르게 학습할 수 있었다. 논문은 8개 short-horizon sub-task에서 demonstration 수를 바꿔가며 fine-tuning을 실험했고, 7개 task에서 최대 100개 demonstration만으로 효과적인 성능 향상을 보였다고 보고한다. 특히 어려운 origami first fold나 lunch-box manipulation task에서 baseline보다 강한 모습을 보였다.

넷째, 새로운 embodiment adaptation도 가능성을 보였다. Gemini Robotics는 ALOHA 2 action data로 학습된 뒤, bi-arm Franka robot과 Apptronik Apollo humanoid에도 fine-tuning되었다. 논문은 새로운 embodiment에 fine-tuning한 뒤 visual disturbance, initial condition 변화, object shape variation에서 single-task diffusion baseline보다 더 강한 일반화를 보였다고 설명한다.

정리하면 실험 결과는 다음을 보여준다.

Gemini 기반 VLM은 embodied reasoning에 강함
robot action data와 결합하면 실제 로봇 제어가 가능함
short-horizon dexterous task에서 baseline보다 강한 성능
visual / instruction / action generalization에서 우수함
100개 이하 demonstration으로 새로운 task에 빠르게 적응 가능
새로운 robot embodiment에도 fine-tuning 가능

9. 로봇을 공부하는 입장에서 본 의미

Gemini Robotics의 가장 큰 의미는 강력한 general-purpose multimodal model을 로봇 action model로 확장했다는 점이다.

OpenVLA는 공개 VLA 모델이라는 점에서 중요했고, π₀는 flow matching 기반 continuous control을 강조했으며, RDT-1B는 양팔 조작용 diffusion foundation model이었다. Gemini Robotics는 여기에 Gemini 2.0의 world knowledge와 reasoning 능력을 결합해, 로봇이 단순히 action을 모방하는 것을 넘어 물리 세계를 이해하고 instruction을 해석하는 방향을 강조한다.

특히 Gemini Robotics-ER의 역할이 중요하다. 이 모델은 단순한 VQA 모델이 아니라, 로봇에 필요한 spatial reasoning, trajectory reasoning, affordance reasoning, grasp prediction, 3D understanding을 수행하는 embodied reasoning backbone에 가깝다. 논문은 Gemini Robotics-ER이 ERQA라는 embodied reasoning benchmark에서 강한 성능을 보였고, zero-shot code generation이나 few-shot in-context robot control에도 활용될 수 있다고 설명한다.

또한 Gemini Robotics는 robot foundation model의 구조적 방향을 보여준다. 앞으로의 로봇 모델은 단순히 “이미지 → action” mapping만 학습하는 것이 아니라, 다음과 같이 구성될 가능성이 크다.

강력한 VLM / LMM backbone
+ embodied reasoning capability
+ robot action data grounding
+ low-latency action decoder
+ task/embodiment-specific fine-tuning

즉, Gemini Robotics는 “Gemini 같은 범용 AI 모델을 실제 물리 세계의 action으로 연결하는 방법”을 보여준 논문이라고 볼 수 있다.

10. 한계점

첫째, Gemini Robotics는 완전히 공개된 open-source VLA 모델은 아니다. 논문과 공식 소개는 공개되어 있지만, 모델 weight와 전체 training pipeline이 OpenVLA처럼 일반 연구자에게 공개된 형태는 아니다. Google DeepMind 공식 페이지도 Gemini Robotics 관련 모델과 SDK 접근을 별도 안내하는 형태로 제공하고 있다.

둘째, cloud backbone과 local decoder 구조는 성능과 latency를 동시에 고려한 설계이지만, 네트워크 연결, cloud inference 비용, 실시간 안정성 측면에서는 실제 배포 환경에 따라 제약이 있을 수 있다. 논문은 전체 end-to-end latency를 약 250ms, effective control frequency를 50Hz로 보고하지만, 이는 특정 시스템 구성에서의 결과로 이해해야 한다. 

셋째, Gemini Robotics-ER의 reasoning 능력도 아직 완전하지 않다. 논문은 Gemini 2.0과 Gemini Robotics-ER이 긴 영상에서 공간 관계를 grounding하거나, 매우 정밀한 robot control에 필요한 numerical point/box prediction을 수행하는 데 한계가 있을 수 있다고 언급한다. 

넷째, 실제 평가의 중심은 ALOHA 2와 일부 adaptation embodiment이다. bi-arm Franka와 Apptronik Apollo humanoid에 대한 adaptation 실험은 가능성을 보여주지만, 모든 휴머노이드나 산업용 로봇에 바로 일반화된다고 보기는 어렵다. 새로운 embodiment에는 여전히 fine-tuning과 target platform data가 필요할 가능성이 높다. 

결론적으로 Gemini Robotics는 Gemini 2.0의 multimodal reasoning을 로봇 action으로 확장한 VLA generalist robot model이다. Gemini Robotics-ER을 통해 물리 세계에 대한 embodied reasoning을 강화하고, Gemini Robotics를 통해 실제 로봇 action chunk를 생성한다. 특히 언어 지시, 새로운 환경, dexterous manipulation, fast adaptation, embodiment transfer를 하나의 큰 프레임 안에서 다룬다는 점에서 중요한 논문이다.

 

* 논문 링크

[2503.20020] Gemini Robotics: Bringing AI into the Physical World

반응형
SMALL