본문 바로가기
Study/논문 리뷰

π₀: A Vision-Language-Action Flow Model for General Robot Control

by 강렬한 스포트라이트 2026. 7. 9.

1. 논문 정보

  • 논문명: π₀: A Vision-Language-Action Flow Model for General Robot Control
  • 저자: Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Chelsea Finn, Sergey Levine, Karol Hausman 외
  • 기관: Physical Intelligence
  • 공개: 2024년 10월 arXiv 공개
  • 게재: Robotics: Science and Systems, RSS 2025
  • 분야: Robot Learning, Vision-Language-Action Model, Generalist Robot Policy
  • 키워드: π₀, Pi-Zero, VLA, Flow Matching, PaliGemma, Robot Foundation Model, Action Chunking, Dexterous Manipulation

2. 한 줄 요약

 

π₀는 pretrained Vision-Language Model 위에 flow matching 기반 action expert를 붙여, 이미지와 언어 명령을 입력받고 연속적인 로봇 action chunk를 생성하는 generalist robot policy이다.

조금 더 풀어서 말하면, 기존 VLA 모델들은 언어 모델처럼 action을 discrete token으로 예측하는 경우가 많았다. 하지만 실제 로봇 제어는 연속적인 action을 빠르고 부드럽게 생성해야 한다. π₀는 이 문제를 해결하기 위해 flow matching을 사용해 continuous action distribution을 모델링하고, 고주파 제어가 필요한 dexterous manipulation task에도 적용할 수 있도록 설계되었다. 논문은 최대 50Hz 수준의 dexterous task 제어를 목표로 한다고 설명한다.

핵심 흐름은 다음과 같다.

이미지 observation
+ 언어 명령
+ 로봇 proprioceptive state
→ pretrained VLM backbone
→ action expert
→ flow matching으로 action chunk 생성
→ 로봇 제어

3. 왜 이 논문을 읽었는가?

이 논문은 OpenVLA, RoboCat과 이어지는 로봇 foundation model 흐름에서 중요한 위치에 있다.

OpenVLA는 LLM/VLM을 이용해 action token을 예측하는 공개 VLA 모델이고, RoboCat은 visual goal-conditioned 방식으로 여러 로봇과 task를 학습하는 generalist agent였다. 반면 π₀는 VLA 구조에 flow matching을 결합해, 연속적이고 정교한 action trajectory를 직접 생성하려는 접근이다.

즉, 이 논문은 다음 질문에 답하려고 한다.

“언어와 이미지를 이해하는 VLM을 기반으로 하면서도, 실제 로봇이 필요한 부드럽고 정밀한 연속 제어를 어떻게 만들 수 있을까?”

논문은 robot foundation model이 실제 환경에서 유용하려면 데이터, 일반화, 강건성 문제가 해결되어야 하며, 이를 위해 large-scale robot data와 pretrained VLM, 그리고 flow matching 기반 action generation을 결합했다고 설명한다.

4. 기존 VLA 방식의 한계

기존 VLA 모델은 이미지와 언어 명령을 입력받아 로봇 action을 예측한다는 점에서 강력하지만, 실제 로봇 manipulation에는 몇 가지 어려움이 있다.

첫째, 로봇 action은 본질적으로 continuous control 문제이다. 로봇 팔의 위치, 자세, gripper 상태는 연속적인 값으로 제어되어야 한다. 하지만 일부 VLA는 action을 discrete token으로 변환해 autoregressive하게 예측한다. 이 방식은 LLM 구조를 활용하기 쉽지만, 고주파 제어와 정교한 손동작에는 한계가 생길 수 있다.

둘째, 복잡한 조작 task는 단일 action이 아니라 여러 step의 action trajectory가 중요하다. 예를 들어 빨래를 접거나, 상자를 조립하거나, 식탁을 치우는 task는 단순 pick-and-place보다 훨씬 긴 horizon과 다양한 물체 상호작용이 필요하다. 논문도 laundry folding, table cleaning, box assembly 같은 복잡한 task를 주요 평가 대상으로 사용한다.

셋째, robot foundation model은 단순히 큰 모델만으로 해결되지 않는다. 논문은 pre-training data와 post-training data의 역할이 다르다고 본다. 다양한 pre-training data는 모델이 여러 상황을 경험하고 recovery 능력을 갖게 해주며, 고품질 post-training data는 특정 downstream task를 fluent하게 수행하도록 만든다.

5. π₀의 핵심 아이디어

π₀의 핵심 아이디어는 pretrained VLM에 robot-specific action expert를 추가하고, action 생성을 flow matching 문제로 푸는 것이다.

π₀는 PaliGemma라는 3B 규모의 open-source VLM을 backbone으로 사용한다. 여기에 300M parameter 규모의 action expert를 추가해 전체 모델은 약 3.3B parameter가 된다. PaliGemma는 이미지와 언어를 이해하는 역할을 하고, action expert는 로봇 state와 noisy action chunk를 처리하면서 실제 로봇 action을 생성하는 역할을 한다.

여기서 중요한 점은 action을 discrete token으로 바꾸지 않는다는 것이다. π₀는 action을 continuous variable로 보고, noise에서 시작해 점점 실제 action trajectory로 denoising하는 vector field를 학습한다. 이는 diffusion model과 비슷한 방식이지만, 논문에서는 conditional flow matching loss를 사용한다. 

간단히 표현하면 다음과 같다.

랜덤 noise action
+ 현재 이미지
+ 언어 명령
+ 로봇 상태
→ action expert가 denoising 방향 예측
→ 여러 integration step을 거쳐 실제 action chunk 생성

6. π₀ 아키텍처 개요

 

π₀는 크게 두 부분으로 구성된다.

VLM backbone
+ action expert

 

첫째, VLM backbone은 PaliGemma 기반이다. 이미지 observation은 image encoder를 통해 embedding으로 변환되고, 언어 명령 token과 함께 transformer backbone에 입력된다. 이를 통해 모델은 인터넷 규모의 vision-language pretraining에서 얻은 semantic knowledge를 활용할 수 있다.

둘째, action expert는 로봇 제어에 특화된 별도 weight set이다. 논문은 이를 mixture-of-experts와 유사한 구조로 설명한다. 이미지와 언어 token은 큰 VLM backbone으로 보내고, 로봇 state와 action token은 작은 action expert로 보낸다. 두 expert는 self-attention을 통해 상호작용한다.

입력은 다음과 같다.

여러 RGB 카메라 이미지
+ 언어 명령
+ 로봇 proprioceptive state
+ noisy action chunk

 

출력은 다음과 같다.

denoising vector field
→ continuous action chunk

 

이 구조의 장점은 두 가지다. VLM backbone은 이미지와 언어 이해를 담당하고, action expert는 고주파 continuous control을 담당한다. 즉, semantic reasoning과 low-level control을 하나의 모델 안에서 분리해 처리하는 구조라고 볼 수 있다.

7. 데이터셋과 평가 환경

π₀는 대규모 robot manipulation data로 학습되었다. 논문 기준 pre-training mixture는 7개의 robot configuration과 68개의 task에서 수집된 약 10,000시간의 dexterous manipulation data를 포함하며, 여기에 OXE, DROID, Bridge 같은 기존 공개 robot dataset도 함께 사용된다.

평가 환경은 크게 세 가지로 나뉜다.

첫째, pre-trained model이 zero-shot 또는 direct prompting으로 다양한 task를 수행할 수 있는지 평가한다.

둘째, 언어 명령을 얼마나 잘 따르는지 평가한다. 예를 들어 table bussing, table setting, grocery bagging처럼 여러 물체를 구분하고, 언어 지시에 맞게 집고 놓는 task가 포함된다.

셋째, 새로운 downstream task에 fine-tuning했을 때 얼마나 잘 적응하는지 평가한다. 논문에서는 bowl stacking, towel folding, tupperware in microwave, drawer task, paper towel replacement 같은 task를 사용한다.

즉, π₀의 평가는 단순한 pick-and-place가 아니라, 여러 물체와 긴 horizon, 언어 조건, dexterous manipulation이 필요한 task를 중심으로 구성되어 있다.

8. 실험 결과

π₀의 핵심 결과는 pretrained VLM과 flow matching 기반 action expert를 결합했을 때, 기존 robot policy보다 복잡한 manipulation task에서 더 강한 성능을 보였다는 것이다.

논문은 π₀가 zero-shot control, language instruction following, fine-tuning task에서 평가되었고, prior VLA 모델 및 dexterous manipulation 전용 모델보다 좋은 성능을 보였다고 보고한다. 특히 복잡한 multi-stage task에서는 pre-training과 fine-tuning을 함께 사용한 full recipe가 가장 좋은 결과를 보였다.

언어 명령 평가에서는 human expert가 제공한 intermediate language command나 high-level VLM policy가 제공한 중간 명령을 사용할 때 성능이 좋아졌다. 이는 π₀가 단순히 motor control만 하는 것이 아니라, pretrained VLM을 통해 언어 지시를 이해하고 task를 수행하는 능력을 가진다는 점을 보여준다.

fine-tuning 결과에서도 pre-training의 효과가 나타났다. 논문은 새로운 dexterous task에서 pre-trained π₀가 scratch model보다 자주 더 좋은 성능을 보였고, 일부 task에서는 최대 약 2배의 개선을 보였다고 설명한다. 특히 pre-training data와 유사한 task일수록 pre-training 효과가 크게 나타났다.

복잡한 multi-stage task에서는 laundry folding, mobile laundry, table bussing, box building, to-go box packing, egg packing 등을 평가했다. 논문은 이러한 task들이 매우 어렵고, 다른 방법으로는 해결하지 못했다고 설명하며, full pre-training + fine-tuning recipe가 전반적으로 가장 좋은 성능을 보였다고 보고한다.

요약하면 실험 결과는 다음을 보여준다.

pretrained VLM은 언어 이해와 semantic reasoning에 도움을 줌
flow matching action expert는 continuous action chunk 생성에 적합함
pre-training은 복잡한 task에서 recovery와 일반화에 도움을 줌
fine-tuning은 downstream task를 더 fluent하게 수행하도록 만듦

9. 로봇을 공부하는 입장에서 본 의미

π₀의 가장 중요한 의미는 VLA 모델이 discrete action token 예측을 넘어, flow matching 기반 continuous action generation으로 확장될 수 있음을 보여준다는 점이다.

OpenVLA는 action을 token화해서 LLM처럼 예측하는 방식에 가깝다. 이 방식은 공개 모델과 fine-tuning 측면에서 의미가 크지만, action discretization으로 인해 정밀 제어에서는 한계가 있을 수 있다. 반면 π₀는 action을 continuous distribution으로 직접 모델링한다. 따라서 high-frequency, dexterous manipulation에 더 적합한 구조를 목표로 한다.

RoboCat과 비교하면 π₀는 goal image가 아니라 language instruction을 주요 task specification으로 사용한다는 점이 다르다. RoboCat은 visual goal-conditioned agent에 가깝고, π₀는 VLM을 기반으로 language-conditioned robot control을 수행하는 VLA에 가깝다.

또한 π₀는 robot foundation model 학습도 LLM처럼 pre-training과 post-training으로 나눠 볼 수 있다는 관점을 제시한다. 논문은 pre-training이 다양한 물리적 상황과 recovery 능력을 제공하고, post-training이 특정 task를 잘 수행하는 전략을 제공한다고 설명한다.

정리하면 π₀의 의미는 다음과 같다.

pretrained VLM의 semantic knowledge 활용
+ flow matching 기반 continuous action generation
+ action chunking을 통한 고주파 제어
+ 대규모 robot data pre-training
+ downstream task fine-tuning
→ 복잡한 real-world manipulation을 위한 VLA 구조 제안

10. 한계점

첫째, 어떤 pre-training data를 어떻게 구성해야 하는지에 대한 원리는 아직 명확하지 않다. 논문도 가능한 데이터를 많이 합쳤지만, 어떤 데이터가 더 도움이 되는지, 어떻게 weighting해야 하는지는 open problem이라고 설명한다.

둘째, 모든 task가 안정적으로 해결되는 것은 아니다. 논문은 평가 task 중 일부가 reliable하게 동작하지 않았고, near-perfect performance를 얻기 위해 어떤 종류의 데이터가 얼마나 필요한지 예측하기 어렵다고 언급한다.

셋째, manipulation을 넘어 완전히 다른 embodiment나 domain까지 확장될지는 아직 확실하지 않다. 논문은 다양한 task와 robot을 결합하는 것이 어느 정도 positive transfer를 주는지, 그리고 이것이 autonomous driving, navigation, legged locomotion 같은 더 다른 domain까지 확장되는지는 future work로 남긴다.

넷째, π₀는 강력한 모델이지만 학습과 배포 비용이 작지 않다. openpi repository는 base checkpoint와 fine-tuning 예제를 제공하지만, full fine-tuning에는 70GB 이상의 GPU memory가 필요하다고 안내한다. LoRA fine-tuning도 22.5GB 이상 GPU memory를 요구한다.

결론적으로 π₀는 “로봇 VLA 모델이 언어와 이미지를 이해하는 것에서 끝나지 않고, flow matching을 통해 실제 로봇의 연속적이고 정교한 action까지 생성할 수 있다”는 방향을 보여준 논문이다. 특히 OpenVLA가 공개 VLA와 fine-tuning 관점에서 중요하다면, π₀는 flow matching 기반 continuous control과 복잡한 dexterous manipulation 관점에서 중요한 논문이라고 볼 수 있다.

 

* 논문 관련 링크

π₀: A Vision-Language-Action Flow Model for General Robot Control · Robotics: Science and Systems

반응형
SMALL