1. 논문 정보
- 논문명: Octo: An Open-Source Generalist Robot Policy
- 모델명: Octo
- 저자: Octo Model Team — Dibya Ghosh, Homer Walke, Karl Pertsch, Kevin Black, Oier Mees, Sudeep Dasari, Joey Hejna, Tobias Kreiman, Ria Doshi, Charles Xu, Jianlan Luo, You Liang Tan, Lawrence Yunliang Chen, Pannag Sanketi, Quan Vuong, Ted Xiao, Dorsa Sadigh, Chelsea Finn, Sergey Levine
- 소속: UC Berkeley, Stanford University, Carnegie Mellon University, Google DeepMind
- 공개: 2024년 5월 arXiv 공개, RSS 2024 논문
- 분야: Robot Learning, Imitation Learning, Generalist Robot Policy, Vision-Language-Action, Diffusion Policy, Cross-Embodiment Learning
- 키워드: Octo, Generalist Robot Policy, Open X-Embodiment, Diffusion Policy, Transformer, Goal Image Conditioning, Language-Conditioned Robot Policy
2. 한 줄 요약

Octo는 여러 로봇 데이터로 사전학습한 오픈소스 generalist robot policy로, 언어 명령이나 목표 이미지를 입력받아 로봇 action을 diffusion 방식으로 예측하고, 새로운 로봇·센서·action space에도 비교적 적은 데이터로 finetuning할 수 있음을 보인 논문이다.
조금 더 풀어서 말하면, 기존 로봇 policy는 보통 특정 로봇, 특정 카메라 구성, 특정 action space에 맞춰 따로 학습된다. 예를 들어 Franka 로봇에서 wrist camera와 end-effector delta action을 쓰는 policy를 학습했다면, 다른 로봇이나 다른 action space로 옮길 때 모델 구조나 입력/출력을 크게 바꿔야 하는 경우가 많다.
Octo는 이 문제를 generalist robot policy 관점에서 접근한다. 여러 로봇과 여러 task에서 수집된 데이터를 하나의 큰 학습 mixture로 만들고, transformer backbone이 다양한 observation token, task token, action readout token을 처리하도록 설계한다. 이를 통해 같은 모델이 여러 camera configuration, language instruction, goal image, 다양한 robot setup을 다룰 수 있게 한다.
핵심 흐름은 다음과 같다.
Open X-Embodiment 데이터 중 25개 dataset 선별
→ 약 800k robot trajectory로 사전학습
→ language instruction 또는 goal image 입력
→ transformer backbone으로 observation/task token 처리
→ diffusion action head로 action chunk 예측
→ 새로운 robot setup에 finetuning
즉, Octo의 핵심은 단순히 “큰 로봇 모델”을 만든 것이 아니라, 오픈소스로 사용할 수 있고, 새로운 observation/action space에 적응 가능한 generalist robot policy의 기본 레시피를 제시했다는 점이다.
3. 왜 이 논문을 읽었는가?
이 논문은 로봇 파운데이션 모델 흐름에서 중요한 질문을 던진다.
“범용 로봇 policy를 만들려면, 모델이 어떤 입력·출력 구조를 가져야 하고, 어떻게 finetuning 가능해야 할까?”
Open X-Embodiment와 RT-X는 여러 로봇 데이터를 통합해 cross-embodiment 학습이 가능하다는 점을 보여줬다. 하지만 RT-X 계열은 사용자가 임의의 sensor input이나 action space를 쉽게 바꿔 적용하기 어렵고, 특히 RT-2-X 같은 대형 모델은 완전히 공개되어 있지 않다는 한계가 있었다. Octo 논문은 기존 generalist robot policy들이 입력 observation, action space, 공개성 측면에서 제한적이었다고 지적한다.
Octo는 이 문제를 해결하기 위해 다음 목표를 둔다.
1. 여러 robot embodiment에서 동작 가능한 policy
2. language instruction과 goal image를 모두 지원하는 policy
3. 새로운 camera input이나 proprioception을 추가할 수 있는 policy
4. 새로운 action space에도 finetuning 가능한 policy
5. 연구 커뮤니티가 직접 사용할 수 있는 open-source policy
따라서 Octo는 RT-1, RT-2, RT-X 이후 흐름에서 “실제로 공개되어 있고, 연구자가 가져다 finetuning할 수 있는 generalist robot policy”라는 점에서 의미가 크다. 논문은 Octo를 fully open-source generalist robot manipulation policy로 제시하며, training pipeline, model checkpoints, data까지 공개했다고 설명한다.
4. 기존 로봇 policy의 한계
기존 로봇 policy 학습 방식의 가장 큰 한계는 로봇 setup이 바뀌면 모델도 다시 맞춰야 한다는 점이다.
첫째, sensor configuration이 다르다. 어떤 로봇은 third-person camera만 쓰고, 어떤 로봇은 wrist camera도 사용한다. 또 어떤 task에서는 force-torque sensor나 proprioception이 중요할 수 있다. 기존 모델은 사전학습 때 정해진 input format에 강하게 묶이는 경우가 많다.
둘째, action space가 다르다. 어떤 로봇은 end-effector delta pose를 쓰고, 어떤 로봇은 joint position control을 쓴다. 또 single-arm robot과 dual-arm robot은 action dimension 자체가 다르다. Octo 논문은 기존 모델들이 새로운 observation이나 action space에 맞게 효과적으로 finetuning되는 능력이 부족했다고 설명한다.
셋째, task specification 방식이 제한적이다. RT-1-X나 RT-2-X는 주로 language instruction을 사용하지만, 실제 로봇 task에서는 “이 상태처럼 만들어라”와 같이 goal image로 지시하는 것이 더 자연스러울 수 있다. Octo는 language instruction뿐 아니라 goal image conditioning도 지원한다.
넷째, 공개성 문제가 있다. 로봇 파운데이션 모델 중 일부는 대규모 모델이나 학습 파이프라인이 공개되어 있지 않아, 연구자들이 재현하거나 실제 로봇에 맞게 바꾸기 어렵다. Octo는 이 문제를 해결하기 위해 pretrained checkpoint, finetuning script, pretraining pipeline, Open X-Embodiment data loader를 공개했다.
5. Octo의 핵심 아이디어
Octo의 핵심 아이디어는 다양한 로봇 observation과 task specification을 token으로 통합하고, transformer backbone이 이를 처리한 뒤 diffusion head로 action을 예측하게 만드는 것이다.
전체 구조는 다음처럼 볼 수 있다.
Task token:
- language instruction
- goal image
Observation token:
- third-person RGB image
- wrist RGB image
- observation history
- 필요 시 새로운 sensor input
Transformer backbone:
- task token과 observation token 처리
- readout token으로 action 예측에 필요한 embedding 생성
Action head:
- diffusion decoding 방식으로 action chunk 생성
여기서 중요한 설계는 입력과 출력을 유연하게 바꿀 수 있도록 만든 compositional architecture이다. Octo는 새로운 observation이나 task input이 추가되면, 기존 transformer weight를 대부분 유지하면서 새로운 positional embedding, lightweight encoder, output head 등을 추가해 finetuning할 수 있다. 논문은 이 구조 덕분에 새로운 센서, action space, robot morphology에 적응할 수 있다고 설명한다.
또 하나의 핵심은 diffusion action head이다. 기존 robot policy는 action을 MSE로 회귀하거나, action dimension을 discrete bin으로 나눠 classification처럼 예측하는 경우가 많았다. Octo는 continuous action을 diffusion 방식으로 생성한다. 논문은 diffusion head가 MSE보다 multi-modal action distribution을 잘 다루고, discretized action보다 continuous action의 정밀도를 유지할 수 있다고 분석한다.
즉, Octo의 핵심을 한 문장으로 정리하면 다음과 같다.
다양한 로봇 데이터로 사전학습한 transformer backbone
+ language / goal image task conditioning
+ 유연한 observation/action adapter
+ diffusion action prediction
= finetuning 가능한 open-source generalist robot policy
6. Octo 아키텍처 개요

Octo는 크게 세 부분으로 구성된다.
1. Task / observation tokenizer
2. Transformer backbone
3. Diffusion action readout head
첫째, task와 observation을 token으로 변환한다. Language instruction은 tokenization 후 pretrained T5-base 모델을 통해 language embedding token으로 변환된다. Image observation과 goal image는 shallow convolution stack을 거친 뒤 patch token sequence로 변환된다. 이렇게 서로 다른 modality를 모두 token sequence로 바꿔 transformer에 입력한다.
둘째, transformer backbone이 token sequence를 처리한다. Octo는 observation token, task token, readout token을 함께 사용한다. Observation token은 시간 순서에 따라 causal하게 처리되고, readout token은 action 예측에 필요한 compact embedding 역할을 한다. 이 readout token이 action head로 전달된다.
셋째, diffusion action head가 action chunk를 예측한다. Octo는 한 step action만 예측하는 것이 아니라 여러 future action으로 구성된 action chunk를 예측한다. Diffusion head는 transformer backbone을 매 denoising step마다 다시 호출하지 않고, transformer가 만든 readout embedding을 조건으로 작은 diffusion head 안에서 denoising을 수행한다.
모델 크기는 다음과 같이 공개되어 있다.
Octo-Small: 27M parameters
Octo-Base: 93M parameters
논문은 Octo-Small과 Octo-Base checkpoint를 공개했으며, GitHub repository에서는 Octo generalist robotic policy의 training과 finetuning code를 제공한다고 설명한다.
7. 데이터셋과 학습 방식
Octo는 Open X-Embodiment Dataset에서 선별한 데이터로 학습된다. Open X-Embodiment 전체는 약 1.5M robot episode를 포함하지만, Octo는 그중 image observation과 delta end-effector control을 포함하고, task와 behavior가 충분히 다양한 dataset을 선별해 약 800k trajectory를 사용한다. 논문은 최종적으로 Open X-Embodiment에서 25개 dataset을 curate했다고 설명한다.
데이터 선택 기준은 다음과 같다.
제외한 데이터:
- image stream이 없는 dataset
- delta end-effector control을 사용하지 않는 dataset
- 지나치게 반복적인 dataset
- 이미지 해상도가 낮은 dataset
- 너무 niche한 task만 포함한 dataset
가중치를 높인 데이터:
- task와 environment가 더 다양한 dataset
또한 dataset마다 camera channel이나 language annotation이 모두 있는 것은 아니기 때문에, Octo는 missing camera channel을 zero-padding하고, gripper action space를 정렬한다. 예를 들어 gripper command에서 +1은 open, 0은 closed가 되도록 맞춘다.
학습 과정에서는 language instruction과 goal image conditioning을 모두 지원하기 위해, training example마다 language instruction이나 goal image를 랜덤하게 drop한다. 언어 annotation이 없는 dataset에서는 goal image conditioning을 사용한다. 또한 goal image는 trajectory의 미래 state에서 sampling하는 hindsight goal relabeling 방식으로 구성된다.
즉, Octo의 학습은 다음 흐름으로 볼 수 있다.
다양한 robot trajectory
→ observation image + task instruction 또는 goal image
→ transformer token sequence
→ readout token
→ diffusion action head
→ future action chunk 예측
8. 실험 구성
Octo 논문은 크게 세 가지 질문을 실험한다.
첫째, Octo가 여러 로봇을 out-of-the-box로 제어할 수 있는가?
둘째, Octo의 pretrained weight가 새로운 로봇·task·observation·action space에 대한 좋은 initialization이 되는가?
셋째, generalist robot policy에서 어떤 설계가 중요한가?
논문은 Octo를 4개 기관, 9개 real robot setup에서 평가했다. 평가에는 single-arm manipulation과 dual-arm manipulation이 포함되며, 다양한 object interaction, long-horizon task, precise manipulation task가 포함된다. 예시로 WidowX BridgeV2, UR5, RT-1 Robot, CMU Baking, Stanford Coffee, Berkeley Peg Insertion, Berkeley Pick-Up, Berkeley Coke, Berkeley Bimanual 등이 등장한다.
비교 대상은 크게 두 부류이다.
Zero-shot 비교:
- RT-1-X
- RT-2-X
- Octo
Finetuning 비교:
- ResNet+Transformer Scratch
- VC-1 visual representation 기반 policy
- Octo finetuning
Zero-shot 평가는 pretraining data에 포함된 robot setup과 유사한 환경에서 수행된다. 하지만 object 위치, 조명, 배경, distractor object가 달라지기 때문에 단순 memorization만으로는 해결하기 어렵다. Finetuning 평가는 새로운 observation input, 새로운 action space, 새로운 robot embodiment를 포함한다.
9. 실험 결과
가장 중요한 결과는 Octo가 zero-shot multi-robot control에서 RT-1-X보다 좋은 성능을 보였고, 일부 평가에서는 훨씬 큰 RT-2-X와 비슷한 수준의 성능을 보였다는 점이다. 논문은 language-conditioned task에서 Octo가 세 가지 robot embodiment/setup 평균으로 RT-1-X보다 29% 높은 success rate를 보였고, WidowX와 RT-1 Robot 평가에서는 55B parameter RT-2-X와 비슷한 성능을 보였다고 보고한다.
또한 Octo는 language instruction뿐 아니라 goal image conditioning도 지원한다. WidowX task에서 goal image conditioning은 language conditioning보다 25% 높은 success rate를 보였다고 논문은 설명한다. 이는 목표 상태를 이미지로 주는 것이 언어보다 더 구체적인 정보를 제공할 수 있음을 시사한다.
두 번째 핵심 결과는 finetuning 성능이다. Octo는 새로운 domain에서 finetuning했을 때 scratch training이나 VC-1 기반 policy보다 훨씬 높은 성능을 보였다. Table I 기준 평균 성공률은 다음과 같다.
ResNet+Transformer Scratch: 평균 20%
VC-1 기반 policy: 평균 15%
Octo finetuning: 평균 72%
세부 task에서도 Octo는 Berkeley Insertion 70%, Stanford Coffee 75%, CMU Baking 50%, Berkeley Pick-Up 60%, Berkeley Coke 100%, Berkeley Bimanual 80%를 기록했다. 논문은 여섯 개 finetuning setup 평균에서 Octo가 다음으로 좋은 baseline보다 52% 높은 성능을 보였다고 설명한다.
세 번째 결과는 설계 요소의 중요성이다. Ablation study에서 Octo-Small은 aggregate performance 83%를 기록했지만, RT-X dataset mix로 학습하면 60%, 단일 Bridge dataset만 사용하면 43%로 떨어졌다. Action prediction 방식도 중요했는데, discretized action prediction은 18%, MSE 기반 continuous prediction은 35%에 그쳤고, diffusion head를 사용한 Octo가 가장 좋은 결과를 보였다. ResNet-50 + Transformer 구조는 70%로 Octo보다 낮았다.
정리하면 실험 결과는 다음을 보여준다.
1. 다양한 robot data mixture가 중요하다.
2. transformer-first architecture가 large-scale robot data 학습에 유리하다.
3. diffusion action head가 MSE나 discretized action보다 좋다.
4. 모델 크기를 키우면 zero-shot 성능도 개선된다.
5. Octo pretrained weight는 새로운 robot setup의 좋은 initialization이 된다.
10. 로봇을 공부하는 입장에서 본 의미
Octo의 가장 큰 의미는 generalist robot policy를 실제 연구자가 사용할 수 있는 형태로 공개했다는 점이다.
RT-1, RT-2, RT-X는 로봇 파운데이션 모델 흐름에서 매우 중요한 논문이지만, 모든 모델과 학습 파이프라인이 자유롭게 공개되어 있는 것은 아니다. 반면 Octo는 pretrained checkpoint, 학습 코드, finetuning 코드, data loader를 공개한다. 이 점은 연구자나 개발자가 자신의 로봇 setup에 generalist policy를 적용해 볼 수 있는 기반을 제공한다.
개발자나 연구자 관점에서 보면 Octo의 의미는 세 가지로 정리할 수 있다.
첫째, 로봇 policy도 pretrain → finetune 흐름으로 갈 수 있음을 보여준다. 기존에는 task마다 policy를 처음부터 학습하는 경우가 많았지만, Octo는 대규모 robot trajectory로 사전학습한 policy가 새로운 task와 robot setup의 좋은 초기값이 될 수 있음을 보였다.
둘째, 입력과 출력의 유연성이 중요하다는 점을 보여준다. 실제 로봇 시스템은 카메라 개수, wrist camera 유무, force-torque sensor, proprioception, action space가 모두 다르다. Octo는 이러한 차이를 token/adaptor/head 구조로 흡수하려고 한다. 이는 generalist robot policy가 단순히 여러 task를 수행하는 것뿐 아니라, 여러 robot interface를 받아들여야 한다는 점을 잘 보여준다.
셋째, goal image conditioning의 가능성을 보여준다. 로봇에게 “문장”으로만 지시하는 것이 아니라, 원하는 최종 상태 이미지를 보여주는 방식은 실제 사용성 측면에서 자연스럽다. Octo는 language와 goal image를 모두 지원하기 때문에, VIMA처럼 multimodal task specification을 다루는 흐름과도 연결된다.
따라서 Octo는 Open X-Embodiment 이후에 읽으면 좋다. Open X-Embodiment가 여러 로봇 데이터를 모으는 데이터셋/RT-X 모델 논문이라면, Octo는 그 흐름을 이어 받아 오픈소스 generalist robot policy를 실제로 학습하고 공개한 논문이라고 볼 수 있다.
11. 한계점
Octo는 중요한 논문이지만, 아직 완전한 범용 로봇 policy라고 보기는 어렵다.
첫째, wrist camera 활용이 아직 충분하지 않다. 논문은 현재 Octo 모델이 wrist camera 정보를 적절히 처리하는 데 어려움이 있었고, 일부 finetuning 결과에서는 third-person camera만 사용할 때가 third-person + wrist camera를 함께 사용할 때보다 더 좋았다고 설명한다. 또한 pretraining data 중 wrist camera 정보가 포함된 비율은 27%에 불과하다고 분석한다.
둘째, language conditioning에도 데이터 한계가 있다. 논문은 pretraining data 중 language annotation이 있는 비율이 56%라고 설명하며, language-conditioned policy와 goal-conditioned policy 사이에 큰 성능 차이가 나타나는 이유 중 하나로 modality coverage 부족을 지적한다.
셋째, 학습은 기본적으로 imitation learning 중심이다. Open X-Embodiment 데이터는 대부분 optimal demonstration으로 구성되어 있고, Octo 역시 이를 imitation 방식으로 학습한다. 논문은 sub-optimal data나 online interaction data를 활용하려면 다른 objective가 필요할 수 있다고 언급한다.
넷째, 평가 범위는 single-arm 및 dual-arm manipulation 중심이다. Octo는 navigation, mobile manipulation, legged robot, humanoid full-body control까지 다루는 모델은 아니다. 논문도 navigation이나 mobile manipulation으로 확장하는 것이 향후 기회라고 설명한다.
다섯째, zero-shot generalization에는 여전히 한계가 있다. 논문은 BridgeV2 domain에서 novel object에는 비교적 잘 대응했지만, 새로운 scene에서는 성능이 조금 떨어지고, flipping이나 precise insertion 같은 novel behavior에서는 큰 성능 저하가 있었다고 설명한다. 즉, Octo는 강한 pretrained policy이지만, 새로운 행동을 완전히 zero-shot으로 해결하는 수준은 아니다.
결론적으로 Octo는 “오픈소스 generalist robot policy를 실제로 학습하고, 여러 로봇 setup에서 zero-shot 및 finetuning 성능을 검증한 논문”이다. 특히 연구자 입장에서는 단순한 benchmark 논문이 아니라, pretrained checkpoint와 finetuning pipeline을 실제로 활용할 수 있다는 점에서 가치가 크다. 다만 완전한 범용 로봇 지능이라기보다는, Open X-Embodiment 기반 generalist manipulation policy의 중요한 출발점으로 보는 것이 적절하다.
* 관련 논문 링크
🐙 Octo: An Open-Source Generalist Robot Policy
🐙 Octo: An Open-Source Generalist Robot Policy
Octo Model Team Dibya Ghosh*,1 Homer Walke*,1 Karl Pertsch*,1,2 Kevin Black*,1 Oier Mees*,1 Sudeep Dasari3 Joey Hejna2 Tobias Kreiman1 Charles Xu1 Jianlan Luo1 You Liang Tan1 Lawrence Yunliang Chen1 Pannag Sanketi4 Quan Vuong4 Ted Xiao4 Dorsa Sadigh2 Chels
octo-models.github.io
'Study > 논문 리뷰' 카테고리의 다른 글
| RoboCat: 스스로 데이터를 생성하며 개선하는 generalist agent (0) | 2026.07.08 |
|---|---|
| OpenVLA: An Open-Source Vision-Language-Action Model (0) | 2026.07.08 |
| Open X-Embodiment: 여러 로봇 데이터를 통합하는 cross-embodiment 학습 (0) | 2026.07.07 |
| VC-1: Embodied AI용 시각 표현 모델 평가 (0) | 2026.07.06 |
| R3M: 사람 영상 기반 visual representation (0) | 2026.07.06 |