1. 논문 정보
- 논문명: RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
- 저자: Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, Jun Zhu
- 기관: Tsinghua University
- 공개: 2024년 10월 arXiv 공개
- 게재: ICLR 2025
- 분야: Robot Learning, Bimanual Manipulation, Diffusion Policy, Vision-Language-Action
- 키워드: RDT-1B, Robotics Diffusion Transformer, bimanual manipulation, diffusion foundation model, unified action space, ALOHA, few-shot learning
2. 한 줄 요약

RDT-1B는 양팔 로봇 조작을 위해 설계된 1.2B 규모의 diffusion-based foundation model이며, 다양한 로봇 데이터로 pre-training한 뒤 ALOHA dual-arm robot 데이터로 fine-tuning하여 복잡한 양팔 조작, 언어 지시 수행, unseen object/scene 일반화, 1~5개 demonstration 기반 few-shot learning을 보여준 논문이다.
조금 더 풀어서 말하면, RDT-1B는 이미지와 언어 명령, 로봇 proprioception, noisy action chunk를 입력받고 diffusion denoising 과정을 통해 다음 action chunk를 생성하는 모델이다. Hugging Face model card 기준으로 RDT-1B는 최대 3개 view의 RGB 이미지와 언어 instruction을 입력받아 다음 64개 robot action을 예측할 수 있다. (Hugging Face)
핵심 흐름은 다음과 같다.
RGB 이미지
+ 언어 명령
+ 로봇 상태
+ noisy action chunk
→ Robotics Diffusion Transformer
→ denoised action chunk
→ 양팔 로봇 제어
3. 왜 이 논문을 읽었는가?
이 논문은 로봇 foundation model 흐름에서 “양팔 조작”을 본격적으로 다룬다는 점에서 중요하다.
기존 VLA 모델들은 주로 single-arm manipulation이나 비교적 단순한 pick-and-place task에 초점을 맞추는 경우가 많았다. 하지만 실제 가정·산업 환경에서는 물체를 잡고 넘기기, 접기, 케이블 꽂기, 병뚜껑 열기처럼 두 팔이 협력해야 하는 task가 많다. RDT-1B 논문은 bimanual manipulation이 중요하지만, 두 팔을 동시에 제어해야 하기 때문에 action distribution이 더 복잡하고 데이터도 부족하다는 점을 문제로 제시한다.
즉, 이 논문은 다음 질문에 답하려고 한다.
“양팔 로봇 조작도 대규모 데이터와 diffusion transformer를 이용해 foundation model처럼 학습할 수 있을까?”
RDT-1B는 이 질문에 대해, multi-robot pre-training과 ALOHA 기반 bimanual fine-tuning, 그리고 physically interpretable unified action space를 결합하는 방식으로 접근한다.
4. 기존 양팔 조작 학습의 한계
양팔 조작은 single-arm manipulation보다 훨씬 어렵다. 두 팔이 동시에 움직이기 때문에 가능한 action mode가 많고, 같은 task를 수행하는 방법도 여러 가지가 될 수 있다. 예를 들어 한 팔로 물체를 잡고 다른 팔로 뚜껑을 열 수도 있고, 반대로 역할을 바꿀 수도 있다. 이런 multi-modal action distribution을 단순 regression으로 학습하면 여러 행동 방식의 평균을 예측하게 되어 실제로는 불가능한 action이 나올 수 있다.
또 다른 문제는 데이터 부족이다. 양팔 로봇 시스템은 구축과 운용 비용이 크기 때문에, 대규모 demonstration dataset을 모으기 어렵다. RDT-1B는 이 문제를 해결하기 위해 여러 로봇 데이터셋을 하나의 unified action space로 통합하고, 이를 기반으로 cross-robot pre-training을 수행한다.
기존 방법들은 로봇 구조가 다르면 데이터를 버리거나, 서로 공통되는 일부 feature만 사용해야 하는 경우가 많았다. 하지만 이렇게 하면 데이터 다양성이 줄어들고, foundation model 학습에 필요한 규모와 다양성을 확보하기 어렵다. RDT는 각 로봇의 action을 물리적 의미가 보존되는 통합 action vector에 매핑함으로써 이 문제를 완화하려고 한다.
5. RDT-1B의 핵심 아이디어
RDT-1B의 핵심 아이디어는 세 가지다.
첫째, 양팔 조작의 복잡한 action distribution을 diffusion model로 표현한다. 양팔 조작에서는 가능한 행동 경로가 여러 개일 수 있으므로, deterministic regression보다 diffusion 방식이 multi-modal action을 표현하는 데 적합하다고 본다. RDT는 noisy action에서 시작해 denoising 과정을 거쳐 실제 action chunk를 생성한다.
둘째, Transformer 기반 diffusion model을 로봇 데이터에 맞게 수정한다. RDT는 Diffusion Transformer, DiT를 backbone으로 사용하되, 로봇 데이터의 불안정한 수치 범위와 비선형 dynamics를 다루기 위해 QKNorm, RMSNorm, MLP Decoder, Alternating Condition Injection 같은 구조적 수정을 적용한다.
셋째, 다양한 로봇의 action space를 하나로 맞추기 위해 Physically Interpretable Unified Action Space를 제안한다. 이 unified action space는 각 차원이 joint position, end-effector pose, velocity, gripper state 등 물리적 의미를 갖도록 설계되어, 서로 다른 로봇 데이터를 하나의 모델에 학습시킬 수 있게 한다. 논문 appendix 기준 이 unified action space는 128차원으로 정의된다.
간단히 정리하면 다음과 같다.
diffusion model
→ multi-modal bimanual action 표현
transformer backbone
→ 대규모 multi-modal robot data 학습
unified action space
→ 서로 다른 로봇 데이터를 하나로 통합
ALOHA fine-tuning
→ 실제 양팔 조작 능력 강화
6. RDT-1B 아키텍처 개요

RDT-1B는 language-conditioned visuomotor policy이다. 입력으로는 언어 instruction, RGB 이미지, proprioception, control frequency, diffusion timestep, noisy action chunk가 들어가고, 출력은 denoised action chunk이다. 프로젝트 페이지는 이를 image/language input을 condition으로 사용하고, low-dimensional proprioception과 noisy action chunk를 denoising input으로 사용하는 구조로 설명한다. (RDT Project Page)
이미지는 frozen SigLIP vision encoder로 처리한다. 언어 명령은 frozen T5-XXL로 encoding한다. proprioception, noisy action chunk, control frequency 같은 low-dimensional input은 MLP와 Fourier features를 이용해 token space로 변환한다.
RDT는 DiT 기반 구조를 사용하지만, 일반 이미지 diffusion model과는 다르게 로봇 action을 예측해야 한다. 그래서 마지막 decoder를 단순 linear layer가 아니라 MLP decoder로 바꾸어 비선형 robot action을 더 잘 표현하게 하고, image token과 language token을 cross-attention에 번갈아 주입하는 Alternating Condition Injection을 사용한다. 이는 이미지 token이 많아 언어 정보가 묻히는 문제를 줄이기 위한 설계이다.
전체 구조는 다음과 같이 볼 수 있다.
Language instruction → T5-XXL encoder
RGB images → SigLIP vision encoder
Proprioception/action/frequency → MLP encoder
Noisy action chunk → Diffusion Transformer
Image/text condition → alternating cross-attention
Output → denoised 64-step action chunk
7. 데이터셋과 평가 환경
RDT-1B는 46개 multi-robot dataset, 1M+ episodes로 pre-training되었다. 프로젝트 페이지는 이를 현재까지 가장 큰 multi-robot collection 중 하나로 설명하며, 이후 ALOHA dual-arm robot에서 수집한 6K+ bimanual episodes로 fine-tuning했다고 밝힌다.
pre-training dataset에는 RT-1, RH20T, DROID, BridgeData V2, RoboSet, Open X-Embodiment subset 등이 포함된다. 모델 card 기준 RDT-1B는 SigLIP을 vision backbone으로, T5-XXL을 language model로 사용한다.
평가는 ALOHA dual-arm robot에서 수행되며, unseen object, unseen scene, instruction following, few-shot learning, dexterous manipulation을 중심으로 구성된다. 대표 task에는 cup washing, water pouring, handover, folding shorts, joystick을 밀어 robot dog를 직진시키는 task 등이 포함된다.
8. 실험 결과
RDT-1B는 ACT, OpenVLA, Octo, scratch RDT와 비교되었다. 논문은 RDT가 여러 real-robot task에서 baselines보다 일관되게 좋은 성능을 보였다고 보고한다. 특히 unseen object와 unseen scene에서 기존 baseline이 전체 task를 끝까지 수행하지 못한 반면, RDT는 여러 sub-task를 이어서 수행하는 모습을 보였다.
언어 지시 수행에서도 RDT의 장점이 나타난다. 예를 들어 물을 “1/3” 또는 “2/3”까지 따르라는 instruction은 training instruction에서 직접 보지 않은 표현이지만, RDT는 어느 손을 사용할지와 어느 정도까지 물을 따라야 하는지를 비교적 잘 따랐다고 논문은 설명한다.
few-shot learning에서는 handover task와 fold shorts task를 평가했다. 논문은 RDT가 1~5개의 demonstration만으로 기존에 없던 새로운 skill을 학습할 수 있음을 보였다고 설명한다. 특히 project page와 ICLR abstract 모두 RDT가 1~5 demonstrations로 새로운 skill을 학습할 수 있다고 요약한다. (ICLR Proceedings)
ablation 결과도 중요하다. RDT에서 diffusion을 제거하고 deterministic regression으로 바꾸거나, 모델 크기를 줄이거나, pre-training 없이 scratch로 학습하면 성능이 크게 떨어졌다. 논문은 큰 모델 크기, 대규모 데이터, diffusion modeling이 모두 RDT 성능에 중요한 요소라고 분석한다.
정리하면 실험 결과는 다음을 보여준다.
diffusion은 양팔 조작의 multi-modal action을 표현하는 데 유리함
대규모 multi-robot pre-training은 unseen object/scene 일반화에 도움을 줌
ALOHA fine-tuning은 실제 양팔 조작 능력을 강화함
RDT는 언어 지시 수행과 few-shot skill learning에서도 장점을 보임
9. 로봇을 공부하는 입장에서 본 의미
RDT-1B의 가장 큰 의미는 “양팔 조작 전용 foundation model”을 본격적으로 제시했다는 점이다. OpenVLA나 π₀가 일반적인 VLA 흐름에서 중요하다면, RDT-1B는 bimanual manipulation이라는 더 어려운 영역에 diffusion transformer를 적용했다는 점에서 의미가 있다.
OpenVLA는 action을 token화해 LLM처럼 예측하는 방식에 가깝다. 반면 RDT-1B는 action을 continuous distribution으로 보고 diffusion denoising을 통해 action chunk를 생성한다. 따라서 여러 가능한 행동 mode가 존재하는 양팔 조작 task에서는 RDT 방식이 더 자연스럽게 맞을 수 있다.
π₀와 비교하면, 둘 다 continuous action generation을 중시하지만 RDT-1B는 특히 양팔 로봇의 action space 통합과 bimanual fine-tuning dataset에 초점을 둔다. π₀가 flow matching 기반 general robot control을 강조한다면, RDT-1B는 diffusion transformer와 unified action space를 이용한 bimanual manipulation foundation model에 가깝다.
또한 RDT-1B의 unified action space는 실용적으로 중요하다. 실제 현장에서는 로봇마다 joint 수, gripper, end-effector control 방식이 다르다. RDT는 이런 차이를 물리적 의미가 있는 하나의 action vector로 맞추려 했고, 이를 통해 서로 다른 로봇 데이터를 foundation model 학습에 활용하려고 했다.
정리하면 RDT-1B의 의미는 다음과 같다.
양팔 조작을 위한 diffusion foundation model
\+ 46개 dataset, 1M+ episodes 기반 pre-training
\+ 6K+ ALOHA bimanual episodes fine-tuning
+ physically interpretable unified action space
+ unseen object/scene 일반화와 few-shot learning
→ bimanual manipulation foundation model의 가능성 제시
10. 한계점
첫째, RDT-1B는 강력하지만 완전히 새로운 로봇 플랫폼에 바로 zero-shot으로 적용되기는 어렵다. Hugging Face model card도 embodiment gap 때문에 pre-training dataset에 없던 robot platform에는 작은 target dataset을 수집해 fine-tuning하는 것을 권장한다고 설명한다.
둘째, 평가가 ALOHA dual-arm robot 중심으로 이루어졌기 때문에, 다른 실제 양팔 로봇 시스템에서도 같은 수준의 성능이 나올지는 추가 검증이 필요하다. 논문 자체도 target dual-arm robot과 pre-training robot 사이의 embodiment gap을 줄이기 위해 별도의 ALOHA bimanual fine-tuning dataset을 수집했다고 설명한다.
셋째, diffusion sampling은 표현력이 좋지만 inference 비용과 latency 측면에서 부담이 될 수 있다. 논문은 action dimension이 이미지보다 훨씬 낮기 때문에 diffusion sampling overhead가 상대적으로 작다고 설명하지만, 실제 고속 제어 환경에서는 sampling step, control frequency, hardware 성능에 따른 검증이 필요하다.
넷째, large model, extensive data, diffusion modeling이 모두 성능에 중요하다는 ablation 결과는 장점이면서 동시에 비용상의 한계이기도 하다. 즉, 좋은 성능을 위해서는 큰 모델과 대규모 데이터, fine-tuning 환경이 필요하다.
결론적으로 RDT-1B는 양팔 로봇 조작을 위한 diffusion foundation model이라는 점에서 중요한 논문이다. 기존 VLA 모델들이 주로 이미지·언어 이해와 single-arm action generation에 집중했다면, RDT-1B는 두 팔이 협력해야 하는 복잡한 manipulation task를 대규모 pre-training과 diffusion transformer로 다루려 했다. 특히 unified action space와 ALOHA fine-tuning을 통해 다양한 로봇 데이터를 하나의 모델로 학습하고 실제 양팔 조작 능력을 강화했다는 점에서 의미가 크다.
* 논문 링크
[2410.07864] RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
'Study > 논문 리뷰' 카테고리의 다른 글
| Gemini Robotics: Gemini 기반 VLA generalist robot model (0) | 2026.07.10 |
|---|---|
| GR00T N1: NVIDIA의 휴머노이드용 VLA foundation model (0) | 2026.07.10 |
| π₀: A Vision-Language-Action Flow Model for General Robot Control (0) | 2026.07.09 |
| RoboCat: 스스로 데이터를 생성하며 개선하는 generalist agent (0) | 2026.07.08 |
| OpenVLA: An Open-Source Vision-Language-Action Model (0) | 2026.07.08 |