1. 논문 정보
- 논문명: SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- 저자: Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, Remi Cadene
- 기관: Hugging Face, Sorbonne University, valeo.ai, École Normale Supérieure Paris-Saclay
- 공개: 2025년 6월 arXiv 공개
- 분야: Robot Learning, Vision-Language-Action Model, Efficient Robotics, Open-Source Robotics
- 키워드: SmolVLA, LeRobot, SmolVLM2, Flow Matching, Action Expert, Asynchronous Inference, Low-cost Robot, SO100, SO101
2. 한 줄 요약

SmolVLA는 450M 규모의 경량 Vision-Language-Action 모델로, 공개된 커뮤니티 로봇 데이터만 사용해 학습하고, 소비자용 GPU나 CPU에서도 실행할 수 있도록 만든 저비용·고효율 VLA 모델이다.
조금 더 풀어서 말하면, 기존 VLA 모델들은 수십억 개 parameter를 가진 대형 모델이 많고, 학습 비용과 inference 비용이 커서 일반 연구자나 개인 개발자가 사용하기 어렵다. SmolVLA는 이 문제를 해결하기 위해 작은 VLM backbone, flow matching 기반 action expert, visual token reduction, layer skipping, asynchronous inference를 결합했다.
핵심 흐름은 다음과 같다.
RGB 이미지
+ 자연어 instruction
+ 로봇 sensorimotor state
→ compact VLM
→ flow matching action expert
→ continuous action chunk 생성
→ 저가형 로봇 제어
즉, SmolVLA의 핵심은 “대형 VLA를 더 크게 만드는 것”이 아니라, “작고 공개적이며 실제로 접근 가능한 VLA를 만드는 것”이다.
3. 왜 이 논문을 읽었는가?
이 논문은 로봇 foundation model의 접근성 문제를 직접 다룬다는 점에서 중요하다.
OpenVLA는 공개 VLA 모델이라는 점에서 의미가 있었지만 7B 규모라서 여전히 학습과 inference 비용이 크다. π₀, RDT-1B, GR00T N1, Gemini Robotics 같은 모델들도 강력하지만, 대부분 큰 모델과 대규모 로봇 데이터, 고가의 하드웨어를 필요로 한다.
SmolVLA는 이 흐름과 반대로 질문한다.
“VLA 모델을 일반 연구자, 개인 개발자, 저가형 로봇 사용자도 학습하고 배포할 수 있을까?”
논문은 기존 VLA 모델이 대규모 academic/industrial dataset에 의존하고, 학습 비용이 높아 실제 접근성이 낮다는 점을 문제로 지적한다. 이에 대해 SmolVLA는 공개된 LeRobot 커뮤니티 데이터, 저가형 SO100/SO101 로봇, 작은 모델 구조, 재현 가능한 학습 코드와 모델 weight 공개를 통해 VLA 연구의 진입 장벽을 낮추려 한다. (Hugging Face Blog)
4. 기존 VLA 모델의 한계
기존 VLA 모델의 가장 큰 한계는 비용이다. OpenVLA, π₀, RDT-1B처럼 강력한 VLA 모델은 수십억 parameter 규모이며, 학습에는 많은 GPU와 대규모 로봇 데이터가 필요하다. 논문은 이러한 모델들이 효과적이지만, 일반 사용자에게는 학습·배포 비용이 높고, 고가의 로봇 플랫폼에 의존하는 경우가 많다고 설명한다.
또 다른 한계는 데이터 접근성이다. 기존 VLA 연구는 주로 연구기관이나 기업이 수집한 대규모 데이터셋에 의존한다. 반면 최근에는 저가형 로봇 플랫폼과 LeRobot 같은 표준화된 오픈소스 도구를 통해 개인이나 커뮤니티가 수집한 데이터가 늘고 있다. SmolVLA는 이런 community-collected dataset이 로봇 학습에 중요한 자원이 될 수 있다고 본다.
마지막으로 inference latency 문제도 있다. 많은 VLA는 action chunk를 한 번 예측한 뒤 해당 chunk를 모두 실행하고, 그 다음에야 새로운 observation을 처리한다. 이 방식은 중간에 환경이 바뀌어도 빠르게 반응하기 어렵다. SmolVLA는 action execution과 observation/action prediction을 분리하는 asynchronous inference stack을 제안해 이 문제를 줄이려 한다.
5. SmolVLA의 핵심 아이디어
SmolVLA의 핵심 아이디어는 크게 세 가지다.
첫째, 작은 VLM backbone을 사용한다. SmolVLA는 SmolVLM2를 VLM backbone으로 사용한다. SmolVLM2는 SigLIP vision encoder와 SmolLM2 language decoder를 기반으로 하며, multi-image/video input에 최적화된 경량 VLM이다.
둘째, action을 discrete token으로 바꾸지 않고 flow matching으로 continuous action chunk를 생성한다. SmolVLA의 action expert는 약 100M parameter 규모의 compact transformer이며, VLM feature를 condition으로 받아 noisy action에서 실제 action chunk로 가는 vector field를 학습한다. 이는 π₀처럼 continuous control에 적합한 방식이다.
셋째, 효율성을 위해 여러 최적화를 적용한다. SmolVLA는 global image만 사용하고 visual token을 frame당 64개로 제한하며, VLM의 일부 layer만 사용한다. 논문은 LLM layer의 절반 정도만 사용하는 것이 속도와 성능 사이의 좋은 trade-off를 제공한다고 설명한다.
간단히 정리하면 다음과 같다.
작은 VLM backbone
+ visual token reduction
+ VLM layer skipping
+ flow matching action expert
+ asynchronous inference
→ 저비용·고효율 VLA 모델
6. SmolVLA 아키텍처 개요
SmolVLA는 크게 두 부분으로 구성된다.
Compact VLM
+ Action Expert
VLM은 이미지, 언어 instruction, robot state를 처리한다. 이미지는 vision encoder를 통해 visual token으로 변환되고, 언어 명령은 text token으로 변환된다. robot sensorimotor state는 linear layer를 통해 하나의 token으로 projection된다. 이후 visual token, language token, state token을 함께 VLM decoder에 넣어 contextual feature를 만든다.
Action Expert는 VLM feature를 condition으로 받아 robot action chunk를 생성한다. 이 action expert는 flow matching objective로 학습되며, cross-attention과 self-attention block을 번갈아 사용하는 구조를 가진다. 기존 일부 VLA가 self-attention만 사용하거나 cross-attention만 사용하는 것과 달리, SmolVLA는 두 attention 방식을 interleaving하여 효율성과 성능을 함께 노린다.
전체 구조는 다음과 같이 볼 수 있다.
Multi-view RGB images
+ language instruction
+ robot state
→ SmolVLM2 backbone
→ VLM feature
VLM feature
+ noisy action chunk
→ Flow Matching Action Expert
→ denoised continuous action chunk
→ robot action execution
중요한 점은 SmolVLA가 작은 모델이라는 점만이 아니라, action tokenization 대신 flow matching을 사용한다는 점이다. 따라서 OpenVLA처럼 action을 discrete token으로 autoregressive하게 생성하는 방식보다, continuous action chunk를 빠르게 생성하는 데 더 적합하다.
7. 데이터셋과 평가 환경
SmolVLA는 Hugging Face의 공개 커뮤니티 데이터 중 481개 dataset을 선별해 pretraining에 사용했다. 이 데이터는 총 22.9K episodes, 10.6M frames 규모이며, 논문은 기존 대형 VLA 학습 데이터보다 훨씬 작은 규모라고 설명한다.
커뮤니티 데이터는 장점과 단점이 모두 있다. 다양한 실제 환경에서 수집되었다는 장점이 있지만, task annotation이 부정확하거나 camera view naming이 제각각인 문제가 있다. SmolVLA는 이를 보완하기 위해 Qwen2.5-VL-3B-Instruct를 사용해 task description을 자동 생성하고, camera view를 top, wrist, side 중심으로 표준화했다.
평가는 simulation과 real world에서 모두 진행되었다. Simulation benchmark로는 LIBERO와 Meta-World를 사용했고, real-world benchmark로는 저가형 SO100, SO101 robot arm을 사용했다. 실제 task에는 pick-place, stacking, sorting, Lego block pick-place 등이 포함된다.
8. 실험 결과
SmolVLA의 핵심 결과는 작은 모델임에도 기존 대형 VLA나 강한 imitation learning baseline과 경쟁하거나 더 좋은 성능을 보였다는 점이다.
Simulation에서는 LIBERO와 Meta-World에서 평가했다. 논문에 따르면 SmolVLA는 LIBERO와 Meta-World에서 Octo, OpenVLA, Diffusion Policy 같은 baseline보다 높은 성능을 보였다. 특히 SmolVLA-0.45B는 LIBERO 평균 87.3%, Meta-World 평균 57.3%를 기록했다.
Real-world SO100 평가에서도 SmolVLA는 좋은 성능을 보였다. Pick-place, stacking, sorting 세 task에서 SmolVLA-0.45B는 평균 78.3% 성공률을 기록했고, ACT는 48.3%, 더 큰 VLA baseline은 61.7%였다. SO101 Lego pick-place task에서는 in-distribution 90%, out-of-distribution 50%를 기록해 ACT의 70%, 40%보다 높았다.
Pretraining 효과도 분명했다. SO100 real-world task에서 pretraining 없이 multi-task training한 SmolVLA는 평균 51.7%였지만, community dataset pretraining을 사용한 경우 평균 78.3%로 향상되었다. 이는 작은 데이터라도 커뮤니티 기반 pretraining이 실제 로봇 성능에 도움이 될 수 있음을 보여준다.
Asynchronous inference도 중요한 결과다. Hugging Face 소개 글은 asynchronous inference가 30% 빠른 response와 2배 task throughput을 지원한다고 설명한다. 논문 표에서도 SO100 real-world task의 평균 completion time이 synchronous 13.75초에서 asynchronous 9.70초로 줄었다. 다만 평균 성공률은 synchronous 78.3%, asynchronous 73.3%로 약간 낮아져, 속도와 안정성 사이의 trade-off가 있음을 보여준다.
정리하면 실험 결과는 다음을 보여준다.
450M 규모의 작은 모델로도 대형 VLA와 경쟁 가능
공개 커뮤니티 데이터 pretraining이 실제 성능 향상에 도움
flow matching action expert가 continuous action chunk 생성에 효과적
SO100/SO101 같은 저가형 로봇에서도 동작 가능
asynchronous inference로 반응성과 처리량 개선 가능
9. 로봇을 공부하는 입장에서 본 의미
SmolVLA의 가장 큰 의미는 VLA 연구의 민주화이다.
OpenVLA는 공개 모델이라는 점에서 중요하지만 7B 규모라 접근성이 제한적이다. π₀, RDT-1B, GR00T N1, Gemini Robotics는 매우 강력하지만, 일반 연구자가 같은 규모로 학습하거나 재현하기 어렵다. SmolVLA는 이와 달리 450M 규모의 모델, 공개 커뮤니티 데이터, LeRobot 기반 학습 코드, 저가형 로봇 플랫폼을 전면에 내세운다.
또한 SmolVLA는 로봇 foundation model이 꼭 거대해야만 하는 것은 아니라는 점을 보여준다. 모델 크기를 줄이더라도 적절한 VLM backbone, flow matching action expert, visual token reduction, layer skipping, community data pretraining을 결합하면 실용적인 성능을 얻을 수 있다.
SmolVLA는 특히 다음과 같은 사용자에게 의미가 크다.
고가 로봇 없이 VLA를 실험하고 싶은 연구자
LeRobot 기반 저가형 로봇을 사용하는 개발자
자체 데이터로 VLA fine-tuning을 해보고 싶은 사용자
대형 GPU cluster 없이 robot policy를 학습하려는 팀
즉, SmolVLA는 “최고 성능의 거대 모델”보다는 “실제로 많은 사람이 써볼 수 있는 VLA baseline”에 가깝다.
10. 한계점
첫째, pretraining 데이터의 embodiment 다양성이 제한적이다. 논문은 현재 pretraining이 주로 SO100 robot type에서 수집된 데이터에 기반하며, 새로운 robot platform으로 일반화하려면 더 다양한 embodiment 데이터가 필요하다고 설명한다.
둘째, 데이터 규모가 아직 작다. SmolVLA의 training dataset은 약 23K trajectories 수준으로, OpenVLA가 약 1M trajectory를 사용한 것과 비교하면 훨씬 작다. 논문도 데이터셋 규모를 확장하면 성능과 일반화가 더 좋아질 수 있다고 본다.
셋째, VLM backbone이 로봇에 최적화된 것은 아니다. SmolVLA는 SmolVLM2를 사용하지만, 논문은 이 backbone이 주로 document reading이나 OCR 성격의 pretraining을 받은 모델이라 실제 로봇 상호작용에 최적인지는 아직 확실하지 않다고 설명한다.
넷째, asynchronous inference는 속도를 높이지만 항상 성공률을 높이는 것은 아니다. 논문 결과에서도 평균 completion time은 줄었지만, 평균 성공률은 synchronous보다 약간 낮았다. 따라서 실제 사용에서는 task 특성에 따라 responsiveness와 안정성 사이의 균형을 조정해야 한다.
결론적으로 SmolVLA는 저비용·경량 VLA 모델이라는 점에서 중요한 논문이다. 기존 VLA 연구가 점점 대형 모델과 대규모 데이터 중심으로 가는 상황에서, SmolVLA는 작은 모델, 공개 데이터, 저가형 로봇, 재현 가능한 학습 코드로도 의미 있는 성능을 낼 수 있음을 보여준다. 특히 VLA를 직접 fine-tuning하거나 실제 저가형 로봇에 배포해보고 싶은 사람에게 좋은 출발점이 되는 모델이다.
* 논문 링크
[2506.01844] SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
'Study > 논문 리뷰' 카테고리의 다른 글
| Gemini Robotics: Gemini 기반 VLA generalist robot model (0) | 2026.07.10 |
|---|---|
| GR00T N1: NVIDIA의 휴머노이드용 VLA foundation model (0) | 2026.07.10 |
| RDT-1B: 양팔 조작용 diffusion foundation model (0) | 2026.07.09 |
| π₀: A Vision-Language-Action Flow Model for General Robot Control (0) | 2026.07.09 |
| RoboCat: 스스로 데이터를 생성하며 개선하는 generalist agent (0) | 2026.07.08 |