
TinyVLA болон SmolVLA нь ажилладаг VLA-г 1 тэрбум параметрээс доош хэмжээнд багтаасан. Хоёр өгүүлэл дэх бодит тоо баримтууд, LeRobot-ийн анхдагч тохиргоонууд, хэмжигдсэн хоцрогдол, мөн 24 ГБ карт дээр нэг ажиллагаа хэр үнэтэй болохыг харуулсан.
Бараг бүх хараа-хэл-үйлдэл загвар тухай бичигдсэн загварууд нь дата төвийн картыг шаарддаг. OpenVLA нь 7 тэрбум параметр юм. GR00T N1.7 болон Pi0.5 нь ойролцоогоор 3 тэрбум бөгөөд нарийн тааруулахын тулд A100 80 GB шаарддаг. Хэрэв таны ширээн дээрх карт 4090 бол, энэ төрлийн загвар нь хүртээмжгүй юм.
Хоёр судалгааны ажил үүнийг шаардлагагүй гэж үздэг. TinyVLA (arXiv 2409.12514, 2025 оны 2-р сард IEEE Robotics and Automation Letters-т хүлээн зөвшөөрөгдсөн) нь 400 саяаас 1.3 тэрбум хүртэлх нуруу болон диффузийн үйлдлийн толгойноос VLA-г бүтээдэг. SmolVLA (arXiv 2506.01844, 2025 оны 6-р сарын 2-нд ирүүлсэн) нь нээлттэй жин, нээлттэй өгөгдөл, нэг хэрэглээний карт дээр ажилладаг скрипттэй 450 сая параметрийг гаргадаг. Энд хоёулаа юу хэмжсэн, мөн 1 тэрбумаас доош гэсэн аргумент хаана хүчингүй болж байгааг харуулав.
Таны мэдэх ёстой зүйлс
- •TinyVLA гурван хэмжээтэй: нийт 422 сая, үүнээс 101 сая нь сургах боломжтой; 740 сая, үүнээс 138 сая нь сургах боломжтой; 1.3 тэрбум, үүнээс 143 сая нь сургах боломжтой. Эхний хоёр нь л 1 тэрбумаас доош байна.
- •Түүний Хүснэгт IV нь нэг A6000 дээрх TinyVLA-1B-ийн үйлдлийн таамаглалд 14 ms, OpenVLA-7B-д 292 ms, багасгасан OpenVLA-1B-д 140 ms хэмжсэн байна.
- •Энэ хурдыг толгой нь хадгалдаг, нуруу нь биш: TinyVLA-H-ийн диффузийн толгойг ACT толгойгоор сольвол таван бодит роботын даалгавар дунджаар 94.0-аас нэг оронтой тоонд хүрнэ. MLP толгой хаа сайгүй 0 оноо авдаг.
- •SmolVLA нь 450 сая, үүнээс ойролцоогоор 100 сая нь үйлдлийн мэргэжилтэн бөгөөд 481 олон нийтийн LeRobot өгөгдлийн багц болон 10.6 сая фрэйм дээр урьдчилан сургагдсан. Энэ нь LIBERO дээр 87.3, робот техникт урьдчилан сургагдсан 3.3 тэрбум Pi0-д 86.0, гурван бодит SO-100 даалгавар дээр 78.3, 3.5 тэрбум Pi0-д 61.7 гэсэн үр дүнг мэдээлсэн.
- •Урьдчилан сургалтгүйгээр нэг даалгаварт сургахад SmolVLA эдгээр даалгавар дээр 40.0 болж буурдаг нь ACT-ийн 48.3-аас доогуур юм. Жижиг байх нь автоматаар хялбар гэсэн үг биш.
- •TinyVLA нь LeRobot-тэй нэгдээгүй бөгөөд CUDA 11.7 wheel stack-ийг ашигладаг. SmolVLA нь lerobot-д байдаг бөгөөд энд 24 GB-ийн түвшинд нэг ажиллуулахад ойролцоогоор 1-3 USD үнэтэй.
Жижиг VLA гэж юуг тооцох вэ
Моделийн картын параметрийн тоо нь нэг тоо биш юм. Энэ нь нийт жин, дүгнэлт хийх үед ачаалагдсан жин, эсвэл градиент хүлээн авдаг жинг илэрхийлж болно . TinyVLA нь энэ хоёрыг хоёуланг нь мэдээлдэг бөгөөд зөрүү нь их: TinyVLA-H нь нийт 1.3 тэрбум боловч 143 сая нь сургах боломжтой, учир нь харааны цамхаг болон хэлний загварын ихэнх хэсэг нь хөлдүү хэвээр байхад LoRA адаптерууд болон үйлдлийн толгой хөдөлдөг. Уг баримт бичигт сургах боломжтой хувийг ойролцоогоор 5 хувь гэж заасан байна.
| Загвар | Параметрүүд | Үндсэн бүтэц | Үйлдлийн толгой | Эх сурвалж |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
Хоёр мөр маргаантай байна. ойролцоогоор 80 сая нь энд байгаа бусад бүхнээс жижиг боловч хэлний загваргүй тул VLA биш юм: энэ нь нэг даалгаврыг сурч, өөр даалгавар гүйцэтгэхийг зааж чадахгүй. 27 сая нь T5-Base текст кодлогчоор дамжуулан нөхцөлдсөн бөгөөд LLM-ийн үндсэн бүтэц биш юм. Сайн суурь үзүүлэлтүүд боловч аль нь ч шошгоны заасан зааврыг дагаж мөрдөх боломжийг олгодоггүй.
Гарчигны үр дүнг агуулсан TinyVLA-H хувилбар нь 1.3 тэрбум бөгөөд энэ шугамаас дээш байрладаг. Илүү чухал асуулт бол загвар нь сургалтын явцад 24 ГБ-д багтаж, дүгнэлт хийх үед таны хяналтын хурдыг хангаж чадах эсэх юм. Та энд сургаж болох таван бодлого бодлогын хуудсанд байна; TinyVLA нь аренагийн бичилттэй бөгөөд хэрэв та бусад бүхний хажууд түүний тоог харахыг хүсвэл.
TinyVLA: хурд нь толгойноос ирдэг, нуруунаас биш
Илэрхий уншигдаж байгаагаар тэд хэлний загварыг жижигрүүлсэн тул хурдан болсон. Гэвч судалгааны ажлын аблацийн шинжилгээ өөр зүйлийг харуулж байна. OpenVLA-ийн 7B нурууг ойролцоогоор 1B нуруугаар солиход үйлдлийн таамаглалыг 292 мс-ээс 140 мс болгон бууруулж, 2 дахин хурдасгасан. TinyVLA-H нь ижил төстэй параметрийн тоотой байхад ижил карт дээр 14 мс-ээр ажилладаг. Үлдсэн 10 дахин хурд нь үйлдлийн толгойноос үүдэлтэй.
| Загвар | Үйлдэл тус бүрийн таамаглал | Хэмжсэн төхөөрөмж |
|---|---|---|
| OpenVLA-7B | 292 ms | нэг A6000 |
| OpenVLA-1B, TinyVLA-ийн нуруугаар солигдсон | 140 ms | нэг A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | нэг A6000 |
OpenVLA нь үйлдлүүдийг хэлний загварын толгойгоор дамжуулан, үйлдлийн хэмжээс тус бүрт нэг нэгээр нь, авторегрессив байдлаар дискретчилсэн токен хэлбэрээр ялгаруулдаг. TinyVLA нь бүх хэсгийг нэг дор гаргадаг диффузийн декодерыг ашигладаг. Хүснэгт V нь TinyVLA-H-ийн архитектурыг харуулж, ижил таван бодит роботын даалгавар дээр зөвхөн толгойг нь сольсон. Энэ нь аль ч судалгааны ажилд хамгийн тодорхой нотолгоо болж байна урсгал тааруулах бодлогууд хийдэг, мөн шалтгаан нь Pi0 токен декодчилохоос татгалзсан.
| TinyVLA-H дээрх гүйцэтгэл | Теннис байрлуулах | Аяга эргүүлэх | Шоо овоолох | Шүүгээ хаах | Хайрцаг нээх |
|---|---|---|---|---|---|
| Diffusion (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Үйлдлийг хэсэгчлэх трансформатор | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Олон үет перцептрон | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 мс-ийн үзүүлэлтүүд нь Хүснэгт IV-т, бүгд нэг A6000 дээр хийгдсэн. Эдгээр нь үйлдлийн таамаглал тус бүрт хамаарах бөгөөд камерын зураг авалт, урьдчилан боловсруулалт болон серво руу цуваа бичих үйлдлүүдийг оруулаагүй болно. Нийтлэгдсэн хоцролтыг хяналтын хурд гэж үзэхгүйгээр, доод хязгаар гэж үзээрэй. Бидний өөрсдийн тоон үзүүлэлтүүд ч мөн адил хязгаарлалттай: таамаглалын хоцролт-ыг үзнэ үү.
TinyVLA-ийн гүйцэтгэл
| Үзүүлэлт | Протокол | TinyVLA-H | Суурь үзүүлэлтүүд |
|---|---|---|---|
| MetaWorld, 50 даалгавар, симуляци | Олон даалгавар, 50 демо, 3 үр | Хүндрэлээр 77.6 / 21.5 / 11.4 / 15.8, дундаж 31.6 | Diffusion Policy дундаж 10.5 |
| Бодит Franka Panda, 5 даалгавар | Даалгавар тус бүрт 100 траектори, 20 туршилт | 94.0 дундаж | OpenVLA 68.3, Diffusion Policy 35.3 |
| Хоёр гарт UR5, 3 даалгавар | Олон даалгавар, даалгавар тус бүрт 10 туршилт | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Хоёр гарт мөрийн тайлбар нь өөрөө уйтгартай: OpenVLA нь зөвхөн нэг гарт өгөгдлөөс бүрдсэн Open X-Embodiment дээр урьдчилан сургагдсан тул хоёр гарт үйлдлийн орон зай нь тархалтаас гадуур бөгөөд тэг оноо авдаг. Диффузийн бодлогын суурь нь эдгээр гурван даалгаврын хоёрт нь TinyVLA-H-г давсан. Дэлгэрэнгүй мэдээлэл: Open X-Embodiment-ийн тайлбар.

TinyVLA репо, 2026 оны 8-р сарын байдлаар
Энэхүү цаас нь сайн. Код нь судалгааны зорилгоор гаргасан. Репозитори нь github.com/liyaxuanliyaxuan/TinyVLA; түүний README нь кодын хувилбарыг 2025 оны 2-р сарын 17-нд, сүүлийн коммитыг 2025 оны 3-р сарын 11-нд хийсэн гэж заасан байна. Цаасыг хуулбарлахад тохиромжтой, харин тогтмол арчилдаг номын сан хүсвэл асуудалтай.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt нь torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 болон CUDA стекийг 11.x хувилбаруудад тогтоосон байна: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README нь Python 3.10-ийг шаарддаг; lerobot 0.6.1 нь 3.12 эсвэл түүнээс хойшхи хувилбарыг шаарддаг тул эдгээр нь нэг орчинд хамт ажиллах боломжгүй. Эхлээд таны GPU-ийн үеийн хувьд torch 2.0.1-ийн бүтээц байгаа эсэхийг баталгаажуулна уу. Хэрэв ажиллуулга VRAM-аас болж зогсвол, санах ой дутагдлын шалгах хуудас нь таамаглахаас илүү хурдан юм.
TinyVLA нь мөн уншдаггүй LeRobot өгөгдлийн багцууд. Түүний формат нь ACT-маягийн HDF5: action, language_raw, болон олон харагдацтай зураг, joint_positions, qpos, qvel агуулсан observations бүлэг. Репозитори нь RLDS оролтод зориулсан data_utils/rlds_to_h5py.py-ийг агуулдаг бөгөөд таск бүрийг aloha_scripts/constants.py файлд dataset_dir, episode_len, camera_names-тай нь гараар бүртгэдэг. Хэрэв таны эпизодууд lerobot эсвэл ширээний компьютер клиент-аас ирсэн бол, та хөрвүүлэлтийг өөрөө хийнэ.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 нь найман карттай төхөөрөмжийг илэрхийлнэ. Үүнийг 1 болгож, багцын хэмжээг 32-оос доош буулгана уу. Нэг GPU-тэй хувилбар нь дээд урсгалд байхгүй тул тушаалыг 4090 дээр яг таг ажиллуулах боломжгүй.
- --deepspeed scripts/zero2.json нь дээд түвшний скрипт директорт байхгүй файлыг заана. DeepSpeed тохиргоонууд нь llava-pythia/scripts/zero2.json хаягаар байрладаг. Эхний ажиллуулахаасаа өмнө замыг засна уу.
- README нь гаралтын директорын нэрэнд llava_pythia, мөн LoRA идэвхжүүлсэн бол lora-г агуулсан байхыг шаарддаг.
- Суурь загвар нь тусдаа татаж авах боломжтой: lesjie/Llava-Pythia-400M, -700M эсвэл -1.3B. lerobot/smolvla_base руу заадаг шиг бодлогыг заах нэг суурь чекпойнт байхгүй.
SmolVLA: Өнөөдөр үдээс хойш ажиллуулж болох 1 тэрбумаас бага параметр бүхий загвар
SmolVLA нь засвар үйлчилгээтэй номын санд ижил аргументыг дэвшүүлдэг. Энэ нь SmolVLM2-500M-Video-Instruct суурь загвар дээр 450 сая параметр агуулдаг бөгөөд үр ашиг нь жижиг хэмжээтэй гэсэн мэдэгдлээс бус, харин configuration_smolvla.py файлаас уншиж болох тохиргоонуудаас үүдэлтэй.
| configuration_smolvla.py дахь тохиргоо | Анхдагч утга | Үр дүн |
|---|---|---|
| num_vlm_layers | 16 | Зөвхөн эхний 16 хэлний загварын давхарга ажиллана |
| expert_width_multiplier | 0.75 | Үйлдлийн эксперт нуугдмал хэмжээ нь VLM-ийн 75 хувьтай тэнцэнэ |
| self_attn_every_n_layers | 2 | Өөрөө-анхаарал нь хөндлөн-анхааралтай ээлжлэн ажиллана |
| chunk_size / n_action_steps | 50 / 50 | Нэг дамжуулалтаар 50 үйлдэл үүсгэж, бүх 50 нь гүйцэтгэгдэнэ |
| num_steps | 10 | Урсгалын тааруулалтын дуу чимээг арилгах нь 10 алхамд тогтоогдсон |
| tokenizer_max_length | 48 | Заавар нь 48 токен болж богиносгогдсон |
| freeze_vision_encoder / train_expert_only | True / True | Нарийвчилсан тааруулалт нь экспертийг хөдөлгөдөг, харааны цамхагийг биш |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Энэ нь өгүүллийн жор биш: түүний урьдчилсан сургалтанд 200000 алхам дээр 100 алхам халаалт ашигласан |
Урьдчилсан сургалтад 481 олон нийтийн LeRobot өгөгдлийн багц, 22.9 K эпизод, 10.6 M фрэймийг 4 GPUs дээр, 256-ийн глобал багцаар 200000 алхам ашигласан; уг баримт бичигт төслийн нийт хугацааг ойролцоогоор 30 K GPU цаг гэж тооцсон байна. Анхаарах нэг тоо: Hugging Face-ийн нээлтийн блогт 487 сонгомол өгөгдлийн багц гэж дурдсан бол баримт бичгийн хүснэгтэд 481 гэсэн байна. Бид баримт бичгийн тоог ашиглаж, зөрүүг тэмдэглэж байна.
| Үзүүлэлт | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO дундаж, олон даалгаварт | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World дундаж, олон даалгаварт | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Бодит SO-100, 3 даалгавар, олон даалгаварт сургалт | 78.3 | - | 61.7 (3.5 B) | - |
| Бодит SO-100, 3 даалгавар, нэг даалгаварт, роботын урьдчилсан сургалтгүй | 40.0 | - | - | 48.3 |
| SO-101 лего түүж байрлуулах, нэг даалгаварт, тархалтад | 90 | - | - | 70 |
| SO-101 лего түүж байрлуулах, нэг даалгаварт, тархалтаас гадуур | 50 | - | - | 40 |
LIBERO бол симуляци бөгөөд одоо тэндхийн бүх чадварлаг загварууд наяад оноо авч байна. Бодит SO-100 мөр, 450 M загвар нь 3.5 B загварыг 16.6 оноогоор давсан нь сонирхолтой; түүний доорх мөр нь эсрэг жин юм. Олон нийтийн урьдчилсан сургалт болон олон даалгаварт сургалтыг хассан тохиолдолд ижил загвар нь ACT-ийн доор 40.0 болж буурдаг. Хамгаалах боломжтой мэдэгдэл бол жижиг загвар автоматаар муу биш, харин илүү сайн биш гэсэн үг юм.
Нэгэн тохиолдол тусална: SmolVLA-ийн баримт бичгийн Meta-World хүснэгтэд TinyVLA-ийн өөрийн хэвлэгдсэн тоог суурь болгон ашигласан тул нэг удаа хоёр загвар нэг хүснэгтэд багтсан байна: SmolVLA-0.45B 57.3, TinyVLA-H 31.6. Мөн SmolVLA нь Pi0-ээс 6 дахин бага санах ой ашиглан 40 хувь хурдан сургагдсан гэж мэдээлсэн. Энэ бүхэн SmolVLA-ийн зохиогчдоос гаралтай; аренагийн бичилт нь утга бүрийг эх сурвалжтай нь холбодог.
SmolVLA хаана цагаа зарцуулдаг вэ
AY-Robots нь SmolVLA-г үйлдлийн алхам тутамд 245 мс, ACT-г 20 мс гэж бодлогын каталог-т жагсаасан байна. TinyVLA нь үйлдлийн таамаглал тутамд 14 мс гэж мэдээлсэн. Эдгээр тоог харьцуулах боломжгүй бөгөөд тэдгээрийг харьцуулж үзэх нь энэ сэдвийн хамгийн түгээмэл алдаа юм: зарим нь нэг урагш дамжуулалтыг хугацаалдаг, зарим нь тэр дамжуулалтыг нэг хэсэгт хувааж, үйлдлийн хэсэгчилэл үүнийг хуваарилдаг.
- SmolVLA нь нэг урагш дамжуулалтаар 50 үйлдэл ялгаруулж, бүх 50-г гүйцэтгэдэг. Баримт бичигт бодит роботууд дээр ашигладаг 30 fps-ээр нэг дүгнэлт нь ойролцоогоор 1.7 секундын хөдөлгөөнийг хамардаг.
- Асинхрон дүгнэлт нь одоогийн хэсэг гүйцэтгэгдэж байхад дараагийн хэсгийг тооцоолно: дундаж даалгавар гүйцэтгэл 9.7 секунд, синхрон 13.75 секунд, ойролцоогоор 30 хувь хурдан, мөн тогтмол 60 секундын хугацаанд 19 сонгож байрлуулах мөчлөг, 9-ийн эсрэг.
- Амжилтын түвшин нь илүү сайн биш, харин харьцуулах боломжтой байсан: синхрон 78.3, асинхрон 73.3. Асинхрон нь нарийвчлал биш, харин гүйцэтгэлийг нэмэгдүүлдэг.
- Хэсэгчилэл нь тооцооллын хоцрогдлыг нуудаг боловч сүлжээний хоцрогдлыг нуудаггүй бөгөөд энэ нь 50 үйлдлийг гүйцэтгэхээр тогтсон тул бодлогыг бага хариу үйлдэлтэй болгодог.
AY-Robots нь таны бодлогыг хэрэгжүүлэх үүлэн GPU подыг автоматаар бэлтгэх боломжтой бөгөөд орон нутгийн роботын клиент тухайн цэгтэй холбогдож, под нь ашиглагдаагүй үедээ өөрийгөө устгах хяналтын системтэй тул чимээгүйгээр төлбөр тооцохгүй. Гэхдээ энэ нь олон нийтийн интернетийн эргэлтийн хугацааг арилгахгүй. Энд байгаа таван бодлогын хяналтын давталт нь ямар ч сүлжээгүйгээр нэг үйлдлийн алхамд 20-485 мс байдаг тул алсын зайн дүгнэлт нь удаан сонгож байрлуулах ажиллагаанд тохиромжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй.

SmolVLA-г нэг хэрэглээний карт дээр нарийн тааруулах
Гарын авлагын зам, lerobot 0.6.1 дээр, 2026 оны 8-р сарын 23-ны байдлаарх одоогийн PyPI хувилбар. Доорх бүх мэдээлэл нь Hugging Face lerobot SmolVLA баримт бичгээс, мөн өдөр татагдсан; удирдамжтай хувилбар нь илүү хялбар.
- 1lerobot-ийг smolvla нэмэлттэйгээр суулгах
SmolVLA-ийн хамаарал нь нэмэлт сонголт бөгөөд үндсэн суулгалтын хэсэг биш юм. Үүнийг суулгалгүйгээр бодлогын төрөл яагаад үл мэдэгдэх байгааг гайхах нь хагас цаг алдах нийтлэг шалтгаан юм.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Хангалттай ангитай өгөгдлийн сан авах
Баримт бичигт ойролцоогоор 50 анги зөвлөж, 25 ангитай ижил даалгавар хангалтгүй байсан гэж заасан. AY-Robots хамгийн багадаа 30-ыг тогтоодог. Өөрийнхөө бичлэгийг хийх, эсвэл өгөгдлийн сангийн лавлах-аас эхлэх.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Нарийвчилсан тохируулгыг эхлүүлэх
lerobot гарын авлагаас авсан тушаал, өөрчлөгдөөгүй. Баримт бичигт 20000 алхамыг нэг A100 дээр ойролцоогоор 4 цаг гэж заасан. 24 ГБ карт дээр илүү урт хугацаа шаардагдах тул хэмжиж үзээрэй.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Багцын хэмжээг таарах хүртэл бууруулах
batch_size=64 нь баримтжуулсан жишээ бөгөөд таны картны талаарх амлалт биш юм. Баримт бичигт ачаалах хугацаа богино хэвээр байх үед багаас эхлээд нэмэгдүүлэхийг зөвлөж байна.
bashlerobot-train --help - 5Хяналтын цэгийг гар дээр ашиглах
Ижил сан, нэг тушаал. Бодит цагийн хэсэгчлэх флагууд нь баримт бичигт тайлбарлагдсан бөгөөд бага чадалтай техник хангамж дээр ашиглах ёстой зүйлс юм.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Та ямар ч замыг сонгосон бай, та хяналтын цэг болон түүнийг үүсгэсэн тохиргоотой болно. Өгөгдлийн сангийн хувилбар, алхамын тоо, үрийг хажууд нь хадгалаарай. lerobot нь анхдагчаар 1000 үрийг ашигладаг; GR00T-ийн нарийвчилсан тохируулгын эхлэх цэг нь ямар ч үрийг ил гаргадаггүй тул эдгээр ажиллагаа нь бит-бит давтагдах боломжгүй юм. Сургалтын баримт бичигт механик хэсгийг үзнэ үү.
Жижиг VLA-г гар дээр суулгах хоёр арга
Та машин болон алдааны горимуудыг эзэмшдэг. SmolVLA-ийн хувьд энэ нь боломжийн юм: нэг pip нэмэлт, нэг сургалтын тушаал, нэг ашиглалтын тушаал. TinyVLA-ийн хувьд энэ нь хөлдөөсөн пин, эвдэрсэн DeepSpeed зам, өөрөө бичсэн өгөгдөл хувиргалт бүхий судалгааны хуулбар юм.
- 24 ГБ карт авах, 30-50 анги бичих, камерын урсгалыг кадр бүрээр шалгах.
- pip install -e ".[smolvla]", lerobot/smolvla_base-ийн эсрэг lerobot-train ажиллуулах, дараа нь гар холбогдсон машинд хяналтын цэгийг үйлчлэх.
- TinyVLA-ийн хувьд: тусдаа conda орчин, өгөгдлийг HDF5 руу хөрвүүлэх, constants.py дотор даалгаврыг бүртгэх, zero2.json замыг засах, train.sh-ийг найман GPU-ээс нэг болгож багасгах.
- Картны төлбөрийг төлсний дараа цагийн төлбөр байхгүй.
- Дүгнэлт нь сервогийн хажууд байрладаг бөгөөд энэ нь хурдан хяналтын давталт хийх цорын ганц арга юм.
- Та бодлогын кодыг нөхөж болно, мөн TinyVLA зөвхөн энэ аргаар л боломжтой.
- 4090 нь ~3 тэрбум бодлого бүрийг хасдаг тул GR00T N1.7 эсвэл Pi0.5-тай орон нутгийн харьцуулалт хийх боломжгүй.
- Орчны тохиргоо нь жинхэнэ ажил юм. TinyVLA-ийн пинүүд л гэхэд нэг өдөр зарцуулж болно.
- Дараалал, дахин оролдох, хяналтын цэгийн хадгалалт байхгүй. 14000-р алхам дээр дахин ачаалах нь дахин эхлэх гэсэн үг.
SmolVLA нь энд байгаа таван бодлогын нэг юм. Та загвар болон өгөгдлийн санг маягтаас сонгоно, бэкенд нь шаардлагатай VRAM-аар GPU түрээсэлж, сургагчийг ажиллуулж, хяналтын цэгүүдийг объектын санд бичдэг. Алхам алхамаар: SO-100 дээрх SmolVLA, эсвэл бүрэн матрицыг сургалтын хуудаснаас үзнэ үү.
| Платформ SmolVLA-д юу илгээдэг вэ | Утга |
|---|---|
| batch size | 2 |
| learning rate | 1e-4 |
| max steps | 20000 |
| gradient accumulation | 8, and it does not reach the trainer |
| extra knobs in the form | seed, logFreq |
| GPU tier | RTX 4090 or any 24 GB card |
| dataset format | LeRobot v3.0 |
| minimum episodes | 30 |
Нэгдүгээрт, эндхийн анхдагч багцын хэмжээ нь lerobot баримт бичгийн жишээнд байгаа 64 биш, харин 2 юм. Мөн градиент хуримтлуулах тохиргоог илгээдэг боловч SmolVLA-д нөлөөлөхгүй тул үр дүнтэй багц нь үнэндээ 2 юм. Анхдагч утга нь дээд урсгалтай таарна гэж таамаглахаас илүүтэйгээр үүнийг зориудаар нэмэгдүүлээрэй. Хоёрдугаарт, TinyVLA-г энд огт сургах боломжгүй.
24 ГБ түвшний ажиллагаа нь цагт 0.30-0.60 USD-ээр 2-5 цаг үргэлжилдэг бөгөөд ойролцоогоор 1-3 USD болно. A100 түвшний ~3 тэрбум бодлого нь цагт 1.20-2.00 USD-ээр 3-6 цаг үргэлжилдэг бөгөөд ойролцоогоор 4-12 USD болно. Үнийг үнэ тарифаас, мөн ижил үйлдлүүдийг CLI болон MCP серверээс үзнэ үү.
Жижиг загвар буруу сонголт байх үед
Хоёр өгүүлэл хоёулаа хураангуйгаас илүү нарийвчилсан байна. TinyVLA-ийн алдааны дүн шинжилгээ тодорхой: 0.4B хувилбар нь зааврыг буруу уншсанаас гурван удаа алдаа гаргасан бөгөөд үүнийг зохиогчид жижиг VLM-ийн хэлний ойлголт хязгаарлагдмал байсантай холбон тайлбарласан бөгөөд энэ горим 1.3B дээр алга болсон. SmolVLA нь ижил муруйг нөгөө талаас харуулж байна: ижил архитектурын 2.25B хувилбар нь LIBERO дээр 88.75, Meta-World дээр 68.24 оноо авсан бол 0.45B загвар нь 87.3 ба 57.3 оноо авсан байна.
- 24 ГБ карт багтдаг бөгөөд энэ нь туршилтын зардлыг хэдэн арван доллараас хэдхэн доллар болгож бууруулна.
- Гарын хажууд ажиллах хангалттай хурдан тул хяналтын давталтад сүлжээний үсрэлт байхгүй.
- Нэг хүн бичиж авах боломжтой өгөгдөл дээр нарийн тааруулдаг, мянга биш хэдэн арван эпизод.
- SmolVLA-ийн жин, өгөгдлийн жагсаалт болон код нь нээлттэй тул муу үр дүнг алдааг олж засварлах боломжтой.
- Зааврыг дагах чадвар сул: хэлний параметр бага, ижил төстэй ишлэлүүдийг ялгах чадвар муу.
- Таны бичиж аваагүй тохиргоонд орон зайн болон харааны ерөнхийлөх чадвар бага.
- Өгөгдлийн багцын согогт илүү мэдрэмтгий, буцаж ашиглах урьдчилсан сургалт багатай.
- Олон даалгаварт болон урт хугацааны ажил нь SmolVLA-ийн 2.25B хувилбарыг оролцуулаад томоохон загваруудад илүү таатай хэвээр байна.
Хийх ёстой харьцуулалт нь TinyVLA-г SmolVLA-тай харьцуулах биш. Энэ нь SmolVLA-г ACT таны өөрийн даалгавар дээр харьцуулах бөгөөд SmolVLA-ийн өгүүлэл нь яагаад гэдгийг тайлбарласан байна. Роботын урьдчилсан сургалтгүйгээр нэг даалгаварт сургагдсан SmolVLA нь гурван SO-100 даалгавар дээр дунджаар 40.0 оноо авсан бол нэг даалгаварт ACT 48.3 оноо авсан. Үүнийг 78.3 болгож өсгөсөн зүйл бол зөвхөн архитектур биш, харин олон нийтийн урьдчилсан сургалт болон олон даалгаварт сургалт юм. SO-101 лего даалгавар дээр, хоёулаа нэг даалгаварт, SmolVLA ялдаг: тархалтаар 70-ын эсрэг 90. Дараа нь SmolVLA-г Pi0.5 хэрэв төсөв зөвшөөрвөл.
Муу өгөгдлийг нөхөх урьдчилсан сургалт бага байдаг тул гэмтэлтэй өгөгдлийн багц дээрх цэвэр алдагдлын муруй нь танд гэмтлийг итгэлтэйгээр хуулбарлах бодлогыг өгнө. lerobot-ын баримт бичиг нь бүтцийн талаар тодорхой заасан байдаг: 5 шоо байрлалд 50 анги, байрлал тус бүрт 10 нь ажилласан; 25 нь ажиллаагүй. Хэрэв алдагдал хэвийн харагдаж, гар ямар ч хэрэгтэй зүйл хийхгүй бол дараахаас эхэлнэ: алдагдал буурч, бодлого юу ч хийхгүй, бодлого зөвхөн нэг тохиргоонд ажиллана эсвэл бодит хэрэглээтэй VLA сургалтын өгөгдөл цуглуулах.
Таван бодлого, нэг харьцуулах хүснэгт
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT бодит параметрийн тоо, үйлдлийн алхам тутамд таамаглалын хоцрогдол, тус бүрд шаардагдах GPU-ийн түвшин, бодит үр дүн өгөхөөс өмнөх хамгийн бага ангийн тоотой.
Бодлогуудыг харьцуулахТаны хэрэгжүүлж болох шийдвэрийн хүснэгт
| Таны нөхцөл байдал | Эхлэх цэг | Яагаад |
|---|---|---|
| Нэг даалгавар, сайн үзүүлэн, хэл байхгүй | ACT | ~80 M, 20 ms, 24 GB card, no base model to download |
| Хэд хэдэн холбогдох даалгавар, тус бүр нэг заавар | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| TinyVLA-ийн үр дүнг тодорхой хуулбарлах | TinyVLA-B or TinyVLA-H | The repo is the only route: isolated env, converted data |
| Олон даалгаварт, олон янзын заавар, A100 төсөв | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run |
| Одоогоор робот байхгүй | Drive a real arm | Дараалалд суурилсан амьд гар нь бүртгэл болон техник хангамж шаардахгүй |
Сүүлийн эгнээнд, шууд дамжуулалттай гар нь таныг бүртгэлгүйгээр хөтөчөөс удирдах боломжтой бодит SO-100-г дамжуулдаг бөгөөд, эхлүүлэх гурван арга нь бусдыг хамарна. SO-100 нь энд лавлагаа гар бөгөөд, эд ангиудад ойролцоогоор 110-150 EUR үнэтэй, мөн бүрэн тохиргооны гарын авлагатай.
1 тэрбумаас доош загваруудын дараа юу ирэх вэ
Параметрийн тоог багасгах нь VLA-г хямд болгох нэг арга боловч ялалт авчрах нь тодорхойгүй. OpenVLA-OFT (arXiv 2502.19645) нь 7 тэрбум нурууг хадгалж, үйлдлийг хэрхэн тайлбарлахыг л өөрчилснөөр үйлдлийн үүсгэлтийн хурдыг 26 дахин нэмэгдүүлж, LIBERO-г 76.5-аас 97.1 хувь хүртэл өсгөсөн байна. BitVLA (arXiv 2506.07530) нь 1-битийн BitNet b1.58 2B4T нурууны жин бүрийг гуравласан болгож, бүрэн нарийвчлалтай OpenVLA-OFT-тэй тэнцэхүйц байхад санах ойг 11.0 дахин багасгаж, төгсгөлөөс төгсгөл хүртэлх хоцролтыг 4.4 дахин бууруулсан байна. X-VLA-0.9B (arXiv 2510.10274) нь урсгалын тааруулалттайгаар 1 тэрбумын шугам дээр байрладаг.
Нийтлэг зүйл: хоцролт нь хэлний загварт бус, үйлдлийн декодерт байдаг. Бодлого хэдэн параметр агуулдаг вэ гэж асуухаасаа өмнө хэрхэн үйлдэл ялгаруулдаг вэ гэж асуу. арена нь 85 загвар, 332 үр дүнтэй бөгөөд тус бүр нь эх сурвалжтайгаа холбогдсон; илүү өргөн хүрээтэй тоймыг манай VLA танилцуулгад үзнэ үү.
Би SmolVLA-г RTX 4090 дээр нарийн тааруулах боломжтой юу?▾
Тийм ээ. SmolVLA нь 450 M параметр бөгөөд AY-Robots үүнийг RTX 4090 / 24 GB түвшинд ажиллуулдаг. lerobot жишээ нь --batch_size=64-г ашигладаг бөгөөд энэ нь таны картны баталгаа биш, харин жишээ юм; баримт бичигт ачаалах хугацаа богино хэвээр байх үед багаас эхэлж, нэмэгдүүлэхийг зөвлөдөг. A100 дээр 20000 алхам хийхэд баримт бичигт дурдсан ойролцоогоор 4 цагаас илүү хугацаа шаардагдана гэж тооцоолж болно.
TinyVLA нь lerobot эсвэл AY-Robots дээр боломжтой юу?▾
Хоёуланд нь үгүй. TinyVLA нь зөвхөн судалгааны репозиторитдоо байрладаг бөгөөд сүүлийн коммит нь 2025 оны 3-р сарын 11-нд хийгдсэн, мөн түүний формат нь LeRobot биш, ACT-маягийн HDF5 юм. AY-Robots нь GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT-г сургадаг. Хэрэв та TinyVLA-г авахыг хүсвэл өөрөө бүтээх хэрэгтэй бөгөөд эхлээд scripts/train.sh доторх DeepSpeed тохиргооны замыг засах шаардлагатай болно.
450 M загвар нь 3 B загвартай үнэхээр өрсөлдөх чадвартай юу?▾
Зохиогчдын өөрсдийн бенчмарк дээр, тийм ээ: LIBERO дээр 87.3-аар 86.0-ийн эсрэг, робот техникээр урьдчилан сургасан 3.3 B Pi0-тэй харьцуулахад, мөн гурван бодит SO-100 даалгавар дээр 78.3-аар 61.7-ийн эсрэг, үүнд ижилхэн судалгааны ажил Pi0-г 3.5 B гэж тэмдэглэсэн байна. Хязгаарлалт нь ижил судалгааны ажилд бий: робот техникээр урьдчилан сургаагүй нэг даалгаварт SmolVLA 40.0 болж буурч, ACT-ийн 48.3-аас доогуур байна.
Жижиг VLA ямар нэгэн зүйл хийхээс өмнө хэдэн эпизод хэрэгтэй вэ?▾
AY-Robots нь SmolVLA-ийн хамгийн бага хэмжээг 30 эпизод, ACT-ийн хамгийн бага хэмжээг 50 гэж тогтоосон. lerobot-ын баримт бичигт ойролцоогоор 50-г зөвлөж, 25 нь ижил даалгаварт хангалтгүй байсан гэж мэдээлсэн. Тоо хэмжээ шиг бүтэц чухал: судалгааны ажилд ашигласан багц нь 5 шоо байрлалыг тус бүр 10 эпизодоор ашигласан.
Яагаад нийтлэгдсэн хоцролтын тоо ийм их зөрүүтэй байдаг вэ?▾
Тэд өөр өөр зүйлсийг хэмждэг. TinyVLA нь A6000 дээр үйлдлийн таамаглал тутамд 14 ms гэж мэдээлсэн; AY-Robots нь SmolVLA-г үйлдлийн алхам тутамд 245 ms, ACT-г 20 ms гэж жагсаасан. Зарим тоо нь нэг урагш дамжуулалтыг хамардаг, зарим нь 50 үйлдлийн хэсэгт дамжуулалтыг хуваадаг, мөн бараг аль нь ч камерын зураг авалт эсвэл серво руу бичих үйлдлийг оруулаагүй байдаг.
Үүлэн таамаглал нь GPU-ийн асуудлыг шийддэг үү?▾
Хэсэгчлэн. AY-Robots нь бодлогыг үйлчилдэг подыг автоматаар хангадаг бөгөөд орон нутгийн клиент нь тухайн эцсийн цэгтэй харилцдаг, мөн ашиглагдаагүй үедээ өөрөө устдаг хяналтын системтэй тул чимээгүйгээр төлбөр тооцохгүй. Энэ нь олон нийтийн интернетийн эргэлтийн хугацааг арилгах боломжгүй бөгөөд хяналтын давталт нь үйлдлийн алхам тутамд аль хэдийн 20-485 ms байдаг. Удаан сонгож байрлуулах үйлдлүүдэд тохиромжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй.
Sources
- TinyVLA: Роботын Манипуляцид зориулсан Хурдан, Өгөгдлийн Үр Ашигтай Хараа-Хэл-Үйлдлийн Загварууд руу
- TinyVLA албан ёсны кодын репозитори (README, requirements.txt, scripts/train.sh)
- TinyVLA төслийн хуудас
- lesjie/Llava-Pythia-1.3B, TinyVLA-H-ийн үндсэн жин
- SmolVLA: Хямд бөгөөд Үр Ашигтай Робот Техникт зориулсан Хараа-Хэл-Үйлдлийн Загвар
- lerobot баримт бичиг: SmolVLA-г нарийн тааруулах
- lerobot: configuration_smolvla.py, SmolVLA-ийн анхдагч тохиргоо
- lerobot/smolvla_base загварын карт
- SmolVLA: Үр Ашигтай Хараа-Хэл-Үйлдлийн Загвар (Hugging Face блог)
- PyPI дээрх lerobot (0.6.1, Python 3.12 эсвэл шинэ хувилбар шаардлагатай)
- OpenVLA: Нээлттэй Эх Кодтой Хараа-Хэл-Үйлдлийн Загвар
- Хараа-Хэл-Үйлдлийн Загваруудыг Нарийн Тааруулах: Хурд ба Амжилтыг Оновчтой Болгох (OpenVLA-OFT)
- BitVLA: Роботын Манипуляцид зориулсан 1-битийн Хараа-Хэл-Үйлдлийн Загварууд
- X-VLA: Өргөтгөх Боломжтой Бие Даасан Хараа-Хэл-Үйлдлийн Загвар болох Зөөлөн-Түлхүүртэй Трансформер
- rail-berkeley/octo-small-1.5 загварын карт (27 M параметр)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started