AY-Robots-ийн бодлогын харьцуулалтын хүснэгт нь GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT загваруудад зориулсан параметрийн тоо, GPU-ийн түвшин, болон таамаглалын хоцрогдлыг харуулсан
SmolVLATinyVLAЖижиг VLAХэрэглээний GPULeRobot

Жижиг VLA загварууд: TinyVLA, SmolVLA болон 1 тэрбумаас доош параметрийн тохиолдол

AY-Robots ResearchAugust 23, 202619 мин унших

TinyVLA болон SmolVLA нь ажилладаг VLA-г 1 тэрбум параметрээс доош хэмжээнд багтаасан. Хоёр өгүүлэл дэх бодит тоо баримтууд, LeRobot-ийн анхдагч тохиргоонууд, хэмжигдсэн хоцрогдол, мөн 24 ГБ карт дээр нэг ажиллагаа хэр үнэтэй болохыг харуулсан.

Бараг бүх хараа-хэл-үйлдэл загвар тухай бичигдсэн загварууд нь дата төвийн картыг шаарддаг. OpenVLA нь 7 тэрбум параметр юм. GR00T N1.7 болон Pi0.5 нь ойролцоогоор 3 тэрбум бөгөөд нарийн тааруулахын тулд A100 80 GB шаарддаг. Хэрэв таны ширээн дээрх карт 4090 бол, энэ төрлийн загвар нь хүртээмжгүй юм.

Хоёр судалгааны ажил үүнийг шаардлагагүй гэж үздэг. TinyVLA (arXiv 2409.12514, 2025 оны 2-р сард IEEE Robotics and Automation Letters-т хүлээн зөвшөөрөгдсөн) нь 400 саяаас 1.3 тэрбум хүртэлх нуруу болон диффузийн үйлдлийн толгойноос VLA-г бүтээдэг. SmolVLA (arXiv 2506.01844, 2025 оны 6-р сарын 2-нд ирүүлсэн) нь нээлттэй жин, нээлттэй өгөгдөл, нэг хэрэглээний карт дээр ажилладаг скрипттэй 450 сая параметрийг гаргадаг. Энд хоёулаа юу хэмжсэн, мөн 1 тэрбумаас доош гэсэн аргумент хаана хүчингүй болж байгааг харуулав.

Таны мэдэх ёстой зүйлс

  • TinyVLA гурван хэмжээтэй: нийт 422 сая, үүнээс 101 сая нь сургах боломжтой; 740 сая, үүнээс 138 сая нь сургах боломжтой; 1.3 тэрбум, үүнээс 143 сая нь сургах боломжтой. Эхний хоёр нь л 1 тэрбумаас доош байна.
  • Түүний Хүснэгт IV нь нэг A6000 дээрх TinyVLA-1B-ийн үйлдлийн таамаглалд 14 ms, OpenVLA-7B-д 292 ms, багасгасан OpenVLA-1B-д 140 ms хэмжсэн байна.
  • Энэ хурдыг толгой нь хадгалдаг, нуруу нь биш: TinyVLA-H-ийн диффузийн толгойг ACT толгойгоор сольвол таван бодит роботын даалгавар дунджаар 94.0-аас нэг оронтой тоонд хүрнэ. MLP толгой хаа сайгүй 0 оноо авдаг.
  • SmolVLA нь 450 сая, үүнээс ойролцоогоор 100 сая нь үйлдлийн мэргэжилтэн бөгөөд 481 олон нийтийн LeRobot өгөгдлийн багц болон 10.6 сая фрэйм дээр урьдчилан сургагдсан. Энэ нь LIBERO дээр 87.3, робот техникт урьдчилан сургагдсан 3.3 тэрбум Pi0-д 86.0, гурван бодит SO-100 даалгавар дээр 78.3, 3.5 тэрбум Pi0-д 61.7 гэсэн үр дүнг мэдээлсэн.
  • Урьдчилан сургалтгүйгээр нэг даалгаварт сургахад SmolVLA эдгээр даалгавар дээр 40.0 болж буурдаг нь ACT-ийн 48.3-аас доогуур юм. Жижиг байх нь автоматаар хялбар гэсэн үг биш.
  • TinyVLA нь LeRobot-тэй нэгдээгүй бөгөөд CUDA 11.7 wheel stack-ийг ашигладаг. SmolVLA нь lerobot-д байдаг бөгөөд энд 24 GB-ийн түвшинд нэг ажиллуулахад ойролцоогоор 1-3 USD үнэтэй.

Жижиг VLA гэж юуг тооцох вэ

Моделийн картын параметрийн тоо нь нэг тоо биш юм. Энэ нь нийт жин, дүгнэлт хийх үед ачаалагдсан жин, эсвэл градиент хүлээн авдаг жинг илэрхийлж болно . TinyVLA нь энэ хоёрыг хоёуланг нь мэдээлдэг бөгөөд зөрүү нь их: TinyVLA-H нь нийт 1.3 тэрбум боловч 143 сая нь сургах боломжтой, учир нь харааны цамхаг болон хэлний загварын ихэнх хэсэг нь хөлдүү хэвээр байхад LoRA адаптерууд болон үйлдлийн толгой хөдөлдөг. Уг баримт бичигт сургах боломжтой хувийг ойролцоогоор 5 хувь гэж заасан байна.

ЗагварПараметрүүдҮндсэн бүтэцҮйлдлийн толгойЭх сурвалж
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregressive action tokensarXiv 2406.09246

Хоёр мөр маргаантай байна. ойролцоогоор 80 сая нь энд байгаа бусад бүхнээс жижиг боловч хэлний загваргүй тул VLA биш юм: энэ нь нэг даалгаврыг сурч, өөр даалгавар гүйцэтгэхийг зааж чадахгүй. 27 сая нь T5-Base текст кодлогчоор дамжуулан нөхцөлдсөн бөгөөд LLM-ийн үндсэн бүтэц биш юм. Сайн суурь үзүүлэлтүүд боловч аль нь ч шошгоны заасан зааврыг дагаж мөрдөх боломжийг олгодоггүй.

1 тэрбумын шугам нь дур зоргынх

Гарчигны үр дүнг агуулсан TinyVLA-H хувилбар нь 1.3 тэрбум бөгөөд энэ шугамаас дээш байрладаг. Илүү чухал асуулт бол загвар нь сургалтын явцад 24 ГБ-д багтаж, дүгнэлт хийх үед таны хяналтын хурдыг хангаж чадах эсэх юм. Та энд сургаж болох таван бодлого бодлогын хуудсанд байна; TinyVLA нь аренагийн бичилттэй бөгөөд хэрэв та бусад бүхний хажууд түүний тоог харахыг хүсвэл.

TinyVLA: хурд нь толгойноос ирдэг, нуруунаас биш

Илэрхий уншигдаж байгаагаар тэд хэлний загварыг жижигрүүлсэн тул хурдан болсон. Гэвч судалгааны ажлын аблацийн шинжилгээ өөр зүйлийг харуулж байна. OpenVLA-ийн 7B нурууг ойролцоогоор 1B нуруугаар солиход үйлдлийн таамаглалыг 292 мс-ээс 140 мс болгон бууруулж, 2 дахин хурдасгасан. TinyVLA-H нь ижил төстэй параметрийн тоотой байхад ижил карт дээр 14 мс-ээр ажилладаг. Үлдсэн 10 дахин хурд нь үйлдлийн толгойноос үүдэлтэй.

ЗагварҮйлдэл тус бүрийн таамаглалХэмжсэн төхөөрөмж
OpenVLA-7B292 msнэг A6000
OpenVLA-1B, TinyVLA-ийн нуруугаар солигдсон140 msнэг A6000
TinyVLA-1B (TinyVLA-H)14 msнэг A6000

OpenVLA нь үйлдлүүдийг хэлний загварын толгойгоор дамжуулан, үйлдлийн хэмжээс тус бүрт нэг нэгээр нь, авторегрессив байдлаар дискретчилсэн токен хэлбэрээр ялгаруулдаг. TinyVLA нь бүх хэсгийг нэг дор гаргадаг диффузийн декодерыг ашигладаг. Хүснэгт V нь TinyVLA-H-ийн архитектурыг харуулж, ижил таван бодит роботын даалгавар дээр зөвхөн толгойг нь сольсон. Энэ нь аль ч судалгааны ажилд хамгийн тодорхой нотолгоо болж байна урсгал тааруулах бодлогууд хийдэг, мөн шалтгаан нь Pi0 токен декодчилохоос татгалзсан.

TinyVLA-H дээрх гүйцэтгэлТеннис байрлуулахАяга эргүүлэхШоо овоолохШүүгээ хаахХайрцаг нээх
Diffusion (droid_diffusion)90.098.398.396.786.7
Үйлдлийг хэсэгчлэх трансформатор13.38.38.313.323.3
Олон үет перцептрон00000
TinyVLA-ийн тоон үзүүлэлтүүд юуг хамардаг вэ

292 / 140 / 14 мс-ийн үзүүлэлтүүд нь Хүснэгт IV-т, бүгд нэг A6000 дээр хийгдсэн. Эдгээр нь үйлдлийн таамаглал тус бүрт хамаарах бөгөөд камерын зураг авалт, урьдчилан боловсруулалт болон серво руу цуваа бичих үйлдлүүдийг оруулаагүй болно. Нийтлэгдсэн хоцролтыг хяналтын хурд гэж үзэхгүйгээр, доод хязгаар гэж үзээрэй. Бидний өөрсдийн тоон үзүүлэлтүүд ч мөн адил хязгаарлалттай: таамаглалын хоцролт-ыг үзнэ үү.

TinyVLA-ийн гүйцэтгэл

ҮзүүлэлтПротоколTinyVLA-HСуурь үзүүлэлтүүд
MetaWorld, 50 даалгавар, симуляциОлон даалгавар, 50 демо, 3 үрХүндрэлээр 77.6 / 21.5 / 11.4 / 15.8, дундаж 31.6Diffusion Policy дундаж 10.5
Бодит Franka Panda, 5 даалгаварДаалгавар тус бүрт 100 траектори, 20 туршилт94.0 дундажOpenVLA 68.3, Diffusion Policy 35.3
Хоёр гарт UR5, 3 даалгаварОлон даалгавар, даалгавар тус бүрт 10 туршилт76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Хоёр гарт мөрийн тайлбар нь өөрөө уйтгартай: OpenVLA нь зөвхөн нэг гарт өгөгдлөөс бүрдсэн Open X-Embodiment дээр урьдчилан сургагдсан тул хоёр гарт үйлдлийн орон зай нь тархалтаас гадуур бөгөөд тэг оноо авдаг. Диффузийн бодлогын суурь нь эдгээр гурван даалгаврын хоёрт нь TinyVLA-H-г давсан. Дэлгэрэнгүй мэдээлэл: Open X-Embodiment-ийн тайлбар.

AY-Robots аренагийн тэргүүлэгчдийн самбар, 85 VLA загварын 332 гүйцэтгэлийн үр дүнг агуулсан эрэмбэлэгдэх хүснэгт, үр дүн бүр нь тухайн загварын цаас эсвэл загварын карттай холбогдсон.
Загвар хоорондын гүйцэтгэлийн үзүүлэлтүүд нь зөвхөн тус бүр нь хаанаас гаралтайг харж байж л харьцуулах боломжтой.

TinyVLA репо, 2026 оны 8-р сарын байдлаар

Энэхүү цаас нь сайн. Код нь судалгааны зорилгоор гаргасан. Репозитори нь github.com/liyaxuanliyaxuan/TinyVLA; түүний README нь кодын хувилбарыг 2025 оны 2-р сарын 17-нд, сүүлийн коммитыг 2025 оны 3-р сарын 11-нд хийсэн гэж заасан байна. Цаасыг хуулбарлахад тохиромжтой, харин тогтмол арчилдаг номын сан хүсвэл асуудалтай.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README-ээс авсан суулгах дараалал, 2026 оны 8-р сарын 23-нд репозиторитой тулгаж шалгасан.
Хамаарлын тогтоосон хувилбарууд нь нэг өдрийг үрдэг урхи юм

requirements.txt нь torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 болон CUDA стекийг 11.x хувилбаруудад тогтоосон байна: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README нь Python 3.10-ийг шаарддаг; lerobot 0.6.1 нь 3.12 эсвэл түүнээс хойшхи хувилбарыг шаарддаг тул эдгээр нь нэг орчинд хамт ажиллах боломжгүй. Эхлээд таны GPU-ийн үеийн хувьд torch 2.0.1-ийн бүтээц байгаа эсэхийг баталгаажуулна уу. Хэрэв ажиллуулга VRAM-аас болж зогсвол, санах ой дутагдлын шалгах хуудас нь таамаглахаас илүү хурдан юм.

TinyVLA нь мөн уншдаггүй LeRobot өгөгдлийн багцууд. Түүний формат нь ACT-маягийн HDF5: action, language_raw, болон олон харагдацтай зураг, joint_positions, qpos, qvel агуулсан observations бүлэг. Репозитори нь RLDS оролтод зориулсан data_utils/rlds_to_h5py.py-ийг агуулдаг бөгөөд таск бүрийг aloha_scripts/constants.py файлд dataset_dir, episode_len, camera_names-тай нь гараар бүртгэдэг. Хэрэв таны эпизодууд lerobot эсвэл ширээний компьютер клиент-аас ирсэн бол, та хөрвүүлэлтийг өөрөө хийнэ.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh-ээс товчилсон. Дээрх бүх флаг болон утгууд нь хамт ирсэн файлд бий.
  • --num_gpus=8 нь найман карттай төхөөрөмжийг илэрхийлнэ. Үүнийг 1 болгож, багцын хэмжээг 32-оос доош буулгана уу. Нэг GPU-тэй хувилбар нь дээд урсгалд байхгүй тул тушаалыг 4090 дээр яг таг ажиллуулах боломжгүй.
  • --deepspeed scripts/zero2.json нь дээд түвшний скрипт директорт байхгүй файлыг заана. DeepSpeed тохиргоонууд нь llava-pythia/scripts/zero2.json хаягаар байрладаг. Эхний ажиллуулахаасаа өмнө замыг засна уу.
  • README нь гаралтын директорын нэрэнд llava_pythia, мөн LoRA идэвхжүүлсэн бол lora-г агуулсан байхыг шаарддаг.
  • Суурь загвар нь тусдаа татаж авах боломжтой: lesjie/Llava-Pythia-400M, -700M эсвэл -1.3B. lerobot/smolvla_base руу заадаг шиг бодлогыг заах нэг суурь чекпойнт байхгүй.

SmolVLA: Өнөөдөр үдээс хойш ажиллуулж болох 1 тэрбумаас бага параметр бүхий загвар

SmolVLA нь засвар үйлчилгээтэй номын санд ижил аргументыг дэвшүүлдэг. Энэ нь SmolVLM2-500M-Video-Instruct суурь загвар дээр 450 сая параметр агуулдаг бөгөөд үр ашиг нь жижиг хэмжээтэй гэсэн мэдэгдлээс бус, харин configuration_smolvla.py файлаас уншиж болох тохиргоонуудаас үүдэлтэй.

configuration_smolvla.py дахь тохиргооАнхдагч утгаҮр дүн
num_vlm_layers16Зөвхөн эхний 16 хэлний загварын давхарга ажиллана
expert_width_multiplier0.75Үйлдлийн эксперт нуугдмал хэмжээ нь VLM-ийн 75 хувьтай тэнцэнэ
self_attn_every_n_layers2Өөрөө-анхаарал нь хөндлөн-анхааралтай ээлжлэн ажиллана
chunk_size / n_action_steps50 / 50Нэг дамжуулалтаар 50 үйлдэл үүсгэж, бүх 50 нь гүйцэтгэгдэнэ
num_steps10Урсгалын тааруулалтын дуу чимээг арилгах нь 10 алхамд тогтоогдсон
tokenizer_max_length48Заавар нь 48 токен болж богиносгогдсон
freeze_vision_encoder / train_expert_onlyTrue / TrueНарийвчилсан тааруулалт нь экспертийг хөдөлгөдөг, харааны цамхагийг биш
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Энэ нь өгүүллийн жор биш: түүний урьдчилсан сургалтанд 200000 алхам дээр 100 алхам халаалт ашигласан

Урьдчилсан сургалтад 481 олон нийтийн LeRobot өгөгдлийн багц, 22.9 K эпизод, 10.6 M фрэймийг 4 GPUs дээр, 256-ийн глобал багцаар 200000 алхам ашигласан; уг баримт бичигт төслийн нийт хугацааг ойролцоогоор 30 K GPU цаг гэж тооцсон байна. Анхаарах нэг тоо: Hugging Face-ийн нээлтийн блогт 487 сонгомол өгөгдлийн багц гэж дурдсан бол баримт бичгийн хүснэгтэд 481 гэсэн байна. Бид баримт бичгийн тоог ашиглаж, зөрүүг тэмдэглэж байна.

ҮзүүлэлтSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO дундаж, олон даалгаварт87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World дундаж, олон даалгаварт57.368.2447.9 (3.5 B, robotics-pretrained)-
Бодит SO-100, 3 даалгавар, олон даалгаварт сургалт78.3-61.7 (3.5 B)-
Бодит SO-100, 3 даалгавар, нэг даалгаварт, роботын урьдчилсан сургалтгүй40.0--48.3
SO-101 лего түүж байрлуулах, нэг даалгаварт, тархалтад90--70
SO-101 лего түүж байрлуулах, нэг даалгаварт, тархалтаас гадуур50--40
Зөвхөн гарчиг мөрийг биш, хүснэгтийг бүхэлд нь уншина уу

LIBERO бол симуляци бөгөөд одоо тэндхийн бүх чадварлаг загварууд наяад оноо авч байна. Бодит SO-100 мөр, 450 M загвар нь 3.5 B загварыг 16.6 оноогоор давсан нь сонирхолтой; түүний доорх мөр нь эсрэг жин юм. Олон нийтийн урьдчилсан сургалт болон олон даалгаварт сургалтыг хассан тохиолдолд ижил загвар нь ACT-ийн доор 40.0 болж буурдаг. Хамгаалах боломжтой мэдэгдэл бол жижиг загвар автоматаар муу биш, харин илүү сайн биш гэсэн үг юм.

Нэгэн тохиолдол тусална: SmolVLA-ийн баримт бичгийн Meta-World хүснэгтэд TinyVLA-ийн өөрийн хэвлэгдсэн тоог суурь болгон ашигласан тул нэг удаа хоёр загвар нэг хүснэгтэд багтсан байна: SmolVLA-0.45B 57.3, TinyVLA-H 31.6. Мөн SmolVLA нь Pi0-ээс 6 дахин бага санах ой ашиглан 40 хувь хурдан сургагдсан гэж мэдээлсэн. Энэ бүхэн SmolVLA-ийн зохиогчдоос гаралтай; аренагийн бичилт нь утга бүрийг эх сурвалжтай нь холбодог.

SmolVLA хаана цагаа зарцуулдаг вэ

AY-Robots нь SmolVLA-г үйлдлийн алхам тутамд 245 мс, ACT-г 20 мс гэж бодлогын каталог-т жагсаасан байна. TinyVLA нь үйлдлийн таамаглал тутамд 14 мс гэж мэдээлсэн. Эдгээр тоог харьцуулах боломжгүй бөгөөд тэдгээрийг харьцуулж үзэх нь энэ сэдвийн хамгийн түгээмэл алдаа юм: зарим нь нэг урагш дамжуулалтыг хугацаалдаг, зарим нь тэр дамжуулалтыг нэг хэсэгт хувааж, үйлдлийн хэсэгчилэл үүнийг хуваарилдаг.

  • SmolVLA нь нэг урагш дамжуулалтаар 50 үйлдэл ялгаруулж, бүх 50-г гүйцэтгэдэг. Баримт бичигт бодит роботууд дээр ашигладаг 30 fps-ээр нэг дүгнэлт нь ойролцоогоор 1.7 секундын хөдөлгөөнийг хамардаг.
  • Асинхрон дүгнэлт нь одоогийн хэсэг гүйцэтгэгдэж байхад дараагийн хэсгийг тооцоолно: дундаж даалгавар гүйцэтгэл 9.7 секунд, синхрон 13.75 секунд, ойролцоогоор 30 хувь хурдан, мөн тогтмол 60 секундын хугацаанд 19 сонгож байрлуулах мөчлөг, 9-ийн эсрэг.
  • Амжилтын түвшин нь илүү сайн биш, харин харьцуулах боломжтой байсан: синхрон 78.3, асинхрон 73.3. Асинхрон нь нарийвчлал биш, харин гүйцэтгэлийг нэмэгдүүлдэг.
  • Хэсэгчилэл нь тооцооллын хоцрогдлыг нуудаг боловч сүлжээний хоцрогдлыг нуудаггүй бөгөөд энэ нь 50 үйлдлийг гүйцэтгэхээр тогтсон тул бодлогыг бага хариу үйлдэлтэй болгодог.
Алсын зайн дүгнэлт үнэгүй биш, мөн ямар ч платформ физикийг засахгүй

AY-Robots нь таны бодлогыг хэрэгжүүлэх үүлэн GPU подыг автоматаар бэлтгэх боломжтой бөгөөд орон нутгийн роботын клиент тухайн цэгтэй холбогдож, под нь ашиглагдаагүй үедээ өөрийгөө устгах хяналтын системтэй тул чимээгүйгээр төлбөр тооцохгүй. Гэхдээ энэ нь олон нийтийн интернетийн эргэлтийн хугацааг арилгахгүй. Энд байгаа таван бодлогын хяналтын давталт нь ямар ч сүлжээгүйгээр нэг үйлдлийн алхамд 20-485 мс байдаг тул алсын зайн дүгнэлт нь удаан сонгож байрлуулах ажиллагаанд тохиромжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй.

AY-Robots-ийн бодлогуудын харьцуулсан хүснэгт нь GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT загваруудын параметрүүдийн тоо, шаардагдах GPU түвшин, үйлдлийн алхам тутамд гарах дүгнэлтийн хоцролт болон тус бүрд шаардагдах хамгийн бага эпизодын тоог харуулсан.
SmolVLA (~450 сая) болон ACT (~80 сая) нь 24 ГБ карт дээр багтах хоёр загвар юм. Бусад гурав нь A100 эсвэл H100 80 ГБ шаарддаг.

SmolVLA-г нэг хэрэглээний карт дээр нарийн тааруулах

Гарын авлагын зам, lerobot 0.6.1 дээр, 2026 оны 8-р сарын 23-ны байдлаарх одоогийн PyPI хувилбар. Доорх бүх мэдээлэл нь Hugging Face lerobot SmolVLA баримт бичгээс, мөн өдөр татагдсан; удирдамжтай хувилбар нь илүү хялбар.

  1. 1
    lerobot-ийг smolvla нэмэлттэйгээр суулгах

    SmolVLA-ийн хамаарал нь нэмэлт сонголт бөгөөд үндсэн суулгалтын хэсэг биш юм. Үүнийг суулгалгүйгээр бодлогын төрөл яагаад үл мэдэгдэх байгааг гайхах нь хагас цаг алдах нийтлэг шалтгаан юм.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Хангалттай ангитай өгөгдлийн сан авах

    Баримт бичигт ойролцоогоор 50 анги зөвлөж, 25 ангитай ижил даалгавар хангалтгүй байсан гэж заасан. AY-Robots хамгийн багадаа 30-ыг тогтоодог. Өөрийнхөө бичлэгийг хийх, эсвэл өгөгдлийн сангийн лавлах-аас эхлэх.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Нарийвчилсан тохируулгыг эхлүүлэх

    lerobot гарын авлагаас авсан тушаал, өөрчлөгдөөгүй. Баримт бичигт 20000 алхамыг нэг A100 дээр ойролцоогоор 4 цаг гэж заасан. 24 ГБ карт дээр илүү урт хугацаа шаардагдах тул хэмжиж үзээрэй.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Багцын хэмжээг таарах хүртэл бууруулах

    batch_size=64 нь баримтжуулсан жишээ бөгөөд таны картны талаарх амлалт биш юм. Баримт бичигт ачаалах хугацаа богино хэвээр байх үед багаас эхлээд нэмэгдүүлэхийг зөвлөж байна.

    bash
    lerobot-train --help
  5. 5
    Хяналтын цэгийг гар дээр ашиглах

    Ижил сан, нэг тушаал. Бодит цагийн хэсэгчлэх флагууд нь баримт бичигт тайлбарлагдсан бөгөөд бага чадалтай техник хангамж дээр ашиглах ёстой зүйлс юм.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Хяналтын цэг нь хүргэх зүйл юм

Та ямар ч замыг сонгосон бай, та хяналтын цэг болон түүнийг үүсгэсэн тохиргоотой болно. Өгөгдлийн сангийн хувилбар, алхамын тоо, үрийг хажууд нь хадгалаарай. lerobot нь анхдагчаар 1000 үрийг ашигладаг; GR00T-ийн нарийвчилсан тохируулгын эхлэх цэг нь ямар ч үрийг ил гаргадаггүй тул эдгээр ажиллагаа нь бит-бит давтагдах боломжгүй юм. Сургалтын баримт бичигт механик хэсгийг үзнэ үү.

Жижиг VLA-г гар дээр суулгах хоёр арга

Та машин болон алдааны горимуудыг эзэмшдэг. SmolVLA-ийн хувьд энэ нь боломжийн юм: нэг pip нэмэлт, нэг сургалтын тушаал, нэг ашиглалтын тушаал. TinyVLA-ийн хувьд энэ нь хөлдөөсөн пин, эвдэрсэн DeepSpeed зам, өөрөө бичсэн өгөгдөл хувиргалт бүхий судалгааны хуулбар юм.

  1. 24 ГБ карт авах, 30-50 анги бичих, камерын урсгалыг кадр бүрээр шалгах.
  2. pip install -e ".[smolvla]", lerobot/smolvla_base-ийн эсрэг lerobot-train ажиллуулах, дараа нь гар холбогдсон машинд хяналтын цэгийг үйлчлэх.
  3. TinyVLA-ийн хувьд: тусдаа conda орчин, өгөгдлийг HDF5 руу хөрвүүлэх, constants.py дотор даалгаврыг бүртгэх, zero2.json замыг засах, train.sh-ийг найман GPU-ээс нэг болгож багасгах.
Давуу талууд
  • Картны төлбөрийг төлсний дараа цагийн төлбөр байхгүй.
  • Дүгнэлт нь сервогийн хажууд байрладаг бөгөөд энэ нь хурдан хяналтын давталт хийх цорын ганц арга юм.
  • Та бодлогын кодыг нөхөж болно, мөн TinyVLA зөвхөн энэ аргаар л боломжтой.
Сул талууд
  • 4090 нь ~3 тэрбум бодлого бүрийг хасдаг тул GR00T N1.7 эсвэл Pi0.5-тай орон нутгийн харьцуулалт хийх боломжгүй.
  • Орчны тохиргоо нь жинхэнэ ажил юм. TinyVLA-ийн пинүүд л гэхэд нэг өдөр зарцуулж болно.
  • Дараалал, дахин оролдох, хяналтын цэгийн хадгалалт байхгүй. 14000-р алхам дээр дахин ачаалах нь дахин эхлэх гэсэн үг.

Жижиг загвар буруу сонголт байх үед

Хоёр өгүүлэл хоёулаа хураангуйгаас илүү нарийвчилсан байна. TinyVLA-ийн алдааны дүн шинжилгээ тодорхой: 0.4B хувилбар нь зааврыг буруу уншсанаас гурван удаа алдаа гаргасан бөгөөд үүнийг зохиогчид жижиг VLM-ийн хэлний ойлголт хязгаарлагдмал байсантай холбон тайлбарласан бөгөөд энэ горим 1.3B дээр алга болсон. SmolVLA нь ижил муруйг нөгөө талаас харуулж байна: ижил архитектурын 2.25B хувилбар нь LIBERO дээр 88.75, Meta-World дээр 68.24 оноо авсан бол 0.45B загвар нь 87.3 ба 57.3 оноо авсан байна.

1B-ээс доош VLA сонгох нь
Хаана хождог вэ
  • 24 ГБ карт багтдаг бөгөөд энэ нь туршилтын зардлыг хэдэн арван доллараас хэдхэн доллар болгож бууруулна.
  • Гарын хажууд ажиллах хангалттай хурдан тул хяналтын давталтад сүлжээний үсрэлт байхгүй.
  • Нэг хүн бичиж авах боломжтой өгөгдөл дээр нарийн тааруулдаг, мянга биш хэдэн арван эпизод.
  • SmolVLA-ийн жин, өгөгдлийн жагсаалт болон код нь нээлттэй тул муу үр дүнг алдааг олж засварлах боломжтой.
Хаана алддаг вэ
  • Зааврыг дагах чадвар сул: хэлний параметр бага, ижил төстэй ишлэлүүдийг ялгах чадвар муу.
  • Таны бичиж аваагүй тохиргоонд орон зайн болон харааны ерөнхийлөх чадвар бага.
  • Өгөгдлийн багцын согогт илүү мэдрэмтгий, буцаж ашиглах урьдчилсан сургалт багатай.
  • Олон даалгаварт болон урт хугацааны ажил нь SmolVLA-ийн 2.25B хувилбарыг оролцуулаад томоохон загваруудад илүү таатай хэвээр байна.

Хийх ёстой харьцуулалт нь TinyVLA-г SmolVLA-тай харьцуулах биш. Энэ нь SmolVLA-г ACT таны өөрийн даалгавар дээр харьцуулах бөгөөд SmolVLA-ийн өгүүлэл нь яагаад гэдгийг тайлбарласан байна. Роботын урьдчилсан сургалтгүйгээр нэг даалгаварт сургагдсан SmolVLA нь гурван SO-100 даалгавар дээр дунджаар 40.0 оноо авсан бол нэг даалгаварт ACT 48.3 оноо авсан. Үүнийг 78.3 болгож өсгөсөн зүйл бол зөвхөн архитектур биш, харин олон нийтийн урьдчилсан сургалт болон олон даалгаварт сургалт юм. SO-101 лего даалгавар дээр, хоёулаа нэг даалгаварт, SmolVLA ялдаг: тархалтаар 70-ын эсрэг 90. Дараа нь SmolVLA-г Pi0.5 хэрэв төсөв зөвшөөрвөл.

Энэ хэмжээнд өгөгдлийн багц үр дүнг тодорхойлно

Муу өгөгдлийг нөхөх урьдчилсан сургалт бага байдаг тул гэмтэлтэй өгөгдлийн багц дээрх цэвэр алдагдлын муруй нь танд гэмтлийг итгэлтэйгээр хуулбарлах бодлогыг өгнө. lerobot-ын баримт бичиг нь бүтцийн талаар тодорхой заасан байдаг: 5 шоо байрлалд 50 анги, байрлал тус бүрт 10 нь ажилласан; 25 нь ажиллаагүй. Хэрэв алдагдал хэвийн харагдаж, гар ямар ч хэрэгтэй зүйл хийхгүй бол дараахаас эхэлнэ: алдагдал буурч, бодлого юу ч хийхгүй, бодлого зөвхөн нэг тохиргоонд ажиллана эсвэл бодит хэрэглээтэй VLA сургалтын өгөгдөл цуглуулах.

Таван бодлого, нэг харьцуулах хүснэгт

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT бодит параметрийн тоо, үйлдлийн алхам тутамд таамаглалын хоцрогдол, тус бүрд шаардагдах GPU-ийн түвшин, бодит үр дүн өгөхөөс өмнөх хамгийн бага ангийн тоотой.

Бодлогуудыг харьцуулах

Таны хэрэгжүүлж болох шийдвэрийн хүснэгт

Таны нөхцөл байдалЭхлэх цэгЯагаад
Нэг даалгавар, сайн үзүүлэн, хэл байхгүйACT~80 M, 20 ms, 24 GB card, no base model to download
Хэд хэдэн холбогдох даалгавар, тус бүр нэг зааварSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
TinyVLA-ийн үр дүнг тодорхой хуулбарлахTinyVLA-B or TinyVLA-HThe repo is the only route: isolated env, converted data
Олон даалгаварт, олон янзын заавар, A100 төсөвGR00T N1.7 or Pi0.5~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run
Одоогоор робот байхгүйDrive a real armДараалалд суурилсан амьд гар нь бүртгэл болон техник хангамж шаардахгүй

Сүүлийн эгнээнд, шууд дамжуулалттай гар нь таныг бүртгэлгүйгээр хөтөчөөс удирдах боломжтой бодит SO-100-г дамжуулдаг бөгөөд, эхлүүлэх гурван арга нь бусдыг хамарна. SO-100 нь энд лавлагаа гар бөгөөд, эд ангиудад ойролцоогоор 110-150 EUR үнэтэй, мөн бүрэн тохиргооны гарын авлагатай.

1 тэрбумаас доош загваруудын дараа юу ирэх вэ

Параметрийн тоог багасгах нь VLA-г хямд болгох нэг арга боловч ялалт авчрах нь тодорхойгүй. OpenVLA-OFT (arXiv 2502.19645) нь 7 тэрбум нурууг хадгалж, үйлдлийг хэрхэн тайлбарлахыг л өөрчилснөөр үйлдлийн үүсгэлтийн хурдыг 26 дахин нэмэгдүүлж, LIBERO-г 76.5-аас 97.1 хувь хүртэл өсгөсөн байна. BitVLA (arXiv 2506.07530) нь 1-битийн BitNet b1.58 2B4T нурууны жин бүрийг гуравласан болгож, бүрэн нарийвчлалтай OpenVLA-OFT-тэй тэнцэхүйц байхад санах ойг 11.0 дахин багасгаж, төгсгөлөөс төгсгөл хүртэлх хоцролтыг 4.4 дахин бууруулсан байна. X-VLA-0.9B (arXiv 2510.10274) нь урсгалын тааруулалттайгаар 1 тэрбумын шугам дээр байрладаг.

Нийтлэг зүйл: хоцролт нь хэлний загварт бус, үйлдлийн декодерт байдаг. Бодлого хэдэн параметр агуулдаг вэ гэж асуухаасаа өмнө хэрхэн үйлдэл ялгаруулдаг вэ гэж асуу. арена нь 85 загвар, 332 үр дүнтэй бөгөөд тус бүр нь эх сурвалжтайгаа холбогдсон; илүү өргөн хүрээтэй тоймыг манай VLA танилцуулгад үзнэ үү.

Би SmolVLA-г RTX 4090 дээр нарийн тааруулах боломжтой юу?

Тийм ээ. SmolVLA нь 450 M параметр бөгөөд AY-Robots үүнийг RTX 4090 / 24 GB түвшинд ажиллуулдаг. lerobot жишээ нь --batch_size=64-г ашигладаг бөгөөд энэ нь таны картны баталгаа биш, харин жишээ юм; баримт бичигт ачаалах хугацаа богино хэвээр байх үед багаас эхэлж, нэмэгдүүлэхийг зөвлөдөг. A100 дээр 20000 алхам хийхэд баримт бичигт дурдсан ойролцоогоор 4 цагаас илүү хугацаа шаардагдана гэж тооцоолж болно.

TinyVLA нь lerobot эсвэл AY-Robots дээр боломжтой юу?

Хоёуланд нь үгүй. TinyVLA нь зөвхөн судалгааны репозиторитдоо байрладаг бөгөөд сүүлийн коммит нь 2025 оны 3-р сарын 11-нд хийгдсэн, мөн түүний формат нь LeRobot биш, ACT-маягийн HDF5 юм. AY-Robots нь GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA болон ACT-г сургадаг. Хэрэв та TinyVLA-г авахыг хүсвэл өөрөө бүтээх хэрэгтэй бөгөөд эхлээд scripts/train.sh доторх DeepSpeed тохиргооны замыг засах шаардлагатай болно.

450 M загвар нь 3 B загвартай үнэхээр өрсөлдөх чадвартай юу?

Зохиогчдын өөрсдийн бенчмарк дээр, тийм ээ: LIBERO дээр 87.3-аар 86.0-ийн эсрэг, робот техникээр урьдчилан сургасан 3.3 B Pi0-тэй харьцуулахад, мөн гурван бодит SO-100 даалгавар дээр 78.3-аар 61.7-ийн эсрэг, үүнд ижилхэн судалгааны ажил Pi0-г 3.5 B гэж тэмдэглэсэн байна. Хязгаарлалт нь ижил судалгааны ажилд бий: робот техникээр урьдчилан сургаагүй нэг даалгаварт SmolVLA 40.0 болж буурч, ACT-ийн 48.3-аас доогуур байна.

Жижиг VLA ямар нэгэн зүйл хийхээс өмнө хэдэн эпизод хэрэгтэй вэ?

AY-Robots нь SmolVLA-ийн хамгийн бага хэмжээг 30 эпизод, ACT-ийн хамгийн бага хэмжээг 50 гэж тогтоосон. lerobot-ын баримт бичигт ойролцоогоор 50-г зөвлөж, 25 нь ижил даалгаварт хангалтгүй байсан гэж мэдээлсэн. Тоо хэмжээ шиг бүтэц чухал: судалгааны ажилд ашигласан багц нь 5 шоо байрлалыг тус бүр 10 эпизодоор ашигласан.

Яагаад нийтлэгдсэн хоцролтын тоо ийм их зөрүүтэй байдаг вэ?

Тэд өөр өөр зүйлсийг хэмждэг. TinyVLA нь A6000 дээр үйлдлийн таамаглал тутамд 14 ms гэж мэдээлсэн; AY-Robots нь SmolVLA-г үйлдлийн алхам тутамд 245 ms, ACT-г 20 ms гэж жагсаасан. Зарим тоо нь нэг урагш дамжуулалтыг хамардаг, зарим нь 50 үйлдлийн хэсэгт дамжуулалтыг хуваадаг, мөн бараг аль нь ч камерын зураг авалт эсвэл серво руу бичих үйлдлийг оруулаагүй байдаг.

Үүлэн таамаглал нь GPU-ийн асуудлыг шийддэг үү?

Хэсэгчлэн. AY-Robots нь бодлогыг үйлчилдэг подыг автоматаар хангадаг бөгөөд орон нутгийн клиент нь тухайн эцсийн цэгтэй харилцдаг, мөн ашиглагдаагүй үедээ өөрөө устдаг хяналтын системтэй тул чимээгүйгээр төлбөр тооцохгүй. Энэ нь олон нийтийн интернетийн эргэлтийн хугацааг арилгах боломжгүй бөгөөд хяналтын давталт нь үйлдлийн алхам тутамд аль хэдийн 20-485 ms байдаг. Удаан сонгож байрлуулах үйлдлүүдэд тохиромжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started