
TinyVLA va SmolVLA ishlaydigan VLAni 1 milliard parametrdan kamroqqa joylashtiradi. Ikkala maqoladan ham haqiqiy raqamlar, lerobot standartlari, o'lchangan kechikish va 24 GB kartada ishlatish qancha turadi.
Deyarli har bir ko'rish-til-harakat modeli haqida yoziladiganlar ma'lumot markazi kartasini talab qiladi. OpenVLA 7 milliard parametrdan iborat. GR00T N1.7 va Pi0.5 taxminan 3 milliard parametrdan iborat bo'lib, nozik sozlash uchun A100 80 GB talab qiladi. Agar stolingizdagi karta 4090 bo'lsa, bu turdagi modelga erishish imkonsiz.
Ikki maqola buni talab qilmasligingizni ta'kidlaydi. TinyVLA (arXiv 2409.12514, 2025-yil fevral oyida IEEE Robotics and Automation Letters tomonidan qabul qilingan) 400 milliondan 1.3 milliardgacha bo'lgan tayanch va diffuziya harakat boshidan VLA yaratadi. SmolVLA (arXiv 2506.01844, 2025-yil 2-iyun kuni taqdim etilgan) ochiq og'irliklar, ochiq ma'lumotlar va bitta iste'molchi kartasida ishlaydigan skript bilan 450 million parametrni taqdim etadi. Mana ikkalasi ham nimani o'lchaganligi va 1 milliarddan kam argumentning o'z kuchini yo'qotadigan joyi.
Bilishingiz kerak bo'lgan narsalar
- •TinyVLA uchta o'lchamda taqdim etiladi: jami 422 million (101 million o'rgatiladigan), 740 million (138 million o'rgatiladigan), 1.3 milliard (143 million o'rgatiladigan). Faqat dastlabki ikkitasi 1 milliarddan kam.
- •Uning IV jadvali TinyVLA-1B uchun bitta A6000 da har bir harakatni bashorat qilish uchun 14 ms, OpenVLA-7B uchun 292 ms va qisqartirilgan OpenVLA-1B uchun 140 ms ni o'lchaydi.
- •Bu tezlikni tayanch emas, balki bosh ushlab turadi: TinyVLA-H ning diffuziya boshini ACT boshi bilan almashtiring va beshta haqiqiy robot vazifasi o'rtacha 94.0 dan bir xonali raqamlarga tushadi. MLP boshi hamma joyda 0 ball oladi.
- •SmolVLA 450 million parametrdan iborat bo'lib, uning taxminan 100 millioni harakat eksperti hisoblanadi, 481 ta jamoat LeRobot ma'lumotlar to'plami va 10.6 million kadrda oldindan o'qitilgan. U LIBERO da 87.3 ballni, robototexnika uchun oldindan o'qitilgan 3.3 milliard parametrlik Pi0 uchun 86.0 ballni, va uchta haqiqiy SO-100 vazifasida 78.3 ballni, 3.5 milliard parametrlik Pi0 uchun 61.7 ballni qayd etadi.
- •Ushbu oldindan o'qitishsiz bitta vazifada o'qitilganda, SmolVLA bu vazifalarda 40.0 ga tushadi, bu ACT ning 48.3 dan past. Kichik avtomatik ravishda oson degani emas.
- •TinyVLA da LeRobot integratsiyasi yo'q va CUDA 11.7 wheel stackini talab qiladi. SmolVLA lerobotda mavjud va bu yerda 24 GB darajasida har bir ishga tushirish uchun taxminan 1 dan 3 USD gacha turadi.
Kichik VLA deb nimani hisoblash mumkin
Model kartasidagi parametrlar soni bitta raqam emas. Bu umumiy vaznlar, inferensiya vaqtida yuklangan vaznlar yoki gradientlarni qabul qiladigan vaznlarni anglatishi mumkin . TinyVLA ikkalasini ham hisobot qiladi va farq katta: TinyVLA-H jami 1.3 B, ammo 143 M o'qitilishi mumkin, chunki ko'rish minorasi va til modelining ko'p qismi muzlatilgan holda qoladi, LoRA adapterlari va harakat boshi esa harakatlanadi. Maqolada o'qitilishi mumkin bo'lgan ulush taxminan 5 foizni tashkil etadi.
| Model | Parametrlar | Tayanch | Harakat boshi | Manba |
|---|---|---|---|---|
| TinyVLA-S | 422 M jami, 101 M o'qitilishi mumkin | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M jami, 138 M o'qitilishi mumkin | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B jami, 143 M o'qitilishi mumkin | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M harakat eksperti | SmolVLM2-500M-Video-Instruct | Oqim moslash eksperti | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S masshtabi, T5-Base matn kodlovchi | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, til modeli yo'q | To'g'ridan-to'g'ri bo'lak regressiyasi | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 va SigLIP kodlovchilar | Avtoregressiv harakat tokenlari | arXiv 2406.09246 |
Ikki qator bahslashishga arziydi. taxminan 80 M bilan bu yerdagi boshqa hamma narsadan kichikroq, ammo til modeli yo'q, shuning uchun u VLA emas: u bitta vazifani o'rganadi va unga boshqa vazifani bajarish buyurilmaydi. 27 M bilan T5-Base matn kodlovchi orqali shartlangan, LLM tayanchi orqali emas. Yaxshi bazaviy modellar, ammo ikkalasi ham yorliqda nazarda tutilgan ko'rsatmalarga rioya qilishni ta'minlamaydi.
Sarlavhadagi natijalarni o'z ichiga olgan TinyVLA-H varianti 1.3 B bo'lib, chiziqdan yuqorida joylashgan. Yaxshiroq savol shundaki, model o'qitish vaqtida 24 GB ga sig'adimi va inferensiya vaqtida sizning boshqaruv tezligingizga erishadimi. Bu yerda o'qitishingiz mumkin bo'lgan beshta siyosat siyosatlar sahifasida; TinyVLA arena yozuviga ega, agar siz uning raqamlarini boshqalarniki bilan birga ko'rmoqchi bo'lsangiz.
TinyVLA: tezlik orqa miya (backbone) dan emas, balki bosh (head) dan keladi
Ochiq-oydin tushuncha shuki, ular til modelini kichikroq qilib, uni tezlashtirishgan. Maqolaning ablasyon tahlili boshqacha deydi. OpenVLA ning 7 B orqa miyasini taxminan 1 B ga almashtirish har bir harakatni bashorat qilishni 292 ms dan 140 ms ga qisqartirdi, bu 2 barobar tezlashishdir. TinyVLA-H, shunga o'xshash parametrlar soniga ega bo'lib, xuddi shu kartada 14 ms da ishlaydi. Qolgan 10 barobar tezlik harakat boshidan (action head) keladi.
| Model | Harakatni bashorat qilish | O'lchangan joyi |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, TinyVLA ning orqa miyasi bilan almashtirilgan | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA harakatlarni til modeli boshi orqali diskretlashtirilgan tokenlar sifatida, har bir harakat o'lchami uchun bittadan, avtoregressiv tarzda chiqaradi. TinyVLA butun qismni bir martada ishlab chiqaradigan diffuziya dekoderini biriktiradi. V jadvali TinyVLA-H dagi arxitekturani ko'rsatadi va xuddi shu beshta haqiqiy robot vazifasida faqat boshni almashtiradi. Bu har ikkala maqoladagi dalil uchun eng aniq dalildir oqim moslashuvi siyosatlari yaratadi va buning sababi Pi0 token dekodlashdan voz kechdi.
| Head on TinyVLA-H | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Diffusion (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Action Chunking Transformer | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Ko'p qatlamli perseptron | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms ko'rsatkichlari IV jadvaldan olingan bo'lib, barchasi bitta A6000 da. Ular har bir harakatni bashorat qilish uchun bo'lib, kamera suratga olish, oldindan ishlov berish va servolarga ketma-ket yozishni o'z ichiga olmaydi. E'lon qilingan kechikishni pastki chegara sifatida qabul qiling, hech qachon boshqaruv tezligi sifatida emas. Bizning raqamlarimiz ham xuddi shunday cheklovga ega: xulosa chiqarish kechikishini ko'ring.
TinyVLA qanday natija ko'rsatdi
| Benchmark | Protocol | TinyVLA-H | Baselines |
|---|---|---|---|
| MetaWorld, 50 ta vazifa, simulyatsiya | Ko'p vazifali, 50 ta demo, 3 ta urug' | 77.6 / 21.5 / 11.4 / 15.8 qiyinlik bo'yicha, o'rtacha 31.6 | Diffusion Policy o'rtacha 10.5 |
| Haqiqiy Franka Panda, 5 ta vazifa | Har bir vazifa uchun 100 ta traektoriya, 20 ta sinov | 94.0 o'rtacha | OpenVLA 68.3, Diffusion Policy 35.3 |
| Ikki qo'lli UR5, 3 ta vazifa | Ko'p vazifali, har bir vazifa uchun 10 ta sinov | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Ikki qo'lli qatorning zerikarli tushuntirishi maqolaning o'zida berilgan: OpenVLA Open X-Embodimentda oldindan o'qitilgan bo'lib, u butunlay bir qo'lli ma'lumotlardan iborat, shuning uchun ikki qo'lli harakat maydoni taqsimotdan tashqarida va u nol ball oladi. Diffuziya siyosati bazasi TinyVLA-H ni ushbu uchta vazifaning ikkitasida mag'lub etadi. Qo'shimcha ma'lumotlar Open X-Embodiment haqidagi maqolada.

TinyVLA repozitoriysi, 2026-yil avgust holatiga ko'ra
Maqola yaxshi. Kod tadqiqot uchun chiqarilgan. Repozitoriy github.com/liyaxuanliyaxuan/TinyVLA; uning README faylida kodning chiqarilish sanasi 2025-yil 17-fevral va oxirgi kommit 2025-yil 11-mart deb ko'rsatilgan. Maqolani qayta ishlab chiqarish uchun yaxshi, ammo agar siz doimiy qo'llab-quvvatlanadigan kutubxona istasangiz, bu muammo bo'lishi mumkin.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt quyidagilarni belgilaydi: torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, va CUDA stekini 11.x g'ildiraklariga: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README Python 3.10 ni talab qiladi; lerobot 0.6.1 esa 3.12 yoki undan yangiroq versiyani talab qiladi, shuning uchun ikkalasi bir muhitda ishlay olmaydi. Avval GPU avlodingiz uchun torch 2.0.1 versiyasi mavjudligini tasdiqlang. Agar ish VRAM yetishmovchiligi tufayli to'xtasa, xotira yetishmovchiligi bo'yicha nazorat ro'yxati taxmin qilishdan ko'ra tezroq yordam beradi.
TinyVLA shuningdek o'qimaydi LeRobot ma'lumotlar to'plamlari. Uning formati ACT-uslubidagi HDF5: action, language_raw va ko'p ko'rinishli tasvirlar, joint_positions, qpos va qvel bilan observations guruhi. Repozitoriy RLDS kiritish uchun data_utils/rlds_to_h5py.py ni o'z ichiga oladi va har bir vazifa aloha_scripts/constants.py faylida dataset_dir, episode_len va camera_names bilan qo'lda ro'yxatdan o'tkaziladi. Agar sizning epizodlaringiz lerobotdan yoki ish stoli mijozidan kelgan bo'lsa, konvertatsiya qilish sizning zimmangizda.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 sakkiz kartali tugunni nazarda tutadi. Uni 1 ga o'rnating va paket hajmini 32 dan ancha pastga tushiring. Yuqori oqimda bitta GPU varianti mavjud emas, shuning uchun buyruqni 4090 da so'zma-so'z ishga tushirib bo'lmaydi.
- --deepspeed scripts/zero2.json yuqori darajadagi scripts katalogida bo'lmagan faylga ishora qiladi. DeepSpeed konfiguratsiyalari llava-pythia/scripts/zero2.json manzilida joylashgan. Birinchi ishga tushirishdan oldin yo'lni to'g'rilang.
- README chiqish katalogi nomida llava_pythia ni, agar LoRA yoqilgan bo'lsa, lora ni o'z ichiga olishini talab qiladi.
- Tayanch alohida yuklab olinadi: lesjie/Llava-Pythia-400M, -700M or -1.3B. Siz lerobot/smolvla_base ga ishora qilganingizdek, siyosatni yo'naltiradigan yagona tayanch nazorat nuqtasi yo'q.
SmolVLA: siz bugun tushdan keyin ishga tushirishingiz mumkin bo'lgan 1 B dan kichik model
SmolVLA xuddi shu argumentni saqlanib turgan kutubxona ichida keltiradi. U SmolVLM2-500M-Video-Instruct tayanchida 450 M parametrga ega va samaradorlik kichik bo'lish haqidagi da'vodan ko'ra, configuration_smolvla.py dan o'qishingiz mumkin bo'lgan sozlamalardan kelib chiqadi.
| Setting in configuration_smolvla.py | Standart | Nima beradi |
|---|---|---|
| num_vlm_layers | 16 | Faqat dastlabki 16 ta til modeli qatlami ishlaydi |
| expert_width_multiplier | 0.75 | Harakat ekspertining yashirin hajmi VLM ning 75 foizini tashkil qiladi |
| self_attn_every_n_layers | 2 | O'z-o'zini diqqat bilan qaratish o'zaro diqqat bilan almashinib turadi |
| chunk_size / n_action_steps | 50 / 50 | Bir o'tish 50 ta harakatni chiqaradi va barcha 50 tasi bajariladi |
| num_steps | 10 | Oqim moslashuvini shovqinni yo'qotish 10 qadamda qat'iylashtirilgan |
| tokenizer_max_length | 48 | Ko'rsatma 48 ta tokengacha qisqartiriladi |
| freeze_vision_encoder / train_expert_only | True / True | Nozik sozlash ekspertni harakatga keltiradi, ko'rish minorasini emas |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Maqoladagi retsept emas: uning oldindan o'qitilishi 200000 qadamdan ortiq 100 qadamli isinishdan foydalangan |
Oldindan o'qitish uchun 481 ta jamoaviy LeRobot ma'lumotlar to'plami, 22.9 K epizod va 10.6 M kadrlar 4 ta GPUda, 256 global paketda 200000 qadam ishlatilgan; maqolada butun loyiha taxminan 30 K GPU soat deb ko'rsatilgan. E'tibor berish kerak bo'lgan bir raqam: Hugging Face ishga tushirish blogida 487 ta tanlangan ma'lumotlar to'plami haqida aytilgan, holbuki maqolaning jadvalida 481 ta deyilgan. Biz maqoladagi raqamdan foydalanamiz va kelishmovchilikni qayd etamiz.

| Benchmark | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO o'rtacha, ko'p vazifali | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World o'rtacha, ko'p vazifali | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Haqiqiy SO-100, 3 vazifa, ko'p vazifali o'qitish | 78.3 | - | 61.7 (3.5 B) | - |
| Haqiqiy SO-100, 3 vazifa, bir vazifali, robototexnika oldindan o'qitishsiz | 40.0 | - | - | 48.3 |
| SO-101 lego terish-joylash, bir vazifali, taqsimot ichida | 90 | - | - | 70 |
| SO-101 lego terish-joylash, bir vazifali, taqsimotdan tashqarida | 50 | - | - | 40 |
LIBERO simulyatsiya bo'lib, hozirda u yerda barcha malakali natijalar saksonliklarda. Haqiqiy SO-100 qatori, bu yerda 450 M model 3.5 B modelni 16.6 ballga mag'lub etadi, qiziqarli hisoblanadi; uning ostidagi qator esa qarshi og'irlikdir. Jamoaviy oldindan o'qitish va ko'p vazifali o'qitishni olib tashlasak, xuddi shu model ACTdan pastga, 40.0 ga tushadi. Himoya qilinadigan da'vo shuki, kichik model avtomatik ravishda yomonroq emas, yaxshiroq ham emas.
Bir tasodif yordam beradi: SmolVLA maqolasining Meta-World jadvali TinyVLA'ning o'z nashr etilgan raqamlarini asos sifatida olib boradi, shuning uchun bir marta ikkala model ham bitta jadvalda joylashgan, SmolVLA-0.45B 57.3 da TinyVLA-H ga qarshi 31.6 da. Shuningdek, u SmolVLA o'qitishini Pi0 ga qaraganda taxminan 40 foiz tezroq va 6 barobar kamroq xotirada amalga oshirilganligini xabar qiladi. Bularning barchasi SmolVLA mualliflaridan keladi; arena yozuvi har bir qiymatni o'z manbasiga bog'laydi.
SmolVLA vaqtini qayerda sarflaydi
AY-Robots SmolVLA'ni har bir harakat bosqichi uchun 245 ms va ACT ni 20 ms da siyosat katalogida. TinyVLA har bir harakat bashorati uchun 14 ms ni xabar qiladi. Bu raqamlar solishtirib bo'lmaydi va ularni shunday deb hisoblash bu mavzudagi eng keng tarqalgan xatodir: ba'zilar bir marta oldinga o'tishni hisoblaydi, ba'zilar esa uni bir bo'lakka bo'lib, harakatni bo'laklarga bo'lish uni amortizatsiya qilgandan so'ng.
- SmolVLA har bir oldinga o'tishda 50 ta harakatni chiqaradi va barcha 50 tasini bajaradi. Maqolada haqiqiy robotlarda ishlatiladigan 30 kadr/sek tezlikda, bitta xulosa taxminan 1.7 soniya harakatni qamrab oladi.
- Asinxron xulosa joriy bo'lak hali bajarilayotgan paytda keyingi bo'lakni hisoblaydi: o'rtacha vazifa bajarilishi 9.7 s sinxron 13.75 s ga qarshi, taxminan 30 foiz tezroq, va belgilangan 60 soniyalik oynada 19 ta olish-qo'yish sikli 9 taga qarshi.
- Muvaffaqiyat darajalari yaxshiroq emas, balki solishtirish mumkin edi, 78.3 sinxron 73.3 asinxron ga qarshi. Asinxronlik aniqlikni emas, balki o'tkazuvchanlikni oshiradi.
- Bo'laklarga bo'lish hisoblash kechikishini yashiradi, tarmoq kechikishini emas, va u siyosatni kamroq reaktiv qiladi, chunki u 50 ta harakatga sodiqdir.
AY-Robots bulutli GPU podini avtomatik ravishda ta'minlashi mumkin, u sizning siyosatingizga xizmat qiladi, shu bilan birga mahalliy robot mijozi o'sha yakuniy nuqta bilan bog'lanadi va pod bo'sh turgan kuzatuvchini olib yuradi, shuning uchun u jim turib hisob-kitob qilish o'rniga o'zini yo'q qiladi. U qilmaydigan narsa – ommaviy internetdagi borib-kelishni olib tashlashdir. Bu yerdagi beshta siyosat bo'yicha boshqaruv sikli hech qanday tarmoqqa ulanishdan oldin har bir harakat bosqichi uchun 20 dan 485 ms gacha, shuning uchun masofaviy xulosa sekin olib-qo'yish uchun maqbul, tezkor reaktiv harakat uchun emas.

SmolVLA ni bitta iste'molchi kartasida nozik sozlash
Qo'lda yo'l, lerobot 0.6.1 da, 2026-yil 23-avgust holatiga ko'ra joriy PyPI relizi. Quyidagi barcha ma'lumotlar Hugging Face lerobot SmolVLA hujjatlaridan, xuddi shu kuni olingan; yo'naltirilgan versiya yumshoqroqdir.
- 1lerobot'ni smolvla qo'shimchasi bilan o'rnating
SmolVLA bog'liqliklari ixtiyoriy qo'shimcha bo'lib, asosiy o'rnatishning bir qismi emas. Ularsiz o'rnatish va keyin siyosat turi nima uchun noma'lum ekanligini o'ylab o'tirish odatiy yarim soatlik yo'qotishdir.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Yetarli epizodlarga ega ma'lumotlar to'plamini oling
Hujjatlarda 50 ga yaqin epizod tavsiya etiladi va xuddi shu vazifa 25 ta epizod bilan yetarli emasligi aytiladi. AY-Robots minimal miqdorni 30 ga belgilaydi. O'zingiznikini yozib oling yoki ma'lumotlar to'plami katalogidan boshlang.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Nozik sozlashni boshlang
lerobot qo'llanmasidagi buyruq, o'zgartirilmagan. Hujjatlarda 20000 qadam bitta A100 da taxminan 4 soatni tashkil etishi aytilgan. 24 GB kartada uzoqroq vaqt kutishingiz va uni o'lchashingiz kerak.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Mos kelguncha batch hajmini kamaytiring
batch_size=64 hujjatlashtirilgan misol bo'lib, kartangiz haqida va'da emas. Hujjatlarda kichikdan boshlash va yuklash vaqtlari qisqa bo'lib qolguncha oshirib borish tavsiya etiladi.
bashlerobot-train --help - 5Nazorat nuqtasini robot qo'liga joylashtiring
Xuddi shu kutubxona, bitta buyruq. Real vaqt rejimida bo'laklarga bo'lish flaglari hujjatlarda izoh qilingan va ular kam quvvatli apparatda foydalanish uchun mo'ljallangan.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Qaysi yo'lni tanlamang, siz nazorat nuqtasi va uni yaratgan konfiguratsiya bilan yakunlaysiz. Ma'lumotlar to'plami versiyasini, qadamlar sonini va urug'ni uning yonida saqlang. lerobot sukut bo'yicha 1000 urug'ni ishlatadi; GR00T'ning nozik sozlash kirish nuqtasi umuman urug'ni ko'rsatmaydi, shuning uchun bu ishlar bitma-bit takrorlanmaydi. Mexanika o'qitish hujjatlarida.
Kichik VLA'ni robot qo'liga o'rnatishning ikki yo'li
Siz mashinaga va nosozlik rejimlariga egasiz. SmolVLA uchun bu oqilona: bitta pip qo'shimchasi, bitta o'qitish buyrug'i, bitta joylashtirish buyrug'i. TinyVLA uchun bu muzlatilgan pinlar, buzilgan DeepSpeed yo'li va o'zingiz yozadigan ma'lumotlarni konvertatsiya qilish bilan tadqiqot reproduktsiyasidir.
- 24 GB kartani oling, 30 dan 50 gacha epizod yozib oling, kamera oqimlarini kadrma-kadr tekshiring.
- pip install -e ".[smolvla]", lerobot/smolvla_base ga qarshi lerobot-train ni ishga tushiring, so'ngra nazorat nuqtasini robot qo'li ulangan mashinada xizmat qiling.
- TinyVLA uchun: alohida conda muhiti, ma'lumotlarni HDF5 ga aylantirish, vazifani constants.py da ro'yxatdan o'tkazish, zero2.json yo'lini tuzatish, train.sh ni sakkizta GPU dan bittaga qisqartirish.
- Karta to'langandan so'ng soatlik to'lov yo'q.
- Xulosa servo motorlar yonida joylashgan, bu tez boshqaruv siklini olishning yagona yo'li.
- Siz siyosat kodini tuzatishingiz mumkin va TinyVLA faqat shu yo'l bilan mavjud.
- 4090 har bir ~3 B siyosatni istisno qiladi, shuning uchun GR00T N1.7 yoki Pi0.5 ga qarshi mahalliy taqqoslash yo'q.
- Muhitni sozlash haqiqiy ishdir. TinyVLA'ning pinlari bir kunni talab qilishi mumkin.
- Navbat yo'q, qayta urinish yo'q, nazorat nuqtasi saqlash yo'q. 14000-qadamda qayta yuklash yana boshlashni anglatadi.
SmolVLA bu yerdagi beshta siyosatdan biridir. Siz shaklda model va ma'lumotlar to'plamini tanlaysiz, backend talab qilingan VRAM bo'yicha GPU ijaraga oladi, o'qituvchini ishga tushiradi va nazorat nuqtalarini ob'ekt saqlash joyiga yozadi. Bosqichma-bosqich: SO-100 da SmolVLA, yoki to'liq matritsani o'qitish sahifasida ko'ring.
| Platforma SmolVLA uchun nima yuboradi | Qiymat |
|---|---|
| batch hajmi | 2 |
| o'rganish tezligi | 1e-4 |
| maksimal qadamlar | 20000 |
| gradient akkumulyatsiyasi | 8, and it does not reach the trainer |
| shakldagi qo'shimcha sozlamalar | seed, logFreq |
| GPU darajasi | RTX 4090 or any 24 GB card |
| ma'lumotlar to'plami formati | LeRobot v3.0 |
| minimal epizodlar | 30 |
Birinchidan, bu yerdagi sukut bo'yicha batch hajmi 2, lerobot hujjatlaridagi misoldagi 64 emas, va gradient akkumulyatsiyasi sozlamasi yuboriladi, lekin SmolVLA uchun hech qanday ta'sir ko'rsatmaydi, shuning uchun samarali batch aslida 2. Sukut bo'yicha yuqori oqimga mos keladi deb taxmin qilishdan ko'ra, uni ataylab oshiring. Ikkinchidan, TinyVLA bu yerda umuman o'qitilmaydi.
24 GB darajasidagi ish 0.30 dan 0.60 USD gacha soatiga 2 dan 5 soatgacha davom etadi, taxminan 1 dan 3 USD gacha. A100 darajasida ~3 B siyosat soatiga 1.20 dan 2.00 USD gacha 3 dan 6 soatgacha davom etadi, taxminan 4 dan 12 USD gacha. narxlarni ko'ring, shuningdek CLI va MCP serveridan xuddi shu operatsiyalarni ko'ring.
Kichik model notoʻgʻri tanlov boʻlganda
Ikkala maqola ham bu yerda xulosalardan koʻra ehtiyotkorroq. TinyVLA'ning nosozlik tahlili aniq: 0.4 B varianti koʻrsatmani notoʻgʻri oʻqish orqali uch marta muvaffaqiyatsizlikka uchradi, mualliflar buni kichikroq VLM'dagi cheklangan tilni tushunish bilan bogʻlashadi va bu rejim 1.3 B'da yoʻqoldi. SmolVLA xuddi shu egri chiziqni boshqa tomondan koʻrsatadi: bir xil arxitekturaning 2.25 B versiyasi LIBERO'da 88.75 va Meta-World'da 68.24 ball toʻplaydi, 0.45 B model uchun esa 87.3 va 57.3 ball.
- 24 GB kartaga sigʻadi, bu tajribani oʻnlab dollardan bir necha dollarga tushiradi.
- Qoʻl yonida ishlash uchun yetarlicha tez, shuning uchun boshqaruv siklida tarmoq sakrashi yoʻq.
- Bir kishi yozib olishi mumkin boʻlgan maʼlumotlar boʻyicha nozik sozlanadi, minglab emas, oʻnlab epizodlar.
- SmolVLA'ning vaznlari, maʼlumotlar roʻyxati va kodi ochiq, shuning uchun yomon natijani tuzatish mumkin.
- Koʻrsatmalarga rioya qilish zaifroq: kamroq til parametrlari, oʻxshash murojaat ifodalarini ajratish qobiliyati kamroq.
- Siz yozib olmagan sozlamalarga fazoviy va vizual umumlashtirish kamroq.
- Maʼlumotlar toʻplamidagi nuqsonlarga nisbatan sezgirroq, tayanish uchun kamroq oldindan oʻqitish mavjud.
- Koʻp vazifali va uzoq muddatli ishlar hali ham kattaroq modellarni, shu jumladan SmolVLA'ning oʻz 2.25 B variantini afzal koʻradi.
Oʻtkazishga arziydigan taqqoslash TinyVLA'ni SmolVLA'ga qarshi emas. Bu SmolVLA'ni ACT sizning oʻz vazifangizda, va SmolVLA maqolasi buning sababini tushuntiradi. Robototexnika boʻyicha oldindan oʻqitishsiz yagona vazifada oʻqitilgan SmolVLA uchta SO-100 vazifasida oʻrtacha 40.0 ball toʻpladi, yagona vazifali ACT esa 48.3 ballga erishdi. Uni 78.3 ga koʻtaradigan narsa faqat arxitektura emas, balki jamoaviy oldindan oʻqitish va koʻp vazifali oʻqitishdir. SO-101 lego vazifasida, ikkalasi ham yagona vazifali boʻlib, SmolVLA gʻalaba qozonadi: tarqatishda 70 ga qarshi 90. Keyin SmolVLA'ni Pi0.5 agar byudjet imkon bersa.
Yomon ma'lumotlarni qoplash uchun kamroq oldindan o'qitish mavjud, shuning uchun nuqsonli ma'lumotlar to'plamidagi toza yo'qotish egri chizig'i nuqsonni ishonchli tarzda takrorlaydigan siyosatni beradi. lerobot hujjatlari tuzilish haqida aniq: 5 ta kub pozitsiyasida 50 ta epizod, har bir pozitsiyada 10 tadan, ishladi; 25 tasi ishlamadi. Agar yo'qotish yaxshi ko'rinsa va qo'l hech qanday foydali ish qilmasa, quyidagilardan boshlang: yo'qotish tushadi, siyosat hech narsa qilmaydi, siyosat faqat bitta sozlamada ishlaydi yoki haqiqatda foydalanish mumkin bo'lgan VLA o'quv ma'lumotlarini yig'ish.
Besh siyosat, bitta taqqoslash jadvali
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT haqiqiy parametrlar soni, har bir harakat bosqichi uchun xulosa chiqarish kechikishi, har biriga kerak bo'ladigan GPU darajasi va foydali ish qilishdan oldingi minimal epizodlar soni bilan.
Siyosatlarni taqqoslangSiz harakat qilishingiz mumkin bo'lgan qarorlar jadvali
| Sizning vaziyatingiz | Boshlang | Nima uchun |
|---|---|---|
| Bitta vazifa, yaxshi namoyishlar, til yo'q | ACT | ~80 M, 20 ms, 24 GB karta, yuklab olish uchun asosiy model yo'q |
| Bir nechta bog'liq vazifalar, har biriga bitta ko'rsatma | SmolVLA | 450 M, lerobotda, minimal 30 epizod, har bir ish uchun 1 dan 3 USD gacha |
| TinyVLA natijasini aniq takrorlash | TinyVLA-B yoki TinyVLA-H | Repo yagona yo'l: izolyatsiya qilingan muhit, konvertatsiya qilingan ma'lumotlar |
| Ko'p vazifali, turli ko'rsatmalar, A100 byudjeti | GR00T N1.7 yoki Pi0.5 | ~3 B, har bir qadam uchun 152 ms va 485 ms, har bir ish uchun 4 dan 12 USD gacha |
| Hali robot yo'q | Haqiqiy qo'lni boshqaring | Navbatga asoslangan jonli qo'l ro'yxatdan o'tishni va apparat vositalarini talab qilmaydi |
Oxirgi qator uchun, jonli qo'l brauzerdan hisobsiz boshqarishingiz mumkin bo'lgan jismoniy SO-100 ni uzatadi va boshlashning uchta usuli qolganini qamrab oladi. SO-100 bu yerda mos yozuv qo'li bo'lib, qismlari taxminan 110 dan 150 Yevrogacha, to'liq sozlash qo'llanmasi.
1 milliarddan kichik modellardan keyin nima keladi
Parametrlar sonini kamaytirish VLA ni arzon qilishning bir usuli bo'lib, bu aniq g'olibona usul emas. OpenVLA-OFT (arXiv 2502.19645) 7 milliardlik asosni saqlab qoladi va faqat harakatlar qanday dekodlanishini o'zgartiradi, harakatlarni yaratish samaradorligining 26 barobar oshganini va LIBERO ning 76.5 dan 97.1 foizgacha ko'tarilganini xabar qiladi. BitVLA (arXiv 2506.07530) 1-bitli BitNet b1.58 2B4T asosining har bir og'irligini uchlikka aylantiradi, 11.0 barobar kam xotira va 4.4 barobar past yakuniy kechikishni xabar qiladi, shu bilan birga to'liq aniqlikdagi OpenVLA-OFT ga mos keladi. X-VLA-0.9B (arXiv 2510.10274) oqim moslashuvi bilan 1 milliardlik chiziqda joylashgan.
Umumiy mavzu: kechikish til modelida emas, balki harakat dekoderida yashaydi. Qancha parametrga ega ekanligini so'rashdan oldin, siyosat harakatlarni qanday chiqarishini so'rang. arena 85 ta model va 332 ta natijaga ega, ularning har biri o'z manbasiga bog'langan; kengroq umumiy ko'rinish bizning VLA ga kirishimiz.
SmolVLA'ni RTX 4090'da nozik sozlashim mumkinmi?▾
Ha. SmolVLA 450 M parametrga ega va AY-Robots uni RTX 4090 / 24 GB darajasida ishga tushiradi. lerobot misoli --batch_size=64 dan foydalanadi, bu sizning kartangiz uchun kafolat emas, balki misoldir; hujjatlarda yuklash vaqtlari qisqa bo'lib qolishi uchun kichikdan boshlash va oshirish tavsiya etiladi. A100 da 20000 qadam uchun hujjatlarda keltirilgan taxminan 4 soatdan ko'proq vaqt kutishingiz kerak.
TinyVLA lerobot'da yoki AY-Robots'da mavjudmi?▾
Ikkalasi ham yo'q. TinyVLA faqat o'zining tadqiqot omborida mavjud, oxirgi kommit 2025 yil 11 martda qilingan va uning formati LeRobot emas, balki ACT-uslubidagi HDF5. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT'ni o'rgatadi. Agar TinyVLA'ni xohlasangiz, uni o'zingiz yaratishingiz kerak bo'ladi va avval scripts/train.sh dagi DeepSpeed konfiguratsiya yo'lini tuzatishingiz kerak bo'ladi.
450 M model haqiqatan ham 3 B model bilan raqobatlasha oladimi?▾
Mualliflarning o'z benchmarklariga ko'ra, ha: LIBERO'da 87.3 ga qarshi 86.0, robototexnika bo'yicha oldindan o'qitilgan 3.3 B Pi0 ga nisbatan, va uchta haqiqiy SO-100 vazifasida 78.3 ga qarshi 61.7, bu yerda xuddi shu maqola Pi0'ni 3.5 B deb belgilaydi. Cheklov xuddi shu maqolada: robototexnika bo'yicha oldindan o'qitishsiz yagona vazifa, SmolVLA 40.0 ga tushadi, ACT'ning 48.3 dan past.
Kichik VLA biror narsa qilishidan oldin qancha epizod kerak?▾
AY-Robots SmolVLA uchun minimal 30 epizod va ACT uchun minimal 50 epizod belgilaydi. lerobot hujjatlari taxminan 50 ta tavsiya qiladi va 25 ta xuddi shu vazifa uchun yetarli emasligini xabar qiladi. Tuzilma soni kabi muhim: maqoladagi to'plam har biri 10 epizoddan iborat 5 ta kub pozitsiyasidan foydalangan.
Nima uchun e'lon qilingan kechikish raqamlari bunchalik farq qiladi?▾
Ular turli narsalarni o'lchaydilar. TinyVLA A6000 da har bir harakatni bashorat qilish uchun 14 ms ni xabar qiladi; AY-Robots SmolVLA'ni har bir harakat bosqichi uchun 245 ms va ACT'ni 20 ms deb ko'rsatadi. Ba'zi raqamlar bitta oldinga o'tishni qamrab oladi, ba'zilari o'tishni 50 harakatli bo'lakka bo'ladi va deyarli hech biri kamera suratga olish yoki servolarga yozishni o'z ichiga olmaydi.
Bulutli inferensiya GPU muammosini hal qiladimi?▾
Qisman. AY-Robots siyosatni ta'minlaydigan podni avtomatik ravishda ta'minlaydi, shu bilan birga mahalliy mijoz ushbu nuqta bilan bog'lanadi, bo'sh turgan kuzatuvchi bilan, shuning uchun u jim hisob-kitob qilish o'rniga o'zini yo'q qiladi. U ommaviy internetdagi borib-kelishni olib tashlay olmaydi va boshqaruv tsikli har bir harakat bosqichi uchun allaqachon 20 dan 485 ms gacha. Sekin tanlash va joylashtirish uchun yaxshi, ammo tez reaktiv harakat uchun emas.
Sources
- TinyVLA: Robot Manipulyatsiyasi uchun Tez, Ma'lumot Samarali Ko'rish-Til-Harakat Modellariga Qarab
- TinyVLA rasmiy kod ombori (README, requirements.txt, scripts/train.sh)
- TinyVLA loyiha sahifasi
- lesjie/Llava-Pythia-1.3B, TinyVLA-H tayanch og'irliklari
- SmolVLA: Arzon va Samarali Robototexnika uchun Ko'rish-Til-Harakat Modeli
- lerobot hujjatlari: SmolVLA'ni nozik sozlash
- lerobot: configuration_smolvla.py, SmolVLA standart sozlamalari
- lerobot/smolvla_base model kartasi
- SmolVLA: Samarali Ko'rish-Til-Harakat Modeli (Hugging Face blogi)
- PyPI'dagi lerobot (0.6.1, Python 3.12 yoki yangiroq versiyasini talab qiladi)
- OpenVLA: Ochiq Manbali Ko'rish-Til-Harakat Modeli
- Ko'rish-Til-Harakat Modellarini Nozik Sozlash: Tezlik va Muvaffaqiyatni Optimallashtirish (OpenVLA-OFT)
- BitVLA: Robot Manipulyatsiyasi uchun 1-bitli Ko'rish-Til-Harakat Modellar
- X-VLA: Masshtablanuvchi Turli Tana Ko'rinishli Ko'rish-Til-Harakat Modeli Sifatida Yumshoq So'rovli Transformer
- rail-berkeley/octo-small-1.5 model kartasi (27 M parametr)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started