AY-Robots siyosatini taqqoslash jadvali parametrlar soni, GPU darajalari va GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT uchun inferens kechikishi bilan
SmolVLATinyVLAKichik VLAIste'molchi GPULeRobot

Kichik VLA Modellar: TinyVLA, SmolVLA va 1 milliarddan kam holat

AY-Robots ResearchAugust 23, 202619 min o'qish

TinyVLA va SmolVLA ishlaydigan VLAni 1 milliard parametrdan kamroqqa joylashtiradi. Ikkala maqoladan ham haqiqiy raqamlar, lerobot standartlari, o'lchangan kechikish va 24 GB kartada ishlatish qancha turadi.

Deyarli har bir ko'rish-til-harakat modeli haqida yoziladiganlar ma'lumot markazi kartasini talab qiladi. OpenVLA 7 milliard parametrdan iborat. GR00T N1.7 va Pi0.5 taxminan 3 milliard parametrdan iborat bo'lib, nozik sozlash uchun A100 80 GB talab qiladi. Agar stolingizdagi karta 4090 bo'lsa, bu turdagi modelga erishish imkonsiz.

Ikki maqola buni talab qilmasligingizni ta'kidlaydi. TinyVLA (arXiv 2409.12514, 2025-yil fevral oyida IEEE Robotics and Automation Letters tomonidan qabul qilingan) 400 milliondan 1.3 milliardgacha bo'lgan tayanch va diffuziya harakat boshidan VLA yaratadi. SmolVLA (arXiv 2506.01844, 2025-yil 2-iyun kuni taqdim etilgan) ochiq og'irliklar, ochiq ma'lumotlar va bitta iste'molchi kartasida ishlaydigan skript bilan 450 million parametrni taqdim etadi. Mana ikkalasi ham nimani o'lchaganligi va 1 milliarddan kam argumentning o'z kuchini yo'qotadigan joyi.

Bilishingiz kerak bo'lgan narsalar

  • TinyVLA uchta o'lchamda taqdim etiladi: jami 422 million (101 million o'rgatiladigan), 740 million (138 million o'rgatiladigan), 1.3 milliard (143 million o'rgatiladigan). Faqat dastlabki ikkitasi 1 milliarddan kam.
  • Uning IV jadvali TinyVLA-1B uchun bitta A6000 da har bir harakatni bashorat qilish uchun 14 ms, OpenVLA-7B uchun 292 ms va qisqartirilgan OpenVLA-1B uchun 140 ms ni o'lchaydi.
  • Bu tezlikni tayanch emas, balki bosh ushlab turadi: TinyVLA-H ning diffuziya boshini ACT boshi bilan almashtiring va beshta haqiqiy robot vazifasi o'rtacha 94.0 dan bir xonali raqamlarga tushadi. MLP boshi hamma joyda 0 ball oladi.
  • SmolVLA 450 million parametrdan iborat bo'lib, uning taxminan 100 millioni harakat eksperti hisoblanadi, 481 ta jamoat LeRobot ma'lumotlar to'plami va 10.6 million kadrda oldindan o'qitilgan. U LIBERO da 87.3 ballni, robototexnika uchun oldindan o'qitilgan 3.3 milliard parametrlik Pi0 uchun 86.0 ballni, va uchta haqiqiy SO-100 vazifasida 78.3 ballni, 3.5 milliard parametrlik Pi0 uchun 61.7 ballni qayd etadi.
  • Ushbu oldindan o'qitishsiz bitta vazifada o'qitilganda, SmolVLA bu vazifalarda 40.0 ga tushadi, bu ACT ning 48.3 dan past. Kichik avtomatik ravishda oson degani emas.
  • TinyVLA da LeRobot integratsiyasi yo'q va CUDA 11.7 wheel stackini talab qiladi. SmolVLA lerobotda mavjud va bu yerda 24 GB darajasida har bir ishga tushirish uchun taxminan 1 dan 3 USD gacha turadi.

Kichik VLA deb nimani hisoblash mumkin

Model kartasidagi parametrlar soni bitta raqam emas. Bu umumiy vaznlar, inferensiya vaqtida yuklangan vaznlar yoki gradientlarni qabul qiladigan vaznlarni anglatishi mumkin . TinyVLA ikkalasini ham hisobot qiladi va farq katta: TinyVLA-H jami 1.3 B, ammo 143 M o'qitilishi mumkin, chunki ko'rish minorasi va til modelining ko'p qismi muzlatilgan holda qoladi, LoRA adapterlari va harakat boshi esa harakatlanadi. Maqolada o'qitilishi mumkin bo'lgan ulush taxminan 5 foizni tashkil etadi.

ModelParametrlarTayanchHarakat boshiManba
TinyVLA-S422 M jami, 101 M o'qitilishi mumkinLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M jami, 138 M o'qitilishi mumkinLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B jami, 143 M o'qitilishi mumkinLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M harakat ekspertiSmolVLM2-500M-Video-InstructOqim moslash ekspertiarXiv 2506.01844
Octo-Small27 MViT-S masshtabi, T5-Base matn kodlovchiDiffusionocto-small-1.5 card
ACT~80 MResNet, til modeli yo'qTo'g'ridan-to'g'ri bo'lak regressiyasiAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 va SigLIP kodlovchilarAvtoregressiv harakat tokenlariarXiv 2406.09246

Ikki qator bahslashishga arziydi. taxminan 80 M bilan bu yerdagi boshqa hamma narsadan kichikroq, ammo til modeli yo'q, shuning uchun u VLA emas: u bitta vazifani o'rganadi va unga boshqa vazifani bajarish buyurilmaydi. 27 M bilan T5-Base matn kodlovchi orqali shartlangan, LLM tayanchi orqali emas. Yaxshi bazaviy modellar, ammo ikkalasi ham yorliqda nazarda tutilgan ko'rsatmalarga rioya qilishni ta'minlamaydi.

1 B chizig'i ixtiyoriy

Sarlavhadagi natijalarni o'z ichiga olgan TinyVLA-H varianti 1.3 B bo'lib, chiziqdan yuqorida joylashgan. Yaxshiroq savol shundaki, model o'qitish vaqtida 24 GB ga sig'adimi va inferensiya vaqtida sizning boshqaruv tezligingizga erishadimi. Bu yerda o'qitishingiz mumkin bo'lgan beshta siyosat siyosatlar sahifasida; TinyVLA arena yozuviga ega, agar siz uning raqamlarini boshqalarniki bilan birga ko'rmoqchi bo'lsangiz.

TinyVLA: tezlik orqa miya (backbone) dan emas, balki bosh (head) dan keladi

Ochiq-oydin tushuncha shuki, ular til modelini kichikroq qilib, uni tezlashtirishgan. Maqolaning ablasyon tahlili boshqacha deydi. OpenVLA ning 7 B orqa miyasini taxminan 1 B ga almashtirish har bir harakatni bashorat qilishni 292 ms dan 140 ms ga qisqartirdi, bu 2 barobar tezlashishdir. TinyVLA-H, shunga o'xshash parametrlar soniga ega bo'lib, xuddi shu kartada 14 ms da ishlaydi. Qolgan 10 barobar tezlik harakat boshidan (action head) keladi.

ModelHarakatni bashorat qilishO'lchangan joyi
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, TinyVLA ning orqa miyasi bilan almashtirilgan140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA harakatlarni til modeli boshi orqali diskretlashtirilgan tokenlar sifatida, har bir harakat o'lchami uchun bittadan, avtoregressiv tarzda chiqaradi. TinyVLA butun qismni bir martada ishlab chiqaradigan diffuziya dekoderini biriktiradi. V jadvali TinyVLA-H dagi arxitekturani ko'rsatadi va xuddi shu beshta haqiqiy robot vazifasida faqat boshni almashtiradi. Bu har ikkala maqoladagi dalil uchun eng aniq dalildir oqim moslashuvi siyosatlari yaratadi va buning sababi Pi0 token dekodlashdan voz kechdi.

Head on TinyVLA-HPlaceTennisFlipMugStackCubesCloseDrawerOpenBox
Diffusion (droid_diffusion)90.098.398.396.786.7
Action Chunking Transformer13.38.38.313.323.3
Ko'p qatlamli perseptron00000
TinyVLA raqamlari nimani qamrab oladi

292 / 140 / 14 ms ko'rsatkichlari IV jadvaldan olingan bo'lib, barchasi bitta A6000 da. Ular har bir harakatni bashorat qilish uchun bo'lib, kamera suratga olish, oldindan ishlov berish va servolarga ketma-ket yozishni o'z ichiga olmaydi. E'lon qilingan kechikishni pastki chegara sifatida qabul qiling, hech qachon boshqaruv tezligi sifatida emas. Bizning raqamlarimiz ham xuddi shunday cheklovga ega: xulosa chiqarish kechikishini ko'ring.

TinyVLA qanday natija ko'rsatdi

BenchmarkProtocolTinyVLA-HBaselines
MetaWorld, 50 ta vazifa, simulyatsiyaKo'p vazifali, 50 ta demo, 3 ta urug'77.6 / 21.5 / 11.4 / 15.8 qiyinlik bo'yicha, o'rtacha 31.6Diffusion Policy o'rtacha 10.5
Haqiqiy Franka Panda, 5 ta vazifaHar bir vazifa uchun 100 ta traektoriya, 20 ta sinov94.0 o'rtachaOpenVLA 68.3, Diffusion Policy 35.3
Ikki qo'lli UR5, 3 ta vazifaKo'p vazifali, har bir vazifa uchun 10 ta sinov76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Ikki qo'lli qatorning zerikarli tushuntirishi maqolaning o'zida berilgan: OpenVLA Open X-Embodimentda oldindan o'qitilgan bo'lib, u butunlay bir qo'lli ma'lumotlardan iborat, shuning uchun ikki qo'lli harakat maydoni taqsimotdan tashqarida va u nol ball oladi. Diffuziya siyosati bazasi TinyVLA-H ni ushbu uchta vazifaning ikkitasida mag'lub etadi. Qo'shimcha ma'lumotlar Open X-Embodiment haqidagi maqolada.

AY-Robots arena peshqadami, 85 ta VLA modelining 332 ta benchmark natijalari bilan saralash mumkin bo'lgan jadvali, har bir qiymat o'zi kelgan maqola yoki model kartasiga bog'langan
Modellararo benchmark raqamlari faqat har birining qayerdan kelganini ko'rganingizda solishtirish mumkin.

TinyVLA repozitoriysi, 2026-yil avgust holatiga ko'ra

Maqola yaxshi. Kod tadqiqot uchun chiqarilgan. Repozitoriy github.com/liyaxuanliyaxuan/TinyVLA; uning README faylida kodning chiqarilish sanasi 2025-yil 17-fevral va oxirgi kommit 2025-yil 11-mart deb ko'rsatilgan. Maqolani qayta ishlab chiqarish uchun yaxshi, ammo agar siz doimiy qo'llab-quvvatlanadigan kutubxona istasangiz, bu muammo bo'lishi mumkin.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README'dagi o'rnatish ketma-ketligi, 2026-08-23 sanasida repozitoriyga nisbatan tekshirilgan.
Bog'liqliklar cheklovlari bir kunni yutib yuboradigan tuzoqdir

requirements.txt quyidagilarni belgilaydi: torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, va CUDA stekini 11.x g'ildiraklariga: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README Python 3.10 ni talab qiladi; lerobot 0.6.1 esa 3.12 yoki undan yangiroq versiyani talab qiladi, shuning uchun ikkalasi bir muhitda ishlay olmaydi. Avval GPU avlodingiz uchun torch 2.0.1 versiyasi mavjudligini tasdiqlang. Agar ish VRAM yetishmovchiligi tufayli to'xtasa, xotira yetishmovchiligi bo'yicha nazorat ro'yxati taxmin qilishdan ko'ra tezroq yordam beradi.

TinyVLA shuningdek o'qimaydi LeRobot ma'lumotlar to'plamlari. Uning formati ACT-uslubidagi HDF5: action, language_raw va ko'p ko'rinishli tasvirlar, joint_positions, qpos va qvel bilan observations guruhi. Repozitoriy RLDS kiritish uchun data_utils/rlds_to_h5py.py ni o'z ichiga oladi va har bir vazifa aloha_scripts/constants.py faylida dataset_dir, episode_len va camera_names bilan qo'lda ro'yxatdan o'tkaziladi. Agar sizning epizodlaringiz lerobotdan yoki ish stoli mijozidan kelgan bo'lsa, konvertatsiya qilish sizning zimmangizda.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh faylidan qisqartirilgan. Yuqoridagi har bir flag va qiymat yetkazib berilgan faylda mavjud.
  • --num_gpus=8 sakkiz kartali tugunni nazarda tutadi. Uni 1 ga o'rnating va paket hajmini 32 dan ancha pastga tushiring. Yuqori oqimda bitta GPU varianti mavjud emas, shuning uchun buyruqni 4090 da so'zma-so'z ishga tushirib bo'lmaydi.
  • --deepspeed scripts/zero2.json yuqori darajadagi scripts katalogida bo'lmagan faylga ishora qiladi. DeepSpeed konfiguratsiyalari llava-pythia/scripts/zero2.json manzilida joylashgan. Birinchi ishga tushirishdan oldin yo'lni to'g'rilang.
  • README chiqish katalogi nomida llava_pythia ni, agar LoRA yoqilgan bo'lsa, lora ni o'z ichiga olishini talab qiladi.
  • Tayanch alohida yuklab olinadi: lesjie/Llava-Pythia-400M, -700M or -1.3B. Siz lerobot/smolvla_base ga ishora qilganingizdek, siyosatni yo'naltiradigan yagona tayanch nazorat nuqtasi yo'q.

SmolVLA: siz bugun tushdan keyin ishga tushirishingiz mumkin bo'lgan 1 B dan kichik model

SmolVLA xuddi shu argumentni saqlanib turgan kutubxona ichida keltiradi. U SmolVLM2-500M-Video-Instruct tayanchida 450 M parametrga ega va samaradorlik kichik bo'lish haqidagi da'vodan ko'ra, configuration_smolvla.py dan o'qishingiz mumkin bo'lgan sozlamalardan kelib chiqadi.

Setting in configuration_smolvla.pyStandartNima beradi
num_vlm_layers16Faqat dastlabki 16 ta til modeli qatlami ishlaydi
expert_width_multiplier0.75Harakat ekspertining yashirin hajmi VLM ning 75 foizini tashkil qiladi
self_attn_every_n_layers2O'z-o'zini diqqat bilan qaratish o'zaro diqqat bilan almashinib turadi
chunk_size / n_action_steps50 / 50Bir o'tish 50 ta harakatni chiqaradi va barcha 50 tasi bajariladi
num_steps10Oqim moslashuvini shovqinni yo'qotish 10 qadamda qat'iylashtirilgan
tokenizer_max_length48Ko'rsatma 48 ta tokengacha qisqartiriladi
freeze_vision_encoder / train_expert_onlyTrue / TrueNozik sozlash ekspertni harakatga keltiradi, ko'rish minorasini emas
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Maqoladagi retsept emas: uning oldindan o'qitilishi 200000 qadamdan ortiq 100 qadamli isinishdan foydalangan

Oldindan o'qitish uchun 481 ta jamoaviy LeRobot ma'lumotlar to'plami, 22.9 K epizod va 10.6 M kadrlar 4 ta GPUda, 256 global paketda 200000 qadam ishlatilgan; maqolada butun loyiha taxminan 30 K GPU soat deb ko'rsatilgan. E'tibor berish kerak bo'lgan bir raqam: Hugging Face ishga tushirish blogida 487 ta tanlangan ma'lumotlar to'plami haqida aytilgan, holbuki maqolaning jadvalida 481 ta deyilgan. Biz maqoladagi raqamdan foydalanamiz va kelishmovchilikni qayd etamiz.

AY-Robotsdagi SmolVLA model sahifasi parametrlar sonini, 24 GB GPU darajasini, har bir harakat bosqichi uchun inferensiya kechikishini va minimal epizodlar sonini ko'rsatmoqda.
Platformaning SmolVLA sahifasi: 450 M parametr, har bir harakat bosqichi uchun 245 ms, RTX 4090 darajasi, kamida 30 epizod.
BenchmarkSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO o'rtacha, ko'p vazifali87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World o'rtacha, ko'p vazifali57.368.2447.9 (3.5 B, robotics-pretrained)-
Haqiqiy SO-100, 3 vazifa, ko'p vazifali o'qitish78.3-61.7 (3.5 B)-
Haqiqiy SO-100, 3 vazifa, bir vazifali, robototexnika oldindan o'qitishsiz40.0--48.3
SO-101 lego terish-joylash, bir vazifali, taqsimot ichida90--70
SO-101 lego terish-joylash, bir vazifali, taqsimotdan tashqarida50--40
Sarlavha qatorini emas, balki butun jadvalni o'qing

LIBERO simulyatsiya bo'lib, hozirda u yerda barcha malakali natijalar saksonliklarda. Haqiqiy SO-100 qatori, bu yerda 450 M model 3.5 B modelni 16.6 ballga mag'lub etadi, qiziqarli hisoblanadi; uning ostidagi qator esa qarshi og'irlikdir. Jamoaviy oldindan o'qitish va ko'p vazifali o'qitishni olib tashlasak, xuddi shu model ACTdan pastga, 40.0 ga tushadi. Himoya qilinadigan da'vo shuki, kichik model avtomatik ravishda yomonroq emas, yaxshiroq ham emas.

Bir tasodif yordam beradi: SmolVLA maqolasining Meta-World jadvali TinyVLA'ning o'z nashr etilgan raqamlarini asos sifatida olib boradi, shuning uchun bir marta ikkala model ham bitta jadvalda joylashgan, SmolVLA-0.45B 57.3 da TinyVLA-H ga qarshi 31.6 da. Shuningdek, u SmolVLA o'qitishini Pi0 ga qaraganda taxminan 40 foiz tezroq va 6 barobar kamroq xotirada amalga oshirilganligini xabar qiladi. Bularning barchasi SmolVLA mualliflaridan keladi; arena yozuvi har bir qiymatni o'z manbasiga bog'laydi.

SmolVLA vaqtini qayerda sarflaydi

AY-Robots SmolVLA'ni har bir harakat bosqichi uchun 245 ms va ACT ni 20 ms da siyosat katalogida. TinyVLA har bir harakat bashorati uchun 14 ms ni xabar qiladi. Bu raqamlar solishtirib bo'lmaydi va ularni shunday deb hisoblash bu mavzudagi eng keng tarqalgan xatodir: ba'zilar bir marta oldinga o'tishni hisoblaydi, ba'zilar esa uni bir bo'lakka bo'lib, harakatni bo'laklarga bo'lish uni amortizatsiya qilgandan so'ng.

  • SmolVLA har bir oldinga o'tishda 50 ta harakatni chiqaradi va barcha 50 tasini bajaradi. Maqolada haqiqiy robotlarda ishlatiladigan 30 kadr/sek tezlikda, bitta xulosa taxminan 1.7 soniya harakatni qamrab oladi.
  • Asinxron xulosa joriy bo'lak hali bajarilayotgan paytda keyingi bo'lakni hisoblaydi: o'rtacha vazifa bajarilishi 9.7 s sinxron 13.75 s ga qarshi, taxminan 30 foiz tezroq, va belgilangan 60 soniyalik oynada 19 ta olish-qo'yish sikli 9 taga qarshi.
  • Muvaffaqiyat darajalari yaxshiroq emas, balki solishtirish mumkin edi, 78.3 sinxron 73.3 asinxron ga qarshi. Asinxronlik aniqlikni emas, balki o'tkazuvchanlikni oshiradi.
  • Bo'laklarga bo'lish hisoblash kechikishini yashiradi, tarmoq kechikishini emas, va u siyosatni kamroq reaktiv qiladi, chunki u 50 ta harakatga sodiqdir.
Masofaviy xulosa bepul emas va hech bir platforma fizikani tuzatmaydi

AY-Robots bulutli GPU podini avtomatik ravishda ta'minlashi mumkin, u sizning siyosatingizga xizmat qiladi, shu bilan birga mahalliy robot mijozi o'sha yakuniy nuqta bilan bog'lanadi va pod bo'sh turgan kuzatuvchini olib yuradi, shuning uchun u jim turib hisob-kitob qilish o'rniga o'zini yo'q qiladi. U qilmaydigan narsa – ommaviy internetdagi borib-kelishni olib tashlashdir. Bu yerdagi beshta siyosat bo'yicha boshqaruv sikli hech qanday tarmoqqa ulanishdan oldin har bir harakat bosqichi uchun 20 dan 485 ms gacha, shuning uchun masofaviy xulosa sekin olib-qo'yish uchun maqbul, tezkor reaktiv harakat uchun emas.

AY-Robots siyosatlarini taqqoslash jadvali GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT ni parametrlar soni, talab qilinadigan GPU darajasi, harakat bosqichi uchun xulosa kechikishi va har biri uchun zarur bo'lgan minimal epizodlar soni bilan ko'rsatadi.
SmolVLA ~450 M va ACT ~80 M hajmli ikkitasi 24 GB kartaga sig'adi. Qolgan uchtasi A100 yoki H100 80 GB talab qiladi.

SmolVLA ni bitta iste'molchi kartasida nozik sozlash

Qo'lda yo'l, lerobot 0.6.1 da, 2026-yil 23-avgust holatiga ko'ra joriy PyPI relizi. Quyidagi barcha ma'lumotlar Hugging Face lerobot SmolVLA hujjatlaridan, xuddi shu kuni olingan; yo'naltirilgan versiya yumshoqroqdir.

  1. 1
    lerobot'ni smolvla qo'shimchasi bilan o'rnating

    SmolVLA bog'liqliklari ixtiyoriy qo'shimcha bo'lib, asosiy o'rnatishning bir qismi emas. Ularsiz o'rnatish va keyin siyosat turi nima uchun noma'lum ekanligini o'ylab o'tirish odatiy yarim soatlik yo'qotishdir.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Yetarli epizodlarga ega ma'lumotlar to'plamini oling

    Hujjatlarda 50 ga yaqin epizod tavsiya etiladi va xuddi shu vazifa 25 ta epizod bilan yetarli emasligi aytiladi. AY-Robots minimal miqdorni 30 ga belgilaydi. O'zingiznikini yozib oling yoki ma'lumotlar to'plami katalogidan boshlang.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Nozik sozlashni boshlang

    lerobot qo'llanmasidagi buyruq, o'zgartirilmagan. Hujjatlarda 20000 qadam bitta A100 da taxminan 4 soatni tashkil etishi aytilgan. 24 GB kartada uzoqroq vaqt kutishingiz va uni o'lchashingiz kerak.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Mos kelguncha batch hajmini kamaytiring

    batch_size=64 hujjatlashtirilgan misol bo'lib, kartangiz haqida va'da emas. Hujjatlarda kichikdan boshlash va yuklash vaqtlari qisqa bo'lib qolguncha oshirib borish tavsiya etiladi.

    bash
    lerobot-train --help
  5. 5
    Nazorat nuqtasini robot qo'liga joylashtiring

    Xuddi shu kutubxona, bitta buyruq. Real vaqt rejimida bo'laklarga bo'lish flaglari hujjatlarda izoh qilingan va ular kam quvvatli apparatda foydalanish uchun mo'ljallangan.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Nazorat nuqtasi yetkazib beriladigan mahsulotdir

Qaysi yo'lni tanlamang, siz nazorat nuqtasi va uni yaratgan konfiguratsiya bilan yakunlaysiz. Ma'lumotlar to'plami versiyasini, qadamlar sonini va urug'ni uning yonida saqlang. lerobot sukut bo'yicha 1000 urug'ni ishlatadi; GR00T'ning nozik sozlash kirish nuqtasi umuman urug'ni ko'rsatmaydi, shuning uchun bu ishlar bitma-bit takrorlanmaydi. Mexanika o'qitish hujjatlarida.

Kichik VLA'ni robot qo'liga o'rnatishning ikki yo'li

Siz mashinaga va nosozlik rejimlariga egasiz. SmolVLA uchun bu oqilona: bitta pip qo'shimchasi, bitta o'qitish buyrug'i, bitta joylashtirish buyrug'i. TinyVLA uchun bu muzlatilgan pinlar, buzilgan DeepSpeed yo'li va o'zingiz yozadigan ma'lumotlarni konvertatsiya qilish bilan tadqiqot reproduktsiyasidir.

  1. 24 GB kartani oling, 30 dan 50 gacha epizod yozib oling, kamera oqimlarini kadrma-kadr tekshiring.
  2. pip install -e ".[smolvla]", lerobot/smolvla_base ga qarshi lerobot-train ni ishga tushiring, so'ngra nazorat nuqtasini robot qo'li ulangan mashinada xizmat qiling.
  3. TinyVLA uchun: alohida conda muhiti, ma'lumotlarni HDF5 ga aylantirish, vazifani constants.py da ro'yxatdan o'tkazish, zero2.json yo'lini tuzatish, train.sh ni sakkizta GPU dan bittaga qisqartirish.
Afzalliklar
  • Karta to'langandan so'ng soatlik to'lov yo'q.
  • Xulosa servo motorlar yonida joylashgan, bu tez boshqaruv siklini olishning yagona yo'li.
  • Siz siyosat kodini tuzatishingiz mumkin va TinyVLA faqat shu yo'l bilan mavjud.
Kompromisslar
  • 4090 har bir ~3 B siyosatni istisno qiladi, shuning uchun GR00T N1.7 yoki Pi0.5 ga qarshi mahalliy taqqoslash yo'q.
  • Muhitni sozlash haqiqiy ishdir. TinyVLA'ning pinlari bir kunni talab qilishi mumkin.
  • Navbat yo'q, qayta urinish yo'q, nazorat nuqtasi saqlash yo'q. 14000-qadamda qayta yuklash yana boshlashni anglatadi.

Kichik model notoʻgʻri tanlov boʻlganda

Ikkala maqola ham bu yerda xulosalardan koʻra ehtiyotkorroq. TinyVLA'ning nosozlik tahlili aniq: 0.4 B varianti koʻrsatmani notoʻgʻri oʻqish orqali uch marta muvaffaqiyatsizlikka uchradi, mualliflar buni kichikroq VLM'dagi cheklangan tilni tushunish bilan bogʻlashadi va bu rejim 1.3 B'da yoʻqoldi. SmolVLA xuddi shu egri chiziqni boshqa tomondan koʻrsatadi: bir xil arxitekturaning 2.25 B versiyasi LIBERO'da 88.75 va Meta-World'da 68.24 ball toʻplaydi, 0.45 B model uchun esa 87.3 va 57.3 ball.

1 B dan kichik VLA'ni tanlash
Qayerda yutadi
  • 24 GB kartaga sigʻadi, bu tajribani oʻnlab dollardan bir necha dollarga tushiradi.
  • Qoʻl yonida ishlash uchun yetarlicha tez, shuning uchun boshqaruv siklida tarmoq sakrashi yoʻq.
  • Bir kishi yozib olishi mumkin boʻlgan maʼlumotlar boʻyicha nozik sozlanadi, minglab emas, oʻnlab epizodlar.
  • SmolVLA'ning vaznlari, maʼlumotlar roʻyxati va kodi ochiq, shuning uchun yomon natijani tuzatish mumkin.
Qayerda yutqazadi
  • Koʻrsatmalarga rioya qilish zaifroq: kamroq til parametrlari, oʻxshash murojaat ifodalarini ajratish qobiliyati kamroq.
  • Siz yozib olmagan sozlamalarga fazoviy va vizual umumlashtirish kamroq.
  • Maʼlumotlar toʻplamidagi nuqsonlarga nisbatan sezgirroq, tayanish uchun kamroq oldindan oʻqitish mavjud.
  • Koʻp vazifali va uzoq muddatli ishlar hali ham kattaroq modellarni, shu jumladan SmolVLA'ning oʻz 2.25 B variantini afzal koʻradi.

Oʻtkazishga arziydigan taqqoslash TinyVLA'ni SmolVLA'ga qarshi emas. Bu SmolVLA'ni ACT sizning oʻz vazifangizda, va SmolVLA maqolasi buning sababini tushuntiradi. Robototexnika boʻyicha oldindan oʻqitishsiz yagona vazifada oʻqitilgan SmolVLA uchta SO-100 vazifasida oʻrtacha 40.0 ball toʻpladi, yagona vazifali ACT esa 48.3 ballga erishdi. Uni 78.3 ga koʻtaradigan narsa faqat arxitektura emas, balki jamoaviy oldindan oʻqitish va koʻp vazifali oʻqitishdir. SO-101 lego vazifasida, ikkalasi ham yagona vazifali boʻlib, SmolVLA gʻalaba qozonadi: tarqatishda 70 ga qarshi 90. Keyin SmolVLA'ni Pi0.5 agar byudjet imkon bersa.

Bu hajmda ma'lumotlar to'plami natijani hal qiladi

Yomon ma'lumotlarni qoplash uchun kamroq oldindan o'qitish mavjud, shuning uchun nuqsonli ma'lumotlar to'plamidagi toza yo'qotish egri chizig'i nuqsonni ishonchli tarzda takrorlaydigan siyosatni beradi. lerobot hujjatlari tuzilish haqida aniq: 5 ta kub pozitsiyasida 50 ta epizod, har bir pozitsiyada 10 tadan, ishladi; 25 tasi ishlamadi. Agar yo'qotish yaxshi ko'rinsa va qo'l hech qanday foydali ish qilmasa, quyidagilardan boshlang: yo'qotish tushadi, siyosat hech narsa qilmaydi, siyosat faqat bitta sozlamada ishlaydi yoki haqiqatda foydalanish mumkin bo'lgan VLA o'quv ma'lumotlarini yig'ish.

Besh siyosat, bitta taqqoslash jadvali

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT haqiqiy parametrlar soni, har bir harakat bosqichi uchun xulosa chiqarish kechikishi, har biriga kerak bo'ladigan GPU darajasi va foydali ish qilishdan oldingi minimal epizodlar soni bilan.

Siyosatlarni taqqoslang

Siz harakat qilishingiz mumkin bo'lgan qarorlar jadvali

Sizning vaziyatingizBoshlangNima uchun
Bitta vazifa, yaxshi namoyishlar, til yo'qACT~80 M, 20 ms, 24 GB karta, yuklab olish uchun asosiy model yo'q
Bir nechta bog'liq vazifalar, har biriga bitta ko'rsatmaSmolVLA450 M, lerobotda, minimal 30 epizod, har bir ish uchun 1 dan 3 USD gacha
TinyVLA natijasini aniq takrorlashTinyVLA-B yoki TinyVLA-HRepo yagona yo'l: izolyatsiya qilingan muhit, konvertatsiya qilingan ma'lumotlar
Ko'p vazifali, turli ko'rsatmalar, A100 byudjetiGR00T N1.7 yoki Pi0.5~3 B, har bir qadam uchun 152 ms va 485 ms, har bir ish uchun 4 dan 12 USD gacha
Hali robot yo'qHaqiqiy qo'lni boshqaringNavbatga asoslangan jonli qo'l ro'yxatdan o'tishni va apparat vositalarini talab qilmaydi

Oxirgi qator uchun, jonli qo'l brauzerdan hisobsiz boshqarishingiz mumkin bo'lgan jismoniy SO-100 ni uzatadi va boshlashning uchta usuli qolganini qamrab oladi. SO-100 bu yerda mos yozuv qo'li bo'lib, qismlari taxminan 110 dan 150 Yevrogacha, to'liq sozlash qo'llanmasi.

1 milliarddan kichik modellardan keyin nima keladi

Parametrlar sonini kamaytirish VLA ni arzon qilishning bir usuli bo'lib, bu aniq g'olibona usul emas. OpenVLA-OFT (arXiv 2502.19645) 7 milliardlik asosni saqlab qoladi va faqat harakatlar qanday dekodlanishini o'zgartiradi, harakatlarni yaratish samaradorligining 26 barobar oshganini va LIBERO ning 76.5 dan 97.1 foizgacha ko'tarilganini xabar qiladi. BitVLA (arXiv 2506.07530) 1-bitli BitNet b1.58 2B4T asosining har bir og'irligini uchlikka aylantiradi, 11.0 barobar kam xotira va 4.4 barobar past yakuniy kechikishni xabar qiladi, shu bilan birga to'liq aniqlikdagi OpenVLA-OFT ga mos keladi. X-VLA-0.9B (arXiv 2510.10274) oqim moslashuvi bilan 1 milliardlik chiziqda joylashgan.

Umumiy mavzu: kechikish til modelida emas, balki harakat dekoderida yashaydi. Qancha parametrga ega ekanligini so'rashdan oldin, siyosat harakatlarni qanday chiqarishini so'rang. arena 85 ta model va 332 ta natijaga ega, ularning har biri o'z manbasiga bog'langan; kengroq umumiy ko'rinish bizning VLA ga kirishimiz.

SmolVLA'ni RTX 4090'da nozik sozlashim mumkinmi?

Ha. SmolVLA 450 M parametrga ega va AY-Robots uni RTX 4090 / 24 GB darajasida ishga tushiradi. lerobot misoli --batch_size=64 dan foydalanadi, bu sizning kartangiz uchun kafolat emas, balki misoldir; hujjatlarda yuklash vaqtlari qisqa bo'lib qolishi uchun kichikdan boshlash va oshirish tavsiya etiladi. A100 da 20000 qadam uchun hujjatlarda keltirilgan taxminan 4 soatdan ko'proq vaqt kutishingiz kerak.

TinyVLA lerobot'da yoki AY-Robots'da mavjudmi?

Ikkalasi ham yo'q. TinyVLA faqat o'zining tadqiqot omborida mavjud, oxirgi kommit 2025 yil 11 martda qilingan va uning formati LeRobot emas, balki ACT-uslubidagi HDF5. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA va ACT'ni o'rgatadi. Agar TinyVLA'ni xohlasangiz, uni o'zingiz yaratishingiz kerak bo'ladi va avval scripts/train.sh dagi DeepSpeed konfiguratsiya yo'lini tuzatishingiz kerak bo'ladi.

450 M model haqiqatan ham 3 B model bilan raqobatlasha oladimi?

Mualliflarning o'z benchmarklariga ko'ra, ha: LIBERO'da 87.3 ga qarshi 86.0, robototexnika bo'yicha oldindan o'qitilgan 3.3 B Pi0 ga nisbatan, va uchta haqiqiy SO-100 vazifasida 78.3 ga qarshi 61.7, bu yerda xuddi shu maqola Pi0'ni 3.5 B deb belgilaydi. Cheklov xuddi shu maqolada: robototexnika bo'yicha oldindan o'qitishsiz yagona vazifa, SmolVLA 40.0 ga tushadi, ACT'ning 48.3 dan past.

Kichik VLA biror narsa qilishidan oldin qancha epizod kerak?

AY-Robots SmolVLA uchun minimal 30 epizod va ACT uchun minimal 50 epizod belgilaydi. lerobot hujjatlari taxminan 50 ta tavsiya qiladi va 25 ta xuddi shu vazifa uchun yetarli emasligini xabar qiladi. Tuzilma soni kabi muhim: maqoladagi to'plam har biri 10 epizoddan iborat 5 ta kub pozitsiyasidan foydalangan.

Nima uchun e'lon qilingan kechikish raqamlari bunchalik farq qiladi?

Ular turli narsalarni o'lchaydilar. TinyVLA A6000 da har bir harakatni bashorat qilish uchun 14 ms ni xabar qiladi; AY-Robots SmolVLA'ni har bir harakat bosqichi uchun 245 ms va ACT'ni 20 ms deb ko'rsatadi. Ba'zi raqamlar bitta oldinga o'tishni qamrab oladi, ba'zilari o'tishni 50 harakatli bo'lakka bo'ladi va deyarli hech biri kamera suratga olish yoki servolarga yozishni o'z ichiga olmaydi.

Bulutli inferensiya GPU muammosini hal qiladimi?

Qisman. AY-Robots siyosatni ta'minlaydigan podni avtomatik ravishda ta'minlaydi, shu bilan birga mahalliy mijoz ushbu nuqta bilan bog'lanadi, bo'sh turgan kuzatuvchi bilan, shuning uchun u jim hisob-kitob qilish o'rniga o'zini yo'q qiladi. U ommaviy internetdagi borib-kelishni olib tashlay olmaydi va boshqaruv tsikli har bir harakat bosqichi uchun allaqachon 20 dan 485 ms gacha. Sekin tanlash va joylashtirish uchun yaxshi, ammo tez reaktiv harakat uchun emas.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started