Tabela poređenja politika AY-Robots sa brojem parametara, nivoima GPU-a i latencijom inferencije za GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT
SmolVLATinyVLAMali VLAPotrošački GPULeRobot

Mali VLA Modeli: TinyVLA, SmolVLA i slučaj ispod 1B

AY-Robots ResearchAugust 23, 202619 min čitanja

TinyVLA i SmolVLA stavljaju funkcionalni VLA ispod 1 milijarde parametara. Stvarni brojevi iz oba rada, zadane postavke lerobota, izmjerena latencija i koliko košta pokretanje na kartici od 24 GB.

Gotovo svaki model vizije-jezika-akcije o kojem se piše pretpostavlja karticu podatkovnog centra. OpenVLA ima 7 milijardi parametara. GR00T N1.7 i Pi0.5 imaju oko 3 milijarde parametara i zahtijevaju A100 80 GB za fino podešavanje. Ako je kartica na vašem stolu 4090, ta klasa modela je izvan dosega.

Dva rada tvrde da vam to ne treba. TinyVLA (arXiv 2409.12514, prihvaćen od strane IEEE Robotics and Automation Letters u veljači 2025.) gradi VLA od okosnice od 400 milijuna do 1.3 milijarde parametara plus glavu za difuzijsku akciju. SmolVLA (arXiv 2506.01844, predan 2. lipnja 2025.) isporučuje 450 milijuna parametara s otvorenim težinama, otvorenim podacima i skriptom koja se pokreće na jednoj potrošačkoj kartici. Evo što su oba izmjerila i gdje argument o manje od 1 milijarde prestaje vrijediti.

Što trebate znati

  • TinyVLA dolazi u tri veličine: ukupno 422 milijuna s 101 milijunom za treniranje, 740 milijuna s 138 milijuna, 1.3 milijarde s 143 milijuna. Samo prve dvije su ispod 1 milijarde.
  • Njegova Tablica IV mjeri 14 ms po predviđanju akcije za TinyVLA-1B na jednoj A6000, u usporedbi s 292 ms za OpenVLA-7B i 140 ms za smanjeni OpenVLA-1B.
  • Glava održava tu brzinu, a ne okosnica: zamijenite difuzijsku glavu TinyVLA-H s ACT glavom i pet zadataka stvarnih robota padaju s prosjeka od 94.0 na jednoznamenkaste brojeve. MLP glava postiže 0 svugdje.
  • SmolVLA ima 450 milijuna parametara, od čega je otprilike 100 milijuna stručnjak za akciju, prethodno obučen na 481 skupu podataka zajednice LeRobot i 10.6 milijuna okvira. Izvještava 87.3 na LIBERO-u u usporedbi s 86.0 za Pi0 obučen za robotiku s 3.3 milijarde parametara, i 78.3 na tri stvarna SO-100 zadatka u usporedbi s 61.7 za Pi0 s 3.5 milijardi parametara.
  • Obučen za jedan zadatak bez tog prethodnog treninga, SmolVLA pada na 40.0 na tim zadacima, ispod ACT-ovih 48.3. Malo nije automatski lako.
  • TinyVLA nema integraciju s LeRobotom i koristi CUDA 11.7 wheel stack. SmolVLA je u lerobotu i košta otprilike 1 do 3 USD po pokretanju na 24 GB razini ovdje.

Što se zapravo smatra malim VLA-om

Broj parametara na kartici modela nije jedan broj. Može značiti ukupne težine, težine učitane tokom inferencije, ili težine koje primaju gradijente tokom . TinyVLA izvještava o oba, a razlika je velika: TinyVLA-H ima ukupno 1.3 B, ali 143 M je trenabilno, jer vizuelni toranj i većina jezičkog modela ostaju zamrznuti dok se LoRA adapteri i akciona glava pomjeraju. Rad navodi da je trenabilni udio oko 5 posto.

ModelParametriOkosnicaAkciona glavaIzvor
TinyVLA-S422 M ukupno, 101 M trenabilnoLlava-Pythia ~400 MDifuzija (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M ukupno, 138 M trenabilnoLlava-Pythia ~700 MDifuzijaarXiv 2409.12514
TinyVLA-H1.3 B ukupno, 143 M trenabilnoLlava-Pythia ~1.3 BDifuzijaarXiv 2409.12514
SmolVLA450 M, ~100 M akcioni ekspertSmolVLM2-500M-Video-InstructEkspert za podudaranje tokaarXiv 2506.01844
Octo-Small27 MViT-S skala, T5-Base tekstualni enkoderDifuzijaocto-small-1.5 card
ACT~80 MResNet, bez jezičkog modelaDirektna regresija segmenataAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 i SigLIP enkoderiAutoregresivni akcioni tokeniarXiv 2406.09246

Dvije stavke su vrijedne rasprave. sa otprilike 80 M je manji od svega ostalog ovdje, ali nema jezički model, tako da nije VLA: uči jedan zadatak i ne može mu se reći da radi drugi. sa 27 M je uslovljen preko T5-Base tekstualnog enkodera, a ne LLM okosnice. Dobre bazne linije, nijedna vam ne pruža praćenje instrukcija koje naziv implicira.

Granica od 1 B je proizvoljna

TinyVLA-H, varijanta koja donosi glavne rezultate, ima 1.3 B i nalazi se iznad te granice. Bolje pitanje je da li model stane u 24 GB tokom treninga i postiže vašu kontrolnu stopu tokom inferencije. Pet politika koje ovdje možete trenirati nalaze se na stranici politika; TinyVLA ima unos u areni ako želite njegove brojeve pored svih ostalih.

TinyVLA: brzina dolazi od glave, ne od okosnice

Očigledno tumačenje je da su smanjili jezički model, pa je postao brži. Ablacija u radu govori suprotno. Zamena OpenVLA-ove okosnice od 7 B za onu od otprilike 1 B smanjila je predviđanje po akciji sa 292 ms na 140 ms, što je dvostruko poboljšanje. TinyVLA-H, sa uporedivim brojem parametara, radi na 14 ms na istoj kartici. Ostalo 10x je akciona glava.

ModelPredviđanje po akcijiIzmereno na
OpenVLA-7B292 msjedan A6000
OpenVLA-1B, okosnica zamenjena TinyVLA-ovom140 msjedan A6000
TinyVLA-1B (TinyVLA-H)14 msjedan A6000

OpenVLA emituje akcije kao diskretizovane tokene kroz glavu jezičkog modela, po jedan za svaku dimenziju akcije, autoregresivno. TinyVLA priključuje difuzioni dekoder koji proizvodi ceo segment u jednom potezu. Tabela V prikazuje arhitekturu TinyVLA-H i menja samo glavu, na istih pet zadataka sa stvarnim robotima. To je najčistiji dokaz u oba rada za argument usklađivanje toka, koji politike stvaraju, i razlog zašto Pi0 se udaljio od dekodiranja tokena.

Glava na TinyVLA-HPlaceTennisFlipMugStackCubesCloseDrawerOpenBox
Difuzija (droid_diffusion)90.098.398.396.786.7
Transformator za segmentiranje akcija13.38.38.313.323.3
Višeslojni perceptron00000
Šta pokrivaju brojevi TinyVLA

Brojke od 292 / 140 / 14 ms su iz Tabele IV, sve na jednom A6000. One su po predviđanju akcije i isključuju snimanje kamerom, predobradu i serijski zapis na servo motore. Objavljenu latenciju tretirajte kao donju granicu, nikada kao kontrolnu brzinu. Naši vlastiti brojevi nose isto ograničenje: pogledajte latencija inferencije.

Šta je TinyVLA postigao

MjeriloProtokolTinyVLA-HOsnovne linije
MetaWorld, 50 zadataka, simulacijaVišezadaćno, 50 demonstracija, 3 sjemena77.6 / 21.5 / 11.4 / 15.8 po težini, prosjek 31.6Diffusion Policy prosjek 10.5
Pravi Franka Panda, 5 zadataka100 putanja po zadatku, 20 pokušaja94.0 prosjekOpenVLA 68.3, Diffusion Policy 35.3
Bimanualni UR5, 3 zadatkaVišezadaćno, 10 pokušaja po zadatku76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Bimanualni red ima dosadno objašnjenje koje sam rad daje: OpenVLA je predtreniran na Open X-Embodimentu, koji se u potpunosti sastoji od podataka s jednom rukom, tako da je prostor akcija s dvije ruke izvan distribucije i postiže nulu. Osnovna linija difuzijske politike nadmašuje TinyVLA-H na dva od ta tri zadatka. Pozadina u članku o Open X-Embodimentu.

AY-Robots arena ljestvica, tablica s mogućnošću sortiranja od 85 VLA modela s 332 rezultata referentnih vrijednosti, svaka vrijednost povezana s radom ili karticom modela iz koje je potekla
Brojevi referentnih vrijednosti među modelima usporedivi su samo kada možete vidjeti odakle je svaki došao.

TinyVLA repozitorij, od kolovoza 2026.

Rad je dobar. Kod je istraživački ispad. Repozitorij je github.com/liyaxuanliyaxuan/TinyVLA; njegov README datira izdanje koda na 17. veljače 2025., a zadnji commit je 11. ožujka 2025. Dobro za reprodukciju rada, problem ako ste željeli održavanu biblioteku.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Sekvenca instalacije iz TinyVLA README-a, provjerena u odnosu na repozitorijum 2026-08-23.
Fiksirane zavisnosti su zamka koja pojede dan

requirements.txt fiksira torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, i CUDA stack na 11.x wheelse: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README traži Python 3.10; lerobot 0.6.1 zahtijeva 3.12 ili noviji, tako da se ova dva ne mogu dijeliti u istom okruženju. Prvo potvrdite da postoji torch 2.0.1 build za vašu generaciju GPU-a. Ako se pokretanje prekine zbog VRAM-a, lista za provjeru nedostatka memorije je brža od nagađanja.

TinyVLA također ne čita LeRobot skupove podataka. Njegov format je HDF5 u ACT stilu: akcija, language_raw, i grupa zapažanja sa slikama iz više pogleda, joint_positions, qpos i qvel. Repozitorijum isporučuje data_utils/rlds_to_h5py.py za RLDS ulaz, a svaki zadatak je ručno registrovan u aloha_scripts/constants.py sa svojim dataset_dir, episode_len i camera_names. Ako su vaše epizode došle iz lerobota ili desktop klijenta, vi ste odgovorni za konverziju.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Skraćeno iz scripts/train.sh. Svaka zastavica i vrijednost iznad nalaze se u isporučenoj datoteci.
  • --num_gpus=8 pretpostavlja čvor sa osam kartica. Postavite ga na 1 i smanjite veličinu paketa znatno ispod 32. Nijedna varijanta sa jednim GPU-om ne isporučuje se uzvodno, tako da se komanda ne može pokrenuti doslovno na 4090.
  • --deepspeed scripts/zero2.json ukazuje na datoteku koja se ne nalazi u direktorijumu scripts najvišeg nivoa. DeepSpeed konfiguracije se isporučuju na llava-pythia/scripts/zero2.json. Popravite putanju pre prvog pokretanja.
  • README zahteva da naziv izlaznog direktorijuma sadrži llava_pythia, plus lora ako je LoRA omogućena.
  • Okosnica je zasebno preuzimanje: lesjie/Llava-Pythia-400M, -700M ili -1.3B. Ne postoji jedna osnovna kontrolna tačka na koju usmeravate politiku na način na koji usmeravate na lerobot/smolvla_base.

SmolVLA: model ispod 1 B koji možete pokrenuti danas popodne

SmolVLA iznosi isti argument unutar održavane biblioteke. Ima 450 M parametara na SmolVLM2-500M-Video-Instruct okosnici, a efikasnost dolazi od postavki koje možete pročitati iz configuration_smolvla.py, a ne od tvrdnje da je mali.

Postavka u configuration_smolvla.pyPodrazumevanoŠta donosi
num_vlm_layers16Samo prvih 16 slojeva jezičkog modela se pokreće
expert_width_multiplier0.75Skrivena veličina eksperta za akcije je 75 posto VLM-a
self_attn_every_n_layers2Samo-pažnja isprepletena sa unakrsnom pažnjom
chunk_size / n_action_steps50 / 50Jedan prolaz emituje 50 akcija i svih 50 se izvršava
num_steps10Denoising usklađivanja toka fiksiran na 10 koraka
tokenizer_max_length48Instrukcija je skraćena na 48 tokena
freeze_vision_encoder / train_expert_onlyTrue / TrueFino podešavanje pomera eksperta, a ne vizuelni toranj
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Nije recept iz rada: njegovo predtreniranje je koristilo zagrevanje od 100 koraka tokom 200000 koraka

Pretrenaža je koristila 481 LeRobot skup podataka iz zajednice, 22.9 K epizoda i 10.6 M okvira na 4 GPU-a, 200000 koraka sa globalnom serijom od 256; rad procjenjuje cijeli projekat na oko 30 K GPU sati. Jedan broj za praćenje: blog o pokretanju Hugging Face-a navodi 487 kuriranih skupova podataka, dok tabela u radu navodi 481. Koristimo brojku iz rada i bilježimo neslaganje.

MjeriloSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO prosjek, više zadataka87.388.7586.0 (3.3 B, pretrenirano za robotiku)-
Meta-World prosjek, više zadataka57.368.2447.9 (3.5 B, pretrenirano za robotiku)-
Stvarni SO-100, 3 zadatka, obuka za više zadataka78.3-61.7 (3.5 B)-
Stvarni SO-100, 3 zadatka, jedan zadatak, bez pretrenaže za robotiku40.0--48.3
SO-101 slaganje lego kockica, jedan zadatak, unutar distribucije90--70
SO-101 slaganje lego kockica, jedan zadatak, izvan distribucije50--40
Pročitajte cijelu tabelu, ne samo naslovni red

LIBERO je simulacija i sve kompetentno tamo sada postiže rezultate u osamdesetim. Red za stvarni SO-100, gdje model od 450 M pobjeđuje model od 3.5 B za 16.6 poena, je zanimljiv; red ispod njega je protuteža. Uklonite pretrenažu zajednice i obuku za više zadataka i isti model pada na 40.0, ispod ACT-a. Odbrambena tvrdnja je da mali model nije automatski lošiji, a ne da je bolji.

Jedna slučajnost pomaže: tabela Meta-World iz SmolVLA rada sadrži objavljene brojeve TinyVLA kao osnovu, tako da po prvi put oba modela stoje u jednoj tabeli, SmolVLA-0.45B na 57.3 naspram TinyVLA-H na 31.6. Takođe se navodi da je obuka SmolVLA oko 40 posto brža od Pi0 uz 6 puta manje memorije. Sve to dolazi od autora SmolVLA; unos u arenu povezuje svaku vrednost sa njenim izvorom.

Gdje SmolVLA provodi svoje vrijeme

AY-Robots navodi SmolVLA na 245 ms po koraku akcije i ACT na 20 ms u katalogu politika. TinyVLA izveštava 14 ms po predviđanju akcije. Ti brojevi nisu uporedivi, a tretiranje kao da jesu je najčešća greška u ovoj temi: neki mere jedan prolaz unapred, neki dele taj prolaz kroz deo kada se grupisanje akcija amortizuje.

  • SmolVLA emituje 50 akcija po prolazu unapred i izvršava svih 50. Pri 30 fps koje rad koristi na stvarnim robotima, jedno zaključivanje pokriva oko 1.7 sekundi kretanja.
  • Asinhrono zaključivanje izračunava sledeći deo dok se trenutni još uvek izvršava: 9.7 s prosečno vreme završetka zadatka naspram 13.75 s sinhronog, otprilike 30 posto brže, i 19 ciklusa uzimanja i postavljanja u fiksnom prozoru od 60 sekundi naspram 9.
  • Stope uspešnosti su bile uporedive, a ne bolje, 78.3 sinhrono naspram 73.3 asinhrono. Asinhronost kupuje propusnost, ne tačnost.
  • Grupisanje skriva latenciju računanja, a ne latenciju mreže, i čini politiku manje reaktivnom jer je posvećena 50 akcijama.
Daljinsko zaključivanje nije besplatno, i nijedna platforma ne popravlja fiziku

AY-Robots može automatski obezbijediti cloud GPU pod koji služi vašoj politici dok lokalni klijent robota komunicira sa tom krajnjom tačkom, a pod sadrži nadzornika neaktivnosti (idle watchdog) tako da se sam uništava umjesto da tiho naplaćuje. Ono što ne radi je uklanjanje povratnog putovanja preko javnog interneta. Kontrolna petlja kroz pet politika ovdje je 20 do 485 ms po koraku akcije prije bilo kakve mreže, tako da je daljinsko zaključivanje izvodljivo za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje.

Tabela poređenja politika AY-Robots koja prikazuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT sa brojem parametara, potrebnim nivoom GPU-a, kašnjenjem zaključivanja po koraku akcije i minimalnim brojem epizoda koje svaka zahtijeva
SmolVLA sa ~450 M i ACT sa ~80 M su dva koja staju na karticu od 24 GB. Ostala tri zahtijevaju A100 ili H100 80 GB.

Fino podešavanje SmolVLA na jednoj potrošačkoj kartici

Ručna putanja, na lerobot 0.6.1, trenutnom PyPI izdanju od 23. avgusta 2026. Sve ispod dolazi iz Hugging Face lerobot SmolVLA dokumentacije, preuzete istog dana; vođena verzija je nježnija.

  1. 1
    Instalirajte lerobot sa smolvla dodatkom

    Zavisnosti SmolVLA su opcioni dodatak, nisu dio osnovne instalacije. Instaliranje bez njih, a zatim čuđenje zašto je tip politike nepoznat, često je izgubljenih pola sata.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Nabavite skup podataka sa dovoljno epizoda

    Dokumentacija preporučuje oko 50 epizoda i navodi da ista zadaća sa 25 nije bila dovoljna. AY-Robots postavlja minimum na 30. Snimite svoje, ili počnite iz direktorijuma skupova podataka.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Pokrenite fino podešavanje

    Komanda iz lerobot vodiča, neizmijenjena. Dokumentacija navodi 20000 koraka kao otprilike 4 sata na jednoj A100. Na kartici od 24 GB, očekujte duže i izmjerite.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Smanjite veličinu paketa dok ne stane

    batch_size=64 je dokumentovani primjer, a ne obećanje o vašoj kartici. Dokumentacija savjetuje da počnete sa malim vrijednostima i povećavate dok vremena učitavanja ostaju kratka.

    bash
    lerobot-train --help
  5. 5
    Pokrenite kontrolnu tačku na ruci

    Ista biblioteka, jedna komanda. Zastavice za chunking u realnom vremenu su komentarisane u dokumentaciji i one su za koje treba posegnuti na hardveru niske snage.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Kontrolna tačka je isporučiva

Kojim god putem krenuli, završavate sa kontrolnom tačkom plus konfiguracijom koja ju je proizvela. Držite reviziju skupa podataka, broj koraka i sjeme pored nje. lerobot podrazumijeva sjeme 1000; GR00T-ova ulazna tačka za fino podešavanje uopšte ne izlaže sjeme, tako da ti pokreti nisu bit-za-bit reproduktivni. Mehanika u dokumentaciji za obuku.

Dva načina da se mali VLA postavi na ruku

Vi posjedujete mašinu i načine kvara. Za SmolVLA to je razumno: jedan pip dodatak, jedna komanda za obuku, jedna komanda za pokretanje. Za TinyVLA to je reprodukcija istraživanja sa zamrznutim pinovima, pokvarenom DeepSpeed putanjom i konverzijom podataka koju sami pišete.

  1. Nabavite karticu od 24 GB, snimite 30 do 50 epizoda, provjerite tokove kamere kadar po kadar.
  2. pip install -e ".[smolvla]", lerobot-train protiv lerobot/smolvla_base, zatim poslužite kontrolnu tačku na mašini u koju je ruka priključena.
  3. Za TinyVLA: odvojeno conda okruženje, konvertujte podatke u HDF5, registrujte zadatak u constants.py, popravite zero2.json putanju, smanjite train.sh sa osam GPU-a na jedan.
Prednosti
  • Nema naplate po satu kada se kartica plati.
  • Inferencija se nalazi pored servoa, jedini način da se dobije brza kontrolna petlja.
  • Možete zakrpiti kod politike, a TinyVLA je dostupan samo na ovaj način.
Kompromisi
  • 4090 isključuje svaku ~3 B politiku, tako da nema lokalnog poređenja sa GR00T N1.7 ili Pi0.5.
  • Postavljanje okruženja je pravi posao. Samo TinyVLA pinovi mogu koštati dan.
  • Nema reda čekanja, nema ponovnog pokušaja, nema skladištenja kontrolnih tačaka. Ponovno pokretanje na koraku 14000 znači ponovno počinjanje.

Kada je mali model pogrešan izbor

Oba rada su ovdje pažljivija nego što su sažeci. Analiza grešaka TinyVLA-a je specifična: varijanta od 0.4 B je tri puta pogriješila pogrešno tumačeći instrukciju, što autori pripisuju ograničenom razumijevanju jezika u manjem VLM-u, a taj način rada je nestao kod 1.3 B. SmolVLA pokazuje istu krivulju s drugog kraja: verzija identične arhitekture od 2.25 B postiže 88.75 na LIBERO-u i 68.24 na Meta-World-u, naspram 87.3 i 57.3 za model od 0.45 B.

Odabir VLA-a ispod 1 B
Gdje pobjeđuje
  • Stane na karticu od 24 GB, što smanjuje trošak eksperimenta s desetaka dolara na nekoliko.
  • Dovoljno brz za rad pored ruke, tako da nema mrežnog skoka u kontrolnoj petlji.
  • Fino se podešava na podacima koje jedna osoba može snimiti, deseci epizoda umjesto tisuća.
  • Težine, popis podataka i kod SmolVLA-a su javni, tako da se loš rezultat može otkloniti.
Gdje gubi
  • Slabije praćenje instrukcija: manje jezičnih parametara, manja sposobnost razdvajanja sličnih referentnih izraza.
  • Manja prostorna i vizualna generalizacija na postavke koje niste snimili.
  • Osjetljiviji na nedostatke u skupu podataka, s manje prethodnog predtreniranja na koje se može osloniti.
  • Višezadaćni rad i rad s dugim horizontom i dalje favoriziraju veće modele, uključujući vlastitu varijantu SmolVLA-a od 2.25 B.

Usporedba koju vrijedi provesti nije TinyVLA protiv SmolVLA-a. To je SmolVLA protiv ACT na vašem vlastitom zadatku, a rad SmolVLA-a je argument zašto. Treniran za jedan zadatak bez predtreniranja robotike, SmolVLA je postigao prosjek od 40.0 na tri SO-100 zadatka gdje je ACT za jedan zadatak postigao 48.3. Ono što ga podiže na 78.3 je predtreniranje zajednice plus višezadaćno treniranje, a ne samo arhitektura. Na SO-101 lego zadatku, oba za jedan zadatak, SmolVLA pobjeđuje: 90 protiv 70 u distribuciji. Zatim SmolVLA protiv Pi0.5 ako budžet dopušta.

Na ovoj veličini, skup podataka odlučuje o ishodu

Manje je predobuke za pokrivanje loših podataka, tako da čista kriva gubitka na neispravnom skupu podataka daje politiku koja pouzdano reprodukuje defekt. Dokumentacija lerobota je direktna o strukturi: 50 epizoda preko 5 pozicija kocke, 10 po poziciji, radilo je; 25 nije. Ako gubitak izgleda dobro, a ruka ne radi ništa korisno, počnite od gubitak pada, politika ne radi ništa, politika radi samo u jednom podešavanju ili prikupljanja VLA podataka za obuku koji su zaista upotrebljivi.

Pet politika, jedna tabela poređenja

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT sa stvarnim brojem parametara, kašnjenjem inferencije po koraku akcije, nivoom GPU-a koji je svakom potreban i minimalnim brojem epizoda prije nego što uradi nešto korisno.

Uporedite politike

Tabela odluka na osnovu koje možete djelovati

Vaša situacijaPočnite saZašto
Jedan zadatak, dobre demonstracije, bez jezikaACT~80 M, 20 ms, 24 GB kartica, nema osnovnog modela za preuzimanje
Nekoliko povezanih zadataka, po jedna instrukcijaSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
Specifično reprodukovanje TinyVLA rezultataTinyVLA-B or TinyVLA-HRepozitorijum je jedini put: izolovano okruženje, konvertovani podaci
Više zadataka, raznovrsne instrukcije, A100 budžetGR00T N1.7 or Pi0.5~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run
Još nema robotaUpravljajte pravom rukomŽiva ruka bazirana na redu čekanja ne zahtijeva registraciju i hardver

Za posljednji red, živa ruka prenosi fizički SO-100 kojim možete upravljati iz preglednika bez računa, a tri načina za početak pokriva ostalo. SO-100 je referentna ruka ovdje, otprilike 110 do 150 EUR u dijelovima, sa potpunim vodičem za postavljanje.

Što dolazi nakon modela ispod 1 B

Smanjenje broja parametara je jedan od načina da se VLA učini jeftinim i ne nužno pobjedničkim. OpenVLA-OFT (arXiv 2502.19645) zadržava 7 B okosnicu i mijenja samo način dekodiranja akcija, izvještavajući o 26x povećanju propusnosti generiranja akcija i porastu LIBERO-a sa 76.5 na 97.1 posto. BitVLA (arXiv 2506.07530) čini svaku težinu 1-bitne BitNet b1.58 2B4T okosnice ternarnom, izvještavajući o 11.0x manjoj memoriji i 4.4x manjoj latenciji od kraja do kraja, dok se podudara s punopreciznim OpenVLA-OFT-om. X-VLA-0.9B (arXiv 2510.10274) nalazi se na liniji od 1 B s podudaranjem toka.

Zajednička nit: dekoder akcija, a ne jezični model, je mjesto gdje se nalazi latencija. Pitajte kako politika emitira akcije prije nego što pitate koliko parametara ima. Arena ima 85 modela i 332 rezultata, svaki povezan sa svojim izvorom; širi pregled nalazi se u našem VLA uvodu.

Mogu li fino podesiti SmolVLA na RTX 4090?

Da. SmolVLA ima 450 M parametara i AY-Robots ga pokreće na RTX 4090 / 24 GB nivou. lerobot primjer koristi --batch_size=64, što je primjer, a ne garancija za vašu karticu; dokumentacija savjetuje da počnete s malim i povećavate dok vremena učitavanja ostaju kratka. Očekujte duže od otprilike 4 sata koje dokumentacija navodi za 20000 koraka na A100.

Je li TinyVLA dostupan u lerobotu ili na AY-Robots?

Ne za oboje. TinyVLA postoji samo u svom istraživačkom repozitorijumu, posljednji commit 11. marta 2025., a njegov format je HDF5 u ACT stilu, a ne LeRobot. AY-Robots trenira GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT. Ako želite TinyVLA, morate ga sami izgraditi, i prvo ćete morati popraviti DeepSpeed config putanju u scripts/train.sh.

Je li model od 450 M zaista konkurentan onom od 3 B?

Prema vlastitim mjerilima autora, da: 87.3 naspram 86.0 na LIBERO-u u odnosu na Pi0 prethodno obučen za robotiku sa 3.3 B, i 78.3 naspram 61.7 na tri stvarna SO-100 zadatka gdje isti rad označava Pi0 sa 3.5 B. Ograničenje je u istom radu: za jedan zadatak bez prethodne obuke za robotiku, SmolVLA pada na 40.0, ispod ACT-ovih 48.3.

Koliko epizoda mi je potrebno prije nego što mali VLA išta uradi?

AY-Robots postavlja minimum za SmolVLA na 30 epizoda, a za ACT na 50. lerobot dokumentacija preporučuje oko 50 i izvještava da 25 nije bilo dovoljno za isti zadatak. Struktura je jednako važna kao i broj: skup u radu koristio je 5 pozicija kocke sa po 10 epizoda.

Zašto se objavljeni brojevi latencije toliko razlikuju?

Mjere različite stvari. TinyVLA izvještava 14 ms po predviđanju akcije na A6000; AY-Robots navodi SmolVLA na 245 ms i ACT na 20 ms po koraku akcije. Neke brojke pokrivaju jedan prolaz naprijed, neke dijele prolaz preko bloka od 50 akcija, a gotovo nijedna ne uključuje snimanje kamerom ili pisanje na servo motore.

Rješava li zaključivanje u oblaku problem sa GPU-om?

Djelimično. AY-Robots automatski obezbjeđuje pod koji služi politiku dok lokalni klijent komunicira s tom krajnjom tačkom, sa idle watchdogom tako da se sam uništava umjesto da tiho naplaćuje. Ne može ukloniti povratno putovanje preko javnog interneta, a kontrolna petlja je već 20 do 485 ms po koraku akcije. Dobro za sporo uzimanje i postavljanje, ne za brzo reaktivno kretanje.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started