
TinyVLA i SmolVLA stavljaju funkcionalni VLA ispod 1 milijarde parametara. Stvarni brojevi iz oba rada, zadane postavke lerobota, izmjerena latencija i koliko košta pokretanje na kartici od 24 GB.
Gotovo svaki model vizije-jezika-akcije o kojem se piše pretpostavlja karticu podatkovnog centra. OpenVLA ima 7 milijardi parametara. GR00T N1.7 i Pi0.5 imaju oko 3 milijarde parametara i zahtijevaju A100 80 GB za fino podešavanje. Ako je kartica na vašem stolu 4090, ta klasa modela je izvan dosega.
Dva rada tvrde da vam to ne treba. TinyVLA (arXiv 2409.12514, prihvaćen od strane IEEE Robotics and Automation Letters u veljači 2025.) gradi VLA od okosnice od 400 milijuna do 1.3 milijarde parametara plus glavu za difuzijsku akciju. SmolVLA (arXiv 2506.01844, predan 2. lipnja 2025.) isporučuje 450 milijuna parametara s otvorenim težinama, otvorenim podacima i skriptom koja se pokreće na jednoj potrošačkoj kartici. Evo što su oba izmjerila i gdje argument o manje od 1 milijarde prestaje vrijediti.
Što trebate znati
- •TinyVLA dolazi u tri veličine: ukupno 422 milijuna s 101 milijunom za treniranje, 740 milijuna s 138 milijuna, 1.3 milijarde s 143 milijuna. Samo prve dvije su ispod 1 milijarde.
- •Njegova Tablica IV mjeri 14 ms po predviđanju akcije za TinyVLA-1B na jednoj A6000, u usporedbi s 292 ms za OpenVLA-7B i 140 ms za smanjeni OpenVLA-1B.
- •Glava održava tu brzinu, a ne okosnica: zamijenite difuzijsku glavu TinyVLA-H s ACT glavom i pet zadataka stvarnih robota padaju s prosjeka od 94.0 na jednoznamenkaste brojeve. MLP glava postiže 0 svugdje.
- •SmolVLA ima 450 milijuna parametara, od čega je otprilike 100 milijuna stručnjak za akciju, prethodno obučen na 481 skupu podataka zajednice LeRobot i 10.6 milijuna okvira. Izvještava 87.3 na LIBERO-u u usporedbi s 86.0 za Pi0 obučen za robotiku s 3.3 milijarde parametara, i 78.3 na tri stvarna SO-100 zadatka u usporedbi s 61.7 za Pi0 s 3.5 milijardi parametara.
- •Obučen za jedan zadatak bez tog prethodnog treninga, SmolVLA pada na 40.0 na tim zadacima, ispod ACT-ovih 48.3. Malo nije automatski lako.
- •TinyVLA nema integraciju s LeRobotom i koristi CUDA 11.7 wheel stack. SmolVLA je u lerobotu i košta otprilike 1 do 3 USD po pokretanju na 24 GB razini ovdje.
Što se zapravo smatra malim VLA-om
Broj parametara na kartici modela nije jedan broj. Može značiti ukupne težine, težine učitane tokom inferencije, ili težine koje primaju gradijente tokom . TinyVLA izvještava o oba, a razlika je velika: TinyVLA-H ima ukupno 1.3 B, ali 143 M je trenabilno, jer vizuelni toranj i većina jezičkog modela ostaju zamrznuti dok se LoRA adapteri i akciona glava pomjeraju. Rad navodi da je trenabilni udio oko 5 posto.
| Model | Parametri | Okosnica | Akciona glava | Izvor |
|---|---|---|---|---|
| TinyVLA-S | 422 M ukupno, 101 M trenabilno | Llava-Pythia ~400 M | Difuzija (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M ukupno, 138 M trenabilno | Llava-Pythia ~700 M | Difuzija | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B ukupno, 143 M trenabilno | Llava-Pythia ~1.3 B | Difuzija | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M akcioni ekspert | SmolVLM2-500M-Video-Instruct | Ekspert za podudaranje toka | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S skala, T5-Base tekstualni enkoder | Difuzija | octo-small-1.5 card |
| ACT | ~80 M | ResNet, bez jezičkog modela | Direktna regresija segmenata | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 i SigLIP enkoderi | Autoregresivni akcioni tokeni | arXiv 2406.09246 |
Dvije stavke su vrijedne rasprave. sa otprilike 80 M je manji od svega ostalog ovdje, ali nema jezički model, tako da nije VLA: uči jedan zadatak i ne može mu se reći da radi drugi. sa 27 M je uslovljen preko T5-Base tekstualnog enkodera, a ne LLM okosnice. Dobre bazne linije, nijedna vam ne pruža praćenje instrukcija koje naziv implicira.
TinyVLA-H, varijanta koja donosi glavne rezultate, ima 1.3 B i nalazi se iznad te granice. Bolje pitanje je da li model stane u 24 GB tokom treninga i postiže vašu kontrolnu stopu tokom inferencije. Pet politika koje ovdje možete trenirati nalaze se na stranici politika; TinyVLA ima unos u areni ako želite njegove brojeve pored svih ostalih.
TinyVLA: brzina dolazi od glave, ne od okosnice
Očigledno tumačenje je da su smanjili jezički model, pa je postao brži. Ablacija u radu govori suprotno. Zamena OpenVLA-ove okosnice od 7 B za onu od otprilike 1 B smanjila je predviđanje po akciji sa 292 ms na 140 ms, što je dvostruko poboljšanje. TinyVLA-H, sa uporedivim brojem parametara, radi na 14 ms na istoj kartici. Ostalo 10x je akciona glava.
| Model | Predviđanje po akciji | Izmereno na |
|---|---|---|
| OpenVLA-7B | 292 ms | jedan A6000 |
| OpenVLA-1B, okosnica zamenjena TinyVLA-ovom | 140 ms | jedan A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | jedan A6000 |
OpenVLA emituje akcije kao diskretizovane tokene kroz glavu jezičkog modela, po jedan za svaku dimenziju akcije, autoregresivno. TinyVLA priključuje difuzioni dekoder koji proizvodi ceo segment u jednom potezu. Tabela V prikazuje arhitekturu TinyVLA-H i menja samo glavu, na istih pet zadataka sa stvarnim robotima. To je najčistiji dokaz u oba rada za argument usklađivanje toka, koji politike stvaraju, i razlog zašto Pi0 se udaljio od dekodiranja tokena.
| Glava na TinyVLA-H | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Difuzija (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Transformator za segmentiranje akcija | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Višeslojni perceptron | 0 | 0 | 0 | 0 | 0 |
Brojke od 292 / 140 / 14 ms su iz Tabele IV, sve na jednom A6000. One su po predviđanju akcije i isključuju snimanje kamerom, predobradu i serijski zapis na servo motore. Objavljenu latenciju tretirajte kao donju granicu, nikada kao kontrolnu brzinu. Naši vlastiti brojevi nose isto ograničenje: pogledajte latencija inferencije.
Šta je TinyVLA postigao
| Mjerilo | Protokol | TinyVLA-H | Osnovne linije |
|---|---|---|---|
| MetaWorld, 50 zadataka, simulacija | Višezadaćno, 50 demonstracija, 3 sjemena | 77.6 / 21.5 / 11.4 / 15.8 po težini, prosjek 31.6 | Diffusion Policy prosjek 10.5 |
| Pravi Franka Panda, 5 zadataka | 100 putanja po zadatku, 20 pokušaja | 94.0 prosjek | OpenVLA 68.3, Diffusion Policy 35.3 |
| Bimanualni UR5, 3 zadatka | Višezadaćno, 10 pokušaja po zadatku | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Bimanualni red ima dosadno objašnjenje koje sam rad daje: OpenVLA je predtreniran na Open X-Embodimentu, koji se u potpunosti sastoji od podataka s jednom rukom, tako da je prostor akcija s dvije ruke izvan distribucije i postiže nulu. Osnovna linija difuzijske politike nadmašuje TinyVLA-H na dva od ta tri zadatka. Pozadina u članku o Open X-Embodimentu.

TinyVLA repozitorij, od kolovoza 2026.
Rad je dobar. Kod je istraživački ispad. Repozitorij je github.com/liyaxuanliyaxuan/TinyVLA; njegov README datira izdanje koda na 17. veljače 2025., a zadnji commit je 11. ožujka 2025. Dobro za reprodukciju rada, problem ako ste željeli održavanu biblioteku.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt fiksira torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, i CUDA stack na 11.x wheelse: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README traži Python 3.10; lerobot 0.6.1 zahtijeva 3.12 ili noviji, tako da se ova dva ne mogu dijeliti u istom okruženju. Prvo potvrdite da postoji torch 2.0.1 build za vašu generaciju GPU-a. Ako se pokretanje prekine zbog VRAM-a, lista za provjeru nedostatka memorije je brža od nagađanja.
TinyVLA također ne čita LeRobot skupove podataka. Njegov format je HDF5 u ACT stilu: akcija, language_raw, i grupa zapažanja sa slikama iz više pogleda, joint_positions, qpos i qvel. Repozitorijum isporučuje data_utils/rlds_to_h5py.py za RLDS ulaz, a svaki zadatak je ručno registrovan u aloha_scripts/constants.py sa svojim dataset_dir, episode_len i camera_names. Ako su vaše epizode došle iz lerobota ili desktop klijenta, vi ste odgovorni za konverziju.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 pretpostavlja čvor sa osam kartica. Postavite ga na 1 i smanjite veličinu paketa znatno ispod 32. Nijedna varijanta sa jednim GPU-om ne isporučuje se uzvodno, tako da se komanda ne može pokrenuti doslovno na 4090.
- --deepspeed scripts/zero2.json ukazuje na datoteku koja se ne nalazi u direktorijumu scripts najvišeg nivoa. DeepSpeed konfiguracije se isporučuju na llava-pythia/scripts/zero2.json. Popravite putanju pre prvog pokretanja.
- README zahteva da naziv izlaznog direktorijuma sadrži llava_pythia, plus lora ako je LoRA omogućena.
- Okosnica je zasebno preuzimanje: lesjie/Llava-Pythia-400M, -700M ili -1.3B. Ne postoji jedna osnovna kontrolna tačka na koju usmeravate politiku na način na koji usmeravate na lerobot/smolvla_base.
SmolVLA: model ispod 1 B koji možete pokrenuti danas popodne
SmolVLA iznosi isti argument unutar održavane biblioteke. Ima 450 M parametara na SmolVLM2-500M-Video-Instruct okosnici, a efikasnost dolazi od postavki koje možete pročitati iz configuration_smolvla.py, a ne od tvrdnje da je mali.
| Postavka u configuration_smolvla.py | Podrazumevano | Šta donosi |
|---|---|---|
| num_vlm_layers | 16 | Samo prvih 16 slojeva jezičkog modela se pokreće |
| expert_width_multiplier | 0.75 | Skrivena veličina eksperta za akcije je 75 posto VLM-a |
| self_attn_every_n_layers | 2 | Samo-pažnja isprepletena sa unakrsnom pažnjom |
| chunk_size / n_action_steps | 50 / 50 | Jedan prolaz emituje 50 akcija i svih 50 se izvršava |
| num_steps | 10 | Denoising usklađivanja toka fiksiran na 10 koraka |
| tokenizer_max_length | 48 | Instrukcija je skraćena na 48 tokena |
| freeze_vision_encoder / train_expert_only | True / True | Fino podešavanje pomera eksperta, a ne vizuelni toranj |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nije recept iz rada: njegovo predtreniranje je koristilo zagrevanje od 100 koraka tokom 200000 koraka |
Pretrenaža je koristila 481 LeRobot skup podataka iz zajednice, 22.9 K epizoda i 10.6 M okvira na 4 GPU-a, 200000 koraka sa globalnom serijom od 256; rad procjenjuje cijeli projekat na oko 30 K GPU sati. Jedan broj za praćenje: blog o pokretanju Hugging Face-a navodi 487 kuriranih skupova podataka, dok tabela u radu navodi 481. Koristimo brojku iz rada i bilježimo neslaganje.
| Mjerilo | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO prosjek, više zadataka | 87.3 | 88.75 | 86.0 (3.3 B, pretrenirano za robotiku) | - |
| Meta-World prosjek, više zadataka | 57.3 | 68.24 | 47.9 (3.5 B, pretrenirano za robotiku) | - |
| Stvarni SO-100, 3 zadatka, obuka za više zadataka | 78.3 | - | 61.7 (3.5 B) | - |
| Stvarni SO-100, 3 zadatka, jedan zadatak, bez pretrenaže za robotiku | 40.0 | - | - | 48.3 |
| SO-101 slaganje lego kockica, jedan zadatak, unutar distribucije | 90 | - | - | 70 |
| SO-101 slaganje lego kockica, jedan zadatak, izvan distribucije | 50 | - | - | 40 |
LIBERO je simulacija i sve kompetentno tamo sada postiže rezultate u osamdesetim. Red za stvarni SO-100, gdje model od 450 M pobjeđuje model od 3.5 B za 16.6 poena, je zanimljiv; red ispod njega je protuteža. Uklonite pretrenažu zajednice i obuku za više zadataka i isti model pada na 40.0, ispod ACT-a. Odbrambena tvrdnja je da mali model nije automatski lošiji, a ne da je bolji.
Jedna slučajnost pomaže: tabela Meta-World iz SmolVLA rada sadrži objavljene brojeve TinyVLA kao osnovu, tako da po prvi put oba modela stoje u jednoj tabeli, SmolVLA-0.45B na 57.3 naspram TinyVLA-H na 31.6. Takođe se navodi da je obuka SmolVLA oko 40 posto brža od Pi0 uz 6 puta manje memorije. Sve to dolazi od autora SmolVLA; unos u arenu povezuje svaku vrednost sa njenim izvorom.
Gdje SmolVLA provodi svoje vrijeme
AY-Robots navodi SmolVLA na 245 ms po koraku akcije i ACT na 20 ms u katalogu politika. TinyVLA izveštava 14 ms po predviđanju akcije. Ti brojevi nisu uporedivi, a tretiranje kao da jesu je najčešća greška u ovoj temi: neki mere jedan prolaz unapred, neki dele taj prolaz kroz deo kada se grupisanje akcija amortizuje.
- SmolVLA emituje 50 akcija po prolazu unapred i izvršava svih 50. Pri 30 fps koje rad koristi na stvarnim robotima, jedno zaključivanje pokriva oko 1.7 sekundi kretanja.
- Asinhrono zaključivanje izračunava sledeći deo dok se trenutni još uvek izvršava: 9.7 s prosečno vreme završetka zadatka naspram 13.75 s sinhronog, otprilike 30 posto brže, i 19 ciklusa uzimanja i postavljanja u fiksnom prozoru od 60 sekundi naspram 9.
- Stope uspešnosti su bile uporedive, a ne bolje, 78.3 sinhrono naspram 73.3 asinhrono. Asinhronost kupuje propusnost, ne tačnost.
- Grupisanje skriva latenciju računanja, a ne latenciju mreže, i čini politiku manje reaktivnom jer je posvećena 50 akcijama.
AY-Robots može automatski obezbijediti cloud GPU pod koji služi vašoj politici dok lokalni klijent robota komunicira sa tom krajnjom tačkom, a pod sadrži nadzornika neaktivnosti (idle watchdog) tako da se sam uništava umjesto da tiho naplaćuje. Ono što ne radi je uklanjanje povratnog putovanja preko javnog interneta. Kontrolna petlja kroz pet politika ovdje je 20 do 485 ms po koraku akcije prije bilo kakve mreže, tako da je daljinsko zaključivanje izvodljivo za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje.

Fino podešavanje SmolVLA na jednoj potrošačkoj kartici
Ručna putanja, na lerobot 0.6.1, trenutnom PyPI izdanju od 23. avgusta 2026. Sve ispod dolazi iz Hugging Face lerobot SmolVLA dokumentacije, preuzete istog dana; vođena verzija je nježnija.
- 1Instalirajte lerobot sa smolvla dodatkom
Zavisnosti SmolVLA su opcioni dodatak, nisu dio osnovne instalacije. Instaliranje bez njih, a zatim čuđenje zašto je tip politike nepoznat, često je izgubljenih pola sata.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Nabavite skup podataka sa dovoljno epizoda
Dokumentacija preporučuje oko 50 epizoda i navodi da ista zadaća sa 25 nije bila dovoljna. AY-Robots postavlja minimum na 30. Snimite svoje, ili počnite iz direktorijuma skupova podataka.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Pokrenite fino podešavanje
Komanda iz lerobot vodiča, neizmijenjena. Dokumentacija navodi 20000 koraka kao otprilike 4 sata na jednoj A100. Na kartici od 24 GB, očekujte duže i izmjerite.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Smanjite veličinu paketa dok ne stane
batch_size=64 je dokumentovani primjer, a ne obećanje o vašoj kartici. Dokumentacija savjetuje da počnete sa malim vrijednostima i povećavate dok vremena učitavanja ostaju kratka.
bashlerobot-train --help - 5Pokrenite kontrolnu tačku na ruci
Ista biblioteka, jedna komanda. Zastavice za chunking u realnom vremenu su komentarisane u dokumentaciji i one su za koje treba posegnuti na hardveru niske snage.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Kojim god putem krenuli, završavate sa kontrolnom tačkom plus konfiguracijom koja ju je proizvela. Držite reviziju skupa podataka, broj koraka i sjeme pored nje. lerobot podrazumijeva sjeme 1000; GR00T-ova ulazna tačka za fino podešavanje uopšte ne izlaže sjeme, tako da ti pokreti nisu bit-za-bit reproduktivni. Mehanika u dokumentaciji za obuku.
Dva načina da se mali VLA postavi na ruku
Vi posjedujete mašinu i načine kvara. Za SmolVLA to je razumno: jedan pip dodatak, jedna komanda za obuku, jedna komanda za pokretanje. Za TinyVLA to je reprodukcija istraživanja sa zamrznutim pinovima, pokvarenom DeepSpeed putanjom i konverzijom podataka koju sami pišete.
- Nabavite karticu od 24 GB, snimite 30 do 50 epizoda, provjerite tokove kamere kadar po kadar.
- pip install -e ".[smolvla]", lerobot-train protiv lerobot/smolvla_base, zatim poslužite kontrolnu tačku na mašini u koju je ruka priključena.
- Za TinyVLA: odvojeno conda okruženje, konvertujte podatke u HDF5, registrujte zadatak u constants.py, popravite zero2.json putanju, smanjite train.sh sa osam GPU-a na jedan.
- Nema naplate po satu kada se kartica plati.
- Inferencija se nalazi pored servoa, jedini način da se dobije brza kontrolna petlja.
- Možete zakrpiti kod politike, a TinyVLA je dostupan samo na ovaj način.
- 4090 isključuje svaku ~3 B politiku, tako da nema lokalnog poređenja sa GR00T N1.7 ili Pi0.5.
- Postavljanje okruženja je pravi posao. Samo TinyVLA pinovi mogu koštati dan.
- Nema reda čekanja, nema ponovnog pokušaja, nema skladištenja kontrolnih tačaka. Ponovno pokretanje na koraku 14000 znači ponovno počinjanje.
SmolVLA je jedna od pet politika ovdje. Model i skup podataka birate u formi, pozadinski sistem iznajmljuje GPU prema potrebnom VRAM-u, pokreće trener i piše kontrolne tačke u skladište objekata. Korak po korak: SmolVLA na SO-100, ili cijela matrica na stranici za obuku.
| Šta platforma šalje za SmolVLA | Vrijednost |
|---|---|
| batch size | 2 |
| learning rate | 1e-4 |
| max steps | 20000 |
| gradient accumulation | 8, and it does not reach the trainer |
| extra knobs in the form | seed, logFreq |
| GPU tier | RTX 4090 or any 24 GB card |
| dataset format | LeRobot v3.0 |
| minimum episodes | 30 |
Prvo, podrazumijevana veličina paketa ovdje je 2, a ne 64 kao u primjeru lerobot dokumentacije, a postavka akumulacije gradijenta se šalje, ali nema efekta za SmolVLA, tako da je efektivna veličina paketa zaista 2. Povećajte je namjerno, umjesto da pretpostavljate da se podrazumijevana vrijednost podudara sa uzvodnom. Drugo, TinyVLA ovdje uopšte nije moguće trenirati.
Pokretanje na nivou od 24 GB traje 2 do 5 sati po cijeni od 0.30 do 0.60 USD po satu, otprilike 1 do 3 USD. Na nivou A100, politika od ~3 B traje 3 do 6 sati po cijeni od 1.20 do 2.00 USD po satu, otprilike 4 do 12 USD. Pogledajte cijene, i iste operacije iz CLI-ja i MCP servera.
Kada je mali model pogrešan izbor
Oba rada su ovdje pažljivija nego što su sažeci. Analiza grešaka TinyVLA-a je specifična: varijanta od 0.4 B je tri puta pogriješila pogrešno tumačeći instrukciju, što autori pripisuju ograničenom razumijevanju jezika u manjem VLM-u, a taj način rada je nestao kod 1.3 B. SmolVLA pokazuje istu krivulju s drugog kraja: verzija identične arhitekture od 2.25 B postiže 88.75 na LIBERO-u i 68.24 na Meta-World-u, naspram 87.3 i 57.3 za model od 0.45 B.
- Stane na karticu od 24 GB, što smanjuje trošak eksperimenta s desetaka dolara na nekoliko.
- Dovoljno brz za rad pored ruke, tako da nema mrežnog skoka u kontrolnoj petlji.
- Fino se podešava na podacima koje jedna osoba može snimiti, deseci epizoda umjesto tisuća.
- Težine, popis podataka i kod SmolVLA-a su javni, tako da se loš rezultat može otkloniti.
- Slabije praćenje instrukcija: manje jezičnih parametara, manja sposobnost razdvajanja sličnih referentnih izraza.
- Manja prostorna i vizualna generalizacija na postavke koje niste snimili.
- Osjetljiviji na nedostatke u skupu podataka, s manje prethodnog predtreniranja na koje se može osloniti.
- Višezadaćni rad i rad s dugim horizontom i dalje favoriziraju veće modele, uključujući vlastitu varijantu SmolVLA-a od 2.25 B.
Usporedba koju vrijedi provesti nije TinyVLA protiv SmolVLA-a. To je SmolVLA protiv ACT na vašem vlastitom zadatku, a rad SmolVLA-a je argument zašto. Treniran za jedan zadatak bez predtreniranja robotike, SmolVLA je postigao prosjek od 40.0 na tri SO-100 zadatka gdje je ACT za jedan zadatak postigao 48.3. Ono što ga podiže na 78.3 je predtreniranje zajednice plus višezadaćno treniranje, a ne samo arhitektura. Na SO-101 lego zadatku, oba za jedan zadatak, SmolVLA pobjeđuje: 90 protiv 70 u distribuciji. Zatim SmolVLA protiv Pi0.5 ako budžet dopušta.
Manje je predobuke za pokrivanje loših podataka, tako da čista kriva gubitka na neispravnom skupu podataka daje politiku koja pouzdano reprodukuje defekt. Dokumentacija lerobota je direktna o strukturi: 50 epizoda preko 5 pozicija kocke, 10 po poziciji, radilo je; 25 nije. Ako gubitak izgleda dobro, a ruka ne radi ništa korisno, počnite od gubitak pada, politika ne radi ništa, politika radi samo u jednom podešavanju ili prikupljanja VLA podataka za obuku koji su zaista upotrebljivi.
Pet politika, jedna tabela poređenja
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT sa stvarnim brojem parametara, kašnjenjem inferencije po koraku akcije, nivoom GPU-a koji je svakom potreban i minimalnim brojem epizoda prije nego što uradi nešto korisno.
Uporedite politikeTabela odluka na osnovu koje možete djelovati
| Vaša situacija | Počnite sa | Zašto |
|---|---|---|
| Jedan zadatak, dobre demonstracije, bez jezika | ACT | ~80 M, 20 ms, 24 GB kartica, nema osnovnog modela za preuzimanje |
| Nekoliko povezanih zadataka, po jedna instrukcija | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| Specifično reprodukovanje TinyVLA rezultata | TinyVLA-B or TinyVLA-H | Repozitorijum je jedini put: izolovano okruženje, konvertovani podaci |
| Više zadataka, raznovrsne instrukcije, A100 budžet | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run |
| Još nema robota | Upravljajte pravom rukom | Živa ruka bazirana na redu čekanja ne zahtijeva registraciju i hardver |
Za posljednji red, živa ruka prenosi fizički SO-100 kojim možete upravljati iz preglednika bez računa, a tri načina za početak pokriva ostalo. SO-100 je referentna ruka ovdje, otprilike 110 do 150 EUR u dijelovima, sa potpunim vodičem za postavljanje.
Što dolazi nakon modela ispod 1 B
Smanjenje broja parametara je jedan od načina da se VLA učini jeftinim i ne nužno pobjedničkim. OpenVLA-OFT (arXiv 2502.19645) zadržava 7 B okosnicu i mijenja samo način dekodiranja akcija, izvještavajući o 26x povećanju propusnosti generiranja akcija i porastu LIBERO-a sa 76.5 na 97.1 posto. BitVLA (arXiv 2506.07530) čini svaku težinu 1-bitne BitNet b1.58 2B4T okosnice ternarnom, izvještavajući o 11.0x manjoj memoriji i 4.4x manjoj latenciji od kraja do kraja, dok se podudara s punopreciznim OpenVLA-OFT-om. X-VLA-0.9B (arXiv 2510.10274) nalazi se na liniji od 1 B s podudaranjem toka.
Zajednička nit: dekoder akcija, a ne jezični model, je mjesto gdje se nalazi latencija. Pitajte kako politika emitira akcije prije nego što pitate koliko parametara ima. Arena ima 85 modela i 332 rezultata, svaki povezan sa svojim izvorom; širi pregled nalazi se u našem VLA uvodu.
Mogu li fino podesiti SmolVLA na RTX 4090?▾
Da. SmolVLA ima 450 M parametara i AY-Robots ga pokreće na RTX 4090 / 24 GB nivou. lerobot primjer koristi --batch_size=64, što je primjer, a ne garancija za vašu karticu; dokumentacija savjetuje da počnete s malim i povećavate dok vremena učitavanja ostaju kratka. Očekujte duže od otprilike 4 sata koje dokumentacija navodi za 20000 koraka na A100.
Je li TinyVLA dostupan u lerobotu ili na AY-Robots?▾
Ne za oboje. TinyVLA postoji samo u svom istraživačkom repozitorijumu, posljednji commit 11. marta 2025., a njegov format je HDF5 u ACT stilu, a ne LeRobot. AY-Robots trenira GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT. Ako želite TinyVLA, morate ga sami izgraditi, i prvo ćete morati popraviti DeepSpeed config putanju u scripts/train.sh.
Je li model od 450 M zaista konkurentan onom od 3 B?▾
Prema vlastitim mjerilima autora, da: 87.3 naspram 86.0 na LIBERO-u u odnosu na Pi0 prethodno obučen za robotiku sa 3.3 B, i 78.3 naspram 61.7 na tri stvarna SO-100 zadatka gdje isti rad označava Pi0 sa 3.5 B. Ograničenje je u istom radu: za jedan zadatak bez prethodne obuke za robotiku, SmolVLA pada na 40.0, ispod ACT-ovih 48.3.
Koliko epizoda mi je potrebno prije nego što mali VLA išta uradi?▾
AY-Robots postavlja minimum za SmolVLA na 30 epizoda, a za ACT na 50. lerobot dokumentacija preporučuje oko 50 i izvještava da 25 nije bilo dovoljno za isti zadatak. Struktura je jednako važna kao i broj: skup u radu koristio je 5 pozicija kocke sa po 10 epizoda.
Zašto se objavljeni brojevi latencije toliko razlikuju?▾
Mjere različite stvari. TinyVLA izvještava 14 ms po predviđanju akcije na A6000; AY-Robots navodi SmolVLA na 245 ms i ACT na 20 ms po koraku akcije. Neke brojke pokrivaju jedan prolaz naprijed, neke dijele prolaz preko bloka od 50 akcija, a gotovo nijedna ne uključuje snimanje kamerom ili pisanje na servo motore.
Rješava li zaključivanje u oblaku problem sa GPU-om?▾
Djelimično. AY-Robots automatski obezbjeđuje pod koji služi politiku dok lokalni klijent komunicira s tom krajnjom tačkom, sa idle watchdogom tako da se sam uništava umjesto da tiho naplaćuje. Ne može ukloniti povratno putovanje preko javnog interneta, a kontrolna petlja je već 20 do 485 ms po koraku akcije. Dobro za sporo uzimanje i postavljanje, ne za brzo reaktivno kretanje.
Sources
- TinyVLA: Ka brzim, podacima efikasnim vizuelno-jezičko-akcionim modelima za robotsku manipulaciju
- TinyVLA zvanični repozitorijum koda (README, requirements.txt, scripts/train.sh)
- TinyVLA projektna stranica
- lesjie/Llava-Pythia-1.3B, težine okosnice TinyVLA-H
- SmolVLA: Vizuelno-jezičko-akcioni model za pristupačnu i efikasnu robotiku
- lerobot dokumentacija: fino podešavanje SmolVLA
- lerobot: configuration_smolvla.py, podrazumijevane postavke SmolVLA
- lerobot/smolvla_base kartica modela
- SmolVLA: Efikasan vizuelno-jezičko-akcioni model (Hugging Face blog)
- lerobot na PyPI (0.6.1, zahtijeva Python 3.12 ili noviji)
- OpenVLA: Vizuelno-jezičko-akcioni model otvorenog koda
- Fino podešavanje vizuelno-jezičko-akcionih modela: Optimizacija brzine i uspjeha (OpenVLA-OFT)
- BitVLA: 1-bitni vizuelno-jezičko-akcioni modeli za robotsku manipulaciju
- X-VLA: Soft-Prompted Transformer kao skalabilni vizuelno-jezičko-akcioni model za različite inkarnacije
- rail-berkeley/octo-small-1.5 kartica modela (27 M parametara)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started