
TinyVLA i SmolVLA stavljaju funkcionalan VLA ispod 1 milijarde parametara. Stvarni brojevi iz oba rada, podrazumevane vrednosti LeRobot-a, izmerena latencija i koliko košta pokretanje na kartici od 24 GB.
Gotovo svaki model vizije, jezika i akcije o kojem se piše pretpostavlja karticu za data centar. OpenVLA ima 7 milijardi parametara. GR00T N1.7 i Pi0.5 imaju oko 3 milijarde parametara i zahtevaju A100 80 GB za fino podešavanje. Ako je kartica na vašem stolu 4090, ta klasa modela je van domašaja.
Dva rada tvrde da vam to nije potrebno. TinyVLA (arXiv 2409.12514, prihvaćen od strane IEEE Robotics and Automation Letters u februaru 2025) gradi VLA od okosnice od 400 miliona do 1.3 milijarde parametara plus difuzionu akcionu glavu. SmolVLA (arXiv 2506.01844, podnet 2. juna 2025) isporučuje 450 miliona parametara sa otvorenim težinama, otvorenim podacima i skriptom koja radi na jednoj potrošačkoj kartici. Evo šta su oba izmerila, i gde argument ispod 1 milijarde prestaje da važi.
Šta treba da znate
- •TinyVLA dolazi u tri veličine: 422 miliona ukupno sa 101 milionom za treniranje, 740 miliona sa 138 miliona, 1.3 milijarde sa 143 miliona. Samo prve dve su ispod 1 milijarde.
- •Njegova Tabela IV meri 14 ms po predviđanju akcije za TinyVLA-1B na jednoj A6000, u poređenju sa 292 ms za OpenVLA-7B i 140 ms za smanjeni OpenVLA-1B.
- •Glava održava tu brzinu, a ne okosnica: zamenite difuzionu glavu TinyVLA-H-a za ACT glavu i pet zadataka sa stvarnim robotom padaju sa proseka od 94.0 u jednocifrene vrednosti. MLP glava postiže 0 svuda.
- •SmolVLA ima 450 miliona parametara, od čega je otprilike 100 miliona akcioni ekspert, predtreniran na 481 community LeRobot skupu podataka i 10.6 miliona frejmova. Izveštava 87.3 na LIBERO-u u poređenju sa 86.0 za Pi0 predtreniran za robotiku sa 3.3 milijarde parametara, i 78.3 na tri stvarna SO-100 zadatka u poređenju sa 61.7 za Pi0 sa 3.5 milijardi parametara.
- •Treniran za jedan zadatak bez tog predtreniranja, SmolVLA pada na 40.0 na tim zadacima, ispod ACT-ovih 48.3. Malo nije automatski lako.
- •TinyVLA nema LeRobot integraciju i koristi CUDA 11.7 wheel stack. SmolVLA je u lerobot-u i košta otprilike 1 do 3 USD po pokretanju na nivou od 24 GB ovde.
Šta se zapravo računa kao mali VLA
Broj parametara na kartici modela nije jedan broj. Može značiti ukupne težine, težine učitane tokom inferencije, ili težine koje primaju gradijente tokom . TinyVLA izveštava o oba, a razlika je velika: TinyVLA-H ima ukupno 1.3 B, ali 143 M je trenabilno, jer vizuelni modul i većina jezičkog modela ostaju zamrznuti dok se LoRA adapteri i akciona glava pomeraju. Rad navodi da je trenabilni udeo oko 5 procenata.
| Model | Parametri | Okosnica | Akciona glava | Izvor |
|---|---|---|---|---|
| TinyVLA-S | 422 M ukupno, 101 M trenabilno | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M ukupno, 138 M trenabilno | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B ukupno, 143 M trenabilno | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M akcioni ekspert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, bez jezičkog modela | Direktna regresija segmenata | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregresivni akcioni tokeni | arXiv 2406.09246 |
Dva reda su vredna rasprave. sa otprilike 80 M je manji od svega ostalog ovde, ali nema jezički model, tako da nije VLA: uči jedan zadatak i ne može mu se reći da radi drugi. sa 27 M je uslovljen preko T5-Base tekstualnog enkodera, a ne LLM okosnice. Dobre polazne tačke, nijedna vam ne pruža praćenje instrukcija koje oznaka podrazumeva.
TinyVLA-H, varijanta koja donosi glavne rezultate, ima 1.3 B i nalazi se iznad linije. Bolje pitanje je da li model staje u 24 GB tokom treninga i postiže željenu kontrolnu stopu tokom inferencije. Pet politika koje ovde možete trenirati nalaze se na stranici politika; TinyVLA ima unos u areni ako želite njegove brojeve pored brojeva svih ostalih.
TinyVLA: brzina dolazi iz glave, a ne iz okosnice
Očigledno tumačenje je da su smanjili jezički model, pa je postao brži. Ablaciona studija u radu govori drugačije. Zamena OpenVLA-ove 7 B okosnice za onu od približno 1 B smanjila je predviđanje po akciji sa 292 ms na 140 ms, što je dvostruko ubrzanje. TinyVLA-H, sa uporedivim brojem parametara, radi na 14 ms na istoj kartici. Ostalo 10x ubrzanje je zasluga akcione glave.
| Model | Predviđanje po akciji | Izmereno na |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, okosnica zamenjena TinyVLA-ovom | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA emituje akcije kao diskretizovane tokene kroz glavu jezičkog modela, po jedan za svaku dimenziju akcije, autoregresivno. TinyVLA priključuje difuzioni dekoder koji proizvodi ceo segment u jednom potezu. Tabela V prikazuje arhitekturu TinyVLA-H i menja samo glavu, na istih pet zadataka sa stvarnim robotima. To je najjasniji dokaz u oba rada za argument usklađivanje toka politika donosi, i razlog zašto Pi0 se udaljio od dekodiranja tokena.
| Glava na TinyVLA-H | PostaviTenis | OkreniŠolju | SložiKocke | ZatvoriFioku | OtvoriKutiju |
|---|---|---|---|---|---|
| Difuzija (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Transformator za grupisanje akcija | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Višeslojni perceptron | 0 | 0 | 0 | 0 | 0 |
Brojke od 292 / 140 / 14 ms su iz Tabele IV, sve na jednom A6000. One se odnose na predviđanje po akciji i isključuju snimanje kamerom, predobradu i serijski upis na servo motore. Objavljenu latenciju tretirajte kao donju granicu, nikada kao kontrolnu brzinu. Naši sopstveni brojevi nose isto ograničenje: pogledajte latenciju inferencije.
Šta je TinyVLA postigao
| Benchmark | Protokol | TinyVLA-H | Osnovne linije |
|---|---|---|---|
| MetaWorld, 50 zadataka, simulacija | Višezadaćni, 50 demonstracija, 3 seed-a | 77.6 / 21.5 / 11.4 / 15.8 po težini, prosek 31.6 | Prosek Diffusion Policy 10.5 |
| Pravi Franka Panda, 5 zadataka | 100 trajektorija po zadatku, 20 pokušaja | Prosek 94.0 | OpenVLA 68.3, Diffusion Policy 35.3 |
| Bimanualni UR5, 3 zadatka | Višezadaćni, 10 pokušaja po zadatku | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Red bimanualnih zadataka ima dosadno objašnjenje koje sam rad daje: OpenVLA je predtreniran na Open X-Embodimentu, koji se u potpunosti sastoji od podataka sa jednom rukom, tako da je akcioni prostor sa dve ruke van distribucije i postiže nulu. Osnovna difuziona politika pobeđuje TinyVLA-H na dva od ta tri zadatka. Pozadina u članku o Open X-Embodimentu.

TinyVLA repozitorijum, od avgusta 2026.
Rad je dobar. Kod je istraživački izdanak. Repozitorijum je github.com/liyaxuanliyaxuan/TinyVLA; njegov README datira objavljivanje koda na 17. februar 2025. godine, a poslednji commit je 11. mart 2025. godine. Dobro za reprodukciju rada, problem ako želite održavanu biblioteku.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt fiksira torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, i CUDA stek na 11.x točkove: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README traži Python 3.10; lerobot 0.6.1 zahteva 3.12 ili noviji, tako da ova dva ne mogu deliti okruženje. Prvo potvrdite da postoji torch 2.0.1 build za vašu GPU generaciju. Ako se pokretanje umesto toga prekine zbog VRAM-a, lista za proveru nedostatka memorije je brža od nagađanja.
TinyVLA takođe ne čita LeRobot skupove podataka. Njegov format je ACT-style HDF5: action, language_raw, i grupa za opservacije sa multi-view slikama, joint_positions, qpos i qvel. Repozitorijum isporučuje data_utils/rlds_to_h5py.py za RLDS ulaz, a svaki zadatak je ručno registrovan u aloha_scripts/constants.py sa svojim dataset_dir, episode_len i camera_names. Ako su vaše epizode došle iz lerobot-a ili desktop klijenta, vi ste odgovorni za konverziju.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 pretpostavlja čvor sa osam kartica. Postavite ga na 1 i smanjite veličinu paketa znatno ispod 32. Nijedna varijanta sa jednim GPU-om ne isporučuje se uzvodno, tako da se komanda ne može pokrenuti doslovno na 4090.
- --deepspeed scripts/zero2.json ukazuje na datoteku koja se ne nalazi u glavnom scripts direktorijumu. DeepSpeed konfiguracije se isporučuju na llava-pythia/scripts/zero2.json. Ispravite putanju pre prvog pokretanja.
- README zahteva da naziv izlaznog direktorijuma sadrži llava_pythia, plus lora ako je LoRA omogućena.
- Okosnica je zasebno preuzimanje: lesjie/Llava-Pythia-400M, -700M ili -1.3B. Ne postoji jedna osnovna kontrolna tačka na koju usmeravate politiku na način na koji usmeravate na lerobot/smolvla_base.
SmolVLA: model ispod 1 B koji možete pokrenuti danas popodne
SmolVLA iznosi isti argument unutar održavane biblioteke. Ima 450 M parametara na SmolVLM2-500M-Video-Instruct okosnici, a efikasnost potiče od podešavanja koja možete pročitati iz configuration_smolvla.py, a ne od tvrdnje da je mali.
| Podešavanje u configuration_smolvla.py | Podrazumevano | Šta donosi |
|---|---|---|
| num_vlm_layers | 16 | Pokreće se samo prvih 16 slojeva jezičkog modela |
| expert_width_multiplier | 0.75 | Skrivena veličina akcionog eksperta je 75 procenata VLM-a |
| self_attn_every_n_layers | 2 | Samo-pažnja isprepletena sa unakrsnom pažnjom |
| chunk_size / n_action_steps | 50 / 50 | Jedan prolaz emituje 50 akcija i svih 50 se izvršava |
| num_steps | 10 | Denoising usklađivanja toka fiksirano na 10 koraka |
| tokenizer_max_length | 48 | Instrukcija je skraćena na 48 tokena |
| freeze_vision_encoder / train_expert_only | True / True | Fino podešavanje pomera eksperta, a ne vizuelni toranj |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nije recept iz rada: njegovo pretreniranje je koristilo zagrevanje od 100 koraka tokom 200000 steps |
Pretrenaža je koristila 481 LeRobot skup podataka iz zajednice, 22.9 K epizoda i 10.6 M frejmova na 4 GPUs, 200000 koraka sa globalnom serijom od 256; rad procenjuje ceo projekat na oko 30 K GPU sati. Jedan broj za praćenje: blog o lansiranju Hugging Face-a navodi 487 kuriranih skupova podataka, dok tabela u radu navodi 481. Koristimo brojku iz rada i beležimo neslaganje.

| Benchmark | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO prosek, više zadataka | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World prosek, više zadataka | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Pravi SO-100, 3 zadatka, obuka sa više zadataka | 78.3 | - | 61.7 (3.5 B) | - |
| Pravi SO-100, 3 zadatka, jedan zadatak, bez pretrenaže za robotiku | 40.0 | - | - | 48.3 |
| SO-101 lego uzmi-postavi, jedan zadatak, u distribuciji | 90 | - | - | 70 |
| SO-101 lego uzmi-postavi, jedan zadatak, van distribucije | 50 | - | - | 40 |
LIBERO je simulacija i sve što je kompetentno sada postiže rezultate u osamdesetim. Red za pravi SO-100, gde model od 450 M pobeđuje model od 3.5 B za 16.6 poena, je zanimljiv; red ispod njega je protivteža. Uklonite pretrenažu zajednice i obuku sa više zadataka i isti model pada na 40.0, ispod ACT-a. Odbrambena tvrdnja je da mali model nije automatski lošiji, a ne da je bolji.
Jedna slučajnost pomaže: tabela Meta-World iz SmolVLA rada sadrži objavljene brojeve TinyVLA-e kao osnovu, tako da po prvi put oba modela stoje u jednoj tabeli, SmolVLA-0.45B sa 57.3 naspram TinyVLA-H sa 31.6. Takođe se navodi da je obuka SmolVLA-e oko 40 procenata brža od Pi0 uz 6 puta manje memorije. Sve ovo potiče od autora SmolVLA-e; unos u arenu povezuje svaku vrednost sa njenim izvorom.
Gde SmolVLA provodi svoje vreme
AY-Robots navodi SmolVLA na 245 ms po koraku akcije i ACT na 20 ms u katalogu politika. TinyVLA izveštava 14 ms po predviđanju akcije. Ti brojevi nisu uporedivi, a tretiranje kao da jesu je najčešća greška u ovoj temi: neki mere jedan prolaz unapred, neki dele taj prolaz kroz deo kada ga grupisanje akcija amortizuje.
- SmolVLA emituje 50 akcija po prolazu unapred i izvršava svih 50. Pri 30 fps koje rad koristi na stvarnim robotima, jedno zaključivanje pokriva oko 1.7 sekundi kretanja.
- Asinhrono zaključivanje izračunava sledeći deo dok se trenutni još uvek izvršava: 9.7 s prosečno vreme završetka zadatka naspram 13.75 s sinhronog, otprilike 30 procenata brže, i 19 ciklusa uzimanja i postavljanja u fiksnom prozoru od 60 sekundi naspram 9.
- Stope uspešnosti su bile uporedive, a ne bolje, 78.3 sinhrono naspram 73.3 asinhrono. Asinhronost kupuje propusnost, ne tačnost.
- Grupisanje skriva kašnjenje obrade, a ne kašnjenje mreže, i čini politiku manje reaktivnom jer je posvećena 50 akcija.
AY-Robots mogu automatski da obezbede cloud GPU pod koji opslužuje vašu politiku dok lokalni robotski klijent komunicira sa tom krajnjom tačkom, a pod sadrži idle watchdog tako da se sam uništava umesto da tiho naplaćuje. Ono što ne radi je uklanjanje povratnog putovanja preko javnog interneta. Kontrolna petlja za pet politika ovde je 20 do 485 ms po koraku akcije pre bilo kakve mreže, tako da je daljinsko zaključivanje izvodljivo za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje.

Fino podešavanje SmolVLA na jednoj potrošačkoj kartici
Ručna putanja, na lerobot 0.6.1, trenutnom PyPI izdanju od 23. avgusta 2026. Sve ispod potiče iz Hugging Face lerobot SmolVLA dokumentacije, preuzete istog dana; vođena verzija je blaža.
- 1Instalirajte lerobot sa smolvla dodatkom
Zavisnosti SmolVLA su opcioni dodatak, nisu deo osnovne instalacije. Instaliranje bez njih, a zatim čuđenje zašto je tip politike nepoznat, uobičajen je gubitak pola sata.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Nabavite skup podataka sa dovoljno epizoda
Dokumentacija preporučuje oko 50 epizoda i navodi da ista radnja sa 25 nije bila dovoljna. AY-Robots postavlja minimum na 30. Snimite svoje, ili počnite iz direktorijuma skupova podataka.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Pokrenite fino podešavanje
Komanda iz lerobot vodiča, neizmenjena. Dokumentacija navodi 20000 koraka kao otprilike 4 sata na jednoj A100 kartici. Na kartici od 24 GB, očekujte duže i izmerite.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Smanjite veličinu paketa dok ne stane
batch_size=64 je dokumentovani primer, a ne obećanje o vašoj kartici. Dokumentacija savetuje da počnete sa malim vrednostima i povećavate ih dok vremena učitavanja ostaju kratka.
bashlerobot-train --help - 5Pokrenite kontrolnu tačku na ruci
Ista biblioteka, jedna komanda. Zastavice za chunking u realnom vremenu su komentarisane u dokumentaciji i one su za koje treba posegnuti na hardveru male snage.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Kojim god putem da krenete, završićete sa kontrolnom tačkom plus konfiguracijom koja ju je proizvela. Čuvajte reviziju skupa podataka, broj koraka i seed pored nje. lerobot podrazumevano koristi seed 1000; GR00T-ova ulazna tačka za fino podešavanje uopšte ne eksponira seed, tako da ti pokreti nisu bit-za-bit reproduktivni. Mehanika u dokumentaciji za obuku.
Dva načina da se mali VLA postavi na ruku
Vi posedujete mašinu i režime kvara. Za SmolVLA to je razumno: jedan pip dodatak, jedna komanda za obuku, jedna komanda za pokretanje. Za TinyVLA to je reprodukcija istraživanja sa zamrznutim pinovima, pokvarenom DeepSpeed putanjom i konverzijom podataka koju sami pišete.
- Nabavite karticu od 24 GB, snimite 30 do 50 epizoda, proverite video strimove kamere kadar po kadar.
- pip install -e ".[smolvla]", lerobot-train protiv lerobot/smolvla_base, zatim poslužite kontrolnu tačku na mašini u koju je ruka priključena.
- Za TinyVLA: odvojeno conda okruženje, konvertujte podatke u HDF5, registrujte zadatak u constants.py, popravite putanju zero2.json, smanjite train.sh sa osam GPU-a na jedan.
- Nema naplate po satu kada je kartica plaćena.
- Inferencija se nalazi pored servo motora, jedini način da se dobije brza kontrolna petlja.
- Možete zakrpiti kod politike, a TinyVLA je dostupan samo na ovaj način.
- 4090 isključuje svaku politiku od ~3 B, tako da nema lokalnog poređenja sa GR00T N1.7 ili Pi0.5.
- Podešavanje okruženja je pravi posao. Samo TinyVLA pinovi mogu koštati dan.
- Nema reda čekanja, nema ponovnog pokušaja, nema skladištenja kontrolnih tačaka. Ponovno pokretanje na koraku 14000 znači ponovno počinjanje.
SmolVLA je jedna od pet politika ovde. Model i skup podataka birate u formi, backend iznajmljuje GPU prema potrebnom VRAM-u, pokreće trener i piše kontrolne tačke u skladište objekata. Korak po korak: SmolVLA na SO-100, ili celu matricu na stranici za obuku.
| Šta platforma šalje za SmolVLA | Vrednost |
|---|---|
| veličina paketa | 2 |
| stopa učenja | 1e-4 |
| maksimalni koraci | 20000 |
| akumulacija gradijenta | 8, and it does not reach the trainer |
| dodatne opcije u formi | seed, logFreq |
| GPU nivo | RTX 4090 or any 24 GB card |
| format skupa podataka | LeRobot v3.0 |
| minimalan broj epizoda | 30 |
Prvo, podrazumevana veličina paketa ovde je 2, a ne 64 kao u primeru lerobot dokumentacije, i podešavanje akumulacije gradijenta se šalje, ali nema efekta za SmolVLA, tako da je efektivna veličina paketa zaista 2. Povećajte je namerno, umesto da pretpostavljate da se podrazumevana vrednost podudara sa uzvodnom. Drugo, TinyVLA ovde uopšte nije moguće trenirati.
Pokretanje na nivou od 24 GB traje 2 do 5 sati po ceni od 0.30 do 0.60 USD po satu, otprilike 1 do 3 USD. Na A100 nivou, politika od ~3 B traje 3 do 6 sati po ceni od 1.20 do 2.00 USD po satu, otprilike 4 do 12 USD. Pogledajte cene, i iste operacije iz CLI-ja i MCP servera.
Kada je mali model pogrešan izbor
Oba rada su ovde pažljivija nego što su to sažeci. Analiza neuspeha TinyVLA-a je specifična: varijanta od 0.4 B je tri puta pogrešno pročitala instrukciju, što autori pripisuju ograničenom razumevanju jezika u manjem VLM-u, a taj režim je nestao kod 1.3 B. SmolVLA pokazuje istu krivu sa drugog kraja: verzija identične arhitekture od 2.25 B postiže 88.75 na LIBERO-u i 68.24 na Meta-World-u, naspram 87.3 i 57.3 za model od 0.45 B.
- Staje na karticu od 24 GB, što smanjuje troškove eksperimenta sa desetina dolara na nekoliko.
- Dovoljno brz da radi pored ruke, tako da nema mrežnog skoka u kontrolnoj petlji.
- Fino se podešava na podacima koje jedna osoba može snimiti, desetinama epizoda umesto hiljadama.
- Težine, lista podataka i kod SmolVLA-a su javni, tako da se loš rezultat može otkloniti.
- Slabije praćenje instrukcija: manje jezičkih parametara, manja sposobnost razdvajanja sličnih referentnih izraza.
- Manja prostorna i vizuelna generalizacija na postavke koje niste snimili.
- Osetljiviji na nedostatke u skupu podataka, sa manje prethodnog treninga na koji se može osloniti.
- Višezadaćni rad i rad sa dugim horizontom i dalje favorizuju veće modele, uključujući sopstvenu varijantu SmolVLA-a od 2.25 B.
Poređenje koje vredi sprovesti nije TinyVLA protiv SmolVLA. To je SmolVLA protiv ACT na vašem sopstvenom zadatku, a rad o SmolVLA-u je argument zašto. Treniran za jedan zadatak bez prethodnog treninga iz robotike, SmolVLA je postigao prosečno 40.0 na tri SO-100 zadatka gde je ACT za jedan zadatak postigao 48.3. Ono što ga podiže na 78.3 je prethodni trening u zajednici plus trening za više zadataka, a ne samo arhitektura. Na SO-101 lego zadatku, oba za jedan zadatak, SmolVLA pobeđuje: 90 naspram 70 u distribuciji. Zatim SmolVLA protiv Pi0.5 ako budžet dozvoljava.
Manje je predobuke za pokrivanje loših podataka, tako da čista kriva gubitka na neispravnom skupu podataka daje politiku koja pouzdano reprodukuje defekt. Dokumentacija lerobot-a je direktna u vezi sa strukturom: 50 epizoda preko 5 pozicija kocke, 10 po poziciji, radilo je; 25 nije. Ako gubitak izgleda u redu, a ruka ne radi ništa korisno, počnite od gubitak opada, politika ne radi ništa, politika radi samo u jednom podešavanju ili prikupljanja VLA podataka za obuku koji su zaista upotrebljivi.
Pet politika, jedna tabela poređenja
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT sa stvarnim brojem parametara, kašnjenjem inferencije po koraku akcije, nivoom GPU-a koji je svakom potreban i minimalnim brojem epizoda pre nego što uradi nešto korisno.
Uporedite politikeTabela odluka na osnovu koje možete delovati
| Vaša situacija | Počnite sa | Zašto |
|---|---|---|
| Jedan zadatak, dobre demonstracije, bez jezika | ACT | ~80 M, 20 ms, 24 GB kartica, bez osnovnog modela za preuzimanje |
| Nekoliko povezanih zadataka, po jedno uputstvo za svaki | SmolVLA | 450 M, in lerobot, minimum 30 epizoda, 1 do 3 USD po pokretanju |
| Specifično reprodukovanje TinyVLA rezultata | TinyVLA-B or TinyVLA-H | Repo je jedini put: izolovano okruženje, konvertovani podaci |
| Više zadataka, raznovrsna uputstva, A100 budžet | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms i 485 ms po koraku, 4 do 12 USD po pokretanju |
| Još uvek nema robota | Upravljajte pravom rukom | Živa ruka zasnovana na redu čekanja ne zahteva registraciju i hardver |
Za poslednji red, živa ruka strimuje fizički SO-100 kojim možete upravljati iz pretraživača bez naloga, a tri načina za početak pokriva ostalo. SO-100 je referentna ruka ovde, otprilike 110 do 150 EUR u delovima, sa kompletnim vodičem za podešavanje.
Šta dolazi posle modela ispod 1 B
Smanjenje broja parametara je jedan od načina da se VLA učini jeftinim i ne očigledno pobedničkim. OpenVLA-OFT (arXiv 2502.19645) zadržava 7 B okosnicu i menja samo način dekodiranja akcija, prijavljujući 26x povećanje protoka generisanja akcija i rast LIBERO-a sa 76.5 na 97.1 procenat. BitVLA (arXiv 2506.07530) čini svaku težinu 1-bitne BitNet b1.58 2B4T okosnice ternarnom, prijavljujući 11.0x manje memorije i 4.4x nižu latenciju od kraja do kraja, dok se podudara sa OpenVLA-OFT pune preciznosti. X-VLA-0.9B (arXiv 2510.10274) se nalazi na liniji od 1 B sa usklađivanjem toka.
Zajednička nit: dekoder akcija, a ne jezički model, je mesto gde se nalazi latencija. Pitajte kako politika emituje akcije pre nego što pitate koliko parametara ima. arena ima 85 modela i 332 rezultata, svaki povezan sa svojim izvorom; širi pregled se nalazi u našem VLA uvodu.
Mogu li fino podesiti SmolVLA na RTX 4090?▾
Da. SmolVLA ima 450 M parametara i AY-Robots ga pokreće na RTX 4090 / 24 GB nivou. lerobot primer koristi --batch_size=64, što je primer, a ne garancija za vašu karticu; dokumentacija savetuje da se počne sa malim vrednostima i povećava dok vremena učitavanja ostaju kratka. Očekujte duže od otprilike 4 sata koje dokumentacija navodi za 20000 koraka na A100.
Da li je TinyVLA dostupan u lerobot-u ili na AY-Robots-u?▾
Ne za oba. TinyVLA postoji samo u svom istraživačkom repozitorijumu, poslednji commit 11 March 2025, i njegov format je ACT-style HDF5, a ne LeRobot. AY-Robots trenira GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT. Ako želite TinyVLA, morate ga sami napraviti, i prvo ćete morati da popravite DeepSpeed config putanju u scripts/train.sh.
Da li je model od 450 M zaista konkurentan onom od 3 B?▾
Prema sopstvenim merenjima autora, da: 87.3 naspram 86.0 na LIBERO-u u poređenju sa Pi0 prethodno obučenim za robotiku na 3.3 B, i 78.3 naspram 61.7 na tri stvarna SO-100 zadatka gde isti rad označava Pi0 na 3.5 B. Ograničenje je u istom radu: za jedan zadatak bez prethodne obuke za robotiku, SmolVLA pada na 40.0, ispod ACT-ovih 48.3.
Koliko epizoda mi je potrebno pre nego što mali VLA počne da radi?▾
AY-Robots postavlja minimum za SmolVLA na 30 epizoda, a za ACT na 50. lerobot dokumentacija preporučuje oko 50 i navodi da 25 nije bilo dovoljno za isti zadatak. Struktura je jednako važna kao i broj: skup iz rada je koristio 5 pozicija kocke sa po 10 epizoda za svaku.
Zašto se objavljeni brojevi latencije toliko razlikuju?▾
Mere različite stvari. TinyVLA izveštava 14 ms po predviđanju akcije na A6000; AY-Robots navodi SmolVLA na 245 ms i ACT na 20 ms po koraku akcije. Neke brojke pokrivaju jedan forward pass, neke dele pass preko bloka od 50 akcija, i skoro nijedna ne uključuje snimanje kamere ili upis na servo motore.
Da li zaključivanje u oblaku rešava problem sa GPU-om?▾
Delimično. AY-Robots automatski obezbeđuje pod koji služi politiku dok lokalni klijent komunicira sa tom krajnjom tačkom, sa idle watchdog-om tako da se sam uništava umesto da tiho naplaćuje. Ne može eliminisati povratno putovanje preko javnog interneta, a kontrolna petlja je već 20 do 485 ms po koraku akcije. Dobro za sporo uzimanje i postavljanje, ne za brzo reaktivno kretanje.
Sources
- TinyVLA: Ka brzim, podacima efikasnim vizuelno-jezičko-akcionim modelima za robotsku manipulaciju
- TinyVLA zvanični repozitorijum koda (README, requirements.txt, scripts/train.sh)
- TinyVLA stranica projekta
- lesjie/Llava-Pythia-1.3B, težine okosnice TinyVLA-H
- SmolVLA: Vizuelno-jezičko-akcioni model za pristupačnu i efikasnu robotiku
- lerobot dokumentacija: fino podešavanje SmolVLA
- lerobot: configuration_smolvla.py, podrazumevane vrednosti za SmolVLA
- lerobot/smolvla_base kartica modela
- SmolVLA: Efikasan vizuelno-jezičko-akcioni model (Hugging Face blog)
- lerobot na PyPI (0.6.1, zahteva Python 3.12 ili noviji)
- OpenVLA: Vizuelno-jezičko-akcioni model otvorenog koda
- Fino podešavanje vizuelno-jezičko-akcionih modela: Optimizacija brzine i uspeha (OpenVLA-OFT)
- BitVLA: 1-bitni vizuelno-jezičko-akcioni modeli za robotsku manipulaciju
- X-VLA: Transformer sa mekim promptovanjem kao skalabilni vizuelno-jezičko-akcioni model za različite inkarnacije
- rail-berkeley/octo-small-1.5 kartica modela (27 M parametara)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started