
TinyVLA i SmolVLA stavljaju funkcionalni VLA ispod 1 milijarde parametara. Stvarni brojevi iz oba rada, zadane postavke LeRobota, izmjerena latencija i koliko košta pokretanje na kartici od 24 GB.
Gotovo svaki model vida-jezika-akcije o kojem se piše pretpostavlja karticu podatkovnog centra. OpenVLA ima 7 milijardi parametara. GR00T N1.7 i Pi0.5 imaju oko 3 milijarde parametara i zahtijevaju A100 80 GB za fino podešavanje. Ako je kartica na vašem stolu 4090, ta klasa modela je izvan dosega.
Dva rada tvrde da vam to ne treba. TinyVLA (arXiv 2409.12514, prihvaćen od strane IEEE Robotics and Automation Letters u veljači 2025.) gradi VLA od okosnice od 400 milijuna do 1.3 milijarde parametara plus difuzijsku akcijsku glavu. SmolVLA (arXiv 2506.01844, predan 2. lipnja 2025.) isporučuje 450 milijuna parametara s otvorenim težinama, otvorenim podacima i skriptom koja se izvodi na jednoj potrošačkoj kartici. Evo što su oba izmjerila i gdje argument o manje od 1 milijarde prestaje vrijediti.
Što trebate znati
- •TinyVLA dolazi u tri veličine: ukupno 422 milijuna s 101 milijunom za treniranje, 740 milijuna s 138 milijuna, 1.3 milijarde s 143 milijuna. Samo prve dvije su ispod 1 milijarde.
- •Njegova Tablica IV mjeri 14 ms po predviđanju akcije za TinyVLA-1B na jednoj A6000, u usporedbi s 292 ms za OpenVLA-7B i 140 ms za smanjeni OpenVLA-1B.
- •Glava drži tu brzinu, a ne okosnica: zamijenite difuzijsku glavu TinyVLA-H s ACT glavom i pet zadataka stvarnog robota padaju s prosjeka od 94.0 na jednoznamenkaste brojeve. MLP glava postiže 0 svugdje.
- •SmolVLA ima 450 milijuna parametara, od čega je otprilike 100 milijuna akcijski ekspert, prethodno treniran na 481 skupu podataka zajednice LeRobot i 10.6 milijuna okvira. Bilježi 87.3 na LIBERO-u u usporedbi s 86.0 za Pi0 prethodno treniran za robotiku s 3.3 milijarde parametara, i 78.3 na tri stvarna SO-100 zadatka u usporedbi s 61.7 za Pi0 s 3.5 milijardi parametara.
- •Treniran za jedan zadatak bez tog prethodnog treniranja, SmolVLA pada na 40.0 na tim zadacima, ispod ACT-ovih 48.3. Malo nije automatski lako.
- •TinyVLA nema integraciju s LeRobotom i koristi CUDA 11.7 wheel stack. SmolVLA je u lerobotu i košta otprilike 1 do 3 USD po pokretanju na razini od 24 GB ovdje.
Što se zapravo smatra malim VLA-om
Broj parametara na kartici modela nije jedan broj. Može značiti ukupne težine, težine učitane tijekom inferencije ili težine koje primaju gradijente tijekom . TinyVLA izvještava o oba, a razlika je velika: TinyVLA-H ima ukupno 1.3 B, ali 143 M je trenabilno, jer vizualni toranj i većina jezičnog modela ostaju zamrznuti dok se LoRA adapteri i akcijska glava pomiču. Rad navodi da je udio trenabilnih parametara oko 5 posto.
| Model | Parametri | Okosnica | Akcijska glava | Izvor |
|---|---|---|---|---|
| TinyVLA-S | 422 M ukupno, 101 M trenabilno | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M ukupno, 138 M trenabilno | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B ukupno, 143 M trenabilno | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M akcijski ekspert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, bez jezičnog modela | Izravna regresija segmenata | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregresivni akcijski tokeni | arXiv 2406.09246 |
Dvije su stavke vrijedne rasprave. s otprilike 80 M je manji od svega ostalog ovdje, ali nema jezični model, pa nije VLA: uči jedan zadatak i ne može mu se reći da radi drugi. s 27 M uvjetovan je putem T5-Base tekstualnog kodera, a ne LLM okosnice. Dobre su to polazne točke, ali nijedna ne pruža slijedeće upute koje naziv implicira.
TinyVLA-H, varijanta koja donosi glavne rezultate, ima 1.3 B i nalazi se iznad granice. Bolje je pitanje može li model stati u 24 GB tijekom treniranja i postići željenu kontrolnu stopu tijekom inferencije. Pet politika koje ovdje možete trenirati nalaze se na stranici politika; TinyVLA ima unos u areni ako želite vidjeti njegove brojeve pored ostalih.
TinyVLA: brzina dolazi iz glave, ne iz okosnice
Očito tumačenje je da su smanjili jezični model, pa je postao brži. Ablacijska studija u radu govori drugačije. Zamjena OpenVLA-ove okosnice od 7 B s onom od otprilike 1 B smanjila je predviđanje po akciji s 292 ms na 140 ms, što je dvostruko poboljšanje. TinyVLA-H, s usporedivim brojem parametara, radi na 14 ms na istoj kartici. Ostali 10x je akcijska glava.
| Model | Predviđanje po akciji | Mjereno na |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, okosnica zamijenjena TinyVLA-ovom | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA emitira akcije kao diskretizirane tokene kroz glavu jezičnog modela, po jedan za svaku dimenziju akcije, autoregresivno. TinyVLA priključuje difuzijski dekoder koji proizvodi cijeli blok u jednom potezu. Tablica V prikazuje arhitekturu TinyVLA-H i mijenja samo glavu, na istih pet zadataka stvarnog robota. To je najčišći dokaz u oba rada za argument usklađivanje toka, koji politike stvaraju, i razlog Pi0 se odmaknuo od dekodiranja tokena.
| Glava na TinyVLA-H | Postavi tenisku lopticu | Okreni šalicu | Složi kocke | Zatvori ladicu | Otvori kutiju |
|---|---|---|---|---|---|
| Difuzija (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Transformator za grupiranje akcija | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Višeslojni perceptron | 0 | 0 | 0 | 0 | 0 |
Brojke od 292 / 140 / 14 ms su iz Tablice IV, sve na jednom A6000. One su po predviđanju akcije i isključuju snimanje kamerom, predobradu i serijski zapis na servo motore. Objavljenu latenciju tretirajte kao donju granicu, nikada kao brzinu kontrole. Naši vlastiti brojevi nose isto ograničenje: pogledajte latenciju inferencije.
Što je TinyVLA postigao
| Mjerilo | Protokol | TinyVLA-H | Osnovne linije |
|---|---|---|---|
| MetaWorld, 50 zadataka, simulacija | Višezadaćno, 50 demonstracija, 3 sjemena | 77.6 / 21.5 / 11.4 / 15.8 po težini, prosjek 31.6 | Prosjek Diffusion Policy 10.5 |
| Pravi Franka Panda, 5 zadataka | 100 trajektorija po zadatku, 20 pokušaja | Prosjek 94.0 | OpenVLA 68.3, Diffusion Policy 35.3 |
| Bimanualni UR5, 3 zadatka | Višezadaćno, 10 pokušaja po zadatku | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Redak za bimanualne zadatke ima dosadno objašnjenje koje sam rad daje: OpenVLA je prethodno treniran na Open X-Embodimentu, koji se u potpunosti sastoji od podataka s jednom rukom, tako da je akcijski prostor s dvije ruke izvan distribucije i postiže nulu. Osnovna linija difuzijske politike nadmašuje TinyVLA-H na dva od ta tri zadatka. Pozadina u članku o Open X-Embodimentu.

TinyVLA repozitorij, od kolovoza 2026.
Rad je dobar. Kod je istraživački prototip. Repozitorij je github.com/liyaxuanliyaxuan/TinyVLA; njegov README datira izdanje koda na 17. veljače 2025., a zadnji commit je 11. ožujka 2025. Dobro za reprodukciju rada, problem ako ste željeli održavanu biblioteku.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt fiksira torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, i CUDA stack na 11.x wheelse: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README traži Python 3.10; lerobot 0.6.1 zahtijeva 3.12 ili noviji, tako da se ta dva ne mogu dijeliti u istom okruženju. Prvo provjerite postoji li torch 2.0.1 build za vašu generaciju GPU-a. Ako se izvođenje umjesto toga prekine zbog VRAM-a, popis za provjeru nedostatka memorije je brži od nagađanja.
TinyVLA također ne čita LeRobot skupove podataka. Njegov format je HDF5 u ACT stilu: action, language_raw, i grupa observations s višestrukim slikama, joint_positions, qpos i qvel. Repozitorij isporučuje data_utils/rlds_to_h5py.py za RLDS ulaz, a svaki zadatak je ručno registriran u aloha_scripts/constants.py sa svojim dataset_dir, episode_len i camera_names. Ako su vaši epizode došle iz lerobota ili desktop klijenta, vi ste odgovorni za konverziju.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 pretpostavlja čvor s osam kartica. Postavite ga na 1 i smanjite veličinu serije znatno ispod 32. Nijedna varijanta s jednom GPU-om ne isporučuje se uzvodno, tako da se naredba ne može pokrenuti doslovno na 4090.
- --deepspeed scripts/zero2.json pokazuje na datoteku koja se ne nalazi u glavnom direktoriju scripts. DeepSpeed konfiguracije isporučuju se na llava-pythia/scripts/zero2.json. Popravite putanju prije prvog pokretanja.
- README zahtijeva da naziv izlaznog direktorija sadrži llava_pythia, plus lora ako je LoRA omogućena.
- Okosnica je zasebno preuzimanje: lesjie/Llava-Pythia-400M, -700M ili -1.3B. Ne postoji jedna osnovna kontrolna točka na koju usmjeravate politiku na način na koji usmjeravate na lerobot/smolvla_base.
SmolVLA: model ispod 1 B koji možete pokrenuti danas poslijepodne
SmolVLA iznosi isti argument unutar održavane biblioteke. Ima 450 M parametara na SmolVLM2-500M-Video-Instruct okosnici, a učinkovitost proizlazi iz postavki koje možete pročitati iz configuration_smolvla.py, a ne iz tvrdnje o tome da je mali.
| Postavka u configuration_smolvla.py | Zadano | Što donosi |
|---|---|---|
| num_vlm_layers | 16 | Pokreće se samo prvih 16 slojeva jezičnog modela |
| expert_width_multiplier | 0.75 | Skrivena veličina akcijskog eksperta je 75 posto VLM-a |
| self_attn_every_n_layers | 2 | Samopažnja isprepletena s unakrsnom pažnjom |
| chunk_size / n_action_steps | 50 / 50 | Jedan prolaz emitira 50 akcija i svih 50 se izvršava |
| num_steps | 10 | Denoising usklađivanja toka fiksiran na 10 koraka |
| tokenizer_max_length | 48 | Uputa je skraćena na 48 tokena |
| freeze_vision_encoder / train_expert_only | True / True | Fino podešavanje pomiče eksperta, a ne vizualni toranj |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nije recept iz rada: njegovo predtreniranje koristilo je zagrijavanje od 100 koraka tijekom 200000 koraka |
Pretprocesiranje je koristilo 481 skup podataka zajednice LeRobot, 22.9 K epizoda i 10.6 M okvira na 4 GPU-a, 200000 koraka s globalnom serijom od 256; rad procjenjuje cijeli projekt na oko 30 K GPU sati. Jedan broj za praćenje: blog o pokretanju Hugging Facea navodi 487 kuriranih skupova podataka, dok tablica u radu navodi 481. Koristimo brojku iz rada i bilježimo neslaganje.
| Mjerilo | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO prosjek, više zadataka | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World prosjek, više zadataka | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Stvarni SO-100, 3 zadatka, obuka za više zadataka | 78.3 | - | 61.7 (3.5 B) | - |
| Stvarni SO-100, 3 zadatka, jedan zadatak, bez pretprocesiranja za robotiku | 40.0 | - | - | 48.3 |
| SO-101 lego podizanje-postavljanje, jedan zadatak, unutar distribucije | 90 | - | - | 70 |
| SO-101 lego podizanje-postavljanje, jedan zadatak, izvan distribucije | 50 | - | - | 40 |
LIBERO je simulacija i sve kompetentno tamo sada postiže rezultate u osamdesetima. Redak za stvarni SO-100, gdje model od 450 M pobjeđuje onaj od 3.5 B za 16.6 bodova, je zanimljiv; redak ispod njega je protuteža. Uklonite pretprocesiranje zajednice i obuku za više zadataka i isti model pada na 40.0, ispod ACT-a. Obranljiva tvrdnja je da mali model nije automatski lošiji, a ne da je bolji.
Jedna slučajnost pomaže: tablica Meta-World u radu SmolVLA-e sadrži vlastite objavljene brojeve TinyVLA-e kao osnovu, tako da po prvi put oba modela sjede u jednoj tablici, SmolVLA-0.45B na 57.3 naspram TinyVLA-H na 31.6. Također izvještava da se SmolVLA trenira oko 40 posto brže od Pi0 s 6 puta manje memorije. Sve to dolazi od autora SmolVLA-e; unos u arenu povezuje svaku vrijednost s njezinim izvorom.
Gdje SmolVLA provodi svoje vrijeme
AY-Robots navodi SmolVLA na 245 ms po koraku akcije i ACT na 20 ms u katalogu politika. TinyVLA izvještava 14 ms po predviđanju akcije. Ti brojevi nisu usporedivi, a tretiranje kao da jesu najčešća je pogreška u ovoj temi: neki mjere jedan prolaz naprijed, neki dijele taj prolaz kroz dio kada ga grupiranje akcija amortizira.
- SmolVLA emitira 50 akcija po prolazu naprijed i izvršava svih 50. Pri 30 fps koje rad koristi na stvarnim robotima, jedno zaključivanje pokriva oko 1.7 sekundi kretanja.
- Asinkrono zaključivanje izračunava sljedeći dio dok se trenutni još uvijek izvršava: 9.7 s prosječnog vremena izvršenja zadatka naspram 13.75 s sinkronog, otprilike 30 posto brže, i 19 ciklusa 'pick-and-place' u fiksnom prozoru od 60 sekundi naspram 9.
- Stope uspješnosti bile su usporedive, a ne bolje, 78.3 sinkrono naspram 73.3 asinkrono. Asinkronost kupuje propusnost, ne točnost.
- Grupiranje skriva latenciju izračuna, a ne latenciju mreže, i čini politiku manje reaktivnom jer je posvećena 50 akcijama.
AY-Robots može automatski osigurati pod s GPU-om u oblaku koji služi vašoj politici dok lokalni klijent robota komunicira s tom krajnjom točkom, a pod sadrži nadzornika mirovanja tako da se sam uništava umjesto da tiho naplaćuje. Ono što ne čini je uklanjanje povratnog putovanja preko javnog interneta. Kontrolna petlja kroz pet politika ovdje iznosi 20 do 485 ms po koraku akcije prije bilo kakve mreže, tako da je udaljeno zaključivanje izvedivo za sporo 'pick-and-place', ali ne i za brzo reaktivno kretanje.

Fino podešavanje SmolVLA na jednoj potrošačkoj kartici
Ručni put, na lerobot 0.6.1, trenutnom PyPI izdanju od 23. kolovoza 2026. Sve dolje navedeno dolazi iz Hugging Face lerobot SmolVLA dokumentacije, preuzete istog dana; vođena verzija je nježnija.
- 1Instalirajte lerobot s dodatkom smolvla
Ovisnosti SmolVLA su opcionalni dodatak, nisu dio osnovne instalacije. Instaliranje bez njih, a zatim čuđenje zašto je tip politike nepoznat, uobičajen je gubitak pola sata.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Nabavite skup podataka s dovoljno epizoda
Dokumentacija preporučuje oko 50 epizoda i navodi da ista zadaća s 25 nije bila dovoljna. AY-Robots postavlja minimum na 30. Snimite vlastite, ili počnite iz direktorija skupova podataka.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Pokrenite fino podešavanje
Naredba iz lerobot vodiča, neizmijenjena. Dokumentacija navodi 20000 koraka kao otprilike 4 sata na jednom A100. Na kartici od 24 GB očekujte duže i izmjerite.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Smanjite veličinu paketa dok ne stane
batch_size=64 je dokumentirani primjer, a ne obećanje o vašoj kartici. Dokumentacija savjetuje da počnete s malim vrijednostima i povećavate dok su vremena učitavanja kratka.
bashlerobot-train --help - 5Pokrenite kontrolnu točku na ruci
Ista biblioteka, jedna naredba. Zastavice za chunking u stvarnom vremenu su komentirane u dokumentaciji i one su za korištenje na hardveru niske snage.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Kojim god putem krenuli, završit ćete s kontrolnom točkom plus konfiguracijom koja ju je proizvela. Držite reviziju skupa podataka, broj koraka i sjeme pored nje. lerobot zadano koristi sjeme 1000; GR00T-ova ulazna točka za fino podešavanje uopće ne izlaže sjeme, tako da ti pokreti nisu bit-za-bit reproducibilni. Mehanika u dokumentaciji za obuku.
Dva načina za postavljanje malog VLA-a na ruku
Vi posjedujete stroj i načine kvara. Za SmolVLA to je razumno: jedan pip dodatak, jedna naredba za obuku, jedna naredba za pokretanje. Za TinyVLA to je reprodukcija istraživanja sa zamrznutim pinovima, pokvarenom DeepSpeed putanjom i konverzijom podataka koju sami pišete.
- Nabavite karticu od 24 GB, snimite 30 do 50 epizoda, provjerite video streamove kamere kadar po kadar.
- pip install -e ".[smolvla]", lerobot-train protiv lerobot/smolvla_base, zatim poslužite kontrolnu točku na stroju u koji je ruka priključena.
- Za TinyVLA: zasebno conda okruženje, pretvorite podatke u HDF5, registrirajte zadatak u constants.py, popravite putanju zero2.json, smanjite train.sh s osam GPU-a na jedan.
- Nema naplate po satu nakon što je kartica plaćena.
- Zaključivanje se nalazi pored serva, jedini način za brzu kontrolnu petlju.
- Možete zakrpati kod politike, a TinyVLA je dostupan samo na ovaj način.
- 4090 isključuje svaku politiku od ~3 B, tako da nema lokalne usporedbe s GR00T N1.7 ili Pi0.5.
- Postavljanje okruženja je pravi posao. Samo pinovi TinyVLA-a mogu koštati cijeli dan.
- Nema reda čekanja, nema ponovnog pokušaja, nema pohrane kontrolnih točaka. Ponovno pokretanje na koraku 14000 znači ponovno počinjanje.
SmolVLA je jedna od pet politika ovdje. Odabirete model i skup podataka u obrascu, pozadinski sustav iznajmljuje GPU prema potrebnom VRAM-u, pokreće trener i piše kontrolne točke u pohranu objekata. Korak po korak: SmolVLA na SO-100, ili cijela matrica na stranici za obuku.
| Što platforma šalje za SmolVLA | Vrijednost |
|---|---|
| veličina paketa | 2 |
| stopa učenja | 1e-4 |
| maksimalni koraci | 20000 |
| akumulacija gradijenta | 8, i ne dolazi do trenera |
| dodatne postavke u obrascu | seed, logFreq |
| GPU razina | RTX 4090 or any 24 GB card |
| format skupa podataka | LeRobot v3.0 |
| minimalni broj epizoda | 30 |
Prvo, zadana veličina paketa ovdje je 2, a ne 64 kao u primjeru lerobot dokumentacije, a postavka akumulacije gradijenta se šalje, ali nema učinka za SmolVLA, tako da je stvarna veličina paketa zapravo 2. Povećajte je namjerno umjesto da pretpostavljate da se zadana vrijednost podudara s uzvodnom. Drugo, TinyVLA ovdje uopće nije moguće trenirati.
Pokretanje na razini od 24 GB traje 2 do 5 sati po cijeni od 0.30 do 0.60 USD po satu, otprilike 1 do 3 USD. Na razini A100, politika od ~3 B traje 3 do 6 sati po cijeni od 1.20 do 2.00 USD po satu, otprilike 4 do 12 USD. Pogledajte cijene, i iste operacije iz CLI-ja i MCP poslužitelja.
Kada je mali model pogrešan izbor
Oba su rada ovdje pažljivija nego što su sažeci. Analiza neuspjeha TinyVLA-e je specifična: varijanta od 0,4 B tri je puta pogriješila u čitanju uputa, što autori pripisuju ograničenom jezičnom razumijevanju u manjem VLM-u, a taj je način nestao kod 1,3 B. SmolVLA pokazuje istu krivulju s drugog kraja: verzija identične arhitekture od 2,25 B postiže 88,75 na LIBERO-u i 68,24 na Meta-Worldu, naspram 87,3 i 57,3 za model od 0,45 B.
- Stane na karticu od 24 GB, što smanjuje trošak eksperimenta s desetaka dolara na nekoliko.
- Dovoljno brz za rad pored ruke, tako da nema mrežnog skoka u kontrolnoj petlji.
- Fino se podešava na podacima koje jedna osoba može snimiti, deseci epizoda umjesto tisuća.
- Težine, popis podataka i kod SmolVLA-e su javni, tako da se loš rezultat može otkloniti.
- Slabije praćenje uputa: manje jezičnih parametara, manja sposobnost razdvajanja sličnih referentnih izraza.
- Manja prostorna i vizualna generalizacija na postavke koje niste snimili.
- Osjetljiviji na nedostatke skupa podataka, s manje prethodne obuke na koju se može osloniti.
- Višezadaćni rad i rad s dugim horizontom i dalje favoriziraju veće modele, uključujući vlastitu varijantu SmolVLA-e od 2,25 B.
Usporedba koju vrijedi provesti nije TinyVLA protiv SmolVLA. To je SmolVLA protiv ACT na vašem vlastitom zadatku, a rad o SmolVLA je argument zašto. Treniran s jednim zadatkom bez predobuke za robotiku, SmolVLA je postigao prosjek od 40,0 na tri SO-100 zadatka gdje je ACT s jednim zadatkom postigao 48,3. Ono što ga podiže na 78,3 je predobuka u zajednici plus višenamjenska obuka, a ne samo arhitektura. Na SO-101 lego zadatku, oba s jednim zadatkom, SmolVLA pobjeđuje: 90 protiv 70 u distribuciji. Zatim SmolVLA protiv Pi0.5 ako budžet dopušta.
Manje je predobuke za pokrivanje loših podataka, pa čista krivulja gubitka na neispravnom skupu podataka daje vam politiku koja pouzdano reproducira kvar. Dokumentacija lerobota je izravna o strukturi: 50 epizoda na 5 pozicija kocke, 10 po poziciji, funkcioniralo je; 25 nije. Ako gubitak izgleda dobro, a ruka ne radi ništa korisno, počnite s gubitak pada, politika ne radi ništa, politika radi samo u jednoj postavci ili prikupljanje VLA podataka za obuku koji su zapravo upotrebljivi.
Pet politika, jedna usporedna tablica
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT sa stvarnim brojem parametara, latencijom zaključivanja po koraku akcije, razinom GPU-a koju svaki treba i minimalnim brojem epizoda prije nego što učini nešto korisno.
Usporedite politikeTablica odluka na koju možete djelovati
| Vaša situacija | Počnite s | Zašto |
|---|---|---|
| Jedan zadatak, dobre demonstracije, bez jezika | ACT | ~80 M, 20 ms, 24 GB kartica, nema osnovnog modela za preuzimanje |
| Nekoliko povezanih zadataka, po jedna instrukcija | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| Specifično reproduciranje rezultata TinyVLA | TinyVLA-B or TinyVLA-H | The repo is the only route: isolated env, converted data |
| Više zadataka, razne instrukcije, A100 budžet | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run |
| Još nema robota | Upravljajte stvarnom rukom | Živa ruka temeljena na redu čekanja ne zahtijeva prijavu niti hardver |
Za zadnji redak, ruka uživo prenosi fizički SO-100 kojim možete upravljati iz preglednika bez računa, a tri načina za početak pokriva ostalo. SO-100 je referentna ruka ovdje, otprilike 110 do 150 EUR u dijelovima, s potpunim vodičem za postavljanje.
Što dolazi nakon modela ispod 1 B
Smanjenje broja parametara jedan je od načina da se VLA učini jeftinim i ne nužno pobjedničkim. OpenVLA-OFT (arXiv 2502.19645) zadržava okosnicu od 7 B i mijenja samo način dekodiranja akcija, izvještavajući o 26x povećanju propusnosti generiranja akcija i porastu LIBERO-a sa 76.5 na 97.1 posto. BitVLA (arXiv 2506.07530) čini svaku težinu 1-bitne BitNet b1.58 2B4T okosnice ternarnom, izvještavajući o 11.0x manjoj memoriji i 4.4x manjoj latenciji od kraja do kraja, dok se podudara s punopreciznim OpenVLA-OFT-om. X-VLA-0.9B (arXiv 2510.10274) nalazi se na liniji od 1 B s usklađivanjem toka.
Zajednička nit: dekoder akcija, a ne jezični model, je mjesto gdje se nalazi latencija. Pitajte kako politika emitira akcije prije nego što pitate koliko parametara ima. arena ima 85 modela i 332 rezultata, svaki povezan sa svojim izvorom; širi pregled nalazi se u našem VLA uvodu.
Mogu li fino podesiti SmolVLA na RTX 4090?▾
Da. SmolVLA ima 450 M parametara i AY-Robots ga pokreće na razini RTX 4090 / 24 GB. Primjer lerobot koristi --batch_size=64, što je primjer, a ne jamstvo za vašu karticu; dokumentacija savjetuje da počnete s malim i povećavate dok su vremena učitavanja kratka. Očekujte dulje od otprilike 4 sata koje dokumentacija navodi za 20000 koraka na A100.
Je li TinyVLA dostupan u lerobotu ili na AY-Robots?▾
Ne za oboje. TinyVLA postoji samo u svom istraživačkom repozitoriju, zadnji commit 11. ožujka 2025., a njegov format je HDF5 u ACT stilu, a ne LeRobot. AY-Robots trenira GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT. Ako želite TinyVLA, morate ga sami izgraditi, a prvo ćete morati popraviti putanju DeepSpeed konfiguracije u scripts/train.sh.
Je li model od 450 M zaista konkurentan onom od 3 B?▾
Prema vlastitim mjerilima autora, da: 87.3 naspram 86.0 na LIBERO-u u usporedbi s Pi0 prethodno obučenim za robotiku na 3.3 B, i 78.3 naspram 61.7 na tri stvarna SO-100 zadatka gdje isti rad označava Pi0 na 3.5 B. Ograničenje je u istom radu: za jedan zadatak bez prethodne obuke za robotiku, SmolVLA pada na 40.0, ispod ACT-ovih 48.3.
Koliko epizoda mi je potrebno prije nego što mali VLA nešto učini?▾
AY-Robots postavlja minimum za SmolVLA na 30 epizoda, a za ACT na 50. Dokumentacija lerobot preporučuje oko 50 i izvještava da 25 nije bilo dovoljno za isti zadatak. Struktura je jednako važna kao i broj: skup u radu koristio je 5 pozicija kocke s po 10 epizoda.
Zašto se objavljeni brojevi latencije toliko razlikuju?▾
Mjere različite stvari. TinyVLA izvještava 14 ms po predviđanju akcije na A6000; AY-Robots navodi SmolVLA na 245 ms i ACT na 20 ms po koraku akcije. Neke brojke pokrivaju jedan prolaz naprijed, neke dijele prolaz preko bloka od 50 akcija, a gotovo nijedna ne uključuje snimanje kamere ili zapisivanje na servo motore.
Rješava li zaključivanje u oblaku problem s GPU-om?▾
Djelomično. AY-Robots automatski osigurava pod koji služi politiku dok lokalni klijent komunicira s tom krajnjom točkom, s nadzornikom mirovanja tako da se sam uništi umjesto da tiho naplaćuje. Ne može ukloniti povratno putovanje javnim internetom, a kontrolna petlja je već 20 do 485 ms po koraku akcije. Dobro za sporo uzimanje i postavljanje, ne za brzo reaktivno kretanje.
Sources
- TinyVLA: Prema brzim, podatkovno učinkovitim vizualno-jezično-akcijskim modelima za robotsku manipulaciju
- Službeni repozitorij koda TinyVLA (README, requirements.txt, scripts/train.sh)
- Projektna stranica TinyVLA
- lesjie/Llava-Pythia-1.3B, težine okosnice TinyVLA-H
- SmolVLA: Vizualno-jezično-akcijski model za pristupačnu i učinkovitu robotiku
- lerobot dokumentacija: fino podešavanje SmolVLA
- lerobot: configuration_smolvla.py, zadane postavke SmolVLA
- lerobot/smolvla_base kartica modela
- SmolVLA: Učinkovit vizualno-jezično-akcijski model (Hugging Face blog)
- lerobot na PyPI (0.6.1, zahtijeva Python 3.12 ili noviji)
- OpenVLA: Vizualno-jezično-akcijski model otvorenog koda
- Fino podešavanje vizualno-jezično-akcijskih modela: Optimizacija brzine i uspjeha (OpenVLA-OFT)
- BitVLA: 1-bitni vizualno-jezično-akcijski modeli za robotsku manipulaciju
- X-VLA: Transformator s mekim upitima kao skalabilni vizualno-jezično-akcijski model za različite inkarnacije
- rail-berkeley/octo-small-1.5 kartica modela (27 M parametara)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started