
TinyVLA in SmolVLA omogočata delujoč VLA pod 1 milijardo parametrov. Realne številke iz obeh člankov, privzete nastavitve lerobot, izmerjena latenca in stroški izvajanja na kartici z 24 GB.
Skoraj vsak vizualno-jezikovni-akcijski model o katerem se piše, predpostavlja kartico podatkovnega centra. OpenVLA ima 7 B parametrov. GR00T N1.7 in Pi0.5 imata okoli 3 B parametrov in za fino učenje potrebujeta A100 80 GB. Če je kartica na vaši mizi 4090, je ta razred modelov nedosegljiv.
Dva članka trdita, da ga ne potrebujete. TinyVLA (arXiv 2409.12514, sprejet s strani IEEE Robotics and Automation Letters februarja 2025) gradi VLA iz hrbtenice od 400 M do 1.3 B plus difuzijsko akcijsko glavo. SmolVLA (arXiv 2506.01844, oddano 2. junija 2025) ponuja 450 M parametrov z odprtimi utežmi, odprtimi podatki in skripto, ki se izvaja na eni potrošniški kartici. Tukaj je, kaj sta oba izmerila in kje argument pod 1 B preneha veljati.
Kaj morate vedeti
- •TinyVLA je na voljo v treh velikostih: 422 M skupno s 101 M učljivih, 740 M s 138 M, 1.3 B s 143 M. Le prvi dve sta pod 1 B.
- •Njegova Tabela IV meri 14 ms na predikcijo akcije za TinyVLA-1B na eni A6000, v primerjavi z 292 ms za OpenVLA-7B in 140 ms za pomanjšan OpenVLA-1B.
- •Glavna komponenta ohranja to hitrost, ne hrbtenica: zamenjajte difuzijsko glavo TinyVLA-H z glavo ACT in pet nalog na realnem robotu pade iz povprečja 94.0 v enomestne številke. Glava MLP doseže 0 povsod.
- •SmolVLA ima 450 M parametrov, od tega približno 100 M akcijskega strokovnjaka, predhodno usposobljenega na 481 skupnostnih LeRobot naborih podatkov in 10.6 M sličicah. Poroča 87.3 na LIBERO v primerjavi z 86.0 za Pi0, predhodno usposobljenega za robotiko, pri 3.3 B, in 78.3 na treh realnih nalogah SO-100 v primerjavi z 61.7 za Pi0 pri 3.5 B.
- •Usposobljen za eno nalogo brez predhodnega usposabljanja, SmolVLA pade na 40.0 pri teh nalogah, pod ACT-jevih 48.3. Majhno ni samodejno enostavno.
- •TinyVLA nima integracije LeRobot in uporablja sklad CUDA 11.7. SmolVLA je v lerobot in stane približno 1 do 3 USD na zagon na ravni 24 GB tukaj.
Kaj dejansko šteje kot majhen VLA
Število parametrov na kartici modela ni eno samo število. Lahko pomeni skupno število uteži, uteži naložene med sklepanjem, ali uteži, ki prejemajo gradiente med . TinyVLA poroča o obeh, in razlika je velika: TinyVLA-H ima skupno 1.3 B, vendar 143 M učljivih, ker vizualni stolp in večina jezikovnega modela ostaneta zamrznjena, medtem ko se LoRA adapterji in akcijska glava premikajo. Članek navaja, da je delež učljivih približno 5 odstotkov.
| Model | Parametri | Hrbtenica | Akcijska glava | Vir |
|---|---|---|---|---|
| TinyVLA-S | 422 M skupno, 101 M učljivih | Llava-Pythia ~400 M | Difuzija (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M skupno, 138 M učljivih | Llava-Pythia ~700 M | Difuzija | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B skupno, 143 M učljivih | Llava-Pythia ~1.3 B | Difuzija | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M akcijski strokovnjak | SmolVLM2-500M-Video-Instruct | Strokovnjak za ujemanje toka | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Difuzija | octo-small-1.5 card |
| ACT | ~80 M | ResNet, brez jezikovnega modela | Neposredna regresija kosov | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Avtoregresivni akcijski žetoni | arXiv 2406.09246 |
O dveh vrsticah je vredno razpravljati. pri približno 80 M je manjši od vsega ostalega tukaj, vendar nima jezikovnega modela, zato ni VLA: nauči se ene naloge in mu ni mogoče ukazati, naj naredi drugo. pri 27 M je pogojen preko besedilnega kodirnika T5-Base, ne pa hrbtenice LLM. Dobre izhodiščne točke, vendar nobena ne zagotavlja sledenja navodilom, ki jih nakazuje oznaka.
TinyVLA-H, različica, ki prinaša glavne rezultate, ima 1.3 B in je nad to mejo. Boljše vprašanje je, ali se model med usposabljanjem prilega v 24 GB in doseže vašo kontrolno hitrost med sklepanjem. Pet politik, ki jih lahko tukaj usposabljate, je na strani s politikami; TinyVLA ima vnos v areni, če želite njegove številke poleg vseh ostalih.
TinyVLA: hitrost prihaja iz glave, ne iz hrbtenice
Očitna razlaga je, da so zmanjšali jezikovni model, zato je postal hitrejši. Ablacijska študija v članku pravi drugače. Zamenjava hrbtenice OpenVLA s 7 B za približno 1 B je zmanjšala predvidevanje na dejanje z 292 ms na 140 ms, kar je 2-kratna izboljšava. TinyVLA-H, s primerljivim številom parametrov, deluje pri 14 ms na isti kartici. Drugih 10-krat je glava za dejanja.
| Model | Predvidevanje na dejanje | Izmerjeno na |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA oddaja dejanja kot diskretizirane žetone skozi glavo jezikovnega modela, enega na dimenzijo dejanja, avtoregresivno. TinyVLA priključi difuzijski dekoder, ki proizvede celoten blok v enem posnetku. Tabela V prikazuje arhitekturo pri TinyVLA-H in zamenja samo glavo, na istih petih nalogah s pravimi roboti. To je najčistejši dokaz v obeh člankih za argument, ki ga podpirajo politike ujemanje toka, in razlog, zakaj se je Pi0 oddaljil od dekodiranja žetonov.
| Glava na TinyVLA-H | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Difuzija (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Transformator za razdeljevanje dejanj | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Večplastni perceptron | 0 | 0 | 0 | 0 | 0 |
Številke 292 / 140 / 14 ms so iz tabele IV, vse na enem A6000. Nanašajo se na predikcijo posameznega dejanja in izključujejo zajemanje kamere, predprocesiranje in serijski zapis na servomotorje. Obravnavajte objavljeno latenco kot spodnjo mejo, nikoli kot kontrolno hitrost. Naše lastne številke imajo enako omejitev: glejte latenco sklepanja.
Kaj je dosegel TinyVLA
| Merilo uspešnosti | Protokol | TinyVLA-H | Osnovne linije |
|---|---|---|---|
| MetaWorld, 50 nalog, simulacija | Večopravilno, 50 demonstracij, 3 semena | 77.6 / 21.5 / 11.4 / 15.8 po težavnosti, povprečje 31.6 | Povprečje politike difuzije 10.5 |
| Pravi Franka Panda, 5 nalog | 100 trajektorij na nalogo, 20 poskusov | 94.0 povprečno | OpenVLA 68.3, Politika difuzije 35.3 |
| Dvoročni UR5, 3 naloge | Večopravilno, 10 poskusov na nalogo | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Politika difuzije 40.3 / 31.3 / 43.0 |
Bimanualna vrstica ima dolgočasno razlago, ki jo podaja sam članek: OpenVLA je predhodno usposobljen na Open X-Embodiment, ki je v celoti sestavljen iz podatkov z eno roko, zato je akcijski prostor z dvema rokama izven distribucije in dosega nič točk. Osnovna linija difuzijske politike premaga TinyVLA-H pri dveh od teh treh nalog. Ozadje v zapisu o Open X-Embodiment.

Repozitorij TinyVLA, stanje avgust 2026
Članek je dober. Koda je raziskovalni izdelek. Repozitorij je github.com/liyaxuanliyaxuan/TinyVLA; njegov README datira izdajo kode na 17. februar 2025, zadnja potrditev pa je 11. marec 2025. Dobro za reprodukcijo članka, problematično, če bi želeli vzdrževano knjižnico.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .Datoteka requirements.txt določa torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 in sklad CUDA na 11.x kolesca: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. Datoteka README zahteva Python 3.10; lerobot 0.6.1 zahteva 3.12 ali novejše, zato okolji ne moreta biti skupni. Najprej preverite, ali obstaja različica torch 2.0.1 za vašo generacijo GPU-ja. Če se izvajanje namesto tega ustavi zaradi pomanjkanja VRAM-a, je kontrolni seznam za pomanjkanje pomnilnika hitrejši od ugibanja.
TinyVLA prav tako ne bere naborov podatkov LeRobot. Njegov format je HDF5 v slogu ACT: action, language_raw in skupina opazovanj z večpoglednimi slikami, joint_positions, qpos in qvel. Repozitorij vsebuje data_utils/rlds_to_h5py.py za vnos RLDS, in vsaka naloga je ročno registrirana v aloha_scripts/constants.py z njenim dataset_dir, episode_len in camera_names. Če so vaši epizode prišle iz lerobot ali namiznega odjemalca, ste odgovorni za pretvorbo.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 predpostavlja vozlišče z osmimi karticami. Nastavite ga na 1 in zmanjšajte velikost paketa precej pod 32. Nobena različica za eno grafično kartico ni dobavljena navzgor, zato ukaza ni mogoče zagnati dobesedno na 4090.
- --deepspeed scripts/zero2.json kaže na datoteko, ki ni v korenskem imeniku scripts. Konfiguracije DeepSpeed so dobavljene na llava-pythia/scripts/zero2.json. Popravite pot pred prvim zagonom.
- README zahteva, da ime izhodnega imenika vsebuje llava_pythia, plus lora, če je omogočen LoRA.
- Hrbtenica je ločen prenos: lesjie/Llava-Pythia-400M, -700M ali -1.3B. Ni ene same osnovne kontrolne točke, na katero bi usmerili politiko, kot usmerite na lerobot/smolvla_base.
SmolVLA: model pod 1 B, ki ga lahko zaženete danes popoldne
SmolVLA podaja enak argument znotraj vzdrževane knjižnice. Ima 450 M parametrov na hrbtenici SmolVLM2-500M-Video-Instruct, učinkovitost pa izhaja iz nastavitev, ki jih lahko preberete iz configuration_smolvla.py, namesto iz trditve o majhnosti.
| Nastavitev v configuration_smolvla.py | Privzeto | Kaj pridobite |
|---|---|---|
| num_vlm_layers | 16 | Izvaja se le prvih 16 plasti jezikovnega modela |
| expert_width_multiplier | 0.75 | Skrita velikost akcijskega strokovnjaka je 75 odstotkov VLM-ja |
| self_attn_every_n_layers | 2 | Samopozornost prepletena s križno pozornostjo |
| chunk_size / n_action_steps | 50 / 50 | En prehod odda 50 dejanj in vseh 50 se izvede |
| num_steps | 10 | Odstranjevanje šuma s tokom ujemanja fiksirano na 10 korakov |
| tokenizer_max_length | 48 | Navodilo je skrajšano na 48 žetonov |
| freeze_vision_encoder / train_expert_only | True / True | Fino uglaševanje premika strokovnjaka, ne vizualnega stolpa |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Ni recept iz članka: njegovo predhodno usposabljanje je uporabilo 100-korakovno ogrevanje čez 200000 korakov |
Predhodno usposabljanje je uporabilo 481 skupnostnih podatkovnih nizov LeRobot, 22.9 K epizod in 10.6 M sličic na 4 GPU-jih, 200000 korakov pri globalni seriji 256; članek ocenjuje celoten projekt na približno 30 K GPU ur. Ena številka, na katero je treba biti pozoren: blog o lansiranju Hugging Face navaja 487 kuriranih podatkovnih nizov, medtem ko tabela v članku navaja 481. Uporabljamo številko iz članka in opozarjamo na neskladje.

| Merilo | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO povprečje, večopravilno | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World povprečje, večopravilno | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Pravi SO-100, 3 naloge, večopravilno usposabljanje | 78.3 | - | 61.7 (3.5 B) | - |
| Pravi SO-100, 3 naloge, eno-opravilno, brez predhodnega usposabljanja za robotiko | 40.0 | - | - | 48.3 |
| SO-101 lego pobiranje-postavljanje, eno-opravilno, znotraj distribucije | 90 | - | - | 70 |
| SO-101 lego pobiranje-postavljanje, eno-opravilno, zunaj distribucije | 50 | - | - | 40 |
LIBERO je simulacija in vse kompetentne rešitve tam zdaj dosegajo rezultate v osemdesetih. Vrstica za pravi SO-100, kjer model 450 M premaga model 3.5 B za 16.6 točk, je zanimiva; vrstica pod njo je protiutež. Če odstranimo skupnostno predhodno usposabljanje in večopravilno usposabljanje, isti model pade na 40.0, pod ACT. Obrambna trditev je, da majhen model ni avtomatsko slabši, ne pa, da je boljši.
Ena naključna ugodnost: tabela Meta-World v članku o SmolVLA vsebuje objavljene številke TinyVLA kot izhodišče, tako da sta tokrat oba modela v eni tabeli, SmolVLA-0.45B pri 57.3 proti TinyVLA-H pri 31.6. Poroča tudi, da je usposabljanje SmolVLA približno 40 odstotkov hitrejše od Pi0 na 6-krat manj pomnilnika. Vse to prihaja od avtorjev SmolVLA; vnos v areni povezuje vsako vrednost z njenim virom.
Kje SmolVLA porabi svoj čas
AY-Robots navaja SmolVLA pri 245 ms na korak dejanja in ACT pri 20 ms v katalogu politik. TinyVLA poroča 14 ms na napoved dejanja. Te številke niso primerljive, in obravnavanje, kot da bi bile, je najpogostejša napaka na tem področju: nekateri merijo čas enega prehoda naprej, nekateri pa ta prehod razdelijo čez kos, ko ga razdelitev dejanj na kose amortizira.
- SmolVLA odda 50 dejanj na prehod naprej in izvede vseh 50. Pri 30 sličicah na sekundo, ki jih članek uporablja na resničnih robotih, eno sklepanje pokriva približno 1.7 sekunde gibanja.
- Asinhrono sklepanje izračuna naslednji kos, medtem ko se trenutni še izvaja: 9.7 s povprečnega časa dokončanja naloge proti 13.75 s sinhronnega, približno 30 odstotkov hitreje, in 19 ciklov pobiranja in odlaganja v fiksnem 60-sekundnem oknu proti 9.
- Stopnje uspešnosti so bile primerljive, ne pa boljše, 78.3 sinhrono proti 73.3 asinhrono. Asinhronost kupuje prepustnost, ne natančnost.
- Razdelitev na kose skriva latenco izračuna, ne latence omrežja, in zmanjšuje reaktivnost politike, ker je zavezana 50 dejanjem.
AY-Robots lahko samodejno zagotovi pod GPU v oblaku, ki služi vaši politiki, medtem ko lokalni robotski odjemalec komunicira s to končno točko, pod pa vsebuje nadzorni mehanizem za mirovanje, tako da se uniči sam, namesto da bi tiho zaračunaval. Kar pa ne stori, je odstranitev povratnega potovanja prek javnega interneta. Krmilna zanka pri petih politikah tukaj je od 20 do 485 ms na korak dejanja, preden se sploh vzpostavi kakršno koli omrežje, zato je oddaljeno sklepanje izvedljivo za počasno pobiranje in odlaganje, ne pa za hitro reaktivno gibanje.

Fino uglaševanje SmolVLA na eni potrošniški kartici
Ročna pot, na lerobot 0.6.1, trenutni izdaji PyPI z dne 23. avgusta 2026. Vse spodaj izhaja iz dokumentacije Hugging Face lerobot SmolVLA, pridobljene istega dne; vodena različica je nežnejša.
- 1Namestite lerobot z dodatkom smolvla
Odvisnosti SmolVLA so izbirni dodatek in niso del osnovne namestitve. Namestitev brez njih in nato spraševanje, zakaj je tip politike neznan, je pogosto izgubljena pol ure.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Pridobite nabor podatkov z dovolj epizodami
Dokumentacija priporoča okoli 50 epizod in navaja, da ista naloga s 25 ni bila dovolj. AY-Robots določa minimum pri 30. Posnemite svoje ali začnite iz imenika naborov podatkov.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Začnite fino uglasitev
Ukaz iz lerobot vodnika, nespremenjen. Dokumentacija navaja 20000 korakov kot približno 4 ure na enem A100. Na 24 GB kartici pričakujte daljši čas in ga izmerite.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Zmanjšajte velikost paketa, dokler se ne prilega
batch_size=64 je dokumentiran primer, ne obljuba glede vaše kartice. Dokumentacija svetuje začetek z majhno vrednostjo in povečevanje, dokler so časi nalaganja kratki.
bashlerobot-train --help - 5Uporabite kontrolno točko na roki
Ista knjižnica, en ukaz. Zastavice za razdeljevanje v realnem času so v dokumentaciji zakomentirane in so tiste, ki jih je treba uporabiti na strojni opremi z nizko porabo energije.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Ne glede na pot, ki jo izberete, boste dobili kontrolno točko in konfiguracijo, ki jo je ustvarila. Zraven shranite revizijo nabora podatkov, število korakov in seme. lerobot privzeto uporablja seme 1000; vstopna točka za fino uglasitev GR00T ne razkriva nobenega semena, zato ti zagoni niso bitno ponovljivi. Mehanika v dokumentaciji za usposabljanje.
Dva načina za namestitev majhnega VLA na roko
Vi ste lastnik stroja in načinov odpovedi. Za SmolVLA je to smiselno: en pip dodatek, en ukaz za usposabljanje, en ukaz za izvedbo. Za TinyVLA je to raziskovalna reprodukcija z zamrznjenimi pini, pokvarjeno potjo DeepSpeed in pretvorbo podatkov, ki jo napišete sami.
- Priskrbite si 24 GB kartico, posnemite 30 do 50 epizod, preverite video tokove kamere sličico za sličico.
- pip install -e ".[smolvla]", lerobot-train proti lerobot/smolvla_base, nato pa postrezite kontrolno točko na stroju, v katerega je priključena roka.
- Za TinyVLA: ločeno conda okolje, pretvorite podatke v HDF5, registrirajte nalogo v constants.py, popravite pot zero2.json, zmanjšajte train.sh z osmih GPU-jev na enega.
- Brez urnega obračunavanja, ko je kartica plačana.
- Inferenca je poleg servomotorjev, edini način za hitro krmilno zanko.
- Lahko popravite kodo politike, in TinyVLA je na voljo samo na ta način.
- 4090 izključuje vsako ~3 B politiko, zato ni lokalne primerjave z GR00T N1.7 ali Pi0.5.
- Nastavitev okolja je pravo delo. Samo pini TinyVLA lahko stanejo en dan.
- Brez čakalne vrste, brez ponovnega poskusa, brez shranjevanja kontrolnih točk. Ponovni zagon pri koraku 14000 pomeni začetek znova.
SmolVLA je ena izmed petih politik tukaj. Model in nabor podatkov izberete v obrazcu, zaledje najame GPU glede na zahtevani VRAM, zažene trenerja in zapiše kontrolne točke v shrambo objektov. Korak za korakom: SmolVLA na SO-100, ali celotno matriko na strani za usposabljanje.
| Kaj platforma pošlje za SmolVLA | Vrednost |
|---|---|
| batch size | 2 |
| learning rate | 1e-4 |
| max steps | 20000 |
| gradient accumulation | 8, and it does not reach the trainer |
| extra knobs in the form | seed, logFreq |
| GPU tier | RTX 4090 or any 24 GB card |
| dataset format | LeRobot v3.0 |
| minimum episodes | 30 |
Prvič, privzeta velikost paketa tukaj je 2, ne 64 kot v primeru dokumentacije lerobot, in nastavitev gradientne akumulacije je poslana, vendar nima učinka za SmolVLA, tako da je dejanski paket res 2. Povečajte ga namerno, namesto da bi predvidevali, da se privzeta vrednost ujema z izvirno. Drugič, TinyVLA tukaj sploh ni mogoče usposabljati.
Zagon na 24 GB nivoju traja 2 do 5 ur po 0.30 do 0.60 USD na uro, približno 1 do 3 USD. Na A100 nivoju ~3 B politika traja 3 do 6 ur po 1.20 do 2.00 USD na uro, približno 4 do 12 USD. Glejte cene, in iste operacije iz CLI in strežnika MCP.
Ko je majhen model napačna izbira
Oba članka sta tukaj bolj previdna kot povzetki. Analiza napak TinyVLA je specifična: različica 0,4 B je trikrat spodletela zaradi napačnega branja navodil, kar avtorji pripisujejo omejenemu razumevanju jezika v manjšem VLM, in ta način je izginil pri 1,3 B. SmolVLA prikazuje isto krivuljo z drugega konca: različica 2,25 B identične arhitekture dosega 88,75 na LIBERO in 68,24 na Meta-World proti 87,3 in 57,3 za model 0,45 B.
- Ustreza 24 GB kartici, kar zniža stroške eksperimenta z deset dolarjev na nekaj.
- Dovolj hiter za delovanje ob roki, tako da ni omrežnega skoka v krmilni zanki.
- Fino se nastavi na podatke, ki jih lahko posname ena oseba, na desetine epizod namesto na tisoče.
- Teže, seznam podatkov in koda SmolVLA so javni, zato je slab rezultat mogoče odpraviti.
- Slabše sledenje navodilom: manj jezikovnih parametrov, manjša sposobnost ločevanja podobnih referenčnih izrazov.
- Manjša prostorska in vizualna generalizacija na nastavitve, ki jih niste posneli.
- Bolj občutljiv na napake v naboru podatkov, z manj predhodnega predhodnega usposabljanja, na katerega bi se lahko zanašal.
- Večopravilno in dolgoročno delo še vedno daje prednost večjim modelom, vključno z lastno različico SmolVLA 2,25 B.
Primerjava, ki jo je vredno izvesti, ni TinyVLA proti SmolVLA. Je SmolVLA proti ACT na vaši lastni nalogi, in članek SmolVLA je argument, zakaj. Usposobljen za eno nalogo brez predhodnega usposabljanja za robotiko, je SmolVLA dosegel povprečno 40,0 na treh nalogah SO-100, kjer je enojna naloga ACT dosegla 48,3. Kar ga dvigne na 78,3, je predhodno usposabljanje skupnosti plus večopravilno usposabljanje, ne samo arhitektura. Pri nalogi SO-101 lego, obe enojni nalogi, SmolVLA zmaga: 90 proti 70 v distribuciji. Nato SmolVLA proti Pi0.5 če proračun dopušča.
Manj je predhodnega predhodnega usposabljanja za pokrivanje slabih podatkov, zato čista krivulja izgube na okvarjenem naboru podatkov zagotavlja politiko, ki samozavestno reproducira napako. Dokumentacija lerobot je neposredna glede strukture: 50 epizod na 5 položajih kocke, 10 na položaj, je delovalo; 25 ni. Če je izguba videti v redu in roka ne dela nič koristnega, začnite pri izguba pade, politika ne dela nič, politika deluje samo v eni nastavitvi ali zbiranje dejansko uporabnih podatkov za usposabljanje VLA za manipulacijo robotov.
Pet politik, ena primerjalna tabela
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA in ACT z realnimi štetji parametrov, zakasnitvijo sklepanja na korak dejanja, nivojem GPU, ki ga vsak potrebuje, in minimalnim številom epizod, preden začne delovati koristno.
Primerjaj politikeTabela odločitev, po kateri lahko ukrepate
| Vaša situacija | Začnite z | Zakaj |
|---|---|---|
| Ena naloga, dobre demonstracije, brez jezika | ACT | ~80 M, 20 ms, 24 GB kartica, brez osnovnega modela za prenos |
| Nekaj sorodnih nalog, vsaka z enim navodilom | SmolVLA | 450 M, v lerobot, najmanj 30 epizod, 1 do 3 USD na zagon |
| Posebno reproduciranje rezultata TinyVLA | TinyVLA-B ali TinyVLA-H | Repozitorij je edina pot: izolirano okolje, pretvorjeni podatki |
| Večopravilnost, različna navodila, proračun A100 | GR00T N1.7 ali Pi0.5 | ~3 B, 152 ms in 485 ms na korak, 4 do 12 USD na zagon |
| Še ni robota | Upravljajte pravo roko | Živa roka na podlagi čakalne vrste ne potrebuje prijave in strojne opreme |
Za zadnjo vrstico, živa roka pretaka fizični SO-100, ki ga lahko upravljate iz brskalnika brez računa, in trije načini za začetek pokriva ostalo. SO-100 je referenčna roka tukaj, približno 110 do 150 EUR v delih, s celotnim vodnikom za namestitev.
Kaj sledi modelom pod 1 B
Zmanjšanje števila parametrov je eden od načinov, kako narediti VLA poceni, vendar ni očitno zmagovalen. OpenVLA-OFT (arXiv 2502.19645) ohranja 7 B hrbtenico in spreminja le način dekodiranja dejanj, pri čemer poroča o 26-kratnem povečanju prepustnosti generiranja dejanj in dvigu LIBERO iz 76,5 na 97,1 odstotka. BitVLA (arXiv 2506.07530) naredi vsako utež 1-bitne BitNet b1.58 2B4T hrbtenice ternarno, pri čemer poroča o 11,0-krat manj pomnilnika in 4,4-krat nižji celoviti zakasnitvi, medtem ko se ujema s polno natančnostjo OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) se nahaja na liniji 1 B z ujemanje toka.
Skupna nit: dekoder dejanj, ne jezikovni model, je tisto, kjer se nahaja zakasnitev. Vprašajte, kako politika oddaja dejanja, preden vprašate, koliko parametrov ima. arena ima 85 modelov in 332 rezultatov, vsak povezan s svojim virom; širši pregled je na voljo v našem uvodu v VLA.
Ali lahko fino uglasim SmolVLA na RTX 4090?▾
Da. SmolVLA ima 450 M parametrov in AY-Robots ga poganja na nivoju RTX 4090 / 24 GB. Primer lerobot uporablja --batch_size=64, kar je primer in ne garancija za vašo kartico; dokumentacija svetuje, da začnete z majhnim in povečujete, dokler so časi nalaganja kratki. Pričakujte daljše čase kot približno 4 ure, ki jih dokumentacija navaja za 20000 korakov na A100.
Ali je TinyVLA na voljo v lerobot ali na AY-Robots?▾
Ne za oboje. TinyVLA obstaja samo v svojem raziskovalnem repozitoriju, zadnji commit 11. marca 2025, in njegov format je HDF5 v slogu ACT namesto LeRobot. AY-Robots trenira GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA in ACT. Če želite TinyVLA, ga morate zgraditi sami, in najprej boste morali popraviti pot do konfiguracije DeepSpeed v scripts/train.sh.
Ali je model s 450 M parametri resnično konkurenčen modelu s 3 B parametri?▾
Po lastnih merilih avtorjev, da: 87.3 proti 86.0 na LIBERO v primerjavi z robotiko predhodno usposobljenim Pi0 pri 3.3 B, in 78.3 proti 61.7 na treh resničnih SO-100 nalogah, kjer ista študija označuje Pi0 pri 3.5 B. Omejitev je v isti študiji: pri enojni nalogi brez robotike predhodnega usposabljanja, SmolVLA pade na 40.0, pod ACT-jevih 48.3.
Koliko epizod potrebujem, preden majhen VLA kaj naredi?▾
AY-Robots določa minimum za SmolVLA pri 30 epizodah in minimum za ACT pri 50. Dokumentacija lerobot priporoča okoli 50 in poroča, da 25 ni bilo dovolj za isto nalogo. Struktura je enako pomembna kot število: v študiji so uporabili 5 pozicij kocke z 10 epizodami za vsako.
Zakaj se objavljene številke latence tako zelo razlikujejo?▾
Merijo različne stvari. TinyVLA poroča 14 ms na predikcijo akcije na A6000; AY-Robots navaja SmolVLA pri 245 ms in ACT pri 20 ms na korak akcije. Nekatere številke zajemajo en sam prehod naprej, nekatere delijo prehod čez 50-akcijski blok, in skoraj nobena ne vključuje zajemanja kamere ali zapisa na servomotorje.
Ali sklepanje v oblaku rešuje problem GPU-ja?▾
Delno. AY-Robots samodejno zagotovi pod, ki služi politiki, medtem ko lokalni odjemalec komunicira s to končno točko, z nadzornikom mirovanja, tako da se uniči, namesto da bi tiho zaračunaval. Ne more odstraniti povratnega potovanja preko javnega interneta, in krmilna zanka je že 20 do 485 ms na korak akcije. V redu za počasno pobiranje in odlaganje, ne pa za hitro reaktivno gibanje.
Sources
- TinyVLA: K hitrim, podatkovno učinkovitim vizualno-jezikovno-akcijskim modelom za robotsko manipulacijo
- Uradni repozitorij kode TinyVLA (README, requirements.txt, scripts/train.sh)
- Projektna stran TinyVLA
- lesjie/Llava-Pythia-1.3B, uteži hrbtenice TinyVLA-H
- SmolVLA: Vizualno-jezikovno-akcijski model za cenovno dostopno in učinkovito robotiko
- Dokumentacija lerobot: fino uglaševanje SmolVLA
- lerobot: configuration_smolvla.py, privzete nastavitve SmolVLA
- Kartica modela lerobot/smolvla_base
- SmolVLA: Učinkovit vizualno-jezikovno-akcijski model (blog Hugging Face)
- lerobot na PyPI (0.6.1, zahteva Python 3.12 ali novejši)
- OpenVLA: Odprtokodni vizualno-jezikovno-akcijski model
- Fino uglaševanje vizualno-jezikovno-akcijskih modelov: Optimizacija hitrosti in uspešnosti (OpenVLA-OFT)
- BitVLA: 1-bitni vizualno-jezikovno-akcijski modeli za robotsko manipulacijo
- X-VLA: Transformator z mehkimi pozivi kot razširljiv vizualno-jezikovno-akcijski model za različne izvedbe
- Kartica modela rail-berkeley/octo-small-1.5 (27 M parametrov)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started