
TinyVLA ja SmolVLA paigutavad töötava VLA alla 1 miljardi parameetri. Tegelikud numbrid mõlemast artiklist, lerobot'i vaikeseaded, mõõdetud latentsus ja mida üks käitus 24 GB kaardil maksab.
Peaaegu iga nägemis-keele-tegevuse mudel millest kirjutatakse, eeldab andmekeskuse kaarti. OpenVLA on 7 miljardit parameetrit. GR00T N1.7 ja Pi0.5 on umbes 3 miljardit ja vajavad peenhäälestamiseks A100 80 GB. Kui teie laual olev kaart on 4090, on see mudeliklass kättesaamatu.
Kaks artiklit väidavad, et seda pole vaja. TinyVLA (arXiv 2409.12514, aktsepteeritud IEEE Robotics and Automation Letters poolt veebruaris 2025) ehitab VLA 400 miljonist kuni 1,3 miljardist selgroost pluss difusioonitegevuse pea. SmolVLA (arXiv 2506.01844, esitatud 2. juunil 2025) tarnib 450 miljonit parameetrit avatud kaalude, avatud andmete ja skriptiga, mis töötab ühel tarbijakaardil. Siin on see, mida mõlemad mõõtsid, ja kus alla 1 miljardi argument enam ei kehti.
Mida peate teadma
- •TinyVLA tarnib kolmes suuruses: 422 miljonit kokku 101 miljoni treenitavaga, 740 miljonit 138 miljoniga, 1,3 miljardit 143 miljoniga. Ainult kaks esimest jäävad alla 1 miljardi.
- •Selle tabel IV mõõdab 14 ms tegevuse ennustuse kohta TinyVLA-1B jaoks ühel A6000-l, võrreldes 292 ms OpenVLA-7B ja 140 ms kahandatud OpenVLA-1B jaoks.
- •Seda kiirust hoiab pea, mitte selgroog: vahetage TinyVLA-H difusioonipea ACT pea vastu ja viis reaalse roboti ülesannet langevad 94,0 keskmiselt ühekohalisteks numbritest. MLP pea saab kõikjal 0 punkti.
- •SmolVLA on 450 miljonit, millest umbes 100 miljonit on tegevusekspert, eelkoolitatud 481 kogukonna LeRobot andmestikul ja 10,6 miljonil kaadril. See teatab LIBERO-l 87,3 võrreldes 86,0-ga robootika-eelkoolitatud Pi0-ga 3,3 miljardi juures ja 78,3 kolmel reaalsel SO-100 ülesandel võrreldes 61,7-ga Pi0-ga 3,5 miljardi juures.
- •Ühe ülesande jaoks ilma selle eelkoolituseta treenituna langeb SmolVLA nendel ülesannetel 40,0-le, mis on alla ACT 48,3. Väike ei tähenda automaatselt lihtsat.
- •TinyVLA-l puudub LeRoboti integratsioon ja see kasutab CUDA 11.7 rataste virna. SmolVLA on lerobot-is ja maksab siin 24 GB tasemel umbes 1 kuni 3 USD jooksu kohta.
Mis tegelikult loeb väikeseks VLA-ks
Mudelikaardi parameetrite arv ei ole üks number. See võib tähendada kaalu koguarvu, järeldamise ajal laaditud kaalusid või kaalusid, mis saavad gradienti . TinyVLA raporteerib mõlemat ja vahe on suur: TinyVLA-H on kokku 1,3 B, kuid treenitav on 143 M, sest nägemistorn ja enamik keelemudelist jäävad külmutatuks, samal ajal kui LoRA adapterid ja tegevuspea liiguvad. Artikkel paigutab treenitava osa umbes 5 protsendi juurde.
| Mudel | Parameetrid | Tugivõrk | Tegevuspea | Allikas |
|---|---|---|---|---|
| TinyVLA-S | 422 M kokku, 101 M treenitav | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M kokku, 138 M treenitav | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1,3 B kokku, 143 M treenitav | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M tegevusekspert | SmolVLM2-500M-Video-Instruct | Voolu sobitamise ekspert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S skaala, T5-Base tekstikodeerija | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, keelemudel puudub | Otsene tüki regressioon | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 ja SigLIP kodeerijad | Autoregressiivsed tegevustokenid | arXiv 2406.09246 |
Kaks rida väärivad arutelu. umbes 80 M juures on väiksem kui kõik muu siin, kuid sellel puudub keelemudel, seega ei ole see VLA: see õpib ühe ülesande ja seda ei saa käskida teist teha. 27 M juures on tingitud T5-Base tekstikodeerija kaudu, mitte LLM-i tugivõrgu kaudu. Head baasjooned, kumbki ei anna teile juhiste järgimist, mida silt eeldab.
TinyVLA-H, peamisi tulemusi kandev variant, on 1,3 B ja asub üle joone. Parem küsimus on, kas mudel mahub treeningu ajal 24 GB-sse ja saavutab järeldamise ajal teie kontrollmäära. Viis poliitikat, mida siin treenida saab, on poliitikate lehel; TinyVLA-l on areeni kirje, kui soovite selle numbreid kõigi teiste omade kõrval.
TinyVLA: kiirus tuleb peast, mitte selgroost
Ilmselge tõlgendus on, et nad tegid keelemudeli väiksemaks, nii et see muutus kiiremaks. Artiklis toodud ablatsioonanalüüs ütleb vastupidist. OpenVLA 7 B põhiosa asendamine ligikaudu 1 B suurusega vähendas tegevuse ennustamise aega 292 ms-lt 140 ms-le, mis on 2-kordne kiirendus. TinyVLA-H, võrreldava parameetrite arvuga, töötab samal kaardil 14 ms-ga. Ülejäänud 10-kordne kiirendus tuleb tegevuspeast.
| Mudel | Tegevuse ennustamise aeg | Mõõdetud |
|---|---|---|
| OpenVLA-7B | 292 ms | üks A6000 |
| OpenVLA-1B, põhiosa vahetatud TinyVLA oma vastu | 140 ms | üks A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | üks A6000 |
OpenVLA väljastab tegevusi diskreetsete tokenitena läbi keelemudeli pea, üks tegevusdimensiooni kohta, autoregressiivselt. TinyVLA lisab difusioondekoodri, mis toodab kogu tüki ühe korraga. Tabel V näitab TinyVLA-H arhitektuuri ja vahetab ainult pea, samadel viiel reaalse roboti ülesandel. See on kõige selgem tõend kummaski artiklis argumendi kohta, mida voolu sobitamise poliitikad esitavad, ja põhjus, miks Pi0 loobus tokenite dekodeerimisest.
| TinyVLA-H pea | Aseta tennisepall | Pööra kruusi | Virnasta kuubikuid | Sulge sahtel | Ava karp |
|---|---|---|---|---|---|
| Difusioon (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Tegevuse tükeldamise transformaator | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Mitmekihiline pertseptron | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms näitajad on tabelist IV, kõik ühel A6000-l. Need on tegevuse ennustuse kohta ja ei hõlma kaamera jäädvustamist, eeltöötlust ega jadasalvestust servodele. Käsitlege avaldatud latentsust kui alumist piiri, mitte kunagi kui juhtimiskiirust. Meie enda numbrid kannavad sama piirangut: vaadake järelduse latentsus.
Mida TinyVLA saavutas
| Võrdlustest | Protokoll | TinyVLA-H | Baasjooned |
|---|---|---|---|
| MetaWorld, 50 ülesannet, sim | Mitme ülesande, 50 demo, 3 seemet | 77.6 / 21.5 / 11.4 / 15.8 raskusastme järgi, keskmine 31.6 | Diffusion Policy keskmine 10.5 |
| Päris Franka Panda, 5 ülesannet | 100 trajektoori ülesande kohta, 20 katset | 94.0 keskmine | OpenVLA 68.3, Diffusion Policy 35.3 |
| Kahekäeline UR5, 3 ülesannet | Mitme ülesande, 10 katset ülesande kohta | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Bimanuaalsel real on igav selgitus, mille paber ise annab: OpenVLA on eelkoolitatud Open X-Embodimentil, mis koosneb täielikult ühekäelistest andmetest, seega on kahekäeline tegevusruum jaotusest väljas ja see saab null punkti. Difusioonipoliitika baasjoon ületab TinyVLA-H-d kahel kolmest ülesandest. Taust on Open X-Embodimenti ülevaates.

TinyVLA repo, seisuga august 2026
Paber on hea. Kood on uurimistöö väljalase. Repositoorium on github.com/liyaxuanliyaxuan/TinyVLA; selle README dateerib koodi väljalaske 17. veebruarile 2025 ja viimane commit on 11. märts 2025. Sobib paberi reprodutseerimiseks, probleemiks, kui soovite hooldatud teeki.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt fikseerib torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 ja CUDA virna 11.x ratastele: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README nõuab Python 3.10; lerobot 0.6.1 vajab 3.12 või uuemat, seega ei saa need kaks keskkonda jagada. Veenduge esmalt, et teie GPU generatsioonile on olemas torch 2.0.1 versioon. Kui käitus sureb VRAM-i puuduse tõttu, on mäluprobleemide kontrollnimekiri kiirem kui oletamine.
TinyVLA ei loe ka LeRoboti andmestikke. Selle formaat on ACT-stiilis HDF5: action, language_raw ja vaatluste grupp mitmevaateliste piltide, joint_positions, qpos ja qvel-iga. Repositooriumis on kaasas data_utils/rlds_to_h5py.py RLDS sisendi jaoks ja iga ülesanne registreeritakse käsitsi failis aloha_scripts/constants.py koos oma dataset_dir, episode_len ja camera_names. Kui teie episoodid pärinevad lerobotist või töölauakliendist, siis teisenduse eest vastutate teie.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 eeldab kaheksakaardilist sõlme. Määra see 1-le ja vähenda paketi suurust tunduvalt alla 32. Ühe GPU-ga varianti ei tarnita ülesvoolu, seega ei saa käsku 4090-l sõna-sõnalt käivitada.
- --deepspeed scripts/zero2.json viitab failile, mis ei asu ülemise taseme scripts kataloogis. DeepSpeedi konfiguratsioonid asuvad llava-pythia/scripts/zero2.json. Paranda tee enne esimest käivitust.
- README nõuab, et väljundkataloogi nimi sisaldaks llava_pythia, pluss lora, kui LoRA on lubatud.
- Selgroog on eraldi allalaaditav: lesjie/Llava-Pythia-400M, -700M või -1.3B. Puudub üks baaskontrollpunkt, millele poliitikat suunata, nagu suunaksid lerobot/smolvla_base'ile.
SmolVLA: alla 1 B mudel, mida saad täna pärastlõunal käivitada
SmolVLA esitab sama argumendi hooldatud teegi sees. See on 450 M parameetrit SmolVLM2-500M-Video-Instruct selgrool ja efektiivsus tuleneb seadetest, mida saab lugeda failist configuration_smolvla.py, mitte väitest, et see on väike.
| Seade failis configuration_smolvla.py | Vaikimisi | Mida see annab |
|---|---|---|
| num_vlm_layers | 16 | Käivituvad ainult esimesed 16 keelemudeli kihti |
| expert_width_multiplier | 0.75 | Tegevuseksperdi peidetud suurus on 75 protsenti VLM-i omast |
| self_attn_every_n_layers | 2 | Enesetähelepanu põimitud risttähelepanuga |
| chunk_size / n_action_steps | 50 / 50 | Üks läbimine väljastab 50 tegevust ja kõik 50 täidetakse |
| num_steps | 10 | Voolu sobitamise müra eemaldamine fikseeritud 10 sammuga |
| tokenizer_max_length | 48 | Juhis kärbitakse 48 märgini |
| freeze_vision_encoder / train_expert_only | True / True | Peenhäälestus liigutab eksperti, mitte nägemistorni |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Mitte paberi retsept: selle eelkoolitus kasutas 100-sammulist soojendust üle 200000 sammu |
Eelõpe kasutas 481 kogukonna LeRobot andmestikku, 22,9 K episoodi ja 10,6 M kaadrit 4 GPU-l, 200000 sammu globaalse partii suurusega 256; artikli kohaselt oli kogu projekti maht umbes 30 K GPU tundi. Üks number, mida jälgida: Hugging Face'i käivitusblogi mainib 487 kureeritud andmestikku, samas kui artikli tabelis on 481. Me kasutame artikli numbrit ja märgime lahknevuse.
| Võrdlusalus | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO keskmine, mitmeülesanne | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World keskmine, mitmeülesanne | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Reaalne SO-100, 3 ülesannet, mitmeülesande treening | 78.3 | - | 61.7 (3.5 B) | - |
| Reaalne SO-100, 3 ülesannet, üheülesanne, ilma robootika eelõppeta | 40.0 | - | - | 48.3 |
| SO-101 lego valimine-paigutamine, üheülesanne, jaotuses | 90 | - | - | 70 |
| SO-101 lego valimine-paigutamine, üheülesanne, väljaspool jaotust | 50 | - | - | 40 |
LIBERO on simulatsioon ja kõik pädevad tulemused jäävad seal praegu kaheksakümnendatesse. Reaalne SO-100 rida, kus 450 M mudel edestab 3.5 B mudelit 16.6 punktiga, on huvitav; selle all olev rida on vastukaaluks. Eemaldades kogukonna eelõppe ja mitmeülesande treeningu, langeb sama mudel 40.0-le, jäädes alla ACT-le. Kaitstav väide on, et väike mudel ei ole automaatselt halvem, mitte et see oleks parem.
Üks juhus aitab: SmolVLA artikli Meta-World tabelis on TinyVLA enda avaldatud numbrid baasjoonena, nii et seekord on mõlemad mudelid ühes tabelis, SmolVLA-0.45B 57.3 vastu TinyVLA-H 31.6. Samuti teatatakse, et SmolVLA treenimine on umbes 40 protsenti kiirem kui Pi0, kasutades 6 korda vähem mälu. Kõik see pärineb SmolVLA autoritelt; arena kirje lingib iga väärtuse selle allikaga.
Kus SmolVLA oma aega veedab
AY-Robots loetleb SmolVLA-d 245 ms tegevussammu kohta ja ACT 20 ms kohta poliitikate kataloogis. TinyVLA teatab 14 ms tegevuse ennustuse kohta. Need numbrid ei ole võrreldavad ja nende käsitlemine võrreldavatena on selle teema kõige levinum viga: mõned ajastavad ühe edasisuunalise läbipääsu, mõned jagavad selle läbipääsu tüki peale, kui tegevuste tükeldamine selle amortiseerib.
- SmolVLA väljastab 50 tegevust ühe edasisuunalise läbipääsu kohta ja täidab kõik 50. 30 kaadrit sekundis, mida artikkel reaalsetel robotitel kasutab, katab üks järeldus umbes 1.7 sekundit liikumist.
- Asünkroonne järeldus arvutab järgmise tüki, samal ajal kui praegune veel täitub: 9.7 s keskmine ülesande täitmine võrreldes 13.75 s sünkroonsega, umbes 30 protsenti kiirem, ja 19 korjamis- ja paigutustsüklit fikseeritud 60-sekundilises aknas võrreldes 9-ga.
- Edukad määrad olid pigem võrreldavad kui paremad, 78.3 sünkroonne võrreldes 73.3 asünkroonsega. Asünkroonsus ostab läbilaskevõimet, mitte täpsust.
- Tükeldamine peidab arvutuslatentsust, mitte võrgulatentsust, ja see muudab poliitika vähem reaktiivseks, sest see on pühendunud 50 tegevusele.
AY-Robots suudab automaatselt varustada pilve GPU-podi, mis teenindab teie poliitikat, samal ajal kui kohalik roboti klient suhtleb selle lõpp-punktiga, ja pod sisaldab passiivset valvekoera, nii et see hävitab end ise, selle asemel et vaikselt arveid esitada. Mida see ei tee, on avaliku interneti edasi-tagasi reisi eemaldamine. Juhtimissilmus üle siinsete viie poliitika on 20 kuni 485 ms tegevussammu kohta enne igasugust võrku, seega on kaugjäreldamine teostatav aeglaseks valimiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks.

SmolVLA peenhäälestamine ühel tarbijakaardil
Käsitsi tee, lerobot 0.6.1-l, praegune PyPI väljalase seisuga 23. august 2026. Kõik allolev pärineb Hugging Face lerobot SmolVLA dokumentatsioonist, mis on samal päeval alla laaditud; juhendatud versioon on leebem.
- 1Paigalda lerobot koos smolvla lisaga
SmolVLA sõltuvused on valikuline lisa, mis ei kuulu põhipaigalduse hulka. Paigaldamine ilma nendeta ja seejärel imestamine, miks poliisi tüüp on tundmatu, on tavaline pool tundi kaotatud aega.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Hangi piisava episoodide arvuga andmestik
Dokumentatsioon soovitab umbes 50 episoodi ja märgib, et sama ülesande puhul 25 episoodiga ei piisanud. AY-Robots määrab miinimumiks 30. Salvesta oma andmed või alusta andmestiku kataloogist.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Alusta peenhäälestust
Käsk lerobot juhendist, muutmata. Dokumentatsioon hindab 20000 sammu umbes 4 tunniks ühel A100-l. 24 GB kaardil oota pikemat aega ja mõõda seda.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Vähenda paketi suurust, kuni see sobib
batch_size=64 on dokumenteeritud näide, mitte lubadus teie kaardi kohta. Dokumentatsioon soovitab alustada väikselt ja suurendada, kuni laadimisaeg püsib lühike.
bashlerobot-train --help - 5Käivita kontrollpunkt robotkäel
Sama teek, üks käsk. Reaalajas tükeldamise lipud on dokumentatsioonis kommenteeritud ja need on need, mida kasutada madala võimsusega riistvaral.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Ükskõik millise tee te valite, lõpetate kontrollpunktiga pluss konfiguratsiooniga, mis selle tootis. Hoidke andmestiku revisjon, sammude arv ja seeme selle kõrval. lerobot vaikimisi seeme on 1000; GR00T peenhäälestuse sisenemispunkt ei paljasta üldse seemet, seega need käivitused ei ole bitipõhiselt reprodutseeritavad. Mehaanika treeningu dokumentatsioonis.
Kaks viisi väikese VLA robotkäele saamiseks
Teile kuulub masin ja vearežiimid. SmolVLA puhul on see mõistlik: üks pip lisa, üks treeningkäsk, üks käivitamiskäsk. TinyVLA puhul on see uurimistöö reprodutseerimine külmutatud pinidega, katkise DeepSpeed teega ja andmete teisendusega, mille kirjutate ise.
- Hangi 24 GB kaart, salvesta 30 kuni 50 episoodi, kontrolli kaamera vooge kaader haaval.
- pip install -e ".[smolvla]", lerobot-train lerobot/smolvla_base vastu, seejärel serveeri kontrollpunkti masinas, kuhu robotkäsi on ühendatud.
- TinyVLA jaoks: eraldi conda keskkond, teisenda andmed HDF5-ks, registreeri ülesanne failis constants.py, paranda zero2.json tee, vähenda train.sh kaheksalt GPU-lt ühele.
- Puudub tunnipõhine arveldamine, kui kaart on tasutud.
- Järeldamine toimub servode kõrval, mis on ainus viis kiire juhtimisahela saamiseks.
- Saate poliisi koodi parandada ja TinyVLA on saadaval ainult sel viisil.
- 4090 välistab iga ~3 B poliisi, seega puudub kohalik võrdlus GR00T N1.7 või Pi0.5 vastu.
- Keskkonna seadistamine on tõeline töö. Ainuüksi TinyVLA pinid võivad maksta terve päeva.
- Puudub järjekord, korduskatse, kontrollpunkti salvestus. Taaskäivitus sammul 14000 tähendab uuesti alustamist.
SmolVLA on üks viiest siinsest poliisist. Valite mudeli ja andmestiku vormis, taustaprogramm rendib GPU vastavalt vajalikule VRAM-ile, käivitab treeneri ja kirjutab kontrollpunktid objektisalvestusse. Samm-sammult: SmolVLA SO-100-l, või täielik maatriks treeninglehel.
| Mida platvorm SmolVLA jaoks saadab | Väärtus |
|---|---|
| paketi suurus | 2 |
| õppimiskiirus | 1e-4 |
| maksimaalsed sammud | 20000 |
| gradientide akumulatsioon | 8, and it does not reach the trainer |
| lisaseaded vormis | seed, logFreq |
| GPU tase | RTX 4090 or any 24 GB card |
| andmestiku formaat | LeRobot v3.0 |
| minimaalne episoodide arv | 30 |
Esiteks, vaikimisi paketi suurus siin on 2, mitte 64 lerobot dokumentatsiooni näites, ja gradientide akumulatsiooni seade saadetakse, kuid sellel pole SmolVLA jaoks mingit mõju, seega tegelik pakett on tõesti 2. Suurendage seda teadlikult, selle asemel et eeldada, et vaikimisi väärtus vastab ülesvoolu seadetele. Teiseks, TinyVLA ei ole siin üldse treenitav.
Käivitus 24 GB tasemel võtab 2 kuni 5 tundi hinnaga 0.30 kuni 0.60 USD tunnis, umbes 1 kuni 3 USD. A100 tasemel on ~3 B poliis 3 kuni 6 tundi hinnaga 1.20 kuni 2.00 USD tunnis, umbes 4 kuni 12 USD. Vaata hinnakirja, ja samu toiminguid CLI-st ja MCP serverist.
Kui väike mudel on vale valik
Mõlemad artiklid on siin hoolikamad kui kokkuvõtted. TinyVLA veaanalüüs on spetsiifiline: 0,4 B variant ebaõnnestus kolm korda juhise valesti lugemise tõttu, mida autorid omistavad väiksema VLM-i piiratud keelelisele mõistmisele, ja see režiim kadus 1,3 B juures. SmolVLA näitab sama kõverat teisest otsast: identse arhitektuuri 2,25 B versioon saavutab LIBERO-l 88,75 ja Meta-Worldil 68,24 punkti, võrreldes 0,45 B mudeli 87,3 ja 57,3-ga.
- Mahub 24 GB kaardile, mis vähendab eksperimendi maksumust kümnetelt dollaritelt paari dollarini.
- Piisavalt kiire, et töötada käe kõrval, seega puudub juhtimisahelas võrguhüpe.
- Peenhäälestub andmetel, mida üks inimene saab salvestada, kümneid episoode tuhandete asemel.
- SmolVLA kaalud, andmete loend ja kood on avalikud, nii et halb tulemus on silutav.
- Nõrgem juhiste järgimine: vähem keeleparameetreid, väiksem võime eristada sarnaseid viitavaid väljendeid.
- Vähem ruumilist ja visuaalset üldistamist seadistustele, mida te ei salvestanud.
- Tundlikum andmestiku defektide suhtes, vähem eeltreeningut, millele toetuda.
- Mitme ülesande ja pika horisondi töö eelistab endiselt suuremaid mudeleid, sealhulgas SmolVLA enda 2,25 B varianti.
Võrdlus, mida tasub teha, ei ole TinyVLA SmolVLA vastu. See on SmolVLA vastu ACT teie enda ülesandel, ja SmolVLA artikkel on argument, miks. Ühe ülesande jaoks treenitud ilma robootika eeltreeninguta saavutas SmolVLA kolmel SO-100 ülesandel keskmiselt 40,0, samas kui ühe ülesande ACT saavutas 48,3. See, mis tõstab selle 78,3-ni, on kogukonna eeltreening pluss mitme ülesande treening, mitte ainult arhitektuur. SO-101 lego ülesandel, mõlemad ühe ülesande jaoks, SmolVLA võidab: 90 versus 70 jaotuses. Seejärel SmolVLA vastu Pi0.5 kui eelarve seda võimaldab.
Eeltreeningut on vähem, et halbu andmeid katta, seega annab puhas kaokõver defektsel andmestikul teile poliitika, mis reprodutseerib defekti enesekindlalt. lerobot'i dokumendid on struktuuri osas otsekohesed: 50 episoodi üle 5 kuubipositsiooni, 10 positsiooni kohta, töötas; 25 ei töötanud. Kui kao näitaja tundub hea ja käsi ei tee midagi kasulikku, alustage siit: kao näitaja langeb, poliitika ei tee midagi, poliitika töötab ainult ühes seadistuses või kogudes tegelikult kasutatavaid VLA treeningandmeid robotmanipulatsiooniks.
Viis poliitikat, üks võrdlustabel
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT tegelike parameetrite arvudega, järelduste latentsus iga tegevussammu kohta, GPU tase, mida igaüks vajab, ja minimaalne episoodide arv enne, kui see midagi kasulikku teeb.
Võrdle poliitikaidOtsustustabel, mille järgi saate tegutseda
| Teie olukord | Alustage | Miks |
|---|---|---|
| Üks ülesanne, head demonstratsioonid, keeleta | ACT | ~80 M, 20 ms, 24 GB kaart, baasmudelit pole vaja alla laadida |
| Mõned seotud ülesanded, igaühele üks juhis | SmolVLA | 450 M, lerobot'is, minimaalselt 30 episoodi, 1 kuni 3 USD jooksu kohta |
| TinyVLA tulemuse spetsiifiline reprodutseerimine | TinyVLA-B või TinyVLA-H | Repo on ainus tee: isoleeritud keskkond, teisendatud andmed |
| Mitme ülesande täitmine, erinevad juhised, A100 eelarve | GR00T N1.7 või Pi0.5 | ~3 B, 152 ms ja 485 ms sammu kohta, 4 kuni 12 USD jooksu kohta |
| Robotit veel pole | Juhi päris kätt | Järjekorrapõhine reaalajas käsi ei vaja registreerimist ega riistvara |
Viimase rea jaoks, reaalajas käsi voogedastab füüsilist SO-100, mida saate brauserist ilma kontota juhtida, ja kolm alustamisviisi katab ülejäänu. SO-100 on siin referentskäsi, osade maksumus umbes 110 kuni 150 EUR, koos täieliku seadistusjuhendiga.
Mis tuleb pärast alla 1 B mudeleid
Parameetrite arvu vähendamine on üks viis VLA odavaks muutmiseks ja mitte ilmtingimata võidukas. OpenVLA-OFT (arXiv 2502.19645) säilitab 7 B selgroo ja muudab ainult seda, kuidas tegevusi dekodeeritakse, teatades 26-kordsest tegevuste genereerimise läbilaskevõime suurenemisest ja LIBERO tõusust 76,5-lt 97,1 protsendile. BitVLA (arXiv 2506.07530) muudab iga 1-bitise BitNet b1.58 2B4T selgroo kaalu ternaarseks, teatades 11,0x vähem mälu ja 4,4x madalama otsast-lõpuni latentsuse, samal ajal sobitudes täppis-OpenVLA-OFT-ga. X-VLA-0.9B (arXiv 2510.10274) asub 1 B joonel voolu sobitamisega.
Ühine joon: latentsus asub tegevusdekoodris, mitte keelemudelis. Küsige, kuidas poliitika tegevusi väljastab, enne kui küsite, mitu parameetrit sellel on. Areen sisaldab 85 mudelit ja 332 tulemust, millest igaüks on lingitud oma allikaga; laiem ülevaade on meie VLA sissejuhatuses.
Kas ma saan SmolVLA-d RTX 4090-l peenhäälestada?▾
Jah. SmolVLA on 450 miljoni parameetriga ja AY-Robots käitab seda RTX 4090 / 24 GB tasemel. lerobot näide kasutab --batch_size=64, mis on pigem näide kui garantii teie kaardile; dokumendid soovitavad alustada väikselt ja suurendada, kuni laadimisajad püsivad lühikesed. Oodake pikemat aega kui umbes 4 tundi, mida dokumendid mainivad 20000 sammu jaoks A100-l.
Kas TinyVLA on saadaval lerobot'is või AY-Robotsis?▾
Mõlemale ei. TinyVLA asub ainult oma uurimisrepositooriumis, viimane commit 11. märts 2025, ja selle formaat on ACT-stiilis HDF5, mitte LeRobot. AY-Robots treenib GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT. Kui soovite TinyVLA-d, peate selle ise ehitama ja kõigepealt parandama DeepSpeedi konfiguratsioonitee failis scripts/train.sh.
Kas 450 miljoni parameetriga mudel on tõesti konkurentsivõimeline 3 miljardi parameetriga mudeliga?▾
Autorite enda võrdlustestide kohaselt jah: 87.3 versus 86.0 LIBERO-l võrreldes robootika-eeltreenitud Pi0-ga 3.3 miljardi parameetriga, ja 78.3 versus 61.7 kolmel reaalsel SO-100 ülesandel, kus sama artikkel märgib Pi0-d 3.5 miljardi parameetriga. Piirang on samas artiklis: ühe ülesande puhul ilma robootika eeltreeninguta langeb SmolVLA 40.0-le, mis on allpool ACT 48.3-st.
Mitu episoodi ma vajan, enne kui väike VLA midagi teeb?▾
AY-Robots määrab SmolVLA miinimumiks 30 episoodi ja ACT miinimumiks 50. lerobot dokumendid soovitavad umbes 50 ja teatavad, et 25 ei olnud sama ülesande jaoks piisav. Struktuur on sama oluline kui arv: artikli komplekt kasutas 5 kuubiku asendit, igaühes 10 episoodi.
Miks avaldatud latentsusnumbrid nii palju erinevad?▾
Nad mõõdavad erinevaid asju. TinyVLA teatab 14 ms tegevuse ennustuse kohta A6000-l; AY-Robots loetleb SmolVLA-d 245 ms ja ACT-d 20 ms tegevussammu kohta. Mõned näitajad hõlmavad ühte edasisuunalist läbimist, mõned jagavad läbimise 50-tegevuse ploki vahel ja peaaegu ükski ei sisalda kaamera jäädvustamist ega servodele kirjutamist.
Kas pilve järeldamine lahendab GPU probleemi?▾
Osaliselt. AY-Robots varustab automaatselt pod'i, mis teenindab poliitikat, samal ajal kui kohalik klient suhtleb selle lõpp-punktiga, koos tühikäigu valvekoeraga, nii et see hävitab end, selle asemel et vaikselt arveldada. See ei saa eemaldada avaliku interneti edasi-tagasi reisi ja juhtimissilmus on juba 20 kuni 485 ms tegevussammu kohta. Sobib aeglaseks valimiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks.
Sources
- TinyVLA: Kiirete, andmetõhusate nägemis-keele-tegevuse mudelite poole robootiliseks manipuleerimiseks
- TinyVLA ametlik koodihoidla (README, requirements.txt, scripts/train.sh)
- TinyVLA projekti leht
- lesjie/Llava-Pythia-1.3B, TinyVLA-H tugikaalu mudel
- SmolVLA: nägemis-keele-tegevuse mudel taskukohase ja tõhusa robootika jaoks
- lerobot dokumentatsioon: SmolVLA peenhäälestamine
- lerobot: configuration_smolvla.py, SmolVLA vaikeseaded
- lerobot/smolvla_base mudelikaart
- SmolVLA: tõhus nägemis-keele-tegevuse mudel (Hugging Face blogi)
- lerobot PyPI-s (0.6.1, nõuab Python 3.12 või uuemat)
- OpenVLA: avatud lähtekoodiga nägemis-keele-tegevuse mudel
- Nägemis-keele-tegevuse mudelite peenhäälestamine: kiiruse ja edu optimeerimine (OpenVLA-OFT)
- BitVLA: 1-bitised nägemis-keele-tegevuse mudelid robootiliseks manipuleerimiseks
- X-VLA: pehme vihjega Transformer kui skaleeritav ristkehastuse nägemis-keele-tegevuse mudel
- rail-berkeley/octo-small-1.5 mudelikaart (27 miljonit parameetrit)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started