
TinyVLA a SmolVLA prinášajú funkčné VLA pod 1 miliardu parametrov. Reálne čísla z oboch článkov, predvolené nastavenia LeRobot, nameraná latencia a náklady na spustenie na 24 GB karte.
Takmer každý vizuálno-jazykovo-akčný model o ktorom sa píše, predpokladá kartu dátového centra. OpenVLA má 7 miliárd parametrov. GR00T N1.7 a Pi0.5 majú okolo 3 miliárd parametrov a na doladenie potrebujú A100 80 GB. Ak je karta na vašom stole 4090, táto trieda modelov je mimo dosahu.
Dva články tvrdia, že to nepotrebujete. TinyVLA (arXiv 2409.12514, prijatý IEEE Robotics and Automation Letters vo februári 2025) stavia VLA z chrbtice s 400 miliónmi až 1,3 miliardami parametrov plus difúznu akčnú hlavu. SmolVLA (arXiv 2506.01844, odoslaný 2. júna 2025) dodáva 450 miliónov parametrov s otvorenými váhami, otvorenými dátami a skriptom, ktorý beží na jednej spotrebiteľskej karte. Tu je to, čo oba modely namerali, a kde argument pod 1 miliardu prestáva platiť.
Čo potrebujete vedieť
- •TinyVLA dodáva tri veľkosti: 422 miliónov celkovo so 101 miliónmi trénovateľných, 740 miliónov so 138 miliónmi, 1,3 miliardy so 143 miliónmi. Len prvé dve sú pod 1 miliardou.
- •Jeho tabuľka IV meria 14 ms na predikciu akcie pre TinyVLA-1B na jednej A6000, oproti 292 ms pre OpenVLA-7B a 140 ms pre zmenšený OpenVLA-1B.
- •Túto rýchlosť drží hlava, nie chrbtica: vymeňte difúznu hlavu TinyVLA-H za hlavu ACT a päť úloh reálneho robota klesne z priemeru 94,0 na jednociferné čísla. Hlava MLP dosahuje 0 všade.
- •SmolVLA má 450 miliónov parametrov, z toho približne 100 miliónov je akčný expert, predtrénovaný na 481 komunitných datasetoch LeRobot a 10,6 miliónoch snímok. Uvádza 87,3 na LIBERO oproti 86,0 pre roboticky predtrénovaný Pi0 s 3,3 miliardami parametrov a 78,3 na troch reálnych úlohách SO-100 oproti 61,7 pre Pi0 s 3,5 miliardami parametrov.
- •Trénovaný na jednej úlohe bez tohto predtrénovania, SmolVLA klesá na 40,0 pri týchto úlohách, pod ACT 48,3. Malé neznamená automaticky ľahké.
- •TinyVLA nemá integráciu LeRobot a vyžaduje balík CUDA 11.7. SmolVLA je v lerobot a stojí približne 1 až 3 USD za spustenie na úrovni 24 GB tu.
Čo sa skutočne považuje za malý VLA
Počet parametrov na karte modelu nie je jedno číslo. Môže to znamenať celkové váhy, váhy načítané pri inferencii, alebo váhy, ktoré prijímajú gradienty počas . TinyVLA uvádza oboje a rozdiel je veľký: TinyVLA-H má celkovo 1.3 B, ale 143 M trénovateľných, pretože vizuálna veža a väčšina jazykového modelu zostávajú zmrazené, zatiaľ čo adaptéry LoRA a akčná hlava sa pohybujú. Príspevok uvádza trénovateľný podiel na približne 5 percent.
| Model | Parametre | Základ | Akčná hlava | Zdroj |
|---|---|---|---|---|
| TinyVLA-S | 422 M celkovo, 101 M trénovateľných | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M celkovo, 138 M trénovateľných | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B celkovo, 143 M trénovateľných | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M akčný expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | škála ViT-S, textový kódovač T5-Base | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, bez jazykového modelu | Priama regresia blokov | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, kódovače DINOv2 a SigLIP | Autoregresívne akčné tokeny | arXiv 2406.09246 |
Dva riadky stoja za diskusiu. s približne 80 M je menší ako všetko ostatné tu, ale nemá jazykový model, takže to nie je VLA: učí sa jednu úlohu a nemožno mu prikázať, aby robil inú. s 27 M je podmienený prostredníctvom textového kódovača T5-Base, nie chrbtice LLM. Dobré základné modely, ani jeden vám neposkytuje dodržiavanie pokynov, ktoré naznačuje štítok.
TinyVLA-H, variant s hlavnými výsledkami, má 1.3 B a je nad touto hranicou. Lepšou otázkou je, či sa model zmestí do 24 GB počas tréningu a dosiahne vašu kontrolnú frekvenciu pri inferencii. Päť politík, ktoré tu môžete trénovať, nájdete na stránke politík; TinyVLA má záznam v aréne, ak chcete jeho čísla vedľa ostatných.
TinyVLA: rýchlosť pochádza z hlavy, nie z chrbtice
Zjavné čítanie je, že zmenšili jazykový model, takže sa zrýchlil. Ablácia v článku hovorí opak. Výmena 7 B chrbtice OpenVLA za približne 1 B znížila predikciu na akciu z 292 ms na 140 ms, čo je 2x zisk. TinyVLA-H, s porovnateľným počtom parametrov, beží na 14 ms na rovnakej karte. Ďalších 10x je akčná hlava.
| Model | Predikcia na akciu | Merané na |
|---|---|---|
| OpenVLA-7B | 292 ms | jedna A6000 |
| OpenVLA-1B, chrbtica vymenená za chrbticu TinyVLA | 140 ms | jedna A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | jedna A6000 |
OpenVLA emituje akcie ako diskretizované tokeny cez hlavu jazykového modelu, jeden na dimenziu akcie, autoregresívne. TinyVLA pripája difúzny dekodér, ktorý produkuje celý blok naraz. Tabuľka V obsahuje architektúru TinyVLA-H a mení iba hlavu, na rovnakých piatich úlohách skutočného robota. Je to najčistejší dôkaz v oboch článkoch pre argument, ktorý robia politiky párovania toku, a dôvod, prečo sa Pi0 odklonil od dekódovania tokenov.
| Head on TinyVLA-H | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Difúzia (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Action Chunking Transformer | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Viacvrstvový perceptrón | 0 | 0 | 0 | 0 | 0 |
Údaje 292 / 140 / 14 ms sú z Tabuľky IV, všetky na jednom A6000. Predstavujú predikciu na jednu akciu a nezahŕňajú snímanie kamerou, predbežné spracovanie a sériový zápis na servá. Zverejnenú latenciu považujte za dolnú hranicu, nikdy nie za riadiacu frekvenciu. Naše vlastné čísla majú rovnaké obmedzenie: pozrite si latenciu inferencie.
Čo dosiahla TinyVLA
| Benchmark | Protokol | TinyVLA-H | Základné modely |
|---|---|---|---|
| MetaWorld, 50 úloh, simulácia | Viacúlohové, 50 ukážok, 3 seed-y | 77.6 / 21.5 / 11.4 / 15.8 podľa obtiažnosti, priemer 31.6 | Diffusion Policy priemer 10.5 |
| Real Franka Panda, 5 úloh | 100 trajektórií na úlohu, 20 pokusov | 94.0 priemer | OpenVLA 68.3, Diffusion Policy 35.3 |
| Bimanual UR5, 3 úlohy | Viacúlohové, 10 pokusov na úlohu | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Riadok pre bimanipuláciu má nudné vysvetlenie, ktoré si článok dáva sám: OpenVLA je predtrenovaný na Open X-Embodiment, ktorý pozostáva výlučne z dát pre jednu ruku, takže akčný priestor pre dve ruky je mimo distribúcie a dosahuje nulové skóre. Základná línia difúznej politiky prekonáva TinyVLA-H na dvoch z týchto troch úloh. Pozadie v článku o Open X-Embodiment.

Repozitár TinyVLA, stav k augustu 2026
Článok je dobrý. Kód je výskumný výstup. Repozitár je github.com/liyaxuanliyaxuan/TinyVLA; jeho README datuje vydanie kódu na 17. februára 2025 a posledný commit je z 11. marca 2025. Dobré na reprodukciu článku, problém, ak by ste chceli udržiavanú knižnicu.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt pins torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, and the CUDA stack to the 11.x wheels: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README vyžaduje Python 3.10; lerobot 0.6.1 vyžaduje 3.12 alebo novší, takže tieto dva nemôžu zdieľať jedno prostredie. Najprv si overte, či existuje zostava torch 2.0.1 pre vašu generáciu GPU. Ak namiesto toho beh zlyhá kvôli VRAM, kontrolný zoznam pre nedostatok pamäte je rýchlejší ako hádanie.
TinyVLA tiež nečíta LeRobot datasety. Jeho formát je HDF5 v štýle ACT: akcia, language_raw a skupina pozorovaní s viacpohľadovými obrázkami, joint_positions, qpos a qvel. Repozitár obsahuje data_utils/rlds_to_h5py.py pre vstup RLDS a každá úloha je ručne zaregistrovaná v aloha_scripts/constants.py s jej dataset_dir, episode_len a camera_names. Ak vaše epizódy pochádzajú z lerobot alebo z desktopového klienta, konverzia je na vás.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 predpokladá uzol s ôsmimi kartami. Nastavte ho na 1 a znížte veľkosť dávky hlboko pod 32. Žiadny variant pre jednu GPU sa nedodáva upstream, takže príkaz nemožno spustiť doslovne na 4090.
- --deepspeed scripts/zero2.json odkazuje na súbor, ktorý nie je v adresári scripts najvyššej úrovne. Konfigurácie DeepSpeed sa dodávajú v llava-pythia/scripts/zero2.json. Opravte cestu pred prvým spustením.
- README vyžaduje, aby názov výstupného adresára obsahoval llava_pythia, plus lora, ak je povolená LoRA.
- Základná sieť je samostatné stiahnutie: lesjie/Llava-Pythia-400M, -700M alebo -1.3B. Neexistuje žiadny jediný základný kontrolný bod, na ktorý by ste nasmerovali politiku tak, ako smerujete na lerobot/smolvla_base.
SmolVLA: model pod 1 miliardu parametrov, ktorý môžete spustiť už dnes popoludní
SmolVLA predkladá rovnaký argument v rámci udržiavanej knižnice. Má 450 miliónov parametrov na základnej sieti SmolVLM2-500M-Video-Instruct a efektivita pochádza z nastavení, ktoré si môžete prečítať v configuration_smolvla.py, a nie z tvrdenia o tom, že je malý.
| Nastavenie v configuration_smolvla.py | Predvolené | Čo to prináša |
|---|---|---|
| num_vlm_layers | 16 | Spúšťa sa len prvých 16 vrstiev jazykového modelu |
| expert_width_multiplier | 0.75 | Skrytá veľkosť akčného experta je 75 percent VLM |
| self_attn_every_n_layers | 2 | Samo-pozornosť prekladaná s krížovou pozornosťou |
| chunk_size / n_action_steps | 50 / 50 | Jeden prechod vygeneruje 50 akcií a všetkých 50 sa vykoná |
| num_steps | 10 | Denoising s prispôsobením toku pevne nastavený na 10 krokov |
| tokenizer_max_length | 48 | Inštrukcia je skrátená na 48 tokenov |
| freeze_vision_encoder / train_expert_only | True / True | Jemné doladenie presúva experta, nie vizuálnu vežu |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nie je to recept z článku: jeho pretrénovanie použilo 100-krokový warmup počas 200000 krokov |
Predtréning využil 481 komunitných datasetov LeRobot, 22,9 tisíc epizód a 10,6 milióna snímok na 4 GPU, 200000 krokov pri globálnej dávke 256; článok odhaduje celý projekt na približne 30 tisíc GPU hodín. Jedno číslo, ktoré treba sledovať: blog o spustení Hugging Face uvádza 487 kurátorovaných datasetov, zatiaľ čo tabuľka v článku uvádza 481. Používame údaj z článku a upozorňujeme na nesúlad.

| Benchmark | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| Priemer LIBERO, viacúlohové | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Priemer Meta-World, viacúlohové | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Reálny SO-100, 3 úlohy, viacúlohové trénovanie | 78.3 | - | 61.7 (3.5 B) | - |
| Reálny SO-100, 3 úlohy, jednoúlohové, bez predtrénovania pre robotiku | 40.0 | - | - | 48.3 |
| SO-101 lego pick-place, jednoúlohové, v distribúcii | 90 | - | - | 70 |
| SO-101 lego pick-place, jednoúlohové, mimo distribúcie | 50 | - | - | 40 |
LIBERO je simulácia a všetko kompetentné tam teraz dosahuje skóre v osemdesiatkach. Riadok s reálnym SO-100, kde 450 M model prekonáva 3,5 B model o 16,6 bodu, je ten zaujímavý; riadok pod ním je protipólom. Ak odstránime komunitné predtrénovanie a viacúlohové trénovanie, ten istý model klesne na 40,0, pod ACT. Obhájiteľné tvrdenie je, že malý model nie je automaticky horší, nie že je lepší.
Jedna náhoda pomáha: tabuľka Meta-World v článku SmolVLA obsahuje vlastné publikované čísla TinyVLA ako základ, takže pre raz oba modely sedia v jednej tabuľke, SmolVLA-0.45B na 57.3 proti TinyVLA-H na 31.6. Tiež uvádza, že tréning SmolVLA je približne o 40 percent rýchlejší ako Pi0 s 6x menšou pamäťou. Všetko pochádza od autorov SmolVLA; záznam v aréne odkazuje každú hodnotu na jej zdroj.
Kde SmolVLA trávi svoj čas
AY-Robots uvádza SmolVLA na 245 ms na krok akcie a ACT na 20 ms v katalógu politík. TinyVLA uvádza 14 ms na predikciu akcie. Tieto čísla nie sú porovnateľné a zaobchádzanie s nimi, akoby boli, je najčastejšou chybou v tejto téme: niektoré merajú jeden dopredný prechod, niektoré rozdelia tento prechod cez blok, keď ho rozdelenie akcií na bloky amortizuje.
- SmolVLA vydáva 50 akcií na jeden dopredný prechod a vykonáva všetkých 50. Pri 30 fps, ktoré článok používa na reálnych robotoch, jeden inferenčný prechod pokrýva približne 1.7 sekundy pohybu.
- Asynchrónna inferencia vypočítava ďalší blok, zatiaľ čo aktuálny sa stále vykonáva: 9.7 s priemerný čas dokončenia úlohy oproti 13.75 s synchrónne, približne o 30 percent rýchlejšie, a 19 cyklov uchopenia a umiestnenia v pevnom 60-sekundovom okne oproti 9.
- Miera úspešnosti bola porovnateľná, nie lepšia, 78.3 synchrónne oproti 73.3 asynchrónne. Asynchrónnosť kupuje priepustnosť, nie presnosť.
- Rozdelenie na bloky (chunking) skrýva latenciu výpočtu, nie latenciu siete, a robí politiku menej reaktívnou, pretože je viazaná na 50 akcií.
AY-Robots dokáže automaticky zriadiť cloudový GPU pod, ktorý obsluhuje vašu politiku, zatiaľ čo lokálny robotický klient komunikuje s týmto koncovým bodom, a pod obsahuje nečinný watchdog, takže sa sám zničí namiesto tichého účtovania. Čo však nerobí, je odstránenie okružnej cesty cez verejný internet. Riadiaca slučka naprieč piatimi politikami je tu 20 až 485 ms na akčný krok pred akoukoľvek sieťou, takže vzdialená inferencia je životaschopná pre pomalé operácie typu pick-and-place, nie pre rýchly reaktívny pohyb.

Jemné ladenie SmolVLA na jednej spotrebiteľskej karte
Manuálna cesta, na lerobot 0.6.1, aktuálnej verzii PyPI k 23. augustu 2026. Všetko nižšie pochádza z dokumentácie Hugging Face lerobot SmolVLA, získanej v ten istý deň; vedená verzia je jemnejšia.
- 1Nainštalujte lerobot s doplnkom smolvla
Závislosti SmolVLA sú voliteľným doplnkom, nie súčasťou základnej inštalácie. Inštalácia bez nich a následné premýšľanie, prečo je typ politiky neznámy, je bežná strata polhodiny.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Získajte dátovú sadu s dostatočným počtom epizód
Dokumentácia odporúča približne 50 epizód a uvádza, že rovnaká úloha s 25 epizódami nebola dostatočná. AY-Robots stanovuje minimum na 30. Nahrajte si vlastné, alebo začnite z adresára dátových sád.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Spustite doladenie
Príkaz z príručky lerobot, neupravený. Dokumentácia uvádza 20000 krokov približne na 4 hodiny na jednej A100. Na 24 GB karte očakávajte dlhší čas a zmerajte ho.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Znížte veľkosť dávky, kým sa nezmestí
batch_size=64 je zdokumentovaný príklad, nie prísľub týkajúci sa vašej karty. Dokumentácia odporúča začať s malou hodnotou a zvyšovať ju, pokiaľ časy načítania zostávajú krátke.
bashlerobot-train --help - 5Nasaďte checkpoint na rameno
Rovnaká knižnica, jeden príkaz. Príznaky pre chunking v reálnom čase sú v dokumentácii zakomentované a sú to tie, po ktorých siahnete na hardvéri s nízkym výkonom.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Nech už sa vydáte akoukoľvek cestou, skončíte s checkpointom plus konfiguráciou, ktorá ho vytvorila. Uchovajte revíziu dátovej sady, počet krokov a seed vedľa neho. lerobot predvolene používa seed 1000; vstupný bod doladenia GR00T neexponuje žiadny seed, takže tieto spustenia nie sú bitovo reprodukovateľné. Mechanika v dokumentácii k trénovaniu.
Dva spôsoby, ako dostať malý VLA na rameno
Vlastníte stroj a režimy zlyhania. Pre SmolVLA je to rozumné: jeden pip extra, jeden príkaz na trénovanie, jeden príkaz na nasadenie. Pre TinyVLA je to reprodukcia výskumu so zamrznutými pinmi, nefunkčnou cestou DeepSpeed a konverziou dát, ktorú si napíšete sami.
- Získajte 24 GB kartu, nahrajte 30 až 50 epizód, overte streamy kamier snímku po snímke.
- pip install -e ".[smolvla]", lerobot-train proti lerobot/smolvla_base, potom naservírujte checkpoint na stroji, ku ktorému je pripojené rameno.
- Pre TinyVLA: samostatné conda prostredie, konvertujte dáta do HDF5, zaregistrujte úlohu v constants.py, opravte cestu zero2.json, znížte train.sh z ôsmich GPU na jedno.
- Žiadne hodinové účtovanie, akonáhle je karta zaplatená.
- Inferencia sedí vedľa servomotorov, jediný spôsob, ako získať rýchlu riadiacu slučku.
- Môžete patchovať kód politiky a TinyVLA je k dispozícii iba týmto spôsobom.
- 4090 vylučuje každú ~3 B politiku, takže žiadne lokálne porovnanie s GR00T N1.7 alebo Pi0.5.
- Nastavenie prostredia je skutočná práca. Samotné piny TinyVLA môžu stáť deň.
- Žiadna fronta, žiadne opakovanie, žiadne úložisko checkpointov. Reštart pri kroku 14000 znamená začať znova.
SmolVLA je jednou z piatich politík tu. Model a dátovú sadu si vyberiete vo formulári, backend si prenajme GPU podľa požadovanej VRAM, spustí tréner a zapíše checkpoints do objektového úložiska. Krok za krokom: SmolVLA na SO-100, alebo celú maticu na stránke trénovania.
| Čo platforma posiela pre SmolVLA | Hodnota |
|---|---|
| veľkosť dávky | 2 |
| rýchlosť učenia | 1e-4 |
| max krokov | 20000 |
| akumulácia gradientu | 8, and it does not reach the trainer |
| extra nastavenia vo formulári | seed, logFreq |
| úroveň GPU | RTX 4090 or any 24 GB card |
| formát dátovej sady | LeRobot v3.0 |
| minimálny počet epizód | 30 |
Po prvé, predvolená veľkosť dávky je tu 2, nie 64 ako v príklade dokumentácie lerobot, a nastavenie akumulácie gradientu sa posiela, ale nemá žiadny vplyv na SmolVLA, takže efektívna dávka je skutočne 2. Zvýšte ju zámerne, namiesto predpokladu, že predvolená hodnota zodpovedá upstreamu. Po druhé, TinyVLA tu vôbec nie je trénovateľná.
Spustenie na úrovni 24 GB trvá 2 až 5 hodín pri 0.30 až 0.60 USD za hodinu, približne 1 až 3 USD. Na úrovni A100 trvá politika ~3 B 3 až 6 hodín pri 1.20 až 2.00 USD za hodinu, približne 4 až 12 USD. Pozrite si cenník, a rovnaké operácie z CLI a servera MCP.
Keď je malý model nesprávna voľba
Oba články sú tu opatrnejšie ako ich zhrnutia. Analýza zlyhaní TinyVLA je špecifická: variant 0,4 B zlyhal trikrát nesprávnym prečítaním inštrukcie, čo autori pripisujú obmedzenému jazykovému porozumeniu v menšom VLM, a tento režim zmizol pri 1,3 B. SmolVLA ukazuje rovnakú krivku z druhého konca: verzia 2,25 B identickej architektúry dosahuje skóre 88,75 na LIBERO a 68,24 na Meta-World oproti 87,3 a 57,3 pre model 0,45 B.
- Zmestí sa na 24 GB kartu, čo zníži náklady na experiment z desiatok dolárov na pár.
- Dostatočne rýchle na spustenie vedľa ramena, takže žiadny sieťový skok v riadiacej slučke.
- Jemné doladenie na dátach, ktoré môže zaznamenať jedna osoba, desiatky epizód namiesto tisícok.
- Váhy, zoznam dát a kód SmolVLA sú verejné, takže zlý výsledok je možné ladiť.
- Slabšie dodržiavanie pokynov: menej jazykových parametrov, menšia schopnosť oddeliť podobné referenčné výrazy.
- Menšia priestorová a vizuálna generalizácia na nastavenia, ktoré ste nezaznamenali.
- Citlivejšie na chyby v dátovej sade, s menším predtrénovaním, na ktoré sa dá spoľahnúť.
- Viacúlohová práca a práca s dlhým horizontom stále uprednostňuje väčšie modely, vrátane vlastného variantu SmolVLA 2,25 B.
Porovnanie, ktoré stojí za to spustiť, nie je TinyVLA proti SmolVLA. Je to SmolVLA proti ACT na vašej vlastnej úlohe, a článok o SmolVLA je argumentom prečo. Trénovaný na jednej úlohe bez predtrénovania robotiky, SmolVLA dosiahol priemer 40,0 v troch úlohách SO-100, kde jednorazový ACT dosiahol 48,3. To, čo ho pozdvihuje na 78,3, je komunitné predtrénovanie plus viacúlohové trénovanie, nie samotná architektúra. Na úlohe SO-101 s legom, obe jednorazové, SmolVLA vyhráva: 90 proti 70 v distribúcii. Potom SmolVLA proti Pi0.5 ak to rozpočet dovolí.
Je menej predtrénovania, ktoré by pokrylo zlé dáta, takže čistá krivka straty na chybnom datasete vám poskytne politiku, ktorá s istotou reprodukuje chybu. Dokumentácia lerobot je priamočiara ohľadom štruktúry: 50 epizód naprieč 5 pozíciami kocky, 10 na pozíciu, fungovalo; 25 nie. Ak strata vyzerá v poriadku a rameno nerobí nič užitočné, začnite pri strata klesá, politika nerobí nič, politika funguje len v jednom nastavení alebo zbieraní tréningových dát VLA, ktoré sú skutočne použiteľné.
Päť politík, jedna porovnávacia tabuľka
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT so skutočným počtom parametrov, latenciou inferencie na akčný krok, úrovňou GPU, ktorú každý potrebuje, a minimálnym počtom epizód, kým urobí niečo užitočné.
Porovnať politikyRozhodovacia tabuľka, podľa ktorej môžete konať
| Vaša situácia | Začnite s | Prečo |
|---|---|---|
| Jedna úloha, dobré ukážky, žiadny jazyk | ACT | ~80 M, 20 ms, 24 GB karta, žiadny základný model na stiahnutie |
| Niekoľko súvisiacich úloh, jedna inštrukcia pre každú | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| Špecifická reprodukcia výsledku TinyVLA | TinyVLA-B or TinyVLA-H | Repozitár je jediná cesta: izolované prostredie, konvertované dáta |
| Viac úloh, rôznorodé inštrukcie, rozpočet A100 | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms a 485 ms na krok, 4 až 12 USD per run |
| Zatiaľ žiadny robot | Ovládať skutočné rameno | Živé rameno založené na fronte nevyžaduje registráciu ani hardvér |
Pre posledný riadok, živé rameno streamuje fyzický SO-100, ktorý môžete ovládať z prehliadača bez účtu, a tri spôsoby spustenia pokrývajú zvyšok. SO-100 je tu referenčné rameno, približne 110 až 150 EUR v súčiastkach, s kompletným sprievodcom nastavením.
Čo prichádza po modeloch pod 1 B
Zmenšenie počtu parametrov je jedným zo spôsobov, ako urobiť VLA lacným, a nie je to nevyhnutne ten víťazný. OpenVLA-OFT (arXiv 2502.19645) si zachováva 7 B chrbticu a mení len spôsob dekódovania akcií, pričom uvádza 26-násobné zvýšenie priepustnosti generovania akcií a nárast LIBERO zo 76.5 na 97.1 percenta. BitVLA (arXiv 2506.07530) robí každý váhový parameter 1-bitovej chrbtice BitNet b1.58 2B4T ternárnym, pričom uvádza 11.0x menšiu pamäť a 4.4x nižšiu end-to-end latenciu pri zachovaní presnosti OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) sa nachádza na hranici 1 B s flow matchingom.
Spoločná niť: dekodér akcií, nie jazykový model, je miestom, kde sa nachádza latencia. Spýtajte sa, ako politika emituje akcie, predtým než sa spýtate, koľko parametrov má. Aréna má 85 modelov a 332 výsledkov, každý prepojený so svojím zdrojom; širší prehľad nájdete v našom úvode do VLA.
Môžem doladiť SmolVLA na RTX 4090?▾
Áno. SmolVLA má 450 M parametrov a AY-Robots ho spúšťa na úrovni RTX 4090 / 24 GB. Príklad lerobot používa --batch_size=64, čo je skôr príklad ako záruka pre vašu kartu; dokumentácia odporúča začať s malými hodnotami a zvyšovať ich, pokiaľ časy načítania zostávajú krátke. Očakávajte dlhšie časy ako približne 4 hodiny, ktoré dokumentácia uvádza pre 20000 krokov na A100.
Je TinyVLA dostupná v lerobot alebo na AY-Robots?▾
Nie, ani jedno. TinyVLA existuje iba vo svojom výskumnom repozitári, posledný commit 11 March 2025, a jeho formát je HDF5 v štýle ACT, nie LeRobot. AY-Robots trénuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT. Ak chcete TinyVLA, musíte si ho zostaviť sami a najprv budete musieť opraviť cestu ku konfigurácii DeepSpeed v scripts/train.sh.
Je 450 M model skutočne konkurencieschopný s 3 B modelom?▾
Podľa vlastných benchmarkov autorov áno: 87.3 proti 86.0 na LIBERO oproti roboticky predtrenovanému Pi0 s 3.3 B, a 78.3 proti 61.7 na troch reálnych úlohách SO-100, kde ten istý článok označuje Pi0 s 3.5 B. Limit je v tom istom článku: pri jednej úlohe bez robotického pretrénovania klesá SmolVLA na 40.0, pod ACT 48.3.
Koľko epizód potrebujem, kým malý VLA niečo urobí?▾
AY-Robots stanovuje minimum pre SmolVLA na 30 epizód a pre ACT na 50. Dokumentácia lerobot odporúča okolo 50 a uvádza, že 25 nebolo dosť pre rovnakú úlohu. Štruktúra je rovnako dôležitá ako počet: súbor v článku použil 5 pozícií kociek s 10 epizódami pre každú.
Prečo sa zverejnené čísla latencie tak veľmi líšia?▾
Merajú rôzne veci. TinyVLA uvádza 14 ms na predikciu akcie na A6000; AY-Robots uvádza SmolVLA na 245 ms a ACT na 20 ms na akčný krok. Niektoré údaje pokrývajú jeden dopredný prechod, niektoré rozdeľujú prechod cez 50-akčný blok a takmer žiadne nezahŕňajú snímanie kamerou alebo zápis do servomotorov.
Rieši cloudová inferencia problém s GPU?▾
Čiastočne. AY-Robots automaticky zriaďuje pod, ktorý obsluhuje politiku, zatiaľ čo lokálny klient komunikuje s týmto koncovým bodom, s nečinným watchdogom, takže sa sám zničí namiesto tichého účtovania. Nemôže odstrániť okružnú cestu cez verejný internet a riadiaca slučka je už 20 až 485 ms na akčný krok. Dobré pre pomalé uchopovanie a umiestňovanie, nie pre rýchly reaktívny pohyb.
Sources
- TinyVLA: Smerom k rýchlym, dátovo efektívnym vizuálno-jazykovo-akčným modelom pre robotickú manipuláciu
- Oficiálny repozitár kódu TinyVLA (README, requirements.txt, scripts/train.sh)
- Projektová stránka TinyVLA
- lesjie/Llava-Pythia-1.3B, váhy chrbtice TinyVLA-H
- SmolVLA: Vizuálno-jazykovo-akčný model pre cenovo dostupnú a efektívnu robotiku
- Dokumentácia lerobot: doladenie SmolVLA
- lerobot: configuration_smolvla.py, predvolené nastavenia SmolVLA
- Karta modelu lerobot/smolvla_base
- SmolVLA: Efektívny vizuálno-jazykovo-akčný model (blog Hugging Face)
- lerobot na PyPI (0.6.1, vyžaduje Python 3.12 alebo novší)
- OpenVLA: Otvorený vizuálno-jazykovo-akčný model
- Doladenie vizuálno-jazykovo-akčných modelov: Optimalizácia rýchlosti a úspešnosti (OpenVLA-OFT)
- BitVLA: 1-bitové vizuálno-jazykovo-akčné modely pre robotickú manipuláciu
- X-VLA: Transformer s jemným promptovaním ako škálovateľný vizuálno-jazykovo-akčný model pre rôzne telá
- Karta modelu rail-berkeley/octo-small-1.5 (27 M parametrov)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started