
TinyVLA a SmolVLA umísťují funkční VLA pod 1 miliardu parametrů. Skutečná čísla z obou článků, výchozí nastavení lerobot, naměřená latence a co stojí spuštění na 24 GB kartě.
Téměř každý vizuálně-jazykově-akční model, o kterém se píše, předpokládá datacentrovou kartu. OpenVLA má 7 miliard parametrů. GR00T N1.7 a Pi0.5 mají kolem 3 miliard parametrů a pro jemné doladění vyžadují A100 80 GB. Pokud je karta na vašem stole 4090, tato třída modelů je mimo dosah.
Dva články tvrdí, že to nepotřebujete. TinyVLA (arXiv 2409.12514, přijato IEEE Robotics and Automation Letters v únoru 2025) staví VLA z páteřní sítě o velikosti 400 milionů až 1,3 miliardy parametrů plus difuzní akční hlavu. SmolVLA (arXiv 2506.01844, odesláno 2. června 2025) dodává 450 milionů parametrů s otevřenými váhami, otevřenými daty a skriptem, který běží na jedné spotřebitelské kartě. Zde je to, co oba změřily, a kde argument pod 1 miliardu parametrů přestává platit.
Co potřebujete vědět
- •TinyVLA se dodává ve třech velikostech: celkem 422 milionů s 101 milionem trénovatelných, 740 milionů s 138 miliony, 1,3 miliardy s 143 miliony. Pouze první dvě jsou pod 1 miliardou.
- •Jeho tabulka IV měří 14 ms na predikci akce pro TinyVLA-1B na jedné A6000, oproti 292 ms pro OpenVLA-7B a 140 ms pro zmenšený OpenVLA-1B.
- •Tuto rychlost drží hlava, nikoli páteřní síť: vyměňte difuzní hlavu TinyVLA-H za hlavu ACT a pět úloh reálného robota klesne z průměru 94,0 na jednociferná čísla. Hlava MLP dosahuje 0 všude.
- •SmolVLA má 450 milionů parametrů, zhruba 100 milionů z nich tvoří akční expert, předtrénovaný na 481 komunitních datových sadách LeRobot a 10,6 milionu snímků. Uvádí 87,3 na LIBERO oproti 86,0 pro roboticky předtrénovaný Pi0 s 3,3 miliardami parametrů a 78,3 na třech reálných úlohách SO-100 oproti 61,7 pro Pi0 s 3,5 miliardami parametrů.
- •Trénovaný na jednu úlohu bez tohoto předtrénování, SmolVLA klesá na 40,0 u těchto úloh, pod 48,3 ACT. Malý neznamená automaticky snadný.
- •TinyVLA nemá integraci LeRobot a vyžaduje stack CUDA 11.7 wheel. SmolVLA je v lerobot a stojí zhruba 1 to 3 USD za běh na úrovni 24 GB zde.
Co se skutečně počítá jako malý VLA
Počet parametrů na kartě modelu není jedno číslo. Může znamenat celkové váhy, váhy načtené při inferenci, nebo váhy, které přijímají gradienty během . TinyVLA uvádí obojí a rozdíl je velký: TinyVLA-H má celkem 1,3 B, ale 143 M je trénovatelných, protože vizuální věž a většina jazykového modelu zůstávají zmrazené, zatímco adaptéry LoRA a akční hlava se pohybují. Článek uvádí trénovatelný podíl na přibližně 5 procentech.
| Model | Parametry | Páteřní síť | Akční hlava | Zdroj |
|---|---|---|---|---|
| TinyVLA-S | Celkem 422 M, 101 M trénovatelných | Llava-Pythia ~400 M | Difúze (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | Celkem 740 M, 138 M trénovatelných | Llava-Pythia ~700 M | Difúze | arXiv 2409.12514 |
| TinyVLA-H | Celkem 1,3 B, 143 M trénovatelných | Llava-Pythia ~1.3 B | Difúze | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M akční expert | SmolVLM2-500M-Video-Instruct | Expert na párování toků | arXiv 2506.01844 |
| Octo-Small | 27 M | Měřítko ViT-S, textový kodér T5-Base | Difúze | octo-small-1.5 card |
| ACT | ~80 M | ResNet, bez jazykového modelu | Přímá regrese bloků | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, kodéry DINOv2 a SigLIP | Autoregresivní akční tokeny | arXiv 2406.09246 |
Dva řádky stojí za diskuzi. s přibližně 80 M je menší než vše ostatní zde, ale nemá jazykový model, takže to není VLA: učí se jeden úkol a nelze mu říct, aby dělal jiný. s 27 M je podmíněn textovým kodérem T5-Base, nikoli páteřní sítí LLM. Dobré základní modely, ani jeden vám nedá dodržování instrukcí, které název naznačuje.
TinyVLA-H, varianta s hlavními výsledky, má 1,3 B a je nad touto hranicí. Lepší otázkou je, zda se model vejde do 24 GB během tréninku a dosáhne vaší řídicí frekvence při inferenci. Pět politik, které zde můžete trénovat, najdete na stránce politik; TinyVLA má záznam v aréně, pokud chcete jeho čísla vedle ostatních.
TinyVLA: rychlost pochází z hlavy, ne z páteře
Zřejmý výklad je, že zmenšili jazykový model, a tak se zrychlil. Ablační studie v článku však říká něco jiného. Výměna 7B páteře OpenVLA za zhruba 1B snížila predikci na akci z 292 ms na 140 ms, což je 2x zrychlení. TinyVLA-H, srovnatelný počtem parametrů, běží na 14 ms na stejné kartě. Dalších 10x je akční hlava.
| Model | Predikce na akci | Měřeno na |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, páteř vyměněna za TinyVLA | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA vydává akce jako diskretizované tokeny prostřednictvím hlavy jazykového modelu, jeden na dimenzi akce, autoregresivně. TinyVLA připojuje difuzní dekodér, který produkuje celý blok najednou. Tabulka V obsahuje architekturu TinyVLA-H a mění pouze hlavu, na stejných pěti úkolech reálného robota. Je to nejčistší důkaz v obou článcích pro argument, že politiky párování toků vytvářejí, a důvod, proč Pi0 se odklonilo od dekódování tokenů.
| Hlava na TinyVLA-H | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Diffusion (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Action Chunking Transformer | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Vícevrstvý perceptron | 0 | 0 | 0 | 0 | 0 |
Údaje 292 / 140 / 14 ms jsou z tabulky IV, všechny na jednom A6000. Jsou to údaje na predikci akce a nezahrnují snímání kamerou, předzpracování a sériový zápis na serva. Zveřejněnou latenci považujte za dolní hranici, nikdy ne za řídicí frekvenci. Naše vlastní čísla mají stejné omezení: viz latence inference.
Co dosáhla TinyVLA
| Benchmark | Protokol | TinyVLA-H | Základní modely |
|---|---|---|---|
| MetaWorld, 50 úloh, simulace | Víceúlohové, 50 ukázek, 3 semena | 77.6 / 21.5 / 11.4 / 15.8 podle obtížnosti, průměr 31.6 | Diffusion Policy průměr 10.5 |
| Skutečná Franka Panda, 5 úloh | 100 trajektorií na úlohu, 20 pokusů | průměr 94.0 | OpenVLA 68.3, Diffusion Policy 35.3 |
| Bimanual UR5, 3 úlohy | Víceúlohové, 10 pokusů na úlohu | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Bimanualní řádek má nudné vysvětlení, které si článek dává sám: OpenVLA je předtrénováno na Open X-Embodiment, které se skládá výhradně z dat pro jednu paži, takže akční prostor pro dvě paže je mimo distribuci a dosahuje nulového skóre. Základní linie difuzní politiky poráží TinyVLA-H na dvou ze tří těchto úkolů. Pozadí v článek o Open X-Embodiment.

Repozitář TinyVLA, k srpnu 2026
Článek je dobrý. Kód je výzkumný prototyp. Repozitář je github.com/liyaxuanliyaxuan/TinyVLA; jeho README datuje vydání kódu na 17. února 2025 a poslední commit je z 11. března 2025. Dobré pro reprodukci článku, problém, pokud byste chtěli udržovanou knihovnu.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt připíná torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 a zásobník CUDA na kola 11.x: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README vyžaduje Python 3.10; lerobot 0.6.1 vyžaduje 3.12 nebo novější, takže tyto dva nemohou sdílet jedno prostředí. Nejprve ověřte, zda existuje sestavení torch 2.0.1 pro vaši generaci GPU. Pokud běh místo toho selže kvůli VRAM, kontrolní seznam pro nedostatek paměti je rychlejší než hádání.
TinyVLA také nečte datové sady LeRobot. Jeho formát je HDF5 ve stylu ACT: akce, language_raw a skupina pozorování s více pohledovými obrázky, joint_positions, qpos a qvel. Repozitář dodává data_utils/rlds_to_h5py.py pro vstup RLDS a každý úkol je ručně registrován v aloha_scripts/constants.py s jeho dataset_dir, episode_len a camera_names. Pokud vaše epizody pocházely z lerobot nebo z desktopového klienta, konverzi vlastníte vy.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 předpokládá uzel s osmi kartami. Nastavte jej na 1 a snižte velikost dávky hluboko pod 32. Žádná varianta s jednou GPU není dodávána upstream, takže příkaz nelze spustit doslovně na 4090.
- --deepspeed scripts/zero2.json ukazuje na soubor, který není v adresáři scripts nejvyšší úrovně. Konfigurace DeepSpeed jsou dodávány v llava-pythia/scripts/zero2.json. Opravte cestu před prvním spuštěním.
- README vyžaduje, aby název výstupního adresáře obsahoval llava_pythia, plus lora, pokud je LoRA povolena.
- Páteř je samostatný ke stažení: lesjie/Llava-Pythia-400M, -700M or -1.3B. Neexistuje žádný jediný základní kontrolní bod, na který byste nasměrovali politiku tak, jako byste nasměrovali na lerobot/smolvla_base.
SmolVLA: model pod 1 B, který můžete spustit dnes odpoledne
SmolVLA předkládá stejný argument uvnitř udržované knihovny. Má 450 M parametrů na páteři SmolVLM2-500M-Video-Instruct a efektivita pochází z nastavení, která si můžete přečíst z configuration_smolvla.py, spíše než z tvrzení o tom, že je malý.
| Nastavení v configuration_smolvla.py | Výchozí | Co to přináší |
|---|---|---|
| num_vlm_layers | 16 | Spouští se pouze prvních 16 vrstev jazykového modelu |
| expert_width_multiplier | 0.75 | Skrytá velikost akčního experta je 75 procent VLM |
| self_attn_every_n_layers | 2 | Samo-pozornost prokládaná křížovou pozorností |
| chunk_size / n_action_steps | 50 / 50 | Jeden průchod vygeneruje 50 akcí a všech 50 je provedeno |
| num_steps | 10 | Denoising s porovnáváním toku je pevně nastaven na 10 kroků |
| tokenizer_max_length | 48 | Instrukce je zkrácena na 48 tokenů |
| freeze_vision_encoder / train_expert_only | True / True | Jemné doladění posouvá experta, nikoli vizuální věž |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nejedná se o recept z článku: jeho předtrénink použil 100-krokový warmup přes 200000 kroků |
Předtrénink využil 481 komunitních datasetů LeRobot, 22,9 tisíc epizod a 10,6 milionů snímků na 4 GPU, 200000 kroků s globální dávkou 256; článek odhaduje celý projekt na přibližně 30 tisíc GPU hodin. Jedno číslo k pozornosti: blog Hugging Face k uvedení uvádí 487 kurátorovaných datasetů, zatímco tabulka v článku uvádí 481. Používáme údaj z článku a upozorňujeme na nesoulad.

| Benchmark | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| Průměr LIBERO, víceúlohové | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Průměr Meta-World, víceúlohové | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Skutečný SO-100, 3 úlohy, víceúlohové trénování | 78.3 | - | 61.7 (3.5 B) | - |
| Skutečný SO-100, 3 úlohy, jednoúlohové, bez robotického předtréninku | 40.0 | - | - | 48.3 |
| SO-101 lego pick-place, jednoúlohové, v distribuci | 90 | - | - | 70 |
| SO-101 lego pick-place, jednoúlohové, mimo distribuci | 50 | - | - | 40 |
LIBERO je simulace a vše kompetentní tam nyní dosahuje skóre v osmdesátkách. Řádek se skutečným SO-100, kde model 450 M poráží model 3.5 B o 16.6 bodů, je ten zajímavý; řádek pod ním je protiváha. Odstraníme-li komunitní předtrénink a víceúlohové trénování, stejný model klesne na 40.0, pod ACT. Obhajitelným tvrzením je, že malý model není automaticky horší, nikoli že je lepší.
Jedna náhoda pomáhá: tabulka Meta-World v článku SmolVLA uvádí vlastní publikovaná čísla TinyVLA jako základ, takže poprvé oba modely sedí v jedné tabulce, SmolVLA-0.45B na 57.3 proti TinyVLA-H na 31.6. Také uvádí, že trénink SmolVLA je přibližně o 40 procent rychlejší než Pi0 na 6x menší paměti. Vše pochází od autorů SmolVLA; záznam v aréně odkazuje každou hodnotu na její zdroj.
Kde SmolVLA tráví svůj čas
AY-Robots uvádí SmolVLA na 245 ms na krok akce a ACT na 20 ms v katalogu politik. TinyVLA uvádí 14 ms na predikci akce. Tato čísla nejsou srovnatelná a považovat je za srovnatelná je nejčastější chybou v tomto tématu: někteří měří jeden průchod vpřed, někteří tento průchod rozdělí napříč blokem, jakmile rozdělení akcí na bloky to amortizuje.
- SmolVLA vydává 50 akcí na jeden průchod vpřed a provádí všech 50. Při 30 snímcích za sekundu, které článek používá na skutečných robotech, pokrývá jedna inference přibližně 1.7 sekundy pohybu.
- Asynchronní inference počítá další blok, zatímco aktuální se stále provádí: průměrné dokončení úkolu 9.7 s oproti 13.75 s synchronnímu, zhruba o 30 procent rychlejší, a 19 cyklů pick-and-place v pevném 60sekundovém okně oproti 9.
- Míra úspěšnosti byla spíše srovnatelná než lepší, 78.3 synchronní oproti 73.3 asynchronní. Asynchronní režim zvyšuje propustnost, nikoli přesnost.
- Rozdělení na bloky skrývá latenci výpočtů, nikoli latenci sítě, a činí politiku méně reaktivní, protože je vázána na 50 akcí.
AY-Robots dokáže automaticky zřídit cloudový GPU pod, který obsluhuje vaši politiku, zatímco lokální robotický klient komunikuje s tímto koncovým bodem, a pod obsahuje nečinný watchdog, takže se sám zničí, místo aby tiše účtoval. Co však nedělá, je odstranění zpáteční cesty přes veřejný internet. Řídicí smyčka napříč pěti politikami zde je 20 až 485 ms na akční krok před jakoukoli sítí, takže vzdálená inference je životaschopná pro pomalé úlohy typu pick-and-place, nikoli pro rychlý reaktivní pohyb.

Jemné ladění SmolVLA na jedné spotřebitelské kartě
Manuální cesta, na lerobot 0.6.1, aktuální vydání PyPI k 23. srpnu 2026. Vše níže pochází z dokumentace Hugging Face lerobot SmolVLA, stažené tentýž den; vedená verze je šetrnější.
- 1Nainstalujte lerobot s doplňkem smolvla
Závislosti SmolVLA jsou volitelným doplňkem, nejsou součástí základní instalace. Instalace bez nich a následné přemýšlení, proč je typ politiky neznámý, je běžná ztráta půl hodiny.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Získejte datovou sadu s dostatečným počtem epizod
Dokumentace doporučuje kolem 50 epizod a uvádí, že stejný úkol s 25 epizodami nestačil. AY-Robots stanovuje minimum na 30. Nahrajte si vlastní, nebo začněte z adresáře datových sad.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Spusťte doladění
Příkaz z průvodce lerobot, neupravený. Dokumentace uvádí 20000 kroků na přibližně 4 hodiny na jedné A100. Na 24 GB kartě očekávejte delší dobu a změřte ji.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Snižte velikost dávky, dokud se nevejde
batch_size=64 je zdokumentovaný příklad, nikoli slib ohledně vaší karty. Dokumentace doporučuje začít s malou hodnotou a zvyšovat ji, dokud zůstávají doby načítání krátké.
bashlerobot-train --help - 5Nasaďte checkpoint na rameno
Stejná knihovna, jeden příkaz. Příznaky pro chunking v reálném čase jsou v dokumentaci zakomentovány a jsou to ty, po kterých sáhnete na hardwaru s nízkým výkonem.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Ať už se vydáte jakoukoli cestou, skončíte s checkpointem a konfigurací, která ho vytvořila. Uchovávejte revizi datové sady, počet kroků a seed vedle něj. lerobot standardně používá seed 1000; vstupní bod pro doladění GR00T neexponuje žádný seed, takže tyto běhy nejsou bitově reprodukovatelné. Mechanika v dokumentaci k tréninku.
Dva způsoby, jak dostat malý VLA na rameno
Vlastníte stroj a režimy selhání. Pro SmolVLA je to rozumné: jeden pip extra, jeden tréninkový příkaz, jeden rollout příkaz. Pro TinyVLA je to reprodukce výzkumu se zamrzlými piny, nefunkční cestou DeepSpeed a konverzí dat, kterou si napíšete sami.
- Pořiďte si 24 GB kartu, nahrajte 30 až 50 epizod, ověřte streamy z kamer snímek po snímku.
- pip install -e ".[smolvla]", lerobot-train proti lerobot/smolvla_base, poté obsluhujte checkpoint na stroji, ke kterému je rameno připojeno.
- Pro TinyVLA: samostatné conda prostředí, konvertujte data do HDF5, zaregistrujte úlohu v constants.py, opravte cestu zero2.json, ořízněte train.sh z osmi GPU na jednu.
- Žádné hodinové účtování, jakmile je karta zaplacena.
- Inference sedí vedle servomotorů, jediný způsob, jak získat rychlou řídicí smyčku.
- Můžete patchovat kód politiky a TinyVLA je k dispozici pouze tímto způsobem.
- 4090 vylučuje každou ~3 B politiku, takže žádné lokální srovnání s GR00T N1.7 nebo Pi0.5.
- Nastavení prostředí je skutečná práce. Samotné piny TinyVLA mohou stát den.
- Žádná fronta, žádné opakování, žádné úložiště checkpointů. Restart v kroku 14000 znamená začít znovu.
SmolVLA je jednou z pěti politik zde. Model a datovou sadu vyberete ve formuláři, backend pronajme GPU podle požadované VRAM, spustí trénink a zapíše checkpoints do objektového úložiště. Krok za krokem: SmolVLA na SO-100, nebo celá matice na stránce tréninku.
| Co platforma posílá pro SmolVLA | Hodnota |
|---|---|
| velikost dávky | 2 |
| rychlost učení | 1e-4 |
| maximální kroky | 20000 |
| akumulace gradientu | 8, a nedostane se k trénerovi |
| další ovládací prvky ve formuláři | seed, logFreq |
| úroveň GPU | RTX 4090 or any 24 GB card |
| formát datové sady | LeRobot v3.0 |
| minimální počet epizod | 30 |
Zaprvé, výchozí velikost dávky je zde 2, nikoli 64 jako v příkladu dokumentace lerobot, a nastavení akumulace gradientu je odesláno, ale nemá žádný vliv na SmolVLA, takže efektivní dávka je skutečně 2. Zvyšte ji záměrně, spíše než abyste předpokládali, že výchozí hodnota odpovídá upstreamu. Zadruhé, TinyVLA zde vůbec nelze trénovat.
Běh na 24 GB úrovni trvá 2 až 5 hodin při 0.30 to 0.60 USD za hodinu, zhruba 1 to 3 USD. Na úrovni A100 je ~3 B politika 3 až 6 hodin při 1.20 to 2.00 USD za hodinu, zhruba 4 to 12 USD. Viz ceník, a stejné operace z CLI a MCP serveru.
Kdy je malý model špatnou volbou
Oba články jsou zde opatrnější než jejich shrnutí. Analýza selhání TinyVLA je specifická: varianta 0.4 B selhala třikrát špatným přečtením instrukce, což autoři připisují omezenému porozumění jazyka u menšího VLM, a tento režim zmizel u 1.3 B. SmolVLA ukazuje stejnou křivku z druhého konce: verze 2.25 B identické architektury dosahuje skóre 88.75 na LIBERO a 68.24 na Meta-World oproti 87.3 a 57.3 pro model 0.45 B.
- Vejde se na 24 GB kartu, což snižuje náklady na experiment z desítek dolarů na pár.
- Dostatečně rychlý na běh vedle ramene, takže žádný síťový skok v řídicí smyčce.
- Jemné doladění na datech, která může zaznamenat jedna osoba, desítky epizod namísto tisíců.
- Váhy, seznam dat a kód SmolVLA jsou veřejné, takže špatný výsledek je laditelný.
- Slabší plnění instrukcí: méně jazykových parametrů, menší schopnost rozlišit podobné referenční výrazy.
- Menší prostorová a vizuální generalizace na nastavení, která jste nezaznamenali.
- Citlivější na vady datové sady, s menším množstvím předtrénování, na které se lze spolehnout.
- Víceúlohové a dlouhodobé práce stále upřednostňují větší modely, včetně vlastní varianty SmolVLA 2.25 B.
Srovnání, které stojí za to provést, není TinyVLA proti SmolVLA. Je to SmolVLA proti ACT na vašem vlastním úkolu, a článek o SmolVLA je argumentem proč. Trénovaný na jedné úloze bez předtrénování v robotice, SmolVLA dosáhl průměru 40.0 napříč třemi úlohami SO-100, kde jednoúlohové ACT dosáhlo 48.3. Co ho pozvedá na 78.3, je komunitní předtrénování plus víceúlohové trénování, nikoli samotná architektura. Na úloze SO-101 s legem, obě jednoúlohové, SmolVLA skutečně vítězí: 90 proti 70 v distribuci. Poté SmolVLA proti Pi0.5 pokud to rozpočet dovolí.
Méně předtrénování předem k pokrytí špatných dat znamená, že čistá křivka ztráty na vadné datové sadě vám poskytne politiku, která s jistotou reprodukuje vadu. Dokumentace lerobot je ohledně struktury nekompromisní: 50 epizod napříč 5 pozicemi kostek, 10 na pozici, fungovalo; 25 ne. Pokud ztráta vypadá v pořádku a rameno nedělá nic užitečného, začněte u ztráta klesá, politika nic nedělá, politika funguje pouze v jednom nastavení nebo sběr skutečně použitelných tréninkových dat VLA pro manipulaci s robotem.
Pět politik, jedna srovnávací tabulka
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT se skutečným počtem parametrů, latencí inference na akční krok, úrovní GPU, kterou každý potřebuje, a minimálním počtem epizod, než začne dělat něco užitečného.
Porovnat politikyRozhodovací tabulka, podle které můžete jednat
| Vaše situace | Začněte s | Proč |
|---|---|---|
| Jeden úkol, dobré demonstrace, bez jazyka | ACT | ~80 M, 20 ms, 24 GB karta, žádný základní model ke stažení |
| Několik souvisejících úkolů, každý s jednou instrukcí | SmolVLA | 450 M, v lerobot, minimálně 30 epizod, 1 až 3 USD za běh |
| Konkrétně reprodukce výsledku TinyVLA | TinyVLA-B or TinyVLA-H | Repo je jediná cesta: izolované prostředí, převedená data |
| Víceúkolové, různé instrukce, rozpočet A100 | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms a 485 ms na krok, 4 až 12 USD za běh |
| Zatím žádný robot | Ovládejte skutečné rameno | Živé rameno založené na frontě nepotřebuje registraci ani hardware |
Pro poslední řádek, živé rameno streamuje fyzický SO-100, který můžete ovládat z prohlížeče bez účtu, a tři způsoby, jak začít pokrývají zbytek. SO-100 je zde referenční rameno, zhruba 110 až 150 EUR v dílech, s kompletním průvodcem nastavením.
Co následuje po modelech pod 1 B
Zmenšování počtu parametrů je jedním ze způsobů, jak zlevnit VLA, a není to zjevně ten vítězný. OpenVLA-OFT (arXiv 2502.19645) si zachovává 7 B páteř a mění pouze způsob dekódování akcí, přičemž uvádí 26násobné zvýšení propustnosti generování akcí a nárůst LIBERO ze 76,5 na 97,1 procenta. BitVLA (arXiv 2506.07530) převádí každou váhu 1bitové páteře BitNet b1.58 2B4T na ternární, přičemž uvádí 11,0x menší paměť a 4,4x nižší end-to-end latenci při zachování přesnosti OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) se nachází na hranici 1 B s flow matching.
Společná nit: dekodér akcí, nikoli jazykový model, je místem, kde se skrývá latence. Zeptejte se, jak politika vydává akce, než se zeptáte, kolik má parametrů. Aréna obsahuje 85 modelů a 332 výsledků, každý s odkazem na svůj zdroj; širší přehled naleznete v našem úvodu do VLA.
Mohu doladit SmolVLA na RTX 4090?▾
Ano. SmolVLA má 450 M parametrů a AY-Robots jej provozuje na úrovni RTX 4090 / 24 GB. Příklad lerobot používá --batch_size=64, což je spíše příklad než záruka pro vaši kartu; dokumentace doporučuje začít s malým nastavením a postupně zvyšovat, dokud zůstávají doby načítání krátké. Očekávejte delší dobu než přibližně 4 hours, které dokumentace uvádí pro 20000 steps na A100.
Je TinyVLA k dispozici v lerobot nebo na AY-Robots?▾
Ne, ani jedno. TinyVLA existuje pouze ve svém výzkumném repozitáři, poslední commit 11 March 2025, a jeho formát je HDF5 ve stylu ACT spíše než LeRobot. AY-Robots trénuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT. Pokud chcete TinyVLA, musíte si jej sestavit sami a nejprve budete muset opravit cestu ke konfiguraci DeepSpeed v scripts/train.sh.
Je model s 450 M parametry skutečně konkurenceschopný s modelem s 3 B parametry?▾
Podle vlastních benchmarků autorů ano: 87.3 proti 86.0 na LIBERO oproti roboticky předtrénovanému Pi0 s 3.3 B, a 78.3 proti 61.7 na třech reálných úlohách SO-100, kde stejný článek označuje Pi0 s 3.5 B. Limit je ve stejném článku: pro jednu úlohu bez robotického předtrénování klesá SmolVLA na 40.0, pod ACT 48.3.
Kolik epizod potřebuji, než malý VLA něco udělá?▾
AY-Robots stanovuje minimum pro SmolVLA na 30 episodes a minimum pro ACT na 50. Dokumentace lerobot doporučuje kolem 50 a uvádí, že 25 nebylo dostatečných pro stejnou úlohu. Struktura je stejně důležitá jako počet: sada v článku používala 5 cube positions s 10 episodes pro každou.
Proč se publikované hodnoty latence tak moc liší?▾
Měří různé věci. TinyVLA uvádí 14 ms na predikci akce na A6000; AY-Robots uvádí SmolVLA na 245 ms a ACT na 20 ms na akční krok. Některé údaje pokrývají jeden dopředný průchod, některé rozdělují průchod přes 50-action chunk a téměř žádné nezahrnují snímání kamerou nebo zápis na serva.
Řeší cloudová inference problém s GPU?▾
Částečně. AY-Robots automaticky zřizuje pod, který obsluhuje politiku, zatímco lokální klient komunikuje s tímto koncovým bodem, s nečinným hlídačem, takže se sám zničí, místo aby tiše účtoval. Nemůže odstranit zpáteční cestu přes veřejný internet a řídicí smyčka je již 20 to 485 ms na akční krok. Dobré pro pomalé uchopování a umisťování, ne pro rychlý reaktivní pohyb.
Sources
- TinyVLA: Směrem k rychlým, datově efektivním vizuálně-jazykově-akčním modelům pro robotickou manipulaci
- TinyVLA oficiální kódový repozitář (README, requirements.txt, scripts/train.sh)
- TinyVLA projektová stránka
- lesjie/Llava-Pythia-1.3B, váhy páteřní sítě TinyVLA-H
- SmolVLA: Vizuálně-jazykově-akční model pro cenově dostupnou a efektivní robotiku
- dokumentace lerobot: doladění SmolVLA
- lerobot: configuration_smolvla.py, výchozí nastavení SmolVLA
- karta modelu lerobot/smolvla_base
- SmolVLA: Efektivní vizuálně-jazykově-akční model (blog Hugging Face)
- lerobot na PyPI (0.6.1, vyžaduje Python 3.12 nebo novější)
- OpenVLA: Open-Source vizuálně-jazykově-akční model
- Doladění vizuálně-jazykově-akčních modelů: Optimalizace rychlosti a úspěšnosti (OpenVLA-OFT)
- BitVLA: 1-bit vizuálně-jazykově-akční modely pro robotickou manipulaci
- X-VLA: Transformer s měkkým promptem jako škálovatelný vizuálně-jazykově-akční model pro různé embodimenty
- karta modelu rail-berkeley/octo-small-1.5 (27 M parametrů)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started