Tabulka porovnání politik AY-Robots s počty parametrů, úrovněmi GPU a latencí inference pro GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT
SmolVLATinyVLAMalé VLASpotřebitelské GPULeRobot

Malé modely VLA: TinyVLA, SmolVLA a případ pod 1 miliardu parametrů

AY-Robots ResearchAugust 23, 202619 min čtení

TinyVLA a SmolVLA umísťují funkční VLA pod 1 miliardu parametrů. Skutečná čísla z obou článků, výchozí nastavení lerobot, naměřená latence a co stojí spuštění na 24 GB kartě.

Téměř každý vizuálně-jazykově-akční model, o kterém se píše, předpokládá datacentrovou kartu. OpenVLA má 7 miliard parametrů. GR00T N1.7 a Pi0.5 mají kolem 3 miliard parametrů a pro jemné doladění vyžadují A100 80 GB. Pokud je karta na vašem stole 4090, tato třída modelů je mimo dosah.

Dva články tvrdí, že to nepotřebujete. TinyVLA (arXiv 2409.12514, přijato IEEE Robotics and Automation Letters v únoru 2025) staví VLA z páteřní sítě o velikosti 400 milionů až 1,3 miliardy parametrů plus difuzní akční hlavu. SmolVLA (arXiv 2506.01844, odesláno 2. června 2025) dodává 450 milionů parametrů s otevřenými váhami, otevřenými daty a skriptem, který běží na jedné spotřebitelské kartě. Zde je to, co oba změřily, a kde argument pod 1 miliardu parametrů přestává platit.

Co potřebujete vědět

  • TinyVLA se dodává ve třech velikostech: celkem 422 milionů s 101 milionem trénovatelných, 740 milionů s 138 miliony, 1,3 miliardy s 143 miliony. Pouze první dvě jsou pod 1 miliardou.
  • Jeho tabulka IV měří 14 ms na predikci akce pro TinyVLA-1B na jedné A6000, oproti 292 ms pro OpenVLA-7B a 140 ms pro zmenšený OpenVLA-1B.
  • Tuto rychlost drží hlava, nikoli páteřní síť: vyměňte difuzní hlavu TinyVLA-H za hlavu ACT a pět úloh reálného robota klesne z průměru 94,0 na jednociferná čísla. Hlava MLP dosahuje 0 všude.
  • SmolVLA má 450 milionů parametrů, zhruba 100 milionů z nich tvoří akční expert, předtrénovaný na 481 komunitních datových sadách LeRobot a 10,6 milionu snímků. Uvádí 87,3 na LIBERO oproti 86,0 pro roboticky předtrénovaný Pi0 s 3,3 miliardami parametrů a 78,3 na třech reálných úlohách SO-100 oproti 61,7 pro Pi0 s 3,5 miliardami parametrů.
  • Trénovaný na jednu úlohu bez tohoto předtrénování, SmolVLA klesá na 40,0 u těchto úloh, pod 48,3 ACT. Malý neznamená automaticky snadný.
  • TinyVLA nemá integraci LeRobot a vyžaduje stack CUDA 11.7 wheel. SmolVLA je v lerobot a stojí zhruba 1 to 3 USD za běh na úrovni 24 GB zde.

Co se skutečně počítá jako malý VLA

Počet parametrů na kartě modelu není jedno číslo. Může znamenat celkové váhy, váhy načtené při inferenci, nebo váhy, které přijímají gradienty během . TinyVLA uvádí obojí a rozdíl je velký: TinyVLA-H má celkem 1,3 B, ale 143 M je trénovatelných, protože vizuální věž a většina jazykového modelu zůstávají zmrazené, zatímco adaptéry LoRA a akční hlava se pohybují. Článek uvádí trénovatelný podíl na přibližně 5 procentech.

ModelParametryPáteřní síťAkční hlavaZdroj
TinyVLA-SCelkem 422 M, 101 M trénovatelnýchLlava-Pythia ~400 MDifúze (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-BCelkem 740 M, 138 M trénovatelnýchLlava-Pythia ~700 MDifúzearXiv 2409.12514
TinyVLA-HCelkem 1,3 B, 143 M trénovatelnýchLlava-Pythia ~1.3 BDifúzearXiv 2409.12514
SmolVLA450 M, ~100 M akční expertSmolVLM2-500M-Video-InstructExpert na párování tokůarXiv 2506.01844
Octo-Small27 MMěřítko ViT-S, textový kodér T5-BaseDifúzeocto-small-1.5 card
ACT~80 MResNet, bez jazykového modeluPřímá regrese blokůAY-Robots catalog
OpenVLA7 BLlama 2 7 B, kodéry DINOv2 a SigLIPAutoregresivní akční tokenyarXiv 2406.09246

Dva řádky stojí za diskuzi. s přibližně 80 M je menší než vše ostatní zde, ale nemá jazykový model, takže to není VLA: učí se jeden úkol a nelze mu říct, aby dělal jiný. s 27 M je podmíněn textovým kodérem T5-Base, nikoli páteřní sítí LLM. Dobré základní modely, ani jeden vám nedá dodržování instrukcí, které název naznačuje.

Hranice 1 B je libovolná

TinyVLA-H, varianta s hlavními výsledky, má 1,3 B a je nad touto hranicí. Lepší otázkou je, zda se model vejde do 24 GB během tréninku a dosáhne vaší řídicí frekvence při inferenci. Pět politik, které zde můžete trénovat, najdete na stránce politik; TinyVLA má záznam v aréně, pokud chcete jeho čísla vedle ostatních.

TinyVLA: rychlost pochází z hlavy, ne z páteře

Zřejmý výklad je, že zmenšili jazykový model, a tak se zrychlil. Ablační studie v článku však říká něco jiného. Výměna 7B páteře OpenVLA za zhruba 1B snížila predikci na akci z 292 ms na 140 ms, což je 2x zrychlení. TinyVLA-H, srovnatelný počtem parametrů, běží na 14 ms na stejné kartě. Dalších 10x je akční hlava.

ModelPredikce na akciMěřeno na
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, páteř vyměněna za TinyVLA140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA vydává akce jako diskretizované tokeny prostřednictvím hlavy jazykového modelu, jeden na dimenzi akce, autoregresivně. TinyVLA připojuje difuzní dekodér, který produkuje celý blok najednou. Tabulka V obsahuje architekturu TinyVLA-H a mění pouze hlavu, na stejných pěti úkolech reálného robota. Je to nejčistší důkaz v obou článcích pro argument, že politiky párování toků vytvářejí, a důvod, proč Pi0 se odklonilo od dekódování tokenů.

Hlava na TinyVLA-HPlaceTennisFlipMugStackCubesCloseDrawerOpenBox
Diffusion (droid_diffusion)90.098.398.396.786.7
Action Chunking Transformer13.38.38.313.323.3
Vícevrstvý perceptron00000
Co pokrývají čísla TinyVLA

Údaje 292 / 140 / 14 ms jsou z tabulky IV, všechny na jednom A6000. Jsou to údaje na predikci akce a nezahrnují snímání kamerou, předzpracování a sériový zápis na serva. Zveřejněnou latenci považujte za dolní hranici, nikdy ne za řídicí frekvenci. Naše vlastní čísla mají stejné omezení: viz latence inference.

Co dosáhla TinyVLA

BenchmarkProtokolTinyVLA-HZákladní modely
MetaWorld, 50 úloh, simulaceVíceúlohové, 50 ukázek, 3 semena77.6 / 21.5 / 11.4 / 15.8 podle obtížnosti, průměr 31.6Diffusion Policy průměr 10.5
Skutečná Franka Panda, 5 úloh100 trajektorií na úlohu, 20 pokusůprůměr 94.0OpenVLA 68.3, Diffusion Policy 35.3
Bimanual UR5, 3 úlohyVíceúlohové, 10 pokusů na úlohu76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Bimanualní řádek má nudné vysvětlení, které si článek dává sám: OpenVLA je předtrénováno na Open X-Embodiment, které se skládá výhradně z dat pro jednu paži, takže akční prostor pro dvě paže je mimo distribuci a dosahuje nulového skóre. Základní linie difuzní politiky poráží TinyVLA-H na dvou ze tří těchto úkolů. Pozadí v článek o Open X-Embodiment.

Žebříček arény AY-Robots, seřaditelná tabulka 85 modelů VLA s 332 výsledky benchmarků, každá hodnota odkazuje zpět na článek nebo kartu modelu, ze které pochází.
Čísla benchmarků napříč modely jsou srovnatelná pouze tehdy, když vidíte, odkud každé pochází.

Repozitář TinyVLA, k srpnu 2026

Článek je dobrý. Kód je výzkumný prototyp. Repozitář je github.com/liyaxuanliyaxuan/TinyVLA; jeho README datuje vydání kódu na 17. února 2025 a poslední commit je z 11. března 2025. Dobré pro reprodukci článku, problém, pokud byste chtěli udržovanou knihovnu.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Instalační sekvence z README TinyVLA, ověřeno proti repozitáři dne 2026-08-23.
Závislosti jsou pastí, která pohltí celý den

requirements.txt připíná torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 a zásobník CUDA na kola 11.x: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README vyžaduje Python 3.10; lerobot 0.6.1 vyžaduje 3.12 nebo novější, takže tyto dva nemohou sdílet jedno prostředí. Nejprve ověřte, zda existuje sestavení torch 2.0.1 pro vaši generaci GPU. Pokud běh místo toho selže kvůli VRAM, kontrolní seznam pro nedostatek paměti je rychlejší než hádání.

TinyVLA také nečte datové sady LeRobot. Jeho formát je HDF5 ve stylu ACT: akce, language_raw a skupina pozorování s více pohledovými obrázky, joint_positions, qpos a qvel. Repozitář dodává data_utils/rlds_to_h5py.py pro vstup RLDS a každý úkol je ručně registrován v aloha_scripts/constants.py s jeho dataset_dir, episode_len a camera_names. Pokud vaše epizody pocházely z lerobot nebo z desktopového klienta, konverzi vlastníte vy.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Zkráceno ze scripts/train.sh. Každý příznak a hodnota výše je v dodaném souboru.
  • --num_gpus=8 předpokládá uzel s osmi kartami. Nastavte jej na 1 a snižte velikost dávky hluboko pod 32. Žádná varianta s jednou GPU není dodávána upstream, takže příkaz nelze spustit doslovně na 4090.
  • --deepspeed scripts/zero2.json ukazuje na soubor, který není v adresáři scripts nejvyšší úrovně. Konfigurace DeepSpeed jsou dodávány v llava-pythia/scripts/zero2.json. Opravte cestu před prvním spuštěním.
  • README vyžaduje, aby název výstupního adresáře obsahoval llava_pythia, plus lora, pokud je LoRA povolena.
  • Páteř je samostatný ke stažení: lesjie/Llava-Pythia-400M, -700M or -1.3B. Neexistuje žádný jediný základní kontrolní bod, na který byste nasměrovali politiku tak, jako byste nasměrovali na lerobot/smolvla_base.

SmolVLA: model pod 1 B, který můžete spustit dnes odpoledne

SmolVLA předkládá stejný argument uvnitř udržované knihovny. Má 450 M parametrů na páteři SmolVLM2-500M-Video-Instruct a efektivita pochází z nastavení, která si můžete přečíst z configuration_smolvla.py, spíše než z tvrzení o tom, že je malý.

Nastavení v configuration_smolvla.pyVýchozíCo to přináší
num_vlm_layers16Spouští se pouze prvních 16 vrstev jazykového modelu
expert_width_multiplier0.75Skrytá velikost akčního experta je 75 procent VLM
self_attn_every_n_layers2Samo-pozornost prokládaná křížovou pozorností
chunk_size / n_action_steps50 / 50Jeden průchod vygeneruje 50 akcí a všech 50 je provedeno
num_steps10Denoising s porovnáváním toku je pevně nastaven na 10 kroků
tokenizer_max_length48Instrukce je zkrácena na 48 tokenů
freeze_vision_encoder / train_expert_onlyTrue / TrueJemné doladění posouvá experta, nikoli vizuální věž
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Nejedná se o recept z článku: jeho předtrénink použil 100-krokový warmup přes 200000 kroků

Předtrénink využil 481 komunitních datasetů LeRobot, 22,9 tisíc epizod a 10,6 milionů snímků na 4 GPU, 200000 kroků s globální dávkou 256; článek odhaduje celý projekt na přibližně 30 tisíc GPU hodin. Jedno číslo k pozornosti: blog Hugging Face k uvedení uvádí 487 kurátorovaných datasetů, zatímco tabulka v článku uvádí 481. Používáme údaj z článku a upozorňujeme na nesoulad.

Stránka modelu SmolVLA na AY-Robots ukazující počet parametrů, úroveň 24 GB GPU, latenci inference na akční krok a minimální počet epizod
Stránka SmolVLA platformy: 450 M parametrů, 245 ms na akční krok, úroveň RTX 4090, minimálně 30 epizod.
BenchmarkSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
Průměr LIBERO, víceúlohové87.388.7586.0 (3.3 B, robotics-pretrained)-
Průměr Meta-World, víceúlohové57.368.2447.9 (3.5 B, robotics-pretrained)-
Skutečný SO-100, 3 úlohy, víceúlohové trénování78.3-61.7 (3.5 B)-
Skutečný SO-100, 3 úlohy, jednoúlohové, bez robotického předtréninku40.0--48.3
SO-101 lego pick-place, jednoúlohové, v distribuci90--70
SO-101 lego pick-place, jednoúlohové, mimo distribuci50--40
Přečtěte si celou tabulku, ne jen řádek s nadpisem

LIBERO je simulace a vše kompetentní tam nyní dosahuje skóre v osmdesátkách. Řádek se skutečným SO-100, kde model 450 M poráží model 3.5 B o 16.6 bodů, je ten zajímavý; řádek pod ním je protiváha. Odstraníme-li komunitní předtrénink a víceúlohové trénování, stejný model klesne na 40.0, pod ACT. Obhajitelným tvrzením je, že malý model není automaticky horší, nikoli že je lepší.

Jedna náhoda pomáhá: tabulka Meta-World v článku SmolVLA uvádí vlastní publikovaná čísla TinyVLA jako základ, takže poprvé oba modely sedí v jedné tabulce, SmolVLA-0.45B na 57.3 proti TinyVLA-H na 31.6. Také uvádí, že trénink SmolVLA je přibližně o 40 procent rychlejší než Pi0 na 6x menší paměti. Vše pochází od autorů SmolVLA; záznam v aréně odkazuje každou hodnotu na její zdroj.

Kde SmolVLA tráví svůj čas

AY-Robots uvádí SmolVLA na 245 ms na krok akce a ACT na 20 ms v katalogu politik. TinyVLA uvádí 14 ms na predikci akce. Tato čísla nejsou srovnatelná a považovat je za srovnatelná je nejčastější chybou v tomto tématu: někteří měří jeden průchod vpřed, někteří tento průchod rozdělí napříč blokem, jakmile rozdělení akcí na bloky to amortizuje.

  • SmolVLA vydává 50 akcí na jeden průchod vpřed a provádí všech 50. Při 30 snímcích za sekundu, které článek používá na skutečných robotech, pokrývá jedna inference přibližně 1.7 sekundy pohybu.
  • Asynchronní inference počítá další blok, zatímco aktuální se stále provádí: průměrné dokončení úkolu 9.7 s oproti 13.75 s synchronnímu, zhruba o 30 procent rychlejší, a 19 cyklů pick-and-place v pevném 60sekundovém okně oproti 9.
  • Míra úspěšnosti byla spíše srovnatelná než lepší, 78.3 synchronní oproti 73.3 asynchronní. Asynchronní režim zvyšuje propustnost, nikoli přesnost.
  • Rozdělení na bloky skrývá latenci výpočtů, nikoli latenci sítě, a činí politiku méně reaktivní, protože je vázána na 50 akcí.
Vzdálená inference není zdarma a žádná platforma neopraví fyziku

AY-Robots dokáže automaticky zřídit cloudový GPU pod, který obsluhuje vaši politiku, zatímco lokální robotický klient komunikuje s tímto koncovým bodem, a pod obsahuje nečinný watchdog, takže se sám zničí, místo aby tiše účtoval. Co však nedělá, je odstranění zpáteční cesty přes veřejný internet. Řídicí smyčka napříč pěti politikami zde je 20 až 485 ms na akční krok před jakoukoli sítí, takže vzdálená inference je životaschopná pro pomalé úlohy typu pick-and-place, nikoli pro rychlý reaktivní pohyb.

Srovnávací tabulka politik AY-Robots ukazující GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT s počtem parametrů, požadovanou úrovní GPU, latencí inference na akční krok a minimálním počtem epizod, které každá potřebuje
SmolVLA s ~450 M a ACT s ~80 M jsou dva, které se vejdou na 24 GB kartu. Ostatní tři potřebují A100 nebo H100 80 GB.

Jemné ladění SmolVLA na jedné spotřebitelské kartě

Manuální cesta, na lerobot 0.6.1, aktuální vydání PyPI k 23. srpnu 2026. Vše níže pochází z dokumentace Hugging Face lerobot SmolVLA, stažené tentýž den; vedená verze je šetrnější.

  1. 1
    Nainstalujte lerobot s doplňkem smolvla

    Závislosti SmolVLA jsou volitelným doplňkem, nejsou součástí základní instalace. Instalace bez nich a následné přemýšlení, proč je typ politiky neznámý, je běžná ztráta půl hodiny.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Získejte datovou sadu s dostatečným počtem epizod

    Dokumentace doporučuje kolem 50 epizod a uvádí, že stejný úkol s 25 epizodami nestačil. AY-Robots stanovuje minimum na 30. Nahrajte si vlastní, nebo začněte z adresáře datových sad.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Spusťte doladění

    Příkaz z průvodce lerobot, neupravený. Dokumentace uvádí 20000 kroků na přibližně 4 hodiny na jedné A100. Na 24 GB kartě očekávejte delší dobu a změřte ji.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Snižte velikost dávky, dokud se nevejde

    batch_size=64 je zdokumentovaný příklad, nikoli slib ohledně vaší karty. Dokumentace doporučuje začít s malou hodnotou a zvyšovat ji, dokud zůstávají doby načítání krátké.

    bash
    lerobot-train --help
  5. 5
    Nasaďte checkpoint na rameno

    Stejná knihovna, jeden příkaz. Příznaky pro chunking v reálném čase jsou v dokumentaci zakomentovány a jsou to ty, po kterých sáhnete na hardwaru s nízkým výkonem.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Checkpoint je výstup

Ať už se vydáte jakoukoli cestou, skončíte s checkpointem a konfigurací, která ho vytvořila. Uchovávejte revizi datové sady, počet kroků a seed vedle něj. lerobot standardně používá seed 1000; vstupní bod pro doladění GR00T neexponuje žádný seed, takže tyto běhy nejsou bitově reprodukovatelné. Mechanika v dokumentaci k tréninku.

Dva způsoby, jak dostat malý VLA na rameno

Vlastníte stroj a režimy selhání. Pro SmolVLA je to rozumné: jeden pip extra, jeden tréninkový příkaz, jeden rollout příkaz. Pro TinyVLA je to reprodukce výzkumu se zamrzlými piny, nefunkční cestou DeepSpeed a konverzí dat, kterou si napíšete sami.

  1. Pořiďte si 24 GB kartu, nahrajte 30 až 50 epizod, ověřte streamy z kamer snímek po snímku.
  2. pip install -e ".[smolvla]", lerobot-train proti lerobot/smolvla_base, poté obsluhujte checkpoint na stroji, ke kterému je rameno připojeno.
  3. Pro TinyVLA: samostatné conda prostředí, konvertujte data do HDF5, zaregistrujte úlohu v constants.py, opravte cestu zero2.json, ořízněte train.sh z osmi GPU na jednu.
Výhody
  • Žádné hodinové účtování, jakmile je karta zaplacena.
  • Inference sedí vedle servomotorů, jediný způsob, jak získat rychlou řídicí smyčku.
  • Můžete patchovat kód politiky a TinyVLA je k dispozici pouze tímto způsobem.
Kompromisy
  • 4090 vylučuje každou ~3 B politiku, takže žádné lokální srovnání s GR00T N1.7 nebo Pi0.5.
  • Nastavení prostředí je skutečná práce. Samotné piny TinyVLA mohou stát den.
  • Žádná fronta, žádné opakování, žádné úložiště checkpointů. Restart v kroku 14000 znamená začít znovu.

Kdy je malý model špatnou volbou

Oba články jsou zde opatrnější než jejich shrnutí. Analýza selhání TinyVLA je specifická: varianta 0.4 B selhala třikrát špatným přečtením instrukce, což autoři připisují omezenému porozumění jazyka u menšího VLM, a tento režim zmizel u 1.3 B. SmolVLA ukazuje stejnou křivku z druhého konce: verze 2.25 B identické architektury dosahuje skóre 88.75 na LIBERO a 68.24 na Meta-World oproti 87.3 a 57.3 pro model 0.45 B.

Výběr VLA pod 1 B
Kde vítězí
  • Vejde se na 24 GB kartu, což snižuje náklady na experiment z desítek dolarů na pár.
  • Dostatečně rychlý na běh vedle ramene, takže žádný síťový skok v řídicí smyčce.
  • Jemné doladění na datech, která může zaznamenat jedna osoba, desítky epizod namísto tisíců.
  • Váhy, seznam dat a kód SmolVLA jsou veřejné, takže špatný výsledek je laditelný.
Kde ztrácí
  • Slabší plnění instrukcí: méně jazykových parametrů, menší schopnost rozlišit podobné referenční výrazy.
  • Menší prostorová a vizuální generalizace na nastavení, která jste nezaznamenali.
  • Citlivější na vady datové sady, s menším množstvím předtrénování, na které se lze spolehnout.
  • Víceúlohové a dlouhodobé práce stále upřednostňují větší modely, včetně vlastní varianty SmolVLA 2.25 B.

Srovnání, které stojí za to provést, není TinyVLA proti SmolVLA. Je to SmolVLA proti ACT na vašem vlastním úkolu, a článek o SmolVLA je argumentem proč. Trénovaný na jedné úloze bez předtrénování v robotice, SmolVLA dosáhl průměru 40.0 napříč třemi úlohami SO-100, kde jednoúlohové ACT dosáhlo 48.3. Co ho pozvedá na 78.3, je komunitní předtrénování plus víceúlohové trénování, nikoli samotná architektura. Na úloze SO-101 s legem, obě jednoúlohové, SmolVLA skutečně vítězí: 90 proti 70 v distribuci. Poté SmolVLA proti Pi0.5 pokud to rozpočet dovolí.

Při této velikosti rozhoduje o výsledku datová sada

Méně předtrénování předem k pokrytí špatných dat znamená, že čistá křivka ztráty na vadné datové sadě vám poskytne politiku, která s jistotou reprodukuje vadu. Dokumentace lerobot je ohledně struktury nekompromisní: 50 epizod napříč 5 pozicemi kostek, 10 na pozici, fungovalo; 25 ne. Pokud ztráta vypadá v pořádku a rameno nedělá nic užitečného, začněte u ztráta klesá, politika nic nedělá, politika funguje pouze v jednom nastavení nebo sběr skutečně použitelných tréninkových dat VLA pro manipulaci s robotem.

Pět politik, jedna srovnávací tabulka

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT se skutečným počtem parametrů, latencí inference na akční krok, úrovní GPU, kterou každý potřebuje, a minimálním počtem epizod, než začne dělat něco užitečného.

Porovnat politiky

Rozhodovací tabulka, podle které můžete jednat

Vaše situaceZačněte sProč
Jeden úkol, dobré demonstrace, bez jazykaACT~80 M, 20 ms, 24 GB karta, žádný základní model ke stažení
Několik souvisejících úkolů, každý s jednou instrukcíSmolVLA450 M, v lerobot, minimálně 30 epizod, 1 až 3 USD za běh
Konkrétně reprodukce výsledku TinyVLATinyVLA-B or TinyVLA-HRepo je jediná cesta: izolované prostředí, převedená data
Víceúkolové, různé instrukce, rozpočet A100GR00T N1.7 or Pi0.5~3 B, 152 ms a 485 ms na krok, 4 až 12 USD za běh
Zatím žádný robotOvládejte skutečné ramenoŽivé rameno založené na frontě nepotřebuje registraci ani hardware

Pro poslední řádek, živé rameno streamuje fyzický SO-100, který můžete ovládat z prohlížeče bez účtu, a tři způsoby, jak začít pokrývají zbytek. SO-100 je zde referenční rameno, zhruba 110 až 150 EUR v dílech, s kompletním průvodcem nastavením.

Co následuje po modelech pod 1 B

Zmenšování počtu parametrů je jedním ze způsobů, jak zlevnit VLA, a není to zjevně ten vítězný. OpenVLA-OFT (arXiv 2502.19645) si zachovává 7 B páteř a mění pouze způsob dekódování akcí, přičemž uvádí 26násobné zvýšení propustnosti generování akcí a nárůst LIBERO ze 76,5 na 97,1 procenta. BitVLA (arXiv 2506.07530) převádí každou váhu 1bitové páteře BitNet b1.58 2B4T na ternární, přičemž uvádí 11,0x menší paměť a 4,4x nižší end-to-end latenci při zachování přesnosti OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) se nachází na hranici 1 B s flow matching.

Společná nit: dekodér akcí, nikoli jazykový model, je místem, kde se skrývá latence. Zeptejte se, jak politika vydává akce, než se zeptáte, kolik má parametrů. Aréna obsahuje 85 modelů a 332 výsledků, každý s odkazem na svůj zdroj; širší přehled naleznete v našem úvodu do VLA.

Mohu doladit SmolVLA na RTX 4090?

Ano. SmolVLA má 450 M parametrů a AY-Robots jej provozuje na úrovni RTX 4090 / 24 GB. Příklad lerobot používá --batch_size=64, což je spíše příklad než záruka pro vaši kartu; dokumentace doporučuje začít s malým nastavením a postupně zvyšovat, dokud zůstávají doby načítání krátké. Očekávejte delší dobu než přibližně 4 hours, které dokumentace uvádí pro 20000 steps na A100.

Je TinyVLA k dispozici v lerobot nebo na AY-Robots?

Ne, ani jedno. TinyVLA existuje pouze ve svém výzkumném repozitáři, poslední commit 11 March 2025, a jeho formát je HDF5 ve stylu ACT spíše než LeRobot. AY-Robots trénuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT. Pokud chcete TinyVLA, musíte si jej sestavit sami a nejprve budete muset opravit cestu ke konfiguraci DeepSpeed v scripts/train.sh.

Je model s 450 M parametry skutečně konkurenceschopný s modelem s 3 B parametry?

Podle vlastních benchmarků autorů ano: 87.3 proti 86.0 na LIBERO oproti roboticky předtrénovanému Pi0 s 3.3 B, a 78.3 proti 61.7 na třech reálných úlohách SO-100, kde stejný článek označuje Pi0 s 3.5 B. Limit je ve stejném článku: pro jednu úlohu bez robotického předtrénování klesá SmolVLA na 40.0, pod ACT 48.3.

Kolik epizod potřebuji, než malý VLA něco udělá?

AY-Robots stanovuje minimum pro SmolVLA na 30 episodes a minimum pro ACT na 50. Dokumentace lerobot doporučuje kolem 50 a uvádí, že 25 nebylo dostatečných pro stejnou úlohu. Struktura je stejně důležitá jako počet: sada v článku používala 5 cube positions s 10 episodes pro každou.

Proč se publikované hodnoty latence tak moc liší?

Měří různé věci. TinyVLA uvádí 14 ms na predikci akce na A6000; AY-Robots uvádí SmolVLA na 245 ms a ACT na 20 ms na akční krok. Některé údaje pokrývají jeden dopředný průchod, některé rozdělují průchod přes 50-action chunk a téměř žádné nezahrnují snímání kamerou nebo zápis na serva.

Řeší cloudová inference problém s GPU?

Částečně. AY-Robots automaticky zřizuje pod, který obsluhuje politiku, zatímco lokální klient komunikuje s tímto koncovým bodem, s nečinným hlídačem, takže se sám zničí, místo aby tiše účtoval. Nemůže odstranit zpáteční cestu přes veřejný internet a řídicí smyčka je již 20 to 485 ms na akční krok. Dobré pro pomalé uchopování a umisťování, ne pro rychlý reaktivní pohyb.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started