Tabuľka porovnania politík AY-Robots s počtom parametrov, úrovňami GPU a latenciou inferencie pre GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT
SmolVLATinyVLAMalé VLASpotrebiteľské GPULeRobot

Malé VLA modely: TinyVLA, SmolVLA a prípad pod 1 miliardu parametrov

AY-Robots ResearchAugust 23, 202619 min čítania

TinyVLA a SmolVLA prinášajú funkčné VLA pod 1 miliardu parametrov. Reálne čísla z oboch článkov, predvolené nastavenia LeRobot, nameraná latencia a náklady na spustenie na 24 GB karte.

Takmer každý vizuálno-jazykovo-akčný model o ktorom sa píše, predpokladá kartu dátového centra. OpenVLA má 7 miliárd parametrov. GR00T N1.7 a Pi0.5 majú okolo 3 miliárd parametrov a na doladenie potrebujú A100 80 GB. Ak je karta na vašom stole 4090, táto trieda modelov je mimo dosahu.

Dva články tvrdia, že to nepotrebujete. TinyVLA (arXiv 2409.12514, prijatý IEEE Robotics and Automation Letters vo februári 2025) stavia VLA z chrbtice s 400 miliónmi až 1,3 miliardami parametrov plus difúznu akčnú hlavu. SmolVLA (arXiv 2506.01844, odoslaný 2. júna 2025) dodáva 450 miliónov parametrov s otvorenými váhami, otvorenými dátami a skriptom, ktorý beží na jednej spotrebiteľskej karte. Tu je to, čo oba modely namerali, a kde argument pod 1 miliardu prestáva platiť.

Čo potrebujete vedieť

  • TinyVLA dodáva tri veľkosti: 422 miliónov celkovo so 101 miliónmi trénovateľných, 740 miliónov so 138 miliónmi, 1,3 miliardy so 143 miliónmi. Len prvé dve sú pod 1 miliardou.
  • Jeho tabuľka IV meria 14 ms na predikciu akcie pre TinyVLA-1B na jednej A6000, oproti 292 ms pre OpenVLA-7B a 140 ms pre zmenšený OpenVLA-1B.
  • Túto rýchlosť drží hlava, nie chrbtica: vymeňte difúznu hlavu TinyVLA-H za hlavu ACT a päť úloh reálneho robota klesne z priemeru 94,0 na jednociferné čísla. Hlava MLP dosahuje 0 všade.
  • SmolVLA má 450 miliónov parametrov, z toho približne 100 miliónov je akčný expert, predtrénovaný na 481 komunitných datasetoch LeRobot a 10,6 miliónoch snímok. Uvádza 87,3 na LIBERO oproti 86,0 pre roboticky predtrénovaný Pi0 s 3,3 miliardami parametrov a 78,3 na troch reálnych úlohách SO-100 oproti 61,7 pre Pi0 s 3,5 miliardami parametrov.
  • Trénovaný na jednej úlohe bez tohto predtrénovania, SmolVLA klesá na 40,0 pri týchto úlohách, pod ACT 48,3. Malé neznamená automaticky ľahké.
  • TinyVLA nemá integráciu LeRobot a vyžaduje balík CUDA 11.7. SmolVLA je v lerobot a stojí približne 1 až 3 USD za spustenie na úrovni 24 GB tu.

Čo sa skutočne považuje za malý VLA

Počet parametrov na karte modelu nie je jedno číslo. Môže to znamenať celkové váhy, váhy načítané pri inferencii, alebo váhy, ktoré prijímajú gradienty počas . TinyVLA uvádza oboje a rozdiel je veľký: TinyVLA-H má celkovo 1.3 B, ale 143 M trénovateľných, pretože vizuálna veža a väčšina jazykového modelu zostávajú zmrazené, zatiaľ čo adaptéry LoRA a akčná hlava sa pohybujú. Príspevok uvádza trénovateľný podiel na približne 5 percent.

ModelParametreZákladAkčná hlavaZdroj
TinyVLA-S422 M celkovo, 101 M trénovateľnýchLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M celkovo, 138 M trénovateľnýchLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B celkovo, 143 M trénovateľnýchLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M akčný expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 Mškála ViT-S, textový kódovač T5-BaseDiffusionocto-small-1.5 card
ACT~80 MResNet, bez jazykového modeluPriama regresia blokovAY-Robots catalog
OpenVLA7 BLlama 2 7 B, kódovače DINOv2 a SigLIPAutoregresívne akčné tokenyarXiv 2406.09246

Dva riadky stoja za diskusiu. s približne 80 M je menší ako všetko ostatné tu, ale nemá jazykový model, takže to nie je VLA: učí sa jednu úlohu a nemožno mu prikázať, aby robil inú. s 27 M je podmienený prostredníctvom textového kódovača T5-Base, nie chrbtice LLM. Dobré základné modely, ani jeden vám neposkytuje dodržiavanie pokynov, ktoré naznačuje štítok.

Hranica 1 B je ľubovoľná

TinyVLA-H, variant s hlavnými výsledkami, má 1.3 B a je nad touto hranicou. Lepšou otázkou je, či sa model zmestí do 24 GB počas tréningu a dosiahne vašu kontrolnú frekvenciu pri inferencii. Päť politík, ktoré tu môžete trénovať, nájdete na stránke politík; TinyVLA má záznam v aréne, ak chcete jeho čísla vedľa ostatných.

TinyVLA: rýchlosť pochádza z hlavy, nie z chrbtice

Zjavné čítanie je, že zmenšili jazykový model, takže sa zrýchlil. Ablácia v článku hovorí opak. Výmena 7 B chrbtice OpenVLA za približne 1 B znížila predikciu na akciu z 292 ms na 140 ms, čo je 2x zisk. TinyVLA-H, s porovnateľným počtom parametrov, beží na 14 ms na rovnakej karte. Ďalších 10x je akčná hlava.

ModelPredikcia na akciuMerané na
OpenVLA-7B292 msjedna A6000
OpenVLA-1B, chrbtica vymenená za chrbticu TinyVLA140 msjedna A6000
TinyVLA-1B (TinyVLA-H)14 msjedna A6000

OpenVLA emituje akcie ako diskretizované tokeny cez hlavu jazykového modelu, jeden na dimenziu akcie, autoregresívne. TinyVLA pripája difúzny dekodér, ktorý produkuje celý blok naraz. Tabuľka V obsahuje architektúru TinyVLA-H a mení iba hlavu, na rovnakých piatich úlohách skutočného robota. Je to najčistejší dôkaz v oboch článkoch pre argument, ktorý robia politiky párovania toku, a dôvod, prečo sa Pi0 odklonil od dekódovania tokenov.

Head on TinyVLA-HPlaceTennisFlipMugStackCubesCloseDrawerOpenBox
Difúzia (droid_diffusion)90.098.398.396.786.7
Action Chunking Transformer13.38.38.313.323.3
Viacvrstvový perceptrón00000
Čo pokrývajú čísla TinyVLA

Údaje 292 / 140 / 14 ms sú z Tabuľky IV, všetky na jednom A6000. Predstavujú predikciu na jednu akciu a nezahŕňajú snímanie kamerou, predbežné spracovanie a sériový zápis na servá. Zverejnenú latenciu považujte za dolnú hranicu, nikdy nie za riadiacu frekvenciu. Naše vlastné čísla majú rovnaké obmedzenie: pozrite si latenciu inferencie.

Čo dosiahla TinyVLA

BenchmarkProtokolTinyVLA-HZákladné modely
MetaWorld, 50 úloh, simuláciaViacúlohové, 50 ukážok, 3 seed-y77.6 / 21.5 / 11.4 / 15.8 podľa obtiažnosti, priemer 31.6Diffusion Policy priemer 10.5
Real Franka Panda, 5 úloh100 trajektórií na úlohu, 20 pokusov94.0 priemerOpenVLA 68.3, Diffusion Policy 35.3
Bimanual UR5, 3 úlohyViacúlohové, 10 pokusov na úlohu76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Riadok pre bimanipuláciu má nudné vysvetlenie, ktoré si článok dáva sám: OpenVLA je predtrenovaný na Open X-Embodiment, ktorý pozostáva výlučne z dát pre jednu ruku, takže akčný priestor pre dve ruky je mimo distribúcie a dosahuje nulové skóre. Základná línia difúznej politiky prekonáva TinyVLA-H na dvoch z týchto troch úloh. Pozadie v článku o Open X-Embodiment.

Rebríček AY-Robots arény, triediteľná tabuľka 85 VLA modelov s 332 výsledkami benchmarkov, pričom každá hodnota je prepojená späť na článok alebo kartu modelu, z ktorého pochádza.
Čísla benchmarkov medzi modelmi sú porovnateľné len vtedy, ak vidíte, odkiaľ každý pochádza.

Repozitár TinyVLA, stav k augustu 2026

Článok je dobrý. Kód je výskumný výstup. Repozitár je github.com/liyaxuanliyaxuan/TinyVLA; jeho README datuje vydanie kódu na 17. februára 2025 a posledný commit je z 11. marca 2025. Dobré na reprodukciu článku, problém, ak by ste chceli udržiavanú knižnicu.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Inštalačná sekvencia z README TinyVLA, skontrolovaná voči repozitáru dňa 2026-08-23.
Závislosti sú pasca, ktorá pohltí celý deň

requirements.txt pins torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, and the CUDA stack to the 11.x wheels: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README vyžaduje Python 3.10; lerobot 0.6.1 vyžaduje 3.12 alebo novší, takže tieto dva nemôžu zdieľať jedno prostredie. Najprv si overte, či existuje zostava torch 2.0.1 pre vašu generáciu GPU. Ak namiesto toho beh zlyhá kvôli VRAM, kontrolný zoznam pre nedostatok pamäte je rýchlejší ako hádanie.

TinyVLA tiež nečíta LeRobot datasety. Jeho formát je HDF5 v štýle ACT: akcia, language_raw a skupina pozorovaní s viacpohľadovými obrázkami, joint_positions, qpos a qvel. Repozitár obsahuje data_utils/rlds_to_h5py.py pre vstup RLDS a každá úloha je ručne zaregistrovaná v aloha_scripts/constants.py s jej dataset_dir, episode_len a camera_names. Ak vaše epizódy pochádzajú z lerobot alebo z desktopového klienta, konverzia je na vás.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Skrátené zo scripts/train.sh. Každý príznak a hodnota vyššie sú v dodanom súbore.
  • --num_gpus=8 predpokladá uzol s ôsmimi kartami. Nastavte ho na 1 a znížte veľkosť dávky hlboko pod 32. Žiadny variant pre jednu GPU sa nedodáva upstream, takže príkaz nemožno spustiť doslovne na 4090.
  • --deepspeed scripts/zero2.json odkazuje na súbor, ktorý nie je v adresári scripts najvyššej úrovne. Konfigurácie DeepSpeed sa dodávajú v llava-pythia/scripts/zero2.json. Opravte cestu pred prvým spustením.
  • README vyžaduje, aby názov výstupného adresára obsahoval llava_pythia, plus lora, ak je povolená LoRA.
  • Základná sieť je samostatné stiahnutie: lesjie/Llava-Pythia-400M, -700M alebo -1.3B. Neexistuje žiadny jediný základný kontrolný bod, na ktorý by ste nasmerovali politiku tak, ako smerujete na lerobot/smolvla_base.

SmolVLA: model pod 1 miliardu parametrov, ktorý môžete spustiť už dnes popoludní

SmolVLA predkladá rovnaký argument v rámci udržiavanej knižnice. Má 450 miliónov parametrov na základnej sieti SmolVLM2-500M-Video-Instruct a efektivita pochádza z nastavení, ktoré si môžete prečítať v configuration_smolvla.py, a nie z tvrdenia o tom, že je malý.

Nastavenie v configuration_smolvla.pyPredvolenéČo to prináša
num_vlm_layers16Spúšťa sa len prvých 16 vrstiev jazykového modelu
expert_width_multiplier0.75Skrytá veľkosť akčného experta je 75 percent VLM
self_attn_every_n_layers2Samo-pozornosť prekladaná s krížovou pozornosťou
chunk_size / n_action_steps50 / 50Jeden prechod vygeneruje 50 akcií a všetkých 50 sa vykoná
num_steps10Denoising s prispôsobením toku pevne nastavený na 10 krokov
tokenizer_max_length48Inštrukcia je skrátená na 48 tokenov
freeze_vision_encoder / train_expert_onlyTrue / TrueJemné doladenie presúva experta, nie vizuálnu vežu
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Nie je to recept z článku: jeho pretrénovanie použilo 100-krokový warmup počas 200000 krokov

Predtréning využil 481 komunitných datasetov LeRobot, 22,9 tisíc epizód a 10,6 milióna snímok na 4 GPU, 200000 krokov pri globálnej dávke 256; článok odhaduje celý projekt na približne 30 tisíc GPU hodín. Jedno číslo, ktoré treba sledovať: blog o spustení Hugging Face uvádza 487 kurátorovaných datasetov, zatiaľ čo tabuľka v článku uvádza 481. Používame údaj z článku a upozorňujeme na nesúlad.

Stránka modelu SmolVLA na AY-Robots zobrazujúca počet parametrov, úroveň GPU s 24 GB, latenciu inferencie na akčný krok a minimálny počet epizód
Stránka SmolVLA platformy: 450 miliónov parametrov, 245 ms na akčný krok, úroveň RTX 4090, minimálne 30 epizód.
BenchmarkSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
Priemer LIBERO, viacúlohové87.388.7586.0 (3.3 B, robotics-pretrained)-
Priemer Meta-World, viacúlohové57.368.2447.9 (3.5 B, robotics-pretrained)-
Reálny SO-100, 3 úlohy, viacúlohové trénovanie78.3-61.7 (3.5 B)-
Reálny SO-100, 3 úlohy, jednoúlohové, bez predtrénovania pre robotiku40.0--48.3
SO-101 lego pick-place, jednoúlohové, v distribúcii90--70
SO-101 lego pick-place, jednoúlohové, mimo distribúcie50--40
Prečítajte si celú tabuľku, nie len titulný riadok

LIBERO je simulácia a všetko kompetentné tam teraz dosahuje skóre v osemdesiatkach. Riadok s reálnym SO-100, kde 450 M model prekonáva 3,5 B model o 16,6 bodu, je ten zaujímavý; riadok pod ním je protipólom. Ak odstránime komunitné predtrénovanie a viacúlohové trénovanie, ten istý model klesne na 40,0, pod ACT. Obhájiteľné tvrdenie je, že malý model nie je automaticky horší, nie že je lepší.

Jedna náhoda pomáha: tabuľka Meta-World v článku SmolVLA obsahuje vlastné publikované čísla TinyVLA ako základ, takže pre raz oba modely sedia v jednej tabuľke, SmolVLA-0.45B na 57.3 proti TinyVLA-H na 31.6. Tiež uvádza, že tréning SmolVLA je približne o 40 percent rýchlejší ako Pi0 s 6x menšou pamäťou. Všetko pochádza od autorov SmolVLA; záznam v aréne odkazuje každú hodnotu na jej zdroj.

Kde SmolVLA trávi svoj čas

AY-Robots uvádza SmolVLA na 245 ms na krok akcie a ACT na 20 ms v katalógu politík. TinyVLA uvádza 14 ms na predikciu akcie. Tieto čísla nie sú porovnateľné a zaobchádzanie s nimi, akoby boli, je najčastejšou chybou v tejto téme: niektoré merajú jeden dopredný prechod, niektoré rozdelia tento prechod cez blok, keď ho rozdelenie akcií na bloky amortizuje.

  • SmolVLA vydáva 50 akcií na jeden dopredný prechod a vykonáva všetkých 50. Pri 30 fps, ktoré článok používa na reálnych robotoch, jeden inferenčný prechod pokrýva približne 1.7 sekundy pohybu.
  • Asynchrónna inferencia vypočítava ďalší blok, zatiaľ čo aktuálny sa stále vykonáva: 9.7 s priemerný čas dokončenia úlohy oproti 13.75 s synchrónne, približne o 30 percent rýchlejšie, a 19 cyklov uchopenia a umiestnenia v pevnom 60-sekundovom okne oproti 9.
  • Miera úspešnosti bola porovnateľná, nie lepšia, 78.3 synchrónne oproti 73.3 asynchrónne. Asynchrónnosť kupuje priepustnosť, nie presnosť.
  • Rozdelenie na bloky (chunking) skrýva latenciu výpočtu, nie latenciu siete, a robí politiku menej reaktívnou, pretože je viazaná na 50 akcií.
Vzdialená inferencia nie je zadarmo a žiadna platforma neopraví fyziku

AY-Robots dokáže automaticky zriadiť cloudový GPU pod, ktorý obsluhuje vašu politiku, zatiaľ čo lokálny robotický klient komunikuje s týmto koncovým bodom, a pod obsahuje nečinný watchdog, takže sa sám zničí namiesto tichého účtovania. Čo však nerobí, je odstránenie okružnej cesty cez verejný internet. Riadiaca slučka naprieč piatimi politikami je tu 20 až 485 ms na akčný krok pred akoukoľvek sieťou, takže vzdialená inferencia je životaschopná pre pomalé operácie typu pick-and-place, nie pre rýchly reaktívny pohyb.

Porovnávacia tabuľka politík AY-Robots zobrazujúca GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT s počtom parametrov, požadovanou úrovňou GPU, latenciou inferencie na akčný krok a minimálnym počtom epizód, ktoré každá potrebuje
SmolVLA s ~450 M a ACT s ~80 M sú tie dve, ktoré sa zmestia na 24 GB kartu. Ostatné tri potrebujú A100 alebo H100 80 GB.

Jemné ladenie SmolVLA na jednej spotrebiteľskej karte

Manuálna cesta, na lerobot 0.6.1, aktuálnej verzii PyPI k 23. augustu 2026. Všetko nižšie pochádza z dokumentácie Hugging Face lerobot SmolVLA, získanej v ten istý deň; vedená verzia je jemnejšia.

  1. 1
    Nainštalujte lerobot s doplnkom smolvla

    Závislosti SmolVLA sú voliteľným doplnkom, nie súčasťou základnej inštalácie. Inštalácia bez nich a následné premýšľanie, prečo je typ politiky neznámy, je bežná strata polhodiny.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Získajte dátovú sadu s dostatočným počtom epizód

    Dokumentácia odporúča približne 50 epizód a uvádza, že rovnaká úloha s 25 epizódami nebola dostatočná. AY-Robots stanovuje minimum na 30. Nahrajte si vlastné, alebo začnite z adresára dátových sád.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Spustite doladenie

    Príkaz z príručky lerobot, neupravený. Dokumentácia uvádza 20000 krokov približne na 4 hodiny na jednej A100. Na 24 GB karte očakávajte dlhší čas a zmerajte ho.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Znížte veľkosť dávky, kým sa nezmestí

    batch_size=64 je zdokumentovaný príklad, nie prísľub týkajúci sa vašej karty. Dokumentácia odporúča začať s malou hodnotou a zvyšovať ju, pokiaľ časy načítania zostávajú krátke.

    bash
    lerobot-train --help
  5. 5
    Nasaďte checkpoint na rameno

    Rovnaká knižnica, jeden príkaz. Príznaky pre chunking v reálnom čase sú v dokumentácii zakomentované a sú to tie, po ktorých siahnete na hardvéri s nízkym výkonom.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Checkpoint je dodávka

Nech už sa vydáte akoukoľvek cestou, skončíte s checkpointom plus konfiguráciou, ktorá ho vytvorila. Uchovajte revíziu dátovej sady, počet krokov a seed vedľa neho. lerobot predvolene používa seed 1000; vstupný bod doladenia GR00T neexponuje žiadny seed, takže tieto spustenia nie sú bitovo reprodukovateľné. Mechanika v dokumentácii k trénovaniu.

Dva spôsoby, ako dostať malý VLA na rameno

Vlastníte stroj a režimy zlyhania. Pre SmolVLA je to rozumné: jeden pip extra, jeden príkaz na trénovanie, jeden príkaz na nasadenie. Pre TinyVLA je to reprodukcia výskumu so zamrznutými pinmi, nefunkčnou cestou DeepSpeed a konverziou dát, ktorú si napíšete sami.

  1. Získajte 24 GB kartu, nahrajte 30 až 50 epizód, overte streamy kamier snímku po snímke.
  2. pip install -e ".[smolvla]", lerobot-train proti lerobot/smolvla_base, potom naservírujte checkpoint na stroji, ku ktorému je pripojené rameno.
  3. Pre TinyVLA: samostatné conda prostredie, konvertujte dáta do HDF5, zaregistrujte úlohu v constants.py, opravte cestu zero2.json, znížte train.sh z ôsmich GPU na jedno.
Výhody
  • Žiadne hodinové účtovanie, akonáhle je karta zaplatená.
  • Inferencia sedí vedľa servomotorov, jediný spôsob, ako získať rýchlu riadiacu slučku.
  • Môžete patchovať kód politiky a TinyVLA je k dispozícii iba týmto spôsobom.
Kompromisy
  • 4090 vylučuje každú ~3 B politiku, takže žiadne lokálne porovnanie s GR00T N1.7 alebo Pi0.5.
  • Nastavenie prostredia je skutočná práca. Samotné piny TinyVLA môžu stáť deň.
  • Žiadna fronta, žiadne opakovanie, žiadne úložisko checkpointov. Reštart pri kroku 14000 znamená začať znova.

Keď je malý model nesprávna voľba

Oba články sú tu opatrnejšie ako ich zhrnutia. Analýza zlyhaní TinyVLA je špecifická: variant 0,4 B zlyhal trikrát nesprávnym prečítaním inštrukcie, čo autori pripisujú obmedzenému jazykovému porozumeniu v menšom VLM, a tento režim zmizol pri 1,3 B. SmolVLA ukazuje rovnakú krivku z druhého konca: verzia 2,25 B identickej architektúry dosahuje skóre 88,75 na LIBERO a 68,24 na Meta-World oproti 87,3 a 57,3 pre model 0,45 B.

Výber VLA pod 1 B
Kde vyhráva
  • Zmestí sa na 24 GB kartu, čo zníži náklady na experiment z desiatok dolárov na pár.
  • Dostatočne rýchle na spustenie vedľa ramena, takže žiadny sieťový skok v riadiacej slučke.
  • Jemné doladenie na dátach, ktoré môže zaznamenať jedna osoba, desiatky epizód namiesto tisícok.
  • Váhy, zoznam dát a kód SmolVLA sú verejné, takže zlý výsledok je možné ladiť.
Kde stráca
  • Slabšie dodržiavanie pokynov: menej jazykových parametrov, menšia schopnosť oddeliť podobné referenčné výrazy.
  • Menšia priestorová a vizuálna generalizácia na nastavenia, ktoré ste nezaznamenali.
  • Citlivejšie na chyby v dátovej sade, s menším predtrénovaním, na ktoré sa dá spoľahnúť.
  • Viacúlohová práca a práca s dlhým horizontom stále uprednostňuje väčšie modely, vrátane vlastného variantu SmolVLA 2,25 B.

Porovnanie, ktoré stojí za to spustiť, nie je TinyVLA proti SmolVLA. Je to SmolVLA proti ACT na vašej vlastnej úlohe, a článok o SmolVLA je argumentom prečo. Trénovaný na jednej úlohe bez predtrénovania robotiky, SmolVLA dosiahol priemer 40,0 v troch úlohách SO-100, kde jednorazový ACT dosiahol 48,3. To, čo ho pozdvihuje na 78,3, je komunitné predtrénovanie plus viacúlohové trénovanie, nie samotná architektúra. Na úlohe SO-101 s legom, obe jednorazové, SmolVLA vyhráva: 90 proti 70 v distribúcii. Potom SmolVLA proti Pi0.5 ak to rozpočet dovolí.

Pri tejto veľkosti rozhoduje o výsledku dataset

Je menej predtrénovania, ktoré by pokrylo zlé dáta, takže čistá krivka straty na chybnom datasete vám poskytne politiku, ktorá s istotou reprodukuje chybu. Dokumentácia lerobot je priamočiara ohľadom štruktúry: 50 epizód naprieč 5 pozíciami kocky, 10 na pozíciu, fungovalo; 25 nie. Ak strata vyzerá v poriadku a rameno nerobí nič užitočné, začnite pri strata klesá, politika nerobí nič, politika funguje len v jednom nastavení alebo zbieraní tréningových dát VLA, ktoré sú skutočne použiteľné.

Päť politík, jedna porovnávacia tabuľka

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT so skutočným počtom parametrov, latenciou inferencie na akčný krok, úrovňou GPU, ktorú každý potrebuje, a minimálnym počtom epizód, kým urobí niečo užitočné.

Porovnať politiky

Rozhodovacia tabuľka, podľa ktorej môžete konať

Vaša situáciaZačnite sPrečo
Jedna úloha, dobré ukážky, žiadny jazykACT~80 M, 20 ms, 24 GB karta, žiadny základný model na stiahnutie
Niekoľko súvisiacich úloh, jedna inštrukcia pre každúSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
Špecifická reprodukcia výsledku TinyVLATinyVLA-B or TinyVLA-HRepozitár je jediná cesta: izolované prostredie, konvertované dáta
Viac úloh, rôznorodé inštrukcie, rozpočet A100GR00T N1.7 or Pi0.5~3 B, 152 ms a 485 ms na krok, 4 až 12 USD per run
Zatiaľ žiadny robotOvládať skutočné ramenoŽivé rameno založené na fronte nevyžaduje registráciu ani hardvér

Pre posledný riadok, živé rameno streamuje fyzický SO-100, ktorý môžete ovládať z prehliadača bez účtu, a tri spôsoby spustenia pokrývajú zvyšok. SO-100 je tu referenčné rameno, približne 110 až 150 EUR v súčiastkach, s kompletným sprievodcom nastavením.

Čo prichádza po modeloch pod 1 B

Zmenšenie počtu parametrov je jedným zo spôsobov, ako urobiť VLA lacným, a nie je to nevyhnutne ten víťazný. OpenVLA-OFT (arXiv 2502.19645) si zachováva 7 B chrbticu a mení len spôsob dekódovania akcií, pričom uvádza 26-násobné zvýšenie priepustnosti generovania akcií a nárast LIBERO zo 76.5 na 97.1 percenta. BitVLA (arXiv 2506.07530) robí každý váhový parameter 1-bitovej chrbtice BitNet b1.58 2B4T ternárnym, pričom uvádza 11.0x menšiu pamäť a 4.4x nižšiu end-to-end latenciu pri zachovaní presnosti OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) sa nachádza na hranici 1 B s flow matchingom.

Spoločná niť: dekodér akcií, nie jazykový model, je miestom, kde sa nachádza latencia. Spýtajte sa, ako politika emituje akcie, predtým než sa spýtate, koľko parametrov má. Aréna má 85 modelov a 332 výsledkov, každý prepojený so svojím zdrojom; širší prehľad nájdete v našom úvode do VLA.

Môžem doladiť SmolVLA na RTX 4090?

Áno. SmolVLA má 450 M parametrov a AY-Robots ho spúšťa na úrovni RTX 4090 / 24 GB. Príklad lerobot používa --batch_size=64, čo je skôr príklad ako záruka pre vašu kartu; dokumentácia odporúča začať s malými hodnotami a zvyšovať ich, pokiaľ časy načítania zostávajú krátke. Očakávajte dlhšie časy ako približne 4 hodiny, ktoré dokumentácia uvádza pre 20000 krokov na A100.

Je TinyVLA dostupná v lerobot alebo na AY-Robots?

Nie, ani jedno. TinyVLA existuje iba vo svojom výskumnom repozitári, posledný commit 11 March 2025, a jeho formát je HDF5 v štýle ACT, nie LeRobot. AY-Robots trénuje GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA a ACT. Ak chcete TinyVLA, musíte si ho zostaviť sami a najprv budete musieť opraviť cestu ku konfigurácii DeepSpeed v scripts/train.sh.

Je 450 M model skutočne konkurencieschopný s 3 B modelom?

Podľa vlastných benchmarkov autorov áno: 87.3 proti 86.0 na LIBERO oproti roboticky predtrenovanému Pi0 s 3.3 B, a 78.3 proti 61.7 na troch reálnych úlohách SO-100, kde ten istý článok označuje Pi0 s 3.5 B. Limit je v tom istom článku: pri jednej úlohe bez robotického pretrénovania klesá SmolVLA na 40.0, pod ACT 48.3.

Koľko epizód potrebujem, kým malý VLA niečo urobí?

AY-Robots stanovuje minimum pre SmolVLA na 30 epizód a pre ACT na 50. Dokumentácia lerobot odporúča okolo 50 a uvádza, že 25 nebolo dosť pre rovnakú úlohu. Štruktúra je rovnako dôležitá ako počet: súbor v článku použil 5 pozícií kociek s 10 epizódami pre každú.

Prečo sa zverejnené čísla latencie tak veľmi líšia?

Merajú rôzne veci. TinyVLA uvádza 14 ms na predikciu akcie na A6000; AY-Robots uvádza SmolVLA na 245 ms a ACT na 20 ms na akčný krok. Niektoré údaje pokrývajú jeden dopredný prechod, niektoré rozdeľujú prechod cez 50-akčný blok a takmer žiadne nezahŕňajú snímanie kamerou alebo zápis do servomotorov.

Rieši cloudová inferencia problém s GPU?

Čiastočne. AY-Robots automaticky zriaďuje pod, ktorý obsluhuje politiku, zatiaľ čo lokálny klient komunikuje s týmto koncovým bodom, s nečinným watchdogom, takže sa sám zničí namiesto tichého účtovania. Nemôže odstrániť okružnú cestu cez verejný internet a riadiaca slučka je už 20 až 485 ms na akčný krok. Dobré pre pomalé uchopovanie a umiestňovanie, nie pre rýchly reaktívny pohyb.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started