Az AY-Robots irányelv-összehasonlító táblázata paraméterszámokkal, GPU szintekkel és következtetési késleltetéssel a GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT modellekhez
SmolVLATinyVLAKis VLAFogyasztói GPULeRobot

Kis VLA modellek: TinyVLA, SmolVLA és az 1 milliárd paraméter alatti eset

AY-Robots ResearchAugust 23, 202619 perc olvasás

A TinyVLA és a SmolVLA működő VLA-t helyez 1 milliárd paraméter alá. Valós számok mindkét tanulmányból, a lerobot alapértelmezései, mért késleltetés, és mennyibe kerül egy futtatás egy 24 GB-os kártyán.

Szinte minden látás-nyelv-akció modell amiről írnak, adatközponti kártyát feltételez. Az OpenVLA 7 milliárd paraméterrel rendelkezik. GR00T N1.7 és Pi0.5 körülbelül 3 milliárd paraméterrel rendelkeznek, és egy A100 80 GB-os kártyát igényelnek finomhangoláshoz. Ha az asztalán lévő kártya egy 4090-es, akkor az ilyen típusú modell elérhetetlen.

Két tanulmány is amellett érvel, hogy nincs rá szükség. A TinyVLA (arXiv 2409.12514, elfogadta az IEEE Robotics and Automation Letters 2025 februárjában) egy VLA-t épít egy 400 millió és 1,3 milliárd paraméter közötti gerinchálózatból, plusz egy diffúziós akciófejből. SmolVLA (arXiv 2506.01844, benyújtva 2025. június 2-án) 450 millió paramétert szállít nyílt súlyokkal, nyílt adatokkal és egy szkripttel, amely egyetlen fogyasztói kártyán fut. Íme, amit mindkettő mért, és hol szűnik meg érvényes lenni az 1 milliárd alatti paraméterekre vonatkozó érv.

Amit tudnia kell

  • A TinyVLA három méretben érhető el: 422 millió összesen 101 millió tréningezhető paraméterrel, 740 millió 138 millióval, 1,3 milliárd 143 millióval. Csak az első kettő marad 1 milliárd alatt.
  • A IV. táblázata 14 ms-t mér akcióelőrejelzésenként a TinyVLA-1B esetében egy A6000-en, szemben az OpenVLA-7B 292 ms-ével és egy zsugorított OpenVLA-1B 140 ms-ével.
  • A sebességet a fej tartja, nem a gerinchálózat: cserélje ki a TinyVLA-H diffúziós fejét egy ACT fejre, és az öt valós robotfeladat 94,0-es átlagról egyjegyű számokra esik. Egy MLP fej mindenhol 0 pontot ér el.
  • A SmolVLA 450 millió paraméterrel rendelkezik, ebből körülbelül 100 millió az akció szakértő, 481 közösségi LeRobot adatkészleten és 10,6 millió képkockán előtanítva. 87,3-at jelent a LIBERO-n, szemben egy robotikára előtanított 3,3 milliárd paraméteres Pi0 86,0-jával, és 78,3-at három valós SO-100 feladaton, szemben egy 3,5 milliárd paraméteres Pi0 61,7-jével.
  • Előtanítás nélkül, egyetlen feladatra tanítva a SmolVLA 40,0-ra esik ezeken a feladatokon, az ACT 48,3-as eredménye alá. A kicsi nem automatikusan könnyű.
  • A TinyVLA nem rendelkezik LeRobot integrációval, és egy CUDA 11.7 wheel stack-et rögzít. A SmolVLA a lerobotban található, és itt a 24 GB-os szinten futtatásonként körülbelül 1-3 USD-be kerül.

Mi számít valójában kis VLA-nak

A modellkártyán szereplő paraméterszám nem egyetlen szám. Jelentheti az összes súlyt, az inferencia során betöltött súlyokat, vagy azokat a súlyokat, amelyek gradienseket kapnak a során. A TinyVLA mindkettőt jelenti, és a különbség nagy: a TinyVLA-H összesen 1,3 B, de 143 M tanítható, mert a látásmodul és a nyelvi modell nagy része befagyasztva marad, miközben a LoRA adapterek és az akciófej mozognak. A tanulmány a tanítható rész arányát körülbelül 5 százalékra teszi.

ModellParaméterekGerincAkciófejForrás
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregressive action tokensarXiv 2406.09246

Két sorról érdemes vitatkozni. Az körülbelül 80 M-mal kisebb, mint bármi más itt, de nincs nyelvi modellje, így nem VLA: egy feladatot tanul meg, és nem lehet neki mást mondani. Az 27 M-mal egy T5-Base szövegkódolón keresztül van kondicionálva, nem LLM gerincen keresztül. Jó alapmodellek, de egyik sem adja meg az utasításkövetést, amit a címke sugall.

Az 1 B-s határ önkényes

A TinyVLA-H, a fő eredményeket hozó változat, 1,3 B, és a vonal felett helyezkedik el. A jobb kérdés az, hogy egy modell belefér-e 24 GB-ba a képzés során, és eléri-e a kívánt vezérlési sebességet az inferencia során. Az öt irányelv, amit itt képezhetsz, megtalálható az irányelvek oldalán; A TinyVLA-nak van egy aréna bejegyzése, ha a számait másoké mellett szeretnéd látni.

TinyVLA: a sebesség a fejből jön, nem a gerincmodulból

A nyilvánvaló értelmezés az, hogy kisebbé tették a nyelvi modellt, így gyorsabb lett. A tanulmány ablációs vizsgálata mást mutat. Az OpenVLA 7 B-s gerincmoduljának egy körülbelül 1 B-sre cserélése az akciónkénti előrejelzést 292 ms-ról 140 ms-ra csökkentette, ami 2-szeres gyorsulás. A TinyVLA-H, hasonló paraméterszámmal, 14 ms alatt fut ugyanazon a kártyán. A másik 10-szeres gyorsulás az akciófejnek köszönhető.

ModellAkciónkénti előrejelzésMérve
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

Az OpenVLA diszkretizált tokenekként bocsát ki akciókat a nyelvi modell fején keresztül, akciódimenziónként egyet, autoregresszíven. A TinyVLA egy diffúziós dekódert csatol, amely egyetlen lépésben állítja elő a teljes adatcsomagot. Az V. táblázat a TinyVLA-H architektúráját mutatja be, és csak a fejet cseréli ki, ugyanazon az öt valós robotfeladaton. Ez a legtisztább bizonyíték bármelyik tanulmányban arra az érvre, amit az áramlásillesztés alapú stratégiák támasztanak alá, és az ok, amiért a a Pi0 elmozdult a tokenalapú dekódolástól.

TinyVLA-H fejTeniszlabda elhelyezéseBögre megfordításaKockák egymásra rakásaFiók bezárásaDoboz kinyitása
Diffúzió (droid_diffusion)90.098.398.396.786.7
Akció daraboló transzformátor13.38.38.313.323.3
Többrétegű perceptron00000
Mit takarnak a TinyVLA számok

A 292 / 140 / 14 ms adatok a IV. táblázatból származnak, mind egy A6000-en futtatva. Ezek akciónkénti előrejelzésekre vonatkoznak, és nem tartalmazzák a kamera rögzítését, az előfeldolgozást és a szervókba történő soros írást. A közzétett késleltetést alsó határként kezelje, soha ne vezérlési sebességként. Saját számaink is ugyanezen korlátozással bírnak: lásd az inferencia késleltetést.

Mit ért el a TinyVLA

BenchmarkProtokollTinyVLA-HAlapvonalak
MetaWorld, 50 feladat, szimulációTöbbfeladatos, 50 demó, 3 seed77.6 / 21.5 / 11.4 / 15.8 nehézség szerint, átlag 31.6Diffusion Policy average 10.5
Valódi Franka Panda, 5 feladat100 trajektória feladatonként, 20 próba94.0 átlagOpenVLA 68.3, Diffusion Policy 35.3
Kétkezes UR5, 3 feladatTöbbfeladatos, 10 próba feladatonként76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

A kétkezes sorra a cikk maga ad unalmas magyarázatot: Az OpenVLA az Open X-Embodimenten van előképzve, ami kizárólag egykarú adatokat tartalmaz, így a kétkarú akciótér eloszlásán kívül esik, és nulla pontot ér el. A diffúziós policy alapvonal a TinyVLA-H-t veri ezen három feladat közül kettőn. Háttérinformációk itt: az Open X-Embodiment összefoglalóban.

Az AY-Robots aréna ranglistája, egy rendezhető táblázat 85 VLA modellről 332 benchmark eredménnyel, minden érték visszalinkelve arra a cikkre vagy modellkártyára, ahonnan származik
A modellközi benchmark számok csak akkor összehasonlíthatók, ha látható, honnan származik mindegyik.

A TinyVLA repó, 2026 augusztusi állapot szerint

A cikk jó. A kód egy kutatási kiadás. A tároló a github.com/liyaxuanliyaxuan/TinyVLA; a README-je szerint a kód 2025. február 17-én jelent meg, az utolsó commit pedig 2025. március 11-én történt. Egy cikk reprodukálásához megfelelő, de problémás, ha egy karbantartott könyvtárat szeretnénk.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
A TinyVLA README telepítési sorrendje, ellenőrizve a repositoryval szemben 2026-08-23-án.
A függőségi rögzítések az a csapda, ami egy napot felemészt

A requirements.txt rögzíti a torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 csomagokat, és a CUDA stacket a 11.x wheel-ekhez: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. A README Python 3.10-et kér; a lerobot 0.6.1 3.12-es vagy újabb verziót igényel, így a kettő nem osztozhat egy környezeten. Először ellenőrizze, hogy létezik-e torch 2.0.1 build az Ön GPU generációjához. Ha egy futás VRAM hiány miatt áll le, az memórián kívüli ellenőrzőlista gyorsabb, mint a találgatás.

A TinyVLA nem olvassa be a LeRobot adathalmazokat. Formátuma ACT-stílusú HDF5: action, language_raw, és egy observations csoport több nézetű képekkel, joint_positions, qpos és qvel adatokkal. A repository tartalmazza a data_utils/rlds_to_h5py.py fájlt RLDS bemenethez, és minden feladat manuálisan van regisztrálva az aloha_scripts/constants.py fájlban a dataset_dir, episode_len és camera_names paraméterekkel. Ha az Ön epizódjai a lerobotból vagy az asztali kliensből származnak, akkor Ön felel a konverzióért.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Rövidítve a scripts/train.sh fájlból. Minden fenti flag és érték megtalálható a mellékelt fájlban.
  • --num_gpus=8 nyolc kártyás csomópontot feltételez. Állítsa 1-re, és csökkentse a kötegméretet jóval 32 alá. Nincs egyetlen GPU-s változat sem a fő ágon, így a parancs nem futtatható szó szerint egy 4090-en.
  • --deepspeed scripts/zero2.json egy olyan fájlra mutat, amely nincs a legfelső szintű scripts könyvtárban. A DeepSpeed konfigurációk a llava-pythia/scripts/zero2.json útvonalon találhatók. Javítsa ki az útvonalat az első futtatás előtt.
  • A README megköveteli, hogy a kimeneti könyvtár neve tartalmazza a llava_pythia-t, plusz a lora-t, ha a LoRA engedélyezve van.
  • A gerinc külön letöltés: lesjie/Llava-Pythia-400M, -700M vagy -1.3B. Nincs egyetlen alap ellenőrzőpont, amire egy irányelvet mutatna, ahogy a lerobot/smolvla_base-re mutat.

SmolVLA: az 1 B alatti modell, amit ma délután futtathat

A SmolVLA ugyanazt az érvet fogalmazza meg egy karbantartott könyvtáron belül. 450 M paraméterrel rendelkezik egy SmolVLM2-500M-Video-Instruct gerincen, és a hatékonyság a configuration_smolvla.py fájlból kiolvasható beállításokból ered, nem pedig abból az állításból, hogy kicsi.

Beállítás a configuration_smolvla.py fájlbanAlapértelmezettMit eredményez
num_vlm_layers16Csak az első 16 nyelvi modell réteg fut
expert_width_multiplier0.75Az akció szakértő rejtett mérete a VLM 75 százaléka
self_attn_every_n_layers2Önfigyelem kereszt-figyelemmel váltakozva
chunk_size / n_action_steps50 / 50Egy menet 50 akciót bocsát ki, és mind az 50 végrehajtásra kerül
num_steps10Az áramlásillesztéses zajszűrés 10 lépésben rögzítve
tokenizer_max_length48Az utasítás 48 tokenre van csonkítva
freeze_vision_encoder / train_expert_onlyTrue / TrueA finomhangolás a szakértőt mozgatja, nem a látás tornyot
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Nem a cikk receptje: az előképzése 100 lépéses bemelegítést használt 200000 lépésen keresztül

Az előképzés 481 közösségi LeRobot adatkészletet, 22,9 K epizódot és 10,6 M képkockát használt 4 GPU-n, 200000 lépésben, 256-os globális köteggel; a tanulmány szerint a teljes projekt körülbelül 30 K GPU órát vett igénybe. Egy szám, amire érdemes figyelni: a Hugging Face indító blogja 487 kurált adatkészletet említ, ahol a tanulmány táblázata 481-et. Mi a tanulmány adatait használjuk, és jelezzük az eltérést.

Az AY-Robots SmolVLA modelloldala, amely a paraméterek számát, a 24 GB-os GPU szintet, a műveleti lépésenkénti következtetési késleltetést és a minimális epizódszámot mutatja.
A platform SmolVLA oldala: 450 M paraméter, 245 ms műveleti lépésenként, RTX 4090 szint, minimum 30 epizód.
TeljesítménytesztSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO átlag, többfeladatos87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World átlag, többfeladatos57.368.2447.9 (3.5 B, robotics-pretrained)-
Valós SO-100, 3 feladat, többfeladatos képzés78.3-61.7 (3.5 B)-
Valós SO-100, 3 feladat, egyfeladatos, robotikai előképzés nélkül40.0--48.3
SO-101 lego felvétel-elhelyezés, egyfeladatos, eloszlásban90--70
SO-101 lego felvétel-elhelyezés, egyfeladatos, eloszlásból kívül50--40
Olvassa el a teljes táblázatot, ne csak a címsort

A LIBERO szimuláció, és minden kompetens megoldás nyolcvanas értékeket ér el ott most. A valós SO-100 sor, ahol egy 450 M-es modell 16,6 ponttal veri a 3,5 B-s modellt, az érdekes; az alatta lévő sor az ellensúly. Ha eltávolítjuk a közösségi előképzést és a többfeladatos képzést, ugyanaz a modell 40,0-ra esik, az ACT alá. A védhető állítás az, hogy egy kis modell nem automatikusan rosszabb, nem pedig az, hogy jobb.

Egy véletlen segít: a SmolVLA tanulmány Meta-World táblázata a TinyVLA saját publikált számait tartalmazza alapként, így egyszerre mindkét modell egy táblázatban szerepel, a SmolVLA-0.45B 57.3-mal a TinyVLA-H 31.6-tal szemben. Azt is jelenti, hogy a SmolVLA képzése körülbelül 40 százalékkal gyorsabb, mint a Pi0-é, 6-szor kevesebb memóriával. Mindez a SmolVLA szerzőitől származik; az aréna bejegyzés linkeli az egyes értékeket a forrásához.

Hol tölti idejét a SmolVLA

Az AY-Robots a SmolVLA-t 245 ms/akciólépés, az ACT pedig 20 ms-ra sorolja a szabályzat katalógusban. A TinyVLA 14 ms-ot jelent akciós előrejelzésenként. Ezek a számok nem összehasonlíthatók, és a leggyakoribb hiba ebben a témában, ha úgy kezeljük őket, mintha azok lennének: egyesek egy előremenő passz idejét mérik, mások ezt a passzt egy darabra osztják, miután az akció darabolás amortizálja.

  • A SmolVLA 50 akciót bocsát ki előremenő passzonként, és mind az 50-et végrehajtja. A tanulmányban valós robotokon használt 30 fps mellett egy következtetés körülbelül 1,7 másodperc mozgást fed le.
  • Az aszinkron következtetés a következő darabot számítja ki, miközben az aktuális még fut: 9,7 s átlagos feladatvégrehajtás a 13,75 s szinkronnal szemben, nagyjából 30 százalékkal gyorsabb, és 19 felvételi és elhelyezési ciklus egy rögzített 60 másodperces ablakban 9-cel szemben.
  • A sikerességi arányok inkább összehasonlíthatók voltak, mint jobbak: 78,3 szinkron a 73,3 aszinkronnal szemben. Az aszinkron átviteli sebességet vásárol, nem pontosságot.
  • A darabolás elrejti a számítási késleltetést, nem a hálózati késleltetést, és kevésbé reaktívvá teszi a szabályzatot, mert 50 akcióra van elkötelezve.
A távoli következtetés nem ingyenes, és egyetlen platform sem javítja meg a fizikát

Az AY-Robots automatikusan képes felhő GPU podot biztosítani, amely kiszolgálja a házirendjét, miközben a helyi robotkliens kommunikál az adott végponttal, és a pod tartalmaz egy tétlen figyelőprogramot, így az magát pusztítja el ahelyett, hogy csendben számlázna. Amit nem tesz meg, az a nyilvános internetes oda-vissza út eltávolítása. Az itt található öt házirend vezérlőhurka 20-485 ms akció lépésenként, még hálózat nélkül is, így a távoli következtetés lassú pick-and-place feladatokhoz életképes, de gyors reaktív mozgáshoz nem.

Az AY-Robots házirend-összehasonlító táblázata, amely bemutatja a GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT modelleket paraméterszámokkal, szükséges GPU szinttel, következtetési késleltetéssel akció lépésenként és az egyes modellekhez szükséges minimális epizódszámmal
A SmolVLA (~450 M) és az ACT (~80 M) az a kettő, amely elfér egy 24 GB-os kártyán. A másik háromhoz A100 vagy H100 80 GB szükséges.

SmolVLA finomhangolása egy fogyasztói kártyán

A manuális út, a lerobot 0.6.1-en, a jelenlegi PyPI kiadás 2026. augusztus 23-i állapot szerint. Minden alábbi információ a Hugging Face lerobot SmolVLA dokumentációjából származik, amelyet ugyanazon a napon töltöttek le; az irányított verzió kíméletesebb.

  1. 1
    A lerobot telepítése a smolvla extrával

    A SmolVLA függőségek opcionális extrák, nem részei az alaptelepítésnek. Ha ezek nélkül telepítjük, majd azon tűnődünk, miért ismeretlen a házirend típusa, az gyakran fél óra elvesztegetett idő.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Szerezzen be elegendő epizódot tartalmazó adatkészletet

    A dokumentáció körülbelül 50 epizódot javasol, és kijelenti, hogy ugyanaz a feladat 25 epizóddal nem volt elegendő. Az AY-Robots 30-ban határozza meg a minimumot. Rögzítsen sajátot, vagy kezdje az adatkészlet-könyvtárból.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Indítsa el a finomhangolást

    A lerobot útmutatóból származó parancs, módosítás nélkül. A dokumentáció szerint 20000 lépés körülbelül 4 órát vesz igénybe egy A100-on. Egy 24 GB-os kártyán hosszabb időre számítson, és mérje meg.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Csökkentse a kötegméretet, amíg bele nem fér

    A batch_size=64 egy dokumentált példa, nem ígéret a kártyájával kapcsolatban. A dokumentáció azt tanácsolja, hogy kezdje kicsivel, és növelje, amíg a betöltési idők rövidek maradnak.

    bash
    lerobot-train --help
  5. 5
    Telepítse a checkpointot a karra

    Ugyanaz a könyvtár, egy parancs. A valós idejű darabolási jelzők ki vannak kommentelve a dokumentációban, és ezeket kell használni alacsony teljesítményű hardver esetén.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Az ellenőrzőpont a kézbesíthető eredmény

Bármilyen utat is választ, egy ellenőrzőponttal és az azt előállító konfigurációval zárja. Tartsa meg mellette az adatkészlet revízióját, a lépésszámot és a seedet. A lerobot alapértelmezés szerint 1000-es seedet használ; a GR00T finomhangolási belépési pontja egyáltalán nem tesz közzé seedet, így ezek a futtatások nem bitről bitre reprodukálhatók. A mechanika a képzési dokumentációban található.

Két módja van egy kis VLA karra juttatásának

Ön birtokolja a gépet és a hibamódokat. A SmolVLA esetében ez ésszerű: egy pip extra, egy train parancs, egy rollout parancs. A TinyVLA esetében ez egy kutatási reprodukció befagyott pinekkel, hibás DeepSpeed útvonallal és egy saját maga által írt adatkonverzióval.

  1. Szerezzen be egy 24 GB-os kártyát, rögzítsen 30-50 epizódot, ellenőrizze a kamera streameket képkockáról képkockára.
  2. pip install -e ".[smolvla]", lerobot-train a lerobot/smolvla_base ellen, majd szolgálja ki az ellenőrzőpontot azon a gépen, amelybe a kar csatlakoztatva van.
  3. TinyVLA esetén: külön conda környezet, adatok konvertálása HDF5-be, feladat regisztrálása a constants.py-ben, a zero2.json útvonal javítása, a train.sh nyolc GPU-ról egyre csökkentése.
Előnyök
  • Nincs óradíjas számlázás, miután a kártya ki van fizetve.
  • Az inferencia a szervók mellett helyezkedik el, ez az egyetlen módja a gyors vezérlőhurok elérésének.
  • Módosíthatja a házirend kódját, és a TinyVLA csak így érhető el.
Kompromisszumok
  • Egy 4090 kizár minden ~3 B házirendet, így nincs helyi összehasonlítás a GR00T N1.7 vagy Pi0.5 ellen.
  • A környezet beállítása az igazi munka. A TinyVLA pinek önmagukban egy napba is kerülhetnek.
  • Nincs sor, nincs újrapróbálkozás, nincs ellenőrzőpont tárolás. Egy újraindítás a 14000. lépésnél azt jelenti, hogy újra kell kezdeni.

Amikor egy kis modell a rossz választás

Mindkét tanulmány óvatosabb itt, mint az összefoglalók. A TinyVLA hibaelemzése specifikus: a 0.4 B változat háromszor hibázott az utasítás félreolvasásával, amit a szerzők a kisebb VLM korlátozott nyelvi megértésének tulajdonítanak, és ez a hiba 1.3 B-nél eltűnt. A SmolVLA ugyanezt a görbét mutatja a másik végéről: az azonos architektúra 2.25 B-s verziója 88.75 pontot ér el a LIBERO-n és 68.24-et a Meta-World-ön, szemben a 0.45 B-s modell 87.3 és 57.3 pontjával.

Egy 1 B alatti VLA kiválasztása
Hol nyer
  • Elfér egy 24 GB-os kártyán, ami egy kísérlet költségét tíz dollárról pár dollárra csökkenti.
  • Elég gyors ahhoz, hogy a kar mellett fusson, így nincs hálózati ugrás a vezérlőhurokban.
  • Egy személy által rögzíthető adatokon finomhangolható, tíz epizódon, nem pedig ezreken.
  • A SmolVLA súlyai, adatlistája és kódja nyilvános, így a rossz eredmény hibakereshető.
Hol veszít
  • Gyengébb utasításkövetés: kevesebb nyelvi paraméter, kisebb képesség a hasonló hivatkozó kifejezések elkülönítésére.
  • Kisebb térbeli és vizuális általánosítás azokra a beállításokra, amelyeket nem rögzített.
  • Érzékenyebb az adathalmaz hibáira, kevesebb előképzési előzménnyel, amire támaszkodhatna.
  • A többfeladatos és hosszú távú munka továbbra is a nagyobb modelleket részesíti előnyben, beleértve a SmolVLA saját 2.25 B változatát is.

A futtatásra érdemes összehasonlítás nem a TinyVLA a SmolVLA ellen. Hanem a SmolVLA a ACT a saját feladatán, és a SmolVLA tanulmány az érv amellett, hogy miért. Egyfeladatosan, robotikai előképzés nélkül tréningezve a SmolVLA átlagosan 40.0 pontot ért el három SO-100 feladatban, ahol az egyfeladatos ACT 48.3-at. Ami 78.3-ra emeli, az a közösségi előképzés plusz a többfeladatos tréning, nem pedig önmagában az architektúra. Az SO-101 lego feladatban, mindkettő egyfeladatosan, a SmolVLA nyer: 90 a 70 ellen eloszlásban. Aztán a SmolVLA a Pi0.5 ellen, ha a költségvetés engedi.

Ekkora méretnél az adatkészlet dönti el az eredményt

Kevesebb előképzés áll rendelkezésre a rossz adatok kompenzálására, így egy hibás adatkészleten kapott tiszta veszteséggörbe olyan irányelvet eredményez, amely magabiztosan reprodukálja a hibát. A lerobot dokumentációja egyértelmű a struktúrát illetően: 50 epizód 5 kockapozícióban, 10 pozíciónként, működött; 25 nem. Ha a veszteség rendben van, és a kar nem csinál semmi hasznosat, kezdje itt: a veszteség csökken, az irányelv nem csinál semmit, az irányelv csak egy beállításban működik vagy valóban használható VLA képzési adatok gyűjtése robotmanipulációhoz.

Öt irányelv, egy összehasonlító táblázat

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT valós paraméterekkel, műveleti lépésenkénti következtetési késleltetéssel, az egyes modellekhez szükséges GPU-szinttel és a minimális epizódszámmal, mielőtt bármi hasznosat tenne.

Hasonlítsa össze az irányelveket

Egy döntési táblázat, amely alapján cselekedhet

Az Ön helyzeteKezdje ezzelMiért
Egy feladat, jó demonstrációk, nincs nyelvACT~80 M, 20 ms, 24 GB card, no base model to download
Néhány kapcsolódó feladat, egy-egy utasításSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
A TinyVLA eredményének specifikus reprodukálásaTinyVLA-B or TinyVLA-HThe repo is the only route: isolated env, converted data
Többfeladatos, változatos utasítások, A100 költségvetésGR00T N1.7 or Pi0.5~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run
Még nincs robotVezessen egy valódi kartA sor alapú élő karhoz nincs szükség regisztrációra és hardverre

Az utolsó sorhoz, az élő kar egy fizikai SO-100-at streamel, amit fiók nélkül is vezérelhetsz a böngészőből, és a három indítási mód lefedi a többit. Az SO-100 itt a referencia kar, nagyjából 110-150 EUR alkatrészekben, egy teljes beállítási útmutatóval.

Mi jön az 1 milliárd alatti modellek után

A paraméterszám csökkentése az egyik módja annak, hogy egy VLA olcsó legyen, de nem feltétlenül ez a nyerő. OpenVLA-OFT (arXiv 2502.19645) megtartja a 7 B gerincet, és csak az akciók dekódolásának módját változtatja meg, 26-szoros növekedést jelentve az akciógenerálási átviteli sebességben, és a LIBERO 76,5-ről 97,1 százalékra emelkedését. BitVLA (arXiv 2506.07530) egy 1-bites BitNet b1.58 2B4T gerinc minden súlyát ternárissá teszi, 11,0-szer kevesebb memóriát és 4,4-szer alacsonyabb végpontok közötti késleltetést jelentve, miközben megegyezik a teljes pontosságú OpenVLA-OFT-tel. X-VLA-0.9B (arXiv 2510.10274) az 1 B vonalon helyezkedik el áramlásillesztéssel.

A közös szál: az akciódekóder, nem a nyelvi modell, az, ahol a késleltetés rejlik. Kérdezd meg, hogyan bocsát ki akciókat egy irányelv, mielőtt megkérdeznéd, hány paramétere van. Az aréna 85 modellt és 332 eredményt tartalmaz, mindegyik a forrásához kapcsolódik; egy szélesebb áttekintés található VLA bevezetőnkben.

Finomhangolhatom a SmolVLA-t egy RTX 4090-en?

Igen. A SmolVLA 450 M paraméterrel rendelkezik, és az AY-Robots az RTX 4090 / 24 GB szinten futtatja. A lerobot példa a --batch_size=64 paramétert használja, ami inkább példa, mint garancia a kártyájára; a dokumentáció azt tanácsolja, hogy kezdje kicsivel, és növelje, amíg a betöltési idők rövidek maradnak. Számítson hosszabb időre, mint a dokumentációban említett körülbelül 4 óra 20000 lépéshez egy A100-on.

Elérhető a TinyVLA a lerobotban vagy az AY-Robots-on?

Mindkettőre nem. A TinyVLA csak a kutatási tárolójában található, utolsó commit 2025. március 11-én volt, és a formátuma ACT-stílusú HDF5, nem pedig LeRobot. Az AY-Robots a GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT modelleket képzi. Ha TinyVLA-t szeretne, azt magának kell megépítenie, és először javítania kell a DeepSpeed konfigurációs útvonalát a scripts/train.sh fájlban.

Valóban versenyképes egy 450 M paraméteres modell egy 3 B paraméteressel?

A szerzők saját benchmarkjai szerint igen: 87.3 a 86.0 ellen a LIBERO-n egy robotikára előképzett 3.3 B paraméteres Pi0-val szemben, és 78.3 a 61.7 ellen három valós SO-100 feladaton, ahol ugyanaz a tanulmány a Pi0-t 3.5 B paraméteresnek jelöli. A korlát ugyanabban a tanulmányban található: egyfeladatos, robotika előképzés nélkül a SmolVLA 40.0-ra esik, az ACT 48.3-as értéke alá.

Hány epizódra van szükségem, mielőtt egy kis VLA bármit is csinálna?

Az AY-Robots a SmolVLA minimumát 30 epizódra, az ACT minimumát pedig 50-re állítja. A lerobot dokumentációja körülbelül 50-et ajánl, és arról számol be, hogy 25 nem volt elegendő ugyanahhoz a feladathoz. A struktúra legalább annyira számít, mint a szám: a tanulmányban használt készlet 5 kockapozíciót használt, mindegyikhez 10 epizóddal.

Miért térnek el ennyire a publikált késleltetési adatok?

Különböző dolgokat mérnek. A TinyVLA 14 ms-ot jelent akciójóslatonként egy A6000-en; az AY-Robots a SmolVLA-t 245 ms-ra, az ACT-t pedig 20 ms-ra sorolja akció lépésenként. Egyes adatok egy előremenő passzt fednek le, mások egy passzt osztanak el egy 50 akcióból álló blokkon, és szinte egyik sem tartalmazza a kamerafelvételt vagy a szervókba való írást.

Megoldja a felhőalapú következtetés a GPU problémát?

Részben. Az AY-Robots automatikusan kiépít egy podot, amely a policyt szolgálja, miközben a helyi kliens az adott végponttal kommunikál, egy tétlen watchdoggal, így az magát pusztítja el, ahelyett, hogy csendben számlázna. Nem tudja kiküszöbölni a nyilvános internetes oda-vissza utat, és a vezérlőhurok már eleve 20-485 ms akció lépésenként. Jó lassú pick-and-place feladatokhoz, de nem gyors reaktív mozgáshoz.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started