
A TinyVLA és a SmolVLA működő VLA-t helyez 1 milliárd paraméter alá. Valós számok mindkét tanulmányból, a lerobot alapértelmezései, mért késleltetés, és mennyibe kerül egy futtatás egy 24 GB-os kártyán.
Szinte minden látás-nyelv-akció modell amiről írnak, adatközponti kártyát feltételez. Az OpenVLA 7 milliárd paraméterrel rendelkezik. GR00T N1.7 és Pi0.5 körülbelül 3 milliárd paraméterrel rendelkeznek, és egy A100 80 GB-os kártyát igényelnek finomhangoláshoz. Ha az asztalán lévő kártya egy 4090-es, akkor az ilyen típusú modell elérhetetlen.
Két tanulmány is amellett érvel, hogy nincs rá szükség. A TinyVLA (arXiv 2409.12514, elfogadta az IEEE Robotics and Automation Letters 2025 februárjában) egy VLA-t épít egy 400 millió és 1,3 milliárd paraméter közötti gerinchálózatból, plusz egy diffúziós akciófejből. SmolVLA (arXiv 2506.01844, benyújtva 2025. június 2-án) 450 millió paramétert szállít nyílt súlyokkal, nyílt adatokkal és egy szkripttel, amely egyetlen fogyasztói kártyán fut. Íme, amit mindkettő mért, és hol szűnik meg érvényes lenni az 1 milliárd alatti paraméterekre vonatkozó érv.
Amit tudnia kell
- •A TinyVLA három méretben érhető el: 422 millió összesen 101 millió tréningezhető paraméterrel, 740 millió 138 millióval, 1,3 milliárd 143 millióval. Csak az első kettő marad 1 milliárd alatt.
- •A IV. táblázata 14 ms-t mér akcióelőrejelzésenként a TinyVLA-1B esetében egy A6000-en, szemben az OpenVLA-7B 292 ms-ével és egy zsugorított OpenVLA-1B 140 ms-ével.
- •A sebességet a fej tartja, nem a gerinchálózat: cserélje ki a TinyVLA-H diffúziós fejét egy ACT fejre, és az öt valós robotfeladat 94,0-es átlagról egyjegyű számokra esik. Egy MLP fej mindenhol 0 pontot ér el.
- •A SmolVLA 450 millió paraméterrel rendelkezik, ebből körülbelül 100 millió az akció szakértő, 481 közösségi LeRobot adatkészleten és 10,6 millió képkockán előtanítva. 87,3-at jelent a LIBERO-n, szemben egy robotikára előtanított 3,3 milliárd paraméteres Pi0 86,0-jával, és 78,3-at három valós SO-100 feladaton, szemben egy 3,5 milliárd paraméteres Pi0 61,7-jével.
- •Előtanítás nélkül, egyetlen feladatra tanítva a SmolVLA 40,0-ra esik ezeken a feladatokon, az ACT 48,3-as eredménye alá. A kicsi nem automatikusan könnyű.
- •A TinyVLA nem rendelkezik LeRobot integrációval, és egy CUDA 11.7 wheel stack-et rögzít. A SmolVLA a lerobotban található, és itt a 24 GB-os szinten futtatásonként körülbelül 1-3 USD-be kerül.
Mi számít valójában kis VLA-nak
A modellkártyán szereplő paraméterszám nem egyetlen szám. Jelentheti az összes súlyt, az inferencia során betöltött súlyokat, vagy azokat a súlyokat, amelyek gradienseket kapnak a során. A TinyVLA mindkettőt jelenti, és a különbség nagy: a TinyVLA-H összesen 1,3 B, de 143 M tanítható, mert a látásmodul és a nyelvi modell nagy része befagyasztva marad, miközben a LoRA adapterek és az akciófej mozognak. A tanulmány a tanítható rész arányát körülbelül 5 százalékra teszi.
| Modell | Paraméterek | Gerinc | Akciófej | Forrás |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
Két sorról érdemes vitatkozni. Az körülbelül 80 M-mal kisebb, mint bármi más itt, de nincs nyelvi modellje, így nem VLA: egy feladatot tanul meg, és nem lehet neki mást mondani. Az 27 M-mal egy T5-Base szövegkódolón keresztül van kondicionálva, nem LLM gerincen keresztül. Jó alapmodellek, de egyik sem adja meg az utasításkövetést, amit a címke sugall.
A TinyVLA-H, a fő eredményeket hozó változat, 1,3 B, és a vonal felett helyezkedik el. A jobb kérdés az, hogy egy modell belefér-e 24 GB-ba a képzés során, és eléri-e a kívánt vezérlési sebességet az inferencia során. Az öt irányelv, amit itt képezhetsz, megtalálható az irányelvek oldalán; A TinyVLA-nak van egy aréna bejegyzése, ha a számait másoké mellett szeretnéd látni.
TinyVLA: a sebesség a fejből jön, nem a gerincmodulból
A nyilvánvaló értelmezés az, hogy kisebbé tették a nyelvi modellt, így gyorsabb lett. A tanulmány ablációs vizsgálata mást mutat. Az OpenVLA 7 B-s gerincmoduljának egy körülbelül 1 B-sre cserélése az akciónkénti előrejelzést 292 ms-ról 140 ms-ra csökkentette, ami 2-szeres gyorsulás. A TinyVLA-H, hasonló paraméterszámmal, 14 ms alatt fut ugyanazon a kártyán. A másik 10-szeres gyorsulás az akciófejnek köszönhető.
| Modell | Akciónkénti előrejelzés | Mérve |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
Az OpenVLA diszkretizált tokenekként bocsát ki akciókat a nyelvi modell fején keresztül, akciódimenziónként egyet, autoregresszíven. A TinyVLA egy diffúziós dekódert csatol, amely egyetlen lépésben állítja elő a teljes adatcsomagot. Az V. táblázat a TinyVLA-H architektúráját mutatja be, és csak a fejet cseréli ki, ugyanazon az öt valós robotfeladaton. Ez a legtisztább bizonyíték bármelyik tanulmányban arra az érvre, amit az áramlásillesztés alapú stratégiák támasztanak alá, és az ok, amiért a a Pi0 elmozdult a tokenalapú dekódolástól.
| TinyVLA-H fej | Teniszlabda elhelyezése | Bögre megfordítása | Kockák egymásra rakása | Fiók bezárása | Doboz kinyitása |
|---|---|---|---|---|---|
| Diffúzió (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Akció daraboló transzformátor | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Többrétegű perceptron | 0 | 0 | 0 | 0 | 0 |
A 292 / 140 / 14 ms adatok a IV. táblázatból származnak, mind egy A6000-en futtatva. Ezek akciónkénti előrejelzésekre vonatkoznak, és nem tartalmazzák a kamera rögzítését, az előfeldolgozást és a szervókba történő soros írást. A közzétett késleltetést alsó határként kezelje, soha ne vezérlési sebességként. Saját számaink is ugyanezen korlátozással bírnak: lásd az inferencia késleltetést.
Mit ért el a TinyVLA
| Benchmark | Protokoll | TinyVLA-H | Alapvonalak |
|---|---|---|---|
| MetaWorld, 50 feladat, szimuláció | Többfeladatos, 50 demó, 3 seed | 77.6 / 21.5 / 11.4 / 15.8 nehézség szerint, átlag 31.6 | Diffusion Policy average 10.5 |
| Valódi Franka Panda, 5 feladat | 100 trajektória feladatonként, 20 próba | 94.0 átlag | OpenVLA 68.3, Diffusion Policy 35.3 |
| Kétkezes UR5, 3 feladat | Többfeladatos, 10 próba feladatonként | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
A kétkezes sorra a cikk maga ad unalmas magyarázatot: Az OpenVLA az Open X-Embodimenten van előképzve, ami kizárólag egykarú adatokat tartalmaz, így a kétkarú akciótér eloszlásán kívül esik, és nulla pontot ér el. A diffúziós policy alapvonal a TinyVLA-H-t veri ezen három feladat közül kettőn. Háttérinformációk itt: az Open X-Embodiment összefoglalóban.

A TinyVLA repó, 2026 augusztusi állapot szerint
A cikk jó. A kód egy kutatási kiadás. A tároló a github.com/liyaxuanliyaxuan/TinyVLA; a README-je szerint a kód 2025. február 17-én jelent meg, az utolsó commit pedig 2025. március 11-én történt. Egy cikk reprodukálásához megfelelő, de problémás, ha egy karbantartott könyvtárat szeretnénk.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .A requirements.txt rögzíti a torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 csomagokat, és a CUDA stacket a 11.x wheel-ekhez: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. A README Python 3.10-et kér; a lerobot 0.6.1 3.12-es vagy újabb verziót igényel, így a kettő nem osztozhat egy környezeten. Először ellenőrizze, hogy létezik-e torch 2.0.1 build az Ön GPU generációjához. Ha egy futás VRAM hiány miatt áll le, az memórián kívüli ellenőrzőlista gyorsabb, mint a találgatás.
A TinyVLA nem olvassa be a LeRobot adathalmazokat. Formátuma ACT-stílusú HDF5: action, language_raw, és egy observations csoport több nézetű képekkel, joint_positions, qpos és qvel adatokkal. A repository tartalmazza a data_utils/rlds_to_h5py.py fájlt RLDS bemenethez, és minden feladat manuálisan van regisztrálva az aloha_scripts/constants.py fájlban a dataset_dir, episode_len és camera_names paraméterekkel. Ha az Ön epizódjai a lerobotból vagy az asztali kliensből származnak, akkor Ön felel a konverzióért.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 nyolc kártyás csomópontot feltételez. Állítsa 1-re, és csökkentse a kötegméretet jóval 32 alá. Nincs egyetlen GPU-s változat sem a fő ágon, így a parancs nem futtatható szó szerint egy 4090-en.
- --deepspeed scripts/zero2.json egy olyan fájlra mutat, amely nincs a legfelső szintű scripts könyvtárban. A DeepSpeed konfigurációk a llava-pythia/scripts/zero2.json útvonalon találhatók. Javítsa ki az útvonalat az első futtatás előtt.
- A README megköveteli, hogy a kimeneti könyvtár neve tartalmazza a llava_pythia-t, plusz a lora-t, ha a LoRA engedélyezve van.
- A gerinc külön letöltés: lesjie/Llava-Pythia-400M, -700M vagy -1.3B. Nincs egyetlen alap ellenőrzőpont, amire egy irányelvet mutatna, ahogy a lerobot/smolvla_base-re mutat.
SmolVLA: az 1 B alatti modell, amit ma délután futtathat
A SmolVLA ugyanazt az érvet fogalmazza meg egy karbantartott könyvtáron belül. 450 M paraméterrel rendelkezik egy SmolVLM2-500M-Video-Instruct gerincen, és a hatékonyság a configuration_smolvla.py fájlból kiolvasható beállításokból ered, nem pedig abból az állításból, hogy kicsi.
| Beállítás a configuration_smolvla.py fájlban | Alapértelmezett | Mit eredményez |
|---|---|---|
| num_vlm_layers | 16 | Csak az első 16 nyelvi modell réteg fut |
| expert_width_multiplier | 0.75 | Az akció szakértő rejtett mérete a VLM 75 százaléka |
| self_attn_every_n_layers | 2 | Önfigyelem kereszt-figyelemmel váltakozva |
| chunk_size / n_action_steps | 50 / 50 | Egy menet 50 akciót bocsát ki, és mind az 50 végrehajtásra kerül |
| num_steps | 10 | Az áramlásillesztéses zajszűrés 10 lépésben rögzítve |
| tokenizer_max_length | 48 | Az utasítás 48 tokenre van csonkítva |
| freeze_vision_encoder / train_expert_only | True / True | A finomhangolás a szakértőt mozgatja, nem a látás tornyot |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nem a cikk receptje: az előképzése 100 lépéses bemelegítést használt 200000 lépésen keresztül |
Az előképzés 481 közösségi LeRobot adatkészletet, 22,9 K epizódot és 10,6 M képkockát használt 4 GPU-n, 200000 lépésben, 256-os globális köteggel; a tanulmány szerint a teljes projekt körülbelül 30 K GPU órát vett igénybe. Egy szám, amire érdemes figyelni: a Hugging Face indító blogja 487 kurált adatkészletet említ, ahol a tanulmány táblázata 481-et. Mi a tanulmány adatait használjuk, és jelezzük az eltérést.

| Teljesítményteszt | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO átlag, többfeladatos | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World átlag, többfeladatos | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Valós SO-100, 3 feladat, többfeladatos képzés | 78.3 | - | 61.7 (3.5 B) | - |
| Valós SO-100, 3 feladat, egyfeladatos, robotikai előképzés nélkül | 40.0 | - | - | 48.3 |
| SO-101 lego felvétel-elhelyezés, egyfeladatos, eloszlásban | 90 | - | - | 70 |
| SO-101 lego felvétel-elhelyezés, egyfeladatos, eloszlásból kívül | 50 | - | - | 40 |
A LIBERO szimuláció, és minden kompetens megoldás nyolcvanas értékeket ér el ott most. A valós SO-100 sor, ahol egy 450 M-es modell 16,6 ponttal veri a 3,5 B-s modellt, az érdekes; az alatta lévő sor az ellensúly. Ha eltávolítjuk a közösségi előképzést és a többfeladatos képzést, ugyanaz a modell 40,0-ra esik, az ACT alá. A védhető állítás az, hogy egy kis modell nem automatikusan rosszabb, nem pedig az, hogy jobb.
Egy véletlen segít: a SmolVLA tanulmány Meta-World táblázata a TinyVLA saját publikált számait tartalmazza alapként, így egyszerre mindkét modell egy táblázatban szerepel, a SmolVLA-0.45B 57.3-mal a TinyVLA-H 31.6-tal szemben. Azt is jelenti, hogy a SmolVLA képzése körülbelül 40 százalékkal gyorsabb, mint a Pi0-é, 6-szor kevesebb memóriával. Mindez a SmolVLA szerzőitől származik; az aréna bejegyzés linkeli az egyes értékeket a forrásához.
Hol tölti idejét a SmolVLA
Az AY-Robots a SmolVLA-t 245 ms/akciólépés, az ACT pedig 20 ms-ra sorolja a szabályzat katalógusban. A TinyVLA 14 ms-ot jelent akciós előrejelzésenként. Ezek a számok nem összehasonlíthatók, és a leggyakoribb hiba ebben a témában, ha úgy kezeljük őket, mintha azok lennének: egyesek egy előremenő passz idejét mérik, mások ezt a passzt egy darabra osztják, miután az akció darabolás amortizálja.
- A SmolVLA 50 akciót bocsát ki előremenő passzonként, és mind az 50-et végrehajtja. A tanulmányban valós robotokon használt 30 fps mellett egy következtetés körülbelül 1,7 másodperc mozgást fed le.
- Az aszinkron következtetés a következő darabot számítja ki, miközben az aktuális még fut: 9,7 s átlagos feladatvégrehajtás a 13,75 s szinkronnal szemben, nagyjából 30 százalékkal gyorsabb, és 19 felvételi és elhelyezési ciklus egy rögzített 60 másodperces ablakban 9-cel szemben.
- A sikerességi arányok inkább összehasonlíthatók voltak, mint jobbak: 78,3 szinkron a 73,3 aszinkronnal szemben. Az aszinkron átviteli sebességet vásárol, nem pontosságot.
- A darabolás elrejti a számítási késleltetést, nem a hálózati késleltetést, és kevésbé reaktívvá teszi a szabályzatot, mert 50 akcióra van elkötelezve.
Az AY-Robots automatikusan képes felhő GPU podot biztosítani, amely kiszolgálja a házirendjét, miközben a helyi robotkliens kommunikál az adott végponttal, és a pod tartalmaz egy tétlen figyelőprogramot, így az magát pusztítja el ahelyett, hogy csendben számlázna. Amit nem tesz meg, az a nyilvános internetes oda-vissza út eltávolítása. Az itt található öt házirend vezérlőhurka 20-485 ms akció lépésenként, még hálózat nélkül is, így a távoli következtetés lassú pick-and-place feladatokhoz életképes, de gyors reaktív mozgáshoz nem.

SmolVLA finomhangolása egy fogyasztói kártyán
A manuális út, a lerobot 0.6.1-en, a jelenlegi PyPI kiadás 2026. augusztus 23-i állapot szerint. Minden alábbi információ a Hugging Face lerobot SmolVLA dokumentációjából származik, amelyet ugyanazon a napon töltöttek le; az irányított verzió kíméletesebb.
- 1A lerobot telepítése a smolvla extrával
A SmolVLA függőségek opcionális extrák, nem részei az alaptelepítésnek. Ha ezek nélkül telepítjük, majd azon tűnődünk, miért ismeretlen a házirend típusa, az gyakran fél óra elvesztegetett idő.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Szerezzen be elegendő epizódot tartalmazó adatkészletet
A dokumentáció körülbelül 50 epizódot javasol, és kijelenti, hogy ugyanaz a feladat 25 epizóddal nem volt elegendő. Az AY-Robots 30-ban határozza meg a minimumot. Rögzítsen sajátot, vagy kezdje az adatkészlet-könyvtárból.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Indítsa el a finomhangolást
A lerobot útmutatóból származó parancs, módosítás nélkül. A dokumentáció szerint 20000 lépés körülbelül 4 órát vesz igénybe egy A100-on. Egy 24 GB-os kártyán hosszabb időre számítson, és mérje meg.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Csökkentse a kötegméretet, amíg bele nem fér
A batch_size=64 egy dokumentált példa, nem ígéret a kártyájával kapcsolatban. A dokumentáció azt tanácsolja, hogy kezdje kicsivel, és növelje, amíg a betöltési idők rövidek maradnak.
bashlerobot-train --help - 5Telepítse a checkpointot a karra
Ugyanaz a könyvtár, egy parancs. A valós idejű darabolási jelzők ki vannak kommentelve a dokumentációban, és ezeket kell használni alacsony teljesítményű hardver esetén.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Bármilyen utat is választ, egy ellenőrzőponttal és az azt előállító konfigurációval zárja. Tartsa meg mellette az adatkészlet revízióját, a lépésszámot és a seedet. A lerobot alapértelmezés szerint 1000-es seedet használ; a GR00T finomhangolási belépési pontja egyáltalán nem tesz közzé seedet, így ezek a futtatások nem bitről bitre reprodukálhatók. A mechanika a képzési dokumentációban található.
Két módja van egy kis VLA karra juttatásának
Ön birtokolja a gépet és a hibamódokat. A SmolVLA esetében ez ésszerű: egy pip extra, egy train parancs, egy rollout parancs. A TinyVLA esetében ez egy kutatási reprodukció befagyott pinekkel, hibás DeepSpeed útvonallal és egy saját maga által írt adatkonverzióval.
- Szerezzen be egy 24 GB-os kártyát, rögzítsen 30-50 epizódot, ellenőrizze a kamera streameket képkockáról képkockára.
- pip install -e ".[smolvla]", lerobot-train a lerobot/smolvla_base ellen, majd szolgálja ki az ellenőrzőpontot azon a gépen, amelybe a kar csatlakoztatva van.
- TinyVLA esetén: külön conda környezet, adatok konvertálása HDF5-be, feladat regisztrálása a constants.py-ben, a zero2.json útvonal javítása, a train.sh nyolc GPU-ról egyre csökkentése.
- Nincs óradíjas számlázás, miután a kártya ki van fizetve.
- Az inferencia a szervók mellett helyezkedik el, ez az egyetlen módja a gyors vezérlőhurok elérésének.
- Módosíthatja a házirend kódját, és a TinyVLA csak így érhető el.
- Egy 4090 kizár minden ~3 B házirendet, így nincs helyi összehasonlítás a GR00T N1.7 vagy Pi0.5 ellen.
- A környezet beállítása az igazi munka. A TinyVLA pinek önmagukban egy napba is kerülhetnek.
- Nincs sor, nincs újrapróbálkozás, nincs ellenőrzőpont tárolás. Egy újraindítás a 14000. lépésnél azt jelenti, hogy újra kell kezdeni.
A SmolVLA az öt házirend egyike itt. Egy űrlapon kiválasztja a modellt és az adatkészletet, a backend a szükséges VRAM alapján bérel egy GPU-t, futtatja a trénert és ellenőrzőpontokat ír az objektumtárolóba. Lépésről lépésre: SmolVLA az SO-100-on, vagy a teljes mátrix a képzési oldalon.
| Amit a platform küld a SmolVLA-hoz | Érték |
|---|---|
| kötegméret | 2 |
| tanulási ráta | 1e-4 |
| maximális lépések | 20000 |
| gradiens akkumuláció | 8, és nem éri el a trénert |
| extra beállítások az űrlapon | seed, logFreq |
| GPU szint | RTX 4090 or any 24 GB card |
| adatkészlet formátum | LeRobot v3.0 |
| minimum epizódok | 30 |
Először is, az alapértelmezett kötegméret itt 2, nem a 64 a lerobot dokumentációs példájában, és a gradiens akkumulációs beállítás elküldésre kerül, de nincs hatása a SmolVLA-ra, így a tényleges köteg valójában 2. Növelje meg szándékosan, ahelyett, hogy feltételezné, hogy az alapértelmezett érték megegyezik a forráséval. Másodszor, a TinyVLA itt egyáltalán nem képezhető.
Egy futtatás a 24 GB-os szinten 2-5 órát vesz igénybe, óránként 0.30-0.60 USD-ért, nagyjából 1-3 USD. Az A100 szinten egy ~3 B házirend 3-6 órát vesz igénybe, óránként 1.20-2.00 USD-ért, nagyjából 4-12 USD. Lásd a árazást, és ugyanazokat a műveleteket a CLI-ből és az MCP szerverről.
Amikor egy kis modell a rossz választás
Mindkét tanulmány óvatosabb itt, mint az összefoglalók. A TinyVLA hibaelemzése specifikus: a 0.4 B változat háromszor hibázott az utasítás félreolvasásával, amit a szerzők a kisebb VLM korlátozott nyelvi megértésének tulajdonítanak, és ez a hiba 1.3 B-nél eltűnt. A SmolVLA ugyanezt a görbét mutatja a másik végéről: az azonos architektúra 2.25 B-s verziója 88.75 pontot ér el a LIBERO-n és 68.24-et a Meta-World-ön, szemben a 0.45 B-s modell 87.3 és 57.3 pontjával.
- Elfér egy 24 GB-os kártyán, ami egy kísérlet költségét tíz dollárról pár dollárra csökkenti.
- Elég gyors ahhoz, hogy a kar mellett fusson, így nincs hálózati ugrás a vezérlőhurokban.
- Egy személy által rögzíthető adatokon finomhangolható, tíz epizódon, nem pedig ezreken.
- A SmolVLA súlyai, adatlistája és kódja nyilvános, így a rossz eredmény hibakereshető.
- Gyengébb utasításkövetés: kevesebb nyelvi paraméter, kisebb képesség a hasonló hivatkozó kifejezések elkülönítésére.
- Kisebb térbeli és vizuális általánosítás azokra a beállításokra, amelyeket nem rögzített.
- Érzékenyebb az adathalmaz hibáira, kevesebb előképzési előzménnyel, amire támaszkodhatna.
- A többfeladatos és hosszú távú munka továbbra is a nagyobb modelleket részesíti előnyben, beleértve a SmolVLA saját 2.25 B változatát is.
A futtatásra érdemes összehasonlítás nem a TinyVLA a SmolVLA ellen. Hanem a SmolVLA a ACT a saját feladatán, és a SmolVLA tanulmány az érv amellett, hogy miért. Egyfeladatosan, robotikai előképzés nélkül tréningezve a SmolVLA átlagosan 40.0 pontot ért el három SO-100 feladatban, ahol az egyfeladatos ACT 48.3-at. Ami 78.3-ra emeli, az a közösségi előképzés plusz a többfeladatos tréning, nem pedig önmagában az architektúra. Az SO-101 lego feladatban, mindkettő egyfeladatosan, a SmolVLA nyer: 90 a 70 ellen eloszlásban. Aztán a SmolVLA a Pi0.5 ellen, ha a költségvetés engedi.
Kevesebb előképzés áll rendelkezésre a rossz adatok kompenzálására, így egy hibás adatkészleten kapott tiszta veszteséggörbe olyan irányelvet eredményez, amely magabiztosan reprodukálja a hibát. A lerobot dokumentációja egyértelmű a struktúrát illetően: 50 epizód 5 kockapozícióban, 10 pozíciónként, működött; 25 nem. Ha a veszteség rendben van, és a kar nem csinál semmi hasznosat, kezdje itt: a veszteség csökken, az irányelv nem csinál semmit, az irányelv csak egy beállításban működik vagy valóban használható VLA képzési adatok gyűjtése robotmanipulációhoz.
Öt irányelv, egy összehasonlító táblázat
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT valós paraméterekkel, műveleti lépésenkénti következtetési késleltetéssel, az egyes modellekhez szükséges GPU-szinttel és a minimális epizódszámmal, mielőtt bármi hasznosat tenne.
Hasonlítsa össze az irányelveketEgy döntési táblázat, amely alapján cselekedhet
| Az Ön helyzete | Kezdje ezzel | Miért |
|---|---|---|
| Egy feladat, jó demonstrációk, nincs nyelv | ACT | ~80 M, 20 ms, 24 GB card, no base model to download |
| Néhány kapcsolódó feladat, egy-egy utasítás | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| A TinyVLA eredményének specifikus reprodukálása | TinyVLA-B or TinyVLA-H | The repo is the only route: isolated env, converted data |
| Többfeladatos, változatos utasítások, A100 költségvetés | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run |
| Még nincs robot | Vezessen egy valódi kart | A sor alapú élő karhoz nincs szükség regisztrációra és hardverre |
Az utolsó sorhoz, az élő kar egy fizikai SO-100-at streamel, amit fiók nélkül is vezérelhetsz a böngészőből, és a három indítási mód lefedi a többit. Az SO-100 itt a referencia kar, nagyjából 110-150 EUR alkatrészekben, egy teljes beállítási útmutatóval.
Mi jön az 1 milliárd alatti modellek után
A paraméterszám csökkentése az egyik módja annak, hogy egy VLA olcsó legyen, de nem feltétlenül ez a nyerő. OpenVLA-OFT (arXiv 2502.19645) megtartja a 7 B gerincet, és csak az akciók dekódolásának módját változtatja meg, 26-szoros növekedést jelentve az akciógenerálási átviteli sebességben, és a LIBERO 76,5-ről 97,1 százalékra emelkedését. BitVLA (arXiv 2506.07530) egy 1-bites BitNet b1.58 2B4T gerinc minden súlyát ternárissá teszi, 11,0-szer kevesebb memóriát és 4,4-szer alacsonyabb végpontok közötti késleltetést jelentve, miközben megegyezik a teljes pontosságú OpenVLA-OFT-tel. X-VLA-0.9B (arXiv 2510.10274) az 1 B vonalon helyezkedik el áramlásillesztéssel.
A közös szál: az akciódekóder, nem a nyelvi modell, az, ahol a késleltetés rejlik. Kérdezd meg, hogyan bocsát ki akciókat egy irányelv, mielőtt megkérdeznéd, hány paramétere van. Az aréna 85 modellt és 332 eredményt tartalmaz, mindegyik a forrásához kapcsolódik; egy szélesebb áttekintés található VLA bevezetőnkben.
Finomhangolhatom a SmolVLA-t egy RTX 4090-en?▾
Igen. A SmolVLA 450 M paraméterrel rendelkezik, és az AY-Robots az RTX 4090 / 24 GB szinten futtatja. A lerobot példa a --batch_size=64 paramétert használja, ami inkább példa, mint garancia a kártyájára; a dokumentáció azt tanácsolja, hogy kezdje kicsivel, és növelje, amíg a betöltési idők rövidek maradnak. Számítson hosszabb időre, mint a dokumentációban említett körülbelül 4 óra 20000 lépéshez egy A100-on.
Elérhető a TinyVLA a lerobotban vagy az AY-Robots-on?▾
Mindkettőre nem. A TinyVLA csak a kutatási tárolójában található, utolsó commit 2025. március 11-én volt, és a formátuma ACT-stílusú HDF5, nem pedig LeRobot. Az AY-Robots a GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA és ACT modelleket képzi. Ha TinyVLA-t szeretne, azt magának kell megépítenie, és először javítania kell a DeepSpeed konfigurációs útvonalát a scripts/train.sh fájlban.
Valóban versenyképes egy 450 M paraméteres modell egy 3 B paraméteressel?▾
A szerzők saját benchmarkjai szerint igen: 87.3 a 86.0 ellen a LIBERO-n egy robotikára előképzett 3.3 B paraméteres Pi0-val szemben, és 78.3 a 61.7 ellen három valós SO-100 feladaton, ahol ugyanaz a tanulmány a Pi0-t 3.5 B paraméteresnek jelöli. A korlát ugyanabban a tanulmányban található: egyfeladatos, robotika előképzés nélkül a SmolVLA 40.0-ra esik, az ACT 48.3-as értéke alá.
Hány epizódra van szükségem, mielőtt egy kis VLA bármit is csinálna?▾
Az AY-Robots a SmolVLA minimumát 30 epizódra, az ACT minimumát pedig 50-re állítja. A lerobot dokumentációja körülbelül 50-et ajánl, és arról számol be, hogy 25 nem volt elegendő ugyanahhoz a feladathoz. A struktúra legalább annyira számít, mint a szám: a tanulmányban használt készlet 5 kockapozíciót használt, mindegyikhez 10 epizóddal.
Miért térnek el ennyire a publikált késleltetési adatok?▾
Különböző dolgokat mérnek. A TinyVLA 14 ms-ot jelent akciójóslatonként egy A6000-en; az AY-Robots a SmolVLA-t 245 ms-ra, az ACT-t pedig 20 ms-ra sorolja akció lépésenként. Egyes adatok egy előremenő passzt fednek le, mások egy passzt osztanak el egy 50 akcióból álló blokkon, és szinte egyik sem tartalmazza a kamerafelvételt vagy a szervókba való írást.
Megoldja a felhőalapú következtetés a GPU problémát?▾
Részben. Az AY-Robots automatikusan kiépít egy podot, amely a policyt szolgálja, miközben a helyi kliens az adott végponttal kommunikál, egy tétlen watchdoggal, így az magát pusztítja el, ahelyett, hogy csendben számlázna. Nem tudja kiküszöbölni a nyilvános internetes oda-vissza utat, és a vezérlőhurok már eleve 20-485 ms akció lépésenként. Jó lassú pick-and-place feladatokhoz, de nem gyors reaktív mozgáshoz.
Sources
- TinyVLA: Gyors, adathatékony látás-nyelv-akció modellek a robotmanipulációhoz
- TinyVLA hivatalos kód tároló (README, requirements.txt, scripts/train.sh)
- TinyVLA projektoldal
- lesjie/Llava-Pythia-1.3B, a TinyVLA-H gerincmodell súlyai
- SmolVLA: Látás-nyelv-akció modell megfizethető és hatékony robotikához
- lerobot dokumentáció: SmolVLA finomhangolása
- lerobot: configuration_smolvla.py, a SmolVLA alapértelmezései
- lerobot/smolvla_base modellkártya
- SmolVLA: Hatékony látás-nyelv-akció modell (Hugging Face blog)
- lerobot a PyPI-n (0.6.1, Python 3.12 vagy újabb szükséges)
- OpenVLA: Nyílt forráskódú látás-nyelv-akció modell
- Látás-nyelv-akció modellek finomhangolása: Sebesség és siker optimalizálása (OpenVLA-OFT)
- BitVLA: 1-bites látás-nyelv-akció modellek robotmanipulációhoz
- X-VLA: Lágyan promptolt transzformátor, mint skálázható, kereszt-testi látás-nyelv-akció modell
- rail-berkeley/octo-small-1.5 modellkártya (27 M paraméter)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started