
TinyVLA dhe SmolVLA vendosin një VLA funksional nën 1 miliard parametra. Numra realë nga të dyja punimet, parametrat e paracaktuar të lerobot, vonesa e matur, dhe sa kushton një ekzekutim në një kartë 24 GB.
Pothuajse çdo model vizion-gjuhë-veprim për të cilin shkruhet, supozon një kartë qendre të dhënash. OpenVLA ka 7 B parametra. GR00T N1.7 dhe Pi0.5 janë rreth 3 B dhe kërkojnë një A100 80 GB për t'u rregulluar (fine-tune). Nëse karta në tavolinën tuaj është një 4090, ajo klasë modelesh është e paarritshme.
Dy punime argumentojnë se nuk ju duhet. TinyVLA (arXiv 2409.12514, pranuar nga IEEE Robotics and Automation Letters në shkurt 2025) ndërton një VLA nga një shtyllë kurrizore (backbone) 400 M deri në 1.3 B plus një kokë veprimi difuzioni. SmolVLA (arXiv 2506.01844, dorëzuar më 2 qershor 2025) ofron 450 M parametra me pesha të hapura, të dhëna të hapura dhe një skript që funksionon në një kartë konsumatore. Ja çfarë matën të dy, dhe ku argumenti nën-1 B pushon së qeni i vlefshëm.
Çfarë duhet të dini
- •TinyVLA ofron tre madhësi: 422 M gjithsej me 101 M të trajnueshme, 740 M me 138 M, 1.3 B me 143 M. Vetëm dy të parat janë nën 1 B.
- •Tabela e tij IV mat 14 ms për parashikim veprimi për TinyVLA-1B në një A6000, kundrejt 292 ms për OpenVLA-7B dhe 140 ms për një OpenVLA-1B të zvogëluar.
- •Koka mban atë shpejtësi, jo shtylla kurrizore (backbone): ndërroni kokën e difuzionit të TinyVLA-H me një kokë ACT dhe pesë detyrat reale të robotit bien nga një mesatare 94.0 në shifra njëshifrore. Një kokë MLP shënon 0 kudo.
- •SmolVLA është 450 M, rreth 100 M prej tij eksperti i veprimit, i paratrajnuar në 481 grupe të dhënash komunitare LeRobot dhe 10.6 M korniza. Ai raporton 87.3 në LIBERO kundrejt 86.0 për një Pi0 të paratrajnuar në robotikë me 3.3 B, dhe 78.3 në tre detyra reale SO-100 kundrejt 61.7 për Pi0 me 3.5 B.
- •I trajnuar me një detyrë pa atë paratrajnim, SmolVLA bie në 40.0 në ato detyra, nën 48.3 të ACT. E vogla nuk është automatikisht e lehtë.
- •TinyVLA nuk ka integrim LeRobot dhe përdor një stack CUDA 11.7 wheel. SmolVLA është në lerobot dhe kushton afërsisht 1 deri në 3 USD për ekzekutim në nivelin 24 GB këtu.
Çfarë konsiderohet në të vërtetë një VLA e vogël
Numri i parametrave në një kartë modeli nuk është një numër i vetëm. Ai mund të nënkuptojë pesha totale, pesha të ngarkuara gjatë inferencës, ose pesha që marrin gradientë gjatë . TinyVLA raporton të dyja, dhe hendeku është i madh: TinyVLA-H është 1.3 B total por 143 M i trajnueshëm, sepse kulla e vizionit dhe shumica e modelit të gjuhës mbeten të ngrira ndërsa adaptuesit LoRA dhe koka e veprimit lëvizin. Punimi e vendos pjesën e trajnueshme në rreth 5 përqind.
| Modeli | Parametrat | Shtylla kurrizore | Koka e veprimit | Burimi |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M i trajnueshëm | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M i trajnueshëm | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M i trajnueshëm | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M ekspert veprimi | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | shkalla ViT-S, kodues teksti T5-Base | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, pa model gjuhe | Regresion i drejtpërdrejtë i copave | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, kodues DINOv2 dhe SigLIP | Tokena veprimi autoregresivë | arXiv 2406.09246 |
Dy rreshta vlejnë të diskutohen. me rreth 80 M është më i vogël se çdo gjë tjetër këtu, por nuk ka model gjuhe, kështu që nuk është një VLA: ai mëson një detyrë dhe nuk mund t'i thuhet të bëjë një tjetër. me 27 M është i kushtëzuar përmes një koduesi teksti T5-Base, jo një shtylle kurrizore LLM. Baza të mira, asnjëra nuk ju jep ndjekjen e udhëzimeve që nënkupton etiketa.
TinyVLA-H, varianti që mbart rezultatet kryesore, është 1.3 B dhe qëndron mbi linjë. Pyetja më e mirë është nëse një model përshtatet në 24 GB gjatë trajnimit dhe arrin shkallën tuaj të kontrollit gjatë inferencës. Pesë politikat që mund të trajnoni këtu janë në faqen e politikave; TinyVLA ka një hyrje në arenë nëse dëshironi numrat e tij pranë atyre të të gjithëve.
TinyVLA: shpejtësia vjen nga koka, jo nga shtylla kurrizore
Leximi i dukshëm është se ata e bënë modelin e gjuhës më të vogël, kështu që u bë më i shpejtë. Ablacioni i punimit thotë të kundërtën. Zëvendësimi i shtyllës kurrizore 7 B të OpenVLA-s me një rreth 1 B e uli parashikimin për veprim nga 292 ms në 140 ms, një fitim 2x. TinyVLA-H, me një numër të krahasueshëm parametrash, funksionon në 14 ms në të njëjtën kartë. 10x tjetër është koka e veprimit.
| Modeli | Parashikimi për veprim | Matja u bë në |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, shtylla kurrizore e zëvendësuar me atë të TinyVLA-s | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA lëshon veprime si shenja të diskretizuara përmes kokës së modelit të gjuhës, një për dimension veprimi, në mënyrë autoregresive. TinyVLA bashkëngjit një dekoder difuzioni që prodhon të gjithë bllokun në një goditje të vetme. Tabela V përmban arkitekturën në TinyVLA-H dhe zëvendëson vetëm kokën, në të njëjtat pesë detyra reale të robotit. Është prova më e qartë në të dyja punimet për argumentin përputhja e rrjedhës që bëjnë politikat, dhe arsyeja Pi0 u largua nga dekodimi i shenjave.
| Performanca në TinyVLA-H | Vendos Tenisin | Përmbys Filxhanin | Grumbullo Kubet | Mbyll Sirtarin | Hap Kutinë |
|---|---|---|---|---|---|
| Difuzioni (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Transformuesi i Ndarjes së Veprimeve | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Perceptroni me Shumë Shtresa | 0 | 0 | 0 | 0 | 0 |
Shifrat 292 / 140 / 14 ms janë nga Tabela IV, të gjitha në një A6000. Ato janë për parashikim veprimi dhe përjashtojnë kapjen e kamerës, parapërpunimin dhe shkrimin serial te servot. Trajtojeni vonesën e publikuar si një kufi të poshtëm, kurrë si shpejtësinë e kontrollit. Numrat tanë mbartin të njëjtin kufizim: shih vonesa e inferencës.
Çfarë rezultati arriti TinyVLA
| Standardi i Performancës | Protokolli | TinyVLA-H | Modelet Referencë |
|---|---|---|---|
| MetaWorld, 50 detyra, sim | Shumë-detyra, 50 demo, 3 fara | 77.6 / 21.5 / 11.4 / 15.8 sipas vështirësisë, mesatarja 31.6 | Politika e Difuzionit mesatarja 10.5 |
| Franka Panda reale, 5 detyra | 100 trajektore për detyrë, 20 prova | 94.0 mesatarja | OpenVLA 68.3, Diffusion Policy 35.3 |
| UR5 Bimanual, 3 detyra | Shumë-detyra, 10 prova për detyrë | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Rreshti bimanual ka një shpjegim të mërzitshëm që vetë punimi jep: OpenVLA është i paratrajnuar në Open X-Embodiment, i cili përbëhet tërësisht nga të dhëna me një krah, kështu që një hapësirë veprimi me dy krahë është jashtë shpërndarjes dhe shënon zero. Baza e politikës së difuzionit mund TinyVLA-H në dy nga ato tre detyra. Sfondi në shkrimi i Open X-Embodiment.

Depoja TinyVLA, që nga gushti 2026
Punimi është i mirë. Kodi është një lëshim kërkimor. Depoja është github.com/liyaxuanliyaxuan/TinyVLA; README-ja e saj daton lëshimin e kodit në 17 shkurt 2025 dhe komitimi i fundit është 11 mars 2025. Mirë për riprodhimin e një punimi, një problem nëse do të dëshironit një bibliotekë të mirëmbajtur.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt fikson torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, dhe stack-un CUDA në 11.x wheels: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README kërkon Python 3.10; lerobot 0.6.1 kërkon 3.12 ose më të re, kështu që të dyja nuk mund të ndajnë një mjedis. Konfirmoni së pari nëse ekziston një version i torch 2.0.1 për gjeneratën tuaj të GPU-së. Nëse një ekzekutim ndërpritet për shkak të VRAM-it, lista e kontrollit për mungesë memorie është më e shpejtë sesa hamendësimi.
TinyVLA gjithashtu nuk lexon grupet e të dhënave LeRobot. Formati i tij është HDF5 i stilit ACT: action, language_raw, dhe një grup vëzhgimesh me imazhe me shumë pamje, joint_positions, qpos dhe qvel. Depozita përmban data_utils/rlds_to_h5py.py për inputin RLDS, dhe çdo detyrë regjistrohet manualisht në aloha_scripts/constants.py me dataset_dir, episode_len dhe camera_names. Nëse episodet tuaja erdhën nga lerobot ose klienti i desktopit, ju jeni përgjegjës për konvertimin.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 supozon një nyje me tetë karta. Vendoseni në 1 dhe ulni madhësinë e grupit (batch size) shumë poshtë 32. Asnjë variant me një GPU nuk shpërndahet lart, kështu që komanda nuk mund të ekzekutohet fjalë për fjalë në një 4090.
- --deepspeed scripts/zero2.json tregon një skedar që nuk është në direktorinë kryesore scripts. Konfigurimet DeepSpeed shpërndahen në llava-pythia/scripts/zero2.json. Rregulloni shtegun para ekzekutimit tuaj të parë.
- README kërkon që emri i direktorisë së daljes të përmbajë llava_pythia, plus lora nëse LoRA është aktivizuar.
- Shtylla kurrizore (backbone) është një shkarkim i veçantë: lesjie/Llava-Pythia-400M, -700M ose -1.3B. Nuk ka një pikë kontrolli bazë të vetme ku ju drejtoni një politikë ashtu siç drejtoni te lerobot/smolvla_base.
SmolVLA: modeli nën 1 B që mund ta ekzekutoni këtë pasdite
SmolVLA bën të njëjtin argument brenda një biblioteke të mirëmbajtur. Ai ka 450 M parametra në një shtyllë kurrizore SmolVLM2-500M-Video-Instruct, dhe efikasiteti vjen nga cilësimet që mund të lexoni nga configuration_smolvla.py, sesa nga një pretendim për të qenë i vogël.
| Cilësimi në configuration_smolvla.py | Parazgjedhur | Çfarë ofron |
|---|---|---|
| num_vlm_layers | 16 | Vetëm 16 shtresat e para të modelit të gjuhës ekzekutohen |
| expert_width_multiplier | 0.75 | Madhësia e fshehur e ekspertit të veprimit është 75 për qind e VLM-së |
| self_attn_every_n_layers | 2 | Vetë-vëmendja e ndërthurur me vëmendjen ndër-sektoriale |
| chunk_size / n_action_steps | 50 / 50 | Një kalim lëshon 50 veprime dhe të gjitha 50 ekzekutohen |
| num_steps | 10 | Zhurmë-heqja e përputhjes së rrjedhës e fiksuar në 10 hapa |
| tokenizer_max_length | 48 | Udhëzimi shkurtohet në 48 shenja |
| freeze_vision_encoder / train_expert_only | True / True | Akordimi i imët lëviz ekspertin, jo kullën e vizionit |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Jo receta e punimit: paratrajnimi i tij përdori një ngrohje 100-hapëshe mbi 200000 hapa |
Paratrajnimi përdori 481 grupe të dhënash komunitare LeRobot, 22.9 K episode dhe 10.6 M korniza në 4 GPU, 200000 hapa me një grup global prej 256; punimi e vlerëson të gjithë projektin në rreth 30 K orë GPU. Një numër për t'u vëzhguar: blogu i lançimit të Hugging Face thotë 487 grupe të dhënash të kuruar, ndërsa tabela e punimit thotë 481. Ne përdorim shifrën e punimit dhe shënojmë mosmarrëveshjen.

| Standard krahasimi | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| Mesatarja LIBERO, shumë-detyrësh | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Mesatarja Meta-World, shumë-detyrësh | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| SO-100 real, 3 detyra, trajnimi shumë-detyrësh | 78.3 | - | 61.7 (3.5 B) | - |
| SO-100 real, 3 detyra, një-detyrësh, pa paratrajnim robotik | 40.0 | - | - | 48.3 |
| SO-101 lego pick-place, një-detyrësh, në shpërndarje | 90 | - | - | 70 |
| SO-101 lego pick-place, një-detyrësh, jashtë shpërndarjes | 50 | - | - | 40 |
LIBERO është simulim dhe çdo gjë kompetente shënon në të tetëdhjetat atje tani. Rreshti i vërtetë SO-100, ku një model 450 M mund një model 3.5 B me 16.6 pikë, është ai interesant; rreshti poshtë tij është kundërpesha. Hiqni paratrajnimin e komunitetit dhe trajnimin shumë-detyrësh dhe i njëjti model bie në 40.0, nën ACT. Pretendimi i mbrojtshëm është se një model i vogël nuk është automatikisht më i keq, jo se është më i mirë.
Një rastësi ndihmon: tabela Meta-World e punimit të SmolVLA përmban numrat e publikuar të TinyVLA si bazë, kështu që për një herë të dy modelet ndodhen në një tabelë, SmolVLA-0.45B në 57.3 kundrejt TinyVLA-H në 31.6. Gjithashtu raporton se trajnimi i SmolVLA është rreth 40 për qind më i shpejtë se Pi0 me 6 herë më pak memorie. E gjithë kjo vjen nga autorët e SmolVLA; hyrja në arenë lidh çdo vlerë me burimin e saj.
Ku SmolVLA kalon kohën e saj
AY-Robots liston SmolVLA në 245 ms për hap veprimi dhe ACT në 20 ms në katalogun e politikave. TinyVLA raporton 14 ms për parashikim veprimi. Këta numra nuk janë të krahasueshëm, dhe trajtimi i tyre si të tillë është gabimi më i zakonshëm në këtë temë: disa llogarisin një kalim përpara, disa e ndajnë atë kalim nëpër një copë pasi ndarja e veprimeve në copa e amortizon atë.
- SmolVLA lëshon 50 veprime për kalim përpara dhe ekzekuton të gjitha 50. Me 30 fps që përdor punimi në robotë realë, një inferencë mbulon rreth 1.7 sekonda lëvizje.
- Inferenca asinkrone llogarit copën tjetër ndërsa ajo aktuale ende ekzekutohet: 9.7 s kohë mesatare e përfundimit të detyrës kundrejt 13.75 s sinkrone, afërsisht 30 për qind më shpejt, dhe 19 cikle marrjeje dhe vendosjeje në një dritare fikse 60-sekondëshe kundrejt 9.
- Shkallët e suksesit ishin të krahasueshme dhe jo më të mira, 78.3 sinkrone kundrejt 73.3 asinkrone. Asinkroniteti blen prurje, jo saktësi.
- Ndarja në copa fsheh vonesën e llogaritjes, jo vonesën e rrjetit, dhe e bën politikën më pak reaktive sepse është e angazhuar për 50 veprime.
AY-Robots mund të ofrojë automatikisht një pod GPU në cloud që shërben politikën tuaj ndërsa klienti lokal i robotit komunikon me atë pikë fundore, dhe pod-i përmban një watchdog pasiv në mënyrë që të shkatërrohet vetë në vend që të faturojë në heshtje. Ajo që nuk bën është heqja e udhëtimit vajtje-ardhje në internetin publik. Cikli i kontrollit nëpër pesë politikat këtu është 20 deri në 485 ms për hap veprimi para çdo rrjeti, kështu që inferenca në distancë është e realizueshme për marrje-vendosje të ngadaltë, jo për lëvizje të shpejtë reaktive.

Rregullimi i imët i SmolVLA në një kartë konsumatore
Shtegu manual, në lerobot 0.6.1, versioni aktual i PyPI-së që nga 23 gusht 2026. Gjithçka më poshtë vjen nga dokumentacioni i Hugging Face lerobot SmolVLA, i marrë në të njëjtën ditë; versioni i udhëzuar është më i butë.
- 1Instaloni lerobot me shtesën smolvla
Varësitë e SmolVLA janë një shtesë opsionale, jo pjesë e instalimit bazë. Instalimi pa të dhe më pas pyetja pse lloji i politikës është i panjohur është një humbje e zakonshme gjysmë ore.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Merrni një grup të dhënash me episode të mjaftueshme
Dokumentacioni rekomandon rreth 50 episode dhe thekson se e njëjta detyrë me 25 nuk ishte e mjaftueshme. AY-Robots e vendos minimumin në 30. Regjistroni tuajat, ose filloni nga drejtoria e grupeve të të dhënave.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Filloni rregullimin e imët
Komanda nga udhëzuesi i lerobot, e pamodifikuar. Dokumentacioni vlerëson 20000 hapa në rreth 4 orë në një A100. Në një kartë 24 GB, prisni më gjatë dhe mateni.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Ulni madhësinë e grupit derisa të përshtatet
batch_size=64 është një shembull i dokumentuar, jo një premtim për kartën tuaj. Dokumentacioni këshillon të filloni me të vogël dhe të rritni ndërsa kohët e ngarkimit mbeten të shkurtra.
bashlerobot-train --help - 5Vendosni pikën e kontrollit në krah
E njëjta bibliotekë, një komandë. Flamujt e ndarjes në kohë reale janë të komentuar në dokumentacion dhe janë ata që duhen përdorur në pajisje me fuqi të ulët.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Cilëndo rrugë të merrni, përfundoni me një pikë kontrolli plus konfigurimin që e prodhoi atë. Mbani rishikimin e grupit të të dhënave, numrin e hapave dhe farën pranë tij. lerobot përdor farën 1000 si parazgjedhje; pika hyrëse e rregullimit të imët të GR00T nuk ekspozon asnjë farë, kështu që ato ekzekutime nuk janë të riprodhueshme bit-për-bit. Mekanika në dokumentacionin e trajnimit.
Dy mënyra për të vendosur një VLA të vogël në një krah
Ju zotëroni makinën dhe mënyrat e dështimit. Për SmolVLA kjo është e arsyeshme: një shtesë pip, një komandë trajnimi, një komandë vendosjeje. Për TinyVLA është një riprodhim kërkimor me pin të ngrirë, një shteg DeepSpeed të prishur dhe një konvertim të të dhënave që e shkruani vetë.
- Merrni një kartë 24 GB, regjistroni 30 deri në 50 episode, verifikoni transmetimet e kamerës kornizë pas kornize.
- pip install -e ".[smolvla]", lerobot-train kundrejt lerobot/smolvla_base, pastaj shërbeni pikën e kontrollit në makinën ku është lidhur krahu.
- Për TinyVLA: mjedis i veçantë conda, konvertoni të dhënat në HDF5, regjistroni detyrën në constants.py, rregulloni shtegun zero2.json, shkurtoni train.sh nga tetë GPU në një.
- Pa faturim për orë pasi karta të jetë paguar.
- Inferenca qëndron pranë servove, e vetmja mënyrë për të marrë një cikël kontrolli të shpejtë.
- Ju mund të ndryshoni kodin e politikës, dhe TinyVLA është i disponueshëm vetëm në këtë mënyrë.
- Një 4090 përjashton çdo politikë ~3 B, kështu që nuk ka krahasim lokal kundrejt GR00T N1.7 ose Pi0.5.
- Konfigurimi i mjedisit është puna e vërtetë. Vetëm pin-et e TinyVLA mund të kushtojnë një ditë.
- Pa radhë, pa riprovim, pa ruajtje të pikave të kontrollit. Një rindezje në hapin 14000 do të thotë të fillosh përsëri.
SmolVLA është një nga pesë politikat këtu. Ju zgjidhni modelin dhe grupin e të dhënave në një formular, backend-i merr me qira një GPU sipas VRAM-it të kërkuar, ekzekuton trajnerin dhe shkruan pikat e kontrollit në ruajtjen e objekteve. Hap pas hapi: SmolVLA në SO-100, ose matrica e plotë në faqen e trajnimit.
| What the platform sends for SmolVLA | Value |
|---|---|
| madhësia e grupit | 2 |
| shkalla e të mësuarit | 1e-4 |
| hapat maksimalë | 20000 |
| akumulimi i gradientit | 8, and it does not reach the trainer |
| kontrolla shtesë në formular | seed, logFreq |
| niveli i GPU | RTX 4090 or any 24 GB card |
| formati i grupit të të dhënave | LeRobot v3.0 |
| episode minimale | 30 |
Së pari, madhësia e grupit parazgjedhur këtu është 2, jo 64 në shembullin e dokumentacionit të lerobot, dhe cilësimi i akumulimit të gradientit dërgohet por nuk ka efekt për SmolVLA, kështu që grupi efektiv është vërtet 2. Rriteni atë qëllimisht në vend që të supozoni se parazgjedhja përputhet me atë origjinal. Së dyti, TinyVLA nuk është i trajnueshëm këtu fare.
Një ekzekutim në nivelin 24 GB zgjat 2 deri në 5 orë me 0.30 deri në 0.60 USD për orë, afërsisht 1 deri në 3 USD. Në nivelin A100, një politikë ~3 B zgjat 3 deri në 6 orë me 1.20 deri në 2.00 USD për orë, afërsisht 4 deri në 12 USD. Shih çmimet, dhe të njëjtat operacione nga CLI dhe serveri MCP.
Kur një model i vogël është zgjedhja e gabuar
Të dyja punimet janë më të kujdesshme këtu sesa përmbledhjet. Analiza e dështimit të TinyVLA është specifike: varianti 0.4 B dështoi tre herë duke keqlexuar udhëzimin, të cilën autorët ia atribuojnë kuptimit të kufizuar të gjuhës në VLM-në më të vogël, dhe ky modalitet u zhduk në 1.3 B. SmolVLA tregon të njëjtën kurbë nga ana tjetër: versioni 2.25 B i arkitekturës identike shënon 88.75 në LIBERO dhe 68.24 në Meta-World kundrejt 87.3 dhe 57.3 për modelin 0.45 B.
- Përshtatet në një kartë 24 GB, gjë që ul koston e një eksperimenti nga dhjetëra dollarë në disa.
- Mjaftueshëm i shpejtë për të funksionuar pranë krahut, kështu që nuk ka kërcim rrjeti në ciklin e kontrollit.
- Rregullohet mirë me të dhënat që një person mund të regjistrojë, dhjetëra episode në vend të mijëra.
- Peshat, lista e të dhënave dhe kodi i SmolVLA-së janë publike, kështu që një rezultat i keq mund të debugohet.
- Në ndjekjen e udhëzimeve: më pak parametra gjuhe, më pak aftësi për të ndarë shprehje referuese të ngjashme.
- Më pak përgjithësim hapësinor dhe vizual në konfigurime që nuk i keni regjistruar.
- Më i ndjeshëm ndaj defekteve të grupit të të dhënave, me më pak paratrajnim për t'u mbështetur.
- Puna me shumë detyra dhe me horizont të gjatë ende favorizon modelet më të mëdha, duke përfshirë variantin 2.25 B të SmolVLA-së.
Krahasimi që ia vlen të bëhet nuk është TinyVLA kundër SmolVLA. Është SmolVLA kundër ACT në detyrën tuaj, dhe punimi i SmolVLA është argumenti pse. I trajnuar me një detyrë të vetme pa paratrajnim robotik, SmolVLA arriti mesatarisht 40.0 në tre detyra SO-100 ku ACT me një detyrë të vetme arriti 48.3. Ajo që e ngre në 78.3 është paratrajnimi i komunitetit plus trajnimi me shumë detyra, jo vetëm arkitektura. Në detyrën lego SO-101, të dyja me një detyrë të vetme, SmolVLA fiton: 90 kundër 70 në shpërndarje. Pastaj SmolVLA kundër Pi0.5 nëse buxheti e lejon.
Ka më pak paratrajnim paraprak për të mbuluar të dhënat e këqija, kështu që një kurbë e pastër humbjeje në një grup të dhënash me defekt ju jep një politikë që riprodhon defektin me besim. Dokumentet e lerobot janë të drejtpërdrejta për strukturën: 50 episode në 5 pozicione kubi, 10 për pozicion, funksionuan; 25 jo. Nëse humbja duket mirë dhe krahu nuk bën asgjë të dobishme, filloni te humbja bie, politika nuk bën asgjë, politika funksionon vetëm në një konfigurim ose mbledhja e të dhënave të trajnimit VLA që janë vërtet të përdorshme.
Pesë politika, një tabelë krahasimi
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT me numër real parametrash, vonesë inferencimi për hap veprimi, nivelin e GPU-së që secili ka nevojë dhe numrin minimal të episodeve para se të bëjë diçka të dobishme.
Krahasoni politikatNjë tabelë vendimesh mbi të cilën mund të veproni
| Situata juaj | Filloni me | Pse |
|---|---|---|
| Një detyrë, demonstrime të mira, pa gjuhë | ACT | ~80 M, 20 ms, kartë 24 GB, pa model bazë për t'u shkarkuar |
| Disa detyra të lidhura, një udhëzim secila | SmolVLA | 450 M, në lerobot, minimumi 30 episode, 1 deri në 3 USD për ekzekutim |
| Riprodhimi specifik i rezultatit TinyVLA | TinyVLA-B ose TinyVLA-H | Repoja është e vetmja rrugë: mjedis i izoluar, të dhëna të konvertuara |
| Shumë-detyra, udhëzime të ndryshme, buxhet A100 | GR00T N1.7 ose Pi0.5 | ~3 B, 152 ms dhe 485 ms për hap, 4 deri në 12 USD për ekzekutim |
| Pa robot ende | Drejtoni një krah real | Krahu i drejtpërdrejtë i bazuar në radhë nuk kërkon regjistrim dhe as pajisje |
Për rreshtin e fundit, krahu live transmeton një SO-100 fizik që mund ta drejtosh nga shfletuesi pa llogari, dhe tre mënyrat për të filluar mbulon pjesën tjetër. SO-100 është krahu referencë këtu, afërsisht 110 deri në 150 EUR në pjesë, me një udhëzues të plotë konfigurimi.
Çfarë vjen pas modeleve nën 1 B
Zvogëlimi i numrit të parametrave është një mënyrë për ta bërë një VLA të lirë dhe jo domosdoshmërisht fituese. OpenVLA-OFT (arXiv 2502.19645) ruan shtyllën kurrizore 7 B dhe ndryshon vetëm mënyrën se si deshifrohen veprimet, duke raportuar një rritje 26x në prurjen e gjenerimit të veprimeve dhe LIBERO-n që rritet nga 76.5 në 97.1 për qind. BitVLA (arXiv 2506.07530) e bën çdo peshë të një shtylle kurrizore 1-bit BitNet b1.58 2B4T ternare, duke raportuar 11.0x më pak memorie dhe 4.4x vonesë më të ulët nga fillimi në fund, ndërsa përputhet me OpenVLA-OFT me saktësi të plotë. X-VLA-0.9B (arXiv 2510.10274) qëndron në linjën 1 B me përputhje fluksi.
Fili i përbashkët: dekoderi i veprimeve, jo modeli i gjuhës, është aty ku qëndron vonesa. Pyesni se si një politikë lëshon veprime përpara se të pyesni sa parametra ka. arena ka 85 modele dhe 332 rezultate, secila e lidhur me burimin e saj; ka një përmbledhje më të gjerë në hyrjen tonë në VLA.
A mund ta rregulloj SmolVLA në një RTX 4090?▾
Po. SmolVLA ka 450 M parametra dhe AY-Robots e ekzekuton atë në nivelin RTX 4090 / 24 GB. Shembulli i lerobot përdor --batch_size=64, i cili është një shembull dhe jo një garanci për kartën tuaj; dokumentacioni këshillon të filloni me pak dhe të rritni ndërsa kohët e ngarkimit mbeten të shkurtra. Pritni më gjatë se rreth 4 orët që dokumentacioni citon për 20000 hapa në një A100.
A është TinyVLA i disponueshëm në lerobot apo në AY-Robots?▾
Jo për të dyja. TinyVLA ekziston vetëm në depozitën e tij kërkimore, ndryshimi i fundit 11 Mars 2025, dhe formati i tij është HDF5 i stilit ACT dhe jo LeRobot. AY-Robots trajnon GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT. Nëse dëshironi TinyVLA, duhet ta ndërtoni vetë, dhe do t'ju duhet të rregulloni shtegun e konfigurimit të DeepSpeed në scripts/train.sh fillimisht.
A është vërtet konkurrues një model 450 M me një model 3 B?▾
Në standardet e autorëve, po: 87.3 kundrejt 86.0 në LIBERO kundrejt një Pi0 të paratrajnuar për robotikë në 3.3 B, dhe 78.3 kundrejt 61.7 në tre detyra reale SO-100 ku i njëjti punim etikon Pi0 në 3.5 B. Kufiri është në të njëjtin punim: detyrë e vetme pa paratrajnim robotikë, SmolVLA bie në 40.0, nën 48.3 të ACT.
Sa episode më duhen para se një VLA i vogël të bëjë diçka?▾
AY-Robots vendos minimumin e SmolVLA në 30 episode dhe minimumin e ACT në 50. Dokumentacioni i lerobot rekomandon rreth 50 dhe raporton se 25 nuk ishin të mjaftueshme për të njëjtën detyrë. Struktura ka rëndësi po aq sa numri: grupi i punimit përdori 5 pozicione kubi me nga 10 episode secili.
Pse numrat e vonesës së publikuar nuk përputhen kaq shumë?▾
Ato masin gjëra të ndryshme. TinyVLA raporton 14 ms për parashikim veprimi në një A6000; AY-Robots liston SmolVLA në 245 ms dhe ACT në 20 ms për hap veprimi. Disa shifra mbulojnë një kalim përpara, disa ndajnë një kalim nëpër një bllok me 50 veprime, dhe pothuajse asnjë nuk përfshin kapjen e kamerës ose shkrimin te servot.
A e zgjidh inferenca në cloud problemin e GPU-së?▾
Pjesërisht. AY-Robots automatikisht ofron një pod që shërben politikën ndërsa klienti lokal flet me atë pikë fundore, me një mbikëqyrës pasiv në mënyrë që të shkatërrohet vetë në vend që të faturojë në heshtje. Nuk mund të heqë udhëtimin vajtje-ardhje të internetit publik, dhe cikli i kontrollit është tashmë 20 deri në 485 ms për hap veprimi. Mirë për marrje-vendosje të ngadaltë, jo për lëvizje të shpejtë reaktive.
Sources
- TinyVLA: Drejt Modeleve të Shpejta, Efikase në të Dhëna, Vizion-Gjuhë-Veprim për Manipulimin Robotik
- Depozita zyrtare e kodit TinyVLA (README, requirements.txt, scripts/train.sh)
- Faqja e projektit TinyVLA
- lesjie/Llava-Pythia-1.3B, peshat e shtyllës kurrizore TinyVLA-H
- SmolVLA: Një Model Vizion-Gjuhë-Veprim për Robotikë të Përballueshme dhe Efikase
- Dokumentacioni i lerobot: rregullimi i SmolVLA
- lerobot: configuration_smolvla.py, parazgjedhjet e SmolVLA
- Karta e modelit lerobot/smolvla_base
- SmolVLA: Model Efikas Vizion-Gjuhë-Veprim (blogu i Hugging Face)
- lerobot në PyPI (0.6.1, kërkon Python 3.12 ose më të ri)
- OpenVLA: Një Model Vizion-Gjuhë-Veprim me Burim të Hapur
- Rregullimi i Modeleve Vizion-Gjuhë-Veprim: Optimizimi i Shpejtësisë dhe Suksesit (OpenVLA-OFT)
- BitVLA: Modele Vizion-Gjuhë-Veprim 1-bit për Manipulimin Robotik
- X-VLA: Transformator me Kërkesë të Butë si Model i Shkallëzueshëm Vizion-Gjuhë-Veprim Ndër-Trupor
- Karta e modelit rail-berkeley/octo-small-1.5 (27 M parametra)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started