
TinyVLA og SmolVLA setja virkt VLA undir 1 milljarð færibreyta. Rauntölur úr báðum greinum, sjálfgefnar stillingar LeRobot, mældur leyndartími og hvað keyrsla kostar á 24 GB korti.
Næstum hvert sjón-tungumál-aðgerðarlíkan sem skrifað er um gerir ráð fyrir gagnamiðstöðvarkorti. OpenVLA er 7 milljarðar færibreytna. GR00T N1.7 og Pi0.5 eru um 3 milljarðar og þurfa A100 80 GB til fínstillingar. Ef kortið á skrifborðinu þínu er 4090, er sú gerð líkana utan seilingar.
Tvær greinar halda því fram að þú þurfir það ekki. TinyVLA (arXiv 2409.12514, samþykkt af IEEE Robotics and Automation Letters í febrúar 2025) byggir VLA úr 400 milljóna til 1,3 milljarða burðarás ásamt dreifingaraðgerðarhaus. SmolVLA (arXiv 2506.01844, sent inn 2. júní 2025) sendir 450 milljónir færibreytna með opnum þyngdum, opnum gögnum og skriftu sem keyrir á einu neytendakorti. Hér er það sem báðir mældu, og hvar röksemdin um undir-1 milljarð hættir að halda.
Það sem þú þarft að vita
- •TinyVLA er fáanlegt í þremur stærðum: 422 milljónir samtals með 101 milljón þjálfanlegra, 740 milljónir með 138 milljónum, 1,3 milljarðar með 143 milljónum. Aðeins fyrstu tvær eru undir 1 milljarði.
- •Tafla IV þess mælir 14 ms á hverja aðgerðarspá fyrir TinyVLA-1B á einu A6000, samanborið við 292 ms fyrir OpenVLA-7B og 140 ms fyrir minnkað OpenVLA-1B.
- •Hausinn heldur þeim hraða, ekki burðarásinn: skiptu dreifingarhaus TinyVLA-H út fyrir ACT haus og fimm raunverulegu vélmennaverkefnin falla úr 94,0 meðaltali niður í einnar tölu. MLP haus skorar 0 alls staðar.
- •SmolVLA er 450 milljónir, um 100 milljónir af því aðgerðasérfræðingurinn, forþjálfað á 481 samfélags LeRobot gagnasöfnum og 10,6 milljónum ramma. Það skilar 87,3 á LIBERO samanborið við 86,0 fyrir vélmennaforþjálfaðan Pi0 á 3,3 milljörðum, og 78,3 á þremur raunverulegum SO-100 verkefnum samanborið við 61,7 fyrir Pi0 á 3,5 milljörðum.
- •Þjálfað sem eitt verkefni án þeirrar forþjálfunar, fellur SmolVLA niður í 40,0 á þeim verkefnum, undir 48,3 hjá ACT. Lítið er ekki sjálfkrafa auðvelt.
- •TinyVLA hefur enga LeRobot samþættingu og festir CUDA 11.7 hjólastafla. SmolVLA er í lerobot og kostar um það bil 1 til 3 USD á keyrslu á 24 GB flokki hér.
Hvað telst í raun lítið VLA
Fjöldi færibreyta á líkanakorti er ekki ein tala. Það getur þýtt heildarþyngdir, þyngdir sem hlaðnar eru við ályktun, eða þyngdir sem fá halla meðan á stendur. TinyVLA skýrir frá báðum, og bilið er mikið: TinyVLA-H er 1.3 B samtals en 143 M þjálfanlegt, vegna þess að sjónkerfið og mest af málalíkaninu haldast frosin á meðan LoRA millistykki og aðgerðarhausinn hreyfast. Greinin setur þjálfanlega hlutann í um 5 prósent.
| Líkan | Færibreytur | Burðarvirki | Aðgerðarhaus | Heimild |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
Tvær raðir eru umdeildar. sem er um 80 M er minna en allt annað hér en hefur ekkert málalíkan, svo það er ekki VLA: það lærir eitt verkefni og er ekki hægt að segja að það geri annað. sem er 27 M er skilyrt í gegnum T5-Base textakóðara, ekki LLM burðarvirki. Góðir grunnlínur, hvorugur gefur þér leiðbeiningarnar sem merkið gefur til kynna.
TinyVLA-H, afbrigðið sem ber fyrirsagnarárangurinn, er 1.3 B og situr fyrir ofan línuna. Betri spurningin er hvort líkan passi í 24 GB við þjálfun og nái stjórnhraða þínum við ályktun. Fimm stefnur sem þú getur þjálfað hér eru á stefnusíðunni; TinyVLA hefur færslu í vettvangi ef þú vilt sjá tölur þess við hlið annarra.
TinyVLA: hraðinn kemur frá hausnum, ekki burðarásnum
Augljós lestur er að þeir gerðu tungumálalíkanið minna, svo það varð hraðara. Ablation rannsókn greinarinnar segir annað. Að skipta út 7 B burðarás OpenVLA fyrir um það bil 1 B minnkaði spá á hverja aðgerð úr 292 ms í 140 ms, 2x aukning. TinyVLA-H, með sambærilegan fjölda færibreyta, keyrir á 14 ms á sama korti. Hin 10x aukningin er aðgerðarhausinn.
| Líkan | Spá á hverja aðgerð | Mælt á |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA gefur frá sér aðgerðir sem stakrænar tákn í gegnum tungumálalíkanhausinn, eitt fyrir hverja aðgerðarvídd, sjálfvirkt. TinyVLA tengir dreifingarkóðara sem framleiðir allan hlutann í einu lagi. Tafla V sýnir arkitektúrinn í TinyVLA-H og skiptir aðeins um hausinn, á sömu fimm raunverulegu vélmennaverkefnunum. Þetta eru hreinustu sannanirnar í hvorri greininni fyrir röksemdafærsluna flæðisjöfnun sem stefnur byggðar á flæðisjöfnun gera, og ástæðan fyrir því að Pi0 færði sig frá táknkóðun.
| Á TinyVLA-H | Setja tennisbolta | Snúa krús | Stafla kubbum | Loka skúffu | Opna kassa |
|---|---|---|---|---|---|
| Dreifing (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Aðgerðarhluta spennir | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Fjöllaga skynjari | 0 | 0 | 0 | 0 | 0 |
Tölurnar 292 / 140 / 14 ms eru úr töflu IV, allar á einni A6000. Þær eru fyrir hverja aðgerðarspá og útiloka myndatöku, forvinnslu og raðskrift á servóin. Líta skal á birtan leyndartíma sem neðri mörk, aldrei sem stjórnhraða. Okkar eigin tölur hafa sömu takmörkun: sjá leyndartíma ályktunar.
Hvað TinyVLA skoraði
| Viðmið | Bókun | TinyVLA-H | Grunnlínur |
|---|---|---|---|
| MetaWorld, 50 verkefni, hermun | Fjölverkefni, 50 sýnishorn, 3 fræ | 77.6 / 21.5 / 11.4 / 15.8 eftir erfiðleikum, meðaltal 31.6 | Meðaltal dreifingarstefnu 10.5 |
| Raunverulegur Franka Panda, 5 verkefni | 100 ferlar á verkefni, 20 tilraunir | 94.0 að meðaltali | OpenVLA 68.3, Dreifingarstefna 35.3 |
| Tvíhöfða UR5, 3 verkefni | Fjölverkefni, 10 tilraunir á verkefni | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Dreifingarstefna 40.3 / 31.3 / 43.0 |
Tvíhandaröðin hefur leiðinlega skýringu sem greinin sjálf gefur: OpenVLA er forþjálfað á Open X-Embodiment, sem samanstendur eingöngu af einarma gögnum, svo tvíarma aðgerðarými er utan dreifingar og fær núll stig. Grunnlína dreifingarstefnunnar slær TinyVLA-H í tveimur af þessum þremur verkefnum. Bakgrunnur í greininni um Open X-Embodiment.

TinyVLA geymslan, frá ágúst 2026
Greinin er góð. Kóðinn er rannsóknarútgáfa. Geymslan er github.com/liyaxuanliyaxuan/TinyVLA; README skrá hennar dagsetur kóðaútgáfuna til 17. febrúar 2025 og síðasta commit er 11. mars 2025. Gott til að endurtaka grein, vandamál ef þú vildir viðhaldið safn.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt festir torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, og CUDA staflann við 11.x hjólin: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README skjalið biður um Python 3.10; lerobot 0.6.1 krefst 3.12 eða nýrra, svo þau tvö geta ekki deilt umhverfi. Staðfestu fyrst að torch 2.0.1 útgáfa sé til fyrir þína GPU kynslóð. Ef keyrsla deyr vegna VRAM í staðinn, er gátlistinn fyrir minnisleysi hraðari en að giska.
TinyVLA les heldur ekki LeRobot gagnasöfn. Snið þess er ACT-stíll HDF5: action, language_raw, og athugunarhópur með fjölmyndamyndum, joint_positions, qpos og qvel. Geymslan sendir með data_utils/rlds_to_h5py.py fyrir RLDS inntak, og hvert verkefni er skráð handvirkt í aloha_scripts/constants.py með dataset_dir, episode_len og camera_names. Ef þínir þættir komu frá lerobot eða skjáborðsforritinu, þá átt þú umbreytinguna.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 gerir ráð fyrir átta korta hnút. Stilltu það á 1 og lækkaðu lotustærðina vel undir 32. Engin ein-GPU útgáfa er send uppstreymis, svo skipunina er ekki hægt að keyra orðrétt á 4090.
- --deepspeed scripts/zero2.json vísar á skrá sem er ekki í efstu scripts möppunni. DeepSpeed stillingarnar eru sendar með á llava-pythia/scripts/zero2.json. Lagaðu slóðina fyrir fyrstu keyrslu.
- README skjalið krefst þess að nafn úttaksmöppunnar innihaldi llava_pythia, auk lora ef LoRA er virkt.
- Burðarvirkið er sér niðurhal: lesjie/Llava-Pythia-400M, -700M eða -1.3B. Það er enginn einn grunnathugunarpunktur sem þú vísar stefnu á eins og þú vísar á lerobot/smolvla_base.
SmolVLA: líkanið undir 1 B sem þú getur keyrt í dag
SmolVLA færir sömu rök innan viðhaldins safns. Það er 450 M færibreytur á SmolVLM2-500M-Video-Instruct burðarvirki, og skilvirkni kemur frá stillingum sem þú getur lesið úr configuration_smolvla.py frekar en frá fullyrðingu um að vera lítið.
| Stilling í configuration_smolvla.py | Sjálfgefið | Hvað það skilar |
|---|---|---|
| num_vlm_layers | 16 | Aðeins fyrstu 16 tungumálalíkanlögin keyra |
| expert_width_multiplier | 0.75 | Falin stærð aðgerðasérfræðings er 75 prósent af VLM |
| self_attn_every_n_layers | 2 | Sjálfsathygli samtvinnuð krossathygli |
| chunk_size / n_action_steps | 50 / 50 | Ein keyrsla gefur frá sér 50 aðgerðir og allar 50 eru framkvæmdar |
| num_steps | 10 | Flæðisjöfnun hávaðaminnkun fest við 10 skref |
| tokenizer_max_length | 48 | Leiðbeiningin er stytt í 48 tákn |
| freeze_vision_encoder / train_expert_only | True / True | Fínstilling færir sérfræðinginn, ekki sjónturninn |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Ekki uppskrift úr greininni: forþjálfun hennar notaði 100 skrefa upphitun yfir 200000 skref |
Forþjálfun notaði 481 LeRobot gagnasöfn samfélagsins, 22.9 K þætti og 10.6 M ramma á 4 GPUum, 200000 skrefum í alþjóðlegri lotu upp á 256; greinin metur allt verkefnið á um 30 K GPU klukkustundir. Eitt númer til að fylgjast með: Hugging Face kynningarbloggið segir 487 safnaðar gagnasöfn þar sem tafla greinarinnar segir 481. Við notum tölu greinarinnar og merkjum ósamræmið.
| Viðmið | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO meðaltal, fjölverkefni | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World meðaltal, fjölverkefni | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Raunverulegt SO-100, 3 verkefni, fjölverkefnaþjálfun | 78.3 | - | 61.7 (3.5 B) | - |
| Raunverulegt SO-100, 3 verkefni, eitt verkefni, engin forþjálfun í vélfærafræði | 40.0 | - | - | 48.3 |
| SO-101 lego taka-setja, eitt verkefni, í dreifingu | 90 | - | - | 70 |
| SO-101 lego taka-setja, eitt verkefni, utan dreifingar | 50 | - | - | 40 |
LIBERO er hermun og allt sem er hæft skorar núna á áttunda áratugnum þar. Raunverulega SO-100 röðin, þar sem 450 M líkan sigrar 3.5 B líkan um 16.6 stig, er sú áhugaverða; röðin undir henni er mótvægið. Fjarlægðu forþjálfun samfélagsins og fjölverkefnaþjálfunina og sama líkanið fellur niður í 40.0, undir ACT. Varnarleg krafa er sú að lítið líkan sé ekki sjálfkrafa verra, ekki að það sé betra.
Eitt tilviljun hjálpar: Meta-World tafla SmolVLA greinarinnar inniheldur birtar tölur TinyVLA sem grunnlínu, svo í eitt skipti sitja báðar gerðirnar í einni töflu, SmolVLA-0.45B á 57.3 á móti TinyVLA-H á 31.6. Hún greinir einnig frá því að SmolVLA þjálfun sé um 40 prósent hraðari en Pi0 á 6x minna minni. Allt þetta kemur frá höfundum SmolVLA; skráningin í vettvanginum tengir hvert gildi við uppruna sinn.
Hvar SmolVLA eyðir tíma sínum
AY-Robots skráir SmolVLA á 245 ms á hvert aðgerðarskref og ACT á 20 ms í stefnuskrá. TinyVLA greinir frá 14 ms á hverja aðgerðarspá. Þessar tölur eru ekki sambærilegar, og að meðhöndla þær eins og þær væru er algengustu mistökin í þessu efni: sumir mæla einn framsendingarferil, sumir deila þeim ferli yfir hluta þegar aðgerðarhlutun hefur afskrifað hann.
- SmolVLA gefur frá sér 50 aðgerðir á hverjum framsendingarferli og framkvæmir allar 50. Við 30 ramma á sekúndu sem greinin notar á raunverulegum vélmennum, nær ein ályktun yfir um 1.7 sekúndur af hreyfingu.
- Ósamstillt ályktun reiknar næsta hluta á meðan sá núverandi er enn í framkvæmd: 9.7 s meðalverkefnalokun á móti 13.75 s samstilltri, um 30 prósent hraðari, og 19 taka-og-setja hringrásir í föstum 60 sekúndna glugga á móti 9.
- Árangurshlutfall var sambærilegt frekar en betra, 78.3 samstillt á móti 73.3 ósamstilltu. Ósamstilling kaupir afköst, ekki nákvæmni.
- Hlutun felur tölvuviðbragðstíma, ekki netviðbragðstíma, og hún gerir stefnuna minna viðbragðsgóða vegna þess að hún er bundin við 50 aðgerðir.
AY-Robots geta sjálfvirkt úthlutað skýja-GPU-einingu sem þjónar stefnu þinni á meðan staðbundinn vélmennaforritari talar við þann endapunkt, og einingin er með aðgerðalausan varðhund svo hún eyðir sér frekar en að rukka hljóðlaust. Það sem hún gerir ekki er að fjarlægja hringferð um almenna internetið. Stýrilykkjan yfir fimm stefnur hér er 20 til 485 ms á hverju aðgerðarskrefi áður en nokkurt net er til staðar, svo fjarlæg ályktun er möguleg fyrir hæga tínslu og staðsetningu, en ekki fyrir hraðvirka viðbragðshreyfingu.

Fínstilling SmolVLA á einu neytendakorti
Handvirka leiðin, á lerobot 0.6.1, núverandi PyPI útgáfa frá 23. ágúst 2026. Allt hér að neðan kemur frá Hugging Face lerobot SmolVLA skjölunum, sótt sama dag; leiðbeinda útgáfan er mildari.
- 1Setja upp lerobot með smolvla viðbótinni
SmolVLA-háðir pakkar eru valfrjáls viðbót, ekki hluti af grunnuppsetningu. Að setja upp án þeirra og velta því svo fyrir sér hvers vegna stefnugerðin er óþekkt er algeng hálftíma töf.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Fáðu gagnasafn með nægum þáttum
Skjölin mæla með um 50 þáttum og segja að sama verkefni með 25 hafi ekki verið nóg. AY-Robots setur lágmarkið við 30. Taktu upp þína eigin, eða byrjaðu frá gagnasafnaskránni.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Hefja fínstillingu
Skipunin úr lerobot leiðbeiningunum, óbreytt. Skjölin segja að 20000 skref taki um það bil 4 klukkustundir á einu A100. Á 24 GB korti, búist við lengri tíma og mælið hann.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Lækka lotustærðina þar til hún passar
batch_size=64 er skjalfest dæmi, ekki loforð um kortið þitt. Skjölin ráðleggja að byrja smátt og auka á meðan hleðslutímar haldast stuttir.
bashlerobot-train --help - 5Keyra gátpunktinn út á arminn
Sama safn, ein skipun. Rauntíma skiptingarflöggin eru útskýrð í skjölunum og eru þau sem á að nota á vélbúnaði með litla aflgjafa.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Hvaða leið sem þú ferð, endarðu með gátpunkt ásamt stillingunum sem framleiddu hann. Haltu gagnasafnsútgáfunni, skrefafjöldanum og fræinu við hliðina á honum. lerobot notar sjálfgefið fræ 1000; fínstillingarinnar inngangspunktur GR00T sýnir ekkert fræ yfirleitt, svo þessar keyrslur eru ekki nákvæmlega endurgeranlegar. Vélbúnaður í þjálfunarskjölunum.
Tvær leiðir til að koma litlum VLA á arm
Þú átt vélina og bilunarhamina. Fyrir SmolVLA er það sanngjarnt: ein pip viðbót, ein þjálfunarskipun, ein útfærsluskipun. Fyrir TinyVLA er það rannsóknarútgáfa með frosnum pinnum, brotinni DeepSpeed slóð og gagnabreytingu sem þú skrifar sjálfur.
- Fáðu þér 24 GB kort, taktu upp 30 til 50 þætti, staðfestu myndavélarstraumana ramma fyrir ramma.
- pip install -e ".[smolvla]", lerobot-train gegn lerobot/smolvla_base, þjónaðu síðan gátpunktinum á vélinni sem armurinn er tengdur við.
- Fyrir TinyVLA: aðskilið conda umhverfi, breyttu gögnum í HDF5, skráðu verkefnið í constants.py, lagaðu zero2.json slóðina, minnkaðu train.sh úr átta GPU í eitt.
- Engin tímagjöld þegar kortið er greitt.
- Ályktun er við hliðina á servóunum, eina leiðin til að fá hraðan stjórnlykkju.
- Þú getur lagað stefnukóðann, og TinyVLA er aðeins fáanlegt á þennan hátt.
- 4090 útilokar allar ~3 B stefnur, svo enginn staðbundinn samanburður við GR00T N1.7 eða Pi0.5.
- Uppsetning umhverfis er raunverulega vinnan. Pinnar TinyVLA einir geta kostað heilan dag.
- Engin biðröð, engin endurtekning, engin gátpunktsgeymsla. Endurræsing á skrefi 14000 þýðir að byrja upp á nýtt.
SmolVLA er ein af fimm stefnum hér. Þú velur líkan og gagnasafn í formi, bakendinn leigir GPU eftir nauðsynlegu VRAM, keyrir þjálfarann og skrifar gátpunkta í hlutageymslu. Skref fyrir skref: SmolVLA á SO-100, eða heildarmatríxuna á þjálfunarsíðunni.
| Hvað pallurinn sendir fyrir SmolVLA | Gildi |
|---|---|
| batch size | 2 |
| learning rate | 1e-4 |
| max steps | 20000 |
| gradient accumulation | 8, and it does not reach the trainer |
| extra knobs in the form | seed, logFreq |
| GPU tier | RTX 4090 or any 24 GB card |
| dataset format | LeRobot v3.0 |
| minimum episodes | 30 |
Í fyrsta lagi er sjálfgefin lotustærð hér 2, ekki 64 eins og í dæminu í lerobot skjölunum, og stilling fyrir uppsöfnun halla er send en hefur engin áhrif fyrir SmolVLA, svo raunveruleg lota er í raun 2. Hækkaðu hana viljandi frekar en að gera ráð fyrir að sjálfgefin stilling passi við upprunalega. Í öðru lagi er TinyVLA alls ekki þjálfanlegt hér.
Keyrsla á 24 GB flokki tekur 2 til 5 klukkustundir á 0.30 til 0.60 USD á klukkustund, um það bil 1 til 3 USD. Á A100 flokki er ~3 B stefna 3 til 6 klukkustundir á 1.20 til 2.00 USD á klukkustund, um það bil 4 til 12 USD. Sjá verðlagningu, og sömu aðgerðir frá CLI og MCP netþjóninum.
Þegar lítið líkan er rangur kostur
Báðar greinarnar eru varkárari hér en samantektirnar. Bilunargreining TinyVLA er sértæk: 0,4 B afbrigðið mistókst þrisvar sinnum með því að lesa leiðbeiningarnar rangt, sem höfundar rekja til takmarkaðs málskilnings í minni VLM, og sá háttur hvarf við 1,3 B. SmolVLA sýnir sömu ferilinn frá hinum endanum: 2,25 B útgáfan af sömu arkitektúr skorar 88,75 á LIBERO og 68,24 á Meta-World á móti 87,3 og 57,3 fyrir 0,45 B líkanið.
- Passar á 24 GB kort, sem lækkar kostnað tilraunar úr tugum dollara í nokkra.
- Nógu hratt til að keyra við hliðina á arminum, svo enginn netstökk í stjórnlykkjunni.
- Fínstillir á gögnum sem einn einstaklingur getur tekið upp, tugum þátta frekar en þúsundum.
- Þyngdir, gagnaskrá og kóði SmolVLA eru opinber, svo hægt er að kemba slæma niðurstöðu.
- Veikari fylgni við leiðbeiningar: færri málfæribreytur, minni geta til að aðgreina svipaðar tilvísanir.
- Minni staðbundin og sjónræn alhæfing á uppsetningar sem þú tókst ekki upp.
- Næmari fyrir göllum í gagnasafni, með minni forþjálfun til að falla aftur á.
- Fjölverkavinnsla og langtímaverkefni styðja enn stærri líkön, þar á meðal 2,25 B afbrigði SmolVLA.
Samanburðurinn sem vert er að keyra er ekki TinyVLA á móti SmolVLA. Það er SmolVLA á móti ACT á þínu eigin verkefni, og SmolVLA greinin er röksemdin fyrir því hvers vegna. Þjálfað í einu verkefni án forþjálfunar í vélfærafræði, náði SmolVLA að meðaltali 40,0 yfir þrjú SO-100 verkefni þar sem ACT í einu verkefni náði 48,3. Það sem lyftir því í 78,3 er forþjálfun samfélagsins ásamt fjölverkavinnsla, ekki arkitektúrinn einn. Í SO-101 legóverkefninu, bæði í einu verkefni, vinnur SmolVLA: 90 á móti 70 í dreifingu. Síðan SmolVLA á móti Pi0.5 ef fjárhagsáætlunin leyfir.
Minni forþjálfun er til staðar til að hylja slæm gögn, svo hrein tapferill á gölluðu gagnasafni gefur þér stefnu sem endurskapar gallann af öryggi. lerobot skjöl eru hreinskilin um uppbyggingu: 50 þættir yfir 5 teningastöður, 10 á stöðu, virkuðu; 25 gerðu það ekki. Ef tapið lítur vel út og armurinn gerir ekkert gagnlegt, byrjaðu á tapið fellur, stefnan gerir ekkert, stefnan virkar aðeins í einni uppsetningu eða að safna VLA þjálfunargögnum sem eru raunverulega nothæf.
Fimm stefnur, ein samanburðartafla
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT með raunverulegum færibreikjafjölda, ályktunartíma á hverju aðgerðarskrefi, GPU-flokknum sem hver þarf og lágmarksfjölda þátta áður en það gerir eitthvað gagnlegt.
Bera saman stefnurnarÁkvörðunartafla sem þú getur byggt á
| Þín staða | Byrjaðu á | Af hverju |
|---|---|---|
| Eitt verkefni, góðar sýnikennslur, ekkert tungumál | ACT | ~80 M, 20 ms, 24 GB card, no base model to download |
| Nokkur skyld verkefni, ein leiðbeining hvert | SmolVLA | 450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run |
| Endurgera TinyVLA niðurstöðuna sérstaklega | TinyVLA-B or TinyVLA-H | The repo is the only route: isolated env, converted data |
| Fjölverkefni, fjölbreyttar leiðbeiningar, A100 fjárhagsáætlun | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run |
| Enginn vélmenni ennþá | Stýrðu raunverulegum armi | Biðraðarmiðuð lifandi armur þarf enga skráningu og engan vélbúnað |
Fyrir síðustu röð, lifandi armurinn streymir líkamlegum SO-100 sem þú getur stýrt úr vafranum án reiknings, og þrjár leiðir til að byrja fjallar um restina. SO-100 er viðmiðunararmurinn hér, um það bil 110 til 150 EUR í hlutum, með fullkominni uppsetningarleiðbeiningu.
Hvað kemur eftir líkönin undir 1 B
Að minnka fjölda færibreyta er ein leið til að gera VLA ódýrt og ekki augljóslega sú vinnandi. OpenVLA-OFT (arXiv 2502.19645) heldur 7 B burðarásnum og breytir aðeins hvernig aðgerðir eru afkóðaðar, og greinir frá 26x aukningu í gegnumstreymi aðgerðamyndunar og LIBERO hækkar úr 76,5 í 97,1 prósent. BitVLA (arXiv 2506.07530) gerir hverja þyngd 1-bita BitNet b1.58 2B4T burðarásar þrígilda, og greinir frá 11,0x minni minni og 4,4x lægri heildarleynd á meðan hún passar við fullnákvæmni OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) situr á 1 B línunni með flæðisjöfnun.
Sameiginlegi þráðurinn: aðgerðarafkóðarinn, ekki tungumálalíkanið, er þar sem leyndin býr. Spyrðu hvernig stefna gefur frá sér aðgerðir áður en þú spyrð hversu margar færibreytur hún hefur. Vettvangurinn hefur 85 líkön og 332 niðurstöður, hver tengd uppruna sínum; það er víðtækara yfirlit í VLA kynningu okkar.
Get ég fínstillt SmolVLA á RTX 4090?▾
Já. SmolVLA er 450 M færibreytur og AY-Robots keyrir það á RTX 4090 / 24 GB flokki. Lerobot dæmið notar --batch_size=64, sem er dæmi frekar en trygging fyrir kortið þitt; skjölun ráðleggur að byrja smátt og auka á meðan hleðslutímar haldast stuttir. Búist við lengri tíma en þeim um það bil 4 klukkustundum sem skjölun nefnir fyrir 20000 skref á A100.
Er TinyVLA fáanlegt í lerobot eða á AY-Robots?▾
Nei við báðu. TinyVLA er aðeins til í rannsóknargeymslunni sinni, síðasta commit 11. mars 2025, og snið þess er ACT-stíll HDF5 frekar en LeRobot. AY-Robots þjálfar GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT. Ef þú vilt TinyVLA þarftu að byggja það sjálfur, og þú verður að laga DeepSpeed config slóðina í scripts/train.sh fyrst.
Er 450 M líkan virkilega samkeppnishæft við 3 B líkan?▾
Samkvæmt eigin viðmiðum höfundanna, já: 87.3 á móti 86.0 á LIBERO samanborið við vélfærafræði-forþjálfaðan Pi0 á 3.3 B, og 78.3 á móti 61.7 á þremur raunverulegum SO-100 verkefnum þar sem sama grein merkir Pi0 á 3.5 B. Takmörkunin er í sömu grein: eitt verkefni án vélfærafræði-forþjálfunar, SmolVLA fellur í 40.0, undir 48.3 hjá ACT.
Hversu marga þætti þarf ég áður en lítið VLA gerir eitthvað?▾
AY-Robots setur lágmark SmolVLA á 30 þætti og lágmark ACT á 50. Lerobot skjölun mælir með um 50 og greinir frá því að 25 hafi ekki verið nóg fyrir sama verkefni. Uppbygging skiptir jafn miklu máli og fjöldi: safn greinarinnar notaði 5 teningastöður með 10 þáttum hver.
Hvers vegna eru birtar tafir tölur svona ósamræmanlegar?▾
Þær mæla mismunandi hluti. TinyVLA greinir frá 14 ms á hverja aðgerðarspá á A6000; AY-Robots skráir SmolVLA á 245 ms og ACT á 20 ms á hvert aðgerðarskref. Sumar tölur ná yfir eina framsendingu, sumar skipta framsendingu yfir 50 aðgerða hluta, og næstum engar innihalda myndavélarupptöku eða skrif í servó.
Leysir skýjaályktun GPU vandamálið?▾
Að hluta til. AY-Robots útvegar sjálfkrafa pod sem þjónar stefnunni á meðan staðbundinn biðlari talar við þann endapunkt, með aðgerðalausum varðhundi svo hann eyðir sér frekar en að rukka hljóðlaust. Það getur ekki fjarlægt hringferð um almennt internet, og stjórnlykkjan er nú þegar 20 til 485 ms á hvert aðgerðarskref. Gott fyrir hæga tínslu og staðsetningu, ekki fyrir hraðvirka viðbragðshreyfingu.
Sources
- TinyVLA: Í átt að hröðum, gagna-hagkvæmum sjón-tungumál-aðgerðarlíkönum fyrir vélfærafræðilega meðhöndlun
- Opinber kóðageymsla TinyVLA (README, requirements.txt, scripts/train.sh)
- Verkefnasíða TinyVLA
- lesjie/Llava-Pythia-1.3B, burðarþyngdir TinyVLA-H
- SmolVLA: Sjón-tungumál-aðgerðarlíkan fyrir hagkvæma og skilvirka vélfærafræði
- lerobot skjölun: fínstilling SmolVLA
- lerobot: configuration_smolvla.py, sjálfgefnar stillingar SmolVLA
- lerobot/smolvla_base líkanakort
- SmolVLA: Skilvirkt sjón-tungumál-aðgerðarlíkan (Hugging Face blogg)
- lerobot á PyPI (0.6.1, krefst Python 3.12 eða nýrra)
- OpenVLA: Opinn-uppspretta sjón-tungumál-aðgerðarlíkan
- Fínstilling sjón-tungumál-aðgerðarlíkana: Hagræðing hraða og árangurs (OpenVLA-OFT)
- BitVLA: 1-bita sjón-tungumál-aðgerðarlíkön fyrir vélfærafræðilega meðhöndlun
- X-VLA: Mjúk-hvattur spennir sem stigstærðlegt kross-líkams sjón-tungumál-aðgerðarlíkan
- rail-berkeley/octo-small-1.5 líkanakort (27 M færibreytur)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started