
TinyVLA un SmolVLA ievieto funkcionējošu VLA zem 1B parametru. Reāli skaitļi no abiem rakstiem, lerobot noklusējuma iestatījumi, izmērītā latentums un cik maksā viena izpilde uz 24 GB kartes.
Gandrīz katrs redzes-valodas-darbības modelis, par ko tiek rakstīts, pieņem datu centra karti. OpenVLA ir 7 miljardi parametru. GR00T N1.7 un Pi0.5 ir aptuveni 3 miljardi un prasa A100 80 GB karti precizēšanai. Ja uz jūsu galda ir 4090 karte, šāda modeļu klase ir nesasniedzama.
Divi pētījumi apgalvo, ka jums tas nav vajadzīgs. TinyVLA (arXiv 2409.12514, pieņemts IEEE Robotics and Automation Letters 2025. gada februārī) veido VLA no 400 miljonu līdz 1,3 miljardu parametru pamata plus difūzijas darbības galvu. SmolVLA (arXiv 2506.01844, iesniegts 2025. gada 2. jūnijā) piedāvā 450 miljonus parametru ar atvērtiem svariem, atvērtiem datiem un skriptu, kas darbojas uz vienas patērētāju kartes. Lūk, ko abi izmērīja, un kur arguments par mazāk nekā 1 miljardu parametru vairs nav spēkā.
Kas jums jāzina
- •TinyVLA tiek piegādāts trīs izmēros: 422 miljoni kopā ar 101 miljonu apmācāmu, 740 miljoni ar 138 miljoniem, 1,3 miljardi ar 143 miljoniem. Tikai pirmie divi ir zem 1 miljarda.
- •Tā IV tabula mēra 14 ms par katru darbības prognozi TinyVLA-1B uz vienas A6000, salīdzinot ar 292 ms OpenVLA-7B un 140 ms samazinātam OpenVLA-1B.
- •Galva nodrošina šo ātrumu, nevis pamats: nomainiet TinyVLA-H difūzijas galvu pret ACT galvu, un pieci reālo robotu uzdevumi samazinās no 94,0 vidējā rādītāja līdz viencipara skaitļiem. MLP galva visur iegūst 0 punktus.
- •SmolVLA ir 450 miljoni, aptuveni 100 miljoni no tiem ir darbības eksperts, iepriekš apmācīts uz 481 kopienas LeRobot datu kopas un 10,6 miljoniem kadru. Tas ziņo par 87,3 LIBERO pret 86,0 robotikas iepriekš apmācītam Pi0 ar 3,3 miljardiem parametru, un 78,3 trīs reālos SO-100 uzdevumos pret 61,7 Pi0 ar 3,5 miljardiem parametru.
- •Apmācīts vienam uzdevumam bez šīs iepriekšējas apmācības, SmolVLA samazinās līdz 40,0 šajos uzdevumos, zem ACT 48,3. Mazs nenozīmē automātiski viegls.
- •TinyVLA nav LeRobot integrācijas un izmanto CUDA 11.7 riteņu steku. SmolVLA ir lerobot un šeit maksā aptuveni 1 līdz 3 USD par katru palaišanu 24 GB līmenī.
Kas patiesībā tiek uzskatīts par mazu VLA
Parametru skaits modeļa kartītē nav viens skaitlis. Tas var nozīmēt kopējo svaru skaitu, inferencē ielādētos svarus vai svarus, kas saņem gradientus laikā. TinyVLA ziņo par abiem, un atšķirība ir liela: TinyVLA-H ir 1.3 B kopā, bet 143 M apmācāmi, jo redzes tornis un lielākā daļa valodu modeļa paliek iesaldēti, kamēr LoRA adapteri un darbības galva kustas. Rakstā apmācāmā daļa ir aptuveni 5 procenti.
| Modelis | Parametri | Pamatstruktūra | Darbības galva | Avots |
|---|---|---|---|---|
| TinyVLA-S | 422 M kopā, 101 M apmācāmi | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M kopā, 138 M apmācāmi | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B kopā, 143 M apmācāmi | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M darbības eksperts | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S mērogs, T5-Base teksta kodētājs | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, bez valodu modeļa | Tieša fragmentu regresija | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregresīvi darbības marķieri | arXiv 2406.09246 |
Divas rindas ir vērts apspriest. ar aptuveni 80 M ir mazāks par visu pārējo šeit, taču tam nav valodu modeļa, tāpēc tas nav VLA: tas apgūst vienu uzdevumu un tam nevar likt darīt citu. ar 27 M tiek kondicionēts, izmantojot T5-Base teksta kodētāju, nevis LLM pamatstruktūru. Labas bāzes līnijas, neviena no tām nenodrošina instrukciju izpildi, ko norāda etiķete.
TinyVLA-H, variants, kas nodrošina galvenos rezultātus, ir 1.3 B un atrodas virs līnijas. Labāks jautājums ir, vai modelis apmācības laikā ietilpst 24 GB un sasniedz jūsu kontroles ātrumu inferencē. Piecas politikas, ko varat apmācīt šeit, ir atrodamas politiku lapā; TinyVLA ir arēnas ieraksts, ja vēlaties redzēt tā skaitļus blakus citiem.
TinyVLA: ātrums nāk no galvas, nevis no mugurkaula
Acīmredzamais secinājums ir, ka viņi samazināja valodu modeli, tāpēc tas kļuva ātrāks. Raksta ablācija liecina par pretējo. Aizstājot OpenVLA 7 B mugurkaulu ar aptuveni 1 B, samazinājās prognozēšana par darbību no 292 ms līdz 140 ms, kas ir 2x pieaugums. TinyVLA-H, ar salīdzināmu parametru skaitu, darbojas ar 14 ms uz tās pašas kartes. Pārējais 10x ir darbības galva.
| Modelis | Prognozēšana par darbību | Mērīts uz |
|---|---|---|
| OpenVLA-7B | 292 ms | viens A6000 |
| OpenVLA-1B, mugurkauls aizstāts ar TinyVLA | 140 ms | viens A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | viens A6000 |
OpenVLA izstaro darbības kā diskretizētus žetonus caur valodu modeļa galvu, pa vienam katrai darbības dimensijai, autoregresīvi. TinyVLA pievieno difūzijas dekoderi, kas rada visu gabalu vienā piegājienā. V tabulā ir TinyVLA-H arhitektūra un tiek mainīta tikai galva, veicot tos pašus piecus reālo robotu uzdevumus. Tas ir tīrākais pierādījums abos rakstos par argumentu plūsmas saskaņošana politikām, un iemesls, kāpēc Pi0 atteicās no žetonu dekodēšanas.
| Galva uz TinyVLA-H | Novietot tenisa bumbiņu | Apgriezt krūzi | Sakraut kubus | Aizvērt atvilktni | Atvērt kasti |
|---|---|---|---|---|---|
| Difūzija (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Darbību sadalīšanas transformators | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Daudzslāņu perceptrons | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms rādītāji ir no IV tabulas, visi uz viena A6000. Tie ir par katru darbības prognozi un neietver kameras uztveršanu, priekšapstrādi un seriālo rakstīšanu uz servomotoriem. Publicēto latentumu uzskatiet par apakšējo robežu, nekad ne par vadības ātrumu. Mūsu pašu rādītājiem ir tāds pats ierobežojums: skatiet secinājumu latentums.
Ko sasniedza TinyVLA
| Etalons | Protokols | TinyVLA-H | Bāzes līnijas |
|---|---|---|---|
| MetaWorld, 50 uzdevumi, simulācija | Daudzuzdevumu, 50 demonstrācijas, 3 sēklas | 77.6 / 21.5 / 11.4 / 15.8 pēc grūtības pakāpes, vidēji 31.6 | Diffusion Policy vidēji 10.5 |
| Reāls Franka Panda, 5 uzdevumi | 100 trajektorijas uz uzdevumu, 20 mēģinājumi | 94.0 vidēji | OpenVLA 68.3, Diffusion Policy 35.3 |
| Divroku UR5, 3 uzdevumi | Daudzuzdevumu, 10 mēģinājumi uz uzdevumu | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Bimanualā rinda ir ar garlaicīgu paskaidrojumu, ko sniedz pats raksts: OpenVLA ir iepriekš apmācīts uz Open X-Embodiment, kas pilnībā sastāv no vienas rokas datiem, tāpēc divu roku darbību telpa ir ārpus izplatīšanas un tā iegūst nulli punktu. Difūzijas politikas bāzes līnija pārspēj TinyVLA-H divos no šiem trim uzdevumiem. Fons Open X-Embodiment aprakstā.

TinyVLA repozitorijs, uz 2026. gada augustu
Raksts ir labs. Kods ir pētniecības izlaidums. Repozitorijs ir github.com/liyaxuanliyaxuan/TinyVLA; tā README norāda koda izlaišanas datumu 2025. gada 17. februārī un pēdējo izmaiņu 2025. gada 11. martā. Tas ir piemērots raksta reproducēšanai, bet problēma, ja vēlējāties uzturētu bibliotēku.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt piesaista torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 un CUDA steku 11.x versijām: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README prasa Python 3.10; lerobot 0.6.1 prasa 3.12 vai jaunāku, tāpēc abas nevar dalīties vienā vidē. Vispirms pārliecinieties, vai jūsu GPU paaudzei ir pieejama torch 2.0.1 versija. Ja izpilde apstājas VRAM trūkuma dēļ, atmiņas trūkuma kontrolsaraksts ir ātrāks par minēšanu.
TinyVLA arī nelasa LeRobot datu kopas. Tās formāts ir ACT stila HDF5: action, language_raw un novērojumu grupa ar vairāku skatu attēliem, joint_positions, qpos un qvel. Repozitorijs piegādā data_utils/rlds_to_h5py.py RLDS ievadei, un katrs uzdevums tiek reģistrēts manuāli aloha_scripts/constants.py ar savu dataset_dir, episode_len un camera_names. Ja jūsu epizodes nāca no lerobot vai darbvirsmas klienta, konversija ir jūsu ziņā.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 pieņem astoņu karšu mezglu. Iestatiet to uz 1 un samaziniet pakešu izmēru krietni zem 32. Neviena viena GPU versija netiek piegādāta augšup, tāpēc komandu nevar palaist burtiski uz 4090.
- --deepspeed scripts/zero2.json norāda uz failu, kas nav augšējā līmeņa scripts direktorijā. DeepSpeed konfigurācijas tiek piegādātas llava-pythia/scripts/zero2.json. Pirms pirmās palaišanas izlabojiet ceļu.
- README prasa, lai izvades direktorija nosaukums saturētu llava_pythia, kā arī lora, ja LoRA ir iespējota.
- Pamatmodelis ir atsevišķa lejupielāde: lesjie/Llava-Pythia-400M, -700M vai -1.3B. Nav viena bāzes kontrolpunkta, uz kuru jūs norādāt politiku tā, kā jūs norādāt uz lerobot/smolvla_base.
SmolVLA: zem 1 B modelis, ko varat palaist šopēcpusdien
SmolVLA izvirza to pašu argumentu uzturētā bibliotēkā. Tam ir 450 M parametri uz SmolVLM2-500M-Video-Instruct pamatmodeļa, un efektivitāte nāk no iestatījumiem, ko varat nolasīt no configuration_smolvla.py, nevis no apgalvojuma par tā mazumu.
| Iestatījums configuration_smolvla.py | Noklusējums | Ko tas dod |
|---|---|---|
| num_vlm_layers | 16 | Tiek palaisti tikai pirmie 16 valodu modeļa slāņi |
| expert_width_multiplier | 0.75 | Darbības eksperta slēptais izmērs ir 75 procenti no VLM |
| self_attn_every_n_layers | 2 | Pašuzmanība mijas ar krustenisko uzmanību |
| chunk_size / n_action_steps | 50 / 50 | Viena pāreja izdod 50 darbības, un visas 50 tiek izpildītas |
| num_steps | 10 | Plūsmas saskaņošanas trokšņu samazināšana fiksēta uz 10 soļiem |
| tokenizer_max_length | 48 | Instrukcija tiek saīsināta līdz 48 marķieriem |
| freeze_vision_encoder / train_expert_only | True / True | Precīza pielāgošana pārvieto ekspertu, nevis redzes torni |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Nav raksta recepte: tā iepriekšējā apmācība izmantoja 100 soļu iesildīšanos vairāk nekā 200000 soļu garumā |
Iepriekšējā apmācībā tika izmantotas 481 kopienas LeRobot datu kopas, 22,9 K epizodes un 10,6 M kadri uz 4 GPU, 200000 soļi ar globālo partiju 256; rakstā viss projekts tiek lēsts ap 30 K GPU stundām. Viens skaitlis, kam jāpievērš uzmanība: Hugging Face palaišanas emuārā minētas 487 atlasītas datu kopas, kur raksta tabulā minētas 481. Mēs izmantojam raksta skaitli un atzīmējam neatbilstību.
| Salīdzinošais tests | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO vidējais, daudzuzdevumu | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World vidējais, daudzuzdevumu | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Reālais SO-100, 3 uzdevumi, daudzuzdevumu apmācība | 78.3 | - | 61.7 (3.5 B) | - |
| Reālais SO-100, 3 uzdevumi, viena uzdevuma, bez robotikas iepriekšējas apmācības | 40.0 | - | - | 48.3 |
| SO-101 lego paņemšanas-novietošanas, viena uzdevuma, izplatījumā | 90 | - | - | 70 |
| SO-101 lego paņemšanas-novietošanas, viena uzdevuma, ārpus izplatījuma | 50 | - | - | 40 |
LIBERO ir simulācija, un viss kompetentais tagad tur gūst astoņdesmitos punktus. Interesanta ir reālā SO-100 rinda, kur 450 M modelis pārspēj 3.5 B modeli par 16.6 punktiem; rinda zem tās ir pretsvars. Atņemot kopienas iepriekšējo apmācību un daudzuzdevumu apmācību, tas pats modelis nokrītas līdz 40.0, zem ACT. Aizstāvamais apgalvojums ir, ka mazs modelis nav automātiski sliktāks, nevis tas, ka tas ir labāks.
Viens nejaušs palīgs: SmolVLA raksta Meta-World tabulā ir iekļauti TinyVLA paši publicētie skaitļi kā bāzes līnija, tāpēc vienreiz abi modeļi atrodas vienā tabulā, SmolVLA-0.45B ar 57.3 pret TinyVLA-H ar 31.6. Tas arī ziņo, ka SmolVLA apmācība ir aptuveni par 40 procentiem ātrāka nekā Pi0, izmantojot 6 reizes mazāk atmiņas. Viss tas nāk no SmolVLA autoriem; arēnas ieraksts saista katru vērtību ar tās avotu.
Kur SmolVLA pavada savu laiku
AY-Robots norāda SmolVLA ar 245 ms par darbības soli un ACT ar 20 ms politiku katalogā. TinyVLA ziņo par 14 ms par darbības prognozi. Šie skaitļi nav salīdzināmi, un to uzskatīšana par salīdzināmiem ir visbiežākā kļūda šajā tēmā: daži mēra vienu pāreju uz priekšu, daži sadala šo pāreju pa gabalu, kad darbību sadalīšana gabalos to amortizē.
- SmolVLA izdod 50 darbības vienā pārejā uz priekšu un izpilda visas 50. Pie 30 kadriem sekundē, ko raksts izmanto reālos robotos, viena secinājumu veikšana aptver aptuveni 1.7 sekundes kustības.
- Asinhronā secinājumu veikšana aprēķina nākamo gabalu, kamēr pašreizējais vēl tiek izpildīts: vidējais uzdevuma pabeigšanas laiks 9.7 s pret 13.75 s sinhronā režīmā, aptuveni par 30 procentiem ātrāk, un 19 paņemšanas un novietošanas cikli fiksētā 60 sekunžu logā pret 9.
- Veiksmes rādītāji bija salīdzināmi, nevis labāki: 78.3 sinhronā režīmā pret 73.3 asinhronā režīmā. Asinhronā darbība nodrošina caurlaidspēju, nevis precizitāti.
- Sadalīšana gabalos slēpj aprēķinu latentumu, nevis tīkla latentumu, un tas padara politiku mazāk reaktīvu, jo tā ir apņēmusies veikt 50 darbības.
AY-Robots var automātiski nodrošināt mākoņa GPU podu, kas apkalpo jūsu politiku, kamēr vietējais robota klients sazinās ar šo galapunktu, un pods satur dīkstāves sargsuni, lai tas iznīcinātu sevi, nevis klusi rēķinātu. Tas, ko tas nedara, ir publiskā interneta turp-atpakaļ ceļa novēršana. Kontroles cilpa piecās politikās šeit ir no 20 līdz 485 ms par darbības soli pirms jebkāda tīkla, tāpēc attālā secināšana ir piemērota lēnai paņemšanai un novietošanai, nevis ātrai reaktīvai kustībai.

SmolVLA precizēšana uz vienas patērētāju kartes
Manuālais ceļš, izmantojot lerobot 0.6.1, pašreizējo PyPI izlaidumu no 2026. gada 23. augusta. Viss zemāk minētais nāk no Hugging Face lerobot SmolVLA dokumentācijas, kas iegūta tajā pašā dienā; vadītā versija ir maigāka.
- 1Instalējiet lerobot ar smolvla papildinājumu
SmolVLA atkarības ir papildu opcija, kas nav daļa no pamata instalācijas. Instalēšana bez tām un pēc tam brīnīšanās, kāpēc politikas tips nav zināms, ir bieži zaudēta pusstunda.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Iegūstiet datu kopu ar pietiekami daudzām epizodēm
Dokumentācija iesaka aptuveni 50 epizodes un norāda, ka tas pats uzdevums ar 25 epizodēm nebija pietiekams. AY-Robots nosaka minimumu 30. Ierakstiet savus datus vai sāciet no datu kopu direktorija.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Sāciet precizēšanu
Komanda no lerobot ceļveža, nemodificēta. Dokumentācija norāda, ka 20000 soļi aizņem aptuveni 4 stundas uz viena A100. Uz 24 GB kartes sagaidiet ilgāku laiku un izmēriet to.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Samaziniet partijas lielumu, līdz tas der
batch_size=64 ir dokumentēts piemērs, nevis solījums par jūsu karti. Dokumentācija iesaka sākt ar mazu vērtību un palielināt to, kamēr ielādes laiks paliek īss.
bashlerobot-train --help - 5Izvietojiet kontrolpunktu uz rokas
Tā pati bibliotēka, viena komanda. Reāllaika sadalīšanas karodziņi ir komentēti dokumentācijā un ir tie, kas jāizmanto mazjaudas aparatūrā.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Neatkarīgi no izvēlētā ceļa, jūs iegūstat kontrolpunktu un konfigurāciju, kas to radīja. Saglabājiet datu kopas revīziju, soļu skaitu un sēklu blakus. lerobot noklusējuma sēkla ir 1000; GR00T precizēšanas sākumpunkts vispār neatklāj sēklu, tāpēc šie izpildījumi nav bitu-pa-bitam reproducējami. Mehānika atrodama apmācības dokumentācijā.
Divi veidi, kā iegūt mazu VLA uz rokas
Jums pieder mašīna un kļūdu režīmi. SmolVLA gadījumā tas ir saprātīgi: viens pip papildinājums, viena apmācības komanda, viena izvietošanas komanda. TinyVLA gadījumā tā ir pētījumu reprodukcija ar fiksētām atkarībām, bojātu DeepSpeed ceļu un datu konversiju, ko rakstāt pats.
- Iegādājieties 24 GB karti, ierakstiet 30 līdz 50 epizodes, pārbaudiet kameras plūsmas kadru pa kadram.
- pip install -e ".[smolvla]", lerobot-train pret lerobot/smolvla_base, pēc tam izvietojiet kontrolpunktu mašīnā, kurā ir pievienota roka.
- TinyVLA gadījumā: atsevišķa conda vide, konvertējiet datus uz HDF5, reģistrējiet uzdevumu constants.py, labojiet zero2.json ceļu, samaziniet train.sh no astoņiem GPU uz vienu.
- Nav stundas maksas, kad karte ir apmaksāta.
- Secinājumi atrodas blakus servomotoriem, tas ir vienīgais veids, kā iegūt ātru vadības cilpu.
- Jūs varat labot politikas kodu, un TinyVLA ir pieejams tikai šādā veidā.
- 4090 izslēdz katru ~3 B politiku, tāpēc nav lokālas salīdzināšanas ar GR00T N1.7 vai Pi0.5.
- Vides iestatīšana ir īstais darbs. TinyVLA atkarības vien var maksāt dienu.
- Nav rindas, nav atkārtotu mēģinājumu, nav kontrolpunktu glabāšanas. Pārstartēšana 14000. solī nozīmē sākt no jauna.
SmolVLA ir viena no piecām politikām šeit. Jūs izvēlaties modeli un datu kopu veidlapā, aizmugursistēma iznomā GPU atbilstoši nepieciešamajai VRAM, palaiž apmācītāju un raksta kontrolpunktus uz objektu krātuvi. Soli pa solim: SmolVLA uz SO-100, vai pilna matrica apmācības lapā.
| Ko platforma sūta SmolVLA | Vērtība |
|---|---|
| partijas lielums | 2 |
| mācīšanās ātrums | 1e-4 |
| maksimālais soļu skaits | 20000 |
| gradientu akumulācija | 8, and it does not reach the trainer |
| papildu iestatījumi veidlapā | seed, logFreq |
| GPU līmenis | RTX 4090 or any 24 GB card |
| datu kopas formāts | LeRobot v3.0 |
| minimālais epizožu skaits | 30 |
Pirmkārt, noklusējuma partijas lielums šeit ir 2, nevis 64 lerobot dokumentācijas piemērā, un gradientu akumulācijas iestatījums tiek nosūtīts, bet tam nav ietekmes uz SmolVLA, tāpēc efektīvais partijas lielums patiešām ir 2. Palieliniet to apzināti, nevis pieņemot, ka noklusējuma vērtība atbilst augšupējai. Otrkārt, TinyVLA šeit vispār nav apmācāms.
Izpilde 24 GB līmenī aizņem 2 līdz 5 stundas ar 0.30 līdz 0.60 USD stundā, aptuveni 1 līdz 3 USD. A100 līmenī ~3 B politika aizņem 3 līdz 6 stundas ar 1.20 līdz 2.00 USD stundā, aptuveni 4 līdz 12 USD. Skatiet cenrādi, un tās pašas darbības no CLI un MCP servera.
Kad mazs modelis ir nepareizā izvēle
Abi raksti šeit ir rūpīgāki nekā to kopsavilkumi. TinyVLA kļūdu analīze ir specifiska: 0,4 B variants trīs reizes kļūdījās, nepareizi nolasot instrukciju, ko autori saista ar ierobežotu valodu izpratni mazākajā VLM, un šis režīms pazuda pie 1,3 B. SmolVLA parāda to pašu līkni no otra gala: identiskās arhitektūras 2,25 B versija iegūst 88,75 punktus LIBERO un 68,24 punktus Meta-World, salīdzinot ar 87,3 un 57,3 punktiem 0,45 B modelim.
- Der 24 GB kartei, kas samazina eksperimenta izmaksas no desmitiem dolāru līdz pāris.
- Pietiekami ātrs, lai darbotos blakus robotrokai, tādējādi novēršot tīkla lēcienu vadības cilpā.
- Precīzi pielāgojas datiem, ko var ierakstīt viens cilvēks, desmitiem epizožu, nevis tūkstošiem.
- SmolVLA svari, datu saraksts un kods ir publiski pieejami, tāpēc sliktu rezultātu var atkļūdot.
- Vājāka instrukciju izpilde: mazāk valodu parametru, mazāka spēja atšķirt līdzīgas atsauces izteiksmes.
- Mazāka telpiskā un vizuālā vispārināšana uz iestatījumiem, ko neesat ierakstījis.
- Jutīgāks pret datu kopas defektiem, ar mazāku iepriekšējo apmācību, uz ko paļauties.
- Daudzuzdevumu un ilgtermiņa darbs joprojām dod priekšroku lielākiem modeļiem, tostarp SmolVLA paša 2,25 B variantam.
Salīdzinājums, ko ir vērts veikt, nav TinyVLA pret SmolVLA. Tas ir SmolVLA pret ACT jūsu pašu uzdevumā, un SmolVLA raksts ir arguments, kāpēc. Apmācīts vienam uzdevumam bez robotikas iepriekšējas apmācības, SmolVLA vidēji ieguva 40,0 punktus trīs SO-100 uzdevumos, kur vienuzdevuma ACT ieguva 48,3. Tas, kas to paceļ līdz 78,3, ir kopienas iepriekšējā apmācība plus daudzuzdevumu apmācība, nevis tikai arhitektūra. SO-101 lego uzdevumā, abos vienuzdevuma režīmos, SmolVLA uzvar: 90 pret 70 izplatībā. Pēc tam SmolVLA pret Pi0.5 ja budžets atļauj.
Ir mazāk iepriekšējas apmācības, lai segtu sliktus datus, tāpēc tīra zudumu līkne uz defektīvas datu kopas dod jums politiku, kas pārliecinoši reproducē defektu. lerobot dokumentācija ir tieša par struktūru: 50 epizodes piecās kuba pozīcijās, 10 katrā pozīcijā, darbojās; 25 nedarbojās. Ja zudums izskatās labi un roka nedara neko noderīgu, sāciet ar zudums krītas, politika nedara neko, politika darbojas tikai vienā iestatījumā vai VLA apmācības datu vākšanu, kas patiešām ir izmantojami.
Piecas politikas, viena salīdzināšanas tabula
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT ar reālu parametru skaitu, secinājumu latentumu uz darbības soli, nepieciešamo GPU līmeni katram un minimālo epizožu skaitu, pirms tas sāk darīt kaut ko noderīgu.
Salīdzināt politikasLēmumu tabula, pēc kuras varat rīkoties
| Jūsu situācija | Sākt ar | Kāpēc |
|---|---|---|
| Viens uzdevums, labas demonstrācijas, bez valodas | ACT | ~80 M, 20 ms, 24 GB karte, nav lejupielādējama bāzes modeļa |
| Daži saistīti uzdevumi, katram viena instrukcija | SmolVLA | 450 M, lerobotā, minimāli 30 epizodes, 1 līdz 3 USD par izpildi |
| Konkrēti reproducējot TinyVLA rezultātu | TinyVLA-B or TinyVLA-H | Repozitorijs ir vienīgais ceļš: izolēta vide, konvertēti dati |
| Daudzuzdevumu, dažādas instrukcijas, A100 budžets | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms un 485 ms uz soli, 4 līdz 12 USD par izpildi |
| Vēl nav robota | Vadīt reālu roku | Uz rindām balstītai tiešraides rokai nav nepieciešama reģistrācija un aparatūra |
Pēdējai rindai, tiešraides roka straumē fizisku SO-100, ko var vadīt no pārlūkprogrammas bez konta, un trīs veidi, kā sākt aptver pārējo. Šeit SO-100 ir atsauces roka, aptuveni 110 līdz 150 EUR detaļās, ar pilnu iestatīšanas rokasgrāmatu.
Kas nāk pēc modeļiem, kas mazāki par 1 B
Parametru skaita samazināšana ir viens veids, kā padarīt VLA lētu, un tas nav acīmredzami uzvarošais veids. OpenVLA-OFT (arXiv 2502.19645) saglabā 7 B pamatu un maina tikai to, kā tiek atšifrētas darbības, ziņojot par 26x darbību ģenerēšanas caurlaidības pieaugumu un LIBERO pieaugumu no 76.5 līdz 97.1 procentiem. BitVLA (arXiv 2506.07530) padara katru 1 bita BitNet b1.58 2B4T pamata svaru trīskāršu, ziņojot par 11.0x mazāku atmiņu un 4.4x zemāku gala-līdz-galam latentumu, vienlaikus atbilstot pilnas precizitātes OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) atrodas uz 1 B līnijas ar plūsmas saskaņošanu.
Kopīgais pavediens: darbību dekodētājs, nevis valodu modelis, ir vieta, kur rodas latentums. Jautājiet, kā politika izstaro darbības, pirms jautājat, cik parametru tai ir. Arēna ir 85 modeļi un 332 rezultāti, katrs saistīts ar savu avotu; plašāks pārskats ir atrodams mūsu VLA ievadā.
Vai es varu precizēt SmolVLA uz RTX 4090?▾
Jā. SmolVLA ir 450 M parametri, un AY-Robots to palaiž uz RTX 4090 / 24 GB līmeņa. lerobot piemērs izmanto --batch_size=64, kas ir piemērs, nevis garantija jūsu kartei; dokumentācija iesaka sākt ar mazu vērtību un palielināt to, kamēr ielādes laiks paliek īss. Sagaidiet ilgāku laiku nekā aptuveni 4 stundas, ko dokumentācija norāda 20000 soļiem uz A100.
Vai TinyVLA ir pieejams lerobot vai AY-Robots?▾
Nē abiem. TinyVLA pastāv tikai savā pētniecības repozitorijā, pēdējā apņemšanās 2025. gada 11. martā, un tā formāts ir ACT-stila HDF5, nevis LeRobot. AY-Robots apmāca GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT. Ja vēlaties TinyVLA, jums tas jāveido pašam, un vispirms jums būs jāizlabo DeepSpeed config path in scripts/train.sh.
Vai 450 M modelis patiešām ir konkurētspējīgs ar 3 B modeli?▾
Pēc autoru pašu etaloniem, jā: 87.3 pret 86.0 uz LIBERO salīdzinājumā ar robotikas iepriekš apmācītu Pi0 pie 3.3 B, un 78.3 pret 61.7 trīs reālos SO-100 uzdevumos, kur tajā pašā rakstā Pi0 ir atzīmēts ar 3.5 B. Ierobežojums ir tajā pašā rakstā: viena uzdevuma bez robotikas iepriekšējas apmācības, SmolVLA samazinās līdz 40.0, zem ACT 48.3.
Cik daudz epizožu man ir nepieciešams, pirms mazs VLA kaut ko dara?▾
AY-Robots nosaka SmolVLA minimumu 30 epizodēs un ACT minimumu 50 epizodēs. lerobot dokumentācija iesaka ap 50 un ziņo, ka 25 nebija pietiekami tam pašam uzdevumam. Struktūra ir tikpat svarīga kā skaits: raksta komplekts izmantoja 5 kuba pozīcijas ar 10 epizodēm katrā.
Kāpēc publicētie latentuma rādītāji tik ļoti atšķiras?▾
Tie mēra dažādas lietas. TinyVLA ziņo par 14 ms uz darbības prognozi uz A6000; AY-Robots norāda SmolVLA pie 245 ms un ACT pie 20 ms uz darbības soli. Daži skaitļi aptver vienu pāreju uz priekšu, daži sadala pāreju pa 50 darbību bloku, un gandrīz neviens neietver kameras uztveršanu vai rakstīšanu uz servomotoriem.
Vai mākoņdatošanas secinājumi atrisina GPU problēmu?▾
Daļēji. AY-Robots automātiski nodrošina podu, kas apkalpo politiku, kamēr lokālais klients sazinās ar šo galapunktu, ar dīkstāves sargsuņu, lai tas iznīcinātu sevi, nevis klusi rēķinātu. Tas nevar novērst publiskā interneta apļveida ceļojumu, un vadības cilpa jau ir no 20 līdz 485 ms uz darbības soli. Labi lēnai paņemšanai un novietošanai, nevis ātrai reaktīvai kustībai.
Sources
- TinyVLA: Ceļā uz ātriem, datu efektīviem redzes-valodas-darbības modeļiem robotu manipulācijai
- TinyVLA oficiālais koda repozitorijs (README, requirements.txt, scripts/train.sh)
- TinyVLA projekta lapa
- lesjie/Llava-Pythia-1.3B, TinyVLA-H mugurkaula svari
- SmolVLA: Redzes-valodas-darbības modelis pieejamai un efektīvai robotikai
- lerobot dokumentācija: SmolVLA precizēšana
- lerobot: configuration_smolvla.py, SmolVLA noklusējuma iestatījumi
- lerobot/smolvla_base modeļa karte
- SmolVLA: Efektīvs redzes-valodas-darbības modelis (Hugging Face emuārs)
- lerobot PyPI (0.6.1, nepieciešams Python 3.12 vai jaunāks)
- OpenVLA: Atvērtā koda redzes-valodas-darbības modelis
- Redzes-valodas-darbības modeļu precizēšana: ātruma un panākumu optimizēšana (OpenVLA-OFT)
- BitVLA: 1-bitu redzes-valodas-darbības modeļi robotikas manipulācijai
- X-VLA: Mīksti-promptēts transformators kā mērogojams starp-ķermeņu redzes-valodas-darbības modelis
- rail-berkeley/octo-small-1.5 modeļa karte (27 M parametri)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started