
TinyVLA na SmolVLA huweka VLA inayofanya kazi chini ya vigezo bilioni 1. Namba halisi kutoka karatasi zote mbili, mipangilio chaguomsingi ya LeRobot, ucheleweshaji uliopimwa, na gharama ya uendeshaji kwenye kadi ya 24 GB.
Karibu kila modeli ya maono-lugha-vitendo ambayo huandikwa kuihusu hudhani kadi ya kituo cha data. OpenVLA ina vigezo bilioni 7. GR00T N1.7 na Pi0.5 zina takriban vigezo bilioni 3 na zinahitaji A100 80 GB kwa urekebishaji mzuri. Ikiwa kadi iliyo mezani kwako ni 4090, aina hiyo ya modeli haiwezi kufikiwa.
Makala mbili zinabishana kuwa hauitaji. TinyVLA (arXiv 2409.12514, iliyokubaliwa na IEEE Robotics and Automation Letters mnamo Februari 2025) inajenga VLA kutoka uti wa mgongo wa 400 M hadi 1.3 B pamoja na kichwa cha vitendo cha usambazaji. SmolVLA (arXiv 2506.01844, iliwasilishwa Juni 2, 2025) inatoa vigezo milioni 450 na uzito wazi, data wazi na hati inayoendeshwa kwenye kadi moja ya mtumiaji. Hapa ndio walichopima wote, na mahali ambapo hoja ya chini ya bilioni 1 inakoma kushikilia.
Unachohitaji kujua
- •TinyVLA inatoa saizi tatu: jumla ya 422 M na 101 M zinazoweza kufunzwa, 740 M na 138 M, 1.3 B na 143 M. Mbili za kwanza tu ndizo ziko chini ya 1 B.
- •Jedwali lake la IV linapima 14 ms kwa utabiri wa kitendo kwa TinyVLA-1B kwenye A6000 moja, dhidi ya 292 ms kwa OpenVLA-7B na 140 ms kwa OpenVLA-1B iliyopunguzwa.
- •Kichwa ndicho kinachoshikilia kasi hiyo, sio uti wa mgongo: badilisha kichwa cha usambazaji cha TinyVLA-H na kichwa cha ACT na kazi tano za roboti halisi zitashuka kutoka wastani wa 94.0 hadi nambari moja. Kichwa cha MLP kinafunga 0 kila mahali.
- •SmolVLA ni 450 M, takriban 100 M yake ni mtaalamu wa vitendo, iliyefunzwa awali kwenye seti data 481 za jamii za LeRobot na fremu milioni 10.6. Inaripoti 87.3 kwenye LIBERO dhidi ya 86.0 kwa Pi0 iliyefunzwa awali kwa roboti yenye 3.3 B, na 78.3 kwenye kazi tatu halisi za SO-100 dhidi ya 61.7 kwa Pi0 yenye 3.5 B.
- •Ikifunzwa kazi moja bila mafunzo hayo ya awali, SmolVLA inashuka hadi 40.0 kwenye kazi hizo, chini ya 48.3 ya ACT. Kidogo sio rahisi kiotomatiki.
- •TinyVLA haina ujumuishaji wa LeRobot na inahitaji mrundiko wa magurudumu wa CUDA 11.7. SmolVLA iko kwenye lerobot na inagharimu takriban USD 1 hadi 3 kwa kila uendeshaji kwenye kiwango cha 24 GB hapa.
Ni nini hasa kinachukuliwa kuwa VLA ndogo
Idadi ya vigezo kwenye kadi ya modeli si namba moja. Inaweza kumaanisha jumla ya uzito, uzito uliopakiwa wakati wa inference, au uzito unaopokea gradients wakati wa . TinyVLA inaripoti zote mbili, na tofauti ni kubwa: TinyVLA-H ina jumla ya 1.3 B lakini 143 M inaweza kufunzwa, kwa sababu mnara wa kuona na sehemu kubwa ya modeli ya lugha hubaki imegandishwa huku adapta za LoRA na kichwa cha hatua vikisonga. Karatasi inaweka sehemu inayoweza kufunzwa kuwa karibu asilimia 5.
| Modeli | Vigezo | Muundo Msingi | Kichwa cha Hatua | Chanzo |
|---|---|---|---|---|
| TinyVLA-S | Jumla 422 M, 101 M inaweza kufunzwa | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | Jumla 740 M, 138 M inaweza kufunzwa | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | Jumla 1.3 B, 143 M inaweza kufunzwa | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M mtaalamu wa hatua | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, hakuna modeli ya lugha | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
Safu mbili zinafaa kujadiliwa. yenye takriban 80 M ni ndogo kuliko zingine zote hapa lakini haina modeli ya lugha, kwa hivyo si VLA: inajifunza kazi moja na haiwezi kuambiwa kufanya nyingine. yenye 27 M inaendeshwa kupitia T5-Base text encoder, si LLM backbone. Ni baselines nzuri, lakini hakuna hata moja inayokupa ufuasi wa maelekezo kama lebo inavyomaanisha.
TinyVLA-H, toleo lenye matokeo makuu, ni 1.3 B na liko juu ya kiwango. Swali bora ni kama modeli inaweza kutoshea katika 24 GB wakati wa mafunzo na kufikia kiwango chako cha udhibiti wakati wa inference. Sera tano unazoweza kufunza hapa ziko kwenye ukurasa wa sera; TinyVLA ina kiingilio cha uwanja ikiwa unataka namba zake kando ya za wengine.
TinyVLA: kasi inatoka kwenye kichwa, si uti wa mgongo
Ufafanuzi wa wazi ni kwamba walifanya modeli ya lugha kuwa ndogo, hivyo ikawa haraka zaidi. Uchambuzi wa karatasi unasema vinginevyo. Kubadilisha uti wa mgongo wa OpenVLA wa 7 B na ule wa takriban 1 B kulipunguza utabiri wa kila kitendo kutoka 292 ms hadi 140 ms, faida ya mara 2. TinyVLA-H, ikiwa na idadi sawa ya vigezo, huendeshwa kwa 14 ms kwenye kadi hiyo hiyo. Mara 10 nyingine ni kichwa cha kitendo.
| Modeli | Utabiri wa kila kitendo | Imepimwa kwenye |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, uti wa mgongo umebadilishwa na wa TinyVLA | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA hutoa vitendo kama tokeni zilizogawanywa kupitia kichwa cha modeli ya lugha, moja kwa kila kipimo cha kitendo, kwa kujitegemea. TinyVLA huambatanisha kidekodisha cha usambazaji kinachozalisha kipande chote kwa mpigo mmoja. Jedwali V lina usanifu wa TinyVLA-H na hubadilisha kichwa tu, kwenye kazi tano zile zile za roboti halisi. Ni ushahidi safi zaidi katika karatasi yoyote kwa hoja ulinganishaji wa mtiririko sera zinazofanya, na sababu Pi0 iliondoka kwenye usimbaji wa tokeni.
| Kichwa kwenye TinyVLA-H | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox |
|---|---|---|---|---|---|
| Usambazaji (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Kibadilishaji cha Vitendo vya Kuchanganya | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Perceptron ya Tabaka Nyingi | 0 | 0 | 0 | 0 | 0 |
Takwimu za 292 / 140 / 14 ms ni Jedwali IV, zote kwenye A6000 moja. Zinawakilisha utabiri wa kila kitendo na hazijumuishi upigaji picha wa kamera, usindikaji wa awali na uandishi wa serial kwa servomotor. Chukulia muda wa kusubiri uliotangazwa kama kikomo cha chini, kamwe si kiwango cha udhibiti. Nambari zetu wenyewe zina kikomo hicho hicho: angalia muda wa kusubiri wa utambuzi.
Nini TinyVLA ilipata
| Kigezo | Itifaki | TinyVLA-H | Misingi |
|---|---|---|---|
| MetaWorld, kazi 50, sim | Kazi nyingi, maonyesho 50, mbegu 3 | 77.6 / 21.5 / 11.4 / 15.8 kwa ugumu, wastani 31.6 | Wastani wa Sera ya Usambazaji 10.5 |
| Franka Panda Halisi, kazi 5 | Njia 100 kwa kila kazi, majaribio 20 | Wastani 94.0 | OpenVLA 68.3, Sera ya Usambazaji 35.3 |
| UR5 ya Mikono Miwili, kazi 3 | Kazi nyingi, majaribio 10 kwa kila kazi | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Sera ya Usambazaji 40.3 / 31.3 / 43.0 |
Safu ya bimanual ina maelezo ya kuchosha ambayo karatasi yenyewe inatoa: OpenVLA imefunzwa awali kwenye Open X-Embodiment, ambayo inajumuisha data ya mkono mmoja pekee, hivyo nafasi ya hatua ya mikono miwili iko nje ya usambazaji na inapata alama sifuri. Msingi wa sera ya usambazaji unashinda TinyVLA-H kwenye kazi mbili kati ya hizo tatu. Maelezo zaidi katika makala ya Open X-Embodiment.

Hifadhi ya TinyVLA, kufikia Agosti 2026
Karatasi ni nzuri. Msimbo ni toleo la utafiti. Hifadhi ni github.com/liyaxuanliyaxuan/TinyVLA; README yake inaonyesha tarehe ya kutolewa kwa msimbo kuwa Februari 17, 2025 na commit ya mwisho ni Machi 11, 2025. Inafaa kwa kuzalisha tena karatasi, tatizo ikiwa unataka maktaba inayotunzwa.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt inabana torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, na staki ya CUDA kwenye magurudumu ya 11.x: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README inaomba Python 3.10; lerobot 0.6.1 inahitaji 3.12 au mpya zaidi, kwa hivyo hizi mbili haziwezi kushiriki mazingira. Thibitisha kuwa toleo la torch 2.0.1 lipo kwa kizazi chako cha GPU kwanza. Ikiwa utendaji utakwama kwa sababu ya VRAM, orodha ya ukaguzi wa kumbukumbu kujaa ni haraka kuliko kukisia.
TinyVLA pia haisomi seti za data za LeRobot. Umbizo lake ni HDF5 ya mtindo wa ACT: action, language_raw, na kikundi cha observations chenye picha za mitazamo mingi, joint_positions, qpos na qvel. Hazina inatoa data_utils/rlds_to_h5py.py kwa ingizo la RLDS, na kila kazi imesajiliwa kwa mkono katika aloha_scripts/constants.py na dataset_dir, episode_len na camera_names zake. Ikiwa vipindi vilitoka lerobot au mteja wa kompyuta ya mezani, unamiliki ubadilishaji.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 inachukulia nodi ya kadi nane. Iweke kuwa 1 na punguza ukubwa wa bechi chini ya 32. Hakuna lahaja ya GPU moja inayotumwa juu, kwa hivyo amri haiwezi kutekelezwa kama ilivyo kwenye 4090.
- --deepspeed scripts/zero2.json inaelekeza kwenye faili ambayo haipo kwenye saraka kuu ya scripts. Mipangilio ya DeepSpeed inapatikana kwenye llava-pythia/scripts/zero2.json. Rekebisha njia kabla ya kukimbia kwako kwa mara ya kwanza.
- README inahitaji jina la saraka ya pato liwe na llava_pythia, pamoja na lora ikiwa LoRA imewezeshwa.
- Utiaji mgongo unapakuliwa kando: lesjie/Llava-Pythia-400M, -700M au -1.3B. Hakuna sehemu moja ya msingi unayoelekeza sera kama unavyoelekeza kwenye lerobot/smolvla_base.
SmolVLA: modeli ya chini ya 1 B unayoweza kuendesha mchana huu
SmolVLA inatoa hoja hiyo hiyo ndani ya maktaba inayotunzwa. Ina vigezo 450 M kwenye uti wa mgongo wa SmolVLM2-500M-Video-Instruct, na ufanisi unatokana na mipangilio unayoweza kusoma kutoka configuration_smolvla.py badala ya madai ya kuwa ndogo.
| Mipangilio katika configuration_smolvla.py | Chaguomsingi | Inachokupa |
|---|---|---|
| num_vlm_layers | 16 | Ni tabaka 16 za kwanza tu za modeli ya lugha zinazotekelezwa |
| expert_width_multiplier | 0.75 | Ukubwa fiche wa mtaalamu wa vitendo ni asilimia 75 ya VLM |
| self_attn_every_n_layers | 2 | Kujitambua kumeingiliana na kutambua-mtambuka |
| chunk_size / n_action_steps | 50 / 50 | Pasi moja hutoa vitendo 50 na vyote 50 vinatendwa |
| num_steps | 10 | Uondoaji kelele wa kulinganisha mtiririko umewekwa hatua 10 |
| tokenizer_max_length | 48 | Maelekezo yamefupishwa hadi tokeni 48 |
| freeze_vision_encoder / train_expert_only | True / True | Urekebishaji mzuri husogeza mtaalamu, si mnara wa maono |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Sio mapishi ya karatasi: mafunzo yake ya awali yalitumiwa na joto la hatua 100 kwa hatua 200000 |
Mafunzo ya awali yalitumiwa na seti data 481 za jumuiya ya LeRobot, vipindi 22.9 K na fremu 10.6 M kwenye GPU 4, hatua 200000 kwa kundi la kimataifa la 256; karatasi inaweka mradi mzima kwa takriban saa 30 K za GPU. Nambari moja ya kuzingatia: blogu ya uzinduzi ya Hugging Face inasema seti data 487 zilizoratibiwa ambapo jedwali la karatasi linasema 481. Tunatumia takwimu ya karatasi na kuashiria kutokubaliana.

| Kiwango cha Kulinganisha | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| Wastani wa LIBERO, kazi nyingi | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Wastani wa Meta-World, kazi nyingi | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| SO-100 Halisi, kazi 3, mafunzo ya kazi nyingi | 78.3 | - | 61.7 (3.5 B) | - |
| SO-100 Halisi, kazi 3, kazi moja, hakuna mafunzo ya awali ya robotiki | 40.0 | - | - | 48.3 |
| SO-101 kuokota na kuweka lego, kazi moja, ndani ya usambazaji | 90 | - | - | 70 |
| SO-101 kuokota na kuweka lego, kazi moja, nje ya usambazaji | 50 | - | - | 40 |
LIBERO ni uigaji na kila kitu chenye uwezo kinafunga katika miaka ya themanini huko sasa. Safu ya SO-100 halisi, ambapo mfumo wa 450 M unashinda ule wa 3.5 B kwa pointi 16.6, ndiyo yenye kuvutia; safu iliyo chini yake ni kipingamizi. Ondoa mafunzo ya awali ya jumuiya na mafunzo ya kazi nyingi na mfumo huo huo unashuka hadi 40.0, chini ya ACT. Madai yanayoweza kutetewa ni kwamba mfumo mdogo si mbaya kiotomatiki, si kwamba ni bora.
Ajali moja inasaidia: jedwali la Meta-World la karatasi ya SmolVLA lina nambari zilizochapishwa za TinyVLA kama msingi, kwa hivyo kwa mara moja mifano yote miwili inakaa kwenye jedwali moja, SmolVLA-0.45B kwa 57.3 dhidi ya TinyVLA-H kwa 31.6. Pia inaripoti mafunzo ya SmolVLA kuwa karibu asilimia 40 haraka kuliko Pi0 kwenye kumbukumbu ndogo mara 6. Yote haya yanatoka kwa waandishi wa SmolVLA; kiingilio cha uwanja inaunganisha kila thamani na chanzo chake.
SmolVLA Hutumia Muda Wake Wapi
AY-Robots inaorodhesha SmolVLA kwa 245 ms kwa hatua ya kitendo na ACT kwa 20 ms katika orodha ya sera. TinyVLA inaripoti 14 ms kwa utabiri wa kitendo. Nambari hizo hazilinganishwi, na kuzichukulia kama zilivyo ni kosa la kawaida katika mada hii: zingine hupima pasi moja ya mbele, zingine hugawanya pasi hiyo katika kipande mara tu ugawaji wa vitendo unapoilipa.
- SmolVLA hutoa vitendo 50 kwa kila pasi ya mbele na kutekeleza vyote 50. Kwa 30 fps ambayo karatasi inatumia kwenye roboti halisi, hitimisho moja hufunika takriban sekunde 1.7 za mwendo.
- Hitimisho lisilosawazishwa huhesabu kipande kinachofuata wakati kile cha sasa bado kinafanya kazi: 9.7 s wastani wa kukamilisha kazi dhidi ya 13.75 s sawazishwa, takriban asilimia 30 haraka, na mizunguko 19 ya kuchukua na kuweka ndani ya dirisha la sekunde 60 lililowekwa dhidi ya 9.
- Viwango vya mafanikio vilikuwa vinavyolingana badala ya bora, 78.3 sawazishwa dhidi ya 73.3 isiyosawazishwa. Async hununua uwezo wa kupitisha data, si usahihi.
- Ugawaji wa vitendo huficha ucheleweshaji wa kompyuta, si ucheleweshaji wa mtandao, na hufanya sera kuwa isiyojibu haraka kwa sababu imejitolea kwa vitendo 50.
AY-Robots inaweza kutoa kiotomatiki pod ya GPU ya wingu inayohudumia sera yako wakati mteja wa roboti wa ndani anawasiliana na kituo hicho, na pod hubeba kifuatiliaji cha kutofanya kazi ili ijiharibu yenyewe badala ya kutoza bili kimya kimya. Kile isichofanya ni kuondoa safari ya kwenda na kurudi ya intaneti ya umma. Kitanzi cha udhibiti katika sera tano hapa ni kati ya 20 hadi 485 ms kwa kila hatua ya kitendo kabla ya mtandao wowote, kwa hivyo utabiri wa mbali unafaa kwa kazi za polepole za kuchukua na kuweka, si kwa mwendo wa haraka wa kuitikia.

Kurekebisha SmolVLA kwenye kadi moja ya mtumiaji
Njia ya mwongozo, kwenye lerobot 0.6.1, toleo la sasa la PyPI kufikia Agosti 23, 2026. Kila kitu kilicho hapa chini kinatoka kwenye nyaraka za Hugging Face lerobot SmolVLA, zilizopatikana siku hiyo hiyo; toleo lililoongozwa ni rahisi zaidi.
- 1Sakinisha lerobot na nyongeza ya smolvla
Vitegemezi vya SmolVLA ni nyongeza ya hiari, si sehemu ya usakinishaji wa msingi. Kusakinisha bila hivyo na kisha kujiuliza kwa nini aina ya sera haijulikani ni upotevu wa nusu saa wa kawaida.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Pata hifadhidata yenye vipindi vya kutosha
Nyaraka zinapendekeza takriban vipindi 50 na zinasema kuwa kazi hiyo hiyo na vipindi 25 haikutosha. AY-Robots huweka kiwango cha chini cha 30. Rekodi yako mwenyewe, au anza kutoka saraka ya hifadhidata.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Anza urekebishaji mzuri
Amri kutoka kwa mwongozo wa lerobot, bila kubadilishwa. Nyaraka zinaweka hatua 20000 kwa takriban saa 4 kwenye A100 moja. Kwenye kadi ya 24 GB, tarajia muda mrefu zaidi na upime.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Punguza ukubwa wa bechi hadi ulingane
batch_size=64 ni mfano uliorekodiwa, si ahadi kuhusu kadi yako. Nyaraka zinashauri kuanza kidogo na kuongeza huku nyakati za upakiaji zikiendelea kuwa fupi.
bashlerobot-train --help - 5Toa kituo cha ukaguzi kwenye mkono
Maktaba ile ile, amri moja. Bendera za kugawanya kwa wakati halisi zimetolewa maoni katika nyaraka na ndizo za kutumia kwenye vifaa vya nguvu ya chini.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Njia yoyote utakayochukua, utaishia na kituo cha ukaguzi pamoja na usanidi uliokizalisha. Weka marekebisho ya hifadhidata, idadi ya hatua na mbegu kando yake. lerobot huweka mbegu chaguomsingi kuwa 1000; sehemu ya kuingilia ya GR00T ya kurekebisha vizuri haionyeshi mbegu kabisa, kwa hivyo miondoko hiyo haiwezi kuzalishwa tena kidogo-kidogo. Mitambo iko katika nyaraka za mafunzo.
Njia mbili za kuweka VLA ndogo kwenye mkono
Unamiliki mashine na njia za kushindwa. Kwa SmolVLA hiyo inafaa: nyongeza moja ya pip, amri moja ya mafunzo, amri moja ya utekelezaji. Kwa TinyVLA ni uzalishaji upya wa utafiti na pini zilizoganda, njia iliyovunjika ya DeepSpeed na ubadilishaji wa data unaoandika mwenyewe.
- Pata kadi ya 24 GB, rekodi vipindi 30 hadi 50, thibitisha mitiririko ya kamera fremu kwa fremu.
- pip install -e ".[smolvla]", lerobot-train dhidi ya lerobot/smolvla_base, kisha tumikia kituo cha ukaguzi kwenye mashine ambayo mkono umeunganishwa.
- Kwa TinyVLA: mazingira tofauti ya conda, badilisha data kuwa HDF5, sajili kazi katika constants.py, rekebisha njia ya zero2.json, kata train.sh kutoka GPU nane hadi moja.
- Hakuna malipo ya kila saa mara tu kadi inapolipwa.
- Utabiri hukaa karibu na serva, ndiyo njia pekee ya kupata kitanzi cha udhibiti wa haraka.
- Unaweza kurekebisha msimbo wa sera, na TinyVLA inapatikana tu kwa njia hii.
- 4090 huondoa kila sera ya ~3 B, kwa hivyo hakuna ulinganisho wa ndani dhidi ya GR00T N1.7 au Pi0.5.
- Kusanidi mazingira ndio kazi halisi. Pini za TinyVLA pekee zinaweza kugharimu siku nzima.
- Hakuna foleni, hakuna jaribio tena, hakuna hifadhi ya kituo cha ukaguzi. Kuanzisha upya kwenye hatua ya 14000 kunamaanisha kuanza tena.
SmolVLA ni mojawapo ya sera tano hapa. Unachagua mfumo na hifadhidata katika fomu, backend hukodisha GPU kwa VRAM inayohitajika, huendesha mkufunzi na kuandika vituo vya ukaguzi kwenye hifadhi ya kitu. Hatua kwa hatua: SmolVLA kwenye SO-100, au matrix kamili kwenye ukurasa wa mafunzo.
| Kile jukwaa hutuma kwa SmolVLA | Thamani |
|---|---|
| ukubwa wa bechi | 2 |
| kiwango cha kujifunza | 1e-4 |
| hatua za juu | 20000 |
| mkusanyiko wa gradient | 8, and it does not reach the trainer |
| vifungo vya ziada katika fomu | seed, logFreq |
| kiwango cha GPU | RTX 4090 or any 24 GB card |
| umbizo la hifadhidata | LeRobot v3.0 |
| vipindi vya chini | 30 |
Kwanza, ukubwa wa bechi chaguomsingi hapa ni 2, si 64 katika mfano wa nyaraka za lerobot, na mpangilio wa mkusanyiko wa gradient unatuma lakini hauna athari kwa SmolVLA, kwa hivyo bechi halisi ni 2. Iongeze kwa makusudi badala ya kudhani chaguomsingi inalingana na chanzo. Pili, TinyVLA haiwezi kufunzwa hapa kabisa.
Uendeshaji kwenye kiwango cha 24 GB huchukua saa 2 hadi 5 kwa 0.30 hadi 0.60 USD kwa saa, takriban 1 hadi 3 USD. Kwenye kiwango cha A100 sera ya ~3 B ni saa 3 hadi 6 kwa 1.20 hadi 2.00 USD kwa saa, takriban 4 hadi 12 USD. Tazama bei, na shughuli zile zile kutoka CLI na seva ya MCP.
Wakati modeli ndogo si chaguo sahihi
Karatasi zote mbili ziko makini zaidi hapa kuliko muhtasari. Uchambuzi wa kushindwa wa TinyVLA ni maalum: lahaja ya 0.4 B ilishindwa mara tatu kwa kusoma vibaya maelekezo, jambo ambalo waandishi wanahusisha na uelewa mdogo wa lugha katika VLM ndogo, na hali hiyo ilitoweka kwenye 1.3 B. SmolVLA inaonyesha mkunjo huo huo kutoka upande mwingine: toleo la 2.25 B la usanifu unaofanana linafunga 88.75 kwenye LIBERO na 68.24 kwenye Meta-World dhidi ya 87.3 na 57.3 kwa modeli ya 0.45 B.
- Inatoshea kadi ya 24 GB, ambayo inapunguza gharama ya jaribio kutoka makumi ya dola hadi chache.
- Haraka vya kutosha kuendeshwa karibu na mkono, hivyo hakuna kuruka kwa mtandao katika kitanzi cha udhibiti.
- Inarekebisha vizuri kwenye data ambayo mtu mmoja anaweza kurekodi, vipindi kadhaa badala ya maelfu.
- Uzito wa SmolVLA, orodha ya data na msimbo ni hadharani, hivyo matokeo mabaya yanaweza kurekebishwa.
- Ufuasi dhaifu wa maelekezo: vigezo vichache vya lugha, uwezo mdogo wa kutenganisha misemo inayofanana.
- Ujumlishaji mdogo wa anga na kuona kwa mipangilio ambayo hukuirekodi.
- Nyeti zaidi kwa kasoro za seti ya data, na mafunzo ya awali kidogo ya kutegemea.
- Kazi za majukumu mengi na zenye upeo mrefu bado zinapendelea modeli kubwa, ikiwemo lahaja ya SmolVLA ya 2.25 B.
Ulinganisho unaostahili kufanywa si TinyVLA dhidi ya SmolVLA. Ni SmolVLA dhidi ya ACT kwenye kazi yako mwenyewe, na karatasi ya SmolVLA ndiyo hoja ya kwanini. Imefunzwa kazi moja bila mafunzo ya awali ya robotiki, SmolVLA ilipata wastani wa 40.0 katika kazi tatu za SO-100 ambapo ACT ya kazi moja ilipata 48.3. Kinachoipandisha hadi 78.3 ni mafunzo ya awali ya jamii pamoja na mafunzo ya majukumu mengi, si usanifu pekee. Kwenye kazi ya lego ya SO-101, zote zikiwa kazi moja, SmolVLA inashinda: 90 dhidi ya 70 katika usambazaji. Kisha SmolVLA dhidi ya Pi0.5 ikiwa bajeti inaruhusu.
Kuna mafunzo machache ya awali ya kufidia data mbaya, kwa hivyo mkondo safi wa hasara kwenye seti ya data yenye kasoro hukupa sera inayozalisha kasoro hiyo kwa ujasiri. Nyaraka za lerobot ziko wazi kuhusu muundo: vipindi 50 katika nafasi 5 za mchemraba, 10 kwa kila nafasi, vilifanya kazi; 25 havikuweza. Ikiwa hasara inaonekana sawa na mkono haufanyi chochote muhimu, anza na hasara inashuka, sera haifanyi chochote, sera inafanya kazi katika usanidi mmoja tu au kukusanya data ya mafunzo ya VLA inayoweza kutumika kweli.
Sera Tano, Jedwali Moja la Kulinganisha
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA na ACT na idadi halisi ya vigezo, muda wa kusubiri wa utambuzi kwa kila hatua ya kitendo, kiwango cha GPU kinachohitajika na idadi ya chini kabisa ya vipindi kabla haijafanya chochote muhimu.
Linganisha seraJedwali la maamuzi unaloweza kutekeleza
| Hali yako | Anza na | Kwa nini |
|---|---|---|
| Kazi moja, maonyesho mazuri, hakuna lugha | ACT | ~80 M, 20 ms, kadi ya 24 GB, hakuna modeli ya msingi ya kupakua |
| Kazi chache zinazohusiana, maelekezo moja kwa kila moja | SmolVLA | 450 M, katika lerobot, vipindi 30 chini kabisa, 1 hadi 3 USD kwa kila uendeshaji |
| Kuzalisha matokeo ya TinyVLA hasa | TinyVLA-B or TinyVLA-H | Repo ndiyo njia pekee: mazingira yaliyotengwa, data iliyobadilishwa |
| Kazi nyingi, maelekezo mbalimbali, bajeti ya A100 | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms na 485 ms kwa kila hatua, 4 hadi 12 USD kwa kila uendeshaji |
| Bado hakuna roboti | Endesha mkono halisi | Mkono halisi unaotegemea foleni hauhitaji kujisajili wala maunzi |
Kwa safu ya mwisho, mkono wa moja kwa moja huonyesha SO-100 halisi unayoweza kuendesha kutoka kwa kivinjari bila akaunti, na njia tatu za kuanza inashughulikia mengine. SO-100 ndio mkono wa rejea hapa, takriban EUR 110 hadi 150 kwa sehemu, pamoja na mwongozo kamili wa usanidi.
Nini kinachokuja baada ya mifumo ya chini ya 1 B
Kupunguza idadi ya vigezo ni njia moja ya kufanya VLA kuwa nafuu na si dhahiri kuwa ndiyo yenye kushinda. OpenVLA-OFT (arXiv 2502.19645) huweka uti wa mgongo wa 7 B na hubadilisha tu jinsi vitendo vinavyofumbuliwa, ikiripoti ongezeko la 26x katika uwezo wa kuzalisha vitendo na LIBERO ikipanda kutoka asilimia 76.5 hadi 97.1. BitVLA (arXiv 2506.07530) hufanya kila uzito wa uti wa mgongo wa 1-bit BitNet b1.58 2B4T kuwa wa tatu, ikiripoti kumbukumbu ndogo kwa 11.0x na ucheleweshaji wa chini wa 4.4x kutoka mwanzo hadi mwisho huku ikilingana na OpenVLA-OFT ya usahihi kamili. X-VLA-0.9B (arXiv 2510.10274) inakaa kwenye mstari wa 1 B na ulinganifu wa mtiririko.
Uzi wa kawaida: kidekoda cha vitendo, si mfumo wa lugha, ndipo ucheleweshaji unapoishi. Uliza jinsi sera inavyotoa vitendo kabla hujauliza ina vigezo vingapi. uwanja una mifumo 85 na matokeo 332, kila moja ikiwa imeunganishwa na chanzo chake; kuna muhtasari mpana zaidi katika utangulizi wetu wa VLA.
Je, ninaweza kurekebisha SmolVLA kwenye RTX 4090?▾
Ndio. SmolVLA ina vigezo 450 M na AY-Robots inaiendesha kwenye kiwango cha RTX 4090 / 24 GB. Mfano wa lerobot unatumia --batch_size=64, ambao ni mfano badala ya uhakika kwa kadi yako; nyaraka zinashauri kuanza kidogo na kuongeza huku muda wa upakiaji ukiendelea kuwa mfupi. Tarajia muda mrefu zaidi ya takriban saa 4 ambazo nyaraka zinataja kwa hatua 20000 kwenye A100.
Je, TinyVLA inapatikana katika lerobot au kwenye AY-Robots?▾
Hapana kwa zote mbili. TinyVLA inapatikana tu kwenye hazina yake ya utafiti, ahadi ya mwisho 11 Machi 2025, na umbizo lake ni HDF5 ya mtindo wa ACT badala ya LeRobot. AY-Robots inafunza GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA na ACT. Ikiwa unataka TinyVLA unaijenga mwenyewe, na utalazimika kurekebisha njia ya usanidi wa DeepSpeed katika scripts/train.sh kwanza.
Je, modeli ya 450 M kweli inashindana na ile ya 3 B?▾
Kwenye vigezo vya waandishi wenyewe, ndio: 87.3 dhidi ya 86.0 kwenye LIBERO dhidi ya Pi0 iliyefunzwa awali kwa robotiki kwa 3.3 B, na 78.3 dhidi ya 61.7 kwenye kazi tatu halisi za SO-100 ambapo karatasi hiyo hiyo inaweka lebo Pi0 kwa 3.5 B. Kikomo kiko kwenye karatasi hiyo hiyo: kazi moja bila mafunzo ya awali ya robotiki, SmolVLA inashuka hadi 40.0, chini ya 48.3 ya ACT.
Ninahitaji vipindi vingapi kabla VLA ndogo haijafanya chochote?▾
AY-Robots inaweka kiwango cha chini cha SmolVLA kwa vipindi 30 na kiwango cha chini cha ACT kwa 50. Nyaraka za lerobot zinapendekeza karibu 50 na zinaripoti kuwa 25 haikutosha kwa kazi hiyo hiyo. Muundo ni muhimu kama idadi: seti ya karatasi ilitumia nafasi 5 za mchemraba na vipindi 10 kila moja.
Kwa nini nambari za ucheleweshaji zilizochapishwa zinatofautiana sana?▾
Wanapima vitu tofauti. TinyVLA inaripoti 14 ms kwa utabiri wa hatua kwenye A6000; AY-Robots inaorodhesha SmolVLA kwa 245 ms na ACT kwa 20 ms kwa hatua ya kitendo. Baadhi ya takwimu zinajumuisha pasi moja ya mbele, zingine zinagawanya pasi katika kipande cha vitendo 50, na karibu hakuna hata moja inayojumuisha kunasa kamera au kuandika kwa servosi.
Je, utabiri wa wingu unasuluhisha tatizo la GPU?▾
Kwa kiasi. AY-Robots inatoa kiotomatiki podi inayohudumia sera huku mteja wa ndani akizungumza na kituo hicho, ikiwa na mlinzi asiyefanya kazi ili ijiharibu yenyewe badala ya kutoza bili kimya kimya. Haiwezi kuondoa safari ya kwenda na kurudi ya intaneti ya umma, na kitanzi cha udhibiti tayari ni 20 hadi 485 ms kwa hatua ya kitendo. Sawa kwa kuchukua na kuweka polepole, si kwa mwendo wa haraka wa kuitikia.
Sources
- TinyVLA: Kuelekea Miundo ya Haraka, Inayotumia Data kwa Ufanisi ya Maono-Lugha-Vitendo kwa Udhibiti wa Roboti
- Hazina rasmi ya msimbo wa TinyVLA (README, requirements.txt, scripts/train.sh)
- Ukurasa wa mradi wa TinyVLA
- lesjie/Llava-Pythia-1.3B, uzito wa uti wa mgongo wa TinyVLA-H
- SmolVLA: Mfumo wa Maono-Lugha-Vitendo kwa Roboti Nafuu na Zenye Ufanisi
- Nyaraka za lerobot: kurekebisha SmolVLA
- lerobot: configuration_smolvla.py, mipangilio chaguomsingi ya SmolVLA
- Kadi ya modeli ya lerobot/smolvla_base
- SmolVLA: Mfumo Bora wa Maono-Lugha-Vitendo (blogu ya Hugging Face)
- lerobot kwenye PyPI (0.6.1, inahitaji Python 3.12 au mpya zaidi)
- OpenVLA: Mfumo wa Maono-Lugha-Vitendo wa Chanzo Huria
- Kurekebisha Miundo ya Maono-Lugha-Vitendo: Kuboresha Kasi na Mafanikio (OpenVLA-OFT)
- BitVLA: Miundo ya Maono-Lugha-Vitendo ya biti 1 kwa Udhibiti wa Roboti
- X-VLA: Transformer Iliyochochewa kwa Laini kama Mfumo wa Maono-Lugha-Vitendo Unaoweza Kupimika wa Miili Mbalimbali
- Kadi ya modeli ya rail-berkeley/octo-small-1.5 (vigezo 27 M)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started