
SmolVLA er 450 M færibreytu VLA sem fínstillist á einu 24 GB korti. Raunverulegar lerobot 0.6.1 skipanir, raunverulegar sjálfgefnar stillingar, fallgildrurnar sem kostuðu heilan dag, og hvað keyrsla kostar.
SmolVLA á einum skjá
- •450 M færibreytur, um 100 M þeirra eru sérfræðingur í flæðissamræmingu. lerobot þjálfar aðeins þann sérfræðing og heldur VLM frosnu, þess vegna passar það á eitt kort.
- •Reiknileiðbeiningar LeRobot setja smolvla hópinn í um það bil 10 til 16 GB af hámarks VRAM við lotu 8 með AdamW. Þess vegna 24 GB.
- •Aðgangsstaðurinn er lerobot-train. Bloggfærsla SmolVLA frá júní 2025 prentar enn python lerobot/scripts/train.py, slóð sem er ekki lengur til. Allt hér fyrir neðan er lerobot 0.6.1.
- •Kósínusáætlunin er forstillt til að minnka yfir 30000 skref. lerobot 0.6.1 minnkar það niður fyrir styttri keyrslu og skráir það, en aldrei upp: venjuleg 100000 skrefa keyrsla endar á 2.5e-6 gólfinu í 70000 skref.
- •Þrjátíu þættir er lágmark AY-Robots, á 24 GB flokki sem kostar 1 til 3 USD á keyrslu á móti 4 til 12 fyrir 80 GB módelin.
Flestir sem vilja sjón-tungumál-aðgerðarlíkan á raunverulegum armi stoppa við vélbúnaðarlínuna. GR00T N1.7 og Pi0.5 eru um þrír milljarðar færibreyta hvor og vilja A100 80 GB eða H100. Ef þú átt leikjatölvu með RTX 4090, þá er það endir ferðarinnar. SmolVLA er undantekningin: 450 M færibreytur, innan LeRobot, byggt til að fínstilla á einu neytendakorti og þjóna frá örgjörva.
Handvirka leiðin fyrst: settu upp lerobot, sæktu lerobot/smolvla_base gátpunktinn, keyrðu raunverulegu skipunina, lestu keyrsluna á meðan hún gerist. Síðan pallaleiðin, og hvar hún hjálpar ekki.
Hvað SmolVLA er, í tölum sem þú getur athugað
SmolVLA er flæðisjöfnun stefna sem er fest við lítið sjónmálslíkan. Burðarásinn er SmolVLM2-500M-Video-Instruct; í greininni eru aðeins fyrstu 16 lög málslíkansins notuð, hver myndrammi er takmarkaður við 64 sjónræna tákn með pixlaflutningi í stað myndflísalagnar, og krossathygli er fléttuð saman við sjálfsathygjarlag í hverri annarri blokk. Kostnaður við ályktun var hönnunarþvingun, ekki eftiráhugsun.
| Eiginleiki | Gildi | Heimild |
|---|---|---|
| Heildarfæribreytur | about 450 M | paper |
| Aðgerðasérfræðingur | about 100 M, flow matching | paper |
| VLM burðarás | HuggingFaceTB/SmolVLM2-500M-Video-Instruct | vlm_model_name |
| VLM lög notuð | first 16 of the language model | num_vlm_layers = 16 |
| Sjónræn tákn á ramma | 64, pixel shuffle, no tiling | paper |
| Forþjálfun | 481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUs | paper |
Viðmiðin eru ástæðan fyrir því að fólk nennir að nota 450 M líkan. Á LIBERO er meðaltalið 87.3 prósent á móti 76.5 fyrir OpenVLA við 7 B og 86.0 fyrir vélfærafræði-forþjálfað Pi0 við 3.3 B; á Meta-World, 57.3 á móti 47.9. Á raunverulegum SO-100 vélbúnaði gefur fjölverkefnaþjálfun 75 prósent í að tína og setja, 90 í stöflun, 70 í flokkun, með meðaltal 78.3, þar sem ACT þjálfað á verkefni að meðaltali 48.3. Sömu raðir eru við hliðina á hverri birtri VLA í SmolVLA vettvangsfærslunni og ACT samanburði við SmolVLA.
SmolVLA er ekki betra en 3 B líkan í öllu. Eigin SO-101 tafla greinarinnar er vísbendingin: 90 prósent árangur í dreifingu, 50 prósent utan hennar, á vettvangi sem það var aldrei forþjálfað á. Það sem það heldur fram, og styður, er að á móti Pi0 þjálfast það um 40 prósent hraðar á 6 sinnum minna minni.
Af hverju 24 GB kort er rétta fyrsta keyrslan
LeRobot sendir með leiðbeiningar um stærðarútreikninga, sem er gagnlegasta síðan í geymslunni fyrir þetta. Hún flokkar stefnur eftir stærð burðarásar og gefur eitt VRAM umslag fyrir hvern hóp, mælt við lotustærð 8 með AdamW, sjálfgefna stillingu LeRobot. Ástand fínstillingarinnar eitt og sér bætir 30 til 100 prósentum við beran fram- og afturábak feril, svo þetta eru ekki tölur sem eingöngu snúa að þyngdum.
| Hópur | Stefnumál | Hámarks VRAM (lotu 8, AdamW) | Byrjenda GPU |
|---|---|---|---|
| Létt BC | act, vqbet, tdmpc | um 2 til 6 GB | RTX 3060, L4 |
| Dreifing | diffusion, multi_task_dit | um 8 til 14 GB | RTX 4070+, L4 |
| Lítil VLA | smolvla | um 10 til 16 GB | RTX 4080+, L4, A10G |
| Stór VLA | pi0, pi0_fast, pi05, xvla, wall_x | um 24 til 40 GB | A100 40 GB+ |
| Fjölhátta | groot, eo1 | um 24 til 40 GB | A100 40 GB+ |
Tíu til sextán gígabæti við lotu 8 er röksemdin: 24 GB kort passar því auk gagnahleðslunnar. AY-Robots setur SmolVLA á RTX 4090 eða hvaða 24 GB kort sem er, að lágmarki 30 þætti, LeRobot v3.0 gögn, 245 ms á aðgerðarskref. Leigt, það er 2 til 5 klukkustundir á 0.30 til 0.60 USD á klukkustund, um 1 til 3 USD fyrir fínstillingar keyrslu, á móti 4 til 12 USD á 80 GB flokki sem GR00T og Pi0.5 þurfa (verðlagningu). Misheppnuð SmolVLA keyrsla er kaffi; misheppnuð GR00T keyrsla, hádegismatur.

- Passar við vélbúnað sem þú gætir nú þegar átt: um það bil 10 til 16 GB við lotu 8.
- Sóað keyrsla kostar klukkustundir og fáeina dollara, svo þú hefur efni á að hafa rangt fyrir þér varðandi gagnasafnið.
- Forþjálfað á samfélagsgagnasöfnum sem deilt er undir lerobot merkinu, með raunverulegum SO-100 og SO-101 niðurstöðum.
- Það býr í lerobot sjálfu: engin söluaðila geymsla, og smolvla_base er ekki lokað.
- 450 M er enn 450 M: árangur utan dreifingar lækkar úr 90 í 50 prósent í SO-101 töflu greinarinnar.
- Það vill LeRobot v3.0 gögn; v2.1 upptöku þarf að breyta (gagnasafn hafnað v3).
- 245 ms á aðgerðarskref er fær stjórnandi fyrir val og staðsetningu, ekki viðbragðsfljótur.
- Dæmið í skjölunum keyrir lotu 64 á A100; á 24 GB skiptir þú lotu fyrir rauntíma.
Skref 0: gagnasafnið ræður keyrslunni, ekki fánarnir
Ekkert hér fyrir neðan skiptir máli ef upptakan er slæm. LeRobot SmolVLA síðan er hreinskilin: viðmiðunargagnasafnið var 50 þættir yfir 5 teningastöður, 10 á stöðu, og sama verkefnið með 25 þáttum gekk illa. Endurtekning á hverri afbrigði alhæfir, hrá þáttafjöldi gerir það ekki. Aldrei tekið upp einn? Byrjaðu á taka upp fyrsta gagnasafnið þitt með skjáborðsforritinu, sem skrifar LeRobot snið úr fjarstýringu lotu, eða fáðu lánað eitt úr gagnasafnaskránni.
- Að minnsta kosti 30 þættir á AY-Robots, um 50 fyrir LeRobot viðmiðunaruppskriftina.
- Sérhver afbrigði sem þú býst við við útfærslu, endurtekin nokkrum sinnum.
- Einn verkefnisstrengur, stafsettur eins við upptöku og útfærslu. Líkanið er skilyrt á þeim texta.
- Fastar myndavélar. Myndavél sem færðist á milli upptöku og útfærslu er algengasta ástæðan fyrir því að hrein tapferill gefur hreyfingarlausan arm.
- Afbrigði sem þú hefur aldrei þjálfað á, svo þú hafir eitthvað heiðarlegt til að prófa gegn.
SmolVLA, Pi0.5 og ACT vilja LeRobot v3.0. GR00T N1.7 og N1.5 vilja v2.0 eða v2.1 og hleðslutæki þeirra hrynur á v3.0. Taktu upp einu sinni, ætlaðu að bera saman líkön síðar, og þú munt umbreyta á annan hvorn veginn: dataset rejected v3.
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_placeMeira um þetta í hvernig á að safna hágæða VLA þjálfunargögnum. Stutta útgáfan: 30 til 50 hreinir þættir af einu verkefni með vísvitandi afbrigðum slá 200 óvandaða þætti af þremur, með mun sem enginn ofurbreyta lokar.
Setja upp lerobot 0.6.1
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot
# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge
# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'
# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-infoGrunn lerobot uppsetningin er létt og heldur þungum ósjálfstæðum bak við aukapakka: smolvla bætir við transformers, num2words og accelerate, training gagnasafnsstaflanum og wandb, core_scripts vélbúnaðar- og sjónræningarfíknirnar. Á Linux ræður uppsetningarslóðin einnig CUDA hjólinu þínu: PyPI sjálfgefið er cu130 hjól með lágmarksrekil 580.65, svo á eldri rekli skaltu setja upp torch frá cu128 vísitölunni fyrst, síðan lerobot.
--policy.path=lerobot/smolvla_base hleður forþjálfuðu 450 M geymslupunkti og fínstillir hann. --policy.type=smolvla byggir nýjan SmolVLA, og sjálfgefin stilling load_vlm_weights = False þýðir að það sækir ekki einu sinni SmolVLM2 burðarásarþyngdirnar nema þú biðjir um það. Ef þú gerir mistök þá þjálfast keyrslan glaðlega, kostar það sama og lærir ekkert sem hægt er að flytja.
Þjálfunarferlið, skipun fyrir skipun
- 1Auðkenna sig gegn Hub
Grunnáfanginn kemur frá Hub, og gagnasafnið þitt líklega líka.
bashhf auth login - 2Lestu valkostina einu sinni
Hver reitur í pípunni og stefnustillingunni er fáni. Skimmaðu yfir hann áður en þú kafar í frumkóðann.
bashlerobot-train --help - 3Byrja fínstillingu
Dæmið í skjölunum keyrir lotu 64 á einni A100; eigin A100 40 GB akkeri í útreikningsleiðbeiningunum er lota 16, og 8 er jafngildi 24 GB. Enginn tímaáætlunarfáni hér viljandi, sjá hér að neðan.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/so100_pick_place \ --batch_size=8 \ --steps=20000 \ --save_freq=2000 \ --log_freq=200 \ --seed=1000 \ --output_dir=outputs/train/smolvla_pick_place \ --job_name=smolvla_pick_place \ --policy.device=cuda \ --wandb.enable=true - 4Lestu log línuna, ekki bara tapið
Á hverjum --log_freq skrefum prentar lerobot tap, grdn, lr, updt_s, data_s, smp/s og, á CUDA, mem_gb. mem_gb segir til um hvort lotan passi, lr hvort tímaáætlunin sé að minnka, og data_s sem nálgast updt_s þýðir að gagnahleðslumaðurinn er flöskuhálsinn, ekki GPU.
bash# if data_s creeps toward updt_s lerobot-train ... --num_workers=8 - 5Safnaðu áföngum sem þú getur borið saman
save_freq er sjálfgefið 20000, svo 20000 skrefa keyrsla skilur eftir einn áfanga og ekkert til að bera hann saman við. Stilltu 2000. Til að ýta á Hub þarf --policy.repo_id.
bash--save_freq=2000 \ --policy.repo_id=${HF_USER}/smolvla_pick_place \ --save_checkpoint_to_hub=true - 6Halda áfram ef vélin deyr
Beindu --config_path á train_config.json við hliðina á áfanganum. lerobot neitar að byrja í núverandi output_dir nema þú sért að halda áfram, svo þú getur ekki óvart skrifað yfir keyrslu.
bashlerobot-train \ --config_path=<path to the saved train_config.json> \ --resume=true
Fánarnir sem raunverulega breyta niðurstöðunni
| Fáni | Hvað hann gerir | Á 24 GB |
|---|---|---|
| --batch_size | Sýni á hvert skref, nokkurn veginn línulegt í VRAM | 4 to 8 |
| --steps | Heildar fínstillingarskref | 20000 first pass |
| --policy.scheduler_decay_steps | Kósínus rotnunarlengd, forstillt 30000 | Bítur aðeins yfir 30000 |
| --policy.use_amp | Blönduð nákvæmni; SmolVLA hefur engan dtype reit | true þegar minni er takmarkað |
| --num_workers | Gagnahleðsluferlar, sjálfgefið 4 | Hækka þar til data_s hættir að hækka |
| --dataset.eval_split | Hlutfall þátta sem haldið er eftir á hvert verkefni | 0.1, with --eval_steps |
| --policy.freeze_vision_encoder | Helur sjónturninn frosinn | true on 24 GB |
| --policy.train_expert_only | Aðeins ~100 M sérfræðingurinn fær hallatölur | true first |
SmolVLA forstillir kósínus tímaáætlun: `scheduler_warmup_steps = 1000`, `scheduler_decay_steps = 30000`, `scheduler_decay_lr = 2.5e-6`. Eldri ráðleggingar segja að 20000 skrefa keyrsla stöðvist því í miðri niðurbrotinu. Í 0.6.1 gerist það ekki: `CosineDecayWithWarmupSchedulerConfig.build()` er gefið `--steps`, og undir `num_decay_steps` endurskalar það bæði, upphitun 1000 í 666 og niðurbrot 30000 í 20000, og prentar *Auto-scaling LR scheduler* á meðan. Það endurskalar aldrei upp á við: niðurbrotið er takmarkað með `min(current_step, decay_steps)`, svo sjálfgefna `--steps=100000` situr á botninum frá skrefi 30000 til enda, 70 prósent af keyrslunni. Aðeins sú langa hlið þarf enn `--policy.scheduler_decay_steps`. `lr` dálkurinn er þar sem þú athugar.
Sjálfgefnar stillingar sem þú erfir ef þú snertir ekkert
A stefna stilling í lerobot hefur sinn eigin fínstillir og tímaáætlunarforstillingu, og nema þú stillir use_policy_training_preset=false þá vinna þessar forstillingar. Helmingur spurninganna sem fólk spyr um SmolVLA þjálfun er svarað af sjálfgefnum stillingum sem það vissi ekki að væru til.
| Stilling | Sjálfgefið í lerobot 0.6.1 | Skilgreint í |
|---|---|---|
| chunk_size / n_action_steps | 50 / 50 | SmolVLAConfig |
| num_steps (flæðisjöfnun hávaðahreinsun) | 10 | SmolVLAConfig |
| optimizer_lr | 1e-4 | SmolVLAConfig |
| scheduler_warmup_steps | 1000 | SmolVLAConfig |
| scheduler_decay_steps | 30000 | SmolVLAConfig |
| scheduler_decay_lr | 2.5e-6 | SmolVLAConfig |
| frysta sjónkóðara | true | SmolVLAConfig |
| þjálfa aðeins sérfræðing | true | SmolVLAConfig |
| batch_size / skref | 8 / 100000 | TrainPipelineConfig |
| fræ / vistunartíðni / fjöldi vinnsluþráða | 1000 / 20000 / 4 | TrainPipelineConfig |
Línurnar tvær sem koma fólki á óvart eru freeze_vision_encoder og train_expert_only, báðar sannar. Upphaflega þjálfarðu um 100 M færibreytur, ekki 450 M, þess vegna passar það á 24 GB. Eigin viðmiðunarakstur LeRobot á fjögurra GPU H100 klasa snýr báðum í false; á einu 24 GB korti breytir það virkri keyrslu í minnisleysi hrun.
Ráðleggingar leiðbeiningarinnar þegar minnið er takmarkandi er að minnka hópstærðina (batch size) og nota gradient accumulation til að endurheimta virka hópinn. Það er engin gradient accumulation í lerobot 0.6.1: TrainPipelineConfig hefur ekki slíkan reit og strengurinn birtist hvergi í útgefna pakkanum. AY-Robots formið sýnir gradient accumulation gildið 8 fyrir SmolVLA og beitir því ekki heldur. Stýripinnar þínir á 24 GB eru --batch_size, sjálfgefnu frystingarnar tvær, og --policy.use_amp.
Hversu langan tíma keyrslan tekur, og hversu mörg skref eru nóg
LeRobot birtir rauntíma viðmið fyrir fimm tímabil (epochs) yfir um það bil 50 þátta gagnasafn, um 45000 ramma á 30 fps. Stærðargráðutölur, segja skjölin, en þær eru munurinn á því að búast við klukkutíma og einum degi.
| Uppsetning | Stefna | Lotustærð | Rauntími |
|---|---|---|---|
| Single L4 / A10G (24 GB) | smolvla | 4 | about 3 to 6 h |
| Single A100 40 GB | smolvla | 16 | about 1 to 2 h |
| 4 x H100 80 GB with accelerate | smolvla | 32 | about 1 to 2 h |
| Single RTX 4090 / RTX 3090 (24 GB) | act | 8 | about 30 to 60 min |
Reglan er 5 til 10 lotur (epochs) yfir gagnasafnið, ekki fastur fjöldi skrefa: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)). Á viðmiðunargagnasafninu sem skjölun bendir á, lerobot/svla_so100_pickplace, segja lýsigögnin frá 50 þáttum og 19631 ramma: lotustærð 8 gefur um 2454 skref á lotu, svo 20000 skref eru u.þ.b. 8 lotur. Helmingaðu lotustærðina og sama fjárhagsáætlun kaupir helmingi færri lotur, svo endurtaktu þetta hvenær sem þú breytir --batch_size.
Að keyra fínstilltu stefnuna aftur á arminum
lerobot-rollout \
--strategy.type=base \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.id=my_follower_arm \
--robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
--task="Grasp the cube and put it in the box." \
--policy.path=${HF_USER}/smolvla_pick_placeAuðvelt er að misskilja 245 ms á hverju aðgerðarskrefi: stefnan gefur frá sér chunk_size = 50 aðgerðir á hverri framsendingu og framkvæmir n_action_steps = 50 af þeim, svo hversu oft þú greiðir þann kostnað ræðst af þessum stillingum, ekki af því hversu oft servóin fá skipun. Það er það sem aðgerðaskipting kaupir, og hvers vegna 245 ms líkan getur stýrt 30 Hz armi. Það sem eftir er er ályktunartöf í lok bitans.
| Mæling (SmolVLA, raunverulegur SO-100) | Samstillt | Ósamstillt |
|---|---|---|
| Lokunartími, taka og setja, 10 tilraunir | 13.75 s | 9.70 s |
| Taka og setja hringrásir í föstum tímaramma | 9 | 19 |
| Árangurshlutfall að meðaltali yfir þrjú verkefni | 78.3 % | 73.3 % |
Þessi þriðja röð er það sem flestar greinar sleppa. Ósamstillt ályktun er um 30 prósent hraðari og tvöfaldar gróflega afköst í föstum tímaramma, og greinin kallar árangurshlutfallið sambærilegt, sem það er að meðaltali. Undir því féll flokkun úr 70 í 50 prósent á meðan taka og setja jókst um 5. lerobot 0.6.1 inniheldur hinn lykilinn í sömu tvíundarskrá: --inference.type=rtc skiptir útfærslunni yfir í rauntíma skiptingu, sem notkunarhluti skriftunnar sjálfrar mælir með fyrir hægu VLA-líkönin, Pi0, Pi0.5 og SmolVLA.
Stýringarlykkjan er 20 til 485 ms á hvert aðgerðarskref eftir líkaninu, og ferðir fram og til baka yfir almennt internet breyta virkri stefnu í hikandi. Fjarlæg ályktun er möguleg fyrir hæga taka og setja, ekki hraða viðbragðshreyfingu: ef verkefnið krefst skjótra leiðréttinga, þá á GPU að vera á sama staðarneti og armurinn.
Tvær leiðir að sama geymslustað
Þú átt vélina, umhverfið og kembiforritið. Eina skýþjónustuþörfin er Hub niðurhal á grunn geymslustaðnum. Rétta leiðin ef þú vilt breyta stefnunni, ef gögnin geta ekki yfirgefið netið þitt, eða ef kortið er aðgerðalaust.
- Þú stjórnar CUDA hjólinu, drifinu, ffmpeg smíðinni og gagnahleðslunni.
- Þú getur plástrað configuration_smolvla.py og endurþjálfað sama dag.
- Þú borgar í rafmagni og tíma, ekki á hverja keyrslu, og kembir TorchCodec sjálfur.
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login
lerobot-train \
--policy.path=lerobot/smolvla_base \
--dataset.repo_id=${HF_USER}/so100_pick_place \
--batch_size=8 --steps=20000 \
--save_freq=2000 --seed=1000 \
--output_dir=outputs/train/smolvla_pick_place \
--job_name=smolvla_pick_place \
--policy.device=cuda --wandb.enable=trueSama keyrsla á bak við eyðublað: þú velur líkan og gagnasafn, bakendinn leigir GPU eftir nauðsynlegu VRAM, keyrir þjálfarann og skrifar geymslustaði í hlutageymslu. Gagnasafnið getur komið frá Hugging Face repo id, opinberu skráasafni, eða vélinni þinni. Byrjaðu á SmolVLA á SO-100, eða fylkinu á þjálfunarsíðunni.
| Reitur | Sjálfgefið sem pallurinn sendir fyrir SmolVLA | Athugasemd |
|---|---|---|
| lotustærð | 2 | Íhaldssamt fyrir 24 GB flokkinn |
| námsferill | 1e-4 | Lerobot forstillingin |
| hámarks skref | 20000 | Viðmiðunarkeyrslan í LeRobot skjölunum |
| halli uppsöfnun | 8 | Sýnt í eyðublaðinu, ekki beitt |
| auka stillingar | seed, logFreq | Seed gerir keyrsluna endurtekningarhæfa |
- 2 til 5 klukkustundir á 24 GB flokknum, um 1 til 3 USD á hverja keyrslu.
- Sömu aðgerðir frá flugstöð á /cli og frá gervigreindarmiðlum á /mcp.
- Ályktunareiningar bera aðgerðalausan varðhund, svo gleymd eining eyðileggur sig í stað þess að rukka hljóðlega.
- Enginn armur ennþá? /live streymir líkamlegum SO-100 sem þú getur stýrt án þess að skrá þig.
Verkefni sem er fast í biðröð er einkenni á markaði, ekki villa: þjálfunarverkefni fast í biðröð. Skref fyrir skref: þjálfaðu fyrstu stefnuna þína og þjálfunarskjölin.
Þegar SmolVLA er röng kostur
Prófið á því hvort SmolVLA hafi verið rétta fyrsta keyrslan er ekki hvort hún virkaði, heldur hvort bilunin sagði þér eitthvað. Náið 60 eða 70 prósentum og stærra líkan er sanngjörn næsta fjárfesting: gögnin bera merki. Náið 10 prósentum og 3 B líkan nær líklega líka 10 prósentum, sem þú lærðir bara fyrir þrjá dollara í stað tólf.

Þess virði að lesa áður en meira er eytt: Pi0.5 á móti SmolVLA fyrir meiri getu á sömu hugmynd, og GR00T N1.7 á móti SmolVLA fyrir NVIDIA leiðina, bæði 80 GB flokkur á 4 til 12 USD á keyrslu. Hin leiðin, ACT er ódýrari grunnlínan: 80 M færibreytur, 20 ms á aðgerðarskref, engin tungumálaskilyrðing. Allar fimm eru á stefnusíðunni; vettvanginum hefur 85 líkön og 332 viðmiðunarniðurstöður.

Gátlistinn áður en þú stækkar eitthvað
- Náði
lr2.5e-6 lágmarki sínu? Fyrir neðan 30000 skref endurskalast rotnunin og lerobot segir frá því við ræsingu; fyrir ofan það, stilltu--policy.scheduler_decay_stepssjálfur. - Fleiri en einn gátpunktur, og þættir haldnir utan með
--dataset.eval_splitsvo að tapmatið þýði eitthvað. - Hreyfist stefnan yfirleitt? Fallandi tap með hreyfingarlausum armi hefur sérstakar orsakir: tap fellur, stefnan gerir ekkert.
- Lifir það af umhverfisbreytingu? Ef ekki: stefnan virkar aðeins í einni uppsetningu.
- Skrifaðir þú niður fræið? lerobot notar sjálfgefið 1000, svo tvær óbreyttar keyrslur haldast sambærilegar.
- Aðeins þá: fleiri þættir, meiri fjölbreytni, eða stærra líkan. Í þeirri röð.
Fyrir hvers vegna þessi líkön eru til og hvað þau gera við tungumálsinnsláttinn, er bakgrunnurinn; keyrir samsetningu í gegnum að fyrstu keyrslu. Fyrir fullgerðan gátpunkt, ; ef armurinn birtist aldrei, .
Þjálfa SmolVLA á þínum eigin armi
Veldu líkanið og arminn og leiðbeiningin gefur þér nákvæmar sjálfgefnar stillingar, gagnasniðið og hvað keyrslan kostar. SmolVLA er á 24 GB flokki á 1 til 3 USD á hverja keyrslu.
Opnaðu þjálfunarleiðbeiningarnarGet ég virkilega fínstillt SmolVLA á RTX 4090?▾
Já. Reiknileiðbeiningar LeRobot gefa til kynna að SmolVLA noti um það bil 10 til 16 GB af hámarks VRAM við batch 8 með AdamW og telja 24 GB neytendakort henta vel fyrir það. Batch 64 í dæminu í skjölunum er parað við eitt A100. Minnið skalar nokkurn veginn línulega með batch, svo notaðu 4 eða 8 og fylgstu með mem_gb.
Hversu marga þætti þarf ég í raun?▾
AY-Robots setur lágmarkið við 30. Skjöl LeRobot mæla með um 50 og greina frá því að 25 þættir af sama verkefni hafi skilað slæmum árangri. Uppbygging er mikilvægari en fjöldi: viðmiðunarsafnið var 5 teningsstöður með 10 þáttum hver, og sú endurtekning er það sem alhæfir.
Skjölin segja batch 64, pallurinn sendir batch 2. Hvað er rétt?▾
Bæði, fyrir mismunandi vélbúnað. Dæmið í skjölunum notar batch 64 og gefur upp um 4 klukkustundir fyrir 20000 skref á einu A100; A100 40 GB viðmið reiknileiðbeininganna er batch 16. Batch 2 er það sem AY-Robots sendir á 24 GB flokknum. Staðbundið er 4 til 8 miðjan, og reikningur tímabila breytist með því.
SmolVLA eða ACT fyrir fyrstu keyrslu á SO-100?▾
ACT ef verkefnið er ein endurtekin hreyfing og þú vilt hraðasta lykkjuna: 20 ms á aðgerðarskref, 80 M færibreytur, engin tungumálaskilyrðing. SmolVLA ef þú vilt tungumálaskilyrðingu, nokkrar verkefnisstrengi í einum geymslustað, og forþjálfaðan grunn. Bæði eru á 24 GB flokknum, svo valið er verkefnið, ekki fjárhagsáætlunin.
Þarf ég að stilla --policy.scheduler_decay_steps?▾
Aðeins þegar --steps er yfir 30000. SmolVLA forstillir kósínus rotnunina við 30000 skref, og lerobot 0.6.1 minnkar hana sjálfkrafa fyrir styttri keyrslu, og skráir "Auto-scaling LR scheduler" þegar það gerist. Það stækkar aldrei, svo sjálfgefið --steps=100000 skilur síðustu 70000 skrefin eftir á 2.5e-6 gólfinu.
Sources
- SmolVLA: Sjón-Tungumál-Aðgerðarlíkan fyrir hagkvæma og skilvirka vélmennafræði
- SmolVLA: Skilvirkt sjón-tungumál-aðgerðarlíkan (Hugging Face blogg)
- lerobot/smolvla_base líkanakort
- LeRobot skjöl: SmolVLA
- LeRobot skjöl: Reiknivélbúnaðarleiðbeiningar fyrir LeRobot þjálfun
- LeRobot skjöl: Uppsetning
- LeRobot skjöl: LeRobotDataset v3.0 og v2.1 breytirinn
- LeRobot skjöl: Ósamstillt ályktun
- lerobot v0.6.1: configuration_smolvla.py
- lerobot v0.6.1: TrainPipelineConfig
- lerobot v0.6.1: CosineDecayWithWarmupSchedulerConfig
- lerobot v0.6.1: lerobot_rollout.py (aðferðir og RTC ályktun)
- lerobot v0.6.1: pyproject.toml (auka og inngangspunktar fyrir stjórnborð)
- lerobot á PyPI
- lerobot/svla_so100_pickplace gagnasafn (50 þættir, 19631 rammar, v3.0)
Sources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot/smolvla_base model card
- LeRobot docs: SmolVLA
- LeRobot docs: Compute HW Guide for LeRobot Training
- LeRobot docs: Installation
- LeRobot docs: LeRobotDataset v3.0 and the v2.1 converter
- LeRobot docs: Asynchronous Inference
- lerobot v0.6.1: configuration_smolvla.py
- lerobot v0.6.1: TrainPipelineConfig
- lerobot v0.6.1: CosineDecayWithWarmupSchedulerConfig
- lerobot v0.6.1: lerobot_rollout.py (strategies and RTC inference)
- lerobot v0.6.1: pyproject.toml (extras and console entry points)
- lerobot on PyPI
- lerobot/svla_so100_pickplace dataset (50 episodes, 19631 frames, v3.0)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started