SmolVLA líkanasíðan á AY-Robots sem sýnir fjölda færibreyta, GPU flokk, töf á ályktun á hverju aðgerðarskrefi og lágmarksfjölda þátta
SmolVLALeRobotVLA ÞjálfunFínstillingSO-100

Hvernig á að þjálfa SmolVLA á 24 GB GPU (lerobot 0.6.1)

AY-Robots ResearchAugust 23, 202617 mínútna lestur

SmolVLA er 450 M færibreytu VLA sem fínstillist á einu 24 GB korti. Raunverulegar lerobot 0.6.1 skipanir, raunverulegar sjálfgefnar stillingar, fallgildrurnar sem kostuðu heilan dag, og hvað keyrsla kostar.

SmolVLA á einum skjá

  • 450 M færibreytur, um 100 M þeirra eru sérfræðingur í flæðissamræmingu. lerobot þjálfar aðeins þann sérfræðing og heldur VLM frosnu, þess vegna passar það á eitt kort.
  • Reiknileiðbeiningar LeRobot setja smolvla hópinn í um það bil 10 til 16 GB af hámarks VRAM við lotu 8 með AdamW. Þess vegna 24 GB.
  • Aðgangsstaðurinn er lerobot-train. Bloggfærsla SmolVLA frá júní 2025 prentar enn python lerobot/scripts/train.py, slóð sem er ekki lengur til. Allt hér fyrir neðan er lerobot 0.6.1.
  • Kósínusáætlunin er forstillt til að minnka yfir 30000 skref. lerobot 0.6.1 minnkar það niður fyrir styttri keyrslu og skráir það, en aldrei upp: venjuleg 100000 skrefa keyrsla endar á 2.5e-6 gólfinu í 70000 skref.
  • Þrjátíu þættir er lágmark AY-Robots, á 24 GB flokki sem kostar 1 til 3 USD á keyrslu á móti 4 til 12 fyrir 80 GB módelin.

Flestir sem vilja sjón-tungumál-aðgerðarlíkan á raunverulegum armi stoppa við vélbúnaðarlínuna. GR00T N1.7 og Pi0.5 eru um þrír milljarðar færibreyta hvor og vilja A100 80 GB eða H100. Ef þú átt leikjatölvu með RTX 4090, þá er það endir ferðarinnar. SmolVLA er undantekningin: 450 M færibreytur, innan LeRobot, byggt til að fínstilla á einu neytendakorti og þjóna frá örgjörva.

Handvirka leiðin fyrst: settu upp lerobot, sæktu lerobot/smolvla_base gátpunktinn, keyrðu raunverulegu skipunina, lestu keyrsluna á meðan hún gerist. Síðan pallaleiðin, og hvar hún hjálpar ekki.

Hvað SmolVLA er, í tölum sem þú getur athugað

SmolVLA er flæðisjöfnun stefna sem er fest við lítið sjónmálslíkan. Burðarásinn er SmolVLM2-500M-Video-Instruct; í greininni eru aðeins fyrstu 16 lög málslíkansins notuð, hver myndrammi er takmarkaður við 64 sjónræna tákn með pixlaflutningi í stað myndflísalagnar, og krossathygli er fléttuð saman við sjálfsathygjarlag í hverri annarri blokk. Kostnaður við ályktun var hönnunarþvingun, ekki eftiráhugsun.

EiginleikiGildiHeimild
Heildarfæribreyturabout 450 Mpaper
Aðgerðasérfræðingurabout 100 M, flow matchingpaper
VLM burðarásHuggingFaceTB/SmolVLM2-500M-Video-Instructvlm_model_name
VLM lög notuðfirst 16 of the language modelnum_vlm_layers = 16
Sjónræn tákn á ramma64, pixel shuffle, no tilingpaper
Forþjálfun481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUspaper

Viðmiðin eru ástæðan fyrir því að fólk nennir að nota 450 M líkan. Á LIBERO er meðaltalið 87.3 prósent á móti 76.5 fyrir OpenVLA við 7 B og 86.0 fyrir vélfærafræði-forþjálfað Pi0 við 3.3 B; á Meta-World, 57.3 á móti 47.9. Á raunverulegum SO-100 vélbúnaði gefur fjölverkefnaþjálfun 75 prósent í að tína og setja, 90 í stöflun, 70 í flokkun, með meðaltal 78.3, þar sem ACT þjálfað á verkefni að meðaltali 48.3. Sömu raðir eru við hliðina á hverri birtri VLA í SmolVLA vettvangsfærslunni og ACT samanburði við SmolVLA.

Heiðarlega útgáfan af stærðarkröfunni

SmolVLA er ekki betra en 3 B líkan í öllu. Eigin SO-101 tafla greinarinnar er vísbendingin: 90 prósent árangur í dreifingu, 50 prósent utan hennar, á vettvangi sem það var aldrei forþjálfað á. Það sem það heldur fram, og styður, er að á móti Pi0 þjálfast það um 40 prósent hraðar á 6 sinnum minna minni.

Af hverju 24 GB kort er rétta fyrsta keyrslan

LeRobot sendir með leiðbeiningar um stærðarútreikninga, sem er gagnlegasta síðan í geymslunni fyrir þetta. Hún flokkar stefnur eftir stærð burðarásar og gefur eitt VRAM umslag fyrir hvern hóp, mælt við lotustærð 8 með AdamW, sjálfgefna stillingu LeRobot. Ástand fínstillingarinnar eitt og sér bætir 30 til 100 prósentum við beran fram- og afturábak feril, svo þetta eru ekki tölur sem eingöngu snúa að þyngdum.

HópurStefnumálHámarks VRAM (lotu 8, AdamW)Byrjenda GPU
Létt BCact, vqbet, tdmpcum 2 til 6 GBRTX 3060, L4
Dreifingdiffusion, multi_task_ditum 8 til 14 GBRTX 4070+, L4
Lítil VLAsmolvlaum 10 til 16 GBRTX 4080+, L4, A10G
Stór VLApi0, pi0_fast, pi05, xvla, wall_xum 24 til 40 GBA100 40 GB+
Fjölháttagroot, eo1um 24 til 40 GBA100 40 GB+

Tíu til sextán gígabæti við lotu 8 er röksemdin: 24 GB kort passar því auk gagnahleðslunnar. AY-Robots setur SmolVLA á RTX 4090 eða hvaða 24 GB kort sem er, að lágmarki 30 þætti, LeRobot v3.0 gögn, 245 ms á aðgerðarskref. Leigt, það er 2 til 5 klukkustundir á 0.30 til 0.60 USD á klukkustund, um 1 til 3 USD fyrir fínstillingar keyrslu, á móti 4 til 12 USD á 80 GB flokki sem GR00T og Pi0.5 þurfa (verðlagningu). Misheppnuð SmolVLA keyrsla er kaffi; misheppnuð GR00T keyrsla, hádegismatur.

AY-Robots kostnaðartafla: kort á stefnu, keyrslutími, verð á keyrslu, þættir sem þarf
SmolVLA og ACT eru á 24 GB röðinni, þrjú 3 B módelin á 80 GB röðinni.
Að byrja með SmolVLA í stað 3 B módels
Hvað þú færð
  • Passar við vélbúnað sem þú gætir nú þegar átt: um það bil 10 til 16 GB við lotu 8.
  • Sóað keyrsla kostar klukkustundir og fáeina dollara, svo þú hefur efni á að hafa rangt fyrir þér varðandi gagnasafnið.
  • Forþjálfað á samfélagsgagnasöfnum sem deilt er undir lerobot merkinu, með raunverulegum SO-100 og SO-101 niðurstöðum.
  • Það býr í lerobot sjálfu: engin söluaðila geymsla, og smolvla_base er ekki lokað.
Hvað þú gefur upp
  • 450 M er enn 450 M: árangur utan dreifingar lækkar úr 90 í 50 prósent í SO-101 töflu greinarinnar.
  • Það vill LeRobot v3.0 gögn; v2.1 upptöku þarf að breyta (gagnasafn hafnað v3).
  • 245 ms á aðgerðarskref er fær stjórnandi fyrir val og staðsetningu, ekki viðbragðsfljótur.
  • Dæmið í skjölunum keyrir lotu 64 á A100; á 24 GB skiptir þú lotu fyrir rauntíma.

Skref 0: gagnasafnið ræður keyrslunni, ekki fánarnir

Ekkert hér fyrir neðan skiptir máli ef upptakan er slæm. LeRobot SmolVLA síðan er hreinskilin: viðmiðunargagnasafnið var 50 þættir yfir 5 teningastöður, 10 á stöðu, og sama verkefnið með 25 þáttum gekk illa. Endurtekning á hverri afbrigði alhæfir, hrá þáttafjöldi gerir það ekki. Aldrei tekið upp einn? Byrjaðu á taka upp fyrsta gagnasafnið þitt með skjáborðsforritinu, sem skrifar LeRobot snið úr fjarstýringu lotu, eða fáðu lánað eitt úr gagnasafnaskránni.

  • Að minnsta kosti 30 þættir á AY-Robots, um 50 fyrir LeRobot viðmiðunaruppskriftina.
  • Sérhver afbrigði sem þú býst við við útfærslu, endurtekin nokkrum sinnum.
  • Einn verkefnisstrengur, stafsettur eins við upptöku og útfærslu. Líkanið er skilyrt á þeim texta.
  • Fastar myndavélar. Myndavél sem færðist á milli upptöku og útfærslu er algengasta ástæðan fyrir því að hrein tapferill gefur hreyfingarlausan arm.
  • Afbrigði sem þú hefur aldrei þjálfað á, svo þú hafir eitthvað heiðarlegt til að prófa gegn.
Gagnasafnsgildran sem kostar einn dag

SmolVLA, Pi0.5 og ACT vilja LeRobot v3.0. GR00T N1.7 og N1.5 vilja v2.0 eða v2.1 og hleðslutæki þeirra hrynur á v3.0. Taktu upp einu sinni, ætlaðu að bera saman líkön síðar, og þú munt umbreyta á annan hvorn veginn: dataset rejected v3.

bash
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_place
Umbreytirinn fylgir með lerobot, svo það er ekkert aukalegt til að setja upp. Það er enginn umbreytir í hina áttina í pakkanum.

Meira um þetta í hvernig á að safna hágæða VLA þjálfunargögnum. Stutta útgáfan: 30 til 50 hreinir þættir af einu verkefni með vísvitandi afbrigðum slá 200 óvandaða þætti af þremur, með mun sem enginn ofurbreyta lokar.

Setja upp lerobot 0.6.1

bash
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot

# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge

# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'

# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-info
PyPI slóðin. Til að laga þjálfarann, klónaðu geymsluna og notaðu pip install -e ".[smolvla,training]" í staðinn.

Grunn lerobot uppsetningin er létt og heldur þungum ósjálfstæðum bak við aukapakka: smolvla bætir við transformers, num2words og accelerate, training gagnasafnsstaflanum og wandb, core_scripts vélbúnaðar- og sjónræningarfíknirnar. Á Linux ræður uppsetningarslóðin einnig CUDA hjólinu þínu: PyPI sjálfgefið er cu130 hjól með lágmarksrekil 580.65, svo á eldri rekli skaltu setja upp torch frá cu128 vísitölunni fyrst, síðan lerobot.

policy.path og policy.type eru ekki sami fáninn

--policy.path=lerobot/smolvla_base hleður forþjálfuðu 450 M geymslupunkti og fínstillir hann. --policy.type=smolvla byggir nýjan SmolVLA, og sjálfgefin stilling load_vlm_weights = False þýðir að það sækir ekki einu sinni SmolVLM2 burðarásarþyngdirnar nema þú biðjir um það. Ef þú gerir mistök þá þjálfast keyrslan glaðlega, kostar það sama og lærir ekkert sem hægt er að flytja.

Þjálfunarferlið, skipun fyrir skipun

  1. 1
    Auðkenna sig gegn Hub

    Grunnáfanginn kemur frá Hub, og gagnasafnið þitt líklega líka.

    bash
    hf auth login
  2. 2
    Lestu valkostina einu sinni

    Hver reitur í pípunni og stefnustillingunni er fáni. Skimmaðu yfir hann áður en þú kafar í frumkóðann.

    bash
    lerobot-train --help
  3. 3
    Byrja fínstillingu

    Dæmið í skjölunum keyrir lotu 64 á einni A100; eigin A100 40 GB akkeri í útreikningsleiðbeiningunum er lota 16, og 8 er jafngildi 24 GB. Enginn tímaáætlunarfáni hér viljandi, sjá hér að neðan.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/so100_pick_place \
      --batch_size=8 \
      --steps=20000 \
      --save_freq=2000 \
      --log_freq=200 \
      --seed=1000 \
      --output_dir=outputs/train/smolvla_pick_place \
      --job_name=smolvla_pick_place \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Lestu log línuna, ekki bara tapið

    Á hverjum --log_freq skrefum prentar lerobot tap, grdn, lr, updt_s, data_s, smp/s og, á CUDA, mem_gb. mem_gb segir til um hvort lotan passi, lr hvort tímaáætlunin sé að minnka, og data_s sem nálgast updt_s þýðir að gagnahleðslumaðurinn er flöskuhálsinn, ekki GPU.

    bash
    # if data_s creeps toward updt_s
    lerobot-train ... --num_workers=8
  5. 5
    Safnaðu áföngum sem þú getur borið saman

    save_freq er sjálfgefið 20000, svo 20000 skrefa keyrsla skilur eftir einn áfanga og ekkert til að bera hann saman við. Stilltu 2000. Til að ýta á Hub þarf --policy.repo_id.

    bash
    --save_freq=2000 \
    --policy.repo_id=${HF_USER}/smolvla_pick_place \
    --save_checkpoint_to_hub=true
  6. 6
    Halda áfram ef vélin deyr

    Beindu --config_path á train_config.json við hliðina á áfanganum. lerobot neitar að byrja í núverandi output_dir nema þú sért að halda áfram, svo þú getur ekki óvart skrifað yfir keyrslu.

    bash
    lerobot-train \
      --config_path=<path to the saved train_config.json> \
      --resume=true

Fánarnir sem raunverulega breyta niðurstöðunni

FániHvað hann gerirÁ 24 GB
--batch_sizeSýni á hvert skref, nokkurn veginn línulegt í VRAM4 to 8
--stepsHeildar fínstillingarskref20000 first pass
--policy.scheduler_decay_stepsKósínus rotnunarlengd, forstillt 30000Bítur aðeins yfir 30000
--policy.use_ampBlönduð nákvæmni; SmolVLA hefur engan dtype reittrue þegar minni er takmarkað
--num_workersGagnahleðsluferlar, sjálfgefið 4Hækka þar til data_s hættir að hækka
--dataset.eval_splitHlutfall þátta sem haldið er eftir á hvert verkefni0.1, with --eval_steps
--policy.freeze_vision_encoderHelur sjónturninn frosinntrue on 24 GB
--policy.train_expert_onlyAðeins ~100 M sérfræðingurinn fær hallatölurtrue first
Tímaáætlunin: hvað 0.6.1 ræður við og hvað ekki

SmolVLA forstillir kósínus tímaáætlun: `scheduler_warmup_steps = 1000`, `scheduler_decay_steps = 30000`, `scheduler_decay_lr = 2.5e-6`. Eldri ráðleggingar segja að 20000 skrefa keyrsla stöðvist því í miðri niðurbrotinu. Í 0.6.1 gerist það ekki: `CosineDecayWithWarmupSchedulerConfig.build()` er gefið `--steps`, og undir `num_decay_steps` endurskalar það bæði, upphitun 1000 í 666 og niðurbrot 30000 í 20000, og prentar *Auto-scaling LR scheduler* á meðan. Það endurskalar aldrei upp á við: niðurbrotið er takmarkað með `min(current_step, decay_steps)`, svo sjálfgefna `--steps=100000` situr á botninum frá skrefi 30000 til enda, 70 prósent af keyrslunni. Aðeins sú langa hlið þarf enn `--policy.scheduler_decay_steps`. `lr` dálkurinn er þar sem þú athugar.

Sjálfgefnar stillingar sem þú erfir ef þú snertir ekkert

A stefna stilling í lerobot hefur sinn eigin fínstillir og tímaáætlunarforstillingu, og nema þú stillir use_policy_training_preset=false þá vinna þessar forstillingar. Helmingur spurninganna sem fólk spyr um SmolVLA þjálfun er svarað af sjálfgefnum stillingum sem það vissi ekki að væru til.

StillingSjálfgefið í lerobot 0.6.1Skilgreint í
chunk_size / n_action_steps50 / 50SmolVLAConfig
num_steps (flæðisjöfnun hávaðahreinsun)10SmolVLAConfig
optimizer_lr1e-4SmolVLAConfig
scheduler_warmup_steps1000SmolVLAConfig
scheduler_decay_steps30000SmolVLAConfig
scheduler_decay_lr2.5e-6SmolVLAConfig
frysta sjónkóðaratrueSmolVLAConfig
þjálfa aðeins sérfræðingtrueSmolVLAConfig
batch_size / skref8 / 100000TrainPipelineConfig
fræ / vistunartíðni / fjöldi vinnsluþráða1000 / 20000 / 4TrainPipelineConfig

Línurnar tvær sem koma fólki á óvart eru freeze_vision_encoder og train_expert_only, báðar sannar. Upphaflega þjálfarðu um 100 M færibreytur, ekki 450 M, þess vegna passar það á 24 GB. Eigin viðmiðunarakstur LeRobot á fjögurra GPU H100 klasa snýr báðum í false; á einu 24 GB korti breytir það virkri keyrslu í minnisleysi hrun.

Minnishnappurinn sem er ekki til staðar

Ráðleggingar leiðbeiningarinnar þegar minnið er takmarkandi er að minnka hópstærðina (batch size) og nota gradient accumulation til að endurheimta virka hópinn. Það er engin gradient accumulation í lerobot 0.6.1: TrainPipelineConfig hefur ekki slíkan reit og strengurinn birtist hvergi í útgefna pakkanum. AY-Robots formið sýnir gradient accumulation gildið 8 fyrir SmolVLA og beitir því ekki heldur. Stýripinnar þínir á 24 GB eru --batch_size, sjálfgefnu frystingarnar tvær, og --policy.use_amp.

Hversu langan tíma keyrslan tekur, og hversu mörg skref eru nóg

LeRobot birtir rauntíma viðmið fyrir fimm tímabil (epochs) yfir um það bil 50 þátta gagnasafn, um 45000 ramma á 30 fps. Stærðargráðutölur, segja skjölin, en þær eru munurinn á því að búast við klukkutíma og einum degi.

UppsetningStefnaLotustærðRauntími
Single L4 / A10G (24 GB)smolvla4about 3 to 6 h
Single A100 40 GBsmolvla16about 1 to 2 h
4 x H100 80 GB with acceleratesmolvla32about 1 to 2 h
Single RTX 4090 / RTX 3090 (24 GB)act8about 30 to 60 min
Gerðu lotuútreikningana áður en þú velur --steps

Reglan er 5 til 10 lotur (epochs) yfir gagnasafnið, ekki fastur fjöldi skrefa: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)). Á viðmiðunargagnasafninu sem skjölun bendir á, lerobot/svla_so100_pickplace, segja lýsigögnin frá 50 þáttum og 19631 ramma: lotustærð 8 gefur um 2454 skref á lotu, svo 20000 skref eru u.þ.b. 8 lotur. Helmingaðu lotustærðina og sama fjárhagsáætlun kaupir helmingi færri lotur, svo endurtaktu þetta hvenær sem þú breytir --batch_size.

Að keyra fínstilltu stefnuna aftur á arminum

bash
lerobot-rollout \
  --strategy.type=base \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.id=my_follower_arm \
  --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
  --task="Grasp the cube and put it in the box." \
  --policy.path=${HF_USER}/smolvla_pick_place
Verkefnisstrengurinn verður að passa við þann sem þú tókst upp með. Líkanið er skilyrt á þeim texta, svo umorðun er önnur leiðbeining.

Auðvelt er að misskilja 245 ms á hverju aðgerðarskrefi: stefnan gefur frá sér chunk_size = 50 aðgerðir á hverri framsendingu og framkvæmir n_action_steps = 50 af þeim, svo hversu oft þú greiðir þann kostnað ræðst af þessum stillingum, ekki af því hversu oft servóin fá skipun. Það er það sem aðgerðaskipting kaupir, og hvers vegna 245 ms líkan getur stýrt 30 Hz armi. Það sem eftir er er ályktunartöf í lok bitans.

Mæling (SmolVLA, raunverulegur SO-100)SamstilltÓsamstillt
Lokunartími, taka og setja, 10 tilraunir13.75 s9.70 s
Taka og setja hringrásir í föstum tímaramma919
Árangurshlutfall að meðaltali yfir þrjú verkefni78.3 %73.3 %

Þessi þriðja röð er það sem flestar greinar sleppa. Ósamstillt ályktun er um 30 prósent hraðari og tvöfaldar gróflega afköst í föstum tímaramma, og greinin kallar árangurshlutfallið sambærilegt, sem það er að meðaltali. Undir því féll flokkun úr 70 í 50 prósent á meðan taka og setja jókst um 5. lerobot 0.6.1 inniheldur hinn lykilinn í sömu tvíundarskrá: --inference.type=rtc skiptir útfærslunni yfir í rauntíma skiptingu, sem notkunarhluti skriftunnar sjálfrar mælir með fyrir hægu VLA-líkönin, Pi0, Pi0.5 og SmolVLA.

Ályktun verður að vera við hliðina á servóunum

Stýringarlykkjan er 20 til 485 ms á hvert aðgerðarskref eftir líkaninu, og ferðir fram og til baka yfir almennt internet breyta virkri stefnu í hikandi. Fjarlæg ályktun er möguleg fyrir hæga taka og setja, ekki hraða viðbragðshreyfingu: ef verkefnið krefst skjótra leiðréttinga, þá á GPU að vera á sama staðarneti og armurinn.

7.4 V, ekki 12 V

Þetta er ekki beint um þjálfunarferli, en það stöðvar fleiri SO-100 verkefni en nokkur ofurfæribreyta. Feetech STS3215 servóin í SO-100 og SO-101 ganga á 7.4 V; 12 V eyðileggur þau. LeKiwi blandar 7.4 V armi við 12 V grunn, sem er hvernig röng tunnutengi finnur ranga innstungu.

Tvær leiðir að sama geymslustað

Þú átt vélina, umhverfið og kembiforritið. Eina skýþjónustuþörfin er Hub niðurhal á grunn geymslustaðnum. Rétta leiðin ef þú vilt breyta stefnunni, ef gögnin geta ekki yfirgefið netið þitt, eða ef kortið er aðgerðalaust.

  • Þú stjórnar CUDA hjólinu, drifinu, ffmpeg smíðinni og gagnahleðslunni.
  • Þú getur plástrað configuration_smolvla.py og endurþjálfað sama dag.
  • Þú borgar í rafmagni og tíma, ekki á hverja keyrslu, og kembir TorchCodec sjálfur.
bash
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login

lerobot-train \
  --policy.path=lerobot/smolvla_base \
  --dataset.repo_id=${HF_USER}/so100_pick_place \
  --batch_size=8 --steps=20000 \
  --save_freq=2000 --seed=1000 \
  --output_dir=outputs/train/smolvla_pick_place \
  --job_name=smolvla_pick_place \
  --policy.device=cuda --wandb.enable=true
Öll handvirka leiðin í einum blokk, lerobot 0.6.1.

Þegar SmolVLA er röng kostur

Prófið á því hvort SmolVLA hafi verið rétta fyrsta keyrslan er ekki hvort hún virkaði, heldur hvort bilunin sagði þér eitthvað. Náið 60 eða 70 prósentum og stærra líkan er sanngjörn næsta fjárfesting: gögnin bera merki. Náið 10 prósentum og 3 B líkan nær líklega líka 10 prósentum, sem þú lærðir bara fyrir þrjá dollara í stað tólf.

AY-Robots þjálfunarfylkið: fimm stefnur sem raðir, fjórir vélmennaarmar sem dálkar
Hver reitur er sinn eigin leiðarvísir. SmolVLA hefur einn fyrir hvern af fjórum örmum.

Þess virði að lesa áður en meira er eytt: Pi0.5 á móti SmolVLA fyrir meiri getu á sömu hugmynd, og GR00T N1.7 á móti SmolVLA fyrir NVIDIA leiðina, bæði 80 GB flokkur á 4 til 12 USD á keyrslu. Hin leiðin, ACT er ódýrari grunnlínan: 80 M færibreytur, 20 ms á aðgerðarskref, engin tungumálaskilyrðing. Allar fimm eru á stefnusíðunni; vettvanginum hefur 85 líkön og 332 viðmiðunarniðurstöður.

AY-Robots stefnusamanburður: færibreytur, GPU flokkur, leynd, lágmarksþættir
Tölurnar fjórar sem ráða keyrslu.

Gátlistinn áður en þú stækkar eitthvað

  1. Náði lr 2.5e-6 lágmarki sínu? Fyrir neðan 30000 skref endurskalast rotnunin og lerobot segir frá því við ræsingu; fyrir ofan það, stilltu --policy.scheduler_decay_steps sjálfur.
  2. Fleiri en einn gátpunktur, og þættir haldnir utan með --dataset.eval_split svo að tapmatið þýði eitthvað.
  3. Hreyfist stefnan yfirleitt? Fallandi tap með hreyfingarlausum armi hefur sérstakar orsakir: tap fellur, stefnan gerir ekkert.
  4. Lifir það af umhverfisbreytingu? Ef ekki: stefnan virkar aðeins í einni uppsetningu.
  5. Skrifaðir þú niður fræið? lerobot notar sjálfgefið 1000, svo tvær óbreyttar keyrslur haldast sambærilegar.
  6. Aðeins þá: fleiri þættir, meiri fjölbreytni, eða stærra líkan. Í þeirri röð.

Fyrir hvers vegna þessi líkön eru til og hvað þau gera við tungumálsinnsláttinn, er bakgrunnurinn; keyrir samsetningu í gegnum að fyrstu keyrslu. Fyrir fullgerðan gátpunkt, ; ef armurinn birtist aldrei, .

Þjálfa SmolVLA á þínum eigin armi

Veldu líkanið og arminn og leiðbeiningin gefur þér nákvæmar sjálfgefnar stillingar, gagnasniðið og hvað keyrslan kostar. SmolVLA er á 24 GB flokki á 1 til 3 USD á hverja keyrslu.

Opnaðu þjálfunarleiðbeiningarnar
Get ég virkilega fínstillt SmolVLA á RTX 4090?

Já. Reiknileiðbeiningar LeRobot gefa til kynna að SmolVLA noti um það bil 10 til 16 GB af hámarks VRAM við batch 8 með AdamW og telja 24 GB neytendakort henta vel fyrir það. Batch 64 í dæminu í skjölunum er parað við eitt A100. Minnið skalar nokkurn veginn línulega með batch, svo notaðu 4 eða 8 og fylgstu með mem_gb.

Hversu marga þætti þarf ég í raun?

AY-Robots setur lágmarkið við 30. Skjöl LeRobot mæla með um 50 og greina frá því að 25 þættir af sama verkefni hafi skilað slæmum árangri. Uppbygging er mikilvægari en fjöldi: viðmiðunarsafnið var 5 teningsstöður með 10 þáttum hver, og sú endurtekning er það sem alhæfir.

Skjölin segja batch 64, pallurinn sendir batch 2. Hvað er rétt?

Bæði, fyrir mismunandi vélbúnað. Dæmið í skjölunum notar batch 64 og gefur upp um 4 klukkustundir fyrir 20000 skref á einu A100; A100 40 GB viðmið reiknileiðbeininganna er batch 16. Batch 2 er það sem AY-Robots sendir á 24 GB flokknum. Staðbundið er 4 til 8 miðjan, og reikningur tímabila breytist með því.

SmolVLA eða ACT fyrir fyrstu keyrslu á SO-100?

ACT ef verkefnið er ein endurtekin hreyfing og þú vilt hraðasta lykkjuna: 20 ms á aðgerðarskref, 80 M færibreytur, engin tungumálaskilyrðing. SmolVLA ef þú vilt tungumálaskilyrðingu, nokkrar verkefnisstrengi í einum geymslustað, og forþjálfaðan grunn. Bæði eru á 24 GB flokknum, svo valið er verkefnið, ekki fjárhagsáætlunin.

Þarf ég að stilla --policy.scheduler_decay_steps?

Aðeins þegar --steps er yfir 30000. SmolVLA forstillir kósínus rotnunina við 30000 skref, og lerobot 0.6.1 minnkar hana sjálfkrafa fyrir styttri keyrslu, og skráir "Auto-scaling LR scheduler" þegar það gerist. Það stækkar aldrei, svo sjálfgefið --steps=100000 skilur síðustu 70000 skrefin eftir á 2.5e-6 gólfinu.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started