SmolVLA mudeli leht AY-Robotsis, näidates parameetrite arvu, GPU taset, järelduse latentsust tegevussammu kohta ja minimaalset episoodide arvu
SmolVLALeRobotVLA treeningPeenhäälestusSO-100

Kuidas treenida SmolVLA-d 24 GB GPU-l (lerobot 0.6.1)

AY-Robots ResearchAugust 23, 202617 min lugemist

SmolVLA on 450 miljoni parameetriga VLA, mida saab peenhäälestada ühel 24 GB kaardil. Tõelised lerobot 0.6.1 käsud, tegelikud vaikesätted, lõksud, mis maksid päeva, ja mida üks käitus maksab.

SmolVLA ühel ekraanil

  • 450 miljonit parameetrit, umbes 100 miljonit neist on voolu sobitamise tegevusekspert. lerobot treenib ainult seda eksperti ja hoiab VLM-i külmutatuna, mistõttu see mahub ühele kaardile.
  • LeRoboti arvutusjuhend paigutab smolvla grupi ligikaudu 10 kuni 16 GB tippu VRAM-i juurde partii 8 korral AdamW-ga. Seega 24 GB.
  • Sisendpunkt on lerobot-train. Juuni 2025 SmolVLA blogipostitus prindib endiselt python lerobot/scripts/train.py, tee, mida enam ei eksisteeri. Kõik allpool on lerobot 0.6.1.
  • Koosinusskeem on eelseadistatud lagunema 30000 sammu jooksul. lerobot 0.6.1 skaleerib seda lühema käitamise jaoks allapoole ja logib selle, kuid mitte kunagi ülespoole: standardne 100000 sammu käitus lõpeb 2.5e-6 piiril 70000 sammu jooksul.
  • Kolmkümmend episoodi on AY-Robotsi miinimum, 24 GB tasemel, mis maksab 1 kuni 3 USD käituse kohta võrreldes 4 kuni 12-ga 80 GB mudelite puhul.

Enamik inimesi, kes soovivad nägemiskeele tegevusmudelit reaalsel robotkäel, peatuvad riistvara piiril. GR00T N1.7 ja Pi0.5 on kumbki umbes kolm miljardit parameetrit ja vajavad A100 80 GB või H100. Kui teil on mänguarvuti RTX 4090-ga, on see tee lõpp. SmolVLA on erand: 450 miljonit parameetrit, LeRoboti sees, ehitatud peenhäälestamiseks ühel tarbijakaardil ja teenindamiseks CPU-lt.

Käsitsi tee esmalt: installige lerobot, tõmmake lerobot/smolvla_base kontrollpunkt, käivitage tegelik käsk, lugege käitust selle toimumise ajal. Seejärel platvormi tee ja kus see ei aita.

Mis on SmolVLA, numbrites, mida saate kontrollida

SmolVLA on voolu sobitamise poliitika, mis on kinnitatud väikesele visuaalsele keelemudelile. Selle selgroog on SmolVLM2-500M-Video-Instruct; artiklis säilitatakse ainult selle keelemudeli esimesed 16 kihti, piiratakse iga kaamera kaadrit 64 visuaalse märgiga pikslite segamise abil piltide plaatideks ja põimitakse risttähelepanu isetähelepanu kihiga igas teises plokis. Järelduste tegemise maksumus oli disainipiirang, mitte tagantjärele mõeldud asi.

OmadusVäärtusAllikas
Parameetrite koguarvabout 450 Mpaper
Tegevusekspertabout 100 M, flow matchingpaper
VLM-i selgroogHuggingFaceTB/SmolVLM2-500M-Video-Instructvlm_model_name
Kasutatud VLM-i kihidfirst 16 of the language modelnum_vlm_layers = 16
Visuaalsed märgid kaadri kohta64, pixel shuffle, no tilingpaper
Eeltreening481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUspaper

Võrdlusnäitajad on põhjuseks, miks inimesed 450 M mudeliga vaeva näevad. LIBERO-s on selle keskmine 87,3 protsenti võrreldes OpenVLA 7 B mudeli 76,5-ga ja robootika-eeltreeninguga Pi0 3,3 B mudeli 86,0-ga; Meta-Worldis 57,3 võrreldes 47,9-ga. Reaalsel SO-100 riistvaral annab mitme ülesande treening 75 protsenti valimisel ja paigutamisel, 90 virnastamisel, 70 sorteerimisel, keskmiselt 78,3, kus ACT ülesande kohta treenitud mudeli keskmine oli 48,3. Samad read on iga avaldatud VLA kõrval SmolVLA areeni kirjes ja ACT vs SmolVLA võrdluses.

Suuruse väite aus versioon

SmolVLA ei ole kõiges parem kui 3 B mudel. Artiklis esitatud SO-101 tabel on ilmekas: 90 protsenti edu jaotuses, 50 protsenti väljaspool seda, platvormil, millel seda kunagi ei eeltreenitud. Mida see väidab ja toetab, on see, et võrreldes Pi0-ga treenib see umbes 40 protsenti kiiremini ja 6 korda vähem mälu kasutades.

Miks 24 GB kaart on õige valik esimeseks käivituseks

LeRobot tarnib arvutusvõimsuse suuruse juhendi, mis on selleks hoidla kõige kasulikum lehekülg. See rühmitab poliitikad selgroo suuruse järgi ja annab igale rühmale ühe VRAM-i ümbriku, mõõdetuna pakisuurusega 8 koos AdamW-ga, mis on leroboti vaikeseade. Optimeerija olek üksi lisab 30 kuni 100 protsenti üle palja edasi- ja tagasipöörde, seega ei ole need ainult kaalude arvud.

RühmPoliitikadMaksimaalne VRAM (pakisuurus 8, AdamW)Alustamiseks sobivad GPU-d
Light BCact, vqbet, tdmpcumbes 2 kuni 6 GBRTX 3060, L4
Diffusiondiffusion, multi_task_ditumbes 8 kuni 14 GBRTX 4070+, L4
Small VLAsmolvlaumbes 10 kuni 16 GBRTX 4080+, L4, A10G
Large VLApi0, pi0_fast, pi05, xvla, wall_xumbes 24 kuni 40 GBA100 40 GB+
Multimodalgroot, eo1umbes 24 kuni 40 GBA100 40 GB+

Kümme kuni kuusteist gigabaiti pakisuurusega 8 on argument: 24 GB kaart mahutab selle pluss andmelaadija. AY-Robots paigutab SmolVLA RTX 4090-le või mis tahes 24 GB kaardile, minimaalselt 30 episoodi, LeRobot v3.0 andmeid, 245 ms tegevussammu kohta. Rendituna on see 2 kuni 5 tundi hinnaga 0.30 kuni 0.60 USD tunnis, umbes 1 kuni 3 USD peenhäälestuse käivituse kohta, võrreldes 4 kuni 12 USD-ga 80 GB tasemel, mida GR00T ja Pi0.5 vajavad (hinnakiri). Ebaõnnestunud SmolVLA käivitus on kohv; ebaõnnestunud GR00T käivitus, lõunasöök.

AY-Robots kulutabel: kaart poliitika kohta, käitusaeg, hind käituse kohta, vajalikud episoodid
SmolVLA ja ACT asuvad 24 GB real, kolm 3 B mudelit 80 GB real.
Alustamine SmolVLA-ga 3 B mudeli asemel
Mida saate
  • Sobib riistvarale, mis teil võib juba olla: umbes 10 kuni 16 GB pakiga 8.
  • Rikutud käitus maksab tunde ja ühe-kohalisi dollareid, nii et võite endale lubada andmestiku osas eksimist.
  • Eelnevalt treenitud kogukonna andmestikel, mis on jagatud lerobot sildi all, reaalsete SO-100 ja SO-101 tulemustega.
  • See elab lerobot'is endas: puudub müüja hoidla ja smolvla_base ei ole piiratud.
Millest loobute
  • 450 M on ikka 450 M: jaotusest väljaspool edu langeb paberi SO-101 tabelis 90-lt 50 protsendile.
  • See soovib LeRobot v3.0 andmeid; v2.1 salvestus tuleb teisendada (andmestik tagasi lükatud v3).
  • 245 ms tegevussammu kohta on pädev valimis- ja paigutamiskontroller, mitte reaktiivne.
  • Dokumentatsiooni näide käitab pakki 64 A100-l; 24 GB puhul vahetate pakki tegeliku aja vastu.

Samm 0: andmestik otsustab käituse, mitte lipud

Miski allpool olevast ei oma tähtsust, kui salvestus on halb. LeRoboti SmolVLA leht on otsekohene: võrdlusandmestik koosnes 50 episoodist üle 5 kuubiku asendi, 10 asendi kohta, ja sama ülesanne 25 episoodiga toimis halvasti. Kordus variatsiooni kohta üldistab, toor-episoodide arv mitte. Pole kunagi salvestanud? Alustage siit: salvestage oma esimene andmestik, koos töölauakliendiga, mis kirjutab LeRoboti formaadi välja teleoperatsiooni seansist, või laenake üks andmestiku kataloogist.

  • Vähemalt 30 episoodi AY-Robotsil, umbes 50 LeRoboti referentsretsepti jaoks.
  • Iga variatsioon, mida ootate juurutamisel, korratud mitu korda.
  • Üks ülesande string, kirjutatud identselt salvestamise ja juurutamise ajal. Mudel on sellele tekstile tingitud.
  • Fikseeritud kaamerad. Salvestamise ja juurutamise vahel liigutatud kaamera on kõige tavalisem põhjus, miks puhas kaokõver annab liikumatu käe.
  • Välja jäetud variatsioon, mida te pole kunagi treeninud, et teil oleks midagi ausat, mille vastu testida.
Andmestiku lõks, mis maksab päeva

SmolVLA, Pi0.5 ja ACT vajavad LeRobot v3.0. GR00T N1.7 ja N1.5 vajavad v2.0 või v2.1 ja nende laadur jookseb v3.0-l kokku. Salvestage üks kord, planeerige mudeleid hiljem võrrelda ja te teisendate ühel või teisel viisil: andmestik lükkas v3 tagasi.

bash
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_place
Konverter on leroboti sees, seega pole midagi lisaks installida. Pakendis puudub konverter teises suunas.

Rohkem sellest leiate siit: kuidas koguda kvaliteetseid VLA treeningandmeid robotmanipulatsiooniks. Lühidalt: 30 kuni 50 puhast episoodi ühest ülesandest tahtliku variatsiooniga on parem kui 200 lohakat episoodi kolmest, marginaaliga, mida ükski hüperparameeter ei sulge.

Installi lerobot 0.6.1

bash
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot

# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge

# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'

# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-info
PyPI tee. Treeneri parandamiseks klooni repositoorium ja kasuta selle asemel <code>pip install -e ".[smolvla,training]"</code>.

Baas lerobot installatsioon on õhuke ja peidab rasked sõltuvused lisapakettide taha: smolvla lisab transformerid, num2words ja accelerate, training andmestiku virna ja wandb, core_scripts riistvara ja visualiseerimise sõltuvused. Linuxis määrab installitee ka teie CUDA wheeli: PyPI vaikeseadeks on cu130 wheel draiveri miinimumversiooniga 580.65, seega vanema draiveri korral installige esmalt torch cu128 indeksist, seejärel lerobot.

policy.path ja policy.type ei ole samad lipud

--policy.path=lerobot/smolvla_base laadib eelkoolitatud 450 M kontrollpunkti ja häälestab seda. --policy.type=smolvla ehitab uue SmolVLA, ja konfiguratsiooni vaikeseade load_vlm_weights = False tähendab, et see ei tõmba isegi SmolVLM2 selgroo kaalusid, kui te seda ei palu. Kui teete vea, siis käitus treenib rõõmsalt, maksab sama palju ja ei õpi midagi ülekantavat.

Treeningu käivitamine, käsk käsu haaval

  1. 1
    Autentimine Hubi vastu

    Baaskontrollpunkt pärineb Hubist ja tõenäoliselt ka teie andmestik.

    bash
    hf auth login
  2. 2
    Lugege valikud korra läbi

    Iga torujuhtme ja poliitika konfiguratsiooni väli on lipp. Sirvige seda enne lähtekoodi süvenemist.

    bash
    lerobot-train --help
  3. 3
    Alustage peenhäälestust

    Dokumentatsiooni näide käivitab partii 64 ühel A100-l; arvutusjuhendi enda A100 40 GB ankur on partii 16 ja 8 on 24 GB ekvivalent. Siin pole meelega ajastaja lippu, vaata allpool.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/so100_pick_place \
      --batch_size=8 \
      --steps=20000 \
      --save_freq=2000 \
      --log_freq=200 \
      --seed=1000 \
      --output_dir=outputs/train/smolvla_pick_place \
      --job_name=smolvla_pick_place \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Lugege logirida, mitte ainult kaotust

    Iga --log_freq sammu järel prindib lerobot kaotuse, grdn, lr, updt_s, data_s, smp/s ja CUDA puhul mem_gb. mem_gb näitab, kas partii mahub, lr, kas ajakava väheneb, ja data_s lähenemine updt_s-le tähendab, et andmelaadija on kitsaskohaks, mitte GPU.

    bash
    # if data_s creeps toward updt_s
    lerobot-train ... --num_workers=8
  5. 5
    Koguge kontrollpunkte, mida saate võrrelda

    save_freq vaikimisi on 20000, nii et 20000 sammu pikkune käivitus jätab ühe kontrollpunkti ja midagi, millega seda võrrelda. Määrake 2000. Hubi lükkamiseks on vaja --policy.repo_id.

    bash
    --save_freq=2000 \
    --policy.repo_id=${HF_USER}/smolvla_pick_place \
    --save_checkpoint_to_hub=true
  6. 6
    Jätkake, kui masin sureb

    Suunake --config_path kontrollpunkti kõrval asuvale train_config.json-ile. lerobot keeldub käivitamast olemasolevasse output_dir-i, välja arvatud juhul, kui jätkate, nii et te ei saa käivitust kogemata üle kirjutada.

    bash
    lerobot-train \
      --config_path=<path to the saved train_config.json> \
      --resume=true

Lipud, mis tegelikult tulemust muudavad

LippMida see teeb24 GB peal
--batch_sizeNäidised sammu kohta, ligikaudu lineaarne VRAM-is4 to 8
--stepsOptimeerija samme kokku20000 esimene läbimine
--policy.scheduler_decay_stepsKoosinuse lagunemise pikkus, eelseadistatud 30000Mõjub ainult üle 30000
--policy.use_ampSegapretsisioon; SmolVLA-l puudub dtype välitrue, kui mälu on piiratud
--num_workersAndmelaadija protsessid, vaikimisi 4Suurendage, kuni data_s lakkab tõusmast
--dataset.eval_splitÜlesande kohta kõrvale jäetud episoodide osakaal0.1, with --eval_steps
--policy.freeze_vision_encoderHoiab nägemistorni külmutatunatrue on 24 GB
--policy.train_expert_onlyAinult ~100 M ekspert saab gradiendidtrue esimesena
Ajakava: mida 0.6.1 käsitleb ja mida mitte

SmolVLA eelseadistab koosinusajakava: scheduler_warmup_steps = 1000, scheduler_decay_steps = 30000, scheduler_decay_lr = 2.5e-6. Vanemad soovitused ütlevad, et 20000-sammuline käitus seiskub seetõttu keset hääbumist. Versioonis 0.6.1 see nii ei ole: CosineDecayWithWarmupSchedulerConfig.build()-ile antakse ette --steps, ja allpool num_decay_steps skaleerib see mõlemad ümber, soojenduse 1000-lt 666-le ja hääbumise 30000-lt 20000-le, printides seejuures Automaatselt skaleeruv LR ajakava. See ei skaleeri kunagi ülespoole: hääbumine on piiratud min(current_step, decay_steps)-iga, nii et vaikimisi --steps=100000 jääb sammust 30000 kuni lõpuni, 70 protsenti käitusest, põrandale. Ainult see pikk külg vajab endiselt --policy.scheduler_decay_steps. lr veerg on see, kust te kontrollite.

Vaikeseaded, mille te pärite, kui te midagi ei puutu

Üks poliitika konfiguratsioon lerobot'is sisaldab oma optimeerija ja ajakava eelseadistust, ja kui te ei määra use_policy_training_preset=false siis need eelseadistused võidavad. Pooled küsimused, mida inimesed SmolVLA treeningu kohta küsivad, on vastatud vaikeseadega, mille olemasolust nad ei teadnud.

SeadeVaikimisi lerobot 0.6.1-sMääratletud
chunk_size / n_action_steps50 / 50SmolVLAConfig
num_steps (voolu sobitamise müra eemaldamine)10SmolVLAConfig
optimizer_lr1e-4SmolVLAConfig
scheduler_warmup_steps1000SmolVLAConfig
scheduler_decay_steps30000SmolVLAConfig
scheduler_decay_lr2.5e-6SmolVLAConfig
freeze_vision_encodertrueSmolVLAConfig
train_expert_onlytrueSmolVLAConfig
batch_size / steps8 / 100000TrainPipelineConfig
seed / save_freq / num_workers1000 / 20000 / 4TrainPipelineConfig

Kaks rida, mis inimesi üllatavad, on freeze_vision_encoder ja train_expert_only, mõlemad tõesed. Vaikimisi treenite ligikaudu 100 miljonit parameetrit, mitte 450 miljonit, mistõttu see mahub 24 GB-le. LeRoboti enda referentskäitus nelja-GPU H100 klastris muudab mõlemad väärtuseks false; ühel 24 GB kaardil muudab see töötava käituse .

Mälunupp, mida pole olemas

Juhendi nõuanne mälupiirangute korral on vähendada paketi suurust (batch size) ja kasutada gradiendi akumulatsiooni (gradient accumulation) efektiivse paketi taastamiseks. Lerobot 0.6.1-s puudub gradiendi akumulatsioon: TrainPipelineConfig-il pole sellist välja ja see string ei esine kusagil väljastatud paketis. AY-Robotsi vorm näitab SmolVLA jaoks gradiendi akumulatsiooni väärtust 8 ja ei rakenda seda samuti. Teie hoovad 24 GB-l on --batch_size, kaks külmutamise vaikeväärtust ja --policy.use_amp.

Kui kaua käitus aega võtab ja kui palju samme on piisav

LeRobot avaldab tegeliku aja ankruid viie epohhi jaoks ligikaudu 50 episoodi andmestiku kohta, umbes 45000 kaadrit 30 kaadrit sekundis. Suurusjärgu numbrid, ütlevad dokumendid, kuid need on erinevus tunni ja päeva ootamise vahel.

SeadistusPoliitikaPakettReaalne aeg
Single L4 / A10G (24 GB)smolvla4umbes 3 kuni 6 t
Single A100 40 GBsmolvla16umbes 1 kuni 2 t
4 x H100 80 GB koos accelerate'igasmolvla32umbes 1 kuni 2 t
Single RTX 4090 / RTX 3090 (24 GB)act8umbes 30 kuni 60 min
Tehke epohhide arvutus enne --steps valimist

Reegel on 5 kuni 10 epohhi andmestiku kohta, mitte fikseeritud sammude arv: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)). Viiteandmestikul, millele dokumendid viitavad, lerobot/svla_so100_pickplace, metaandmed teatavad 50 episoodist ja 19631 kaadrist: pakett 8 annab umbes 2454 sammu epohhi kohta, seega 20000 sammu on ligikaudu 8 epohhi. Vähendage paketti poole võrra ja sama eelarve ostab poole vähem epohhe, seega tehke see uuesti iga kord, kui muudate --batch_size.

Peenhäälestatud poliitika käivitamine tagasi robotkäel

bash
lerobot-rollout \
  --strategy.type=base \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.id=my_follower_arm \
  --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
  --task="Grasp the cube and put it in the box." \
  --policy.path=${HF_USER}/smolvla_pick_place
Ülesande string peab vastama sellele, millega salvestasite. Mudel on sellele tekstile tingitud, seega parafraas on teistsugune juhis.

245 ms tegevussammu kohta on kergesti valesti mõistetav: poliitika väljastab chunk_size = 50 tegevust edasisuunatud läbimise kohta ja täidab n_action_steps = 50 neist, seega see, kui tihti seda kulu maksate, on määratud nende nuppudega, mitte sellega, kui tihti servod käsu saavad. Seda tegevuste tükeldamine ostab ja miks 245 ms mudel suudab juhtida 30 Hz kätt. Järele jääb järeldamise latentsus tüki lõpus.

Mõõtmine (SmolVLA, reaalne SO-100)SünkroonneAsünkroonne
Lõpetamisaeg, korja ja aseta, 10 katset13.75 s9.70 s
Korja ja aseta tsüklid fikseeritud ajaaknas919
Edukusmäär keskmiselt kolme ülesande kohta78.3 %73.3 %

See kolmas rida on see, mida enamik kirjutisi vahele jätab. Asünkroonne järeldamine on umbes 30 protsenti kiirem ja kahekordistab ligikaudu läbilaskevõimet fikseeritud ajaaknas, ning artikkel nimetab edukusmäärasid võrreldavateks, mis keskmiselt nii ongi. Selle all langes sorteerimine 70-lt 50 protsendile, samal ajal kui korja ja aseta võitis 5. lerobot 0.6.1 kannab teist hooba samas binaaris: --inference.type=rtc lülitab väljarullimise reaalajas tükeldamisele, mida skripti enda kasutusplokk soovitab aeglastele VLA-dele, Pi0-le, Pi0.5-le ja SmolVLA-le.

Järeldamine peab asuma servode kõrval

Juhtimissilmus on mudelist olenevalt 20 kuni 485 ms tegevussammu kohta, ja avaliku interneti edasi-tagasi reisid muudavad töötava poliitika kõhklevaks. Kaugjäreldamine on teostatav aeglase korja ja aseta jaoks, mitte kiire reaktiivse liikumise jaoks: kui ülesanne vajab kiireid parandusi, kuulub GPU samasse LAN-i kui käsi.

7.4 V, mitte 12 V

Koolituse seisukohalt kõrvaline teema, kuid see lõpetab rohkem SO-100 projekte kui ükski hüperparameeter. Feetech STS3215 servod SO-100 ja SO-101 robotites töötavad 7.4 V pingel; 12 V hävitab need. LeKiwi segab 7.4 V käe 12 V alusega, mis ongi viis, kuidas vale tünnpistik leiab vale pesa.

Kaks teed sama kontrollpunktini

Sina omad masinat, keskkonda ja silumist. Ainus pilvesõltuvus on baaskontrollpunkti allalaadimine Hubist. Õige tee, kui soovid poliitikat muuta, kui andmed ei tohi sinu võrgust lahkuda või kui kaart on jõude.

  • Sina kontrollid CUDA ratast, draiverit, ffmpeg-i ehitust ja andmelaadurit.
  • Sa saad parandada configuration_smolvla.py faili ja uuesti treenida sama pärastlõuna jooksul.
  • Sa maksad elektri ja aja eest, mitte iga käivituse eest, ja silud TorchCodec-i ise.
bash
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login

lerobot-train \
  --policy.path=lerobot/smolvla_base \
  --dataset.repo_id=${HF_USER}/so100_pick_place \
  --batch_size=8 --steps=20000 \
  --save_freq=2000 --seed=1000 \
  --output_dir=outputs/train/smolvla_pick_place \
  --job_name=smolvla_pick_place \
  --policy.device=cuda --wandb.enable=true
Kogu käsitsi tee ühes plokis, lerobot 0.6.1.

Kui SmolVLA on vale valik

Test selle kohta, kas SmolVLA oli õige esimene käivitus, ei seisne selles, kas see töötas, vaid selles, kas ebaõnnestumine andis teile midagi teada. Saavutage 60 või 70 protsenti ja suurem mudel on mõistlik järgmine investeering: andmed sisaldavad signaali. Saavutage 10 protsenti ja 3 B mudel saavutab tõenäoliselt samuti 10 protsenti, mille te just õppisite kolme dollari eest kaheteistkümne asemel.

AY-Robotsi treeningmaatriks: viis poliitikat ridadena, neli robotkätt veergudena
Iga lahter on omaette juhend. SmolVLA-l on üks iga nelja käe jaoks.

Väärt lugemist enne suuremate kulutuste tegemist: Pi0.5 versus SmolVLA sama idee suurema võimsuse jaoks, ja GR00T N1.7 versus SmolVLA NVIDIA tee jaoks, mõlemad 80 GB tasemel 4 kuni 12 USD jooksu kohta. Teine võimalus, ACT on odavam baasjoon: 80 M parameetrit, 20 ms tegevussammu kohta, keelelist tingimist pole. Kõik viis asuvad poliitikate lehel; areenil on 85 mudelit ja 332 võrdlustulemust.

AY-Robotsi poliitikate võrdlus: parameetrid, GPU tase, latentsus, minimaalsed episoodid
Neli numbrit, mis otsustavad käivituse.

Kontrollnimekiri enne millegi skaleerimist

  1. Kas lr jõudis oma 2.5e-6 piirini? Alla 30000 sammu lerobot skaleerib lagunemist ümber ja teatab sellest käivitamisel; sellest kõrgemal määrake --policy.scheduler_decay_steps ise.
  2. Rohkem kui üks kontrollpunkt ja episoodid, mis on välja jäetud --dataset.eval_split abil, nii et hindamise kadu tähendab midagi.
  3. Kas poliitika liigub üldse? Langeval kaol liikumatu käega on spetsiifilised põhjused: kadu langeb, poliitika ei tee midagi.
  4. Kas see elab üle stseeni muutuse? Kui mitte: poliitika töötab ainult ühes seadistuses.
  5. Kas panite seemne kirja? lerobot vaikimisi on 1000, nii et kaks puutumata käitust jäävad võrreldavaks.
  6. Alles siis: rohkem episoode, rohkem variatsioone või suurem mudel. Selles järjekorras.

Selle kohta, miks need mudelid eksisteerivad ja mida nad keele sisendiga teevad, on taustaks ; viib kokkupaneku läbi esimese käituseni. Lõpetatud kontrollpunkti jaoks ; kui käsi kunagi ei ilmu, siis .

Treenige SmolVLA-d oma käel

Valige mudel ja käsi ning juhend annab teile täpsed vaikeseaded, andmestiku formaadi ja käituse maksumuse. SmolVLA asub 24 GB tasemel hinnaga 1 kuni 3 USD käituse kohta.

Avage treeningjuhendid
Kas ma saan tõesti SmolVLA-d RTX 4090-l peenhäälestada?

Jah. LeRoboti arvutusjuhend paigutab SmolVLA tipp-VRAM-i umbes 10 kuni 16 GB-le partii 8 juures koos AdamW-ga ja loetleb 24 GB tarbijakaardid selle jaoks mugavatena. Dokumentatsiooni näites olev partii 64 on paaris ühe A100-ga. Mälu skaleerub partiiga ligikaudu lineaarselt, seega kasutage 4 või 8 ja jälgige mem_gb-d.

Mitu episoodi mul tegelikult vaja on?

AY-Robots seab miinimumiks 30. LeRoboti dokumendid soovitavad umbes 50 ja teatavad, et 25 sama ülesande episoodi toimisid halvasti. Struktuur on olulisem kui arv: võrdluskomplektis oli 5 kuubiku positsiooni, igaühes 10 episoodi, ja just see kordus üldistub.

Dokumendid ütlevad partii 64, platvorm saadab partii 2. Kumb on õige?

Mõlemad, erineva riistvara jaoks. Dokumentatsiooni näites kasutatakse partiid 64 ja mainitakse umbes 4 tundi 20000 sammu jaoks ühel A100-l; arvutusjuhendi A100 40 GB ankur on partii 16. Partii 2 on see, mida AY-Robots saadab 24 GB tasemel. Kohapeal on 4 kuni 8 keskmine ja ajastu aritmeetika muutub sellega.

SmolVLA või ACT esimeseks käivituseks SO-100-l?

ACT, kui ülesanne on üks korduv liigutus ja soovite kiireimat tsüklit: 20 ms tegevussammu kohta, 80 M parameetrit, keelelist tingimist pole. SmolVLA, kui soovite keelelist tingimist, mitut ülesande stringi ühes kontrollpunktis ja eelkoolitatud baasi. Mõlemad asuvad 24 GB tasemel, seega valik on ülesanne, mitte eelarve.

Kas ma pean määrama --policy.scheduler_decay_steps?

Ainult siis, kui --steps on üle 30000. SmolVLA eelseadistab koosinuse lagunemise 30000 sammu juures ja lerobot 0.6.1 skaleerib selle lühema käivituse jaoks ise alla, logides selle tegemisel "Auto-scaling LR scheduler". See ei skaleeri kunagi üles, nii et vaikimisi --steps=100000 jätab viimased 70000 sammu 2.5e-6 tasemele.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started