Stranica modela SmolVLA na AY-Robots prikazuje broj parametara, razinu GPU-a, kašnjenje inferencije po koraku akcije i minimalan broj epizoda
SmolVLALeRobotObuka VLAFino podešavanjeSO-100

Kako trenirati SmolVLA na 24 GB GPU-u (lerobot 0.6.1)

AY-Robots ResearchAugust 23, 202617 min čitanja

SmolVLA je VLA s 450 milijuna parametara koji se fino podešava na jednoj 24 GB kartici. Stvarne lerobot 0.6.1 naredbe, stvarne zadane postavke, zamke koje koštaju cijeli dan i koliko košta jedno pokretanje.

SmolVLA na jednom zaslonu

  • 450 M parametara, od čega je oko 100 M stručnjak za akcije usklađivanja toka. lerobot trenira samo tog stručnjaka i drži VLM zamrznutim, zbog čega stane na jednu karticu.
  • LeRobotov vodič za izračune procjenjuje smolvla grupu na otprilike 10 do 16 GB vršnog VRAM-a pri batch 8 s AdamW-om. Stoga 24 GB.
  • Ulazna točka je lerobot-train. Blog objava o SmolVLA-u iz lipnja 2025. još uvijek ispisuje python lerobot/scripts/train.py, putanju koja više ne postoji. Sve ispod je lerobot 0.6.1.
  • Kosinusni raspored je unaprijed postavljen da opada tijekom 30000 koraka. lerobot 0.6.1 to smanjuje za kraće izvođenje i bilježi, ali nikada ne povećava: standardno izvođenje od 100000 koraka završava na podu od 2.5e-6 za 70000 koraka.
  • Trideset epizoda je minimum za AY-Robots, na razini od 24 GB koja košta 1 do 3 USD po izvođenju u usporedbi s 4 do 12 za modele od 80 GB.

Većina ljudi koji žele model vizualnog jezika i akcije na stvarnoj ruci zaustavljaju se na hardverskoj liniji. GR00T N1.7 i Pi0.5 imaju oko tri milijarde parametara svaki i zahtijevaju A100 80 GB ili H100. Ako posjedujete gaming PC s RTX 4090, to je kraj puta. SmolVLA je iznimka: 450 M parametara, unutar LeRobota, izgrađen da se fino podešava na jednoj potrošačkoj kartici i poslužuje s CPU-a.

Prvo ručni put: instalirajte lerobot, povucite lerobot/smolvla_base kontrolnu točku, pokrenite stvarnu naredbu, čitajte izvođenje dok se događa. Zatim put platforme i gdje to ne pomaže.

Što je SmolVLA, u brojkama koje možete provjeriti

SmolVLA je usklađivanje toka politika pričvršćena na mali vizualni jezični model. Okosnica je SmolVLM2-500M-Video-Instruct; rad zadržava samo prvih 16 slojeva njegovog jezičnog modela, ograničava svaki kadar kamere na 64 vizualna tokena s miješanjem piksela umjesto popločavanja slike, te izmjenjuje unakrsnu pažnju sa slojem samopažnje svakog drugog bloka. Trošak inferencije bio je ograničenje dizajna, a ne naknadna misao.

SvojstvoVrijednostIzvor
Ukupni parametriabout 450 Mpaper
Stručnjak za akcijeabout 100 M, flow matchingpaper
VLM okosnicaHuggingFaceTB/SmolVLM2-500M-Video-Instructvlm_model_name
Korišteni VLM slojevifirst 16 of the language modelnum_vlm_layers = 16
Vizualni tokeni po kadru64, pixel shuffle, no tilingpaper
Pretrenaža481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUspaper

Mjerila su razlog zašto se ljudi zamaraju s modelom od 450 M. Na LIBERO-u prosječno postiže 87.3 posto naspram 76.5 za OpenVLA od 7 B i 86.0 za Pi0 pretreniran za robotiku od 3.3 B; na Meta-Worldu, 57.3 naspram 47.9. Na stvarnom SO-100 hardveru, višenamjensko treniranje daje 75 posto na 'pick and place', 90 na slaganju, 70 na sortiranju, s prosjekom od 78.3, dok ACT treniran po zadatku prosječno postiže 48.3. Isti redovi nalaze se pored svakog objavljenog VLA-a u SmolVLA unosu u arenu i usporedbi ACT-a sa SmolVLA-om.

Iskrena verzija tvrdnje o veličini

SmolVLA nije bolji od modela od 3 B u svemu. Vlastita SO-101 tablica u radu to otkriva: 90 posto uspjeha u distribuciji, 50 posto izvan nje, na platformi na kojoj nikada nije bio pretreniran. Ono što tvrdi i podržava jest da se u usporedbi s Pi0 trenira oko 40 posto brže na 6 puta manje memorije.

Zašto je kartica od 24 GB pravi izbor za prvi pokretanje

LeRobot isporučuje vodič za dimenzioniranje računalnih resursa, najkorisniju stranicu u repozitoriju za ovu svrhu. Grupe politika su prema veličini okosnice i daju jednu VRAM omotnicu po grupi, mjereno s veličinom paketa 8 i AdamW-om, što je zadana postavka LeRobota. Samo stanje optimizatora dodaje 30 do 100 posto iznad samog prolaza naprijed i natrag, tako da ovo nisu samo brojke težina.

GrupaPolitikeVršni VRAM (paket 8, AdamW)Preporučeni GPU-ovi
Lagani BCact, vqbet, tdmpcabout 2 to 6 GBRTX 3060, L4
Difuzijadiffusion, multi_task_ditabout 8 to 14 GBRTX 4070+, L4
Mali VLAsmolvlaabout 10 to 16 GBRTX 4080+, L4, A10G
Veliki VLApi0, pi0_fast, pi05, xvla, wall_xabout 24 to 40 GBA100 40 GB+
Višemodalnigroot, eo1about 24 to 40 GBA100 40 GB+

Argument je deset do šesnaest gigabajta pri paketu 8: kartica od 24 GB to podržava, plus učitavač podataka. AY-Robots postavlja SmolVLA na RTX 4090 ili bilo koju karticu od 24 GB, s minimalno 30 epizoda, LeRobot v3.0 podataka, 245 ms po koraku akcije. Iznajmljeno, to je 2 do 5 sati po cijeni od 0.30 do 0.60 USD po satu, oko 1 do 3 USD po fine-tuning pokretanju, naspram 4 do 12 USD na razini od 80 GB koju trebaju GR00T i Pi0.5 (cijene). Neuspješno pokretanje SmolVLA-e je kava; neuspješno pokretanje GR00T-a, ručak.

AY-Robots tablica troškova: kartica po politici, vrijeme izvođenja, cijena po izvođenju, potrebne epizode
SmolVLA i ACT nalaze se u retku od 24 GB, tri modela od 3 B u retku od 80 GB.
Početak sa SmolVLA umjesto modela od 3 B
Što dobivate
  • Odgovara hardveru koji možda već posjedujete: otprilike 10 do 16 GB pri batchu 8.
  • Propušteno izvođenje košta sate i nekoliko dolara, tako da si možete priuštiti pogrešku u vezi s podatkovnim skupom.
  • Prethodno treniran na skupovima podataka zajednice dijeljenim pod oznakom lerobot, sa stvarnim SO-100 i SO-101 rezultatima.
  • Živi u samom lerobotu: nema repozitorija dobavljača, a smolvla_base nije ograničen.
Čega se odričete
  • 450 M je i dalje 450 M: uspjeh izvan distribucije pada s 90 na 50 posto u tablici SO-101 u radu.
  • Zahtijeva LeRobot v3.0 podatke; snimka v2.1 mora se pretvoriti (dataset rejected v3).
  • 245 ms po koraku akcije je kompetentan kontroler za 'pick and place', a ne reaktivan.
  • Primjer iz dokumentacije pokreće batch 64 na A100; na 24 GB mijenjate batch za stvarno vrijeme.

Korak 0: skup podataka odlučuje o izvođenju, a ne zastavice

Ništa ispod nije važno ako je snimka loša. Stranica LeRobot SmolVLA je izravna: referentni skup podataka sastojao se od 50 epizoda raspoređenih na 5 pozicija kocke, 10 po poziciji, a isti zadatak s 25 epizoda izveden je loše. Ponavljanje po varijaciji generalizira, sirovi broj epizoda ne. Nikada niste snimili jednu? Počnite na snimite svoj prvi skup podataka, s desktop klijentom, koji piše LeRobot format iz teleoperacije sesije, ili posudite jedan iz direktorija skupova podataka.

  • Najmanje 30 epizoda na AY-Robots, oko 50 za referentni recept LeRobot.
  • Svaka varijacija koju očekujete pri implementaciji, ponovljena nekoliko puta.
  • Jedan niz zadataka, identično napisan u vrijeme snimanja i implementacije. Model je uvjetovan tim tekstom.
  • Fiksne kamere. Kamera pomaknuta između snimanja i implementacije najčešći je razlog zašto čista krivulja gubitka rezultira nepomičnom rukom.
  • Zadržana varijacija na kojoj nikada niste trenirali, tako da imate nešto iskreno za testiranje.
Zamka skupa podataka koja košta jedan dan

SmolVLA, Pi0.5 i ACT zahtijevaju LeRobot v3.0. GR00T N1.7 i N1.5 zahtijevaju v2.0 ili v2.1, a njihov učitavač se ruši na v3.0. Snimite jednom, planirajte usporediti modele kasnije, i pretvorit ćete na ovaj ili onaj način: dataset rejected v3.

bash
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_place
Konverter dolazi unutar lerobot-a, tako da nema potrebe za dodatnom instalacijom. U paketu nema konvertera u drugom smjeru.

Više o ovome u kako prikupiti visokokvalitetne podatke za obuku VLA za manipulaciju robotom. Ukratko: 30 do 50 čistih epizoda jednog zadatka s namjernom varijacijom nadmašuje 200 neurednih epizoda tri zadatka, s razlikom koju nijedan hiperparametar ne može zatvoriti.

Instaliraj lerobot 0.6.1

bash
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot

# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge

# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'

# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-info
PyPI putanja. Za zakrpu trenera, klonirajte repozitorij i umjesto toga koristite pip install -e ".[smolvla,training]".

Osnovna lerobot instalacija je minimalistička i teške ovisnosti skriva iza dodataka: smolvla dodaje transformere, num2words i accelerate, training skup podataka i wandb, core_scripts hardverske i vizualizacijske ovisnosti. Na Linuxu putanja instalacije također određuje vaš CUDA wheel: zadana PyPI vrijednost je cu130 wheel s minimalnom verzijom drivera 580.65, pa na starijem driveru prvo instalirajte torch s cu128 indeksa, a zatim lerobot.

policy.path i policy.type nisu ista zastavica

--policy.path=lerobot/smolvla_base loads the pretrained 450 M checkpoint and fine-tunes it. --policy.type=smolvla builds a fresh SmolVLA, and the config default load_vlm_weights = False means it does not even pull the SmolVLM2 backbone weights unless you ask. Get it wrong and the run trains happily, costs the same, and learns nothing transferable.

Pokretanje treninga, naredba po naredbu

  1. 1
    Autentifikacija na Hub

    Osnovna kontrolna točka dolazi s Huba, a vjerojatno i vaš skup podataka.

    bash
    hf auth login
  2. 2
    Pročitajte opcije jednom

    Svako polje konfiguracije cjevovoda i politike je zastavica. Prelistajte je prije nego što zaronite u izvorni kod.

    bash
    lerobot-train --help
  3. 3
    Pokrenite fino podešavanje

    Primjer iz dokumentacije pokreće batch 64 na jednom A100; vlastito sidro A100 40 GB u vodiču za izračun je batch 16, a 8 je ekvivalent za 24 GB. Ovdje namjerno nema zastavice za scheduler, pogledajte dolje.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/so100_pick_place \
      --batch_size=8 \
      --steps=20000 \
      --save_freq=2000 \
      --log_freq=200 \
      --seed=1000 \
      --output_dir=outputs/train/smolvla_pick_place \
      --job_name=smolvla_pick_place \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Pročitajte redak dnevnika, ne samo gubitak

    Svakih --log_freq koraka lerobot ispisuje loss, grdn, lr, updt_s, data_s, smp/s i, na CUDA-i, mem_gb. mem_gb govori je li batch stao, lr govori propada li raspored, a data_s koji se približava updt_s znači da je dataloader usko grlo, a ne GPU.

    bash
    # if data_s creeps toward updt_s
    lerobot-train ... --num_workers=8
  5. 5
    Prikupite kontrolne točke koje možete usporediti

    save_freq zadano je 20000, tako da pokretanje od 20000 koraka ostavlja jednu kontrolnu točku i ništa za usporedbu. Postavite 2000. Guranje na Hub zahtijeva --policy.repo_id.

    bash
    --save_freq=2000 \
    --policy.repo_id=${HF_USER}/smolvla_pick_place \
    --save_checkpoint_to_hub=true
  6. 6
    Nastavite ako se stroj ugasi

    Usmjerite --config_path na train_config.json pored kontrolne točke. lerobot odbija pokrenuti se u postojeći output_dir osim ako ne nastavljate, tako da ne možete slučajno prebrisati pokretanje.

    bash
    lerobot-train \
      --config_path=<path to the saved train_config.json> \
      --resume=true

Zastavice koje zapravo mijenjaju ishod

ZastavicaŠto radiNa 24 GB
--batch_sizeUzorci po koraku, otprilike linearno u VRAM-u4 do 8
--stepsUkupni koraci optimizatora20000 prvi prolaz
--policy.scheduler_decay_stepsDuljina kosinusnog raspada, unaprijed postavljeno 30000Djeluje samo iznad 30000
--policy.use_ampMješovita preciznost; SmolVLA nema polje dtypetrue kada je memorija ograničena
--num_workersProcesi dataloadera, zadano 4Povećavajte dok data_s ne prestane rasti
--dataset.eval_splitUdio epizoda zadržanih po zadatku0.1, s --eval_steps
--policy.freeze_vision_encoderZadržava vizualni toranj zamrznutimtrue na 24 GB
--policy.train_expert_onlySamo ~100 M ekspert dobiva gradijentetrue prvo
Raspored: što 0.6.1 obrađuje, a što ne

SmolVLA unaprijed postavlja kosinusni raspored: `scheduler_warmup_steps = 1000`, `scheduler_decay_steps = 30000`, `scheduler_decay_lr = 2.5e-6`. Stariji savjeti kažu da se pokretanje od 20000 koraka stoga zaustavlja usred opadanja. U 0.6.1 to nije slučaj: `CosineDecayWithWarmupSchedulerConfig.build()` dobiva `--steps`, i ispod `num_decay_steps` skalira oba, zagrijavanje 1000 na 666 i opadanje 30000 na 20000, ispisujući Automatsko skaliranje LR raspoređivača dok to radi. Nikada ne skalira prema gore: opadanje je ograničeno s `min(current_step, decay_steps)`, tako da standardni `--steps=100000` ostaje na dnu od koraka 30000 do kraja, 70 posto izvođenja. Samo ta duga strana još uvijek treba `--policy.scheduler_decay_steps`. Stupac `lr` je mjesto gdje provjeravate.

Zadane postavke koje nasljeđujete ako ništa ne dirate

Konfiguracija politike u lerobotu nosi vlastiti optimizator i unaprijed postavljeni raspoređivač, i osim ako ne postavite use_policy_training_preset=false te unaprijed postavljene postavke pobjeđuju. Polovica pitanja koja ljudi postavljaju o SmolVLA treningu odgovorena je zadanom postavkom za koju nisu znali da postoji.

PostavkaZadano u lerobot 0.6.1Definirano u
chunk_size / n_action_steps50 / 50SmolVLAConfig
num_steps (usklađivanje toka denoise)10SmolVLAConfig
optimizer_lr1e-4SmolVLAConfig
scheduler_warmup_steps1000SmolVLAConfig
scheduler_decay_steps30000SmolVLAConfig
scheduler_decay_lr2.5e-6SmolVLAConfig
freeze_vision_encodertrueSmolVLAConfig
train_expert_onlytrueSmolVLAConfig
batch_size / steps8 / 100000TrainPipelineConfig
seed / save_freq / num_workers1000 / 20000 / 4TrainPipelineConfig

Dvije linije koje iznenađuju ljude su freeze_vision_encoder i train_expert_only, obje istinite. Izvan kutije trenirate otprilike 100 M parametara, a ne 450 M, zbog čega stane na 24 GB. LeRobotovo vlastito referentno pokretanje na H100 klasteru s četiri GPU-a prebacuje obje na false; na jednoj 24 GB kartici to pretvara radno pokretanje u .

Memorijska poluga koja ne postoji

Savjet vodiča kada ste ograničeni memorijom je smanjiti veličinu serije (batch size) i koristiti akumulaciju gradijenta (gradient accumulation) za oporavak efektivne serije. Nema akumulacije gradijenta u lerobot 0.6.1: TrainPipelineConfig nema takvo polje i niz se nigdje ne pojavljuje u objavljenom paketu. AY-Robots obrazac prikazuje vrijednost akumulacije gradijenta od 8 za SmolVLA i ne primjenjuje je. Vaše poluge na 24 GB su --batch_size, dvije zadane postavke zamrzavanja i --policy.use_amp.

Koliko dugo traje pokretanje i koliko je koraka dovoljno

LeRobot objavljuje referentne točke stvarnog vremena za pet epoha preko skupa podataka od otprilike 50 epizoda, oko 45000 sličica pri 30 fps. Brojke reda veličine, kažu dokumenti, ali one čine razliku između očekivanja sata i dana.

PostavkaPolitikaSerijaStvarno vrijeme
Jedan L4 / A10G (24 GB)smolvla4oko 3 do 6 h
Jedan A100 40 GBsmolvla16oko 1 do 2 h
4 x H100 80 GB s ubrzanjemsmolvla32oko 1 do 2 h
Jedan RTX 4090 / RTX 3090 (24 GB)act8oko 30 do 60 min
Izračunajte epohe prije nego odaberete --steps

Pravilo je 5 do 10 epoha preko skupa podataka, a ne fiksni broj koraka: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)). Na referentnom skupu podataka na koji upućuje dokumentacija, lerobot/svla_so100_pickplace, metapodaci izvještavaju o 50 epizoda i 19631 kadru: serija od 8 daje oko 2454 koraka po epohi, tako da je 20000 koraka otprilike 8 epoha. Prepolačite seriju i isti budžet kupuje pola epoha, stoga ponovite ovo kad god mijenjate --batch_size.

Pokretanje fino podešene politike natrag na ruci

bash
lerobot-rollout \
  --strategy.type=base \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.id=my_follower_arm \
  --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
  --task="Grasp the cube and put it in the box." \
  --policy.path=${HF_USER}/smolvla_pick_place
Niz zadatka mora odgovarati onome s kojim ste snimali. Model je uvjetovan tim tekstom, tako da je parafraza drugačija instrukcija.

245 ms po koraku akcije lako je pogrešno protumačiti: politika emitira chunk_size = 50 akcija po prolazu naprijed i izvršava n_action_steps = 50 od njih, tako da je učestalost plaćanja tog troška određena tim postavkama, a ne učestalošću primanja naredbi od strane serva. To je ono što grupiranje akcija donosi, i zašto model od 245 ms može pokretati ruku od 30 Hz. Ono što preostaje je latencija inferencije na kraju bloka.

Mjerenje (SmolVLA, stvarni SO-100)SinkronoAsinkrono
Vrijeme dovršetka, uzmi i postavi, 10 pokušaja13.75 s9.70 s
Ciklusi uzimanja i postavljanja u fiksnom vremenskom prozoru919
Stopa uspješnosti prosječna za tri zadatka78.3 %73.3 %

Taj treći redak je ono što većina izvještaja preskače. Asinkrona inferencija je oko 30 posto brža i otprilike udvostručuje propusnost u fiksnom prozoru, a rad naziva stope uspješnosti usporedivima, što u prosjeku i jesu. Ispod toga, sortiranje je palo sa 70 na 50 posto dok je uzimanje i postavljanje dobilo 5. lerobot 0.6.1 nosi drugu polugu u istom binarnom kodu: --inference.type=rtc prebacuje izvođenje na grupiranje u stvarnom vremenu, što vlastiti blok upotrebe skripte preporučuje za spore VLA-ove, Pi0, Pi0.5 i SmolVLA.

Inferencija mora biti pored serva

Upravljačka petlja je 20 do 485 ms po koraku akcije ovisno o modelu, a povratna putovanja preko javnog interneta pretvaraju radnu politiku u oklijevajuću. Daljinska inferencija je izvediva za sporo uzimanje i postavljanje, ali ne i za brzo reaktivno kretanje: ako zadatak zahtijeva brze korekcije, GPU pripada na istu LAN mrežu kao i ruka.

7.4 V, ne 12 V

Iako nije tema za trening, ovo prekida više SO-100 projekata nego bilo koji hiperparametar. Feetech STS3215 servomotori u SO-100 i SO-101 rade na 7.4 V; 12 V ih uništava. LeKiwi kombinira ruku od 7.4 V s bazom od 12 V, što je način na koji pogrešni konektor pronalazi pogrešnu utičnicu.

Dva puta do iste kontrolne točke

Vi posjedujete stroj, okruženje i otklanjanje pogrešaka. Jedina ovisnost o oblaku je preuzimanje osnovne kontrolne točke s Huba. Pravi put ako želite modificirati politiku, ako podaci ne smiju napustiti vašu mrežu ili ako je kartica neaktivna.

  • Vi kontrolirate CUDA kotač, upravljački program, ffmpeg izgradnju i dataloader.
  • Možete zakrpati configuration_smolvla.py i ponovno trenirati isto poslijepodne.
  • Plaćate strujom i vremenom, ne po pokretanju, i sami otklanjate pogreške u TorchCodec-u.
bash
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login

lerobot-train \
  --policy.path=lerobot/smolvla_base \
  --dataset.repo_id=${HF_USER}/so100_pick_place \
  --batch_size=8 --steps=20000 \
  --save_freq=2000 --seed=1000 \
  --output_dir=outputs/train/smolvla_pick_place \
  --job_name=smolvla_pick_place \
  --policy.device=cuda --wandb.enable=true
Cijeli ručni put u jednom bloku, lerobot 0.6.1.

Kada je SmolVLA pogrešan izbor

Test je li SmolVLA bio pravi prvi pokušaj nije u tome je li uspio, već u tome je li vam neuspjeh nešto rekao. Dosegnite 60 ili 70 posto i veći model je razuman sljedeći trošak: podaci nose signal. Dosegnite 10 posto i model od 3 B će najvjerojatnije također dosegnuti 10 posto, što ste upravo naučili za tri dolara umjesto dvanaest.

Matrica treniranja AY-Robots: pet politika kao redovi, četiri robotske ruke kao stupci
Svaka ćelija je vlastiti vodič. SmolVLA ima po jedan za svaku od četiri ruke.

Vrijedi pročitati prije nego što potrošite više: Pi0.5 protiv SmolVLA za veći kapacitet na istoj ideji, i GR00T N1.7 protiv SmolVLA za NVIDIA put, oba 80 GB razina po 4 do 12 USD po pokretanju. Drugi način, ACT je jeftinija početna točka: 80 M parametara, 20 ms po koraku akcije, bez jezičnog uvjetovanja. Svih pet se nalazi na stranici s politikama; areni ima 85 modela i 332 rezultata benchmarka.

Usporedba politika AY-Robots: parametri, GPU razina, latencija, minimalne epizode
Četiri broja koja odlučuju o pokretanju.

Kontrolna lista prije nego što išta skalirate

  1. Je li lr dosegao svoju donju granicu od 2.5e-6? Ispod 30000 koraka lerobot ponovno skalira opadanje i to navodi pri pokretanju; iznad toga, sami postavite --policy.scheduler_decay_steps.
  2. Više od jedne kontrolne točke i epizode izdvojene s --dataset.eval_split tako da gubitak evaluacije nešto znači.
  3. Pomiče li se politika uopće? Padajući gubitak s nepomičnom rukom ima specifične uzroke: gubitak pada, politika ne radi ništa.
  4. Preživljava li promjenu scene? Ako ne: politika radi samo u jednom postavu.
  5. Jeste li zapisali seed? lerobot po zadanim postavkama koristi 1000, tako da dva netaknuta pokretanja ostaju usporediva.
  6. Tek tada: više epizoda, više varijacija ili veći model. Tim redoslijedom.

Zašto ovi modeli postoje i što rade s jezičnim unosom, je pozadina; provodi montažu kroz do prvog pokretanja. Za završenu kontrolnu točku, ; ako se ruka nikada ne pojavi, .

Trenirajte SmolVLA na vlastitoj ruci

Odaberite model i ruku, a vodič vam daje točne zadane postavke, format skupa podataka i troškove pokretanja. SmolVLA se nalazi na razini od 24 GB po cijeni od 1 do 3 USD po pokretanju.

Otvorite vodiče za treniranje
Mogu li zaista fino podesiti SmolVLA na RTX 4090?

Da. LeRobotov vodič za izračunavanje procjenjuje SmolVLA na otprilike 10 do 16 GB vršnog VRAM-a pri batch 8 s AdamW-om i navodi 24 GB potrošačke kartice kao udobne za to. Batch 64 u primjeru dokumentacije uparen je s jednim A100. Memorija se skalira otprilike linearno s batchom, stoga koristite 4 ili 8 i pratite mem_gb.

Koliko mi je epizoda zapravo potrebno?

AY-Robots postavlja minimum na 30. LeRobot dokumentacija preporučuje oko 50 i izvještava da je 25 epizoda istog zadatka loše funkcioniralo. Struktura je važnija od broja: referentni skup bio je 5 pozicija kocke s po 10 epizoda, i to ponavljanje je ono što se generalizira.

Dokumentacija kaže batch 64, platforma šalje batch 2. Što je ispravno?

Oba, za različit hardver. Primjer iz dokumentacije koristi batch 64 i navodi oko 4 sata za 20000 koraka na jednom A100; sidro A100 40 GB u vodiču za izračunavanje je batch 16. Batch 2 je ono što AY-Robots šalje na razini od 24 GB. Lokalno je 4 do 8 sredina, a aritmetika epoha se mijenja s tim.

SmolVLA ili ACT za prvo pokretanje na SO-100?

ACT ako je zadatak jedno ponavljajuće kretanje i želite najbržu petlju: 20 ms po koraku akcije, 80 M parametara, bez jezičnog uvjetovanja. SmolVLA ako želite jezično uvjetovanje, nekoliko nizova zadataka u jednoj kontrolnoj točki i unaprijed treniranu bazu. Oba se nalaze na razini od 24 GB, tako da je izbor zadatak, a ne budžet.

Moram li postaviti --policy.scheduler_decay_steps?

Samo kada je --steps iznad 30000. SmolVLA unaprijed postavlja kosinusni pad na 30000 koraka, a lerobot 0.6.1 ga samostalno smanjuje za kraće pokretanje, bilježeći "Auto-scaling LR scheduler" kada to čini. Nikada se ne skalira prema gore, tako da zadani --steps=100000 ostavlja zadnjih 70000 koraka na podu od 2.5e-6.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started