Stranica modela SmolVLA na AY-Robots prikazuje broj parametara, GPU nivo, kašnjenje inferencije po koraku akcije i minimalan broj epizoda
SmolVLALeRobotVLA TreningFino podešavanjeSO-100

Kako trenirati SmolVLA na 24 GB GPU-u (lerobot 0.6.1)

AY-Robots ResearchAugust 23, 202617 min čitanja

SmolVLA je VLA sa 450 miliona parametara koji se fino podešava na jednoj kartici od 24 GB. Stvarne lerobot 0.6.1 komande, stvarne podrazumevane vrednosti, zamke koje koštaju dan i koliko košta jedno pokretanje.

SmolVLA na jednom ekranu

  • 450 M parametara, od kojih je oko 100 M ekspert za akcije sa usklađivanjem toka. lerobot trenira samo tog eksperta i drži VLM zamrznutim, zbog čega staje na jednu karticu.
  • LeRobot-ov vodič za računanje procenjuje smolvla grupu na otprilike 10 do 16 GB vršnog VRAM-a pri batch 8 sa AdamW. Stoga 24 GB.
  • Ulazna tačka je lerobot-train. Blog post o SmolVLA iz juna 2025. i dalje prikazuje python lerobot/scripts/train.py, putanju koja više ne postoji. Sve ispod je lerobot 0.6.1.
  • Kosinusni raspored je unapred podešen da opada tokom 30000 koraka. lerobot 0.6.1 to smanjuje za kraće pokretanje i beleži, ali nikada ne povećava: standardno pokretanje od 100000 koraka završava na podu od 2.5e-6 za 70000 koraka.
  • Trideset epizoda je minimum za AY-Robots, na nivou od 24 GB koji košta 1 do 3 USD po pokretanju, naspram 4 do 12 za modele od 80 GB.

Većina ljudi koja želi model vizije, jezika i akcije na pravoj ruci staje kod hardverske linije. GR00T N1.7 i Pi0.5 imaju oko tri milijarde parametara svaki i zahtevaju A100 80 GB ili H100. Ako posedujete gejmerski PC sa RTX 4090, to je kraj puta. SmolVLA je izuzetak: 450 M parametara, unutar LeRobot-a, napravljen da se fino podešava na jednoj potrošačkoj kartici i služi sa CPU-a.

Prvo ručna ruta: instalirajte lerobot, preuzmite lerobot/smolvla_base kontrolnu tačku, pokrenite pravu komandu, pratite pokretanje dok se dešava. Zatim ruta platforme, i gde ona ne pomaže.

Šta je SmolVLA, u brojevima koje možete proveriti

SmolVLA je usklađivanje toka politika pričvršćena na mali vizuelni jezički model. Okosnica je SmolVLM2-500M-Video-Instruct; rad zadržava samo prvih 16 slojeva svog jezičkog modela, ograničava svaki kadar kamere na 64 vizuelna tokena sa premeštanjem piksela umesto popločavanja slike, i prepliće unakrsnu pažnju sa slojem samopažnje svakog drugog bloka. Trošak inferencije bio je ograničenje dizajna, a ne naknadna misao.

SvojstvoVrednostIzvor
Ukupni parametriabout 450 Mpaper
Ekspert za akcijeabout 100 M, flow matchingpaper
VLM okosnicaHuggingFaceTB/SmolVLM2-500M-Video-Instructvlm_model_name
Korišćeni VLM slojevifirst 16 of the language modelnum_vlm_layers = 16
Vizuelni tokeni po kadru64, pixel shuffle, no tilingpaper
Pretreniranje481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUspaper

Benchmark rezultati su razlog zašto se ljudi bave modelom od 450 M. Na LIBERO-u prosečno postiže 87.3 procenta u poređenju sa 76.5 za OpenVLA od 7 B i 86.0 za Pi0 pretreniran za robotiku od 3.3 B; na Meta-World-u, 57.3 u poređenju sa 47.9. Na stvarnom SO-100 hardveru, višenamensko treniranje daje 75 procenata za podizanje i postavljanje, 90 za slaganje, 70 za sortiranje, sa prosekom od 78.3, gde ACT treniran po zadatku prosečno je postigao 48.3. Isti redovi se nalaze pored svakog objavljenog VLA u SmolVLA arena unos i poređenje ACT-a sa SmolVLA.

Iskrena verzija tvrdnje o veličini

SmolVLA nije bolji od modela od 3 B u svemu. Sopstvena SO-101 tabela u radu to jasno pokazuje: 90 procenata uspeha u distribuciji, 50 procenata van nje, na platformi na kojoj nikada nije bio pretreniran. Ono što tvrdi, i potkrepljuje, jeste da se u poređenju sa Pi0 trenira oko 40 procenata brže na 6 puta manje memorije.

Zašto je kartica od 24 GB pravi izbor za prvo pokretanje

LeRobot isporučuje vodič za dimenzionisanje računarskih resursa, što je najkorisnija stranica u repozitorijumu za ovu svrhu. On grupiše politike po veličini okosnice i daje jedan VRAM opseg po grupi, meren sa veličinom paketa 8 i AdamW, podrazumevanim za lerobot. Samo stanje optimizatora dodaje 30 do 100 procenata u odnosu na čisti forward i backward prolaz, tako da ovo nisu cifre koje se odnose samo na težine.

GrupaPolitikeMaksimalni VRAM (paket 8, AdamW)Preporučeni GPU-ovi
Laki BCact, vqbet, tdmpcabout 2 to 6 GBRTX 3060, L4
Difuzijadiffusion, multi_task_ditabout 8 to 14 GBRTX 4070+, L4
Mali VLAsmolvlaabout 10 to 16 GBRTX 4080+, L4, A10G
Veliki VLApi0, pi0_fast, pi05, xvla, wall_xabout 24 to 40 GBA100 40 GB+
Multimodalnigroot, eo1about 24 to 40 GBA100 40 GB+

Deset do šesnaest gigabajta sa veličinom paketa 8 je argument: kartica od 24 GB to pokriva, plus dataloader. AY-Robots postavlja SmolVLA na RTX 4090 ili bilo koju karticu od 24 GB, minimum 30 epizoda, LeRobot v3.0 podataka, 245 ms po koraku akcije. Iznajmljeno, to je 2 do 5 sati po ceni od 0.30 do 0.60 USD po satu, oko 1 do 3 USD po fine-tuning pokretanju, naspram 4 do 12 USD na nivou od 80 GB koji GR00T i Pi0.5 zahtevaju (cene). Neuspelo pokretanje SmolVLA je kafa; neuspelo pokretanje GR00T-a, ručak.

AY-Robots tabela troškova: kartica po politici, vreme izvršavanja, cena po izvršavanju, potrebne epizode
SmolVLA i ACT se nalaze u redu od 24 GB, tri modela od 3 B u redu od 80 GB.
Početak sa SmolVLA umesto modela od 3 B
Šta dobijate
  • Odgovara hardveru koji možda već posedujete: otprilike 10 do 16 GB pri batch 8.
  • Propušteno izvršavanje košta sate i jednocifrene dolare, tako da možete sebi priuštiti da pogrešite u vezi sa skupom podataka.
  • Prethodno treniran na skupovima podataka zajednice deljenim pod lerobot oznakom, sa stvarnim SO-100 i SO-101 rezultatima.
  • Živi u samom lerobotu: nema repozitorijuma dobavljača, a smolvla_base nije ograničen.
Čega se odričete
  • 450 M je i dalje 450 M: uspeh van distribucije pada sa 90 na 50 procenata u SO-101 tabeli rada.
  • Zahteva LeRobot v3.0 podatke; snimak v2.1 mora biti konvertovan (dataset rejected v3).
  • 245 ms po koraku akcije je kompetentan kontroler za 'pick and place', a ne reaktivan.
  • Primer iz dokumentacije pokreće batch 64 na A100; na 24 GB menjate batch za realno vreme.

Korak 0: skup podataka odlučuje o izvršavanju, a ne zastavice

Ništa ispod nije važno ako je snimak loš. LeRobot SmolVLA stranica je direktna: referentni skup podataka je imao 50 epizoda raspoređenih na 5 pozicija kocke, 10 po poziciji, a isti zadatak sa 25 epizoda je loše izveden. Ponavljanje po varijaciji generalizuje, sirov broj epizoda ne. Nikada niste snimili nijedan? Počnite sa snimite svoj prvi skup podataka, sa desktop klijentom, koji piše LeRobot format iz teleoperacione sesije, ili pozajmite jedan iz direktorijuma skupova podataka.

  • Najmanje 30 epizoda na AY-Robots, oko 50 za LeRobot referentni recept.
  • Svaka varijacija koju očekujete pri implementaciji, ponovljena nekoliko puta.
  • Jedan string zadatka, identično napisan u vreme snimanja i implementacije. Model je uslovljen tim tekstom.
  • Fiksne kamere. Kamera pomerena između snimanja i implementacije je najčešći razlog zašto čista kriva gubitka daje nepokretnu ruku.
  • Zadržana varijacija na kojoj nikada niste trenirali, tako da imate nešto iskreno za testiranje.
Zamka skupa podataka koja košta jedan dan

SmolVLA, Pi0.5 i ACT zahtevaju LeRobot v3.0. GR00T N1.7 i N1.5 zahtevaju v2.0 ili v2.1 i njihov učitavač se ruši na v3.0. Snimite jednom, planirajte da kasnije uporedite modele, i konvertovaćete na ovaj ili onaj način: skup podataka odbijen v3.

bash
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_place
Konverter se isporučuje unutar lerobot-a, tako da nema ničega dodatnog za instalaciju. U paketu ne postoji konverter u drugom smeru.

Više o ovome u kako prikupiti visokokvalitetne VLA podatke za obuku. Ukratko: 30 do 50 čistih epizoda jednog zadatka sa namernom varijacijom nadmašuje 200 neurednih epizoda tri zadatka, sa razlikom koju nijedan hiperparametar ne može da zatvori.

Instalacija lerobot 0.6.1

bash
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot

# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge

# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'

# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-info
PyPI putanja. Da biste zakrpili trener, klonirajte repozitorijum i umesto toga koristite pip install -e ".[smolvla,training]".

Osnovna lerobot instalacija je minimalistička i teške zavisnosti su iza dodataka (extras): smolvla dodaje transformere, num2words i accelerate, training stak za skupove podataka i wandb, core_scripts zavisnosti za hardver i vizualizaciju. Na Linuxu, putanja instalacije takođe određuje vaš CUDA wheel: podrazumevana PyPI vrednost je cu130 wheel sa minimalnom verzijom drajvera 580.65, tako da na starijem drajveru prvo instalirajte torch sa cu128 indeksa, a zatim lerobot.

policy.path i policy.type nisu ista zastavica

--policy.path=lerobot/smolvla_base loads the pretrained 450 M checkpoint and fine-tunes it. --policy.type=smolvla builds a fresh SmolVLA, and the config default load_vlm_weights = False means it does not even pull the SmolVLM2 backbone weights unless you ask. Get it wrong and the run trains happily, costs the same, and learns nothing transferable.

Pokretanje obuke, komanda po komanda

  1. 1
    Autentifikacija na Hub-u

    Osnovna kontrolna tačka dolazi sa Hub-a, a verovatno i vaš skup podataka.

    bash
    hf auth login
  2. 2
    Pročitajte opcije jednom

    Svako polje konfiguracije pajplajna i politike je zastavica. Prelistajte je pre nego što se udubite u izvorni kod.

    bash
    lerobot-train --help
  3. 3
    Pokrenite fino podešavanje

    Primer iz dokumentacije pokreće batch 64 na jednom A100; sopstveni A100 40 GB anchor iz vodiča za računanje je batch 16, a 8 je ekvivalent za 24 GB. Nema zastavice za scheduler ovde namerno, pogledajte ispod.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/so100_pick_place \
      --batch_size=8 \
      --steps=20000 \
      --save_freq=2000 \
      --log_freq=200 \
      --seed=1000 \
      --output_dir=outputs/train/smolvla_pick_place \
      --job_name=smolvla_pick_place \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Pročitajte liniju loga, ne samo gubitak

    Na svakih --log_freq koraka lerobot ispisuje loss, grdn, lr, updt_s, data_s, smp/s i, na CUDA-i, mem_gb. mem_gb govori da li batch staje, lr da li se raspored smanjuje, a data_s koji se približava updt_s znači da je dataloader usko grlo, a ne GPU.

    bash
    # if data_s creeps toward updt_s
    lerobot-train ... --num_workers=8
  5. 5
    Sakupite kontrolne tačke koje možete uporediti

    save_freq podrazumevano iznosi 20000, tako da pokretanje od 20000 koraka ostavlja jednu kontrolnu tačku i ništa za poređenje. Postavite na 2000. Guranje na Hub zahteva --policy.repo_id.

    bash
    --save_freq=2000 \
    --policy.repo_id=${HF_USER}/smolvla_pick_place \
    --save_checkpoint_to_hub=true
  6. 6
    Nastavite ako mašina prestane sa radom

    Usmjerite --config_path na train_config.json pored kontrolne tačke. lerobot odbija da se pokrene u postojećem output_dir-u osim ako ne nastavljate, tako da ne možete slučajno prepisati pokretanje.

    bash
    lerobot-train \
      --config_path=<path to the saved train_config.json> \
      --resume=true

Zastavice koje zapravo menjaju ishod

ZastavicaŠta radiNa 24 GB
--batch_sizeUzorci po koraku, približno linearno u VRAM-u4 to 8
--stepsUkupni koraci optimizatora20000 prvi prolaz
--policy.scheduler_decay_stepsDužina kosinusnog opadanja, unapred podešeno 30000Deluje samo iznad 30000
--policy.use_ampMešovita preciznost; SmolVLA nema polje dtypetrue kada je memorija ograničena
--num_workersProcesi dataloader-a, podrazumevano 4Povećavajte dok data_s ne prestane da raste
--dataset.eval_splitDeo epizoda zadržanih po zadatku0.1, with --eval_steps
--policy.freeze_vision_encoderOdržava vizuelni enkoder zamrznutimtrue na 24 GB
--policy.train_expert_onlySamo ~100 M ekspert dobija gradijentetrue prvo
Raspored: šta 0.6.1 obrađuje, a šta ne

SmolVLA unapred postavlja kosinusni raspored: `scheduler_warmup_steps = 1000`, `scheduler_decay_steps = 30000`, `scheduler_decay_lr = 2.5e-6`. Stariji saveti kažu da se pokretanje od 20000 koraka stoga zaustavlja usred opadanja. U verziji 0.6.1 to se ne dešava: `CosineDecayWithWarmupSchedulerConfig.build()` dobija `--steps`, i ispod `num_decay_steps` on skalira oba, zagrevanje sa 1000 na 666 i opadanje sa 30000 na 20000, štampajući *Auto-scaling LR scheduler*. Nikada ne skalira naviše: opadanje je ograničeno sa `min(current_step, decay_steps)`, tako da standardni `--steps=100000` ostaje na minimumu od koraka 30000 do kraja, 70 procenata izvršavanja. Samo ta duga strana i dalje zahteva `--policy.scheduler_decay_steps`. Kolona `lr` je mesto gde proveravate.

Podrazumevane vrednosti koje nasleđujete ako ništa ne dirate

A konfiguracija u lerobot-u nosi sopstveni optimizator i unapred podešeni raspored, i osim ako ne postavite use_policy_training_preset=false ti unapred podešeni parametri pobeđuju. Polovina pitanja koja ljudi postavljaju o SmolVLA treningu odgovorena je podrazumevanom vrednošću za koju nisu znali da postoji.

PodešavanjePodrazumevano u lerobot 0.6.1Definisano u
chunk_size / n_action_steps50 / 50SmolVLAConfig
num_steps (denoising usklađivanja toka)10SmolVLAConfig
optimizer_lr1e-4SmolVLAConfig
scheduler_warmup_steps1000SmolVLAConfig
scheduler_decay_steps30000SmolVLAConfig
scheduler_decay_lr2.5e-6SmolVLAConfig
freeze_vision_encodertrueSmolVLAConfig
train_expert_onlytrueSmolVLAConfig
batch_size / steps8 / 100000TrainPipelineConfig
seed / save_freq / num_workers1000 / 20000 / 4TrainPipelineConfig

Dve linije koje iznenađuju ljude su freeze_vision_encoder i train_expert_only, obe tačne. Podrazumevano trenirate otprilike 100 M parametara, a ne 450 M, zbog čega staje na 24 GB. Sopstveno referentno pokretanje LeRobot-a na H100 klasteru sa četiri GPU-a prebacuje obe na false; na jednoj kartici od 24 GB to pretvara ispravno pokretanje u .

Memorijski prekidač koji ne postoji

Savet vodiča kada ste ograničeni memorijom je da smanjite veličinu paketa (batch size) i koristite akumulaciju gradijenta (gradient accumulation) da biste povratili efektivni paket. Nema akumulacije gradijenta u lerobot 0.6.1: TrainPipelineConfig nema takvo polje i string se ne pojavljuje nigde u objavljenom paketu. AY-Robots obrazac prikazuje vrednost akumulacije gradijenta od 8 za SmolVLA i ne primenjuje je. Vaše poluge na 24 GB su --batch_size, dve podrazumevane vrednosti zamrzavanja, i --policy.use_amp.

Koliko dugo traje pokretanje i koliko koraka je dovoljno

LeRobot objavljuje vremenske (wall-clock) reference za pet epoha preko skupa podataka od otprilike 50 epizoda, oko 45000 frejmova pri 30 fps. Brojke reda veličine, kažu dokumenti, ali one čine razliku između očekivanja sata i dana.

PodešavanjePolitikaSerijaRealno vreme
Single L4 / A10G (24 GB)smolvla4about 3 to 6 h
Single A100 40 GBsmolvla16about 1 to 2 h
4 x H100 80 GB with acceleratesmolvla32about 1 to 2 h
Single RTX 4090 / RTX 3090 (24 GB)act8about 30 to 60 min
Izračunajte epohe pre nego što odaberete --steps

Pravilo je 5 do 10 epoha preko skupa podataka, a ne fiksni broj koraka: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)) . Na referentnom skupu podataka na koji dokumentacija ukazuje, lerobot/svla_so100_pickplace, metapodaci prijavljuju 50 epizoda i 19631 frejm: serija od 8 daje oko 2454 koraka po epohi, tako da je 20000 koraka otprilike 8 epoha. Prepolovite seriju i isti budžet kupuje pola epoha, pa ponovite ovo kad god menjate --batch_size.

Pokretanje fino podešene politike nazad na ruci

bash
lerobot-rollout \
  --strategy.type=base \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.id=my_follower_arm \
  --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
  --task="Grasp the cube and put it in the box." \
  --policy.path=${HF_USER}/smolvla_pick_place
Niz zadataka mora da se podudara sa onim sa kojim ste snimali. Model je uslovljen tim tekstom, tako da je parafraza drugačija instrukcija.

245 ms po koraku akcije je lako pogrešno protumačiti: politika emituje chunk_size = 50 akcija po prolazu unapred i izvršava n_action_steps = 50 od njih, tako da je učestalost plaćanja tog troška određena tim parametrima, a ne učestalošću kojom servoi dobijaju komandu. To je ono što razdvajanje akcija omogućava, i zašto model od 245 ms može da pokreće ruku od 30 Hz. Ono što preostaje je kašnjenje inferencije na kraju bloka.

Merenje (SmolVLA, pravi SO-100)SinhronoAsinhrono
Vreme završetka, uzmi i postavi, 10 pokušaja13.75 s9.70 s
Ciklusi uzmi i postavi u fiksnom vremenskom prozoru919
Stopa uspešnosti prosečna za tri zadatka78.3 %73.3 %

Taj treći red je ono što većina tekstova preskače. Asinhrona inferencija je oko 30 procenata brža i otprilike udvostručuje propusnost u fiksnom vremenskom prozoru, a rad navodi da su stope uspešnosti uporedive, što u proseku i jesu. Ispod toga, sortiranje je palo sa 70 na 50 procenata, dok je uzmi i postavi dobilo 5. lerobot 0.6.1 nosi drugu polugu u istom binarnom fajlu: --inference.type=rtc prebacuje izvođenje na razdvajanje u realnom vremenu, što sopstveni blok upotrebe skripte preporučuje za spore VLA-ove, Pi0, Pi0.5 i SmolVLA.

Inferencija mora biti pored servoa

Kontrolna petlja je 20 do 485 ms po koraku akcije u zavisnosti od modela, a povratna putovanja preko javnog interneta pretvaraju funkcionalnu politiku u oklevajuću. Daljinska inferencija je izvodljiva za sporo uzmi i postavi, ali ne i za brzo reaktivno kretanje: ako zadatak zahteva brze korekcije, GPU pripada istoj LAN mreži kao i ruka.

7.4 V, ne 12 V

Nije tema za obuku, ali okončava više SO-100 projekata nego bilo koji hiperparametar. Feetech STS3215 servo motori u SO-100 i SO-101 rade na 7.4 V; 12 V ih uništava. LeKiwi kombinuje ruku od 7.4 V sa bazom od 12 V, što je način na koji pogrešan DC konektor pronalazi pogrešnu utičnicu.

Dva puta do iste kontrolne tačke

Vi posedujete mašinu, okruženje i otklanjanje grešaka. Jedina zavisnost od oblaka je preuzimanje osnovne kontrolne tačke sa Huba. Pravi put ako želite da modifikujete politiku, ako podaci ne mogu napustiti vašu mrežu, ili ako je kartica neaktivna.

  • Vi kontrolišete CUDA točak, drajver, ffmpeg build i dataloader.
  • Možete zakrpiti configuration_smolvla.py i ponovo trenirati istog popodneva.
  • Plaćate strujom i vremenom, ne po pokretanju, i sami otklanjate greške u TorchCodec-u.
bash
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login

lerobot-train \
  --policy.path=lerobot/smolvla_base \
  --dataset.repo_id=${HF_USER}/so100_pick_place \
  --batch_size=8 --steps=20000 \
  --save_freq=2000 --seed=1000 \
  --output_dir=outputs/train/smolvla_pick_place \
  --job_name=smolvla_pick_place \
  --policy.device=cuda --wandb.enable=true
Cela ručna ruta u jednom bloku, lerobot 0.6.1.

Kada je SmolVLA pogrešan izbor

Test da li je SmolVLA bio pravi prvi pokušaj nije u tome da li je uspeo, već u tome da li vam je neuspeh nešto rekao. Dostignite 60 ili 70 procenata i veći model je razuman sledeći korak: podaci nose signal. Dostignite 10 procenata i model od 3 B će najverovatnije takođe dostići 10 procenata, što ste upravo naučili za tri dolara umesto dvanaest.

Matrica obuke AY-Robots: pet politika kao redovi, četiri robotske ruke kao kolone
Svaka ćelija je sopstveni vodič. SmolVLA ima po jedan za svaku od četiri ruke.

Vredi pročitati pre nego što potrošite više: Pi0.5 protiv SmolVLA za veći kapacitet na istoj ideji, i GR00T N1.7 protiv SmolVLA za NVIDIA put, oba 80 GB nivoa po ceni od 4 do 12 USD po pokretanju. Drugi način, ACT je jeftinija osnova: 80 M parametara, 20 ms po koraku akcije, bez jezičkog uslovljavanja. Svih pet se nalazi na stranici sa politikama; areni ima 85 modela i 332 rezultata benčmarka.

Poređenje politika AY-Robots: parametri, GPU nivo, latencija, minimalne epizode
Četiri broja koja odlučuju o pokretanju.

Kontrolna lista pre nego što bilo šta skalirate

  1. Da li je lr dostigao svoj minimum od 2.5e-6? Ispod 30000 koraka lerobot preskalira opadanje i to navodi pri pokretanju; iznad toga, sami podesite --policy.scheduler_decay_steps.
  2. Više od jedne kontrolne tačke i epizode izdvojene sa --dataset.eval_split tako da gubitak evaluacije nešto znači.
  3. Da li se politika uopšte pomera? Opadajući gubitak sa nepokretnom rukom ima specifične uzroke: gubitak opada, politika ne radi ništa.
  4. Da li preživljava promenu scene? Ako ne: politika radi samo u jednom podešavanju.
  5. Da li ste zapisali seed? lerobot podrazumevano koristi 1000, tako da dva netaknuta pokretanja ostaju uporediva.
  6. Tek tada: više epizoda, više varijacija ili veći model. Tim redosledom.

Zašto ovi modeli postoje i šta rade sa jezičkim unosom, je pozadina; vodi montažu kroz do prvog pokretanja . Za završenu kontrolnu tačku, ; ako se ruka nikada ne pojavi, .

Obučite SmolVLA na svojoj ruci

Izaberite model i ruku, a vodič vam daje tačne podrazumevane vrednosti, format skupa podataka i cenu pokretanja. SmolVLA se nalazi na nivou od 24 GB po ceni od 1 do 3 USD po pokretanju.

Otvorite vodiče za obuku
Mogu li zaista fino podesiti SmolVLA na RTX 4090?

Da. LeRobot-ov vodič za računanje procenjuje SmolVLA na otprilike 10 do 16 GB vršnog VRAM-a pri batch 8 sa AdamW i navodi da su potrošačke kartice od 24 GB udobne za to. Batch 64 u primeru dokumentacije je uparen sa jednim A100. Memorija se skalira približno linearno sa batch-om, pa koristite 4 ili 8 i pratite mem_gb.

Koliko mi je epizoda zapravo potrebno?

AY-Robots postavlja minimum na 30. LeRobot dokumentacija preporučuje oko 50 i izveštava da je 25 epizoda istog zadatka loše funkcionisalo. Struktura je važnija od broja: referentni skup je bio 5 pozicija kocke sa po 10 epizoda, i to ponavljanje je ono što generalizuje.

Dokumentacija kaže batch 64, platforma šalje batch 2. Šta je ispravno?

Oba, za različit hardver. Primer iz dokumentacije koristi batch 64 i navodi oko 4 sata za 20000 koraka na jednom A100; sidro A100 40 GB u vodiču za računanje je batch 16. Batch 2 je ono što AY-Robots šalje na nivou od 24 GB. Lokalno je 4 do 8 sredina, i aritmetika epoha se menja sa tim.

SmolVLA ili ACT za prvo pokretanje na SO-100?

ACT ako je zadatak jedno ponavljajuće kretanje i želite najbržu petlju: 20 ms po koraku akcije, 80 M parametara, bez jezičkog uslovljavanja. SmolVLA ako želite jezičko uslovljavanje, nekoliko nizova zadataka u jednoj kontrolnoj tački i unapred obučenu bazu. Oba se nalaze na nivou od 24 GB, tako da je izbor zadatak, a ne budžet.

Da li moram da postavim --policy.scheduler_decay_steps?

Samo kada je --steps iznad 30000. SmolVLA unapred postavlja kosinusni opadanje na 30000 koraka, a lerobot 0.6.1 ga samostalno smanjuje za kraće pokretanje, beležeći "Auto-scaling LR scheduler" kada to radi. Nikada se ne skalira naviše, tako da podrazumevani --steps=100000 ostavlja poslednjih 70000 koraka na podu od 2.5e-6.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started