
SmolVLA je VLA sa 450 miliona parametara koji se fino podešava na jednoj kartici od 24 GB. Stvarne lerobot 0.6.1 komande, stvarne podrazumevane vrednosti, zamke koje koštaju dan i koliko košta jedno pokretanje.
SmolVLA na jednom ekranu
- •450 M parametara, od kojih je oko 100 M ekspert za akcije sa usklađivanjem toka. lerobot trenira samo tog eksperta i drži VLM zamrznutim, zbog čega staje na jednu karticu.
- •LeRobot-ov vodič za računanje procenjuje smolvla grupu na otprilike 10 do 16 GB vršnog VRAM-a pri batch 8 sa AdamW. Stoga 24 GB.
- •Ulazna tačka je lerobot-train. Blog post o SmolVLA iz juna 2025. i dalje prikazuje python lerobot/scripts/train.py, putanju koja više ne postoji. Sve ispod je lerobot 0.6.1.
- •Kosinusni raspored je unapred podešen da opada tokom 30000 koraka. lerobot 0.6.1 to smanjuje za kraće pokretanje i beleži, ali nikada ne povećava: standardno pokretanje od 100000 koraka završava na podu od 2.5e-6 za 70000 koraka.
- •Trideset epizoda je minimum za AY-Robots, na nivou od 24 GB koji košta 1 do 3 USD po pokretanju, naspram 4 do 12 za modele od 80 GB.
Većina ljudi koja želi model vizije, jezika i akcije na pravoj ruci staje kod hardverske linije. GR00T N1.7 i Pi0.5 imaju oko tri milijarde parametara svaki i zahtevaju A100 80 GB ili H100. Ako posedujete gejmerski PC sa RTX 4090, to je kraj puta. SmolVLA je izuzetak: 450 M parametara, unutar LeRobot-a, napravljen da se fino podešava na jednoj potrošačkoj kartici i služi sa CPU-a.
Prvo ručna ruta: instalirajte lerobot, preuzmite lerobot/smolvla_base kontrolnu tačku, pokrenite pravu komandu, pratite pokretanje dok se dešava. Zatim ruta platforme, i gde ona ne pomaže.
Šta je SmolVLA, u brojevima koje možete proveriti
SmolVLA je usklađivanje toka politika pričvršćena na mali vizuelni jezički model. Okosnica je SmolVLM2-500M-Video-Instruct; rad zadržava samo prvih 16 slojeva svog jezičkog modela, ograničava svaki kadar kamere na 64 vizuelna tokena sa premeštanjem piksela umesto popločavanja slike, i prepliće unakrsnu pažnju sa slojem samopažnje svakog drugog bloka. Trošak inferencije bio je ograničenje dizajna, a ne naknadna misao.
| Svojstvo | Vrednost | Izvor |
|---|---|---|
| Ukupni parametri | about 450 M | paper |
| Ekspert za akcije | about 100 M, flow matching | paper |
| VLM okosnica | HuggingFaceTB/SmolVLM2-500M-Video-Instruct | vlm_model_name |
| Korišćeni VLM slojevi | first 16 of the language model | num_vlm_layers = 16 |
| Vizuelni tokeni po kadru | 64, pixel shuffle, no tiling | paper |
| Pretreniranje | 481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUs | paper |
Benchmark rezultati su razlog zašto se ljudi bave modelom od 450 M. Na LIBERO-u prosečno postiže 87.3 procenta u poređenju sa 76.5 za OpenVLA od 7 B i 86.0 za Pi0 pretreniran za robotiku od 3.3 B; na Meta-World-u, 57.3 u poređenju sa 47.9. Na stvarnom SO-100 hardveru, višenamensko treniranje daje 75 procenata za podizanje i postavljanje, 90 za slaganje, 70 za sortiranje, sa prosekom od 78.3, gde ACT treniran po zadatku prosečno je postigao 48.3. Isti redovi se nalaze pored svakog objavljenog VLA u SmolVLA arena unos i poređenje ACT-a sa SmolVLA.
SmolVLA nije bolji od modela od 3 B u svemu. Sopstvena SO-101 tabela u radu to jasno pokazuje: 90 procenata uspeha u distribuciji, 50 procenata van nje, na platformi na kojoj nikada nije bio pretreniran. Ono što tvrdi, i potkrepljuje, jeste da se u poređenju sa Pi0 trenira oko 40 procenata brže na 6 puta manje memorije.
Zašto je kartica od 24 GB pravi izbor za prvo pokretanje
LeRobot isporučuje vodič za dimenzionisanje računarskih resursa, što je najkorisnija stranica u repozitorijumu za ovu svrhu. On grupiše politike po veličini okosnice i daje jedan VRAM opseg po grupi, meren sa veličinom paketa 8 i AdamW, podrazumevanim za lerobot. Samo stanje optimizatora dodaje 30 do 100 procenata u odnosu na čisti forward i backward prolaz, tako da ovo nisu cifre koje se odnose samo na težine.
| Grupa | Politike | Maksimalni VRAM (paket 8, AdamW) | Preporučeni GPU-ovi |
|---|---|---|---|
| Laki BC | act, vqbet, tdmpc | about 2 to 6 GB | RTX 3060, L4 |
| Difuzija | diffusion, multi_task_dit | about 8 to 14 GB | RTX 4070+, L4 |
| Mali VLA | smolvla | about 10 to 16 GB | RTX 4080+, L4, A10G |
| Veliki VLA | pi0, pi0_fast, pi05, xvla, wall_x | about 24 to 40 GB | A100 40 GB+ |
| Multimodalni | groot, eo1 | about 24 to 40 GB | A100 40 GB+ |
Deset do šesnaest gigabajta sa veličinom paketa 8 je argument: kartica od 24 GB to pokriva, plus dataloader. AY-Robots postavlja SmolVLA na RTX 4090 ili bilo koju karticu od 24 GB, minimum 30 epizoda, LeRobot v3.0 podataka, 245 ms po koraku akcije. Iznajmljeno, to je 2 do 5 sati po ceni od 0.30 do 0.60 USD po satu, oko 1 do 3 USD po fine-tuning pokretanju, naspram 4 do 12 USD na nivou od 80 GB koji GR00T i Pi0.5 zahtevaju (cene). Neuspelo pokretanje SmolVLA je kafa; neuspelo pokretanje GR00T-a, ručak.

- Odgovara hardveru koji možda već posedujete: otprilike 10 do 16 GB pri batch 8.
- Propušteno izvršavanje košta sate i jednocifrene dolare, tako da možete sebi priuštiti da pogrešite u vezi sa skupom podataka.
- Prethodno treniran na skupovima podataka zajednice deljenim pod lerobot oznakom, sa stvarnim SO-100 i SO-101 rezultatima.
- Živi u samom lerobotu: nema repozitorijuma dobavljača, a smolvla_base nije ograničen.
- 450 M je i dalje 450 M: uspeh van distribucije pada sa 90 na 50 procenata u SO-101 tabeli rada.
- Zahteva LeRobot v3.0 podatke; snimak v2.1 mora biti konvertovan (dataset rejected v3).
- 245 ms po koraku akcije je kompetentan kontroler za 'pick and place', a ne reaktivan.
- Primer iz dokumentacije pokreće batch 64 na A100; na 24 GB menjate batch za realno vreme.
Korak 0: skup podataka odlučuje o izvršavanju, a ne zastavice
Ništa ispod nije važno ako je snimak loš. LeRobot SmolVLA stranica je direktna: referentni skup podataka je imao 50 epizoda raspoređenih na 5 pozicija kocke, 10 po poziciji, a isti zadatak sa 25 epizoda je loše izveden. Ponavljanje po varijaciji generalizuje, sirov broj epizoda ne. Nikada niste snimili nijedan? Počnite sa snimite svoj prvi skup podataka, sa desktop klijentom, koji piše LeRobot format iz teleoperacione sesije, ili pozajmite jedan iz direktorijuma skupova podataka.
- Najmanje 30 epizoda na AY-Robots, oko 50 za LeRobot referentni recept.
- Svaka varijacija koju očekujete pri implementaciji, ponovljena nekoliko puta.
- Jedan string zadatka, identično napisan u vreme snimanja i implementacije. Model je uslovljen tim tekstom.
- Fiksne kamere. Kamera pomerena između snimanja i implementacije je najčešći razlog zašto čista kriva gubitka daje nepokretnu ruku.
- Zadržana varijacija na kojoj nikada niste trenirali, tako da imate nešto iskreno za testiranje.
SmolVLA, Pi0.5 i ACT zahtevaju LeRobot v3.0. GR00T N1.7 i N1.5 zahtevaju v2.0 ili v2.1 i njihov učitavač se ruši na v3.0. Snimite jednom, planirajte da kasnije uporedite modele, i konvertovaćete na ovaj ili onaj način: skup podataka odbijen v3.
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_placeViše o ovome u kako prikupiti visokokvalitetne VLA podatke za obuku. Ukratko: 30 do 50 čistih epizoda jednog zadatka sa namernom varijacijom nadmašuje 200 neurednih epizoda tri zadatka, sa razlikom koju nijedan hiperparametar ne može da zatvori.
Instalacija lerobot 0.6.1
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot
# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge
# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'
# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-infoOsnovna lerobot instalacija je minimalistička i teške zavisnosti su iza dodataka (extras): smolvla dodaje transformere, num2words i accelerate, training stak za skupove podataka i wandb, core_scripts zavisnosti za hardver i vizualizaciju. Na Linuxu, putanja instalacije takođe određuje vaš CUDA wheel: podrazumevana PyPI vrednost je cu130 wheel sa minimalnom verzijom drajvera 580.65, tako da na starijem drajveru prvo instalirajte torch sa cu128 indeksa, a zatim lerobot.
--policy.path=lerobot/smolvla_base loads the pretrained 450 M checkpoint and fine-tunes it. --policy.type=smolvla builds a fresh SmolVLA, and the config default load_vlm_weights = False means it does not even pull the SmolVLM2 backbone weights unless you ask. Get it wrong and the run trains happily, costs the same, and learns nothing transferable.
Pokretanje obuke, komanda po komanda
- 1Autentifikacija na Hub-u
Osnovna kontrolna tačka dolazi sa Hub-a, a verovatno i vaš skup podataka.
bashhf auth login - 2Pročitajte opcije jednom
Svako polje konfiguracije pajplajna i politike je zastavica. Prelistajte je pre nego što se udubite u izvorni kod.
bashlerobot-train --help - 3Pokrenite fino podešavanje
Primer iz dokumentacije pokreće batch 64 na jednom A100; sopstveni A100 40 GB anchor iz vodiča za računanje je batch 16, a 8 je ekvivalent za 24 GB. Nema zastavice za scheduler ovde namerno, pogledajte ispod.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/so100_pick_place \ --batch_size=8 \ --steps=20000 \ --save_freq=2000 \ --log_freq=200 \ --seed=1000 \ --output_dir=outputs/train/smolvla_pick_place \ --job_name=smolvla_pick_place \ --policy.device=cuda \ --wandb.enable=true - 4Pročitajte liniju loga, ne samo gubitak
Na svakih --log_freq koraka lerobot ispisuje loss, grdn, lr, updt_s, data_s, smp/s i, na CUDA-i, mem_gb. mem_gb govori da li batch staje, lr da li se raspored smanjuje, a data_s koji se približava updt_s znači da je dataloader usko grlo, a ne GPU.
bash# if data_s creeps toward updt_s lerobot-train ... --num_workers=8 - 5Sakupite kontrolne tačke koje možete uporediti
save_freq podrazumevano iznosi 20000, tako da pokretanje od 20000 koraka ostavlja jednu kontrolnu tačku i ništa za poređenje. Postavite na 2000. Guranje na Hub zahteva --policy.repo_id.
bash--save_freq=2000 \ --policy.repo_id=${HF_USER}/smolvla_pick_place \ --save_checkpoint_to_hub=true - 6Nastavite ako mašina prestane sa radom
Usmjerite --config_path na train_config.json pored kontrolne tačke. lerobot odbija da se pokrene u postojećem output_dir-u osim ako ne nastavljate, tako da ne možete slučajno prepisati pokretanje.
bashlerobot-train \ --config_path=<path to the saved train_config.json> \ --resume=true
Zastavice koje zapravo menjaju ishod
| Zastavica | Šta radi | Na 24 GB |
|---|---|---|
| --batch_size | Uzorci po koraku, približno linearno u VRAM-u | 4 to 8 |
| --steps | Ukupni koraci optimizatora | 20000 prvi prolaz |
| --policy.scheduler_decay_steps | Dužina kosinusnog opadanja, unapred podešeno 30000 | Deluje samo iznad 30000 |
| --policy.use_amp | Mešovita preciznost; SmolVLA nema polje dtype | true kada je memorija ograničena |
| --num_workers | Procesi dataloader-a, podrazumevano 4 | Povećavajte dok data_s ne prestane da raste |
| --dataset.eval_split | Deo epizoda zadržanih po zadatku | 0.1, with --eval_steps |
| --policy.freeze_vision_encoder | Održava vizuelni enkoder zamrznutim | true na 24 GB |
| --policy.train_expert_only | Samo ~100 M ekspert dobija gradijente | true prvo |
SmolVLA unapred postavlja kosinusni raspored: `scheduler_warmup_steps = 1000`, `scheduler_decay_steps = 30000`, `scheduler_decay_lr = 2.5e-6`. Stariji saveti kažu da se pokretanje od 20000 koraka stoga zaustavlja usred opadanja. U verziji 0.6.1 to se ne dešava: `CosineDecayWithWarmupSchedulerConfig.build()` dobija `--steps`, i ispod `num_decay_steps` on skalira oba, zagrevanje sa 1000 na 666 i opadanje sa 30000 na 20000, štampajući *Auto-scaling LR scheduler*. Nikada ne skalira naviše: opadanje je ograničeno sa `min(current_step, decay_steps)`, tako da standardni `--steps=100000` ostaje na minimumu od koraka 30000 do kraja, 70 procenata izvršavanja. Samo ta duga strana i dalje zahteva `--policy.scheduler_decay_steps`. Kolona `lr` je mesto gde proveravate.
Podrazumevane vrednosti koje nasleđujete ako ništa ne dirate
A konfiguracija u lerobot-u nosi sopstveni optimizator i unapred podešeni raspored, i osim ako ne postavite use_policy_training_preset=false ti unapred podešeni parametri pobeđuju. Polovina pitanja koja ljudi postavljaju o SmolVLA treningu odgovorena je podrazumevanom vrednošću za koju nisu znali da postoji.
| Podešavanje | Podrazumevano u lerobot 0.6.1 | Definisano u |
|---|---|---|
| chunk_size / n_action_steps | 50 / 50 | SmolVLAConfig |
| num_steps (denoising usklađivanja toka) | 10 | SmolVLAConfig |
| optimizer_lr | 1e-4 | SmolVLAConfig |
| scheduler_warmup_steps | 1000 | SmolVLAConfig |
| scheduler_decay_steps | 30000 | SmolVLAConfig |
| scheduler_decay_lr | 2.5e-6 | SmolVLAConfig |
| freeze_vision_encoder | true | SmolVLAConfig |
| train_expert_only | true | SmolVLAConfig |
| batch_size / steps | 8 / 100000 | TrainPipelineConfig |
| seed / save_freq / num_workers | 1000 / 20000 / 4 | TrainPipelineConfig |
Dve linije koje iznenađuju ljude su freeze_vision_encoder i train_expert_only, obe tačne. Podrazumevano trenirate otprilike 100 M parametara, a ne 450 M, zbog čega staje na 24 GB. Sopstveno referentno pokretanje LeRobot-a na H100 klasteru sa četiri GPU-a prebacuje obe na false; na jednoj kartici od 24 GB to pretvara ispravno pokretanje u .
Savet vodiča kada ste ograničeni memorijom je da smanjite veličinu paketa (batch size) i koristite akumulaciju gradijenta (gradient accumulation) da biste povratili efektivni paket. Nema akumulacije gradijenta u lerobot 0.6.1: TrainPipelineConfig nema takvo polje i string se ne pojavljuje nigde u objavljenom paketu. AY-Robots obrazac prikazuje vrednost akumulacije gradijenta od 8 za SmolVLA i ne primenjuje je. Vaše poluge na 24 GB su --batch_size, dve podrazumevane vrednosti zamrzavanja, i --policy.use_amp.
Koliko dugo traje pokretanje i koliko koraka je dovoljno
LeRobot objavljuje vremenske (wall-clock) reference za pet epoha preko skupa podataka od otprilike 50 epizoda, oko 45000 frejmova pri 30 fps. Brojke reda veličine, kažu dokumenti, ali one čine razliku između očekivanja sata i dana.
| Podešavanje | Politika | Serija | Realno vreme |
|---|---|---|---|
| Single L4 / A10G (24 GB) | smolvla | 4 | about 3 to 6 h |
| Single A100 40 GB | smolvla | 16 | about 1 to 2 h |
| 4 x H100 80 GB with accelerate | smolvla | 32 | about 1 to 2 h |
| Single RTX 4090 / RTX 3090 (24 GB) | act | 8 | about 30 to 60 min |
Pravilo je 5 do 10 epoha preko skupa podataka, a ne fiksni broj koraka: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)) . Na referentnom skupu podataka na koji dokumentacija ukazuje, lerobot/svla_so100_pickplace, metapodaci prijavljuju 50 epizoda i 19631 frejm: serija od 8 daje oko 2454 koraka po epohi, tako da je 20000 koraka otprilike 8 epoha. Prepolovite seriju i isti budžet kupuje pola epoha, pa ponovite ovo kad god menjate --batch_size.
Pokretanje fino podešene politike nazad na ruci
lerobot-rollout \
--strategy.type=base \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.id=my_follower_arm \
--robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
--task="Grasp the cube and put it in the box." \
--policy.path=${HF_USER}/smolvla_pick_place245 ms po koraku akcije je lako pogrešno protumačiti: politika emituje chunk_size = 50 akcija po prolazu unapred i izvršava n_action_steps = 50 od njih, tako da je učestalost plaćanja tog troška određena tim parametrima, a ne učestalošću kojom servoi dobijaju komandu. To je ono što razdvajanje akcija omogućava, i zašto model od 245 ms može da pokreće ruku od 30 Hz. Ono što preostaje je kašnjenje inferencije na kraju bloka.
| Merenje (SmolVLA, pravi SO-100) | Sinhrono | Asinhrono |
|---|---|---|
| Vreme završetka, uzmi i postavi, 10 pokušaja | 13.75 s | 9.70 s |
| Ciklusi uzmi i postavi u fiksnom vremenskom prozoru | 9 | 19 |
| Stopa uspešnosti prosečna za tri zadatka | 78.3 % | 73.3 % |
Taj treći red je ono što većina tekstova preskače. Asinhrona inferencija je oko 30 procenata brža i otprilike udvostručuje propusnost u fiksnom vremenskom prozoru, a rad navodi da su stope uspešnosti uporedive, što u proseku i jesu. Ispod toga, sortiranje je palo sa 70 na 50 procenata, dok je uzmi i postavi dobilo 5. lerobot 0.6.1 nosi drugu polugu u istom binarnom fajlu: --inference.type=rtc prebacuje izvođenje na razdvajanje u realnom vremenu, što sopstveni blok upotrebe skripte preporučuje za spore VLA-ove, Pi0, Pi0.5 i SmolVLA.
Kontrolna petlja je 20 do 485 ms po koraku akcije u zavisnosti od modela, a povratna putovanja preko javnog interneta pretvaraju funkcionalnu politiku u oklevajuću. Daljinska inferencija je izvodljiva za sporo uzmi i postavi, ali ne i za brzo reaktivno kretanje: ako zadatak zahteva brze korekcije, GPU pripada istoj LAN mreži kao i ruka.
Dva puta do iste kontrolne tačke
Vi posedujete mašinu, okruženje i otklanjanje grešaka. Jedina zavisnost od oblaka je preuzimanje osnovne kontrolne tačke sa Huba. Pravi put ako želite da modifikujete politiku, ako podaci ne mogu napustiti vašu mrežu, ili ako je kartica neaktivna.
- Vi kontrolišete CUDA točak, drajver, ffmpeg build i dataloader.
- Možete zakrpiti configuration_smolvla.py i ponovo trenirati istog popodneva.
- Plaćate strujom i vremenom, ne po pokretanju, i sami otklanjate greške u TorchCodec-u.
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login
lerobot-train \
--policy.path=lerobot/smolvla_base \
--dataset.repo_id=${HF_USER}/so100_pick_place \
--batch_size=8 --steps=20000 \
--save_freq=2000 --seed=1000 \
--output_dir=outputs/train/smolvla_pick_place \
--job_name=smolvla_pick_place \
--policy.device=cuda --wandb.enable=trueIsto pokretanje iza forme: birate model i skup podataka, pozadinski sistem iznajmljuje GPU prema potrebnom VRAM-u, pokreće trenera i upisuje kontrolne tačke u skladište objekata. Skup podataka može doći iz Hugging Face repo id-a, javnog direktorijuma, ili vaše mašine. Počnite na SmolVLA na SO-100, ili matrici na stranici za obuku.
| Polje | Podrazumevano što platforma šalje za SmolVLA | Napomena |
|---|---|---|
| veličina paketa | 2 | Konzervativno za nivo od 24 GB |
| stopa učenja | 1e-4 | Lerobot predpodešavanje |
| maksimalni koraci | 20000 | Referentno pokretanje u LeRobot dokumentaciji |
| akumulacija gradijenta | 8 | Prikazano u formi, nije primenjeno |
| dodatna podešavanja | seed, logFreq | Seed čini pokretanje ponovljivim |
- 2 do 5 sati na nivou od 24 GB, oko 1 do 3 USD po pokretanju.
- Iste operacije sa terminala na /cli i od AI agenata na /mcp.
- Inference podovi nose idle watchdog, tako da se zaboravljeni pod uništava umesto da tiho naplaćuje.
- Još uvek nemate ruku? /live strimuje fizički SO-100 koji možete voziti bez registracije.
Posao zaglavljen u redu čekanja je simptom spot tržišta, a ne greška: posao obuke zaglavljen u redu čekanja. Korak po korak: obučite svoju prvu politiku i dokumentacija za obuku.
Kada je SmolVLA pogrešan izbor
Test da li je SmolVLA bio pravi prvi pokušaj nije u tome da li je uspeo, već u tome da li vam je neuspeh nešto rekao. Dostignite 60 ili 70 procenata i veći model je razuman sledeći korak: podaci nose signal. Dostignite 10 procenata i model od 3 B će najverovatnije takođe dostići 10 procenata, što ste upravo naučili za tri dolara umesto dvanaest.

Vredi pročitati pre nego što potrošite više: Pi0.5 protiv SmolVLA za veći kapacitet na istoj ideji, i GR00T N1.7 protiv SmolVLA za NVIDIA put, oba 80 GB nivoa po ceni od 4 do 12 USD po pokretanju. Drugi način, ACT je jeftinija osnova: 80 M parametara, 20 ms po koraku akcije, bez jezičkog uslovljavanja. Svih pet se nalazi na stranici sa politikama; areni ima 85 modela i 332 rezultata benčmarka.

Kontrolna lista pre nego što bilo šta skalirate
- Da li je
lrdostigao svoj minimum od 2.5e-6? Ispod 30000 koraka lerobot preskalira opadanje i to navodi pri pokretanju; iznad toga, sami podesite--policy.scheduler_decay_steps. - Više od jedne kontrolne tačke i epizode izdvojene sa
--dataset.eval_splittako da gubitak evaluacije nešto znači. - Da li se politika uopšte pomera? Opadajući gubitak sa nepokretnom rukom ima specifične uzroke: gubitak opada, politika ne radi ništa.
- Da li preživljava promenu scene? Ako ne: politika radi samo u jednom podešavanju.
- Da li ste zapisali seed? lerobot podrazumevano koristi 1000, tako da dva netaknuta pokretanja ostaju uporediva.
- Tek tada: više epizoda, više varijacija ili veći model. Tim redosledom.
Zašto ovi modeli postoje i šta rade sa jezičkim unosom, je pozadina; vodi montažu kroz do prvog pokretanja . Za završenu kontrolnu tačku, ; ako se ruka nikada ne pojavi, .
Obučite SmolVLA na svojoj ruci
Izaberite model i ruku, a vodič vam daje tačne podrazumevane vrednosti, format skupa podataka i cenu pokretanja. SmolVLA se nalazi na nivou od 24 GB po ceni od 1 do 3 USD po pokretanju.
Otvorite vodiče za obukuMogu li zaista fino podesiti SmolVLA na RTX 4090?▾
Da. LeRobot-ov vodič za računanje procenjuje SmolVLA na otprilike 10 do 16 GB vršnog VRAM-a pri batch 8 sa AdamW i navodi da su potrošačke kartice od 24 GB udobne za to. Batch 64 u primeru dokumentacije je uparen sa jednim A100. Memorija se skalira približno linearno sa batch-om, pa koristite 4 ili 8 i pratite mem_gb.
Koliko mi je epizoda zapravo potrebno?▾
AY-Robots postavlja minimum na 30. LeRobot dokumentacija preporučuje oko 50 i izveštava da je 25 epizoda istog zadatka loše funkcionisalo. Struktura je važnija od broja: referentni skup je bio 5 pozicija kocke sa po 10 epizoda, i to ponavljanje je ono što generalizuje.
Dokumentacija kaže batch 64, platforma šalje batch 2. Šta je ispravno?▾
Oba, za različit hardver. Primer iz dokumentacije koristi batch 64 i navodi oko 4 sata za 20000 koraka na jednom A100; sidro A100 40 GB u vodiču za računanje je batch 16. Batch 2 je ono što AY-Robots šalje na nivou od 24 GB. Lokalno je 4 do 8 sredina, i aritmetika epoha se menja sa tim.
SmolVLA ili ACT za prvo pokretanje na SO-100?▾
ACT ako je zadatak jedno ponavljajuće kretanje i želite najbržu petlju: 20 ms po koraku akcije, 80 M parametara, bez jezičkog uslovljavanja. SmolVLA ako želite jezičko uslovljavanje, nekoliko nizova zadataka u jednoj kontrolnoj tački i unapred obučenu bazu. Oba se nalaze na nivou od 24 GB, tako da je izbor zadatak, a ne budžet.
Da li moram da postavim --policy.scheduler_decay_steps?▾
Samo kada je --steps iznad 30000. SmolVLA unapred postavlja kosinusni opadanje na 30000 koraka, a lerobot 0.6.1 ga samostalno smanjuje za kraće pokretanje, beležeći "Auto-scaling LR scheduler" kada to radi. Nikada se ne skalira naviše, tako da podrazumevani --steps=100000 ostavlja poslednjih 70000 koraka na podu od 2.5e-6.
Sources
- SmolVLA: Model vida, jezika i akcije za pristupačnu i efikasnu robotiku
- SmolVLA: Efikasan model vida, jezika i akcije (Hugging Face blog)
- lerobot/smolvla_base kartica modela
- LeRobot dokumentacija: SmolVLA
- LeRobot dokumentacija: Vodič za računarski hardver za LeRobot obuku
- LeRobot dokumentacija: Instalacija
- LeRobot dokumentacija: LeRobotDataset v3.0 i konverter v2.1
- LeRobot dokumentacija: Asinhrono zaključivanje
- lerobot v0.6.1: configuration_smolvla.py
- lerobot v0.6.1: TrainPipelineConfig
- lerobot v0.6.1: CosineDecayWithWarmupSchedulerConfig
- lerobot v0.6.1: lerobot_rollout.py (strategije i RTC zaključivanje)
- lerobot v0.6.1: pyproject.toml (dodaci i ulazne tačke konzole)
- lerobot na PyPI
- lerobot/svla_so100_pickplace skup podataka (50 epizoda, 19631 frejm, v3.0)
Sources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot/smolvla_base model card
- LeRobot docs: SmolVLA
- LeRobot docs: Compute HW Guide for LeRobot Training
- LeRobot docs: Installation
- LeRobot docs: LeRobotDataset v3.0 and the v2.1 converter
- LeRobot docs: Asynchronous Inference
- lerobot v0.6.1: configuration_smolvla.py
- lerobot v0.6.1: TrainPipelineConfig
- lerobot v0.6.1: CosineDecayWithWarmupSchedulerConfig
- lerobot v0.6.1: lerobot_rollout.py (strategies and RTC inference)
- lerobot v0.6.1: pyproject.toml (extras and console entry points)
- lerobot on PyPI
- lerobot/svla_so100_pickplace dataset (50 episodes, 19631 frames, v3.0)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started