
Fino podesite Pi0.5, VLA model za podudaranje toka (flow-matching VLA) tvrtke Physical Intelligence, na vlastitim robotskim podacima. Stvarne komande za openpi i lerobot pi05, zamke formata skupa podataka, ograničenja VRAM-a i latencije.
Pi0.5 je model za kojim posežete kada politika mora da radi u prostoriji koju nikada nije videla. Takođe je i najnezgodniji od pet politika koje se mogu trenirati ovde za fino podešavanje ručno: uzvodno spremište je prvo JAX, LeRobot port je premestio implementaciju iz lerobot-record-a u 0.6.0 i učinio osnovnu instalaciju premalom za treniranje, a potpuno fino podešavanje ne staje na 4090. Ispod: šta usklađivanje toka košta pri inferenciji, dve komandne rute i broj od 485 ms koji odlučuje da li je rezultat upotrebljiv.
Šta treba da znate
- •VLA sa usklađivanjem toka: 3B PaliGemma VLM plus 300M akcioni ekspert koji dekodira kontinuirane segmente akcija. Dva načina za fino podešavanje, openpi i LeRobot pi05, udaljeni 0,65 poena na LIBERO proseku.
- •Potpuno fino podešavanje zahteva više od 70 GB VRAM-a. openpi navodi LoRA na 22,5 GB, samo na svojoj JAX putanji.
- •Skup podataka mora biti LeRobotDataset v3.0 sa q01 i q99 kvantilima u meta/stats.json, inače prva serija baca grešku.
- •Prvo proverite svoju lerobot verziju: 0.6.0 je osnovni paket učinio laganim i premestio implementaciju iz lerobot-record-a.
- •Ovde radi na 485 ms po koraku akcije, zahteva 50 epizoda i košta oko 4 do 12 USD po pokretanju.
Šta je Pi0.5 zapravo
Physical Intelligence je objavio pi0 u oktobru 2024: model sa usklađivanjem toka vizuelno-jezičko-akcioni model na prethodno obučenom VLM-u: PaliGemma sa 3 milijarde parametara plus 300M akcioni ekspert inicijalizovan od nule, ukupno 3,3 milijarde. Rad izveštava o pre-treningu na preko 10.000 sati robotskih podataka kroz 7 robotskih konfiguracija i 68 zadataka. Više u članku o pi0.
Pi0.5 (arXiv 2504.16054, 22. april 2025) zadržava taj kostur i mijenja režim obuke: web podaci, detekcija objekata, verbalne instrukcije od ljudi koji obučavaju robota, oznake podzadataka, podaci o unakrsnom utjelovljenju od robota u mnogim domovima. Rezultat je robot koji čisti kuhinje u kućama koje nisu bile u skupu za obuku. README datoteka openpi dodaje detalj koji naslov ne sadrži: objavljeni pi0.5 je obučen sa izolacijom znanja (arXiv 2505.23705).
| Svojstvo | pi0 | pi0.5 |
|---|---|---|
| Varijanta VLM okosnice | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Varijanta eksperta za akcije | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| podrazumevani akcioni horizont | 50 | 50 |
| maksimalna dužina tokena | 48 | 200 |
| diskretni ulaz stanja | false | true, stanje diskretizovano u segmente u promptu |
| Osnovna kontrolna tačka | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
README datoteka openpi je eksplicitna: repozitorijum podržava samo glavu za podudaranje toka, za obuku i inferenciju pi0.5. Rad opisuje dvije faze, a kod sadrži samo drugu: pre-obuka predstavlja svaku akciju kao diskretne tokene putem FAST tokenizatora, a pri implementaciji model zaključuje podzadatak visokog nivoa prije svakog bloka akcija. Ništa od toga nije u repozitorijumu. Kartica lerobot/pi05_base daje istu listu i dodaje RL, iako rad o pi0.5 uopšte ne opisuje fazu učenja potkrepljivanjem. LeRobot port nasljeđuje taj opseg, kao i svaki hostovani trener na njemu, uključujući ovaj ovdje. Licenciranje je takođe podijeljeno: stranica dokumentacije pi05 kaže Apache 2.0, kartica lerobot/pi05_base je označena sa license: gemma.
Šta podudaranje toka mijenja u vezi sa obukom i inferencijom
Politika politika koju možete trenirati na SO-100 ili direktno regresira akcije (ACT) ili ih tokenizira i autoregresivno dekodira (pi0-FAST). Usklađivanje toka ne radi nijedno od toga: ono uči vektorsko polje koje prenosi šum do čistog bloka akcija, a zatim ga integriše. Rad o pi0 koristi 10 koraka integracije sa veličinom koraka 0.1; LeRobot-ova pi05 konfiguracija sadrži isti `num_inference_steps: int = 10`.
- Trening: gubitak regresira bučni blok akcija. Nema tokenizatora za podešavanje, nema diskretizacije vaših zglobnih uglova.
- Inferencija: jedan blok košta deset prolaza unaprijed kroz eksperta za akcije. To je strukturno, a ne problem podešavanja.
- Izlaz: kontinuirane akcije dimenzije 32, interno popunjene, gubitak uzet na dimenzijama koje vaš robot ima. Ruka sa 6-DoF plus hvataljka koristi 7.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma okosnica, i kapija ispred nje
PaliGemma (arXiv 2407.07726) je SigLIP-So400m vizualni enkoder na Gemma-2B jezičnom modelu, sa oko 3B parametara. Pi0.5 nasljeđuje svoj tokenizator, a taj tokenizator se nalazi u zatvorenom repozitoriju. Ovo je najčešći način na koji prvi pokretaj propadne, prije prvog koraka obuke.
Dokumentacija LeRobot pi05 jasno navodi: pi0.5 koristi zatvoreni google/paligemma-3b-pt-224 tokenizator, stoga prihvatite njegovu licencu na Hubu i prvo pokrenite hf auth login. Pristup se odobrava ručno, ne trenutno. Preskočite to, pokrenite plaćeno pokretanje u oblaku i platit ćete za pod koji ne može preuzeti tokenizator.
Prije nego počnete: format skupa podataka, epizode, hardver
Pi0.5 u LeRobotu čita LeRobot skup podataka u v3.0 rasporedu, koji je stigao s lerobot 0.4.0 u oktobru 2025: mnogo epizoda po Parquet i MP4 datoteci umjesto jedne datoteke po epizodi, sa granicama u meta/episodes/ umjesto u nazivima datoteka. Snimite pomoću desktop klijenta ili slijedite snimite svoj prvi skup podataka i imat ćete ga.
| Način | Potrebna GPU memorija | Primjer GPU-a |
|---|---|---|
| Inferencija | više od 8 GB | RTX 4090 |
| Fino podešavanje, LoRA | više od 22.5 GB | RTX 4090 |
| Fino podešavanje, puno | više od 70 GB | A100 80 GB ili H100 |
Pi0.5 i SmolVLA žele LeRobot v3.0. GR00T N1.7 i GR00T N1.5 žele v2.0 ili v2.1 i ruše se na v3.0 skupu podataka. Jedna sesija snimanja ne može hraniti oba bez konverzije, a greška ne kaže "pogrešna verzija skupa podataka". Pogledajte skup podataka odbijen: v3 potreban.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPlatforma želi najmanje 50 epizoda za Pi0.5, isti minimum kao za GR00T i ACT. Predobuka obavlja najveći dio posla, tako da 50 čistih epizoda pobjeđuje 200 neurednih. Novi ste u ovome? Počnite sa vodičem za prikupljanje podataka.

Ruta A: fino podešavanje sa openpi repozitorijumom
Referentna implementacija: prvo JAX, testirano samo na Ubuntu 22.04, vođeno konfiguracionim objektima umesto zastavicama. PyTorch putanja je stigla u septembru 2025, validirana na LIBERO. Tri koraka: konvertujte svoje podatke, definišite konfiguraciju, trenirajte i poslužite.
- 1Klonirajte i instalirajte
openpi koristi uv. GIT_LFS_SKIP_SMUDGE omogućava da LeRobot dođe kao zavisnost bez LFS blobova.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Konvertujte svoje podatke u LeRobot skup podataka
Upstream isporučuje konvertere za LIBERO i DROID i očekuje da prilagodite jedan. Posao je mapiranje ključeva.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Dodajte konfiguraciju za treniranje
Konfiguracije su TrainConfig unosi u src/openpi/training/config.py. Ova prilagođava pi05_droid_finetune, sa učitavačem težina usmerenim na pi05_base.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Izračunajte normirane statistike
Pokreće se prema imenu konfiguracije, a ne skupu podataka. Preskakanje je klasičan prvi neuspeh ovde.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Trenirajte
Varijabla omogućava JAX-u da koristi 90 posto GPU memorije umesto podrazumevanih 75. Na kartici od 80 GB to odlučuje da li će se pokretanje preživeti.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Poslužite ga
Server sluša na portu 8000 i odgovara na upite za posmatranje; vaše robotsko okruženje je klijent.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi-jeva PyTorch implementacija ne podržava pi0-FAST, mješovitu preciznost, FSDP, LoRA ili EMA težine, tako da je LoRA koja dostiže 22.5 GB samo za JAX, putem gemma_2b_lora i gemma_300m_lora varijanti. Još gore: podešavanje kopira zakrpljene datoteke preko vaših instaliranih transformers 4.53.2, a README upozorava da sa uv-ovim podrazumijevanim načinom hardlinka ovo trajno mijenja transformere u uv kešu i može se proširiti na druge projekte. Poništite to sa uv cache clean transformers.
Ruta B: fino podešavanje sa lerobot pi05
LeRobot port obuhvata iste težine u CLI-ju koji već koristite za ACT i SmolVLA. Sve ispod je provjereno u odnosu na lerobot 0.6.1, izdanje od 3. avgusta 2026, i pi05 dokumentaciju od 23. avgusta 2026. Verzije su ovdje bitne: v3.0 skupovi podataka stigli su sa 0.4.0 u oktobru 2025, blog 0.5.0 od 9. marta 2026. predstavlja pi0-FAST i Real-Time Chunking, a 0.6.0 od 6. jula 2026. učinio je osnovni paket laganim i premjestio implementaciju na lerobot-rollout.
Jedna stvar se nije pomjerila: lerobot-train i lerobot-record su već bili ulazne tačke u 0.3.2, avgusta 2025. Tutorijal koji još uvijek poziva python -m lerobot.scripts.train prethodi godini promjena i vrijedi mu ne vjerovati ni u ostalom.
- 1Instalacija sa pravim dodacima
Od verzije 0.6.0 osnovna instalacija sadrži samo osnovne ML zavisnosti, a pi dodatak ne dodaje kod za skup podataka ili obuku, tako da fino podešavanje zahteva i dodatak za obuku. Starije jednolinijske komande ovde ne uspevaju prilikom uvoza.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Autentifikacija
Prihvatite licencu paligemma-3b-pt-224 u pregledaču, a zatim se prijavite na mašini koja vrši obuku.
bashhf auth login - 3Dodavanje kvantilnih statistika
Pi0.5 normalizuje STATE i ACTION pomoću kvantila, tako da meta/stats.json zahteva q01 i q99. Stariji skupovi podataka sadrže samo min, max, mean, std.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4Fino podešavanje iz lerobot/pi05_base
Podesite veličinu paketa na ono što vaša kartica može da podnese; dokumentacija koristi 64 na LIBERO-u sa 80 GB. Eksplicitno prosledite bfloat16, podrazumevana konfiguracija je float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Pokrenite ga na ruci
U verziji 0.6.x ovo je lerobot-rollout: lerobot-record odbija politiku i odbacuje nazive eval_ skupova podataka. Base upravlja rukom, sentry snima izvođenje.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Zastava | Šta radi | Napomena |
|---|---|---|
| --policy.type=pi05 | bira Pi0.5 | obavezno sa pretrained_path, izostavite sa --policy.path |
| --policy.pretrained_path | učitava samo težine | nazivi funkcija iz vašeg skupa podataka, sačuvana podešavanja se resetuju |
| --policy.path | težine plus config.json kontrolne tačke | sačuvana podešavanja kao što je n_action_steps se nasleđuju |
| --policy.n_action_steps | koraci potrošeni po delu | vraća se na 50, nikada iznad chunk_size (podrazumevano 50) |
| --policy.train_expert_only | zamrzava VLM, obučava eksperta | podrazumevano false, manje memorije, neki trošak u uspehu |
| --policy.gradient_checkpointing | ponovo izračunava umesto da skladišti aktivacije | podrazumevano false, prva poluga kada se pokretanje neće uklopiti |
| --peft.method_type=LORA | LoRA adapteri umesto punih težina | zahteva peft dodatak, dokumentovani primer je SmolVLA |
| --policy.rtc_training_max_delay | kondicioniranje prefiksa akcije za RTC | samo glavna grana, nije u 0.6.1, mora ostati ispod chunk_size |
| --rename_map | mapira kolone skupa podataka na funkcije politike | potrebno kada se vaši ključevi kamere razlikuju |
Bez kvantila dobijate ValueError: QUANTILES normalization mode requires q01 and q99 stats na prvom paketu. Ponovo izračunajte statistike, ali rezultat se nalazi u $HF_LEROBOT_HOME/your_dataset, a ne u kešu koji čita --dataset.repo_id, pa obučavajte sa --dataset.root koji pokazuje tamo ili gurnite na Hub. Ili preskočite kvantile sa --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kao što to radi referentna komanda LIBERO.
Tri skupa podrazumevanih vrednosti i koje od njih stižu do trenera
openpi-jev TrainConfig je referenca, LeRobot-ov PI05Config je ono što lerobot-train koristi kada ništa ne kažete, a obrazac ovdje šalje treći skup. Iznenađenje je stopa učenja: oba podrazumijevana podešavanja dostižu vrhunac na 2.5e-5, dok openpi-jev vlastiti pi05_libero config i ova platforma je podižu na 5e-5.
| Postavka | openpi TrainConfig | lerobot pi05 i lerobot-train | AY-Robots šalje |
|---|---|---|---|
| Veličina paketa | 32 | 8 | 1 |
| Vršna stopa učenja | 2.5e-5, kosinusni pad | optimizer_lr 2.5e-5 | 5e-5 |
| Koraci obuke | 30,000 | 100,000 | 30,000 |
| Interval kontrolne tačke | 1,000 steps | 20,000 steps | nije u obrascu |
| Sjeme | 42 | 1,000 | u obrascu |
| Akcioni blok | action_horizon 50 | chunk_size 50, n_action_steps 50 | nije u obrascu |
| Tip podataka težine | bfloat16 | float32 dok ne proslijedite --policy.dtype | nije u obrascu |
| Akumulacija gradijenta | nema takvog prekidača, umjesto toga fsdp_devices | odsutno iz svakog izdanja do sada | 16, i ispušteno je |
Je li port vjeran? Tim LeRobot-a je dodatno fino podesio osnovni model LIBERO za 6k koraka i uporedio ga sa referentnim brojevima openpi-ja na četiri paketa: 97.5 posto prosječno naspram 96.85, ispred na Libero 10, iza na Spatial. Ruta je izbor alata, a ne kvaliteta.
- Više od 10.000 sati pre-obuke robota stoji iza toga, tako da 50 epizoda vašeg zadatka može biti dovoljno.
- Kontinuirane akcije: nema tokenizatora za podešavanje, nema diskretizacijskog praga na vašim zglobnim uglovima.
- LeRobot port postiže 97.5 posto na LIBERO prosjeku naspram openpi-jevih 96.85, tako da prijateljskiji CLI ne košta ništa mjerljivo.
- Parametarski efikasne putanje na obje strane: openpi-jeve JAX LoRA varijante, LeRobot-ova PEFT integracija.
- Potpuno fino podešavanje zahtijeva više od 70 GB. Broj od 22.5 GB LoRA je openpi-jev JAX broj; nijedan nije objavljen za pi05 pod PEFT-om.
- 485 ms po akcionom koraku, najsporiji od pet ovdje: dvostruko sporiji od SmolVLA, dvadeset četiri puta sporiji od ACT-a.
- LeRobot v3.0 je potreban, tako da se skup podataka snimljen za GR00T pokret mora konvertovati, i obrnuto.
- Nove opcije prvo dolaze na main: RTC i MEM memorija tokom obuke nisu u 0.6.1, tako da najnovija dokumentacija može značiti instalaciju sa git-a.
Stvarnost od 485 ms i gdje prestaje biti upotrebljiva
Ovo odlučuje o vašem projektu, stoga dolazi prije tabele troškova. po koraku akcije izmjereno ovdje za Pi0.5 iznosi 485 ms. U poređenju sa ostala četiri:
| Politika | Inferencija po koraku akcije | Parametri | GPU nivo | Minimalne epizode |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 ili bilo koja kartica od 24 GB | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB ili H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB ili H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 ili bilo koja kartica od 24 GB | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB ili H100 80 GB | 50 |

Kontrolna petlja u ovih pet modela traje 20 do 485 ms po koraku akcije. Povratna putovanja preko javnog interneta, povrh 485 ms, pretvaraju funkcionalnu politiku u oklijevajuću. Daljinska inferencija je izvodljiva za sporo uzimanje i postavljanje, ne za brzo reaktivno kretanje. Radije bismo to rekli nego prodali demo koji radi samo na LAN-u. Ako se vaša ruka zaustavlja između segmenata, počnite od politika se zamrzava usred kretanja.
Upstream ima odgovor, a pola toga je već u izdanju koje možete instalirati. Real-Time Chunking generira sljedeći segment dok ruka još uvijek izvršava trenutni, zatim vodi preklapajuće korake novog segmenta da ostanu blizu već izvršenog dijela, tako da se ruka ne zaustavlja ili trza na spoju. Oblik za vrijeme inferencije isporučen je u changelogu 0.4.2 za Pi0, Pi0.5 i SmolVLA i predstavlja zastavicu za implementaciju, a ne za ponovno treniranje:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60To ne čini model bržim. To skriva prazninu: 485 ms se i dalje troši, ali izvan kritične putanje, tako da red ne presuši između segmenata. Varijanta za vrijeme treniranja iz arXiv 2512.05964 ide dalje: model uči uvjetovati se na čistom prefiksu akcije, tako da se pri inferenciji preklapanje čvrsto 'inpainta' s vremenskim koracima toka po akciji umjesto da se vodi, a povratni prolaz vođenja nestaje. Tijekom treniranja uzorkuje duljinu prefiksa po primjeru i uzima gubitak toka na preostalom postfiksu. Ta zastavica postoji samo na glavnoj grani, ne u 0.6.1, a kašnjenje za koje trenirate mora ostati ispod chunk_size.
Dva načina za dobijanje Pi0.5 kontrolne tačke
Iznajmljujete ili posedujete karticu od 80 GB, instalirate jedan od gore navedenih stekova, konvertujete svoj skup podataka i nadgledate pokretanje. Zadržavate svaku kontrolu: openpi-jev JAX LoRA, LeRobot-ove PEFT adaptere, relativne akcije, prilagođena mapiranja tastera. Takođe zadržavate svaki neuspeh.
- Hardver: A100 80 GB ili H100, ili kartica od 24 GB na openpi-jevom JAX LoRA putu.
- Podešavanje: jedno popodne za prvo pokretanje, uglavnom mapiranje tastera i gated tokenizer.
- Nije na hostovanoj formi: PEFT adapteri, relativne akcije, RTC u vreme treninga, MEM memorija.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Birate model i skup podataka u formi za trening, backend iznajmljuje GPU na spot tržištu prema potrebnom VRAM-u, pokreće trenera i upisuje kontrolne tačke u skladište objekata. Pi0.5 je ovde samo u oblaku. Postoje vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.
| Podešavanje | Šta platforma šalje za Pi0.5 |
|---|---|
| Osnovna kontrolna tačka | lerobot/pi05_base |
| Tip politike | pi05 |
| Veličina paketa | 1 |
| Stopa učenja | 5e-5 |
| Maksimalni koraci | 30000 |
| Akumulacija gradijenta | 16, ali pogledajte upozorenje ispod |
| Dodatne kontrole u formi | seed, logFreq |
| Format skupa podataka | LeRobot v3.0 |
| GPU nivo | A100 80 GB ili H100 80 GB |
Trener šalje vrednost akumulacije gradijenta od 16, a lerobot 0.5.1 nema flag da je primi, pa se ona odbacuje. Nijedan objavljeni lerobot je nema: kontrola postoji samo na main grani, kao --accelerator.gradient_accumulation.steps. Efektivna veličina paketa ovde je 1, naspram 256 koje koristi openpi-jeva pi05_libero konfiguracija. Vredi znati pre nego što pročitate krivu gubitka. Kontrola se primenjuje na GR00T N1.7 i GR00T N1.5 pokretanja.
Inferencija radi na isti način: pod se obezbeđuje da služi politiku i vaš lokalni klijent razgovara sa njim. Pod ima idle watchdog i sam se uništava, tako da zaboravljena kartica ne naplaćuje tiho. Primjenjuje se upozorenje o latenciji, zbog čega ACT sa 20 ms često pobeđuje u brzom zadatku.
Kada ne radi
| Simptom | Najverovatniji uzrok |
|---|---|
| Pokretanje odbijeno pre početka | Skup podataka v2.1, ali Pi0.5 želi v3.0, ili obrnuto za GR00T |
| ImportError, nedostaje datasets paket | lerobot 0.6.x bez dodatka za trening |
| ValueError o q01 i q99 na prvom paketu | Nema kvantila u meta/stats.json; ponovo izračunajte ili koristite MEAN_STD |
| CUDA nema dovoljno memorije u koraku 0 | Potpuno fino podešavanje ispod 70 GB; pokušajte sa kontrolnim tačkama ili train_expert_only |
| 401 ili greška gated repozitorijuma | Licenca PaliGemma tokenizatora nije prihvaćena |
| Gubitak opada, robot ne radi ništa | Nepodudarnost normalizacije, ili politika kopira stanje |
| Ruka pauzira između delova | Latencija po koraku plus povratno putovanje; red čekanja za delove se isprazni |
| Radi u jednom podešavanju, ne radi u drugom | Previše malo epizoda, ili sve u jednoj konfiguraciji |
- Skup podataka odbijen: potrebna je v3
- Nedostatak memorije tokom obuke
- Gubitak opada, ali politika ne radi ništa
- Politika se zamrzava usred pokreta
- Politika radi samo u jednom podešavanju
- Posao obuke zaglavljen u redu čekanja
Koliko košta jedno pokretanje
Pi0.5 se nalazi u skupom sloju jer mu je potrebna kartica od 80 GB, a spot cijene se mijenjaju, tako da je broj raspon, a ne cijena. Za mnoge SO-100 zadatke, prvo obučite SmolVLA ili ACT na sloju od 24 GB, potvrdite da je zadatak uopšte naučiv, a zatim potrošite A100 sati na njega. Obučite svoju prvu politiku prolazi kroz tu jeftiniju petlju, a cijene sadrži trenutne slojeve.
| Sloj | Politike | Tipično pokretanje | Cijena po satu | Trošak po pokretanju |
|---|---|---|---|---|
| A100 80 GB ili H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 do 6 sati | 1.20 to 2.00 USD | oko 4 do 12 USD |
| RTX 4090 ili bilo koja kartica od 24 GB | SmolVLA, ACT | 2 do 5 sati | 0.30 to 0.60 USD | oko 1 do 3 USD |

Prije nego što posvetite veče: GR00T N1.7 protiv Pi0.5 i Pi0.5 protiv SmolVLA izlažu iste brojeve jedan pored drugog. Arena sadrži 85 VLA modela sa 332 rezultata benchmarka, svaki povezan sa svojim izvorom, a pozadina o porodici nalazi se u našem pregledu VLA modela.
Trenirajte Pi0.5 bez izgradnje steka
Odaberite skup podataka i hiperparametre u obrascu. Pozadinski sistem iznajmljuje karticu od 80 GB na spot tržištu, pokreće trener i piše kontrolne tačke u skladište objekata. Vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.
Otvorite vodiče za obukuMogu li fino podesiti Pi0.5 na RTX 4090?▾
Ne za potpuno fino podešavanje: openpi navodi više od 70 GB za to, tako da je potrebna A100 80 GB ili H100. Njegova cifra od 22.5 GB za LoRA pripada JAX putanji; PyTorch implementacija nema LoRA. LeRobotova PEFT integracija postoji, ali njen dokumentovani primjer je SmolVLA i nije objavljena cifra VRAM-a za pi05.
Koliko epizoda mi je potrebno?▾
Pedeset, isto kao i za GR00T i ACT; samo SmolVLA ide niže, na 30. Osnovna kontrolna tačka nosi više od 10,000 sati predobuke, tako da se fino podešavanje prilagođava, a ne uči od nule: 50 čistih, raznolikih epizoda nadmašuje dvjesto iz jedne konfiguracije.
Koja je razlika između --policy.path i --policy.pretrained_path?▾
--policy.path učitava težine i config.json kontrolne tačke, tako da se nasljeđuju pohranjene postavke kao što je n_action_steps i --policy.type mora biti izostavljen. --policy.pretrained_path učitava samo težine: nazivi funkcija dolaze iz vašeg skupa podataka, pohranjene postavke se resetuju, --policy.type je obavezan. Zato LIBERO komanda eksplicitno prosljeđuje n_action_steps=10 i empty_cameras=1; inače se vraćaju na 50 i 0.
Da li mi otvorena verzija daje puni Pi0.5 iz rada?▾
Ne. Oba podržavaju samo 'flow matching action head'. Faza predobuke diskretnih tokena sa FAST akcionim tokenizatorom i predviđanje podzadataka visokog nivoa nisu objavljeni, a lerobot/pi05_base kartica dodaje RL na tu listu iako rad o pi0.5 ne opisuje fazu učenja potkrepljenjem. Trenirate niskonivelnu politiku uslovljenu jezičkim nizom koji vi dostavite, a ne model koji sam dekomponuje dugi zadatak.
Protiv kojih verzija je napisan ovaj vodič?▾
openpi na main grani i lerobot 0.6.1, izdanje od 3. avgusta 2026., oba pročitana 23. avgusta 2026. Skupovi podataka v3.0 stigli su sa 0.4.0 u oktobru 2025. Verzija 0.6.0 učinila je osnovni paket laganim, tako da lerobot[pi] sam više ne instalira stek za obuku, i premjestila je implementaciju na lerobot-rollout. RTC u vrijeme obuke je samo na main grani; hostovani trener ovdje pokreće 0.5.1.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started