
Fino podesite Pi0.5, VLA model za usklađivanje toka (flow-matching) od Physical Intelligence, na podacima vašeg robota. Stvarne komande za openpi i lerobot pi05, zamke formata skupa podataka, VRAM i ograničenja latencije.
Pi0.5 je model koji birate kada politika mora da radi u prostoriji koju nikada ranije nije videla. Takođe je i najnezgodniji od pet politika koje se mogu trenirati ovde za fino podešavanje ručno: uzvodno skladište je prvenstveno JAX, LeRobot port je premestio implementaciju iz lerobot-record-a u verziji 0.6.0 i učinio osnovnu instalaciju premalom za treniranje, a potpuno fino podešavanje ne staje na 4090. Ispod: šta usklađivanje toka košta pri inferenciji, dve komandne rute i broj od 485 ms koji odlučuje da li je rezultat upotrebljiv.
Šta treba da znate
- •VLA za usklađivanje toka: 3B PaliGemma VLM plus 300M ekspert za akcije koji dekodira kontinuirane delove akcija. Dve rute za fino podešavanje, openpi i LeRobot pi05, udaljene 0.65 poena na LIBERO proseku.
- •Potpuno fino podešavanje zahteva više od 70 GB VRAM-a. openpi navodi LoRA na 22.5 GB, samo na svojoj JAX putanji.
- •Skup podataka mora biti LeRobotDataset v3.0 sa q01 i q99 kvantilima u meta/stats.json, inače prva serija baca grešku.
- •Prvo proverite svoju lerobot verziju: 0.6.0 je učinio osnovni paket laganim i premestio implementaciju iz lerobot-record-a.
- •Ovde radi na 485 ms po koraku akcije, zahteva 50 epizoda i košta oko 4 do 12 USD po pokretanju.
Šta je Pi0.5 zapravo
Physical Intelligence je objavio pi0 u oktobru 2024: model za usklađivanje toka model vida-jezika-akcije na unapred obučenom VLM-u: PaliGemma sa 3 milijarde parametara plus 300M ekspert za akcije inicijalizovan od nule, ukupno 3.3 milijarde. Rad izveštava o pre-treningu na preko 10,000 sati robotskih podataka kroz 7 robotskih konfiguracija i 68 zadataka. Više u članku o pi0.
Pi0.5 (arXiv 2504.16054, 22. april 2025) zadržava taj kostur i menja režim obuke: veb podaci, detekcija objekata, verbalna uputstva od ljudi koji obučavaju robota, oznake podzadataka, podaci o unakrsnom otelotvorenju od robota u mnogim domovima. Rezultat je robot koji čisti kuhinje u kućama koje nisu bile u skupu za obuku. openpi README dodaje detalj koji naslov ne sadrži: objavljeni pi0.5 je obučen sa knowledge insulation (arXiv 2505.23705).
| Svojstvo | pi0 | pi0.5 |
|---|---|---|
| VLM varijanta okosnice | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Varijanta akcionog eksperta | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| podrazumevani action_horizon | 50 | 50 |
| max_token_len | 48 | 200 |
| discrete_state_input | false | true, stanje diskretizovano u segmente u promptu |
| Osnovni kontrolni punkt | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README je eksplicitan: repozitorijum podržava samo flow matching head, kako za obuku tako i za inferenciju pi0.5. Rad opisuje dve faze, a kod sadrži samo drugu: pre-obuka predstavlja svaku akciju kao diskretne tokene putem FAST tokenizatora, a pri implementaciji model zaključuje podzadatak visokog nivoa pre svakog bloka akcija. Ništa od toga nije u repozitorijumu. Kartica lerobot/pi05_base daje istu listu i dodaje RL, iako rad o pi0.5 uopšte ne opisuje fazu učenja potkrepljivanjem. LeRobot port nasleđuje taj opseg, kao i svaki hostovani trener na njemu, uključujući ovaj ovde. Licenciranje je takođe podeljeno: pi05 doc page kaže Apache 2.0, kartica lerobot/pi05_base je označena sa license: gemma.
Šta flow matching menja u vezi sa obukom i inferencijom
A politika koju možete trenirati na SO-100 ili direktno regresira akcije (ACT) ili ih tokenizuje i dekodira autoregresivno (pi0-FAST). Usklađivanje toka ne radi ni jedno ni drugo: ono uči vektorsko polje koje prenosi šum do čistog segmenta akcije, a zatim ga integriše. Pi0 rad koristi 10 koraka integracije sa veličinom koraka 0.1; LeRobot-ova pi05 konfiguracija sadrži isti num_inference_steps: int = 10.
- Trening: gubitak regresira segment akcije sa šumom. Nema tokenizatora za podešavanje, nema diskretizacije vaših zglobnih uglova.
- Inferencija: jedan segment košta deset prolaza unapred kroz eksperta za akcije. To je strukturno, a ne problem podešavanja.
- Izlaz: kontinuirane akcije dimenzije 32, interno popunjene, gubitak se uzima na dimenzijama koje vaš robot ima. Ruka sa 6-stepeni slobode plus hvataljka koristi 7.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma okosnica i kapija ispred nje
PaliGemma (arXiv 2407.07726) je SigLIP-So400m vizuelni enkoder na Gemma-2B jezičkom modelu, sa oko 3B parametara. Pi0.5 nasleđuje svoj tokenizator, a taj tokenizator se nalazi u zatvorenom repozitorijumu. Ovo je najčešći način na koji prvi pokušaj propada, pre prvog koraka obuke.
Dokumentacija za LeRobot pi05 to jasno navodi: pi0.5 koristi zatvoreni google/paligemma-3b-pt-224 tokenizator, stoga prihvatite njegovu licencu na Hub-u i prvo pokrenite hf auth login. Pristup se odobrava ručno, ne trenutno. Preskočite to, pokrenite plaćeno izvršavanje u oblaku i platićete pod koji ne može da preuzme tokenizator.
Pre nego što počnete: format skupa podataka, epizode, hardver
Pi0.5 u LeRobot-u čita LeRobot skup podataka u v3.0 rasporedu, koji je stigao sa lerobot 0.4.0 u oktobru 2025: mnogo epizoda po Parquet i MP4 datoteci umesto jedne datoteke po epizodi, sa granicama u meta/episodes/ umesto u nazivima datoteka. Snimajte sa desktop klijentom ili pratite snimite svoj prvi skup podataka i imaćete ga.
| Režim | Potrebna GPU memorija | Primer GPU-a |
|---|---|---|
| Inferencija | više od 8 GB | RTX 4090 |
| Fino podešavanje, LoRA | više od 22.5 GB | RTX 4090 |
| Fino podešavanje, puno | više od 70 GB | A100 80 GB ili H100 |
Pi0.5 i SmolVLA zahtevaju LeRobot v3.0. GR00T N1.7 i GR00T N1.5 zahtevaju v2.0 ili v2.1 i padaju na skupu podataka v3.0. Jedna sesija snimanja ne može da napaja oba bez konverzije, a greška ne kaže "pogrešna verzija skupa podataka". Pogledajte skup podataka odbijen: v3 je potreban.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPlatforma zahteva najmanje 50 epizoda za Pi0.5, što je isti minimum kao za GR00T i ACT. Predobuka obavlja najveći deo posla, tako da 50 čistih epizoda vredi više od 200 neurednih. Novi ste u ovome? Počnite sa vodičem za prikupljanje podataka.

Ruta A: fino podešavanje pomoću openpi repozitorijuma
Referentna implementacija: prvo JAX, testirano samo na Ubuntu 22.04, vođeno konfiguracionim objektima umesto zastavicama. PyTorch putanja je stigla u septembru 2025, validirana na LIBERO. Tri koraka: konvertujte svoje podatke, definišite konfiguraciju, trenirajte i poslužite.
- 1Klonirajte i instalirajte
openpi koristi uv. GIT_LFS_SKIP_SMUDGE omogućava da LeRobot bude zavisnost bez LFS blobova.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Konvertujte svoje podatke u LeRobot skup podataka
Upstream isporučuje konvertore za LIBERO i DROID i očekuje da prilagodite jedan. Posao je mapiranje ključeva.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Dodajte konfiguraciju za obuku
Konfiguracije su TrainConfig unosi u src/openpi/training/config.py. Ova prilagođava pi05_droid_finetune, sa učitavačem težina usmerenim na pi05_base.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Izračunajte statistiku normi
Pokreće se u odnosu na naziv konfiguracije, a ne na skup podataka. Preskakanje ovoga je klasičan prvi neuspeh ovde.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Trenirajte
Varijabla omogućava JAX-u da koristi 90 posto GPU memorije umesto podrazumevanih 75. Na kartici od 80 GB to odlučuje da li će se pokretanje izvršiti do kraja.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Poslužite ga
Server sluša na portu 8000 i odgovara na upite za posmatranje; vaše robotsko okruženje je klijent.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi-jeva PyTorch implementacija ne podržava pi0-FAST, mešovitu preciznost, FSDP, LoRA ili EMA težine, tako da je LoRA koja dostiže 22.5 GB samo za JAX, putem varijanti gemma_2b_lora i gemma_300m_lora. Još gore: podešavanje kopira zakrpljene datoteke preko vaših instaliranih transformers 4.53.2, a README upozorava da sa podrazumevanim hardlink režimom uv-a ovo trajno menja transformers u uv kešu i može se proširiti na druge projekte. Poništite to sa uv cache clean transformers.
Ruta B: fino podešavanje sa lerobot pi05
LeRobot port obuhvata iste težine u CLI-u koji već koristite za ACT i SmolVLA. Sve dole navedeno je provereno u odnosu na lerobot 0.6.1, izdanje od 3. avgusta 2026, i pi05 dokumentaciju od 23. avgusta 2026. Verzije su ovde važne: v3.0 skupovi podataka stigli su sa 0.4.0 u oktobru 2025, blog 0.5.0 od 9. marta 2026. predstavlja pi0-FAST i Real-Time Chunking, a 0.6.0 od 6. jula 2026. učinio je osnovni paket laganim i prebacio implementaciju na lerobot-rollout.
Jedna stvar se nije promenila: lerobot-train i lerobot-record su već bili ulazne tačke u 0.3.2, avgusta 2025. Tutorijal koji i dalje poziva python -m lerobot.scripts.train prethodi godini promena i vredi mu ne verovati ni u ostalom.
- 1Instalacija sa pravim dodacima
Od verzije 0.6.0, osnovna instalacija sadrži samo osnovne ML zavisnosti, a 'pi' dodatak ne dodaje kod za skup podataka ili obuku, tako da fino podešavanje zahteva i 'training' dodatak. Starije jednolinijske komande ovde ne uspevaju pri uvozu.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Autentifikacija
Prihvatite licencu paligemma-3b-pt-224 u pregledaču, a zatim se prijavite na mašini koja vrši obuku.
bashhf auth login - 3Dodavanje kvantilnih statistika
Pi0.5 normalizuje STATE i ACTION pomoću kvantila, tako da meta/stats.json zahteva q01 i q99. Stariji skupovi podataka sadrže samo min, max, mean, std.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4Fino podešavanje iz lerobot/pi05_base
Podesite veličinu paketa (batch size) na ono što vaša kartica može da podnese; dokumentacija koristi 64 na LIBERO sa 80 GB. Eksplicitno prosledite bfloat16, podrazumevana vrednost konfiguracije je float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Pokrenite ga na ruci
U verziji 0.6.x ovo je lerobot-rollout: lerobot-record odbija politiku i odbacuje nazive eval_ skupova podataka. Base upravlja rukom, sentry snima izvođenje.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Zastava | Šta radi | Napomena |
|---|---|---|
| --policy.type=pi05 | bira Pi0.5 | obavezno sa pretrained_path, izostaviti sa --policy.path |
| --policy.pretrained_path | učitava samo težine | nazivi karakteristika iz vašeg skupa podataka, sačuvana podešavanja se resetuju |
| --policy.path | težine plus config.json kontrolne tačke | sačuvana podešavanja kao što je n_action_steps se nasleđuju |
| --policy.n_action_steps | koraci potrošeni po delu | vraća se na 50, nikada iznad chunk_size (podrazumevano 50) |
| --policy.train_expert_only | zamrzava VLM, obučava eksperta | podrazumevano false, manje memorije, neki trošak u uspehu |
| --policy.gradient_checkpointing | ponovo izračunava umesto da skladišti aktivacije | podrazumevano false, prva poluga kada se pokretanje ne uklapa |
| --peft.method_type=LORA | LoRA adapteri umesto punih težina | zahteva peft dodatak, dokumentovani primer je SmolVLA |
| --policy.rtc_training_max_delay | kondicioniranje prefiksa akcije za RTC | samo glavna grana, nije u 0.6.1, mora ostati ispod chunk_size |
| --rename_map | mapira kolone skupa podataka na karakteristike politike | potrebno kada se ključevi vaše kamere razlikuju |
Bez kvantila dobijate ValueError: QUANTILES normalization mode requires q01 and q99 stats pri prvom paketu. Ponovo izračunajte statistike, ali rezultat se nalazi u $HF_LEROBOT_HOME/your_dataset, a ne u kešu koji čita --dataset.repo_id, pa trenirajte sa --dataset.root koji pokazuje tamo ili gurnite na Hub. Ili preskočite kvantile sa --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kao što to radi referentna komanda LIBERO.
Tri skupa podrazumevanih vrednosti i koje od njih stižu do trenera
openpi-jev TrainConfig je referenca, LeRobot-ov PI05Config je ono što lerobot-train koristi kada ništa ne kažete, a obrazac ovde šalje treći skup. Iznenađenje je stopa učenja: oba podrazumevana podešavanja dostižu vrhunac od 2.5e-5, dok openpi-jeva sopstvena pi05_libero konfiguracija i ova platforma je podižu na 5e-5.
| Podešavanje | openpi TrainConfig | lerobot pi05 i lerobot-train | AY-Robots šalje |
|---|---|---|---|
| Veličina paketa | 32 | 8 | 1 |
| Maksimalna stopa učenja | 2.5e-5, kosinusni pad | optimizer_lr 2.5e-5 | 5e-5 |
| Koraci obuke | 30,000 | 100,000 | 30,000 |
| Interval kontrolne tačke | 1,000 koraka | 20,000 koraka | nije u obrascu |
| Seed | 42 | 1,000 | u obrascu |
| Akcioni blok | action_horizon 50 | chunk_size 50, n_action_steps 50 | nije u obrascu |
| Tip podataka težine | bfloat16 | float32 dok ne prosledite --policy.dtype | nije u obrascu |
| Akumulacija gradijenta | nema takvog podešavanja, umesto toga fsdp_devices | odsutno iz svakog izdanja do sada | 16, i izbačeno je |
Da li je port veran? LeRobot tim je fino podesio LIBERO osnovni model za dodatnih 6k koraka i uporedio ga sa referentnim brojevima openpi-ja na četiri paketa: 97.5 procenata prosečno naspram 96.85, ispred na Libero 10, iza na Spatial. Ruta je izbor alata, a ne kvaliteta.
- Više od 10,000 sati pre-obuke robota stoji iza toga, tako da 50 epizoda vašeg zadatka može biti dovoljno.
- Kontinuirane akcije: nema tokenizatora za podešavanje, nema diskretizacione granice na vašim zglobnim uglovima.
- LeRobot port postiže 97.5 procenata na LIBERO proseku naspram openpi-jevih 96.85, tako da prijateljskiji CLI ne košta ništa merljivo.
- Parametarski efikasne putanje sa obe strane: openpi-jeve JAX LoRA varijante, LeRobot-ova PEFT integracija.
- Potpuno fino podešavanje zahteva više od 70 GB. Broj od 22.5 GB za LoRA je openpi-jev JAX broj; nijedan nije objavljen za pi05 pod PEFT-om.
- 485 ms po akcionom koraku, najsporiji od pet ovde: dvostruko sporiji od SmolVLA, dvadeset četiri puta sporiji od ACT-a.
- LeRobot v3.0 je potreban, tako da skup podataka snimljen za GR00T pokretanje treba konvertovati, i obrnuto.
- Nove opcije prvo stižu na main: RTC i MEM memorija tokom obuke nisu u 0.6.1, tako da najnovija dokumentacija može značiti instalaciju sa git-a.
Stvarnost od 485 ms i gde prestaje da bude upotrebljiva
Ovo odlučuje o vašem projektu, pa dolazi pre tabele troškova. po koraku akcije izmereno ovde za Pi0.5 je 485 ms. U poređenju sa ostala četiri:
| Politika | Inferencija po koraku akcije | Parametri | GPU nivo | Minimalne epizode |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

Kontrolna petlja ovih pet modela radi 20 do 485 ms po koraku akcije. Povratna putovanja preko javnog interneta, povrh 485 ms, pretvaraju funkcionalnu politiku u oklevajuću. Daljinsko zaključivanje je izvodljivo za sporo uzimanje i postavljanje, ne i za brzo reaktivno kretanje. Radije bismo to rekli nego prodali demo koji radi samo na LAN-u. Ako se vaša ruka zaustavlja između delova, počnite od politika se zamrzava usred pokreta.
Upstream ima odgovor, a pola toga je već u izdanju koje možete instalirati. Real-Time Chunking generiše sledeći deo dok ruka još uvek izvršava trenutni, zatim vodi preklapajuće korake novog dela da ostanu blizu već izvršenog dela, tako da se ruka ne zaustavlja ili trza na spoju. Forma za vreme zaključivanja isporučena je u changelogu 0.4.2 za Pi0, Pi0.5 i SmolVLA i predstavlja rollout zastavicu, a ne ponovnu obuku:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60To ne čini model bržim. To skriva prazninu: 485 ms se i dalje troši, ali van kritične putanje, tako da red ne presuši između delova. Varijanta za vreme obuke iz arXiv 2512.05964 ide dalje: model uči da se uslovljava čistim prefiksom akcije, tako da se pri zaključivanju preklapanje teško popunjava vremenskim koracima toka po akciji umesto da se vodi, a povratni prolaz vođenja nestaje. Tokom obuke uzorkuje dužinu prefiksa po primeru i uzima gubitak toka na preostalom postfiksu. Ta zastavica postoji samo na glavnoj grani, ne u 0.6.1, a kašnjenje za koje trenirate mora ostati ispod chunk_size.
Dva načina da dobijete Pi0.5 kontrolnu tačku
Iznajmljujete ili posedujete karticu od 80 GB, instalirate jedan od gore navedenih stekova, konvertujete svoj skup podataka i nadgledate pokretanje. Zadržavate svaku opciju: openpi-jev JAX LoRA, LeRobot-ove PEFT adaptere, relativne akcije, prilagođena mapiranja tastera. Zadržavate i svaki neuspeh.
- Hardver: A100 80 GB ili H100, ili kartica od 24 GB na openpi-jevom JAX LoRA putu.
- Podešavanje: jedno popodne za prvo pokretanje, uglavnom mapiranje tastera i gated tokenizer.
- Nije dostupno na hostovanoj formi: PEFT adapteri, relativne akcije, RTC u vreme treninga, MEM memorija.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Birate model i skup podataka u formi za trening, backend iznajmljuje GPU na spot tržištu prema potrebnom VRAM-u, pokreće trener i upisuje kontrolne tačke u skladište objekata. Pi0.5 je ovde samo u oblaku. Postoje vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.
| Podešavanje | Šta platforma šalje za Pi0.5 |
|---|---|
| Osnovna kontrolna tačka | lerobot/pi05_base |
| Tip politike | pi05 |
| Veličina paketa | 1 |
| Stopa učenja | 5e-5 |
| Maksimalni koraci | 30000 |
| Akumulacija gradijenta | 16, ali pogledajte upozorenje ispod |
| Dodatne opcije u formi | seed, logFreq |
| Format skupa podataka | LeRobot v3.0 |
| GPU nivo | A100 80 GB ili H100 80 GB |
Trener šalje vrednost akumulacije gradijenta od 16, a lerobot 0.5.1 nema flag da je primi, pa se ona odbacuje. Nijedan objavljeni lerobot ga nema: opcija postoji samo na main grani, kao --accelerator.gradient_accumulation.steps. Efektivna veličina paketa ovde je 1, za razliku od 256 koje koristi openpi-jeva pi05_libero konfiguracija. Vredi znati pre nego što pročitate krivu gubitka. Opcija se primenjuje na GR00T N1.7 i GR00T N1.5 pokretanja.
Inferencija radi na isti način: pod se obezbeđuje da služi politiku i vaš lokalni klijent komunicira sa njim. Pod ima idle watchdog i sam se uništava, tako da zaboravljena kartica ne naplaćuje tiho. Primedba o kašnjenju se primenjuje, zbog čega ACT sa 20 ms često pobeđuje u brzom zadatku.
Kada ne radi
| Simptom | Najverovatniji uzrok |
|---|---|
| Pokretanje odbijeno pre nego što počne | Skup podataka v2.1, ali Pi0.5 želi v3.0, ili obrnuto za GR00T |
| ImportError, nedostaje paket datasets | lerobot 0.6.x bez dodatka za trening |
| ValueError o q01 i q99 na prvom paketu | Nema kvantila u meta/stats.json; ponovo izračunajte ili koristite MEAN_STD |
| CUDA nema dovoljno memorije u koraku 0 | Potpuno fino podešavanje ispod 70 GB; pokušajte sa checkpointing-om ili train_expert_only |
| Greška 401 ili gated repo greška | Licenca PaliGemma tokenizera nije prihvaćena |
| Gubitak opada, robot ne radi ništa | Nepodudarnost normalizacije, ili politika kopira stanje |
| Ruka pauzira između delova | Kašnjenje po koraku plus povratno putovanje; red čekanja za delove se isprazni |
| Radi u jednom podešavanju, ne radi u drugom | Premalo epizoda, ili sve u jednoj konfiguraciji |
- Skup podataka odbijen: potrebna je v3
- Nema dovoljno memorije tokom obuke
- Gubitak opada, ali politika ne radi ništa
- Politika se zamrzava usred pokreta
- Politika radi samo u jednom podešavanju
- Posao obuke zaglavljen u redu čekanja
Koliko košta jedno pokretanje
Pi0.5 se nalazi u skupom nivou jer mu je potrebna kartica od 80 GB, a spot cene se menjaju, tako da je cifra raspon, a ne fiksna cena. Za mnoge SO-100 zadatke, prvo obučite SmolVLA ili ACT na nivou od 24 GB, potvrdite da je zadatak uopšte naučiv, a zatim potrošite A100 sate na njega. Obučite svoju prvu politiku prolazi kroz tu jeftiniju petlju, a cene sadrži trenutne nivoe.
| Nivo | Politike | Tipično pokretanje | Cena po satu | Cena po pokretanju |
|---|---|---|---|---|
| A100 80 GB or H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 to 6 hours | 1.20 to 2.00 USD | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | 0.30 to 0.60 USD | about 1 to 3 USD |

Pre nego što posvetite veče: GR00T N1.7 protiv Pi0.5 i Pi0.5 protiv SmolVLA izlažu iste brojeve jedan naspram drugog. Arena sadrži 85 VLA modela sa 332 rezultata benčmarka, svaki povezan sa svojim izvorom, a pozadina o porodici je u našem pregledu VLA modela.
Trenirajte Pi0.5 bez izgradnje steka
Izaberite skup podataka i hiperparametre u obrascu. Bekend iznajmljuje karticu od 80 GB na spot tržištu, pokreće trener i upisuje kontrolne tačke u skladište objekata. Vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.
Otvorite vodiče za obukuMogu li fino podesiti Pi0.5 na RTX 4090?▾
Nije potpuno fino podešavanje: openpi navodi više od 70 GB za to, tako da je potrebna A100 80 GB ili H100. Njegova LoRA vrednost od 22.5 GB pripada JAX putanji; PyTorch implementacija nema LoRA. LeRobot-ova PEFT integracija postoji, ali njen dokumentovani primer je SmolVLA i nije objavljena VRAM vrednost za pi05.
Koliko epizoda mi je potrebno?▾
Pedeset, isti minimum kao GR00T i ACT; samo SmolVLA ide niže, na 30. Osnovna kontrolna tačka nosi više od 10,000 sati predobuke, tako da se fino podešavanje prilagođava umesto da uči od nule: 50 čistih, raznovrsnih epizoda pobeđuje dve stotine iz jedne konfiguracije.
Koja je razlika između --policy.path i --policy.pretrained_path?▾
--policy.path učitava težine i config.json kontrolne tačke, tako da se nasleđuju sačuvana podešavanja kao što su n_action_steps i --policy.type mora biti izostavljen. --policy.pretrained_path učitava samo težine: imena funkcija dolaze iz vašeg skupa podataka, sačuvana podešavanja se resetuju, --policy.type je obavezan. Zato LIBERO komanda eksplicitno prosleđuje n_action_steps=10 i empty_cameras=1; inače se vraćaju na 50 i 0.
Da li mi otvorena verzija daje pun Pi0.5 iz rada?▾
Ne. Oba podržavaju samo glavu akcije za usklađivanje toka. Faza predobuke diskretnih tokena sa FAST tokenizatorom akcija i predviđanje podzadataka visokog nivoa nisu objavljeni, a lerobot/pi05_base kartica dodaje RL na tu listu iako rad o pi0.5 ne opisuje fazu učenja potkrepljivanjem. Trenirate niskonivojsku politiku uslovljenu jezičkim nizom koji vi obezbeđujete, a ne model koji sam dekomponuje dug zadatak.
Protiv kojih verzija je napisan ovaj vodič?▾
openpi na glavnoj grani i lerobot 0.6.1, izdanje od 3. avgusta 2026, oba pročitana 23. avgusta 2026. Skupovi podataka v3.0 stigli su sa 0.4.0 u oktobru 2025. Verzija 0.6.0 je učinila osnovni paket laganim, tako da lerobot[pi] sam više ne instalira stek za obuku, i prebacila je implementaciju na lerobot-rollout. RTC u vreme obuke je samo na glavnoj grani; hostovani trener ovde pokreće 0.5.1.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started