
Fino podesite Pi0.5, VLA model za podudaranje toka (flow-matching VLA) tvrtke Physical Intelligence, na vlastitim robotskim podacima. Stvarne naredbe za openpi i lerobot pi05, zamke formata skupa podataka, ograničenja VRAM-a i latencije.
Pi0.5 je model za kojim posežete kada politika mora raditi u prostoriji koju nikada prije nije vidjela. Također je i najnezgrapniji od pet politika koje se mogu trenirati ovdje za fino podešavanje ručno: uzvodno spremište je prvenstveno JAX, LeRobot port je premjestio implementaciju iz lerobot-recorda u verziji 0.6.0 i učinio osnovnu instalaciju premalom za treniranje, a potpuno fino podešavanje ne stane na 4090. Ispod: što usklađivanje toka košta pri inferenciji, dvije komandne rute i broj od 485 ms koji odlučuje je li rezultat upotrebljiv.
Što trebate znati
- •VLA s usklađivanjem toka: 3B PaliGemma VLM plus 300M stručnjak za akcije koji dekodira kontinuirane dijelove akcija. Dvije rute za fino podešavanje, openpi i LeRobot pi05, s razlikom od 0.65 bodova na LIBERO prosjeku.
- •Potpuno fino podešavanje zahtijeva više od 70 GB VRAM-a. openpi navodi LoRA-u na 22.5 GB, samo na svojoj JAX putanji.
- •Skup podataka mora biti LeRobotDataset v3.0 s q01 i q99 kvantilima u meta/stats.json, inače će prva serija baciti grešku.
- •Prvo provjerite svoju lerobot verziju: 0.6.0 je učinio osnovni paket laganim i premjestio implementaciju iz lerobot-recorda.
- •Ovdje radi na 485 ms po koraku akcije, zahtijeva 50 epizoda i košta oko 4 do 12 USD po pokretanju.
Što je Pi0.5 zapravo
Physical Intelligence objavio je pi0 u listopadu 2024.: model s usklađivanjem toka vizualno-jezično-akcijski model na prethodno treniranom VLM-u: PaliGemma s 3 milijarde parametara plus 300M stručnjak za akcije inicijaliziran od nule, ukupno 3.3 milijarde. Rad izvještava o pred-treniranju na preko 10,000 sati robotskih podataka kroz 7 robotskih konfiguracija i 68 zadataka. Više u članku o pi0.
Pi0.5 (arXiv 2504.16054, 22. travnja 2025.) zadržava taj kostur i mijenja režim treninga: web podaci, detekcija objekata, verbalne upute ljudi koji podučavaju robota, oznake podzadataka, podaci o unakrsnoj inkarnaciji od robota u mnogim domovima. Rezultat je robot koji čisti kuhinje u kućama koje nisu bile u skupu za trening. README datoteka openpi dodaje detalj koji naslov ne sadrži: objavljeni pi0.5 je treniran s izolacijom znanja (arXiv 2505.23705).
| Svojstvo | pi0 | pi0.5 |
|---|---|---|
| Varijanta VLM okosnice | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Varijanta stručnjaka za akcije | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| zadana vrijednost action_horizon | 50 | 50 |
| max_token_len | 48 | 200 |
| diskretni ulaz stanja | false | true, stanje diskretizirano u spremnike u upitu |
| Osnovna kontrolna točka | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
README datoteka openpi je eksplicitna: repozitorij podržava samo glavu za usklađivanje toka (flow matching head), za trening i inferenciju pi0.5. Rad opisuje dvije faze, a kod sadrži samo drugu: pre-trening predstavlja svaku akciju kao diskretne tokene putem FAST tokenizera, a pri implementaciji model zaključuje podzadatak visoke razine prije svakog bloka akcija. Ništa od toga nije u repozitoriju. Kartica lerobot/pi05_base daje isti popis i dodaje RL, iako rad o pi0.5 uopće ne opisuje fazu učenja potpomognutog nagradom. LeRobot port nasljeđuje taj opseg, kao i svaki hostirani trener na njemu, uključujući ovaj ovdje. Licenciranje je također podijeljeno: stranica s dokumentacijom pi05 kaže Apache 2.0, kartica lerobot/pi05_base je označena s license: gemma.
Što usklađivanje toka mijenja u vezi s treningom i inferencijom
Politika koju možete trenirati na SO-100 ili izravno regresira akcije (ACT) ili ih tokenizira i autoregresivno dekodira (pi0-FAST). Usklađivanje toka ne radi nijedno od toga: ono uči vektorsko polje koje prenosi šum do čistog bloka akcija, a zatim ga integrira. Rad o pi0 koristi 10 koraka integracije s veličinom koraka 0.1; LeRobotova pi05 konfiguracija sadrži isti num_inference_steps: int = 10.
- Trening: gubitak regresira bučni blok akcija. Nema tokenizatora za podešavanje, nema diskretizacije vaših kutova zglobova.
- Inferencija: jedan blok košta deset prolaza unaprijed kroz stručnjaka za akcije. To je strukturno, a ne problem podešavanja.
- Izlaz: kontinuirane akcije dimenzije 32, interno popunjene, gubitak se uzima na dimenzijama koje vaš robot ima. Ruka sa 6-stupnjeva slobode plus hvataljka koristi 7.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma okosnica i vrata ispred nje
PaliGemma (arXiv 2407.07726) je SigLIP-So400m vizualni enkoder na jezičnom modelu Gemma-2B, s oko 3B parametara. Pi0.5 nasljeđuje svoj tokenizator, a taj se tokenizator nalazi u zatvorenom repozitoriju. Ovo je najčešći način na koji prvi pokretaj propadne, prije prvog koraka obuke.
Dokumentacija LeRobot pi05 jasno navodi: pi0.5 koristi zatvoreni google/paligemma-3b-pt-224 tokenizator, stoga prvo prihvatite njegovu licencu na Hubu i pokrenite hf auth login. Pristup se odobrava ručno, ne odmah. Preskočite to, pokrenite plaćeno izvršavanje u oblaku i platit ćete za pod koji ne može preuzeti tokenizator.
Prije nego počnete: format skupa podataka, epizode, hardver
Pi0.5 u LeRobotu čita LeRobot skup podataka u v3.0 rasporedu, koji je stigao s lerobot 0.4.0 u listopadu 2025.: mnogo epizoda po Parquet i MP4 datoteci umjesto jedne datoteke po epizodi, s granicama u meta/episodes/ umjesto u nazivima datoteka. Snimite s desktop klijentom ili slijedite snimite svoj prvi skup podataka i imat ćete ga.
| Način rada | Potrebna GPU memorija | Primjer GPU-a |
|---|---|---|
| Zaključivanje | više od 8 GB | RTX 4090 |
| Fino podešavanje, LoRA | više od 22.5 GB | RTX 4090 |
| Fino podešavanje, potpuno | više od 70 GB | A100 80 GB ili H100 |
Pi0.5 i SmolVLA zahtijevaju LeRobot v3.0. GR00T N1.7 i GR00T N1.5 zahtijevaju v2.0 ili v2.1 i ruše se na skupu podataka v3.0. Jedna sesija snimanja ne može poslužiti oboma bez konverzije, a pogreška ne kaže "pogrešna verzija skupa podataka". Pogledajte skup podataka odbijen: potrebna v3.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPlatforma zahtijeva najmanje 50 epizoda za Pi0.5, što je isti minimum kao za GR00T i ACT. Predobuka obavlja najveći dio posla, tako da 50 čistih epizoda nadmašuje 200 neurednih. Novi ste u ovome? Započnite s vodičem za prikupljanje podataka.

Ruta A: fino podešavanje s openpi repozitorijem
Referentna implementacija: prvo JAX, testirano samo na Ubuntu 22.04, vođeno konfiguracijskim objektima umjesto zastavicama. PyTorch putanja stigla je u rujnu 2025., validirana na LIBERO. Tri koraka: pretvorite svoje podatke, definirajte konfiguraciju, trenirajte i poslužite.
- 1Klonirajte i instalirajte
openpi koristi uv. GIT_LFS_SKIP_SMUDGE omogućuje da LeRobot dođe kao ovisnost bez LFS blobova.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Pretvorite svoje podatke u LeRobot skup podataka
Upstream isporučuje konvertere za LIBERO i DROID i očekuje da prilagodite jedan. Posao je mapiranje ključeva.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Dodajte konfiguraciju za treniranje
Konfiguracije su TrainConfig unosi u src/openpi/training/config.py. Ova prilagođava pi05_droid_finetune, s učitavačem težina usmjerenim na pi05_base.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Izračunajte statistiku norme
Pokreće se prema nazivu konfiguracije, a ne skupu podataka. Preskakanje je klasičan prvi neuspjeh ovdje.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Trenirajte
Varijabla omogućuje JAX-u da koristi 90 posto GPU memorije umjesto zadanih 75. Na kartici od 80 GB to odlučuje hoće li se izvođenje preživjeti.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Poslužite ga
Poslužitelj sluša na portu 8000 i odgovara na upite za promatranje; vaše robotsko okruženje je klijent.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi's PyTorch implementacija ne podržava pi0-FAST, mješovitu preciznost, FSDP, LoRA ili EMA težine, tako da je LoRA koja doseže 22.5 GB samo za JAX, putem gemma_2b_lora i gemma_300m_lora varijanti. Još gore: postavka kopira zakrpane datoteke preko vašeg instaliranog transformers 4.53.2, a README upozorava da s uv-ovim zadanim načinom hardlinka ovo trajno mijenja transformere u uv predmemoriji i može procuriti u druge projekte. Poništite to s uv cache clean transformers.
Ruta B: fino podešavanje s lerobot pi05
LeRobot port obuhvaća iste težine u CLI-ju koji već koristite za ACT i SmolVLA. Sve dolje navedeno provjereno je s lerobot 0.6.1, izdanjem od 3. kolovoza 2026., i pi05 dokumentacijom od 23. kolovoza 2026. Verzije su ovdje važne: v3.0 skupovi podataka stigli su s 0.4.0 u listopadu 2025., blog 0.5.0 od 9. ožujka 2026. predstavlja pi0-FAST i Real-Time Chunking, a 0.6.0 od 6. srpnja 2026. učinio je osnovni paket laganim i premjestio implementaciju na lerobot-rollout.
Jedna stvar se nije pomaknula: lerobot-train i lerobot-record već su bili ulazne točke u 0.3.2, kolovoz 2025. Vodič koji još uvijek poziva python -m lerobot.scripts.train prethodi godini promjena i vrijedi mu ne vjerovati ni u ostatku.
- 1Instalacija s pravim dodacima
Od verzije 0.6.0 osnovna instalacija sadrži samo osnovne ML ovisnosti, a 'pi' dodatak ne dodaje kod za skup podataka ili treniranje, pa fino podešavanje zahtijeva i 'training' dodatak. Starije jednolinijske naredbe ovdje ne uspijevaju prilikom uvoza.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Autentifikacija
Prihvatite licencu paligemma-3b-pt-224 u pregledniku, a zatim se prijavite na računalu koje trenira.
bashhf auth login - 3Dodajte statistiku kvantila
Pi0.5 normalizira STATE i ACTION pomoću kvantila, pa meta/stats.json treba q01 i q99. Stariji skupovi podataka sadrže samo min, max, mean, std.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4Fino podešavanje iz lerobot/pi05_base
Postavite veličinu paketa na onu koju vaša kartica može podnijeti; dokumentacija koristi 64 na LIBERO-u s 80 GB. Eksplicitno proslijedite bfloat16, zadana konfiguracija je float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Pokrenite ga na ruci
U verziji 0.6.x ovo je lerobot-rollout: lerobot-record odbija politiku i odbacuje nazive skupova podataka s prefiksom eval_. Base upravlja rukom, sentry bilježi izvođenje.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Zastavica | Što radi | Napomena |
|---|---|---|
| --policy.type=pi05 | odabire Pi0.5 | obavezno uz pretrained_path, izostavite uz --policy.path |
| --policy.pretrained_path | učitava samo težine | nazivi značajki iz vašeg skupa podataka, pohranjene postavke se resetiraju |
| --policy.path | težine plus konfiguracija kontrolne točke config.json | pohranjene postavke poput n_action_steps se nasljeđuju |
| --policy.n_action_steps | koraci potrošeni po bloku | vraća se na 50, nikad iznad chunk_size (zadano 50) |
| --policy.train_expert_only | zamrzava VLM, trenira eksperta | zadano false, manje memorije, neki trošak u uspjehu |
| --policy.gradient_checkpointing | ponovno izračunava umjesto pohranjivanja aktivacija | zadano false, prva poluga kada se izvođenje neće uklopiti |
| --peft.method_type=LORA | LoRA adapteri umjesto punih težina | potreban je peft dodatak, dokumentirani primjer je SmolVLA |
| --policy.rtc_training_max_delay | uvjetovanje prefiksom akcije za RTC | samo glavna grana, nije u 0.6.1, mora ostati ispod chunk_size |
| --rename_map | preslikava stupce skupa podataka na značajke politike | potrebno kada se vaši ključevi kamere razlikuju |
Bez kvantila dobivate ValueError: QUANTILES normalization mode requires q01 and q99 stats na prvom paketu. Ponovno izračunajte statistiku, ali rezultat završava u $HF_LEROBOT_HOME/your_dataset, a ne u predmemoriji koju čita --dataset.repo_id, pa trenirajte s --dataset.root koji pokazuje tamo ili gurnite na Hub. Ili preskočite kvantile s --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kao što to čini referentna naredba LIBERO.
Tri skupa zadanih vrijednosti i koje od njih dolaze do trenera
openpi-jev TrainConfig je referenca, LeRobot-ov PI05Config je ono što lerobot-train koristi kada ništa ne kažete, a obrazac ovdje šalje treći skup. Iznenađenje je stopa učenja: oba zadana podešavanja dosežu vrhunac od 2.5e-5, dok openpi-jeva vlastita pi05_libero konfiguracija i ova platforma podižu je na 5e-5.
| Postavka | openpi TrainConfig | lerobot pi05 i lerobot-train | AY-Robots šalje |
|---|---|---|---|
| Veličina serije | 32 | 8 | 1 |
| Vršna stopa učenja | 2.5e-5, kosinusni pad | optimizer_lr 2.5e-5 | 5e-5 |
| Koraci treniranja | 30,000 | 100,000 | 30,000 |
| Interval kontrolne točke | 1,000 steps | 20,000 steps | nije u obrascu |
| Sjeme | 42 | 1,000 | u obrascu |
| Blok akcija | action_horizon 50 | chunk_size 50, n_action_steps 50 | nije u obrascu |
| Tip podataka težine | bfloat16 | float32 dok ne proslijedite --policy.dtype | nije u obrascu |
| Akumulacija gradijenta | nema takve opcije, umjesto toga fsdp_devices | odsutno iz svakog dosadašnjeg izdanja | 16, i to je izostavljeno |
Je li port vjeran? Tim LeRobot-a je dodatno fino podesio osnovni model LIBERO za 6k koraka i usporedio ga s referentnim brojevima openpi-ja na četiri paketa: 97.5 posto prosječno naspram 96.85, ispred na Libero 10, iza na Spatial. Ruta je izbor alata, a ne kvalitete.
- Više od 10,000 sati predtreniranja robota stoji iza toga, tako da 50 epizoda vašeg zadatka može biti dovoljno.
- Kontinuirane akcije: nema tokenizatora za podešavanje, nema praga diskretizacije na vašim kutovima zglobova.
- LeRobot port postiže 97.5 posto na LIBERO prosjeku naspram openpi-jevih 96.85, tako da prijateljskiji CLI ne košta ništa mjerljivo.
- Parametarski učinkoviti putevi s obje strane: openpi-jeve JAX LoRA varijante, LeRobot-ova PEFT integracija.
- Potpuno fino podešavanje zahtijeva više od 70 GB. Broj od 22.5 GB za LoRA je openpi-jev JAX broj; nijedan nije objavljen za pi05 pod PEFT-om.
- 485 ms po koraku akcije, najsporiji od pet ovdje: dvostruko sporiji od SmolVLA, dvadeset i četiri puta sporiji od ACT-a.
- Potreban je LeRobot v3.0, tako da skup podataka snimljen za GR00T pokret treba pretvoriti, i obrnuto.
- Nove opcije prvo dolaze na main: RTC i MEM memorija u vrijeme treniranja nisu u 0.6.1, tako da najnovija dokumentacija može značiti instalaciju s gita.
Stvarnost od 485 ms i gdje prestaje biti upotrebljiva
Ovo odlučuje o vašem projektu, stoga dolazi prije tablice troškova. po koraku akcije izmjerena ovdje za Pi0.5 iznosi 485 ms. U usporedbi s ostala četiri:
| Politika | Inferencija po koraku akcije | Parametri | GPU razina | Minimalne epizode |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

Kontrolna petlja za ovih pet modela traje 20 do 485 ms po koraku akcije. Povratna putovanja preko javnog interneta, povrh 485 ms, pretvaraju funkcionalnu politiku u oklijevajuću. Udaljena inferencija je izvediva za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje. Radije bismo to rekli nego prodavali demo koji radi samo na LAN-u. Ako se vaša ruka zaustavlja između dijelova, počnite s zastojima politike usred kretanja.
Upstream ima odgovor, a pola toga je već u izdanju koje možete instalirati. Real-Time Chunking generira sljedeći dio dok ruka još uvijek izvršava trenutni, a zatim vodi preklapajuće korake novog dijela da ostanu blizu već izvršenog dijela, tako da se ruka ne zaustavlja ili trza na spoju. Oblik za vrijeme inferencije isporučen je u changelogu 0.4.2 za Pi0, Pi0.5 i SmolVLA i predstavlja zastavicu za rollout, a ne za ponovno treniranje:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60To ne čini model bržim. To skriva prazninu: 485 ms se i dalje troši, ali izvan kritičnog puta, tako da se red ne isušuje između dijelova. Varijanta za vrijeme treniranja iz arXiv 2512.05964 ide dalje: model uči uvjetovati se na čistom prefiksu akcije, tako da se pri inferenciji preklapanje čvrsto 'inpainta' s vremenskim koracima toka po akciji umjesto da se vodi, a povratni prolaz vođenja nestaje. Tijekom treniranja uzorkuje duljinu prefiksa po primjeru i uzima gubitak toka na preostalom postfiksu. Ta zastavica postoji samo na 'main' grani, ne u 0.6.1, a kašnjenje za koje trenirate mora ostati ispod chunk_size.
Dva načina za dobivanje Pi0.5 kontrolne točke
Iznajmljujete ili posjedujete karticu od 80 GB, instalirate jedan od gore navedenih paketa, pretvarate svoj skup podataka i nadgledate izvođenje. Zadržavate svaku postavku: openpi-jev JAX LoRA, LeRobot-ove PEFT adaptere, relativne akcije, prilagođena mapiranja tipki. Također zadržavate svaki neuspjeh.
- Hardver: A100 80 GB ili H100, ili kartica od 24 GB na putanji openpi-jevog JAX LoRA.
- Postavljanje: jedno poslijepodne za prvo pokretanje, uglavnom mapiranje tipki i gated tokenizer.
- Nije dostupno na hostiranom obrascu: PEFT adapteri, relativne akcije, RTC tijekom treninga, MEM memorija.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Odabirete model i skup podataka u obrascu za treniranje, pozadinski sustav iznajmljuje GPU na spot tržištu prema potrebnom VRAM-u, pokreće trener i zapisuje kontrolne točke u objektno skladište. Pi0.5 je ovdje samo u oblaku. Vodiči postoje za SO-100, SO-101, Koch v1.1 i LeKiwi.
| Postavka | Što platforma šalje za Pi0.5 |
|---|---|
| Osnovna kontrolna točka | lerobot/pi05_base |
| Tip politike | pi05 |
| Veličina paketa | 1 |
| Stopa učenja | 5e-5 |
| Maksimalni koraci | 30000 |
| Akumulacija gradijenta | 16, ali pogledajte upozorenje ispod |
| Dodatne postavke u obrascu | seed, logFreq |
| Format skupa podataka | LeRobot v3.0 |
| GPU razina | A100 80 GB ili H100 80 GB |
Trener šalje vrijednost akumulacije gradijenta od 16, a lerobot 0.5.1 nema zastavicu za primanje, pa se ona odbacuje. Nijedan objavljeni lerobot je nema: postavka postoji samo na glavnoj grani, kao --accelerator.gradient_accumulation.steps. Efektivna veličina paketa ovdje je 1, za razliku od 256 koje koristi openpi-jeva pi05_libero konfiguracija. Vrijedi znati prije nego što pročitate krivulju gubitka. Postavka se primjenjuje na GR00T N1.7 i GR00T N1.5 izvođenja.
Zaključivanje radi na isti način: pod je osiguran za posluživanje politike i vaš lokalni klijent komunicira s njim. Pod ima nadzornika neaktivnosti i sam se uništava, tako da zaboravljena kartica ne naplaćuje tiho. Primjenjuje se upozorenje o latenciji, zbog čega ACT s 20 ms često pobjeđuje u brzom zadatku.
Kada ne radi
| Simptom | Najvjerojatniji uzrok |
|---|---|
| Pokretanje odbijeno prije početka | Skup podataka v2.1, ali Pi0.5 želi v3.0, ili obrnuto za GR00T |
| ImportError, nedostaje paket datasets | lerobot 0.6.x bez dodatka za treniranje |
| ValueError o q01 i q99 na prvom paketu | Nema kvantila u meta/stats.json; ponovno izračunajte ili koristite MEAN_STD |
| CUDA izvan memorije u koraku 0 | Potpuno fino podešavanje ispod 70 GB; pokušajte s kontrolnim točkama ili train_expert_only |
| Greška 401 ili gated repo | Licenca PaliGemma tokenizatora nije prihvaćena |
| Gubitak pada, robot ne radi ništa | Nepodudarnost normalizacije, ili politika kopira stanje |
| Ruka pauzira između dijelova | Latencija po koraku plus povratno putovanje; red čekanja dijelova se isprazni |
| Radi u jednoj postavci, ne radi u drugoj | Premalo epizoda, ili sve u jednoj konfiguraciji |
- Skup podataka odbijen: potrebna je v3
- Nedostatak memorije tijekom treniranja
- Gubitak pada, ali politika ne radi ništa
- Politika se zamrzava usred pokreta
- Politika radi samo u jednoj postavci
- Posao treniranja zaglavljen u redu čekanja
Koliko košta jedno pokretanje
Pi0.5 se nalazi u skupoj razini jer zahtijeva karticu od 80 GB, a spot cijene se mijenjaju, pa je brojka raspon, a ne fiksna cijena. Za mnoge SO-100 zadatke, trenirajte SmolVLA ili ACT na razini od 24 GB, prvo potvrdite da je zadatak uopće naučiv, a zatim potrošite A100 sati na njega. Trenirajte svoju prvu politiku prolazi kroz tu jeftiniju petlju, a cijene prikazuju trenutne razine.
| Razina | Politike | Tipično pokretanje | Cijena po satu | Trošak po pokretanju |
|---|---|---|---|---|
| A100 80 GB ili H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 do 6 sati | 1.20 do 2.00 USD | oko 4 do 12 USD |
| RTX 4090 ili bilo koja kartica od 24 GB | SmolVLA, ACT | 2 do 5 sati | 0.30 do 0.60 USD | oko 1 do 3 USD |

Prije nego što posvetite večer: i uspoređuju iste brojeve. sadrži 85 VLA modela s 332 rezultata benchmarka, svaki povezan sa svojim izvorom, a pozadina o obitelji nalazi se u .
Trenirajte Pi0.5 bez postavljanja okruženja
Odaberite skup podataka i hiperparametre u obrascu. Pozadinski sustav iznajmljuje karticu od 80 GB na spot tržištu, pokreće trener i zapisuje kontrolne točke u objektno skladište. Vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.
Otvorite vodiče za treniranjeMogu li fino podesiti Pi0.5 na RTX 4090?▾
Nije potpuno fino podešavanje: openpi navodi više od 70 GB za to, dakle A100 80 GB ili H100. Njegova brojka od 22.5 GB za LoRA pripada JAX putanji; PyTorch implementacija nema LoRA. LeRobotova PEFT integracija postoji, ali njezin dokumentirani primjer je SmolVLA i nije objavljena VRAM brojka za pi05.
Koliko mi je epizoda potrebno?▾
Pedeset, isti minimum kao GR00T i ACT; samo SmolVLA ide niže, na 30. Osnovna kontrolna točka sadrži više od 10,000 sati predtreniranja, tako da se fino podešavanje prilagođava umjesto da uči od nule: 50 čistih, raznolikih epizoda nadmašuje dvjesto iz jedne konfiguracije.
Koja je razlika između --policy.path i --policy.pretrained_path?▾
--policy.path učitava težine i config.json kontrolne točke, tako da se nasljeđuju pohranjene postavke poput n_action_steps i --policy.type mora biti izostavljen. --policy.pretrained_path učitava samo težine: nazivi značajki dolaze iz vašeg skupa podataka, pohranjene postavke se resetiraju, --policy.type je obavezan. Zato LIBERO naredba eksplicitno prosljeđuje n_action_steps=10 i empty_cameras=1; inače se vraćaju na 50 i 0.
Daje li mi otvorena verzija puni Pi0.5 iz rada?▾
Ne. Oba podržavaju samo 'flow matching action head'. Faza predtreniranja s diskretnim tokenima s FAST 'action tokenizerom' i predviđanje podzadataka visoke razine nisu objavljeni, a kartica lerobot/pi05_base dodaje RL na taj popis iako rad o pi0.5 ne opisuje fazu učenja potkrepljenjem. Trenirate niskorazinsku politiku uvjetovanu jezičnim nizom koji vi dostavite, a ne model koji sam dekomponira dugi zadatak.
Protiv kojih je verzija napisan ovaj vodič?▾
openpi na glavnoj grani i lerobot 0.6.1, izdanje od 3. kolovoza 2026., oba pročitana 23. kolovoza 2026. Skupovi podataka v3.0 stigli su s 0.4.0 u listopadu 2025. Verzija 0.6.0 učinila je osnovni paket laganim, tako da lerobot[pi] sam više ne instalira 'training stack', i premjestila je implementaciju na lerobot-rollout. RTC u vrijeme treniranja je samo na glavnoj grani; ovdje hostirani trener pokreće 0.5.1.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started