Matrica obuke AY-Robots s pet politika kao redovima i četiri robotske ruke kao stupcima, svaka ćelija je veza na specifični vodič za fino podešavanje
Pi0.5Podudaranje tokaVLA obukaLeRobotFino podešavanje

Kako trenirati Pi0.5 na vlastitim robotskim podacima

AY-Robots ResearchAugust 23, 202616 min čitanja

Fino podesite Pi0.5, VLA model za podudaranje toka (flow-matching VLA) tvrtke Physical Intelligence, na vlastitim robotskim podacima. Stvarne komande za openpi i lerobot pi05, zamke formata skupa podataka, ograničenja VRAM-a i latencije.

Pi0.5 je model za kojim posežete kada politika mora da radi u prostoriji koju nikada nije videla. Takođe je i najnezgodniji od pet politika koje se mogu trenirati ovde za fino podešavanje ručno: uzvodno spremište je prvo JAX, LeRobot port je premestio implementaciju iz lerobot-record-a u 0.6.0 i učinio osnovnu instalaciju premalom za treniranje, a potpuno fino podešavanje ne staje na 4090. Ispod: šta usklađivanje toka košta pri inferenciji, dve komandne rute i broj od 485 ms koji odlučuje da li je rezultat upotrebljiv.

Šta treba da znate

  • VLA sa usklađivanjem toka: 3B PaliGemma VLM plus 300M akcioni ekspert koji dekodira kontinuirane segmente akcija. Dva načina za fino podešavanje, openpi i LeRobot pi05, udaljeni 0,65 poena na LIBERO proseku.
  • Potpuno fino podešavanje zahteva više od 70 GB VRAM-a. openpi navodi LoRA na 22,5 GB, samo na svojoj JAX putanji.
  • Skup podataka mora biti LeRobotDataset v3.0 sa q01 i q99 kvantilima u meta/stats.json, inače prva serija baca grešku.
  • Prvo proverite svoju lerobot verziju: 0.6.0 je osnovni paket učinio laganim i premestio implementaciju iz lerobot-record-a.
  • Ovde radi na 485 ms po koraku akcije, zahteva 50 epizoda i košta oko 4 do 12 USD po pokretanju.

Šta je Pi0.5 zapravo

Physical Intelligence je objavio pi0 u oktobru 2024: model sa usklađivanjem toka vizuelno-jezičko-akcioni model na prethodno obučenom VLM-u: PaliGemma sa 3 milijarde parametara plus 300M akcioni ekspert inicijalizovan od nule, ukupno 3,3 milijarde. Rad izveštava o pre-treningu na preko 10.000 sati robotskih podataka kroz 7 robotskih konfiguracija i 68 zadataka. Više u članku o pi0.

Pi0.5 (arXiv 2504.16054, 22. april 2025) zadržava taj kostur i mijenja režim obuke: web podaci, detekcija objekata, verbalne instrukcije od ljudi koji obučavaju robota, oznake podzadataka, podaci o unakrsnom utjelovljenju od robota u mnogim domovima. Rezultat je robot koji čisti kuhinje u kućama koje nisu bile u skupu za obuku. README datoteka openpi dodaje detalj koji naslov ne sadrži: objavljeni pi0.5 je obučen sa izolacijom znanja (arXiv 2505.23705).

Svojstvopi0pi0.5
Varijanta VLM okosnicegemma_2b (PaliGemma)gemma_2b (PaliGemma)
Varijanta eksperta za akcijegemma_300mgemma_300m
action_dim3232
podrazumevani akcioni horizont5050
maksimalna dužina tokena48200
diskretni ulaz stanjafalsetrue, stanje diskretizovano u segmente u promptu
Osnovna kontrolna tačkags://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Ono što je javno nije cijeli rad

README datoteka openpi je eksplicitna: repozitorijum podržava samo glavu za podudaranje toka, za obuku i inferenciju pi0.5. Rad opisuje dvije faze, a kod sadrži samo drugu: pre-obuka predstavlja svaku akciju kao diskretne tokene putem FAST tokenizatora, a pri implementaciji model zaključuje podzadatak visokog nivoa prije svakog bloka akcija. Ništa od toga nije u repozitorijumu. Kartica lerobot/pi05_base daje istu listu i dodaje RL, iako rad o pi0.5 uopšte ne opisuje fazu učenja potkrepljivanjem. LeRobot port nasljeđuje taj opseg, kao i svaki hostovani trener na njemu, uključujući ovaj ovdje. Licenciranje je takođe podijeljeno: stranica dokumentacije pi05 kaže Apache 2.0, kartica lerobot/pi05_base je označena sa license: gemma.

Šta podudaranje toka mijenja u vezi sa obukom i inferencijom

Politika politika koju možete trenirati na SO-100 ili direktno regresira akcije (ACT) ili ih tokenizira i autoregresivno dekodira (pi0-FAST). Usklađivanje toka ne radi nijedno od toga: ono uči vektorsko polje koje prenosi šum do čistog bloka akcija, a zatim ga integriše. Rad o pi0 koristi 10 koraka integracije sa veličinom koraka 0.1; LeRobot-ova pi05 konfiguracija sadrži isti `num_inference_steps: int = 10`.

  • Trening: gubitak regresira bučni blok akcija. Nema tokenizatora za podešavanje, nema diskretizacije vaših zglobnih uglova.
  • Inferencija: jedan blok košta deset prolaza unaprijed kroz eksperta za akcije. To je strukturno, a ne problem podešavanja.
  • Izlaz: kontinuirane akcije dimenzije 32, interno popunjene, gubitak uzet na dimenzijama koje vaš robot ima. Ruka sa 6-DoF plus hvataljka koristi 7.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
Pročitano iz src/openpi/models/pi0_config.py na openpi glavnoj grani, 23. augusta 2026.

PaliGemma okosnica, i kapija ispred nje

PaliGemma (arXiv 2407.07726) je SigLIP-So400m vizualni enkoder na Gemma-2B jezičnom modelu, sa oko 3B parametara. Pi0.5 nasljeđuje svoj tokenizator, a taj tokenizator se nalazi u zatvorenom repozitoriju. Ovo je najčešći način na koji prvi pokretaj propadne, prije prvog koraka obuke.

Prihvatite zatvorenu licencu prije nego što iznajmite GPU

Dokumentacija LeRobot pi05 jasno navodi: pi0.5 koristi zatvoreni google/paligemma-3b-pt-224 tokenizator, stoga prihvatite njegovu licencu na Hubu i prvo pokrenite hf auth login. Pristup se odobrava ručno, ne trenutno. Preskočite to, pokrenite plaćeno pokretanje u oblaku i platit ćete za pod koji ne može preuzeti tokenizator.

Prije nego počnete: format skupa podataka, epizode, hardver

Pi0.5 u LeRobotu čita LeRobot skup podataka u v3.0 rasporedu, koji je stigao s lerobot 0.4.0 u oktobru 2025: mnogo epizoda po Parquet i MP4 datoteci umjesto jedne datoteke po epizodi, sa granicama u meta/episodes/ umjesto u nazivima datoteka. Snimite pomoću desktop klijenta ili slijedite snimite svoj prvi skup podataka i imat ćete ga.

NačinPotrebna GPU memorijaPrimjer GPU-a
Inferencijaviše od 8 GBRTX 4090
Fino podešavanje, LoRAviše od 22.5 GBRTX 4090
Fino podešavanje, punoviše od 70 GBA100 80 GB ili H100
Verziona zamka koja košta dan

Pi0.5 i SmolVLA žele LeRobot v3.0. GR00T N1.7 i GR00T N1.5 žele v2.0 ili v2.1 i ruše se na v3.0 skupu podataka. Jedna sesija snimanja ne može hraniti oba bez konverzije, a greška ne kaže "pogrešna verzija skupa podataka". Pogledajte skup podataka odbijen: v3 potreban.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
Iz dokumentacije LeRobotDataset v3.0.

Platforma želi najmanje 50 epizoda za Pi0.5, isti minimum kao za GR00T i ACT. Predobuka obavlja najveći dio posla, tako da 50 čistih epizoda pobjeđuje 200 neurednih. Novi ste u ovome? Počnite sa vodičem za prikupljanje podataka.

Stranica AY-Robots politika koja upoređuje pet politika koje se mogu trenirati po parametrima, GPU rangu, latenciji i minimalnom broju epizoda
Pi0.5 se nalazi u A100 i H100 rangu sa 485 ms po koraku akcije, sa minimalno 50 epizoda.

Ruta A: fino podešavanje sa openpi repozitorijumom

Referentna implementacija: prvo JAX, testirano samo na Ubuntu 22.04, vođeno konfiguracionim objektima umesto zastavicama. PyTorch putanja je stigla u septembru 2025, validirana na LIBERO. Tri koraka: konvertujte svoje podatke, definišite konfiguraciju, trenirajte i poslužite.

  1. 1
    Klonirajte i instalirajte

    openpi koristi uv. GIT_LFS_SKIP_SMUDGE omogućava da LeRobot dođe kao zavisnost bez LFS blobova.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Konvertujte svoje podatke u LeRobot skup podataka

    Upstream isporučuje konvertere za LIBERO i DROID i očekuje da prilagodite jedan. Posao je mapiranje ključeva.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Dodajte konfiguraciju za treniranje

    Konfiguracije su TrainConfig unosi u src/openpi/training/config.py. Ova prilagođava pi05_droid_finetune, sa učitavačem težina usmerenim na pi05_base.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Izračunajte normirane statistike

    Pokreće se prema imenu konfiguracije, a ne skupu podataka. Preskakanje je klasičan prvi neuspeh ovde.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Trenirajte

    Varijabla omogućava JAX-u da koristi 90 posto GPU memorije umesto podrazumevanih 75. Na kartici od 80 GB to odlučuje da li će se pokretanje preživeti.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Poslužite ga

    Server sluša na portu 8000 i odgovara na upite za posmatranje; vaše robotsko okruženje je klijent.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch putanja nije JAX putanja

openpi-jeva PyTorch implementacija ne podržava pi0-FAST, mješovitu preciznost, FSDP, LoRA ili EMA težine, tako da je LoRA koja dostiže 22.5 GB samo za JAX, putem gemma_2b_lora i gemma_300m_lora varijanti. Još gore: podešavanje kopira zakrpljene datoteke preko vaših instaliranih transformers 4.53.2, a README upozorava da sa uv-ovim podrazumijevanim načinom hardlinka ovo trajno mijenja transformere u uv kešu i može se proširiti na druge projekte. Poništite to sa uv cache clean transformers.

Ruta B: fino podešavanje sa lerobot pi05

LeRobot port obuhvata iste težine u CLI-ju koji već koristite za ACT i SmolVLA. Sve ispod je provjereno u odnosu na lerobot 0.6.1, izdanje od 3. avgusta 2026, i pi05 dokumentaciju od 23. avgusta 2026. Verzije su ovdje bitne: v3.0 skupovi podataka stigli su sa 0.4.0 u oktobru 2025, blog 0.5.0 od 9. marta 2026. predstavlja pi0-FAST i Real-Time Chunking, a 0.6.0 od 6. jula 2026. učinio je osnovni paket laganim i premjestio implementaciju na lerobot-rollout.

Jedna stvar se nije pomjerila: lerobot-train i lerobot-record su već bili ulazne tačke u 0.3.2, avgusta 2025. Tutorijal koji još uvijek poziva python -m lerobot.scripts.train prethodi godini promjena i vrijedi mu ne vjerovati ni u ostalom.

  1. 1
    Instalacija sa pravim dodacima

    Od verzije 0.6.0 osnovna instalacija sadrži samo osnovne ML zavisnosti, a pi dodatak ne dodaje kod za skup podataka ili obuku, tako da fino podešavanje zahteva i dodatak za obuku. Starije jednolinijske komande ovde ne uspevaju prilikom uvoza.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Autentifikacija

    Prihvatite licencu paligemma-3b-pt-224 u pregledaču, a zatim se prijavite na mašini koja vrši obuku.

    bash
    hf auth login
  3. 3
    Dodavanje kvantilnih statistika

    Pi0.5 normalizuje STATE i ACTION pomoću kvantila, tako da meta/stats.json zahteva q01 i q99. Stariji skupovi podataka sadrže samo min, max, mean, std.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    Fino podešavanje iz lerobot/pi05_base

    Podesite veličinu paketa na ono što vaša kartica može da podnese; dokumentacija koristi 64 na LIBERO-u sa 80 GB. Eksplicitno prosledite bfloat16, podrazumevana konfiguracija je float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Pokrenite ga na ruci

    U verziji 0.6.x ovo je lerobot-rollout: lerobot-record odbija politiku i odbacuje nazive eval_ skupova podataka. Base upravlja rukom, sentry snima izvođenje.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
ZastavaŠta radiNapomena
--policy.type=pi05bira Pi0.5obavezno sa pretrained_path, izostavite sa --policy.path
--policy.pretrained_pathučitava samo težinenazivi funkcija iz vašeg skupa podataka, sačuvana podešavanja se resetuju
--policy.pathtežine plus config.json kontrolne tačkesačuvana podešavanja kao što je n_action_steps se nasleđuju
--policy.n_action_stepskoraci potrošeni po deluvraća se na 50, nikada iznad chunk_size (podrazumevano 50)
--policy.train_expert_onlyzamrzava VLM, obučava ekspertapodrazumevano false, manje memorije, neki trošak u uspehu
--policy.gradient_checkpointingponovo izračunava umesto da skladišti aktivacijepodrazumevano false, prva poluga kada se pokretanje neće uklopiti
--peft.method_type=LORALoRA adapteri umesto punih težinazahteva peft dodatak, dokumentovani primer je SmolVLA
--policy.rtc_training_max_delaykondicioniranje prefiksa akcije za RTCsamo glavna grana, nije u 0.6.1, mora ostati ispod chunk_size
--rename_mapmapira kolone skupa podataka na funkcije politikepotrebno kada se vaši ključevi kamere razlikuju
Greška koju većina prvih pokretanja doživi

Bez kvantila dobijate ValueError: QUANTILES normalization mode requires q01 and q99 stats na prvom paketu. Ponovo izračunajte statistike, ali rezultat se nalazi u $HF_LEROBOT_HOME/your_dataset, a ne u kešu koji čita --dataset.repo_id, pa obučavajte sa --dataset.root koji pokazuje tamo ili gurnite na Hub. Ili preskočite kvantile sa --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kao što to radi referentna komanda LIBERO.

Tri skupa podrazumevanih vrednosti i koje od njih stižu do trenera

openpi-jev TrainConfig je referenca, LeRobot-ov PI05Config je ono što lerobot-train koristi kada ništa ne kažete, a obrazac ovdje šalje treći skup. Iznenađenje je stopa učenja: oba podrazumijevana podešavanja dostižu vrhunac na 2.5e-5, dok openpi-jev vlastiti pi05_libero config i ova platforma je podižu na 5e-5.

Postavkaopenpi TrainConfiglerobot pi05 i lerobot-trainAY-Robots šalje
Veličina paketa3281
Vršna stopa učenja2.5e-5, kosinusni padoptimizer_lr 2.5e-55e-5
Koraci obuke30,000100,00030,000
Interval kontrolne tačke1,000 steps20,000 stepsnije u obrascu
Sjeme421,000u obrascu
Akcioni blokaction_horizon 50chunk_size 50, n_action_steps 50nije u obrascu
Tip podataka težinebfloat16float32 dok ne proslijedite --policy.dtypenije u obrascu
Akumulacija gradijentanema takvog prekidača, umjesto toga fsdp_devicesodsutno iz svakog izdanja do sada16, i ispušteno je

Je li port vjeran? Tim LeRobot-a je dodatno fino podesio osnovni model LIBERO za 6k koraka i uporedio ga sa referentnim brojevima openpi-ja na četiri paketa: 97.5 posto prosječno naspram 96.85, ispred na Libero 10, iza na Spatial. Ruta je izbor alata, a ne kvaliteta.

Fino podešavanje Pi0.5 na vlastitim podacima
Prednosti
  • Više od 10.000 sati pre-obuke robota stoji iza toga, tako da 50 epizoda vašeg zadatka može biti dovoljno.
  • Kontinuirane akcije: nema tokenizatora za podešavanje, nema diskretizacijskog praga na vašim zglobnim uglovima.
  • LeRobot port postiže 97.5 posto na LIBERO prosjeku naspram openpi-jevih 96.85, tako da prijateljskiji CLI ne košta ništa mjerljivo.
  • Parametarski efikasne putanje na obje strane: openpi-jeve JAX LoRA varijante, LeRobot-ova PEFT integracija.
Kompromisi
  • Potpuno fino podešavanje zahtijeva više od 70 GB. Broj od 22.5 GB LoRA je openpi-jev JAX broj; nijedan nije objavljen za pi05 pod PEFT-om.
  • 485 ms po akcionom koraku, najsporiji od pet ovdje: dvostruko sporiji od SmolVLA, dvadeset četiri puta sporiji od ACT-a.
  • LeRobot v3.0 je potreban, tako da se skup podataka snimljen za GR00T pokret mora konvertovati, i obrnuto.
  • Nove opcije prvo dolaze na main: RTC i MEM memorija tokom obuke nisu u 0.6.1, tako da najnovija dokumentacija može značiti instalaciju sa git-a.

Stvarnost od 485 ms i gdje prestaje biti upotrebljiva

Ovo odlučuje o vašem projektu, stoga dolazi prije tabele troškova. po koraku akcije izmjereno ovdje za Pi0.5 iznosi 485 ms. U poređenju sa ostala četiri:

PolitikaInferencija po koraku akcijeParametriGPU nivoMinimalne epizode
ACT20 ms~80 MRTX 4090 ili bilo koja kartica od 24 GB50
GR00T N1.7152 ms~3 BA100 80 GB ili H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB ili H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 ili bilo koja kartica od 24 GB30
Pi0.5485 ms~3 BA100 80 GB ili H100 80 GB50
AY-Robots stranica za direktno poređenje za GR00T N1.7 protiv Pi0.5, sa parametrima, GPU nivoom, kašnjenjem i formatom skupa podataka
Isti GPU nivo, isti donji prag epizoda, različita verzija skupa podataka, trostruki jaz u kašnjenju.
Inferencija mora biti pored servoa

Kontrolna petlja u ovih pet modela traje 20 do 485 ms po koraku akcije. Povratna putovanja preko javnog interneta, povrh 485 ms, pretvaraju funkcionalnu politiku u oklijevajuću. Daljinska inferencija je izvodljiva za sporo uzimanje i postavljanje, ne za brzo reaktivno kretanje. Radije bismo to rekli nego prodali demo koji radi samo na LAN-u. Ako se vaša ruka zaustavlja između segmenata, počnite od politika se zamrzava usred kretanja.

Upstream ima odgovor, a pola toga je već u izdanju koje možete instalirati. Real-Time Chunking generira sljedeći segment dok ruka još uvijek izvršava trenutni, zatim vodi preklapajuće korake novog segmenta da ostanu blizu već izvršenog dijela, tako da se ruka ne zaustavlja ili trza na spoju. Oblik za vrijeme inferencije isporučen je u changelogu 0.4.2 za Pi0, Pi0.5 i SmolVLA i predstavlja zastavicu za implementaciju, a ne za ponovno treniranje:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon je broj koraka prethodnog segmenta s kojima se novi mora složiti; RTC dokumentacija navodi 8 do 12 kao uobičajeni raspon. Zadani pozadinski sustav inferencije je --inference.type=sync.

To ne čini model bržim. To skriva prazninu: 485 ms se i dalje troši, ali izvan kritične putanje, tako da red ne presuši između segmenata. Varijanta za vrijeme treniranja iz arXiv 2512.05964 ide dalje: model uči uvjetovati se na čistom prefiksu akcije, tako da se pri inferenciji preklapanje čvrsto 'inpainta' s vremenskim koracima toka po akciji umjesto da se vodi, a povratni prolaz vođenja nestaje. Tijekom treniranja uzorkuje duljinu prefiksa po primjeru i uzima gubitak toka na preostalom postfiksu. Ta zastavica postoji samo na glavnoj grani, ne u 0.6.1, a kašnjenje za koje trenirate mora ostati ispod chunk_size.

Dva načina za dobijanje Pi0.5 kontrolne tačke

Iznajmljujete ili posedujete karticu od 80 GB, instalirate jedan od gore navedenih stekova, konvertujete svoj skup podataka i nadgledate pokretanje. Zadržavate svaku kontrolu: openpi-jev JAX LoRA, LeRobot-ove PEFT adaptere, relativne akcije, prilagođena mapiranja tastera. Takođe zadržavate svaki neuspeh.

  • Hardver: A100 80 GB ili H100, ili kartica od 24 GB na openpi-jevom JAX LoRA putu.
  • Podešavanje: jedno popodne za prvo pokretanje, uglavnom mapiranje tastera i gated tokenizer.
  • Nije na hostovanoj formi: PEFT adapteri, relativne akcije, RTC u vreme treninga, MEM memorija.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Komanda koju nijedna hostovana forma ne pokreće, i pip ne može da instalira: RTC u vreme treninga je flag glavne grane.

Kada ne radi

SimptomNajverovatniji uzrok
Pokretanje odbijeno pre početkaSkup podataka v2.1, ali Pi0.5 želi v3.0, ili obrnuto za GR00T
ImportError, nedostaje datasets paketlerobot 0.6.x bez dodatka za trening
ValueError o q01 i q99 na prvom paketuNema kvantila u meta/stats.json; ponovo izračunajte ili koristite MEAN_STD
CUDA nema dovoljno memorije u koraku 0Potpuno fino podešavanje ispod 70 GB; pokušajte sa kontrolnim tačkama ili train_expert_only
401 ili greška gated repozitorijumaLicenca PaliGemma tokenizatora nije prihvaćena
Gubitak opada, robot ne radi ništaNepodudarnost normalizacije, ili politika kopira stanje
Ruka pauzira između delovaLatencija po koraku plus povratno putovanje; red čekanja za delove se isprazni
Radi u jednom podešavanju, ne radi u drugomPreviše malo epizoda, ili sve u jednoj konfiguraciji

Koliko košta jedno pokretanje

Pi0.5 se nalazi u skupom sloju jer mu je potrebna kartica od 80 GB, a spot cijene se mijenjaju, tako da je broj raspon, a ne cijena. Za mnoge SO-100 zadatke, prvo obučite SmolVLA ili ACT na sloju od 24 GB, potvrdite da je zadatak uopšte naučiv, a zatim potrošite A100 sati na njega. Obučite svoju prvu politiku prolazi kroz tu jeftiniju petlju, a cijene sadrži trenutne slojeve.

SlojPolitikeTipično pokretanjeCijena po satuTrošak po pokretanju
A100 80 GB ili H100Pi0.5, GR00T N1.7, GR00T N1.53 do 6 sati1.20 to 2.00 USDoko 4 do 12 USD
RTX 4090 ili bilo koja kartica od 24 GBSmolVLA, ACT2 do 5 sati0.30 to 0.60 USDoko 1 do 3 USD
Tabela troškova AY-Robots koja prikazuje koji GPU svaka politika zahtijeva, tipično vrijeme izvođenja i cijenu, te koliko je epizoda potrebno prije nego što politika postane korisna
Ista dva nivoa na stranici proizvoda: Pi0.5 iznajmljuje karticu od 80 GB, SmolVLA i ACT staju na 4090.

Prije nego što posvetite veče: GR00T N1.7 protiv Pi0.5 i Pi0.5 protiv SmolVLA izlažu iste brojeve jedan pored drugog. Arena sadrži 85 VLA modela sa 332 rezultata benchmarka, svaki povezan sa svojim izvorom, a pozadina o porodici nalazi se u našem pregledu VLA modela.

Trenirajte Pi0.5 bez izgradnje steka

Odaberite skup podataka i hiperparametre u obrascu. Pozadinski sistem iznajmljuje karticu od 80 GB na spot tržištu, pokreće trener i piše kontrolne tačke u skladište objekata. Vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.

Otvorite vodiče za obuku
Mogu li fino podesiti Pi0.5 na RTX 4090?

Ne za potpuno fino podešavanje: openpi navodi više od 70 GB za to, tako da je potrebna A100 80 GB ili H100. Njegova cifra od 22.5 GB za LoRA pripada JAX putanji; PyTorch implementacija nema LoRA. LeRobotova PEFT integracija postoji, ali njen dokumentovani primjer je SmolVLA i nije objavljena cifra VRAM-a za pi05.

Koliko epizoda mi je potrebno?

Pedeset, isto kao i za GR00T i ACT; samo SmolVLA ide niže, na 30. Osnovna kontrolna tačka nosi više od 10,000 sati predobuke, tako da se fino podešavanje prilagođava, a ne uči od nule: 50 čistih, raznolikih epizoda nadmašuje dvjesto iz jedne konfiguracije.

Koja je razlika između --policy.path i --policy.pretrained_path?

--policy.path učitava težine i config.json kontrolne tačke, tako da se nasljeđuju pohranjene postavke kao što je n_action_steps i --policy.type mora biti izostavljen. --policy.pretrained_path učitava samo težine: nazivi funkcija dolaze iz vašeg skupa podataka, pohranjene postavke se resetuju, --policy.type je obavezan. Zato LIBERO komanda eksplicitno prosljeđuje n_action_steps=10 i empty_cameras=1; inače se vraćaju na 50 i 0.

Da li mi otvorena verzija daje puni Pi0.5 iz rada?

Ne. Oba podržavaju samo 'flow matching action head'. Faza predobuke diskretnih tokena sa FAST akcionim tokenizatorom i predviđanje podzadataka visokog nivoa nisu objavljeni, a lerobot/pi05_base kartica dodaje RL na tu listu iako rad o pi0.5 ne opisuje fazu učenja potkrepljenjem. Trenirate niskonivelnu politiku uslovljenu jezičkim nizom koji vi dostavite, a ne model koji sam dekomponuje dugi zadatak.

Protiv kojih verzija je napisan ovaj vodič?

openpi na main grani i lerobot 0.6.1, izdanje od 3. avgusta 2026., oba pročitana 23. avgusta 2026. Skupovi podataka v3.0 stigli su sa 0.4.0 u oktobru 2025. Verzija 0.6.0 učinila je osnovni paket laganim, tako da lerobot[pi] sam više ne instalira stek za obuku, i premjestila je implementaciju na lerobot-rollout. RTC u vrijeme obuke je samo na main grani; hostovani trener ovdje pokreće 0.5.1.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started