Matrica obuke AY-Robots sa pet politika kao redovima i četiri robotske ruke kao kolonama, svaka ćelija je veza ka specifičnom vodiču za fino podešavanje
Pi0.5Usklađivanje tokaVLA obukaLeRobotFino podešavanje

Kako trenirati Pi0.5 na podacima vašeg robota

AY-Robots ResearchAugust 23, 202616 min čitanja

Fino podesite Pi0.5, VLA model za usklađivanje toka (flow-matching) od Physical Intelligence, na podacima vašeg robota. Stvarne komande za openpi i lerobot pi05, zamke formata skupa podataka, VRAM i ograničenja latencije.

Pi0.5 je model koji birate kada politika mora da radi u prostoriji koju nikada ranije nije videla. Takođe je i najnezgodniji od pet politika koje se mogu trenirati ovde za fino podešavanje ručno: uzvodno skladište je prvenstveno JAX, LeRobot port je premestio implementaciju iz lerobot-record-a u verziji 0.6.0 i učinio osnovnu instalaciju premalom za treniranje, a potpuno fino podešavanje ne staje na 4090. Ispod: šta usklađivanje toka košta pri inferenciji, dve komandne rute i broj od 485 ms koji odlučuje da li je rezultat upotrebljiv.

Šta treba da znate

  • VLA za usklađivanje toka: 3B PaliGemma VLM plus 300M ekspert za akcije koji dekodira kontinuirane delove akcija. Dve rute za fino podešavanje, openpi i LeRobot pi05, udaljene 0.65 poena na LIBERO proseku.
  • Potpuno fino podešavanje zahteva više od 70 GB VRAM-a. openpi navodi LoRA na 22.5 GB, samo na svojoj JAX putanji.
  • Skup podataka mora biti LeRobotDataset v3.0 sa q01 i q99 kvantilima u meta/stats.json, inače prva serija baca grešku.
  • Prvo proverite svoju lerobot verziju: 0.6.0 je učinio osnovni paket laganim i premestio implementaciju iz lerobot-record-a.
  • Ovde radi na 485 ms po koraku akcije, zahteva 50 epizoda i košta oko 4 do 12 USD po pokretanju.

Šta je Pi0.5 zapravo

Physical Intelligence je objavio pi0 u oktobru 2024: model za usklađivanje toka model vida-jezika-akcije na unapred obučenom VLM-u: PaliGemma sa 3 milijarde parametara plus 300M ekspert za akcije inicijalizovan od nule, ukupno 3.3 milijarde. Rad izveštava o pre-treningu na preko 10,000 sati robotskih podataka kroz 7 robotskih konfiguracija i 68 zadataka. Više u članku o pi0.

Pi0.5 (arXiv 2504.16054, 22. april 2025) zadržava taj kostur i menja režim obuke: veb podaci, detekcija objekata, verbalna uputstva od ljudi koji obučavaju robota, oznake podzadataka, podaci o unakrsnom otelotvorenju od robota u mnogim domovima. Rezultat je robot koji čisti kuhinje u kućama koje nisu bile u skupu za obuku. openpi README dodaje detalj koji naslov ne sadrži: objavljeni pi0.5 je obučen sa knowledge insulation (arXiv 2505.23705).

Svojstvopi0pi0.5
VLM varijanta okosnicegemma_2b (PaliGemma)gemma_2b (PaliGemma)
Varijanta akcionog ekspertagemma_300mgemma_300m
action_dim3232
podrazumevani action_horizon5050
max_token_len48200
discrete_state_inputfalsetrue, stanje diskretizovano u segmente u promptu
Osnovni kontrolni punktgs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Ono što je javno nije ceo rad

openpi README je eksplicitan: repozitorijum podržava samo flow matching head, kako za obuku tako i za inferenciju pi0.5. Rad opisuje dve faze, a kod sadrži samo drugu: pre-obuka predstavlja svaku akciju kao diskretne tokene putem FAST tokenizatora, a pri implementaciji model zaključuje podzadatak visokog nivoa pre svakog bloka akcija. Ništa od toga nije u repozitorijumu. Kartica lerobot/pi05_base daje istu listu i dodaje RL, iako rad o pi0.5 uopšte ne opisuje fazu učenja potkrepljivanjem. LeRobot port nasleđuje taj opseg, kao i svaki hostovani trener na njemu, uključujući ovaj ovde. Licenciranje je takođe podeljeno: pi05 doc page kaže Apache 2.0, kartica lerobot/pi05_base je označena sa license: gemma.

Šta flow matching menja u vezi sa obukom i inferencijom

A politika koju možete trenirati na SO-100 ili direktno regresira akcije (ACT) ili ih tokenizuje i dekodira autoregresivno (pi0-FAST). Usklađivanje toka ne radi ni jedno ni drugo: ono uči vektorsko polje koje prenosi šum do čistog segmenta akcije, a zatim ga integriše. Pi0 rad koristi 10 koraka integracije sa veličinom koraka 0.1; LeRobot-ova pi05 konfiguracija sadrži isti num_inference_steps: int = 10.

  • Trening: gubitak regresira segment akcije sa šumom. Nema tokenizatora za podešavanje, nema diskretizacije vaših zglobnih uglova.
  • Inferencija: jedan segment košta deset prolaza unapred kroz eksperta za akcije. To je strukturno, a ne problem podešavanja.
  • Izlaz: kontinuirane akcije dimenzije 32, interno popunjene, gubitak se uzima na dimenzijama koje vaš robot ima. Ruka sa 6-stepeni slobode plus hvataljka koristi 7.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
Pročitano iz src/openpi/models/pi0_config.py na glavnoj grani openpi, 23. avgust 2026.

PaliGemma okosnica i kapija ispred nje

PaliGemma (arXiv 2407.07726) je SigLIP-So400m vizuelni enkoder na Gemma-2B jezičkom modelu, sa oko 3B parametara. Pi0.5 nasleđuje svoj tokenizator, a taj tokenizator se nalazi u zatvorenom repozitorijumu. Ovo je najčešći način na koji prvi pokušaj propada, pre prvog koraka obuke.

Prihvatite zatvorenu licencu pre nego što iznajmite GPU

Dokumentacija za LeRobot pi05 to jasno navodi: pi0.5 koristi zatvoreni google/paligemma-3b-pt-224 tokenizator, stoga prihvatite njegovu licencu na Hub-u i prvo pokrenite hf auth login. Pristup se odobrava ručno, ne trenutno. Preskočite to, pokrenite plaćeno izvršavanje u oblaku i platićete pod koji ne može da preuzme tokenizator.

Pre nego što počnete: format skupa podataka, epizode, hardver

Pi0.5 u LeRobot-u čita LeRobot skup podataka u v3.0 rasporedu, koji je stigao sa lerobot 0.4.0 u oktobru 2025: mnogo epizoda po Parquet i MP4 datoteci umesto jedne datoteke po epizodi, sa granicama u meta/episodes/ umesto u nazivima datoteka. Snimajte sa desktop klijentom ili pratite snimite svoj prvi skup podataka i imaćete ga.

RežimPotrebna GPU memorijaPrimer GPU-a
Inferencijaviše od 8 GBRTX 4090
Fino podešavanje, LoRAviše od 22.5 GBRTX 4090
Fino podešavanje, punoviše od 70 GBA100 80 GB ili H100
Verziona zamka koja košta dan

Pi0.5 i SmolVLA zahtevaju LeRobot v3.0. GR00T N1.7 i GR00T N1.5 zahtevaju v2.0 ili v2.1 i padaju na skupu podataka v3.0. Jedna sesija snimanja ne može da napaja oba bez konverzije, a greška ne kaže "pogrešna verzija skupa podataka". Pogledajte skup podataka odbijen: v3 je potreban.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
Iz dokumentacije LeRobotDataset v3.0.

Platforma zahteva najmanje 50 epizoda za Pi0.5, što je isti minimum kao za GR00T i ACT. Predobuka obavlja najveći deo posla, tako da 50 čistih epizoda vredi više od 200 neurednih. Novi ste u ovome? Počnite sa vodičem za prikupljanje podataka.

Stranica sa politikama AY-Robots koja upoređuje pet politika koje se mogu trenirati po parametrima, GPU rangu, latenciji i minimalnom broju epizoda
Pi0.5 se nalazi u A100 i H100 rangu sa 485 ms po koraku akcije, sa minimalno 50 epizoda.

Ruta A: fino podešavanje pomoću openpi repozitorijuma

Referentna implementacija: prvo JAX, testirano samo na Ubuntu 22.04, vođeno konfiguracionim objektima umesto zastavicama. PyTorch putanja je stigla u septembru 2025, validirana na LIBERO. Tri koraka: konvertujte svoje podatke, definišite konfiguraciju, trenirajte i poslužite.

  1. 1
    Klonirajte i instalirajte

    openpi koristi uv. GIT_LFS_SKIP_SMUDGE omogućava da LeRobot bude zavisnost bez LFS blobova.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Konvertujte svoje podatke u LeRobot skup podataka

    Upstream isporučuje konvertore za LIBERO i DROID i očekuje da prilagodite jedan. Posao je mapiranje ključeva.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Dodajte konfiguraciju za obuku

    Konfiguracije su TrainConfig unosi u src/openpi/training/config.py. Ova prilagođava pi05_droid_finetune, sa učitavačem težina usmerenim na pi05_base.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Izračunajte statistiku normi

    Pokreće se u odnosu na naziv konfiguracije, a ne na skup podataka. Preskakanje ovoga je klasičan prvi neuspeh ovde.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Trenirajte

    Varijabla omogućava JAX-u da koristi 90 posto GPU memorije umesto podrazumevanih 75. Na kartici od 80 GB to odlučuje da li će se pokretanje izvršiti do kraja.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Poslužite ga

    Server sluša na portu 8000 i odgovara na upite za posmatranje; vaše robotsko okruženje je klijent.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
Putanja PyTorch-a nije putanja JAX-a

openpi-jeva PyTorch implementacija ne podržava pi0-FAST, mešovitu preciznost, FSDP, LoRA ili EMA težine, tako da je LoRA koja dostiže 22.5 GB samo za JAX, putem varijanti gemma_2b_lora i gemma_300m_lora. Još gore: podešavanje kopira zakrpljene datoteke preko vaših instaliranih transformers 4.53.2, a README upozorava da sa podrazumevanim hardlink režimom uv-a ovo trajno menja transformers u uv kešu i može se proširiti na druge projekte. Poništite to sa uv cache clean transformers.

Ruta B: fino podešavanje sa lerobot pi05

LeRobot port obuhvata iste težine u CLI-u koji već koristite za ACT i SmolVLA. Sve dole navedeno je provereno u odnosu na lerobot 0.6.1, izdanje od 3. avgusta 2026, i pi05 dokumentaciju od 23. avgusta 2026. Verzije su ovde važne: v3.0 skupovi podataka stigli su sa 0.4.0 u oktobru 2025, blog 0.5.0 od 9. marta 2026. predstavlja pi0-FAST i Real-Time Chunking, a 0.6.0 od 6. jula 2026. učinio je osnovni paket laganim i prebacio implementaciju na lerobot-rollout.

Jedna stvar se nije promenila: lerobot-train i lerobot-record su već bili ulazne tačke u 0.3.2, avgusta 2025. Tutorijal koji i dalje poziva python -m lerobot.scripts.train prethodi godini promena i vredi mu ne verovati ni u ostalom.

  1. 1
    Instalacija sa pravim dodacima

    Od verzije 0.6.0, osnovna instalacija sadrži samo osnovne ML zavisnosti, a 'pi' dodatak ne dodaje kod za skup podataka ili obuku, tako da fino podešavanje zahteva i 'training' dodatak. Starije jednolinijske komande ovde ne uspevaju pri uvozu.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Autentifikacija

    Prihvatite licencu paligemma-3b-pt-224 u pregledaču, a zatim se prijavite na mašini koja vrši obuku.

    bash
    hf auth login
  3. 3
    Dodavanje kvantilnih statistika

    Pi0.5 normalizuje STATE i ACTION pomoću kvantila, tako da meta/stats.json zahteva q01 i q99. Stariji skupovi podataka sadrže samo min, max, mean, std.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    Fino podešavanje iz lerobot/pi05_base

    Podesite veličinu paketa (batch size) na ono što vaša kartica može da podnese; dokumentacija koristi 64 na LIBERO sa 80 GB. Eksplicitno prosledite bfloat16, podrazumevana vrednost konfiguracije je float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Pokrenite ga na ruci

    U verziji 0.6.x ovo je lerobot-rollout: lerobot-record odbija politiku i odbacuje nazive eval_ skupova podataka. Base upravlja rukom, sentry snima izvođenje.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
ZastavaŠta radiNapomena
--policy.type=pi05bira Pi0.5obavezno sa pretrained_path, izostaviti sa --policy.path
--policy.pretrained_pathučitava samo težinenazivi karakteristika iz vašeg skupa podataka, sačuvana podešavanja se resetuju
--policy.pathtežine plus config.json kontrolne tačkesačuvana podešavanja kao što je n_action_steps se nasleđuju
--policy.n_action_stepskoraci potrošeni po deluvraća se na 50, nikada iznad chunk_size (podrazumevano 50)
--policy.train_expert_onlyzamrzava VLM, obučava ekspertapodrazumevano false, manje memorije, neki trošak u uspehu
--policy.gradient_checkpointingponovo izračunava umesto da skladišti aktivacijepodrazumevano false, prva poluga kada se pokretanje ne uklapa
--peft.method_type=LORALoRA adapteri umesto punih težinazahteva peft dodatak, dokumentovani primer je SmolVLA
--policy.rtc_training_max_delaykondicioniranje prefiksa akcije za RTCsamo glavna grana, nije u 0.6.1, mora ostati ispod chunk_size
--rename_mapmapira kolone skupa podataka na karakteristike politikepotrebno kada se ključevi vaše kamere razlikuju
Greška na koju većina prvih pokretanja nailazi

Bez kvantila dobijate ValueError: QUANTILES normalization mode requires q01 and q99 stats pri prvom paketu. Ponovo izračunajte statistike, ali rezultat se nalazi u $HF_LEROBOT_HOME/your_dataset, a ne u kešu koji čita --dataset.repo_id, pa trenirajte sa --dataset.root koji pokazuje tamo ili gurnite na Hub. Ili preskočite kvantile sa --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kao što to radi referentna komanda LIBERO.

Tri skupa podrazumevanih vrednosti i koje od njih stižu do trenera

openpi-jev TrainConfig je referenca, LeRobot-ov PI05Config je ono što lerobot-train koristi kada ništa ne kažete, a obrazac ovde šalje treći skup. Iznenađenje je stopa učenja: oba podrazumevana podešavanja dostižu vrhunac od 2.5e-5, dok openpi-jeva sopstvena pi05_libero konfiguracija i ova platforma je podižu na 5e-5.

Podešavanjeopenpi TrainConfiglerobot pi05 i lerobot-trainAY-Robots šalje
Veličina paketa3281
Maksimalna stopa učenja2.5e-5, kosinusni padoptimizer_lr 2.5e-55e-5
Koraci obuke30,000100,00030,000
Interval kontrolne tačke1,000 koraka20,000 korakanije u obrascu
Seed421,000u obrascu
Akcioni blokaction_horizon 50chunk_size 50, n_action_steps 50nije u obrascu
Tip podataka težinebfloat16float32 dok ne prosledite --policy.dtypenije u obrascu
Akumulacija gradijentanema takvog podešavanja, umesto toga fsdp_devicesodsutno iz svakog izdanja do sada16, i izbačeno je

Da li je port veran? LeRobot tim je fino podesio LIBERO osnovni model za dodatnih 6k koraka i uporedio ga sa referentnim brojevima openpi-ja na četiri paketa: 97.5 procenata prosečno naspram 96.85, ispred na Libero 10, iza na Spatial. Ruta je izbor alata, a ne kvaliteta.

Fino podešavanje Pi0.5 na sopstvenim podacima
Prednosti
  • Više od 10,000 sati pre-obuke robota stoji iza toga, tako da 50 epizoda vašeg zadatka može biti dovoljno.
  • Kontinuirane akcije: nema tokenizatora za podešavanje, nema diskretizacione granice na vašim zglobnim uglovima.
  • LeRobot port postiže 97.5 procenata na LIBERO proseku naspram openpi-jevih 96.85, tako da prijateljskiji CLI ne košta ništa merljivo.
  • Parametarski efikasne putanje sa obe strane: openpi-jeve JAX LoRA varijante, LeRobot-ova PEFT integracija.
Kompromisi
  • Potpuno fino podešavanje zahteva više od 70 GB. Broj od 22.5 GB za LoRA je openpi-jev JAX broj; nijedan nije objavljen za pi05 pod PEFT-om.
  • 485 ms po akcionom koraku, najsporiji od pet ovde: dvostruko sporiji od SmolVLA, dvadeset četiri puta sporiji od ACT-a.
  • LeRobot v3.0 je potreban, tako da skup podataka snimljen za GR00T pokretanje treba konvertovati, i obrnuto.
  • Nove opcije prvo stižu na main: RTC i MEM memorija tokom obuke nisu u 0.6.1, tako da najnovija dokumentacija može značiti instalaciju sa git-a.

Stvarnost od 485 ms i gde prestaje da bude upotrebljiva

Ovo odlučuje o vašem projektu, pa dolazi pre tabele troškova. po koraku akcije izmereno ovde za Pi0.5 je 485 ms. U poređenju sa ostala četiri:

PolitikaInferencija po koraku akcijeParametriGPU nivoMinimalne epizode
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots stranica za direktno poređenje GR00T N1.7 sa Pi0.5, sa parametrima, GPU nivoom, kašnjenjem i formatom skupa podataka
Isti GPU nivo, isti minimum epizoda, različita verzija skupa podataka, trostruka razlika u kašnjenju.
Zaključivanje mora biti pored servo motora

Kontrolna petlja ovih pet modela radi 20 do 485 ms po koraku akcije. Povratna putovanja preko javnog interneta, povrh 485 ms, pretvaraju funkcionalnu politiku u oklevajuću. Daljinsko zaključivanje je izvodljivo za sporo uzimanje i postavljanje, ne i za brzo reaktivno kretanje. Radije bismo to rekli nego prodali demo koji radi samo na LAN-u. Ako se vaša ruka zaustavlja između delova, počnite od politika se zamrzava usred pokreta.

Upstream ima odgovor, a pola toga je već u izdanju koje možete instalirati. Real-Time Chunking generiše sledeći deo dok ruka još uvek izvršava trenutni, zatim vodi preklapajuće korake novog dela da ostanu blizu već izvršenog dela, tako da se ruka ne zaustavlja ili trza na spoju. Forma za vreme zaključivanja isporučena je u changelogu 0.4.2 za Pi0, Pi0.5 i SmolVLA i predstavlja rollout zastavicu, a ne ponovnu obuku:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon je broj koraka prethodnog dela sa kojima se novi mora složiti; RTC dokumentacija navodi 8 do 12 kao uobičajeni opseg. Podrazumevani backend za zaključivanje je --inference.type=sync.

To ne čini model bržim. To skriva prazninu: 485 ms se i dalje troši, ali van kritične putanje, tako da red ne presuši između delova. Varijanta za vreme obuke iz arXiv 2512.05964 ide dalje: model uči da se uslovljava čistim prefiksom akcije, tako da se pri zaključivanju preklapanje teško popunjava vremenskim koracima toka po akciji umesto da se vodi, a povratni prolaz vođenja nestaje. Tokom obuke uzorkuje dužinu prefiksa po primeru i uzima gubitak toka na preostalom postfiksu. Ta zastavica postoji samo na glavnoj grani, ne u 0.6.1, a kašnjenje za koje trenirate mora ostati ispod chunk_size.

Dva načina da dobijete Pi0.5 kontrolnu tačku

Iznajmljujete ili posedujete karticu od 80 GB, instalirate jedan od gore navedenih stekova, konvertujete svoj skup podataka i nadgledate pokretanje. Zadržavate svaku opciju: openpi-jev JAX LoRA, LeRobot-ove PEFT adaptere, relativne akcije, prilagođena mapiranja tastera. Zadržavate i svaki neuspeh.

  • Hardver: A100 80 GB ili H100, ili kartica od 24 GB na openpi-jevom JAX LoRA putu.
  • Podešavanje: jedno popodne za prvo pokretanje, uglavnom mapiranje tastera i gated tokenizer.
  • Nije dostupno na hostovanoj formi: PEFT adapteri, relativne akcije, RTC u vreme treninga, MEM memorija.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Komanda koju hostovana forma ne pokreće, a pip ne može da instalira: RTC u vreme treninga je flag glavne grane.

Kada ne radi

SimptomNajverovatniji uzrok
Pokretanje odbijeno pre nego što počneSkup podataka v2.1, ali Pi0.5 želi v3.0, ili obrnuto za GR00T
ImportError, nedostaje paket datasetslerobot 0.6.x bez dodatka za trening
ValueError o q01 i q99 na prvom paketuNema kvantila u meta/stats.json; ponovo izračunajte ili koristite MEAN_STD
CUDA nema dovoljno memorije u koraku 0Potpuno fino podešavanje ispod 70 GB; pokušajte sa checkpointing-om ili train_expert_only
Greška 401 ili gated repo greškaLicenca PaliGemma tokenizera nije prihvaćena
Gubitak opada, robot ne radi ništaNepodudarnost normalizacije, ili politika kopira stanje
Ruka pauzira između delovaKašnjenje po koraku plus povratno putovanje; red čekanja za delove se isprazni
Radi u jednom podešavanju, ne radi u drugomPremalo epizoda, ili sve u jednoj konfiguraciji

Koliko košta jedno pokretanje

Pi0.5 se nalazi u skupom nivou jer mu je potrebna kartica od 80 GB, a spot cene se menjaju, tako da je cifra raspon, a ne fiksna cena. Za mnoge SO-100 zadatke, prvo obučite SmolVLA ili ACT na nivou od 24 GB, potvrdite da je zadatak uopšte naučiv, a zatim potrošite A100 sate na njega. Obučite svoju prvu politiku prolazi kroz tu jeftiniju petlju, a cene sadrži trenutne nivoe.

NivoPolitikeTipično pokretanjeCena po satuCena po pokretanju
A100 80 GB or H100Pi0.5, GR00T N1.7, GR00T N1.53 to 6 hours1.20 to 2.00 USDabout 4 to 12 USD
RTX 4090 or any 24 GB cardSmolVLA, ACT2 to 5 hours0.30 to 0.60 USDabout 1 to 3 USD
Tabela troškova AY-Robots koja prikazuje koji GPU je potreban za svaku politiku, tipično vreme izvršavanja i cenu, kao i koliko je epizoda potrebno pre nego što politika postane korisna
Ista dva nivoa na stranici proizvoda: Pi0.5 iznajmljuje karticu od 80 GB, SmolVLA i ACT staju na 4090.

Pre nego što posvetite veče: GR00T N1.7 protiv Pi0.5 i Pi0.5 protiv SmolVLA izlažu iste brojeve jedan naspram drugog. Arena sadrži 85 VLA modela sa 332 rezultata benčmarka, svaki povezan sa svojim izvorom, a pozadina o porodici je u našem pregledu VLA modela.

Trenirajte Pi0.5 bez izgradnje steka

Izaberite skup podataka i hiperparametre u obrascu. Bekend iznajmljuje karticu od 80 GB na spot tržištu, pokreće trener i upisuje kontrolne tačke u skladište objekata. Vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.

Otvorite vodiče za obuku
Mogu li fino podesiti Pi0.5 na RTX 4090?

Nije potpuno fino podešavanje: openpi navodi više od 70 GB za to, tako da je potrebna A100 80 GB ili H100. Njegova LoRA vrednost od 22.5 GB pripada JAX putanji; PyTorch implementacija nema LoRA. LeRobot-ova PEFT integracija postoji, ali njen dokumentovani primer je SmolVLA i nije objavljena VRAM vrednost za pi05.

Koliko epizoda mi je potrebno?

Pedeset, isti minimum kao GR00T i ACT; samo SmolVLA ide niže, na 30. Osnovna kontrolna tačka nosi više od 10,000 sati predobuke, tako da se fino podešavanje prilagođava umesto da uči od nule: 50 čistih, raznovrsnih epizoda pobeđuje dve stotine iz jedne konfiguracije.

Koja je razlika između --policy.path i --policy.pretrained_path?

--policy.path učitava težine i config.json kontrolne tačke, tako da se nasleđuju sačuvana podešavanja kao što su n_action_steps i --policy.type mora biti izostavljen. --policy.pretrained_path učitava samo težine: imena funkcija dolaze iz vašeg skupa podataka, sačuvana podešavanja se resetuju, --policy.type je obavezan. Zato LIBERO komanda eksplicitno prosleđuje n_action_steps=10 i empty_cameras=1; inače se vraćaju na 50 i 0.

Da li mi otvorena verzija daje pun Pi0.5 iz rada?

Ne. Oba podržavaju samo glavu akcije za usklađivanje toka. Faza predobuke diskretnih tokena sa FAST tokenizatorom akcija i predviđanje podzadataka visokog nivoa nisu objavljeni, a lerobot/pi05_base kartica dodaje RL na tu listu iako rad o pi0.5 ne opisuje fazu učenja potkrepljivanjem. Trenirate niskonivojsku politiku uslovljenu jezičkim nizom koji vi obezbeđujete, a ne model koji sam dekomponuje dug zadatak.

Protiv kojih verzija je napisan ovaj vodič?

openpi na glavnoj grani i lerobot 0.6.1, izdanje od 3. avgusta 2026, oba pročitana 23. avgusta 2026. Skupovi podataka v3.0 stigli su sa 0.4.0 u oktobru 2025. Verzija 0.6.0 je učinila osnovni paket laganim, tako da lerobot[pi] sam više ne instalira stek za obuku, i prebacila je implementaciju na lerobot-rollout. RTC u vreme obuke je samo na glavnoj grani; hostovani trener ovde pokreće 0.5.1.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started