Matrica za obuku AY-Robots s pet politika kao redovima i četiri robotske ruke kao stupcima, svaka ćelija poveznica na specifični vodič za fino podešavanje
Pi0.5Podudaranje tokaVLA obukaLeRobotFino podešavanje

Kako trenirati Pi0.5 na vlastitim robotskim podacima

AY-Robots ResearchAugust 23, 202616 min čitanja

Fino podesite Pi0.5, VLA model za podudaranje toka (flow-matching VLA) tvrtke Physical Intelligence, na vlastitim robotskim podacima. Stvarne naredbe za openpi i lerobot pi05, zamke formata skupa podataka, ograničenja VRAM-a i latencije.

Pi0.5 je model za kojim posežete kada politika mora raditi u prostoriji koju nikada prije nije vidjela. Također je i najnezgrapniji od pet politika koje se mogu trenirati ovdje za fino podešavanje ručno: uzvodno spremište je prvenstveno JAX, LeRobot port je premjestio implementaciju iz lerobot-recorda u verziji 0.6.0 i učinio osnovnu instalaciju premalom za treniranje, a potpuno fino podešavanje ne stane na 4090. Ispod: što usklađivanje toka košta pri inferenciji, dvije komandne rute i broj od 485 ms koji odlučuje je li rezultat upotrebljiv.

Što trebate znati

  • VLA s usklađivanjem toka: 3B PaliGemma VLM plus 300M stručnjak za akcije koji dekodira kontinuirane dijelove akcija. Dvije rute za fino podešavanje, openpi i LeRobot pi05, s razlikom od 0.65 bodova na LIBERO prosjeku.
  • Potpuno fino podešavanje zahtijeva više od 70 GB VRAM-a. openpi navodi LoRA-u na 22.5 GB, samo na svojoj JAX putanji.
  • Skup podataka mora biti LeRobotDataset v3.0 s q01 i q99 kvantilima u meta/stats.json, inače će prva serija baciti grešku.
  • Prvo provjerite svoju lerobot verziju: 0.6.0 je učinio osnovni paket laganim i premjestio implementaciju iz lerobot-recorda.
  • Ovdje radi na 485 ms po koraku akcije, zahtijeva 50 epizoda i košta oko 4 do 12 USD po pokretanju.

Što je Pi0.5 zapravo

Physical Intelligence objavio je pi0 u listopadu 2024.: model s usklađivanjem toka vizualno-jezično-akcijski model na prethodno treniranom VLM-u: PaliGemma s 3 milijarde parametara plus 300M stručnjak za akcije inicijaliziran od nule, ukupno 3.3 milijarde. Rad izvještava o pred-treniranju na preko 10,000 sati robotskih podataka kroz 7 robotskih konfiguracija i 68 zadataka. Više u članku o pi0.

Pi0.5 (arXiv 2504.16054, 22. travnja 2025.) zadržava taj kostur i mijenja režim treninga: web podaci, detekcija objekata, verbalne upute ljudi koji podučavaju robota, oznake podzadataka, podaci o unakrsnoj inkarnaciji od robota u mnogim domovima. Rezultat je robot koji čisti kuhinje u kućama koje nisu bile u skupu za trening. README datoteka openpi dodaje detalj koji naslov ne sadrži: objavljeni pi0.5 je treniran s izolacijom znanja (arXiv 2505.23705).

Svojstvopi0pi0.5
Varijanta VLM okosnicegemma_2b (PaliGemma)gemma_2b (PaliGemma)
Varijanta stručnjaka za akcijegemma_300mgemma_300m
action_dim3232
zadana vrijednost action_horizon5050
max_token_len48200
diskretni ulaz stanjafalsetrue, stanje diskretizirano u spremnike u upitu
Osnovna kontrolna točkags://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Ono što je javno nije cijeli rad

README datoteka openpi je eksplicitna: repozitorij podržava samo glavu za usklađivanje toka (flow matching head), za trening i inferenciju pi0.5. Rad opisuje dvije faze, a kod sadrži samo drugu: pre-trening predstavlja svaku akciju kao diskretne tokene putem FAST tokenizera, a pri implementaciji model zaključuje podzadatak visoke razine prije svakog bloka akcija. Ništa od toga nije u repozitoriju. Kartica lerobot/pi05_base daje isti popis i dodaje RL, iako rad o pi0.5 uopće ne opisuje fazu učenja potpomognutog nagradom. LeRobot port nasljeđuje taj opseg, kao i svaki hostirani trener na njemu, uključujući ovaj ovdje. Licenciranje je također podijeljeno: stranica s dokumentacijom pi05 kaže Apache 2.0, kartica lerobot/pi05_base je označena s license: gemma.

Što usklađivanje toka mijenja u vezi s treningom i inferencijom

Politika koju možete trenirati na SO-100 ili izravno regresira akcije (ACT) ili ih tokenizira i autoregresivno dekodira (pi0-FAST). Usklađivanje toka ne radi nijedno od toga: ono uči vektorsko polje koje prenosi šum do čistog bloka akcija, a zatim ga integrira. Rad o pi0 koristi 10 koraka integracije s veličinom koraka 0.1; LeRobotova pi05 konfiguracija sadrži isti num_inference_steps: int = 10.

  • Trening: gubitak regresira bučni blok akcija. Nema tokenizatora za podešavanje, nema diskretizacije vaših kutova zglobova.
  • Inferencija: jedan blok košta deset prolaza unaprijed kroz stručnjaka za akcije. To je strukturno, a ne problem podešavanja.
  • Izlaz: kontinuirane akcije dimenzije 32, interno popunjene, gubitak se uzima na dimenzijama koje vaš robot ima. Ruka sa 6-stupnjeva slobode plus hvataljka koristi 7.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
Pročitano iz src/openpi/models/pi0_config.py na glavnoj grani openpi, 23. kolovoza 2026.

PaliGemma okosnica i vrata ispred nje

PaliGemma (arXiv 2407.07726) je SigLIP-So400m vizualni enkoder na jezičnom modelu Gemma-2B, s oko 3B parametara. Pi0.5 nasljeđuje svoj tokenizator, a taj se tokenizator nalazi u zatvorenom repozitoriju. Ovo je najčešći način na koji prvi pokretaj propadne, prije prvog koraka obuke.

Prihvatite zatvorenu licencu prije nego unajmite GPU

Dokumentacija LeRobot pi05 jasno navodi: pi0.5 koristi zatvoreni google/paligemma-3b-pt-224 tokenizator, stoga prvo prihvatite njegovu licencu na Hubu i pokrenite hf auth login. Pristup se odobrava ručno, ne odmah. Preskočite to, pokrenite plaćeno izvršavanje u oblaku i platit ćete za pod koji ne može preuzeti tokenizator.

Prije nego počnete: format skupa podataka, epizode, hardver

Pi0.5 u LeRobotu čita LeRobot skup podataka u v3.0 rasporedu, koji je stigao s lerobot 0.4.0 u listopadu 2025.: mnogo epizoda po Parquet i MP4 datoteci umjesto jedne datoteke po epizodi, s granicama u meta/episodes/ umjesto u nazivima datoteka. Snimite s desktop klijentom ili slijedite snimite svoj prvi skup podataka i imat ćete ga.

Način radaPotrebna GPU memorijaPrimjer GPU-a
Zaključivanjeviše od 8 GBRTX 4090
Fino podešavanje, LoRAviše od 22.5 GBRTX 4090
Fino podešavanje, potpunoviše od 70 GBA100 80 GB ili H100
Verzijska zamka koja košta cijeli dan

Pi0.5 i SmolVLA zahtijevaju LeRobot v3.0. GR00T N1.7 i GR00T N1.5 zahtijevaju v2.0 ili v2.1 i ruše se na skupu podataka v3.0. Jedna sesija snimanja ne može poslužiti oboma bez konverzije, a pogreška ne kaže "pogrešna verzija skupa podataka". Pogledajte skup podataka odbijen: potrebna v3.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
Iz dokumentacije LeRobotDataset v3.0.

Platforma zahtijeva najmanje 50 epizoda za Pi0.5, što je isti minimum kao za GR00T i ACT. Predobuka obavlja najveći dio posla, tako da 50 čistih epizoda nadmašuje 200 neurednih. Novi ste u ovome? Započnite s vodičem za prikupljanje podataka.

Stranica s politikama AY-Robots koja uspoređuje pet politika koje se mogu trenirati prema parametrima, GPU razini, latenciji i minimalnom broju epizoda
Pi0.5 se nalazi u razini A100 i H100 s 485 ms po koraku akcije, s minimalno 50 epizoda.

Ruta A: fino podešavanje s openpi repozitorijem

Referentna implementacija: prvo JAX, testirano samo na Ubuntu 22.04, vođeno konfiguracijskim objektima umjesto zastavicama. PyTorch putanja stigla je u rujnu 2025., validirana na LIBERO. Tri koraka: pretvorite svoje podatke, definirajte konfiguraciju, trenirajte i poslužite.

  1. 1
    Klonirajte i instalirajte

    openpi koristi uv. GIT_LFS_SKIP_SMUDGE omogućuje da LeRobot dođe kao ovisnost bez LFS blobova.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Pretvorite svoje podatke u LeRobot skup podataka

    Upstream isporučuje konvertere za LIBERO i DROID i očekuje da prilagodite jedan. Posao je mapiranje ključeva.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Dodajte konfiguraciju za treniranje

    Konfiguracije su TrainConfig unosi u src/openpi/training/config.py. Ova prilagođava pi05_droid_finetune, s učitavačem težina usmjerenim na pi05_base.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Izračunajte statistiku norme

    Pokreće se prema nazivu konfiguracije, a ne skupu podataka. Preskakanje je klasičan prvi neuspjeh ovdje.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Trenirajte

    Varijabla omogućuje JAX-u da koristi 90 posto GPU memorije umjesto zadanih 75. Na kartici od 80 GB to odlučuje hoće li se izvođenje preživjeti.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Poslužite ga

    Poslužitelj sluša na portu 8000 i odgovara na upite za promatranje; vaše robotsko okruženje je klijent.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch putanja nije JAX putanja

openpi's PyTorch implementacija ne podržava pi0-FAST, mješovitu preciznost, FSDP, LoRA ili EMA težine, tako da je LoRA koja doseže 22.5 GB samo za JAX, putem gemma_2b_lora i gemma_300m_lora varijanti. Još gore: postavka kopira zakrpane datoteke preko vašeg instaliranog transformers 4.53.2, a README upozorava da s uv-ovim zadanim načinom hardlinka ovo trajno mijenja transformere u uv predmemoriji i može procuriti u druge projekte. Poništite to s uv cache clean transformers.

Ruta B: fino podešavanje s lerobot pi05

LeRobot port obuhvaća iste težine u CLI-ju koji već koristite za ACT i SmolVLA. Sve dolje navedeno provjereno je s lerobot 0.6.1, izdanjem od 3. kolovoza 2026., i pi05 dokumentacijom od 23. kolovoza 2026. Verzije su ovdje važne: v3.0 skupovi podataka stigli su s 0.4.0 u listopadu 2025., blog 0.5.0 od 9. ožujka 2026. predstavlja pi0-FAST i Real-Time Chunking, a 0.6.0 od 6. srpnja 2026. učinio je osnovni paket laganim i premjestio implementaciju na lerobot-rollout.

Jedna stvar se nije pomaknula: lerobot-train i lerobot-record već su bili ulazne točke u 0.3.2, kolovoz 2025. Vodič koji još uvijek poziva python -m lerobot.scripts.train prethodi godini promjena i vrijedi mu ne vjerovati ni u ostatku.

  1. 1
    Instalacija s pravim dodacima

    Od verzije 0.6.0 osnovna instalacija sadrži samo osnovne ML ovisnosti, a 'pi' dodatak ne dodaje kod za skup podataka ili treniranje, pa fino podešavanje zahtijeva i 'training' dodatak. Starije jednolinijske naredbe ovdje ne uspijevaju prilikom uvoza.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Autentifikacija

    Prihvatite licencu paligemma-3b-pt-224 u pregledniku, a zatim se prijavite na računalu koje trenira.

    bash
    hf auth login
  3. 3
    Dodajte statistiku kvantila

    Pi0.5 normalizira STATE i ACTION pomoću kvantila, pa meta/stats.json treba q01 i q99. Stariji skupovi podataka sadrže samo min, max, mean, std.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    Fino podešavanje iz lerobot/pi05_base

    Postavite veličinu paketa na onu koju vaša kartica može podnijeti; dokumentacija koristi 64 na LIBERO-u s 80 GB. Eksplicitno proslijedite bfloat16, zadana konfiguracija je float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Pokrenite ga na ruci

    U verziji 0.6.x ovo je lerobot-rollout: lerobot-record odbija politiku i odbacuje nazive skupova podataka s prefiksom eval_. Base upravlja rukom, sentry bilježi izvođenje.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
ZastavicaŠto radiNapomena
--policy.type=pi05odabire Pi0.5obavezno uz pretrained_path, izostavite uz --policy.path
--policy.pretrained_pathučitava samo težinenazivi značajki iz vašeg skupa podataka, pohranjene postavke se resetiraju
--policy.pathtežine plus konfiguracija kontrolne točke config.jsonpohranjene postavke poput n_action_steps se nasljeđuju
--policy.n_action_stepskoraci potrošeni po blokuvraća se na 50, nikad iznad chunk_size (zadano 50)
--policy.train_expert_onlyzamrzava VLM, trenira ekspertazadano false, manje memorije, neki trošak u uspjehu
--policy.gradient_checkpointingponovno izračunava umjesto pohranjivanja aktivacijazadano false, prva poluga kada se izvođenje neće uklopiti
--peft.method_type=LORALoRA adapteri umjesto punih težinapotreban je peft dodatak, dokumentirani primjer je SmolVLA
--policy.rtc_training_max_delayuvjetovanje prefiksom akcije za RTCsamo glavna grana, nije u 0.6.1, mora ostati ispod chunk_size
--rename_mappreslikava stupce skupa podataka na značajke politikepotrebno kada se vaši ključevi kamere razlikuju
Greška na koju većina prvih pokretanja naiđe

Bez kvantila dobivate ValueError: QUANTILES normalization mode requires q01 and q99 stats na prvom paketu. Ponovno izračunajte statistiku, ali rezultat završava u $HF_LEROBOT_HOME/your_dataset, a ne u predmemoriji koju čita --dataset.repo_id, pa trenirajte s --dataset.root koji pokazuje tamo ili gurnite na Hub. Ili preskočite kvantile s --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kao što to čini referentna naredba LIBERO.

Tri skupa zadanih vrijednosti i koje od njih dolaze do trenera

openpi-jev TrainConfig je referenca, LeRobot-ov PI05Config je ono što lerobot-train koristi kada ništa ne kažete, a obrazac ovdje šalje treći skup. Iznenađenje je stopa učenja: oba zadana podešavanja dosežu vrhunac od 2.5e-5, dok openpi-jeva vlastita pi05_libero konfiguracija i ova platforma podižu je na 5e-5.

Postavkaopenpi TrainConfiglerobot pi05 i lerobot-trainAY-Robots šalje
Veličina serije3281
Vršna stopa učenja2.5e-5, kosinusni padoptimizer_lr 2.5e-55e-5
Koraci treniranja30,000100,00030,000
Interval kontrolne točke1,000 steps20,000 stepsnije u obrascu
Sjeme421,000u obrascu
Blok akcijaaction_horizon 50chunk_size 50, n_action_steps 50nije u obrascu
Tip podataka težinebfloat16float32 dok ne proslijedite --policy.dtypenije u obrascu
Akumulacija gradijentanema takve opcije, umjesto toga fsdp_devicesodsutno iz svakog dosadašnjeg izdanja16, i to je izostavljeno

Je li port vjeran? Tim LeRobot-a je dodatno fino podesio osnovni model LIBERO za 6k koraka i usporedio ga s referentnim brojevima openpi-ja na četiri paketa: 97.5 posto prosječno naspram 96.85, ispred na Libero 10, iza na Spatial. Ruta je izbor alata, a ne kvalitete.

Fino podešavanje Pi0.5 na vlastitim podacima
Prednosti
  • Više od 10,000 sati predtreniranja robota stoji iza toga, tako da 50 epizoda vašeg zadatka može biti dovoljno.
  • Kontinuirane akcije: nema tokenizatora za podešavanje, nema praga diskretizacije na vašim kutovima zglobova.
  • LeRobot port postiže 97.5 posto na LIBERO prosjeku naspram openpi-jevih 96.85, tako da prijateljskiji CLI ne košta ništa mjerljivo.
  • Parametarski učinkoviti putevi s obje strane: openpi-jeve JAX LoRA varijante, LeRobot-ova PEFT integracija.
Kompromisi
  • Potpuno fino podešavanje zahtijeva više od 70 GB. Broj od 22.5 GB za LoRA je openpi-jev JAX broj; nijedan nije objavljen za pi05 pod PEFT-om.
  • 485 ms po koraku akcije, najsporiji od pet ovdje: dvostruko sporiji od SmolVLA, dvadeset i četiri puta sporiji od ACT-a.
  • Potreban je LeRobot v3.0, tako da skup podataka snimljen za GR00T pokret treba pretvoriti, i obrnuto.
  • Nove opcije prvo dolaze na main: RTC i MEM memorija u vrijeme treniranja nisu u 0.6.1, tako da najnovija dokumentacija može značiti instalaciju s gita.

Stvarnost od 485 ms i gdje prestaje biti upotrebljiva

Ovo odlučuje o vašem projektu, stoga dolazi prije tablice troškova. po koraku akcije izmjerena ovdje za Pi0.5 iznosi 485 ms. U usporedbi s ostala četiri:

PolitikaInferencija po koraku akcijeParametriGPU razinaMinimalne epizode
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
Stranica AY-Robots usporedbe GR00T N1.7 protiv Pi0.5, s parametrima, GPU razinom, latencijom i formatom skupa podataka
Ista GPU razina, isti minimalni broj epizoda, različita verzija skupa podataka, trostruki jaz u latenciji.
Inferencija mora biti blizu serva

Kontrolna petlja za ovih pet modela traje 20 do 485 ms po koraku akcije. Povratna putovanja preko javnog interneta, povrh 485 ms, pretvaraju funkcionalnu politiku u oklijevajuću. Udaljena inferencija je izvediva za sporo uzimanje i postavljanje (pick-and-place), ali ne i za brzo reaktivno kretanje. Radije bismo to rekli nego prodavali demo koji radi samo na LAN-u. Ako se vaša ruka zaustavlja između dijelova, počnite s zastojima politike usred kretanja.

Upstream ima odgovor, a pola toga je već u izdanju koje možete instalirati. Real-Time Chunking generira sljedeći dio dok ruka još uvijek izvršava trenutni, a zatim vodi preklapajuće korake novog dijela da ostanu blizu već izvršenog dijela, tako da se ruka ne zaustavlja ili trza na spoju. Oblik za vrijeme inferencije isporučen je u changelogu 0.4.2 za Pi0, Pi0.5 i SmolVLA i predstavlja zastavicu za rollout, a ne za ponovno treniranje:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon je broj koraka prethodnog dijela s kojima se novi mora složiti; RTC dokumentacija navodi 8 do 12 kao uobičajeni raspon. Zadani pozadinski sustav inferencije je --inference.type=sync.

To ne čini model bržim. To skriva prazninu: 485 ms se i dalje troši, ali izvan kritičnog puta, tako da se red ne isušuje između dijelova. Varijanta za vrijeme treniranja iz arXiv 2512.05964 ide dalje: model uči uvjetovati se na čistom prefiksu akcije, tako da se pri inferenciji preklapanje čvrsto 'inpainta' s vremenskim koracima toka po akciji umjesto da se vodi, a povratni prolaz vođenja nestaje. Tijekom treniranja uzorkuje duljinu prefiksa po primjeru i uzima gubitak toka na preostalom postfiksu. Ta zastavica postoji samo na 'main' grani, ne u 0.6.1, a kašnjenje za koje trenirate mora ostati ispod chunk_size.

Dva načina za dobivanje Pi0.5 kontrolne točke

Iznajmljujete ili posjedujete karticu od 80 GB, instalirate jedan od gore navedenih paketa, pretvarate svoj skup podataka i nadgledate izvođenje. Zadržavate svaku postavku: openpi-jev JAX LoRA, LeRobot-ove PEFT adaptere, relativne akcije, prilagođena mapiranja tipki. Također zadržavate svaki neuspjeh.

  • Hardver: A100 80 GB ili H100, ili kartica od 24 GB na putanji openpi-jevog JAX LoRA.
  • Postavljanje: jedno poslijepodne za prvo pokretanje, uglavnom mapiranje tipki i gated tokenizer.
  • Nije dostupno na hostiranom obrascu: PEFT adapteri, relativne akcije, RTC tijekom treninga, MEM memorija.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Naredba koju hostirani obrazac ne pokreće, a pip ne može instalirati: RTC tijekom treninga je zastavica glavne grane.

Kada ne radi

SimptomNajvjerojatniji uzrok
Pokretanje odbijeno prije početkaSkup podataka v2.1, ali Pi0.5 želi v3.0, ili obrnuto za GR00T
ImportError, nedostaje paket datasetslerobot 0.6.x bez dodatka za treniranje
ValueError o q01 i q99 na prvom paketuNema kvantila u meta/stats.json; ponovno izračunajte ili koristite MEAN_STD
CUDA izvan memorije u koraku 0Potpuno fino podešavanje ispod 70 GB; pokušajte s kontrolnim točkama ili train_expert_only
Greška 401 ili gated repoLicenca PaliGemma tokenizatora nije prihvaćena
Gubitak pada, robot ne radi ništaNepodudarnost normalizacije, ili politika kopira stanje
Ruka pauzira između dijelovaLatencija po koraku plus povratno putovanje; red čekanja dijelova se isprazni
Radi u jednoj postavci, ne radi u drugojPremalo epizoda, ili sve u jednoj konfiguraciji

Koliko košta jedno pokretanje

Pi0.5 se nalazi u skupoj razini jer zahtijeva karticu od 80 GB, a spot cijene se mijenjaju, pa je brojka raspon, a ne fiksna cijena. Za mnoge SO-100 zadatke, trenirajte SmolVLA ili ACT na razini od 24 GB, prvo potvrdite da je zadatak uopće naučiv, a zatim potrošite A100 sati na njega. Trenirajte svoju prvu politiku prolazi kroz tu jeftiniju petlju, a cijene prikazuju trenutne razine.

RazinaPolitikeTipično pokretanjeCijena po satuTrošak po pokretanju
A100 80 GB ili H100Pi0.5, GR00T N1.7, GR00T N1.53 do 6 sati1.20 do 2.00 USDoko 4 do 12 USD
RTX 4090 ili bilo koja kartica od 24 GBSmolVLA, ACT2 do 5 sati0.30 do 0.60 USDoko 1 do 3 USD
Tablica troškova AY-Robots koja prikazuje koji GPU svaka politika zahtijeva, tipično vrijeme izvođenja i cijenu, te koliko je epizoda potrebno prije nego što politika postane korisna
Ista dva nivoa na stranici proizvoda: Pi0.5 iznajmljuje karticu od 80 GB, SmolVLA i ACT stanu na 4090.

Prije nego što posvetite večer: i uspoređuju iste brojeve. sadrži 85 VLA modela s 332 rezultata benchmarka, svaki povezan sa svojim izvorom, a pozadina o obitelji nalazi se u .

Trenirajte Pi0.5 bez postavljanja okruženja

Odaberite skup podataka i hiperparametre u obrascu. Pozadinski sustav iznajmljuje karticu od 80 GB na spot tržištu, pokreće trener i zapisuje kontrolne točke u objektno skladište. Vodiči za SO-100, SO-101, Koch v1.1 i LeKiwi.

Otvorite vodiče za treniranje
Mogu li fino podesiti Pi0.5 na RTX 4090?

Nije potpuno fino podešavanje: openpi navodi više od 70 GB za to, dakle A100 80 GB ili H100. Njegova brojka od 22.5 GB za LoRA pripada JAX putanji; PyTorch implementacija nema LoRA. LeRobotova PEFT integracija postoji, ali njezin dokumentirani primjer je SmolVLA i nije objavljena VRAM brojka za pi05.

Koliko mi je epizoda potrebno?

Pedeset, isti minimum kao GR00T i ACT; samo SmolVLA ide niže, na 30. Osnovna kontrolna točka sadrži više od 10,000 sati predtreniranja, tako da se fino podešavanje prilagođava umjesto da uči od nule: 50 čistih, raznolikih epizoda nadmašuje dvjesto iz jedne konfiguracije.

Koja je razlika između --policy.path i --policy.pretrained_path?

--policy.path učitava težine i config.json kontrolne točke, tako da se nasljeđuju pohranjene postavke poput n_action_steps i --policy.type mora biti izostavljen. --policy.pretrained_path učitava samo težine: nazivi značajki dolaze iz vašeg skupa podataka, pohranjene postavke se resetiraju, --policy.type je obavezan. Zato LIBERO naredba eksplicitno prosljeđuje n_action_steps=10 i empty_cameras=1; inače se vraćaju na 50 i 0.

Daje li mi otvorena verzija puni Pi0.5 iz rada?

Ne. Oba podržavaju samo 'flow matching action head'. Faza predtreniranja s diskretnim tokenima s FAST 'action tokenizerom' i predviđanje podzadataka visoke razine nisu objavljeni, a kartica lerobot/pi05_base dodaje RL na taj popis iako rad o pi0.5 ne opisuje fazu učenja potkrepljenjem. Trenirate niskorazinsku politiku uvjetovanu jezičnim nizom koji vi dostavite, a ne model koji sam dekomponira dugi zadatak.

Protiv kojih je verzija napisan ovaj vodič?

openpi na glavnoj grani i lerobot 0.6.1, izdanje od 3. kolovoza 2026., oba pročitana 23. kolovoza 2026. Skupovi podataka v3.0 stigli su s 0.4.0 u listopadu 2025. Verzija 0.6.0 učinila je osnovni paket laganim, tako da lerobot[pi] sam više ne instalira 'training stack', i premjestila je implementaciju na lerobot-rollout. RTC u vrijeme treniranja je samo na glavnoj grani; ovdje hostirani trener pokreće 0.5.1.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started