AY-Robots treeningmaatriks viie poliitikaga ridadena ja nelja robotkäega veergudena, iga lahter on link konkreetsele peenhäälestamise juhendile
Pi0.5Voolu SobitamineVLA TreeningLeRobotPeenhäälestamine

Kuidas treenida Pi0.5 oma robotiandmetega

AY-Robots ResearchAugust 23, 202616 min lugemist

Peenhäälesta Pi0.5, Physical Intelligence'i voolu sobitamise VLA, oma robotiandmetega. Tegelikud käsud openpi ja lerobot pi05 jaoks, andmestiku formaadi lõksud, VRAM-i ja latentsuse piirangud.

Pi0.5 on mudel, mille poole pöördute, kui poliitika peab töötama ruumis, mida see pole kunagi näinud. See on ka kõige ebamugavam viiest treeningpoliitikast siin, et peenhäälestada käsitsi: ülesvoolu hoidla on esmalt JAX, LeRoboti port viis juurutamise lerobot-recordist välja versioonis 0.6.0 ja tegi baasinstalli treenimiseks liiga väikeseks ning täielik peenhäälestus ei mahu 4090-le. Allpool: mida voolu sobitamine maksab järeldamisel, kaks käsurea marsruuti ja 485 ms number, mis otsustab, kas tulemus on kasutatav.

Mida peate teadma

  • Voolu sobitamise VLA: 3B PaliGemma VLM pluss 300M tegevusekspert, mis dekodeerib pidevaid tegevusplokke. Kaks marsruuti selle peenhäälestamiseks, openpi ja LeRobot pi05, 0.65 punkti kaugusel LIBERO keskmisest.
  • Täielik peenhäälestus vajab rohkem kui 70 GB VRAM-i. openpi loetleb LoRA 22.5 GB-ga, ainult oma JAX-teel.
  • Andmestik peab olema LeRobotDataset v3.0 koos q01 ja q99 kvantiilidega failis meta/stats.json, vastasel juhul viskab esimene partii vea.
  • Kontrollige esmalt oma lerobot versiooni: 0.6.0 tegi baaspaketi kergeks ja viis juurutamise lerobot-recordist välja.
  • Siin töötab see 485 ms tegevussammu kohta, vajab 50 episoodi ja maksab umbes 4 kuni 12 USD jooksu kohta.

Mis Pi0.5 tegelikult on

Physical Intelligence avaldas pi0 oktoobris 2024: voolu sobitamise nägemis-keele-tegevuse mudel eelkoolitatud VLM-il: PaliGemma 3 miljardi parameetriga pluss 300M tegevusekspert, mis on algusest peale initsialiseeritud, kokku 3.3 miljardit. Artikkel teatab eelkoolitusest üle 10 000 tunni robotiandmetega 7 roboti konfiguratsiooni ja 68 ülesande kohta. Rohkem pi0 artiklis.

Pi0.5 (arXiv 2504.16054, 22. aprill 2025) säilitab selle skeleti ja muudab treeningdieeti: veebiandmed, objektituvastus, inimeste suulised juhised robotile, alamülesannete sildid, ristkehastuse andmed robotitelt paljudes kodudes. Tulemuseks on robot, mis puhastab kööke majades, mis ei kuulunud treeningkomplekti. openpi README lisab detaili, mida pealkiri ei tee: välja antud pi0.5 treeniti teadmiste isolatsiooniga (arXiv 2505.23705).

Omaduspi0pi0.5
VLM selgroo variantgemma_2b (PaliGemma)gemma_2b (PaliGemma)
Tegevuseksperdi variantgemma_300mgemma_300m
action_dim3232
action_horizon vaikeväärtus5050
max_token_len48200
diskreetne oleku sisendfalsetrue, olek diskretiseeritud lahtritesse viipas
Baas kontrollpunktgs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Mis on avalik, ei ole kogu artikkel

openpi README on selgesõnaline: hoidla toetab ainult voolu sobitamise pead, nii pi0.5 treeninguks kui ka järeldamiseks. Artikkel kirjeldab kahte etappi ja kood sisaldab ainult teist: eelkoolitus esindab iga tegevust diskreetsete tokenitena FAST tokeniseerija kaudu ja juurutamisel järeldab mudel enne iga tegevusplokki kõrgetasemelist alamülesannet. Kumbki neist ei ole hoidlas. The lerobot/pi05_base kaart annab sama nimekirja ja lisab RL-i, kuigi pi0.5 artikkel ei kirjelda üldse tugevdamisõppe etappi. LeRoboti port pärib selle ulatuse ja samuti iga sellel hostitud treener, sealhulgas see siin. Litsentsimine on samuti jagatud: pi05 dokumendileht ütleb Apache 2.0, the lerobot/pi05_base kaart on märgistatud license: gemma.

Mida voolu sobitamine treeningus ja järeldamises muudab

A poliitika mida saab treenida SO-100-l, kas regresseerib tegevusi otse (ACT) või tokeniseerib need ja dekodeerib autoregressiivselt (pi0-FAST). Voolu sobitamine ei tee kumbagi: see õpib vektorvälja, mis transpordib müra puhtasse tegevuste plokki, seejärel integreerib selle. pi0 paber kasutab 10 integratsioonisammu sammu suurusega 0.1; LeRoboti pi05 konfiguratsioon sisaldab sama num_inference_steps: int = 10.

  • Treening: kadu regresseerib müraga tegevuste plokki. Pole vaja häälestada tokeniseerijat, pole vaja liigendnurki diskretiseerida.
  • Järeldamine: üks plokk maksab kümme edasisuunalist läbimist tegevuseksperdi kaudu. See on struktuurne, mitte häälestamise probleem.
  • Väljund: pidevad tegevused dimensiooniga 32, sisemiselt polsterdatud, kadu võetakse roboti dimensioonide järgi. 6-DoF käsi pluss haarats kasutab 7.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
Loetud failist src/openpi/models/pi0_config.py openpi põhiharust, 23. august 2026.

PaliGemma selgroog ja selle ees olev värav

PaliGemma (arXiv 2407.07726) on SigLIP-So400m nägemise kodeerija Gemma-2B keelemudelil, umbes 3B parameetriga. Pi0.5 pärib oma tokeniseerija ja see tokeniseerija asub piiratud ligipääsuga repositooriumis. See on kõige tavalisem viis, kuidas esimene käivitus ebaõnnestub, enne esimest treeningusamm.

Aktsepteerige piiratud ligipääsuga litsents enne GPU rentimist

LeRoboti pi05 dokumendid ütlevad selgelt: pi0.5 kasutab piiratud ligipääsuga google/paligemma-3b-pt-224 tokeniseerijat, seega aktsepteerige selle litsents Hubis ja käivitage esmalt hf auth login. Ligipääs antakse käsitsi, mitte koheselt. Jätke see vahele, alustage tasulist pilvekäivitust ja maksate podi eest, mis ei saa tokeniseerijat alla laadida.

Enne alustamist: andmestiku formaat, episoodid, riistvara

Pi0.5 LeRobotis loeb LeRoboti andmestikku v3.0 paigutuses, mis saabus lerobot 0.4.0-ga oktoobris 2025: mitu episoodi Parquet- ja MP4-faili kohta ühe faili asemel iga episoodi, piiridega meta/episodes/ asemel failinimedes. Salvestage töölauakliendiga või järgige salvestage oma esimene andmestik ja teil on see olemas.

RežiimNõutav GPU mäluNäide GPU-st
Järeldamineüle 8 GBRTX 4090
Peenhäälestus, LoRAüle 22,5 GBRTX 4090
Peenhäälestus, täieliküle 70 GBA100 80 GB või H100
Versioonilõks, mis maksab päeva

Pi0.5 ja SmolVLA vajavad LeRobot v3.0. GR00T N1.7 ja GR00T N1.5 vajavad v2.0 või v2.1 ning jooksevad v3.0 andmestiku puhul kokku. Üks salvestussessioon ei saa mõlemat ilma konversioonita toita ja veateade ei ütle "vale andmestiku versioon". Vt andmestik tagasi lükatud: v3 nõutav.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
LeRobotDataset v3.0 dokumentatsioonist.

Platvorm soovib Pi0.5 jaoks vähemalt 50 episoodi, sama miinimum kui GR00T ja ACT puhul. Eelõpe teeb suurema osa tööst, seega 50 puhast episoodi on parem kui 200 lohakat. Uus selles valdkonnas? Alusta andmete kogumise juhendist.

AY-Robots poliitikate leht, mis võrdleb viit treenitavat poliitikat parameetrite, GPU taseme, latentsuse ja minimaalsete episoodide järgi
Pi0.5 asub A100 ja H100 tasemel, pakkudes 485 ms tegevussammu kohta, minimaalselt 50 episoodiga.

Tee A: peenhäälestamine openpi repositooriumiga

Referentsimplementatsioon: esmalt JAX, testitud ainult Ubuntu 22.04-l, juhitud konfiguratsiooniobjektide, mitte lippude abil. PyTorchi tee saabus septembris 2025, valideeritud LIBERO-l. Kolm sammu: teisendage oma andmed, määratlege konfiguratsioon, treenige ja serveerige.

  1. 1
    Kloonimine ja installimine

    openpi kasutab uv-d. GIT_LFS_SKIP_SMUDGE võimaldab LeRobotil tulla sõltuvusena ilma LFS-blobideta.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Teisendage oma andmed LeRoboti andmestikuks

    Ülesvoolu tarnitakse LIBERO ja DROID jaoks konverterid ning eeldatakse, et kohandate ühte neist. Töö seisneb võtmete kaardistamises.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Lisage treeningkonfiguratsioon

    Konfiguratsioonid on TrainConfig kirjed failis src/openpi/training/config.py. See kohandab pi05_droid_finetune'i, kus kaalude laadija on suunatud pi05_base'ile.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Arvutage normistatistika

    Käivitub konfiguratsiooni nime, mitte andmestiku vastu. Selle vahelejätmine on siin klassikaline esimene viga.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Treenimine

    Muutuja võimaldab JAX-il kasutada 90 protsenti GPU mälust vaikimisi 75 asemel. 80 GB kaardil otsustab see, kas käivitus õnnestub.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Serveeri seda

    Server kuulab pordil 8000 ja vastab vaatluspäringutele; teie roboti käitusaeg on klient.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorchi tee ei ole JAX-i tee

openpi's PyTorch implementatsioon ei toeta pi0-FAST, segatäpsust, FSDP-d, LoRA-t ega EMA kaalusid, seega 22.5 GB suurune LoRA on saadaval ainult JAX-i kaudu, kasutades gemma_2b_lora ja gemma_300m_lora variante. Halvem veel: seadistus kopeerib paigatud failid teie installitud transformers 4.53.2 peale ja README hoiatab, et uv-i vaikimisi hardlink-režiimis muudab see transformers'i uv-vahemälus püsivalt ja võib lekkida teistesse projektidesse. Võta see tagasi käsuga uv cache clean transformers.

Tee B: peenhäälestamine lerobot pi05-ga

LeRoboti port pakib samad kaalud CLI-sse, mida te juba kasutate ACT ja SmolVLA. Kõik alljärgnev kontrolliti lerobot 0.6.1 (väljaanne alates 3. augustist 2026) ja pi05 dokumentatsiooni (23. august 2026) vastu. Versioonid on siin olulised: v3.0 andmestikud saabusid koos 0.4.0-ga oktoobris 2025, 9. märtsi 2026. aasta 0.5.0 blogi tutvustab pi0-FAST-i ja Real-Time Chunking'ut ning 6. juuli 2026. aasta 0.6.0 tegi baaspaketi kergeks ja viis juurutamise lerobot-rollout'i.

Üks asi ei muutunud: lerobot-train ja lerobot-record olid juba sisenemispunktid versioonis 0.3.2, august 2025. Õpetus, mis endiselt kutsub python -m lerobot.scripts.train, on aasta jagu muutustest vanem ja väärib ka ülejäänud osas umbusaldamist.

  1. 1
    Installimine õigete lisapakettidega

    Alates versioonist 0.6.0 sisaldab baasinstall ainult ML-i põhisõltuvusi ning pi-lisapakett ei lisa andmestiku ega treeningkoodi, seega vajab peenhäälestus ka treeningu lisapaketti. Vanemad üherealised käsud ebaõnnestuvad siin importimise ajal.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Autentimine

    Nõustu paligemma-3b-pt-224 litsentsiga brauseris, seejärel logi sisse masinasse, mis treenib.

    bash
    hf auth login
  3. 3
    Lisa kvantiilstatistika

    Pi0.5 normaliseerib STATE ja ACTION kvantiilidega, seega vajab meta/stats.json q01 ja q99. Vanemad andmestikud sisaldavad ainult min, max, mean, std.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    Peenhäälestus lerobot/pi05_base baasilt

    Määra paketi suurus vastavalt sellele, mida sinu kaart talub; dokumentatsioonis kasutatakse LIBERO-l 64-st 80 GB juures. Edasta bfloat16 selgesõnaliselt, konfiguratsiooni vaikeseade on float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Käivita see robotkäel

    Versioonis 0.6.x on see lerobot-rollout: lerobot-record keeldub poliitikast ja lükkab tagasi eval_ andmestiku nimed. Base juhib kätt, sentry salvestab väljarullumise.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
LippMida see teebMärkus
--policy.type=pi05valib Pi0.5nõutav koos pretrained_path-iga, jäta välja koos --policy.path-iga
--policy.pretrained_pathlaadib ainult kaaludtunnuste nimed sinu andmestikust, salvestatud seaded lähtestatakse
--policy.pathkaalud pluss kontrollpunkti config.jsonsalvestatud seaded, nagu n_action_steps, päritakse
--policy.n_action_stepssammud, mis tarbitakse tüki kohtanaaseb 50-le, mitte kunagi üle chunk_size (vaikimisi 50)
--policy.train_expert_onlykülmutab VLM-i, treenib ekspertivaikimisi false, vähem mälu, mõningane edu kulu
--policy.gradient_checkpointingarvutab uuesti aktiveerimiste salvestamise asemelvaikimisi false, esimene hoob, kui käivitus ei mahu
--peft.method_type=LORALoRA adapterid täiskaalude asemelvajab peft lisapaketti, dokumenteeritud näide on SmolVLA
--policy.rtc_training_max_delaytegevuse eesliite tingimine RTC jaoksainult peaharus, mitte versioonis 0.6.1, peab jääma alla chunk_size
--rename_mapkaardistab andmestiku veerud poliitika tunnustelevajalik, kui sinu kaamera võtmed erinevad
Viga, millega enamik esimesi käivitusi kokku puutub

Ilma kvantiilideta saad esimesel pakil ValueError: QUANTILES normalization mode requires q01 and q99 stats. Arvuta statistika uuesti, kuid tulemus maandub kausta $HF_LEROBOT_HOME/your_dataset, mitte vahemällu, mida --dataset.repo_id loeb, seega treeni, kasutades --dataset.root, mis sinna viitab, või lükka Hubi. Või jäta kvantiilid vahele, kasutades --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', nagu teeb LIBERO viitekäsk.

Kolm vaikeseadete komplekti ja millised neist treenerini jõuavad

openpi TrainConfig on referents, LeRoboti PI05Config on see, mida lerobot-train kasutab, kui te midagi ei ütle, ja siinne vorm saadab kolmanda komplekti. Üllatuseks on õppimiskiirus: mõlemad ülesvoolu vaikeseaded tipnevad 2.5e-5 juures, samas kui openpi enda pi05_libero konfiguratsioon ja see platvorm tõstavad selle 5e-5-ni.

Seadeopenpi TrainConfiglerobot pi05 ja lerobot-trainAY-Robots saadab
Pakendi suurus3281
Tippõppimiskiirus2.5e-5, koosinuslangusoptimizer_lr 2.5e-55e-5
Treeningusammud30,000100,00030,000
Kontrollpunkti intervall1,000 sammu20,000 sammupole vormis
Seeme421,000vormis
Tegevuse tükkaction_horizon 50chunk_size 50, n_action_steps 50pole vormis
Kaalu andmetüüpbfloat16float32, kuni edastate --policy.dtypepole vormis
Gradiendi akumulatsioonsellist nuppu pole, selle asemel fsdp_devicesseni puudub igast väljalaskest16, ja see on ära jäetud

Kas port on usaldusväärne? LeRoboti meeskond peenhäälestas LIBERO baasmudelit veel 6k sammu võrra ja võrdles openpi võrdlusnumbritega neljas sviidis: 97.5 protsenti keskmiselt võrreldes 96.85-ga, ees Libero 10-s, taga Spatial-is. See tee on tööriistavalik, mitte kvaliteedivalik.

Pi0.5 peenhäälestamine oma andmetega
Eelised
  • Selle taga on üle 10 000 tunni roboti eeltreeningut, seega võib 50 episoodi teie ülesandest piisata.
  • Pidevad tegevused: pole vaja häälestada tokeniseerijat, pole diskretiseerimise piirangut teie liigendnurkadele.
  • LeRoboti port saavutab LIBERO keskmisel 97.5 protsenti võrreldes openpi 96.85-ga, seega sõbralikum CLI ei maksa midagi mõõdetavat.
  • Parameetritõhusad teed mõlemal poolel: openpi JAX LoRA variandid, LeRoboti PEFT integratsioon.
Kompromissid
  • Täielikuks peenhäälestamiseks on vaja rohkem kui 70 GB. 22.5 GB LoRA näitaja on openpi JAX-i number; pi05 jaoks PEFT-i all pole ühtegi avaldatud.
  • 485 ms tegevussammu kohta, siin viiest aeglaseim: kaks korda SmolVLA, kakskümmend neli korda ACT.
  • LeRobot v3.0 on vajalik, seega GR00T käitamiseks salvestatud andmestik vajab teisendamist ja vastupidi.
  • Uued valikud jõuavad esmalt main-i: treeninguaegne RTC ja MEM mälu pole versioonis 0.6.1, seega võivad uusimad dokumendid tähendada gitist installimist.

485 ms reaalsus ja koht, kus see lakkab olemast kasutatav

See otsustab teie projekti, seega tuleb see enne kulutabelit. järelduse latentsus tegevussammu kohta, mis on siin Pi0.5 jaoks mõõdetud, on 485 ms. Võrreldes teiste neljaga:

PoliitikaJäreldus tegevussammu kohtaParameetridGPU taseMinimaalsed episoodid
ACT20 ms~80 MRTX 4090 või mis tahes 24 GB kaart50
GR00T N1.7152 ms~3 BA100 80 GB või H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB või H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 või mis tahes 24 GB kaart30
Pi0.5485 ms~3 BA100 80 GB või H100 80 GB50
AY-Robotsi võrdlusleht GR00T N1.7 ja Pi0.5 jaoks, koos parameetrite, GPU taseme, latentsuse ja andmestiku formaadiga
Sama GPU tase, sama episoodide miinimum, erinev andmestiku versioon, kolmekordne latentsuse vahe.
Järeldamine peab asuma servode kõrval

Nende viie mudeli juhtimistsükkel kestab 20 kuni 485 ms tegevussammu kohta. Avaliku interneti edasi-tagasi reisid lisaks 485 ms-le muudavad töötava poliitika kõhklevaks. Kaugjäreldamine on teostatav aeglaseks esemete võtmiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks. Me pigem ütleme seda, kui müüme demo, mis töötab ainult LAN-is. Kui teie käsi peatub tükkide vahel, alustage siit: poliitika hangub liikumise keskel.

Ülesvoolu on vastus ja pool sellest on juba väljaandes, mille saate installida. Reaalajas tükeldamine (Real-Time Chunking) genereerib järgmise tüki, samal ajal kui käsi täidab veel praegust, seejärel juhib uue tüki kattuvad sammud jääma juba täidetud osale lähedale, nii et käsi ei seiskuks ega tõmbleks ühenduskohas. Järeldusaja vorm, mis tarniti 0.4.2 muudatuste logis Pi0, Pi0.5 ja SmolVLA jaoks, on juurutuslipp, mitte ümberõpe:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon näitab, mitme eelmise tüki sammuga peab uus tükk ühilduma; RTC dokumendid annavad tavaliseks vahemikuks 8 kuni 12. Vaikimisi järeldamise taustaprogramm on --inference.type=sync.

See ei tee mudelit kiiremaks. See peidab lünga: 485 ms kulub endiselt, kuid väljaspool kriitilist teed, nii et järjekord ei jää tükkide vahel tühjaks. arXiv 2512.05964 treeninguaegne variant läheb kaugemale: mudel õpib tingima puhta tegevuse eesliitega, nii et järeldamisel on kattumine kõvasti sisse maalitud tegevuspõhiste voo ajasammudega juhendamise asemel ja juhendamise tagasikäik kaob. Treeningu ajal võtab see iga näite kohta eesliite pikkuse ja arvutab voo kadu ülejäänud järelliitel. See lipp on ainult peaharus, mitte versioonis 0.6.1, ja viivitus, mille jaoks te treenite, peab jääma alla chunk_size.

Kaks võimalust Pi0.5 kontrollpunkti saamiseks

Rendid või omad 80 GB kaarti, installid ühe ülaltoodud tarkvarapaketi, teisendad oma andmestiku ja jälgid käivitust. Sa säilitad kõik seaded: openpi JAX LoRA, LeRoboti PEFT adapterid, suhtelised toimingud, kohandatud klahvikaardistused. Samuti säilitad kõik ebaõnnestumised.

  • Riistvara: A100 80 GB või H100, või 24 GB kaart openpi JAX LoRA teel.
  • Seadistus: pärastlõuna esimeseks käivituseks, peamiselt klahvikaardistus ja piiratud tokeniseerija.
  • Ei ole hostitud vormil: PEFT adapterid, suhtelised toimingud, treeninguaegne RTC, MEM mälu.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Käsk, mida hostitud vorm ei käivita ja mida pip ei saa installida: treeninguaegne RTC on peaharu lipp.

Kui see ei tööta

SümptomKõige tõenäolisem põhjus
Käivitus lükatakse tagasi enne algustAndmestik v2.1, kuid Pi0.5 soovib v3.0, või vastupidi GR00T puhul
ImportError, datasets pakett puudublerobot 0.6.x ilma treeningu lisata
ValueError q01 ja q99 kohta esimeses pakisPuuduvad kvantiilid meta/stats.json-is; arvuta uuesti või kasuta MEAN_STD
CUDA mälu otsas sammul 0Täielik peenhäälestus alla 70 GB; proovi kontrollpunkti või train_expert_only
401 või piiratud repo vigaPaliGemma tokeniseerija litsentsi ei ole aktsepteeritud
Kadu langeb, robot ei tee midagiNormaliseerimise mittevastavus või poliitika kopeerib olekut
Käsi peatub tükkide vahelSammupõhine latentsus pluss edasi-tagasi reis; tükkide järjekord tühjeneb
Töötab ühes seadistuses, ebaõnnestub teisesLiiga vähe episoode või kõik ühes konfiguratsioonis

Mida üks käitus maksab

Pi0.5 asub kallimas astmes, sest see vajab 80 GB kaarti ja hetkehinnad liiguvad, seega on näitaja pigem vahemik kui kindel hind. Paljude SO-100 ülesannete puhul treeni SmolVLA või ACT-i esmalt 24 GB astmel, veendu, et ülesanne on üldse õpitav, seejärel kuluta sellele A100 tunde. Treeni oma esimene poliitika kirjeldab seda odavamat tsüklit ja hinnakiri sisaldab praeguseid astmeid.

AstePoliitikadTüüpiline käitusHind tunnisKäituse maksumus
A100 80 GB or H100Pi0.5, GR00T N1.7, GR00T N1.53 to 6 hours1.20 to 2.00 USDumbes 4 to 12 USD
RTX 4090 või mis tahes 24 GB kaartSmolVLA, ACT2 to 5 hours0.30 to 0.60 USDumbes 1 to 3 USD
AY-Robotsi kulutabel, mis näitab, millist GPU-d iga poliitika vajab, tüüpilist käitusaega ja hinda ning mitu episoodi on vaja enne, kui poliitika on kasulik
Samad kaks taset tootelehel: Pi0.5 rendib 80 GB kaardi, SmolVLA ja ACT mahuvad 4090-le.

Enne õhtu pühendamist: GR00T N1.7 Pi0.5 vastu ja Pi0.5 SmolVLA vastu esitavad samad numbrid kõrvuti. Areena sisaldab 85 VLA mudelit 332 võrdlustulemusega, millest igaüks on lingitud oma allikaga, ja perekonna taust on leitav meie VLA ülevaates.

Treenige Pi0.5 ilma virna ehitamata

Valige andmestik ja hüperparameetrid vormis. Taustasüsteem rendib hetketurult 80 GB kaardi, käivitab treeneri ja kirjutab kontrollpunktid objektisalvestusse. Juhendid SO-100, SO-101, Koch v1.1 ja LeKiwi jaoks.

Avage treeningjuhendid
Kas ma saan Pi0.5-i RTX 4090-l peenhäälestada?

Mitte täielik peenhäälestus: openpi loetleb selleks üle 70 GB, seega A100 80 GB või H100. Selle 22,5 GB LoRA näitaja kuulub JAX-i teele; PyTorchi implementatsioonil puudub LoRA. LeRoboti PEFT-integratsioon on olemas, kuid selle dokumenteeritud näide on SmolVLA ja pi05 jaoks pole VRAM-i näitajat avaldatud.

Mitu episoodi ma vajan?

Viiskümmend, sama miinimum kui GR00T-l ja ACT-l; ainult SmolVLA läheb madalamale, 30-le. Baaskontrollpunkt sisaldab üle 10 000 tunni eelkoolitust, nii et peenhäälestus kohandub, mitte ei õpi nullist: 50 puhast, mitmekesist episoodi on parem kui kakssada ühest konfiguratsioonist.

Mis vahe on --policy.path ja --policy.pretrained_path vahel?

--policy.path laeb kaalud ja kontrollpunkti config.json-i, nii et salvestatud seaded, nagu n_action_steps, päritakse ja --policy.type tuleb välja jätta. --policy.pretrained_path laeb ainult kaalud: funktsiooninimed tulevad teie andmestikust, salvestatud seaded lähtestatakse, --policy.type on nõutav. Seepärast edastab LIBERO käsk n_action_steps=10 ja empty_cameras=1 selgesõnaliselt; vastasel juhul langevad need tagasi 50-le ja 0-le.

Kas avatud versioon annab mulle paberis kirjeldatud täieliku Pi0.5?

Ei. Mõlemad toetavad ainult voolu sobitamise tegevuspead. Diskreetse märgi eelkoolituse etappi FAST-i tegevustokeniseerija ja kõrgetasemelise alamülesande ennustusega ei avaldatud ning lerobot/pi05_base kaart lisab sellele loendile RL-i, kuigi pi0.5 paber ei kirjelda ühtegi tugevdamisõppe etappi. Te treenite madala taseme poliitikat, mis on tingitud teie antud keele stringist, mitte mudelit, mis ise pikka ülesannet lahti harutab.

Milliste versioonide jaoks see juhend on kirjutatud?

openpi peaharus ja lerobot 0.6.1, mis on välja antud alates 3. augustist 2026, mõlemad loetud 23. augustil 2026. v3.0 andmestikud saabusid koos 0.4.0-ga oktoobris 2025. 0.6.0 tegi baaspaketi kergeks, nii et lerobot[pi] üksi ei installi enam treeningvirna ja viis juurutamise lerobot-rollout'i. Treeninguaegne RTC on ainult peaharus; siinne hostitud treener käitab versiooni 0.5.1.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started