
Peenhäälesta Pi0.5, Physical Intelligence'i voolu sobitamise VLA, oma robotiandmetega. Tegelikud käsud openpi ja lerobot pi05 jaoks, andmestiku formaadi lõksud, VRAM-i ja latentsuse piirangud.
Pi0.5 on mudel, mille poole pöördute, kui poliitika peab töötama ruumis, mida see pole kunagi näinud. See on ka kõige ebamugavam viiest treeningpoliitikast siin, et peenhäälestada käsitsi: ülesvoolu hoidla on esmalt JAX, LeRoboti port viis juurutamise lerobot-recordist välja versioonis 0.6.0 ja tegi baasinstalli treenimiseks liiga väikeseks ning täielik peenhäälestus ei mahu 4090-le. Allpool: mida voolu sobitamine maksab järeldamisel, kaks käsurea marsruuti ja 485 ms number, mis otsustab, kas tulemus on kasutatav.
Mida peate teadma
- •Voolu sobitamise VLA: 3B PaliGemma VLM pluss 300M tegevusekspert, mis dekodeerib pidevaid tegevusplokke. Kaks marsruuti selle peenhäälestamiseks, openpi ja LeRobot pi05, 0.65 punkti kaugusel LIBERO keskmisest.
- •Täielik peenhäälestus vajab rohkem kui 70 GB VRAM-i. openpi loetleb LoRA 22.5 GB-ga, ainult oma JAX-teel.
- •Andmestik peab olema LeRobotDataset v3.0 koos q01 ja q99 kvantiilidega failis meta/stats.json, vastasel juhul viskab esimene partii vea.
- •Kontrollige esmalt oma lerobot versiooni: 0.6.0 tegi baaspaketi kergeks ja viis juurutamise lerobot-recordist välja.
- •Siin töötab see 485 ms tegevussammu kohta, vajab 50 episoodi ja maksab umbes 4 kuni 12 USD jooksu kohta.
Mis Pi0.5 tegelikult on
Physical Intelligence avaldas pi0 oktoobris 2024: voolu sobitamise nägemis-keele-tegevuse mudel eelkoolitatud VLM-il: PaliGemma 3 miljardi parameetriga pluss 300M tegevusekspert, mis on algusest peale initsialiseeritud, kokku 3.3 miljardit. Artikkel teatab eelkoolitusest üle 10 000 tunni robotiandmetega 7 roboti konfiguratsiooni ja 68 ülesande kohta. Rohkem pi0 artiklis.
Pi0.5 (arXiv 2504.16054, 22. aprill 2025) säilitab selle skeleti ja muudab treeningdieeti: veebiandmed, objektituvastus, inimeste suulised juhised robotile, alamülesannete sildid, ristkehastuse andmed robotitelt paljudes kodudes. Tulemuseks on robot, mis puhastab kööke majades, mis ei kuulunud treeningkomplekti. openpi README lisab detaili, mida pealkiri ei tee: välja antud pi0.5 treeniti teadmiste isolatsiooniga (arXiv 2505.23705).
| Omadus | pi0 | pi0.5 |
|---|---|---|
| VLM selgroo variant | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Tegevuseksperdi variant | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| action_horizon vaikeväärtus | 50 | 50 |
| max_token_len | 48 | 200 |
| diskreetne oleku sisend | false | true, olek diskretiseeritud lahtritesse viipas |
| Baas kontrollpunkt | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README on selgesõnaline: hoidla toetab ainult voolu sobitamise pead, nii pi0.5 treeninguks kui ka järeldamiseks. Artikkel kirjeldab kahte etappi ja kood sisaldab ainult teist: eelkoolitus esindab iga tegevust diskreetsete tokenitena FAST tokeniseerija kaudu ja juurutamisel järeldab mudel enne iga tegevusplokki kõrgetasemelist alamülesannet. Kumbki neist ei ole hoidlas. The lerobot/pi05_base kaart annab sama nimekirja ja lisab RL-i, kuigi pi0.5 artikkel ei kirjelda üldse tugevdamisõppe etappi. LeRoboti port pärib selle ulatuse ja samuti iga sellel hostitud treener, sealhulgas see siin. Litsentsimine on samuti jagatud: pi05 dokumendileht ütleb Apache 2.0, the lerobot/pi05_base kaart on märgistatud license: gemma.
Mida voolu sobitamine treeningus ja järeldamises muudab
A poliitika mida saab treenida SO-100-l, kas regresseerib tegevusi otse (ACT) või tokeniseerib need ja dekodeerib autoregressiivselt (pi0-FAST). Voolu sobitamine ei tee kumbagi: see õpib vektorvälja, mis transpordib müra puhtasse tegevuste plokki, seejärel integreerib selle. pi0 paber kasutab 10 integratsioonisammu sammu suurusega 0.1; LeRoboti pi05 konfiguratsioon sisaldab sama num_inference_steps: int = 10.
- Treening: kadu regresseerib müraga tegevuste plokki. Pole vaja häälestada tokeniseerijat, pole vaja liigendnurki diskretiseerida.
- Järeldamine: üks plokk maksab kümme edasisuunalist läbimist tegevuseksperdi kaudu. See on struktuurne, mitte häälestamise probleem.
- Väljund: pidevad tegevused dimensiooniga 32, sisemiselt polsterdatud, kadu võetakse roboti dimensioonide järgi. 6-DoF käsi pluss haarats kasutab 7.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma selgroog ja selle ees olev värav
PaliGemma (arXiv 2407.07726) on SigLIP-So400m nägemise kodeerija Gemma-2B keelemudelil, umbes 3B parameetriga. Pi0.5 pärib oma tokeniseerija ja see tokeniseerija asub piiratud ligipääsuga repositooriumis. See on kõige tavalisem viis, kuidas esimene käivitus ebaõnnestub, enne esimest treeningusamm.
LeRoboti pi05 dokumendid ütlevad selgelt: pi0.5 kasutab piiratud ligipääsuga google/paligemma-3b-pt-224 tokeniseerijat, seega aktsepteerige selle litsents Hubis ja käivitage esmalt hf auth login. Ligipääs antakse käsitsi, mitte koheselt. Jätke see vahele, alustage tasulist pilvekäivitust ja maksate podi eest, mis ei saa tokeniseerijat alla laadida.
Enne alustamist: andmestiku formaat, episoodid, riistvara
Pi0.5 LeRobotis loeb LeRoboti andmestikku v3.0 paigutuses, mis saabus lerobot 0.4.0-ga oktoobris 2025: mitu episoodi Parquet- ja MP4-faili kohta ühe faili asemel iga episoodi, piiridega meta/episodes/ asemel failinimedes. Salvestage töölauakliendiga või järgige salvestage oma esimene andmestik ja teil on see olemas.
| Režiim | Nõutav GPU mälu | Näide GPU-st |
|---|---|---|
| Järeldamine | üle 8 GB | RTX 4090 |
| Peenhäälestus, LoRA | üle 22,5 GB | RTX 4090 |
| Peenhäälestus, täielik | üle 70 GB | A100 80 GB või H100 |
Pi0.5 ja SmolVLA vajavad LeRobot v3.0. GR00T N1.7 ja GR00T N1.5 vajavad v2.0 või v2.1 ning jooksevad v3.0 andmestiku puhul kokku. Üks salvestussessioon ei saa mõlemat ilma konversioonita toita ja veateade ei ütle "vale andmestiku versioon". Vt andmestik tagasi lükatud: v3 nõutav.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPlatvorm soovib Pi0.5 jaoks vähemalt 50 episoodi, sama miinimum kui GR00T ja ACT puhul. Eelõpe teeb suurema osa tööst, seega 50 puhast episoodi on parem kui 200 lohakat. Uus selles valdkonnas? Alusta andmete kogumise juhendist.

Tee A: peenhäälestamine openpi repositooriumiga
Referentsimplementatsioon: esmalt JAX, testitud ainult Ubuntu 22.04-l, juhitud konfiguratsiooniobjektide, mitte lippude abil. PyTorchi tee saabus septembris 2025, valideeritud LIBERO-l. Kolm sammu: teisendage oma andmed, määratlege konfiguratsioon, treenige ja serveerige.
- 1Kloonimine ja installimine
openpi kasutab uv-d. GIT_LFS_SKIP_SMUDGE võimaldab LeRobotil tulla sõltuvusena ilma LFS-blobideta.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Teisendage oma andmed LeRoboti andmestikuks
Ülesvoolu tarnitakse LIBERO ja DROID jaoks konverterid ning eeldatakse, et kohandate ühte neist. Töö seisneb võtmete kaardistamises.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Lisage treeningkonfiguratsioon
Konfiguratsioonid on TrainConfig kirjed failis src/openpi/training/config.py. See kohandab pi05_droid_finetune'i, kus kaalude laadija on suunatud pi05_base'ile.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Arvutage normistatistika
Käivitub konfiguratsiooni nime, mitte andmestiku vastu. Selle vahelejätmine on siin klassikaline esimene viga.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Treenimine
Muutuja võimaldab JAX-il kasutada 90 protsenti GPU mälust vaikimisi 75 asemel. 80 GB kaardil otsustab see, kas käivitus õnnestub.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Serveeri seda
Server kuulab pordil 8000 ja vastab vaatluspäringutele; teie roboti käitusaeg on klient.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi's PyTorch implementatsioon ei toeta pi0-FAST, segatäpsust, FSDP-d, LoRA-t ega EMA kaalusid, seega 22.5 GB suurune LoRA on saadaval ainult JAX-i kaudu, kasutades gemma_2b_lora ja gemma_300m_lora variante. Halvem veel: seadistus kopeerib paigatud failid teie installitud transformers 4.53.2 peale ja README hoiatab, et uv-i vaikimisi hardlink-režiimis muudab see transformers'i uv-vahemälus püsivalt ja võib lekkida teistesse projektidesse. Võta see tagasi käsuga uv cache clean transformers.
Tee B: peenhäälestamine lerobot pi05-ga
LeRoboti port pakib samad kaalud CLI-sse, mida te juba kasutate ACT ja SmolVLA. Kõik alljärgnev kontrolliti lerobot 0.6.1 (väljaanne alates 3. augustist 2026) ja pi05 dokumentatsiooni (23. august 2026) vastu. Versioonid on siin olulised: v3.0 andmestikud saabusid koos 0.4.0-ga oktoobris 2025, 9. märtsi 2026. aasta 0.5.0 blogi tutvustab pi0-FAST-i ja Real-Time Chunking'ut ning 6. juuli 2026. aasta 0.6.0 tegi baaspaketi kergeks ja viis juurutamise lerobot-rollout'i.
Üks asi ei muutunud: lerobot-train ja lerobot-record olid juba sisenemispunktid versioonis 0.3.2, august 2025. Õpetus, mis endiselt kutsub python -m lerobot.scripts.train, on aasta jagu muutustest vanem ja väärib ka ülejäänud osas umbusaldamist.
- 1Installimine õigete lisapakettidega
Alates versioonist 0.6.0 sisaldab baasinstall ainult ML-i põhisõltuvusi ning pi-lisapakett ei lisa andmestiku ega treeningkoodi, seega vajab peenhäälestus ka treeningu lisapaketti. Vanemad üherealised käsud ebaõnnestuvad siin importimise ajal.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Autentimine
Nõustu paligemma-3b-pt-224 litsentsiga brauseris, seejärel logi sisse masinasse, mis treenib.
bashhf auth login - 3Lisa kvantiilstatistika
Pi0.5 normaliseerib STATE ja ACTION kvantiilidega, seega vajab meta/stats.json q01 ja q99. Vanemad andmestikud sisaldavad ainult min, max, mean, std.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4Peenhäälestus lerobot/pi05_base baasilt
Määra paketi suurus vastavalt sellele, mida sinu kaart talub; dokumentatsioonis kasutatakse LIBERO-l 64-st 80 GB juures. Edasta bfloat16 selgesõnaliselt, konfiguratsiooni vaikeseade on float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Käivita see robotkäel
Versioonis 0.6.x on see lerobot-rollout: lerobot-record keeldub poliitikast ja lükkab tagasi eval_ andmestiku nimed. Base juhib kätt, sentry salvestab väljarullumise.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Lipp | Mida see teeb | Märkus |
|---|---|---|
| --policy.type=pi05 | valib Pi0.5 | nõutav koos pretrained_path-iga, jäta välja koos --policy.path-iga |
| --policy.pretrained_path | laadib ainult kaalud | tunnuste nimed sinu andmestikust, salvestatud seaded lähtestatakse |
| --policy.path | kaalud pluss kontrollpunkti config.json | salvestatud seaded, nagu n_action_steps, päritakse |
| --policy.n_action_steps | sammud, mis tarbitakse tüki kohta | naaseb 50-le, mitte kunagi üle chunk_size (vaikimisi 50) |
| --policy.train_expert_only | külmutab VLM-i, treenib eksperti | vaikimisi false, vähem mälu, mõningane edu kulu |
| --policy.gradient_checkpointing | arvutab uuesti aktiveerimiste salvestamise asemel | vaikimisi false, esimene hoob, kui käivitus ei mahu |
| --peft.method_type=LORA | LoRA adapterid täiskaalude asemel | vajab peft lisapaketti, dokumenteeritud näide on SmolVLA |
| --policy.rtc_training_max_delay | tegevuse eesliite tingimine RTC jaoks | ainult peaharus, mitte versioonis 0.6.1, peab jääma alla chunk_size |
| --rename_map | kaardistab andmestiku veerud poliitika tunnustele | vajalik, kui sinu kaamera võtmed erinevad |
Ilma kvantiilideta saad esimesel pakil ValueError: QUANTILES normalization mode requires q01 and q99 stats. Arvuta statistika uuesti, kuid tulemus maandub kausta $HF_LEROBOT_HOME/your_dataset, mitte vahemällu, mida --dataset.repo_id loeb, seega treeni, kasutades --dataset.root, mis sinna viitab, või lükka Hubi. Või jäta kvantiilid vahele, kasutades --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', nagu teeb LIBERO viitekäsk.
Kolm vaikeseadete komplekti ja millised neist treenerini jõuavad
openpi TrainConfig on referents, LeRoboti PI05Config on see, mida lerobot-train kasutab, kui te midagi ei ütle, ja siinne vorm saadab kolmanda komplekti. Üllatuseks on õppimiskiirus: mõlemad ülesvoolu vaikeseaded tipnevad 2.5e-5 juures, samas kui openpi enda pi05_libero konfiguratsioon ja see platvorm tõstavad selle 5e-5-ni.
| Seade | openpi TrainConfig | lerobot pi05 ja lerobot-train | AY-Robots saadab |
|---|---|---|---|
| Pakendi suurus | 32 | 8 | 1 |
| Tippõppimiskiirus | 2.5e-5, koosinuslangus | optimizer_lr 2.5e-5 | 5e-5 |
| Treeningusammud | 30,000 | 100,000 | 30,000 |
| Kontrollpunkti intervall | 1,000 sammu | 20,000 sammu | pole vormis |
| Seeme | 42 | 1,000 | vormis |
| Tegevuse tükk | action_horizon 50 | chunk_size 50, n_action_steps 50 | pole vormis |
| Kaalu andmetüüp | bfloat16 | float32, kuni edastate --policy.dtype | pole vormis |
| Gradiendi akumulatsioon | sellist nuppu pole, selle asemel fsdp_devices | seni puudub igast väljalaskest | 16, ja see on ära jäetud |
Kas port on usaldusväärne? LeRoboti meeskond peenhäälestas LIBERO baasmudelit veel 6k sammu võrra ja võrdles openpi võrdlusnumbritega neljas sviidis: 97.5 protsenti keskmiselt võrreldes 96.85-ga, ees Libero 10-s, taga Spatial-is. See tee on tööriistavalik, mitte kvaliteedivalik.
- Selle taga on üle 10 000 tunni roboti eeltreeningut, seega võib 50 episoodi teie ülesandest piisata.
- Pidevad tegevused: pole vaja häälestada tokeniseerijat, pole diskretiseerimise piirangut teie liigendnurkadele.
- LeRoboti port saavutab LIBERO keskmisel 97.5 protsenti võrreldes openpi 96.85-ga, seega sõbralikum CLI ei maksa midagi mõõdetavat.
- Parameetritõhusad teed mõlemal poolel: openpi JAX LoRA variandid, LeRoboti PEFT integratsioon.
- Täielikuks peenhäälestamiseks on vaja rohkem kui 70 GB. 22.5 GB LoRA näitaja on openpi JAX-i number; pi05 jaoks PEFT-i all pole ühtegi avaldatud.
- 485 ms tegevussammu kohta, siin viiest aeglaseim: kaks korda SmolVLA, kakskümmend neli korda ACT.
- LeRobot v3.0 on vajalik, seega GR00T käitamiseks salvestatud andmestik vajab teisendamist ja vastupidi.
- Uued valikud jõuavad esmalt main-i: treeninguaegne RTC ja MEM mälu pole versioonis 0.6.1, seega võivad uusimad dokumendid tähendada gitist installimist.
485 ms reaalsus ja koht, kus see lakkab olemast kasutatav
See otsustab teie projekti, seega tuleb see enne kulutabelit. järelduse latentsus tegevussammu kohta, mis on siin Pi0.5 jaoks mõõdetud, on 485 ms. Võrreldes teiste neljaga:
| Poliitika | Järeldus tegevussammu kohta | Parameetrid | GPU tase | Minimaalsed episoodid |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 või mis tahes 24 GB kaart | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB või H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB või H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 või mis tahes 24 GB kaart | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB või H100 80 GB | 50 |

Nende viie mudeli juhtimistsükkel kestab 20 kuni 485 ms tegevussammu kohta. Avaliku interneti edasi-tagasi reisid lisaks 485 ms-le muudavad töötava poliitika kõhklevaks. Kaugjäreldamine on teostatav aeglaseks esemete võtmiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks. Me pigem ütleme seda, kui müüme demo, mis töötab ainult LAN-is. Kui teie käsi peatub tükkide vahel, alustage siit: poliitika hangub liikumise keskel.
Ülesvoolu on vastus ja pool sellest on juba väljaandes, mille saate installida. Reaalajas tükeldamine (Real-Time Chunking) genereerib järgmise tüki, samal ajal kui käsi täidab veel praegust, seejärel juhib uue tüki kattuvad sammud jääma juba täidetud osale lähedale, nii et käsi ei seiskuks ega tõmbleks ühenduskohas. Järeldusaja vorm, mis tarniti 0.4.2 muudatuste logis Pi0, Pi0.5 ja SmolVLA jaoks, on juurutuslipp, mitte ümberõpe:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60See ei tee mudelit kiiremaks. See peidab lünga: 485 ms kulub endiselt, kuid väljaspool kriitilist teed, nii et järjekord ei jää tükkide vahel tühjaks. arXiv 2512.05964 treeninguaegne variant läheb kaugemale: mudel õpib tingima puhta tegevuse eesliitega, nii et järeldamisel on kattumine kõvasti sisse maalitud tegevuspõhiste voo ajasammudega juhendamise asemel ja juhendamise tagasikäik kaob. Treeningu ajal võtab see iga näite kohta eesliite pikkuse ja arvutab voo kadu ülejäänud järelliitel. See lipp on ainult peaharus, mitte versioonis 0.6.1, ja viivitus, mille jaoks te treenite, peab jääma alla chunk_size.
Kaks võimalust Pi0.5 kontrollpunkti saamiseks
Rendid või omad 80 GB kaarti, installid ühe ülaltoodud tarkvarapaketi, teisendad oma andmestiku ja jälgid käivitust. Sa säilitad kõik seaded: openpi JAX LoRA, LeRoboti PEFT adapterid, suhtelised toimingud, kohandatud klahvikaardistused. Samuti säilitad kõik ebaõnnestumised.
- Riistvara: A100 80 GB või H100, või 24 GB kaart openpi JAX LoRA teel.
- Seadistus: pärastlõuna esimeseks käivituseks, peamiselt klahvikaardistus ja piiratud tokeniseerija.
- Ei ole hostitud vormil: PEFT adapterid, suhtelised toimingud, treeninguaegne RTC, MEM mälu.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Valite mudeli ja andmestiku treeningvormil, taustasüsteem rendib GPU-d spot-turult vastavalt vajalikule VRAM-ile, käivitab treeneri ja kirjutab kontrollpunktid objektisalvestusse. Pi0.5 on siin ainult pilvepõhine. Juhendid on olemas SO-100, SO-101, Koch v1.1 ja LeKiwi jaoks.
| Seade | Mida platvorm Pi0.5 jaoks saadab |
|---|---|
| Baaskontrollpunkt | lerobot/pi05_base |
| Poliitika tüüp | pi05 |
| Paketi suurus | 1 |
| Õppimiskiirus | 5e-5 |
| Maksimaalsed sammud | 30000 |
| Gradiendi akumulatsioon | 16, kuid vaata allolevat hoiatust |
| Lisaseaded vormil | seed, logFreq |
| Andmestiku formaat | LeRobot v3.0 |
| GPU tase | A100 80 GB või H100 80 GB |
Treener saadab gradiendi akumulatsiooni väärtuse 16 ja lerobot 0.5.1-l puudub lipp selle vastuvõtmiseks, seega see jäetakse maha. Ühelgi välja antud lerobotil seda pole: seade eksisteerib ainult peaharus, kui --accelerator.gradient_accumulation.steps. Efektiivne paketi suurus on siin 1, võrreldes 256-ga, mida openpi pi05_libero konfiguratsioon kasutab. Väärt teada enne, kui loete kadumiskõverat. Seade kehtib GR00T N1.7 ja GR00T N1.5 käivituste puhul.
Järeldamine töötab samamoodi: poliitika teenindamiseks luuakse pod ja teie kohalik klient suhtleb sellega. Podil on tühikäigu valvekoer ja see hävitab end ise, nii et unustatud vaheleht ei arvelda vaikselt. Kehtib latentsuse hoiatus, mistõttu ACT 20 ms juures võidab sageli kiire ülesande.
Kui see ei tööta
| Sümptom | Kõige tõenäolisem põhjus |
|---|---|
| Käivitus lükatakse tagasi enne algust | Andmestik v2.1, kuid Pi0.5 soovib v3.0, või vastupidi GR00T puhul |
| ImportError, datasets pakett puudub | lerobot 0.6.x ilma treeningu lisata |
| ValueError q01 ja q99 kohta esimeses pakis | Puuduvad kvantiilid meta/stats.json-is; arvuta uuesti või kasuta MEAN_STD |
| CUDA mälu otsas sammul 0 | Täielik peenhäälestus alla 70 GB; proovi kontrollpunkti või train_expert_only |
| 401 või piiratud repo viga | PaliGemma tokeniseerija litsentsi ei ole aktsepteeritud |
| Kadu langeb, robot ei tee midagi | Normaliseerimise mittevastavus või poliitika kopeerib olekut |
| Käsi peatub tükkide vahel | Sammupõhine latentsus pluss edasi-tagasi reis; tükkide järjekord tühjeneb |
| Töötab ühes seadistuses, ebaõnnestub teises | Liiga vähe episoode või kõik ühes konfiguratsioonis |
- Andmestik tagasi lükatud: v3 nõutav
- Mälu puudus treeningu ajal
- Kadu langeb, kuid poliitika ei tee midagi
- Poliitika hangub liikumise keskel
- Poliitika töötab ainult ühes seadistuses
- Treeningtöö on järjekorras kinni
Mida üks käitus maksab
Pi0.5 asub kallimas astmes, sest see vajab 80 GB kaarti ja hetkehinnad liiguvad, seega on näitaja pigem vahemik kui kindel hind. Paljude SO-100 ülesannete puhul treeni SmolVLA või ACT-i esmalt 24 GB astmel, veendu, et ülesanne on üldse õpitav, seejärel kuluta sellele A100 tunde. Treeni oma esimene poliitika kirjeldab seda odavamat tsüklit ja hinnakiri sisaldab praeguseid astmeid.
| Aste | Poliitikad | Tüüpiline käitus | Hind tunnis | Käituse maksumus |
|---|---|---|---|---|
| A100 80 GB or H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 to 6 hours | 1.20 to 2.00 USD | umbes 4 to 12 USD |
| RTX 4090 või mis tahes 24 GB kaart | SmolVLA, ACT | 2 to 5 hours | 0.30 to 0.60 USD | umbes 1 to 3 USD |

Enne õhtu pühendamist: GR00T N1.7 Pi0.5 vastu ja Pi0.5 SmolVLA vastu esitavad samad numbrid kõrvuti. Areena sisaldab 85 VLA mudelit 332 võrdlustulemusega, millest igaüks on lingitud oma allikaga, ja perekonna taust on leitav meie VLA ülevaates.
Treenige Pi0.5 ilma virna ehitamata
Valige andmestik ja hüperparameetrid vormis. Taustasüsteem rendib hetketurult 80 GB kaardi, käivitab treeneri ja kirjutab kontrollpunktid objektisalvestusse. Juhendid SO-100, SO-101, Koch v1.1 ja LeKiwi jaoks.
Avage treeningjuhendidKas ma saan Pi0.5-i RTX 4090-l peenhäälestada?▾
Mitte täielik peenhäälestus: openpi loetleb selleks üle 70 GB, seega A100 80 GB või H100. Selle 22,5 GB LoRA näitaja kuulub JAX-i teele; PyTorchi implementatsioonil puudub LoRA. LeRoboti PEFT-integratsioon on olemas, kuid selle dokumenteeritud näide on SmolVLA ja pi05 jaoks pole VRAM-i näitajat avaldatud.
Mitu episoodi ma vajan?▾
Viiskümmend, sama miinimum kui GR00T-l ja ACT-l; ainult SmolVLA läheb madalamale, 30-le. Baaskontrollpunkt sisaldab üle 10 000 tunni eelkoolitust, nii et peenhäälestus kohandub, mitte ei õpi nullist: 50 puhast, mitmekesist episoodi on parem kui kakssada ühest konfiguratsioonist.
Mis vahe on --policy.path ja --policy.pretrained_path vahel?▾
--policy.path laeb kaalud ja kontrollpunkti config.json-i, nii et salvestatud seaded, nagu n_action_steps, päritakse ja --policy.type tuleb välja jätta. --policy.pretrained_path laeb ainult kaalud: funktsiooninimed tulevad teie andmestikust, salvestatud seaded lähtestatakse, --policy.type on nõutav. Seepärast edastab LIBERO käsk n_action_steps=10 ja empty_cameras=1 selgesõnaliselt; vastasel juhul langevad need tagasi 50-le ja 0-le.
Kas avatud versioon annab mulle paberis kirjeldatud täieliku Pi0.5?▾
Ei. Mõlemad toetavad ainult voolu sobitamise tegevuspead. Diskreetse märgi eelkoolituse etappi FAST-i tegevustokeniseerija ja kõrgetasemelise alamülesande ennustusega ei avaldatud ning lerobot/pi05_base kaart lisab sellele loendile RL-i, kuigi pi0.5 paber ei kirjelda ühtegi tugevdamisõppe etappi. Te treenite madala taseme poliitikat, mis on tingitud teie antud keele stringist, mitte mudelit, mis ise pikka ülesannet lahti harutab.
Milliste versioonide jaoks see juhend on kirjutatud?▾
openpi peaharus ja lerobot 0.6.1, mis on välja antud alates 3. augustist 2026, mõlemad loetud 23. augustil 2026. v3.0 andmestikud saabusid koos 0.4.0-ga oktoobris 2025. 0.6.0 tegi baaspaketi kergeks, nii et lerobot[pi] üksi ei installi enam treeningvirna ja viis juurutamise lerobot-rollout'i. Treeninguaegne RTC on ainult peaharus; siinne hostitud treener käitab versiooni 0.5.1.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started