
Fínstilltu Pi0.5, flæðisamsvörunar VLA frá Physical Intelligence, á eigin vélmennagögnum. Raunverulegar skipanir fyrir openpi og lerobot pi05, gildrur í gagnasafns sniði, VRAM og leyndarmörk.
Pi0.5 er líkanið sem þú grípur til þegar stefna þarf að virka í herbergi sem hún hefur aldrei séð. Það er líka það óþægilegasta af þeim fimm þjálfanlegar stefnur hér til að fínstilla handvirkt: upprunalega geymslan er JAX fyrst, LeRobot útgáfan færði dreifingu út úr lerobot-record í 0.6.0 og gerði grunn uppsetninguna of litla til að þjálfa með, og full fínstilling passar ekki á 4090. Hér fyrir neðan: hvað flæðisjöfnun kostar við ályktun, tvær skipanaleiðirnar, og 485 ms talan sem ræður því hvort niðurstaðan sé nothæf.
Það sem þú þarft að vita
- •Flæðisjöfnunar VLA: 3B PaliGemma VLM auk 300M aðgerðasérfræðings sem afkóðar samfellda aðgerðabita. Tvær leiðir til að fínstilla það, openpi og LeRobot pi05, 0.65 stigum í sundur á LIBERO meðaltali.
- •Full fínstilling þarf meira en 70 GB af VRAM. openpi listar LoRA við 22.5 GB, aðeins á JAX leiðinni sinni.
- •Gagnasafnið verður að vera LeRobotDataset v3.0 með q01 og q99 kvartílum í meta/stats.json, annars kastar fyrsta lotan villu.
- •Athugaðu lerobot útgáfuna þína fyrst: 0.6.0 gerði grunn pakkann léttan og færði dreifingu út úr lerobot-record.
- •Hér keyrir það á 485 ms á aðgerðarskref, vill 50 þætti, og kostar um 4 til 12 USD á keyrslu.
Hvað Pi0.5 er í raun
Physical Intelligence gaf út pi0 í október 2024: flæðisjöfnunar sjón-mál-aðgerð líkan á forþjálfuðu VLM: PaliGemma með 3 milljarða færibreytur auk 300M aðgerðasérfræðings sem var frumstilltur frá grunni, samtals 3.3 milljarðar. Greinin greinir frá forþjálfun á yfir 10.000 klukkustundum af vélmennagögnum yfir 7 vélmennastillingar og 68 verkefni. Meira í pi0 greininni.
Pi0.5 (arXiv 2504.16054, 22 April 2025) heldur þeirri grunnbyggingu og breytir þjálfunarfæðinu: vefgögn, hlutgreining, munnlegar leiðbeiningar frá mönnum sem þjálfa vélmennið, undirverkefnismerkingar, gögn frá vélmennum í mörgum heimilum sem sýna mismunandi útfærslur. Niðurstaðan er vélmenni sem þrífur eldhús í húsum sem voru ekki í þjálfunarsettinu. openpi README bætir við smáatriði sem titillinn gerir ekki: útgefna pi0.5 var þjálfuð með þekkingareinangrun (arXiv 2505.23705).
| Eiginleiki | pi0 | pi0.5 |
|---|---|---|
| VLM grunnstoðarafbrigði | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Aðgerðasérfræðingarafbrigði | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| Sjálfgefin aðgerðarsjóndeildarhringur | 50 | 50 |
| max_token_len | 48 | 200 |
| discrete_state_input | false | true, ástandi skipt í flokka í hvatningunni |
| Grunnáfangapunktur | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README er skýrt: geymslan styður aðeins flæðisjöfnunarhausinn, fyrir pi0.5 þjálfun og ályktun jafnt. Greinin lýsir tveimur stigum og kóðinn inniheldur aðeins það síðara: forþjálfun táknar hverja aðgerð sem staka tákn í gegnum FAST tokenizer, og við útfærslu ályktar líkanið undirverkefni á háu stigi fyrir hvern aðgerðarhluta. Ekkert af þessu er í geymslunni. lerobot/pi05_base kortið gefur sama lista og bætir við RL, þó að pi0.5 greinin lýsi engu styrkingarnámsstigi yfirleitt. LeRobot útfærslan erfir það umfang, og það gerir hver hýstur þjálfari á henni líka, þar á meðal sá hér. Leyfisveiting er líka skipt: pi05 skjalsíðan segir Apache 2.0, lerobot/pi05_base kortið er merkt license: gemma.
Hvað flæðisjöfnun breytir varðandi þjálfun og ályktun
Stjórnunarstefna stjórnunarstefna sem hægt er að þjálfa á SO-100 annaðhvort skilar aðgerðum beint (ACT) eða táknar þær og afkóðar sjálfvirkt (pi0-FAST). Flæðisjöfnun gerir hvorugt: hún lærir vigursvið sem flytur hávaða í hreinan aðgerðabút, og samþættir hann síðan. pi0-ritgerðin notar 10 samþættingarskref með skrefstærð 0.1; pi05 stilling LeRobot inniheldur sama num_inference_steps: int = 10.
- Þjálfun: tapið skilar hávaðasömum aðgerðabút. Enginn táknari til að stilla, engin sundurgreining á liðhornunum þínum.
- Ályktun: einn bútur kostar tíu framsendingar í gegnum aðgerðasérfræðinginn. Þetta er byggingarbundið, ekki stillingarvandamál.
- Úttak: samfelldar aðgerðir af vídd 32, fylltar innbyrðis, tap tekið á víddunum sem vélmennið þitt hefur. 6-DoF armur ásamt gripara notar 7.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma burðarvirkið, og hliðið fyrir framan það
PaliGemma (arXiv 2407.07726) er SigLIP-So400m sjónkóðari á Gemma-2B tungumálamódeli, um 3B færibreytur. Pi0.5 erfir táknara sinn, og sá táknari er í lokuðu geymslusvæði. Þetta er algengasta ástæðan fyrir því að fyrsta keyrsla mistekst, áður en fyrsta þjálfunarskrefið.
LeRobot pi05 skjölun segir það skýrt: pi0.5 notar lokaða google/paligemma-3b-pt-224 táknarann, svo samþykktu leyfi hans á Hub og keyrðu hf auth login fyrst. Aðgangur er veittur handvirkt, ekki samstundis. Slepptu því, byrjaðu á greiddri skýkeyrslu, og þú borgar fyrir pod sem getur ekki sótt táknara.
Áður en þú byrjar: gagnasafnsnið, þættir, vélbúnaður
Pi0.5 í LeRobot les LeRobot gagnasafn í v3.0 skipulagi, sem kom með lerobot 0.4.0 í október 2025: margir þættir í hverri Parquet og MP4 skrá í stað einnar skrár á hvern þátt, með mörkum í meta/episodes/ frekar en skráarnöfnum. Taktu upp með skjáborðsforritinu eða fylgdu skráðu fyrsta gagnasafnið þitt og þú hefur það.
| Hamur | GPU minni sem þarf | Dæmi um GPU |
|---|---|---|
| Ályktun | more than 8 GB | RTX 4090 |
| Fínstilling, LoRA | more than 22.5 GB | RTX 4090 |
| Fínstilling, full | more than 70 GB | A100 80 GB or H100 |
Pi0.5 og SmolVLA krefjast LeRobot v3.0. GR00T N1.7 og GR00T N1.5 krefjast v2.0 eða v2.1 og hrynja á v3.0 gagnasafni. Ein upptökulota getur ekki fóðrað bæði án umbreytingar, og villan segir ekki "wrong dataset version". Sjá gagnasafn hafnað: v3 krafist.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsVettvangurinn krefst að minnsta kosti 50 þátta fyrir Pi0.5, sama lágmark og fyrir GR00T og ACT. Forþjálfun sér um erfiðasta verkið, svo 50 hreinir þættir eru betri en 200 slakir. Nýr í þessu? Byrjaðu á leiðbeiningunum um gagnasöfnun.

Leið A: fínstilla með openpi geymslunni
Viðmiðunarútfærslan: JAX fyrst, prófuð eingöngu á Ubuntu 22.04, knúin áfram af stillingahlutum frekar en flöggum. PyTorch leið kom í september 2025, staðfest á LIBERO. Þrjú skref: umbreyta gögnunum þínum, skilgreina stillingu, þjálfa og þjóna.
- 1Klóna og setja upp
openpi notar uv. GIT_LFS_SKIP_SMUDGE er það sem gerir LeRobot kleift að koma inn sem háð án LFS-kubba.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Umbreyta gögnunum þínum í LeRobot gagnasafn
Uppstreymið sendir með breytir fyrir LIBERO og DROID og gerir ráð fyrir að þú aðlagir einn. Verkið er lykilkortlagningin.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Bæta við þjálfunarstillingu
Stillingar eru TrainConfig færslur í src/openpi/training/config.py. Þessi aðlagar pi05_droid_finetune, með þyngdarhleðslunni beint á pi05_base.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Reikna staðlaðar tölfræði
Keyrir gegn stillingarnafninu, ekki gagnasafninu. Að sleppa því er klassíska fyrsta bilunin hér.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Þjálfa
Breytan leyfir JAX að nota 90 prósent af GPU minni í stað sjálfgefna 75. Á 80 GB korti ræður það því hvort keyrslan lifir af.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Þjóna því
Þjónninn hlustar á port 8000 og svarar athugunarfyrirspurnum; keyrslutími vélmennisins þíns er biðlarinn.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi's PyTorch útfærsla styður ekki pi0-FAST, blandaða nákvæmni, FSDP, LoRA eða EMA þyngdir, svo LoRA sem nær 22.5 GB er eingöngu JAX, í gegnum gemma_2b_lora og gemma_300m_lora afbrigðin. Verra: uppsetningin afritar plástraðar skrár yfir uppsettu transformers 4.53.2, og README varar við því að með sjálfgefnum hardlink ham uv breytir þetta transformers varanlega í uv skyndiminni og getur lekið inn í önnur verkefni. Hættu við þetta með uv cache clean transformers.
Leið B: fínstilla með lerobot pi05
LeRobot portið umvefur sömu þyngdir í CLI sem þú notar nú þegar fyrir ACT og SmolVLA. Allt hér að neðan var athugað gegn lerobot 0.6.1, útgáfunni frá 3. ágúst 2026, og pi05 skjölunum þann 23. ágúst 2026. Útgáfur skipta máli hér: v3.0 gagnasöfn komu með 0.4.0 í október 2025, 0.5.0 bloggið frá 9. mars 2026 kynnir pi0-FAST og Real-Time Chunking, og 0.6.0 þann 6. júlí 2026 gerði grunn pakkann léttan og færði útfærslu yfir í lerobot-rollout.
Eitt hreyfðist ekki: lerobot-train og lerobot-record voru nú þegar inngangspunktar í 0.3.2, ágúst 2025. Kennsla sem enn kallar á python -m lerobot.scripts.train er frá því fyrir ári af breytingum og er þess virði að vantreysta á restinni líka.
- 1Setja upp með réttum viðbótum
Frá og með 0.6.0 inniheldur grunnuppsetningin aðeins kjarna ML-háðir, og pi-viðbótin bætir ekki við neinum gagnasafns- eða þjálfunarkóða, svo fínstilling þarf einnig þjálfunarviðbótina. Eldri einfaldar skipanir mistakast hér við innflutning.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Auðkenna
Samþykktu paligemma-3b-pt-224 leyfið í vafra, skráðu þig síðan inn á tölvunni sem þjálfar.
bashhf auth login - 3Bæta við kvartíl-tölfræði
Pi0.5 staðlar STATE og ACTION með kvartílum, svo meta/stats.json þarf q01 og q99. Eldri gagnasöfn innihalda aðeins min, max, mean, std.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4Fínstilla frá lerobot/pi05_base
Stilltu stærð lotunnar eftir því hvað kortið þitt þolir; skjölun notar 64 á LIBERO með 80 GB. Sendu bfloat16 skýrt, sjálfgefið í stillingum er float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Keyra það á arminum
Í 0.6.x er þetta lerobot-rollout: lerobot-record neitar stefnu og hafnar eval_ gagnasafnsnöfnum. Base stýrir arminum, sentry skráir útfærsluna.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Fáni | Hvað það gerir | Athugasemd |
|---|---|---|
| --policy.type=pi05 | velur Pi0.5 | nauðsynlegt með pretrained_path, sleppa með --policy.path |
| --policy.pretrained_path | hleður aðeins þyngdum | eiginleikanöfn úr gagnasafninu þínu, geymdar stillingar endurstilltar |
| --policy.path | þyngdir auk checkpoint config.json | geymdar stillingar eins og n_action_steps eru erfðar |
| --policy.n_action_steps | skref notuð á hverja sneið | fer aftur í 50, aldrei yfir chunk_size (sjálfgefið 50) |
| --policy.train_expert_only | frystir VLM, þjálfar sérfræðinginn | sjálfgefið false, minna minni, nokkur kostnaður í árangri |
| --policy.gradient_checkpointing | endurreikna í stað þess að geyma virkjanir | sjálfgefið false, fyrsta handfangið þegar keyrsla passar ekki |
| --peft.method_type=LORA | LoRA millistykki í stað fullra þyngda | þarf peft viðbótina, skjalfest dæmi er SmolVLA |
| --policy.rtc_training_max_delay | aðgerðarforvirk skilyrðing fyrir RTC | aðeins í aðalgrein, ekki í 0.6.1, verður að vera undir chunk_size |
| --rename_map | varpar gagnasafnsdálkum á stefnueiginleika | nauðsynlegt þegar myndavélalyklar þínir eru ólíkir |
Án kvartíla færðu ValueError: QUANTILES normalization mode requires q01 and q99 stats í fyrstu lotu. Endurreiknaðu tölfræðina, en niðurstaðan lendir í $HF_LEROBOT_HOME/your_dataset, ekki skyndiminni sem --dataset.repo_id les, svo þjálfaðu með --dataset.root sem vísar þangað eða ýttu á Hub. Eða slepptu kvartílum með --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', eins og LIBERO viðmiðunarskipunin gerir.
Þrjú sett af sjálfgefnum gildum, og hver þeirra ná til þjálfarans
TrainConfig frá openpi er viðmiðið, PI05Config frá LeRobot er það sem lerobot-train notar þegar ekkert er gefið upp, og eyðublaðið hér sendir þriðja settið. Það sem kemur á óvart er námshraðinn: báðar sjálfgefnu stillingarnar ná hámarki í 2.5e-5, á meðan pi05_libero stilling openpi sjálfs og þessi vettvangur hækka hann í 5e-5.
| Stilling | openpi TrainConfig | lerobot pi05 og lerobot-train | AY-Robots sendir |
|---|---|---|---|
| Lotustærð | 32 | 8 | 1 |
| Hámarks námshraði | 2.5e-5, kósínus hrörnun | optimizer_lr 2.5e-5 | 5e-5 |
| Þjálfunarskref | 30,000 | 100,000 | 30,000 |
| Athugunarpunktabil | 1,000 steps | 20,000 steps | ekki í eyðublaðinu |
| Fræ | 42 | 1,000 | í eyðublaðinu |
| Aðgerðarhluti | action_horizon 50 | chunk_size 50, n_action_steps 50 | ekki í eyðublaðinu |
| Þyngdar gagnagerð | bfloat16 | float32 þar til þú sendir --policy.dtype | ekki í eyðublaðinu |
| Hallastöflun | enginn slíkur hnappur, fsdp_devices í staðinn | fjarverandi í öllum útgáfum hingað til | 16, og því er sleppt |
Er útfærslan trú? LeRobot teymið fínstillti LIBERO grunnlíkanið í 6k skrefum til viðbótar og bar saman við viðmiðunartölur openpi á fjórum sviðum: 97.5 prósent að meðaltali á móti 96.85, á undan á Libero 10, á eftir á Spatial. Leiðin er val á verkfærum, ekki gæðum.
- Meira en 10,000 klukkustundir af forþjálfun vélmenna að baki, svo 50 þættir af verkefni þínu geta verið nóg.
- Samfelldar aðgerðir: enginn táknari til að stilla, engin sundurgreiningarþröskuldur á liðhornunum þínum.
- LeRobot útfærslan skorar 97.5 prósent að meðaltali á LIBERO á móti 96.85 hjá openpi, svo vinalegri CLI kostar ekkert mælanlegt.
- Færibreytuvænar leiðir á báðum hliðum: JAX LoRA afbrigði openpi, PEFT samþætting LeRobot.
- Full fínstilling þarf meira en 70 GB. 22.5 GB LoRA talan er JAX tala openpi; engin er gefin út fyrir pi05 undir PEFT.
- 485 ms per action step, hægast af þeim fimm hér: tvisvar sinnum SmolVLA, tuttugu og fjórum sinnum ACT.
- LeRobot v3.0 er nauðsynlegt, svo gagnasafn sem skráð er fyrir GR00T keyrslu þarf að breyta, og öfugt.
- Nýir valkostir lenda fyrst á main: RTC og MEM minni á þjálfunartíma eru ekki í 0.6.1, svo nýjustu skjöl geta þýtt uppsetningu frá git.
Raunveruleikinn 485 ms, og hvar hann hættir að vera nothæfur
Þetta ræður verkefni þínu, svo það kemur á undan kostnaðartöflunni. Töf á á hverju aðgerðarskrefi mæld hér fyrir Pi0.5 er 485 ms. Í samanburði við hin fjögur:
| Stefna | Ályktun á aðgerðarskrefi | Færibreytur | GPU flokkur | Lágmarksþættir |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

Stýrilásinn yfir þessi fimm módel keyrir 20 til 485 ms á hvert aðgerðarskref. Hringferðir um almennt internet ofan á 485 ms breyta virkri stefnu í hikandi. Fjarlæg ályktun er raunhæf fyrir hæga tínslu og staðsetningu, ekki fyrir hraðvirka hreyfingu. Við viljum frekar segja það en að selja kynningu sem virkar aðeins á staðarneti. Ef armurinn þinn stoppar á milli bita, byrjaðu á stefna frýs í miðri hreyfingu.
Uppstreymi hefur svar, og helmingur þess er nú þegar í útgáfunni sem þú getur sett upp. Rauntíma bútun (Real-Time Chunking) býr til næsta bút á meðan armurinn er enn að framkvæma þann núverandi, leiðir síðan skarast skref nýja bútsins til að halda sér nálægt þeim hluta sem þegar hefur verið framkvæmdur, svo armurinn stöðvast ekki eða kippist við samskeytin. Ályktunartímaformið sem fylgdi með í 0.4.2 breytingaskránni fyrir Pi0, Pi0.5 og SmolVLA og er útfærslufáni, ekki endurþjálfun:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60Það gerir módelið ekki hraðvirkara. Það felur bilið: 485 ms eru enn notaðar, en utan mikilvægrar leiðar, svo biðröðin tæmist ekki á milli bita. Þjálfunartíma afbrigðið frá arXiv 2512.05964 gengur lengra: módelið lærir að skilyrða sig á hreinan aðgerðarforskeyti, svo við ályktun er skörunin harðmáluð með flæðistímastigum á hverja aðgerð í stað þess að vera leiðbeint, og leiðbeiningar afturábak ferlið hverfur. Við þjálfun tekur það sýnishorn af forskeytalengd á hvert dæmi og tekur flæðitapið á eftirstandandi eftirskeyti. Sá fáni er aðeins á aðalútgáfu, ekki í 0.6.1, og seinkunin sem þú þjálfar fyrir verður að vera undir chunk_size.
Tvær leiðir til að fá Pi0.5 geymslupunkt
Þú leigir eða átt 80 GB kort, setur upp einn af ofangreindum stakkum, umbreytir gagnasafninu þínu og fylgist með keyrslunni. Þú heldur öllum stillingum: JAX LoRA frá openpi, PEFT millistykki LeRobot, hlutfallslegar aðgerðir, sérsniðnar lyklakortanir. Þú heldur einnig öllum bilunum.
- Vélbúnaður: A100 80 GB eða H100, eða 24 GB kort á JAX LoRA leið openpi.
- Uppsetning: einn eftirmiðdagur fyrir fyrstu keyrslu, aðallega lyklakortun og lokaði táknarinn.
- Ekki á hýstu formi: PEFT millistykki, hlutfallslegar aðgerðir, RTC á æfingartíma, MEM minni.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Þú velur líkan og gagnasafn í þjálfunarforminu, bakendinn leigir GPU á skyndimarkaði eftir nauðsynlegu VRAM, keyrir þjálfarann og skrifar geymslupunkta í hlutageymslu. Pi0.5 er eingöngu í skýinu hér. Leiðbeiningar eru til fyrir SO-100, SO-101, Koch v1.1 og LeKiwi.
| Stilling | Það sem pallurinn sendir fyrir Pi0.5 |
|---|---|
| Grunngeymslupunktur | lerobot/pi05_base |
| Tegund stefnu | pi05 |
| Hópstærð | 1 |
| Námsferill | 5e-5 |
| Hámarks skref | 30000 |
| Hallastyrkur | 16, en sjáðu viðvörunina hér að neðan |
| Auka stillingar í forminu | seed, logFreq |
| Gagnasafnsform | LeRobot v3.0 |
| GPU flokkur | A100 80 GB eða H100 80 GB |
Þjálfarinn sendir hallastyrksgildið 16 og lerobot 0.5.1 hefur ekkert flagg til að taka á móti því, svo því er sleppt. Engin útgefin lerobot hefur slíkt: stillingin er aðeins til á aðalgrein, sem --accelerator.gradient_accumulation.steps. Virk hópstærð hér er 1, á móti 256 sem pi05_libero stilling openpi notar. Þess virði að vita áður en þú lest tapferil. Stillingin á við um GR00T N1.7 og GR00T N1.5 keyrslur.
Ályktun virkar á sama hátt: pod er úthlutað til að þjóna stefnunni og staðbundinn viðskiptavinur þinn talar við það. Podinn hefur aðgerðalausan varðhund og eyðileggur sig sjálfur, svo gleymdur flipi reikningsfærist ekki hljóðlaust. Seinkunarfyrirvarinn á við, þess vegna ACT við 20 ms vinnur oft hratt verkefni.
Þegar það virkar ekki
| Einkenni | Líklegasta orsök |
|---|---|
| Keyrsla hafnað áður en hún byrjar | Gagnasafn v2.1 en Pi0.5 vill v3.0, eða öfugt fyrir GR00T |
| ImportError, datasets pakki vantar | lerobot 0.6.x án þjálfunaraukans |
| ValueError um q01 og q99 á fyrsta hópi | Engin kvartíl í meta/stats.json; endurreikna eða nota MEAN_STD |
| CUDA minni uppurið í skrefi 0 | Full fínstilling undir 70 GB; reyndu geymslupunktun eða train_expert_only |
| 401 eða lokuð geymsluvilla | PaliGemma táknaraleyfi ekki samþykkt |
| Tap lækkar, vélmenni gerir ekkert | Ósamræmi í stöðlun, eða stefnan afritar ástandið |
| Armur stoppar á milli bita | Seinkun á hvert skref auk ferðar fram og til baka; bitaröðin tæmist |
| Virkar í einni uppsetningu, bilar í annarri | Of fáir þættir, eða allir í einni stillingu |
- Gagnamengi hafnað: v3 krafist
- Minnislaust við þjálfun
- Tap minnkar en stefnan gerir ekkert
- Stefna frýs í miðri hreyfingu
- Stefna virkar aðeins í einni uppsetningu
- Þjálfunarverkefni fast í biðröð
Hvað ein keyrsla kostar
Pi0.5 er í dýra flokknum vegna þess að það þarf 80 GB kort, og verð á augnabliksmarkaði breytist, svo talan er svið frekar en verð. Fyrir mörg SO-100 verkefni, þjálfaðu SmolVLA eða ACT á 24 GB flokknum fyrst, staðfestu að verkefnið sé yfirhöfuð læranlegt, og eyðdu síðan A100 klukkustundum í það. Þjálfaðu fyrstu stefnu þína sýnir þessa ódýrari lykkju, og verðlagning sýnir núverandi flokka.
| Flokkur | Stefnum | Dæmigerð keyrsla | Verð á klukkustund | Kostnaður á keyrslu |
|---|---|---|---|---|
| A100 80 GB eða H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 til 6 klukkustundir | 1.20 til 2.00 USD | um 4 til 12 USD |
| RTX 4090 eða hvaða 24 GB kort sem er | SmolVLA, ACT | 2 til 5 klukkustundir | 0.30 til 0.60 USD | um 1 til 3 USD |

Áður en kvöldi er varið: og sýna sömu tölurnar hlið við hlið. geymir 85 VLA módel með 332 viðmiðunarniðurstöðum, hver tengd uppruna sínum, og bakgrunnur um fjölskylduna er í .
Þjálfa Pi0.5 án þess að byggja upp staflann
Veldu gagnasafnið og ofurbreyturnar í eyðublaði. Bakendinn leigir 80 GB kort á skyndimarkaði, keyrir þjálfarann og skrifar geymslupunkta í hlutageymslu. Leiðbeiningar fyrir SO-100, SO-101, Koch v1.1 og LeKiwi.
Opna þjálfunarleiðbeiningarnarGet ég fínstillt Pi0.5 á RTX 4090?▾
Ekki full fínstilling: openpi listar meira en 70 GB fyrir það, svo A100 80 GB eða H100. 22.5 GB LoRA talan tilheyrir JAX leiðinni; PyTorch útfærslan hefur enga LoRA. PEFT samþætting LeRobot er til staðar, en skjalfest dæmi þess er SmolVLA og engin VRAM tala er gefin út fyrir pi05.
Hversu marga þætti þarf ég?▾
Fimmtíu, sama lágmark og GR00T og ACT; aðeins SmolVLA fer lægra, í 30. Grunngeymslupunkturinn inniheldur meira en 10.000 klukkustundir af forþjálfun, svo fínstillingin aðlagar sig frekar en lærir frá grunni: 50 hreinir, fjölbreyttir þættir eru betri en tvö hundruð úr einni stillingu.
Hver er munurinn á --policy.path og --policy.pretrained_path?▾
--policy.path hleður þyngdum og config.json geymslupunktsins, svo geymdar stillingar eins og n_action_steps erfast og --policy.type verður að sleppa. --policy.pretrained_path hleður aðeins þyngdum: eiginleikanöfn koma frá gagnasafninu þínu, geymdar stillingar endurstillast, --policy.type er krafist. Þess vegna sendir LIBERO skipunin n_action_steps=10 og empty_cameras=1 skýrt; annars falla þau aftur í 50 og 0.
Gefur opna útgáfan mér fulla Pi0.5 úr greininni?▾
Nei. Báðir styðja aðeins flæðisamsvörunar aðgerðarhausinn. Forþjálfunarstigið með stökum táknum með FAST aðgerðartáknara og háþróuð forspá undirverkefna voru ekki gefin út, og lerobot/pi05_base kortið bætir RL við þann lista þó að pi0.5 greinin lýsi engu styrkingarnámsstigi. Þú þjálfar lágt stig stefnu sem er skilyrt á tungumálsstreng sem þú gefur upp, ekki líkan sem sundurgreinir langt verkefni sjálft.
Gegn hvaða útgáfum er þessi leiðbeining skrifuð?▾
openpi á aðalgreininni og lerobot 0.6.1, útgáfan frá 3. ágúst 2026, báðar lesnar 23. ágúst 2026. v3.0 gagnasöfn komu með 0.4.0 í október 2025. 0.6.0 gerði grunn pakkann léttan, svo lerobot[pi] eitt og sér setur ekki lengur upp þjálfunarstafla, og færði útfærslu yfir í lerobot-rollout. RTC á þjálfunartíma er aðeins á aðalgreininni; hýsti þjálfarinn hér keyrir 0.5.1.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started