AY-Robots þjálfunarfylkið með fimm stefnum sem raðir og fjórum vélmennaörmum sem dálkar, hver reitur tengill á sérstaka fínstillingarleiðbeiningar
Pi0.5FlæðisamsvörunVLA ÞjálfunLeRobotFínstilling

Hvernig á að þjálfa Pi0.5 á eigin vélmennagögnum

AY-Robots ResearchAugust 23, 202616 mínútna lestur

Fínstilltu Pi0.5, flæðisamsvörunar VLA frá Physical Intelligence, á eigin vélmennagögnum. Raunverulegar skipanir fyrir openpi og lerobot pi05, gildrur í gagnasafns sniði, VRAM og leyndarmörk.

Pi0.5 er líkanið sem þú grípur til þegar stefna þarf að virka í herbergi sem hún hefur aldrei séð. Það er líka það óþægilegasta af þeim fimm þjálfanlegar stefnur hér til að fínstilla handvirkt: upprunalega geymslan er JAX fyrst, LeRobot útgáfan færði dreifingu út úr lerobot-record í 0.6.0 og gerði grunn uppsetninguna of litla til að þjálfa með, og full fínstilling passar ekki á 4090. Hér fyrir neðan: hvað flæðisjöfnun kostar við ályktun, tvær skipanaleiðirnar, og 485 ms talan sem ræður því hvort niðurstaðan sé nothæf.

Það sem þú þarft að vita

  • Flæðisjöfnunar VLA: 3B PaliGemma VLM auk 300M aðgerðasérfræðings sem afkóðar samfellda aðgerðabita. Tvær leiðir til að fínstilla það, openpi og LeRobot pi05, 0.65 stigum í sundur á LIBERO meðaltali.
  • Full fínstilling þarf meira en 70 GB af VRAM. openpi listar LoRA við 22.5 GB, aðeins á JAX leiðinni sinni.
  • Gagnasafnið verður að vera LeRobotDataset v3.0 með q01 og q99 kvartílum í meta/stats.json, annars kastar fyrsta lotan villu.
  • Athugaðu lerobot útgáfuna þína fyrst: 0.6.0 gerði grunn pakkann léttan og færði dreifingu út úr lerobot-record.
  • Hér keyrir það á 485 ms á aðgerðarskref, vill 50 þætti, og kostar um 4 til 12 USD á keyrslu.

Hvað Pi0.5 er í raun

Physical Intelligence gaf út pi0 í október 2024: flæðisjöfnunar sjón-mál-aðgerð líkan á forþjálfuðu VLM: PaliGemma með 3 milljarða færibreytur auk 300M aðgerðasérfræðings sem var frumstilltur frá grunni, samtals 3.3 milljarðar. Greinin greinir frá forþjálfun á yfir 10.000 klukkustundum af vélmennagögnum yfir 7 vélmennastillingar og 68 verkefni. Meira í pi0 greininni.

Pi0.5 (arXiv 2504.16054, 22 April 2025) heldur þeirri grunnbyggingu og breytir þjálfunarfæðinu: vefgögn, hlutgreining, munnlegar leiðbeiningar frá mönnum sem þjálfa vélmennið, undirverkefnismerkingar, gögn frá vélmennum í mörgum heimilum sem sýna mismunandi útfærslur. Niðurstaðan er vélmenni sem þrífur eldhús í húsum sem voru ekki í þjálfunarsettinu. openpi README bætir við smáatriði sem titillinn gerir ekki: útgefna pi0.5 var þjálfuð með þekkingareinangrun (arXiv 2505.23705).

Eiginleikipi0pi0.5
VLM grunnstoðarafbrigðigemma_2b (PaliGemma)gemma_2b (PaliGemma)
Aðgerðasérfræðingarafbrigðigemma_300mgemma_300m
action_dim3232
Sjálfgefin aðgerðarsjóndeildarhringur5050
max_token_len48200
discrete_state_inputfalsetrue, ástandi skipt í flokka í hvatningunni
Grunnáfangapunkturgs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Það sem er opinbert er ekki öll greinin

openpi README er skýrt: geymslan styður aðeins flæðisjöfnunarhausinn, fyrir pi0.5 þjálfun og ályktun jafnt. Greinin lýsir tveimur stigum og kóðinn inniheldur aðeins það síðara: forþjálfun táknar hverja aðgerð sem staka tákn í gegnum FAST tokenizer, og við útfærslu ályktar líkanið undirverkefni á háu stigi fyrir hvern aðgerðarhluta. Ekkert af þessu er í geymslunni. lerobot/pi05_base kortið gefur sama lista og bætir við RL, þó að pi0.5 greinin lýsi engu styrkingarnámsstigi yfirleitt. LeRobot útfærslan erfir það umfang, og það gerir hver hýstur þjálfari á henni líka, þar á meðal sá hér. Leyfisveiting er líka skipt: pi05 skjalsíðan segir Apache 2.0, lerobot/pi05_base kortið er merkt license: gemma.

Hvað flæðisjöfnun breytir varðandi þjálfun og ályktun

Stjórnunarstefna stjórnunarstefna sem hægt er að þjálfa á SO-100 annaðhvort skilar aðgerðum beint (ACT) eða táknar þær og afkóðar sjálfvirkt (pi0-FAST). Flæðisjöfnun gerir hvorugt: hún lærir vigursvið sem flytur hávaða í hreinan aðgerðabút, og samþættir hann síðan. pi0-ritgerðin notar 10 samþættingarskref með skrefstærð 0.1; pi05 stilling LeRobot inniheldur sama num_inference_steps: int = 10.

  • Þjálfun: tapið skilar hávaðasömum aðgerðabút. Enginn táknari til að stilla, engin sundurgreining á liðhornunum þínum.
  • Ályktun: einn bútur kostar tíu framsendingar í gegnum aðgerðasérfræðinginn. Þetta er byggingarbundið, ekki stillingarvandamál.
  • Úttak: samfelldar aðgerðir af vídd 32, fylltar innbyrðis, tap tekið á víddunum sem vélmennið þitt hefur. 6-DoF armur ásamt gripara notar 7.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
Lesið úr src/openpi/models/pi0_config.py á openpi main greininni, 23. ágúst 2026.

PaliGemma burðarvirkið, og hliðið fyrir framan það

PaliGemma (arXiv 2407.07726) er SigLIP-So400m sjónkóðari á Gemma-2B tungumálamódeli, um 3B færibreytur. Pi0.5 erfir táknara sinn, og sá táknari er í lokuðu geymslusvæði. Þetta er algengasta ástæðan fyrir því að fyrsta keyrsla mistekst, áður en fyrsta þjálfunarskrefið.

Samþykktu lokaða leyfið áður en þú leigir GPU

LeRobot pi05 skjölun segir það skýrt: pi0.5 notar lokaða google/paligemma-3b-pt-224 táknarann, svo samþykktu leyfi hans á Hub og keyrðu hf auth login fyrst. Aðgangur er veittur handvirkt, ekki samstundis. Slepptu því, byrjaðu á greiddri skýkeyrslu, og þú borgar fyrir pod sem getur ekki sótt táknara.

Áður en þú byrjar: gagnasafnsnið, þættir, vélbúnaður

Pi0.5 í LeRobot les LeRobot gagnasafn í v3.0 skipulagi, sem kom með lerobot 0.4.0 í október 2025: margir þættir í hverri Parquet og MP4 skrá í stað einnar skrár á hvern þátt, með mörkum í meta/episodes/ frekar en skráarnöfnum. Taktu upp með skjáborðsforritinu eða fylgdu skráðu fyrsta gagnasafnið þitt og þú hefur það.

HamurGPU minni sem þarfDæmi um GPU
Ályktunmore than 8 GBRTX 4090
Fínstilling, LoRAmore than 22.5 GBRTX 4090
Fínstilling, fullmore than 70 GBA100 80 GB or H100
Útgáfugildran sem kostar heilan dag

Pi0.5 og SmolVLA krefjast LeRobot v3.0. GR00T N1.7 og GR00T N1.5 krefjast v2.0 eða v2.1 og hrynja á v3.0 gagnasafni. Ein upptökulota getur ekki fóðrað bæði án umbreytingar, og villan segir ekki "wrong dataset version". Sjá gagnasafn hafnað: v3 krafist.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
Úr LeRobotDataset v3.0 skjölunum.

Vettvangurinn krefst að minnsta kosti 50 þátta fyrir Pi0.5, sama lágmark og fyrir GR00T og ACT. Forþjálfun sér um erfiðasta verkið, svo 50 hreinir þættir eru betri en 200 slakir. Nýr í þessu? Byrjaðu á leiðbeiningunum um gagnasöfnun.

AY-Robots stefnusíðan sem ber saman fimm þjálfanlegar stefnur eftir færibreytum, GPU flokki, leynd og lágmarksþáttum.
Pi0.5 er í A100 og H100 flokki með 485 ms á hvert aðgerðarskref, með 50 þátta lágmarki.

Leið A: fínstilla með openpi geymslunni

Viðmiðunarútfærslan: JAX fyrst, prófuð eingöngu á Ubuntu 22.04, knúin áfram af stillingahlutum frekar en flöggum. PyTorch leið kom í september 2025, staðfest á LIBERO. Þrjú skref: umbreyta gögnunum þínum, skilgreina stillingu, þjálfa og þjóna.

  1. 1
    Klóna og setja upp

    openpi notar uv. GIT_LFS_SKIP_SMUDGE er það sem gerir LeRobot kleift að koma inn sem háð án LFS-kubba.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Umbreyta gögnunum þínum í LeRobot gagnasafn

    Uppstreymið sendir með breytir fyrir LIBERO og DROID og gerir ráð fyrir að þú aðlagir einn. Verkið er lykilkortlagningin.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Bæta við þjálfunarstillingu

    Stillingar eru TrainConfig færslur í src/openpi/training/config.py. Þessi aðlagar pi05_droid_finetune, með þyngdarhleðslunni beint á pi05_base.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Reikna staðlaðar tölfræði

    Keyrir gegn stillingarnafninu, ekki gagnasafninu. Að sleppa því er klassíska fyrsta bilunin hér.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Þjálfa

    Breytan leyfir JAX að nota 90 prósent af GPU minni í stað sjálfgefna 75. Á 80 GB korti ræður það því hvort keyrslan lifir af.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Þjóna því

    Þjónninn hlustar á port 8000 og svarar athugunarfyrirspurnum; keyrslutími vélmennisins þíns er biðlarinn.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch leiðin er ekki JAX leiðin

openpi's PyTorch útfærsla styður ekki pi0-FAST, blandaða nákvæmni, FSDP, LoRA eða EMA þyngdir, svo LoRA sem nær 22.5 GB er eingöngu JAX, í gegnum gemma_2b_lora og gemma_300m_lora afbrigðin. Verra: uppsetningin afritar plástraðar skrár yfir uppsettu transformers 4.53.2, og README varar við því að með sjálfgefnum hardlink ham uv breytir þetta transformers varanlega í uv skyndiminni og getur lekið inn í önnur verkefni. Hættu við þetta með uv cache clean transformers.

Leið B: fínstilla með lerobot pi05

LeRobot portið umvefur sömu þyngdir í CLI sem þú notar nú þegar fyrir ACT og SmolVLA. Allt hér að neðan var athugað gegn lerobot 0.6.1, útgáfunni frá 3. ágúst 2026, og pi05 skjölunum þann 23. ágúst 2026. Útgáfur skipta máli hér: v3.0 gagnasöfn komu með 0.4.0 í október 2025, 0.5.0 bloggið frá 9. mars 2026 kynnir pi0-FAST og Real-Time Chunking, og 0.6.0 þann 6. júlí 2026 gerði grunn pakkann léttan og færði útfærslu yfir í lerobot-rollout.

Eitt hreyfðist ekki: lerobot-train og lerobot-record voru nú þegar inngangspunktar í 0.3.2, ágúst 2025. Kennsla sem enn kallar á python -m lerobot.scripts.train er frá því fyrir ári af breytingum og er þess virði að vantreysta á restinni líka.

  1. 1
    Setja upp með réttum viðbótum

    Frá og með 0.6.0 inniheldur grunnuppsetningin aðeins kjarna ML-háðir, og pi-viðbótin bætir ekki við neinum gagnasafns- eða þjálfunarkóða, svo fínstilling þarf einnig þjálfunarviðbótina. Eldri einfaldar skipanir mistakast hér við innflutning.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Auðkenna

    Samþykktu paligemma-3b-pt-224 leyfið í vafra, skráðu þig síðan inn á tölvunni sem þjálfar.

    bash
    hf auth login
  3. 3
    Bæta við kvartíl-tölfræði

    Pi0.5 staðlar STATE og ACTION með kvartílum, svo meta/stats.json þarf q01 og q99. Eldri gagnasöfn innihalda aðeins min, max, mean, std.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    Fínstilla frá lerobot/pi05_base

    Stilltu stærð lotunnar eftir því hvað kortið þitt þolir; skjölun notar 64 á LIBERO með 80 GB. Sendu bfloat16 skýrt, sjálfgefið í stillingum er float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Keyra það á arminum

    Í 0.6.x er þetta lerobot-rollout: lerobot-record neitar stefnu og hafnar eval_ gagnasafnsnöfnum. Base stýrir arminum, sentry skráir útfærsluna.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
FániHvað það gerirAthugasemd
--policy.type=pi05velur Pi0.5nauðsynlegt með pretrained_path, sleppa með --policy.path
--policy.pretrained_pathhleður aðeins þyngdumeiginleikanöfn úr gagnasafninu þínu, geymdar stillingar endurstilltar
--policy.pathþyngdir auk checkpoint config.jsongeymdar stillingar eins og n_action_steps eru erfðar
--policy.n_action_stepsskref notuð á hverja sneiðfer aftur í 50, aldrei yfir chunk_size (sjálfgefið 50)
--policy.train_expert_onlyfrystir VLM, þjálfar sérfræðinginnsjálfgefið false, minna minni, nokkur kostnaður í árangri
--policy.gradient_checkpointingendurreikna í stað þess að geyma virkjanirsjálfgefið false, fyrsta handfangið þegar keyrsla passar ekki
--peft.method_type=LORALoRA millistykki í stað fullra þyngdaþarf peft viðbótina, skjalfest dæmi er SmolVLA
--policy.rtc_training_max_delayaðgerðarforvirk skilyrðing fyrir RTCaðeins í aðalgrein, ekki í 0.6.1, verður að vera undir chunk_size
--rename_mapvarpar gagnasafnsdálkum á stefnueiginleikanauðsynlegt þegar myndavélalyklar þínir eru ólíkir
Villan sem flestar fyrstu keyrslur lenda í

Án kvartíla færðu ValueError: QUANTILES normalization mode requires q01 and q99 stats í fyrstu lotu. Endurreiknaðu tölfræðina, en niðurstaðan lendir í $HF_LEROBOT_HOME/your_dataset, ekki skyndiminni sem --dataset.repo_id les, svo þjálfaðu með --dataset.root sem vísar þangað eða ýttu á Hub. Eða slepptu kvartílum með --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', eins og LIBERO viðmiðunarskipunin gerir.

Þrjú sett af sjálfgefnum gildum, og hver þeirra ná til þjálfarans

TrainConfig frá openpi er viðmiðið, PI05Config frá LeRobot er það sem lerobot-train notar þegar ekkert er gefið upp, og eyðublaðið hér sendir þriðja settið. Það sem kemur á óvart er námshraðinn: báðar sjálfgefnu stillingarnar ná hámarki í 2.5e-5, á meðan pi05_libero stilling openpi sjálfs og þessi vettvangur hækka hann í 5e-5.

Stillingopenpi TrainConfiglerobot pi05 og lerobot-trainAY-Robots sendir
Lotustærð3281
Hámarks námshraði2.5e-5, kósínus hrörnunoptimizer_lr 2.5e-55e-5
Þjálfunarskref30,000100,00030,000
Athugunarpunktabil1,000 steps20,000 stepsekki í eyðublaðinu
Fræ421,000í eyðublaðinu
Aðgerðarhlutiaction_horizon 50chunk_size 50, n_action_steps 50ekki í eyðublaðinu
Þyngdar gagnagerðbfloat16float32 þar til þú sendir --policy.dtypeekki í eyðublaðinu
Hallastöflunenginn slíkur hnappur, fsdp_devices í staðinnfjarverandi í öllum útgáfum hingað til16, og því er sleppt

Er útfærslan trú? LeRobot teymið fínstillti LIBERO grunnlíkanið í 6k skrefum til viðbótar og bar saman við viðmiðunartölur openpi á fjórum sviðum: 97.5 prósent að meðaltali á móti 96.85, á undan á Libero 10, á eftir á Spatial. Leiðin er val á verkfærum, ekki gæðum.

Fínstilling Pi0.5 á eigin gögnum
Kostir
  • Meira en 10,000 klukkustundir af forþjálfun vélmenna að baki, svo 50 þættir af verkefni þínu geta verið nóg.
  • Samfelldar aðgerðir: enginn táknari til að stilla, engin sundurgreiningarþröskuldur á liðhornunum þínum.
  • LeRobot útfærslan skorar 97.5 prósent að meðaltali á LIBERO á móti 96.85 hjá openpi, svo vinalegri CLI kostar ekkert mælanlegt.
  • Færibreytuvænar leiðir á báðum hliðum: JAX LoRA afbrigði openpi, PEFT samþætting LeRobot.
Málamiðlanir
  • Full fínstilling þarf meira en 70 GB. 22.5 GB LoRA talan er JAX tala openpi; engin er gefin út fyrir pi05 undir PEFT.
  • 485 ms per action step, hægast af þeim fimm hér: tvisvar sinnum SmolVLA, tuttugu og fjórum sinnum ACT.
  • LeRobot v3.0 er nauðsynlegt, svo gagnasafn sem skráð er fyrir GR00T keyrslu þarf að breyta, og öfugt.
  • Nýir valkostir lenda fyrst á main: RTC og MEM minni á þjálfunartíma eru ekki í 0.6.1, svo nýjustu skjöl geta þýtt uppsetningu frá git.

Raunveruleikinn 485 ms, og hvar hann hættir að vera nothæfur

Þetta ræður verkefni þínu, svo það kemur á undan kostnaðartöflunni. Töf á á hverju aðgerðarskrefi mæld hér fyrir Pi0.5 er 485 ms. Í samanburði við hin fjögur:

StefnaÁlyktun á aðgerðarskrefiFæribreyturGPU flokkurLágmarksþættir
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots samanburðarsíðan fyrir GR00T N1.7 á móti Pi0.5, með færibreytum, GPU flokki, töf og gagnasniði
Sami GPU flokkur, sama lágmarksfjöldi þátta, mismunandi útgáfa af gagnasafni, þrefaldur munur á töf.
Ályktun verður að vera við hliðina á servóunum

Stýrilásinn yfir þessi fimm módel keyrir 20 til 485 ms á hvert aðgerðarskref. Hringferðir um almennt internet ofan á 485 ms breyta virkri stefnu í hikandi. Fjarlæg ályktun er raunhæf fyrir hæga tínslu og staðsetningu, ekki fyrir hraðvirka hreyfingu. Við viljum frekar segja það en að selja kynningu sem virkar aðeins á staðarneti. Ef armurinn þinn stoppar á milli bita, byrjaðu á stefna frýs í miðri hreyfingu.

Uppstreymi hefur svar, og helmingur þess er nú þegar í útgáfunni sem þú getur sett upp. Rauntíma bútun (Real-Time Chunking) býr til næsta bút á meðan armurinn er enn að framkvæma þann núverandi, leiðir síðan skarast skref nýja bútsins til að halda sér nálægt þeim hluta sem þegar hefur verið framkvæmdur, svo armurinn stöðvast ekki eða kippist við samskeytin. Ályktunartímaformið sem fylgdi með í 0.4.2 breytingaskránni fyrir Pi0, Pi0.5 og SmolVLA og er útfærslufáni, ekki endurþjálfun:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon er hversu mörg skref af fyrri bútnum sá nýi þarf að samræmast; RTC skjöl gefa 8 til 12 sem venjulegt svið. Sjálfgefinn ályktunarbakendi er --inference.type=sync.

Það gerir módelið ekki hraðvirkara. Það felur bilið: 485 ms eru enn notaðar, en utan mikilvægrar leiðar, svo biðröðin tæmist ekki á milli bita. Þjálfunartíma afbrigðið frá arXiv 2512.05964 gengur lengra: módelið lærir að skilyrða sig á hreinan aðgerðarforskeyti, svo við ályktun er skörunin harðmáluð með flæðistímastigum á hverja aðgerð í stað þess að vera leiðbeint, og leiðbeiningar afturábak ferlið hverfur. Við þjálfun tekur það sýnishorn af forskeytalengd á hvert dæmi og tekur flæðitapið á eftirstandandi eftirskeyti. Sá fáni er aðeins á aðalútgáfu, ekki í 0.6.1, og seinkunin sem þú þjálfar fyrir verður að vera undir chunk_size.

Tvær leiðir til að fá Pi0.5 geymslupunkt

Þú leigir eða átt 80 GB kort, setur upp einn af ofangreindum stakkum, umbreytir gagnasafninu þínu og fylgist með keyrslunni. Þú heldur öllum stillingum: JAX LoRA frá openpi, PEFT millistykki LeRobot, hlutfallslegar aðgerðir, sérsniðnar lyklakortanir. Þú heldur einnig öllum bilunum.

  • Vélbúnaður: A100 80 GB eða H100, eða 24 GB kort á JAX LoRA leið openpi.
  • Uppsetning: einn eftirmiðdagur fyrir fyrstu keyrslu, aðallega lyklakortun og lokaði táknarinn.
  • Ekki á hýstu formi: PEFT millistykki, hlutfallslegar aðgerðir, RTC á æfingartíma, MEM minni.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Skipunin sem ekkert hýst form keyrir, og pip getur ekki sett upp: RTC á æfingartíma er flagg á aðalgrein.

Þegar það virkar ekki

EinkenniLíklegasta orsök
Keyrsla hafnað áður en hún byrjarGagnasafn v2.1 en Pi0.5 vill v3.0, eða öfugt fyrir GR00T
ImportError, datasets pakki vantarlerobot 0.6.x án þjálfunaraukans
ValueError um q01 og q99 á fyrsta hópiEngin kvartíl í meta/stats.json; endurreikna eða nota MEAN_STD
CUDA minni uppurið í skrefi 0Full fínstilling undir 70 GB; reyndu geymslupunktun eða train_expert_only
401 eða lokuð geymsluvillaPaliGemma táknaraleyfi ekki samþykkt
Tap lækkar, vélmenni gerir ekkertÓsamræmi í stöðlun, eða stefnan afritar ástandið
Armur stoppar á milli bitaSeinkun á hvert skref auk ferðar fram og til baka; bitaröðin tæmist
Virkar í einni uppsetningu, bilar í annarriOf fáir þættir, eða allir í einni stillingu

Hvað ein keyrsla kostar

Pi0.5 er í dýra flokknum vegna þess að það þarf 80 GB kort, og verð á augnabliksmarkaði breytist, svo talan er svið frekar en verð. Fyrir mörg SO-100 verkefni, þjálfaðu SmolVLA eða ACT á 24 GB flokknum fyrst, staðfestu að verkefnið sé yfirhöfuð læranlegt, og eyðdu síðan A100 klukkustundum í það. Þjálfaðu fyrstu stefnu þína sýnir þessa ódýrari lykkju, og verðlagning sýnir núverandi flokka.

FlokkurStefnumDæmigerð keyrslaVerð á klukkustundKostnaður á keyrslu
A100 80 GB eða H100Pi0.5, GR00T N1.7, GR00T N1.53 til 6 klukkustundir1.20 til 2.00 USDum 4 til 12 USD
RTX 4090 eða hvaða 24 GB kort sem erSmolVLA, ACT2 til 5 klukkustundir0.30 til 0.60 USDum 1 til 3 USD
Kostnaðartafla AY-Robots sem sýnir hvaða GPU hver stefna þarf, dæmigerðan keyrslutíma og verð, og hversu margir þættir þarf áður en stefna er nothæf.
Sömu tvö stigin á vörusíðunni: Pi0.5 leigir 80 GB kortið, SmolVLA og ACT passa á 4090.

Áður en kvöldi er varið: og sýna sömu tölurnar hlið við hlið. geymir 85 VLA módel með 332 viðmiðunarniðurstöðum, hver tengd uppruna sínum, og bakgrunnur um fjölskylduna er í .

Þjálfa Pi0.5 án þess að byggja upp staflann

Veldu gagnasafnið og ofurbreyturnar í eyðublaði. Bakendinn leigir 80 GB kort á skyndimarkaði, keyrir þjálfarann og skrifar geymslupunkta í hlutageymslu. Leiðbeiningar fyrir SO-100, SO-101, Koch v1.1 og LeKiwi.

Opna þjálfunarleiðbeiningarnar
Get ég fínstillt Pi0.5 á RTX 4090?

Ekki full fínstilling: openpi listar meira en 70 GB fyrir það, svo A100 80 GB eða H100. 22.5 GB LoRA talan tilheyrir JAX leiðinni; PyTorch útfærslan hefur enga LoRA. PEFT samþætting LeRobot er til staðar, en skjalfest dæmi þess er SmolVLA og engin VRAM tala er gefin út fyrir pi05.

Hversu marga þætti þarf ég?

Fimmtíu, sama lágmark og GR00T og ACT; aðeins SmolVLA fer lægra, í 30. Grunngeymslupunkturinn inniheldur meira en 10.000 klukkustundir af forþjálfun, svo fínstillingin aðlagar sig frekar en lærir frá grunni: 50 hreinir, fjölbreyttir þættir eru betri en tvö hundruð úr einni stillingu.

Hver er munurinn á --policy.path og --policy.pretrained_path?

--policy.path hleður þyngdum og config.json geymslupunktsins, svo geymdar stillingar eins og n_action_steps erfast og --policy.type verður að sleppa. --policy.pretrained_path hleður aðeins þyngdum: eiginleikanöfn koma frá gagnasafninu þínu, geymdar stillingar endurstillast, --policy.type er krafist. Þess vegna sendir LIBERO skipunin n_action_steps=10 og empty_cameras=1 skýrt; annars falla þau aftur í 50 og 0.

Gefur opna útgáfan mér fulla Pi0.5 úr greininni?

Nei. Báðir styðja aðeins flæðisamsvörunar aðgerðarhausinn. Forþjálfunarstigið með stökum táknum með FAST aðgerðartáknara og háþróuð forspá undirverkefna voru ekki gefin út, og lerobot/pi05_base kortið bætir RL við þann lista þó að pi0.5 greinin lýsi engu styrkingarnámsstigi. Þú þjálfar lágt stig stefnu sem er skilyrt á tungumálsstreng sem þú gefur upp, ekki líkan sem sundurgreinir langt verkefni sjálft.

Gegn hvaða útgáfum er þessi leiðbeining skrifuð?

openpi á aðalgreininni og lerobot 0.6.1, útgáfan frá 3. ágúst 2026, báðar lesnar 23. ágúst 2026. v3.0 gagnasöfn komu með 0.4.0 í október 2025. 0.6.0 gerði grunn pakkann léttan, svo lerobot[pi] eitt og sér setur ekki lengur upp þjálfunarstafla, og færði útfærslu yfir í lerobot-rollout. RTC á þjálfunartíma er aðeins á aðalgreininni; hýsti þjálfarinn hér keyrir 0.5.1.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started