AY-Robots apmācības matrica ar piecām politikām kā rindām un četrām robotu rokām kā kolonnām, katra šūna ir saite uz konkrētu precizētas apmācības ceļvedi
Pi0.5Plūsmas saskaņošanaVLA apmācībaLeRobotPrecizēta apmācība

Kā apmācīt Pi0.5 ar saviem robota datiem

AY-Robots ResearchAugust 23, 202616 min lasīšanas

Precizēti apmāciet Pi0.5, plūsmas saskaņošanas VLA no Physical Intelligence, ar saviem robota datiem. Reālas komandas priekš openpi un lerobot pi05, datu kopas formāta slazdi, VRAM un latentuma ierobežojumi.

Pi0.5 ir modelis, ko izvēlas, ja politikai jādarbojas telpā, ko tā nekad nav redzējusi. Tas ir arī visneērtākais no piecām apmācāmām politikām šeit, lai precizētu manuāli: augšupējais repozitorijs vispirms ir JAX, LeRobot ports pārvietoja izvietošanu ārpus lerobot-record versijā 0.6.0 un padarīja bāzes instalāciju pārāk mazu apmācībai, un pilna precizēšana neietilpst 4090. Zemāk: ko plūsmas saskaņošana maksā secinājumu posmā, divi komandu maršruti un 485 ms skaitlis, kas nosaka, vai rezultāts ir izmantojams.

Kas jums jāzina

  • Plūsmas saskaņošanas VLA: 3B PaliGemma VLM plus 300M darbības eksperts, kas dekodē nepārtrauktas darbības fragmentus. Divi veidi, kā to precizēt, openpi un LeRobot pi05, ar 0.65 punktu atšķirību LIBERO vidējā rādītājā.
  • Pilnai precizēšanai nepieciešams vairāk nekā 70 GB VRAM. openpi norāda LoRA pie 22.5 GB, tikai savā JAX ceļā.
  • Datu kopai jābūt LeRobotDataset v3.0 ar q01 un q99 kvantilēm meta/stats.json, pretējā gadījumā pirmā partija radīs kļūdu.
  • Vispirms pārbaudiet savu lerobot versiju: 0.6.0 padarīja bāzes pakotni vieglu un pārvietoja izvietošanu ārpus lerobot-record.
  • Šeit tas darbojas ar 485 ms uz darbības soli, prasa 50 epizodes un maksā aptuveni 4 līdz 12 USD par vienu palaišanu.

Kas Pi0.5 patiesībā ir

Physical Intelligence publicēja pi0 2024. gada oktobrī: plūsmas saskaņošanas redzes-valodas-darbības modelis uz iepriekš apmācīta VLM: PaliGemma ar 3 miljardiem parametru plus 300M darbības eksperts, inicializēts no nulles, kopā 3.3 miljardi. Rakstā ziņots par iepriekšēju apmācību vairāk nekā 10 000 stundu robotu datu apjomā, izmantojot 7 robotu konfigurācijas un 68 uzdevumus. Vairāk pi0 rakstā.

Pi0.5 (arXiv 2504.16054, 2025. gada 22. aprīlis) saglabā šo skeletu un maina apmācības diētu: tīmekļa dati, objektu noteikšana, verbālas instrukcijas no cilvēkiem, kas apmāca robotu, apakšuzdevumu marķējumi, starp-ķermeņu dati no robotiem daudzās mājās. Rezultāts ir robots, kas tīra virtuves mājās, kuras nebija apmācības kopā. openpi README pievieno detaļu, ko nosaukums neietver: izlaistais pi0.5 tika apmācīts ar zināšanu izolāciju (arXiv 2505.23705).

Īpašībapi0pi0.5
VLM pamata variantsgemma_2b (PaliGemma)gemma_2b (PaliGemma)
Darbības eksperta variantsgemma_300mgemma_300m
action_dim3232
action_horizon default5050
max_token_len48200
diskrēta stāvokļa ievadefalsetrue, stāvoklis diskretizēts segmentos uzvednē
Bāzes kontrolpunktsgs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Kas ir publiski, nav viss raksts

openpi README ir skaidrs: repozitorijs atbalsta tikai plūsmas saskaņošanas galvu (flow matching head) gan pi0.5 apmācībai, gan secinājumiem. Raksts apraksta divas stadijas, un kods ietver tikai otro: pirmsapmācība attēlo katru darbību kā diskrētus marķierus, izmantojot FAST tokenizatoru, un izvietošanas laikā modelis secina augsta līmeņa apakšuzdevumu pirms katras darbības daļas. Neviens no tiem nav repozitorijā. The lerobot/pi05_base karte sniedz to pašu sarakstu un pievieno RL, lai gan pi0.5 raksts vispār neapraksta nekādu pastiprinātas mācīšanās stadiju. The LeRobot ports pārmanto šo darbības jomu, tāpat kā katrs tajā mitinātais apmācītājs, ieskaitot šeit esošo. Licencēšana arī ir sadalīta: pi05 dokumentācijas lapa norāda Apache 2.0, the lerobot/pi05_base karte ir marķēta ar license: gemma.

Ko plūsmas saskaņošana maina apmācībā un secinājumos

A politika ko var apmācīt uz SO-100, vai nu tieši regresē darbības (ACT) vai tokenizē tās un dekodē autoregresīvi (pi0-FAST). Plūsmas saskaņošana nedara nevienu no šiem: tā iemācās vektoru lauku, kas transportē troksni uz tīru darbību bloku, pēc tam to integrē. pi0 rakstā tiek izmantoti 10 integrācijas soļi ar soļa lielumu 0.1; LeRobot pi05 konfigurācija satur to pašu num_inference_steps: int = 10.

  • Apmācība: zudums regresē trokšņainu darbību bloku. Nav jāpielāgo tokenizators, nav jādiskretizē jūsu locītavu leņķi.
  • Secinājums: viens bloks maksā desmit pārejas caur darbības ekspertu. Tas ir strukturāli, nevis pielāgošanas problēma.
  • Izvade: nepārtrauktas darbības ar 32 dimensijām, iekšēji polsterētas, zudums tiek ņemts no robota dimensijām. 6-DoF roka plus satvērējs izmanto 7.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
Lasīts no src/openpi/models/pi0_config.py openpi galvenajā zarā, 2026. gada 23. augustā.

PaliGemma mugurkauls un vārti tā priekšā

PaliGemma (arXiv 2407.07726) ir SigLIP-So400m redzes kodētājs uz Gemma-2B valodu modeļa, aptuveni 3B parametri. Pi0.5 manto savu tokenizatoru, un šis tokenizators atrodas slēgtā repozitorijā. Tas ir visbiežākais veids, kā pirmais izpildījums beidzas neveiksmīgi, pirms pirmā apmācības soļa.

Pieņemiet slēgto licenci pirms GPU nomas

LeRobot pi05 dokumentācija to skaidri norāda: pi0.5 izmanto slēgto google/paligemma-3b-pt-224 tokenizatoru, tāpēc vispirms pieņemiet tā licenci Hub un palaidiet hf auth login. Piekļuve tiek piešķirta manuāli, nevis uzreiz. Izlaidiet to, sāciet maksas mākoņpakalpojuma izpildījumu, un jūs maksāsiet par podu, kas nevar lejupielādēt tokenizatoru.

Pirms sākat: datu kopas formāts, epizodes, aparatūra

Pi0.5 LeRobot lasa LeRobot datu kopu v3.0 izkārtojumā, kas parādījās ar lerobot 0.4.0 2025. gada oktobrī: daudzas epizodes katrā Parquet un MP4 failā, nevis viens fails katrai epizodei, ar robežām meta/episodes/ nevis failu nosaukumos. Ierakstiet ar darbvirsmas klientu vai sekojiet ierakstiet savu pirmo datu kopu un jums tas būs.

RežīmsNepieciešamā GPU atmiņaPiemērs GPU
Secinājumimore than 8 GBRTX 4090
Precizēšana, LoRAmore than 22.5 GBRTX 4090
Precizēšana, pilnamore than 70 GBA100 80 GB or H100
Versijas slazds, kas maksā dienu

Pi0.5 un SmolVLA vēlas LeRobot v3.0. GR00T N1.7 un GR00T N1.5 vēlas v2.0 vai v2.1 un avarē ar v3.0 datu kopu. Viena ierakstīšanas sesija nevar nodrošināt abas bez konversijas, un kļūda nesaka "nepareiza datu kopas versija". Skatīt datu kopa noraidīta: nepieciešama v3.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
No LeRobotDataset v3.0 dokumentācijas.

Platforma vēlas vismaz 50 epizodes Pi0.5, tas pats minimums kā GR00T un ACT. Pirmapmācība veic lielāko darbu, tāpēc 50 tīras epizodes ir labākas par 200 paviršām. Jauns šajā jomā? Sāciet ar datu vākšanas ceļvedi.

AY-Robots politiku lapa, kas salīdzina piecas apmācāmās politikas pēc parametriem, GPU līmeņa, latentuma un minimālā epizožu skaita.
Pi0.5 atrodas A100 un H100 līmenī ar 485 ms par darbības soli, ar minimālo 50 epizožu slieksni.

A maršruts: precizēšana ar openpi repozitoriju

Atsauces implementācija: vispirms JAX, testēta tikai uz Ubuntu 22.04, vadīta ar konfigurācijas objektiem, nevis karodziņiem. PyTorch ceļš parādījās 2025. gada septembrī, validēts uz LIBERO. Trīs soļi: konvertējiet savus datus, definējiet konfigurāciju, apmāciet un apkalpojiet.

  1. 1
    Klonēt un instalēt

    openpi izmanto uv. GIT_LFS_SKIP_SMUDGE ir tas, kas ļauj LeRobot ienākt kā atkarībai bez LFS binārajiem objektiem.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Konvertējiet savus datus uz LeRobot datu kopu

    Augšpusē tiek piegādāti konvertētāji LIBERO un DROID un tiek sagaidīts, ka jūs pielāgosiet vienu. Darbs ir atslēgu kartēšana.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Pievienot apmācības konfigurāciju

    Konfigurācijas ir TrainConfig ieraksti src/openpi/training/config.py. Šis pielāgo pi05_droid_finetune, ar svara ielādētāju, kas norādīts uz pi05_base.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Aprēķināt normēšanas statistiku

    Darbojas pret konfigurācijas nosaukumu, nevis datu kopu. Tā izlaišana ir klasiska pirmā kļūda šeit.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Apmācīt

    Šis mainīgais ļauj JAX izmantot 90 procentus GPU atmiņas, nevis noklusējuma 75. Uz 80 GB kartes tas nosaka, vai izpilde izdzīvos.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Apkalpot

    Serveris klausās uz portu 8000 un atbild uz novērojumu vaicājumiem; jūsu robota izpildlaiks ir klients.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch ceļš nav JAX ceļš

openpi PyTorch implementācija neatbalsta pi0-FAST, jauktu precizitāti, FSDP, LoRA vai EMA svarus, tāpēc LoRA, kas sasniedz 22.5 GB, ir pieejama tikai JAX, izmantojot gemma_2b_lora un gemma_300m_lora variantus. Vēl ļaunāk: iestatīšana kopē labotus failus virs jūsu instalētā transformers 4.53.2, un README brīdina, ka ar uv noklusējuma cieto saišu režīmu tas neatgriezeniski modificē transformers uv kešatmiņā un var noplūst citos projektos. Atsauciet to ar uv cache clean transformers.

B maršruts: precizēt ar lerobot pi05

LeRobot ports ietver tos pašus svarus CLI, ko jau izmantojat priekš ACT un SmolVLA. Viss zemāk minētais tika pārbaudīts ar lerobot 0.6.1, izlaidumu kopš 2026. gada 3. augusta, un pi05 dokumentāciju 2026. gada 23. augustā. Versijām šeit ir nozīme: v3.0 datu kopas parādījās ar 0.4.0 2025. gada oktobrī, 0.5.0 emuārs 2026. gada 9. martā iepazīstina ar pi0-FAST un Real-Time Chunking, un 0.6.0 2026. gada 6. jūlijā padarīja bāzes pakotni vieglu un pārcēla izvietošanu uz lerobot-rollout.

Viena lieta nemainījās: lerobot-train un lerobot-record jau bija ieejas punkti 0.3.2 versijā, 2025. gada augustā. Apmācība, kas joprojām izsauc python -m lerobot.scripts.train ir pirms gada izmaiņām un ir vērts neuzticēties arī pārējam.

  1. 1
    Instalēt ar pareizajiem papildinājumiem

    Kopš 0.6.0 pamata instalācija ietver tikai galvenās ML atkarības, un `pi` papildinājums nepievieno datu kopas vai apmācības kodu, tāpēc precizēšanai ir nepieciešams arī apmācības papildinājums. Vecākas vienrindas komandas šeit neizdodas importēšanas laikā.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Autentificēties

    Pārlūkprogrammā pieņemiet paligemma-3b-pt-224 licenci, pēc tam piesakieties mašīnā, kas veic apmācību.

    bash
    hf auth login
  3. 3
    Pievienot kvantiļu statistiku

    Pi0.5 normalizē STATE un ACTION ar kvantilēm, tāpēc meta/stats.json ir nepieciešami q01 un q99. Vecākas datu kopas satur tikai min, max, mean, std.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    Precizēt no lerobot/pi05_base

    Iestatiet pakešu izmēru atbilstoši tam, ko jūsu karte spēj apstrādāt; dokumentācijā tiek izmantots 64 uz LIBERO ar 80 GB. Eksplicīti norādiet bfloat16, konfigurācijas noklusējums ir float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Palaist to uz rokas

    Versijā 0.6.x tas ir lerobot-rollout: lerobot-record atsakās no politikas un noraida `eval_` datu kopu nosaukumus. `Base` vada robotu roku, `sentry` ieraksta izpildi.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
FlagWhat it doesNote
--policy.type=pi05atlasa Pi0.5nepieciešams ar pretrained_path, izlaist ar --policy.path
--policy.pretrained_pathielādē tikai svarusiezīmju nosaukumi no jūsu datu kopas, saglabātie iestatījumi tiek atiestatīti
--policy.pathsvari plus kontrolpunkta config.jsonsaglabātie iestatījumi, piemēram, n_action_steps, tiek pārmantoti
--policy.n_action_stepssoļi, kas patērēti vienā gabalāatgriežas pie 50, nekad nepārsniedz chunk_size (noklusējums 50)
--policy.train_expert_onlyiesaldē VLM, apmāca ekspertunoklusējums false, mazāk atmiņas, zināmas izmaksas veiksmes ziņā
--policy.gradient_checkpointingpārrēķināt, nevis saglabāt aktivizācijasnoklusējums false, pirmais svira, ja izpilde neietilpst
--peft.method_type=LORALoRA adapteri pilnu svaru vietānepieciešams peft papildinājums, dokumentētais piemērs ir SmolVLA
--policy.rtc_training_max_delaydarbības prefiksa kondicionēšana RTCtikai galvenajā zarā, nav 0.6.1 versijā, jāpaliek zem chunk_size
--rename_mapkartē datu kopas kolonnas uz politikas iezīmēmnepieciešams, ja jūsu kameras atslēgas atšķiras
Kļūda, ar ko saskaras lielākā daļa pirmo palaišanu

Bez kvantilēm jūs saņemsiet ValueError: QUANTILES normalization mode requires q01 and q99 stats pirmajā paketē. Pārrēķiniet statistiku, taču rezultāts nonāks $HF_LEROBOT_HOME/your_dataset, nevis kešatmiņā, ko nolasa --dataset.repo_id, tāpēc apmāciet ar --dataset.root, kas norāda uz šo vietu, vai augšupielādējiet uz Hub. Vai arī izlaidiet kvantiles ar --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kā to dara LIBERO atsauces komanda.

Trīs noklusējuma iestatījumu kopas un kuras no tām sasniedz apmācītāju

openpi TrainConfig ir atsauce, LeRobot PI05Config ir tas, ko lerobot-train izmanto, ja neko nesakāt, un šeit esošā forma nosūta trešo kopu. Pārsteigums ir mācīšanās ātrums: abas augšupējās noklusējuma vērtības sasniedz 2.5e-5, savukārt openpi paša pi05_libero konfigurācija un šī platforma to paaugstina līdz 5e-5.

Iestatījumsopenpi TrainConfiglerobot pi05 un lerobot-trainAY-Robots nosūta
Pakešu izmērs3281
Maksimālais mācīšanās ātrums2.5e-5, kosinusa samazinājumsoptimizer_lr 2.5e-55e-5
Apmācības soļi30,000100,00030,000
Kontrolpunkta intervāls1,000 soļi20,000 soļinav formā
Sēkla421,000formā
Darbības bloksaction_horizon 50chunk_size 50, n_action_steps 50nav formā
Svara datu tipsbfloat16float32 until you pass --policy.dtypenav formā
Gradientu akumulācijanav tāda regulētāja, tā vietā fsdp_devicesabsent from every release so far16, un tas tiek atmests

Vai ports ir uzticams? LeRobot komanda precizēja LIBERO bāzes modeli vēl 6k soļus un salīdzināja ar openpi atsauces skaitļiem četrās komplektās: 97.5 procentu vidējais pret 96.85, priekšā Libero 10, atpaliek Spatial. Maršruts ir rīku izvēle, nevis kvalitātes izvēle.

Pi0.5 precizēšana ar jūsu pašu datiem
Priekšrocības
  • Vairāk nekā 10,000 stundu robotu iepriekšējas apmācības, tāpēc 50 jūsu uzdevuma epizodes var būt pietiekamas.
  • Nepārtrauktas darbības: nav jāpielāgo tokenizators, nav diskretizācijas ierobežojuma jūsu locītavu leņķiem.
  • LeRobot ports iegūst 97.5 procentus LIBERO vidējā rādītājā pret openpi 96.85, tāpēc draudzīgākais CLI nemaksā neko mērāmu.
  • Parametru efektīvi ceļi abās pusēs: openpi JAX LoRA varianti, LeRobot PEFT integrācija.
Kompromisi
  • Pilnai precizēšanai nepieciešami vairāk nekā 70 GB. 22.5 GB LoRA skaitlis ir openpi JAX skaitlis; neviens nav publicēts pi05 zem PEFT.
  • 485 ms uz darbības soli, lēnākais no pieciem šeit: divreiz SmolVLA, divdesmit četras reizes ACT.
  • Nepieciešams LeRobot v3.0, tāpēc datu kopa, kas ierakstīta GR00T palaišanai, ir jākonvertē, un otrādi.
  • Jaunas opcijas vispirms nonāk galvenajā zarā: apmācības laika RTC un MEM atmiņa nav 0.6.1 versijā, tāpēc jaunākā dokumentācija var nozīmēt instalēšanu no git.

485 ms realitāte un tas, kur tā kļūst nelietojama

Tas nosaka jūsu projektu, tāpēc tas ir pirms izmaksu tabulas. uz darbības soli, kas šeit izmērīts Pi0.5, ir 485 ms. Salīdzinājumā ar pārējiem četriem:

PolitikaSecinājums uz darbības soliParametriGPU līmenisMinimālais epizožu skaits
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots salīdzinājuma lapa GR00T N1.7 pret Pi0.5, ar parametriem, GPU līmeni, latentumu un datu kopas formātu
Viens un tas pats GPU līmenis, viens un tas pats epizožu minimums, atšķirīga datu kopas versija, trīskārša latentuma atšķirība.
Secinājumiem jāatrodas blakus servomotoriem

Vadības cikls šajos piecos modeļos ilgst no 20 līdz 485 ms uz vienu darbības soli. Publiskā interneta datu apmaiņas laiks, kas pārsniedz 485 ms, pārvērš strādājošu politiku par svārstīgu. Attālā secināšana ir piemērota lēnai paņemšanas un novietošanas darbībai, nevis ātrai reaktīvai kustībai. Mēs labāk to pateiktu, nekā pārdotu demonstrāciju, kas darbojas tikai lokālajā tīklā. Ja jūsu roka apstājas starp fragmentiem, sāciet ar politikas apstāšanos kustības vidū.

Augšupējā plūsma piedāvā risinājumu, un puse no tā jau ir pieejama izlaidumā, ko varat instalēt. Reāllaika sadalīšana fragmentos (Real-Time Chunking) ģenerē nākamo fragmentu, kamēr roka vēl izpilda pašreizējo, un pēc tam vada jaunā fragmenta pārklājošos soļus, lai tie paliktu tuvu jau izpildītajai daļai, tādējādi roka neapstājas un neraustās savienojuma vietā. Secināšanas laika forma, kas iekļauta 0.4.2 izmaiņu žurnālā Pi0, Pi0.5 un SmolVLA, ir izvēršanas karogs, nevis atkārtota apmācība:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon norāda, cik soļiem no iepriekšējā fragmenta jaunajam ir jāsakrīt; RTC dokumentācija norāda 8 līdz 12 kā parasto diapazonu. Noklusējuma secināšanas aizmugursistēma ir --inference.type=sync.

Tas nepadara modeli ātrāku. Tas paslēpj atstarpi: 485 ms joprojām tiek patērētas, bet ārpus kritiskā ceļa, lai rinda neiztukšotos starp fragmentiem. Apmācības laika variants no arXiv 2512.05964 iet vēl tālāk: modelis iemācās nosacīt tīru darbības prefiksu, tāpēc secināšanas laikā pārklājums tiek stingri iekrāsots ar katras darbības plūsmas laika soļiem, nevis vadīts, un vadības atpakaļejošā pāreja pazūd. Apmācības laikā tas paraugo prefiksa garumu katram piemēram un aprēķina plūsmas zudumu atlikušajai pēcfiksai. Šis karogs ir pieejams tikai galvenajā versijā, nevis 0.6.1, un apmācības aizkavei ir jāpaliek zem chunk_size.

Divi veidi, kā iegūt Pi0.5 kontrolpunktu

Jūs nomājat vai jums pieder 80 GB karte, instalējat vienu no iepriekš minētajām programmatūras pakotnēm, konvertējat savu datu kopu un uzraugāt izpildi. Jūs saglabājat visas vadības iespējas: openpi JAX LoRA, LeRobot PEFT adapterus, relatīvās darbības, pielāgotas taustiņu kartēšanas. Jūs saglabājat arī visas kļūdas.

  • Aparatūra: A100 80 GB vai H100, vai 24 GB karte openpi JAX LoRA ceļā.
  • Iestatīšana: pēcpusdiena pirmajai izpildei, galvenokārt taustiņu kartēšana un vārtu tokenizators.
  • Nav pieejams mitinātajā formā: PEFT adapteri, relatīvās darbības, apmācības laika RTC, MEM atmiņa.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Komanda, ko neizpilda neviena mitinātā forma, un pip nevar instalēt: apmācības laika RTC ir galvenās atzara karodziņš.

Kad tas nedarbojas

SimptomsVisvairāk iespējamais cēlonis
Izpilde noraidīta pirms sākumaDatu kopa v2.1, bet Pi0.5 vēlas v3.0, vai otrādi GR00T gadījumā
ImportError, trūkst datasets pakotneslerobot 0.6.x bez apmācības papildinājuma
ValueError par q01 un q99 pirmajā paketēNav kvantiļu meta/stats.json; pārrēķiniet vai izmantojiet MEAN_STD
CUDA atmiņas trūkums 0. solīPilna precizēšana zem 70 GB; mēģiniet kontrolpunktu vai train_expert_only
401 vai ierobežotas repozitorija kļūdaPaliGemma tokenizatora licence nav pieņemta
Zaudējumi krītas, robots neko nedaraNormalizācijas neatbilstība, vai politika kopē stāvokli
Roka apstājas starp fragmentiemLatentums uz soli plus turp un atpakaļ ceļš; fragmentu rinda iztukšojas
Darbojas vienā iestatījumā, neizdodas citāPārāk maz epizožu, vai visas vienā konfigurācijā

Cik maksā viens izpildes cikls

Pi0.5 atrodas dārgajā līmenī, jo tam nepieciešama 80 GB karte, un spot cenas mainās, tāpēc skaitlis ir diapazons, nevis precīza cena. Daudziem SO-100 uzdevumiem vispirms apmāciet SmolVLA vai ACT 24 GB līmenī, vispirms pārliecinieties, ka uzdevums vispār ir apgūstams, un tikai tad tērējiet tam A100 stundas. Apmāciet savu pirmo politiku izskaidro šo lētāko ciklu, un cenrādis satur pašreizējos līmeņus.

LīmenisPolitikasTipisks izpildes ciklsCena par stunduIzmaksas par izpildes ciklu
A100 80 GB vai H100Pi0.5, GR00T N1.7, GR00T N1.53 to 6 hours1.20 to 2.00 USDabout 4 to 12 USD
RTX 4090 vai jebkura 24 GB karteSmolVLA, ACT2 to 5 hours0.30 to 0.60 USDabout 1 to 3 USD
AY-Robots izmaksu tabula, kas parāda, kurš GPU ir nepieciešams katrai politikai, tipisko izpildes laiku un cenu, un cik daudz epizožu ir nepieciešams, pirms politika kļūst noderīga
Tās pašas divas pakāpes produkta lapā: Pi0.5 nomā 80 GB karti, SmolVLA un ACT der uz 4090.

Pirms veltīt vakaru: un salīdzina tos pašus skaitļus. satur 85 VLA modeļus ar 332 etalonu rezultātiem, katrs ir saistīts ar savu avotu, un informācija par saimi ir atrodama .

Apmāciet Pi0.5, neveidojot sistēmu

Izvēlieties datu kopu un hiperparametrus veidlapā. Aizmugursistēma nomā 80 GB karti tūlītējā tirgū, palaiž apmācītāju un ieraksta kontrolpunktus objektu krātuvē. Ceļveži SO-100, SO-101, Koch v1.1 un LeKiwi.

Atvērt apmācības ceļvežus
Vai es varu precizēt Pi0.5 uz RTX 4090?

Nav pilna precizēšana: openpi tam norāda vairāk nekā 70 GB, tātad A100 80 GB vai H100. Tā 22.5 GB LoRA rādītājs pieder JAX ceļam; PyTorch implementācijai nav LoRA. LeRobot PEFT integrācija pastāv, taču tās dokumentētais piemērs ir SmolVLA, un pi05 nav publicēts VRAM rādītājs.

Cik daudz epizožu man ir nepieciešams?

Piecdesmit, tas pats minimums kā GR00T un ACT; tikai SmolVLA ir zemāks, 30. Bāzes kontrolpunkts satur vairāk nekā 10 000 stundu iepriekšējas apmācības, tāpēc precizēšana pielāgojas, nevis mācās no nulles: 50 tīras, daudzveidīgas epizodes pārspēj divsimt no vienas konfigurācijas.

Kāda ir atšķirība starp --policy.path un --policy.pretrained_path?

--policy.path ielādē svarus un kontrolpunkta config.json, tāpēc saglabātie iestatījumi, piemēram, n_action_steps, tiek mantoti, un --policy.type ir jāizlaiž. --policy.pretrained_path ielādē tikai svarus: funkciju nosaukumi nāk no jūsu datu kopas, saglabātie iestatījumi tiek atiestatīti, --policy.type ir obligāts. Tāpēc LIBERO komanda skaidri nodod n_action_steps=10 un empty_cameras=1; pretējā gadījumā tie atgriežas pie 50 un 0.

Vai atvērtā versija dod man pilnu Pi0.5 no raksta?

Nē. Abi atbalsta tikai plūsmas saskaņošanas darbības galvu. Diskrēto marķieru iepriekšējas apmācības posms ar FAST darbības marķierizētāju un augsta līmeņa apakšuzdevumu prognozēšana netika izlaista, un lerobot/pi05_base karte pievieno RL šim sarakstam, lai gan pi0.5 rakstā nav aprakstīts pastiprinātas mācīšanās posms. Jūs apmācāt zema līmeņa politiku, kas ir atkarīga no jūsu nodrošinātās valodas virknes, nevis modeli, kas pats sadala garu uzdevumu.

Pret kurām versijām ir rakstīts šis ceļvedis?

openpi galvenajā un lerobot 0.6.1, izlaidums kopš 2026. gada 3. augusta, abi lasīti 2026. gada 23. augustā. v3.0 datu kopas ieradās ar 0.4.0 2025. gada oktobrī. 0.6.0 padarīja bāzes pakotni vieglu, tāpēc lerobot[pi] vairs neinstalē apmācības sistēmu, un pārvietoja izvietošanu uz lerobot-rollout. Apmācības laika RTC ir tikai galvenajā; šeit mitinātais apmācītājs darbojas ar 0.5.1.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started