
Precizēti apmāciet Pi0.5, plūsmas saskaņošanas VLA no Physical Intelligence, ar saviem robota datiem. Reālas komandas priekš openpi un lerobot pi05, datu kopas formāta slazdi, VRAM un latentuma ierobežojumi.
Pi0.5 ir modelis, ko izvēlas, ja politikai jādarbojas telpā, ko tā nekad nav redzējusi. Tas ir arī visneērtākais no piecām apmācāmām politikām šeit, lai precizētu manuāli: augšupējais repozitorijs vispirms ir JAX, LeRobot ports pārvietoja izvietošanu ārpus lerobot-record versijā 0.6.0 un padarīja bāzes instalāciju pārāk mazu apmācībai, un pilna precizēšana neietilpst 4090. Zemāk: ko plūsmas saskaņošana maksā secinājumu posmā, divi komandu maršruti un 485 ms skaitlis, kas nosaka, vai rezultāts ir izmantojams.
Kas jums jāzina
- •Plūsmas saskaņošanas VLA: 3B PaliGemma VLM plus 300M darbības eksperts, kas dekodē nepārtrauktas darbības fragmentus. Divi veidi, kā to precizēt, openpi un LeRobot pi05, ar 0.65 punktu atšķirību LIBERO vidējā rādītājā.
- •Pilnai precizēšanai nepieciešams vairāk nekā 70 GB VRAM. openpi norāda LoRA pie 22.5 GB, tikai savā JAX ceļā.
- •Datu kopai jābūt LeRobotDataset v3.0 ar q01 un q99 kvantilēm meta/stats.json, pretējā gadījumā pirmā partija radīs kļūdu.
- •Vispirms pārbaudiet savu lerobot versiju: 0.6.0 padarīja bāzes pakotni vieglu un pārvietoja izvietošanu ārpus lerobot-record.
- •Šeit tas darbojas ar 485 ms uz darbības soli, prasa 50 epizodes un maksā aptuveni 4 līdz 12 USD par vienu palaišanu.
Kas Pi0.5 patiesībā ir
Physical Intelligence publicēja pi0 2024. gada oktobrī: plūsmas saskaņošanas redzes-valodas-darbības modelis uz iepriekš apmācīta VLM: PaliGemma ar 3 miljardiem parametru plus 300M darbības eksperts, inicializēts no nulles, kopā 3.3 miljardi. Rakstā ziņots par iepriekšēju apmācību vairāk nekā 10 000 stundu robotu datu apjomā, izmantojot 7 robotu konfigurācijas un 68 uzdevumus. Vairāk pi0 rakstā.
Pi0.5 (arXiv 2504.16054, 2025. gada 22. aprīlis) saglabā šo skeletu un maina apmācības diētu: tīmekļa dati, objektu noteikšana, verbālas instrukcijas no cilvēkiem, kas apmāca robotu, apakšuzdevumu marķējumi, starp-ķermeņu dati no robotiem daudzās mājās. Rezultāts ir robots, kas tīra virtuves mājās, kuras nebija apmācības kopā. openpi README pievieno detaļu, ko nosaukums neietver: izlaistais pi0.5 tika apmācīts ar zināšanu izolāciju (arXiv 2505.23705).
| Īpašība | pi0 | pi0.5 |
|---|---|---|
| VLM pamata variants | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Darbības eksperta variants | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| action_horizon default | 50 | 50 |
| max_token_len | 48 | 200 |
| diskrēta stāvokļa ievade | false | true, stāvoklis diskretizēts segmentos uzvednē |
| Bāzes kontrolpunkts | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README ir skaidrs: repozitorijs atbalsta tikai plūsmas saskaņošanas galvu (flow matching head) gan pi0.5 apmācībai, gan secinājumiem. Raksts apraksta divas stadijas, un kods ietver tikai otro: pirmsapmācība attēlo katru darbību kā diskrētus marķierus, izmantojot FAST tokenizatoru, un izvietošanas laikā modelis secina augsta līmeņa apakšuzdevumu pirms katras darbības daļas. Neviens no tiem nav repozitorijā. The lerobot/pi05_base karte sniedz to pašu sarakstu un pievieno RL, lai gan pi0.5 raksts vispār neapraksta nekādu pastiprinātas mācīšanās stadiju. The LeRobot ports pārmanto šo darbības jomu, tāpat kā katrs tajā mitinātais apmācītājs, ieskaitot šeit esošo. Licencēšana arī ir sadalīta: pi05 dokumentācijas lapa norāda Apache 2.0, the lerobot/pi05_base karte ir marķēta ar license: gemma.
Ko plūsmas saskaņošana maina apmācībā un secinājumos
A politika ko var apmācīt uz SO-100, vai nu tieši regresē darbības (ACT) vai tokenizē tās un dekodē autoregresīvi (pi0-FAST). Plūsmas saskaņošana nedara nevienu no šiem: tā iemācās vektoru lauku, kas transportē troksni uz tīru darbību bloku, pēc tam to integrē. pi0 rakstā tiek izmantoti 10 integrācijas soļi ar soļa lielumu 0.1; LeRobot pi05 konfigurācija satur to pašu num_inference_steps: int = 10.
- Apmācība: zudums regresē trokšņainu darbību bloku. Nav jāpielāgo tokenizators, nav jādiskretizē jūsu locītavu leņķi.
- Secinājums: viens bloks maksā desmit pārejas caur darbības ekspertu. Tas ir strukturāli, nevis pielāgošanas problēma.
- Izvade: nepārtrauktas darbības ar 32 dimensijām, iekšēji polsterētas, zudums tiek ņemts no robota dimensijām. 6-DoF roka plus satvērējs izmanto 7.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma mugurkauls un vārti tā priekšā
PaliGemma (arXiv 2407.07726) ir SigLIP-So400m redzes kodētājs uz Gemma-2B valodu modeļa, aptuveni 3B parametri. Pi0.5 manto savu tokenizatoru, un šis tokenizators atrodas slēgtā repozitorijā. Tas ir visbiežākais veids, kā pirmais izpildījums beidzas neveiksmīgi, pirms pirmā apmācības soļa.
LeRobot pi05 dokumentācija to skaidri norāda: pi0.5 izmanto slēgto google/paligemma-3b-pt-224 tokenizatoru, tāpēc vispirms pieņemiet tā licenci Hub un palaidiet hf auth login. Piekļuve tiek piešķirta manuāli, nevis uzreiz. Izlaidiet to, sāciet maksas mākoņpakalpojuma izpildījumu, un jūs maksāsiet par podu, kas nevar lejupielādēt tokenizatoru.
Pirms sākat: datu kopas formāts, epizodes, aparatūra
Pi0.5 LeRobot lasa LeRobot datu kopu v3.0 izkārtojumā, kas parādījās ar lerobot 0.4.0 2025. gada oktobrī: daudzas epizodes katrā Parquet un MP4 failā, nevis viens fails katrai epizodei, ar robežām meta/episodes/ nevis failu nosaukumos. Ierakstiet ar darbvirsmas klientu vai sekojiet ierakstiet savu pirmo datu kopu un jums tas būs.
| Režīms | Nepieciešamā GPU atmiņa | Piemērs GPU |
|---|---|---|
| Secinājumi | more than 8 GB | RTX 4090 |
| Precizēšana, LoRA | more than 22.5 GB | RTX 4090 |
| Precizēšana, pilna | more than 70 GB | A100 80 GB or H100 |
Pi0.5 un SmolVLA vēlas LeRobot v3.0. GR00T N1.7 un GR00T N1.5 vēlas v2.0 vai v2.1 un avarē ar v3.0 datu kopu. Viena ierakstīšanas sesija nevar nodrošināt abas bez konversijas, un kļūda nesaka "nepareiza datu kopas versija". Skatīt datu kopa noraidīta: nepieciešama v3.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPlatforma vēlas vismaz 50 epizodes Pi0.5, tas pats minimums kā GR00T un ACT. Pirmapmācība veic lielāko darbu, tāpēc 50 tīras epizodes ir labākas par 200 paviršām. Jauns šajā jomā? Sāciet ar datu vākšanas ceļvedi.

A maršruts: precizēšana ar openpi repozitoriju
Atsauces implementācija: vispirms JAX, testēta tikai uz Ubuntu 22.04, vadīta ar konfigurācijas objektiem, nevis karodziņiem. PyTorch ceļš parādījās 2025. gada septembrī, validēts uz LIBERO. Trīs soļi: konvertējiet savus datus, definējiet konfigurāciju, apmāciet un apkalpojiet.
- 1Klonēt un instalēt
openpi izmanto uv. GIT_LFS_SKIP_SMUDGE ir tas, kas ļauj LeRobot ienākt kā atkarībai bez LFS binārajiem objektiem.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Konvertējiet savus datus uz LeRobot datu kopu
Augšpusē tiek piegādāti konvertētāji LIBERO un DROID un tiek sagaidīts, ka jūs pielāgosiet vienu. Darbs ir atslēgu kartēšana.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Pievienot apmācības konfigurāciju
Konfigurācijas ir TrainConfig ieraksti src/openpi/training/config.py. Šis pielāgo pi05_droid_finetune, ar svara ielādētāju, kas norādīts uz pi05_base.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Aprēķināt normēšanas statistiku
Darbojas pret konfigurācijas nosaukumu, nevis datu kopu. Tā izlaišana ir klasiska pirmā kļūda šeit.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Apmācīt
Šis mainīgais ļauj JAX izmantot 90 procentus GPU atmiņas, nevis noklusējuma 75. Uz 80 GB kartes tas nosaka, vai izpilde izdzīvos.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Apkalpot
Serveris klausās uz portu 8000 un atbild uz novērojumu vaicājumiem; jūsu robota izpildlaiks ir klients.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi PyTorch implementācija neatbalsta pi0-FAST, jauktu precizitāti, FSDP, LoRA vai EMA svarus, tāpēc LoRA, kas sasniedz 22.5 GB, ir pieejama tikai JAX, izmantojot gemma_2b_lora un gemma_300m_lora variantus. Vēl ļaunāk: iestatīšana kopē labotus failus virs jūsu instalētā transformers 4.53.2, un README brīdina, ka ar uv noklusējuma cieto saišu režīmu tas neatgriezeniski modificē transformers uv kešatmiņā un var noplūst citos projektos. Atsauciet to ar uv cache clean transformers.
B maršruts: precizēt ar lerobot pi05
LeRobot ports ietver tos pašus svarus CLI, ko jau izmantojat priekš ACT un SmolVLA. Viss zemāk minētais tika pārbaudīts ar lerobot 0.6.1, izlaidumu kopš 2026. gada 3. augusta, un pi05 dokumentāciju 2026. gada 23. augustā. Versijām šeit ir nozīme: v3.0 datu kopas parādījās ar 0.4.0 2025. gada oktobrī, 0.5.0 emuārs 2026. gada 9. martā iepazīstina ar pi0-FAST un Real-Time Chunking, un 0.6.0 2026. gada 6. jūlijā padarīja bāzes pakotni vieglu un pārcēla izvietošanu uz lerobot-rollout.
Viena lieta nemainījās: lerobot-train un lerobot-record jau bija ieejas punkti 0.3.2 versijā, 2025. gada augustā. Apmācība, kas joprojām izsauc python -m lerobot.scripts.train ir pirms gada izmaiņām un ir vērts neuzticēties arī pārējam.
- 1Instalēt ar pareizajiem papildinājumiem
Kopš 0.6.0 pamata instalācija ietver tikai galvenās ML atkarības, un `pi` papildinājums nepievieno datu kopas vai apmācības kodu, tāpēc precizēšanai ir nepieciešams arī apmācības papildinājums. Vecākas vienrindas komandas šeit neizdodas importēšanas laikā.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Autentificēties
Pārlūkprogrammā pieņemiet paligemma-3b-pt-224 licenci, pēc tam piesakieties mašīnā, kas veic apmācību.
bashhf auth login - 3Pievienot kvantiļu statistiku
Pi0.5 normalizē STATE un ACTION ar kvantilēm, tāpēc meta/stats.json ir nepieciešami q01 un q99. Vecākas datu kopas satur tikai min, max, mean, std.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4Precizēt no lerobot/pi05_base
Iestatiet pakešu izmēru atbilstoši tam, ko jūsu karte spēj apstrādāt; dokumentācijā tiek izmantots 64 uz LIBERO ar 80 GB. Eksplicīti norādiet bfloat16, konfigurācijas noklusējums ir float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Palaist to uz rokas
Versijā 0.6.x tas ir lerobot-rollout: lerobot-record atsakās no politikas un noraida `eval_` datu kopu nosaukumus. `Base` vada robotu roku, `sentry` ieraksta izpildi.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Flag | What it does | Note |
|---|---|---|
| --policy.type=pi05 | atlasa Pi0.5 | nepieciešams ar pretrained_path, izlaist ar --policy.path |
| --policy.pretrained_path | ielādē tikai svarus | iezīmju nosaukumi no jūsu datu kopas, saglabātie iestatījumi tiek atiestatīti |
| --policy.path | svari plus kontrolpunkta config.json | saglabātie iestatījumi, piemēram, n_action_steps, tiek pārmantoti |
| --policy.n_action_steps | soļi, kas patērēti vienā gabalā | atgriežas pie 50, nekad nepārsniedz chunk_size (noklusējums 50) |
| --policy.train_expert_only | iesaldē VLM, apmāca ekspertu | noklusējums false, mazāk atmiņas, zināmas izmaksas veiksmes ziņā |
| --policy.gradient_checkpointing | pārrēķināt, nevis saglabāt aktivizācijas | noklusējums false, pirmais svira, ja izpilde neietilpst |
| --peft.method_type=LORA | LoRA adapteri pilnu svaru vietā | nepieciešams peft papildinājums, dokumentētais piemērs ir SmolVLA |
| --policy.rtc_training_max_delay | darbības prefiksa kondicionēšana RTC | tikai galvenajā zarā, nav 0.6.1 versijā, jāpaliek zem chunk_size |
| --rename_map | kartē datu kopas kolonnas uz politikas iezīmēm | nepieciešams, ja jūsu kameras atslēgas atšķiras |
Bez kvantilēm jūs saņemsiet ValueError: QUANTILES normalization mode requires q01 and q99 stats pirmajā paketē. Pārrēķiniet statistiku, taču rezultāts nonāks $HF_LEROBOT_HOME/your_dataset, nevis kešatmiņā, ko nolasa --dataset.repo_id, tāpēc apmāciet ar --dataset.root, kas norāda uz šo vietu, vai augšupielādējiet uz Hub. Vai arī izlaidiet kvantiles ar --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}', kā to dara LIBERO atsauces komanda.
Trīs noklusējuma iestatījumu kopas un kuras no tām sasniedz apmācītāju
openpi TrainConfig ir atsauce, LeRobot PI05Config ir tas, ko lerobot-train izmanto, ja neko nesakāt, un šeit esošā forma nosūta trešo kopu. Pārsteigums ir mācīšanās ātrums: abas augšupējās noklusējuma vērtības sasniedz 2.5e-5, savukārt openpi paša pi05_libero konfigurācija un šī platforma to paaugstina līdz 5e-5.
| Iestatījums | openpi TrainConfig | lerobot pi05 un lerobot-train | AY-Robots nosūta |
|---|---|---|---|
| Pakešu izmērs | 32 | 8 | 1 |
| Maksimālais mācīšanās ātrums | 2.5e-5, kosinusa samazinājums | optimizer_lr 2.5e-5 | 5e-5 |
| Apmācības soļi | 30,000 | 100,000 | 30,000 |
| Kontrolpunkta intervāls | 1,000 soļi | 20,000 soļi | nav formā |
| Sēkla | 42 | 1,000 | formā |
| Darbības bloks | action_horizon 50 | chunk_size 50, n_action_steps 50 | nav formā |
| Svara datu tips | bfloat16 | float32 until you pass --policy.dtype | nav formā |
| Gradientu akumulācija | nav tāda regulētāja, tā vietā fsdp_devices | absent from every release so far | 16, un tas tiek atmests |
Vai ports ir uzticams? LeRobot komanda precizēja LIBERO bāzes modeli vēl 6k soļus un salīdzināja ar openpi atsauces skaitļiem četrās komplektās: 97.5 procentu vidējais pret 96.85, priekšā Libero 10, atpaliek Spatial. Maršruts ir rīku izvēle, nevis kvalitātes izvēle.
- Vairāk nekā 10,000 stundu robotu iepriekšējas apmācības, tāpēc 50 jūsu uzdevuma epizodes var būt pietiekamas.
- Nepārtrauktas darbības: nav jāpielāgo tokenizators, nav diskretizācijas ierobežojuma jūsu locītavu leņķiem.
- LeRobot ports iegūst 97.5 procentus LIBERO vidējā rādītājā pret openpi 96.85, tāpēc draudzīgākais CLI nemaksā neko mērāmu.
- Parametru efektīvi ceļi abās pusēs: openpi JAX LoRA varianti, LeRobot PEFT integrācija.
- Pilnai precizēšanai nepieciešami vairāk nekā 70 GB. 22.5 GB LoRA skaitlis ir openpi JAX skaitlis; neviens nav publicēts pi05 zem PEFT.
- 485 ms uz darbības soli, lēnākais no pieciem šeit: divreiz SmolVLA, divdesmit četras reizes ACT.
- Nepieciešams LeRobot v3.0, tāpēc datu kopa, kas ierakstīta GR00T palaišanai, ir jākonvertē, un otrādi.
- Jaunas opcijas vispirms nonāk galvenajā zarā: apmācības laika RTC un MEM atmiņa nav 0.6.1 versijā, tāpēc jaunākā dokumentācija var nozīmēt instalēšanu no git.
485 ms realitāte un tas, kur tā kļūst nelietojama
Tas nosaka jūsu projektu, tāpēc tas ir pirms izmaksu tabulas. uz darbības soli, kas šeit izmērīts Pi0.5, ir 485 ms. Salīdzinājumā ar pārējiem četriem:
| Politika | Secinājums uz darbības soli | Parametri | GPU līmenis | Minimālais epizožu skaits |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

Vadības cikls šajos piecos modeļos ilgst no 20 līdz 485 ms uz vienu darbības soli. Publiskā interneta datu apmaiņas laiks, kas pārsniedz 485 ms, pārvērš strādājošu politiku par svārstīgu. Attālā secināšana ir piemērota lēnai paņemšanas un novietošanas darbībai, nevis ātrai reaktīvai kustībai. Mēs labāk to pateiktu, nekā pārdotu demonstrāciju, kas darbojas tikai lokālajā tīklā. Ja jūsu roka apstājas starp fragmentiem, sāciet ar politikas apstāšanos kustības vidū.
Augšupējā plūsma piedāvā risinājumu, un puse no tā jau ir pieejama izlaidumā, ko varat instalēt. Reāllaika sadalīšana fragmentos (Real-Time Chunking) ģenerē nākamo fragmentu, kamēr roka vēl izpilda pašreizējo, un pēc tam vada jaunā fragmenta pārklājošos soļus, lai tie paliktu tuvu jau izpildītajai daļai, tādējādi roka neapstājas un neraustās savienojuma vietā. Secināšanas laika forma, kas iekļauta 0.4.2 izmaiņu žurnālā Pi0, Pi0.5 un SmolVLA, ir izvēršanas karogs, nevis atkārtota apmācība:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60Tas nepadara modeli ātrāku. Tas paslēpj atstarpi: 485 ms joprojām tiek patērētas, bet ārpus kritiskā ceļa, lai rinda neiztukšotos starp fragmentiem. Apmācības laika variants no arXiv 2512.05964 iet vēl tālāk: modelis iemācās nosacīt tīru darbības prefiksu, tāpēc secināšanas laikā pārklājums tiek stingri iekrāsots ar katras darbības plūsmas laika soļiem, nevis vadīts, un vadības atpakaļejošā pāreja pazūd. Apmācības laikā tas paraugo prefiksa garumu katram piemēram un aprēķina plūsmas zudumu atlikušajai pēcfiksai. Šis karogs ir pieejams tikai galvenajā versijā, nevis 0.6.1, un apmācības aizkavei ir jāpaliek zem chunk_size.
Divi veidi, kā iegūt Pi0.5 kontrolpunktu
Jūs nomājat vai jums pieder 80 GB karte, instalējat vienu no iepriekš minētajām programmatūras pakotnēm, konvertējat savu datu kopu un uzraugāt izpildi. Jūs saglabājat visas vadības iespējas: openpi JAX LoRA, LeRobot PEFT adapterus, relatīvās darbības, pielāgotas taustiņu kartēšanas. Jūs saglabājat arī visas kļūdas.
- Aparatūra: A100 80 GB vai H100, vai 24 GB karte openpi JAX LoRA ceļā.
- Iestatīšana: pēcpusdiena pirmajai izpildei, galvenokārt taustiņu kartēšana un vārtu tokenizators.
- Nav pieejams mitinātajā formā: PEFT adapteri, relatīvās darbības, apmācības laika RTC, MEM atmiņa.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Jūs izvēlaties modeli un datu kopu apmācības formā, aizmugursistēma nomā GPU spot tirgū atbilstoši nepieciešamajai VRAM, palaiž apmācītāju un ieraksta kontrolpunktus objektu krātuvē. Pi0.5 šeit ir pieejams tikai mākonī. Ir pieejami ceļveži priekš SO-100, SO-101, Koch v1.1 un LeKiwi.
| Iestatījums | Ko platforma sūta Pi0.5 |
|---|---|
| Bāzes kontrolpunkts | lerobot/pi05_base |
| Politikas veids | pi05 |
| Pakešu izmērs | 1 |
| Mācīšanās ātrums | 5e-5 |
| Maksimālais soļu skaits | 30000 |
| Gradienta akumulācija | 16, bet skatiet brīdinājumu zemāk |
| Papildu vadības iespējas formā | seed, logFreq |
| Datu kopas formāts | LeRobot v3.0 |
| GPU līmenis | A100 80 GB vai H100 80 GB |
Apmācītājs sūta gradienta akumulācijas vērtību 16, un lerobot 0.5.1 nav karodziņa, lai to saņemtu, tāpēc tā tiek atmesta. Nevienam izlaistajam lerobot nav šāda karodziņa: šī vadības iespēja pastāv tikai galvenajā zarā, kā --accelerator.gradient_accumulation.steps. Efektīvais pakešu izmērs šeit ir 1, salīdzinot ar 256, ko izmanto openpi pi05_libero konfigurācija. Ir vērts to zināt, pirms lasāt zaudējumu līkni. Šī vadības iespēja attiecas uz GR00T N1.7 un GR00T N1.5 izpildēm.
Secinājumu iegūšana darbojas tāpat: tiek nodrošināts pods, lai apkalpotu politiku, un jūsu lokālais klients ar to sazinās. Podam ir dīkstāves sargsuns un tas pats sevi iznīcina, tāpēc aizmirsta cilne nerēķinās klusi. Attiecas latentuma brīdinājums, tāpēc ACT ar 20 ms bieži uzvar ātrā uzdevumā.
Kad tas nedarbojas
| Simptoms | Visvairāk iespējamais cēlonis |
|---|---|
| Izpilde noraidīta pirms sākuma | Datu kopa v2.1, bet Pi0.5 vēlas v3.0, vai otrādi GR00T gadījumā |
| ImportError, trūkst datasets pakotnes | lerobot 0.6.x bez apmācības papildinājuma |
| ValueError par q01 un q99 pirmajā paketē | Nav kvantiļu meta/stats.json; pārrēķiniet vai izmantojiet MEAN_STD |
| CUDA atmiņas trūkums 0. solī | Pilna precizēšana zem 70 GB; mēģiniet kontrolpunktu vai train_expert_only |
| 401 vai ierobežotas repozitorija kļūda | PaliGemma tokenizatora licence nav pieņemta |
| Zaudējumi krītas, robots neko nedara | Normalizācijas neatbilstība, vai politika kopē stāvokli |
| Roka apstājas starp fragmentiem | Latentums uz soli plus turp un atpakaļ ceļš; fragmentu rinda iztukšojas |
| Darbojas vienā iestatījumā, neizdodas citā | Pārāk maz epizožu, vai visas vienā konfigurācijā |
- Datu kopa noraidīta: nepieciešama v3
- Atmiņas trūkums apmācības laikā
- Zudums samazinās, bet politika neko nedara
- Politika sastingst kustības vidū
- Politika darbojas tikai vienā iestatījumā
- Apmācības darbs iestrēdzis rindā
Cik maksā viens izpildes cikls
Pi0.5 atrodas dārgajā līmenī, jo tam nepieciešama 80 GB karte, un spot cenas mainās, tāpēc skaitlis ir diapazons, nevis precīza cena. Daudziem SO-100 uzdevumiem vispirms apmāciet SmolVLA vai ACT 24 GB līmenī, vispirms pārliecinieties, ka uzdevums vispār ir apgūstams, un tikai tad tērējiet tam A100 stundas. Apmāciet savu pirmo politiku izskaidro šo lētāko ciklu, un cenrādis satur pašreizējos līmeņus.
| Līmenis | Politikas | Tipisks izpildes cikls | Cena par stundu | Izmaksas par izpildes ciklu |
|---|---|---|---|---|
| A100 80 GB vai H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 to 6 hours | 1.20 to 2.00 USD | about 4 to 12 USD |
| RTX 4090 vai jebkura 24 GB karte | SmolVLA, ACT | 2 to 5 hours | 0.30 to 0.60 USD | about 1 to 3 USD |

Pirms veltīt vakaru: un salīdzina tos pašus skaitļus. satur 85 VLA modeļus ar 332 etalonu rezultātiem, katrs ir saistīts ar savu avotu, un informācija par saimi ir atrodama .
Apmāciet Pi0.5, neveidojot sistēmu
Izvēlieties datu kopu un hiperparametrus veidlapā. Aizmugursistēma nomā 80 GB karti tūlītējā tirgū, palaiž apmācītāju un ieraksta kontrolpunktus objektu krātuvē. Ceļveži SO-100, SO-101, Koch v1.1 un LeKiwi.
Atvērt apmācības ceļvežusVai es varu precizēt Pi0.5 uz RTX 4090?▾
Nav pilna precizēšana: openpi tam norāda vairāk nekā 70 GB, tātad A100 80 GB vai H100. Tā 22.5 GB LoRA rādītājs pieder JAX ceļam; PyTorch implementācijai nav LoRA. LeRobot PEFT integrācija pastāv, taču tās dokumentētais piemērs ir SmolVLA, un pi05 nav publicēts VRAM rādītājs.
Cik daudz epizožu man ir nepieciešams?▾
Piecdesmit, tas pats minimums kā GR00T un ACT; tikai SmolVLA ir zemāks, 30. Bāzes kontrolpunkts satur vairāk nekā 10 000 stundu iepriekšējas apmācības, tāpēc precizēšana pielāgojas, nevis mācās no nulles: 50 tīras, daudzveidīgas epizodes pārspēj divsimt no vienas konfigurācijas.
Kāda ir atšķirība starp --policy.path un --policy.pretrained_path?▾
--policy.path ielādē svarus un kontrolpunkta config.json, tāpēc saglabātie iestatījumi, piemēram, n_action_steps, tiek mantoti, un --policy.type ir jāizlaiž. --policy.pretrained_path ielādē tikai svarus: funkciju nosaukumi nāk no jūsu datu kopas, saglabātie iestatījumi tiek atiestatīti, --policy.type ir obligāts. Tāpēc LIBERO komanda skaidri nodod n_action_steps=10 un empty_cameras=1; pretējā gadījumā tie atgriežas pie 50 un 0.
Vai atvērtā versija dod man pilnu Pi0.5 no raksta?▾
Nē. Abi atbalsta tikai plūsmas saskaņošanas darbības galvu. Diskrēto marķieru iepriekšējas apmācības posms ar FAST darbības marķierizētāju un augsta līmeņa apakšuzdevumu prognozēšana netika izlaista, un lerobot/pi05_base karte pievieno RL šim sarakstam, lai gan pi0.5 rakstā nav aprakstīts pastiprinātas mācīšanās posms. Jūs apmācāt zema līmeņa politiku, kas ir atkarīga no jūsu nodrošinātās valodas virknes, nevis modeli, kas pats sadala garu uzdevumu.
Pret kurām versijām ir rakstīts šis ceļvedis?▾
openpi galvenajā un lerobot 0.6.1, izlaidums kopš 2026. gada 3. augusta, abi lasīti 2026. gada 23. augustā. v3.0 datu kopas ieradās ar 0.4.0 2025. gada oktobrī. 0.6.0 padarīja bāzes pakotni vieglu, tāpēc lerobot[pi] vairs neinstalē apmācības sistēmu, un pārvietoja izvietošanu uz lerobot-rollout. Apmācības laika RTC ir tikai galvenajā; šeit mitinātais apmācītājs darbojas ar 0.5.1.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started