
Physical Intelligence වෙතින් වන flow-matching VLA වන Pi0.5, ඔබේම රොබෝ දත්ත මත සියුම්-සුසර කරන්න. openpi සහ lerobot pi05 සඳහා සැබෑ විධාන, දත්ත කට්ටල ආකෘති උගුල්, VRAM සහ ප්රමාද සීමාවන්.
Pi0.5 යනු ප්රතිපත්තියක් කිසිදා නොදුටු කාමරයක ක්රියාත්මක විය යුතු විට ඔබ භාවිතා කරන ආකෘතියයි. එය මෙහි ඇති පුහුණු කළ හැකි ප්රතිපත්ති පහෙන් වඩාත්ම අපහසු එකකි අතින් සියුම්-සුසර කිරීමට: මක්නිසාද යත්, ඉහළ ධාරිතා ගබඩාව මුලින්ම JAX වන අතර, LeRobot port එක 0.6.0 හිදී lerobot-record වලින් deployment ඉවත් කර, මූලික ස්ථාපනය පුහුණු කිරීමට තරම් කුඩා කළ අතර, සම්පූර්ණ සියුම්-සුසර කිරීමක් 4090 එකකට නොගැලපේ. පහත දැක්වෙන්නේ: flow matching inference හිදී වැයවන ආකාරය, විධාන මාර්ග දෙක සහ ප්රතිඵලය භාවිතා කළ හැකිද යන්න තීරණය කරන 485 ms අගයයි.
ඔබ දැනගත යුතු දේ
- •flow-matching VLA එකක්: 3B PaliGemma VLM එකක් සහ අඛණ්ඩ ක්රියා කොටස් විකේතනය කරන 300M ක්රියා විශේෂඥයෙක්. එය සියුම්-සුසර කිරීමට මාර්ග දෙකක්, openpi සහ LeRobot pi05, LIBERO සාමාන්යය මත 0.65 ලකුණු වලින් වෙනස් වේ.
- •සම්පූර්ණ සියුම්-සුසර කිරීම සඳහා 70 GB ට වැඩි VRAM අවශ්ය වේ. openpi, LoRA 22.5 GB ලෙස දක්වයි, එය JAX මාර්ගයේ පමණි.
- •දත්ත කට්ටලය meta/stats.json හි q01 සහ q99 quantiles සහිත LeRobotDataset v3.0 විය යුතුය, නැතහොත් batch එකක් දෝෂයක් ඇති කරයි.
- •මුලින්ම ඔබේ lerobot සංස්කරණය පරීක්ෂා කරන්න: 0.6.0 මූලික පැකේජය සැහැල්ලු කර lerobot-record වලින් deployment ඉවත් කළේය.
- •මෙහිදී එය එක් ක්රියා පියවරකට 485 ms කින් ක්රියාත්මක වන අතර, කථාංග 50 ක් අවශ්ය වන අතර, එක් ධාවනයකට දළ වශයෙන් 4 සිට 12 USD දක්වා වැය වේ.
Pi0.5 ඇත්ත වශයෙන්ම කුමක්ද
Physical Intelligence 2024 ඔක්තෝම්බර් මාසයේදී pi0 ප්රකාශයට පත් කළේය: එය pretrained VLM එකක් මත පදනම් වූ flow matching දෘශ්ය-භාෂා-ක්රියා ආකෘතියක් වේ. PaliGemma 3 බිලියන පරාමිති සහිත, සහ මුල සිටම ආරම්භ කරන ලද 300M ක්රියා විශේෂඥයෙකුගෙන් සමන්විත, මුළු බිලියන 3.3 ක ආකෘතියකි. මෙම පත්රිකාව රොබෝ වින්යාස 7ක් සහ කාර්යයන් 68ක් හරහා රොබෝ දත්ත පැය 10,000 කට අධික ප්රමාණයක් මත පූර්ව පුහුණුව වාර්තා කරයි. වැඩි විස්තර pi0 ලිපියෙන්.
Pi0.5 (arXiv 2504.16054, 22 April 2025) එම සැකිල්ල රඳවාගෙන පුහුණු කිරීමේ ආහාර රටාව වෙනස් කරයි: වෙබ් දත්ත, වස්තු හඳුනාගැනීම, රොබෝවරයාට පුහුණු කරන මිනිසුන්ගෙන් වාචික උපදෙස්, උපකාර්ය ලේබල, බොහෝ නිවෙස්වල ඇති රොබෝවරුන්ගෙන් හරස්-ශරීර දත්ත. එහි ප්රතිඵලය වන්නේ පුහුණු කට්ටලයේ නොතිබූ නිවෙස්වල මුළුතැන්ගෙවල් පිරිසිදු කරන රොබෝවරයෙකි. openpi README හි මාතෘකාවේ නොමැති විස්තරයක් එක් කරයි: නිකුත් කරන ලද pi0.5 දැනුම පරිවරණය (arXiv 2505.23705) සමඟ පුහුණු කර ඇත.
| ගුණාංගය | pi0 | pi0.5 |
|---|---|---|
| VLM පසුබිම් ප්රභේදය | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| ක්රියා විශේෂඥ ප්රභේදය | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| ක්රියා ක්ෂිතිජ පෙරනිමිය | 50 | 50 |
| max_token_len | 48 | 200 |
| විවික්ත තත්ව ආදානය | false | true, state discretized into bins in the prompt |
| මූලික පිරික්සුම් ස්ථානය | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README පැහැදිලිව සඳහන් කරයි: ගබඩාව සහාය දක්වන්නේ flow matching head එකට පමණි, pi0.5 පුහුණු කිරීම සහ අනුමාන කිරීම යන දෙකටම. පත්රිකාව අදියර දෙකක් විස්තර කරන අතර කේතය දරන්නේ දෙවන අදියර පමණි: පූර්ව-පුහුණුව සෑම ක්රියාවක්ම FAST tokenizer හරහා විවික්ත ටෝකන ලෙස නිරූපණය කරයි, සහ යෙදවීමේදී ආකෘතිය එක් එක් ක්රියා කොටසට පෙර ඉහළ මට්ටමේ උපකාර්යයක් අනුමාන කරයි. ඒවායින් කිසිවක් ගබඩාවේ නොමැත. lerobot/pi05_base කාඩ්පත එකම ලැයිස්තුව ලබා දෙන අතර RL එකතු කරයි, නමුත් pi0.5 පත්රිකාව කිසිදු ශක්තිමත් කිරීමේ ඉගෙනුම් අදියරක් විස්තර නොකරයි. LeRobot port එක එම විෂය පථය උරුම කර ගනී, සහ එහි ඇති සෑම සත්කාරක පුහුණුකරුවෙකුම, මෙතන ඇති එක ඇතුළුව. බලපත්ර ලබා දීම ද බෙදී ඇත: pi05 doc පිටුව Apache 2.0 යැයි කියයි, lerobot/pi05_base කාඩ්පත license: gemma ලෙස ටැග් කර ඇත.
flow matching පුහුණු කිරීම සහ අනුමාන කිරීම ගැන වෙනස් කරන්නේ කුමක්ද
අ ප්රතිපත්තියක් ඔබට SO-100 මත පුහුණු කළ හැකි ක්රියා සෘජුවම ප්රතිගමනය කරයි (ACT) හෝ ඒවා ටෝකනයිස් කර ස්වයංක්රීයව විකේතනය කරයි (pi0-FAST). ප්රවාහ ගැලපීම මේ දෙකෙන් එකක්වත් නොකරයි: එය ශබ්දය පිරිසිදු ක්රියා කැබැල්ලකට, ඉන්පසු එය ඒකාබද්ධ කරයි. pi0 පත්රිකාව 0.1 පියවර ප්රමාණයෙන් ඒකාබද්ධ කිරීමේ පියවර 10ක් භාවිතා කරයි; LeRobot's pi05 config එකම `num_inference_steps: int = 10` දරයි.
- පුහුණුව: හානි වූ ක්රියා කැබැල්ලක් මත පාඩුව ප්රතිගමනය කරයි. සුසර කිරීමට ටෝකනයිසරයක් නැත, ඔබේ සන්ධි කෝණ විවික්තකරණයක් නැත.
- අනුමානය: එක් කැබැල්ලක් සඳහා ක්රියා විශේෂඥයා හරහා ඉදිරි ගමන් දහයක් වැය වේ. එය ව්යුහාත්මක වන අතර, සුසර කිරීමේ ගැටලුවක් නොවේ.
- ප්රතිදානය: අභ්යන්තරව පෑඩ් කරන ලද, මානය 32ක අඛණ්ඩ ක්රියා, ඔබේ රොබෝවරයා සතුව ඇති මානයන් මත පාඩුව ගනු ලැබේ. 6-DoF අතක් සහ ග්රිපරයක් 7ක් භාවිතා කරයි.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma කොඳු නාරටිය සහ එය ඉදිරිපිට ඇති දොරටුව
PaliGemma (arXiv 2407.07726) යනු Gemma-2B භාෂා ආකෘතියක් මත පදනම් වූ SigLIP-So400m දෘශ්ය එන්කෝඩරයක් වන අතර, එය ආසන්න වශයෙන් 3B පරාමිති වලින් සමන්විත වේ. Pi0.5 එහි ටෝකනයිසර් උරුම කර ගන්නා අතර, එම ටෝකනයිසර් ගේට්ටු සහිත ගබඩාවක (gated repository) පිහිටා ඇත. පළමු ධාවනයක් (run) අසාර්ථක වීමට වඩාත් පොදු ක්රමය මෙයයි, පළමු පුහුණු පියවර ට පෙර.
LeRobot pi05 ලේඛනවල එය පැහැදිලිව සඳහන් වේ: pi0.5 ගේට්ටු සහිත google/paligemma-3b-pt-224 ටෝකනයිසර් භාවිතා කරයි, එබැවින් Hub හි එහි බලපත්රය පිළිගෙන පළමුව hf auth login ධාවනය කරන්න. ප්රවේශය ක්ෂණිකව නොව අතින් ලබා දේ. එය මඟ හැර, ගෙවන ලද ක්ලවුඩ් ධාවනයක් (cloud run) ආරම්භ කළහොත්, ඔබට ටෝකනයිසර් බාගත කළ නොහැකි පොඩ් එකක් (pod) සඳහා ගෙවීමට සිදුවේ.
ඔබ ආරම්භ කිරීමට පෙර: දත්ත කට්ටල ආකෘතිය, කථාංග, දෘඪාංග
LeRobot හි Pi0.5 කියවන්නේ LeRobot දත්ත කට්ටලයක් v3.0 සැකැස්මකින් යුත්, එය 2025 ඔක්තෝම්බර් මාසයේදී lerobot 0.4.0 සමඟ නිකුත් විය: එක් Parquet සහ MP4 ගොනුවකට කථාංග කිහිපයක්, එක් ගොනුවකට කථාංගයක් වෙනුවට, meta/episodes/ හි සීමා නිර්ණයන් සමඟින්. ඩෙස්ක්ටොප් සේවාදායකයා සමඟින් පටිගත කරන්න හෝ ඔබේ පළමු දත්ත කට්ටලය පටිගත කරන්න අනුගමනය කරන්න එවිට ඔබට එය ලැබෙනු ඇත.
| ක්රමය | අවශ්ය GPU මතකය | උදාහරණ GPU |
|---|---|---|
| අනුමානය | 8 GB ට වඩා | RTX 4090 |
| සියුම් සුසර කිරීම, LoRA | 22.5 GB ට වඩා | RTX 4090 |
| සියුම් සුසර කිරීම, සම්පූර්ණ | 70 GB ට වඩා | A100 80 GB or H100 |
Pi0.5 සහ SmolVLA සඳහා LeRobot v3.0 අවශ්ය වේ. GR00T N1.7 සහ GR00T N1.5 සඳහා v2.0 හෝ v2.1 අවශ්ය වන අතර v3.0 දත්ත කට්ටලයකදී බිඳ වැටේ. එක් පටිගත කිරීමේ සැසියකට පරිවර්තනයකින් තොරව දෙකටම සැපයිය නොහැකි අතර, දෝෂය "වැරදි දත්ත කට්ටල අනුවාදය" යැයි නොකියයි. දත්ත කට්ටලය ප්රතික්ෂේප කරන ලදී: v3 අවශ්යයි බලන්න.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPi0.5 සඳහා අවම වශයෙන් කථාංග 50ක් වේදිකාවට අවශ්ය වේ, එය GR00T සහ ACT සඳහා වන අවම සීමාවට සමාන වේ. පූර්ව පුහුණුව මගින් ප්රධාන කාර්යය සිදු කරයි, එබැවින් පිරිසිදු කථාංග 50ක් අවුල් සහගත කථාංග 200කට වඩා හොඳය. මේ සඳහා අලුත්ද? මෙයින් ආරම්භ කරන්න දත්ත එකතු කිරීමේ මාර්ගෝපදේශය

මාර්ගය A: openpi repository භාවිතයෙන් fine-tune කරන්න
යොමු ක්රියාත්මක කිරීම: මුලින්ම JAX, Ubuntu 22.04 මත පමණක් පරීක්ෂා කර ඇත, flags වෙනුවට config objects මගින් ධාවනය වේ. PyTorch මාර්ගයක් 2025 සැප්තැම්බර් මාසයේදී LIBERO මත වලංගු කරමින් පැමිණියේය. පියවර තුනක්: ඔබේ දත්ත පරිවර්තනය කරන්න, config එකක් නිර්වචනය කරන්න, පුහුණු කර සේවය කරන්න.
- 1Clone කර ස්ථාපනය කරන්න
openpi uv භාවිතා කරයි. GIT_LFS_SKIP_SMUDGE යනු LFS blobs නොමැතිව LeRobot dependency එකක් ලෙස පැමිණීමට ඉඩ සලසන දෙයයි.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2ඔබේ දත්ත LeRobot dataset එකක් බවට පරිවර්තනය කරන්න
Upstream මගින් LIBERO සහ DROID සඳහා converters සපයන අතර, ඒවායින් එකක් අනුවර්තනය කිරීමට ඔබෙන් අපේක්ෂා කරයි. කාර්යය වන්නේ key mapping ය.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3පුහුණු config එකක් එක් කරන්න
Configs යනු src/openpi/training/config.py හි ඇති TrainConfig entries වේ. මෙය pi05_droid_finetune අනුවර්තනය කරයි, weight loader එක pi05_base වෙත යොමු කර ඇත.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4සාමාන්ය සංඛ්යාන ගණනය කරන්න
මෙය dataset එකට එරෙහිව නොව, config නාමයට එරෙහිව ධාවනය වේ. මෙය මඟ හැරීම මෙහි ඇති සාමාන්ය පළමු අසාර්ථකත්වයයි.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5පුහුණු කරන්න
මෙම විචල්යය JAX හට පෙරනිමි 75 වෙනුවට GPU මතකයෙන් සියයට 90ක් භාවිතා කිරීමට ඉඩ සලසයි. 80 GB කාඩ්පතකදී, ධාවනය සාර්ථක වේද යන්න තීරණය කරන්නේ එයයි.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6එය සේවය කරන්න
සේවාදායකය port 8000 හි සවන් දෙන අතර observation queries වලට පිළිතුරු සපයයි; ඔබේ රොබෝ ධාවන කාලය සේවාදායකයා වේ.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi හි PyTorch ක්රියාත්මක කිරීම pi0-FAST, mixed precision, FSDP, LoRA හෝ EMA weights සඳහා සහය නොදක්වයි, එබැවින් 22.5 GB දක්වා ළඟා වන LoRA, gemma_2b_lora සහ gemma_300m_lora ප්රභේද හරහා JAX සඳහා පමණි. ඊටත් වඩා නරකයි: මෙම සැකසුම ඔබ ස්ථාපනය කර ඇති transformers 4.53.2 මත පැච් කරන ලද ගොනු පිටපත් කරයි, තවද README අනතුරු අඟවන්නේ uv හි පෙරනිමි hardlink මාදිලිය සමඟින් මෙය uv cache හි ඇති transformers ස්ථිරවම වෙනස් කරන අතර වෙනත් ව්යාපෘතිවලට කාන්දු විය හැකි බවයි. uv cache clean transformers භාවිතයෙන් එය අහෝසි කරන්න.
මාර්ගය B: lerobot pi05 සමඟ fine-tune කරන්න
ඔබ දැනටමත් භාවිතා කරන CLI හි LeRobot port එකම weights අසුරයි ACT සහ SmolVLA. පහත සියල්ල lerobot 0.6.1, 2026 අගෝස්තු 3 සිට නිකුත් වූ සංස්කරණය සහ 2026 අගෝස්තු 23 දිනැති pi05 docs සමඟ පරීක්ෂා කරන ලදී. මෙහිදී සංස්කරණ වැදගත් වේ: v3.0 දත්ත කට්ටල 2025 ඔක්තෝබර් මාසයේදී 0.4.0 සමඟ පැමිණියේය, 2026 මාර්තු 9 දිනැති 0.5.0 බ්ලොග් සටහන pi0-FAST සහ Real-Time Chunking ඉදිරිපත් කරයි, සහ 2026 ජූලි 6 දිනැති 0.6.0 මූලික පැකේජය සැහැල්ලු කර යෙදවීම lerobot-rollout වෙත ගෙන ගියේය.
එක් දෙයක් වෙනස් නොවීය: lerobot-train සහ lerobot-record දැනටමත් 2025 අගෝස්තු මාසයේදී 0.3.2 හි entry points විය. python -m lerobot.scripts.train තවමත් අමතන නිබන්ධනයක් වසරක වෙනස්කම් වලට පෙර පැවති එකක් වන අතර ඉතිරි දේ සම්බන්ධයෙන්ද විශ්වාස නොකළ යුතුය.
- 1නිවැරදි අතිරේක සමඟ ස්ථාපනය කරන්න
0.6.0 සිට මූලික ස්ථාපනය මූලික ML යැපීම් පමණක් දරන අතර, pi අතිරේකය කිසිදු දත්ත කට්ටලයක් හෝ පුහුණු කේතයක් එක් නොකරයි, එබැවින් සියුම් සුසර කිරීමකට පුහුණු අතිරේකයද අවශ්ය වේ. පැරණි එක්-පේළි මෙහි ආනයන වේලාවේදී අසාර්ථක වේ.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2සත්යාපනය කරන්න
බ්රවුසරයකින් paligemma-3b-pt-224 බලපත්රය පිළිගන්න, ඉන්පසු පුහුණු කරන යන්ත්රයට පිවිසෙන්න.
bashhf auth login - 3ප්රමාණාංක සංඛ්යාලේඛන එක් කරන්න
Pi0.5 STATE සහ ACTION ප්රමාණාංක සමඟ සාමාන්යකරණය කරයි, එබැවින් meta/stats.json සඳහා q01 සහ q99 අවශ්ය වේ. පැරණි දත්ත කට්ටලවල ඇත්තේ min, max, mean, std පමණි.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4lerobot/pi05_base වෙතින් සියුම් සුසර කරන්න
ඔබේ කාඩ්පතට ඔරොත්තු දෙන පරිදි කණ්ඩායම් ප්රමාණය සකසන්න; ලේඛනවල LIBERO හි 80 GB දී 64 භාවිතා කරයි. bfloat16 පැහැදිලිවම ලබා දෙන්න, වින්යාසයේ පෙරනිමිය float32 වේ.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5එය අත මත ධාවනය කරන්න
0.6.x හි මෙය lerobot-rollout වේ: lerobot-record ප්රතිපත්තියක් ප්රතික්ෂේප කරන අතර eval_ දත්ත කට්ටල නම් ප්රතික්ෂේප කරයි. Base අත ධාවනය කරයි, sentry rollout එක වාර්තා කරයි.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| ධජය | එය කරන්නේ කුමක්ද | සටහන |
|---|---|---|
| --policy.type=pi05 | Pi0.5 තෝරයි | pretrained_path සමඟ අනිවාර්ය වේ, --policy.path සමඟ අත්හරින්න |
| --policy.pretrained_path | බර පමණක් පටවයි | ඔබේ දත්ත කට්ටලයෙන් විශේෂාංග නම්, ගබඩා කර ඇති සැකසුම් යළි පිහිටුවනු ලැබේ |
| --policy.path | බර සහ චෙක්පොයින්ට් config.json | n_action_steps වැනි ගබඩා කර ඇති සැකසුම් උරුම වේ |
| --policy.n_action_steps | කැබැල්ලකට පරිභෝජනය කරන පියවර | 50 ට ආපසු වැටේ, chunk_size (පෙරනිමි 50) ට වඩා වැඩි නොවේ |
| --policy.train_expert_only | VLM කැටි කරයි, විශේෂඥයා පුහුණු කරයි | පෙරනිමි අසත්ය, අඩු මතකය, සාර්ථකත්වයට යම් පිරිවැයක් |
| --policy.gradient_checkpointing | සක්රිය කිරීම් ගබඩා කරනවා වෙනුවට නැවත ගණනය කරන්න | පෙරනිමි අසත්ය, ධාවනයක් නොගැලපෙන විට පළමු ලීවරය |
| --peft.method_type=LORA | සම්පූර්ණ බර වෙනුවට LoRA ඇඩැප්ටර | peft අතිරේකය අවශ්ය වේ, ලේඛනගත උදාහරණය SmolVLA වේ |
| --policy.rtc_training_max_delay | RTC සඳහා ක්රියා-පෙරනිමි කොන්දේසි | ප්රධාන ශාඛාව පමණි, 0.6.1 හි නොවේ, chunk_size ට වඩා අඩු විය යුතුය |
| --rename_map | දත්ත කට්ටල තීරු ප්රතිපත්ති විශේෂාංග වෙත සිතියම්ගත කරයි | ඔබේ කැමරා යතුරු වෙනස් වන විට අවශ්ය වේ |
ප්රමාණාංක නොමැතිව ඔබට පළමු කණ්ඩායමේදී ValueError: QUANTILES normalization mode requires q01 and q99 stats ලැබේ. සංඛ්යාලේඛන නැවත ගණනය කරන්න, නමුත් ප්රතිඵලය --dataset.repo_id කියවන හැඹිලියට නොව $HF_LEROBOT_HOME/your_dataset වෙත ගොඩබසිනු ඇත, එබැවින් --dataset.root එහි යොමු කරමින් පුහුණු කරන්න හෝ Hub වෙත තල්ලු කරන්න. නැතහොත් LIBERO යොමු විධානය කරන පරිදි --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' සමඟ ප්රමාණාංක මඟ හරින්න.
පෙරනිමි කට්ටල තුනක් සහ පුහුණුකරු වෙත ළඟා වන්නේ කුමන ඒවාද
openpi's TrainConfig යනු මූලාශ්රයයි, LeRobot's PI05Config යනු ඔබ කිසිවක් නොකියන විට lerobot-train භාවිතා කරන දෙයයි, සහ මෙහි ඇති පෝරමය තුන්වන කට්ටලයක් යවයි. පුදුමය නම් ඉගෙනුම් අනුපාතයයි: ඉහළ ප්රවාහයේ පෙරනිමි අගයන් දෙකම 2.5e-5 දක්වා ඉහළ යන අතර, openpi's pi05_libero config සහ මෙම වේදිකාව එය 5e-5 දක්වා වැඩි කරයි.
| සැකසුම | openpi TrainConfig | lerobot pi05 සහ lerobot-train | AY-Robots යවයි |
|---|---|---|---|
| කණ්ඩායම් ප්රමාණය | 32 | 8 | 1 |
| උපරිම ඉගෙනුම් අනුපාතය | 2.5e-5, කෝසයින් ක්ෂය වීම | optimizer_lr 2.5e-5 | 5e-5 |
| පුහුණු පියවර | 30,000 | 100,000 | 30,000 |
| පරීක්ෂණ ලක්ෂ්ය පරතරය | 1,000 steps | 20,000 steps | පෝරමයේ නැත |
| බීජය | 42 | 1,000 | පෝරමයේ ඇත |
| ක්රියා කොටස | action_horizon 50 | chunk_size 50, n_action_steps 50 | පෝරමයේ නැත |
| බර දත්ත වර්ගය | bfloat16 | float32 ඔබ --policy.dtype ලබා දෙන තුරු | පෝරමයේ නැත |
| ග්රේඩියන්ට් සමුච්චය | එවැනි බොත්තමක් නැත, ඒ වෙනුවට fsdp_devices | මේ වන තෙක් සෑම නිකුතුවකින්ම නොමැත | 16, සහ එය අතහැර දමා ඇත |
පෝට් එක විශ්වාසදායකද? LeRobot කණ්ඩායම LIBERO මූලික ආකෘතිය තවත් 6k පියවර සඳහා සියුම් ලෙස සකස් කර, openpi හි යොමු අංක සමඟ සූට් හතරකදී සංසන්දනය කළේය: 97.5% සාමාන්යය 96.85 ට එරෙහිව, Libero 10 හි ඉදිරියෙන්, Spatial හි පසුපසින්. මෙම මාර්ගය මෙවලම් තේරීමක් මිස ගුණාත්මක තේරීමක් නොවේ.
- රොබෝ පූර්ව පුහුණුව සඳහා පැය 10,000 කට වඩා වැඩි කාලයක් වැය වී ඇත, එබැවින් ඔබේ කාර්යයේ කථාංග 50 ක් ප්රමාණවත් විය හැකිය.
- අඛණ්ඩ ක්රියා: සුසර කිරීමට ටෝකනයිසර් නොමැත, ඔබේ සන්ධි කෝණ මත විවික්තකරණ සීමාවක් නොමැත.
- LeRobot පෝට් එක LIBERO සාමාන්යය මත openpi හි 96.85 ට එරෙහිව 97.5% ක් ලබා ගනී, එබැවින් වඩාත් මිත්රශීලී CLI මැනිය හැකි කිසිවක් වැය නොවේ.
- දෙපසම පරාමිති-කාර්යක්ෂම මාර්ග: openpi හි JAX LoRA ප්රභේද, LeRobot හි PEFT ඒකාබද්ධ කිරීම.
- සම්පූර්ණ සියුම් ලෙස සකස් කිරීමට 70 GB ට වඩා අවශ්ය වේ. 22.5 GB LoRA අගය openpi හි JAX අංකයයි; PEFT යටතේ pi05 සඳහා කිසිවක් ප්රකාශයට පත් කර නොමැත.
- එක් ක්රියා පියවරකට 485 ms, මෙහි ඇති පහෙන් මන්දගාමීම: SmolVLA මෙන් දෙගුණයක්, ACT මෙන් විසිහතර ගුණයක්.
- LeRobot v3.0 අවශ්ය වේ, එබැවින් GR00T ධාවනයක් සඳහා වාර්තා කරන ලද දත්ත කට්ටලයක් පරිවර්තනය කළ යුතු අතර, අනෙක් අතටද එසේමය.
- නව විකල්ප මුලින්ම main වෙත පැමිණේ: පුහුණු කාලයෙහි RTC සහ MEM මතකය 0.6.1 හි නොමැත, එබැවින් නවතම ලේඛන යනු git වෙතින් ස්ථාපනය කිරීම විය හැකිය.
485 ms යථාර්ථය, සහ එය භාවිතයට ගත නොහැකි වන තැන
මෙය ඔබේ ව්යාපෘතිය තීරණය කරයි, එබැවින් එය පිරිවැය වගුවට පෙර පැමිණේ. Pi0.5 සඳහා මෙහි මනින ලද එක් ක්රියාකාරී පියවරකට 485 ms වේ. අනෙක් හතරට සාපේක්ෂව:
| ප්රතිපත්තිය | එක් ක්රියාකාරී පියවරකට අනුමානය | පරාමිති | GPU ස්ථරය | අවම කථාංග |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

මෙම ආකෘති පහ හරහා පාලන ලූපය එක් ක්රියාකාරී පියවරකට මිලි තත්පර 20 සිට 485 දක්වා ධාවනය වේ. මිලි තත්පර 485 ට අමතරව පොදු අන්තර්ජාලයේ ගමන් කිරීම් ක්රියාකාරී ප්රතිපත්තියක් පැකිලෙන එකක් බවට පත් කරයි. දුරස්ථ අනුමානය මන්දගාමී තෝරාගැනීම් සහ ස්ථානගත කිරීම් සඳහා ශක්ය වන අතර, වේගවත් ප්රතික්රියාශීලී චලනයන් සඳහා නොවේ. LAN එකක පමණක් ක්රියා කරන demo එකක් විකිණීමට වඩා එය පැවසීමට අපි කැමැත්තෙමු. ඔබේ අත කොටස් අතර විරාමයක් ගන්නේ නම්, ප්රතිපත්තිය චලනය මැද නතර වේ යන කොටසින් ආරම්භ කරන්න.
උඩුගං ප්රවාහයට පිළිතුරක් ඇති අතර, එයින් අඩක් ඔබට ස්ථාපනය කළ හැකි නිකුතුවේ දැනටමත් ඇත. Real-Time Chunking මගින් ඊළඟ කොටස ජනනය කරන්නේ අත තවමත් වත්මන් කොටස ක්රියාත්මක කරන අතරතුර වන අතර, පසුව නව කොටසේ අතිච්ඡාදනය වන පියවර දැනටමත් ක්රියාත්මක කර ඇති කොටසට සමීපව තබා ගැනීමට මඟ පෙන්වයි, එවිට අත සන්ධියේදී නතර වීමක් හෝ ගැස්සීමක් සිදු නොවේ. Pi0, Pi0.5 සහ SmolVLA සඳහා 0.4.2 වෙනස්කම් ලැයිස්තුවේ අනුමාන-කාල ආකෘතිය නිකුත් කර ඇති අතර එය නැවත පුහුණු කිරීමක් නොව, rollout flag එකකි:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60එය ආකෘතිය වේගවත් නොකරයි. එය පරතරය සඟවයි: මිලි තත්පර 485 තවමත් වැය වේ, නමුත් තීරණාත්මක මාර්ගයෙන් බැහැරව, එබැවින් කොටස් අතර පෝලිම හිස් නොවේ. arXiv 2512.05964 වෙතින් පුහුණු-කාල ප්රභේදය තවදුරටත් ඉදිරියට යයි: ආකෘතිය පිරිසිදු ක්රියාකාරී උපසර්ගයක් මත කොන්දේසිගත කිරීමට ඉගෙන ගනී, එබැවින් අනුමානයේදී අතිච්ඡාදනය මඟ පෙන්වීම වෙනුවට එක්-ක්රියාකාරී ප්රවාහ කාල පියවර සමඟ දැඩි ලෙස පින්තාරු කර ඇති අතර, මඟ පෙන්වීමේ පසුපස ගමන් මාර්ගය අතුරුදහන් වේ. පුහුණු කිරීමේදී එය එක් උදාහරණයකට උපසර්ග දිගක් නියැදි කරන අතර ඉතිරි පසුසර්ගය මත ප්රවාහ අලාභය ගනී. එම flag එක 0.6.1 හි නොව, ප්රධාන වශයෙන් පමණක් පවතී, තවද ඔබ පුහුණු කරන ප්රමාදය chunk_size ට වඩා අඩු විය යුතුය.
Pi0.5 චෙක්පොයින්ට් එකක් ලබා ගැනීමට ක්රම දෙකක්
ඔබ 80 GB කාඩ්පතක් කුලියට ගන්නවා හෝ අයිති කර ගන්නවා, ඉහත ස්ටැක් එකක් ස්ථාපනය කරනවා, ඔබේ දත්ත කට්ටලය පරිවර්තනය කරනවා සහ ධාවනය අධීක්ෂණය කරනවා. ඔබට සෑම පාලනයක්ම තිබෙනවා: openpi's JAX LoRA, LeRobot's PEFT ඇඩැප්ටර, සාපේක්ෂ ක්රියා, අභිරුචි යතුරු සිතියම්කරණය. ඔබට සෑම අසාර්ථකත්වයක්ම ද තිබෙනවා.
- දෘඪාංග: A100 80 GB හෝ H100, හෝ openpi's JAX LoRA මාර්ගයේ 24 GB කාඩ්පතක්.
- සැකසීම: පළමු ධාවනය සඳහා දහවල් කාලයක්, බොහෝ දුරට යතුරු සිතියම්කරණය සහ ගේටඩ් ටෝකනයිසර්.
- සත්කාරක ආකෘතියේ නොමැත: PEFT ඇඩැප්ටර, සාපේක්ෂ ක්රියා, පුහුණු කාල RTC, MEM මතකය.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000ඔබ පුහුණු ආකෘතියේ ආකෘතිය සහ දත්ත කට්ටලය තෝරා ගන්නවා, පසුබිම අවශ්ය VRAM අනුව ස්පොට් වෙළඳපොලකින් GPU එකක් කුලියට ගන්නවා, පුහුණුකරු ධාවනය කරනවා සහ චෙක්පොයින්ට් වස්තු ගබඩාවට ලියනවා. Pi0.5 මෙහි වලාකුළු-පමණි. SO-100, SO-101, Koch v1.1 සහ LeKiwi සඳහා මාර්ගෝපදේශ තිබෙනවා.
| සැකසුම | Pi0.5 සඳහා වේදිකාව යවන්නේ කුමක්ද |
|---|---|
| මූලික චෙක්පොයින්ට් | lerobot/pi05_base |
| ප්රතිපත්ති වර්ගය | pi05 |
| කණ්ඩායම් ප්රමාණය | 1 |
| ඉගෙනුම් අනුපාතය | 5e-5 |
| උපරිම පියවර | 30000 |
| ග්රේඩියන්ට් සමුච්චය | 16, but see the warning below |
| ආකෘතියේ අමතර පාලන | seed, logFreq |
| දත්ත කට්ටල ආකෘතිය | LeRobot v3.0 |
| GPU ස්ථරය | A100 80 GB or H100 80 GB |
පුහුණුකරු 16 ක ග්රේඩියන්ට් සමුච්චය අගයක් යවන අතර lerobot 0.5.1 හට එය ලබා ගැනීමට ධජයක් නොමැති බැවින් එය ඉවත් කරනු ලැබේ. නිකුත් කරන ලද lerobot එකක එවැනි ධජයක් නොමැත: පාලනය පවතින්නේ ප්රධාන ශාඛාවේ පමණි, --accelerator.gradient_accumulation.steps ලෙස. මෙහි ඵලදායී කණ්ඩායම් ප්රමාණය 1 කි, openpi's pi05_libero config භාවිතා කරන 256 ට සාපේක්ෂව. පාඩු වක්රයක් කියවීමට පෙර මෙය දැන ගැනීම වටී. මෙම පාලනය GR00T N1.7 සහ GR00T N1.5 ධාවනයන් සඳහා අදාළ වේ.
අනුමානය ද ඒ ආකාරයෙන්ම ක්රියා කරයි: ප්රතිපත්තියට සේවය කිරීම සඳහා පොඩ් එකක් සපයනු ලබන අතර ඔබේ දේශීය සේවාදායකයා එය සමඟ සන්නිවේදනය කරයි. පොඩ් එකට නිෂ්ක්රීය වොච්ඩෝග් එකක් ඇති අතර එය තනිවම විනාශ වේ, එබැවින් අමතක වූ ටැබ් එකක් නිහඬව බිල්පත් නොකරයි. ප්රමාදයේ අනතුරු ඇඟවීම අදාළ වේ, ඒ නිසා 20 ms හි ACT බොහෝ විට වේගවත් කාර්යයක් ජය ගනී.
එය ක්රියා නොකරන විට
| රෝග ලක්ෂණය | බොහෝ දුරට හේතුව |
|---|---|
| ධාවනය ආරම්භ වීමට පෙර ප්රතික්ෂේප විය | Dataset v2.1 but Pi0.5 wants v3.0, or reverse for GR00T |
| ImportError, datasets පැකේජය නැති වී ඇත | lerobot 0.6.x without the training extra |
| කණ්ඩායම් එකේ q01 සහ q99 පිළිබඳ ValueError | No quantiles in meta/stats.json; recompute or use MEAN_STD |
| පියවර 0 දී CUDA මතකය අවසන් විය | Full fine-tune below 70 GB; try checkpointing or train_expert_only |
| 401 හෝ ගේටඩ් රෙපෝ දෝෂය | PaliGemma tokenizer license not accepted |
| පාඩුව පහත වැටේ, රොබෝවරයා කිසිවක් නොකරයි | Normalisation mismatch, or the policy copies the state |
| කැබලි අතර අත නතර වේ | Per-step latency plus round trip; the chunk queue runs dry |
| එක් සැකසුමක ක්රියා කරයි, තවත් එකක අසාර්ථක වේ | Too few episodes, or all in one configuration |
- දත්ත කට්ටලය ප්රතික්ෂේප කරන ලදී: v3 අවශ්යයි
- පුහුණු කිරීමේදී මතකය අවසන් වීම
- අලාභය අඩු වුවත් ප්රතිපත්තිය කිසිවක් නොකරයි
- චලනය මැද ප්රතිපත්තිය අක්රිය වීම
- ප්රතිපත්තිය ක්රියා කරන්නේ එක් සැකසුමක පමණි
- පුහුණු කිරීමේ කාර්යය පෝලිමේ සිරවීම
එක් ධාවනයකට වැය වන මුදල
Pi0.5 මිල අධික ස්ථරයේ පවතින්නේ එයට 80 GB කාඩ්පතක් අවශ්ය වන නිසාත්, ස්ථාන මිල ගණන් වෙනස් වන නිසාත්, එම නිසා අගය මිලකට වඩා පරාසයකි. බොහෝ SO-100 කාර්යයන් සඳහා, මුලින්ම 24 GB ස්ථරයේ SmolVLA හෝ ACT පුහුණු කරන්න, කාර්යය ඉගෙන ගත හැකි දැයි තහවුරු කර, පසුව ඒ සඳහා A100 පැය ගණනක් වැය කරන්න. ඔබේ පළමු ප්රතිපත්තිය පුහුණු කරන්න එම ලාභදායී චක්රය විස්තර කරන අතර, මිලකරණය වත්මන් ස්ථර දක්වයි.
| ස්ථරය | ප්රතිපත්ති | සාමාන්ය ධාවනය | පැයකට මිල | ධාවනයකට පිරිවැය |
|---|---|---|---|---|
| A100 80 GB හෝ H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | පැය 3 සිට 6 දක්වා | 1.20 සිට 2.00 USD | ආසන්න වශයෙන් 4 සිට 12 USD |
| RTX 4090 හෝ ඕනෑම 24 GB කාඩ්පතක් | SmolVLA, ACT | පැය 2 සිට 5 දක්වා | 0.30 සිට 0.60 USD | ආසන්න වශයෙන් 1 සිට 3 USD |

සන්ධ්යාවක් කැප කිරීමට පෙර: GR00T N1.7 Pi0.5 ට එරෙහිව සහ Pi0.5 SmolVLA ට එරෙහිව එකම සංඛ්යා එකින් එක ඉදිරිපත් කරයි. අරීනා 332 මිණුම් සලකුණු ප්රතිඵල සහිත VLA මාදිලි 85ක් දරයි, ඒ සෑම එකක්ම එහි මූලාශ්රයට සම්බන්ධ කර ඇත, සහ පවුල පිළිබඳ පසුබිම අපගේ VLA දළ විශ්ලේෂණය.
ස්ටැක් එකක් ගොඩනොනගා Pi0.5 පුහුණු කරන්න
ආකෘතියකින් දත්ත කට්ටලය සහ අධිපරාමිති තෝරන්න. පසුබිම ක්ෂණික වෙළඳපොලෙන් 80 GB කාඩ්පතක් කුලියට ගනී, පුහුණුකරු ධාවනය කරයි සහ පරීක්ෂණ ස්ථාන වස්තු ගබඩාවට ලියයි. SO-100, SO-101, Koch v1.1 සහ LeKiwi සඳහා මාර්ගෝපදේශ.
පුහුණු මාර්ගෝපදේශ විවෘත කරන්නමට RTX 4090 එකක Pi0.5 සියුම් ලෙස සුසර කළ හැකිද?▾
සම්පූර්ණ සියුම් සුසර කිරීමක් නොවේ: openpi ඒ සඳහා 70 GB ට වඩා ලැයිස්තුගත කරයි, එබැවින් A100 80 GB හෝ H100. එහි 22.5 GB LoRA අගය JAX මාර්ගයට අයත් වේ; PyTorch ක්රියාත්මක කිරීමේදී LoRA නොමැත. LeRobot හි PEFT ඒකාබද්ධ කිරීම පවතී, නමුත් එහි ලේඛනගත උදාහරණය SmolVLA වන අතර pi05 සඳහා VRAM අගයක් ප්රකාශයට පත් කර නොමැත.
මට කථාංග කීයක් අවශ්යද?▾
පනහක්, GR00T සහ ACT හා සමාන අවම අගය; SmolVLA පමණක් 30 දක්වා පහළ යයි. මූලික පරීක්ෂණ ස්ථානය පැය 10,000 කට වඩා වැඩි පූර්ව පුහුණුවක් දරයි, එබැවින් සියුම් සුසර කිරීම කිසිවක් නොමැතිව ඉගෙන ගන්නවාට වඩා අනුවර්තනය වේ: පිරිසිදු, විවිධ කථාංග 50ක් එක් වින්යාසයකින් දෙසීයක් පරදවයි.
--policy.path සහ --policy.pretrained_path අතර වෙනස කුමක්ද?▾
--policy.path මගින් weights සහ checkpoint හි config.json පූරණය කරයි, එබැවින් n_action_steps වැනි ගබඩා කර ඇති සැකසුම් උරුම වන අතර --policy.type අත්හැරිය යුතුය. --policy.pretrained_path මගින් weights පමණක් පූරණය කරයි: විශේෂාංග නම් ඔබේ දත්ත කට්ටලයෙන් පැමිණේ, ගබඩා කර ඇති සැකසුම් යළි පිහිටුවනු ලැබේ, --policy.type අවශ්ය වේ. LIBERO විධානය n_action_steps=10 සහ empty_cameras=1 පැහැදිලිවම ලබා දෙන්නේ එබැවිනි; එසේ නොමැතිනම් ඒවා 50 සහ 0 වෙත ආපසු යයි.
විවෘත අනුවාදය මට පත්රිකාවේ ඇති සම්පූර්ණ Pi0.5 ලබා දෙයිද?▾
නැත. දෙකම flow matching action head එකට පමණක් සහය දක්වයි. FAST action tokenizer සහිත discrete-token පූර්ව පුහුණු අදියර සහ ඉහළ මට්ටමේ උප කාර්ය අනාවැකි නිකුත් කර නොමැත, තවද pi0.5 පත්රිකාවේ කිසිදු ශක්තිමත් කිරීමේ ඉගෙනුම් අදියරක් විස්තර කර නොතිබුණද lerobot/pi05_base කාඩ්පත එම ලැයිස්තුවට RL එක් කරයි. ඔබ දිගු කාර්යයක් තනිවම විඝටනය කරන ආකෘතියක් නොව, ඔබ සපයන භාෂා නූලක් මත පදනම් වූ පහළ මට්ටමේ ප්රතිපත්තියක් පුහුණු කරයි.
මෙම මාර්ගෝපදේශය ලියා ඇත්තේ කුමන අනුවාදවලට එරෙහිවද?▾
ප්රධාන openpi සහ lerobot 0.6.1, 2026 අගෝස්තු 3 සිට නිකුත් කරන ලද, දෙකම 2026 අගෝස්තු 23 දින කියවා ඇත. v3.0 දත්ත කට්ටල 2025 ඔක්තෝම්බර් මාසයේදී 0.4.0 සමඟ පැමිණියේය. 0.6.0 මූලික පැකේජය සැහැල්ලු කළේය, එබැවින් lerobot[pi] පමණක් තවදුරටත් පුහුණු ස්ටැක් එකක් ස්ථාපනය නොකරයි, සහ යෙදවීම lerobot-rollout වෙත ගෙන ගියේය. පුහුණු කාලය RTC ප්රධාන වශයෙන් පමණි; මෙහි සත්කාරක පුහුණුකරු 0.5.1 ධාවනය කරයි.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started