
Physical Intelligence-ийн урсгал тааруулах VLA болох Pi0.5-ыг өөрийн роботын өгөгдөл дээр нарийн тааруулна. openpi болон lerobot pi05-д зориулсан бодит тушаалууд, өгөгдлийн багцын форматын урхи, VRAM болон хоцролтын хязгаарлалтууд.
Pi0.5 нь өмнө нь үзэгдээгүй өрөөнд бодлого хэрэгжүүлэх шаардлагатай үед таны сонгох загвар юм. Энэ нь мөн энд байгаа таван сургах боломжтой бодлогууд-ын хамгийн төвөгтэй нь бөгөөд нарийн тааруулах гараар хийхэд: эх репозитор нь эхлээд JAX, LeRobot порт нь 0.6.0 хувилбарт lerobot-record-оос байршуулалтыг шилжүүлж, суурь суулгалтыг сургахад хэтэрхий жижиг болгосон, мөн бүрэн нарийн тааруулалт нь 4090-д багтахгүй. Доор: урсгалын тааруулалт таамаглалд хэр их зардалтай болох, хоёр командын зам, мөн үр дүн ашиглах боломжтой эсэхийг шийддэг 485 мс тоо.
Таны мэдэх ёстой зүйлс
- •Урсгалын тааруулалттай VLA: 3B PaliGemma VLM дээр 300M үйлдлийн эксперт нэмэгдэж, тасралтгүй үйлдлийн хэсгүүдийг тайлдаг. Үүнийг нарийн тааруулах хоёр зам, openpi болон LeRobot pi05, LIBERO дунджаар 0.65 оноогоор ялгаатай.
- •Бүрэн нарийн тааруулалт нь 70 ГБ-аас дээш VRAM шаарддаг. openpi нь LoRA-г 22.5 ГБ-аар, зөвхөн JAX зам дээрээ жагсаасан.
- •Өгөгдлийн багц нь meta/stats.json дотор q01 болон q99 квантилтай LeRobotDataset v3.0 байх ёстой, эс бөгөөс багц алдаа өгнө.
- •Эхлээд lerobot хувилбараа шалгана уу: 0.6.0 нь суурь багцыг хөнгөн болгож, байршуулалтыг lerobot-record-оос шилжүүлсэн.
- •Энд энэ нь үйлдлийн алхам тутамд 485 мс-ээр ажилладаг, 50 анги шаарддаг, мөн нэг ажиллуулалт нь ойролцоогоор 4-12 USD үнэтэй.
Pi0.5 үнэндээ юу вэ
Physical Intelligence 2024 оны 10-р сард pi0-г нийтэлсэн: урсгалын тааруулалттай хараа-хэл-үйлдлийн загвар урьдчилан сургасан VLM дээр: 3 тэрбум параметртэй PaliGemma дээр 300M үйлдлийн экспертийг тэгээс эхлүүлсэн, нийт 3.3 тэрбум. Уг баримт бичигт 7 роботын тохиргоо, 68 даалгаврын хүрээнд 10,000 гаруй цагийн роботын өгөгдөл дээр урьдчилан сургасан тухай дурдсан. Дэлгэрэнгүйг pi0 нийтлэлээс.
Pi0.5 (arXiv 2504.16054, 22 April 2025) нь тэрхүү араг ясыг хадгалж, сургалтын хоолны дэглэмийг өөрчилсөн: вэб мэдээлэл, объектын илрүүлэлт, роботыг сургаж буй хүмүүсийн аман заавар, дэд даалгаврын шошго, олон гэрт байгаа роботуудаас авсан бие даасан мэдээлэл. Үр дүн нь сургалтын багцад ороогүй байшингуудад гал тогоо цэвэрлэж буй робот юм. openpi README нь гарчигт байхгүй нэгэн дэлгэрэнгүй мэдээллийг нэмсэн: хувилбарт гарсан pi0.5 нь мэдлэгийн тусгаарлалтаар (arXiv 2505.23705) сургагдсан.
| Шинж чанар | pi0 | pi0.5 |
|---|---|---|
| VLM үндсэн хувилбар | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Үйлдлийн мэргэжилтний хувилбар | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| action_horizon анхдагч | 50 | 50 |
| max_token_len | 48 | 200 |
| дискрет төлөвийн оролт | false | true, төлөвийг сануулгад савнуудад хуваасан |
| Үндсэн шалгах цэг | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README нь тодорхой заасан: энэхүү репозитори нь зөвхөн урсгалын тааруулах толгойг дэмждэг бөгөөд pi0.5-ийн сургалт болон дүгнэлт хийхэд адилхан. Уг өгүүлэлд хоёр үе шатыг тайлбарласан бөгөөд код нь зөвхөн хоёр дахь үе шатыг агуулдаг: урьдчилсан сургалт нь FAST токенизатороор дамжуулан үйлдэл бүрийг дискрет токен болгон илэрхийлдэг бөгөөд байршуулах үед загвар нь үйлдэл бүрийн өмнө өндөр түвшний дэд даалгаврыг дүгнэдэг. Эдгээрийн аль нь ч репозиторид байхгүй. lerobot/pi05_base карт нь ижил жагсаалтыг өгч, RL-ийг нэмсэн боловч pi0.5 өгүүлэлд ямар ч бэхжүүлсэн сургалтын үе шатыг огт тайлбарлаагүй. LeRobot порт нь энэхүү хамрах хүрээг өвлөн авсан бөгөөд үүн дээр байршуулсан сургагч багш бүр, түүний дотор энд байгаа нь ч мөн адил. Лиценз нь мөн хуваагдсан: pi05 баримт бичгийн хуудас нь Apache 2.0 гэж заасан бол lerobot/pi05_base карт нь license: gemma гэж тэмдэглэгдсэн байна.
Урсгалын тааруулалт нь сургалт болон дүгнэлтэд юуг өөрчилдөг вэ
SO-100 дээр сургаж болох бодлого нь үйлдлүүдийг шууд регресс хийдэг (ACT) эсвэл токен болгож, авторегрессив байдлаар тайлдаг (pi0-FAST). Урсгалын тааруулалт нь аль алиныг нь хийдэггүй: энэ нь дуу чимээг цэвэр үйлдлийн хэсэг рүү зөөдөг векторын талбарыг сурч, дараа нь нэгтгэдэг. pi0-ийн баримт бичигт 0.1 алхамтай 10 нэгтгэх алхам ашигладаг; LeRobot-ийн pi05 тохиргоо нь ижил num_inference_steps: int = 10-ийг агуулдаг.
- Сургалт: алдагдал нь дуу чимээтэй үйлдлийн хэсгийг регресс хийдэг. Тохируулах токенжуулагч байхгүй, үений өнцгийг дискретчлэх шаардлагагүй.
- Дүгнэлт: нэг хэсэг нь үйлдлийн экспертээр дамжуулан арван урагш дамжуулалт хийх зардалтай. Энэ нь бүтцийн шинж чанартай бөгөөд тохируулах асуудал биш.
- Гаралт: 32 хэмжээст тасралтгүй үйлдлүүд, дотооддоо дүүргэгдсэн, роботын тань хэмжээсүүд дээр алдагдал тооцогддог. 6-DoF гар болон баригч нь 7-г ашигладаг.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma-ийн үндсэн бүтэц, болон түүний урд талын хаалга
PaliGemma (arXiv 2407.07726) нь SigLIP-So400m харааны кодлогч бөгөөд Gemma-2B хэлний загвар дээр суурилсан, ойролцоогоор 3 тэрбум параметр юм. Pi0.5 нь өөрийн токенизаторыг өвлөн авсан бөгөөд энэ токенизатор нь хаалттай репозиторит байрладаг. Эхний ажиллагаа ихэвчлэн эхний сургалтын алхам хийгдэхээс өмнө зогсдог.
LeRobot pi05-ийн баримт бичигт тодорхой заасан байдаг: pi0.5 нь хаалттай google/paligemma-3b-pt-224 токенизаторыг ашигладаг тул Hub дээрх лицензийг хүлээн зөвшөөрч, эхлээд hf auth login командыг ажиллуулна уу. Нэвтрэх эрхийг гараар олгодог, шууд биш. Үүнийг алгасаж, төлбөртэй үүлэн ажиллагааг эхлүүлбэл, та токенизатор татаж чадахгүй под-ын төлбөрийг төлөх болно.
Эхлэхээсээ өмнө: өгөгдлийн багцын формат, эпизодууд, техник хангамж
LeRobot дахь Pi0.5 нь LeRobot өгөгдлийн багц v3.0 зохион байгуулалтаар уншдаг бөгөөд энэ нь 2025 оны 10-р сард lerobot 0.4.0-той хамт гарсан: нэг файл тутамд нэг эпизод байхын оронд Parquet болон MP4 файл тутамд олон эпизодтой, мөн файлын нэрийн оронд meta/episodes/ дотор хил хязгаартай байна. ширээний компьютер клиент ашиглан бичлэг хийх эсвэл анхны өгөгдлийн багцаа бичих зааврыг дагаж хийвэл танд бэлэн болно.
| Горим | Шаардагдах GPU санах ой | Жишээ GPU |
|---|---|---|
| Дүгнэлт гаргах | more than 8 GB | RTX 4090 |
| Нарийвчилсан тааруулалт, LoRA | more than 22.5 GB | RTX 4090 |
| Нарийвчилсан тааруулалт, бүрэн | more than 70 GB | A100 80 GB or H100 |
Pi0.5 болон SmolVLA нь LeRobot v3.0-ийг шаарддаг. GR00T N1.7 болон GR00T N1.5 нь v2.0 эсвэл v2.1-ийг шаарддаг бөгөөд v3.0 өгөгдлийн багц дээр алдаа гардаг. Нэг бичлэгийн сесс нь хөрвүүлэлтгүйгээр хоёуланг нь тэжээх боломжгүй бөгөөд алдаа нь "өгөгдлийн багцын буруу хувилбар" гэж хэлдэггүй. Үзнэ үү: өгөгдлийн багц татгалзсан: v3 шаардлагатай.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsПлатформ нь Pi0.5-д дор хаяж 50 анги шаарддаг бөгөөд энэ нь GR00T болон ACT-тэй ижил хэмжээ юм. Урьдчилсан сургалт нь хүнд ажлыг гүйцэтгэдэг тул 50 цэвэр анги нь 200 хайнга ангиас илүү үр дүнтэй. Үүнд шинээр орж байна уу? Эхлэхдээ өгөгдөл цуглуулах гарын авлагаар.

Зам А: openpi репозитороор нарийн тааруулах
Лавлагаа хэрэгжилт: Эхлээд JAX, зөвхөн Ubuntu 22.04 дээр туршигдсан, флаг ашиглахын оронд конфиг объектоор удирдагддаг. PyTorch зам нь 2025 оны 9-р сард гарч ирсэн бөгөөд LIBERO дээр баталгаажсан. Гурван алхам: өгөгдлөө хөрвүүлэх, конфиг тодорхойлох, сургах, үйлчлэх.
- 1Клондож суулгах
openpi нь uv-г ашигладаг. GIT_LFS_SKIP_SMUDGE нь LeRobot-г LFS blobгүйгээр хамааралтай болгох боломжийг олгодог.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Өгөгдлөө LeRobot өгөгдлийн санд хөрвүүлэх
Upstream нь LIBERO болон DROID-д зориулсан хөрвүүлэгчдийг нийлүүлдэг бөгөөд танаас нэгийг нь дасан зохицуулахыг хүлээдэг. Ажил нь түлхүүрийн зураглал юм.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3Сургалтын конфиг нэмэх
Конфигууд нь src/openpi/training/config.py доторх TrainConfig бичиглэлүүд юм. Энэ нь pi05_droid_finetune-г дасан зохицуулж, жин ачаалагчийг pi05_base руу чиглүүлсэн байна.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Хэвийн статистикийг тооцоолох
Өгөгдлийн сангийн нэрээр биш, конфигийн нэрээр ажилладаг. Үүнийг алгасах нь эндхийн сонгодог анхны алдаа юм.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5Сургах
Энэ хувьсагч нь JAX-д GPU санах ойн 90 хувийг ашиглах боломжийг олгодог бөгөөд анхдагч 75 хувийн оронд. 80 ГБ карт дээр энэ нь ажиллагаа амжилттай болох эсэхийг шийддэг.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Үйлчлэх
Сервер нь 8000 порт дээр сонсож, ажиглалтын хүсэлтүүдэд хариулдаг; таны роботын ажиллах орчин нь клиент юм.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi-ийн PyTorch хэрэгжүүлэлт нь pi0-FAST, холимог нарийвчлал, FSDP, LoRA эсвэл EMA жинг дэмждэггүй тул 22.5 GB хүрдэг LoRA нь зөвхөн JAX-д gemma_2b_lora болон gemma_300m_lora хувилбаруудаар дамжин ажилладаг. Үүнээс ч муу нь: уг тохиргоо нь засварласан файлуудыг таны суулгасан transformers 4.53.2 дээр хуулдаг бөгөөд README нь uv-ийн анхдагч hardlink горимоор энэ нь uv кэш дэх transformers-ийг байнгын өөрчилдөг бөгөөд бусад төслүүдэд нөлөөлж болзошгүйг анхааруулдаг. Үүнийг uv cache clean transformers тушаалаар буцаана.
Зам Б: lerobot pi05-аар нарийн тааруулах
LeRobot порт нь таны аль хэдийн ашигладаг CLI доторх ижил жингүүдийг ACT болон SmolVLA. Доорх бүх зүйлийг 2026 оны 8-р сарын 3-наас хойш гарсан lerobot 0.6.1 хувилбар болон 2026 оны 8-р сарын 23-ны pi05 баримт бичигтэй тулгаж шалгасан. Энд хувилбарууд чухал: v3.0 өгөгдлийн багцууд 2025 оны 10-р сард 0.4.0-тэй хамт ирсэн, 2026 оны 3-р сарын 9-ний 0.5.0 блог нь pi0-FAST болон Real-Time Chunking-ийг танилцуулсан, мөн 2026 оны 7-р сарын 6-ны 0.6.0 нь үндсэн багцыг хөнгөн болгож, байршуулалтыг lerobot-rollout руу шилжүүлсэн.
Нэг зүйл хөдлөөгүй: lerobot-train болон lerobot-record нь 2025 оны 8-р сард 0.3.2 хувилбарт аль хэдийн нэвтрэх цэгүүд байсан. Одоо ч гэсэн python -m lerobot.scripts.train гэж дууддаг заавар нь нэг жилийн өөрчлөлтөөс өмнөх үеийнх бөгөөд бусад зүйл дээр ч итгэхгүй байх нь зүйтэй.
- 1Зөв нэмэлтүүдээр суулгах
0.6.0 хувилбараас хойш суурь суулгац нь зөвхөн үндсэн ML хамаарлыг агуулдаг бөгөөд pi нэмэлт нь өгөгдлийн багц эсвэл сургалтын кодыг нэмдэггүй тул нарийн тааруулахын тулд сургалтын нэмэлт хэрэгтэй болно. Хуучин нэг мөрүүд энд импортлох үед алдаа гардаг.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Нэвтрэх
Хөтөч дээр paligemma-3b-pt-224 лицензийг хүлээн зөвшөөрөөд, дараа нь сургалт хийх машинд нэвтэрнэ үү.
bashhf auth login - 3Квантил статистик нэмэх
Pi0.5 нь STATE болон ACTION-ийг квантил ашиглан хэвийн болгодог тул meta/stats.json-д q01 болон q99 хэрэгтэй. Хуучин өгөгдлийн багцууд зөвхөн min, max, mean, std-ийг агуулдаг.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4lerobot/pi05_base-аас нарийн тааруулах
Багцын хэмжээг таны картын тэсвэрлэх хэмжээнд тохируулна уу; баримт бичигт LIBERO дээр 80 ГБ-д 64-ийг ашигладаг. bfloat16-г тодорхой зааж өгнө үү, тохиргооны анхдагч утга нь float32 юм.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Үүнийг роботын гарт ажиллуулах
0.6.x хувилбарт энэ нь lerobot-rollout юм: lerobot-record нь бодлогыг хүлээн зөвшөөрдөггүй бөгөөд eval_ өгөгдлийн багцын нэрийг татгалздаг. Base нь гарыг удирддаг, sentry нь rollout-ийг бичдэг.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Туг | Юу хийдэг | Тэмдэглэл |
|---|---|---|
| --policy.type=pi05 | Pi0.5-ийг сонгоно | pretrained_path-тай хамт заавал байх ёстой, --policy.path-тай хамт орхиж болно |
| --policy.pretrained_path | зөвхөн жинг ачаална | танай өгөгдлийн багцаас онцлог нэрс, хадгалагдсан тохиргоог дахин тохируулна |
| --policy.path | жингүүд болон checkpoint config.json | n_action_steps зэрэг хадгалагдсан тохиргоог өвлөнө |
| --policy.n_action_steps | хэсэг тутамд хэрэглэгдэх алхамууд | 50 руу буцна, chunk_size-аас хэзээ ч хэтрэхгүй (анхдагч 50) |
| --policy.train_expert_only | VLM-ийг царцааж, экспертийг сургана | анхдагч утга false, бага санах ой, амжилтад зарим зардал гарна |
| --policy.gradient_checkpointing | идэвхжүүлэлтийг хадгалахын оронд дахин тооцоолно | анхдагч утга false, ажиллуулах боломжгүй үед анхны хөшүүрэг |
| --peft.method_type=LORA | Бүрэн жингийн оронд LoRA адаптерууд | peft нэмэлт хэрэгтэй, баримтжуулсан жишээ нь SmolVLA |
| --policy.rtc_training_max_delay | RTC-д зориулсан үйлдлийн угтвар нөхцөл | зөвхөн үндсэн салбарт, 0.6.1-д байхгүй, chunk_size-аас доош байх ёстой |
| --rename_map | өгөгдлийн багцын багануудыг бодлогын онцлог шинж чанаруудад зураглана | танай камерын түлхүүрүүд өөр байвал хэрэгтэй |
Квантилгүйгээр та эхний багц дээр ValueError: QUANTILES normalization mode requires q01 and q99 stats алдааг авах болно. Статистикийг дахин тооцоол, гэхдээ үр дүн нь --dataset.repo_id-ийн уншдаг кэш биш, харин $HF_LEROBOT_HOME/your_dataset-д хадгалагдана, тиймээс --dataset.root-ийг тэнд чиглүүлэн сургалт хийх эсвэл Hub руу түлхэх хэрэгтэй. Эсвэл LIBERO-ийн лавлах команд шиг --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' ашиглан квантилийг алгасаж болно.
Гурван төрлийн анхдагч утгууд, болон тэдгээрийн аль нь сургагчид хүрдэг
openpi-ийн TrainConfig нь лавлагаа, LeRobot-ийн PI05Config нь та юу ч хэлэхгүй үед lerobot-train-ийн ашигладаг зүйл бөгөөд энд байгаа маягт нь гурав дахь багцыг илгээдэг. Гэнэтийн зүйл бол суралцах хурд юм: хоёулаа эхний тохиргоо нь 2.5e-5-д хүрч байхад, openpi-ийн өөрийн pi05_libero тохиргоо болон энэ платформ нь үүнийг 5e-5 болгож нэмэгдүүлдэг.
| Тохиргоо | openpi TrainConfig | lerobot pi05 болон lerobot-train | AY-Robots илгээдэг |
|---|---|---|---|
| Багцын хэмжээ | 32 | 8 | 1 |
| Суралцах хурдны оргил | 2.5e-5, косинус задрал | optimizer_lr 2.5e-5 | 5e-5 |
| Сургалтын алхамууд | 30,000 | 100,000 | 30,000 |
| Хяналтын цэгийн завсарлага | 1,000 алхам | 20,000 алхам | маягтад байхгүй |
| Үр | 42 | 1,000 | маягтад байгаа |
| Үйлдлийн хэсэг | action_horizon 50 | chunk_size 50, n_action_steps 50 | маягтад байхгүй |
| Жингийн өгөгдлийн төрөл | bfloat16 | float32 та --policy.dtype дамжуулах хүртэл | маягтад байхгүй |
| Градиент хуримтлал | ийм тохируулга байхгүй, оронд нь fsdp_devices | одоог хүртэлх хувилбар бүрт байхгүй | 16, мөн хасагдсан |
Порт нь үнэнч үү? LeRobot баг LIBERO суурь загварыг нэмэлт 6 мянган алхам сургаж, openpi-ийн лавлагаа тоотой дөрвөн багц дээр харьцуулсан: 96.85-тай харьцуулахад дунджаар 97.5 хувь, Libero 10 дээр илүү, Spatial дээр хоцорсон. Энэ зам нь чанарын сонголт биш, харин хэрэгслийн сонголт юм.
- 10,000 гаруй цагийн роботын урьдчилсан сургалт хийгдсэн тул таны даалгаврын 50 анги хангалттай байж болно.
- Тасралтгүй үйлдлүүд: тохируулах токенизатор байхгүй, үений өнцөгт дискретчилэл байхгүй.
- LeRobot порт нь LIBERO-ийн дунджаар openpi-ийн 96.85-тай харьцуулахад 97.5 хувь оноо авдаг тул илүү ээлтэй CLI нь хэмжигдэхүйц зардалгүй.
- Хоёр талд параметр-үр ашигтай замууд: openpi-ийн JAX LoRA хувилбарууд, LeRobot-ийн PEFT интеграц.
- Бүрэн нарийн тааруулалт нь 70 ГБ-аас илүү зай шаарддаг. 22.5 ГБ LoRA тоо нь openpi-ийн JAX тоо юм; PEFT дор pi05-д зориулсан нь хэвлэгдээгүй байна.
- Үйлдлийн алхам тутамд 485 мс, энд байгаа таваас хамгийн удаан нь: SmolVLA-аас хоёр дахин, ACT-аас хорин дөрөв дахин удаан.
- LeRobot v3.0 шаардлагатай тул GR00T ажиллуулахад бичигдсэн өгөгдлийн багцыг хөрвүүлэх шаардлагатай бөгөөд эсрэгээрээ.
- Шинэ сонголтууд эхлээд үндсэн хувилбар дээр гардаг: сургалтын үеийн RTC болон MEM санах ой 0.6.1 хувилбарт байхгүй тул хамгийн сүүлийн үеийн баримт бичиг нь git-ээс суулгахыг хэлж болно.
485 мс-ийн бодит байдал ба түүнийг ашиглах боломжгүй болох цэг
Энэ нь таны төслийг шийддэг тул зардлын хүснэгтээс өмнө ирдэг. нь Pi0.5-д зориулж энд хэмжсэн үйлдлийн алхам тутамд 485 мс байна. Бусад дөрөвтэй харьцуулахад:
| Бодлого | Үйлдлийн алхам тутамд таамаглал | Параметрүүд | GPU зэрэглэл | Хамгийн бага ангиуд |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

Эдгээр таван загварын хяналтын давталт нь үйлдлийн алхам тутамд 20-485 мс ажилладаг. Нийтийн интернетийн 485 мс-ээс дээш хугацааны эргэлт нь ажиллаж буй бодлогыг эргэлзээтэй болгодог. Алсын дүгнэлт нь удаан сонгох, байрлуулахад тохиромжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй. Бид зөвхөн LAN дээр ажилладаг демо зарахын оронд үүнийг хэлэх нь дээр. Хэрэв таны гар хэсгүүдийн хооронд түр зогсвол бодлого хөдөлгөөний дунд хөлддөг хэсгээс эхэлнэ үү.
Дээд урсгал нь хариулттай бөгөөд түүний тал хувь нь таны суулгах боломжтой хувилбарт аль хэдийн багтсан байна. Бодит цагийн хэсэгчилэл нь гар одоогийн хэсгийг гүйцэтгэж байхад дараагийн хэсгийг үүсгэж, дараа нь шинэ хэсгийн давхцаж буй алхмуудыг аль хэдийн гүйцэтгэсэн хэсэгт ойр байлгахаар чиглүүлдэг тул гар нь залгаасан дээр гацах эсвэл огцом хөдлөхгүй. Дүгнэлт хийх үеийн хэлбэр нь 0.4.2 хувилбарын өөрчлөлтийн бүртгэлд Pi0, Pi0.5 болон SmolVLA-д зориулагдан багтсан бөгөөд энэ нь дахин сургах биш, харин нэвтрүүлэх туг юм:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60Энэ нь загварыг хурдасгахгүй. Энэ нь зайг нуудаг: 485 мс хэвээр зарцуулагддаг боловч чухал замаас гадуур байдаг тул дараалал нь хэсгүүдийн хооронд хоосордоггүй. arXiv 2512.05964-ээс авсан сургалтын үеийн хувилбар нь илүү гүнзгийрүүлсэн: загвар нь цэвэр үйлдлийн угтварт нөхцөл байдлыг сурдаг тул дүгнэлт хийх үед давхцал нь чиглүүлэгдсэн байдлаар биш, харин үйлдлийн урсгалын цагийн алхамуудаар хатуу будсан байдаг бөгөөд чиглүүлгийн урвуу дамжуулалт алга болдог. Сургалтын үед энэ нь жишээ тутамд угтварын уртыг түүвэрлэж, үлдсэн дагаврын урсгалын алдагдлыг авдаг. Тэр туг нь зөвхөн үндсэн хувилбарт байдаг, 0.6.1-д байхгүй бөгөөд таны сургах хугацааны саатал нь chunk_size-аас доош байх ёстой.
Pi0.5 чекпойнт авах хоёр арга
Та 80 ГБ карт түрээслэх эсвэл өмчлөх, дээрх стекүүдийн нэгийг суулгах, өгөгдлийн сангаа хөрвүүлэх, ажиллагааг хянах хэрэгтэй. Та бүх тохиргоог өөрөө хийнэ: openpi's JAX LoRA, LeRobot's PEFT адаптерууд, харьцангуй үйлдлүүд, захиалгат түлхүүрийн зураглал. Мөн та бүх алдааг өөрөө хариуцна.
- Техник хангамж: A100 80 ГБ эсвэл H100, эсвэл openpi-ийн JAX LoRA зам дээрх 24 ГБ карт.
- Тохиргоо: Эхний ажиллагаанд нэг үдээс, ихэвчлэн түлхүүрийн зураглал болон хаалттай токенайзер.
- Хостлогдсон хэлбэрт байхгүй: PEFT адаптерууд, харьцангуй үйлдлүүд, сургалтын үеийн RTC, MEM санах ой.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Та загвар болон өгөгдлийн санг сургалтын маягт дээр сонгоход, бэкенд нь шаардлагатай VRAM-аар GPU-г спот зах зээлээс түрээсэлж, сургагчийг ажиллуулж, чекпойнт-уудыг обьект хадгалах санд бичдэг. Pi0.5 энд зөвхөн үүлэн орчинд ажиллана. SO-100, SO-101, Koch v1.1 болон LeKiwi загваруудад зориулсан гарын авлагууд байдаг.
| Тохиргоо | Платформ Pi0.5-д юу илгээдэг вэ |
|---|---|
| Үндсэн чекпойнт | lerobot/pi05_base |
| Бодлогын төрөл | pi05 |
| Багцын хэмжээ | 1 |
| Сургалтын хурд | 5e-5 |
| Хамгийн их алхам | 30000 |
| Градиент хуримтлал | 16, гэхдээ доорх анхааруулгыг үзнэ үү |
| Маягт дахь нэмэлт тохиргоо | seed, logFreq |
| Өгөгдлийн сангийн формат | LeRobot v3.0 |
| GPU түвшин | A100 80 GB эсвэл H100 80 GB |
Сургагч нь 16-ийн градиент хуримтлалын утгыг илгээдэг боловч lerobot 0.5.1 үүнийг хүлээн авах флаггүй тул хаягддаг. Ямар ч хувилбарлагдсан lerobot-д ийм флаг байхгүй: энэ тохиргоо зөвхөн үндсэн хувилбар дээр --accelerator.gradient_accumulation.steps хэлбэрээр байдаг. Эндхийн үр дүнтэй багцын хэмжээ нь 1 бөгөөд openpi-ийн pi05_libero тохиргооны ашигладаг 256-тай харьцуулахад бага юм. Алдагдлын муруйг уншихаасаа өмнө үүнийг мэдэх нь чухал. Энэ тохиргоо нь GR00T N1.7 болон GR00T N1.5 ажиллагаанд хэрэглэгддэг.
Дүгнэлт хийх нь ижил аргаар ажилладаг: бодлогыг үйлчлэх зорилгоор под бэлтгэгдэж, таны локал клиент түүнтэй харилцдаг. Под нь идэвхгүй хяналтын системтэй бөгөөд өөрийгөө устгадаг тул мартсан таб чимээгүйгээр төлбөр тооцохгүй. Хоцролтын анхааруулга үйлчилдэг бөгөөд тиймээс 20 мс-ийн ACT нь ихэвчлэн хурдан даалгаврыг гүйцэтгэдэг.
Ажиллахгүй үед
| Шинж тэмдэг | Хамгийн их магадлалтай шалтгаан |
|---|---|
| Ажиллагаа эхлэхээс өмнө татгалзсан | Өгөгдлийн сан v2.1 боловч Pi0.5 нь v3.0-ийг хүсдэг, эсвэл GR00T-ийн хувьд эсрэгээрээ |
| ImportError, datasets багц байхгүй | lerobot 0.6.x сургалтын нэмэлтгүйгээр |
| Эхний багц дээрх q01 болон q99-ийн тухай ValueError | meta/stats.json дотор квантил байхгүй; дахин тооцоолох эсвэл MEAN_STD ашиглах |
| 0-р алхам дээр CUDA санах ой дууссан | 70 ГБ-аас доош бүрэн нарийн тааруулалт; чекпойнт хийх эсвэл train_expert_only-г оролдоно уу |
| 401 эсвэл хаалттай репо алдаа | PaliGemma токенайзерийн лицензийг хүлээн аваагүй |
| Алдагдал буурч, робот юу ч хийхгүй байна | Хэвийн болгох зөрүү, эсвэл бодлого нь төлөвийг хуулбарлаж байна |
| Гар хэсгүүдийн хооронд түр зогсоно | Алхам тутамд хоцролт нэмэх нь эргэлтийн хугацаа; хэсгийн дараалал хоосорно |
| Нэг тохиргоонд ажиллаж, нөгөөд нь бүтэлгүйтсэн | Хэт цөөн эпизод, эсвэл бүгд нэг тохиргоонд |
- Өгөгдлийн багц татгалзсан: v3 шаардлагатай
- Сургалтын явцад санах ой дууссан
- Алдагдал буурсан ч бодлого юу ч хийхгүй байна
- Бодлого хөдөлгөөний дунд хөлдсөн
- Бодлого зөвхөн нэг тохиргоонд ажилладаг
- Сургалтын ажил дараалалд гацсан
Нэг ажиллагаа хэр үнэтэй вэ
Pi0.5 нь 80 ГБ карт шаарддаг тул үнэтэй түвшинд багтдаг бөгөөд спот үнэ хэлбэлздэг тул энэ нь үнэ биш харин үнийн хүрээ юм. Олон SO-100 даалгаврын хувьд эхлээд SmolVLA эсвэл ACT-г 24 ГБ түвшинд сургаж, даалгаврыг ер нь сурах боломжтой эсэхийг баталгаажуулсны дараа A100 цагийг зарцуулна. Анхны бодлогоо сургах нь хямд давталтыг тайлбарлаж, үнэ нь одоогийн түвшинг харуулдаг.
| Түвшин | Бодлогууд | Ердийн ажиллагаа | Цагийн үнэ | Нэг ажиллагааны зардал |
|---|---|---|---|---|
| A100 80 ГБ эсвэл H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3-аас 6 цаг | 1.20-аас 2.00 USD | ойролцоогоор 4-өөс 12 USD |
| RTX 4090 эсвэл бусад 24 ГБ карт | SmolVLA, ACT | 2-оос 5 цаг | 0.30-аас 0.60 USD | ойролцоогоор 1-ээс 3 USD |

Оройг зориулахаасаа өмнө: болон нь ижил тоонуудыг нэг нэгэнтэй нь харьцуулж харуулдаг. нь 85 VLA загварыг 332 бенчмарк үр дүнтэйгээр агуулдаг бөгөөд тус бүр нь эх сурвалжтайгаа холбогдсон байдаг. Уг гэр бүлийн талаарх мэдээллийг -оос үзнэ үү.
Стек үүсгэхгүйгээр Pi0.5-ийг сургах
Өгөгдлийн багц болон хэт параметрүүдийг маягтаас сонгоно уу. Арын систем нь спот зах зээлээс 80 ГБ карт түрээсэлж, сургагчийг ажиллуулж, шалгах цэгүүдийг объектын санд бичдэг. SO-100, SO-101, Koch v1.1 болон LeKiwi-д зориулсан гарын авлагууд.
Сургалтын гарын авлагуудыг нээхБи Pi0.5-ийг RTX 4090 дээр нарийн тааруулах боломжтой юу?▾
Бүрэн нарийн тааруулах боломжгүй: openpi үүнд 70 ГБ-аас дээш зай шаардлагатай гэж жагсаасан тул A100 80 ГБ эсвэл H100 хэрэгтэй. Түүний 22.5 ГБ LoRA үзүүлэлт нь JAX замд хамаардаг; PyTorch хэрэгжилт нь LoRA-гүй. LeRobot-ийн PEFT интеграцчлал байдаг ч түүний баримтжуулсан жишээ нь SmolVLA бөгөөд pi05-д зориулсан VRAM үзүүлэлт нийтлэгдээгүй байна.
Надад хэдэн эпизод хэрэгтэй вэ?▾
Тавин, GR00T болон ACT-тэй ижил доод хязгаар; зөвхөн SmolVLA 30-аар доогуур байдаг. Үндсэн шалгах цэг нь 10,000 гаруй цагийн урьдчилсан сургалтыг агуулдаг тул нарийн тааруулалт нь юунаас ч суралцах бус, харин дасан зохицдог: 50 цэвэр, олон янзын эпизод нь нэг тохиргооноос гарах хоёр зуун эпизодоос илүү үр дүнтэй.
--policy.path болон --policy.pretrained_path хоёрын ялгаа юу вэ?▾
--policy.path нь жин болон шалгах цэгийн config.json-ийг ачаалдаг тул n_action_steps зэрэг хадгалагдсан тохиргоог өвлөн авдаг бөгөөд --policy.type-ийг орхих ёстой. --policy.pretrained_path нь зөвхөн жинг ачаалдаг: онцлог шинж чанаруудын нэрс таны өгөгдлийн багцаас ирдэг, хадгалагдсан тохиргоог дахин тохируулдаг, --policy.type шаардлагатай. Тиймээс LIBERO команд n_action_steps=10 болон empty_cameras=1-ийг тодорхой дамжуулдаг; эс тэгвээс тэд 50 болон 0 руу буцдаг.
Нээлттэй хувилбар нь надад цаасан дээрх Pi0.5-ийг бүрэн өгөх үү?▾
Үгүй. Хоёулаа зөвхөн урсгалын тааруулалтын үйлдлийн толгойг дэмждэг. FAST үйлдлийн токенизатор болон өндөр түвшний дэд даалгаврын таамаглал бүхий дискрет-токен урьдчилсан сургалтын үе шат нь гараагүй бөгөөд lerobot/pi05_base карт нь уг жагсаалтад RL-ийг нэмдэг хэдийгээр pi0.5 цаас нь бэхжүүлэлтийн сургалтын үе шатыг тайлбарлаагүй байдаг. Та урт даалгаврыг өөрөө задалдаг загвар биш, харин таны өгсөн хэлний мөрөнд суурилсан бага түвшний бодлогыг сургадаг.
Энэхүү гарын авлагыг ямар хувилбаруудад зориулж бичсэн бэ?▾
openpi нь үндсэн хувилбар дээр болон lerobot 0.6.1, 2026 оны 8-р сарын 3-наас хойшхи хувилбар, хоёуланг нь 2026 оны 8-р сарын 23-нд уншсан. v3.0 өгөгдлийн багцууд 2025 оны 10-р сард 0.4.0-тэй хамт ирсэн. 0.6.0 нь үндсэн багцыг хөнгөн болгосон тул lerobot[pi] дангаараа сургалтын стек суулгахаа больж, байршуулалтыг lerobot-rollout руу шилжүүлсэн. Сургалтын үеийн RTC нь зөвхөн үндсэн хувилбар дээр байдаг; энд байршуулсан сургагч нь 0.5.1 хувилбарыг ажиллуулдаг.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started