
Physical Intelligence kompaniyasining oqimga mos keluvchi VLA modeli Pi0.5 ni o'z robot ma'lumotlaringiz bo'yicha nozik sozlang. openpi va lerobot pi05 uchun haqiqiy buyruqlar, ma'lumotlar to'plami formati tuzoqlari, VRAM va kechikish cheklovlari.
Pi0.5 - bu siyosat hech qachon ko'rmagan xonada ishlashi kerak bo'lganda foydalanadigan modeldir. Bu yerda mavjud bo'lgan beshta o'rgatiladigan siyosatlar orasida qo'lda nozik sozlash uchun eng noqulayidir: yuqori oqimdagi omborxona birinchi navbatda JAX, LeRobot porti 0.6.0 versiyasida joylashtirishni lerobot-record'dan tashqariga ko'chirdi va asosiy o'rnatishni o'qitish uchun juda kichik qildi, to'liq nozik sozlash esa 4090 ga sig'maydi. Quyida: oqim moslashuvi inferensiyada qancha turadi, ikkita buyruq yo'li va natijaning foydalanishga yaroqliligini hal qiluvchi 485 ms raqami.
Bilishingiz kerak bo'lgan narsalar
- •Oqim moslashuvchi VLA: 3B PaliGemma VLM va uzluksiz harakat qismlarini dekodlovchi 300M harakat eksperti. Uni nozik sozlashning ikkita yo'li, openpi va LeRobot pi05, LIBERO o'rtacha ko'rsatkichida 0.65 ball farq qiladi.
- •To'liq nozik sozlash uchun 70 GB dan ortiq VRAM kerak. openpi LoRA'ni faqat JAX yo'lida 22.5 GB deb ko'rsatadi.
- •Ma'lumotlar to'plami meta/stats.json faylida q01 va q99 kvantillari bo'lgan LeRobotDataset v3.0 bo'lishi kerak, aks holda birinchi partiya xato beradi.
- •Avval lerobot versiyangizni tekshiring: 0.6.0 asosiy paketni yengil qildi va joylashtirishni lerobot-record'dan tashqariga ko'chirdi.
- •Bu yerda u har bir harakat bosqichida 485 ms tezlikda ishlaydi, 50 epizod talab qiladi va har bir ishga tushirish uchun taxminan 4 dan 12 USD gacha turadi.
Pi0.5 aslida nima
Physical Intelligence 2024-yil oktabr oyida pi0'ni nashr etdi: bu oldindan o'qitilgan VLM ustida oqim moslashuvchi ko'rish-til-harakat modeli: 3 milliard parametrli PaliGemma va noldan boshlangan 300M harakat eksperti, jami 3.3 milliard. Maqolada 7 ta robot konfiguratsiyasi va 68 ta vazifa bo'yicha 10,000 soatdan ortiq robot ma'lumotlarida oldindan o'qitish haqida xabar berilgan. Batafsil pi0 maqolasida.
Pi0.5 (arXiv 2504.16054, 22 April 2025) o'sha skeletni saqlab qoladi va o'qitish ratsionini o'zgartiradi: veb ma'lumotlar, obyektlarni aniqlash, robotga murabbiylik qilayotgan insonlarning og'zaki ko'rsatmalari, kichik vazifa yorliqlari, ko'plab uylardagi robotlardan olingan turli xil mujassamlash ma'lumotlari. Natijada, o'qitish to'plamiga kirmagan uylarda oshxonalarni tozalaydigan robot paydo bo'ladi. openpi README sarlavhada bo'lmagan bir tafsilotni qo'shadi: chiqarilgan pi0.5 bilim izolyatsiyasi bilan o'qitilgan (arXiv 2505.23705).
| Xususiyat | pi0 | pi0.5 |
|---|---|---|
| VLM asosiy variant | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| Harakat ekspert varianti | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| action_horizon sukut bo'yicha | 50 | 50 |
| max_token_len | 48 | 200 |
| discrete_state_input | false | true, holat promptdagi bo'laklarga diskretlashtirilgan |
| Asosiy nazorat nuqtasi | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README aniq aytadi: ombor faqat oqim moslash boshini qo'llab-quvvatlaydi, pi0.5 o'qitish va xulosa chiqarish uchun. Maqolada ikki bosqich tasvirlangan va kod faqat ikkinchisini o'z ichiga oladi: oldindan o'qitish har bir harakatni FAST tokenizer orqali diskret tokenlar sifatida ifodalaydi va joylashtirishda model har bir harakat bo'lagidan oldin yuqori darajadagi kichik vazifani aniqlaydi. Ularning hech biri omborda mavjud emas. lerobot/pi05_base kartasi xuddi shu ro'yxatni beradi va RLni qo'shadi, garchi pi0.5 maqolasida umuman mustahkamlash o'rganish bosqichi tasvirlanmagan bo'lsa ham. LeRobot porti bu doiraga meros bo'lib o'tadi, va undagi har bir joylashtirilgan o'qituvchi ham, shu jumladan bu yerda joylashgan ham. Litsenziyalash ham bo'lingan: pi05 hujjat sahifasida Apache 2.0 deyilgan, lerobot/pi05_base kartasi license: gemma bilan belgilangan.
Oqim moslash o'qitish va xulosa chiqarishda nimani o'zgartiradi
SO-100 da o'rgatishingiz mumkin bo'lgan siyosat harakatlarni to'g'ridan-to'g'ri regressiya qiladi (ACT) yoki ularni tokenizatsiya qilib, avtoregressiv tarzda dekodlaydi (pi0-FAST). Oqim moslashuvi ikkalasini ham qilmaydi: u shovqinni toza harakat bo'lagiga olib boradigan vektor maydonini o'rganadi, keyin uni integratsiyalaydi. pi0 maqolasi 0.1 qadam o'lchamida 10 ta integratsiya qadamini ishlatadi; LeRobot'ning pi05 konfiguratsiyasi xuddi shu num_inference_steps: int = 10 ni o'z ichiga oladi.
- O'qitish: yo'qotish shovqinli harakat bo'lagini regressiya qiladi. Sozlash uchun tokenizer yo'q, bo'g'in burchaklaringizni diskretizatsiya qilish yo'q.
- Xulosa chiqarish: bitta bo'lak harakat eksperti orqali o'nta oldinga o'tishni talab qiladi. Bu tuzilmaviy, sozlash muammosi emas.
- Chiqish: 32 o'lchamli uzluksiz harakatlar, ichki qismida to'ldirilgan, yo'qotish robotlaringiz ega bo'lgan o'lchamlar bo'yicha olinadi. 6-DoF qo'l va tutqich 7 tadan foydalanadi.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma tayanch tarmog'i va uning oldidagi darvoza
PaliGemma (arXiv 2407.07726) SigLIP-So400m vizual kodlovchisi boʻlib, Gemma-2B til modelida, taxminan 3B parametrga ega. Pi0.5 oʻzining tokenizatorini meros qilib oladi va bu tokenizator yopiq (gated) omborda joylashgan. Bu birinchi ishga tushirishning, birinchi o'qitish bosqichidan oldin, eng keng tarqalgan o'lim usulidir.
LeRobot pi05 hujjatlarida aniq aytilgan: pi0.5 yopiq (gated) google/paligemma-3b-pt-224 tokenizatoridan foydalanadi, shuning uchun avval Hub'dagi litsenziyasini qabul qiling va hf auth login buyrug'ini ishga tushiring. Kirish huquqi qo'lda beriladi, bir zumda emas. Uni o'tkazib yuborsangiz, pullik bulutli ishga tushirishni boshlaysiz va tokenizatorni yuklab ololmaydigan pod uchun pul to'laysiz.
Boshlashdan oldin: ma'lumotlar to'plami formati, epizodlar, apparat
LeRobot'dagi Pi0.5 LeRobot ma'lumotlar to'plamini v3.0 tartibida o'qiydi, bu lerobot 0.4.0 bilan 2025-yil oktyabr oyida paydo bo'lgan: har bir Parquet va MP4 faylida ko'plab epizodlar, har bir epizod uchun bitta fayl o'rniga, chegaralar fayl nomlarida emas, balki meta/episodes/ ichida joylashgan. Ish stoli mijozi yordamida yozib oling yoki birinchi ma'lumotlar to'plamingizni yozib oling ko'rsatmalariga amal qiling va sizda u bo'ladi.
| Rejim | Talab qilinadigan GPU xotirasi | Misol GPU |
|---|---|---|
| Xulosa chiqarish | 8 GB dan ortiq | RTX 4090 |
| Nozik sozlash, LoRA | 22.5 GB dan ortiq | RTX 4090 |
| Nozik sozlash, to'liq | 70 GB dan ortiq | A100 80 GB yoki H100 |
Pi0.5 va SmolVLA LeRobot v3.0 ni talab qiladi. GR00T N1.7 va GR00T N1.5 v2.0 yoki v2.1 ni talab qiladi va v3.0 ma'lumotlar to'plamida ishlamay qoladi. Bitta yozuv sessiyasi konvertatsiyasiz ikkalasini ham ta'minlay olmaydi va xato "noto'g'ri ma'lumotlar to'plami versiyasi" deb aytmaydi. Qarang: ma'lumotlar to'plami rad etildi: v3 talab qilinadi.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPlatform Pi0.5 uchun kamida 50 ta epizodni talab qiladi, bu GR00T va ACT bilan bir xil minimal talab. Oldindan o'qitish asosiy ishni bajaradi, shuning uchun 50 ta toza epizod 200 ta tartibsiz epizoddan ustun turadi. Bu sohada yangimisiz? Boshlang ma'lumotlarni yig'ish bo'yicha qo'llanma.

A yo'nalishi: openpi repozitoriysi bilan nozik sozlash
Ma'lumotnoma implementatsiyasi: avval JAX, faqat Ubuntu 22.04 da sinovdan o'tkazilgan, bayroqlar o'rniga konfiguratsiya obyektlari orqali boshqariladi. PyTorch yo'li 2025-yil sentabr oyida keldi, LIBERO da tasdiqlangan. Uch bosqich: ma'lumotlaringizni konvertatsiya qiling, konfiguratsiyani aniqlang, o'qiting va xizmat ko'rsating.
- 1Klonlash va o'rnatish
openpi uv dan foydalanadi. GIT_LFS_SKIP_SMUDGE LeRobotni LFS blob'larisiz bog'liqlik sifatida kirishiga imkon beradi.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2Ma'lumotlaringizni LeRobot ma'lumotlar to'plamiga aylantirish
Upstream LIBERO va DROID uchun konvertorlarni taqdim etadi va sizdan birini moslashtirishingizni kutadi. Ish kalit xaritalashdan iborat.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3O'qitish konfiguratsiyasini qo'shish
Konfiguratsiyalar src/openpi/training/config.py dagi TrainConfig yozuvlaridir. Bu konfiguratsiya pi05_droid_finetune ni moslashtiradi, og'irlik yuklovchisi pi05_base ga yo'naltirilgan.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4Norm statistikalarini hisoblash
Konfiguratsiya nomi bo'yicha ishlaydi, ma'lumotlar to'plami bo'yicha emas. Uni o'tkazib yuborish bu yerda klassik birinchi xatodir.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5O'qitish
O'zgaruvchi JAX ga standart 75 foiz o'rniga GPU xotirasining 90 foizini ishlatishga imkon beradi. 80 GB kartada bu ishning davom etishini hal qiladi.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6Xizmat ko'rsatish
Server 8000-portda tinglaydi va kuzatuv so'rovlariga javob beradi; sizning robot ish vaqtingiz mijoz hisoblanadi.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi's PyTorch implementatsiyasi pi0-FAST, aralash aniqlik, FSDP, LoRA yoki EMA og'irliklarini qo'llab-quvvatlamaydi, shuning uchun 22.5 GB ga yetadigan LoRA faqat JAX orqali, gemma_2b_lora va gemma_300m_lora variantlari orqali mavjud. Yomon tomoni: sozlash o'rnatilgan transformers 4.53.2 ustiga tuzatilgan fayllarni nusxalaydi va README ogohlantiradiki, uv'ning standart hardlink rejimi bilan bu transformersni uv keshida doimiy ravishda o'zgartiradi va boshqa loyihalarga tarqalishi mumkin. Buni uv cache clean transformers buyrug'i bilan bekor qiling.
B yo'li: lerobot pi05 bilan nozik sozlash
LeRobot porti siz allaqachon foydalanadigan CLI'dagi bir xil og'irliklarni o'z ichiga oladi: ACT va SmolVLA. Quyida keltirilganlarning barchasi lerobot 0.6.1 (2026-yil 3-avgustdan beri chiqarilgan versiya) va 2026-yil 23-avgustdagi pi05 hujjatlariga qarshi tekshirildi. Bu yerda versiyalar muhim: v3.0 ma'lumotlar to'plamlari 2025-yil oktyabr oyida 0.4.0 bilan keldi, 2026-yil 9-martdagi 0.5.0 blogi pi0-FAST va Real-Time Chunking'ni taqdim etadi, va 2026-yil 6-iyuldagi 0.6.0 asosiy paketni yengil qildi va joylashtirishni lerobot-rollout'ga ko'chirdi.
Bir narsa o'zgarmadi: lerobot-train va lerobot-record 2025-yil avgust oyida, 0.3.2 versiyasida allaqachon kirish nuqtalari edi. Hali ham python -m lerobot.scripts.train buyrug'ini chaqiradigan qo'llanma bir yillik o'zgarishlardan oldingi davrga tegishli va qolgan qismiga ham ishonmaslikka arziydi.
- 1Kerakli qoʻshimchalar bilan oʻrnatish
0.6.0 versiyasidan boshlab asosiy oʻrnatish faqat asosiy ML bogʻliqliklarini oʻz ichiga oladi, va pi qoʻshimchasi hech qanday maʼlumotlar toʻplami yoki oʻqitish kodini qoʻshmaydi, shuning uchun nozik sozlash uchun ham oʻqitish qoʻshimchasi kerak boʻladi. Eskiroq bir qatorli buyruqlar import vaqtida ishlamaydi.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2Autentifikatsiya qilish
Brauzerda paligemma-3b-pt-224 litsenziyasini qabul qiling, soʻngra oʻqitish amalga oshiriladigan mashinaga kiring.
bashhf auth login - 3Kvantil statistikalarini qoʻshish
Pi0.5 STATE va ACTIONni kvantillar bilan normallashtiradi, shuning uchun meta/stats.json q01 va q99 qiymatlariga muhtoj. Eskiroq maʼlumotlar toʻplamlari faqat min, max, mean, std qiymatlarini oʻz ichiga oladi.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4lerobot/pi05_base dan nozik sozlash
Paket hajmini kartangiz bardosh bera oladigan darajada oʻrnating; hujjatlarda LIBEROda 80 GB bilan 64 ishlatiladi. bfloat16 ni aniq koʻrsating, konfiguratsiya sukut boʻyicha float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5Uni qoʻlda ishga tushirish
0.6.x versiyasida bu lerobot-rollout: lerobot-record siyosatni rad etadi va eval_ maʼlumotlar toʻplami nomlarini qabul qilmaydi. Base qoʻlni boshqaradi, sentry esa rolloutni yozib oladi.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| Flag | What it does | Note |
|---|---|---|
| --policy.type=pi05 | Pi0.5 ni tanlaydi | pretrained_path bilan majburiy, --policy.path bilan qoldiriladi |
| --policy.pretrained_path | faqat ogʻirliklarni yuklaydi | maʼlumotlar toʻplamingizdagi xususiyat nomlari, saqlangan sozlamalar qayta tiklanadi |
| --policy.path | ogʻirliklar va checkpoint config.json | n_action_steps kabi saqlangan sozlamalar meros qilib olinadi |
| --policy.n_action_steps | har bir boʻlak uchun sarflangan qadamlar | 50 ga qaytadi, chunk_size dan oshmaydi (sukut boʻyicha 50) |
| --policy.train_expert_only | VLMni muzlatadi, ekspertni oʻqitadi | sukut boʻyicha false, kamroq xotira, muvaffaqiyatda biroz xarajat |
| --policy.gradient_checkpointing | aktivatsiyalarni saqlash oʻrniga qayta hisoblaydi | sukut boʻyicha false, ishga tushirish sigʻmaganda birinchi vosita |
| --peft.method_type=LORA | toʻliq ogʻirliklar oʻrniga LoRA adapterlari | peft qoʻshimchasini talab qiladi, hujjatlashtirilgan misol SmolVLA |
| --policy.rtc_training_max_delay | RTC uchun harakat-prefiks shartlashuvi | faqat asosiy tarmoqda, 0.6.1 da emas, chunk_size dan past boʻlishi kerak |
| --rename_map | maʼlumotlar toʻplami ustunlarini siyosat xususiyatlariga moslashtiradi | kamera kalitlaringiz farq qilganda kerak boʻladi |
Kvantillarsiz birinchi paketda ValueError: QUANTILES normalization mode requires q01 and q99 stats xatosini olasiz. Statistikani qayta hisoblang, lekin natija $HF_LEROBOT_HOME/your_dataset ga tushadi, --dataset.repo_id oʻqiydigan keshga emas, shuning uchun --dataset.root ni oʻsha yerga yoʻnaltirib oʻqiting yoki Hubga yuklang. Yoki LIBERO maʼlumotnoma buyrugʻi kabi --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' bilan kvantillarni oʻtkazib yuboring.
Uchta sukut boʻyicha sozlamalar toʻplami va ulardan qaysilari oʻqituvchiga yetib boradi
openpi's TrainConfig mos yozuvdir, LeRobot's PI05Config esa siz hech narsa demaganingizda lerobot-train foydalanadigan konfiguratsiyadir va bu yerdagi shakl uchinchi to'plamni yuboradi. Ajablanarlisi shundaki, o'rganish tezligi: ikkala yuqori oqim sukut bo'yicha 2.5e-5 ga yetadi, openpi'ning o'z pi05_libero konfiguratsiyasi va ushbu platforma esa uni 5e-5 ga ko'taradi.
| Sozlama | openpi TrainConfig | lerobot pi05 va lerobot-train | AY-Robots yuboradi |
|---|---|---|---|
| Paket hajmi | 32 | 8 | 1 |
| Eng yuqori o'rganish tezligi | 2.5e-5, kosinusli pasayish | optimizer_lr 2.5e-5 | 5e-5 |
| O'qitish bosqichlari | 30,000 | 100,000 | 30,000 |
| Nazorat nuqtasi oralig'i | 1,000 qadam | 20,000 qadam | shaklda yo'q |
| Urug' | 42 | 1,000 | shaklda |
| Harakat bo'lagi | action_horizon 50 | chunk_size 50, n_action_steps 50 | shaklda yo'q |
| Og'irlik turi | bfloat16 | float32 until you pass --policy.dtype | shaklda yo'q |
| Gradient to'planishi | bunday tugma yo'q, buning o'rniga fsdp_devices | absent from every release so far | 16, va u tushirildi |
Port ishonchlimi? LeRobot jamoasi LIBERO bazaviy modelini qo'shimcha 6 ming qadam uchun nozik sozlab, openpi'ning to'rtta to'plamdagi mos yozuv raqamlari bilan solishtirdi: 97.5 foiz o'rtacha 96.85 ga qarshi, Libero 10 da oldinda, Spatial da orqada. Yo'l asbob tanlovi, sifat tanlovi emas.
- Ortida 10,000 soatdan ortiq robotni oldindan o'qitish bor, shuning uchun vazifangizning 50 ta epizodi yetarli bo'lishi mumkin.
- Uzluksiz harakatlar: sozlash uchun tokenizator yo'q, bo'g'in burchaklaringizda diskretizatsiya chegarasi yo'q.
- LeRobot porti LIBERO o'rtacha ko'rsatkichida openpi'ning 96.85 ga qarshi 97.5 foiz ball to'playdi, shuning uchun qulayroq CLI hech qanday o'lchanadigan xarajatga ega emas.
- Ikkala tomonda ham parametr-samarali yo'llar: openpi'ning JAX LoRA variantlari, LeRobot'ning PEFT integratsiyasi.
- To'liq nozik sozlash uchun 70 GB dan ortiq joy kerak. 22.5 GB LoRA raqami openpi'ning JAX raqamidir; PEFT ostida pi05 uchun hech qanday ma'lumot e'lon qilinmagan.
- Harakat bosqichi uchun 485 ms, bu yerdagi beshtadan eng sekin: SmolVLA dan ikki barobar, ACT dan yigirma to'rt barobar.
- LeRobot v3.0 talab qilinadi, shuning uchun GR00T ishga tushirish uchun yozilgan ma'lumotlar to'plamini o'zgartirish kerak, va aksincha.
- Yangi imkoniyatlar avval asosiy tarmoqqa tushadi: o'qitish vaqtidagi RTC va MEM xotirasi 0.6.1 da yo'q, shuning uchun eng yangi hujjatlar git'dan o'rnatishni anglatishi mumkin.
485 ms haqiqat va u qayerda yaroqsiz bo'lib qoladi
Bu sizning loyihangizni hal qiladi, shuning uchun u xarajatlar jadvalidan oldin keladi. Pi0.5 uchun bu yerda o'lchangan har bir harakat bosqichi uchun 485 ms. Qolgan to'rttasiga qarshi:
| Siyosat | Harakat bosqichi uchun xulosa | Parametrlar | GPU darajasi | Minimal epizodlar |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

Ushbu beshta model bo'ylab boshqaruv sikli har bir harakat bosqichi uchun 20 dan 485 ms gacha ishlaydi. 485 ms ustiga jamoat interneti bo'ylab borib-kelishlar ishlaydigan siyosatni ikkilanuvchan siyosatga aylantiradi. Masofaviy xulosa chiqarish sekin tanlash va joylashtirish uchun maqbul, tezkor reaktiv harakat uchun emas. Biz LANda ishlaydigan demo sotishdan ko'ra, shuni aytishni afzal ko'ramiz. Agar qo'lingiz bo'laklar orasida to'xtab qolsa, harakat o'rtasida siyosat muzlashidan boshlang.
Yuqori oqimda javob bor va uning yarmi siz o'rnatishingiz mumkin bo'lgan relizda allaqachon mavjud. Real-Time Chunking qo'l hozirgi bo'lakni bajarayotgan paytda keyingi bo'lakni yaratadi, so'ngra yangi bo'lakning bir-biriga mos keladigan qadamlarini allaqachon bajarilgan qismga yaqin turishga yo'naltiradi, shunda qo'l birikma joyida to'xtab qolmaydi yoki silkinmaydi. Xulosa chiqarish vaqtidagi shakl Pi0, Pi0.5 va SmolVLA uchun 0.4.2 o'zgarishlar jurnalida chiqarilgan va bu qayta o'qitish emas, balki rollout flagidir:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60Bu modelni tezlashtirmaydi. Bu bo'shliqni yashiradi: 485 ms hali ham sarflanadi, ammo muhim yo'ldan tashqarida, shuning uchun navbat bo'laklar orasida qurib qolmaydi. arXiv 2512.05964 dagi o'qitish vaqtidagi variant yanada uzoqroqqa boradi: model toza harakat prefiksiga shart qo'yishni o'rganadi, shuning uchun xulosa chiqarishda bir-biriga mos kelish yo'naltirilgan o'rniga har bir harakat uchun oqim vaqt qadamlari bilan qattiq bo'yaladi va yo'naltirishning orqaga o'tishi yo'qoladi. O'qitish davomida u har bir misol uchun prefiks uzunligini tanlaydi va qolgan postfiksda oqim yo'qotishini oladi. Bu flag faqat mainda mavjud, 0.6.1 da emas, va siz o'qitadigan kechikish chunk_size dan past bo'lishi kerak.
Pi0.5 checkpoint olishning ikki yo'li
Siz 80 GB kartani ijaraga olasiz yoki egasiz, yuqoridagi staklardan birini o'rnatasiz, ma'lumotlar to'plamingizni o'zgartirasiz va ishni nazorat qilasiz. Siz har bir sozlamani saqlab qolasiz: openpi'ning JAX LoRA, LeRobot'ning PEFT adapterlari, nisbiy harakatlar, maxsus tugmalar xaritalari. Siz har bir muvaffaqiyatsizlikni ham saqlab qolasiz.
- Uskuna: A100 80 GB yoki H100, yoki openpi'ning JAX LoRA yo'lida 24 GB karta.
- O'rnatish: birinchi ishga tushirish uchun bir tushdan keyin, asosan tugmalar xaritasi va gated tokenizer.
- Xosting qilingan shaklda emas: PEFT adapterlari, nisbiy harakatlar, o'qitish vaqtidagi RTC, MEM xotirasi.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000Siz model va ma'lumotlar to'plamini o'qitish shaklida, backend kerakli VRAM bo'yicha spot bozorda GPU ijaraga oladi, o'qituvchini ishga tushiradi va checkpointlarni obyekt xotirasiga yozadi. Pi0.5 bu yerda faqat bulutda ishlaydi. Qo'llanmalar mavjud: SO-100, SO-101, Koch v1.1 va LeKiwi.
| Sozlama | Platform Pi0.5 uchun nimani yuboradi |
|---|---|
| Asosiy checkpoint | lerobot/pi05_base |
| Siyosat turi | pi05 |
| Paket hajmi | 1 |
| O'rganish tezligi | 5e-5 |
| Maksimal qadamlar | 30000 |
| Gradient akkumulyatsiyasi | 16, lekin quyidagi ogohlantirishga qarang |
| Shakldagi qo'shimcha sozlamalar | seed, logFreq |
| Ma'lumotlar to'plami formati | LeRobot v3.0 |
| GPU darajasi | A100 80 GB yoki H100 80 GB |
O'qituvchi 16 qiymatli gradient akkumulyatsiyasini yuboradi va lerobot 0.5.1 uni qabul qilish uchun bayroqqa ega emas, shuning uchun u tashlab yuboriladi. Hech bir chiqarilgan lerobotda bunday bayroq yo'q: sozlama faqat asosiy tarmoqda --accelerator.gradient_accumulation.steps sifatida mavjud. Bu yerda samarali paket hajmi 1 ga teng, openpi'ning pi05_libero konfiguratsiyasi ishlatadigan 256 ga qarshi. Yo'qotish egri chizig'ini o'qishdan oldin buni bilishga arziydi. Sozlama GR00T N1.7 va GR00T N1.5 ishlarida qo'llaniladi.
Xulosa chiqarish ham xuddi shunday ishlaydi: siyosatga xizmat ko'rsatish uchun pod taqdim etiladi va mahalliy mijozingiz u bilan bog'lanadi. Podda bo'sh turgan kuzatuvchi mavjud va u o'zini o'zi yo'q qiladi, shuning uchun unutilgan yorliq jim turib hisob-kitob qilmaydi. Kechikish ogohlantirishi qo'llaniladi, shuning uchun ACT 20 ms da tezkor vazifani ko'pincha yutadi.
Ishlamaganda
| Semptom | Eng ehtimoliy sabab |
|---|---|
| Ishga tushishdan oldin rad etildi | Ma'lumotlar to'plami v2.1, lekin Pi0.5 v3.0 ni xohlaydi, yoki GR00T uchun teskarisi |
| ImportError, datasets paketi yo'q | lerobot 0.6.x o'qitish qo'shimchasiz |
| Birinchi paketda q01 va q99 haqida ValueError | meta/stats.json da kvantillar yo'q; qayta hisoblang yoki MEAN_STD dan foydalaning |
| 0-qadamda CUDA xotirasi tugadi | 70 GB dan past to'liq nozik sozlash; checkpointing yoki train_expert_only ni sinab ko'ring |
| 401 yoki gated repo xatosi | PaliGemma tokenizer litsenziyasi qabul qilinmagan |
| Yo'qotish kamayadi, robot hech narsa qilmaydi | Normalizatsiya mos kelmasligi, yoki siyosat holatni nusxalaydi |
| Qo'l bo'laklar orasida to'xtaydi | Har bir qadam uchun kechikish va borib-kelish; bo'lak navbati quriydi |
| Bir sozlamada ishlaydi, boshqasida ishlamaydi | Juda kam epizodlar, yoki hammasi bir konfiguratsiyada |
- Ma'lumotlar to'plami rad etildi: v3 talab qilinadi
- O'qitish jarayonida xotira yetishmovchiligi
- Yo'qotish kamayadi, lekin siyosat hech narsa qilmaydi
- Siyosat harakat o'rtasida muzlab qoladi
- Siyosat faqat bitta sozlamada ishlaydi
- O'qitish ishi navbatda qolib ketdi
Bitta ishlanmaning narxi
Pi0.5 qimmat toifaga kiradi, chunki unga 80 GB karta kerak va spot narxlar o'zgaruvchan, shuning uchun ko'rsatkich narx emas, balki diapazon hisoblanadi. Ko'pgina SO-100 vazifalari uchun avval 24 GB toifasida SmolVLA yoki ACT ni o'rgating, vazifaning umuman o'rganilishi mumkinligini tasdiqlang, keyin unga A100 soat sarflang. Birinchi siyosatingizni o'rgating o'sha arzonroq siklni ko'rsatadi, va narxlar joriy toifalarni o'z ichiga oladi.
| Toifa | Siyosatlar | Odatiy ishlanma | Soatiga narx | Ishlanma narxi |
|---|---|---|---|---|
| A100 80 GB yoki H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 dan 6 soatgacha | 1.20 dan 2.00 USD gacha | taxminan 4 dan 12 USD gacha |
| RTX 4090 yoki har qanday 24 GB karta | SmolVLA, ACT | 2 dan 5 soatgacha | 0.30 dan 0.60 USD gacha | taxminan 1 dan 3 USD gacha |

Bir kechani sarflashdan oldin: GR00T N1.7 against Pi0.5 va Pi0.5 against SmolVLA bir xil raqamlarni yonma-yon taqqoslaydi. Arena 332 ta benchmark natijasi bilan 85 ta VLA modelini o'z ichiga oladi, ularning har biri o'z manbasiga bog'langan va oila haqida ma'lumot bizning VLA umumiy ko'rinishimizda.
Stackni qurmasdan Pi0.5 ni o'qiting
Ma'lumotlar to'plamini va giperparametrlarni shaklda tanlang. Backend spot bozorida 80 GB kartani ijaraga oladi, o'qituvchini ishga tushiradi va nazorat nuqtalarini ob'ekt saqlash joyiga yozadi. SO-100, SO-101, Koch v1.1 va LeKiwi uchun qo'llanmalar.
O'qitish qo'llanmalarini ochishPi0.5 ni RTX 4090 da fine-tune qila olamanmi?▾
To'liq fine-tune emas: openpi buning uchun 70 GB dan ortiq ko'rsatadi, shuning uchun A100 80 GB yoki H100. Uning 22.5 GB LoRA ko'rsatkichi JAX yo'liga tegishli; PyTorch implementatsiyasida LoRA yo'q. LeRobot'ning PEFT integratsiyasi mavjud, ammo uning hujjatlashtirilgan misoli SmolVLA va pi05 uchun VRAM ko'rsatkichi e'lon qilinmagan.
Menga qancha epizod kerak?▾
Ellik, GR00T va ACT bilan bir xil minimal chegara; faqat SmolVLA pastroq, 30 ta. Asosiy nazorat nuqtasi 10,000 soatdan ortiq oldindan o'qitishni o'z ichiga oladi, shuning uchun fine-tune noldan o'rganishdan ko'ra moslashadi: 50 ta toza, xilma-xil epizodlar bitta konfiguratsiyadan olingan ikki yuztasini yengadi.
What is the difference between --policy.path and --policy.pretrained_path?▾
--policy.path og'irliklar va nazorat nuqtasining config.json faylini yuklaydi, shuning uchun n_action_steps kabi saqlangan sozlamalar meros qilib olinadi va --policy.type o'tkazib yuborilishi kerak. --policy.pretrained_path faqat og'irliklarni yuklaydi: xususiyat nomlari sizning ma'lumotlar to'plamingizdan keladi, saqlangan sozlamalar qayta tiklanadi, --policy.type talab qilinadi. Shuning uchun LIBERO buyrug'i n_action_steps=10 va empty_cameras=1 ni aniq o'tkazadi; aks holda ular 50 va 0 ga qaytadi.
Ochiq versiya menga maqoladagi to'liq Pi0.5 ni beradimi?▾
Yo'q. Ikkalasi ham faqat oqim moslashuvchi harakat boshini qo'llab-quvvatlaydi. FAST harakat tokenizatori va yuqori darajadagi kichik vazifa bashorati bilan diskret-token oldindan o'qitish bosqichi chiqarilmagan va lerobot/pi05_base kartasi bu ro'yxatga RL ni qo'shadi, garchi pi0.5 maqolasida mustahkamlash o'rganish bosqichi tasvirlanmagan bo'lsa ham. Siz uzoq vazifani o'zi ajratadigan modelni emas, balki siz taqdim etgan til satriga bog'liq past darajadagi siyosatni o'rgatasiz.
Bu qo'llanma qaysi versiyalarga qarshi yozilgan?▾
main dagi openpi va 2026 yil 3 avgustdan beri chiqarilgan lerobot 0.6.1, ikkalasi ham 2026 yil 23 avgustda o'qilgan. v3.0 ma'lumotlar to'plamlari 2025 yil oktyabr oyida 0.4.0 bilan keldi. 0.6.0 asosiy paketni yengil qildi, shuning uchun lerobot[pi] o'zi endi o'qitish stackini o'rnatmaydi va joylashtirishni lerobot-rollout ga ko'chirdi. O'qitish vaqtidagi RTC faqat main da; bu yerdagi joylashtirilgan o'qituvchi 0.5.1 da ishlaydi.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started