AY-Robots o'quv matritsasi, beshta siyosat qatorlar sifatida va to'rtta robot qo'li ustunlar sifatida, har bir katakcha ma'lum bir nozik sozlash qo'llanmasiga havola.
Pi0.5Oqimga MoslashVLA O'qitishLeRobotNozik Sozlash

Pi0.5 ni O'z Robotingiz Ma'lumotlari Bo'yicha Qanday O'rgatish Kerak

AY-Robots ResearchAugust 23, 202616 daqiqa o'qish

Physical Intelligence kompaniyasining oqimga mos keluvchi VLA modeli Pi0.5 ni o'z robot ma'lumotlaringiz bo'yicha nozik sozlang. openpi va lerobot pi05 uchun haqiqiy buyruqlar, ma'lumotlar to'plami formati tuzoqlari, VRAM va kechikish cheklovlari.

Pi0.5 - bu siyosat hech qachon ko'rmagan xonada ishlashi kerak bo'lganda foydalanadigan modeldir. Bu yerda mavjud bo'lgan beshta o'rgatiladigan siyosatlar orasida qo'lda nozik sozlash uchun eng noqulayidir: yuqori oqimdagi omborxona birinchi navbatda JAX, LeRobot porti 0.6.0 versiyasida joylashtirishni lerobot-record'dan tashqariga ko'chirdi va asosiy o'rnatishni o'qitish uchun juda kichik qildi, to'liq nozik sozlash esa 4090 ga sig'maydi. Quyida: oqim moslashuvi inferensiyada qancha turadi, ikkita buyruq yo'li va natijaning foydalanishga yaroqliligini hal qiluvchi 485 ms raqami.

Bilishingiz kerak bo'lgan narsalar

  • Oqim moslashuvchi VLA: 3B PaliGemma VLM va uzluksiz harakat qismlarini dekodlovchi 300M harakat eksperti. Uni nozik sozlashning ikkita yo'li, openpi va LeRobot pi05, LIBERO o'rtacha ko'rsatkichida 0.65 ball farq qiladi.
  • To'liq nozik sozlash uchun 70 GB dan ortiq VRAM kerak. openpi LoRA'ni faqat JAX yo'lida 22.5 GB deb ko'rsatadi.
  • Ma'lumotlar to'plami meta/stats.json faylida q01 va q99 kvantillari bo'lgan LeRobotDataset v3.0 bo'lishi kerak, aks holda birinchi partiya xato beradi.
  • Avval lerobot versiyangizni tekshiring: 0.6.0 asosiy paketni yengil qildi va joylashtirishni lerobot-record'dan tashqariga ko'chirdi.
  • Bu yerda u har bir harakat bosqichida 485 ms tezlikda ishlaydi, 50 epizod talab qiladi va har bir ishga tushirish uchun taxminan 4 dan 12 USD gacha turadi.

Pi0.5 aslida nima

Physical Intelligence 2024-yil oktabr oyida pi0'ni nashr etdi: bu oldindan o'qitilgan VLM ustida oqim moslashuvchi ko'rish-til-harakat modeli: 3 milliard parametrli PaliGemma va noldan boshlangan 300M harakat eksperti, jami 3.3 milliard. Maqolada 7 ta robot konfiguratsiyasi va 68 ta vazifa bo'yicha 10,000 soatdan ortiq robot ma'lumotlarida oldindan o'qitish haqida xabar berilgan. Batafsil pi0 maqolasida.

Pi0.5 (arXiv 2504.16054, 22 April 2025) o'sha skeletni saqlab qoladi va o'qitish ratsionini o'zgartiradi: veb ma'lumotlar, obyektlarni aniqlash, robotga murabbiylik qilayotgan insonlarning og'zaki ko'rsatmalari, kichik vazifa yorliqlari, ko'plab uylardagi robotlardan olingan turli xil mujassamlash ma'lumotlari. Natijada, o'qitish to'plamiga kirmagan uylarda oshxonalarni tozalaydigan robot paydo bo'ladi. openpi README sarlavhada bo'lmagan bir tafsilotni qo'shadi: chiqarilgan pi0.5 bilim izolyatsiyasi bilan o'qitilgan (arXiv 2505.23705).

Xususiyatpi0pi0.5
VLM asosiy variantgemma_2b (PaliGemma)gemma_2b (PaliGemma)
Harakat ekspert variantigemma_300mgemma_300m
action_dim3232
action_horizon sukut bo'yicha5050
max_token_len48200
discrete_state_inputfalsetrue, holat promptdagi bo'laklarga diskretlashtirilgan
Asosiy nazorat nuqtasigs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Ommaviy bo'lgan narsa butun maqola emas

openpi README aniq aytadi: ombor faqat oqim moslash boshini qo'llab-quvvatlaydi, pi0.5 o'qitish va xulosa chiqarish uchun. Maqolada ikki bosqich tasvirlangan va kod faqat ikkinchisini o'z ichiga oladi: oldindan o'qitish har bir harakatni FAST tokenizer orqali diskret tokenlar sifatida ifodalaydi va joylashtirishda model har bir harakat bo'lagidan oldin yuqori darajadagi kichik vazifani aniqlaydi. Ularning hech biri omborda mavjud emas. lerobot/pi05_base kartasi xuddi shu ro'yxatni beradi va RLni qo'shadi, garchi pi0.5 maqolasida umuman mustahkamlash o'rganish bosqichi tasvirlanmagan bo'lsa ham. LeRobot porti bu doiraga meros bo'lib o'tadi, va undagi har bir joylashtirilgan o'qituvchi ham, shu jumladan bu yerda joylashgan ham. Litsenziyalash ham bo'lingan: pi05 hujjat sahifasida Apache 2.0 deyilgan, lerobot/pi05_base kartasi license: gemma bilan belgilangan.

Oqim moslash o'qitish va xulosa chiqarishda nimani o'zgartiradi

SO-100 da o'rgatishingiz mumkin bo'lgan siyosat harakatlarni to'g'ridan-to'g'ri regressiya qiladi (ACT) yoki ularni tokenizatsiya qilib, avtoregressiv tarzda dekodlaydi (pi0-FAST). Oqim moslashuvi ikkalasini ham qilmaydi: u shovqinni toza harakat bo'lagiga olib boradigan vektor maydonini o'rganadi, keyin uni integratsiyalaydi. pi0 maqolasi 0.1 qadam o'lchamida 10 ta integratsiya qadamini ishlatadi; LeRobot'ning pi05 konfiguratsiyasi xuddi shu num_inference_steps: int = 10 ni o'z ichiga oladi.

  • O'qitish: yo'qotish shovqinli harakat bo'lagini regressiya qiladi. Sozlash uchun tokenizer yo'q, bo'g'in burchaklaringizni diskretizatsiya qilish yo'q.
  • Xulosa chiqarish: bitta bo'lak harakat eksperti orqali o'nta oldinga o'tishni talab qiladi. Bu tuzilmaviy, sozlash muammosi emas.
  • Chiqish: 32 o'lchamli uzluksiz harakatlar, ichki qismida to'ldirilgan, yo'qotish robotlaringiz ega bo'lgan o'lchamlar bo'yicha olinadi. 6-DoF qo'l va tutqich 7 tadan foydalanadi.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
openpi asosiy tarmog'idagi src/openpi/models/pi0_config.py faylidan o'qilgan, 2026-yil 23-avgust.

PaliGemma tayanch tarmog'i va uning oldidagi darvoza

PaliGemma (arXiv 2407.07726) SigLIP-So400m vizual kodlovchisi boʻlib, Gemma-2B til modelida, taxminan 3B parametrga ega. Pi0.5 oʻzining tokenizatorini meros qilib oladi va bu tokenizator yopiq (gated) omborda joylashgan. Bu birinchi ishga tushirishning, birinchi o'qitish bosqichidan oldin, eng keng tarqalgan o'lim usulidir.

GPU ijaraga olishdan oldin yopiq (gated) litsenziyani qabul qiling

LeRobot pi05 hujjatlarida aniq aytilgan: pi0.5 yopiq (gated) google/paligemma-3b-pt-224 tokenizatoridan foydalanadi, shuning uchun avval Hub'dagi litsenziyasini qabul qiling va hf auth login buyrug'ini ishga tushiring. Kirish huquqi qo'lda beriladi, bir zumda emas. Uni o'tkazib yuborsangiz, pullik bulutli ishga tushirishni boshlaysiz va tokenizatorni yuklab ololmaydigan pod uchun pul to'laysiz.

Boshlashdan oldin: ma'lumotlar to'plami formati, epizodlar, apparat

LeRobot'dagi Pi0.5 LeRobot ma'lumotlar to'plamini v3.0 tartibida o'qiydi, bu lerobot 0.4.0 bilan 2025-yil oktyabr oyida paydo bo'lgan: har bir Parquet va MP4 faylida ko'plab epizodlar, har bir epizod uchun bitta fayl o'rniga, chegaralar fayl nomlarida emas, balki meta/episodes/ ichida joylashgan. Ish stoli mijozi yordamida yozib oling yoki birinchi ma'lumotlar to'plamingizni yozib oling ko'rsatmalariga amal qiling va sizda u bo'ladi.

RejimTalab qilinadigan GPU xotirasiMisol GPU
Xulosa chiqarish8 GB dan ortiqRTX 4090
Nozik sozlash, LoRA22.5 GB dan ortiqRTX 4090
Nozik sozlash, to'liq70 GB dan ortiqA100 80 GB yoki H100
Bir kunni yo'qotadigan versiya tuzog'i

Pi0.5 va SmolVLA LeRobot v3.0 ni talab qiladi. GR00T N1.7 va GR00T N1.5 v2.0 yoki v2.1 ni talab qiladi va v3.0 ma'lumotlar to'plamida ishlamay qoladi. Bitta yozuv sessiyasi konvertatsiyasiz ikkalasini ham ta'minlay olmaydi va xato "noto'g'ri ma'lumotlar to'plami versiyasi" deb aytmaydi. Qarang: ma'lumotlar to'plami rad etildi: v3 talab qilinadi.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
LeRobotDataset v3.0 hujjatlaridan.

Platform Pi0.5 uchun kamida 50 ta epizodni talab qiladi, bu GR00T va ACT bilan bir xil minimal talab. Oldindan o'qitish asosiy ishni bajaradi, shuning uchun 50 ta toza epizod 200 ta tartibsiz epizoddan ustun turadi. Bu sohada yangimisiz? Boshlang ma'lumotlarni yig'ish bo'yicha qo'llanma.

AY-Robots siyosatlari sahifasi beshta o'qitiladigan siyosatni parametrlar, GPU darajasi, kechikish va minimal epizodlar bo'yicha solishtiradi.
Pi0.5 A100 va H100 darajasida har bir harakat bosqichi uchun 485 ms tezlikda, minimal 50 epizod bilan joylashgan.

A yo'nalishi: openpi repozitoriysi bilan nozik sozlash

Ma'lumotnoma implementatsiyasi: avval JAX, faqat Ubuntu 22.04 da sinovdan o'tkazilgan, bayroqlar o'rniga konfiguratsiya obyektlari orqali boshqariladi. PyTorch yo'li 2025-yil sentabr oyida keldi, LIBERO da tasdiqlangan. Uch bosqich: ma'lumotlaringizni konvertatsiya qiling, konfiguratsiyani aniqlang, o'qiting va xizmat ko'rsating.

  1. 1
    Klonlash va o'rnatish

    openpi uv dan foydalanadi. GIT_LFS_SKIP_SMUDGE LeRobotni LFS blob'larisiz bog'liqlik sifatida kirishiga imkon beradi.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Ma'lumotlaringizni LeRobot ma'lumotlar to'plamiga aylantirish

    Upstream LIBERO va DROID uchun konvertorlarni taqdim etadi va sizdan birini moslashtirishingizni kutadi. Ish kalit xaritalashdan iborat.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    O'qitish konfiguratsiyasini qo'shish

    Konfiguratsiyalar src/openpi/training/config.py dagi TrainConfig yozuvlaridir. Bu konfiguratsiya pi05_droid_finetune ni moslashtiradi, og'irlik yuklovchisi pi05_base ga yo'naltirilgan.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Norm statistikalarini hisoblash

    Konfiguratsiya nomi bo'yicha ishlaydi, ma'lumotlar to'plami bo'yicha emas. Uni o'tkazib yuborish bu yerda klassik birinchi xatodir.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    O'qitish

    O'zgaruvchi JAX ga standart 75 foiz o'rniga GPU xotirasining 90 foizini ishlatishga imkon beradi. 80 GB kartada bu ishning davom etishini hal qiladi.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Xizmat ko'rsatish

    Server 8000-portda tinglaydi va kuzatuv so'rovlariga javob beradi; sizning robot ish vaqtingiz mijoz hisoblanadi.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch yo'li JAX yo'li emas

openpi's PyTorch implementatsiyasi pi0-FAST, aralash aniqlik, FSDP, LoRA yoki EMA og'irliklarini qo'llab-quvvatlamaydi, shuning uchun 22.5 GB ga yetadigan LoRA faqat JAX orqali, gemma_2b_lora va gemma_300m_lora variantlari orqali mavjud. Yomon tomoni: sozlash o'rnatilgan transformers 4.53.2 ustiga tuzatilgan fayllarni nusxalaydi va README ogohlantiradiki, uv'ning standart hardlink rejimi bilan bu transformersni uv keshida doimiy ravishda o'zgartiradi va boshqa loyihalarga tarqalishi mumkin. Buni uv cache clean transformers buyrug'i bilan bekor qiling.

B yo'li: lerobot pi05 bilan nozik sozlash

LeRobot porti siz allaqachon foydalanadigan CLI'dagi bir xil og'irliklarni o'z ichiga oladi: ACT va SmolVLA. Quyida keltirilganlarning barchasi lerobot 0.6.1 (2026-yil 3-avgustdan beri chiqarilgan versiya) va 2026-yil 23-avgustdagi pi05 hujjatlariga qarshi tekshirildi. Bu yerda versiyalar muhim: v3.0 ma'lumotlar to'plamlari 2025-yil oktyabr oyida 0.4.0 bilan keldi, 2026-yil 9-martdagi 0.5.0 blogi pi0-FAST va Real-Time Chunking'ni taqdim etadi, va 2026-yil 6-iyuldagi 0.6.0 asosiy paketni yengil qildi va joylashtirishni lerobot-rollout'ga ko'chirdi.

Bir narsa o'zgarmadi: lerobot-train va lerobot-record 2025-yil avgust oyida, 0.3.2 versiyasida allaqachon kirish nuqtalari edi. Hali ham python -m lerobot.scripts.train buyrug'ini chaqiradigan qo'llanma bir yillik o'zgarishlardan oldingi davrga tegishli va qolgan qismiga ham ishonmaslikka arziydi.

  1. 1
    Kerakli qoʻshimchalar bilan oʻrnatish

    0.6.0 versiyasidan boshlab asosiy oʻrnatish faqat asosiy ML bogʻliqliklarini oʻz ichiga oladi, va pi qoʻshimchasi hech qanday maʼlumotlar toʻplami yoki oʻqitish kodini qoʻshmaydi, shuning uchun nozik sozlash uchun ham oʻqitish qoʻshimchasi kerak boʻladi. Eskiroq bir qatorli buyruqlar import vaqtida ishlamaydi.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Autentifikatsiya qilish

    Brauzerda paligemma-3b-pt-224 litsenziyasini qabul qiling, soʻngra oʻqitish amalga oshiriladigan mashinaga kiring.

    bash
    hf auth login
  3. 3
    Kvantil statistikalarini qoʻshish

    Pi0.5 STATE va ACTIONni kvantillar bilan normallashtiradi, shuning uchun meta/stats.json q01 va q99 qiymatlariga muhtoj. Eskiroq maʼlumotlar toʻplamlari faqat min, max, mean, std qiymatlarini oʻz ichiga oladi.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    lerobot/pi05_base dan nozik sozlash

    Paket hajmini kartangiz bardosh bera oladigan darajada oʻrnating; hujjatlarda LIBEROda 80 GB bilan 64 ishlatiladi. bfloat16 ni aniq koʻrsating, konfiguratsiya sukut boʻyicha float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Uni qoʻlda ishga tushirish

    0.6.x versiyasida bu lerobot-rollout: lerobot-record siyosatni rad etadi va eval_ maʼlumotlar toʻplami nomlarini qabul qilmaydi. Base qoʻlni boshqaradi, sentry esa rolloutni yozib oladi.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
FlagWhat it doesNote
--policy.type=pi05Pi0.5 ni tanlaydipretrained_path bilan majburiy, --policy.path bilan qoldiriladi
--policy.pretrained_pathfaqat ogʻirliklarni yuklaydimaʼlumotlar toʻplamingizdagi xususiyat nomlari, saqlangan sozlamalar qayta tiklanadi
--policy.pathogʻirliklar va checkpoint config.jsonn_action_steps kabi saqlangan sozlamalar meros qilib olinadi
--policy.n_action_stepshar bir boʻlak uchun sarflangan qadamlar50 ga qaytadi, chunk_size dan oshmaydi (sukut boʻyicha 50)
--policy.train_expert_onlyVLMni muzlatadi, ekspertni oʻqitadisukut boʻyicha false, kamroq xotira, muvaffaqiyatda biroz xarajat
--policy.gradient_checkpointingaktivatsiyalarni saqlash oʻrniga qayta hisoblaydisukut boʻyicha false, ishga tushirish sigʻmaganda birinchi vosita
--peft.method_type=LORAtoʻliq ogʻirliklar oʻrniga LoRA adapterlaripeft qoʻshimchasini talab qiladi, hujjatlashtirilgan misol SmolVLA
--policy.rtc_training_max_delayRTC uchun harakat-prefiks shartlashuvifaqat asosiy tarmoqda, 0.6.1 da emas, chunk_size dan past boʻlishi kerak
--rename_mapmaʼlumotlar toʻplami ustunlarini siyosat xususiyatlariga moslashtiradikamera kalitlaringiz farq qilganda kerak boʻladi
Koʻpchilik birinchi ishga tushirishlarda uchraydigan xato

Kvantillarsiz birinchi paketda ValueError: QUANTILES normalization mode requires q01 and q99 stats xatosini olasiz. Statistikani qayta hisoblang, lekin natija $HF_LEROBOT_HOME/your_dataset ga tushadi, --dataset.repo_id oʻqiydigan keshga emas, shuning uchun --dataset.root ni oʻsha yerga yoʻnaltirib oʻqiting yoki Hubga yuklang. Yoki LIBERO maʼlumotnoma buyrugʻi kabi --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' bilan kvantillarni oʻtkazib yuboring.

Uchta sukut boʻyicha sozlamalar toʻplami va ulardan qaysilari oʻqituvchiga yetib boradi

openpi's TrainConfig mos yozuvdir, LeRobot's PI05Config esa siz hech narsa demaganingizda lerobot-train foydalanadigan konfiguratsiyadir va bu yerdagi shakl uchinchi to'plamni yuboradi. Ajablanarlisi shundaki, o'rganish tezligi: ikkala yuqori oqim sukut bo'yicha 2.5e-5 ga yetadi, openpi'ning o'z pi05_libero konfiguratsiyasi va ushbu platforma esa uni 5e-5 ga ko'taradi.

Sozlamaopenpi TrainConfiglerobot pi05 va lerobot-trainAY-Robots yuboradi
Paket hajmi3281
Eng yuqori o'rganish tezligi2.5e-5, kosinusli pasayishoptimizer_lr 2.5e-55e-5
O'qitish bosqichlari30,000100,00030,000
Nazorat nuqtasi oralig'i1,000 qadam20,000 qadamshaklda yo'q
Urug'421,000shaklda
Harakat bo'lagiaction_horizon 50chunk_size 50, n_action_steps 50shaklda yo'q
Og'irlik turibfloat16float32 until you pass --policy.dtypeshaklda yo'q
Gradient to'planishibunday tugma yo'q, buning o'rniga fsdp_devicesabsent from every release so far16, va u tushirildi

Port ishonchlimi? LeRobot jamoasi LIBERO bazaviy modelini qo'shimcha 6 ming qadam uchun nozik sozlab, openpi'ning to'rtta to'plamdagi mos yozuv raqamlari bilan solishtirdi: 97.5 foiz o'rtacha 96.85 ga qarshi, Libero 10 da oldinda, Spatial da orqada. Yo'l asbob tanlovi, sifat tanlovi emas.

Pi0.5 ni o'z ma'lumotlaringizda nozik sozlash
Afzalliklar
  • Ortida 10,000 soatdan ortiq robotni oldindan o'qitish bor, shuning uchun vazifangizning 50 ta epizodi yetarli bo'lishi mumkin.
  • Uzluksiz harakatlar: sozlash uchun tokenizator yo'q, bo'g'in burchaklaringizda diskretizatsiya chegarasi yo'q.
  • LeRobot porti LIBERO o'rtacha ko'rsatkichida openpi'ning 96.85 ga qarshi 97.5 foiz ball to'playdi, shuning uchun qulayroq CLI hech qanday o'lchanadigan xarajatga ega emas.
  • Ikkala tomonda ham parametr-samarali yo'llar: openpi'ning JAX LoRA variantlari, LeRobot'ning PEFT integratsiyasi.
Kamchiliklar
  • To'liq nozik sozlash uchun 70 GB dan ortiq joy kerak. 22.5 GB LoRA raqami openpi'ning JAX raqamidir; PEFT ostida pi05 uchun hech qanday ma'lumot e'lon qilinmagan.
  • Harakat bosqichi uchun 485 ms, bu yerdagi beshtadan eng sekin: SmolVLA dan ikki barobar, ACT dan yigirma to'rt barobar.
  • LeRobot v3.0 talab qilinadi, shuning uchun GR00T ishga tushirish uchun yozilgan ma'lumotlar to'plamini o'zgartirish kerak, va aksincha.
  • Yangi imkoniyatlar avval asosiy tarmoqqa tushadi: o'qitish vaqtidagi RTC va MEM xotirasi 0.6.1 da yo'q, shuning uchun eng yangi hujjatlar git'dan o'rnatishni anglatishi mumkin.

485 ms haqiqat va u qayerda yaroqsiz bo'lib qoladi

Bu sizning loyihangizni hal qiladi, shuning uchun u xarajatlar jadvalidan oldin keladi. Pi0.5 uchun bu yerda o'lchangan har bir harakat bosqichi uchun 485 ms. Qolgan to'rttasiga qarshi:

SiyosatHarakat bosqichi uchun xulosaParametrlarGPU darajasiMinimal epizodlar
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots GR00T N1.7 va Pi0.5 uchun parametrlar, GPU darajasi, kechikish va ma'lumotlar to'plami formati bilan to'qnashuv sahifasi
Bir xil GPU darajasi, bir xil epizod chegarasi, turli ma'lumotlar to'plami versiyasi, uch barobar kechikish farqi.
Xulosa chiqarish servolar yonida bo'lishi kerak

Ushbu beshta model bo'ylab boshqaruv sikli har bir harakat bosqichi uchun 20 dan 485 ms gacha ishlaydi. 485 ms ustiga jamoat interneti bo'ylab borib-kelishlar ishlaydigan siyosatni ikkilanuvchan siyosatga aylantiradi. Masofaviy xulosa chiqarish sekin tanlash va joylashtirish uchun maqbul, tezkor reaktiv harakat uchun emas. Biz LANda ishlaydigan demo sotishdan ko'ra, shuni aytishni afzal ko'ramiz. Agar qo'lingiz bo'laklar orasida to'xtab qolsa, harakat o'rtasida siyosat muzlashidan boshlang.

Yuqori oqimda javob bor va uning yarmi siz o'rnatishingiz mumkin bo'lgan relizda allaqachon mavjud. Real-Time Chunking qo'l hozirgi bo'lakni bajarayotgan paytda keyingi bo'lakni yaratadi, so'ngra yangi bo'lakning bir-biriga mos keladigan qadamlarini allaqachon bajarilgan qismga yaqin turishga yo'naltiradi, shunda qo'l birikma joyida to'xtab qolmaydi yoki silkinmaydi. Xulosa chiqarish vaqtidagi shakl Pi0, Pi0.5 va SmolVLA uchun 0.4.2 o'zgarishlar jurnalida chiqarilgan va bu qayta o'qitish emas, balki rollout flagidir:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon bu yangi bo'lak avvalgi bo'lakning qancha qadamiga mos kelishi kerakligini bildiradi; RTC hujjatlarida 8 dan 12 gacha odatiy diapazon sifatida ko'rsatilgan. Standart xulosa chiqarish backend --inference.type=sync.

Bu modelni tezlashtirmaydi. Bu bo'shliqni yashiradi: 485 ms hali ham sarflanadi, ammo muhim yo'ldan tashqarida, shuning uchun navbat bo'laklar orasida qurib qolmaydi. arXiv 2512.05964 dagi o'qitish vaqtidagi variant yanada uzoqroqqa boradi: model toza harakat prefiksiga shart qo'yishni o'rganadi, shuning uchun xulosa chiqarishda bir-biriga mos kelish yo'naltirilgan o'rniga har bir harakat uchun oqim vaqt qadamlari bilan qattiq bo'yaladi va yo'naltirishning orqaga o'tishi yo'qoladi. O'qitish davomida u har bir misol uchun prefiks uzunligini tanlaydi va qolgan postfiksda oqim yo'qotishini oladi. Bu flag faqat mainda mavjud, 0.6.1 da emas, va siz o'qitadigan kechikish chunk_size dan past bo'lishi kerak.

Pi0.5 checkpoint olishning ikki yo'li

Siz 80 GB kartani ijaraga olasiz yoki egasiz, yuqoridagi staklardan birini o'rnatasiz, ma'lumotlar to'plamingizni o'zgartirasiz va ishni nazorat qilasiz. Siz har bir sozlamani saqlab qolasiz: openpi'ning JAX LoRA, LeRobot'ning PEFT adapterlari, nisbiy harakatlar, maxsus tugmalar xaritalari. Siz har bir muvaffaqiyatsizlikni ham saqlab qolasiz.

  • Uskuna: A100 80 GB yoki H100, yoki openpi'ning JAX LoRA yo'lida 24 GB karta.
  • O'rnatish: birinchi ishga tushirish uchun bir tushdan keyin, asosan tugmalar xaritasi va gated tokenizer.
  • Xosting qilingan shaklda emas: PEFT adapterlari, nisbiy harakatlar, o'qitish vaqtidagi RTC, MEM xotirasi.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Xosting qilingan shakl ishga tushirmaydigan va pip o'rnatolmaydigan buyruq: o'qitish vaqtidagi RTC asosiy tarmoq bayrog'idir.

Ishlamaganda

SemptomEng ehtimoliy sabab
Ishga tushishdan oldin rad etildiMa'lumotlar to'plami v2.1, lekin Pi0.5 v3.0 ni xohlaydi, yoki GR00T uchun teskarisi
ImportError, datasets paketi yo'qlerobot 0.6.x o'qitish qo'shimchasiz
Birinchi paketda q01 va q99 haqida ValueErrormeta/stats.json da kvantillar yo'q; qayta hisoblang yoki MEAN_STD dan foydalaning
0-qadamda CUDA xotirasi tugadi70 GB dan past to'liq nozik sozlash; checkpointing yoki train_expert_only ni sinab ko'ring
401 yoki gated repo xatosiPaliGemma tokenizer litsenziyasi qabul qilinmagan
Yo'qotish kamayadi, robot hech narsa qilmaydiNormalizatsiya mos kelmasligi, yoki siyosat holatni nusxalaydi
Qo'l bo'laklar orasida to'xtaydiHar bir qadam uchun kechikish va borib-kelish; bo'lak navbati quriydi
Bir sozlamada ishlaydi, boshqasida ishlamaydiJuda kam epizodlar, yoki hammasi bir konfiguratsiyada

Bitta ishlanmaning narxi

Pi0.5 qimmat toifaga kiradi, chunki unga 80 GB karta kerak va spot narxlar o'zgaruvchan, shuning uchun ko'rsatkich narx emas, balki diapazon hisoblanadi. Ko'pgina SO-100 vazifalari uchun avval 24 GB toifasida SmolVLA yoki ACT ni o'rgating, vazifaning umuman o'rganilishi mumkinligini tasdiqlang, keyin unga A100 soat sarflang. Birinchi siyosatingizni o'rgating o'sha arzonroq siklni ko'rsatadi, va narxlar joriy toifalarni o'z ichiga oladi.

ToifaSiyosatlarOdatiy ishlanmaSoatiga narxIshlanma narxi
A100 80 GB yoki H100Pi0.5, GR00T N1.7, GR00T N1.53 dan 6 soatgacha1.20 dan 2.00 USD gachataxminan 4 dan 12 USD gacha
RTX 4090 yoki har qanday 24 GB kartaSmolVLA, ACT2 dan 5 soatgacha0.30 dan 0.60 USD gachataxminan 1 dan 3 USD gacha
AY-Robots narxlar jadvali, unda har bir siyosatga qaysi GPU kerakligi, odatiy ish vaqti va narxi, shuningdek, siyosat foydali bo'lishidan oldin qancha epizod kerakligi ko'rsatilgan.
Mahsulot sahifasidagi bir xil ikki daraja: Pi0.5 80 GB kartani ijaraga oladi, SmolVLA va ACT 4090 ga sig'adi.

Bir kechani sarflashdan oldin: GR00T N1.7 against Pi0.5 va Pi0.5 against SmolVLA bir xil raqamlarni yonma-yon taqqoslaydi. Arena 332 ta benchmark natijasi bilan 85 ta VLA modelini o'z ichiga oladi, ularning har biri o'z manbasiga bog'langan va oila haqida ma'lumot bizning VLA umumiy ko'rinishimizda.

Stackni qurmasdan Pi0.5 ni o'qiting

Ma'lumotlar to'plamini va giperparametrlarni shaklda tanlang. Backend spot bozorida 80 GB kartani ijaraga oladi, o'qituvchini ishga tushiradi va nazorat nuqtalarini ob'ekt saqlash joyiga yozadi. SO-100, SO-101, Koch v1.1 va LeKiwi uchun qo'llanmalar.

O'qitish qo'llanmalarini ochish
Pi0.5 ni RTX 4090 da fine-tune qila olamanmi?

To'liq fine-tune emas: openpi buning uchun 70 GB dan ortiq ko'rsatadi, shuning uchun A100 80 GB yoki H100. Uning 22.5 GB LoRA ko'rsatkichi JAX yo'liga tegishli; PyTorch implementatsiyasida LoRA yo'q. LeRobot'ning PEFT integratsiyasi mavjud, ammo uning hujjatlashtirilgan misoli SmolVLA va pi05 uchun VRAM ko'rsatkichi e'lon qilinmagan.

Menga qancha epizod kerak?

Ellik, GR00T va ACT bilan bir xil minimal chegara; faqat SmolVLA pastroq, 30 ta. Asosiy nazorat nuqtasi 10,000 soatdan ortiq oldindan o'qitishni o'z ichiga oladi, shuning uchun fine-tune noldan o'rganishdan ko'ra moslashadi: 50 ta toza, xilma-xil epizodlar bitta konfiguratsiyadan olingan ikki yuztasini yengadi.

What is the difference between --policy.path and --policy.pretrained_path?

--policy.path og'irliklar va nazorat nuqtasining config.json faylini yuklaydi, shuning uchun n_action_steps kabi saqlangan sozlamalar meros qilib olinadi va --policy.type o'tkazib yuborilishi kerak. --policy.pretrained_path faqat og'irliklarni yuklaydi: xususiyat nomlari sizning ma'lumotlar to'plamingizdan keladi, saqlangan sozlamalar qayta tiklanadi, --policy.type talab qilinadi. Shuning uchun LIBERO buyrug'i n_action_steps=10 va empty_cameras=1 ni aniq o'tkazadi; aks holda ular 50 va 0 ga qaytadi.

Ochiq versiya menga maqoladagi to'liq Pi0.5 ni beradimi?

Yo'q. Ikkalasi ham faqat oqim moslashuvchi harakat boshini qo'llab-quvvatlaydi. FAST harakat tokenizatori va yuqori darajadagi kichik vazifa bashorati bilan diskret-token oldindan o'qitish bosqichi chiqarilmagan va lerobot/pi05_base kartasi bu ro'yxatga RL ni qo'shadi, garchi pi0.5 maqolasida mustahkamlash o'rganish bosqichi tasvirlanmagan bo'lsa ham. Siz uzoq vazifani o'zi ajratadigan modelni emas, balki siz taqdim etgan til satriga bog'liq past darajadagi siyosatni o'rgatasiz.

Bu qo'llanma qaysi versiyalarga qarshi yozilgan?

main dagi openpi va 2026 yil 3 avgustdan beri chiqarilgan lerobot 0.6.1, ikkalasi ham 2026 yil 23 avgustda o'qilgan. v3.0 ma'lumotlar to'plamlari 2025 yil oktyabr oyida 0.4.0 bilan keldi. 0.6.0 asosiy paketni yengil qildi, shuning uchun lerobot[pi] o'zi endi o'qitish stackini o'rnatmaydi va joylashtirishni lerobot-rollout ga ko'chirdi. O'qitish vaqtidagi RTC faqat main da; bu yerdagi joylashtirilgan o'qituvchi 0.5.1 da ishlaydi.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started