AY-Robots сургалтын матриц: таван бодлого мөрөнд, дөрвөн робот гар баганад, нэгж нүд нь тодорхой нарийн тааруулах гарын авлага руу холбогдсон байна.
Pi0.5Урсгал ТааруулалтVLA СургалтLeRobotНарийн Тааруулалт

Өөрийн роботын өгөгдөл дээр Pi0.5-ыг хэрхэн сургах вэ

AY-Robots ResearchAugust 23, 202616 мин унших

Physical Intelligence-ийн урсгал тааруулах VLA болох Pi0.5-ыг өөрийн роботын өгөгдөл дээр нарийн тааруулна. openpi болон lerobot pi05-д зориулсан бодит тушаалууд, өгөгдлийн багцын форматын урхи, VRAM болон хоцролтын хязгаарлалтууд.

Pi0.5 нь өмнө нь үзэгдээгүй өрөөнд бодлого хэрэгжүүлэх шаардлагатай үед таны сонгох загвар юм. Энэ нь мөн энд байгаа таван сургах боломжтой бодлогууд-ын хамгийн төвөгтэй нь бөгөөд нарийн тааруулах гараар хийхэд: эх репозитор нь эхлээд JAX, LeRobot порт нь 0.6.0 хувилбарт lerobot-record-оос байршуулалтыг шилжүүлж, суурь суулгалтыг сургахад хэтэрхий жижиг болгосон, мөн бүрэн нарийн тааруулалт нь 4090-д багтахгүй. Доор: урсгалын тааруулалт таамаглалд хэр их зардалтай болох, хоёр командын зам, мөн үр дүн ашиглах боломжтой эсэхийг шийддэг 485 мс тоо.

Таны мэдэх ёстой зүйлс

  • Урсгалын тааруулалттай VLA: 3B PaliGemma VLM дээр 300M үйлдлийн эксперт нэмэгдэж, тасралтгүй үйлдлийн хэсгүүдийг тайлдаг. Үүнийг нарийн тааруулах хоёр зам, openpi болон LeRobot pi05, LIBERO дунджаар 0.65 оноогоор ялгаатай.
  • Бүрэн нарийн тааруулалт нь 70 ГБ-аас дээш VRAM шаарддаг. openpi нь LoRA-г 22.5 ГБ-аар, зөвхөн JAX зам дээрээ жагсаасан.
  • Өгөгдлийн багц нь meta/stats.json дотор q01 болон q99 квантилтай LeRobotDataset v3.0 байх ёстой, эс бөгөөс багц алдаа өгнө.
  • Эхлээд lerobot хувилбараа шалгана уу: 0.6.0 нь суурь багцыг хөнгөн болгож, байршуулалтыг lerobot-record-оос шилжүүлсэн.
  • Энд энэ нь үйлдлийн алхам тутамд 485 мс-ээр ажилладаг, 50 анги шаарддаг, мөн нэг ажиллуулалт нь ойролцоогоор 4-12 USD үнэтэй.

Pi0.5 үнэндээ юу вэ

Physical Intelligence 2024 оны 10-р сард pi0-г нийтэлсэн: урсгалын тааруулалттай хараа-хэл-үйлдлийн загвар урьдчилан сургасан VLM дээр: 3 тэрбум параметртэй PaliGemma дээр 300M үйлдлийн экспертийг тэгээс эхлүүлсэн, нийт 3.3 тэрбум. Уг баримт бичигт 7 роботын тохиргоо, 68 даалгаврын хүрээнд 10,000 гаруй цагийн роботын өгөгдөл дээр урьдчилан сургасан тухай дурдсан. Дэлгэрэнгүйг pi0 нийтлэлээс.

Pi0.5 (arXiv 2504.16054, 22 April 2025) нь тэрхүү араг ясыг хадгалж, сургалтын хоолны дэглэмийг өөрчилсөн: вэб мэдээлэл, объектын илрүүлэлт, роботыг сургаж буй хүмүүсийн аман заавар, дэд даалгаврын шошго, олон гэрт байгаа роботуудаас авсан бие даасан мэдээлэл. Үр дүн нь сургалтын багцад ороогүй байшингуудад гал тогоо цэвэрлэж буй робот юм. openpi README нь гарчигт байхгүй нэгэн дэлгэрэнгүй мэдээллийг нэмсэн: хувилбарт гарсан pi0.5 нь мэдлэгийн тусгаарлалтаар (arXiv 2505.23705) сургагдсан.

Шинж чанарpi0pi0.5
VLM үндсэн хувилбарgemma_2b (PaliGemma)gemma_2b (PaliGemma)
Үйлдлийн мэргэжилтний хувилбарgemma_300mgemma_300m
action_dim3232
action_horizon анхдагч5050
max_token_len48200
дискрет төлөвийн оролтfalsetrue, төлөвийг сануулгад савнуудад хуваасан
Үндсэн шалгах цэгgs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Олон нийтэд ил болсон нь бүхэл бүтэн өгүүлэл биш

openpi README нь тодорхой заасан: энэхүү репозитори нь зөвхөн урсгалын тааруулах толгойг дэмждэг бөгөөд pi0.5-ийн сургалт болон дүгнэлт хийхэд адилхан. Уг өгүүлэлд хоёр үе шатыг тайлбарласан бөгөөд код нь зөвхөн хоёр дахь үе шатыг агуулдаг: урьдчилсан сургалт нь FAST токенизатороор дамжуулан үйлдэл бүрийг дискрет токен болгон илэрхийлдэг бөгөөд байршуулах үед загвар нь үйлдэл бүрийн өмнө өндөр түвшний дэд даалгаврыг дүгнэдэг. Эдгээрийн аль нь ч репозиторид байхгүй. lerobot/pi05_base карт нь ижил жагсаалтыг өгч, RL-ийг нэмсэн боловч pi0.5 өгүүлэлд ямар ч бэхжүүлсэн сургалтын үе шатыг огт тайлбарлаагүй. LeRobot порт нь энэхүү хамрах хүрээг өвлөн авсан бөгөөд үүн дээр байршуулсан сургагч багш бүр, түүний дотор энд байгаа нь ч мөн адил. Лиценз нь мөн хуваагдсан: pi05 баримт бичгийн хуудас нь Apache 2.0 гэж заасан бол lerobot/pi05_base карт нь license: gemma гэж тэмдэглэгдсэн байна.

Урсгалын тааруулалт нь сургалт болон дүгнэлтэд юуг өөрчилдөг вэ

SO-100 дээр сургаж болох бодлого нь үйлдлүүдийг шууд регресс хийдэг (ACT) эсвэл токен болгож, авторегрессив байдлаар тайлдаг (pi0-FAST). Урсгалын тааруулалт нь аль алиныг нь хийдэггүй: энэ нь дуу чимээг цэвэр үйлдлийн хэсэг рүү зөөдөг векторын талбарыг сурч, дараа нь нэгтгэдэг. pi0-ийн баримт бичигт 0.1 алхамтай 10 нэгтгэх алхам ашигладаг; LeRobot-ийн pi05 тохиргоо нь ижил num_inference_steps: int = 10-ийг агуулдаг.

  • Сургалт: алдагдал нь дуу чимээтэй үйлдлийн хэсгийг регресс хийдэг. Тохируулах токенжуулагч байхгүй, үений өнцгийг дискретчлэх шаардлагагүй.
  • Дүгнэлт: нэг хэсэг нь үйлдлийн экспертээр дамжуулан арван урагш дамжуулалт хийх зардалтай. Энэ нь бүтцийн шинж чанартай бөгөөд тохируулах асуудал биш.
  • Гаралт: 32 хэмжээст тасралтгүй үйлдлүүд, дотооддоо дүүргэгдсэн, роботын тань хэмжээсүүд дээр алдагдал тооцогддог. 6-DoF гар болон баригч нь 7-г ашигладаг.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
openpi-ийн үндсэн салбар дахь src/openpi/models/pi0_config.py файлаас 2026 оны 8-р сарын 23-нд уншив.

PaliGemma-ийн үндсэн бүтэц, болон түүний урд талын хаалга

PaliGemma (arXiv 2407.07726) нь SigLIP-So400m харааны кодлогч бөгөөд Gemma-2B хэлний загвар дээр суурилсан, ойролцоогоор 3 тэрбум параметр юм. Pi0.5 нь өөрийн токенизаторыг өвлөн авсан бөгөөд энэ токенизатор нь хаалттай репозиторит байрладаг. Эхний ажиллагаа ихэвчлэн эхний сургалтын алхам хийгдэхээс өмнө зогсдог.

GPU түрээслэхээсээ өмнө хаалттай лицензийг хүлээн зөвшөөрнө үү

LeRobot pi05-ийн баримт бичигт тодорхой заасан байдаг: pi0.5 нь хаалттай google/paligemma-3b-pt-224 токенизаторыг ашигладаг тул Hub дээрх лицензийг хүлээн зөвшөөрч, эхлээд hf auth login командыг ажиллуулна уу. Нэвтрэх эрхийг гараар олгодог, шууд биш. Үүнийг алгасаж, төлбөртэй үүлэн ажиллагааг эхлүүлбэл, та токенизатор татаж чадахгүй под-ын төлбөрийг төлөх болно.

Эхлэхээсээ өмнө: өгөгдлийн багцын формат, эпизодууд, техник хангамж

LeRobot дахь Pi0.5 нь LeRobot өгөгдлийн багц v3.0 зохион байгуулалтаар уншдаг бөгөөд энэ нь 2025 оны 10-р сард lerobot 0.4.0-той хамт гарсан: нэг файл тутамд нэг эпизод байхын оронд Parquet болон MP4 файл тутамд олон эпизодтой, мөн файлын нэрийн оронд meta/episodes/ дотор хил хязгаартай байна. ширээний компьютер клиент ашиглан бичлэг хийх эсвэл анхны өгөгдлийн багцаа бичих зааврыг дагаж хийвэл танд бэлэн болно.

ГоримШаардагдах GPU санах ойЖишээ GPU
Дүгнэлт гаргахmore than 8 GBRTX 4090
Нарийвчилсан тааруулалт, LoRAmore than 22.5 GBRTX 4090
Нарийвчилсан тааруулалт, бүрэнmore than 70 GBA100 80 GB or H100
Нэг өдөр үрчихдэг хувилбарын урхи

Pi0.5 болон SmolVLA нь LeRobot v3.0-ийг шаарддаг. GR00T N1.7 болон GR00T N1.5 нь v2.0 эсвэл v2.1-ийг шаарддаг бөгөөд v3.0 өгөгдлийн багц дээр алдаа гардаг. Нэг бичлэгийн сесс нь хөрвүүлэлтгүйгээр хоёуланг нь тэжээх боломжгүй бөгөөд алдаа нь "өгөгдлийн багцын буруу хувилбар" гэж хэлдэггүй. Үзнэ үү: өгөгдлийн багц татгалзсан: v3 шаардлагатай.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
LeRobotDataset v3.0 баримт бичгээс.

Платформ нь Pi0.5-д дор хаяж 50 анги шаарддаг бөгөөд энэ нь GR00T болон ACT-тэй ижил хэмжээ юм. Урьдчилсан сургалт нь хүнд ажлыг гүйцэтгэдэг тул 50 цэвэр анги нь 200 хайнга ангиас илүү үр дүнтэй. Үүнд шинээр орж байна уу? Эхлэхдээ өгөгдөл цуглуулах гарын авлагаар.

AY-Robots-ийн бодлогын хуудас нь таван сургах боломжтой бодлогыг параметр, GPU түвшин, хоцрогдол болон хамгийн бага эпизодоор харьцуулсан байна.
Pi0.5 нь A100 болон H100 түвшинд нэг үйлдлийн алхамд 485 мс хурдтай, хамгийн багадаа 50 эпизодтойгоор ажилладаг.

Зам А: openpi репозитороор нарийн тааруулах

Лавлагаа хэрэгжилт: Эхлээд JAX, зөвхөн Ubuntu 22.04 дээр туршигдсан, флаг ашиглахын оронд конфиг объектоор удирдагддаг. PyTorch зам нь 2025 оны 9-р сард гарч ирсэн бөгөөд LIBERO дээр баталгаажсан. Гурван алхам: өгөгдлөө хөрвүүлэх, конфиг тодорхойлох, сургах, үйлчлэх.

  1. 1
    Клондож суулгах

    openpi нь uv-г ашигладаг. GIT_LFS_SKIP_SMUDGE нь LeRobot-г LFS blobгүйгээр хамааралтай болгох боломжийг олгодог.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Өгөгдлөө LeRobot өгөгдлийн санд хөрвүүлэх

    Upstream нь LIBERO болон DROID-д зориулсан хөрвүүлэгчдийг нийлүүлдэг бөгөөд танаас нэгийг нь дасан зохицуулахыг хүлээдэг. Ажил нь түлхүүрийн зураглал юм.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Сургалтын конфиг нэмэх

    Конфигууд нь src/openpi/training/config.py доторх TrainConfig бичиглэлүүд юм. Энэ нь pi05_droid_finetune-г дасан зохицуулж, жин ачаалагчийг pi05_base руу чиглүүлсэн байна.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Хэвийн статистикийг тооцоолох

    Өгөгдлийн сангийн нэрээр биш, конфигийн нэрээр ажилладаг. Үүнийг алгасах нь эндхийн сонгодог анхны алдаа юм.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Сургах

    Энэ хувьсагч нь JAX-д GPU санах ойн 90 хувийг ашиглах боломжийг олгодог бөгөөд анхдагч 75 хувийн оронд. 80 ГБ карт дээр энэ нь ажиллагаа амжилттай болох эсэхийг шийддэг.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Үйлчлэх

    Сервер нь 8000 порт дээр сонсож, ажиглалтын хүсэлтүүдэд хариулдаг; таны роботын ажиллах орчин нь клиент юм.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch зам нь JAX зам биш

openpi-ийн PyTorch хэрэгжүүлэлт нь pi0-FAST, холимог нарийвчлал, FSDP, LoRA эсвэл EMA жинг дэмждэггүй тул 22.5 GB хүрдэг LoRA нь зөвхөн JAX-д gemma_2b_lora болон gemma_300m_lora хувилбаруудаар дамжин ажилладаг. Үүнээс ч муу нь: уг тохиргоо нь засварласан файлуудыг таны суулгасан transformers 4.53.2 дээр хуулдаг бөгөөд README нь uv-ийн анхдагч hardlink горимоор энэ нь uv кэш дэх transformers-ийг байнгын өөрчилдөг бөгөөд бусад төслүүдэд нөлөөлж болзошгүйг анхааруулдаг. Үүнийг uv cache clean transformers тушаалаар буцаана.

Зам Б: lerobot pi05-аар нарийн тааруулах

LeRobot порт нь таны аль хэдийн ашигладаг CLI доторх ижил жингүүдийг ACT болон SmolVLA. Доорх бүх зүйлийг 2026 оны 8-р сарын 3-наас хойш гарсан lerobot 0.6.1 хувилбар болон 2026 оны 8-р сарын 23-ны pi05 баримт бичигтэй тулгаж шалгасан. Энд хувилбарууд чухал: v3.0 өгөгдлийн багцууд 2025 оны 10-р сард 0.4.0-тэй хамт ирсэн, 2026 оны 3-р сарын 9-ний 0.5.0 блог нь pi0-FAST болон Real-Time Chunking-ийг танилцуулсан, мөн 2026 оны 7-р сарын 6-ны 0.6.0 нь үндсэн багцыг хөнгөн болгож, байршуулалтыг lerobot-rollout руу шилжүүлсэн.

Нэг зүйл хөдлөөгүй: lerobot-train болон lerobot-record нь 2025 оны 8-р сард 0.3.2 хувилбарт аль хэдийн нэвтрэх цэгүүд байсан. Одоо ч гэсэн python -m lerobot.scripts.train гэж дууддаг заавар нь нэг жилийн өөрчлөлтөөс өмнөх үеийнх бөгөөд бусад зүйл дээр ч итгэхгүй байх нь зүйтэй.

  1. 1
    Зөв нэмэлтүүдээр суулгах

    0.6.0 хувилбараас хойш суурь суулгац нь зөвхөн үндсэн ML хамаарлыг агуулдаг бөгөөд pi нэмэлт нь өгөгдлийн багц эсвэл сургалтын кодыг нэмдэггүй тул нарийн тааруулахын тулд сургалтын нэмэлт хэрэгтэй болно. Хуучин нэг мөрүүд энд импортлох үед алдаа гардаг.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Нэвтрэх

    Хөтөч дээр paligemma-3b-pt-224 лицензийг хүлээн зөвшөөрөөд, дараа нь сургалт хийх машинд нэвтэрнэ үү.

    bash
    hf auth login
  3. 3
    Квантил статистик нэмэх

    Pi0.5 нь STATE болон ACTION-ийг квантил ашиглан хэвийн болгодог тул meta/stats.json-д q01 болон q99 хэрэгтэй. Хуучин өгөгдлийн багцууд зөвхөн min, max, mean, std-ийг агуулдаг.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    lerobot/pi05_base-аас нарийн тааруулах

    Багцын хэмжээг таны картын тэсвэрлэх хэмжээнд тохируулна уу; баримт бичигт LIBERO дээр 80 ГБ-д 64-ийг ашигладаг. bfloat16-г тодорхой зааж өгнө үү, тохиргооны анхдагч утга нь float32 юм.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Үүнийг роботын гарт ажиллуулах

    0.6.x хувилбарт энэ нь lerobot-rollout юм: lerobot-record нь бодлогыг хүлээн зөвшөөрдөггүй бөгөөд eval_ өгөгдлийн багцын нэрийг татгалздаг. Base нь гарыг удирддаг, sentry нь rollout-ийг бичдэг.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
ТугЮу хийдэгТэмдэглэл
--policy.type=pi05Pi0.5-ийг сонгоноpretrained_path-тай хамт заавал байх ёстой, --policy.path-тай хамт орхиж болно
--policy.pretrained_pathзөвхөн жинг ачаалнатанай өгөгдлийн багцаас онцлог нэрс, хадгалагдсан тохиргоог дахин тохируулна
--policy.pathжингүүд болон checkpoint config.jsonn_action_steps зэрэг хадгалагдсан тохиргоог өвлөнө
--policy.n_action_stepsхэсэг тутамд хэрэглэгдэх алхамууд50 руу буцна, chunk_size-аас хэзээ ч хэтрэхгүй (анхдагч 50)
--policy.train_expert_onlyVLM-ийг царцааж, экспертийг сурганаанхдагч утга false, бага санах ой, амжилтад зарим зардал гарна
--policy.gradient_checkpointingидэвхжүүлэлтийг хадгалахын оронд дахин тооцоолноанхдагч утга false, ажиллуулах боломжгүй үед анхны хөшүүрэг
--peft.method_type=LORAБүрэн жингийн оронд LoRA адаптеруудpeft нэмэлт хэрэгтэй, баримтжуулсан жишээ нь SmolVLA
--policy.rtc_training_max_delayRTC-д зориулсан үйлдлийн угтвар нөхцөлзөвхөн үндсэн салбарт, 0.6.1-д байхгүй, chunk_size-аас доош байх ёстой
--rename_mapөгөгдлийн багцын багануудыг бодлогын онцлог шинж чанаруудад зурагланатанай камерын түлхүүрүүд өөр байвал хэрэгтэй
Ихэнх анхны ажиллагаанд гардаг алдаа

Квантилгүйгээр та эхний багц дээр ValueError: QUANTILES normalization mode requires q01 and q99 stats алдааг авах болно. Статистикийг дахин тооцоол, гэхдээ үр дүн нь --dataset.repo_id-ийн уншдаг кэш биш, харин $HF_LEROBOT_HOME/your_dataset-д хадгалагдана, тиймээс --dataset.root-ийг тэнд чиглүүлэн сургалт хийх эсвэл Hub руу түлхэх хэрэгтэй. Эсвэл LIBERO-ийн лавлах команд шиг --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' ашиглан квантилийг алгасаж болно.

Гурван төрлийн анхдагч утгууд, болон тэдгээрийн аль нь сургагчид хүрдэг

openpi-ийн TrainConfig нь лавлагаа, LeRobot-ийн PI05Config нь та юу ч хэлэхгүй үед lerobot-train-ийн ашигладаг зүйл бөгөөд энд байгаа маягт нь гурав дахь багцыг илгээдэг. Гэнэтийн зүйл бол суралцах хурд юм: хоёулаа эхний тохиргоо нь 2.5e-5-д хүрч байхад, openpi-ийн өөрийн pi05_libero тохиргоо болон энэ платформ нь үүнийг 5e-5 болгож нэмэгдүүлдэг.

Тохиргооopenpi TrainConfiglerobot pi05 болон lerobot-trainAY-Robots илгээдэг
Багцын хэмжээ3281
Суралцах хурдны оргил2.5e-5, косинус задралoptimizer_lr 2.5e-55e-5
Сургалтын алхамууд30,000100,00030,000
Хяналтын цэгийн завсарлага1,000 алхам20,000 алхаммаягтад байхгүй
Үр421,000маягтад байгаа
Үйлдлийн хэсэгaction_horizon 50chunk_size 50, n_action_steps 50маягтад байхгүй
Жингийн өгөгдлийн төрөлbfloat16float32 та --policy.dtype дамжуулах хүртэлмаягтад байхгүй
Градиент хуримтлалийм тохируулга байхгүй, оронд нь fsdp_devicesодоог хүртэлх хувилбар бүрт байхгүй16, мөн хасагдсан

Порт нь үнэнч үү? LeRobot баг LIBERO суурь загварыг нэмэлт 6 мянган алхам сургаж, openpi-ийн лавлагаа тоотой дөрвөн багц дээр харьцуулсан: 96.85-тай харьцуулахад дунджаар 97.5 хувь, Libero 10 дээр илүү, Spatial дээр хоцорсон. Энэ зам нь чанарын сонголт биш, харин хэрэгслийн сонголт юм.

Өөрийн өгөгдөл дээр Pi0.5-ийг нарийн тааруулах
Давуу талууд
  • 10,000 гаруй цагийн роботын урьдчилсан сургалт хийгдсэн тул таны даалгаврын 50 анги хангалттай байж болно.
  • Тасралтгүй үйлдлүүд: тохируулах токенизатор байхгүй, үений өнцөгт дискретчилэл байхгүй.
  • LeRobot порт нь LIBERO-ийн дунджаар openpi-ийн 96.85-тай харьцуулахад 97.5 хувь оноо авдаг тул илүү ээлтэй CLI нь хэмжигдэхүйц зардалгүй.
  • Хоёр талд параметр-үр ашигтай замууд: openpi-ийн JAX LoRA хувилбарууд, LeRobot-ийн PEFT интеграц.
Сул талууд
  • Бүрэн нарийн тааруулалт нь 70 ГБ-аас илүү зай шаарддаг. 22.5 ГБ LoRA тоо нь openpi-ийн JAX тоо юм; PEFT дор pi05-д зориулсан нь хэвлэгдээгүй байна.
  • Үйлдлийн алхам тутамд 485 мс, энд байгаа таваас хамгийн удаан нь: SmolVLA-аас хоёр дахин, ACT-аас хорин дөрөв дахин удаан.
  • LeRobot v3.0 шаардлагатай тул GR00T ажиллуулахад бичигдсэн өгөгдлийн багцыг хөрвүүлэх шаардлагатай бөгөөд эсрэгээрээ.
  • Шинэ сонголтууд эхлээд үндсэн хувилбар дээр гардаг: сургалтын үеийн RTC болон MEM санах ой 0.6.1 хувилбарт байхгүй тул хамгийн сүүлийн үеийн баримт бичиг нь git-ээс суулгахыг хэлж болно.

485 мс-ийн бодит байдал ба түүнийг ашиглах боломжгүй болох цэг

Энэ нь таны төслийг шийддэг тул зардлын хүснэгтээс өмнө ирдэг. нь Pi0.5-д зориулж энд хэмжсэн үйлдлийн алхам тутамд 485 мс байна. Бусад дөрөвтэй харьцуулахад:

БодлогоҮйлдлийн алхам тутамд таамаглалПараметрүүдGPU зэрэглэлХамгийн бага ангиуд
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots-ийн GR00T N1.7 болон Pi0.5-ийн харьцуулсан хуудас, параметрүүд, GPU зэрэглэл, хоцролт болон өгөгдлийн багцын форматтай.
Ижил GPU зэрэглэл, ижил ангийн доод хязгаар, өөр өгөгдлийн багцын хувилбар, гурав дахин их хоцролтын зөрүү.
Дүгнэлт хийх нь сервогийн хажууд байрлах ёстой

Эдгээр таван загварын хяналтын давталт нь үйлдлийн алхам тутамд 20-485 мс ажилладаг. Нийтийн интернетийн 485 мс-ээс дээш хугацааны эргэлт нь ажиллаж буй бодлогыг эргэлзээтэй болгодог. Алсын дүгнэлт нь удаан сонгох, байрлуулахад тохиромжтой боловч хурдан хариу үйлдэл үзүүлэх хөдөлгөөнд тохиромжгүй. Бид зөвхөн LAN дээр ажилладаг демо зарахын оронд үүнийг хэлэх нь дээр. Хэрэв таны гар хэсгүүдийн хооронд түр зогсвол бодлого хөдөлгөөний дунд хөлддөг хэсгээс эхэлнэ үү.

Дээд урсгал нь хариулттай бөгөөд түүний тал хувь нь таны суулгах боломжтой хувилбарт аль хэдийн багтсан байна. Бодит цагийн хэсэгчилэл нь гар одоогийн хэсгийг гүйцэтгэж байхад дараагийн хэсгийг үүсгэж, дараа нь шинэ хэсгийн давхцаж буй алхмуудыг аль хэдийн гүйцэтгэсэн хэсэгт ойр байлгахаар чиглүүлдэг тул гар нь залгаасан дээр гацах эсвэл огцом хөдлөхгүй. Дүгнэлт хийх үеийн хэлбэр нь 0.4.2 хувилбарын өөрчлөлтийн бүртгэлд Pi0, Pi0.5 болон SmolVLA-д зориулагдан багтсан бөгөөд энэ нь дахин сургах биш, харин нэвтрүүлэх туг юм:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon нь өмнөх хэсгийн хэдэн алхамтай шинэ хэсэг нь тохирох ёстойг заана; RTC docs-т 8-аас 12-ыг ердийн хязгаар гэж заасан байдаг. Анхдагч дүгнэлтийн бэкэнд нь --inference.type=sync.

Энэ нь загварыг хурдасгахгүй. Энэ нь зайг нуудаг: 485 мс хэвээр зарцуулагддаг боловч чухал замаас гадуур байдаг тул дараалал нь хэсгүүдийн хооронд хоосордоггүй. arXiv 2512.05964-ээс авсан сургалтын үеийн хувилбар нь илүү гүнзгийрүүлсэн: загвар нь цэвэр үйлдлийн угтварт нөхцөл байдлыг сурдаг тул дүгнэлт хийх үед давхцал нь чиглүүлэгдсэн байдлаар биш, харин үйлдлийн урсгалын цагийн алхамуудаар хатуу будсан байдаг бөгөөд чиглүүлгийн урвуу дамжуулалт алга болдог. Сургалтын үед энэ нь жишээ тутамд угтварын уртыг түүвэрлэж, үлдсэн дагаврын урсгалын алдагдлыг авдаг. Тэр туг нь зөвхөн үндсэн хувилбарт байдаг, 0.6.1-д байхгүй бөгөөд таны сургах хугацааны саатал нь chunk_size-аас доош байх ёстой.

Pi0.5 чекпойнт авах хоёр арга

Та 80 ГБ карт түрээслэх эсвэл өмчлөх, дээрх стекүүдийн нэгийг суулгах, өгөгдлийн сангаа хөрвүүлэх, ажиллагааг хянах хэрэгтэй. Та бүх тохиргоог өөрөө хийнэ: openpi's JAX LoRA, LeRobot's PEFT адаптерууд, харьцангуй үйлдлүүд, захиалгат түлхүүрийн зураглал. Мөн та бүх алдааг өөрөө хариуцна.

  • Техник хангамж: A100 80 ГБ эсвэл H100, эсвэл openpi-ийн JAX LoRA зам дээрх 24 ГБ карт.
  • Тохиргоо: Эхний ажиллагаанд нэг үдээс, ихэвчлэн түлхүүрийн зураглал болон хаалттай токенайзер.
  • Хостлогдсон хэлбэрт байхгүй: PEFT адаптерууд, харьцангуй үйлдлүүд, сургалтын үеийн RTC, MEM санах ой.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Хостлогдсон хэлбэрээр ажилладаггүй, pip суулгаж чаддаггүй тушаал: сургалтын үеийн RTC нь үндсэн салбарын флаг юм.

Ажиллахгүй үед

Шинж тэмдэгХамгийн их магадлалтай шалтгаан
Ажиллагаа эхлэхээс өмнө татгалзсанӨгөгдлийн сан v2.1 боловч Pi0.5 нь v3.0-ийг хүсдэг, эсвэл GR00T-ийн хувьд эсрэгээрээ
ImportError, datasets багц байхгүйlerobot 0.6.x сургалтын нэмэлтгүйгээр
Эхний багц дээрх q01 болон q99-ийн тухай ValueErrormeta/stats.json дотор квантил байхгүй; дахин тооцоолох эсвэл MEAN_STD ашиглах
0-р алхам дээр CUDA санах ой дууссан70 ГБ-аас доош бүрэн нарийн тааруулалт; чекпойнт хийх эсвэл train_expert_only-г оролдоно уу
401 эсвэл хаалттай репо алдааPaliGemma токенайзерийн лицензийг хүлээн аваагүй
Алдагдал буурч, робот юу ч хийхгүй байнаХэвийн болгох зөрүү, эсвэл бодлого нь төлөвийг хуулбарлаж байна
Гар хэсгүүдийн хооронд түр зогсоноАлхам тутамд хоцролт нэмэх нь эргэлтийн хугацаа; хэсгийн дараалал хоосорно
Нэг тохиргоонд ажиллаж, нөгөөд нь бүтэлгүйтсэнХэт цөөн эпизод, эсвэл бүгд нэг тохиргоонд

Нэг ажиллагаа хэр үнэтэй вэ

Pi0.5 нь 80 ГБ карт шаарддаг тул үнэтэй түвшинд багтдаг бөгөөд спот үнэ хэлбэлздэг тул энэ нь үнэ биш харин үнийн хүрээ юм. Олон SO-100 даалгаврын хувьд эхлээд SmolVLA эсвэл ACT-г 24 ГБ түвшинд сургаж, даалгаврыг ер нь сурах боломжтой эсэхийг баталгаажуулсны дараа A100 цагийг зарцуулна. Анхны бодлогоо сургах нь хямд давталтыг тайлбарлаж, үнэ нь одоогийн түвшинг харуулдаг.

ТүвшинБодлогуудЕрдийн ажиллагааЦагийн үнэНэг ажиллагааны зардал
A100 80 ГБ эсвэл H100Pi0.5, GR00T N1.7, GR00T N1.53-аас 6 цаг1.20-аас 2.00 USDойролцоогоор 4-өөс 12 USD
RTX 4090 эсвэл бусад 24 ГБ картSmolVLA, ACT2-оос 5 цаг0.30-аас 0.60 USDойролцоогоор 1-ээс 3 USD
AY-Robots-ийн зардлын хүснэгт нь бодлого тус бүрд ямар GPU шаардлагатайг, ердийн ажиллах хугацаа болон үнийг, мөн бодлого ашигтай болохоос өмнө хэдэн эпизод хэрэгтэйг харуулсан.
Бүтээгдэхүүний хуудас дээрх ижил хоёр шатлал: Pi0.5 нь 80 ГБ карт түрээсэлдэг, SmolVLA болон ACT нь 4090 дээр багтдаг.

Оройг зориулахаасаа өмнө: болон нь ижил тоонуудыг нэг нэгэнтэй нь харьцуулж харуулдаг. нь 85 VLA загварыг 332 бенчмарк үр дүнтэйгээр агуулдаг бөгөөд тус бүр нь эх сурвалжтайгаа холбогдсон байдаг. Уг гэр бүлийн талаарх мэдээллийг -оос үзнэ үү.

Стек үүсгэхгүйгээр Pi0.5-ийг сургах

Өгөгдлийн багц болон хэт параметрүүдийг маягтаас сонгоно уу. Арын систем нь спот зах зээлээс 80 ГБ карт түрээсэлж, сургагчийг ажиллуулж, шалгах цэгүүдийг объектын санд бичдэг. SO-100, SO-101, Koch v1.1 болон LeKiwi-д зориулсан гарын авлагууд.

Сургалтын гарын авлагуудыг нээх
Би Pi0.5-ийг RTX 4090 дээр нарийн тааруулах боломжтой юу?

Бүрэн нарийн тааруулах боломжгүй: openpi үүнд 70 ГБ-аас дээш зай шаардлагатай гэж жагсаасан тул A100 80 ГБ эсвэл H100 хэрэгтэй. Түүний 22.5 ГБ LoRA үзүүлэлт нь JAX замд хамаардаг; PyTorch хэрэгжилт нь LoRA-гүй. LeRobot-ийн PEFT интеграцчлал байдаг ч түүний баримтжуулсан жишээ нь SmolVLA бөгөөд pi05-д зориулсан VRAM үзүүлэлт нийтлэгдээгүй байна.

Надад хэдэн эпизод хэрэгтэй вэ?

Тавин, GR00T болон ACT-тэй ижил доод хязгаар; зөвхөн SmolVLA 30-аар доогуур байдаг. Үндсэн шалгах цэг нь 10,000 гаруй цагийн урьдчилсан сургалтыг агуулдаг тул нарийн тааруулалт нь юунаас ч суралцах бус, харин дасан зохицдог: 50 цэвэр, олон янзын эпизод нь нэг тохиргооноос гарах хоёр зуун эпизодоос илүү үр дүнтэй.

--policy.path болон --policy.pretrained_path хоёрын ялгаа юу вэ?

--policy.path нь жин болон шалгах цэгийн config.json-ийг ачаалдаг тул n_action_steps зэрэг хадгалагдсан тохиргоог өвлөн авдаг бөгөөд --policy.type-ийг орхих ёстой. --policy.pretrained_path нь зөвхөн жинг ачаалдаг: онцлог шинж чанаруудын нэрс таны өгөгдлийн багцаас ирдэг, хадгалагдсан тохиргоог дахин тохируулдаг, --policy.type шаардлагатай. Тиймээс LIBERO команд n_action_steps=10 болон empty_cameras=1-ийг тодорхой дамжуулдаг; эс тэгвээс тэд 50 болон 0 руу буцдаг.

Нээлттэй хувилбар нь надад цаасан дээрх Pi0.5-ийг бүрэн өгөх үү?

Үгүй. Хоёулаа зөвхөн урсгалын тааруулалтын үйлдлийн толгойг дэмждэг. FAST үйлдлийн токенизатор болон өндөр түвшний дэд даалгаврын таамаглал бүхий дискрет-токен урьдчилсан сургалтын үе шат нь гараагүй бөгөөд lerobot/pi05_base карт нь уг жагсаалтад RL-ийг нэмдэг хэдийгээр pi0.5 цаас нь бэхжүүлэлтийн сургалтын үе шатыг тайлбарлаагүй байдаг. Та урт даалгаврыг өөрөө задалдаг загвар биш, харин таны өгсөн хэлний мөрөнд суурилсан бага түвшний бодлогыг сургадаг.

Энэхүү гарын авлагыг ямар хувилбаруудад зориулж бичсэн бэ?

openpi нь үндсэн хувилбар дээр болон lerobot 0.6.1, 2026 оны 8-р сарын 3-наас хойшхи хувилбар, хоёуланг нь 2026 оны 8-р сарын 23-нд уншсан. v3.0 өгөгдлийн багцууд 2025 оны 10-р сард 0.4.0-тэй хамт ирсэн. 0.6.0 нь үндсэн багцыг хөнгөн болгосон тул lerobot[pi] дангаараа сургалтын стек суулгахаа больж, байршуулалтыг lerobot-rollout руу шилжүүлсэн. Сургалтын үеийн RTC нь зөвхөн үндсэн хувилбар дээр байдаг; энд байршуулсан сургагч нь 0.5.1 хувилбарыг ажиллуулдаг.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started