AY-Robots оқыту матрицасы, бес саясат жолдар ретінде және төрт робот қолы бағандар ретінде, әрбір ұяшық нақты жіңішке баптау нұсқаулығына сілтеме болып табылады
Pi0.5Ағынды сәйкестендіруVLA оқытуLeRobotЖіңішке баптау

Pi0.5-ті өз робот деректеріңізде қалай үйретуге болады

AY-Robots ResearchAugust 23, 202616 мин оқу

Physical Intelligence компаниясының ағынды сәйкестендіруші VLA-сы Pi0.5-ті өз робот деректеріңізде жіңішке баптаңыз. openpi және lerobot pi05 үшін нақты пәрмендер, деректер жинағы форматының тұзақтары, VRAM және кідіріс шектеулері.

Pi0.5 - бұл саясат бұрын-соңды көрмеген бөлмеде жұмыс істеуі қажет болғанда қолданатын модель. Ол сондай-ақ мұндағы бес оқытылатын саясаттың ішіндегі ең ыңғайсызы, қолмен дәл баптау үшін: жоғарғы репозиторий бірінші кезекте JAX, LeRobot порты 0.6.0 нұсқасында орналастыруды lerobot-record-тан шығарды және базалық орнатуды оқыту үшін тым кішкентай етті, ал толық дәл баптау 4090-ға сыймайды. Төменде: ағын сәйкестендіру инференцияда қанша тұрады, екі командалық маршрут және нәтиженің жарамдылығын анықтайтын 485 мс саны.

Нені білу қажет

  • Ағын сәйкестендіру VLA: 3B PaliGemma VLM және үздіксіз әрекет бөліктерін декодтайтын 300M әрекет сарапшысы. Оны дәл баптаудың екі жолы, openpi және LeRobot pi05, LIBERO орташа көрсеткіші бойынша 0.65 ұпай айырмашылығы бар.
  • Толық дәл баптау үшін 70 ГБ-тан астам VRAM қажет. openpi LoRA-ны 22.5 ГБ деп көрсетеді, тек JAX жолында.
  • Деректер жинағы meta/stats.json файлында q01 және q99 квантильдері бар LeRobotDataset v3.0 болуы керек, әйтпесе бірінші пакет қате жібереді.
  • Алдымен lerobot нұсқаңызды тексеріңіз: 0.6.0 базалық пакетті жеңілдетті және орналастыруды lerobot-record-тан шығарды.
  • Мұнда ол әрекет қадамына 485 мс жылдамдықпен жұмыс істейді, 50 эпизодты қажет етеді және бір іске қосу үшін шамамен 4-тен 12 USD дейін тұрады.

Pi0.5 іс жүзінде не

Physical Intelligence 2024 жылдың қазанында pi0-ді жариялады: алдын ала оқытылған VLM-дегі ағын сәйкестендіру көру-тіл-әрекет моделі: 3 миллиард параметрлі PaliGemma және нөлден бастап инициализацияланған 300M әрекет сарапшысы, барлығы 3.3 миллиард. Мақалада 7 робот конфигурациясы мен 68 тапсырма бойынша 10,000 сағаттан астам робот деректерінде алдын ала оқыту туралы хабарланады. Толығырақ pi0 мақаласында.

Pi0.5 (arXiv 2504.16054, 22 сәуір 2025) сол қаңқаны сақтайды және оқыту диетасын өзгертеді: веб-деректер, нысандарды анықтау, роботты үйрететін адамдардың ауызша нұсқаулары, қосалқы тапсырма белгілері, көптеген үйлердегі роботтардан алынған кросс-дене деректері. Нәтижесінде, оқыту жиынтығында болмаған үйлерде асүйлерді тазалайтын робот пайда болады. openpi README тақырыпта жоқ бір мәліметті қосады: шығарылған pi0.5 білім оқшаулауымен (arXiv 2505.23705) оқытылған.

Сипаттамаpi0pi0.5
VLM backbone variantgemma_2b (PaliGemma)gemma_2b (PaliGemma)
Action expert variantgemma_300mgemma_300m
action_dim3232
action_horizon default5050
max_token_len48200
discrete_state_inputfalsetrue, күй сұрауда биндерге дискреттелген
Base checkpointgs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
Жарияланған нәрсе бүкіл мақала емес

openpi README нақты айтады: репозиторий тек ағынды сәйкестендіру басын қолдайды, pi0.5 оқыту және қорытынды жасау үшін. Мақалада екі кезең сипатталған және код тек екіншісін қамтиды: алдын ала оқыту әрбір әрекетті FAST токенизаторы арқылы дискретті токендер ретінде көрсетеді, ал орналастыру кезінде модель әрбір әрекет блогының алдында жоғары деңгейлі қосалқы тапсырманы қорытындылайды. Олардың ешқайсысы репозиторийде жоқ. lerobot/pi05_base картасы бірдей тізімді береді және RL қосады, дегенмен pi0.5 мақаласында күшейткіш оқыту кезеңі мүлдем сипатталмаған. LeRobot порты бұл ауқымды мұра етеді, және оның үстіндегі әрбір хостталған тренажер де, соның ішінде мына жердегі де. Лицензиялау да бөлінген: pi05 құжат бетінде Apache 2.0 делінген, lerobot/pi05_base картасы license: gemma деп белгіленген.

Ағынды сәйкестендіру оқыту мен қорытынды жасауға не өзгерістер енгізеді

SO-100-де үйретуге болатын саясат әрекеттерді тікелей регрессиялайды (ACT) немесе оларды токенизациялап, авторегрессивті түрде декодтайды (pi0-FAST). Ағын сәйкестендіру екеуін де жасамайды: ол шуды таза әрекет бөлігіне тасымалдайтын векторлық өрісті үйреніп, содан кейін оны біріктіреді. pi0 мақаласында 0.1 қадам өлшемімен 10 интеграциялық қадам қолданылады; LeRobot-тың pi05 конфигурациясы бірдей `num_inference_steps: int = 10` мәнін қамтиды.

  • Оқыту: шығын шуланған әрекет бөлігін регрессиялайды. Реттеуге арналған токенизатор жоқ, буын бұрыштарын дискреттеу жоқ.
  • Қорытындылау: бір бөлік әрекет сарапшысы арқылы он алға басуды қажет етеді. Бұл құрылымдық мәселе, реттеу мәселесі емес.
  • Шығыс: 32 өлшемді үздіксіз әрекеттер, ішкі жағынан толтырылған, шығын роботыңыздың өлшемдері бойынша алынады. 6-еркіндік дәрежесі бар қол және қысқыш 7-ні пайдаланады.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
src/openpi/models/pi0_config.py файлынан openpi негізгі тармағында, 2026 жылғы 23 тамызда оқылды.

PaliGemma негізі және оның алдындағы қақпа

PaliGemma (arXiv 2407.07726) — шамамен 3B параметрлі Gemma-2B тіл моделіндегі SigLIP-So400m визуалды кодтағыш. Pi0.5 өзінің токенизаторын мұра етеді, және бұл токенизатор қақпалы репозиторийде орналасқан. Бұл бірінші іске қосудың ең жиі тоқтап қалу жолы, бірінші оқыту қадамы.

GPU жалға алмас бұрын қақпалы лицензияны қабылдаңыз

LeRobot pi05 құжаттамасы анық айтады: pi0.5 қақпалы google/paligemma-3b-pt-224 токенизаторын пайдаланады, сондықтан Hub-та оның лицензиясын қабылдап, алдымен hf auth login іске қосыңыз. Қолжетімділік бірден емес, қолмен беріледі. Оны өткізіп жіберсеңіз, ақылы бұлтты іске қосуды бастасаңыз, токенизаторды жүктей алмайтын под үшін ақы төлейсіз.

Бастамас бұрын: деректер жинағының форматы, эпизодтар, жабдық

LeRobot-тағы Pi0.5 LeRobot деректер жинағы v3.0 орналасуындағы деректерді оқиды, ол lerobot 0.4.0-мен 2025 жылдың қазанында шықты: әр Parquet және MP4 файлына бір файлдан емес, көптеген эпизодтар эпизод, шекаралары файл атауларында емес, meta/episodes/ ішінде. жұмыс үстелі клиенті арқылы жазыңыз немесе алғашқы деректер жинағыңызды жазыңыз нұсқауларын орындаңыз, сонда сізде ол болады.

РежимҚажетті GPU жадыМысал GPU
Инференс8 ГБ-тан артықRTX 4090
Дәл баптау, LoRA22.5 ГБ-тан артықRTX 4090
Дәл баптау, толық70 ГБ-тан артықA100 80 ГБ немесе H100
Бір күнді жоғалтатын нұсқа тұзағы

Pi0.5 және SmolVLA LeRobot v3.0 нұсқасын қажет етеді. GR00T N1.7 және GR00T N1.5 v2.0 немесе v2.1 нұсқасын қажет етеді және v3.0 деректер жинағында істен шығады. Бір жазу сессиясы түрлендірусіз екеуін де қамтамасыз ете алмайды, ал қатеде "деректер жинағының нұсқасы қате" деп көрсетілмейді. деректер жинағы қабылданбады: v3 қажет бөлімін қараңыз.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
LeRobotDataset v3.0 құжаттамасынан.

Платформа Pi0.5 үшін кемінде 50 эпизодты қажет етеді, бұл GR00T және ACT үшін де сондай. Алдын ала оқыту негізгі жұмысты атқарады, сондықтан 50 таза эпизод 200 ақаулы эпизодтан артық. Бұл сіз үшін жаңа ма? деректер жинау нұсқаулығынан бастаңыз.

AY-Robots саясаттар беті бес оқытылатын саясатты параметрлер, GPU деңгейі, кідіріс және ең аз эпизодтар бойынша салыстырады.
Pi0.5 A100 және H100 деңгейінде әрекет қадамына 485 мс жылдамдықпен, ең аз 50 эпизодпен орналасқан.

А бағыты: openpi репозиторийімен дәлдеп баптау

Анықтамалық іске асыру: бірінші JAX, тек Ubuntu 22.04 жүйесінде тексерілген, жалаушалар емес, конфигурация нысандарымен басқарылады. PyTorch жолы 2025 жылдың қыркүйегінде келді, LIBERO-да расталды. Үш қадам: деректеріңізді түрлендіру, конфигурацияны анықтау, оқыту және қызмет көрсету.

  1. 1
    Клондау және орнату

    openpi uv қолданады. GIT_LFS_SKIP_SMUDGE LeRobot-тың LFS блобтарынсыз тәуелділік ретінде келуіне мүмкіндік береді.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    Деректеріңізді LeRobot деректер жинағына түрлендіру

    Жоғары ағын LIBERO және DROID үшін түрлендіргіштерді жеткізеді және сізден біреуін бейімдеуді күтеді. Жұмыс кілтті сәйкестендіруде.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    Оқыту конфигурациясын қосу

    Конфигурациялар src/openpi/training/config.py файлындағы TrainConfig жазбалары болып табылады. Бұл pi05_droid_finetune-ді бейімдейді, салмақ жүктегіші pi05_base-ге бағытталған.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    Норма статистикасын есептеу

    Деректер жинағына емес, конфигурация атауына қарсы жұмыс істейді. Оны өткізіп жіберу – мұндағы классикалық бірінші сәтсіздік.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    Оқыту

    Айнымалы JAX-қа әдепкі 75 пайыздың орнына GPU жадының 90 пайызын пайдалануға мүмкіндік береді. 80 ГБ картада бұл іске қосудың аман қалуын шешеді.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    Қызмет көрсету

    Сервер 8000 портында тыңдайды және бақылау сұрауларына жауап береді; сіздің роботтың орындалу уақыты клиент болып табылады.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch жолы JAX жолы емес

openpi's PyTorch іске асырылуы pi0-FAST, аралас дәлдікті, FSDP, LoRA немесе EMA салмақтарын қолдамайды, сондықтан 22.5 ГБ жететін LoRA тек JAX арқылы, gemma_2b_lora және gemma_300m_lora нұсқалары арқылы қолжетімді. Одан да жаманы: орнату патчталған файлдарды орнатылған transformers 4.53.2 үстіне көшіреді, және README uv-дің әдепкі hardlink режимімен бұл transformers-ті uv кэшінде тұрақты түрде өзгертетінін және басқа жобаларға таралуы мүмкін екенін ескертеді. Оны uv cache clean transformers арқылы болдырмаңыз.

B бағыты: lerobot pi05 арқылы дәл баптау

LeRobot порты сіз бұрыннан қолданатын CLI-дегі бірдей салмақтарды орайды ACT және SmolVLA. Төмендегінің бәрі lerobot 0.6.1 нұсқасымен, 2026 жылғы 3 тамыздан бергі шығарылыммен және 2026 жылғы 23 тамыздағы pi05 құжаттамасымен тексерілді. Мұнда нұсқалар маңызды: v3.0 деректер жинақтары 2025 жылғы қазанда 0.4.0 нұсқасымен келді, 2026 жылғы 9 наурыздағы 0.5.0 блогы pi0-FAST және Real-Time Chunking-ті ұсынады, ал 2026 жылғы 6 шілдедегі 0.6.0 негізгі пакетті жеңілдетіп, орналастыруды lerobot-rollout-қа ауыстырды.

Бір нәрсе өзгерген жоқ: lerobot-train және lerobot-record 2025 жылғы тамыздағы 0.3.2 нұсқасында кіру нүктелері болған. Әлі де python -m lerobot.scripts.train шақыратын оқулық бір жылдық өзгерістерден бұрын жасалған және қалған бөлігіне де сенбеуге тұрарлық.

  1. 1
    Дұрыс қосымшалармен орнату

    0.6.0 нұсқасынан бастап, негізгі орнату тек негізгі ML тәуелділіктерін қамтиды, ал pi қосымшасы деректер жинағын немесе оқыту кодын қоспайды, сондықтан дәл баптау үшін оқыту қосымшасы да қажет. Ескі бір жолды командалар импорттау кезінде қате береді.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    Аутентификациядан өту

    Браузерде paligemma-3b-pt-224 лицензиясын қабылдаңыз, содан кейін оқыту жүргізетін машинаға кіріңіз.

    bash
    hf auth login
  3. 3
    Квантильдік статистиканы қосу

    Pi0.5 STATE және ACTION мәндерін квантильдермен қалыпқа келтіреді, сондықтан meta/stats.json файлына q01 және q99 қажет. Ескі деректер жинақтарында тек min, max, mean, std болады.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    lerobot/pi05_base негізінде дәл баптау

    Пакет өлшемін картаңыз көтере алатын мәнге орнатыңыз; құжаттарда LIBERO-да 80 ГБ үшін 64 қолданылады. bfloat16 мәнін нақты көрсетіңіз, конфигурацияның әдепкі мәні float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    Оны қолда іске қосу

    0.6.x нұсқасында бұл lerobot-rollout: lerobot-record саясатты қабылдамайды және eval_ деректер жинағының атауларын қабылдамайды. Base қолды басқарады, sentry орындалуды жазады.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
ЖалаушаНе істейдіЕскерту
--policy.type=pi05Pi0.5 таңдайдыpretrained_path-пен міндетті, --policy.path-пен бірге қалдырыңыз
--policy.pretrained_pathтек салмақтарды жүктейдідеректер жинағыңыздағы мүмкіндік атаулары, сақталған параметрлер қалпына келтіріледі
--policy.pathсалмақтар және checkpoint config.jsonn_action_steps сияқты сақталған параметрлер мұрагерлікке алынады
--policy.n_action_stepsбір бөлікке жұмсалатын қадамдар50-ге оралады, chunk_size-дан (әдепкі 50) ешқашан аспайды
--policy.train_expert_onlyVLM-ді қатырады, сарапшыны оқытадыәдепкі false, жады аз, сәттілікке біраз шығын
--policy.gradient_checkpointingактивацияларды сақтаудың орнына қайта есептеуәдепкі false, іске қосу сәйкес келмеген кездегі бірінші тұтқа
--peft.method_type=LORAтолық салмақтардың орнына LoRA адаптерлеріpeft қосымшасын қажет етеді, құжатталған мысал SmolVLA
--policy.rtc_training_max_delayRTC үшін әрекет префиксін шарттаутек негізгі тармақта, 0.6.1 нұсқасында жоқ, chunk_size-дан төмен болуы керек
--rename_mapдеректер жинағы бағандарын саясат мүмкіндіктеріне сәйкестендіредікамера кілттеріңіз әртүрлі болған кезде қажет
Көптеген алғашқы іске қосулар кездесетін қате

Квантильдерсіз бірінші пакетте ValueError: QUANTILES normalization mode requires q01 and q99 stats қатесін аласыз. Статистиканы қайта есептеңіз, бірақ нәтиже --dataset.repo_id оқитын кэште емес, $HF_LEROBOT_HOME/your_dataset ішінде болады, сондықтан --dataset.root сол жерді көрсететіндей етіп оқытыңыз немесе Hub-қа жіберіңіз. Немесе LIBERO анықтамалық командасы сияқты --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' арқылы квантильдерді өткізіп жіберіңіз.

Әдепкі параметрлердің үш жиынтығы және олардың қайсысы оқытушыға жетеді

openpi's TrainConfig - бұл эталон, LeRobot's PI05Config - сіз ештеңе айтпаған кезде lerobot-train қолданатын нәрсе, ал мұндағы форма үшінші жиынтықты жібереді. Тосынсый - оқыту жылдамдығы: екі жоғарғы әдепкі мән де 2.5e-5-ке жетеді, ал openpi-дің өзінің pi05_libero конфигурациясы және бұл платформа оны 5e-5-ке дейін көтереді.

Параметрopenpi TrainConfiglerobot pi05 және lerobot-trainAY-Robots жібереді
Пакет өлшемі3281
Ең жоғары оқыту жылдамдығы2.5e-5, cosine decayoptimizer_lr 2.5e-55e-5
Оқыту қадамдары30,000100,00030,000
Бақылау нүктесінің аралығы1,000 қадам20,000 қадамформада жоқ
Тұқым421,000формада
Әрекет бөлігіaction_horizon 50chunk_size 50, n_action_steps 50формада жоқ
Салмақ dtypebfloat16float32 until you pass --policy.dtypeформада жоқ
Градиентті жинақтаумұндай реттегіш жоқ, оның орнына fsdp_devicesосы уақытқа дейінгі әрбір шығарылымда жоқ16, and it is dropped

Порт сенімді ме? LeRobot командасы LIBERO базалық моделін қосымша 6 мың қадамға дәлдеп баптады және openpi-дің төрт жиынтықтағы эталондық көрсеткіштерімен салыстырды: орташа есеппен 97.5 пайыз 96.85-ке қарсы, Libero 10-да алда, Spatial-да артта. Бұл бағыт - құрал таңдауы, сапа таңдауы емес.

Pi0.5 моделін өз деректеріңізде дәлдеп баптау
Артықшылықтар
  • Оның артында 10,000 сағаттан астам роботты алдын ала оқыту бар, сондықтан сіздің тапсырмаңыздың 50 эпизоды жеткілікті болуы мүмкін.
  • Үздіксіз әрекеттер: баптауға арналған токенизатор жоқ, буын бұрыштарыңызда дискреттеу шегі жоқ.
  • LeRobot порты LIBERO орташа көрсеткіші бойынша openpi-дің 96.85-ке қарсы 97.5 пайыз жинайды, сондықтан ыңғайлы CLI ешқандай өлшенетін шығынсыз.
  • Екі жағында да параметрлік тиімді жолдар: openpi-дің JAX LoRA нұсқалары, LeRobot-тың PEFT интеграциясы.
Ымыралар
  • Толық дәлдеп баптау үшін 70 ГБ-тан астам қажет. 22.5 ГБ LoRA көрсеткіші openpi-дің JAX нөмірі; PEFT астында pi05 үшін ешқайсысы жарияланған жоқ.
  • Әрекет қадамына 485 мс, мұндағы бесеудің ішіндегі ең баяуы: SmolVLA-дан екі есе, ACT-тан жиырма төрт есе баяу.
  • LeRobot v3.0 қажет, сондықтан GR00T іске қосу үшін жазылған деректер жиынтығын түрлендіру қажет, және керісінше.
  • Жаңа опциялар алдымен main-ге түседі: оқыту кезіндегі RTC және MEM жады 0.6.1 нұсқасында жоқ, сондықтан ең жаңа құжаттама git-тен орнатуды білдіруі мүмкін.

485 мс шындығы және оның қолдануға жарамсыз болатын жері

Бұл сіздің жобаңызды анықтайды, сондықтан ол шығындар кестесінен бұрын келеді. Мұнда Pi0.5 үшін өлшенген әрекет қадамына 485 мс құрайды. Қалған төртеуімен салыстырғанда:

СаясатӘрекет қадамына инференцияПараметрлерGPU деңгейіМинималды эпизодтар
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots GR00T N1.7 мен Pi0.5-ті салыстыратын беті, параметрлері, GPU деңгейі, кідірісі және деректер жинағы форматы көрсетілген.
Бірдей GPU деңгейі, бірдей эпизодтық шек, әртүрлі деректер жинағы нұсқасы, үш еселенген кідіріс айырмашылығы.
Инференс серволардың жанында орналасуы керек

Бұл бес модельдегі басқару циклі әрекет қадамына 20-дан 485 мс-қа дейін жұмыс істейді. 485 мс-тан асатын жалпы интернеттегі айналымдар жұмыс істеп тұрған саясатты екіұшты етеді. Қашықтағы инференс баяу алу-орналастыру үшін жарамды, бірақ жылдам реактивті қозғалыс үшін емес. Біз мұны айтқанды, тек LAN-да жұмыс істейтін демонстрацияны сатқаннан артық көреміз. Егер сіздің қолыңыз бөліктер арасында кідірсе, саясат қозғалыс ортасында қатып қалады бөлімінен бастаңыз.

Жоғары ағында жауап бар, және оның жартысы сіз орната алатын шығарылымда. Нақты уақыттағы бөліктеу (Real-Time Chunking) келесі бөлікті қол ағымдағы бөлікті орындап жатқанда жасайды, содан кейін жаңа бөліктің қабаттасатын қадамдарын бұрын орындалған бөлікке жақын ұстауға бағыттайды, осылайша қол тігісте тоқтап қалмайды немесе сілкініп кетпейді. Pi0, Pi0.5 және SmolVLA үшін 0.4.2 өзгерістер журналында жіберілген инференс-уақыт формасы қайта оқыту емес, енгізу (rollout) жалаушасы болып табылады:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon – жаңа бөлік алдыңғы бөліктің қанша қадамымен келісуі керек екенін білдіреді; RTC құжаттары әдеттегі диапазон ретінде 8-ден 12-ге дейін береді. Әдепкі инференс бэкэнды --inference.type=sync.

Бұл модельді жылдамдатпайды. Ол алшақтықты жасырады: 485 мс әлі де жұмсалады, бірақ маңызды жолдан тыс, сондықтан кезек бөліктер арасында құрғап қалмайды. arXiv 2512.05964-тен алынған оқыту-уақыт нұсқасы одан әрі дамиды: модель таза әрекет префиксіне негізделуді үйренеді, сондықтан инференс кезінде қабаттасу бағытталғанның орнына әрекетке қатысты ағын уақыт қадамдарымен қатты боялады, және бағыттау кері өтуі жоғалады. Оқыту кезінде ол әр мысал үшін префикс ұзындығын таңдайды және қалған постфикс бойынша ағын жоғалуын қабылдайды. Бұл жалауша тек main-да бар, 0.6.1-де емес, және сіз оқытатын кідіріс chunk_size-дан төмен болуы керек.

Pi0.5 чекпойнт алудың екі жолы

Сіз 80 ГБ картаны жалға аласыз немесе иеленесіз, жоғарыдағы стектердің бірін орнатасыз, деректер жинағыңызды түрлендіресіз және іске қосуды қадағалайсыз. Сіз әрбір параметрді сақтайсыз: openpi-дің JAX LoRA, LeRobot-тың PEFT адаптерлері, салыстырмалы әрекеттер, реттелетін пернелерді баптау. Сіз сондай-ақ әрбір сәтсіздікті сақтайсыз.

  • Аппараттық құрал: A100 80 GB немесе H100, немесе openpi-дің JAX LoRA жолындағы 24 GB карта.
  • Орнату: бірінші іске қосу үшін бір түстен кейін, негізінен пернелерді баптау және қақпалы токенизатор.
  • Хостингтік формада жоқ: PEFT адаптерлері, салыстырмалы әрекеттер, оқыту кезіндегі RTC, MEM жады.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
Хостингтік форма іске қоспайтын және pip орната алмайтын пәрмен: оқыту кезіндегі RTC – негізгі тармақтың жалаушасы.

Жұмыс істемеген кезде

СимптомЫқтимал себеп
Іске қосу басталмай тұрып қабылданбадыДеректер жинағы v2.1, бірақ Pi0.5 v3.0 қалайды, немесе GR00T үшін керісінше
ImportError, datasets пакеті жоқlerobot 0.6.x оқыту қосымшасысыз
Бірінші пакеттегі q01 және q99 туралы ValueErrormeta/stats.json файлында квантильдер жоқ; қайта есептеңіз немесе MEAN_STD қолданыңыз
0-қадамда CUDA жады жеткіліксіз70 GB-тан төмен толық реттеу; чекпойнт жасауды немесе train_expert_only қолдануды көріңіз
401 немесе қақпалы репо қатесіPaliGemma токенизаторының лицензиясы қабылданбады
Жоғалту төмендейді, робот ештеңе істемейдіҚалыпқа келтіру сәйкессіздігі, немесе саясат күйді көшіреді
Қол бөліктер арасында кідіредіӘр қадамдағы кідіріс плюс кері жол; бөлік кезегі бос қалады
Бір орнатуда жұмыс істейді, басқасында істен шығадыЭпизодтар тым аз, немесе барлығы бір конфигурацияда

Бір іске қосу қанша тұрады

Pi0.5 қымбат деңгейде орналасқан, себебі оған 80 ГБ карта қажет, ал спот бағалары өзгеріп отырады, сондықтан көрсеткіш баға емес, диапазон болып табылады. Көптеген SO-100 тапсырмалары үшін алдымен SmolVLA немесе ACT-ті алдымен 24 ГБ деңгейінде оқытыңыз, тапсырманың үйренуге болатындығын растаңыз, содан кейін оған A100 сағат жұмсаңыз. Алғашқы саясатыңызды оқытыңыз сол арзанырақ циклды көрсетеді, және бағалар ағымдағы деңгейлерді көрсетеді.

ДеңгейСаясаттарӘдеттегі іске қосуСағатына бағасыБір іске қосу құны
A100 80 ГБ немесе H100Pi0.5, GR00T N1.7, GR00T N1.53-тен 6 сағатқа дейін1.20-ден 2.00 USD-ға дейіншамамен 4-тен 12 USD-ға дейін
RTX 4090 немесе кез келген 24 ГБ картаSmolVLA, ACT2-ден 5 сағатқа дейін0.30-ден 0.60 USD-ға дейіншамамен 1-ден 3 USD-ға дейін
AY-Robots шығындар кестесі, онда әр саясатқа қандай GPU қажет екендігі, әдеттегі жұмыс уақыты мен бағасы, сондай-ақ саясат пайдалы болғанға дейін қанша эпизод қажет екендігі көрсетілген.
Өнім бетіндегі бірдей екі деңгей: Pi0.5 80 ГБ картаны жалға алады, SmolVLA және ACT 4090-ға сыяды.

Бір кешті арнамас бұрын: GR00T N1.7 Pi0.5-ке қарсы және Pi0.5 SmolVLA-ға қарсы бірдей сандарды бетпе-бет қояды. Аренада 332 бенчмарк нәтижесі бар 85 VLA моделі бар, олардың әрқайсысы өз дереккөзіне сілтемеленген, ал отбасы туралы ақпарат біздің VLA шолуымызда.

Стек құрмай Pi0.5-ті жаттықтыру

Деректер жинағын және гиперпараметрлерді формада таңдаңыз. Бекенд спот нарығынан 80 ГБ картаны жалға алады, жаттықтырушыны іске қосады және бақылау нүктелерін объектілік сақтау қоймасына жазады. SO-100, SO-101, Koch v1.1 және LeKiwi үшін нұсқаулықтар.

Жаттығу нұсқаулықтарын ашу
Pi0.5-ті RTX 4090-да реттей аламын ба?

Толық реттеу емес: openpi ол үшін 70 ГБ-тан астам көрсетеді, сондықтан A100 80 ГБ немесе H100 қажет. Оның 22.5 ГБ LoRA көрсеткіші JAX жолына жатады; PyTorch іске асыруында LoRA жоқ. LeRobot-тың PEFT интеграциясы бар, бірақ оның құжатталған мысалы SmolVLA болып табылады және pi05 үшін VRAM көрсеткіші жарияланбаған.

Маған қанша эпизод қажет?

Елу, GR00T және ACT сияқты ең төменгі шек; тек SmolVLA 30-ға дейін төмендейді. Негізгі бақылау нүктесі 10,000 сағаттан астам алдын ала оқытуды қамтиды, сондықтан реттеу нөлден үйренудің орнына бейімделеді: 50 таза, әртүрлі эпизод бір конфигурациядан екі жүзді жеңеді.

--policy.path және --policy.pretrained_path арасындағы айырмашылық неде?

--policy.path салмақтарды және бақылау нүктесінің config.json файлын жүктейді, сондықтан n_action_steps сияқты сақталған параметрлер мұрагерлікке алынады және --policy.type алынып тасталуы керек. --policy.pretrained_path тек салмақтарды жүктейді: мүмкіндік атаулары сіздің деректер жинағыңыздан келеді, сақталған параметрлер қалпына келтіріледі, --policy.type қажет. Сондықтан LIBERO командасы n_action_steps=10 және empty_cameras=1 параметрлерін нақты береді; әйтпесе олар 50 және 0-ге оралады.

Ашық нұсқа мақаладағы толық Pi0.5-ті бере ме?

Жоқ. Екеуі де тек ағынды сәйкестендіру әрекет басын қолдайды. FAST әрекет токенизаторымен дискретті-токенді алдын ала оқыту кезеңі және жоғары деңгейлі қосалқы тапсырманы болжау шығарылған жоқ, ал lerobot/pi05_base картасы бұл тізімге RL қосады, тіпті pi0.5 мақаласында күшейткіш оқыту кезеңі сипатталмаса да. Сіз ұсынған тіл жолына негізделген төмен деңгейлі саясатты үйретесіз, ұзақ тапсырманы өзі ыдырататын модельді емес.

Бұл нұсқаулық қандай нұсқаларға қарсы жазылған?

openpi негізгі және lerobot 0.6.1, 2026 жылғы 3 тамыздан бері шығарылған, екеуі де 2026 жылғы 23 тамызда оқылды. v3.0 деректер жинақтары 2025 жылғы қазанда 0.4.0 нұсқасымен келді. 0.6.0 негізгі пакетті жеңілдетті, сондықтан lerobot[pi] жалғыз өзі енді жаттығу стегін орнатпайды және орналастыруды lerobot-rollout-қа ауыстырды. Жаттығу кезіндегі RTC тек негізгіде; мұндағы хостингтік жаттықтырушы 0.5.1 нұсқасында жұмыс істейді.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started