AY-Robots శిక్షణ మ్యాట్రిక్స్, ఐదు పాలసీలు అడ్డు వరుసలుగా మరియు నాలుగు రోబోట్ చేతులు నిలువు వరుసలుగా, ప్రతి సెల్ ఒక నిర్దిష్ట ఫైన్-ట్యూనింగ్ గైడ్‌కు లింక్
Pi0.5ఫ్లో మ్యాచింగ్VLA శిక్షణLeRobotఫైన్-ట్యూనింగ్

మీ స్వంత రోబోట్ డేటాపై Pi0.5ని ఎలా శిక్షణ ఇవ్వాలి

AY-Robots ResearchAugust 23, 202616 నిమిషాల చదువు

ఫిజికల్ ఇంటెలిజెన్స్ నుండి ఫ్లో-మ్యాచింగ్ VLA అయిన Pi0.5ని మీ స్వంత రోబోట్ డేటాపై ఫైన్-ట్యూన్ చేయండి. openpi మరియు lerobot pi05 కోసం నిజమైన ఆదేశాలు, డేటాసెట్ ఫార్మాట్ సమస్యలు, VRAM మరియు లేటెన్సీ పరిమితులు.

Pi0.5 అనేది ఒక పాలసీ ఇంతకు ముందు చూడని గదిలో పని చేయాల్సి వచ్చినప్పుడు మీరు ఎంచుకునే మోడల్. ఇది ఇక్కడ ఉన్న ఐదు శిక్షణ ఇవ్వగల పాలసీలు లో అత్యంత కష్టమైనది, చేతితో ఫైన్-ట్యూన్ చేయడానికి: అప్‌స్ట్రీమ్ రిపోజిటరీ మొదట JAX, LeRobot పోర్ట్ 0.6.0లో lerobot-record నుండి డిప్లాయ్‌మెంట్‌ను తరలించింది మరియు బేస్ ఇన్‌స్టాల్‌ను శిక్షణ ఇవ్వడానికి చాలా చిన్నదిగా చేసింది, మరియు పూర్తి ఫైన్-ట్యూన్ 4090లో సరిపోదు. కింద: ఇన్ఫరెన్స్ వద్ద ఫ్లో మ్యాచింగ్ ఎంత ఖర్చవుతుంది, రెండు కమాండ్ మార్గాలు, మరియు ఫలితం ఉపయోగపడగలదా అని నిర్ణయించే 485 ms సంఖ్య.

మీరు తెలుసుకోవలసినవి

  • ఒక ఫ్లో-మ్యాచింగ్ VLA: 3B పాలిగెమ్మా VLM మరియు నిరంతర యాక్షన్ చంక్‌లను డీకోడ్ చేసే 300M యాక్షన్ ఎక్స్‌పర్ట్. దీన్ని ఫైన్-ట్యూన్ చేయడానికి రెండు మార్గాలు, openpi మరియు LeRobot pi05, LIBERO సగటున 0.65 పాయింట్ల తేడాతో.
  • పూర్తి ఫైన్-ట్యూనింగ్‌కు 70 GB కంటే ఎక్కువ VRAM అవసరం. openpi LoRAను 22.5 GB వద్ద జాబితా చేస్తుంది, దాని JAX మార్గంలో మాత్రమే.
  • డేటాసెట్ meta/stats.jsonలో q01 మరియు q99 క్వాంటైల్స్‌తో LeRobotDataset v3.0 అయి ఉండాలి, లేకపోతే బ్యాచ్ ఒకటి లోపం చూపుతుంది.
  • ముందుగా మీ lerobot వెర్షన్‌ను తనిఖీ చేయండి: 0.6.0 బేస్ ప్యాకేజీని తేలికగా చేసి, lerobot-record నుండి డిప్లాయ్‌మెంట్‌ను తరలించింది.
  • ఇక్కడ ఇది ప్రతి యాక్షన్ స్టెప్‌కు 485 ms వద్ద నడుస్తుంది, 50 ఎపిసోడ్‌లు కావాలి, మరియు ప్రతి రన్‌కు సుమారు 4 నుండి 12 USD ఖర్చవుతుంది.

Pi0.5 అంటే ఏమిటి

ఫిజికల్ ఇంటెలిజెన్స్ అక్టోబర్ 2024లో pi0ను ప్రచురించింది: ఒక ప్రీట్రైన్డ్ VLMపై ఫ్లో మ్యాచింగ్ విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్: 3 బిలియన్ పారామీటర్లతో పాలిగెమ్మా మరియు మొదటి నుండి ప్రారంభించబడిన 300M యాక్షన్ ఎక్స్‌పర్ట్, మొత్తం 3.3 బిలియన్. ఈ పత్రం 7 రోబోట్ కాన్ఫిగరేషన్‌లు మరియు 68 టాస్క్‌లలో 10,000 గంటలకు పైగా రోబోట్ డేటాపై ప్రీ-ట్రైనింగ్‌ను నివేదిస్తుంది. మరింత సమాచారం pi0 వ్యాసంలో.

Pi0.5 (arXiv 2504.16054, 22 ఏప్రిల్ 2025) ఆ స్కెలిటన్‌ను అలాగే ఉంచి, శిక్షణ ఆహారాన్ని మార్చింది: వెబ్ డేటా, ఆబ్జెక్ట్ డిటెక్షన్, రోబోట్‌కు శిక్షణ ఇచ్చే మానవుల నుండి మౌఖిక సూచనలు, సబ్‌టాస్క్ లేబుల్‌లు, అనేక ఇళ్లలోని రోబోట్‌ల నుండి క్రాస్-ఎంబోడిమెంట్ డేటా. శిక్షణ సెట్‌లో లేని ఇళ్లలో వంటగదులను శుభ్రం చేసే రోబోట్ ఫలితం. ఓపెన్‌పి README శీర్షికలో లేని ఒక వివరాలను జోడిస్తుంది: విడుదలైన pi0.5 నాలెడ్జ్ ఇన్సులేషన్‌తో (arXiv 2505.23705) శిక్షణ పొందింది.

లక్షణంpi0pi0.5
VLM బ్యాక్‌బోన్ వేరియంట్gemma_2b (PaliGemma)gemma_2b (PaliGemma)
యాక్షన్ ఎక్స్‌పర్ట్ వేరియంట్gemma_300mgemma_300m
action_dim3232
action_horizon డిఫాల్ట్5050
max_token_len48200
discrete_state_inputfalsetrue, ప్రాంప్ట్‌లో స్టేట్ బిన్‌లుగా విభజించబడింది
బేస్ చెక్‌పాయింట్gs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
ప్రజలకు అందుబాటులో ఉన్నది మొత్తం పేపర్ కాదు

ఓపెన్‌పి README స్పష్టంగా పేర్కొంది: రిపోజిటరీ pi0.5 శిక్షణ మరియు ఇన్‌ఫరెన్స్ రెండింటికీ ఫ్లో మ్యాచింగ్ హెడ్‌ను మాత్రమే సపోర్ట్ చేస్తుంది. ఈ పేపర్ రెండు దశలను వివరిస్తుంది మరియు కోడ్ రెండవ దశను మాత్రమే కలిగి ఉంది: ప్రీ-ట్రైనింగ్ ప్రతి చర్యను FAST టోకెనైజర్ ద్వారా వివిక్త టోకెన్‌లుగా సూచిస్తుంది, మరియు డిప్లాయ్‌మెంట్ వద్ద మోడల్ ప్రతి యాక్షన్ చంక్ ముందు ఒక ఉన్నత-స్థాయి సబ్‌టాస్క్‌ను ఊహిస్తుంది. వాటిలో ఏదీ రిపోజిటరీలో లేదు. lerobot/pi05_base కార్డ్ అదే జాబితాను ఇస్తుంది మరియు RLని జోడిస్తుంది, అయితే pi0.5 పేపర్ ఎటువంటి రీన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ దశను వివరించదు. LeRobot పోర్ట్ ఆ పరిధిని వారసత్వంగా పొందుతుంది, మరియు దానిపై హోస్ట్ చేయబడిన ప్రతి ట్రైనర్ కూడా, ఇక్కడ ఉన్నది కూడా. లైసెన్సింగ్ కూడా విభజించబడింది: pi05 డాక్ పేజీ Apache 2.0 అని చెబుతుంది, lerobot/pi05_base కార్డ్ license: gemma అని ట్యాగ్ చేయబడింది.

ఫ్లో మ్యాచింగ్ శిక్షణ మరియు ఇన్‌ఫరెన్స్ గురించి ఏమి మారుస్తుంది

ఒక పాలసీ మీరు SO-100లో శిక్షణ ఇవ్వగలరు, అది చర్యలను నేరుగా రిగ్రెస్ చేస్తుంది (ACT) లేదా వాటిని టోకనైజ్ చేసి ఆటోరిగ్రెసివ్‌గా డీకోడ్ చేస్తుంది (pi0-FAST). ఫ్లో మ్యాచింగ్ రెండూ చేయదు: ఇది శబ్దాన్ని శుభ్రమైన యాక్షన్ చంక్, ఆపై దానిని అనుసంధానిస్తుంది. pi0 పేపర్ 0.1 స్టెప్ సైజు వద్ద 10 ఇంటిగ్రేషన్ స్టెప్‌లను ఉపయోగిస్తుంది; LeRobot యొక్క pi05 కాన్ఫిగరేషన్ అదే num_inference_steps: int = 10ని కలిగి ఉంటుంది.

  • శిక్షణ: నష్టము నాయిస్డ్ యాక్షన్ చంక్‌ను రిగ్రెస్ చేస్తుంది. ట్యూన్ చేయడానికి టోకనైజర్ లేదు, మీ జాయింట్ యాంగిల్స్‌ను డిస్క్రిటైజ్ చేయాల్సిన అవసరం లేదు.
  • ఇన్‌ఫరెన్స్: ఒక చంక్ యాక్షన్ ఎక్స్‌పర్ట్ ద్వారా పది ఫార్వర్డ్ పాస్‌లకు ఖర్చవుతుంది. ఇది నిర్మాణాత్మకమైనది, ట్యూనింగ్ సమస్య కాదు.
  • అవుట్‌పుట్: 32 డైమెన్షన్ల నిరంతర చర్యలు, అంతర్గతంగా ప్యాడ్ చేయబడినవి, మీ రోబోట్ కలిగి ఉన్న డైమెన్షన్లపై నష్టం తీసుకోబడుతుంది. 6-DoF ఆర్మ్ ప్లస్ గ్రిప్పర్ 7ని ఉపయోగిస్తుంది.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
openpi మెయిన్ బ్రాంచ్‌లోని src/openpi/models/pi0_config.py నుండి చదవబడింది, 23 ఆగస్టు 2026.

పాలిజెమ్మా బ్యాక్‌బోన్, మరియు దాని ముందున్న గేట్

PaliGemma (arXiv 2407.07726) అనేది Gemma-2B లాంగ్వేజ్ మోడల్‌పై SigLIP-So400m విజన్ ఎన్‌కోడర్, సుమారు 3B పారామీటర్‌లతో ఉంటుంది. Pi0.5 దాని టోకెనైజర్‌ను వారసత్వంగా పొందుతుంది, మరియు ఆ టోకెనైజర్ గేటెడ్ రిపోజిటరీలో ఉంటుంది. మొదటి రన్ విఫలమవడానికి ఇది అత్యంత సాధారణ మార్గం, మొదటి ట్రైనింగ్ స్టెప్.

మీరు GPUని అద్దెకు తీసుకునే ముందు గేటెడ్ లైసెన్స్‌ను అంగీకరించండి

LeRobot pi05 డాక్యుమెంట్లు స్పష్టంగా పేర్కొంటున్నాయి: pi0.5 గేటెడ్ google/paligemma-3b-pt-224 టోకెనైజర్‌ను ఉపయోగిస్తుంది, కాబట్టి హబ్‌లో దాని లైసెన్స్‌ను అంగీకరించి, ముందుగా hf auth login రన్ చేయండి. యాక్సెస్ మాన్యువల్‌గా మంజూరు చేయబడుతుంది, తక్షణమే కాదు. దీన్ని దాటవేసి, పెయిడ్ క్లౌడ్ రన్‌ను ప్రారంభిస్తే, టోకెనైజర్‌ను డౌన్‌లోడ్ చేయలేని పాడ్ కోసం మీరు చెల్లించాల్సి ఉంటుంది.

మీరు ప్రారంభించే ముందు: డేటాసెట్ ఫార్మాట్, ఎపిసోడ్‌లు, హార్డ్‌వేర్

LeRobotలోని Pi0.5 LeRobot డేటాసెట్‌ను v3.0 లేఅవుట్‌లో చదువుతుంది, ఇది అక్టోబర్ 2025లో lerobot 0.4.0తో వచ్చింది: ప్రతి Parquet మరియు MP4 ఫైల్‌కు అనేక ఎపిసోడ్‌లు, ప్రతి ఎపిసోడ్‌కు, ఫైల్‌నేమ్‌లకు బదులుగా meta/episodes/లో సరిహద్దులతో. డెస్క్‌టాప్ క్లయింట్‌తో రికార్డ్ చేయండి లేదా మీ మొదటి డేటాసెట్‌ను రికార్డ్ చేయండిను అనుసరించండి మరియు మీకు అది లభిస్తుంది.

మోడ్GPU మెమరీ అవసరంఉదాహరణ GPU
ఇన్‌ఫరెన్స్more than 8 GBRTX 4090
ఫైన్-ట్యూనింగ్, LoRAmore than 22.5 GBRTX 4090
ఫైన్-ట్యూనింగ్, పూర్తిmore than 70 GBA100 80 GB or H100
ఒక రోజును వృథా చేసే వెర్షన్ ట్రాప్

Pi0.5 మరియు SmolVLA లకు LeRobot v3.0 అవసరం. GR00T N1.7 మరియు GR00T N1.5 లకు v2.0 లేదా v2.1 అవసరం మరియు అవి v3.0 డేటాసెట్‌పై క్రాష్ అవుతాయి. ఒక రికార్డింగ్ సెషన్ మార్పిడి లేకుండా రెండింటికీ అందించదు, మరియు లోపం "తప్పు డేటాసెట్ వెర్షన్" అని చెప్పదు. డేటాసెట్ తిరస్కరించబడింది: v3 అవసరం చూడండి.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
LeRobotDataset v3.0 డాక్యుమెంటేషన్ నుండి.

Pi0.5 కోసం ప్లాట్‌ఫారమ్‌కు కనీసం 50 ఎపిసోడ్‌లు అవసరం, ఇది GR00T మరియు ACT లతో సమానం. ప్రీ-ట్రైనింగ్ భారీ పనిని చేస్తుంది, కాబట్టి 50 శుభ్రమైన ఎపిసోడ్‌లు 200 అస్తవ్యస్తమైన వాటి కంటే మెరుగు. దీనికి కొత్తవారైతే? దీనితో ప్రారంభించండి డేటా సేకరణ గైడ్.

AY-Robots పాలసీల పేజీ ఐదు శిక్షణ పొందే పాలసీలను పారామీటర్లు, GPU శ్రేణి, లేటెన్సీ మరియు కనిష్ట ఎపిసోడ్‌ల ద్వారా పోల్చుతుంది.
Pi0.5 A100 మరియు H100 శ్రేణిలో ప్రతి చర్య దశకు 485 ms వద్ద, 50 ఎపిసోడ్‌ల కనిష్టంతో ఉంటుంది.

మార్గం A: openpi రిపోజిటరీతో ఫైన్-ట్యూన్ చేయండి

రిఫరెన్స్ ఇంప్లిమెంటేషన్: మొదట JAX, Ubuntu 22.04లో మాత్రమే పరీక్షించబడింది, ఫ్లాగ్‌ల కంటే కాన్ఫిగ్ ఆబ్జెక్ట్‌ల ద్వారా నడపబడుతుంది. PyTorch మార్గం సెప్టెంబర్ 2025లో వచ్చింది, LIBEROలో ధృవీకరించబడింది. మూడు దశలు: మీ డేటాను మార్చండి, కాన్ఫిగ్‌ను నిర్వచించండి, శిక్షణ ఇవ్వండి మరియు సేవ చేయండి.

  1. 1
    క్లోన్ చేసి ఇన్‌స్టాల్ చేయండి

    openpi uvని ఉపయోగిస్తుంది. GIT_LFS_SKIP_SMUDGE అనేది LeRobot LFS బ్లోబ్‌లు లేకుండా డిపెండెన్సీగా రావడానికి అనుమతిస్తుంది.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    మీ డేటాను LeRobot డేటాసెట్‌గా మార్చండి

    అప్‌స్ట్రీమ్ LIBERO మరియు DROID కోసం కన్వర్టర్‌లను అందిస్తుంది మరియు మీరు ఒకదాన్ని స్వీకరించాలని ఆశిస్తుంది. పని కీ మ్యాపింగ్.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    శిక్షణ కాన్ఫిగ్‌ను జోడించండి

    కాన్ఫిగ్‌లు src/openpi/training/config.pyలో TrainConfig ఎంట్రీలు. ఇది pi05_droid_finetuneని స్వీకరిస్తుంది, వెయిట్ లోడర్ pi05_base వద్ద సూచించబడింది.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    నార్మ్ గణాంకాలను లెక్కించండి

    డేటాసెట్‌కు వ్యతిరేకంగా కాకుండా, కాన్ఫిగ్ పేరుకు వ్యతిరేకంగా నడుస్తుంది. దీన్ని దాటవేయడం ఇక్కడ క్లాసిక్ మొదటి వైఫల్యం.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    శిక్షణ ఇవ్వండి

    ఈ వేరియబుల్ JAX డిఫాల్ట్ 75 శాతం బదులు 90 శాతం GPU మెమరీని ఉపయోగించడానికి అనుమతిస్తుంది. 80 GB కార్డ్‌లో, ఇది రన్ నిలబడుతుందా లేదా అని నిర్ణయిస్తుంది.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    సేవ చేయండి

    సర్వర్ పోర్ట్ 8000లో వింటుంది మరియు అబ్జర్వేషన్ ప్రశ్నలకు సమాధానం ఇస్తుంది; మీ రోబోట్ రన్‌టైమ్ క్లయింట్.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch మార్గం JAX మార్గం కాదు

openpi యొక్క PyTorch అమలు pi0-FAST, మిక్స్‌డ్ ప్రెసిషన్, FSDP, LoRA లేదా EMA వెయిట్‌లను సపోర్ట్ చేయదు, కాబట్టి 22.5 GBకి చేరే LoRA కేవలం JAX మాత్రమే, gemma_2b_lora మరియు gemma_300m_lora వేరియంట్‌ల ద్వారా. అంతకంటే దారుణం: ఈ సెటప్ మీ ఇన్‌స్టాల్ చేయబడిన transformers 4.53.2 పై ప్యాచ్ చేయబడిన ఫైల్‌లను కాపీ చేస్తుంది, మరియు uv యొక్క డిఫాల్ట్ హార్డ్‌లింక్ మోడ్‌తో ఇది uv కాష్‌లోని transformers ను శాశ్వతంగా మారుస్తుందని మరియు ఇతర ప్రాజెక్ట్‌లలోకి లీక్ అవ్వగలదని README హెచ్చరిస్తుంది. దీనిని uv cache clean transformers తో రద్దు చేయండి.

మార్గం B: lerobot pi05 తో ఫైన్-ట్యూన్ చేయండి

LeRobot పోర్ట్ మీరు ఇప్పటికే ఉపయోగించే CLI లో అదే వెయిట్‌లను చుట్టి ఉంటుంది ACT మరియు SmolVLA. కింద ఉన్నవన్నీ lerobot 0.6.1, 3 ఆగస్టు 2026 నుండి విడుదలైన వెర్షన్, మరియు 23 ఆగస్టు 2026 నాటి pi05 డాక్యుమెంట్‌లకు వ్యతిరేకంగా తనిఖీ చేయబడ్డాయి. ఇక్కడ వెర్షన్‌లు ముఖ్యమైనవి: v3.0 డేటాసెట్‌లు అక్టోబర్ 2025లో 0.4.0 తో వచ్చాయి, 9 మార్చి 2026 నాటి 0.5.0 బ్లాగ్ pi0-FAST మరియు Real-Time Chunking ను పరిచయం చేసింది, మరియు 6 జూలై 2026 నాటి 0.6.0 బేస్ ప్యాకేజీని తేలికగా చేసి, డిప్లాయ్‌మెంట్‌ను lerobot-rollout కు మార్చింది.

ఒక విషయం మారలేదు: lerobot-train మరియు lerobot-record ఇప్పటికే 0.3.2, ఆగస్టు 2025 లో ఎంట్రీ పాయింట్‌లుగా ఉన్నాయి. python -m lerobot.scripts.train అని ఇప్పటికీ పిలిచే ఒక ట్యుటోరియల్ ఒక సంవత్సరం మార్పులకు ముందుది మరియు మిగిలిన వాటిపై కూడా నమ్మకం ఉంచదగినది కాదు.

  1. 1
    సరైన ఎక్స్‌ట్రాలతో ఇన్‌స్టాల్ చేయండి

    0.6.0 నుండి, బేస్ ఇన్‌స్టాల్ కేవలం కోర్ ML డిపెండెన్సీలను మాత్రమే కలిగి ఉంటుంది, మరియు పై ఎక్స్‌ట్రా ఎటువంటి డేటాసెట్ లేదా శిక్షణ కోడ్‌ను జోడించదు, కాబట్టి ఫైన్-ట్యూన్ చేయడానికి శిక్షణ ఎక్స్‌ట్రా కూడా అవసరం. పాత వన్-లైనర్‌లు ఇక్కడ ఇంపోర్ట్ సమయంలో విఫలమవుతాయి.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    అథెంటికేట్ చేయండి

    బ్రౌజర్‌లో paligemma-3b-pt-224 లైసెన్స్‌ను అంగీకరించండి, ఆపై శిక్షణ ఇచ్చే మెషీన్‌లో లాగిన్ చేయండి.

    bash
    hf auth login
  3. 3
    క్వాంటైల్ గణాంకాలను జోడించండి

    Pi0.5 STATE మరియు ACTION లను క్వాంటైల్స్‌తో నార్మలైజ్ చేస్తుంది, కాబట్టి meta/stats.json కు q01 మరియు q99 అవసరం. పాత డేటాసెట్‌లు కేవలం min, max, mean, std లను మాత్రమే కలిగి ఉంటాయి.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    lerobot/pi05_base నుండి ఫైన్-ట్యూన్ చేయండి

    మీ కార్డ్ తట్టుకునే బ్యాచ్ పరిమాణాన్ని సెట్ చేయండి; డాక్యుమెంట్లు 80 GB వద్ద LIBERO లో 64 ను ఉపయోగిస్తాయి. bfloat16 ను స్పష్టంగా పాస్ చేయండి, కాన్ఫిగ్ డిఫాల్ట్ float32.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    ఆర్మ్‌పై అమలు చేయండి

    0.6.x లో ఇది lerobot-rollout: lerobot-record ఒక పాలసీని తిరస్కరిస్తుంది మరియు eval_ డేటాసెట్ పేర్లను అంగీకరించదు. బేస్ ఆర్మ్‌ను నడుపుతుంది, సెంటినల్ రోల్‌అవుట్‌ను రికార్డ్ చేస్తుంది.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
ఫ్లాగ్ఇది ఏమి చేస్తుందిగమనిక
--policy.type=pi05Pi0.5 ను ఎంచుకుంటుందిpretrained_path తో అవసరం, --policy.path తో వదిలివేయండి
--policy.pretrained_pathబరువులను మాత్రమే లోడ్ చేస్తుందిమీ డేటాసెట్ నుండి ఫీచర్ పేర్లు, నిల్వ చేయబడిన సెట్టింగ్‌లు రీసెట్ చేయబడతాయి
--policy.pathబరువులు మరియు చెక్‌పాయింట్ config.jsonn_action_steps వంటి నిల్వ చేయబడిన సెట్టింగ్‌లు వారసత్వంగా వస్తాయి
--policy.n_action_stepsప్రతి చంక్‌కు వినియోగించబడే దశలు50 కి తిరిగి వస్తుంది, chunk_size (డిఫాల్ట్ 50) కంటే ఎక్కువ ఉండదు
--policy.train_expert_onlyVLM ను స్తంభింపజేస్తుంది, నిపుణుడికి శిక్షణ ఇస్తుందిడిఫాల్ట్ తప్పు, తక్కువ మెమరీ, విజయంలో కొంత ఖర్చు
--policy.gradient_checkpointingయాక్టివేషన్‌లను నిల్వ చేయడానికి బదులుగా తిరిగి లెక్కించండిడిఫాల్ట్ తప్పు, ఒక రన్ సరిపోనప్పుడు మొదటి లివర్
--peft.method_type=LORAపూర్తి బరువులకు బదులుగా LoRA అడాప్టర్‌లుpeft ఎక్స్‌ట్రా అవసరం, డాక్యుమెంట్ చేయబడిన ఉదాహరణ SmolVLA
--policy.rtc_training_max_delayRTC కోసం యాక్షన్-ప్రిఫిక్స్ కండిషనింగ్మెయిన్ బ్రాంచ్ మాత్రమే, 0.6.1 లో లేదు, chunk_size కంటే తక్కువ ఉండాలి
--rename_mapడేటాసెట్ కాలమ్‌లను పాలసీ ఫీచర్‌లకు మ్యాప్ చేస్తుందిమీ కెమెరా కీలు భిన్నంగా ఉన్నప్పుడు అవసరం
చాలా మొదటి రన్‌లు ఎదుర్కొనే లోపం

క్వాంటైల్స్ లేకుండా మీరు మొదటి బ్యాచ్‌లో ValueError: QUANTILES normalization mode requires q01 and q99 stats పొందుతారు. గణాంకాలను తిరిగి లెక్కించండి, కానీ ఫలితం $HF_LEROBOT_HOME/your_dataset లో ఉంటుంది, --dataset.repo_id చదివే కాష్‌లో కాదు, కాబట్టి --dataset.root ను అక్కడికి సూచించేలా శిక్షణ ఇవ్వండి లేదా హబ్‌కు పుష్ చేయండి. లేదా LIBERO రిఫరెన్స్ కమాండ్ చేసినట్లుగా --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' తో క్వాంటైల్స్‌ను దాటవేయండి.

మూడు డిఫాల్ట్‌ల సెట్‌లు, మరియు ఏవి ట్రైనర్‌కు చేరుకుంటాయి

openpi యొక్క TrainConfig అనేది రిఫరెన్స్, మీరు ఏమీ చెప్పనప్పుడు lerobot-train ఉపయోగించేది LeRobot యొక్క PI05Config, మరియు ఇక్కడ ఉన్న ఫారం మూడవ సెట్‌ను పంపుతుంది. ఆశ్చర్యకరమైన విషయం ఏమిటంటే లెర్నింగ్ రేట్: రెండు అప్‌స్ట్రీమ్ డిఫాల్ట్‌లు 2.5e-5 వద్ద గరిష్ట స్థాయికి చేరుకుంటాయి, అయితే openpi యొక్క సొంత pi05_libero కాన్ఫిగ్ మరియు ఈ ప్లాట్‌ఫారమ్ దానిని 5e-5కి పెంచుతాయి.

సెట్టింగ్openpi TrainConfiglerobot pi05 మరియు lerobot-trainAY-Robots పంపుతుంది
బ్యాచ్ సైజు3281
గరిష్ట లెర్నింగ్ రేట్2.5e-5, కొసైన్ డికేoptimizer_lr 2.5e-55e-5
ట్రైనింగ్ స్టెప్స్30,000100,00030,000
చెక్‌పాయింట్ విరామం1,000 స్టెప్స్20,000 స్టెప్స్ఫారంలో లేదు
సీడ్421,000ఫారంలో ఉంది
యాక్షన్ చంక్action_horizon 50chunk_size 50, n_action_steps 50ఫారంలో లేదు
వెయిట్ dtypebfloat16float32 మీరు --policy.dtype పాస్ చేసే వరకుఫారంలో లేదు
గ్రాడియంట్ అక్యుములేషన్అలాంటి నాబ్ లేదు, బదులుగా fsdp_devicesఇప్పటివరకు ప్రతి విడుదల నుండి లేదు16, మరియు అది వదిలివేయబడింది

పోర్ట్ నమ్మదగినదా? LeRobot బృందం LIBERO బేస్ మోడల్‌ను అదనంగా 6k స్టెప్స్ కోసం ఫైన్-ట్యూన్ చేసింది మరియు నాలుగు సూట్‌లలో openpi యొక్క రిఫరెన్స్ నంబర్‌లతో పోల్చింది: 96.85కి వ్యతిరేకంగా 97.5 శాతం సగటు, Libero 10లో ముందుంది, Spatialలో వెనుకబడింది. ఈ మార్గం టూలింగ్ ఎంపిక, నాణ్యత ఎంపిక కాదు.

మీ స్వంత డేటాపై Pi0.5ని ఫైన్-ట్యూన్ చేయడం
ప్రయోజనాలు
  • దీని వెనుక 10,000 గంటల కంటే ఎక్కువ రోబోట్ ప్రీ-ట్రైనింగ్ ఉంది, కాబట్టి మీ పనికి 50 ఎపిసోడ్‌లు సరిపోతాయి.
  • నిరంతర చర్యలు: ట్యూన్ చేయడానికి టోకెనైజర్ లేదు, మీ జాయింట్ యాంగిల్స్‌పై డిస్క్రిటైజేషన్ ఫ్లోర్ లేదు.
  • LeRobot పోర్ట్ LIBERO సగటుపై openpi యొక్క 96.85కి వ్యతిరేకంగా 97.5 శాతం స్కోర్ చేస్తుంది, కాబట్టి స్నేహపూర్వక CLI కొలవదగిన ఖర్చును కలిగి ఉండదు.
  • రెండు వైపులా పారామీటర్-ఎఫిషియెంట్ పాత్‌లు: openpi యొక్క JAX LoRA వేరియంట్‌లు, LeRobot యొక్క PEFT ఇంటిగ్రేషన్.
ట్రేడ్-ఆఫ్‌లు
  • పూర్తి ఫైన్-ట్యూనింగ్‌కు 70 GB కంటే ఎక్కువ అవసరం. 22.5 GB LoRA సంఖ్య openpi యొక్క JAX సంఖ్య; PEFT కింద pi05 కోసం ఏదీ ప్రచురించబడలేదు.
  • ప్రతి యాక్షన్ స్టెప్‌కు 485 ms, ఇక్కడ ఉన్న ఐదింటిలో నెమ్మదైనది: SmolVLA కంటే రెండు రెట్లు, ACT కంటే ఇరవై నాలుగు రెట్లు.
  • LeRobot v3.0 అవసరం, కాబట్టి GR00T రన్ కోసం రికార్డ్ చేయబడిన డేటాసెట్‌ను మార్చాలి, మరియు దీనికి విరుద్ధంగా.
  • కొత్త ఎంపికలు మొదట మెయిన్‌లో వస్తాయి: ట్రైనింగ్-టైమ్ RTC మరియు MEM మెమరీ 0.6.1లో లేవు, కాబట్టి సరికొత్త డాక్యుమెంట్‌లు గిట్ నుండి ఇన్‌స్టాల్ చేయడాన్ని సూచించవచ్చు.

485 ms వాస్తవం, మరియు అది ఎక్కడ ఉపయోగపడకుండా పోతుంది

ఇది మీ ప్రాజెక్ట్‌ను నిర్ణయిస్తుంది, కాబట్టి ఇది ఖర్చు పట్టికకు ముందు వస్తుంది. Pi0.5 కోసం ఇక్కడ కొలవబడిన ప్రతి చర్య దశకు 485 ms. మిగిలిన నాలుగు వాటితో పోలిస్తే:

PolicyInference per action stepParamsGPU tierMinimum episodes
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.7 కు వ్యతిరేకంగా Pi0.5 కోసం AY-Robots హెడ్-టు-హెడ్ పేజీ, పారామీటర్లు, GPU టియర్, లేటెన్సీ మరియు డేటాసెట్ ఫార్మాట్‌తో
అదే GPU టియర్, అదే ఎపిసోడ్ ఫ్లోర్, విభిన్న డేటాసెట్ వెర్షన్, మూడు రెట్లు లేటెన్సీ గ్యాప్.
ఇన్ఫరెన్స్ సర్వోల పక్కన ఉండాలి

ఈ ఐదు మోడల్‌లలో నియంత్రణ లూప్ ప్రతి చర్య దశకు 20 నుండి 485 ms వరకు నడుస్తుంది. 485 ms పైన పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్‌లు పనిచేసే విధానాన్ని సంకోచించే విధానంగా మారుస్తాయి. రిమోట్ ఇన్ఫరెన్స్ నెమ్మదిగా వస్తువులను తీయడానికి మరియు ఉంచడానికి ఆచరణీయం, వేగవంతమైన ప్రతిస్పందన కదలికకు కాదు. LANలో మాత్రమే పనిచేసే డెమోను విక్రయించడం కంటే అలా చెప్పడమే మాకు ఇష్టం. మీ చేయి ఖండాల మధ్య ఆగిపోతే, పాలసీ మధ్య కదలికలో స్తంభిస్తుంది వద్ద ప్రారంభించండి.

అప్‌స్ట్రీమ్ వద్ద ఒక పరిష్కారం ఉంది, మరియు అందులో సగం మీరు ఇన్‌స్టాల్ చేయగల విడుదలలోనే ఉంది. రియల్-టైమ్ చంకింగ్, చేయి ప్రస్తుత ఖండాన్ని అమలు చేస్తున్నప్పుడు తదుపరి ఖండాన్ని ఉత్పత్తి చేస్తుంది, ఆపై కొత్త ఖండం యొక్క అతివ్యాప్తి చెందుతున్న దశలను ఇప్పటికే అమలు చేసిన భాగానికి దగ్గరగా ఉండేలా మార్గనిర్దేశం చేస్తుంది, తద్వారా చేయి అతుకు వద్ద ఆగిపోదు లేదా కుదుపుకు గురికాదు. Pi0, Pi0.5 మరియు SmolVLA కోసం 0.4.2 చేంజ్‌లాగ్‌లో పంపబడిన ఇన్ఫరెన్స్-టైమ్ ఫారం ఒక రోల్‌అవుట్ ఫ్లాగ్, రీట్రైన్ కాదు:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon అనేది మునుపటి ఖండం యొక్క ఎన్ని దశలతో కొత్తది అంగీకరించాలో సూచిస్తుంది; RTC డాక్యుమెంట్లు 8 నుండి 12 వరకు సాధారణ పరిధిగా ఇస్తాయి. డిఫాల్ట్ ఇన్ఫరెన్స్ బ్యాకెండ్ --inference.type=sync.

ఇది మోడల్‌ను వేగవంతం చేయదు. ఇది అంతరాన్ని దాచిపెడుతుంది: 485 ms ఇప్పటికీ ఖర్చు అవుతుంది, కానీ కీలక మార్గం నుండి దూరంగా, కాబట్టి ఖండాల మధ్య క్యూ ఎండిపోదు. arXiv 2512.05964 నుండి వచ్చిన శిక్షణ-సమయ వేరియంట్ మరింత ముందుకు వెళుతుంది: మోడల్ ఒక క్లీన్ యాక్షన్ ప్రిఫిక్స్‌పై షరతు విధించడం నేర్చుకుంటుంది, కాబట్టి ఇన్ఫరెన్స్ వద్ద అతివ్యాప్తి మార్గనిర్దేశం చేయబడకుండా, ప్రతి-చర్య ప్రవాహ టైమ్‌స్టెప్‌లతో గట్టిగా ఇన్-పెయింట్ చేయబడుతుంది, మరియు మార్గనిర్దేశక బ్యాక్‌వర్డ్ పాస్ అదృశ్యమవుతుంది. శిక్షణ సమయంలో ఇది ప్రతి ఉదాహరణకు ఒక ప్రిఫిక్స్ పొడవును నమూనా చేస్తుంది మరియు మిగిలిన పోస్ట్‌ఫిక్స్‌పై ప్రవాహ నష్టాన్ని తీసుకుంటుంది. ఆ ఫ్లాగ్ మెయిన్‌లో మాత్రమే ఉంటుంది, 0.6.1లో కాదు, మరియు మీరు శిక్షణ ఇచ్చే ఆలస్యం chunk_size కంటే తక్కువగా ఉండాలి.

Pi0.5 చెక్‌పాయింట్‌ను పొందడానికి రెండు మార్గాలు

మీరు 80 GB కార్డ్‌ను అద్దెకు తీసుకుంటారు లేదా స్వంతం చేసుకుంటారు, పైన పేర్కొన్న స్టాక్‌లలో ఒకదాన్ని ఇన్‌స్టాల్ చేస్తారు, మీ డేటాసెట్‌ను మారుస్తారు మరియు రన్‌ను పర్యవేక్షిస్తారు. మీరు ప్రతి నాబ్‌ను ఉంచుకుంటారు: openpi యొక్క JAX LoRA, LeRobot యొక్క PEFT అడాప్టర్‌లు, సాపేక్ష చర్యలు, అనుకూల కీ మ్యాపింగ్‌లు. మీరు ప్రతి వైఫల్యాన్ని కూడా ఉంచుకుంటారు.

  • హార్డ్‌వేర్: A100 80 GB లేదా H100, లేదా openpi యొక్క JAX LoRA మార్గంలో 24 GB కార్డ్.
  • సెటప్: మొదటి రన్ కోసం ఒక మధ్యాహ్నం, ఎక్కువగా కీ మ్యాపింగ్ మరియు గేటెడ్ టోకెనైజర్.
  • హోస్ట్ చేసిన ఫారమ్‌లో లేదు: PEFT అడాప్టర్‌లు, సాపేక్ష చర్యలు, శిక్షణ-సమయ RTC, MEM మెమరీ.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
హోస్ట్ చేసిన ఫారమ్ అమలు చేయని ఆదేశం, మరియు pip ఇన్‌స్టాల్ చేయదు: శిక్షణ-సమయ RTC అనేది ప్రధాన బ్రాంచ్ ఫ్లాగ్.

ఇది పని చేయనప్పుడు

లక్షణంఅత్యంత సంభావ్య కారణం
రన్ ప్రారంభం కాకముందే తిరస్కరించబడిందిడేటాసెట్ v2.1 కానీ Pi0.5 v3.0 కోరుకుంటుంది, లేదా GR00T కోసం దీనికి విరుద్ధంగా
ImportError, డేటాసెట్స్ ప్యాకేజీ లేదుశిక్షణ అదనపు లేకుండా lerobot 0.6.x
బ్యాచ్ ఒకటిలో q01 మరియు q99 గురించి ValueErrormeta/stats.jsonలో క్వాంటైల్స్ లేవు; తిరిగి లెక్కించండి లేదా MEAN_STDని ఉపయోగించండి
దశ 0 వద్ద CUDA మెమరీ అయిపోయింది70 GB కంటే తక్కువ పూర్తి ఫైన్-ట్యూన్; చెక్‌పాయింటింగ్ లేదా train_expert_onlyని ప్రయత్నించండి
401 లేదా గేటెడ్ రెపో లోపంPaliGemma టోకెనైజర్ లైసెన్స్ ఆమోదించబడలేదు
నష్టం తగ్గుతుంది, రోబోట్ ఏమీ చేయదుసాధారణీకరణ సరిపోలడం లేదు, లేదా పాలసీ స్థితిని కాపీ చేస్తుంది
చంక్‌ల మధ్య ఆర్మ్ ఆగిపోతుందిప్రతి-దశ లేటెన్సీ ప్లస్ రౌండ్ ట్రిప్; చంక్ క్యూ ఎండిపోతుంది
ఒక సెటప్‌లో పనిచేస్తుంది, మరొకదానిలో విఫలమవుతుందిచాలా తక్కువ ఎపిసోడ్‌లు, లేదా అన్నీ ఒకే కాన్ఫిగరేషన్‌లో

ఒక రన్ ఎంత ఖర్చవుతుంది

Pi0.5 ఖరీదైన శ్రేణిలో ఉంది ఎందుకంటే దీనికి 80 GB కార్డ్ అవసరం, మరియు స్పాట్ ధరలు మారుతూ ఉంటాయి, కాబట్టి ఈ సంఖ్య ఒక ధర కాకుండా ఒక పరిధిని సూచిస్తుంది. అనేక SO-100 పనుల కోసం, ముందుగా SmolVLA లేదా ACTని 24 GB శ్రేణిలో శిక్షణ ఇవ్వండి, పని నేర్చుకోదగినదా అని నిర్ధారించుకోండి, ఆపై దానిపై A100 గంటలు వెచ్చించండి. మీ మొదటి పాలసీకి శిక్షణ ఇవ్వండి ఆ చౌకైన లూప్‌ను వివరిస్తుంది, మరియు ధర ప్రస్తుత శ్రేణులను కలిగి ఉంది.

శ్రేణిపాలసీలుసాధారణ రన్గంటకు ధరఒక రన్‌కు ఖర్చు
A100 80 GB or H100Pi0.5, GR00T N1.7, GR00T N1.53 to 6 hours1.20 to 2.00 USDabout 4 to 12 USD
RTX 4090 or any 24 GB cardSmolVLA, ACT2 to 5 hours0.30 to 0.60 USDabout 1 to 3 USD
AY-Robots ఖర్చుల పట్టిక, ప్రతి పాలసీకి ఏ GPU అవసరమో, సాధారణ రన్ టైమ్ మరియు ధర, మరియు ఒక పాలసీ ఉపయోగకరంగా మారడానికి ముందు ఎన్ని ఎపిసోడ్‌లు అవసరమో చూపుతుంది.
ఉత్పత్తి పేజీలో అదే రెండు శ్రేణులు: Pi0.5 80 GB కార్డ్‌ను అద్దెకు తీసుకుంటుంది, SmolVLA మరియు ACT 4090లో సరిపోతాయి.

ఒక సాయంత్రం కేటాయించే ముందు: GR00T N1.7 వర్సెస్ Pi0.5 మరియు Pi0.5 వర్సెస్ SmolVLA అదే సంఖ్యలను తలపైన తలపెట్టి చూపిస్తాయి. అరేనా 332 బెంచ్‌మార్క్ ఫలితాలతో 85 VLA మోడళ్లను కలిగి ఉంది, ప్రతి ఒక్కటి దాని మూలానికి లింక్ చేయబడింది, మరియు ఈ కుటుంబం గురించిన నేపథ్యం మా VLA అవలోకనం.

స్టాక్‌ను నిర్మించకుండా Pi0.5కి శిక్షణ ఇవ్వండి

ఒక ఫారమ్‌లో డేటాసెట్ మరియు హైపర్‌పారామీటర్‌లను ఎంచుకోండి. బ్యాకెండ్ స్పాట్ మార్కెట్‌లో 80 GB కార్డ్‌ను అద్దెకు తీసుకుంటుంది, ట్రైనర్‌ను నడుపుతుంది మరియు చెక్‌పాయింట్‌లను ఆబ్జెక్ట్ స్టోరేజ్‌కు వ్రాస్తుంది. SO-100, SO-101, Koch v1.1 మరియు LeKiwi కోసం మార్గదర్శకాలు.

శిక్షణ మార్గదర్శకాలను తెరవండి
నేను RTX 4090లో Pi0.5ని ఫైన్-ట్యూన్ చేయవచ్చా?

పూర్తి ఫైన్-ట్యూన్ కాదు: openpi దాని కోసం 70 GB కంటే ఎక్కువ జాబితా చేస్తుంది, కాబట్టి A100 80 GB లేదా H100. దీని 22.5 GB LoRA సంఖ్య JAX మార్గానికి చెందినది; PyTorch అమలుకు LoRA లేదు. LeRobot యొక్క PEFT ఇంటిగ్రేషన్ ఉంది, కానీ దాని డాక్యుమెంట్ చేయబడిన ఉదాహరణ SmolVLA మరియు pi05 కోసం VRAM సంఖ్య ప్రచురించబడలేదు.

నాకు ఎన్ని ఎపిసోడ్‌లు అవసరం?

యాభై, GR00T మరియు ACT వలె అదే కనీస సంఖ్య; SmolVLA మాత్రమే తక్కువగా, 30 వద్ద ఉంటుంది. బేస్ చెక్‌పాయింట్ 10,000 గంటల కంటే ఎక్కువ ప్రీ-ట్రైనింగ్‌ను కలిగి ఉంటుంది, కాబట్టి ఫైన్-ట్యూన్ ఏమీ నేర్చుకోకుండానే స్వీకరిస్తుంది: 50 శుభ్రమైన, విభిన్న ఎపిసోడ్‌లు ఒక కాన్ఫిగరేషన్ నుండి రెండు వందలను అధిగమిస్తాయి.

--policy.path మరియు --policy.pretrained_path మధ్య తేడా ఏమిటి?

--policy.path వెయిట్‌లను మరియు చెక్‌పాయింట్ యొక్క config.jsonను లోడ్ చేస్తుంది, కాబట్టి n_action_steps వంటి నిల్వ చేయబడిన సెట్టింగ్‌లు వారసత్వంగా వస్తాయి మరియు --policy.type తప్పనిసరిగా వదిలివేయబడాలి. --policy.pretrained_path వెయిట్‌లను మాత్రమే లోడ్ చేస్తుంది: ఫీచర్ పేర్లు మీ డేటాసెట్ నుండి వస్తాయి, నిల్వ చేయబడిన సెట్టింగ్‌లు రీసెట్ చేయబడతాయి, --policy.type అవసరం. అందుకే LIBERO కమాండ్ n_action_steps=10 మరియు empty_cameras=1ని స్పష్టంగా పంపుతుంది; లేకపోతే అవి 50 మరియు 0కి తిరిగి వస్తాయి.

ఓపెన్ వెర్షన్ పేపర్‌లో ఉన్న పూర్తి Pi0.5ని నాకు అందిస్తుందా?

లేదు. రెండూ ఫ్లో మ్యాచింగ్ యాక్షన్ హెడ్‌ను మాత్రమే సపోర్ట్ చేస్తాయి. FAST యాక్షన్ టోకెనైజర్ మరియు హై-లెవల్ సబ్‌టాస్క్ ప్రిడిక్షన్‌తో కూడిన డిస్క్రీట్-టోకెన్ ప్రీ-ట్రైనింగ్ దశ విడుదల కాలేదు, మరియు lerobot/pi05_base కార్డ్ ఆ జాబితాకు RLని జోడిస్తుంది, అయినప్పటికీ pi0.5 పేపర్లో రీన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ దశ గురించి వివరించబడలేదు. మీరు అందించే భాషా స్ట్రింగ్‌పై ఆధారపడి తక్కువ-స్థాయి పాలసీకి శిక్షణ ఇస్తారు, సుదీర్ఘమైన పనిని స్వయంగా విడదీసే మోడల్‌కు కాదు.

ఈ గైడ్ ఏ వెర్షన్‌లను ఉద్దేశించి వ్రాయబడింది?

మెయిన్‌లో openpi మరియు lerobot 0.6.1, 3 ఆగస్టు 2026 నుండి విడుదలైనవి, రెండూ 23 ఆగస్టు 2026న చదవబడ్డాయి. v3.0 డేటాసెట్‌లు అక్టోబర్ 2025లో 0.4.0తో వచ్చాయి. 0.6.0 బేస్ ప్యాకేజీని తేలికగా చేసింది, కాబట్టి lerobot[pi] మాత్రమే ఇకపై శిక్షణ స్టాక్‌ను ఇన్‌స్టాల్ చేయదు, మరియు డిప్లాయ్‌మెంట్‌ను lerobot-rolloutకి మార్చింది. ట్రైనింగ్-టైమ్ RTC మెయిన్‌లో మాత్రమే ఉంది; ఇక్కడ హోస్ట్ చేయబడిన ట్రైనర్ 0.5.1ని నడుపుతుంది.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started