
ఫిజికల్ ఇంటెలిజెన్స్ నుండి ఫ్లో-మ్యాచింగ్ VLA అయిన Pi0.5ని మీ స్వంత రోబోట్ డేటాపై ఫైన్-ట్యూన్ చేయండి. openpi మరియు lerobot pi05 కోసం నిజమైన ఆదేశాలు, డేటాసెట్ ఫార్మాట్ సమస్యలు, VRAM మరియు లేటెన్సీ పరిమితులు.
Pi0.5 అనేది ఒక పాలసీ ఇంతకు ముందు చూడని గదిలో పని చేయాల్సి వచ్చినప్పుడు మీరు ఎంచుకునే మోడల్. ఇది ఇక్కడ ఉన్న ఐదు శిక్షణ ఇవ్వగల పాలసీలు లో అత్యంత కష్టమైనది, చేతితో ఫైన్-ట్యూన్ చేయడానికి: అప్స్ట్రీమ్ రిపోజిటరీ మొదట JAX, LeRobot పోర్ట్ 0.6.0లో lerobot-record నుండి డిప్లాయ్మెంట్ను తరలించింది మరియు బేస్ ఇన్స్టాల్ను శిక్షణ ఇవ్వడానికి చాలా చిన్నదిగా చేసింది, మరియు పూర్తి ఫైన్-ట్యూన్ 4090లో సరిపోదు. కింద: ఇన్ఫరెన్స్ వద్ద ఫ్లో మ్యాచింగ్ ఎంత ఖర్చవుతుంది, రెండు కమాండ్ మార్గాలు, మరియు ఫలితం ఉపయోగపడగలదా అని నిర్ణయించే 485 ms సంఖ్య.
మీరు తెలుసుకోవలసినవి
- •ఒక ఫ్లో-మ్యాచింగ్ VLA: 3B పాలిగెమ్మా VLM మరియు నిరంతర యాక్షన్ చంక్లను డీకోడ్ చేసే 300M యాక్షన్ ఎక్స్పర్ట్. దీన్ని ఫైన్-ట్యూన్ చేయడానికి రెండు మార్గాలు, openpi మరియు LeRobot pi05, LIBERO సగటున 0.65 పాయింట్ల తేడాతో.
- •పూర్తి ఫైన్-ట్యూనింగ్కు 70 GB కంటే ఎక్కువ VRAM అవసరం. openpi LoRAను 22.5 GB వద్ద జాబితా చేస్తుంది, దాని JAX మార్గంలో మాత్రమే.
- •డేటాసెట్ meta/stats.jsonలో q01 మరియు q99 క్వాంటైల్స్తో LeRobotDataset v3.0 అయి ఉండాలి, లేకపోతే బ్యాచ్ ఒకటి లోపం చూపుతుంది.
- •ముందుగా మీ lerobot వెర్షన్ను తనిఖీ చేయండి: 0.6.0 బేస్ ప్యాకేజీని తేలికగా చేసి, lerobot-record నుండి డిప్లాయ్మెంట్ను తరలించింది.
- •ఇక్కడ ఇది ప్రతి యాక్షన్ స్టెప్కు 485 ms వద్ద నడుస్తుంది, 50 ఎపిసోడ్లు కావాలి, మరియు ప్రతి రన్కు సుమారు 4 నుండి 12 USD ఖర్చవుతుంది.
Pi0.5 అంటే ఏమిటి
ఫిజికల్ ఇంటెలిజెన్స్ అక్టోబర్ 2024లో pi0ను ప్రచురించింది: ఒక ప్రీట్రైన్డ్ VLMపై ఫ్లో మ్యాచింగ్ విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్: 3 బిలియన్ పారామీటర్లతో పాలిగెమ్మా మరియు మొదటి నుండి ప్రారంభించబడిన 300M యాక్షన్ ఎక్స్పర్ట్, మొత్తం 3.3 బిలియన్. ఈ పత్రం 7 రోబోట్ కాన్ఫిగరేషన్లు మరియు 68 టాస్క్లలో 10,000 గంటలకు పైగా రోబోట్ డేటాపై ప్రీ-ట్రైనింగ్ను నివేదిస్తుంది. మరింత సమాచారం pi0 వ్యాసంలో.
Pi0.5 (arXiv 2504.16054, 22 ఏప్రిల్ 2025) ఆ స్కెలిటన్ను అలాగే ఉంచి, శిక్షణ ఆహారాన్ని మార్చింది: వెబ్ డేటా, ఆబ్జెక్ట్ డిటెక్షన్, రోబోట్కు శిక్షణ ఇచ్చే మానవుల నుండి మౌఖిక సూచనలు, సబ్టాస్క్ లేబుల్లు, అనేక ఇళ్లలోని రోబోట్ల నుండి క్రాస్-ఎంబోడిమెంట్ డేటా. శిక్షణ సెట్లో లేని ఇళ్లలో వంటగదులను శుభ్రం చేసే రోబోట్ ఫలితం. ఓపెన్పి README శీర్షికలో లేని ఒక వివరాలను జోడిస్తుంది: విడుదలైన pi0.5 నాలెడ్జ్ ఇన్సులేషన్తో (arXiv 2505.23705) శిక్షణ పొందింది.
| లక్షణం | pi0 | pi0.5 |
|---|---|---|
| VLM బ్యాక్బోన్ వేరియంట్ | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| యాక్షన్ ఎక్స్పర్ట్ వేరియంట్ | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| action_horizon డిఫాల్ట్ | 50 | 50 |
| max_token_len | 48 | 200 |
| discrete_state_input | false | true, ప్రాంప్ట్లో స్టేట్ బిన్లుగా విభజించబడింది |
| బేస్ చెక్పాయింట్ | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
ఓపెన్పి README స్పష్టంగా పేర్కొంది: రిపోజిటరీ pi0.5 శిక్షణ మరియు ఇన్ఫరెన్స్ రెండింటికీ ఫ్లో మ్యాచింగ్ హెడ్ను మాత్రమే సపోర్ట్ చేస్తుంది. ఈ పేపర్ రెండు దశలను వివరిస్తుంది మరియు కోడ్ రెండవ దశను మాత్రమే కలిగి ఉంది: ప్రీ-ట్రైనింగ్ ప్రతి చర్యను FAST టోకెనైజర్ ద్వారా వివిక్త టోకెన్లుగా సూచిస్తుంది, మరియు డిప్లాయ్మెంట్ వద్ద మోడల్ ప్రతి యాక్షన్ చంక్ ముందు ఒక ఉన్నత-స్థాయి సబ్టాస్క్ను ఊహిస్తుంది. వాటిలో ఏదీ రిపోజిటరీలో లేదు. lerobot/pi05_base కార్డ్ అదే జాబితాను ఇస్తుంది మరియు RLని జోడిస్తుంది, అయితే pi0.5 పేపర్ ఎటువంటి రీన్ఫోర్స్మెంట్ లెర్నింగ్ దశను వివరించదు. LeRobot పోర్ట్ ఆ పరిధిని వారసత్వంగా పొందుతుంది, మరియు దానిపై హోస్ట్ చేయబడిన ప్రతి ట్రైనర్ కూడా, ఇక్కడ ఉన్నది కూడా. లైసెన్సింగ్ కూడా విభజించబడింది: pi05 డాక్ పేజీ Apache 2.0 అని చెబుతుంది, lerobot/pi05_base కార్డ్ license: gemma అని ట్యాగ్ చేయబడింది.
ఫ్లో మ్యాచింగ్ శిక్షణ మరియు ఇన్ఫరెన్స్ గురించి ఏమి మారుస్తుంది
ఒక పాలసీ మీరు SO-100లో శిక్షణ ఇవ్వగలరు, అది చర్యలను నేరుగా రిగ్రెస్ చేస్తుంది (ACT) లేదా వాటిని టోకనైజ్ చేసి ఆటోరిగ్రెసివ్గా డీకోడ్ చేస్తుంది (pi0-FAST). ఫ్లో మ్యాచింగ్ రెండూ చేయదు: ఇది శబ్దాన్ని శుభ్రమైన యాక్షన్ చంక్, ఆపై దానిని అనుసంధానిస్తుంది. pi0 పేపర్ 0.1 స్టెప్ సైజు వద్ద 10 ఇంటిగ్రేషన్ స్టెప్లను ఉపయోగిస్తుంది; LeRobot యొక్క pi05 కాన్ఫిగరేషన్ అదే num_inference_steps: int = 10ని కలిగి ఉంటుంది.
- శిక్షణ: నష్టము నాయిస్డ్ యాక్షన్ చంక్ను రిగ్రెస్ చేస్తుంది. ట్యూన్ చేయడానికి టోకనైజర్ లేదు, మీ జాయింట్ యాంగిల్స్ను డిస్క్రిటైజ్ చేయాల్సిన అవసరం లేదు.
- ఇన్ఫరెన్స్: ఒక చంక్ యాక్షన్ ఎక్స్పర్ట్ ద్వారా పది ఫార్వర్డ్ పాస్లకు ఖర్చవుతుంది. ఇది నిర్మాణాత్మకమైనది, ట్యూనింగ్ సమస్య కాదు.
- అవుట్పుట్: 32 డైమెన్షన్ల నిరంతర చర్యలు, అంతర్గతంగా ప్యాడ్ చేయబడినవి, మీ రోబోట్ కలిగి ఉన్న డైమెన్షన్లపై నష్టం తీసుకోబడుతుంది. 6-DoF ఆర్మ్ ప్లస్ గ్రిప్పర్ 7ని ఉపయోగిస్తుంది.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to Trueపాలిజెమ్మా బ్యాక్బోన్, మరియు దాని ముందున్న గేట్
PaliGemma (arXiv 2407.07726) అనేది Gemma-2B లాంగ్వేజ్ మోడల్పై SigLIP-So400m విజన్ ఎన్కోడర్, సుమారు 3B పారామీటర్లతో ఉంటుంది. Pi0.5 దాని టోకెనైజర్ను వారసత్వంగా పొందుతుంది, మరియు ఆ టోకెనైజర్ గేటెడ్ రిపోజిటరీలో ఉంటుంది. మొదటి రన్ విఫలమవడానికి ఇది అత్యంత సాధారణ మార్గం, మొదటి ట్రైనింగ్ స్టెప్.
LeRobot pi05 డాక్యుమెంట్లు స్పష్టంగా పేర్కొంటున్నాయి: pi0.5 గేటెడ్ google/paligemma-3b-pt-224 టోకెనైజర్ను ఉపయోగిస్తుంది, కాబట్టి హబ్లో దాని లైసెన్స్ను అంగీకరించి, ముందుగా hf auth login రన్ చేయండి. యాక్సెస్ మాన్యువల్గా మంజూరు చేయబడుతుంది, తక్షణమే కాదు. దీన్ని దాటవేసి, పెయిడ్ క్లౌడ్ రన్ను ప్రారంభిస్తే, టోకెనైజర్ను డౌన్లోడ్ చేయలేని పాడ్ కోసం మీరు చెల్లించాల్సి ఉంటుంది.
మీరు ప్రారంభించే ముందు: డేటాసెట్ ఫార్మాట్, ఎపిసోడ్లు, హార్డ్వేర్
LeRobotలోని Pi0.5 LeRobot డేటాసెట్ను v3.0 లేఅవుట్లో చదువుతుంది, ఇది అక్టోబర్ 2025లో lerobot 0.4.0తో వచ్చింది: ప్రతి Parquet మరియు MP4 ఫైల్కు అనేక ఎపిసోడ్లు, ప్రతి ఎపిసోడ్కు, ఫైల్నేమ్లకు బదులుగా meta/episodes/లో సరిహద్దులతో. డెస్క్టాప్ క్లయింట్తో రికార్డ్ చేయండి లేదా మీ మొదటి డేటాసెట్ను రికార్డ్ చేయండిను అనుసరించండి మరియు మీకు అది లభిస్తుంది.
| మోడ్ | GPU మెమరీ అవసరం | ఉదాహరణ GPU |
|---|---|---|
| ఇన్ఫరెన్స్ | more than 8 GB | RTX 4090 |
| ఫైన్-ట్యూనింగ్, LoRA | more than 22.5 GB | RTX 4090 |
| ఫైన్-ట్యూనింగ్, పూర్తి | more than 70 GB | A100 80 GB or H100 |
Pi0.5 మరియు SmolVLA లకు LeRobot v3.0 అవసరం. GR00T N1.7 మరియు GR00T N1.5 లకు v2.0 లేదా v2.1 అవసరం మరియు అవి v3.0 డేటాసెట్పై క్రాష్ అవుతాయి. ఒక రికార్డింగ్ సెషన్ మార్పిడి లేకుండా రెండింటికీ అందించదు, మరియు లోపం "తప్పు డేటాసెట్ వెర్షన్" అని చెప్పదు. డేటాసెట్ తిరస్కరించబడింది: v3 అవసరం చూడండి.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPi0.5 కోసం ప్లాట్ఫారమ్కు కనీసం 50 ఎపిసోడ్లు అవసరం, ఇది GR00T మరియు ACT లతో సమానం. ప్రీ-ట్రైనింగ్ భారీ పనిని చేస్తుంది, కాబట్టి 50 శుభ్రమైన ఎపిసోడ్లు 200 అస్తవ్యస్తమైన వాటి కంటే మెరుగు. దీనికి కొత్తవారైతే? దీనితో ప్రారంభించండి డేటా సేకరణ గైడ్.

మార్గం A: openpi రిపోజిటరీతో ఫైన్-ట్యూన్ చేయండి
రిఫరెన్స్ ఇంప్లిమెంటేషన్: మొదట JAX, Ubuntu 22.04లో మాత్రమే పరీక్షించబడింది, ఫ్లాగ్ల కంటే కాన్ఫిగ్ ఆబ్జెక్ట్ల ద్వారా నడపబడుతుంది. PyTorch మార్గం సెప్టెంబర్ 2025లో వచ్చింది, LIBEROలో ధృవీకరించబడింది. మూడు దశలు: మీ డేటాను మార్చండి, కాన్ఫిగ్ను నిర్వచించండి, శిక్షణ ఇవ్వండి మరియు సేవ చేయండి.
- 1క్లోన్ చేసి ఇన్స్టాల్ చేయండి
openpi uvని ఉపయోగిస్తుంది. GIT_LFS_SKIP_SMUDGE అనేది LeRobot LFS బ్లోబ్లు లేకుండా డిపెండెన్సీగా రావడానికి అనుమతిస్తుంది.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2మీ డేటాను LeRobot డేటాసెట్గా మార్చండి
అప్స్ట్రీమ్ LIBERO మరియు DROID కోసం కన్వర్టర్లను అందిస్తుంది మరియు మీరు ఒకదాన్ని స్వీకరించాలని ఆశిస్తుంది. పని కీ మ్యాపింగ్.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3శిక్షణ కాన్ఫిగ్ను జోడించండి
కాన్ఫిగ్లు src/openpi/training/config.pyలో TrainConfig ఎంట్రీలు. ఇది pi05_droid_finetuneని స్వీకరిస్తుంది, వెయిట్ లోడర్ pi05_base వద్ద సూచించబడింది.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4నార్మ్ గణాంకాలను లెక్కించండి
డేటాసెట్కు వ్యతిరేకంగా కాకుండా, కాన్ఫిగ్ పేరుకు వ్యతిరేకంగా నడుస్తుంది. దీన్ని దాటవేయడం ఇక్కడ క్లాసిక్ మొదటి వైఫల్యం.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5శిక్షణ ఇవ్వండి
ఈ వేరియబుల్ JAX డిఫాల్ట్ 75 శాతం బదులు 90 శాతం GPU మెమరీని ఉపయోగించడానికి అనుమతిస్తుంది. 80 GB కార్డ్లో, ఇది రన్ నిలబడుతుందా లేదా అని నిర్ణయిస్తుంది.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6సేవ చేయండి
సర్వర్ పోర్ట్ 8000లో వింటుంది మరియు అబ్జర్వేషన్ ప్రశ్నలకు సమాధానం ఇస్తుంది; మీ రోబోట్ రన్టైమ్ క్లయింట్.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi యొక్క PyTorch అమలు pi0-FAST, మిక్స్డ్ ప్రెసిషన్, FSDP, LoRA లేదా EMA వెయిట్లను సపోర్ట్ చేయదు, కాబట్టి 22.5 GBకి చేరే LoRA కేవలం JAX మాత్రమే, gemma_2b_lora మరియు gemma_300m_lora వేరియంట్ల ద్వారా. అంతకంటే దారుణం: ఈ సెటప్ మీ ఇన్స్టాల్ చేయబడిన transformers 4.53.2 పై ప్యాచ్ చేయబడిన ఫైల్లను కాపీ చేస్తుంది, మరియు uv యొక్క డిఫాల్ట్ హార్డ్లింక్ మోడ్తో ఇది uv కాష్లోని transformers ను శాశ్వతంగా మారుస్తుందని మరియు ఇతర ప్రాజెక్ట్లలోకి లీక్ అవ్వగలదని README హెచ్చరిస్తుంది. దీనిని uv cache clean transformers తో రద్దు చేయండి.
మార్గం B: lerobot pi05 తో ఫైన్-ట్యూన్ చేయండి
LeRobot పోర్ట్ మీరు ఇప్పటికే ఉపయోగించే CLI లో అదే వెయిట్లను చుట్టి ఉంటుంది ACT మరియు SmolVLA. కింద ఉన్నవన్నీ lerobot 0.6.1, 3 ఆగస్టు 2026 నుండి విడుదలైన వెర్షన్, మరియు 23 ఆగస్టు 2026 నాటి pi05 డాక్యుమెంట్లకు వ్యతిరేకంగా తనిఖీ చేయబడ్డాయి. ఇక్కడ వెర్షన్లు ముఖ్యమైనవి: v3.0 డేటాసెట్లు అక్టోబర్ 2025లో 0.4.0 తో వచ్చాయి, 9 మార్చి 2026 నాటి 0.5.0 బ్లాగ్ pi0-FAST మరియు Real-Time Chunking ను పరిచయం చేసింది, మరియు 6 జూలై 2026 నాటి 0.6.0 బేస్ ప్యాకేజీని తేలికగా చేసి, డిప్లాయ్మెంట్ను lerobot-rollout కు మార్చింది.
ఒక విషయం మారలేదు: lerobot-train మరియు lerobot-record ఇప్పటికే 0.3.2, ఆగస్టు 2025 లో ఎంట్రీ పాయింట్లుగా ఉన్నాయి. python -m lerobot.scripts.train అని ఇప్పటికీ పిలిచే ఒక ట్యుటోరియల్ ఒక సంవత్సరం మార్పులకు ముందుది మరియు మిగిలిన వాటిపై కూడా నమ్మకం ఉంచదగినది కాదు.
- 1సరైన ఎక్స్ట్రాలతో ఇన్స్టాల్ చేయండి
0.6.0 నుండి, బేస్ ఇన్స్టాల్ కేవలం కోర్ ML డిపెండెన్సీలను మాత్రమే కలిగి ఉంటుంది, మరియు పై ఎక్స్ట్రా ఎటువంటి డేటాసెట్ లేదా శిక్షణ కోడ్ను జోడించదు, కాబట్టి ఫైన్-ట్యూన్ చేయడానికి శిక్షణ ఎక్స్ట్రా కూడా అవసరం. పాత వన్-లైనర్లు ఇక్కడ ఇంపోర్ట్ సమయంలో విఫలమవుతాయి.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2అథెంటికేట్ చేయండి
బ్రౌజర్లో paligemma-3b-pt-224 లైసెన్స్ను అంగీకరించండి, ఆపై శిక్షణ ఇచ్చే మెషీన్లో లాగిన్ చేయండి.
bashhf auth login - 3క్వాంటైల్ గణాంకాలను జోడించండి
Pi0.5 STATE మరియు ACTION లను క్వాంటైల్స్తో నార్మలైజ్ చేస్తుంది, కాబట్టి meta/stats.json కు q01 మరియు q99 అవసరం. పాత డేటాసెట్లు కేవలం min, max, mean, std లను మాత్రమే కలిగి ఉంటాయి.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4lerobot/pi05_base నుండి ఫైన్-ట్యూన్ చేయండి
మీ కార్డ్ తట్టుకునే బ్యాచ్ పరిమాణాన్ని సెట్ చేయండి; డాక్యుమెంట్లు 80 GB వద్ద LIBERO లో 64 ను ఉపయోగిస్తాయి. bfloat16 ను స్పష్టంగా పాస్ చేయండి, కాన్ఫిగ్ డిఫాల్ట్ float32.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5ఆర్మ్పై అమలు చేయండి
0.6.x లో ఇది lerobot-rollout: lerobot-record ఒక పాలసీని తిరస్కరిస్తుంది మరియు eval_ డేటాసెట్ పేర్లను అంగీకరించదు. బేస్ ఆర్మ్ను నడుపుతుంది, సెంటినల్ రోల్అవుట్ను రికార్డ్ చేస్తుంది.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| ఫ్లాగ్ | ఇది ఏమి చేస్తుంది | గమనిక |
|---|---|---|
| --policy.type=pi05 | Pi0.5 ను ఎంచుకుంటుంది | pretrained_path తో అవసరం, --policy.path తో వదిలివేయండి |
| --policy.pretrained_path | బరువులను మాత్రమే లోడ్ చేస్తుంది | మీ డేటాసెట్ నుండి ఫీచర్ పేర్లు, నిల్వ చేయబడిన సెట్టింగ్లు రీసెట్ చేయబడతాయి |
| --policy.path | బరువులు మరియు చెక్పాయింట్ config.json | n_action_steps వంటి నిల్వ చేయబడిన సెట్టింగ్లు వారసత్వంగా వస్తాయి |
| --policy.n_action_steps | ప్రతి చంక్కు వినియోగించబడే దశలు | 50 కి తిరిగి వస్తుంది, chunk_size (డిఫాల్ట్ 50) కంటే ఎక్కువ ఉండదు |
| --policy.train_expert_only | VLM ను స్తంభింపజేస్తుంది, నిపుణుడికి శిక్షణ ఇస్తుంది | డిఫాల్ట్ తప్పు, తక్కువ మెమరీ, విజయంలో కొంత ఖర్చు |
| --policy.gradient_checkpointing | యాక్టివేషన్లను నిల్వ చేయడానికి బదులుగా తిరిగి లెక్కించండి | డిఫాల్ట్ తప్పు, ఒక రన్ సరిపోనప్పుడు మొదటి లివర్ |
| --peft.method_type=LORA | పూర్తి బరువులకు బదులుగా LoRA అడాప్టర్లు | peft ఎక్స్ట్రా అవసరం, డాక్యుమెంట్ చేయబడిన ఉదాహరణ SmolVLA |
| --policy.rtc_training_max_delay | RTC కోసం యాక్షన్-ప్రిఫిక్స్ కండిషనింగ్ | మెయిన్ బ్రాంచ్ మాత్రమే, 0.6.1 లో లేదు, chunk_size కంటే తక్కువ ఉండాలి |
| --rename_map | డేటాసెట్ కాలమ్లను పాలసీ ఫీచర్లకు మ్యాప్ చేస్తుంది | మీ కెమెరా కీలు భిన్నంగా ఉన్నప్పుడు అవసరం |
క్వాంటైల్స్ లేకుండా మీరు మొదటి బ్యాచ్లో ValueError: QUANTILES normalization mode requires q01 and q99 stats పొందుతారు. గణాంకాలను తిరిగి లెక్కించండి, కానీ ఫలితం $HF_LEROBOT_HOME/your_dataset లో ఉంటుంది, --dataset.repo_id చదివే కాష్లో కాదు, కాబట్టి --dataset.root ను అక్కడికి సూచించేలా శిక్షణ ఇవ్వండి లేదా హబ్కు పుష్ చేయండి. లేదా LIBERO రిఫరెన్స్ కమాండ్ చేసినట్లుగా --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' తో క్వాంటైల్స్ను దాటవేయండి.
మూడు డిఫాల్ట్ల సెట్లు, మరియు ఏవి ట్రైనర్కు చేరుకుంటాయి
openpi యొక్క TrainConfig అనేది రిఫరెన్స్, మీరు ఏమీ చెప్పనప్పుడు lerobot-train ఉపయోగించేది LeRobot యొక్క PI05Config, మరియు ఇక్కడ ఉన్న ఫారం మూడవ సెట్ను పంపుతుంది. ఆశ్చర్యకరమైన విషయం ఏమిటంటే లెర్నింగ్ రేట్: రెండు అప్స్ట్రీమ్ డిఫాల్ట్లు 2.5e-5 వద్ద గరిష్ట స్థాయికి చేరుకుంటాయి, అయితే openpi యొక్క సొంత pi05_libero కాన్ఫిగ్ మరియు ఈ ప్లాట్ఫారమ్ దానిని 5e-5కి పెంచుతాయి.
| సెట్టింగ్ | openpi TrainConfig | lerobot pi05 మరియు lerobot-train | AY-Robots పంపుతుంది |
|---|---|---|---|
| బ్యాచ్ సైజు | 32 | 8 | 1 |
| గరిష్ట లెర్నింగ్ రేట్ | 2.5e-5, కొసైన్ డికే | optimizer_lr 2.5e-5 | 5e-5 |
| ట్రైనింగ్ స్టెప్స్ | 30,000 | 100,000 | 30,000 |
| చెక్పాయింట్ విరామం | 1,000 స్టెప్స్ | 20,000 స్టెప్స్ | ఫారంలో లేదు |
| సీడ్ | 42 | 1,000 | ఫారంలో ఉంది |
| యాక్షన్ చంక్ | action_horizon 50 | chunk_size 50, n_action_steps 50 | ఫారంలో లేదు |
| వెయిట్ dtype | bfloat16 | float32 మీరు --policy.dtype పాస్ చేసే వరకు | ఫారంలో లేదు |
| గ్రాడియంట్ అక్యుములేషన్ | అలాంటి నాబ్ లేదు, బదులుగా fsdp_devices | ఇప్పటివరకు ప్రతి విడుదల నుండి లేదు | 16, మరియు అది వదిలివేయబడింది |
పోర్ట్ నమ్మదగినదా? LeRobot బృందం LIBERO బేస్ మోడల్ను అదనంగా 6k స్టెప్స్ కోసం ఫైన్-ట్యూన్ చేసింది మరియు నాలుగు సూట్లలో openpi యొక్క రిఫరెన్స్ నంబర్లతో పోల్చింది: 96.85కి వ్యతిరేకంగా 97.5 శాతం సగటు, Libero 10లో ముందుంది, Spatialలో వెనుకబడింది. ఈ మార్గం టూలింగ్ ఎంపిక, నాణ్యత ఎంపిక కాదు.
- దీని వెనుక 10,000 గంటల కంటే ఎక్కువ రోబోట్ ప్రీ-ట్రైనింగ్ ఉంది, కాబట్టి మీ పనికి 50 ఎపిసోడ్లు సరిపోతాయి.
- నిరంతర చర్యలు: ట్యూన్ చేయడానికి టోకెనైజర్ లేదు, మీ జాయింట్ యాంగిల్స్పై డిస్క్రిటైజేషన్ ఫ్లోర్ లేదు.
- LeRobot పోర్ట్ LIBERO సగటుపై openpi యొక్క 96.85కి వ్యతిరేకంగా 97.5 శాతం స్కోర్ చేస్తుంది, కాబట్టి స్నేహపూర్వక CLI కొలవదగిన ఖర్చును కలిగి ఉండదు.
- రెండు వైపులా పారామీటర్-ఎఫిషియెంట్ పాత్లు: openpi యొక్క JAX LoRA వేరియంట్లు, LeRobot యొక్క PEFT ఇంటిగ్రేషన్.
- పూర్తి ఫైన్-ట్యూనింగ్కు 70 GB కంటే ఎక్కువ అవసరం. 22.5 GB LoRA సంఖ్య openpi యొక్క JAX సంఖ్య; PEFT కింద pi05 కోసం ఏదీ ప్రచురించబడలేదు.
- ప్రతి యాక్షన్ స్టెప్కు 485 ms, ఇక్కడ ఉన్న ఐదింటిలో నెమ్మదైనది: SmolVLA కంటే రెండు రెట్లు, ACT కంటే ఇరవై నాలుగు రెట్లు.
- LeRobot v3.0 అవసరం, కాబట్టి GR00T రన్ కోసం రికార్డ్ చేయబడిన డేటాసెట్ను మార్చాలి, మరియు దీనికి విరుద్ధంగా.
- కొత్త ఎంపికలు మొదట మెయిన్లో వస్తాయి: ట్రైనింగ్-టైమ్ RTC మరియు MEM మెమరీ 0.6.1లో లేవు, కాబట్టి సరికొత్త డాక్యుమెంట్లు గిట్ నుండి ఇన్స్టాల్ చేయడాన్ని సూచించవచ్చు.
485 ms వాస్తవం, మరియు అది ఎక్కడ ఉపయోగపడకుండా పోతుంది
ఇది మీ ప్రాజెక్ట్ను నిర్ణయిస్తుంది, కాబట్టి ఇది ఖర్చు పట్టికకు ముందు వస్తుంది. Pi0.5 కోసం ఇక్కడ కొలవబడిన ప్రతి చర్య దశకు 485 ms. మిగిలిన నాలుగు వాటితో పోలిస్తే:
| Policy | Inference per action step | Params | GPU tier | Minimum episodes |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

ఈ ఐదు మోడల్లలో నియంత్రణ లూప్ ప్రతి చర్య దశకు 20 నుండి 485 ms వరకు నడుస్తుంది. 485 ms పైన పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్లు పనిచేసే విధానాన్ని సంకోచించే విధానంగా మారుస్తాయి. రిమోట్ ఇన్ఫరెన్స్ నెమ్మదిగా వస్తువులను తీయడానికి మరియు ఉంచడానికి ఆచరణీయం, వేగవంతమైన ప్రతిస్పందన కదలికకు కాదు. LANలో మాత్రమే పనిచేసే డెమోను విక్రయించడం కంటే అలా చెప్పడమే మాకు ఇష్టం. మీ చేయి ఖండాల మధ్య ఆగిపోతే, పాలసీ మధ్య కదలికలో స్తంభిస్తుంది వద్ద ప్రారంభించండి.
అప్స్ట్రీమ్ వద్ద ఒక పరిష్కారం ఉంది, మరియు అందులో సగం మీరు ఇన్స్టాల్ చేయగల విడుదలలోనే ఉంది. రియల్-టైమ్ చంకింగ్, చేయి ప్రస్తుత ఖండాన్ని అమలు చేస్తున్నప్పుడు తదుపరి ఖండాన్ని ఉత్పత్తి చేస్తుంది, ఆపై కొత్త ఖండం యొక్క అతివ్యాప్తి చెందుతున్న దశలను ఇప్పటికే అమలు చేసిన భాగానికి దగ్గరగా ఉండేలా మార్గనిర్దేశం చేస్తుంది, తద్వారా చేయి అతుకు వద్ద ఆగిపోదు లేదా కుదుపుకు గురికాదు. Pi0, Pi0.5 మరియు SmolVLA కోసం 0.4.2 చేంజ్లాగ్లో పంపబడిన ఇన్ఫరెన్స్-టైమ్ ఫారం ఒక రోల్అవుట్ ఫ్లాగ్, రీట్రైన్ కాదు:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60ఇది మోడల్ను వేగవంతం చేయదు. ఇది అంతరాన్ని దాచిపెడుతుంది: 485 ms ఇప్పటికీ ఖర్చు అవుతుంది, కానీ కీలక మార్గం నుండి దూరంగా, కాబట్టి ఖండాల మధ్య క్యూ ఎండిపోదు. arXiv 2512.05964 నుండి వచ్చిన శిక్షణ-సమయ వేరియంట్ మరింత ముందుకు వెళుతుంది: మోడల్ ఒక క్లీన్ యాక్షన్ ప్రిఫిక్స్పై షరతు విధించడం నేర్చుకుంటుంది, కాబట్టి ఇన్ఫరెన్స్ వద్ద అతివ్యాప్తి మార్గనిర్దేశం చేయబడకుండా, ప్రతి-చర్య ప్రవాహ టైమ్స్టెప్లతో గట్టిగా ఇన్-పెయింట్ చేయబడుతుంది, మరియు మార్గనిర్దేశక బ్యాక్వర్డ్ పాస్ అదృశ్యమవుతుంది. శిక్షణ సమయంలో ఇది ప్రతి ఉదాహరణకు ఒక ప్రిఫిక్స్ పొడవును నమూనా చేస్తుంది మరియు మిగిలిన పోస్ట్ఫిక్స్పై ప్రవాహ నష్టాన్ని తీసుకుంటుంది. ఆ ఫ్లాగ్ మెయిన్లో మాత్రమే ఉంటుంది, 0.6.1లో కాదు, మరియు మీరు శిక్షణ ఇచ్చే ఆలస్యం chunk_size కంటే తక్కువగా ఉండాలి.
Pi0.5 చెక్పాయింట్ను పొందడానికి రెండు మార్గాలు
మీరు 80 GB కార్డ్ను అద్దెకు తీసుకుంటారు లేదా స్వంతం చేసుకుంటారు, పైన పేర్కొన్న స్టాక్లలో ఒకదాన్ని ఇన్స్టాల్ చేస్తారు, మీ డేటాసెట్ను మారుస్తారు మరియు రన్ను పర్యవేక్షిస్తారు. మీరు ప్రతి నాబ్ను ఉంచుకుంటారు: openpi యొక్క JAX LoRA, LeRobot యొక్క PEFT అడాప్టర్లు, సాపేక్ష చర్యలు, అనుకూల కీ మ్యాపింగ్లు. మీరు ప్రతి వైఫల్యాన్ని కూడా ఉంచుకుంటారు.
- హార్డ్వేర్: A100 80 GB లేదా H100, లేదా openpi యొక్క JAX LoRA మార్గంలో 24 GB కార్డ్.
- సెటప్: మొదటి రన్ కోసం ఒక మధ్యాహ్నం, ఎక్కువగా కీ మ్యాపింగ్ మరియు గేటెడ్ టోకెనైజర్.
- హోస్ట్ చేసిన ఫారమ్లో లేదు: PEFT అడాప్టర్లు, సాపేక్ష చర్యలు, శిక్షణ-సమయ RTC, MEM మెమరీ.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000మీరు మోడల్ మరియు డేటాసెట్ను శిక్షణ ఫారమ్లో ఎంచుకుంటారు, బ్యాకెండ్ అవసరమైన VRAM ద్వారా స్పాట్ మార్కెట్లో GPUని అద్దెకు తీసుకుంటుంది, ట్రైనర్ను నడుపుతుంది మరియు వ్రాస్తుంది చెక్పాయింట్లు ఆబ్జెక్ట్ స్టోరేజ్కు. Pi0.5 ఇక్కడ క్లౌడ్-మాత్రమే. దీని కోసం గైడ్లు ఉన్నాయి SO-100, SO-101, Koch v1.1 మరియు LeKiwi.
| సెట్టింగ్ | Pi0.5 కోసం ప్లాట్ఫారమ్ పంపేది |
|---|---|
| బేస్ చెక్పాయింట్ | lerobot/pi05_base |
| పాలసీ రకం | pi05 |
| బ్యాచ్ పరిమాణం | 1 |
| లెర్నింగ్ రేట్ | 5e-5 |
| గరిష్ట దశలు | 30000 |
| గ్రాడియంట్ అక్యుములేషన్ | 16, కానీ క్రింద ఉన్న హెచ్చరికను చూడండి |
| ఫారమ్లోని అదనపు నాబ్లు | seed, logFreq |
| డేటాసెట్ ఫార్మాట్ | LeRobot v3.0 |
| GPU టైర్ | A100 80 GB or H100 80 GB |
ట్రైనర్ 16 గ్రాడియంట్ అక్యుములేషన్ విలువను పంపుతుంది మరియు lerobot 0.5.1 దానిని స్వీకరించడానికి ఎటువంటి ఫ్లాగ్ను కలిగి లేదు, కాబట్టి అది వదిలివేయబడుతుంది. విడుదలైన lerobot దేనికీ ఒకటి లేదు: నాబ్ ప్రధానంగా మాత్రమే ఉంది, --accelerator.gradient_accumulation.steps వలె. ఇక్కడ ప్రభావవంతమైన బ్యాచ్ పరిమాణం 1, openpi యొక్క pi05_libero కాన్ఫిగ్ ఉపయోగించే 256కి వ్యతిరేకంగా. మీరు లాస్ కర్వ్ను చదివే ముందు తెలుసుకోవడం విలువ. ఈ నాబ్ GR00T N1.7 మరియు GR00T N1.5 రన్లకు వర్తిస్తుంది.
ఇన్ఫరెన్స్ అదే విధంగా పనిచేస్తుంది: పాలసీని అందించడానికి ఒక పాడ్ ఏర్పాటు చేయబడుతుంది మరియు మీ స్థానిక క్లయింట్ దానితో మాట్లాడుతుంది. పాడ్కు ఐడిల్ వాచ్డాగ్ ఉంటుంది మరియు అది స్వయంగా నాశనం అవుతుంది, కాబట్టి మర్చిపోయిన ట్యాబ్ నిశ్శబ్దంగా బిల్లు చేయదు. లేటెన్సీ హెచ్చరిక వర్తిస్తుంది, అందుకే ACT 20 ms వద్ద తరచుగా వేగవంతమైన పనిని గెలుస్తుంది.
ఇది పని చేయనప్పుడు
| లక్షణం | అత్యంత సంభావ్య కారణం |
|---|---|
| రన్ ప్రారంభం కాకముందే తిరస్కరించబడింది | డేటాసెట్ v2.1 కానీ Pi0.5 v3.0 కోరుకుంటుంది, లేదా GR00T కోసం దీనికి విరుద్ధంగా |
| ImportError, డేటాసెట్స్ ప్యాకేజీ లేదు | శిక్షణ అదనపు లేకుండా lerobot 0.6.x |
| బ్యాచ్ ఒకటిలో q01 మరియు q99 గురించి ValueError | meta/stats.jsonలో క్వాంటైల్స్ లేవు; తిరిగి లెక్కించండి లేదా MEAN_STDని ఉపయోగించండి |
| దశ 0 వద్ద CUDA మెమరీ అయిపోయింది | 70 GB కంటే తక్కువ పూర్తి ఫైన్-ట్యూన్; చెక్పాయింటింగ్ లేదా train_expert_onlyని ప్రయత్నించండి |
| 401 లేదా గేటెడ్ రెపో లోపం | PaliGemma టోకెనైజర్ లైసెన్స్ ఆమోదించబడలేదు |
| నష్టం తగ్గుతుంది, రోబోట్ ఏమీ చేయదు | సాధారణీకరణ సరిపోలడం లేదు, లేదా పాలసీ స్థితిని కాపీ చేస్తుంది |
| చంక్ల మధ్య ఆర్మ్ ఆగిపోతుంది | ప్రతి-దశ లేటెన్సీ ప్లస్ రౌండ్ ట్రిప్; చంక్ క్యూ ఎండిపోతుంది |
| ఒక సెటప్లో పనిచేస్తుంది, మరొకదానిలో విఫలమవుతుంది | చాలా తక్కువ ఎపిసోడ్లు, లేదా అన్నీ ఒకే కాన్ఫిగరేషన్లో |
- డేటాసెట్ తిరస్కరించబడింది: v3 అవసరం
- శిక్షణ సమయంలో మెమరీ సరిపోలేదు
- నష్టం తగ్గుతుంది కానీ పాలసీ ఏమీ చేయదు
- కదలిక మధ్యలో పాలసీ స్తంభిస్తుంది
- పాలసీ ఒకే సెటప్లో మాత్రమే పనిచేస్తుంది
- శిక్షణ ఉద్యోగం క్యూలో నిలిచిపోయింది
ఒక రన్ ఎంత ఖర్చవుతుంది
Pi0.5 ఖరీదైన శ్రేణిలో ఉంది ఎందుకంటే దీనికి 80 GB కార్డ్ అవసరం, మరియు స్పాట్ ధరలు మారుతూ ఉంటాయి, కాబట్టి ఈ సంఖ్య ఒక ధర కాకుండా ఒక పరిధిని సూచిస్తుంది. అనేక SO-100 పనుల కోసం, ముందుగా SmolVLA లేదా ACTని 24 GB శ్రేణిలో శిక్షణ ఇవ్వండి, పని నేర్చుకోదగినదా అని నిర్ధారించుకోండి, ఆపై దానిపై A100 గంటలు వెచ్చించండి. మీ మొదటి పాలసీకి శిక్షణ ఇవ్వండి ఆ చౌకైన లూప్ను వివరిస్తుంది, మరియు ధర ప్రస్తుత శ్రేణులను కలిగి ఉంది.
| శ్రేణి | పాలసీలు | సాధారణ రన్ | గంటకు ధర | ఒక రన్కు ఖర్చు |
|---|---|---|---|---|
| A100 80 GB or H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 to 6 hours | 1.20 to 2.00 USD | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | 0.30 to 0.60 USD | about 1 to 3 USD |

ఒక సాయంత్రం కేటాయించే ముందు: GR00T N1.7 వర్సెస్ Pi0.5 మరియు Pi0.5 వర్సెస్ SmolVLA అదే సంఖ్యలను తలపైన తలపెట్టి చూపిస్తాయి. అరేనా 332 బెంచ్మార్క్ ఫలితాలతో 85 VLA మోడళ్లను కలిగి ఉంది, ప్రతి ఒక్కటి దాని మూలానికి లింక్ చేయబడింది, మరియు ఈ కుటుంబం గురించిన నేపథ్యం మా VLA అవలోకనం.
స్టాక్ను నిర్మించకుండా Pi0.5కి శిక్షణ ఇవ్వండి
ఒక ఫారమ్లో డేటాసెట్ మరియు హైపర్పారామీటర్లను ఎంచుకోండి. బ్యాకెండ్ స్పాట్ మార్కెట్లో 80 GB కార్డ్ను అద్దెకు తీసుకుంటుంది, ట్రైనర్ను నడుపుతుంది మరియు చెక్పాయింట్లను ఆబ్జెక్ట్ స్టోరేజ్కు వ్రాస్తుంది. SO-100, SO-101, Koch v1.1 మరియు LeKiwi కోసం మార్గదర్శకాలు.
శిక్షణ మార్గదర్శకాలను తెరవండినేను RTX 4090లో Pi0.5ని ఫైన్-ట్యూన్ చేయవచ్చా?▾
పూర్తి ఫైన్-ట్యూన్ కాదు: openpi దాని కోసం 70 GB కంటే ఎక్కువ జాబితా చేస్తుంది, కాబట్టి A100 80 GB లేదా H100. దీని 22.5 GB LoRA సంఖ్య JAX మార్గానికి చెందినది; PyTorch అమలుకు LoRA లేదు. LeRobot యొక్క PEFT ఇంటిగ్రేషన్ ఉంది, కానీ దాని డాక్యుమెంట్ చేయబడిన ఉదాహరణ SmolVLA మరియు pi05 కోసం VRAM సంఖ్య ప్రచురించబడలేదు.
నాకు ఎన్ని ఎపిసోడ్లు అవసరం?▾
యాభై, GR00T మరియు ACT వలె అదే కనీస సంఖ్య; SmolVLA మాత్రమే తక్కువగా, 30 వద్ద ఉంటుంది. బేస్ చెక్పాయింట్ 10,000 గంటల కంటే ఎక్కువ ప్రీ-ట్రైనింగ్ను కలిగి ఉంటుంది, కాబట్టి ఫైన్-ట్యూన్ ఏమీ నేర్చుకోకుండానే స్వీకరిస్తుంది: 50 శుభ్రమైన, విభిన్న ఎపిసోడ్లు ఒక కాన్ఫిగరేషన్ నుండి రెండు వందలను అధిగమిస్తాయి.
--policy.path మరియు --policy.pretrained_path మధ్య తేడా ఏమిటి?▾
--policy.path వెయిట్లను మరియు చెక్పాయింట్ యొక్క config.jsonను లోడ్ చేస్తుంది, కాబట్టి n_action_steps వంటి నిల్వ చేయబడిన సెట్టింగ్లు వారసత్వంగా వస్తాయి మరియు --policy.type తప్పనిసరిగా వదిలివేయబడాలి. --policy.pretrained_path వెయిట్లను మాత్రమే లోడ్ చేస్తుంది: ఫీచర్ పేర్లు మీ డేటాసెట్ నుండి వస్తాయి, నిల్వ చేయబడిన సెట్టింగ్లు రీసెట్ చేయబడతాయి, --policy.type అవసరం. అందుకే LIBERO కమాండ్ n_action_steps=10 మరియు empty_cameras=1ని స్పష్టంగా పంపుతుంది; లేకపోతే అవి 50 మరియు 0కి తిరిగి వస్తాయి.
ఓపెన్ వెర్షన్ పేపర్లో ఉన్న పూర్తి Pi0.5ని నాకు అందిస్తుందా?▾
లేదు. రెండూ ఫ్లో మ్యాచింగ్ యాక్షన్ హెడ్ను మాత్రమే సపోర్ట్ చేస్తాయి. FAST యాక్షన్ టోకెనైజర్ మరియు హై-లెవల్ సబ్టాస్క్ ప్రిడిక్షన్తో కూడిన డిస్క్రీట్-టోకెన్ ప్రీ-ట్రైనింగ్ దశ విడుదల కాలేదు, మరియు lerobot/pi05_base కార్డ్ ఆ జాబితాకు RLని జోడిస్తుంది, అయినప్పటికీ pi0.5 పేపర్లో రీన్ఫోర్స్మెంట్ లెర్నింగ్ దశ గురించి వివరించబడలేదు. మీరు అందించే భాషా స్ట్రింగ్పై ఆధారపడి తక్కువ-స్థాయి పాలసీకి శిక్షణ ఇస్తారు, సుదీర్ఘమైన పనిని స్వయంగా విడదీసే మోడల్కు కాదు.
ఈ గైడ్ ఏ వెర్షన్లను ఉద్దేశించి వ్రాయబడింది?▾
మెయిన్లో openpi మరియు lerobot 0.6.1, 3 ఆగస్టు 2026 నుండి విడుదలైనవి, రెండూ 23 ఆగస్టు 2026న చదవబడ్డాయి. v3.0 డేటాసెట్లు అక్టోబర్ 2025లో 0.4.0తో వచ్చాయి. 0.6.0 బేస్ ప్యాకేజీని తేలికగా చేసింది, కాబట్టి lerobot[pi] మాత్రమే ఇకపై శిక్షణ స్టాక్ను ఇన్స్టాల్ చేయదు, మరియు డిప్లాయ్మెంట్ను lerobot-rolloutకి మార్చింది. ట్రైనింగ్-టైమ్ RTC మెయిన్లో మాత్రమే ఉంది; ఇక్కడ హోస్ట్ చేయబడిన ట్రైనర్ 0.5.1ని నడుపుతుంది.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started