AY-Robots பயிற்சி அணி, ஐந்து கொள்கைகள் வரிசைகளாகவும் நான்கு ரோபோ கைகள் பத்திகளாகவும், ஒவ்வொரு கலமும் ஒரு குறிப்பிட்ட நுட்பமான சரிசெய்தல் வழிகாட்டிக்கு ஒரு இணைப்பாகவும் உள்ளது
Pi0.5ஃப்ளோ மேட்சிங்VLA பயிற்சிLeRobotநுட்பமான சரிசெய்தல்

உங்கள் சொந்த ரோபோ தரவில் Pi0.5 ஐ எவ்வாறு பயிற்சி செய்வது

AY-Robots ResearchAugust 23, 202616 நிமிடம் வாசிப்பு

Physical Intelligence இலிருந்து வரும் flow-matching VLA ஆன Pi0.5 ஐ உங்கள் சொந்த ரோபோ தரவில் நுட்பமாகச் சரிசெய்யவும். openpi மற்றும் lerobot pi05 க்கான உண்மையான கட்டளைகள், தரவுத்தொகுப்பு வடிவமைப்பு சிக்கல்கள், VRAM மற்றும் தாமத வரம்புகள்.

Pi0.5 என்பது ஒரு கொள்கை ஒருபோதும் பார்த்திராத அறையில் வேலை செய்ய வேண்டியிருக்கும் போது நீங்கள் பயன்படுத்தும் மாதிரி. இது ஐந்து மாதிரிகளில் மிகவும் சிக்கலானது பயிற்சி செய்யக்கூடிய கொள்கைகள் இங்கு மேம்படுத்துவதற்கு கையால்: அப்ஸ்ட்ரீம் ரெப்போசிட்டரி முதலில் JAX ஐ அடிப்படையாகக் கொண்டது, LeRobot போர்ட் 0.6.0 இல் lerobot-record இலிருந்து வரிசைப்படுத்தலை நகர்த்தியது மற்றும் அடிப்படை நிறுவலை பயிற்சி செய்ய முடியாத அளவுக்கு சிறியதாக ஆக்கியது, மேலும் முழுமையான மேம்படுத்துதல் ஒரு 4090 இல் பொருந்தாது. கீழே: பாய்வு பொருத்தம் அனுமானத்தில் எவ்வளவு செலவாகிறது, இரண்டு கட்டளை வழிகள், மற்றும் முடிவு பயன்படுத்தக்கூடியதா என்பதை தீர்மானிக்கும் 485 ms எண்.

நீங்கள் தெரிந்து கொள்ள வேண்டியவை

  • ஒரு பாய்வு-பொருத்த VLA: ஒரு 3B PaliGemma VLM மற்றும் தொடர்ச்சியான செயல் துண்டுகளை டிகோட் செய்யும் ஒரு 300M செயல் நிபுணர். இதை மேம்படுத்துவதற்கு இரண்டு வழிகள், openpi மற்றும் LeRobot pi05, LIBERO சராசரியில் 0.65 புள்ளிகள் வேறுபாடு.
  • முழுமையான மேம்படுத்துதலுக்கு 70 GB க்கும் அதிகமான VRAM தேவை. openpi, LoRA ஐ 22.5 GB இல் பட்டியலிடுகிறது, அதன் JAX பாதையில் மட்டுமே.
  • தரவுத்தொகுப்பு LeRobotDataset v3.0 ஆக இருக்க வேண்டும், meta/stats.json இல் q01 மற்றும் q99 குவாண்டில்களுடன், இல்லையெனில் முதல் தொகுதி பிழை ஏற்படுத்தும்.
  • முதலில் உங்கள் lerobot பதிவை சரிபார்க்கவும்: 0.6.0 அடிப்படை தொகுப்பை இலகுவாக்கியது மற்றும் lerobot-record இலிருந்து வரிசைப்படுத்தலை நகர்த்தியது.
  • இங்கு இது ஒரு செயல் படிக்கு 485 ms இல் இயங்குகிறது, 50 எபிசோடுகள் தேவை, மற்றும் ஒரு ரன்னுக்கு சுமார் 4 முதல் 12 USD செலவாகும்.

Pi0.5 உண்மையில் என்ன

Physical Intelligence அக்டோபர் 2024 இல் pi0 ஐ வெளியிட்டது: ஒரு பாய்வு பொருத்தம் பார்வை-மொழி-செயல் மாதிரி ஒரு முன்-பயிற்சி பெற்ற VLM இல்: 3 பில்லியன் அளவுருக்கள் கொண்ட PaliGemma மற்றும் புதிதாகத் தொடங்கப்பட்ட ஒரு 300M செயல் நிபுணர், மொத்தம் 3.3 பில்லியன். இந்த ஆய்வுக் கட்டுரை 7 ரோபோ உள்ளமைவுகள் மற்றும் 68 பணிகளில் 10,000 மணிநேரத்திற்கும் மேலான ரோபோ தரவுகளில் முன்-பயிற்சி பெற்றதாகக் கூறுகிறது. மேலும் pi0 கட்டுரை.

Pi0.5 (arXiv 2504.16054, 22 ஏப்ரல் 2025) அதே கட்டமைப்பைத் தக்கவைத்து, பயிற்சி முறையை மாற்றுகிறது: வலைத் தரவு, பொருள் கண்டறிதல், ரோபோவுக்குப் பயிற்சி அளிக்கும் மனிதர்களிடமிருந்து வாய்மொழி அறிவுறுத்தல்கள், துணைப் பணி லேபிள்கள், பல வீடுகளில் உள்ள ரோபோக்களிலிருந்து வரும் குறுக்கு-உருவத் தரவு. இதன் விளைவாக, பயிற்சித் தொகுப்பில் இல்லாத வீடுகளில் சமையலறைகளைச் சுத்தம் செய்யும் ஒரு ரோபோ உருவாகிறது. openpi README, தலைப்பில் இல்லாத ஒரு விவரத்தைச் சேர்க்கிறது: வெளியிடப்பட்ட pi0.5 அறிவுத் தனிமைப்படுத்தலுடன் (arXiv 2505.23705) பயிற்சி அளிக்கப்பட்டது.

பண்புpi0pi0.5
VLM பேக்போன் மாறுபாடுgemma_2b (PaliGemma)gemma_2b (PaliGemma)
செயல் நிபுணர் மாறுபாடுgemma_300mgemma_300m
action_dim3232
action_horizon இயல்புநிலை5050
max_token_len48200
discrete_state_inputfalsetrue, ப்ராம்ப்டில் நிலை பின்களாகப் பிரிக்கப்பட்டுள்ளது
அடிப்படை செக்பாயிண்ட்gs://openpi-assets/checkpoints/pi0_basegs://openpi-assets/checkpoints/pi05_base
பொதுவில் இருப்பது முழு ஆய்வுக் கட்டுரை அல்ல

openpi README தெளிவாகக் கூறுகிறது: களஞ்சியம் pi0.5 பயிற்சி மற்றும் ஊகத்திற்கு (inference) ஒரே மாதிரியாக, ஃப்ளோ மேட்சிங் ஹெட்டை மட்டுமே ஆதரிக்கிறது. ஆய்வுக் கட்டுரை இரண்டு நிலைகளை விவரிக்கிறது, மேலும் குறியீடு இரண்டாவது நிலையை மட்டுமே கொண்டுள்ளது: முன்-பயிற்சி (pre-training) ஒவ்வொரு செயலையும் FAST டோக்கனைசர் மூலம் தனித்த டோக்கன்களாகக் குறிக்கிறது, மேலும் வரிசைப்படுத்தலின் போது (deployment) மாதிரி ஒவ்வொரு செயல் துண்டுக்கும் முன் ஒரு உயர்-நிலை துணைப் பணியை ஊகிக்கிறது. இவை இரண்டும் களஞ்சியத்தில் இல்லை. lerobot/pi05_base கார்டு அதே பட்டியலைக் கொடுத்து RL ஐச் சேர்க்கிறது, இருப்பினும் pi0.5 ஆய்வுக் கட்டுரை எந்த வலுவூட்டல் கற்றல் நிலையையும் விவரிக்கவில்லை. LeRobot போர்ட் அந்த நோக்கத்தை மரபுரிமையாகப் பெறுகிறது, மேலும் அதில் ஹோஸ்ட் செய்யப்பட்ட ஒவ்வொரு பயிற்சியாளரும், இங்குள்ள ஒன்றும் அவ்வாறே. உரிமமும் பிரிக்கப்பட்டுள்ளது: pi05 ஆவணப் பக்கம் Apache 2.0 என்று கூறுகிறது, lerobot/pi05_base கார்டு license: gemma என்று குறியிடப்பட்டுள்ளது.

ஃப்ளோ மேட்சிங் பயிற்சி மற்றும் ஊகத்தைப் பற்றி என்ன மாற்றுகிறது

ஒரு கொள்கை நீங்கள் SO-100 இல் பயிற்சி அளிக்கலாம், இது செயல்களை நேரடியாக (ACT) அல்லது அவற்றை டோக்கனைஸ் செய்து தானாகவே டிகோட் செய்கிறது (pi0-FAST). ஃப்ளோ மேட்சிங் இவை இரண்டையும் செய்யாது: இது சத்தத்தை ஒரு சுத்தமான செயல் துண்டு, பின்னர் அதை ஒருங்கிணைக்கிறது. pi0 ஆய்வுக் கட்டுரை 0.1 படி அளவில் 10 ஒருங்கிணைப்பு படிகளைப் பயன்படுத்துகிறது; LeRobot இன் pi05 உள்ளமைவு அதே num_inference_steps: int = 10 ஐக் கொண்டுள்ளது.

  • பயிற்சி: இழப்பு ஒரு சத்தம் நிறைந்த செயல் துண்டுகளை மீண்டும் உருவாக்குகிறது. சரிசெய்ய டோக்கனைசர் இல்லை, உங்கள் மூட்டு கோணங்களை பிரித்தெடுக்க வேண்டியதில்லை.
  • ஊகித்தல்: ஒரு துண்டுக்கு செயல் நிபுணர் வழியாக பத்து முன்னோக்கு பாஸ்கள் செலவாகும். இது கட்டமைப்பு ரீதியானது, சரிசெய்தல் பிரச்சனை அல்ல.
  • வெளியீடு: 32 பரிமாணங்களின் தொடர்ச்சியான செயல்கள், உள்நாட்டில் திணிக்கப்பட்டு, உங்கள் ரோபோவின் பரிமாணங்களில் இழப்பு எடுக்கப்படுகிறது. ஒரு 6-DoF கை மற்றும் கிரிப்பர் 7 ஐப் பயன்படுத்துகிறது.
python
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
    dtype: str = "bfloat16"
    paligemma_variant: _gemma.Variant = "gemma_2b"
    action_expert_variant: _gemma.Variant = "gemma_300m"

    action_dim: int = 32
    action_horizon: int = 50
    max_token_len: int = None      # 200 if pi05 else 48

    pi05: bool = False             # flips discrete_state_input to True
openpi முதன்மை கிளையில் உள்ள src/openpi/models/pi0_config.py இலிருந்து படிக்கப்பட்டது, 23 ஆகஸ்ட் 2026.

PaliGemma முதுகெலும்பு மற்றும் அதற்கு முன்னால் உள்ள வாயில்

PaliGemma (arXiv 2407.07726) என்பது Gemma-2B மொழி மாதிரியில் உள்ள ஒரு SigLIP-So400m விஷன் என்கோடர் ஆகும், இது சுமார் 3B அளவுருக்களைக் கொண்டது. Pi0.5 அதன் டோக்கனைசரை மரபுரிமையாகப் பெறுகிறது, மேலும் அந்த டோக்கனைசர் ஒரு கேடட் களஞ்சியத்தில் உள்ளது. முதல் ஓட்டம் இறப்பதற்கான பொதுவான வழி இதுதான், முதல் பயிற்சி படிநிலை.

GPU ஐ வாடகைக்கு எடுப்பதற்கு முன் கேடட் உரிமத்தை ஏற்கவும்

LeRobot pi05 ஆவணங்கள் இதைத் தெளிவாகக் கூறுகின்றன: pi0.5 கேடட் google/paligemma-3b-pt-224 டோக்கனைசரைப் பயன்படுத்துகிறது, எனவே ஹப்பில் அதன் உரிமத்தை ஏற்றுக்கொண்டு முதலில் hf auth login ஐ இயக்கவும். அணுகல் உடனடியாக அல்ல, கைமுறையாக வழங்கப்படுகிறது. இதைத் தவிர்த்து, கட்டண கிளவுட் ரன் ஒன்றைத் தொடங்கினால், டோக்கனைசரைப் பதிவிறக்க முடியாத ஒரு பாட்-க்கு நீங்கள் பணம் செலுத்துவீர்கள்.

தொடங்குவதற்கு முன்: தரவுத்தொகுப்பு வடிவம், எபிசோடுகள், வன்பொருள்

LeRobot இல் உள்ள Pi0.5 ஒரு LeRobot தரவுத்தொகுப்பு v3.0 அமைப்பில் படிக்கிறது, இது அக்டோபர் 2025 இல் lerobot 0.4.0 உடன் வந்தது: ஒரு Parquet மற்றும் MP4 கோப்பில் பல எபிசோடுகள், ஒரு கோப்பிற்கு ஒரு எபிசோட், கோப்புப் பெயர்களுக்குப் பதிலாக meta/episodes/ இல் எல்லைகளுடன். உடன் பதிவு செய்யவும் டெஸ்க்டாப் கிளையன்ட் அல்லது பின்பற்றவும் உங்கள் முதல் தரவுத்தொகுப்பை பதிவு செய்யவும் மற்றும் நீங்கள் அதைப் பெறுவீர்கள்.

முறைதேவையான GPU நினைவகம்எடுத்துக்காட்டு GPU
இன்ஃபரன்ஸ்more than 8 GBRTX 4090
ஃபைன்-ட்யூனிங், LoRAmore than 22.5 GBRTX 4090
ஃபைன்-ட்யூனிங், முழுmore than 70 GBA100 80 GB or H100
ஒரு நாளை வீணடிக்கும் பதிப்பு சிக்கல்

Pi0.5 மற்றும் SmolVLA-க்கு LeRobot v3.0 தேவை. GR00T N1.7 மற்றும் GR00T N1.5-க்கு v2.0 அல்லது v2.1 தேவை, மேலும் அவை v3.0 தரவுத்தொகுப்பில் செயலிழக்கும். ஒரு பதிவு அமர்வு மாற்றமின்றி இரண்டிற்கும் தரவை வழங்க முடியாது, மேலும் பிழை "தவறான தரவுத்தொகுப்பு பதிப்பு" என்று கூறாது. தரவுத்தொகுப்பு நிராகரிக்கப்பட்டது: v3 தேவை என்பதைப் பார்க்கவும்.

bash
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>

# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ...         -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsets
LeRobotDataset v3.0 ஆவணத்திலிருந்து.

Pi0.5-க்கு குறைந்தபட்சம் 50 எபிசோடுகள் தேவை என்று தளம் விரும்புகிறது, இது GR00T மற்றும் ACT-க்கு சமமானதாகும். முன்-பயிற்சி முக்கிய வேலையைச் செய்கிறது, எனவே 50 சுத்தமான எபிசோடுகள் 200 ஒழுங்கற்ற எபிசோடுகளை விட சிறந்தவை. இதற்குப் புதியவரா? இதனுடன் தொடங்கவும் தரவு சேகரிப்பு வழிகாட்டி

AY-Robots கொள்கைகள் பக்கம், ஐந்து பயிற்சி செய்யக்கூடிய கொள்கைகளை அளவுருக்கள், GPU அடுக்கு, தாமதம் மற்றும் குறைந்தபட்ச எபிசோடுகள் மூலம் ஒப்பிடுகிறது.
Pi0.5 ஆனது A100 மற்றும் H100 அடுக்கில் ஒரு செயல் படிக்கு 485 ms என்ற வேகத்தில், 50 எபிசோட் தளத்துடன் உள்ளது.

வழி A: openpi களஞ்சியத்துடன் நுண்-சரிசெய்தல் (fine-tune)

குறிப்புச் செயலாக்கம்: முதலில் JAX, Ubuntu 22.04 இல் மட்டுமே சோதிக்கப்பட்டது, கொடிகளை (flags) விட உள்ளமைவுப் பொருள்கள் (config objects) மூலம் இயக்கப்படுகிறது. PyTorch பாதை செப்டம்பர் 2025 இல் வந்தது, LIBERO இல் சரிபார்க்கப்பட்டது. மூன்று படிகள்: உங்கள் தரவை மாற்றுதல், உள்ளமைவை வரையறுத்தல், பயிற்சி செய்தல் மற்றும் சேவை செய்தல்.

  1. 1
    குளோன் செய்து நிறுவுதல்

    openpi ஆனது uv ஐப் பயன்படுத்துகிறது. GIT_LFS_SKIP_SMUDGE என்பது LeRobot ஐ LFS ப்ளாப்கள் இல்லாமல் ஒரு சார்புநிலையாக வர அனுமதிக்கும்.

    bash
    git clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git
    cd openpi
    
    GIT_LFS_SKIP_SMUDGE=1 uv sync
    GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .
  2. 2
    உங்கள் தரவை ஒரு LeRobot தரவுத்தொகுப்பாக மாற்றுதல்

    அப்ஸ்ட்ரீம் LIBERO மற்றும் DROID க்கான மாற்றிகளை (converters) வழங்குகிறது, மேலும் நீங்கள் ஒன்றை மாற்றியமைக்க வேண்டும் என்று எதிர்பார்க்கிறது. முக்கிய வேலை, விசை மேப்பிங் ஆகும்.

    bash
    uv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data
  3. 3
    ஒரு பயிற்சி உள்ளமைவைச் சேர்த்தல்

    உள்ளமைவுகள் (Configs) src/openpi/training/config.py இல் உள்ள TrainConfig உள்ளீடுகள் ஆகும். இது pi05_droid_finetune ஐ மாற்றியமைக்கிறது, எடை ஏற்றும் கருவி (weight loader) pi05_base ஐ நோக்கி சுட்டிக்காட்டப்பட்டுள்ளது.

    python
    TrainConfig(
        name="pi05_so100",
        model=pi0_config.Pi0Config(
            pi05=True,
            action_dim=32,        # pi05 is trained with 32-dim actions
            action_horizon=16,
        ),
        # Copy LeRobotLiberoDataConfig in the same file and rewrite the key
        # mapping for your camera names, then reference your copy here.
        data=LeRobotLiberoDataConfig(
            repo_id="your_hf_username/my_so100_dataset",
            base_config=DataConfig(prompt_from_task=True),
        ),
        weight_loader=weight_loaders.CheckpointWeightLoader(
            "gs://openpi-assets/checkpoints/pi05_base/params"
        ),
        batch_size=32,
        num_train_steps=20_000,
    )
  4. 4
    சாதாரண புள்ளிவிவரங்களைக் கணக்கிடுதல்

    தரவுத்தொகுப்பிற்கு எதிராக அல்லாமல், உள்ளமைவுப் பெயருக்கு எதிராக இயங்குகிறது. இதைத் தவிர்ப்பது இங்கு ஏற்படும் பொதுவான முதல் தோல்வியாகும்.

    bash
    uv run scripts/compute_norm_stats.py --config-name pi05_so100
  5. 5
    பயிற்சி செய்தல்

    இந்த மாறி JAX ஆனது இயல்புநிலை 75 சதவீதத்திற்குப் பதிலாக 90 சதவீத GPU நினைவகத்தைப் பயன்படுத்த அனுமதிக்கிறது. 80 GB கார்டில், இது இயக்கம் நீடிக்குமா என்பதைத் தீர்மானிக்கிறது.

    bash
    XLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \
        --exp-name=my_experiment \
        --overwrite
  6. 6
    சேவை செய்தல்

    சேவையகம் போர்ட் 8000 இல் கேட்டு, கண்காணிப்பு வினவல்களுக்குப் பதிலளிக்கிறது; உங்கள் ரோபோ ரன்டைம் கிளையன்ட் ஆகும்.

    bash
    uv run scripts/serve_policy.py policy:checkpoint \
        --policy.config=pi05_so100 \
        --policy.dir=checkpoints/pi05_so100/my_experiment/20000
PyTorch பாதை JAX பாதை அல்ல

openpi இன் PyTorch செயலாக்கம் pi0-FAST, கலப்பு துல்லியம் (mixed precision), FSDP, LoRA அல்லது EMA எடைகளை ஆதரிக்கவில்லை, எனவே 22.5 GB ஐ அடையும் LoRA ஆனது JAX இல் மட்டுமே உள்ளது, gemma_2b_lora மற்றும் gemma_300m_lora வகைகளின் மூலம். மோசமானது: இந்த அமைப்பு உங்கள் நிறுவப்பட்ட transformers 4.53.2 மீது திருத்தப்பட்ட கோப்புகளை நகலெடுக்கிறது, மேலும் README எச்சரிக்கிறது, uv இன் இயல்புநிலை ஹார்ட்லிங்க் பயன்முறையுடன் இது uv கேச் இல் உள்ள transformers ஐ நிரந்தரமாக மாற்றியமைக்கிறது மற்றும் பிற திட்டங்களில் கசியக்கூடும். இதை ரத்து செய்ய uv cache clean transformers ஐப் பயன்படுத்தவும்.

வழி B: lerobot pi05 உடன் ஃபைன்-ட்யூன் செய்யவும்

LeRobot போர்ட் நீங்கள் ஏற்கனவே பயன்படுத்தும் CLI இல் அதே எடைகளை உள்ளடக்கியது ACT மற்றும் SmolVLA. கீழே உள்ள அனைத்தும் lerobot 0.6.1 (ஆகஸ்ட் 3, 2026 முதல் வெளியான பதிப்பு) மற்றும் ஆகஸ்ட் 23, 2026 அன்று வெளியான pi05 ஆவணங்களுக்கு எதிராக சரிபார்க்கப்பட்டது. பதிப்புகள் இங்கு முக்கியம்: v3.0 தரவுத்தொகுப்புகள் அக்டோபர் 2025 இல் 0.4.0 உடன் வந்தன, மார்ச் 9, 2026 இன் 0.5.0 வலைப்பதிவு pi0-FAST மற்றும் Real-Time Chunking ஐ வழங்குகிறது, மேலும் ஜூலை 6, 2026 இல் 0.6.0 அடிப்படை தொகுப்பை இலகுவாக்கி, வரிசைப்படுத்தலை lerobot-rollout க்கு மாற்றியது.

ஒரு விஷயம் மாறவில்லை: lerobot-train மற்றும் lerobot-record ஏற்கனவே 0.3.2, ஆகஸ்ட் 2025 இல் நுழைவுப் புள்ளிகளாக இருந்தன. python -m lerobot.scripts.train என்று இன்னும் அழைக்கும் ஒரு பயிற்சி, ஒரு வருட மாற்றங்களுக்கு முந்தையது மற்றும் மற்றவற்றிலும் நம்பத்தகாதது.

  1. 1
    சரியான கூடுதல் அம்சங்களுடன் நிறுவவும்

    0.6.0 முதல், அடிப்படை நிறுவல் முக்கிய ML சார்புகளை மட்டுமே கொண்டுள்ளது, மேலும் pi கூடுதல் எந்த தரவுத்தொகுப்பு அல்லது பயிற்சி குறியீட்டையும் சேர்க்கவில்லை, எனவே ஒரு ஃபைன்-ட்யூன் பயிற்சி கூடுதல் தேவைப்படுகிறது. பழைய ஒரு-வரி கட்டளைகள் இறக்குமதி நேரத்தில் இங்கே தோல்வியடைகின்றன.

    bash
    # policy dependencies plus the training stack
    pip install 'lerobot[pi,training]'
    
    # from a source checkout
    pip install -e ".[pi,training]"
    
    # driving an SO-100 afterwards needs the robot extras too
    pip install 'lerobot[core_scripts,feetech]'
  2. 2
    அங்கீகரிக்கவும்

    ஒரு உலாவியில் paligemma-3b-pt-224 உரிமத்தை ஏற்றுக்கொண்டு, பின்னர் பயிற்சி அளிக்கும் கணினியில் உள்நுழையவும்.

    bash
    hf auth login
  3. 3
    குவாண்டில் புள்ளிவிவரங்களைச் சேர்க்கவும்

    Pi0.5 ஆனது STATE மற்றும் ACTION ஐ குவாண்டில்களுடன் இயல்பாக்குகிறது, எனவே meta/stats.json க்கு q01 மற்றும் q99 தேவை. பழைய தரவுத்தொகுப்புகள் min, max, mean, std ஆகியவற்றை மட்டுமே கொண்டுள்ளன.

    bash
    lerobot-edit-dataset \
        --repo_id your_dataset \
        --new_repo_id your_dataset \
        --operation.type recompute_stats \
        --operation.overwrite true
  4. 4
    lerobot/pi05_base இலிருந்து ஃபைன்-ட்யூன் செய்யவும்

    உங்கள் கார்டு தாங்கும் அளவுக்கு பேட்ச் அளவை அமைக்கவும்; ஆவணங்கள் LIBERO இல் 80 GB இல் 64 ஐப் பயன்படுத்துகின்றன. bfloat16 ஐ வெளிப்படையாக அனுப்பவும், உள்ளமைவு இயல்புநிலை float32 ஆகும்.

    bash
    lerobot-train \
        --dataset.repo_id=${HF_USER}/my_so100_dataset \
        --policy.type=pi05 \
        --policy.pretrained_path=lerobot/pi05_base \
        --policy.gradient_checkpointing=true \
        --policy.dtype=bfloat16 \
        --policy.device=cuda \
        --policy.push_to_hub=false \
        --output_dir=./outputs/pi05_so100 \
        --job_name=pi05_so100 \
        --batch_size=4 \
        --num_workers=8 \
        --steps=30000 \
        --save_freq=5000 \
        --seed=1000
  5. 5
    கையில் இயக்கவும்

    0.6.x இல் இது lerobot-rollout: lerobot-record ஒரு கொள்கையை மறுக்கிறது மற்றும் eval_ தரவுத்தொகுப்பு பெயர்களை நிராகரிக்கிறது. Base ஆனது கையை இயக்குகிறது, sentry ஆனது ரோல்அவுட்டைப் பதிவு செய்கிறது.

    bash
    lerobot-rollout \
        --strategy.type=base \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
        --task="Put lego brick into the transparent box" \
        --duration=60
    
    # same run, recorded into an eval_ dataset
    lerobot-rollout \
        --strategy.type=sentry \
        --policy.path=${HF_USER}/my_policy \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM1 \
        --dataset.repo_id=${HF_USER}/eval_so100 \
        --dataset.single_task="Put lego brick into the transparent box" \
        --duration=600
கொடிஅது என்ன செய்கிறதுகுறிப்பு
--policy.type=pi05Pi0.5 ஐத் தேர்ந்தெடுக்கிறதுpretrained_path உடன் தேவை, --policy.path உடன் தவிர்க்கவும்
--policy.pretrained_pathஎடைகளை மட்டுமே ஏற்றுகிறதுஉங்கள் தரவுத்தொகுப்பிலிருந்து அம்சப் பெயர்கள், சேமிக்கப்பட்ட அமைப்புகள் மீட்டமைக்கப்படும்
--policy.pathஎடைகள் மற்றும் செக்பாயிண்ட் config.jsonn_action_steps போன்ற சேமிக்கப்பட்ட அமைப்புகள் பெறப்படும்
--policy.n_action_stepsஒரு துண்டிற்கு நுகரப்படும் படிகள்50 க்கு திரும்பும், chunk_size (இயல்புநிலை 50) க்கு மேல் ஒருபோதும் இருக்காது
--policy.train_expert_onlyVLM ஐ முடக்குகிறது, நிபுணருக்கு பயிற்சி அளிக்கிறதுஇயல்புநிலை தவறு, குறைந்த நினைவகம், வெற்றியில் சில செலவு
--policy.gradient_checkpointingசெயல்பாடுகளை சேமிப்பதற்கு பதிலாக மீண்டும் கணக்கிடுங்கள்இயல்புநிலை தவறு, ஒரு ரன் பொருந்தாதபோது முதல் நெம்புகோல்
--peft.method_type=LORAமுழு எடைகளுக்கு பதிலாக LoRA அடாப்டர்கள்peft கூடுதல் தேவை, ஆவணப்படுத்தப்பட்ட எடுத்துக்காட்டு SmolVLA
--policy.rtc_training_max_delayRTC க்கான செயல்-முன்னொட்டு நிலைப்படுத்தல்முக்கிய கிளை மட்டுமே, 0.6.1 இல் இல்லை, chunk_size க்கு கீழே இருக்க வேண்டும்
--rename_mapதரவுத்தொகுப்பு நெடுவரிசைகளை கொள்கை அம்சங்களுக்கு வரைபடமாக்குகிறதுஉங்கள் கேமரா விசைகள் வேறுபடும்போது தேவை
பெரும்பாலான முதல் ரன்கள் சந்திக்கும் பிழை

குவாண்டில்கள் இல்லாமல், முதல் பேட்சில் ValueError: QUANTILES normalization mode requires q01 and q99 stats என்ற பிழையைப் பெறுவீர்கள். புள்ளிவிவரங்களை மீண்டும் கணக்கிடுங்கள், ஆனால் முடிவு $HF_LEROBOT_HOME/your_dataset இல் இறங்குகிறது, --dataset.repo_id படிக்கும் கேச் இல் அல்ல, எனவே --dataset.root ஐ அங்கு சுட்டிக்காட்டி பயிற்சி அளிக்கவும் அல்லது ஹப்பிற்கு தள்ளவும். அல்லது LIBERO குறிப்பு கட்டளை செய்வது போல, --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' உடன் குவாண்டில்களைத் தவிர்க்கவும்.

மூன்று இயல்புநிலை தொகுப்புகள், மற்றும் பயிற்சியாளரை அடையும் தொகுப்புகள்

openpi's TrainConfig என்பது குறிப்பு, LeRobot's PI05Config என்பது lerobot-train நீங்கள் எதுவும் சொல்லாதபோது பயன்படுத்துவது, மேலும் இங்குள்ள படிவம் ஒரு மூன்றாவது தொகுப்பை அனுப்புகிறது. ஆச்சரியம் என்னவென்றால் கற்றல் விகிதம்: இரண்டு அப்ஸ்ட்ரீம் இயல்புநிலைகளும் 2.5e-5 இல் உச்சத்தை அடைகின்றன, அதேசமயம் openpi இன் pi05_libero உள்ளமைவு மற்றும் இந்த தளம் அதை 5e-5 ஆக உயர்த்துகின்றன.

அமைப்புopenpi TrainConfiglerobot pi05 மற்றும் lerobot-trainAY-Robots அனுப்புகிறது
தொகுப்பு அளவு3281
உச்ச கற்றல் விகிதம்2.5e-5, கோசைன் சிதைவுoptimizer_lr 2.5e-55e-5
பயிற்சி படிகள்30,000100,00030,000
சரிபார்ப்பு இடைவெளி1,000 படிகள்20,000 படிகள்படிவத்தில் இல்லை
சீட்421,000படிவத்தில் உள்ளது
செயல் துண்டுaction_horizon 50chunk_size 50, n_action_steps 50படிவத்தில் இல்லை
எடை dtypebfloat16float32 நீங்கள் --policy.dtype அனுப்பும் வரைபடிவத்தில் இல்லை
கிரேடியன்ட் குவிப்புஅப்படி ஒரு கட்டுப்பாடு இல்லை, அதற்கு பதிலாக fsdp_devicesஇதுவரை எந்த வெளியீட்டிலும் இல்லை16, மேலும் அது கைவிடப்படுகிறது

இந்த போர்ட் நம்பகமானதா? LeRobot குழு LIBERO அடிப்படை மாதிரியை மேலும் 6k படிகளுக்கு ஃபைன்-ட்யூன் செய்து, openpi இன் குறிப்பு எண்களுடன் நான்கு தொகுப்புகளில் ஒப்பிட்டது: 97.5 சதவீதம் சராசரி எதிராக 96.85, Libero 10 இல் முன்னணியில், Spatial இல் பின்தங்கியுள்ளது. இந்த வழி ஒரு கருவி தேர்வு, தரமான தேர்வு அல்ல.

உங்கள் சொந்த தரவுகளில் Pi0.5 ஐ ஃபைன்-ட்யூன் செய்தல்
நன்மைகள்
  • இதன் பின்னால் 10,000 மணிநேரத்திற்கும் மேலான ரோபோ முன்-பயிற்சி உள்ளது, எனவே உங்கள் பணியின் 50 எபிசோடுகள் போதுமானதாக இருக்கும்.
  • தொடர்ச்சியான செயல்கள்: ட்யூன் செய்ய டோக்கனைசர் இல்லை, உங்கள் மூட்டு கோணங்களில் தனித்தன்மை வரம்பு இல்லை.
  • LeRobot போர்ட் LIBERO சராசரியில் 97.5 சதவீதம் மதிப்பெண் பெறுகிறது, openpi இன் 96.85 க்கு எதிராக, எனவே நட்புரீதியான CLI அளவிடக்கூடிய செலவு எதையும் ஏற்படுத்தாது.
  • இருபுறமும் அளவுரு-திறமையான வழிகள்: openpi இன் JAX LoRA வகைகள், LeRobot இன் PEFT ஒருங்கிணைப்பு.
சாதக பாதகங்கள்
  • முழு ஃபைன்-ட்யூனிங்கிற்கு 70 GB க்கும் அதிகமாக தேவைப்படுகிறது. 22.5 GB LoRA எண்ணிக்கை openpi இன் JAX எண்; PEFT இன் கீழ் pi05 க்கு எதுவும் வெளியிடப்படவில்லை.
  • ஒரு செயல் படிக்கு 485 ms, இங்குள்ள ஐந்தில் மிக மெதுவானது: SmolVLA ஐ விட இரு மடங்கு, ACT ஐ விட இருபத்தி நான்கு மடங்கு.
  • LeRobot v3.0 தேவைப்படுகிறது, எனவே ஒரு GR00T இயக்கத்திற்காக பதிவுசெய்யப்பட்ட தரவுத்தொகுப்பை மாற்ற வேண்டும், மற்றும் நேர்மாறாகவும்.
  • புதிய விருப்பங்கள் முதலில் மெயினில் வருகின்றன: பயிற்சி நேர RTC மற்றும் MEM நினைவகம் 0.6.1 இல் இல்லை, எனவே புதிய ஆவணங்கள் git இலிருந்து நிறுவுவதைக் குறிக்கலாம்.

485 மில்லி விநாடி யதார்த்தம், மற்றும் அது எங்கு பயன்படுத்த முடியாததாகிறது

இது உங்கள் திட்டத்தை தீர்மானிக்கிறது, எனவே இது செலவு அட்டவணைக்கு முன் வருகிறது. ஒரு செயல் படிக்கு Pi0.5 க்கு இங்கு அளவிடப்பட்டது 485 மில்லி விநாடிகள் ஆகும். மற்ற நான்கு மாடல்களுடன் ஒப்பிடுகையில்:

PolicyInference per action stepParamsGPU tierMinimum episodes
ACT20 ms~80 MRTX 4090 or any 24 GB card50
GR00T N1.7152 ms~3 BA100 80 GB or H100 80 GB50
GR00T N1.5165 ms~3 BA100 80 GB or H100 80 GB50
SmolVLA245 ms~450 MRTX 4090 or any 24 GB card30
Pi0.5485 ms~3 BA100 80 GB or H100 80 GB50
AY-Robots இன் GR00T N1.7 மற்றும் Pi0.5 க்கான நேரடி ஒப்பீட்டுப் பக்கம், அளவுருக்கள், GPU அடுக்கு, தாமதம் மற்றும் தரவுத்தொகுப்பு வடிவம் ஆகியவற்றுடன்
அதே GPU அடுக்கு, அதே எபிசோட் தளம், வேறுபட்ட தரவுத்தொகுப்பு பதிப்பு, மூன்று மடங்கு தாமத இடைவெளி.
இன்ஃபரன்ஸ் சர்வோக்களுக்கு அடுத்ததாக இருக்க வேண்டும்

இந்த ஐந்து மாடல்களிலும் உள்ள கட்டுப்பாட்டு சுழற்சி ஒரு செயல் படிக்கு 20 முதல் 485 மில்லி விநாடிகள் வரை இயங்குகிறது. 485 மில்லி விநாடிகளுக்கு மேல் பொது இணைய ரவுண்ட் டிரிப்கள் ஒரு செயல்படும் கொள்கையை தயக்கமானதாக மாற்றும். மெதுவான பிக்-அண்ட்-பிளேஸ் செயல்பாடுகளுக்கு ரிமோட் இன்ஃபரன்ஸ் சாத்தியமானது, ஆனால் வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல. LAN இல் மட்டுமே செயல்படும் ஒரு டெமோவை விற்பதை விட இதைச் சொல்வதே நல்லது. உங்கள் கை துண்டுகளுக்கு இடையில் இடைநிறுத்தப்பட்டால், கொள்கை இயக்கத்தின் நடுவில் உறைந்து போகிறது என்பதில் இருந்து தொடங்கவும்.

அப்ஸ்ட்ரீமில் ஒரு தீர்வு உள்ளது, அதில் பாதி நீங்கள் நிறுவக்கூடிய வெளியீட்டில் ஏற்கனவே உள்ளது. ரியல்-டைம் சங்கிங் (Real-Time Chunking) அடுத்த துண்டினை, கை தற்போதைய துண்டினை செயல்படுத்திக் கொண்டிருக்கும்போதே உருவாக்குகிறது, பின்னர் புதிய துண்டின் ஒன்றுடன் ஒன்று சேரும் படிகளை ஏற்கனவே செயல்படுத்தப்பட்ட பகுதிக்கு அருகில் இருக்குமாறு வழிநடத்துகிறது, இதனால் கை இணைப்பில் நின்றுவிடவோ அல்லது அதிர்ச்சியடையவோ செய்யாது. Pi0, Pi0.5 மற்றும் SmolVLA க்கான 0.4.2 சேஞ்ச்லாக்கில் அனுப்பப்பட்ட இன்ஃபரன்ஸ்-டைம் வடிவம் ஒரு ரோல்அவுட் ஃபிளாக் ஆகும், மீண்டும் பயிற்சி அளிப்பது அல்ல:

bash
lerobot-rollout \
    --strategy.type=base \
    --policy.path=${HF_USER}/my_policy \
    --inference.type=rtc \
    --inference.rtc.execution_horizon=10 \
    --inference.rtc.max_guidance_weight=10.0 \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM1 \
    --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
    --task="Put lego brick into the transparent box" \
    --duration=60
execution_horizon என்பது முந்தைய துண்டின் எத்தனை படிகளுடன் புதிய துண்டு ஒத்துப்போக வேண்டும் என்பதைக் குறிக்கிறது; RTC ஆவணங்கள் 8 முதல் 12 வரை வழக்கமான வரம்பாகக் கொடுக்கின்றன. இயல்புநிலை இன்ஃபரன்ஸ் பேக்கெண்ட் --inference.type=sync.

இது மாடலை வேகமாக ஆக்காது. இது இடைவெளியை மறைக்கிறது: 485 மில்லி விநாடிகள் இன்னும் செலவிடப்படுகின்றன, ஆனால் முக்கியமான பாதையில் இருந்து விலகி, இதனால் துண்டுகளுக்கு இடையில் வரிசை வறண்டு போகாது. arXiv 2512.05964 இலிருந்து பயிற்சி-நேர மாறுபாடு மேலும் செல்கிறது: மாடல் ஒரு சுத்தமான செயல் முன்னொட்டை (action prefix) நிபந்தனைக்குட்படுத்த கற்றுக்கொள்கிறது, எனவே இன்ஃபரன்ஸில் ஒன்றுடன் ஒன்று சேரும் பகுதி வழிகாட்டப்படுவதற்குப் பதிலாக, ஒரு-செயல்-ஓட்ட நேரப்படிகளுடன் (per-action flow timesteps) கடினமாக வரையப்படுகிறது, மேலும் வழிகாட்டுதல் பின்னோக்கிய பாஸ் மறைந்துவிடுகிறது. பயிற்சியின் போது, இது ஒரு எடுத்துக்காட்டுக்கு ஒரு முன்னொட்டு நீளத்தை மாதிரியாக எடுத்து, மீதமுள்ள பின்னொட்டில் (postfix) ஓட்ட இழப்பை (flow loss) எடுக்கிறது. அந்த ஃபிளாக் மெயினில் மட்டுமே உள்ளது, 0.6.1 இல் இல்லை, மேலும் நீங்கள் பயிற்சி அளிக்கும் தாமதம் chunk_size க்கு கீழே இருக்க வேண்டும்.

Pi0.5 செக்பாயிண்ட்டைப் பெறுவதற்கான இரண்டு வழிகள்

நீங்கள் ஒரு 80 GB கார்டை வாடகைக்கு எடுக்கலாம் அல்லது சொந்தமாக வைத்திருக்கலாம், மேலே உள்ள ஸ்டேக்குகளில் ஒன்றை நிறுவலாம், உங்கள் தரவுத்தொகுப்பை மாற்றலாம் மற்றும் ரன்-ஐ கண்காணிக்கலாம். openpi's JAX LoRA, LeRobot's PEFT அடாப்டர்கள், ரிலேட்டிவ் ஆக்சன்ஸ், கஸ்டம் கீ மேப்பிங்ஸ் போன்ற ஒவ்வொரு கட்டுப்பாட்டையும் நீங்கள் வைத்திருக்கலாம். ஒவ்வொரு தோல்வியையும் நீங்கள் தான் எதிர்கொள்ள வேண்டும்.

  • வன்பொருள்: A100 80 GB அல்லது H100, அல்லது openpi's JAX LoRA பாதையில் ஒரு 24 GB கார்டு.
  • அமைப்பு: முதல் ரன்னுக்கு ஒரு மதியம், பெரும்பாலும் கீ மேப்பிங் மற்றும் கேடட் டோக்கனைசர்.
  • ஹோஸ்ட் செய்யப்பட்ட படிவத்தில் இல்லை: PEFT அடாப்டர்கள், ரிலேட்டிவ் ஆக்சன்ஸ், பயிற்சி நேர RTC, MEM மெமரி.
bash
lerobot-train \
    --dataset.repo_id=${HF_USER}/my_so100_dataset \
    --policy.type=pi05 \
    --policy.pretrained_path=lerobot/pi05_base \
    --policy.rtc_training_max_delay=10 \
    --policy.gradient_checkpointing=true \
    --policy.dtype=bfloat16 \
    --batch_size=4 --steps=30000 --seed=1000
ஹோஸ்ட் செய்யப்பட்ட படிவம் இயக்காத கட்டளை, மற்றும் pip நிறுவ முடியாது: பயிற்சி நேர RTC என்பது ஒரு மெயின் பிராஞ்ச் ஃபிளாக் ஆகும்.

அது வேலை செய்யாதபோது

அறிகுறிமிகவும் சாத்தியமான காரணம்
ரன் தொடங்குவதற்கு முன்பே நிராகரிக்கப்பட்டதுதரவுத்தொகுப்பு v2.1 ஆனால் Pi0.5 v3.0 ஐ விரும்புகிறது, அல்லது GR00T க்கு நேர்மாறாக
ImportError, டேட்டாசெட்ஸ் தொகுப்பு இல்லைபயிற்சி கூடுதல் இல்லாமல் lerobot 0.6.x
பேட்ச் ஒன்றில் q01 மற்றும் q99 பற்றிய ValueErrormeta/stats.json இல் குவாண்டில்ஸ் இல்லை; மீண்டும் கணக்கிடவும் அல்லது MEAN_STD ஐப் பயன்படுத்தவும்
படி 0 இல் CUDA நினைவகம் இல்லை70 GB க்கும் குறைவான முழு ஃபைன்-ட்யூன்; செக்பாயிண்டிங் அல்லது train_expert_only ஐ முயற்சிக்கவும்
401 அல்லது கேடட் ரெப்போ பிழைPaliGemma டோக்கனைசர் உரிமம் ஏற்கப்படவில்லை
லாஸ் குறைகிறது, ரோபோட் எதுவும் செய்யவில்லைசாதாரணமயமாக்கல் பொருந்தாமை, அல்லது கொள்கை நிலையை நகலெடுக்கிறது
சங்குகளுக்கு இடையில் கை நிற்கிறதுஒரு படிக்கு தாமதம் மற்றும் ரவுண்ட் ட்ரிப்; சன்க் வரிசை வறண்டு போகிறது
ஒரு அமைப்பில் வேலை செய்கிறது, மற்றொன்றில் தோல்வியடைகிறதுமிகக் குறைவான எபிசோடுகள், அல்லது அனைத்தும் ஒரே உள்ளமைவில்

ஒரு ஓட்டத்தின் செலவு என்ன

Pi0.5 ஆனது விலையுயர்ந்த அடுக்கில் உள்ளது, ஏனெனில் அதற்கு 80 GB கார்டு தேவைப்படுகிறது, மேலும் ஸ்பாட் விலைகள் மாறுபடும், எனவே இந்த எண்ணிக்கை ஒரு விலையை விட ஒரு வரம்பாகும். பல SO-100 பணிகளுக்கு, முதலில் SmolVLA அல்லது ACT ஐ 24 GB அடுக்கில் முதலில் பயிற்சி செய்யுங்கள், பணி கற்றுக்கொள்ளக்கூடியதா என்பதை உறுதிப்படுத்தவும், பின்னர் A100 மணிநேரத்தை அதில் செலவிடவும். உங்கள் முதல் கொள்கையைப் பயிற்றுவிக்கவும் அந்த மலிவான சுழற்சியைக் காட்டுகிறது, மேலும் விலை நிர்ணயம் தற்போதைய அடுக்குகளைக் கொண்டுள்ளது.

அடுக்குகொள்கைகள்வழக்கமான ஓட்டம்மணிநேர விலைஒரு ஓட்டத்தின் செலவு
A100 80 GB or H100Pi0.5, GR00T N1.7, GR00T N1.53 to 6 hours1.20 to 2.00 USDabout 4 to 12 USD
RTX 4090 or any 24 GB cardSmolVLA, ACT2 to 5 hours0.30 to 0.60 USDabout 1 to 3 USD
AY-Robots செலவு அட்டவணை, ஒவ்வொரு கொள்கைக்கும் எந்த GPU தேவை, வழக்கமான இயக்க நேரம் மற்றும் விலை, மற்றும் ஒரு கொள்கை பயனுள்ளதாக மாறுவதற்கு முன் எத்தனை எபிசோடுகள் தேவை என்பதைக் காட்டுகிறது.
தயாரிப்புப் பக்கத்தில் உள்ள அதே இரண்டு அடுக்குகள்: Pi0.5 ஆனது 80 GB கார்டை வாடகைக்கு எடுக்கிறது, SmolVLA மற்றும் ACT ஆகியவை 4090 இல் பொருந்தும்.

ஒரு மாலை நேரத்தை அர்ப்பணிக்கும் முன்: GR00T N1.7 மற்றும் Pi0.5 மற்றும் Pi0.5 மற்றும் SmolVLA ஆகியவை ஒரே எண்களை நேருக்கு நேர் ஒப்பிடுகின்றன. Arena ஆனது 85 VLA மாதிரிகள் மற்றும் 332 பெஞ்ச்மார்க் முடிவுகளைக் கொண்டுள்ளது, ஒவ்வொன்றும் அதன் மூலத்துடன் இணைக்கப்பட்டுள்ளது, மேலும் இந்த குடும்பத்தைப் பற்றிய பின்னணி தகவல்கள் எங்கள் VLA கண்ணோட்டத்தில்.

ஸ்டேக்கை உருவாக்காமல் Pi0.5 ஐப் பயிற்றுவிக்கவும்

ஒரு படிவத்தில் தரவுத்தொகுப்பு மற்றும் ஹைப்பர்பாராமீட்டர்களைத் தேர்ந்தெடுக்கவும். பின்தளம் உடனடி சந்தையில் 80 GB கார்டை வாடகைக்கு எடுத்து, பயிற்சியாளரை இயக்கி, சரிபார்ப்புப் புள்ளிகளை பொருள் சேமிப்பகத்தில் எழுதுகிறது. SO-100, SO-101, Koch v1.1 மற்றும் LeKiwi க்கான வழிகாட்டிகள்.

பயிற்சி வழிகாட்டிகளைத் திறக்கவும்
RTX 4090 இல் Pi0.5 ஐ ஃபைன்-ட்யூன் செய்ய முடியுமா?

முழுமையான ஃபைன்-ட்யூன் அல்ல: openpi அதற்காக 70 GB க்கும் அதிகமாக பட்டியலிடுகிறது, எனவே ஒரு A100 80 GB அல்லது ஒரு H100 தேவை. அதன் 22.5 GB LoRA எண்ணிக்கை JAX பாதைக்கு சொந்தமானது; PyTorch செயலாக்கத்தில் LoRA இல்லை. LeRobot இன் PEFT ஒருங்கிணைப்பு உள்ளது, ஆனால் அதன் ஆவணப்படுத்தப்பட்ட எடுத்துக்காட்டு SmolVLA ஆகும், மேலும் pi05 க்கான VRAM எண்ணிக்கை எதுவும் வெளியிடப்படவில்லை.

எனக்கு எத்தனை எபிசோடுகள் தேவை?

ஐம்பது, GR00T மற்றும் ACT க்கு சமமான குறைந்தபட்சம்; SmolVLA மட்டுமே 30 ஆகக் குறைவாக உள்ளது. அடிப்படை சரிபார்ப்புப் புள்ளி 10,000 மணிநேரத்திற்கும் மேலான முன்-பயிற்சியைக் கொண்டுள்ளது, எனவே ஃபைன்-ட்யூன் புதிதாகக் கற்றுக்கொள்வதற்குப் பதிலாக மாற்றியமைக்கிறது: 50 சுத்தமான, மாறுபட்ட எபிசோடுகள் ஒரு உள்ளமைவில் இருந்து இருநூறு எபிசோடுகளை விட சிறந்தவை.

--policy.path மற்றும் --policy.pretrained_path இடையே உள்ள வேறுபாடு என்ன?

--policy.path எடைகள் மற்றும் சரிபார்ப்புப் புள்ளியின் config.json ஐ ஏற்றுகிறது, எனவே n_action_steps போன்ற சேமிக்கப்பட்ட அமைப்புகள் பெறப்படுகின்றன மற்றும் --policy.type தவிர்க்கப்பட வேண்டும். --policy.pretrained_path எடைகளை மட்டுமே ஏற்றுகிறது: அம்சப் பெயர்கள் உங்கள் தரவுத்தொகுப்பிலிருந்து வருகின்றன, சேமிக்கப்பட்ட அமைப்புகள் மீட்டமைக்கப்படுகின்றன, --policy.type தேவை. அதனால்தான் LIBERO கட்டளை n_action_steps=10 மற்றும் empty_cameras=1 ஐ வெளிப்படையாக அனுப்புகிறது; இல்லையெனில் அவை 50 மற்றும் 0 க்குத் திரும்பும்.

திறந்த பதிப்பு ஆய்வுக் கட்டுரையில் உள்ள முழு Pi0.5 ஐ எனக்கு வழங்குகிறதா?

இல்லை. இரண்டும் ஃப்ளோ மேட்சிங் ஆக்‌ஷன் ஹெட்டை மட்டுமே ஆதரிக்கின்றன. FAST ஆக்‌ஷன் டோக்கனைசர் மற்றும் உயர்-நிலை துணைப்பணி கணிப்புடன் கூடிய தனித்த-டோக்கன் முன்-பயிற்சி நிலை வெளியிடப்படவில்லை, மேலும் lerobot/pi05_base கார்டு அந்தப் பட்டியலில் RL ஐச் சேர்க்கிறது, இருப்பினும் pi0.5 ஆய்வுக் கட்டுரை எந்த வலுவூட்டல் கற்றல் நிலையையும் விவரிக்கவில்லை. நீங்கள் வழங்கும் மொழிச் சரத்தின் அடிப்படையில் ஒரு குறைந்த-நிலை கொள்கையைப் பயிற்றுவிக்கிறீர்கள், ஒரு நீண்ட பணியை தானே பிரிக்கும் மாதிரியை அல்ல.

இந்த வழிகாட்டி எந்தப் பதிப்புகளுக்கு எதிராக எழுதப்பட்டுள்ளது?

முக்கியமான openpi மற்றும் lerobot 0.6.1, 2026 ஆகஸ்ட் 3 முதல் வெளியிடப்பட்டது, இரண்டும் 2026 ஆகஸ்ட் 23 அன்று படிக்கப்பட்டன. v3.0 தரவுத்தொகுப்புகள் 2025 அக்டோபரில் 0.4.0 உடன் வந்தன. 0.6.0 அடிப்படை தொகுப்பை இலகுவாக்கியது, எனவே lerobot[pi] மட்டும் இனி ஒரு பயிற்சி ஸ்டேக்கை நிறுவவில்லை, மேலும் வரிசைப்படுத்தலை lerobot-rollout க்கு மாற்றியது. பயிற்சி நேர RTC முக்கியமானது மட்டுமே; இங்கு ஹோஸ்ட் செய்யப்பட்ட பயிற்சியாளர் 0.5.1 ஐ இயக்குகிறார்.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started