
Physical Intelligence இலிருந்து வரும் flow-matching VLA ஆன Pi0.5 ஐ உங்கள் சொந்த ரோபோ தரவில் நுட்பமாகச் சரிசெய்யவும். openpi மற்றும் lerobot pi05 க்கான உண்மையான கட்டளைகள், தரவுத்தொகுப்பு வடிவமைப்பு சிக்கல்கள், VRAM மற்றும் தாமத வரம்புகள்.
Pi0.5 என்பது ஒரு கொள்கை ஒருபோதும் பார்த்திராத அறையில் வேலை செய்ய வேண்டியிருக்கும் போது நீங்கள் பயன்படுத்தும் மாதிரி. இது ஐந்து மாதிரிகளில் மிகவும் சிக்கலானது பயிற்சி செய்யக்கூடிய கொள்கைகள் இங்கு மேம்படுத்துவதற்கு கையால்: அப்ஸ்ட்ரீம் ரெப்போசிட்டரி முதலில் JAX ஐ அடிப்படையாகக் கொண்டது, LeRobot போர்ட் 0.6.0 இல் lerobot-record இலிருந்து வரிசைப்படுத்தலை நகர்த்தியது மற்றும் அடிப்படை நிறுவலை பயிற்சி செய்ய முடியாத அளவுக்கு சிறியதாக ஆக்கியது, மேலும் முழுமையான மேம்படுத்துதல் ஒரு 4090 இல் பொருந்தாது. கீழே: பாய்வு பொருத்தம் அனுமானத்தில் எவ்வளவு செலவாகிறது, இரண்டு கட்டளை வழிகள், மற்றும் முடிவு பயன்படுத்தக்கூடியதா என்பதை தீர்மானிக்கும் 485 ms எண்.
நீங்கள் தெரிந்து கொள்ள வேண்டியவை
- •ஒரு பாய்வு-பொருத்த VLA: ஒரு 3B PaliGemma VLM மற்றும் தொடர்ச்சியான செயல் துண்டுகளை டிகோட் செய்யும் ஒரு 300M செயல் நிபுணர். இதை மேம்படுத்துவதற்கு இரண்டு வழிகள், openpi மற்றும் LeRobot pi05, LIBERO சராசரியில் 0.65 புள்ளிகள் வேறுபாடு.
- •முழுமையான மேம்படுத்துதலுக்கு 70 GB க்கும் அதிகமான VRAM தேவை. openpi, LoRA ஐ 22.5 GB இல் பட்டியலிடுகிறது, அதன் JAX பாதையில் மட்டுமே.
- •தரவுத்தொகுப்பு LeRobotDataset v3.0 ஆக இருக்க வேண்டும், meta/stats.json இல் q01 மற்றும் q99 குவாண்டில்களுடன், இல்லையெனில் முதல் தொகுதி பிழை ஏற்படுத்தும்.
- •முதலில் உங்கள் lerobot பதிவை சரிபார்க்கவும்: 0.6.0 அடிப்படை தொகுப்பை இலகுவாக்கியது மற்றும் lerobot-record இலிருந்து வரிசைப்படுத்தலை நகர்த்தியது.
- •இங்கு இது ஒரு செயல் படிக்கு 485 ms இல் இயங்குகிறது, 50 எபிசோடுகள் தேவை, மற்றும் ஒரு ரன்னுக்கு சுமார் 4 முதல் 12 USD செலவாகும்.
Pi0.5 உண்மையில் என்ன
Physical Intelligence அக்டோபர் 2024 இல் pi0 ஐ வெளியிட்டது: ஒரு பாய்வு பொருத்தம் பார்வை-மொழி-செயல் மாதிரி ஒரு முன்-பயிற்சி பெற்ற VLM இல்: 3 பில்லியன் அளவுருக்கள் கொண்ட PaliGemma மற்றும் புதிதாகத் தொடங்கப்பட்ட ஒரு 300M செயல் நிபுணர், மொத்தம் 3.3 பில்லியன். இந்த ஆய்வுக் கட்டுரை 7 ரோபோ உள்ளமைவுகள் மற்றும் 68 பணிகளில் 10,000 மணிநேரத்திற்கும் மேலான ரோபோ தரவுகளில் முன்-பயிற்சி பெற்றதாகக் கூறுகிறது. மேலும் pi0 கட்டுரை.
Pi0.5 (arXiv 2504.16054, 22 ஏப்ரல் 2025) அதே கட்டமைப்பைத் தக்கவைத்து, பயிற்சி முறையை மாற்றுகிறது: வலைத் தரவு, பொருள் கண்டறிதல், ரோபோவுக்குப் பயிற்சி அளிக்கும் மனிதர்களிடமிருந்து வாய்மொழி அறிவுறுத்தல்கள், துணைப் பணி லேபிள்கள், பல வீடுகளில் உள்ள ரோபோக்களிலிருந்து வரும் குறுக்கு-உருவத் தரவு. இதன் விளைவாக, பயிற்சித் தொகுப்பில் இல்லாத வீடுகளில் சமையலறைகளைச் சுத்தம் செய்யும் ஒரு ரோபோ உருவாகிறது. openpi README, தலைப்பில் இல்லாத ஒரு விவரத்தைச் சேர்க்கிறது: வெளியிடப்பட்ட pi0.5 அறிவுத் தனிமைப்படுத்தலுடன் (arXiv 2505.23705) பயிற்சி அளிக்கப்பட்டது.
| பண்பு | pi0 | pi0.5 |
|---|---|---|
| VLM பேக்போன் மாறுபாடு | gemma_2b (PaliGemma) | gemma_2b (PaliGemma) |
| செயல் நிபுணர் மாறுபாடு | gemma_300m | gemma_300m |
| action_dim | 32 | 32 |
| action_horizon இயல்புநிலை | 50 | 50 |
| max_token_len | 48 | 200 |
| discrete_state_input | false | true, ப்ராம்ப்டில் நிலை பின்களாகப் பிரிக்கப்பட்டுள்ளது |
| அடிப்படை செக்பாயிண்ட் | gs://openpi-assets/checkpoints/pi0_base | gs://openpi-assets/checkpoints/pi05_base |
openpi README தெளிவாகக் கூறுகிறது: களஞ்சியம் pi0.5 பயிற்சி மற்றும் ஊகத்திற்கு (inference) ஒரே மாதிரியாக, ஃப்ளோ மேட்சிங் ஹெட்டை மட்டுமே ஆதரிக்கிறது. ஆய்வுக் கட்டுரை இரண்டு நிலைகளை விவரிக்கிறது, மேலும் குறியீடு இரண்டாவது நிலையை மட்டுமே கொண்டுள்ளது: முன்-பயிற்சி (pre-training) ஒவ்வொரு செயலையும் FAST டோக்கனைசர் மூலம் தனித்த டோக்கன்களாகக் குறிக்கிறது, மேலும் வரிசைப்படுத்தலின் போது (deployment) மாதிரி ஒவ்வொரு செயல் துண்டுக்கும் முன் ஒரு உயர்-நிலை துணைப் பணியை ஊகிக்கிறது. இவை இரண்டும் களஞ்சியத்தில் இல்லை. lerobot/pi05_base கார்டு அதே பட்டியலைக் கொடுத்து RL ஐச் சேர்க்கிறது, இருப்பினும் pi0.5 ஆய்வுக் கட்டுரை எந்த வலுவூட்டல் கற்றல் நிலையையும் விவரிக்கவில்லை. LeRobot போர்ட் அந்த நோக்கத்தை மரபுரிமையாகப் பெறுகிறது, மேலும் அதில் ஹோஸ்ட் செய்யப்பட்ட ஒவ்வொரு பயிற்சியாளரும், இங்குள்ள ஒன்றும் அவ்வாறே. உரிமமும் பிரிக்கப்பட்டுள்ளது: pi05 ஆவணப் பக்கம் Apache 2.0 என்று கூறுகிறது, lerobot/pi05_base கார்டு license: gemma என்று குறியிடப்பட்டுள்ளது.
ஃப்ளோ மேட்சிங் பயிற்சி மற்றும் ஊகத்தைப் பற்றி என்ன மாற்றுகிறது
ஒரு கொள்கை நீங்கள் SO-100 இல் பயிற்சி அளிக்கலாம், இது செயல்களை நேரடியாக (ACT) அல்லது அவற்றை டோக்கனைஸ் செய்து தானாகவே டிகோட் செய்கிறது (pi0-FAST). ஃப்ளோ மேட்சிங் இவை இரண்டையும் செய்யாது: இது சத்தத்தை ஒரு சுத்தமான செயல் துண்டு, பின்னர் அதை ஒருங்கிணைக்கிறது. pi0 ஆய்வுக் கட்டுரை 0.1 படி அளவில் 10 ஒருங்கிணைப்பு படிகளைப் பயன்படுத்துகிறது; LeRobot இன் pi05 உள்ளமைவு அதே num_inference_steps: int = 10 ஐக் கொண்டுள்ளது.
- பயிற்சி: இழப்பு ஒரு சத்தம் நிறைந்த செயல் துண்டுகளை மீண்டும் உருவாக்குகிறது. சரிசெய்ய டோக்கனைசர் இல்லை, உங்கள் மூட்டு கோணங்களை பிரித்தெடுக்க வேண்டியதில்லை.
- ஊகித்தல்: ஒரு துண்டுக்கு செயல் நிபுணர் வழியாக பத்து முன்னோக்கு பாஸ்கள் செலவாகும். இது கட்டமைப்பு ரீதியானது, சரிசெய்தல் பிரச்சனை அல்ல.
- வெளியீடு: 32 பரிமாணங்களின் தொடர்ச்சியான செயல்கள், உள்நாட்டில் திணிக்கப்பட்டு, உங்கள் ரோபோவின் பரிமாணங்களில் இழப்பு எடுக்கப்படுகிறது. ஒரு 6-DoF கை மற்றும் கிரிப்பர் 7 ஐப் பயன்படுத்துகிறது.
# openpi/src/openpi/models/pi0_config.py - the defaults every pi05 config inherits
@dataclasses.dataclass(frozen=True)
class Pi0Config(_model.BaseModelConfig):
dtype: str = "bfloat16"
paligemma_variant: _gemma.Variant = "gemma_2b"
action_expert_variant: _gemma.Variant = "gemma_300m"
action_dim: int = 32
action_horizon: int = 50
max_token_len: int = None # 200 if pi05 else 48
pi05: bool = False # flips discrete_state_input to TruePaliGemma முதுகெலும்பு மற்றும் அதற்கு முன்னால் உள்ள வாயில்
PaliGemma (arXiv 2407.07726) என்பது Gemma-2B மொழி மாதிரியில் உள்ள ஒரு SigLIP-So400m விஷன் என்கோடர் ஆகும், இது சுமார் 3B அளவுருக்களைக் கொண்டது. Pi0.5 அதன் டோக்கனைசரை மரபுரிமையாகப் பெறுகிறது, மேலும் அந்த டோக்கனைசர் ஒரு கேடட் களஞ்சியத்தில் உள்ளது. முதல் ஓட்டம் இறப்பதற்கான பொதுவான வழி இதுதான், முதல் பயிற்சி படிநிலை.
LeRobot pi05 ஆவணங்கள் இதைத் தெளிவாகக் கூறுகின்றன: pi0.5 கேடட் google/paligemma-3b-pt-224 டோக்கனைசரைப் பயன்படுத்துகிறது, எனவே ஹப்பில் அதன் உரிமத்தை ஏற்றுக்கொண்டு முதலில் hf auth login ஐ இயக்கவும். அணுகல் உடனடியாக அல்ல, கைமுறையாக வழங்கப்படுகிறது. இதைத் தவிர்த்து, கட்டண கிளவுட் ரன் ஒன்றைத் தொடங்கினால், டோக்கனைசரைப் பதிவிறக்க முடியாத ஒரு பாட்-க்கு நீங்கள் பணம் செலுத்துவீர்கள்.
தொடங்குவதற்கு முன்: தரவுத்தொகுப்பு வடிவம், எபிசோடுகள், வன்பொருள்
LeRobot இல் உள்ள Pi0.5 ஒரு LeRobot தரவுத்தொகுப்பு v3.0 அமைப்பில் படிக்கிறது, இது அக்டோபர் 2025 இல் lerobot 0.4.0 உடன் வந்தது: ஒரு Parquet மற்றும் MP4 கோப்பில் பல எபிசோடுகள், ஒரு கோப்பிற்கு ஒரு எபிசோட், கோப்புப் பெயர்களுக்குப் பதிலாக meta/episodes/ இல் எல்லைகளுடன். உடன் பதிவு செய்யவும் டெஸ்க்டாப் கிளையன்ட் அல்லது பின்பற்றவும் உங்கள் முதல் தரவுத்தொகுப்பை பதிவு செய்யவும் மற்றும் நீங்கள் அதைப் பெறுவீர்கள்.
| முறை | தேவையான GPU நினைவகம் | எடுத்துக்காட்டு GPU |
|---|---|---|
| இன்ஃபரன்ஸ் | more than 8 GB | RTX 4090 |
| ஃபைன்-ட்யூனிங், LoRA | more than 22.5 GB | RTX 4090 |
| ஃபைன்-ட்யூனிங், முழு | more than 70 GB | A100 80 GB or H100 |
Pi0.5 மற்றும் SmolVLA-க்கு LeRobot v3.0 தேவை. GR00T N1.7 மற்றும் GR00T N1.5-க்கு v2.0 அல்லது v2.1 தேவை, மேலும் அவை v3.0 தரவுத்தொகுப்பில் செயலிழக்கும். ஒரு பதிவு அமர்வு மாற்றமின்றி இரண்டிற்கும் தரவை வழங்க முடியாது, மேலும் பிழை "தவறான தரவுத்தொகுப்பு பதிப்பு" என்று கூறாது. தரவுத்தொகுப்பு நிராகரிக்கப்பட்டது: v3 தேவை என்பதைப் பார்க்கவும்.
# v2.1 -> v3.0, run against a dataset already on the Hub
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=<HF_USER/DATASET_ID>
# aggregates episode-0000.parquet, episode-0001.parquet, ... -> file-0000.parquet
# aggregates episode-0000.mp4, episode-0001.mp4, ... -> file-0000.mp4
# rewrites meta/episodes/* with per-episode lengths, tasks and offsetsPi0.5-க்கு குறைந்தபட்சம் 50 எபிசோடுகள் தேவை என்று தளம் விரும்புகிறது, இது GR00T மற்றும் ACT-க்கு சமமானதாகும். முன்-பயிற்சி முக்கிய வேலையைச் செய்கிறது, எனவே 50 சுத்தமான எபிசோடுகள் 200 ஒழுங்கற்ற எபிசோடுகளை விட சிறந்தவை. இதற்குப் புதியவரா? இதனுடன் தொடங்கவும் தரவு சேகரிப்பு வழிகாட்டி

வழி A: openpi களஞ்சியத்துடன் நுண்-சரிசெய்தல் (fine-tune)
குறிப்புச் செயலாக்கம்: முதலில் JAX, Ubuntu 22.04 இல் மட்டுமே சோதிக்கப்பட்டது, கொடிகளை (flags) விட உள்ளமைவுப் பொருள்கள் (config objects) மூலம் இயக்கப்படுகிறது. PyTorch பாதை செப்டம்பர் 2025 இல் வந்தது, LIBERO இல் சரிபார்க்கப்பட்டது. மூன்று படிகள்: உங்கள் தரவை மாற்றுதல், உள்ளமைவை வரையறுத்தல், பயிற்சி செய்தல் மற்றும் சேவை செய்தல்.
- 1குளோன் செய்து நிறுவுதல்
openpi ஆனது uv ஐப் பயன்படுத்துகிறது. GIT_LFS_SKIP_SMUDGE என்பது LeRobot ஐ LFS ப்ளாப்கள் இல்லாமல் ஒரு சார்புநிலையாக வர அனுமதிக்கும்.
bashgit clone --recurse-submodules git@github.com:Physical-Intelligence/openpi.git cd openpi GIT_LFS_SKIP_SMUDGE=1 uv sync GIT_LFS_SKIP_SMUDGE=1 uv pip install -e . - 2உங்கள் தரவை ஒரு LeRobot தரவுத்தொகுப்பாக மாற்றுதல்
அப்ஸ்ட்ரீம் LIBERO மற்றும் DROID க்கான மாற்றிகளை (converters) வழங்குகிறது, மேலும் நீங்கள் ஒன்றை மாற்றியமைக்க வேண்டும் என்று எதிர்பார்க்கிறது. முக்கிய வேலை, விசை மேப்பிங் ஆகும்.
bashuv run examples/libero/convert_libero_data_to_lerobot.py --data_dir /path/to/your/data - 3ஒரு பயிற்சி உள்ளமைவைச் சேர்த்தல்
உள்ளமைவுகள் (Configs) src/openpi/training/config.py இல் உள்ள TrainConfig உள்ளீடுகள் ஆகும். இது pi05_droid_finetune ஐ மாற்றியமைக்கிறது, எடை ஏற்றும் கருவி (weight loader) pi05_base ஐ நோக்கி சுட்டிக்காட்டப்பட்டுள்ளது.
pythonTrainConfig( name="pi05_so100", model=pi0_config.Pi0Config( pi05=True, action_dim=32, # pi05 is trained with 32-dim actions action_horizon=16, ), # Copy LeRobotLiberoDataConfig in the same file and rewrite the key # mapping for your camera names, then reference your copy here. data=LeRobotLiberoDataConfig( repo_id="your_hf_username/my_so100_dataset", base_config=DataConfig(prompt_from_task=True), ), weight_loader=weight_loaders.CheckpointWeightLoader( "gs://openpi-assets/checkpoints/pi05_base/params" ), batch_size=32, num_train_steps=20_000, ) - 4சாதாரண புள்ளிவிவரங்களைக் கணக்கிடுதல்
தரவுத்தொகுப்பிற்கு எதிராக அல்லாமல், உள்ளமைவுப் பெயருக்கு எதிராக இயங்குகிறது. இதைத் தவிர்ப்பது இங்கு ஏற்படும் பொதுவான முதல் தோல்வியாகும்.
bashuv run scripts/compute_norm_stats.py --config-name pi05_so100 - 5பயிற்சி செய்தல்
இந்த மாறி JAX ஆனது இயல்புநிலை 75 சதவீதத்திற்குப் பதிலாக 90 சதவீத GPU நினைவகத்தைப் பயன்படுத்த அனுமதிக்கிறது. 80 GB கார்டில், இது இயக்கம் நீடிக்குமா என்பதைத் தீர்மானிக்கிறது.
bashXLA_PYTHON_CLIENT_MEM_FRACTION=0.9 uv run scripts/train.py pi05_so100 \ --exp-name=my_experiment \ --overwrite - 6சேவை செய்தல்
சேவையகம் போர்ட் 8000 இல் கேட்டு, கண்காணிப்பு வினவல்களுக்குப் பதிலளிக்கிறது; உங்கள் ரோபோ ரன்டைம் கிளையன்ட் ஆகும்.
bashuv run scripts/serve_policy.py policy:checkpoint \ --policy.config=pi05_so100 \ --policy.dir=checkpoints/pi05_so100/my_experiment/20000
openpi இன் PyTorch செயலாக்கம் pi0-FAST, கலப்பு துல்லியம் (mixed precision), FSDP, LoRA அல்லது EMA எடைகளை ஆதரிக்கவில்லை, எனவே 22.5 GB ஐ அடையும் LoRA ஆனது JAX இல் மட்டுமே உள்ளது, gemma_2b_lora மற்றும் gemma_300m_lora வகைகளின் மூலம். மோசமானது: இந்த அமைப்பு உங்கள் நிறுவப்பட்ட transformers 4.53.2 மீது திருத்தப்பட்ட கோப்புகளை நகலெடுக்கிறது, மேலும் README எச்சரிக்கிறது, uv இன் இயல்புநிலை ஹார்ட்லிங்க் பயன்முறையுடன் இது uv கேச் இல் உள்ள transformers ஐ நிரந்தரமாக மாற்றியமைக்கிறது மற்றும் பிற திட்டங்களில் கசியக்கூடும். இதை ரத்து செய்ய uv cache clean transformers ஐப் பயன்படுத்தவும்.
வழி B: lerobot pi05 உடன் ஃபைன்-ட்யூன் செய்யவும்
LeRobot போர்ட் நீங்கள் ஏற்கனவே பயன்படுத்தும் CLI இல் அதே எடைகளை உள்ளடக்கியது ACT மற்றும் SmolVLA. கீழே உள்ள அனைத்தும் lerobot 0.6.1 (ஆகஸ்ட் 3, 2026 முதல் வெளியான பதிப்பு) மற்றும் ஆகஸ்ட் 23, 2026 அன்று வெளியான pi05 ஆவணங்களுக்கு எதிராக சரிபார்க்கப்பட்டது. பதிப்புகள் இங்கு முக்கியம்: v3.0 தரவுத்தொகுப்புகள் அக்டோபர் 2025 இல் 0.4.0 உடன் வந்தன, மார்ச் 9, 2026 இன் 0.5.0 வலைப்பதிவு pi0-FAST மற்றும் Real-Time Chunking ஐ வழங்குகிறது, மேலும் ஜூலை 6, 2026 இல் 0.6.0 அடிப்படை தொகுப்பை இலகுவாக்கி, வரிசைப்படுத்தலை lerobot-rollout க்கு மாற்றியது.
ஒரு விஷயம் மாறவில்லை: lerobot-train மற்றும் lerobot-record ஏற்கனவே 0.3.2, ஆகஸ்ட் 2025 இல் நுழைவுப் புள்ளிகளாக இருந்தன. python -m lerobot.scripts.train என்று இன்னும் அழைக்கும் ஒரு பயிற்சி, ஒரு வருட மாற்றங்களுக்கு முந்தையது மற்றும் மற்றவற்றிலும் நம்பத்தகாதது.
- 1சரியான கூடுதல் அம்சங்களுடன் நிறுவவும்
0.6.0 முதல், அடிப்படை நிறுவல் முக்கிய ML சார்புகளை மட்டுமே கொண்டுள்ளது, மேலும் pi கூடுதல் எந்த தரவுத்தொகுப்பு அல்லது பயிற்சி குறியீட்டையும் சேர்க்கவில்லை, எனவே ஒரு ஃபைன்-ட்யூன் பயிற்சி கூடுதல் தேவைப்படுகிறது. பழைய ஒரு-வரி கட்டளைகள் இறக்குமதி நேரத்தில் இங்கே தோல்வியடைகின்றன.
bash# policy dependencies plus the training stack pip install 'lerobot[pi,training]' # from a source checkout pip install -e ".[pi,training]" # driving an SO-100 afterwards needs the robot extras too pip install 'lerobot[core_scripts,feetech]' - 2அங்கீகரிக்கவும்
ஒரு உலாவியில் paligemma-3b-pt-224 உரிமத்தை ஏற்றுக்கொண்டு, பின்னர் பயிற்சி அளிக்கும் கணினியில் உள்நுழையவும்.
bashhf auth login - 3குவாண்டில் புள்ளிவிவரங்களைச் சேர்க்கவும்
Pi0.5 ஆனது STATE மற்றும் ACTION ஐ குவாண்டில்களுடன் இயல்பாக்குகிறது, எனவே meta/stats.json க்கு q01 மற்றும் q99 தேவை. பழைய தரவுத்தொகுப்புகள் min, max, mean, std ஆகியவற்றை மட்டுமே கொண்டுள்ளன.
bashlerobot-edit-dataset \ --repo_id your_dataset \ --new_repo_id your_dataset \ --operation.type recompute_stats \ --operation.overwrite true - 4lerobot/pi05_base இலிருந்து ஃபைன்-ட்யூன் செய்யவும்
உங்கள் கார்டு தாங்கும் அளவுக்கு பேட்ச் அளவை அமைக்கவும்; ஆவணங்கள் LIBERO இல் 80 GB இல் 64 ஐப் பயன்படுத்துகின்றன. bfloat16 ஐ வெளிப்படையாக அனுப்பவும், உள்ளமைவு இயல்புநிலை float32 ஆகும்.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/my_so100_dataset \ --policy.type=pi05 \ --policy.pretrained_path=lerobot/pi05_base \ --policy.gradient_checkpointing=true \ --policy.dtype=bfloat16 \ --policy.device=cuda \ --policy.push_to_hub=false \ --output_dir=./outputs/pi05_so100 \ --job_name=pi05_so100 \ --batch_size=4 \ --num_workers=8 \ --steps=30000 \ --save_freq=5000 \ --seed=1000 - 5கையில் இயக்கவும்
0.6.x இல் இது lerobot-rollout: lerobot-record ஒரு கொள்கையை மறுக்கிறது மற்றும் eval_ தரவுத்தொகுப்பு பெயர்களை நிராகரிக்கிறது. Base ஆனது கையை இயக்குகிறது, sentry ஆனது ரோல்அவுட்டைப் பதிவு செய்கிறது.
bashlerobot-rollout \ --strategy.type=base \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \ --task="Put lego brick into the transparent box" \ --duration=60 # same run, recorded into an eval_ dataset lerobot-rollout \ --strategy.type=sentry \ --policy.path=${HF_USER}/my_policy \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --dataset.repo_id=${HF_USER}/eval_so100 \ --dataset.single_task="Put lego brick into the transparent box" \ --duration=600
| கொடி | அது என்ன செய்கிறது | குறிப்பு |
|---|---|---|
| --policy.type=pi05 | Pi0.5 ஐத் தேர்ந்தெடுக்கிறது | pretrained_path உடன் தேவை, --policy.path உடன் தவிர்க்கவும் |
| --policy.pretrained_path | எடைகளை மட்டுமே ஏற்றுகிறது | உங்கள் தரவுத்தொகுப்பிலிருந்து அம்சப் பெயர்கள், சேமிக்கப்பட்ட அமைப்புகள் மீட்டமைக்கப்படும் |
| --policy.path | எடைகள் மற்றும் செக்பாயிண்ட் config.json | n_action_steps போன்ற சேமிக்கப்பட்ட அமைப்புகள் பெறப்படும் |
| --policy.n_action_steps | ஒரு துண்டிற்கு நுகரப்படும் படிகள் | 50 க்கு திரும்பும், chunk_size (இயல்புநிலை 50) க்கு மேல் ஒருபோதும் இருக்காது |
| --policy.train_expert_only | VLM ஐ முடக்குகிறது, நிபுணருக்கு பயிற்சி அளிக்கிறது | இயல்புநிலை தவறு, குறைந்த நினைவகம், வெற்றியில் சில செலவு |
| --policy.gradient_checkpointing | செயல்பாடுகளை சேமிப்பதற்கு பதிலாக மீண்டும் கணக்கிடுங்கள் | இயல்புநிலை தவறு, ஒரு ரன் பொருந்தாதபோது முதல் நெம்புகோல் |
| --peft.method_type=LORA | முழு எடைகளுக்கு பதிலாக LoRA அடாப்டர்கள் | peft கூடுதல் தேவை, ஆவணப்படுத்தப்பட்ட எடுத்துக்காட்டு SmolVLA |
| --policy.rtc_training_max_delay | RTC க்கான செயல்-முன்னொட்டு நிலைப்படுத்தல் | முக்கிய கிளை மட்டுமே, 0.6.1 இல் இல்லை, chunk_size க்கு கீழே இருக்க வேண்டும் |
| --rename_map | தரவுத்தொகுப்பு நெடுவரிசைகளை கொள்கை அம்சங்களுக்கு வரைபடமாக்குகிறது | உங்கள் கேமரா விசைகள் வேறுபடும்போது தேவை |
குவாண்டில்கள் இல்லாமல், முதல் பேட்சில் ValueError: QUANTILES normalization mode requires q01 and q99 stats என்ற பிழையைப் பெறுவீர்கள். புள்ளிவிவரங்களை மீண்டும் கணக்கிடுங்கள், ஆனால் முடிவு $HF_LEROBOT_HOME/your_dataset இல் இறங்குகிறது, --dataset.repo_id படிக்கும் கேச் இல் அல்ல, எனவே --dataset.root ஐ அங்கு சுட்டிக்காட்டி பயிற்சி அளிக்கவும் அல்லது ஹப்பிற்கு தள்ளவும். அல்லது LIBERO குறிப்பு கட்டளை செய்வது போல, --policy.normalization_mapping='{"ACTION": "MEAN_STD", "STATE": "MEAN_STD", "VISUAL": "IDENTITY"}' உடன் குவாண்டில்களைத் தவிர்க்கவும்.
மூன்று இயல்புநிலை தொகுப்புகள், மற்றும் பயிற்சியாளரை அடையும் தொகுப்புகள்
openpi's TrainConfig என்பது குறிப்பு, LeRobot's PI05Config என்பது lerobot-train நீங்கள் எதுவும் சொல்லாதபோது பயன்படுத்துவது, மேலும் இங்குள்ள படிவம் ஒரு மூன்றாவது தொகுப்பை அனுப்புகிறது. ஆச்சரியம் என்னவென்றால் கற்றல் விகிதம்: இரண்டு அப்ஸ்ட்ரீம் இயல்புநிலைகளும் 2.5e-5 இல் உச்சத்தை அடைகின்றன, அதேசமயம் openpi இன் pi05_libero உள்ளமைவு மற்றும் இந்த தளம் அதை 5e-5 ஆக உயர்த்துகின்றன.
| அமைப்பு | openpi TrainConfig | lerobot pi05 மற்றும் lerobot-train | AY-Robots அனுப்புகிறது |
|---|---|---|---|
| தொகுப்பு அளவு | 32 | 8 | 1 |
| உச்ச கற்றல் விகிதம் | 2.5e-5, கோசைன் சிதைவு | optimizer_lr 2.5e-5 | 5e-5 |
| பயிற்சி படிகள் | 30,000 | 100,000 | 30,000 |
| சரிபார்ப்பு இடைவெளி | 1,000 படிகள் | 20,000 படிகள் | படிவத்தில் இல்லை |
| சீட் | 42 | 1,000 | படிவத்தில் உள்ளது |
| செயல் துண்டு | action_horizon 50 | chunk_size 50, n_action_steps 50 | படிவத்தில் இல்லை |
| எடை dtype | bfloat16 | float32 நீங்கள் --policy.dtype அனுப்பும் வரை | படிவத்தில் இல்லை |
| கிரேடியன்ட் குவிப்பு | அப்படி ஒரு கட்டுப்பாடு இல்லை, அதற்கு பதிலாக fsdp_devices | இதுவரை எந்த வெளியீட்டிலும் இல்லை | 16, மேலும் அது கைவிடப்படுகிறது |
இந்த போர்ட் நம்பகமானதா? LeRobot குழு LIBERO அடிப்படை மாதிரியை மேலும் 6k படிகளுக்கு ஃபைன்-ட்யூன் செய்து, openpi இன் குறிப்பு எண்களுடன் நான்கு தொகுப்புகளில் ஒப்பிட்டது: 97.5 சதவீதம் சராசரி எதிராக 96.85, Libero 10 இல் முன்னணியில், Spatial இல் பின்தங்கியுள்ளது. இந்த வழி ஒரு கருவி தேர்வு, தரமான தேர்வு அல்ல.
- இதன் பின்னால் 10,000 மணிநேரத்திற்கும் மேலான ரோபோ முன்-பயிற்சி உள்ளது, எனவே உங்கள் பணியின் 50 எபிசோடுகள் போதுமானதாக இருக்கும்.
- தொடர்ச்சியான செயல்கள்: ட்யூன் செய்ய டோக்கனைசர் இல்லை, உங்கள் மூட்டு கோணங்களில் தனித்தன்மை வரம்பு இல்லை.
- LeRobot போர்ட் LIBERO சராசரியில் 97.5 சதவீதம் மதிப்பெண் பெறுகிறது, openpi இன் 96.85 க்கு எதிராக, எனவே நட்புரீதியான CLI அளவிடக்கூடிய செலவு எதையும் ஏற்படுத்தாது.
- இருபுறமும் அளவுரு-திறமையான வழிகள்: openpi இன் JAX LoRA வகைகள், LeRobot இன் PEFT ஒருங்கிணைப்பு.
- முழு ஃபைன்-ட்யூனிங்கிற்கு 70 GB க்கும் அதிகமாக தேவைப்படுகிறது. 22.5 GB LoRA எண்ணிக்கை openpi இன் JAX எண்; PEFT இன் கீழ் pi05 க்கு எதுவும் வெளியிடப்படவில்லை.
- ஒரு செயல் படிக்கு 485 ms, இங்குள்ள ஐந்தில் மிக மெதுவானது: SmolVLA ஐ விட இரு மடங்கு, ACT ஐ விட இருபத்தி நான்கு மடங்கு.
- LeRobot v3.0 தேவைப்படுகிறது, எனவே ஒரு GR00T இயக்கத்திற்காக பதிவுசெய்யப்பட்ட தரவுத்தொகுப்பை மாற்ற வேண்டும், மற்றும் நேர்மாறாகவும்.
- புதிய விருப்பங்கள் முதலில் மெயினில் வருகின்றன: பயிற்சி நேர RTC மற்றும் MEM நினைவகம் 0.6.1 இல் இல்லை, எனவே புதிய ஆவணங்கள் git இலிருந்து நிறுவுவதைக் குறிக்கலாம்.
485 மில்லி விநாடி யதார்த்தம், மற்றும் அது எங்கு பயன்படுத்த முடியாததாகிறது
இது உங்கள் திட்டத்தை தீர்மானிக்கிறது, எனவே இது செலவு அட்டவணைக்கு முன் வருகிறது. ஒரு செயல் படிக்கு Pi0.5 க்கு இங்கு அளவிடப்பட்டது 485 மில்லி விநாடிகள் ஆகும். மற்ற நான்கு மாடல்களுடன் ஒப்பிடுகையில்:
| Policy | Inference per action step | Params | GPU tier | Minimum episodes |
|---|---|---|---|---|
| ACT | 20 ms | ~80 M | RTX 4090 or any 24 GB card | 50 |
| GR00T N1.7 | 152 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| GR00T N1.5 | 165 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |
| SmolVLA | 245 ms | ~450 M | RTX 4090 or any 24 GB card | 30 |
| Pi0.5 | 485 ms | ~3 B | A100 80 GB or H100 80 GB | 50 |

இந்த ஐந்து மாடல்களிலும் உள்ள கட்டுப்பாட்டு சுழற்சி ஒரு செயல் படிக்கு 20 முதல் 485 மில்லி விநாடிகள் வரை இயங்குகிறது. 485 மில்லி விநாடிகளுக்கு மேல் பொது இணைய ரவுண்ட் டிரிப்கள் ஒரு செயல்படும் கொள்கையை தயக்கமானதாக மாற்றும். மெதுவான பிக்-அண்ட்-பிளேஸ் செயல்பாடுகளுக்கு ரிமோட் இன்ஃபரன்ஸ் சாத்தியமானது, ஆனால் வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல. LAN இல் மட்டுமே செயல்படும் ஒரு டெமோவை விற்பதை விட இதைச் சொல்வதே நல்லது. உங்கள் கை துண்டுகளுக்கு இடையில் இடைநிறுத்தப்பட்டால், கொள்கை இயக்கத்தின் நடுவில் உறைந்து போகிறது என்பதில் இருந்து தொடங்கவும்.
அப்ஸ்ட்ரீமில் ஒரு தீர்வு உள்ளது, அதில் பாதி நீங்கள் நிறுவக்கூடிய வெளியீட்டில் ஏற்கனவே உள்ளது. ரியல்-டைம் சங்கிங் (Real-Time Chunking) அடுத்த துண்டினை, கை தற்போதைய துண்டினை செயல்படுத்திக் கொண்டிருக்கும்போதே உருவாக்குகிறது, பின்னர் புதிய துண்டின் ஒன்றுடன் ஒன்று சேரும் படிகளை ஏற்கனவே செயல்படுத்தப்பட்ட பகுதிக்கு அருகில் இருக்குமாறு வழிநடத்துகிறது, இதனால் கை இணைப்பில் நின்றுவிடவோ அல்லது அதிர்ச்சியடையவோ செய்யாது. Pi0, Pi0.5 மற்றும் SmolVLA க்கான 0.4.2 சேஞ்ச்லாக்கில் அனுப்பப்பட்ட இன்ஃபரன்ஸ்-டைம் வடிவம் ஒரு ரோல்அவுட் ஃபிளாக் ஆகும், மீண்டும் பயிற்சி அளிப்பது அல்ல:
lerobot-rollout \
--strategy.type=base \
--policy.path=${HF_USER}/my_policy \
--inference.type=rtc \
--inference.rtc.execution_horizon=10 \
--inference.rtc.max_guidance_weight=10.0 \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM1 \
--robot.cameras="{ up: {type: opencv, index_or_path: /dev/video10, width: 640, height: 480, fps: 30}}" \
--task="Put lego brick into the transparent box" \
--duration=60இது மாடலை வேகமாக ஆக்காது. இது இடைவெளியை மறைக்கிறது: 485 மில்லி விநாடிகள் இன்னும் செலவிடப்படுகின்றன, ஆனால் முக்கியமான பாதையில் இருந்து விலகி, இதனால் துண்டுகளுக்கு இடையில் வரிசை வறண்டு போகாது. arXiv 2512.05964 இலிருந்து பயிற்சி-நேர மாறுபாடு மேலும் செல்கிறது: மாடல் ஒரு சுத்தமான செயல் முன்னொட்டை (action prefix) நிபந்தனைக்குட்படுத்த கற்றுக்கொள்கிறது, எனவே இன்ஃபரன்ஸில் ஒன்றுடன் ஒன்று சேரும் பகுதி வழிகாட்டப்படுவதற்குப் பதிலாக, ஒரு-செயல்-ஓட்ட நேரப்படிகளுடன் (per-action flow timesteps) கடினமாக வரையப்படுகிறது, மேலும் வழிகாட்டுதல் பின்னோக்கிய பாஸ் மறைந்துவிடுகிறது. பயிற்சியின் போது, இது ஒரு எடுத்துக்காட்டுக்கு ஒரு முன்னொட்டு நீளத்தை மாதிரியாக எடுத்து, மீதமுள்ள பின்னொட்டில் (postfix) ஓட்ட இழப்பை (flow loss) எடுக்கிறது. அந்த ஃபிளாக் மெயினில் மட்டுமே உள்ளது, 0.6.1 இல் இல்லை, மேலும் நீங்கள் பயிற்சி அளிக்கும் தாமதம் chunk_size க்கு கீழே இருக்க வேண்டும்.
Pi0.5 செக்பாயிண்ட்டைப் பெறுவதற்கான இரண்டு வழிகள்
நீங்கள் ஒரு 80 GB கார்டை வாடகைக்கு எடுக்கலாம் அல்லது சொந்தமாக வைத்திருக்கலாம், மேலே உள்ள ஸ்டேக்குகளில் ஒன்றை நிறுவலாம், உங்கள் தரவுத்தொகுப்பை மாற்றலாம் மற்றும் ரன்-ஐ கண்காணிக்கலாம். openpi's JAX LoRA, LeRobot's PEFT அடாப்டர்கள், ரிலேட்டிவ் ஆக்சன்ஸ், கஸ்டம் கீ மேப்பிங்ஸ் போன்ற ஒவ்வொரு கட்டுப்பாட்டையும் நீங்கள் வைத்திருக்கலாம். ஒவ்வொரு தோல்வியையும் நீங்கள் தான் எதிர்கொள்ள வேண்டும்.
- வன்பொருள்: A100 80 GB அல்லது H100, அல்லது openpi's JAX LoRA பாதையில் ஒரு 24 GB கார்டு.
- அமைப்பு: முதல் ரன்னுக்கு ஒரு மதியம், பெரும்பாலும் கீ மேப்பிங் மற்றும் கேடட் டோக்கனைசர்.
- ஹோஸ்ட் செய்யப்பட்ட படிவத்தில் இல்லை: PEFT அடாப்டர்கள், ரிலேட்டிவ் ஆக்சன்ஸ், பயிற்சி நேர RTC, MEM மெமரி.
lerobot-train \
--dataset.repo_id=${HF_USER}/my_so100_dataset \
--policy.type=pi05 \
--policy.pretrained_path=lerobot/pi05_base \
--policy.rtc_training_max_delay=10 \
--policy.gradient_checkpointing=true \
--policy.dtype=bfloat16 \
--batch_size=4 --steps=30000 --seed=1000நீங்கள் மாடல் மற்றும் தரவுத்தொகுப்பை பயிற்சி படிவத்தில் தேர்வு செய்கிறீர்கள், பின்தளம் தேவையான VRAM-க்கு ஏற்ப ஒரு ஸ்பாட் மார்க்கெட்டில் ஒரு GPU-ஐ வாடகைக்கு எடுத்து, பயிற்சியாளரை இயக்கி, செக்பாயிண்ட்களை ஆப்ஜெக்ட் ஸ்டோரேஜில் எழுதுகிறது. Pi0.5 இங்கு கிளவுட்-மட்டுமே. SO-100, SO-101, Koch v1.1 மற்றும் LeKiwi க்கான வழிகாட்டிகள் உள்ளன.
| அமைப்பு | Pi0.5 க்காக தளம் அனுப்புவது |
|---|---|
| அடிப்படை செக்பாயிண்ட் | lerobot/pi05_base |
| கொள்கை வகை | pi05 |
| பேட்ச் அளவு | 1 |
| கற்றல் விகிதம் | 5e-5 |
| அதிகபட்ச படிகள் | 30000 |
| கிரேடியன்ட் குவிப்பு | 16, ஆனால் கீழே உள்ள எச்சரிக்கையைப் பார்க்கவும் |
| படிவத்தில் உள்ள கூடுதல் கட்டுப்பாடுகள் | seed, logFreq |
| தரவுத்தொகுப்பு வடிவம் | LeRobot v3.0 |
| GPU அடுக்கு | A100 80 GB அல்லது H100 80 GB |
பயிற்சியாளர் 16 என்ற கிரேடியன்ட் குவிப்பு மதிப்பை அனுப்புகிறார், மேலும் lerobot 0.5.1 அதைப் பெறுவதற்கு எந்த ஃபிளாக்கும் இல்லை, எனவே அது கைவிடப்படுகிறது. வெளியிடப்பட்ட lerobot-ல் எதுவும் இல்லை: இந்த கட்டுப்பாடு --accelerator.gradient_accumulation.steps ஆக மெயின்-ல் மட்டுமே உள்ளது. இங்கு பயனுள்ள பேட்ச் அளவு 1 ஆகும், openpi's pi05_libero config பயன்படுத்தும் 256-க்கு எதிராக. ஒரு லாஸ் கர்வ்-ஐ படிக்கும் முன் இதை அறிவது நல்லது. இந்த கட்டுப்பாடு GR00T N1.7 மற்றும் GR00T N1.5 ரன்களில் பொருந்தும்.
இன்ஃபரன்ஸ் அதே வழியில் செயல்படுகிறது: கொள்கையைச் சேவை செய்ய ஒரு பாட் வழங்கப்படுகிறது, மேலும் உங்கள் லோக்கல் கிளையன்ட் அதனுடன் பேசுகிறது. பாட் ஒரு ஐடில் வாட்ச்டாக்-ஐக் கொண்டுள்ளது மற்றும் தன்னைத்தானே அழித்துக் கொள்கிறது, எனவே மறக்கப்பட்ட ஒரு டேப் அமைதியாக பில் செய்யாது. லேட்டன்சி எச்சரிக்கை பொருந்தும், அதனால்தான் ACT 20 ms இல் ஒரு வேகமான பணியை பெரும்பாலும் வெல்கிறது.
அது வேலை செய்யாதபோது
| அறிகுறி | மிகவும் சாத்தியமான காரணம் |
|---|---|
| ரன் தொடங்குவதற்கு முன்பே நிராகரிக்கப்பட்டது | தரவுத்தொகுப்பு v2.1 ஆனால் Pi0.5 v3.0 ஐ விரும்புகிறது, அல்லது GR00T க்கு நேர்மாறாக |
| ImportError, டேட்டாசெட்ஸ் தொகுப்பு இல்லை | பயிற்சி கூடுதல் இல்லாமல் lerobot 0.6.x |
| பேட்ச் ஒன்றில் q01 மற்றும் q99 பற்றிய ValueError | meta/stats.json இல் குவாண்டில்ஸ் இல்லை; மீண்டும் கணக்கிடவும் அல்லது MEAN_STD ஐப் பயன்படுத்தவும் |
| படி 0 இல் CUDA நினைவகம் இல்லை | 70 GB க்கும் குறைவான முழு ஃபைன்-ட்யூன்; செக்பாயிண்டிங் அல்லது train_expert_only ஐ முயற்சிக்கவும் |
| 401 அல்லது கேடட் ரெப்போ பிழை | PaliGemma டோக்கனைசர் உரிமம் ஏற்கப்படவில்லை |
| லாஸ் குறைகிறது, ரோபோட் எதுவும் செய்யவில்லை | சாதாரணமயமாக்கல் பொருந்தாமை, அல்லது கொள்கை நிலையை நகலெடுக்கிறது |
| சங்குகளுக்கு இடையில் கை நிற்கிறது | ஒரு படிக்கு தாமதம் மற்றும் ரவுண்ட் ட்ரிப்; சன்க் வரிசை வறண்டு போகிறது |
| ஒரு அமைப்பில் வேலை செய்கிறது, மற்றொன்றில் தோல்வியடைகிறது | மிகக் குறைவான எபிசோடுகள், அல்லது அனைத்தும் ஒரே உள்ளமைவில் |
- தரவுத்தொகுப்பு நிராகரிக்கப்பட்டது: v3 தேவை
- பயிற்சியின் போது நினைவகம் பற்றாக்குறை
- இழப்பு குறைகிறது ஆனால் கொள்கை எதுவும் செய்யவில்லை
- கொள்கை நடுப்பாதையில் உறைந்துவிடுகிறது
- கொள்கை ஒரு அமைப்பில் மட்டுமே செயல்படுகிறது
- பயிற்சி பணி வரிசையில் சிக்கியுள்ளது
ஒரு ஓட்டத்தின் செலவு என்ன
Pi0.5 ஆனது விலையுயர்ந்த அடுக்கில் உள்ளது, ஏனெனில் அதற்கு 80 GB கார்டு தேவைப்படுகிறது, மேலும் ஸ்பாட் விலைகள் மாறுபடும், எனவே இந்த எண்ணிக்கை ஒரு விலையை விட ஒரு வரம்பாகும். பல SO-100 பணிகளுக்கு, முதலில் SmolVLA அல்லது ACT ஐ 24 GB அடுக்கில் முதலில் பயிற்சி செய்யுங்கள், பணி கற்றுக்கொள்ளக்கூடியதா என்பதை உறுதிப்படுத்தவும், பின்னர் A100 மணிநேரத்தை அதில் செலவிடவும். உங்கள் முதல் கொள்கையைப் பயிற்றுவிக்கவும் அந்த மலிவான சுழற்சியைக் காட்டுகிறது, மேலும் விலை நிர்ணயம் தற்போதைய அடுக்குகளைக் கொண்டுள்ளது.
| அடுக்கு | கொள்கைகள் | வழக்கமான ஓட்டம் | மணிநேர விலை | ஒரு ஓட்டத்தின் செலவு |
|---|---|---|---|---|
| A100 80 GB or H100 | Pi0.5, GR00T N1.7, GR00T N1.5 | 3 to 6 hours | 1.20 to 2.00 USD | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | 0.30 to 0.60 USD | about 1 to 3 USD |

ஒரு மாலை நேரத்தை அர்ப்பணிக்கும் முன்: GR00T N1.7 மற்றும் Pi0.5 மற்றும் Pi0.5 மற்றும் SmolVLA ஆகியவை ஒரே எண்களை நேருக்கு நேர் ஒப்பிடுகின்றன. Arena ஆனது 85 VLA மாதிரிகள் மற்றும் 332 பெஞ்ச்மார்க் முடிவுகளைக் கொண்டுள்ளது, ஒவ்வொன்றும் அதன் மூலத்துடன் இணைக்கப்பட்டுள்ளது, மேலும் இந்த குடும்பத்தைப் பற்றிய பின்னணி தகவல்கள் எங்கள் VLA கண்ணோட்டத்தில்.
ஸ்டேக்கை உருவாக்காமல் Pi0.5 ஐப் பயிற்றுவிக்கவும்
ஒரு படிவத்தில் தரவுத்தொகுப்பு மற்றும் ஹைப்பர்பாராமீட்டர்களைத் தேர்ந்தெடுக்கவும். பின்தளம் உடனடி சந்தையில் 80 GB கார்டை வாடகைக்கு எடுத்து, பயிற்சியாளரை இயக்கி, சரிபார்ப்புப் புள்ளிகளை பொருள் சேமிப்பகத்தில் எழுதுகிறது. SO-100, SO-101, Koch v1.1 மற்றும் LeKiwi க்கான வழிகாட்டிகள்.
பயிற்சி வழிகாட்டிகளைத் திறக்கவும்RTX 4090 இல் Pi0.5 ஐ ஃபைன்-ட்யூன் செய்ய முடியுமா?▾
முழுமையான ஃபைன்-ட்யூன் அல்ல: openpi அதற்காக 70 GB க்கும் அதிகமாக பட்டியலிடுகிறது, எனவே ஒரு A100 80 GB அல்லது ஒரு H100 தேவை. அதன் 22.5 GB LoRA எண்ணிக்கை JAX பாதைக்கு சொந்தமானது; PyTorch செயலாக்கத்தில் LoRA இல்லை. LeRobot இன் PEFT ஒருங்கிணைப்பு உள்ளது, ஆனால் அதன் ஆவணப்படுத்தப்பட்ட எடுத்துக்காட்டு SmolVLA ஆகும், மேலும் pi05 க்கான VRAM எண்ணிக்கை எதுவும் வெளியிடப்படவில்லை.
எனக்கு எத்தனை எபிசோடுகள் தேவை?▾
ஐம்பது, GR00T மற்றும் ACT க்கு சமமான குறைந்தபட்சம்; SmolVLA மட்டுமே 30 ஆகக் குறைவாக உள்ளது. அடிப்படை சரிபார்ப்புப் புள்ளி 10,000 மணிநேரத்திற்கும் மேலான முன்-பயிற்சியைக் கொண்டுள்ளது, எனவே ஃபைன்-ட்யூன் புதிதாகக் கற்றுக்கொள்வதற்குப் பதிலாக மாற்றியமைக்கிறது: 50 சுத்தமான, மாறுபட்ட எபிசோடுகள் ஒரு உள்ளமைவில் இருந்து இருநூறு எபிசோடுகளை விட சிறந்தவை.
--policy.path மற்றும் --policy.pretrained_path இடையே உள்ள வேறுபாடு என்ன?▾
--policy.path எடைகள் மற்றும் சரிபார்ப்புப் புள்ளியின் config.json ஐ ஏற்றுகிறது, எனவே n_action_steps போன்ற சேமிக்கப்பட்ட அமைப்புகள் பெறப்படுகின்றன மற்றும் --policy.type தவிர்க்கப்பட வேண்டும். --policy.pretrained_path எடைகளை மட்டுமே ஏற்றுகிறது: அம்சப் பெயர்கள் உங்கள் தரவுத்தொகுப்பிலிருந்து வருகின்றன, சேமிக்கப்பட்ட அமைப்புகள் மீட்டமைக்கப்படுகின்றன, --policy.type தேவை. அதனால்தான் LIBERO கட்டளை n_action_steps=10 மற்றும் empty_cameras=1 ஐ வெளிப்படையாக அனுப்புகிறது; இல்லையெனில் அவை 50 மற்றும் 0 க்குத் திரும்பும்.
திறந்த பதிப்பு ஆய்வுக் கட்டுரையில் உள்ள முழு Pi0.5 ஐ எனக்கு வழங்குகிறதா?▾
இல்லை. இரண்டும் ஃப்ளோ மேட்சிங் ஆக்ஷன் ஹெட்டை மட்டுமே ஆதரிக்கின்றன. FAST ஆக்ஷன் டோக்கனைசர் மற்றும் உயர்-நிலை துணைப்பணி கணிப்புடன் கூடிய தனித்த-டோக்கன் முன்-பயிற்சி நிலை வெளியிடப்படவில்லை, மேலும் lerobot/pi05_base கார்டு அந்தப் பட்டியலில் RL ஐச் சேர்க்கிறது, இருப்பினும் pi0.5 ஆய்வுக் கட்டுரை எந்த வலுவூட்டல் கற்றல் நிலையையும் விவரிக்கவில்லை. நீங்கள் வழங்கும் மொழிச் சரத்தின் அடிப்படையில் ஒரு குறைந்த-நிலை கொள்கையைப் பயிற்றுவிக்கிறீர்கள், ஒரு நீண்ட பணியை தானே பிரிக்கும் மாதிரியை அல்ல.
இந்த வழிகாட்டி எந்தப் பதிப்புகளுக்கு எதிராக எழுதப்பட்டுள்ளது?▾
முக்கியமான openpi மற்றும் lerobot 0.6.1, 2026 ஆகஸ்ட் 3 முதல் வெளியிடப்பட்டது, இரண்டும் 2026 ஆகஸ்ட் 23 அன்று படிக்கப்பட்டன. v3.0 தரவுத்தொகுப்புகள் 2025 அக்டோபரில் 0.4.0 உடன் வந்தன. 0.6.0 அடிப்படை தொகுப்பை இலகுவாக்கியது, எனவே lerobot[pi] மட்டும் இனி ஒரு பயிற்சி ஸ்டேக்கை நிறுவவில்லை, மேலும் வரிசைப்படுத்தலை lerobot-rollout க்கு மாற்றியது. பயிற்சி நேர RTC முக்கியமானது மட்டுமே; இங்கு ஹோஸ்ட் செய்யப்பட்ட பயிற்சியாளர் 0.5.1 ஐ இயக்குகிறார்.
Sources
- Physical-Intelligence/openpi: open-source models and packages for robotics
- openpi training configs, including pi05_libero and pi05_droid_finetune
- pi0: A Vision-Language-Action Flow Model for General Robot Control
- pi0.5: a Vision-Language-Action Model with Open-World Generalization
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- PaliGemma: A versatile 3B VLM for transfer
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- LeRobot pi05 documentation on the main branch, including training-time RTC
- LeRobot documentation: parameter efficient fine-tuning with PEFT
- LeRobotDataset v3.0 format documentation
- LeRobot release notes: v0.3.2 through v0.6.1, with the v0.6.0 breaking changes
- LeRobot v0.5.0: Scaling Every Dimension
- lerobot/pi05_base model card
- LeRobot documentation: Real-Time Chunking (RTC)
- openpi Pi0Config: the model defaults pi0 and pi05 inherit
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started