
GR00T N1.7, Pi0.5, SmolVLA, ACT அல்லது GR00T N1.5? உண்மையான சூழ்நிலைகளுக்குப் பொருத்தப்பட்ட ஒரு முடிவெடுக்கும் அட்டவணை, வெளியிடப்பட்ட பெஞ்ச்மார்க் எண்கள், தாமதம், ஒரு ரன் செலவு மற்றும் ஒவ்வொரு தேர்வுக்கும் பின்னால் உள்ள உரிமங்களுடன்.
இன்று ஒரு SO-100 வகுப்பு கையில் ஐந்து கொள்கைகள் பயிற்சி செய்யக்கூடியவை. அவை அனுமானத்தில் 24 காரணி வேறுபடுகின்றன செயல்திறன் தாமதம், 37 அளவுரு எண்ணிக்கை மற்றும் ஒரு ரன் செலவில் 12, மற்றும் நீங்கள் முடிவை அனுப்பலாமா என்பதில் வேறுபடுகின்றன. ஐந்து மாதிரி அட்டைகள் இதை தீர்க்காது: உங்களிடம் உள்ள கேள்விக்கு எதுவும் பதிலளிக்கவில்லை, நான் முதலில் எதை இயக்க வேண்டும்?
கீழே உள்ள ஒவ்வொரு எண்ணும் ஆகஸ்ட் 2026 இல் உள்ள ஆவணங்கள், களஞ்சியங்கள் மற்றும் அட்டைகளில் இருந்து எடுக்கப்பட்டது. தள எண்கள் வருகின்றன இவற்றிலிருந்து AY-Robots கொள்கை பட்டியல்; இரண்டும் வேறுபடும் இடங்களில், இரண்டும் காட்டப்பட்டுள்ளன.
சுருக்கமான பதிப்பு
- •உங்கள் தரவுத்தொகுப்பில் சந்தேகம் இருந்தால் ACT ஐ முதலில் பயிற்சி செய்யுங்கள்: ஒரு ரன்னுக்கு 1 முதல் 3 USD, மோசமான தரவை மறைக்க முன் பயிற்சி பெற்ற எதுவும் இல்லை.
- •GR00T N1.7 மற்றும் Pi0.5 ஆகியவை LIBERO இல் அரை புள்ளிக்குள் உள்ளன, 97.0 எதிராக 96.85 முதல் 97.5 வரை. இது எதையும் தேர்வு செய்ய ஒரு காரணம் அல்ல.
- •Pi0.5 என்பது பொதுமைப்படுத்தலுக்கானது, துல்லியத்திற்கானதல்ல, மேலும் 485 ms இல் மிக மெதுவானது.
- •SmolVLA, 450 M அளவுருக்களுடன், இங்குள்ள ஒரே VLA ஆகும், இது ஒரு 24 GB கார்டில் நன்றாக சரிசெய்யப்படுகிறது.
- •20 ms இல் ACT என்பது வேகமான எதிர்வினை இயக்கத்திற்கான ஒரே விருப்பம். உரிமங்கள் மற்றவற்றை தீர்மானிக்கின்றன.
முடிவு அட்டவணை
| உங்கள் நிலைமை | இதற்குப் பயிற்சி அளிக்கவும் | ஏன் |
|---|---|---|
| தரவுத்தொகுப்பின் தரம் நிரூபிக்கப்படவில்லை | ACT | முன்பயிற்சி செய்யப்பட்ட எதுவும் பழுதடைந்த தரவுத்தொகுப்பை மறைக்காது, மேலும் தோல்வியுற்றால் 1 முதல் 3 USD செலவாகும். |
| தொடர்பு-செறிவுள்ள, பல-படிநிலை, மொழி-நிபந்தனைக்குட்பட்ட | GR00T N1.7 | நான்கு LIBERO தொகுப்புகளில் 97.0%, மேலும் ஒரு சார்பு இறுதி-செயல்பாட்டு இடவெளி. |
| வேகமான எதிர்வினை இயக்கம், சர்வோக்களில் ஊகித்தல் | ACT | 20 மில்லி விநாடிகள். அடுத்த வேகமானது 7.6 மடங்கு மெதுவாகும். |
| புதிய பொருள்கள், புதிய காட்சி, திறந்த உலகம் | Pi0.5 | விநியோகத்திற்கு அப்பாற்பட்ட நடத்தைக்காக உருவாக்கப்பட்டது, 104 இடங்கள் வரை. |
| ஒரு 24 GB அட்டை, இன்னும் மொழி தேவை | SmolVLA | 450 மில்லியன் அளவுருக்கள், 30 அத்தியாயங்கள் குறைந்தபட்சம், உள்ளூரில் இயங்குகிறது. |
| 2025 இல் பதிவு செய்யப்பட்ட ஒரு இயக்கத்தை மீண்டும் உருவாக்குதல் | GR00T N1.5 | நீங்கள் கட்டாயம் செய்தால் மட்டுமே: LeRobot இப்போது அதை நிராகரிக்கிறது, எடைகள் வணிகரீதியற்றவை. |
| இது ஒரு தயாரிப்பாக அனுப்பப்படும் | N1.7, SmolVLA or ACT | N1.5 வணிகரீதியற்றது, Pi0.5 Gemma விதிமுறைகளைக் கொண்டுள்ளது, SmolVLA இன் அட்டையில் எதுவும் குறிப்பிடப்படவில்லை. |
ஐந்து வேட்பாளர்கள்
ஐந்துமே , கொள்கைகள்: கேமரா பிரேம்கள், கூட்டு நிலைகள் மற்றும், அவற்றில் நான்குக்கும், ஒரு மொழி அறிவுறுத்தல், எதிர்கால கூட்டு இலக்குகளின் ஒரு பகுதிக்கு மேப் செய்யப்பட்டுள்ளது. அவற்றை வேறுபடுத்துவது எவ்வளவு நீங்கள் வருவதற்கு முன் கற்றுக்கொள்ளப்பட்டது.
| கொள்கை | அளவுருக்கள் | தாமதம் | GPU அடுக்கு | உள்ளூர்? | குறைந்தபட்ச அத்தியாயங்கள் | வடிவம் | செலவு |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA-வின் தற்போதைய பார்வை-மொழி-செயல் மாதிரி, சுமார் 3 பில்லியன் அளவுருக்களைக் கொண்டது, தோராயமாக 40 மில்லியன் அளவுருக்கள் நுண்ணிய சரிசெய்தலின் போது பயிற்சி பெற்றன. N1.6 இலிருந்து ஏற்பட்ட மாற்றங்களை களஞ்சியம் பட்டியலிடுகிறது: முதுகெலும்பு ஒரு விற்பனையாளர் ஈகிள் மாதிரியிலிருந்து Qwen3-VL இல் உள்ள Cosmos-Reason2-2B ஆக மாற்றப்பட்டது, பரவல் அடுக்குகளின் எண்ணிக்கை 32 இலிருந்து 16 ஆகவும், நிலை மற்றும் செயல் பரிமாணங்கள் 29 இலிருந்து 132 ஆகவும், செயல் எல்லை 16 இலிருந்து 40 ஆகவும் மாற்றப்பட்டுள்ளன.
ஒரு சிறிய கையில் முக்கியமானது சார்பு இறுதி-செயல்பாட்டு செயல்வெளி: N1.7 ஆனது தற்போதைய நிலையிலிருந்து ஏற்படும் மாற்றங்களை கணிக்கிறது, இது 20K மணிநேர ஈகோஸ்கேல் மனித வீடியோவை ஒரு ரோபோ கொள்கையாக மாற்ற அனுமதிக்கிறது. விவரக்குறிப்புகள் N1.7 பக்கத்தில், செயல்முறை SO-100 வழிகாட்டியில் N1.7.
Isaac-GR00T README ஆனது N1.7 ஐ ஒரு பொது கிடைக்கும் தன்மை வெளியீடாக அறிவிக்கிறது, முழுமையான அளவுகோல்கள் மற்றும் ஆதரவுடன். அதன் Hugging Face அட்டை இன்னும் புதுப்பிக்கப்படவில்லை: Model Version புலம் இன்னும் GR00T N1.7 EA என்று படிக்கிறது. களஞ்சியமே புதிய ஆவணம்.
GR00T N1.5
அதே 3 B அளவு, ஈகிள் 2 பேக்போன், சிக்லிப்2 மற்றும் T5, ஃப்ளோ-மேட்சிங் டிஐடி ஹெட். இது ஏற்கனவே உங்களிடம் உள்ள ஒரு ஐ நீட்டிக்க உதவுகிறது. இரண்டு விஷயங்கள் இதை ஒரு மோசமான இயல்புநிலையாக ஆக்குகின்றன: எடைகள் NVIDIA's one-way non-commercial licence, and current LeRobot releases removed N1.5 support. See .
Pi0.5
Physical Intelligence's VLA, கொள்கை வகை pi05. இந்த ஆய்வுக் கட்டுரை PaliGemma இலிருந்து தொடங்கப்பட்ட 2 B VLM மற்றும் 300 M செயல் நிபுணரைக் கொடுக்கிறது, இது ரோபோவை 50 Hz இல் இயக்குகிறது; LeRobot's pi05 config defaults to a 50-step chunk, one second at that rate. The selling point is unseen places: உண்மையான வீடுகளில் சுமார் 400 மணிநேர மொபைல் கையாளுதல், மற்றும் 3, 12, 22, 53, 82 மற்றும் 104 இடங்களுக்கு மேல் ஒரு ஸ்கேலிங் ஆய்வு, அங்கு 104-இட மாதிரி, சோதனை வீடுகளிலேயே பயிற்சி பெற்ற ஒரு கட்டுப்பாட்டுடன் பொருந்தியது.
ஒரு வரம்பு, குறிப்பிடப்பட்டுள்ளது lerobot/pi05_base கார்டில்: போர்ட் பாய்வு-பொருந்தும் செயல்பாட்டுத் தலையை மட்டுமே கொண்டு செல்கிறது. துணைப்பணி கணிப்பு, செயல்பாட்டு டோக்கனைசேஷன் மற்றும் RL ஆகியவை அப்ஸ்ட்ரீமில் வெளியிடப்படவில்லை, மேலும் openpi அதன் சொந்த களஞ்சியத்தைப் பற்றியும் அதையே கூறுகிறது. Pi0.5 பக்கம் மற்றும் SO-100 வழிகாட்டியில் Pi0.5 மீதமுள்ளவற்றை கொண்டுள்ளது.
Pi0.5 க்கு கேடட் google/paligemma-3b-pt-224 டோக்கனைசர் தேவை (gated: manual, இருப்பினும் Google கோரிக்கைகள் உடனடியாகச் செயல்படுத்தப்படும் என்று கூறுகிறது). அதை ஏற்றுக்கொண்டு, பயிற்சிச் சூழலில் hf auth login ஐ இயக்காமல், பணி தொடங்கி, சிறிது நேரம் பதிவிறக்கம் செய்து, பின்னர் நெட்வொர்க் பிழை போல் தோன்றும் அங்கீகாரப் பிழையில் நின்றுவிடுகிறது. nvidia/GR00T-N1.7-3B கேடட் செய்யப்படவில்லை, ஆனால் அதன் nvidia/Cosmos-Reason2-2B பேக்போன் கேடட் செய்யப்பட்டுள்ளது (gated: auto). வரிசையில் சேர்ப்பதற்கு முன் இரண்டையும் அழிக்கவும்; ஒரு ரன் சும்மா இருந்தால், சிக்கிய-வரிசைப் பக்கம் எதைச் சரிபார்க்க வேண்டும் என்பதைக் காட்டுகிறது.
SmolVLA
450 M அளவுருக்கள், செயல்பாட்டு நிபுணரில் சுமார் 100 M, SmolVLM-2 இல் VLM உறைந்துபோய், அதன் முதல் 16 மொழி-மாடல் அடுக்குகளை மட்டுமே பயன்படுத்தி. முன் பயிற்சி சமூகத் தரவுகளாகும்: 481 தரவுத்தொகுப்புகள், 10.6 M பிரேம்கள், நீங்கள் பயன்படுத்தும் அதே மலிவான கைகளிலிருந்து. இங்குள்ள ஒரே VLA, ஒரு 24 GB கார்டில் பொருந்துகிறது, மேலும் ஒரே 30 எபிசோட் தளம். பார்க்கவும் SmolVLA பக்கம்.
ACT
இது ஒரு அடிப்படை மாதிரி அல்ல. ALOHA இலிருந்து வரும் Action Chunking Transformer ஆனது சுமார் 80 M அளவுருக்களைக் கொண்டது, இது ஒவ்வொரு பணிக்கும் புதிதாகப் பயிற்றுவிக்கப்பட்டது, 50 Hz இல் 50 செயல்விளக்கங்கள் மூலம். இந்த ஆய்வுக் கட்டுரை சுமார் பத்து நிமிட செயல்விளக்கங்களிலிருந்து ஆறு உண்மையான இருகைப் பணிகளைப் பற்றி அறிக்கை செய்கிறது, இது எடுத்துக்காட்டுகளில் 80 முதல் 90 சதவீதம் வரை வெற்றியைப் பெற்றது. இதன் யோசனை, செயல் துண்டாக்கம், இந்த பக்கத்தில் உள்ள ஒவ்வொரு மாதிரியிலும் உள்ளது, மேலும் அதன் நீக்கம் இன்னும் விளைவை சிறப்பாக அளவிடுகிறது: தற்காலிக ஒருங்கிணைப்பு அணைக்கப்பட்ட இரண்டு உருவகப்படுத்தப்பட்ட பணிகளில், k=1 இல் 1 சதவீதத்திலிருந்து k=100 இல் 44 சதவீதமாக வெற்றி அதிகரிக்கிறது. ACT பக்கம் மீதமுள்ள தகவல்களைக் கொண்டுள்ளது.
தரவு அளவுகோல்கள் உண்மையில் என்ன சொல்கின்றன
LIBERO என்பது இந்த ஐந்தில் மூன்று மாதிரிகள் அறிக்கை செய்யும் ஒரு தரவு அளவுகோல்: உருவகப்படுத்தப்பட்ட Franka Panda இல் மொழி-நிபந்தனைக்குட்பட்ட பணிகள், கீழே உள்ள நான்கு தொகுப்புகளாகப் பிரிக்கப்பட்டு, ஒவ்வொன்றிலும் பத்து பணிகள் உள்ளன. NVIDIA ஒவ்வொரு தொகுப்பிற்கும் 200 சோதனைகளை நடத்தியது.
| மாதிரி | இடஞ்சார்ந்த | பொருள் | இலக்கு | 10 (நீண்ட) | சராசரி |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
ஒவ்வொரு எண்ணும் வெவ்வேறு சோதனை அமைப்பு மற்றும் பட்ஜெட்டில் இருந்து வருகிறது. GR00T உலகளாவிய தொகுதி 640 இல் 20K படிகளை இயக்கியது; openpi எண்ணிக்கை ஒரு 30K சரிபார்ப்புப் புள்ளி; LeRobot போர்ட் ஒரு LIBERO அடிப்படை மாதிரியில் 6K படிகளைச் சேர்த்தது. SmolVLA மேலும் ஒரு பொருந்தாத நிலை: அதன் ஆய்வுக் கட்டுரை அந்த வரிசையை LIBERO இல் முதலில் இருந்து, VLA முன் பயிற்சி இல்லாமல் பயிற்சி அளிக்கிறது, அதேசமயம் அதற்கு மேலே உள்ள மூன்று முன் பயிற்சி பெற்ற சரிபார்ப்புப் புள்ளிகளை நன்றாகச் சரிசெய்கின்றன. 96.85 முதல் 97.5 வரை ஒரு தொகுப்பாகவும், 87.3% வரையிலான இடைவெளியை உண்மையானதாகவும், ஆனால் 6.7 மடங்கு அளவுருக்களுடன் பெறப்பட்டதாகவும் கருதுங்கள்.
SimplerEnv பரவலைக் காட்டுகிறது, ஆனால் LIBERO காட்டவில்லை. NVIDIA ஆனது N1.7 ஐ N1.6 உடன் ஒப்பிடுகிறது, இது ஒரு தலைமுறை வேறுபாடு.
| SimplerEnv தொகுப்பு | N1.6 சராசரி | N1.7 சராசரி | சிறந்த ஏற்ற இறக்கம் | மோசமான ஏற்ற இறக்கம் |
|---|---|---|---|---|
| பிரிட்ஜ் (WidowX), 7 பணிகள் | 56.6% | 62.3% | stack_cube 5.0 முதல் 48.0 வரை | put_eggplant_in_basket 89.0 முதல் 53.0 வரை |
| ஃப்ராக்டல் (கூகிள் ரோபோ), 6 பணிகள் | 52.0% | 72.5% | open_drawer 0.0 முதல் 65.0 வரை | எதுவுமில்லை, ஒவ்வொரு பணியும் மேம்படுத்தப்பட்டது |
பிரிட்ஜ் வரிசை பயனுள்ளது: சராசரியாக 5.7 புள்ளிகள் பெற்றது, அதே நேரத்தில் put_eggplant_in_basket 36 புள்ளிகளை இழந்தது மற்றும் put_eggplant_in_sink 33 இலிருந்து 2 ஆகக் குறைந்தது. ஒரு புதிய தலைமுறை விநியோகத்தை உயர்த்துவதற்குப் பதிலாக நகர்த்துகிறது, எனவே உங்கள் பணி N1.7 பின்னடைவு ஏற்பட்ட இடத்தில் இருந்தால், சராசரி எதுவும் சொல்லாது.

ஐந்தில், SmolVLA ஆய்வுக் கட்டுரை மட்டுமே SO-100 வகுப்பு கையைப் பற்றி அறிக்கை செய்கிறது: மூன்று பணிகளில் SmolVLA க்கு 78.3 சதவீதமும், Pi0 க்கு 61.7 சதவீதமும், இரண்டும் பல பணிகளுக்கானவை, ஒற்றைப் பணிக்காகப் பயிற்சி பெற்ற ACT க்கு 48.3 சதவீதத்திற்கு எதிராக, இது ஒப்பிடக்கூடியது அல்ல. தெளிவான ஜோடி SO-101 பிக்-அண்ட்-பிளேஸில் இரண்டும் ஒற்றைப் பணிக்கானவை: விநியோகத்தில் 70 க்கு எதிராக 90, அதற்கு வெளியே 40 க்கு எதிராக 50. ஒப்பிடுக ACT மற்றும் SmolVLA மற்றும் Pi0.5 மற்றும் SmolVLA, அல்லது உலாவுக அரங்கம்.
தாமதம் மற்றும் செலவு வரிசைப்படுத்தலைத் தீர்மானிக்கின்றன
இன்ஃபரன்ஸ் லேட்டன்சி என்பது மக்கள் கடைசியாகக் கண்டுபிடிக்கும் மற்றும் முதலில் வருந்தும் ஒரு வரம்பு. ஒரு பெஞ்ச்மார்க்கில் ஐந்து புள்ளிகள் சிறப்பாக இருக்கும் ஒரு கொள்கை, ஆனால் ஒரு செயல் படிக்கு அரை வினாடி தாமதம் உங்கள் மேசையில் மோசமாகத் தோன்றும்: தொடர்பு இயக்கவியல் காத்திருக்காது.
ஒரு எச்சரிக்கை: GR00T எண்ணிக்கை NVIDIA இன் கார்டுடன் ஒத்துப்போகவில்லை, இது 4 டி-நாய்ஸிங் படிகள் மற்றும் ஒரு கேமராவை H100 இல் ஈகர் பயன்முறையில் 85.8 ms, torch.compile உடன் 48.6 ms, முழு TensorRT வழியாக 27.9 ms என அளவிடுகிறது. இங்குள்ள 152 ms என்பது சேவை மேலதிகச் செலவு மற்றும் ஒன்றுக்கு மேற்பட்ட கேமராக்களுடன் கூடிய முழு-ஸ்டாக் எண்ணிக்கை, இது ஒரு ஃபார்வர்ட் பாஸ் அல்ல.
20 முதல் 485 ms வரையிலான லூப் மாதிரியுடையது, மேலும் பொது இணைய ரவுண்ட் ட்ரிப்கள் அதனுடன் சேர்க்கப்படுகின்றன. ரிமோட் இன்ஃபரன்ஸ் மெதுவான பிக்-அண்ட்-பிளேஸுக்கு சாத்தியமானது, வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல. உங்கள் பணிக்கு வேகம் தேவைப்பட்டால், இன்ஃபரன்ஸ் சர்வோக்களுக்கு அடுத்ததாக அமைகிறது: ACT அல்லது SmolVLA, உள்நாட்டில். தொடர்புடையது: கொள்கை இயக்கத்தின் நடுவில் முடங்குகிறது.
மாதிரியை மாற்றாமல் நேரத்தை வாங்குவதற்கான ஒரு வழி: SmolVLA கட்டுரை ஒத்திசைவான செயல்பாட்டை அளவிடுகிறது, அங்கு கொள்கை அடுத்ததை கணிப்பதற்கு முன் ஒரு பகுதியை முடிக்கிறது, ஒத்திசைவற்ற செயல்பாட்டிற்கு எதிராக, அங்கு கணிப்பு செயல்பாட்டுடன் ஒன்றுடன் ஒன்று இணைகிறது. வெற்றி ஒத்திருக்கிறது, 78.3 க்கு எதிராக 73.3, ஆனால் அதே பிக்-அண்ட்-பிளேஸ் 13.75 க்கு பதிலாக 9.7 வினாடிகள் எடுக்கிறது, மேலும் ஒரு நிலையான சாளரத்தில் ரோபோ 9 க்கு பதிலாக 19 சுழற்சிகளை நிர்வகிக்கிறது.
உரிமங்கள், யாரும் சரிபார்க்காததால் சரிபார்க்கப்பட்டது
| மாதிரி | எடைகளுக்கான உரிமம் | குறியீட்டிற்கான உரிமம் | வணிகப் பயன்பாடு |
|---|---|---|---|
| GR00T N1.7 | NVIDIA திறந்த மாதிரி உரிமம்; அட்டை வணிகப் பயன்பாட்டை அனுமதிக்கிறது | Apache 2.0 | ஆம் |
| GR00T N1.5 | NVIDIA ஒருவழி வணிகமற்ற உரிமம் | Apache 2.0 | இல்லை |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | இரண்டையும் படிக்கவும், அவை வேறுபடுகின்றன |
| SmolVLA | smolvla_base அட்டையில் உரிமப் புலம் இல்லை | Apache 2.0 (LeRobot) | குறியீடு ஆம், எடைகள் குறிப்பிடப்படவில்லை |
| ACT | அடிப்படை எடைகள் இல்லை | Apache 2.0 (LeRobot) | ஆம் |
Pi0.5 வரிசைக்கு கவனம் தேவை. LeRobot pi05 ஆவணங்கள் Apache 2.0 ஐ openpi உடன் இணக்கமாகக் குறிப்பிடுகின்றன, அதே நேரத்தில் Hub அட்டை lerobot/pi05_base கொண்டுள்ளது license: gemma. இரண்டும் செயல்பாட்டில் உள்ளன. GR00T N1.7 ஒரு மென்மையான பதிப்பைக் கொண்டுள்ளது: Isaac-GR00T README ஆனது N1.7 ஆனது Apache 2.0 இன் கீழ் முழுமையாக வணிக ரீதியாக உரிமம் பெறக்கூடியது என்று குறிப்பிடுகிறது, அதே நேரத்தில் அதன் சொந்த உரிமப் பிரிவு மற்றும் மாதிரி அட்டை குறியீட்டை மட்டும் Apache 2.0 இன் கீழும், எடைகளை NVIDIA திறந்த மாதிரி உரிமத்தின் கீழும் வைக்கின்றன.
நீங்கள் உண்மையில் இயக்கும் இயல்புநிலைகள்
ஒவ்வொரு பயிற்சியாளர் படிவமும் ஒரு இயல்புநிலையை அனுப்புகிறது, மேலும் அவை தன்னிச்சையானவை அல்ல. ACT இன் இயல்புநிலைகள் LeRobot இன் சொந்தமானவை: தொகுதி 8, lr 1e-5, 100000 பயிற்சி படிகள், chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. கீழே உள்ள ஒரு நெடுவரிசை ஒரு பொறி.
| கொள்கை | தொகுதி | LR | அதிகபட்ச படிகள் | சாய்வு திரட்சி | பொருந்துமா? | கூடுதல் கட்டுப்பாடுகள் |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T இன் ஃபைன்-ட்யூனிங் நுழைவுப் புள்ளி (launch_finetune.py, ஒரு tyro CLI) அதன் config dataclass இல் seed field இல்லை, எனவே இயக்கங்கள் பிட்-க்கு-பிட் மறுஉருவாக்கக்கூடியவை அல்ல. இந்த களஞ்சியம், தீர்மானிக்க முடியாத பட மேம்பாடுகளிலிருந்து இயக்கங்களுக்கு இடையே 5 முதல் 6 சதவீதம் மாறுபாடு இருப்பதாகவும் எச்சரிக்கிறது, இது ஆன்லைனில் விவாதிக்கப்படும் பெரும்பாலான பெஞ்ச்மார்க் இடைவெளிகளை விட பெரியது. LeRobot இன் இயல்புநிலை seed 1000 ஆகும். grad-accum நெடுவரிசை lerobot 0.5.1 ஐ விவரிக்கிறது; upstream 0.6.2 இதை --accelerator.gradient_accumulation.steps ஆக வெளிப்படுத்துகிறது.
மாதிரித் தேர்வை விட முக்கியமான கட்டுப்பாடு
இது செயல் துண்டு. நீண்ட துண்டுகள் மென்மையான இயக்கத்தையும் குறைவான கூட்டுப் பிழைகளையும் தருகின்றன, ஆனால் தொகுதி செயல்படுத்தப்படும்போது கொள்கை உறுதிப்படுத்தப்படுகிறது, எனவே நகரும் எதற்கும் தாமதமாக எதிர்வினையாற்றுகிறது: ஒரு நிலையான கனசதுரத்தில் நம்பிக்கையுடன், உருளும் ஒன்றில் நம்பிக்கையற்றது. அது மிகைப்படுத்தினால், செயல்படுத்தப்பட்ட பகுதியை சுருக்குவது மறுபயிற்சியை விட சிறந்தது மற்றும் இலவசம். குறுகியதாக நிற்கும் ஒரு மூட்டு ஒரு வேறுபட்ட பிரச்சனை; பார்க்கவும் .
- ACT: ACTConfig இயல்பாக
chunk_size 100மற்றும்n_action_steps 100ஆக இருக்கும். தற்காலிக ஒருங்கிணைப்பு முடக்கப்பட்டுள்ளது மற்றும்n_action_steps 1தேவைப்படுகிறது. - GR00T N1.7: உள் எல்லை 16 இலிருந்து 40 ஆக உயர்ந்தது, ஆனாலும் LeRobot இன் SO-101 எடுத்துக்காட்டு இன்னும்
--policy.chunk_size=16 --policy.n_action_steps=16ஐ இயக்குகிறது. ரோல்அவுட் கொடி--execution-horizonஎன மறுபெயரிடப்பட்டது. - Pi0.5: ஒரு 50-படி துண்டு, இதில் LeRobot இன் LIBERO செய்முறை
--policy.n_action_steps=10வழியாக 10 ஐ செயல்படுத்துகிறது; நீங்கள் கொடியை நீக்கினால்--policy.pretrained_pathஉடன் அது 50 ஆக திரும்பும். - SmolVLA: 50-செயல் துண்டுகள், இரண்டு கட்டுப்பாடுகளும் வெளிப்படுத்தப்பட்டுள்ளன.
ஒரு மதிய வேளையில் ஐந்தையும் எப்படி சோதிப்பது
மலிவான பதில் மேலும் படிப்பது அல்ல. சுமார் 15 USD செலவழித்து, கை உங்களுக்குச் சொல்லட்டும்: ஒருமுறை பதிவுசெய்து, முதலில் மலிவான மாதிரியைப் பயிற்றுவிக்கவும், தரவு சரியாக இருப்பதாக நிரூபிக்கப்பட்டவுடன் அதிகரிக்கவும். அமைப்பு அளவை விட சிறந்தது, இதன் நோக்கம் மற்றும் .
- 150 எபிசோடுகளை ஒருமுறை பதிவு செய்யவும்
GR00T, Pi0.5 மற்றும் ACT-க்கு 50, SmolVLA-க்கு 30 என்ற எண்ணிக்கையில் தரவுகளைப் பதிவு செய்யவும். ஒவ்வொரு மாறுபாட்டையும் பரவலாகப் பதிவு செய்யாமல் மீண்டும் மீண்டும் செய்யவும்: 50 எபிசோடுகள் 5 கியூப் நிலைகளில் பயிற்சி செய்யப்பட்டன, 25 எபிசோடுகள் பயிற்சி செய்யப்படவில்லை. உங்கள் முதல் தரவுத்தொகுப்பைப் பதிவு செய்யவும்.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ACT-ஐ முதலில் பயிற்சி செய்யவும், ஏனெனில் அது உங்களை ஏமாற்றாது
முன்பயிற்சி செய்யப்பட்ட எடைகள் இல்லை, எனவே இது பணியைச் செய்தால், உங்கள் தரவுத்தொகுப்பில் அந்தப் பணி உள்ளது. ACT செயலற்றுப் போனால், தரவைச் சரிசெய்யவும். 1 முதல் 3 USD, 24 GB கார்டில் 2 முதல் 5 மணிநேரம்.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3மாற்றப்படாத அதே தரவுத்தொகுப்பில் SmolVLA-வை இயக்கவும்
அதே தரவு, அதே கை, 80 M அளவுருக்களுக்குப் பதிலாக 450 M அளவுருக்கள், மேலும் மொழி சார்ந்த நிபந்தனைகள். LeRobot ஒரு A100-ல் சுமார் 4 மணிநேரத்தில் 20K படிநிலைப் பயிற்சியை நிறைவு செய்கிறது. முன்பயிற்சி ஏதேனும் பயனுள்ளதா என்பதை இது உங்களுக்குத் தெரிவிக்கும்.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T-ஐப் பயன்படுத்துவதற்கு முன் v2.1-க்கு மாற்றவும்
GR00T ஆனது LeRobot v2 வடிவத்தின் ஒரு வகையை, மேலும் இணைக்கப்பட்ட நிலை மற்றும் செயல் வரிசைகள் பெயரிடப்பட்ட புலங்களாக எவ்வாறு பிரிக்கப்படுகின்றன என்பதைக் காட்டும் கூடுதல்
meta/modality.jsonகோப்பையும் படிக்கிறது. ஒரு v3.0 தரவுத்தொகுப்பு அந்த லோடரை செயலிழக்கச் செய்கிறது, ஏனெனில் v3.0 பல எபிசோடுகளைப் பகிரப்பட்ட கோப்புகளில் தொகுக்கிறது, அதேசமயம் v2 ஒரு எபிசோடுக்கு ஒரு கோப்பை எழுதியது. Isaac-GR00T ஆனதுscripts/lerobot_conversion/convert_v3_to_v2.pyஎன்ற டவுன்கிரேட் உதவியாளரை வழங்குகிறது; v3 நிராகரிப்புப் பக்கம் ஒரு விரைவான வழி.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5முதல் இரண்டு முறைகள் திருப்திகரமாக இல்லாவிட்டால் மட்டுமே GR00T N1.7-க்கு மேம்படுத்தவும்
இங்கு காட்டப்பட்டுள்ள NVIDIA-வின் CLI மூலமாகவோ அல்லது LeRobot-ன்
grootகொள்கை வகை மூலமாகவோ. NVIDIA ஆனது ஃபைன்-ட்யூனிங்கிற்கு 40 GB அல்லது அதற்கு மேற்பட்ட VRAM-ஐயும், இன்ஃபரன்ஸிற்கு 16 GB-ஐயும் பரிந்துரைக்கிறது. OOM ஏற்பட்டால், OOM பக்கத்தைப் பார்க்கவும்.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
அந்த ஸ்கிரீனிங் பாஸை இயக்க இரண்டு வழிகள்
மூன்று சூழல்கள், ஏனெனில் டூல்செயின்கள் ஒன்றிணைந்து செயல்படாது. LeRobot மெயின் கிளையில் 0.6.2 ஆக உள்ளது மற்றும் Python 3.12 அல்லது புதியது தேவை; Isaac-GR00T மற்றும் openpi ஆகியவை தனித்தனி uv-நிர்வகிக்கப்பட்ட ரெப்போக்கள்.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T ஆனது
torchcodec0.8.0-ஐ அதன் ஒரே வீடியோ பேக்கெண்டாகப் பயன்படுத்துகிறது, இதற்கு FFmpeg 4 முதல் 7 வரை தேவை. FFmpeg 8 ஆதரிக்கப்படவில்லை, AV1 உறுதி செய்யப்படவில்லை. - openpi நினைவகத் தேவைகள்: இன்ஃபரன்ஸ் 8 GB-க்கு மேல், LoRA 22.5 GB-க்கு மேல், முழு ஃபைன்-ட்யூனிங் 70 GB-க்கு மேல். பிந்தையதுதான் Pi0.5 ஒரு A100 பணி என்பதற்கான காரணம்.
- GPU-வை நீங்களே வாடகைக்கு எடுத்து, பின்னர் அதை அழித்து, மூன்று செட் செக்பாயிண்ட் பாதைகளை கைமுறையாகச் சரிசெய்யவும்.
அதே ஐந்து மாதிரிகள், ஒரு வடிவம். மாதிரி, தரவுத்தொகுப்பு மற்றும் ஹைப்பர் அளவுருக்களைத் தேர்ந்தெடுக்கவும்; பின்தளம் ஒரு தேவையான VRAM-க்கு ஏற்ப GPU-வை வாடகைக்கு எடுத்து, பயிற்சியாளரை இயக்கி, செக்பாயிண்ட்களை ஆப்ஜெக்ட் ஸ்டோரேஜில் எழுதுகிறது.
- பயிற்சி மேட்ரிக்ஸ் ஐந்து மாதிரிகள் நான்கு கைகளால் ஆனது, ஒவ்வொரு கலமும் ஒரு வழிகாட்டி: SO-100 இல் SmolVLA, SO-101 இல் ACT.
- இன்ஃபரன்ஸ் பாட்கள்
/api/inference/podமூலம் தானாகவே ஒதுக்கப்படுகின்றன, ஒரு செயலற்ற வாட்ச்டாக் உடன், எனவே மறக்கப்பட்ட பாட் அமைதியாக பில் செய்யப்படாது. - அடிப்படை செக்பாயிண்ட்கள் விற்பனையாளர்களின் சொந்தமானவை:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT-க்கு எதுவும் இல்லை. - CLI-யிலிருந்தும் மற்றும் MCP சர்வர் வழியாக AI ஏஜெண்டுகளிலிருந்தும் அதே செயல்பாடுகள்.
- வன்பொருள் இல்லையா? லைவ் ஆர்ம் பதிவு இல்லாமல் ஒரு இயற்பியல் SO-100-ஐ ஸ்ட்ரீம் செய்கிறது; ட்ரை பக்கம் உள்ளே நுழையும் வழிகளைக் காட்டுகிறது.
அடிப்படை மாதிரி அல்லது புதிதாக
உண்மையான சிக்கல் எந்த 3B மாடலைத் தேர்ந்தெடுப்பது என்பதல்ல. ஒரு முன்-பயிற்சி பெற்ற VLA-வை பயன்படுத்த வேண்டுமா என்பதே. ACT ஆனது, 80 மில்லியன் அளவுருக்களுடன், எந்த முன்-பயிற்சியும் இல்லாமல், ஒவ்வொரு பணிக்கும் சுமார் பத்து நிமிட செயல்விளக்கங்களிலிருந்து ஆறு உண்மையான இருகைப் பணிகளைக் கற்றுக்கொண்டது என்பதைக் கருத்தில் கொள்ளும்போது.
- மொழி நிலைப்படுத்தல். ACT-க்கு இது இல்லை; ஒரு ACT செக்பாயிண்ட் ஒரு பணியைச் செய்கிறது.
- உங்கள் செயல்விளக்கங்களில் இல்லாத பொருட்களில் சிறந்தது: SO-101 இல், ACT-யின் 40% விநியோகத்திற்கு வெளியே உள்ளவற்றுக்கு எதிராக 50%.
- பல பணிகள்: SmolVLA ஒரு செக்பாயிண்ட் மூலம் மூன்று SO-100 பணிகளில் 78.3% ஐ அடைகிறது; ACT ஒரு பணிக்கு மட்டுமே இயக்கப்பட்டது.
- 7.6x முதல் 24x வரை தாமதம்: ACT-யின் 20 ms-க்கு எதிராக ஒரு செயல் படிக்கு 152 முதல் 485 ms வரை.
- ஒரு ரன்னுக்கு 1 முதல் 3 USD-க்கு பதிலாக 4 முதல் 12 USD, மற்றும் எந்த 24 GB கார்டுக்கு பதிலாக A100 அடுக்கு.
- உரிம வெளிப்பாடு, மேலும் புதிதாக இல்லாத ஒரு கட்டுப்படுத்தப்பட்ட-ரெப்போ தோல்வி முறை.
- முன்-பயிற்சி பெற்ற எடைகள் ஒரு மோசமான தரவுத்தொகுப்பை மறைக்கலாம். உடைந்த தரவுகளில் பாதி வேலை செய்யும் ஒரு ஃபைன்-ட்யூன், தரவைப் பார்ப்பதற்கு ஒரு வாரம் செலவாகும்.
பழைய ரன்னை மீண்டும் உருவாக்குதல்
2025 செக்பாயிண்டைப் பின்தொடர்வது உங்களுக்கான மாடல் தேர்வை எளிதாக்குகிறது மற்றும் சிக்கலை பதிப்பு குறியீடாக மாற்றுகிறது: தற்போதைய LeRobot N1.5 ஐ நிராகரிக்கிறது, எனவே நீங்கள் குறியிடுகிறீர்கள் lerobot==0.5.1. எந்த விதை புலமும் இல்லாமல் மற்றும் ரன்களுக்கு இடையில் 5 முதல் 6 சதவீதம் மாறுபாட்டுடன், மறுஉருவாக்கம் தோராயமானது. மற்றும் தளப் பக்கத்தைக் கொண்டுள்ளன.

இரண்டாகக் குறைந்ததா? ACT எதிராக GR00T N1.7 மற்றும் GR00T N1.7 எதிராக SmolVLA. மூல வரிசைகள் அரங்கம் உள்ளீடுகளில் உள்ளன: GR00T N1.7, Pi0.5, SmolVLA மற்றும் ACT.
இந்த தளம் உங்களுக்கு எங்கு உதவாது
- இது தொலைநிலை ஊகத்தை (remote inference) விரைவுபடுத்த முடியாது. 20 முதல் 485 மில்லி விநாடிகள் சுழற்சி மாதிரிக்கு உரியது; இணையப் பயணங்கள் அதை மேலும் அதிகரிக்கும்.
- இது GR00T அல்லது Pi0.5 ஐ உங்கள் சொந்த வன்பொருளில் நுண்-சரிசெய்ய (fine-tune) முடியாது. இங்கு இரண்டும் கிளவுட்-மட்டுமே; SmolVLA மற்றும் ACT மட்டுமே உள்ளூரில் இயங்கும்.
- இது ஒரு தரவுத்தொகுப்பை (dataset) சரிசெய்ய முடியாது. இழப்பு குறைகிறது ஆனால் கொள்கை எதுவும் செய்யவில்லை என்பது ஒரு தரவுச் சிக்கல், ஒரு அமைப்பில் மட்டுமே செயல்படும் ஒரு கொள்கை என்பது ஒரு கவரேஜ் சிக்கல்.
- இது GR00T இயக்கங்களை மீண்டும் உருவாக்கக்கூடியதாக (reproducible) மாற்ற முடியாது: மேல்நிலை உள்ளமைவில் (upstream config) 'seed' புலம் இல்லை.
85 மாதிரிகள், 332 பெஞ்ச்மார்க் முடிவுகள், ஒவ்வொரு எண்ணும் அதன் மூலத்துடன் இணைக்கப்பட்டுள்ளது
இந்த பக்கத்தில் உள்ள அட்டவணைகளின் வரிசைப்படுத்தக்கூடிய பதிப்பு: 85 பார்வை-மொழி-செயல் மாதிரிகள், 332 பெஞ்ச்மார்க் முடிவுகள், ஒவ்வொன்றும் அதன் கட்டுரை அல்லது மாதிரி அட்டையுடன் இணைக்கப்பட்டுள்ளன.
அரங்கத்தைத் திறக்கவும்ஒன்றைத் தேர்ந்தெடுத்து முன்னேறுதல்
ஒரு இயல்புநிலை: 50 எபிசோட்களைப் பதிவுசெய்து, தரவுத்தொகுப்பை நிரூபிக்க ACT ஐ 1 முதல் 3 USD க்குப் பயிற்சி அளித்து, பின்னர் SmolVLA ஐ அதே தரவில் பயன்படுத்தவும். மொத்தமாக 6 USD க்கும் குறைவாக, அவை முக்கியமான கேள்விக்கு பதிலளிக்கின்றன: இங்கே முன் பயிற்சி உதவுகிறதா, அல்லது தடை தரவுதானா. தொடர்பு நிறைந்த பல-படி பணிகளுக்கு GR00T N1.7 க்கு மேம்படுத்தவும், காட்சி மாறும்போது Pi0.5 க்கு, காட்சி மாறும்போது.
தள வழிகாட்டி: உங்கள் முதல் கொள்கையைப் பயிற்றுவிக்கவும், பின்னர் உங்கள் முதல் கொள்கையை இயக்கவும். பயிற்சி ஆவணங்கள் மற்றும் தரவுத்தொகுப்பு ஆவணங்கள் படிவம் மற்றும் வடிவமைப்பை உள்ளடக்கியது; SO-100 பக்கம் மற்றும் முழுமையான SO-100 வழிகாட்டி உருவாக்கம் மற்றும் அளவீட்டை உள்ளடக்கியது. பின்னணி: VLA கண்ணோட்டம் மற்றும் Pi0 ஃப்ளோ-மேட்சிங் கட்டுரை. உங்கள் வெற்றி விகிதத்தை அதிகரிக்கும் ஒன்று தரவு தர வழிகாட்டி.
SO-100 இல் எந்த VLA கொள்கையை நான் முதலில் பயிற்சி செய்ய வேண்டும்?▾
ACT, பின்னர் SmolVLA. ACT புதிதாகப் பயிற்சி அளிக்கிறது, எனவே அது ஒரு மோசமான தரவுத்தொகுப்பை மறைக்க முடியாது, மேலும் ஒரு 24 GB கார்டில் ஒரு ரன் 1 முதல் 3 USD செலவாகும். ACT பணியைச் செய்தால், GR00T N1.7 அல்லது Pi0.5 ரன்னுக்கு 4 முதல் 12 USD வீணாகாது.
GR00T N1.7 உண்மையில் Pi0.5 ஐ விட சிறந்ததா?▾
LIBERO இல் அவை சத்தத்திற்குள் உள்ளன: GR00T N1.7 க்கு நான்கு சூட்களில் 97.0%, openpi இல் 30k படிகளில் Pi0.5 க்கு 96.85%, LeRobot போர்ட்டுக்கு 97.5%, இவை அனைத்தும் வெவ்வேறு ஹார்னஸ்களிலிருந்து வந்தவை. உண்மையான வேறுபாடுகள் ஒரு செயல் படிக்கு 152 ms எதிராக 485 ms, v2.1 தரவுத்தொகுப்புகள் எதிராக v3.0, மற்றும் பெஞ்ச்மார்க் துல்லியம் எதிராக திறந்த உலக பொதுமைப்படுத்தல்.
இவற்றில் எதையாவது ஒரு RTX 4090 இல் நான் ஃபைன்-ட்யூன் செய்ய முடியுமா?▾
SmolVLA மற்றும் ACT, ஆம்; இரண்டும் ஒரு RTX 4090 அல்லது எந்த 24 GB கார்டுக்கும் பட்டியலிடப்பட்டுள்ளன மற்றும் உள்ளூரில் இயங்குகின்றன. GR00T N1.7, N1.5 மற்றும் Pi0.5 க்கு ஒரு A100 அல்லது H100 80 GB தேவை மற்றும் இங்கு கிளவுட்-மட்டும். GR00T ஃபைன்-ட்யூனிங்கிற்கு NVIDIA 40 GB அல்லது அதற்கு மேல் பரிந்துரைக்கிறது; முழு Pi0.5 ஃபைன்-ட்யூனுக்கு openpi இன் குறைந்தபட்சம் 70 GB க்கு மேல் உள்ளது, LoRA க்கு 22.5 GB.
இந்த ஐந்தில் எதை நான் வணிக ரீதியாகப் பயன்படுத்தலாம்?▾
GR00T N1.7 எடைகள் NVIDIA Open Model License Agreement இன் கீழ் உள்ளன, இது வணிகப் பயன்பாட்டை உள்ளடக்கியது என்று கார்டு கூறுகிறது. N1.5 எடைகள் வணிக ரீதியற்றவை. SmolVLA இன் குறியீடு LeRobot இல் Apache 2.0 ஆகும், ஆனால் lerobot/smolvla_base கார்டில் உரிமப் புலம் இல்லை, எனவே எடைகள் குறிப்பிடப்படவில்லை. ACT க்கு உரிமம் பெற அடிப்படை எடைகள் இல்லை. Pi0.5 தெளிவற்றது: LeRobot இன் ஆவணங்கள் Apache 2.0 என்று கூறுகின்றன, அதன் கார்டு மெட்டாடேட்டா உரிமம்: gemma என்று படிக்கிறது.
Sources
- NVIDIA Isaac-GR00T களஞ்சியம்: GA நிலை, N1.6 இலிருந்து N1.7 மாற்றங்கள், வன்பொருள் தேவைகள், torchcodec மற்றும் FFmpeg கட்டுப்பாடுகள், launch_finetune.py, ரன்-டு-ரன் மாறுபாடு
- nvidia/GR00T-N1.7-3B மாதிரி அட்டை: Cosmos-Reason2-2B பேக்போன், 3 B அளவுருக்கள், அனுமான நேர அட்டவணை, NVIDIA Open Model License, Model Version புலம்
- nvidia/GR00T-N1.5-3B மாதிரி அட்டை: Eagle 2 குறிப்பு, SigLip2 மற்றும் T5, ஃப்ளோ மேட்சிங் DiT, ஒருவழி வணிக ரீதியற்ற உரிமம்
- Isaac-GR00T LIBERO எடுத்துக்காட்டு: 20K படிகள் மற்றும் தொகுதி அளவு 640 இல் சூட் வாரியான வெற்றி விகிதங்கள், ஒரு சூட்டிற்கு 200 சோதனைகள்
- Isaac-GR00T SimplerEnv எடுத்துக்காட்டு: பணி வாரியான பிரிட்ஜ் மற்றும் ஃபிராக்டல் வெற்றி விகிதங்கள், GR00T N1.6 எதிராக N1.7
- pi0.5: திறந்த உலக பொதுமைப்படுத்தலுடன் கூடிய ஒரு பார்வை-மொழி-செயல் மாதிரி (2 B VLM மற்றும் 300 M செயல் நிபுணர், 50 Hz கட்டுப்பாடு, சுமார் 400 மணிநேர மொபைல் கையாளுதல், 3 முதல் 104 இடங்களுக்கு மேல் அளவிடுதல் ஆய்வு)
- openpi களஞ்சியம்: GPU நினைவக குறைந்தபட்சங்கள், ஃப்ளோ-மேட்சிங்-ஹெட்-மட்டும் நோக்கம், மற்றும் examples/libero இல் உள்ள Pi0.5 LIBERO முடிவுகள்
- lerobot/pi05_base மாதிரி அட்டை: LeRobot போர்ட்டின் நோக்கம், உரிமம்: gemma மெட்டாடேட்டா, lerobot-train பயன்பாடு
- LeRobot pi0.5 ஆவணங்கள்: கேடட் PaliGemma டோக்கனைசர், LIBERO மறுஉருவாக்க அட்டவணை, n_action_steps ஃபால்பேக் ட்ராப், Apache 2.0 அறிக்கை
- SmolVLA: மலிவான மற்றும் திறமையான ரோபோடிக்ஸிற்கான ஒரு பார்வை-மொழி-செயல் மாதிரி (450 M அளவுருக்கள், LIBERO மற்றும் Meta-World அட்டவணைகள், SO-100 மற்றும் SO-101 முடிவுகள், ஒத்திசைவற்ற அனுமானம்)
- LeRobot SmolVLA ஆவணங்கள்: 25 க்கு எதிராக 5 நிலைகளில் 50 எபிசோடுகள், ஒரு A100 இல் சுமார் 4 மணிநேரத்தில் 20k படிகள்
- குறைந்த விலை வன்பொருளுடன் நுணுக்கமான இருகைப் கையாளுதலைக் கற்றல் (ACT மற்றும் ALOHA): 80-90 சதவீதத்தில் 6 பணிகள், k=1 முதல் k=100 வரை துண்டு அளவு நீக்கம்
- LeRobot 0.6.2: ACTConfig மற்றும் SmolVLAConfig இயல்புநிலைகள், இயல்புநிலை விதை 1000, --accelerator.gradient_accumulation.steps, Python 3.12 தேவை, Apache 2.0
- LeRobot GR00T ஆவணங்கள்: கொள்கை வகை groot, N1.5 ஆதரவு நீக்கப்பட்டது, pin lerobot==0.5.1, SO-101 துண்டு அளவு எடுத்துக்காட்டு
- lerobot/smolvla_base மாதிரி அட்டை: --policy.path ஆல் பயன்படுத்தப்படும் SmolVLA அடிப்படை செக்பாயிண்ட், மற்றும் அதன் அட்டை மெட்டாடேட்டா, இதில் உரிமப் புலம் இல்லை
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started