
GR00T N1.7, Pi0.5, SmolVLA, ACT හෝ GR00T N1.5? සැබෑ තත්වයන්ට ගැලපෙන තීරණ වගුවක්, ප්රකාශිත මිණුම් සලකුණු අංක, ප්රමාදය, එක් ධාවනයකට වැයවන පිරිවැය සහ එක් එක් තේරීම පිටුපස ඇති බලපත්ර සමඟින්.
අද වන විට SO-100 පන්තියේ රොබෝ අතක් මත ප්රතිපත්ති පහක් පුහුණු කළ හැක. ඒවා අනුමාන කිරීමේ ප්රමාදය 24 ගුණයකින්, පරාමිති ගණන 37 ගුණයකින් සහ එක් ධාවනයක පිරිවැය 12 ගුණයකින් වෙනස් වන අතර, ඔබට ප්රතිඵලය නැව්ගත කළ හැකිද යන්න මතද වෙනස් වේ. ආකෘති කාඩ්පත් පහක් එය විසඳන්නේ නැත: ඔබට ඇති ප්රශ්නයට කිසිවක් පිළිතුරු දෙන්නේ නැත, මා මුලින්ම ධාවනය කළ යුත්තේ කුමක්ද?
පහත සෑම අංකයක්ම 2026 අගෝස්තු මාසයේදී පත්රිකා, රිපෝ සහ කාඩ්පත් වලින් කියවන ලදී. වේදිකා අංක පැමිණෙන්නේ AY-Robots ප්රතිපත්ති නාමාවලිය වෙතින්ය; දෙක එකඟ නොවන තැන, දෙකම පෙන්වා ඇත.
කෙටි සාරාංශය
- •ඔබේ දත්ත කට්ටලය ගැන සැකයක් ඇත්නම් ACT මුලින්ම පුහුණු කරන්න: එක් ධාවනයකට 1 සිට 3 USD, නරක දත්ත ආවරණය කිරීමට පෙර පුහුණු කළ කිසිවක් නැත.
- •GR00T N1.7 සහ Pi0.5 LIBERO මත අර්ධ ලක්ෂයක් තුළ පිහිටා ඇත, 97.0 එදිරිව 96.85 සිට 97.5 දක්වා. එය කිසිවක් තෝරා ගැනීමට හේතුවක් නොවේ.
- •Pi0.5 යනු සාමාන්යකරණ ක්රීඩාව මිස නිරවද්යතා ක්රීඩාව නොවේ, තවද 485 ms දී වඩාත්ම මන්දගාමී වේ.
- •SmolVLA, 450 M පරාමිති සහිතව, මෙහි ඇති එකම VLA වන අතර එය එක් 24 GB කාඩ්පතක් මත සියුම් ලෙස සුසර කරයි.
- •20 ms හි ACT යනු වේගවත් ප්රතික්රියාශීලී චලනය සඳහා ඇති එකම විකල්පයයි. බලපත්ර ඉතිරිය තීරණය කරයි.
තීරණ වගුව
| ඔබේ තත්ත්වය | මෙය පුහුණු කරන්න | මන්ද |
|---|---|---|
| දත්ත කට්ටලයේ ගුණාත්මකභාවය සනාථ කර නොමැත | ACT | පුහුණු නොකළ කිසිවක් බිඳුණු දත්ත කට්ටලයක් සඟවන්නේ නැත, අසාර්ථක වීම සඳහා 1 සිට 3 USD වැය වේ. |
| ස්පර්ශ බහුල, බහු-පියවර, භාෂා-නියමිත | GR00T N1.7 | LIBERO කට්ටල හතරක් හරහා 97.0%, ඊට අමතරව සාපේක්ෂ අවසාන-ක්රියාකාරී ක්රියා අවකාශයක්. |
| වේගවත් ප්රතික්රියාශීලී චලනය, සර්වෝ වලදී අනුමානය | ACT | 20 ms. ඊළඟ වේගවත්ම එක 7.6 ගුණයකින් මන්දගාමී වේ. |
| නව වස්තූන්, නව දර්ශනය, විවෘත ලෝකය | Pi0.5 | 104 ස්ථාන හරහා, බෙදාහැරීමෙන් පිටත හැසිරීම් සඳහා ගොඩනගා ඇත. |
| එක් 24 GB කාඩ්පතක්, තවමත් භාෂාව අවශ්යයි | SmolVLA | 450 M පරාමිති, 30 කථාංග සීමාවක්, දේශීයව ක්රියාත්මක වේ. |
| 2025 දී වාර්තා කරන ලද ධාවනයක් ප්රතිනිෂ්පාදනය කිරීම | GR00T N1.5 | ඔබට අවශ්ය නම් පමණි: LeRobot දැන් එය ප්රතික්ෂේප කරයි, බර වාණිජ නොවේ. |
| මෙය නිෂ්පාදනයක් ලෙස නිකුත් කෙරේ | N1.7, SmolVLA or ACT | N1.5 වාණිජ නොවේ, Pi0.5 Gemma නියමයන් දරයි, SmolVLA හි කාඩ්පත කිසිවක් සඳහන් නොකරයි. |
අපේක්ෂකයින් පස්දෙනා
සියලුම පස්දෙනා ප්රතිපත්ති වේ: කැමරා රාමු, සන්ධි පිහිටීම් සහ, ඔවුන්ගෙන් හතර දෙනෙකු සඳහා, අනාගත සන්ධි ඉලක්ක සමූහයකට සිතියම්ගත කරන ලද භාෂා උපදෙස්. ඔවුන් වෙන් කරන්නේ කොපමණ ප්රමාණයක් ඔබ පැමිණීමට පෙර ඉගෙන ගෙන තිබේද යන්නයි.
| ප්රතිපත්තිය | පරාමිති | ප්රමාදය | GPU ස්ථරය | දේශීයද? | අවම කථාංග | ආකෘතිය | පිරිවැය |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA හි වත්මන් දෘශ්ය-භාෂා-ක්රියාකාරී ආකෘතිය, දළ වශයෙන් පරාමිති බිලියන 3ක් පමණ, සියුම්-සුසර කිරීම අතරතුර මිලියන 40ක් පමණ පුහුණු කර ඇත. N1.6 සිට වෙනස්කම් ගබඩාවේ ලැයිස්තුගත කර ඇත: Eagle ආකෘතියක සිට Qwen3-VL මත Cosmos-Reason2-2B දක්වා වූ මූලික ව්යුහය, විසරණ ස්ථර 32 සිට 16 දක්වා, තත්ත්ව සහ ක්රියාකාරී මානයන් 29 සිට 132 දක්වා, ක්රියාකාරී ක්ෂිතිජය 16 සිට 40 දක්වා.
කුඩා අතක් මත වැදගත් වන්නේ සාපේක්ෂ අවසාන-ක්රියාකාරී ක්රියාකාරී අවකාශයයි: N1.7 පුරෝකථනය කරන්නේ වත්මන් ඉරියව්වෙන් ඇති වෙනස්කම් වන අතර, එය EgoScale මානව වීඩියෝ පැය 20K රොබෝ ප්රතිපත්තියකට මාරු කිරීමට ඉඩ සලසයි. N1.7 පිටුව මත පිරිවිතර, ක්රියා පටිපාටිය SO-100 මාර්ගෝපදේශය මත N1.7 හි ඇත.
Isaac-GR00T README N1.7 සාමාන්ය ලබා ගත හැකි නිකුතුවක් ලෙස ප්රකාශ කරයි, සම්පූර්ණ මිණුම් සලකුණු සහ සහාය සමඟින්. එහි Hugging Face කාඩ්පත යාවත්කාලීන වී නොමැත: Model Version ක්ෂේත්රය තවමත් GR00T N1.7 EA ලෙස කියවෙයි. ගබඩාව නවතම ලේඛනයයි.
GR00T N1.5
එකම 3 B පරිමාණය, Eagle 2 backbone, SigLip2 සහ T5, flow-matching DiT head. එය පවතින්නේ ඔබ දැනටමත් ඇති එකක් පුළුල් කිරීමටයි. එය දුර්වල පෙරනිමියක් වීමට හේතු දෙකක් තිබේ: බරෙහි ඇත්තේ NVIDIA හි එක්-මාර්ග වාණිජ නොවන බලපත්රය වන අතර, වත්මන් LeRobot නිකුතු N1.5 සහාය ඉවත් කර ඇත. බලන්න .
Pi0.5
Physical Intelligence හි VLA, ප්රතිපත්ති වර්ගය pi05. මෙම පත්රිකාව PaliGemma වෙතින් ආරම්භ කරන ලද 2 B VLM එකක් සහ 300 M ක්රියාකාරී විශේෂඥයෙකු ලබා දෙයි, එය රොබෝවරයා 50 Hz වේගයකින් ධාවනය කරයි; LeRobot හි pi05 config පෙරනිමියෙන් 50-පියවර කැබැල්ලකට, එම වේගයෙන් තත්පරයකට සකසා ඇත. එහි විකුණුම් ලක්ෂ්යය වන්නේ නොදුටු ස්ථානයි: සැබෑ නිවෙස්වල ජංගම හැසිරවීම් පැය 400 ක් පමණ, සහ ස්ථාන 3, 12, 22, 53, 82 සහ 104 පුරා පරිමාණ අධ්යයනයක්, එහිදී 104-ස්ථාන ආකෘතිය පරීක්ෂණ නිවෙස්වලම පුහුණු කරන ලද පාලනයකට ගැලපේ.
එක් සීමාවක්, සඳහන් කර ඇත lerobot/pi05_base කාඩ්පතේ: වරාය රැගෙන යන්නේ ප්රවාහයට ගැලපෙන ක්රියා ශීර්ෂය පමණි. උප කාර්ය අනාවැකි, ක්රියා ටෝකනීකරණය සහ RL ඉහළට නිකුත් කර නොතිබූ අතර, openpi ද එහිම ගබඩාව ගැනද එයම පවසයි. Pi0.5 පිටුව සහ SO-100 මාර්ගෝපදේශය මත Pi0.5 ඉතිරිය ඇත.
Pi0.5 ට ගේට්ටු සහිත google/paligemma-3b-pt-224 ටෝකනයිසර් අවශ්ය වේ (gated: manual, ගූගල් පවසන්නේ ඉල්ලීම් වහාම සකසන බවයි). එය පිළිගෙන පුහුණු පරිසරය තුළ hf auth login ධාවනය නොකර, කාර්යය ආරම්භ වී, ටික වේලාවක් බාගත වී, පසුව ජාල දෝෂයක් ලෙස පෙනෙන අවසර දෝෂයකින් මිය යයි. nvidia/GR00T-N1.7-3B ගේට්ටු සහිත නොවේ, නමුත් එහි nvidia/Cosmos-Reason2-2B පසුබිම ගේට්ටු සහිත වේ (gated: auto). පෝලිම්ගත කිරීමට පෙර දෙකම ඉවත් කරන්න; ධාවනයක් අක්රියව තිබේ නම්, ඇලී ඇති පෝලිම් පිටුව පරීක්ෂා කළ යුතු දේ ලැයිස්තුගත කරයි.
SmolVLA
ක්රියා විශේෂඥයා තුළ 100 M පමණ වන, 450 M පරාමිති, SmolVLM-2 මත VLM ශීත කළ විට සහ එහි පළමු භාෂා-ආකෘති ස්ථර 16 පමණක් භාවිතා කරන ලදී. පූර්ව පුහුණුව ප්රජා දත්ත විය: 481 දත්ත කට්ටල, 10.6 M රාමු, ඔබ භාවිතා කරන ලාභ අත් වලින්. මෙහි ඇති එකම VLA එක 24 GB කාඩ්පතකට ගැලපෙන අතර, එකම 30 කථාංගය තට්ටුව. බලන්න SmolVLA පිටුව.
ACT
පදනම් ආකෘතියක් නොවේ. ALOHA වෙතින් ලැබෙන Action Chunking Transformer යනු කාර්යයක් සඳහා මුල සිටම පුහුණු කරන ලද, 50 Hz දී නිරූපණ 50ක් මත පදනම් වූ, දළ වශයෙන් 80 M පරාමිති සහිත ආකෘතියකි. මෙම පත්රිකාව මගින් එක් එක් නිරූපණයන් විනාඩි දහයක් පමණ වන සත්ය ද්වි-අත් කාර්යයන් හයක් වාර්තා කරන අතර, එය ඉස්මතු කරන උදාහරණ මත 80 සිට 90 දක්වා ප්රතිශතයක් සාර්ථකත්වය පෙන්වයි. එහි අදහස, ක්රියා ඛණ්ඩනය, මෙම පිටුවේ ඇති සෑම ආකෘතියකම පවතී, තවද එහි ඇබ්ලේෂන් මගින් තවමත් හොඳම බලපෑම මනිනු ලැබේ: තාවකාලික එන්සෙම්බල් කිරීම අක්රිය කර ඇති අනුකරණය කරන ලද කාර්යයන් දෙකක් හරහා, k=1 හිදී 1 ප්රතිශතයේ සිට k=100 හිදී 44 ප්රතිශතය දක්වා සාර්ථකත්වය ඉහළ යයි. ACT පිටුව ඉතිරිය ඇත.
බෙන්ච්මාර්ක් ඇත්ත වශයෙන්ම පවසන්නේ කුමක්ද
මෙම පහෙන් තුනක් වාර්තා කරන එකම බෙන්ච්මාර්කය LIBERO වේ: අනුකරණය කරන ලද Franka Panda මත භාෂා-නියමිත කාර්යයන්, පහත දැක්වෙන සූට් හතරකට බෙදා ඇති අතර එක් එක් සූට් එකේ කාර්යයන් දහය බැගින් ඇත. NVIDIA එක් එක් සූට් එක සඳහා අත්හදා බැලීම් 200ක් සිදු කළේය.
| ආකෘතිය | අවකාශීය | වස්තුව | ඉලක්කය | 10 (දිගු) | සාමාන්යය |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
සෑම අංකයක්ම විවිධ පරීක්ෂණ ක්රමවේදයකින් සහ අයවැයකින් ලබාගෙන ඇත. GR00T ගෝලීය කණ්ඩායම් 640ක් යටතේ පියවර 20Kක් ධාවනය කරන ලදී; openpi අගය 30K පරීක්ෂණ ලක්ෂ්යයකි; LeRobot port එක LIBERO මූලික ආකෘතියට පියවර 6Kක් එකතු කරන ලදී. SmolVLA තවදුරටත් නොගැලපීමකි: එහි පත්රිකාව එම පේළිය LIBERO මත මුල සිටම පුහුණු කරයි, VLA පූර්ව පුහුණුවකින් තොරව, ඉහත තුන පූර්ව පුහුණු කරන ලද පරීක්ෂණ ලක්ෂ්ය සියුම් ලෙස සකස් කරයි. 96.85 සිට 97.5 දක්වා එක් පොකුරක් ලෙස සලකන්න, සහ 87.3% දක්වා ඇති පරතරය සැබෑ ලෙස සලකන්න, නමුත් එය පරාමිති 6.7 ගුණයකින් මිලදී ගෙන ඇත.
SimplerEnv ව්යාප්තිය පෙන්වයි, එය LIBERO නොපෙන්වයි. NVIDIA N1.7 N1.6 සමඟ සංසන්දනය කරයි, එයට ආසන්නතම පොදු දෙය පරම්පරාගත වෙනසකි.
| SimplerEnv කට්ටලය | N1.6 සාමාන්යය | N1.7 සාමාන්යය | හොඳම වෙනස | නරකම වෙනස |
|---|---|---|---|---|
| Bridge (WidowX), කාර්යයන් 7 | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), කාර්යයන් 6 | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | කිසිවක් නැත, සෑම කාර්යයක්ම වැඩි දියුණු විය |
බ්රිජ් පේළිය ප්රයෝජනවත් එකකි: සාමාන්යයෙන් ලකුණු 5.7ක් ලබාගෙන ඇත put_eggplant_in_basket 36ක් අහිමි වූ අතර put_eggplant_in_sink 33 සිට 2 දක්වා පහත වැටුණි. නව පරම්පරාවක් එය ඉහළ නැංවීමට වඩා ව්යාප්තිය චලනය කරයි, එබැවින් ඔබේ කාර්යය N1.7 පසුබෑමට ලක් වූ තැන පිහිටා තිබේ නම්, සාමාන්යය කිසිවක් නොකියයි.

පහෙන්, SmolVLA පත්රිකාව පමණක් SO-100 පන්තියේ අතක් පිළිබඳව වාර්තා කරයි: කාර්යයන් තුනක් හරහා SmolVLA සඳහා සියයට 78.3ක් සහ Pi0 සඳහා 61.7ක්, දෙකම බහු-කාර්ය, ACT පුහුණු තනි-කාර්යය සඳහා 48.3ට එරෙහිව, එය සමාන නොවේ. පිරිසිදු යුගලනය SO-101 තෝරාගැනීම සහ තැබීම මත තනි-කාර්යය වේ: ව්යාප්තියේ 70ට එරෙහිව 90, එයින් පිටත 40ට එරෙහිව 50. සසඳන්න ACT SmolVLAට එරෙහිව සහ Pi0.5 SmolVLAට එරෙහිව, නැතහොත් පිරික්සන්න ක්රීඩාංගණය.
ප්රමාදය සහ පිරිවැය යෙදවීම තීරණය කරයි
අනුමාන ප්රමාදය යනු මිනිසුන් අවසානයට සොයා ගන්නා සහ මුලින්ම පසුතැවෙන සීමාවයි. මිණුම් සලකුණක ලකුණු පහකින් වඩා හොඳ නමුත් එක් ක්රියාකාරී පියවරකට තත්පර භාගයක් ගතවන ප්රතිපත්තියක් ඔබේ මේසය මත නරක ලෙස පෙනේ: ස්පර්ශ ගතිකත්වය බලා නොසිටියි.
එක් අවවාදයක්: GR00T අගය NVIDIA හි කාඩ්පත සමඟ නොගැලපේ, එය H100 මත eager mode හි 85.8 ms දී 4 denoising steps සහ එක් කැමරාවක්, torch.compile සමඟ 48.6 ms, සම්පූර්ණ TensorRT හරහා 27.9 ms ලෙස වේලාව සටහන් කරයි. මෙහි ඇති 152 ms යනු සේවා සැපයීමේ අමතර වියදම් සහ එක් කැමරාවකට වඩා වැඩි ගණනක් සහිත සම්පූර්ණ-ස්ටැක් අගයකි, එය forward pass එකක් නොවේ.
20 සිට 485 ms දක්වා ලූපය ආකෘතියේ වන අතර, පොදු අන්තර්ජාලයේ ගමන් කාලය එයට එකතු වේ. දුරස්ථ අනුමානය මන්දගාමී pick-and-place සඳහා ශක්ය වේ, වේගවත් ප්රතික්රියාශීලී චලනයන් සඳහා නොවේ. ඔබේ කාර්යයට වේගය අවශ්ය නම්, අනුමානය servos අසල පිහිටා ඇත: ACT හෝ SmolVLA, දේශීයව. අදාළ: ප්රතිපත්තිය චලනය මැදදී නතර වේ.
ආකෘතිය වෙනස් නොකර කාලය ලබා ගැනීමට එක් ක්රමයක්: SmolVLA පත්රිකාව සමමුහුර්ත ක්රියාත්මක කිරීම මනිනු ලබයි, එහිදී ප්රතිපත්තිය ඊළඟ එක පුරෝකථනය කිරීමට පෙර කොටසක් අවසන් කරයි, අසමමුහුර්ත ක්රියාත්මක කිරීමට එරෙහිව, එහිදී පුරෝකථනය ක්රියාත්මක කිරීම සමඟ අතිච්ඡාදනය වේ. සාර්ථකත්වය සමාන වේ, 78.3 එදිරිව 73.3, නමුත් එම pick-and-place සඳහා 13.75 වෙනුවට තත්පර 9.7 ක් ගතවේ, සහ ස්ථාවර කවුළුවක රොබෝවරයා 9 වෙනුවට චක්ර 19 ක් කළමනාකරණය කරයි.
බලපත්ර, කිසිවෙකු ඒවා පරීක්ෂා නොකරන නිසා පරීක්ෂා කරන ලදී
| ආකෘතිය | Weights බලපත්රය | කේත බලපත්රය | වාණිජ භාවිතය |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; කාඩ්පත වාණිජ භාවිතයට ඉඩ දෙයි | Apache 2.0 | ඔව් |
| GR00T N1.5 | NVIDIA ඒකපාර්ශ්වික වාණිජ නොවන බලපත්රය | Apache 2.0 | නැත |
| Pi0.5 | pi05_base කාඩ්පතේ metadata හි license: gemma ලෙස සඳහන් වේ | Apache 2.0 (openpi, LeRobot docs) | දෙකම කියවන්න, ඒවා එකඟ නොවේ |
| SmolVLA | smolvla_base කාඩ්පතේ බලපත්ර ක්ෂේත්රයක් නොමැත | Apache 2.0 (LeRobot) | කේතය ඔව්, weights සඳහන් කර නැත |
| ACT | මූලික weights නොපවතී | Apache 2.0 (LeRobot) | ඔව් |
Pi0.5 පේළියට අවධානය යොමු කළ යුතුය. LeRobot pi05 ලේඛනගත කිරීම openpi සමඟ අනුකූලව Apache 2.0 බව සඳහන් කරයි, Hub කාඩ්පත සඳහා lerobot/pi05_base දරයි license: gemma. දෙකම සක්රීයයි. GR00T N1.7 සතුව මෘදු අනුවාදයක් ඇත: Isaac-GR00T README හි N1.7 Apache 2.0 යටතේ සම්පූර්ණයෙන්ම වාණිජමය වශයෙන් බලපත්රගත කළ හැකි බව සඳහන් වේ, එහිම බලපත්ර කොටස සහ model card මඟින් කේතය පමණක් Apache 2.0 යටතේ ද weights NVIDIA Open Model License යටතේ ද තබා ඇත.
ඔබ සැබවින්ම ක්රියාත්මක කරන පෙරනිමි
සෑම පුහුණුකරුවෙකුගේම ආකෘතියක් පෙරනිමියක් සමඟ එන අතර ඒවා අත්තනෝමතික නොවේ. ACT හි ඒවා LeRobot ගේම වේ: batch 8, lr 1e-5, 100000 පුහුණු පියවර, chunk size 100, ACTConfig upstream සමඟ ගැලපෙන අතර k=100 ACT පත්රිකාවෙන්. පහත එක් තීරුවක් උගුලකි.
| ප්රතිපත්තිය | කණ්ඩායම | LR | උපරිම පියවර | Grad accum | අදාළද? | අමතර පාලක |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ඔව් | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ඔව් | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | නැත (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | නැත | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | නැත | chunkSize, nActionSteps, seed, logFreq |
GR00T හි fine-tuning ඇතුල්වීමේ ලක්ෂ්යය (launch_finetune.py, tyro CLI එකක්) සතුව seed field එකක් නොමැත එහි config dataclass හි, එබැවින් ධාවනයන් bit-for-bit ප්රතිනිෂ්පාදනය කළ නොහැක. repo එක ද අනතුරු අඟවයි ධාවනයන් අතර 5 සිට 6 දක්වා ප්රතිශත විචලනයක් non-deterministic image augmentations වලින්, එය බොහෝ benchmark හි පරතරයන්ට වඩා විශාල වන අතර ඒවා අන්තර්ජාලය හරහා විවාදයට ලක්වේ. LeRobot හි පෙරනිමි seed අගය 1000 වේ. grad-accum තීරුව විස්තර කරයි lerobot 0.5.1; upstream 0.6.2 එය නිරාවරණය කරයි --accelerator.gradient_accumulation.steps.
මොඩලයක් තෝරා ගැනීමට වඩා වැදගත් වන පාලකය
මෙය ක්රියාකාරී කොටසයි. දිගු කොටස් සුමට චලනයක් සහ අඩු සංයෝග දෝෂ ලබා දෙයි, නමුත් කොටස ක්රියාත්මක වන විට ප්රතිපත්තිය කැපවී ඇති බැවින්, චලනය වන ඕනෑම දෙයකට එය ප්රමාද වී ප්රතිචාර දක්වයි: ස්ථිතික ඝනකයක් මත විශ්වාසයෙන් යුක්ත වන අතර, පෙරළෙන එකක් මත බලාපොරොත්තු රහිතය. එය ඉලක්කය ඉක්මවා ගියහොත්, ක්රියාත්මක කළ කොටස කෙටි කිරීම නැවත පුහුණු කිරීමට වඩා හොඳ වන අතර එය නොමිලේ. කෙටියෙන් නතර වන සන්ධියක් වෙනස් ගැටලුවකි; බලන්න .
- ACT: ACTConfig පෙරනිමියෙන්
chunk_size 100සහn_action_steps 100වේ. තාවකාලික සමූහකරණය අක්රිය කර ඇති අතරn_action_steps 1අවශ්ය වේ. - GR00T N1.7: අභ්යන්තර ක්ෂිතිජය 16 සිට 40 දක්වා වැඩි විය, නමුත් LeRobot's SO-101 example තවමත්
--policy.chunk_size=16 --policy.n_action_steps=16ධාවනය කරයි. The rollout flag was renamed to--execution-horizon. - Pi0.5: පියවර 50 ක කොටසක්, එයින් LeRobot's LIBERO recipe 10 ක්
--policy.n_action_steps=10හරහා ක්රියාත්මක කරයි; ඔබ flag එක අතහැර දැමුවහොත්--policy.pretrained_pathසමඟ එය 50 දක්වා ආපසු හැරේ. - SmolVLA: ක්රියා 50 ක කොටස්, පාලක දෙකම නිරාවරණය කර ඇත.
එක දහවල් කාලයකදී පහම පරීක්ෂා කරන්නේ කෙසේද
ලාභම පිළිතුර වැඩිපුර කියවීම නොවේ. 15 USD පමණ වැය කර අතට ඔබට කියන්නට ඉඩ දෙන්න: එක් වරක් පටිගත කරන්න, පළමුව ලාභ ආකෘතිය පුහුණු කරන්න, දත්ත නිවැරදි බව ඔප්පු වූ පසු එය වැඩි කරන්න. ව්යුහය පරිමාවට වඩා හොඳයි, එය සහ හි අරමුණයි.
- 1කථාංග 50ක් එක් වරක් වාර්තා කරන්න
GR00T, Pi0.5 සහ ACT සඳහා පදනම 50ක් ද, SmolVLA සඳහා 30ක් ද සකස් කරයි. විවිධත්වය තුනී නොකර එක් එක් වෙනස්කම් නැවත කරන්න: පුහුණු කරන ලද ඝනක ස්ථාන 5ක් හරහා කථාංග 50ක්, ඉන් 25ක් පුහුණු නොකළේය. ඔබේ පළමු දත්ත කට්ටලය වාර්තා කරන්න බලන්න.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ACT මුලින්ම පුහුණු කරන්න, මන්ද එය ඔබට බොරු කිව නොහැක
පෙර පුහුණු කළ බර නොමැත, එබැවින් එය කාර්යය කරන්නේ නම්, ඔබේ දත්ත කට්ටලයේ කාර්යය අඩංගු වේ. ACT අක්රිය වුවහොත්, දත්ත නිවැරදි කරන්න. 24 GB කාඩ්පතක 1 සිට 3 USD, පැය 2 සිට 5 දක්වා.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3එකම දත්ත කට්ටලය මත SmolVLA වෙනස් නොකර ධාවනය කරන්න
එකම දත්ත, එකම අත, 80 M වෙනුවට 450 M පරාමිති, සහ භාෂා තත්ත්වකරණය. LeRobot A100 එකක 20K පියවර ධාවනයක් දළ වශයෙන් පැය 4ක් ලෙස සලකයි. පෙර පුහුණුවෙන් යමක් ලැබේදැයි මෙය ඔබට කියයි.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T ස්පර්ශ කිරීමට පෙර v2.1 දක්වා පරිවර්තනය කරන්න
GR00T LeRobot v2 ආකෘතියේ රසයක් කියවයි, ඊට අමතරව
meta/modality.jsonඑකතු කරන ලද තත්ත්ව සහ ක්රියා අරා නම් කරන ලද ක්ෂේත්රවලට බෙදෙන ආකාරය සිතියම්ගත කරයි. v3.0 දත්ත කට්ටලයක් එම ලෝඩරය බිඳ දමයි, මන්ද v3.0 බොහෝ කථාංග පොදු ගොනු වලට ඇසුරුම් කරන අතර v2 එක් කථාංගයකට එකක් ලිවීය. Isaac-GR00Tscripts/lerobot_conversion/convert_v3_to_v2.pyලෙස පහත හෙලීමේ සහායකය නැව්ගත කරයි; v3 ප්රතික්ෂේප කිරීමේ පිටුව වේගවත් මාර්ගයයි.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5පළමු දෙකෙන් යමක් ඉතිරි වී ඇත්නම් පමණක් GR00T N1.7 වෙත යොමු වන්න
මෙහි පෙන්වා ඇති NVIDIA හි CLI හරහා, හෝ LeRobot හි
grootප්රතිපත්ති වර්ගය හරහා. NVIDIA සියුම් සුසර කිරීම සඳහා 40 GB හෝ ඊට වැඩි VRAM, අනුමානය සඳහා 16 GB නිර්දේශ කරයි. OOM එකකදී, OOM පිටුව බලන්න.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
එම පරීක්ෂණ ධාවනය කිරීමට ක්රම දෙකක්
මෙවලම් දාම එකට නොපවතින නිසා පරිසර තුනක්. ප්රධාන LeRobot 0.6.2 වන අතර Python 3.12 හෝ නවතම අවශ්ය වේ; Isaac-GR00T සහ openpi යනු වෙනම uv-කළමනාකරණය කරන ලද ගබඩා වේ.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0 එහි එකම වීඩියෝ පසුබිම ලෙස සලකයි, FFmpeg 4 සිට 7 දක්වා අවශ්ය වේ. FFmpeg 8 සහය නොදක්වයි, AV1 සහතික නොවේ. - openpi මතක සීමා: 8 GB ට වැඩි අනුමානය, 22.5 GB ට වැඩි LoRA, 70 GB ට වැඩි සම්පූර්ණ සියුම් සුසර කිරීම. අවසාන එක Pi0.5 A100 කාර්යයක් වීමට හේතුවයි.
- GPU එක ඔබම කුලියට ගන්න, පසුව එය විනාශ කරන්න, චෙක්පොයින්ට් මාර්ග කට්ටල තුනක් අතින් සමථයකට පත් කරන්න.
එකම මාදිලි පහ, එක් ආකෘතියක්. මාදිලිය, දත්ත කට්ටලය සහ අධිපරාමිති තෝරන්න; පසුබිම අවශ්ය VRAM ප්රමාණයට අනුව GPU එකක් කුලියට ගනී, පුහුණුකරු ධාවනය කර චෙක්පොයින්ට් වස්තු ගබඩාවට ලියයි.
- The පුහුණු අනුකෘතිය යනු මාදිලි පහක් සහ අත් හතරක් වන අතර, සෑම කොටුවක්ම මාර්ගෝපදේශයකි: SO-100 මත SmolVLA, SO-101 මත ACT.
- අනුමාන පොඩ්
/api/inference/podමගින් ස්වයංක්රීයව සපයනු ලබන්නේ අක්රිය මුරකරුවෙකු සමඟිනි, එබැවින් අමතක වූ පොඩ් එකක් නිහඬව බිල්පත් නොකරයි. - මූලික චෙක්පොයින්ට් යනු විකුණුම්කරුවන්ගේම ඒවාය:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT සතුව කිසිවක් නොමැත. - Same operations from CLI වෙතින් සහ MCP සේවාදායකය හරහා AI නියෝජිතයන්ගෙන් එකම මෙහෙයුම්.
- දෘඪාංග නැද්ද? සජීවී අත ලියාපදිංචියකින් තොරව භෞතික SO-100ක් විකාශනය කරයි; උත්සාහ කිරීමේ පිටුව ඇතුල් වීමේ මාර්ග පෙන්වයි.
මූලික ආකෘතිය හෝ මුල සිට
තෝරාගත යුතු 3 B මාදිලිය කුමක්ද යන්න සැබෑ ගැටලුව නොවේ. එය පුහුණු කරන ලද VLA එකක් කිසිසේත් භාවිතා කළ යුතුද යන්නයි, ලබා දී ඇති පරිදි ACT විසින් සැබෑ ද්වි-අත් කාර්යයන් හයක්, එක් එක් මිනිත්තු දහයක පමණ නිරූපණ වලින්, 80 M පරාමිති සමඟින් ඉගෙන ගත් බවත් කිසිවක් පෙර පුහුණු කර නොතිබූ බවත්ය.
- භාෂා අනුවර්තනය. ACT සතුව කිසිවක් නැත; එක් ACT චෙක්පොයින්ට් එකක් එක් කාර්යයක් කරයි.
- ඔබේ නිරූපණවල නොමැති වස්තූන් මත වඩා හොඳයි: SO-101 මත, ACT හි 40% ට සාපේක්ෂව 50% ක් බෙදාහැරීමෙන් පිටත.
- බහු-කාර්යයන්: SmolVLA එක් චෙක්පොයින්ට් එකක් සමඟ SO-100 කාර්යයන් තුනක් හරහා 78.3% ක් කරා ළඟා වේ; ACT ධාවනය කරන ලද්දේ තනි කාර්යයක් ලෙස පමණි.
- 7.6x සිට 24x දක්වා ප්රමාදය: ACT හි 20 ms ට සාපේක්ෂව එක් ක්රියාකාරී පියවරකට 152 සිට 485 ms.
- 1 සිට 3 වෙනුවට එක් ධාවනයකට 4 සිට 12 USD, සහ ඕනෑම 24 GB කාඩ්පතක් වෙනුවට A100 ස්ථරයක්.
- බලපත්ර නිරාවරණය, තවද මුල සිට නොපවතින gated-repo අසාර්ථක මාදිලියක්.
- පෙර පුහුණු කරන ලද බර නරක දත්ත කට්ටලයක් ආවරණය කළ හැකිය. බිඳුණු දත්ත මත අඩක් ක්රියා කරන සියුම් ගැලපීමක් දත්ත දෙස බැලීමට පෙර සතියක් වැය වේ.
පැරණි ධාවනයක් ප්රතිනිෂ්පාදනය කිරීමේ අවස්ථාව
2025 චෙක්පොයින්ට් එකක් පසුපස හඹා යාමෙන් ඔබට ආකෘති තේරීම සිදු වන අතර ගැටලුව අනුවාද ඇණ ගැසීමක් බවට පත් කරයි: වත්මන් LeRobot N1.5 ප්රතික්ෂේප කරයි, එබැවින් ඔබ lerobot==0.5.1. බීජ ක්ෂේත්රයක් නොමැතිව සහ ධාවනයන් අතර 5 සිට 6 ප්රතිශත විචලනයක් සමඟ , ප්රතිනිෂ්පාදනය ඉදිකිරීම අනුව ආසන්න වේ. SO-100 මාර්ගෝපදේශය මත N1.5 සහ N1.5 ප්රතිපත්ති පිටුව වේදිකා පැත්ත ඇත.

දෙකක් දක්වා? ACT එදිරිව GR00T N1.7 සහ GR00T N1.7 එදිරිව SmolVLA. අමු පේළි අරීනා ඇතුළත් කිරීම් වල ඇත: GR00T N1.7, Pi0.5, SmolVLA සහ ACT.
මෙම වේදිකාව ඔබට උදව් නොකරන තැන්
- එය දුරස්ථ අනුමාන කිරීම් වේගවත් කළ නොහැක. 20 සිට 485 ms දක්වා වූ ලූපය ආකෘතියට අයත් වේ; අන්තර්ජාල වට සංචාර එයට එකතු වේ.
- එය ඔබේම දෘඪාංග මත GR00T හෝ Pi0.5 සියුම්ව සුසර කළ නොහැක. මෙහිදී දෙකම වලාකුළු-පමණි; SmolVLA සහ ACT පමණක් දේශීයව ක්රියාත්මක වේ.
- එය දත්ත කට්ටලයක් නිවැරදි කළ නොහැක. පාඩුව අඩු වුවත් ප්රතිපත්තිය කිසිවක් නොකරයි යනු දත්ත ගැටලුවකි, එක් සැකසුමක පමණක් ක්රියා කරන ප්රතිපත්තියක් යනු ආවරණ ගැටලුවකි.
- එය GR00T ධාවන නැවත නිපදවිය නොහැක: ඉහළ ධාරාවේ වින්යාසයට seed ක්ෂේත්රයක් නොමැත.
මාදිලි 85ක්, මිණුම් සලකුණු ප්රතිඵල 332ක්, සෑම අංකයක්ම එහි මූලාශ්රයට සම්බන්ධ කර ඇත
මෙම පිටුවේ ඇති වගු වල වර්ග කළ හැකි අනුවාදය: 85 දෘශ්ය-භාෂා-ක්රියාකාරී මාදිලි, 332 මිණුම් සලකුණු ප්රතිඵල, ඒ සෑම එකක්ම එහි පත්රිකාවට හෝ මාදිලි කාඩ්පතට සම්බන්ධ කර ඇත.
අරීනා විවෘත කරන්නඑකක් තෝරාගෙන ඉදිරියට යාම
එක් පෙරනිමියක්: කථාංග 50ක් පටිගත කරන්න, දත්ත කට්ටලය ඔප්පු කිරීමට ACT ඩොලර් 1 සිට 3 දක්වා පුහුණු කරන්න, ඉන්පසු SmolVLA එකම දත්ත මත. එකට ඩොලර් 6කට අඩුවෙන්, ඔවුන් වැදගත් ප්රශ්නයට පිළිතුරු සපයයි: මෙහි පූර්ව පුහුණුව උපකාරී වේද, නැතහොත් බාධාව දත්තද යන්න. ස්පර්ශ බහුල බහු-පියවර කාර්යයන් සඳහා GR00T N1.7 වෙත, දර්ශනය වෙනස් වන විට Pi0.5 වෙත දර්ශනය වෙනස් වේ.
වේදිකා මාර්ගෝපදේශය: ඔබේ පළමු ප්රතිපත්තිය පුහුණු කරන්න, ඉන්පසු ඔබේ පළමු ප්රතිපත්තිය ක්රියාත්මක කරන්න. එම පුහුණු ලේඛන සහ දත්ත කට්ටල ලේඛන ආකෘතිය සහ සැකැස්ම ආවරණය කරයි; SO-100 පිටුව සහ සම්පූර්ණ SO-100 මාර්ගෝපදේශය ගොඩනැගීම සහ ක්රමාංකනය ආවරණය කරයි. පසුබිම: VLA දළ විශ්ලේෂණය සහ Pi0 ප්රවාහ-ගැලපෙන ලිපිය. ඔබේ සාර්ථකත්ව අනුපාතය ඉහළ නංවන එක වන්නේ දත්ත තත්ත්ව මාර්ගෝපදේශය.
SO-100 එකකදී මම මුලින්ම පුහුණු කළ යුත්තේ කුමන VLA ප්රතිපත්තියද?▾
ACT, පසුව SmolVLA. ACT මුල සිටම පුහුණු වන නිසා, එයට නරක දත්ත කට්ටලයක් ආවරණය කළ නොහැක, තවද 24 GB කාඩ්පතක එක් ධාවනයකට 1 සිට 3 USD දක්වා වැය වේ. ACT එම කාර්යය සිදු කරන්නේ නම්, GR00T N1.7 හෝ Pi0.5 ධාවනයක් සඳහා වැය වන 4 සිට 12 USD නාස්ති නොවේ.
GR00T N1.7 ඇත්තටම Pi0.5 වලට වඩා හොඳද?▾
LIBERO මත ඒවා ශබ්ද සීමාව තුළ පවතී: GR00T N1.7 සඳහා සූට් හතරක් හරහා 97.0%, openpi හි 30k පියවර වලදී Pi0.5 සඳහා 96.85%, LeRobot port එක සඳහා 97.5%, මේ සියල්ල විවිධ harnesses වලින්. සැබෑ වෙනස්කම් වන්නේ එක් ක්රියා පියවරකට 152 ms එදිරිව 485 ms, v2.1 දත්ත කට්ටල එදිරිව v3.0, සහ benchmark නිරවද්යතාවය එදිරිව open-world generalization ය.
මට මේවායින් ඕනෑම එකක් තනි RTX 4090 එකක fine-tune කළ හැකිද?▾
SmolVLA සහ ACT, ඔව්; දෙකම RTX 4090 හෝ ඕනෑම 24 GB කාඩ්පතක් සඳහා ලැයිස්තුගත කර ඇති අතර දේශීයව ධාවනය වේ. GR00T N1.7, N1.5 සහ Pi0.5 සඳහා A100 හෝ H100 80 GB අවශ්ය වන අතර මෙහිදී cloud-only වේ. NVIDIA GR00T fine-tuning සඳහා 40 GB හෝ ඊට වැඩි ප්රමාණයක් නිර්දේශ කරයි; openpi හි අවම අවශ්යතාවය සම්පූර්ණ Pi0.5 fine-tune එකක් සඳහා 70 GB ට වැඩි වන අතර, LoRA සඳහා 22.5 GB වේ.
මේ පහෙන් මට වාණිජමය වශයෙන් භාවිතා කළ හැක්කේ කුමක්ද?▾
GR00T N1.7 weights NVIDIA Open Model License Agreement යටතේ පවතී, එය කාඩ්පතේ සඳහන් වන පරිදි වාණිජමය භාවිතය ආවරණය කරයි. N1.5 weights වාණිජමය නොවේ. SmolVLA හි කේතය LeRobot හි Apache 2.0 වේ, නමුත් lerobot/smolvla_base කාඩ්පතේ බලපත්ර ක්ෂේත්රයක් නොමැති බැවින් weights සඳහන් කර නොමැත. ACT හට බලපත්ර ලබා දීමට මූලික weights නොමැත. Pi0.5 අපැහැදිලිය: LeRobot හි docs Apache 2.0 යැයි කියයි, එහි card metadata හි license: gemma ලෙස සඳහන් වේ.
Sources
- NVIDIA Isaac-GR00T repository: GA තත්ත්වය, N1.6 සිට N1.7 දක්වා වෙනස්කම්, දෘඪාංග අවශ්යතා, torchcodec සහ FFmpeg සීමා, launch_finetune.py, ධාවනයෙන් ධාවනයට විචලනය
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 සහ T5, flow matching DiT, එක්-මාර්ග වාණිජමය නොවන බලපත්රය
- Isaac-GR00T LIBERO උදාහරණය: 20K පියවර සහ batch size 640 දී එක් සූට් එකකට සාර්ථකත්ව අනුපාත, එක් සූට් එකකට අත්හදා බැලීම් 200
- Isaac-GR00T SimplerEnv උදාහරණය: එක් කාර්යයකට Bridge සහ Fractal සාර්ථකත්ව අනුපාත, GR00T N1.6 එදිරිව N1.7
- pi0.5: Open-World Generalization සහිත Vision-Language-Action Model එකක් (2 B VLM සහ 300 M action expert, 50 Hz control, ජංගම හැසිරවීම් පැය 400ක් පමණ, ස්ථාන 3 සිට 104 දක්වා පරිමාණ අධ්යයනය)
- openpi repository: GPU memory floors, flow-matching-head-only scope, සහ examples/libero හි Pi0.5 LIBERO ප්රතිඵල
- lerobot/pi05_base model card: LeRobot port හි විෂය පථය, license: gemma metadata, lerobot-train භාවිතය
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 ප්රකාශය
- SmolVLA: දැරිය හැකි සහ කාර්යක්ෂම රොබෝ විද්යාව සඳහා Vision-Language-Action Model එකක් (450 M parameters, LIBERO සහ Meta-World tables, SO-100 සහ SO-101 ප්රතිඵල, async inference)
- LeRobot SmolVLA documentation: ස්ථාන 5ක් හරහා කථාංග 50ක් එදිරිව 25, A100 එකක පැය 4ක් පමණ ඇතුළත 20k පියවර
- අඩු වියදම් දෘඪාංග සමඟ සියුම් ද්වි-අත් හැසිරවීම් ඉගෙනීම (ACT සහ ALOHA): 80-90 ප්රතිශතයකින් කාර්යයන් 6ක්, k=1 සිට k=100 දක්වා chunk size ablation
- LeRobot 0.6.2: ACTConfig සහ SmolVLAConfig defaults, default seed 1000, --accelerator.gradient_accumulation.steps, Python 3.12 අවශ්යතාවය, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 සහාය ඉවත් කර ඇත, pin lerobot==0.5.1, SO-101 chunk size උදාහරණය
- lerobot/smolvla_base model card: --policy.path මගින් භාවිතා කරන SmolVLA base checkpoint, සහ එහි card metadata, එහි බලපත්ර ක්ෂේත්රයක් නොමැත
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started