AY-Robots ප්‍රතිපත්ති සංසන්දන වගුව GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA සහ ACT එක ළඟින් පෙන්වයි, පරාමිති ගණන, GPU ස්ථරය, අනුමාන ප්‍රමාදය සහ අවම කථාංග ගණන සමඟින්
vla-මාදිලිප්‍රතිපත්ති-පුහුණුවමාදිලි-තේරීමlerobotso-100

2026 දී ඔබ පුහුණු කළ යුතු කුමන VLA ප්‍රතිපත්තියක්ද?

AY-Robots ResearchAugust 23, 202618 මිනිත්තු කියවීම

GR00T N1.7, Pi0.5, SmolVLA, ACT හෝ GR00T N1.5? සැබෑ තත්වයන්ට ගැලපෙන තීරණ වගුවක්, ප්‍රකාශිත මිණුම් සලකුණු අංක, ප්‍රමාදය, එක් ධාවනයකට වැයවන පිරිවැය සහ එක් එක් තේරීම පිටුපස ඇති බලපත්‍ර සමඟින්.

අද වන විට SO-100 පන්තියේ රොබෝ අතක් මත ප්‍රතිපත්ති පහක් පුහුණු කළ හැක. ඒවා අනුමාන කිරීමේ ප්‍රමාදය 24 ගුණයකින්, පරාමිති ගණන 37 ගුණයකින් සහ එක් ධාවනයක පිරිවැය 12 ගුණයකින් වෙනස් වන අතර, ඔබට ප්‍රතිඵලය නැව්ගත කළ හැකිද යන්න මතද වෙනස් වේ. ආකෘති කාඩ්පත් පහක් එය විසඳන්නේ නැත: ඔබට ඇති ප්‍රශ්නයට කිසිවක් පිළිතුරු දෙන්නේ නැත, මා මුලින්ම ධාවනය කළ යුත්තේ කුමක්ද?

පහත සෑම අංකයක්ම 2026 අගෝස්තු මාසයේදී පත්‍රිකා, රිපෝ සහ කාඩ්පත් වලින් කියවන ලදී. වේදිකා අංක පැමිණෙන්නේ AY-Robots ප්‍රතිපත්ති නාමාවලිය වෙතින්ය; දෙක එකඟ නොවන තැන, දෙකම පෙන්වා ඇත.

කෙටි සාරාංශය

  • ඔබේ දත්ත කට්ටලය ගැන සැකයක් ඇත්නම් ACT මුලින්ම පුහුණු කරන්න: එක් ධාවනයකට 1 සිට 3 USD, නරක දත්ත ආවරණය කිරීමට පෙර පුහුණු කළ කිසිවක් නැත.
  • GR00T N1.7 සහ Pi0.5 LIBERO මත අර්ධ ලක්ෂයක් තුළ පිහිටා ඇත, 97.0 එදිරිව 96.85 සිට 97.5 දක්වා. එය කිසිවක් තෝරා ගැනීමට හේතුවක් නොවේ.
  • Pi0.5 යනු සාමාන්‍යකරණ ක්‍රීඩාව මිස නිරවද්‍යතා ක්‍රීඩාව නොවේ, තවද 485 ms දී වඩාත්ම මන්දගාමී වේ.
  • SmolVLA, 450 M පරාමිති සහිතව, මෙහි ඇති එකම VLA වන අතර එය එක් 24 GB කාඩ්පතක් මත සියුම් ලෙස සුසර කරයි.
  • 20 ms හි ACT යනු වේගවත් ප්‍රතික්‍රියාශීලී චලනය සඳහා ඇති එකම විකල්පයයි. බලපත්‍ර ඉතිරිය තීරණය කරයි.

තීරණ වගුව

ඔබේ තත්ත්වයමෙය පුහුණු කරන්නමන්ද
දත්ත කට්ටලයේ ගුණාත්මකභාවය සනාථ කර නොමැතACTපුහුණු නොකළ කිසිවක් බිඳුණු දත්ත කට්ටලයක් සඟවන්නේ නැත, අසාර්ථක වීම සඳහා 1 සිට 3 USD වැය වේ.
ස්පර්ශ බහුල, බහු-පියවර, භාෂා-නියමිතGR00T N1.7LIBERO කට්ටල හතරක් හරහා 97.0%, ඊට අමතරව සාපේක්ෂ අවසාන-ක්‍රියාකාරී ක්‍රියා අවකාශයක්.
වේගවත් ප්‍රතික්‍රියාශීලී චලනය, සර්වෝ වලදී අනුමානයACT20 ms. ඊළඟ වේගවත්ම එක 7.6 ගුණයකින් මන්දගාමී වේ.
නව වස්තූන්, නව දර්ශනය, විවෘත ලෝකයPi0.5104 ස්ථාන හරහා, බෙදාහැරීමෙන් පිටත හැසිරීම් සඳහා ගොඩනගා ඇත.
එක් 24 GB කාඩ්පතක්, තවමත් භාෂාව අවශ්‍යයිSmolVLA450 M පරාමිති, 30 කථාංග සීමාවක්, දේශීයව ක්‍රියාත්මක වේ.
2025 දී වාර්තා කරන ලද ධාවනයක් ප්‍රතිනිෂ්පාදනය කිරීමGR00T N1.5ඔබට අවශ්‍ය නම් පමණි: LeRobot දැන් එය ප්‍රතික්ෂේප කරයි, බර වාණිජ නොවේ.
මෙය නිෂ්පාදනයක් ලෙස නිකුත් කෙරේN1.7, SmolVLA or ACTN1.5 වාණිජ නොවේ, Pi0.5 Gemma නියමයන් දරයි, SmolVLA හි කාඩ්පත කිසිවක් සඳහන් නොකරයි.

අපේක්ෂකයින් පස්දෙනා

සියලුම පස්දෙනා ප්‍රතිපත්ති වේ: කැමරා රාමු, සන්ධි පිහිටීම් සහ, ඔවුන්ගෙන් හතර දෙනෙකු සඳහා, අනාගත සන්ධි ඉලක්ක සමූහයකට සිතියම්ගත කරන ලද භාෂා උපදෙස්. ඔවුන් වෙන් කරන්නේ කොපමණ ප්‍රමාණයක් ඔබ පැමිණීමට පෙර ඉගෙන ගෙන තිබේද යන්නයි.

ප්‍රතිපත්තියපරාමිතිප්‍රමාදයGPU ස්ථරයදේශීයද?අවම කථාංගආකෘතියපිරිවැය
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA හි වත්මන් දෘශ්‍ය-භාෂා-ක්‍රියාකාරී ආකෘතිය, දළ වශයෙන් පරාමිති බිලියන 3ක් පමණ, සියුම්-සුසර කිරීම අතරතුර මිලියන 40ක් පමණ පුහුණු කර ඇත. N1.6 සිට වෙනස්කම් ගබඩාවේ ලැයිස්තුගත කර ඇත: Eagle ආකෘතියක සිට Qwen3-VL මත Cosmos-Reason2-2B දක්වා වූ මූලික ව්‍යුහය, විසරණ ස්ථර 32 සිට 16 දක්වා, තත්ත්ව සහ ක්‍රියාකාරී මානයන් 29 සිට 132 දක්වා, ක්‍රියාකාරී ක්ෂිතිජය 16 සිට 40 දක්වා.

කුඩා අතක් මත වැදගත් වන්නේ සාපේක්ෂ අවසාන-ක්‍රියාකාරී ක්‍රියාකාරී අවකාශයයි: N1.7 පුරෝකථනය කරන්නේ වත්මන් ඉරියව්වෙන් ඇති වෙනස්කම් වන අතර, එය EgoScale මානව වීඩියෝ පැය 20K රොබෝ ප්‍රතිපත්තියකට මාරු කිරීමට ඉඩ සලසයි. N1.7 පිටුව මත පිරිවිතර, ක්‍රියා පටිපාටිය SO-100 මාර්ගෝපදේශය මත N1.7 හි ඇත.

ගබඩාවේ GA, ආකෘති කාඩ්පතේ EA

Isaac-GR00T README N1.7 සාමාන්‍ය ලබා ගත හැකි නිකුතුවක් ලෙස ප්‍රකාශ කරයි, සම්පූර්ණ මිණුම් සලකුණු සහ සහාය සමඟින්. එහි Hugging Face කාඩ්පත යාවත්කාලීන වී නොමැත: Model Version ක්ෂේත්‍රය තවමත් GR00T N1.7 EA ලෙස කියවෙයි. ගබඩාව නවතම ලේඛනයයි.

GR00T N1.5

එකම 3 B පරිමාණය, Eagle 2 backbone, SigLip2 සහ T5, flow-matching DiT head. එය පවතින්නේ ඔබ දැනටමත් ඇති එකක් පුළුල් කිරීමටයි. එය දුර්වල පෙරනිමියක් වීමට හේතු දෙකක් තිබේ: බරෙහි ඇත්තේ NVIDIA හි එක්-මාර්ග වාණිජ නොවන බලපත්‍රය වන අතර, වත්මන් LeRobot නිකුතු N1.5 සහාය ඉවත් කර ඇත. බලන්න .

Pi0.5

Physical Intelligence හි VLA, ප්‍රතිපත්ති වර්ගය pi05. මෙම පත්‍රිකාව PaliGemma වෙතින් ආරම්භ කරන ලද 2 B VLM එකක් සහ 300 M ක්‍රියාකාරී විශේෂඥයෙකු ලබා දෙයි, එය රොබෝවරයා 50 Hz වේගයකින් ධාවනය කරයි; LeRobot හි pi05 config පෙරනිමියෙන් 50-පියවර කැබැල්ලකට, එම වේගයෙන් තත්පරයකට සකසා ඇත. එහි විකුණුම් ලක්ෂ්‍යය වන්නේ නොදුටු ස්ථානයි: සැබෑ නිවෙස්වල ජංගම හැසිරවීම් පැය 400 ක් පමණ, සහ ස්ථාන 3, 12, 22, 53, 82 සහ 104 පුරා පරිමාණ අධ්‍යයනයක්, එහිදී 104-ස්ථාන ආකෘතිය පරීක්ෂණ නිවෙස්වලම පුහුණු කරන ලද පාලනයකට ගැලපේ.

එක් සීමාවක්, සඳහන් කර ඇත lerobot/pi05_base කාඩ්පතේ: වරාය රැගෙන යන්නේ ප්‍රවාහයට ගැලපෙන ක්‍රියා ශීර්ෂය පමණි. උප කාර්ය අනාවැකි, ක්‍රියා ටෝකනීකරණය සහ RL ඉහළට නිකුත් කර නොතිබූ අතර, openpi ද එහිම ගබඩාව ගැනද එයම පවසයි. Pi0.5 පිටුව සහ SO-100 මාර්ගෝපදේශය මත Pi0.5 ඉතිරිය ඇත.

දවසක් කන උගුල: ගේට්ටු සහිත ගබඩා

Pi0.5 ට ගේට්ටු සහිත google/paligemma-3b-pt-224 ටෝකනයිසර් අවශ්‍ය වේ (gated: manual, ගූගල් පවසන්නේ ඉල්ලීම් වහාම සකසන බවයි). එය පිළිගෙන පුහුණු පරිසරය තුළ hf auth login ධාවනය නොකර, කාර්යය ආරම්භ වී, ටික වේලාවක් බාගත වී, පසුව ජාල දෝෂයක් ලෙස පෙනෙන අවසර දෝෂයකින් මිය යයි. nvidia/GR00T-N1.7-3B ගේට්ටු සහිත නොවේ, නමුත් එහි nvidia/Cosmos-Reason2-2B පසුබිම ගේට්ටු සහිත වේ (gated: auto). පෝලිම්ගත කිරීමට පෙර දෙකම ඉවත් කරන්න; ධාවනයක් අක්‍රියව තිබේ නම්, ඇලී ඇති පෝලිම් පිටුව පරීක්ෂා කළ යුතු දේ ලැයිස්තුගත කරයි.

SmolVLA

ක්‍රියා විශේෂඥයා තුළ 100 M පමණ වන, 450 M පරාමිති, SmolVLM-2 මත VLM ශීත කළ විට සහ එහි පළමු භාෂා-ආකෘති ස්ථර 16 පමණක් භාවිතා කරන ලදී. පූර්ව පුහුණුව ප්‍රජා දත්ත විය: 481 දත්ත කට්ටල, 10.6 M රාමු, ඔබ භාවිතා කරන ලාභ අත් වලින්. මෙහි ඇති එකම VLA එක 24 GB කාඩ්පතකට ගැලපෙන අතර, එකම 30 කථාංගය තට්ටුව. බලන්න SmolVLA පිටුව.

ACT

පදනම් ආකෘතියක් නොවේ. ALOHA වෙතින් ලැබෙන Action Chunking Transformer යනු කාර්යයක් සඳහා මුල සිටම පුහුණු කරන ලද, 50 Hz දී නිරූපණ 50ක් මත පදනම් වූ, දළ වශයෙන් 80 M පරාමිති සහිත ආකෘතියකි. මෙම පත්‍රිකාව මගින් එක් එක් නිරූපණයන් විනාඩි දහයක් පමණ වන සත්‍ය ද්වි-අත් කාර්යයන් හයක් වාර්තා කරන අතර, එය ඉස්මතු කරන උදාහරණ මත 80 සිට 90 දක්වා ප්‍රතිශතයක් සාර්ථකත්වය පෙන්වයි. එහි අදහස, ක්‍රියා ඛණ්ඩනය, මෙම පිටුවේ ඇති සෑම ආකෘතියකම පවතී, තවද එහි ඇබ්ලේෂන් මගින් තවමත් හොඳම බලපෑම මනිනු ලැබේ: තාවකාලික එන්සෙම්බල් කිරීම අක්‍රිය කර ඇති අනුකරණය කරන ලද කාර්යයන් දෙකක් හරහා, k=1 හිදී 1 ප්‍රතිශතයේ සිට k=100 හිදී 44 ප්‍රතිශතය දක්වා සාර්ථකත්වය ඉහළ යයි. ACT පිටුව ඉතිරිය ඇත.

බෙන්ච්මාර්ක් ඇත්ත වශයෙන්ම පවසන්නේ කුමක්ද

මෙම පහෙන් තුනක් වාර්තා කරන එකම බෙන්ච්මාර්කය LIBERO වේ: අනුකරණය කරන ලද Franka Panda මත භාෂා-නියමිත කාර්යයන්, පහත දැක්වෙන සූට් හතරකට බෙදා ඇති අතර එක් එක් සූට් එකේ කාර්යයන් දහය බැගින් ඇත. NVIDIA එක් එක් සූට් එක සඳහා අත්හදා බැලීම් 200ක් සිදු කළේය.

ආකෘතියඅවකාශීයවස්තුවඉලක්කය10 (දිගු)සාමාන්‍යය
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
මෙම පේළි දැඩි ලෙස සැසඳිය නොහැක

සෑම අංකයක්ම විවිධ පරීක්ෂණ ක්‍රමවේදයකින් සහ අයවැයකින් ලබාගෙන ඇත. GR00T ගෝලීය කණ්ඩායම් 640ක් යටතේ පියවර 20Kක් ධාවනය කරන ලදී; openpi අගය 30K පරීක්ෂණ ලක්ෂ්‍යයකි; LeRobot port එක LIBERO මූලික ආකෘතියට පියවර 6Kක් එකතු කරන ලදී. SmolVLA තවදුරටත් නොගැලපීමකි: එහි පත්‍රිකාව එම පේළිය LIBERO මත මුල සිටම පුහුණු කරයි, VLA පූර්ව පුහුණුවකින් තොරව, ඉහත තුන පූර්ව පුහුණු කරන ලද පරීක්ෂණ ලක්ෂ්‍ය සියුම් ලෙස සකස් කරයි. 96.85 සිට 97.5 දක්වා එක් පොකුරක් ලෙස සලකන්න, සහ 87.3% දක්වා ඇති පරතරය සැබෑ ලෙස සලකන්න, නමුත් එය පරාමිති 6.7 ගුණයකින් මිලදී ගෙන ඇත.

SimplerEnv ව්‍යාප්තිය පෙන්වයි, එය LIBERO නොපෙන්වයි. NVIDIA N1.7 N1.6 සමඟ සංසන්දනය කරයි, එයට ආසන්නතම පොදු දෙය පරම්පරාගත වෙනසකි.

SimplerEnv කට්ටලයN1.6 සාමාන්‍යයN1.7 සාමාන්‍යයහොඳම වෙනසනරකම වෙනස
Bridge (WidowX), කාර්යයන් 756.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), කාර්යයන් 652.0%72.5%open_drawer 0.0 to 65.0කිසිවක් නැත, සෑම කාර්යයක්ම වැඩි දියුණු විය

බ්‍රිජ් පේළිය ප්‍රයෝජනවත් එකකි: සාමාන්‍යයෙන් ලකුණු 5.7ක් ලබාගෙන ඇත put_eggplant_in_basket 36ක් අහිමි වූ අතර put_eggplant_in_sink 33 සිට 2 දක්වා පහත වැටුණි. නව පරම්පරාවක් එය ඉහළ නැංවීමට වඩා ව්‍යාප්තිය චලනය කරයි, එබැවින් ඔබේ කාර්යය N1.7 පසුබෑමට ලක් වූ තැන පිහිටා තිබේ නම්, සාමාන්‍යය කිසිවක් නොකියයි.

AY-Robots ක්‍රීඩාංගණයේ ප්‍රමුඛ පුවරුව, දෘශ්‍ය-භාෂා-ක්‍රියා මාදිලි 85ක වර්ග කළ හැකි වගුවක් මිණුම් සලකුණු ප්‍රතිඵල 332ක් සමඟින්, එක් එක් අගය එය පැමිණි පත්‍රිකාවට හෝ මාදිලි කාඩ්පතට සම්බන්ධ කර ඇත
ක්‍රීඩාංගණයේ VLA මාදිලි 85ක් සහ මිණුම් සලකුණු ප්‍රතිඵල 332ක් අඩංගු වේ, ඒ සෑම එකක්ම එහි පත්‍රිකාවට හෝ මාදිලි කාඩ්පතට සම්බන්ධ කර ඇත. බ්ලොග් සටහනක සඳහන් අංකයක් සත්‍ය දැයි පරීක්ෂා කිරීමට ප්‍රයෝජනවත් වේ.

පහෙන්, SmolVLA පත්‍රිකාව පමණක් SO-100 පන්තියේ අතක් පිළිබඳව වාර්තා කරයි: කාර්යයන් තුනක් හරහා SmolVLA සඳහා සියයට 78.3ක් සහ Pi0 සඳහා 61.7ක්, දෙකම බහු-කාර්ය, ACT පුහුණු තනි-කාර්යය සඳහා 48.3ට එරෙහිව, එය සමාන නොවේ. පිරිසිදු යුගලනය SO-101 තෝරාගැනීම සහ තැබීම මත තනි-කාර්යය වේ: ව්‍යාප්තියේ 70ට එරෙහිව 90, එයින් පිටත 40ට එරෙහිව 50. සසඳන්න ACT SmolVLAට එරෙහිව සහ Pi0.5 SmolVLAට එරෙහිව, නැතහොත් පිරික්සන්න ක්‍රීඩාංගණය.

ප්‍රමාදය සහ පිරිවැය යෙදවීම තීරණය කරයි

අනුමාන ප්‍රමාදය යනු මිනිසුන් අවසානයට සොයා ගන්නා සහ මුලින්ම පසුතැවෙන සීමාවයි. මිණුම් සලකුණක ලකුණු පහකින් වඩා හොඳ නමුත් එක් ක්‍රියාකාරී පියවරකට තත්පර භාගයක් ගතවන ප්‍රතිපත්තියක් ඔබේ මේසය මත නරක ලෙස පෙනේ: ස්පර්ශ ගතිකත්වය බලා නොසිටියි.

එක් අවවාදයක්: GR00T අගය NVIDIA හි කාඩ්පත සමඟ නොගැලපේ, එය H100 මත eager mode හි 85.8 ms දී 4 denoising steps සහ එක් කැමරාවක්, torch.compile සමඟ 48.6 ms, සම්පූර්ණ TensorRT හරහා 27.9 ms ලෙස වේලාව සටහන් කරයි. මෙහි ඇති 152 ms යනු සේවා සැපයීමේ අමතර වියදම් සහ එක් කැමරාවකට වඩා වැඩි ගණනක් සහිත සම්පූර්ණ-ස්ටැක් අගයකි, එය forward pass එකක් නොවේ.

දුරස්ථ අනුමානයට දැඩි සීමාවක් ඇත

20 සිට 485 ms දක්වා ලූපය ආකෘතියේ වන අතර, පොදු අන්තර්ජාලයේ ගමන් කාලය එයට එකතු වේ. දුරස්ථ අනුමානය මන්දගාමී pick-and-place සඳහා ශක්‍ය වේ, වේගවත් ප්‍රතික්‍රියාශීලී චලනයන් සඳහා නොවේ. ඔබේ කාර්යයට වේගය අවශ්‍ය නම්, අනුමානය servos අසල පිහිටා ඇත: ACT හෝ SmolVLA, දේශීයව. අදාළ: ප්‍රතිපත්තිය චලනය මැදදී නතර වේ.

ආකෘතිය වෙනස් නොකර කාලය ලබා ගැනීමට එක් ක්‍රමයක්: SmolVLA පත්‍රිකාව සමමුහුර්ත ක්‍රියාත්මක කිරීම මනිනු ලබයි, එහිදී ප්‍රතිපත්තිය ඊළඟ එක පුරෝකථනය කිරීමට පෙර කොටසක් අවසන් කරයි, අසමමුහුර්ත ක්‍රියාත්මක කිරීමට එරෙහිව, එහිදී පුරෝකථනය ක්‍රියාත්මක කිරීම සමඟ අතිච්ඡාදනය වේ. සාර්ථකත්වය සමාන වේ, 78.3 එදිරිව 73.3, නමුත් එම pick-and-place සඳහා 13.75 වෙනුවට තත්පර 9.7 ක් ගතවේ, සහ ස්ථාවර කවුළුවක රොබෝවරයා 9 වෙනුවට චක්‍ර 19 ක් කළමනාකරණය කරයි.

බලපත්‍ර, කිසිවෙකු ඒවා පරීක්ෂා නොකරන නිසා පරීක්ෂා කරන ලදී

ආකෘතියWeights බලපත්‍රයකේත බලපත්‍රයවාණිජ භාවිතය
GR00T N1.7NVIDIA Open Model License; කාඩ්පත වාණිජ භාවිතයට ඉඩ දෙයිApache 2.0ඔව්
GR00T N1.5NVIDIA ඒකපාර්ශ්වික වාණිජ නොවන බලපත්‍රයApache 2.0නැත
Pi0.5pi05_base කාඩ්පතේ metadata හි license: gemma ලෙස සඳහන් වේApache 2.0 (openpi, LeRobot docs)දෙකම කියවන්න, ඒවා එකඟ නොවේ
SmolVLAsmolvla_base කාඩ්පතේ බලපත්‍ර ක්ෂේත්‍රයක් නොමැතApache 2.0 (LeRobot)කේතය ඔව්, weights සඳහන් කර නැත
ACTමූලික weights නොපවතීApache 2.0 (LeRobot)ඔව්

Pi0.5 පේළියට අවධානය යොමු කළ යුතුය. LeRobot pi05 ලේඛනගත කිරීම openpi සමඟ අනුකූලව Apache 2.0 බව සඳහන් කරයි, Hub කාඩ්පත සඳහා lerobot/pi05_base දරයි license: gemma. දෙකම සක්‍රීයයි. GR00T N1.7 සතුව මෘදු අනුවාදයක් ඇත: Isaac-GR00T README හි N1.7 Apache 2.0 යටතේ සම්පූර්ණයෙන්ම වාණිජමය වශයෙන් බලපත්‍රගත කළ හැකි බව සඳහන් වේ, එහිම බලපත්‍ර කොටස සහ model card මඟින් කේතය පමණක් Apache 2.0 යටතේ ද weights NVIDIA Open Model License යටතේ ද තබා ඇත.

ඔබ සැබවින්ම ක්‍රියාත්මක කරන පෙරනිමි

සෑම පුහුණුකරුවෙකුගේම ආකෘතියක් පෙරනිමියක් සමඟ එන අතර ඒවා අත්තනෝමතික නොවේ. ACT හි ඒවා LeRobot ගේම වේ: batch 8, lr 1e-5, 100000 පුහුණු පියවර, chunk size 100, ACTConfig upstream සමඟ ගැලපෙන අතර k=100 ACT පත්‍රිකාවෙන්. පහත එක් තීරුවක් උගුලකි.

ප්‍රතිපත්තියකණ්ඩායමLRඋපරිම පියවරGrad accumඅදාළද?අමතර පාලක
GR00T N1.7321e-4200001ඔව්saveSteps
GR00T N1.511e-5200016ඔව්saveSteps
Pi0.515e-53000016නැත (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008නැතseed, logFreq
ACT81e-51000001නැතchunkSize, nActionSteps, seed, logFreq
ප්‍රතිනිෂ්පාදනය කිරීමේ හැකියාව, 2026 අගෝස්තු දිනැති

GR00T හි fine-tuning ඇතුල්වීමේ ලක්ෂ්‍යය (launch_finetune.py, tyro CLI එකක්) සතුව seed field එකක් නොමැත එහි config dataclass හි, එබැවින් ධාවනයන් bit-for-bit ප්‍රතිනිෂ්පාදනය කළ නොහැක. repo එක ද අනතුරු අඟවයි ධාවනයන් අතර 5 සිට 6 දක්වා ප්‍රතිශත විචලනයක් non-deterministic image augmentations වලින්, එය බොහෝ benchmark හි පරතරයන්ට වඩා විශාල වන අතර ඒවා අන්තර්ජාලය හරහා විවාදයට ලක්වේ. LeRobot හි පෙරනිමි seed අගය 1000 වේ. grad-accum තීරුව විස්තර කරයි lerobot 0.5.1; upstream 0.6.2 එය නිරාවරණය කරයි --accelerator.gradient_accumulation.steps.

මොඩලයක් තෝරා ගැනීමට වඩා වැදගත් වන පාලකය

මෙය ක්‍රියාකාරී කොටසයි. දිගු කොටස් සුමට චලනයක් සහ අඩු සංයෝග දෝෂ ලබා දෙයි, නමුත් කොටස ක්‍රියාත්මක වන විට ප්‍රතිපත්තිය කැපවී ඇති බැවින්, චලනය වන ඕනෑම දෙයකට එය ප්‍රමාද වී ප්‍රතිචාර දක්වයි: ස්ථිතික ඝනකයක් මත විශ්වාසයෙන් යුක්ත වන අතර, පෙරළෙන එකක් මත බලාපොරොත්තු රහිතය. එය ඉලක්කය ඉක්මවා ගියහොත්, ක්‍රියාත්මක කළ කොටස කෙටි කිරීම නැවත පුහුණු කිරීමට වඩා හොඳ වන අතර එය නොමිලේ. කෙටියෙන් නතර වන සන්ධියක් වෙනස් ගැටලුවකි; බලන්න .

  • ACT: ACTConfig පෙරනිමියෙන් chunk_size 100 සහ n_action_steps 100 වේ. තාවකාලික සමූහකරණය අක්‍රිය කර ඇති අතර n_action_steps 1 අවශ්‍ය වේ.
  • GR00T N1.7: අභ්‍යන්තර ක්ෂිතිජය 16 සිට 40 දක්වා වැඩි විය, නමුත් LeRobot's SO-101 example තවමත් --policy.chunk_size=16 --policy.n_action_steps=16 ධාවනය කරයි. The rollout flag was renamed to --execution-horizon.
  • Pi0.5: පියවර 50 ක කොටසක්, එයින් LeRobot's LIBERO recipe 10 ක් --policy.n_action_steps=10 හරහා ක්‍රියාත්මක කරයි; ඔබ flag එක අතහැර දැමුවහොත් --policy.pretrained_path සමඟ එය 50 දක්වා ආපසු හැරේ.
  • SmolVLA: ක්‍රියා 50 ක කොටස්, පාලක දෙකම නිරාවරණය කර ඇත.

එක දහවල් කාලයකදී පහම පරීක්ෂා කරන්නේ කෙසේද

ලාභම පිළිතුර වැඩිපුර කියවීම නොවේ. 15 USD පමණ වැය කර අතට ඔබට කියන්නට ඉඩ දෙන්න: එක් වරක් පටිගත කරන්න, පළමුව ලාභ ආකෘතිය පුහුණු කරන්න, දත්ත නිවැරදි බව ඔප්පු වූ පසු එය වැඩි කරන්න. ව්‍යුහය පරිමාවට වඩා හොඳයි, එය සහ හි අරමුණයි.

  1. 1
    කථාංග 50ක් එක් වරක් වාර්තා කරන්න

    GR00T, Pi0.5 සහ ACT සඳහා පදනම 50ක් ද, SmolVLA සඳහා 30ක් ද සකස් කරයි. විවිධත්වය තුනී නොකර එක් එක් වෙනස්කම් නැවත කරන්න: පුහුණු කරන ලද ඝනක ස්ථාන 5ක් හරහා කථාංග 50ක්, ඉන් 25ක් පුහුණු නොකළේය. ඔබේ පළමු දත්ත කට්ටලය වාර්තා කරන්න බලන්න.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ACT මුලින්ම පුහුණු කරන්න, මන්ද එය ඔබට බොරු කිව නොහැක

    පෙර පුහුණු කළ බර නොමැත, එබැවින් එය කාර්යය කරන්නේ නම්, ඔබේ දත්ත කට්ටලයේ කාර්යය අඩංගු වේ. ACT අක්‍රිය වුවහොත්, දත්ත නිවැරදි කරන්න. 24 GB කාඩ්පතක 1 සිට 3 USD, පැය 2 සිට 5 දක්වා.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    එකම දත්ත කට්ටලය මත SmolVLA වෙනස් නොකර ධාවනය කරන්න

    එකම දත්ත, එකම අත, 80 M වෙනුවට 450 M පරාමිති, සහ භාෂා තත්ත්වකරණය. LeRobot A100 එකක 20K පියවර ධාවනයක් දළ වශයෙන් පැය 4ක් ලෙස සලකයි. පෙර පුහුණුවෙන් යමක් ලැබේදැයි මෙය ඔබට කියයි.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T ස්පර්ශ කිරීමට පෙර v2.1 දක්වා පරිවර්තනය කරන්න

    GR00T LeRobot v2 ආකෘතියේ රසයක් කියවයි, ඊට අමතරව meta/modality.json එකතු කරන ලද තත්ත්ව සහ ක්‍රියා අරා නම් කරන ලද ක්ෂේත්‍රවලට බෙදෙන ආකාරය සිතියම්ගත කරයි. v3.0 දත්ත කට්ටලයක් එම ලෝඩරය බිඳ දමයි, මන්ද v3.0 බොහෝ කථාංග පොදු ගොනු වලට ඇසුරුම් කරන අතර v2 එක් කථාංගයකට එකක් ලිවීය. Isaac-GR00T scripts/lerobot_conversion/convert_v3_to_v2.py ලෙස පහත හෙලීමේ සහායකය නැව්ගත කරයි; v3 ප්‍රතික්ෂේප කිරීමේ පිටුව වේගවත් මාර්ගයයි.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    පළමු දෙකෙන් යමක් ඉතිරි වී ඇත්නම් පමණක් GR00T N1.7 වෙත යොමු වන්න

    මෙහි පෙන්වා ඇති NVIDIA හි CLI හරහා, හෝ LeRobot හි groot ප්‍රතිපත්ති වර්ගය හරහා. NVIDIA සියුම් සුසර කිරීම සඳහා 40 GB හෝ ඊට වැඩි VRAM, අනුමානය සඳහා 16 GB නිර්දේශ කරයි. OOM එකකදී, OOM පිටුව බලන්න.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

එම පරීක්ෂණ ධාවනය කිරීමට ක්‍රම දෙකක්

මෙවලම් දාම එකට නොපවතින නිසා පරිසර තුනක්. ප්‍රධාන LeRobot 0.6.2 වන අතර Python 3.12 හෝ නවතම අවශ්‍ය වේ; Isaac-GR00T සහ openpi යනු වෙනම uv-කළමනාකරණය කරන ලද ගබඩා වේ.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T torchcodec 0.8.0 එහි එකම වීඩියෝ පසුබිම ලෙස සලකයි, FFmpeg 4 සිට 7 දක්වා අවශ්‍ය වේ. FFmpeg 8 සහය නොදක්වයි, AV1 සහතික නොවේ.
  • openpi මතක සීමා: 8 GB ට වැඩි අනුමානය, 22.5 GB ට වැඩි LoRA, 70 GB ට වැඩි සම්පූර්ණ සියුම් සුසර කිරීම. අවසාන එක Pi0.5 A100 කාර්යයක් වීමට හේතුවයි.
  • GPU එක ඔබම කුලියට ගන්න, පසුව එය විනාශ කරන්න, චෙක්පොයින්ට් මාර්ග කට්ටල තුනක් අතින් සමථයකට පත් කරන්න.

මූලික ආකෘතිය හෝ මුල සිට

තෝරාගත යුතු 3 B මාදිලිය කුමක්ද යන්න සැබෑ ගැටලුව නොවේ. එය පුහුණු කරන ලද VLA එකක් කිසිසේත් භාවිතා කළ යුතුද යන්නයි, ලබා දී ඇති පරිදි ACT විසින් සැබෑ ද්වි-අත් කාර්යයන් හයක්, එක් එක් මිනිත්තු දහයක පමණ නිරූපණ වලින්, 80 M පරාමිති සමඟින් ඉගෙන ගත් බවත් කිසිවක් පෙර පුහුණු කර නොතිබූ බවත්ය.

මුල සිට ACT පුහුණු කරනවා වෙනුවට පෙර පුහුණු කරන ලද VLA එකක් සියුම් ලෙස සකස් කිරීම
ඔබට ලැබෙන දේ
  • භාෂා අනුවර්තනය. ACT සතුව කිසිවක් නැත; එක් ACT චෙක්පොයින්ට් එකක් එක් කාර්යයක් කරයි.
  • ඔබේ නිරූපණවල නොමැති වස්තූන් මත වඩා හොඳයි: SO-101 මත, ACT හි 40% ට සාපේක්ෂව 50% ක් බෙදාහැරීමෙන් පිටත.
  • බහු-කාර්යයන්: SmolVLA එක් චෙක්පොයින්ට් එකක් සමඟ SO-100 කාර්යයන් තුනක් හරහා 78.3% ක් කරා ළඟා වේ; ACT ධාවනය කරන ලද්දේ තනි කාර්යයක් ලෙස පමණි.
එයින් ඔබට වැය වන දේ
  • 7.6x සිට 24x දක්වා ප්‍රමාදය: ACT හි 20 ms ට සාපේක්ෂව එක් ක්‍රියාකාරී පියවරකට 152 සිට 485 ms.
  • 1 සිට 3 වෙනුවට එක් ධාවනයකට 4 සිට 12 USD, සහ ඕනෑම 24 GB කාඩ්පතක් වෙනුවට A100 ස්ථරයක්.
  • බලපත්‍ර නිරාවරණය, තවද මුල සිට නොපවතින gated-repo අසාර්ථක මාදිලියක්.
  • පෙර පුහුණු කරන ලද බර නරක දත්ත කට්ටලයක් ආවරණය කළ හැකිය. බිඳුණු දත්ත මත අඩක් ක්‍රියා කරන සියුම් ගැලපීමක් දත්ත දෙස බැලීමට පෙර සතියක් වැය වේ.

පැරණි ධාවනයක් ප්‍රතිනිෂ්පාදනය කිරීමේ අවස්ථාව

2025 චෙක්පොයින්ට් එකක් පසුපස හඹා යාමෙන් ඔබට ආකෘති තේරීම සිදු වන අතර ගැටලුව අනුවාද ඇණ ගැසීමක් බවට පත් කරයි: වත්මන් LeRobot N1.5 ප්‍රතික්ෂේප කරයි, එබැවින් ඔබ lerobot==0.5.1. බීජ ක්ෂේත්‍රයක් නොමැතිව සහ ධාවනයන් අතර 5 සිට 6 ප්‍රතිශත විචලනයක් සමඟ , ප්‍රතිනිෂ්පාදනය ඉදිකිරීම අනුව ආසන්න වේ. SO-100 මාර්ගෝපදේශය මත N1.5 සහ N1.5 ප්‍රතිපත්ති පිටුව වේදිකා පැත්ත ඇත.

The AY-Robots head to head comparison page for GR00T N1.7 against Pi0.5, showing parameter counts, GPU requirements, inference latency, dataset format and minimum episode counts side by side
Head to head on /compare/groot-n1-7-vs-pi0-5. The two 3 B models look interchangeable on a spec sheet and are not: one wants LeRobot v2.1, one wants v3.0.

දෙකක් දක්වා? ACT එදිරිව GR00T N1.7 සහ GR00T N1.7 එදිරිව SmolVLA. අමු පේළි අරීනා ඇතුළත් කිරීම් වල ඇත: GR00T N1.7, Pi0.5, SmolVLA සහ ACT.

මෙම වේදිකාව ඔබට උදව් නොකරන තැන්

මාදිලි 85ක්, මිණුම් සලකුණු ප්‍රතිඵල 332ක්, සෑම අංකයක්ම එහි මූලාශ්‍රයට සම්බන්ධ කර ඇත

මෙම පිටුවේ ඇති වගු වල වර්ග කළ හැකි අනුවාදය: 85 දෘශ්‍ය-භාෂා-ක්‍රියාකාරී මාදිලි, 332 මිණුම් සලකුණු ප්‍රතිඵල, ඒ සෑම එකක්ම එහි පත්‍රිකාවට හෝ මාදිලි කාඩ්පතට සම්බන්ධ කර ඇත.

අරීනා විවෘත කරන්න

එකක් තෝරාගෙන ඉදිරියට යාම

එක් පෙරනිමියක්: කථාංග 50ක් පටිගත කරන්න, දත්ත කට්ටලය ඔප්පු කිරීමට ACT ඩොලර් 1 සිට 3 දක්වා පුහුණු කරන්න, ඉන්පසු SmolVLA එකම දත්ත මත. එකට ඩොලර් 6කට අඩුවෙන්, ඔවුන් වැදගත් ප්‍රශ්නයට පිළිතුරු සපයයි: මෙහි පූර්ව පුහුණුව උපකාරී වේද, නැතහොත් බාධාව දත්තද යන්න. ස්පර්ශ බහුල බහු-පියවර කාර්යයන් සඳහා GR00T N1.7 වෙත, දර්ශනය වෙනස් වන විට Pi0.5 වෙත දර්ශනය වෙනස් වේ.

වේදිකා මාර්ගෝපදේශය: ඔබේ පළමු ප්‍රතිපත්තිය පුහුණු කරන්න, ඉන්පසු ඔබේ පළමු ප්‍රතිපත්තිය ක්‍රියාත්මක කරන්න. එම පුහුණු ලේඛන සහ දත්ත කට්ටල ලේඛන ආකෘතිය සහ සැකැස්ම ආවරණය කරයි; SO-100 පිටුව සහ සම්පූර්ණ SO-100 මාර්ගෝපදේශය ගොඩනැගීම සහ ක්‍රමාංකනය ආවරණය කරයි. පසුබිම: VLA දළ විශ්ලේෂණය සහ Pi0 ප්‍රවාහ-ගැලපෙන ලිපිය. ඔබේ සාර්ථකත්ව අනුපාතය ඉහළ නංවන එක වන්නේ දත්ත තත්ත්ව මාර්ගෝපදේශය.

SO-100 එකකදී මම මුලින්ම පුහුණු කළ යුත්තේ කුමන VLA ප්‍රතිපත්තියද?

ACT, පසුව SmolVLA. ACT මුල සිටම පුහුණු වන නිසා, එයට නරක දත්ත කට්ටලයක් ආවරණය කළ නොහැක, තවද 24 GB කාඩ්පතක එක් ධාවනයකට 1 සිට 3 USD දක්වා වැය වේ. ACT එම කාර්යය සිදු කරන්නේ නම්, GR00T N1.7 හෝ Pi0.5 ධාවනයක් සඳහා වැය වන 4 සිට 12 USD නාස්ති නොවේ.

GR00T N1.7 ඇත්තටම Pi0.5 වලට වඩා හොඳද?

LIBERO මත ඒවා ශබ්ද සීමාව තුළ පවතී: GR00T N1.7 සඳහා සූට් හතරක් හරහා 97.0%, openpi හි 30k පියවර වලදී Pi0.5 සඳහා 96.85%, LeRobot port එක සඳහා 97.5%, මේ සියල්ල විවිධ harnesses වලින්. සැබෑ වෙනස්කම් වන්නේ එක් ක්‍රියා පියවරකට 152 ms එදිරිව 485 ms, v2.1 දත්ත කට්ටල එදිරිව v3.0, සහ benchmark නිරවද්‍යතාවය එදිරිව open-world generalization ය.

මට මේවායින් ඕනෑම එකක් තනි RTX 4090 එකක fine-tune කළ හැකිද?

SmolVLA සහ ACT, ඔව්; දෙකම RTX 4090 හෝ ඕනෑම 24 GB කාඩ්පතක් සඳහා ලැයිස්තුගත කර ඇති අතර දේශීයව ධාවනය වේ. GR00T N1.7, N1.5 සහ Pi0.5 සඳහා A100 හෝ H100 80 GB අවශ්‍ය වන අතර මෙහිදී cloud-only වේ. NVIDIA GR00T fine-tuning සඳහා 40 GB හෝ ඊට වැඩි ප්‍රමාණයක් නිර්දේශ කරයි; openpi හි අවම අවශ්‍යතාවය සම්පූර්ණ Pi0.5 fine-tune එකක් සඳහා 70 GB ට වැඩි වන අතර, LoRA සඳහා 22.5 GB වේ.

මේ පහෙන් මට වාණිජමය වශයෙන් භාවිතා කළ හැක්කේ කුමක්ද?

GR00T N1.7 weights NVIDIA Open Model License Agreement යටතේ පවතී, එය කාඩ්පතේ සඳහන් වන පරිදි වාණිජමය භාවිතය ආවරණය කරයි. N1.5 weights වාණිජමය නොවේ. SmolVLA හි කේතය LeRobot හි Apache 2.0 වේ, නමුත් lerobot/smolvla_base කාඩ්පතේ බලපත්‍ර ක්ෂේත්‍රයක් නොමැති බැවින් weights සඳහන් කර නොමැත. ACT හට බලපත්‍ර ලබා දීමට මූලික weights නොමැත. Pi0.5 අපැහැදිලිය: LeRobot හි docs Apache 2.0 යැයි කියයි, එහි card metadata හි license: gemma ලෙස සඳහන් වේ.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started