GR00T N1.7፣ GR00T N1.5፣ Pi0.5፣ SmolVLA እና ACTን ከፓራሜትር ብዛት፣ የጂፒዩ ደረጃ፣ የመገመት መዘግየት (inference latency) እና ዝቅተኛው የክፍል ብዛት ጋር ጎን ለጎን የሚያሳይ የ AY-Robots ፖሊሲዎች ንጽጽር ሰንጠረዥ
vla-ሞዴሎችየፖሊሲ ስልጠናየሞዴል ምርጫlerobotso-100

የትኛውን VLA ፖሊሲ በ2026 ማሰልጠን አለብዎት?

AY-Robots ResearchAugust 23, 202618 ደቂቃ ንባብ

GR00T N1.7፣ Pi0.5፣ SmolVLA፣ ACT ወይስ GR00T N1.5? ከእውነተኛ ሁኔታዎች ጋር የተጣመረ የመወሰኛ ሰንጠረዥ፣ ከታተሙት የቤንችማርክ ቁጥሮች፣ መዘግየት (latency)፣ ለእያንዳንዱ አሂድ ወጪ እና ከእያንዳንዱ ምርጫ ጀርባ ባሉ ፈቃዶች ጋር።

ዛሬ በአንድ SO-100 ክፍል ክንድ ላይ አምስት ፖሊሲዎች ማሰልጠን ይቻላል። እነዚህም በ24 እጥፍ የኢንፈረንስ መዘግየት፣ በ37 እጥፍ የፓራሜትር ብዛት እና በ12 እጥፍ የአንድ ሩጫ ወጪ፣ እንዲሁም ውጤቱን መላክ ይቻል እንደሆነ ይለያያሉ። አምስት ሞዴል ካርዶች ይህን ጥያቄ አይመልሱትም፡ የትኛውን መጀመሪያ ላስኬድ የሚለውን ጥያቄዎትን አንዳቸውም አይመልሱም።

ከታች ያሉት ሁሉም ቁጥሮች ከወረቀቶች፣ ሪፖዎች እና ካርዶች በነሐሴ 2026 የተነበቡ ናቸው። የፕላትፎርም ቁጥሮች የመጡት ከ የAY-Robots ፖሊሲ ካታሎግ፤ ሁለቱ የማይስማሙ ከሆነ፣ ሁለቱም ይታያሉ።

አጭር ማብራሪያ

  • የእርስዎን የውሂብ ስብስብ የሚጠራጠሩ ከሆነ መጀመሪያ ACTን ያሰልጥኑ፡ ለአንድ ሩጫ ከ1 እስከ 3 ዶላር፣ መጥፎ መረጃን ለመሸፈን ምንም ቅድመ-የሰለጠነ ነገር የለም።
  • GR00T N1.7 እና Pi0.5 በLIBERO ላይ ከግማሽ ነጥብ ውስጥ ይገኛሉ፣ 97.0 ከ96.85 እስከ 97.5። ይህ አንዱን ለመምረጥ ምክንያት አይደለም።
  • Pi0.5 የአጠቃላይ የማድረግ እንጂ የትክክለኛነት ጉዳይ አይደለም፣ እና በ485 ms በጣም ቀርፋፋ ነው።
  • SmolVLA፣ በ450 M ፓራሜትሮች፣ በአንድ 24 ጊባ ካርድ ላይ ብቻ የሚስተካከል ብቸኛው VLA ነው።
  • ACT በ20 ms ለፈጣን ምላሽ ሰጪ እንቅስቃሴ ብቸኛው አማራጭ ነው። ፈቃዶች ቀሪውን ይወስናሉ።

የውሳኔ ሰንጠረዥ

የእርስዎ ሁኔታይህን ያሰልጥኑለምን
የመረጃ ስብስብ ጥራት ያልተረጋገጠACTምንም ቅድመ-የሰለጠነ ነገር የተበላሸ የመረጃ ስብስብን አይሰውርም፣ እና አለመሳካት ከ1 እስከ 3 USD ያስከፍላል።
ግንኙነት የበዛበት፣ ባለብዙ ደረጃ፣ በቋንቋ የተመሰረተGR00T N1.7በአራት LIBERO ስብስቦች ላይ 97.0%፣ በተጨማሪም አንጻራዊ የመጨረሻ-አስፈጻሚ የእንቅስቃሴ ቦታ።
ፈጣን ምላሽ ሰጪ እንቅስቃሴ፣ በሰርቮስ ላይ ግምትACT20 ms. ቀጣዩ ፈጣን 7.6 እጥፍ ቀርፋፋ ነው።
አዲስ ነገሮች፣ አዲስ ትዕይንት፣ ክፍት ዓለምPi0.5ከስርጭት ውጪ ለሆኑ ባህሪያት የተገነባ፣ እስከ 104 ቦታዎች ላይ።
አንድ 24 GB ካርድ፣ አሁንም ቋንቋ ይፈልጋሉSmolVLA450 M መለኪያዎች፣ 30 የትዕይንት ክፍል ወለል፣ በአካባቢው ይሰራል።
በ2025 የተቀዳ ሩጫን እንደገና ማባዛትGR00T N1.5ግድ ከሆነ ብቻ: LeRobot አሁን አይቀበለውም፣ ክብደቶች ለንግድ ያልሆኑ ናቸው።
ይህ እንደ ምርት ይላካልN1.7, SmolVLA or ACTN1.5 ለንግድ ያልሆነ ነው፣ Pi0.5 የGemma ውሎችን ይይዛል፣ የSmolVLA ካርድ ምንም አይገልጽም።

አምስቱ እጩዎች

አምስቱም ፖሊሲዎች ናቸው: የካሜራ ፍሬሞች፣ የመገጣጠሚያ ቦታዎች እና፣ ከአራቱ ውስጥ፣ የቋንቋ መመሪያ፣ ለወደፊት የመገጣጠሚያ ኢላማዎች ክፍል የተመደበ። የሚለያቸው ነገር እርስዎ ከመምጣትዎ በፊት ምን ያህል እንደተማሩ ነው።

ፖሊሲመለኪያዎችመዘግየትጂፒዩ ደረጃአካባቢያዊ?ዝቅተኛ ክፍሎችቅርጸትዋጋ
ACT~80 M20 ms24 GB cardአዎ50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardአዎ30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBአይ50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBአይ50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBአይ50v3.04 to 12 USD

GR00T N1.7

የNVIDIA የአሁኑ የእይታ-ቋንቋ-ድርጊት ሞዴል፣ ወደ 3 ቢሊዮን የሚጠጉ መለኪያዎች ያሉት፣ ከ40 ሚሊዮን የሚጠጉት በጥሩ ማስተካከያ ወቅት የሰለጠኑ ናቸው። ማከማቻው ከN1.6 የተደረጉ ለውጦችን ይዘረዝራል፡ የጀርባ አጥንት ከEagle ሞዴል ወደ Cosmos-Reason2-2B በQwen3-VL፣ የስርጭት ንብርብሮች ከ32 ወደ 16፣ የሁኔታ እና የድርጊት ልኬቶች ከ29 ወደ 132፣ የድርጊት አድማስ ከ16 ወደ 40።

በትንሽ ክንድ ላይ አስፈላጊው ነገር አንጻራዊው የመጨረሻ-ተፅዕኖ ፈጣሪ የድርጊት ቦታ ነው፡ N1.7 ከአሁን ካለው አቀማመጥ ለውጦችን ይተነብያል፣ ይህም 20K ሰዓታት የEgoScale የሰው ቪዲዮ ወደ ሮቦት ፖሊሲ እንዲተላለፍ ያስችላል። ዝርዝር መግለጫው በየN1.7 ገጽ ላይ፣ አሰራሩ በየN1.7 በSO-100 መመሪያ

GA በማከማቻው ውስጥ፣ EA በሞዴል ካርዱ ላይ

የIsaac-GR00T README N1.7ን እንደ አጠቃላይ ተገኝነት ልቀት፣ ሙሉ መለኪያዎች እና ድጋፍ ያለው መሆኑን ያውጃል። የHugging Face ካርዱ ገና አልተዘመነም፡ የModel Version መስክ አሁንም GR00T N1.7 EA ይላል። ማከማቻው አዲሱ ሰነድ ነው።

GR00T N1.5

ተመሳሳይ 3 ቢ ስኬል፣ Eagle 2 ባክቦን፣ SigLip2 እና T5፣ ፍሎው-ማችንግ ዲአይቲ ሄድ። አስቀድሞ ያለዎትን ለማስፋት ያለ ነው። ሁለት ነገሮች ደካማ ነባሪ ያደርጉታል፡ ክብደቶቹ NVIDIA's የአንድ-መንገድ ለንግድ ያልሆነ ፈቃድ ይዘዋል፣ እና የአሁኑ የLeRobot ልቀቶች የN1.5 ድጋፍን አስወግደዋል። ይመልከቱ .

Pi0.5

Physical Intelligence's ቪኤልኤ፣ የፖሊሲ አይነት pi05. ወረቀቱ ከPaliGemma የተጀመረ 2 ቢ ቪኤልኤም እና 300 ኤም የአክሽን ኤክስፐርት ይሰጣል፣ ሮቦቱን በ50 ኸርዝ ያንቀሳቅሳል፤ የLeRobot's pi05 ኮንፊግ ነባሪው 50-ደረጃ ቸንክ ነው፣ በዚያ ፍጥነት አንድ ሰከንድ። የሽያጭ ነጥቡ ያልታዩ ቦታዎች ናቸው፡ በእውነተኛ ቤቶች ውስጥ ወደ 400 ሰዓታት የሚጠጋ የሞባይል ማኒፑሌሽን፣ እና በ3፣ 12፣ 22፣ 53፣ 82 እና 104 ቦታዎች ላይ የተደረገ የስኬሊንግ ጥናት፣ በዚህም የ104-ቦታ ሞዴል በራሳቸው የሙከራ ቤቶች ላይ የሰለጠነ ቁጥጥርን አዛምዷ።

አንድ ገደብ፣ በlerobot/pi05_base ካርድ ላይ የተገለጸው: ወደቡ የሚያስተላልፈው ፍሰት-ተዛማጅ የሆነውን የድርጊት ራስን ብቻ ነው። ንዑስ ተግባር ትንበያ፣ የድርጊት ቶከን ማድረግ እና RL ከላይ አልተለቀቁም፣ እና openpi የራሱ ማከማቻም ተመሳሳይ እንደሆነ ይናገራል። የPi0.5 ገጽ እና የPi0.5 በSO-100 ላይ ያለው መመሪያ ቀሪውን ይዘዋል።

ከሰዓት በኋላ የሚበላው ወጥመድ: የተገደቡ ማከማቻዎች

Pi0.5 የተገደበውን google/paligemma-3b-pt-224 ቶከናይዘር ይፈልጋል (gated: manual፣ ምንም እንኳን Google ጥያቄዎች ወዲያውኑ እንደሚሰሩ ቢናገርም)። ይህን ተቀብሎ በስልጠና አካባቢው ውስጥ hf auth login ሳያካሂዱ፣ ስራው ይጀምራል፣ ለተወሰነ ጊዜ ያወርዳል፣ ከዚያም እንደ አውታረ መረብ ስህተት በሚነበብ የፍቃድ ስህተት ይቋረጣል። nvidia/GR00T-N1.7-3B የተገደበ አይደለም፣ ነገር ግን የእሱ nvidia/Cosmos-Reason2-2B የጀርባ አጥንት የተገደበ ነው (gated: auto)። ወደ ወረፋ ከማስገባትዎ በፊት ሁለቱንም ያጽዱ፤ አንድ ሩጫ ስራ ፈትቶ ከቆየ፣ የተጣበቀው-ወረፋ ገጽ ምን ማረጋገጥ እንዳለቦት ይዘረዝራል።

SmolVLA

450 M ፓራሜትሮች፣ ከ100 M የሚሆኑት በድርጊት ኤክስፐርት ውስጥ፣ በSmolVLM-2 ላይ VLMው ቀዝቅዞ እና የእሱ የመጀመሪያዎቹ 16 የቋንቋ-ሞዴል ንብርብሮች ብቻ ጥቅም ላይ ውለዋል። ቅድመ-ስልጠናው የማህበረሰብ ዳታ ነበር: 481 የዳታ ስብስቦች፣ 10.6 M ፍሬሞች፣ ከእርስዎ ከሚጠቀሙባቸው ተመሳሳይ ርካሽ ክንዶች የተገኙ። እዚህ አንድ 24 GB ካርድ የሚመጥን ብቸኛው VLA፣ እና ብቸኛው 30 ክፍል ወለል። ይመልከቱ የSmolVLA ገጽ.

ACT

መሰረታዊ ሞዴል አይደለም። ከALOHA የመጣው Action Chunking Transformer ለእያንዳንዱ ተግባር ከባዶ የሰለጠነ ወደ 80 M ፓራሜትሮች አሉት፣ በ50 ማሳያዎች በ50 Hz። ወረቀቱ ስድስት እውነተኛ የሁለት እጅ ተግባራትን ሪፖርት ያደርጋል፣ እያንዳንዳቸው ከአስር ደቂቃ ማሳያዎች የተገኙ ናቸው፣ በሚያጎላባቸው ምሳሌዎች ላይ ከ80 እስከ 90 በመቶ ስኬት አለው። የእሱ ሀሳብ፣ የድርጊት ክፍፍል፣ በዚህ ገጽ ላይ ባሉ ሁሉም ሞዴሎች ውስጥ ይገኛል፣ እና የእሱ አብሌሽን አሁንም ውጤቱን የሚለካው በጣም በተሻለ ሁኔታ ነው፡ ጊዜያዊ ስብስብ ጠፍቶ በሁለት አስመሳይ ተግባራት ላይ፣ ስኬት ከ1 በመቶ (k=1) ወደ 44 በመቶ (k=100) ከፍ ይላል። የACT ገጽ ቀሪውን ይዟል።

የመለኪያ መመዘኛዎቹ በትክክል የሚሉት

LIBERO ከእነዚህ አምስት ውስጥ ሦስቱ ሪፖርት የሚያደርጉበት አንድ የመለኪያ መመዘኛ ነው፡ በቋንቋ የተመሰረቱ ተግባራት በአስመሳይ Franka Panda ላይ፣ ከታች ባሉት አራት ስብስቦች የተከፋፈሉ ሲሆን እያንዳንዳቸው አስር ተግባራት አሏቸው። NVIDIA ለእያንዳንዱ ስብስብ 200 ሙከራዎችን አድርጓል።

ሞዴልቦታዊዕቃግብ10 (ረጅም)አማካይ
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
እነዚህ ረድፎች በጥብቅ ሊነፃፀሩ አይችሉም

እያንዳንዱ ቁጥር ከተለያዩ የሙከራ ስርዓቶች እና በጀቶች የመጣ ነው። GR00T በ20K እርምጃዎች በ640 ግሎባል ባች ላይ ሰርቷል፤ የopenpi አሃዝ የ30K ቼክፖይንት ነው፤ የLeRobot ፖርት በLIBERO መሰረታዊ ሞዴል ላይ 6K እርምጃዎችን ጨምሯል። SmolVLA ተጨማሪ አለመጣጣም ነው: የእሱ ወረቀት ያንን ረድፍ በLIBERO ላይ ከባዶ ያሰለጥናል፣ ያለ VLA ቅድመ-ስልጠና፣ ከሱ በላይ ያሉት ሶስቱ ግን ቅድመ-የሰለጠኑ ቼክፖይንቶችን ያጣራሉ። ከ96.85 እስከ 97.5 እንደ አንድ ስብስብ ይቁጠሩት፣ እና ወደ 87.3% ያለው ክፍተት እውነት ቢሆንም በ6.7x የፓራሜትሮች ብዛት የተገኘ ነው።

SimplerEnv ስርጭቱን ያሳያል፣ LIBERO ግን አያሳይም። NVIDIA N1.7ን ከN1.6 ጋር ያነፃፅራል፣ ይህም ለgenerational delta. በጣም ቅርብ የሆነ የህዝብ ነገር ነው።

SimplerEnv ስብስብN1.6 አማካይN1.7 አማካይምርጥ መወዛወዝበጣም መጥፎ መወዛወዝ
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0ምንም፣ እያንዳንዱ ተግባር ተሻሽሏል

የብሪጅ ረድፍ ጠቃሚው ነው፡ በአማካይ 5.7 ነጥብ ሲገኝ put_eggplant_in_basket 36 አጥቷል እና put_eggplant_in_sink ከ33 ወደ 2 ወርዷል። አዲስ ትውልድ ስርጭቱን ከማንሳት ይልቅ ያንቀሳቅሰዋል፣ ስለዚህ ስራዎ N1.7 ወደ ኋላ በቀረበት ቦታ ከሆነ፣ አማካዩ ምንም አይናገርም።

የAY-Robots አሬና የመሪዎች ሰሌዳ፣ 85 የእይታ-ቋንቋ-ድርጊት ሞዴሎችን የያዘ ሊደረደር የሚችል ሠንጠረዥ ሲሆን 332 የቤንችማርክ ውጤቶች አሉት፣ እያንዳንዱ እሴት ከመጣበት ወረቀት ወይም ሞዴል ካርድ ጋር የተገናኘ ነው።
አሬናው 85 የVLA ሞዴሎችን እና 332 የቤንችማርክ ውጤቶችን ይዟል፣ እያንዳንዳቸውም ከየወረቀታቸው ወይም ከሞዴል ካርዳቸው ጋር የተገናኙ ናቸው። በብሎግ ፖስት ላይ የተጠቀሰ ቁጥር እውነት መሆኑን ለማረጋገጥ ጠቃሚ ነው።

ከአምስቱ ውስጥ፣ የSmolVLA ወረቀት ብቻ ነው ስለ SO-100 ክፍል ክንድ ሪፖርት የሚያደርገው፡ ለSmolVLA 78.3 በመቶ እና ለPi0 በሶስት ተግባራት ላይ 61.7፣ ሁለቱም ባለብዙ ተግባር፣ ከ48.3 ለACT በአንድ ተግባር የሰለጠነ ጋር ሲነጻጸር፣ ይህም ተመሳሳይ አይደለም። ንጹህ ጥምረት በSO-101 መርጦ ማስቀመጥ ላይ ሁለቱም ነጠላ ተግባር ናቸው፡ በስርጭት ውስጥ 90 ከ70፣ ከስርጭት ውጪ 50 ከ40። ከሱ ውጪ። ያወዳድሩ በ ACT ከSmolVLA ጋር እና Pi0.5 ከSmolVLA ጋር፣ ወይም ያስሱ አሬናውን.

መዘግየት እና ወጪ መዘርጋትን ይወስናሉ

የግምት መዘግየት ሰዎች በመጨረሻ የሚያገኙት እና በመጀመሪያ የሚጸጸቱበት ገደብ ነው። በአንድ መለኪያ ላይ በአምስት ነጥብ የተሻለ ፖሊሲ ግን በአንድ የድርጊት እርምጃ ግማሽ ሰከንድ የሚወስድ ከሆነ በጠረጴዛዎ ላይ የከፋ ይመስላል: የግንኙነት ተለዋዋጭነት አይጠብቅም።

አንድ ማስጠንቀቂያ: የGR00T አሃዝ ከNVIDIA ካርድ ጋር አይስማማም, ይህም 4 የድምፅ ቅነሳ ደረጃዎችን እና አንድ ካሜራ በH100 ላይ በ85.8 ms በ eager mode, በtorch.compile 48.6 ms, እና ሙሉ TensorRTን በመጠቀም 27.9 ms ይወስዳል። እዚህ ያለው 152 ms የአገልግሎት ወጪን እና ከአንድ በላይ ካሜራዎችን ያካተተ አጠቃላይ የሲስተም አሃዝ ነው, እንጂ forward pass አይደለም።

የርቀት ግምት ከፍተኛ ገደብ አለው

ከ20 እስከ 485 ms ያለው ዑደት የሞዴሉ ነው, እና የህዝብ-ኢንተርኔት የጉዞ ጊዜዎች ይጨምሩበታል። የርቀት ግምት ለቀርፋፋ pick-and-place ተግባራት ተስማሚ ነው, ፈጣን ምላሽ ለሚሹ እንቅስቃሴዎች ግን አይደለም። ተግባርዎ ፍጥነት የሚፈልግ ከሆነ, ግምቱ ከሰርቮስ አጠገብ ይቀመጣል: ACT ወይም SmolVLA, በአካባቢው። ተዛማጅ: ፖሊሲው በእንቅስቃሴ መካከል ይቀዘቅዛል

ሞዴሉን ሳይቀይሩ ጊዜ ለመግዛት አንድ መንገድ: የSmolVLA ወረቀት synchronous executionን ይለካል, በዚህም ፖሊሲው ቀጣዩን ከመተንበዩ በፊት አንድ ክፍል ያጠናቅቃል, ከ asynchronous ጋር ሲነጻጸር, በዚህም ትንበያ ከ execution ጋር ይደራረባል። ስኬት ተመሳሳይ ነው, 78.3 ከ 73.3 ጋር ሲነጻጸር, ነገር ግን ተመሳሳይ pick-and-place 13.75 ፈንታ 9.7 ሰከንዶች ይወስዳል, እና በ ቋሚ መስኮት ውስጥ ሮቦቱ 9 ፈንታ 19 ዑደቶችን ያስተዳድራል።

ፈቃዶች፣ ማንም ስለማይፈትሻቸው ተፈትሸዋል

ሞዴልየክብደት ፈቃድየኮድ ፈቃድየንግድ አጠቃቀም
GR00T N1.7NVIDIA Open Model License; ካርዱ ለንግድ አገልግሎት ይፈቅዳልApache 2.0አዎ
GR00T N1.5NVIDIA የአንድ-መንገድ ለንግድ ያልሆነ ፈቃድApache 2.0አይ
Pi0.5pi05_base ካርድ ሜታዳታ ፈቃድ: gemma ይላልApache 2.0 (openpi, LeRobot ሰነዶች)ሁለቱንም ያንብቡ, አይስማሙም
SmolVLAበ smolvla_base ካርዱ ላይ የፈቃድ መስክ የለምApache 2.0 (LeRobot)ኮድ አዎ, ክብደቶች አልተገለጹም
ACTምንም መሰረታዊ ክብደቶች የሉምApache 2.0 (LeRobot)አዎ

የ Pi0.5 ረድፍ ጥንቃቄ ያስፈልገዋል። የ LeRobot pi05 ሰነድ ከ openpi ጋር በሚስማማ መልኩ Apache 2.0 ይላል፣ የ Hub ካርዱ ለ lerobot/pi05_base ሲይዝ license: gemma። ሁለቱም ንቁ ናቸው። GR00T N1.7 ደግሞ የቀለለ ስሪት አለው፡ የ Isaac-GR00T README N1.7 በ Apache 2.0 ስር ሙሉ በሙሉ ለንግድ አገልግሎት ፈቃድ ሊሰጥ እንደሚችል በነገራችን ላይ ይገልጻል፣ የራሱ የፈቃድ ክፍል እና የሞዴል ካርዱ ኮዱን ብቻ በ Apache 2.0 ስር ሲያስቀምጡ ክብደቶቹን ደግሞ በ NVIDIA Open Model License ስር አስቀምጠዋል።

በእርግጥ የሚያስኬዷቸው ነባሪዎች

እያንዳንዱ የትሬነር ፎርም ነባሪ ቅንብር ይዞ ይመጣል፣ እና እነዚህም በዘፈቀደ የተመረጡ አይደሉም። ACT's are LeRobot's own: batch 8, lr 1e-5, 100000 የሥልጠና ደረጃዎች፣ የቁራጭ መጠን 100፣ ከ ACTConfig አፕስትሪም ጋር የሚዛመድ እና k=100 from the ACT paper. ከታች ካሉት ዓምዶች አንዱ ወጥመድ ነው።

ፖሊሲባችLRከፍተኛ ደረጃዎችግራድ አኩምይሠራል?ተጨማሪ መቆጣጠሪያዎች
GR00T N1.7321e-4200001አዎsaveSteps
GR00T N1.511e-5200016አዎsaveSteps
Pi0.515e-53000016አይ (ለሮቦት 0.5.1)seed, logFreq
SmolVLA21e-4200008አይseed, logFreq
ACT81e-51000001አይchunkSize, nActionSteps, seed, logFreq
የመራባት ችሎታ፣ ነሐሴ 2026 የተጻፈ

የGR00T የፋይን-ቲዩኒንግ መግቢያ ነጥብ (launch_finetune.py፣ ታይሮ CLI) በኮንፊግ ዳታክላሱ ውስጥ የሲድ መስክ የለውም፣ ስለዚህ ሩጫዎች ቢት-ለ-ቢት ሊባዙ አይችሉም። ሪፖው በተጨማሪም ከማይወሰኑ የምስል ማበልጸጊያዎች የተነሳ በሩጫዎች መካከል ከ5 እስከ 6 በመቶ ልዩነት እንዳለ ያስጠነቅቃል፣ ይህም በመስመር ላይ ከሚከራከሩባቸው አብዛኛዎቹ የቤንችማርክ ክፍተቶች ይበልጣል። የLeRobot ነባሪ ሲድ 1000 ነው። የግራድ-አኩም ዓምድ ለሮቦት 0.5.1ን ይገልጻል፤ አፕስትሪም 0.6.2 ደግሞ እንደ --accelerator.gradient_accumulation.steps ያሳያል።

ከሞዴል ምርጫ በላይ አስፈላጊ የሆነው መቆጣጠሪያ

ይህ የድርጊት ክፍል ነው። ረዘም ያሉ ክፍሎች ለስላሳ እንቅስቃሴ እና አነስተኛ ስህተቶችን ይሰጣሉ፣ ነገር ግን ፖሊሲው ብሎኩ በሚሰራበት ጊዜ የተወሰነ ስለሆነ፣ ለሚንቀሳቀስ ማንኛውም ነገር ዘግይቶ ምላሽ ይሰጣል፡ በማይንቀሳቀስ ኪዩብ ላይ በራስ መተማመን ሲኖረው፣ በሚንከባለል ላይ ተስፋ የለውም። ከልክ በላይ ከሄደ፣ የተሰራውን ክፍል ማሳጠር እንደገና ከማሰልጠን የተሻለ እና ነፃ ነው። ቀደም ብሎ የሚቆም መገጣጠሚያ የተለየ ችግር ነው፤ ይመልከቱ .

  • ACT: ACTConfig በነባሪነት chunk_size 100 እና n_action_steps 100 ይጠቀማል። ጊዜያዊ ስብስብ ጠፍቷል እና n_action_steps 1 ያስፈልገዋል።
  • GR00T N1.7: ውስጣዊው አድማስ ከ16 ወደ 40 ቢሄድም፣ የLeRobot SO-101 ምሳሌ አሁንም --policy.chunk_size=16 --policy.n_action_steps=16ን ያካሂዳል። የrollout ባንዲራ ወደ --execution-horizon ተቀይሯል።
  • Pi0.5: 50-ደረጃ ያለው ክፍል ሲሆን፣ የLeRobot LIBERO የምግብ አሰራር 10ቱን በ--policy.n_action_steps=10 በኩል ያከናውናል። --policy.pretrained_path ሲኖር ባንዲራውን ከዘለሉ ወደ 50 ይመለሳል።
  • SmolVLA: 50-ድርጊት ክፍሎች፣ ሁለቱም መቆጣጠሪያዎች ክፍት ናቸው።

አምስቱንም በአንድ ከሰዓት በኋላ እንዴት ማጣራት ይቻላል

ርካሹ መልስ ብዙ ማንበብ አይደለም። ወደ 15 USD ያህል አውጥተው ክንዱ እንዲነግርዎት ያድርጉ፡ አንድ ጊዜ ይመዝግቡ፣ መጀመሪያ ርካሹን ሞዴል ያሰለጥኑ፣ መረጃው ትክክል መሆኑን ካረጋገጠ በኋላ ያሳድጉ። መዋቅር ከብዛት ይበልጣል፣ የ እና የ .

  1. 1
    50 ክፍሎችን አንድ ጊዜ ይመዝግቡ

    ሃምሳ ለGR00T፣ Pi0.5 እና ACT፣ እንዲሁም ለSmolVLA 30 መንገድ ይከፍታል። እያንዳንዱን ልዩነት ደጋግመው ይስሩ እንጂ አያዳርሱት፡ 50 ክፍሎች በ5 የኩብ አቀማመጦች ላይ የሰለጠኑ ሲሆን 25ቱ ግን አልሰለጠኑም። የመጀመሪያውን የውሂብ ስብስብዎን ይመዝግቡ

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ACTን መጀመሪያ ያሰልጥኑ፣ ምክንያቱም ሊዋሽዎት አይችልም

    ቅድመ-የሰለጠኑ ክብደቶች የሉም፣ ስለዚህ ስራውን ከሰራ፣ የውሂብ ስብስብዎ ስራውን ይዟል። ACT ከቀዘቀዘ፣ ውሂቡን ያስተካክሉ። 1 to 3 USD፣ 2 to 5 ሰዓታት በ24 GB ካርድ ላይ።

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLAን በተመሳሳይ የውሂብ ስብስብ ላይ ያሂዱ፣ ሳይቀየር

    ተመሳሳይ ውሂብ፣ ተመሳሳይ ክንድ፣ ከ80 M ይልቅ 450 M መለኪያዎች፣ በተጨማሪም የቋንቋ ሁኔታ። LeRobot 20K እርምጃዎችን በአንድ A100 ላይ በግምት 4 ሰዓታት ይወስዳል። ይህ ቅድመ-ስልጠና ምንም ነገር እንደሚያመጣ ይነግርዎታል።

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00Tን ከመንካትዎ በፊት ወደ v2.1 ይቀይሩ

    GR00T የLeRobot v2 ቅርጸት አይነትን እና የተጨመረ meta/modality.json የተዋሃዱ የሁኔታ እና የድርጊት ድርድሮች ወደ ስም ያላቸው መስኮች እንዴት እንደሚከፋፈሉ የሚያሳይ ካርታ ያነባል። v3.0 የውሂብ ስብስብ ያንን ጫኝ ያበላሸዋል፣ ምክንያቱም v3.0 ብዙ ክፍሎችን ወደ የጋራ ፋይሎች ስለሚያስገባ v2 ግን ለእያንዳንዱ ክፍል አንድ ፋይል ይጽፍ ነበር። Isaac-GR00T የማውረድ ረዳቱን እንደ scripts/lerobot_conversion/convert_v3_to_v2.py ያቀርባል፤ የv3 ውድቅ ገጽ ፈጣን መንገድ ነው።

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    የመጀመሪያዎቹ ሁለቱ ምንም ካልሰሩ ወደ GR00T N1.7 ብቻ ያሳድጉ

    እዚህ በሚታየው በNVIDIA CLI በኩል፣ ወይም በLeRobot groot ፖሊሲ አይነት። NVIDIA ለጥሩ ማስተካከያ 40 GB ወይም ከዚያ በላይ VRAM፣ ለመገመት ደግሞ 16 GB ይመክራል። በOOM ላይ፣ የOOM ገጽን ይመልከቱ።

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

ያንን የማጣሪያ ማለፊያ ለማስኬድ ሁለት መንገዶች

ሶስት አካባቢዎች፣ ምክንያቱም የመሳሪያ ሰንሰለቶቹ አብረው አይኖሩም። በዋናው ላይ ያለው LeRobot 0.6.2 ሲሆን Python 3.12 ወይም ከዚያ በላይ ያስፈልገዋል፤ Isaac-GR00T እና openpi የተለዩ በuv የሚተዳደሩ ማከማቻዎች ናቸው።

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T torchcodec 0.8.0ን እንደ ብቸኛ የቪዲዮ የኋላ ክፍል ይጠቀማል፣ FFmpeg 4 እስከ 7 ያስፈልገዋል። FFmpeg 8 አይደገፍም፣ AV1 ዋስትና የለውም።
  • openpi የማህደረ ትውስታ ገደቦች፡ መገመት ከ8 GB በላይ፣ LoRA ከ22.5 GB በላይ፣ ሙሉ ጥሩ ማስተካከያ ከ70 GB በላይ። ይህ የመጨረሻው Pi0.5 የA100 ስራ የሆነበት ምክንያት ነው።
  • ጂፒዩውን እራስዎ ይከራዩ፣ በኋላ ያጥፉት፣ ሶስት የፍተሻ ነጥብ መንገዶችን በእጅ ያስተካክሉ።

መሰረታዊ ሞዴል ወይም ከባዶ

ትክክለኛው ምርጫ የትኛውን 3 B ሞዴል መምረጥ አይደለም። ይልቁንም ቅድመ-ስልጠና የወሰደ VLA መጠቀም አለመጠቀም ነው፣ ምክንያቱም ACT እያንዳንዳቸው ከአስር ደቂቃ በሚበልጡ ማሳያዎች ስድስት እውነተኛ የሁለት እጅ ስራዎችን የተማረው በ80 M ፓራሜትሮች እና ምንም ቅድመ-ስልጠና ሳይወስድ ነው።

ቅድመ-ስልጠና የወሰደ VLAን ማስተካከል ከACTን ከባዶ ከማሰልጠን ይልቅ
የሚያገኙት
  • የቋንቋ ማስተካከያ። ACT የለውም፤ አንድ የACT ቼክፖይንት አንድ ተግባር ያከናውናል።
  • ከማሳያዎችዎ ውጪ ባሉ ነገሮች ላይ የተሻለ: በSO-101 ላይ፣ 50% ከACT 40% ከስርጭት ውጪ።
  • በአጠቃላይ ብዙ ተግባር: SmolVLA በሶስት SO-100 ተግባራት ላይ በአንድ ቼክፖይንት 78.3% ይደርሳል፤ ACT የተካሄደው ለአንድ ተግባር ብቻ ነበር።
የሚያስከፍልዎት
  • ከ7.6x እስከ 24x የሚደርስ መዘግየት: በአንድ የድርጊት እርምጃ ከ152 እስከ 485 ms ከACT 20 ms ጋር ሲነጻጸር።
  • በአንድ ሩጫ ከ4 እስከ 12 USD ከ1 እስከ 3 ይልቅ፣ እና A100 ደረጃ ከማንኛውም 24 GB ካርድ ይልቅ።
  • የፍቃድ ተጋላጭነት፣ በተጨማሪም ከባዶ በማይኖር የተገደበ-ሪፖ ውድቀት ሁነታ።
  • ቅድመ-ስልጠና የወሰዱ ክብደቶች መጥፎ የውሂብ ስብስብን ሊሸፍኑ ይችላሉ። በተበላሸ ውሂብ ላይ በከፊል የሚሰራ ማስተካከያ ውሂቡን ከመመልከትዎ በፊት አንድ ሳምንት ያስከፍላል።

የድሮ ሩጫን እንደገና የማባዛት ሁኔታ

የ2025 ቼክፖይንትን መከታተል የሞዴል ምርጫውን ለእርስዎ ያደርገዋል እና ችግሩን ወደ ስሪት ማስተካከል ይለውጠዋል: አሁን ያለው LeRobot N1.5ን አይቀበልም፣ ስለዚህ እርስዎ lerobot==0.5.1. ምንም የዘር መስክ እና ከ5 እስከ 6 በመቶ ልዩነት ሳይኖር በሩጫዎች መካከል፣ ማባዛቱ በመዋቅር ግምታዊ ነው። እና የመድረክ ጎን አላቸው።

የAY-Robots የGR00T N1.7 እና Pi0.5 ፊት ለፊት ማነፃፀሪያ ገጽ፣ የፓራሜትር ብዛቶችን፣ የጂፒዩ መስፈርቶችን፣ የኢንፈረንስ መዘግየትን፣ የዳታሴት ቅርጸትን እና ዝቅተኛውን የክፍል ብዛት ጎን ለጎን የሚያሳይ።
በ/compare/groot-n1-7-vs-pi0-5 ላይ ፊት ለፊት። ሁለቱ 3 B ሞዴሎች በዝርዝር ወረቀት ላይ የሚለዋወጡ ቢመስሉም አይደሉም፡ አንዱ LeRobot v2.1 ሲፈልግ ሌላኛው v3.0 ይፈልጋል።

ወደ ሁለት ቀንሷል? ACT ከGR00T N1.7 ጋር እና GR00T N1.7 ከSmolVLA ጋር። ጥሬ ረድፎች በአሬና ግቤቶች ውስጥ ይገኛሉ፦ GR00T N1.7, Pi0.5, SmolVLA እና ACT.

ይህ መድረክ የማይረዳዎት ቦታ

  • የርቀት ኢንፈረንስን ፈጣን ማድረግ አይችልም። ከ20 እስከ 485 ms ያለው ዑደት የሞዴሉ ሲሆን፤ የኢንተርኔት የጉዞ ጊዜ ደግሞ ይጨምርበታል።
  • GR00T ወይም Pi0.5ን በራስዎ ሃርድዌር ላይ ማስተካከል አይችልም። ሁለቱም እዚህ ላይ የደመና-ብቻ ናቸው፤ SmolVLA እና ACT ብቻ በአካባቢው ይሰራሉ።
  • ዳታሴትን ማስተካከል አይችልም። ኪሳራው እየቀነሰ ፖሊሲው ምንም አያደርግም የዳታ ችግር ነው፣ በአንድ ቅንብር ውስጥ ብቻ የሚሰራ ፖሊሲ ደግሞ የሽፋን ችግር ነው።
  • የGR00T ስራዎችን እንደገና ሊባዙ የሚችሉ ማድረግ አይችልም፦ የላይኛው ኮንፊግ የዘር መስክ የለውም።

85 ሞዴሎች፣ 332 የቤንችማርክ ውጤቶች፣ እያንዳንዱ ቁጥር ወደ ምንጩ የተገናኘ

በዚህ ገጽ ላይ ያሉት ሰንጠረዦች ሊደረደሩ የሚችሉበት ስሪት: 85 የራዕይ-ቋንቋ-ድርጊት ሞዴሎች፣ 332 የቤንችማርክ ውጤቶች፣ እያንዳንዳቸው ወደየወረቀታቸው ወይም ሞዴል ካርዳቸው የተገናኙ ናቸው።

አሬናውን ክፈት

አንዱን መርጦ መቀጠል

አንድ ነባሪ: 50 ክፍሎችን ይመዝግቡ፣ የውሂብ ስብስቡን ለማረጋገጥ ACTን ከ1 እስከ 3 USD ያህል ያሰልጥኑ፣ ከዚያም SmolVLAን በተመሳሳይ ውሂብ ላይ ያሰለጥኑ። በአጠቃላይ ከ6 USD በታች፣ እና አስፈላጊውን ጥያቄ ይመልሳሉ: ቅድመ-ስልጠና እዚህ ይረዳል ወይስ የአንገት ማነቆው ውሂቡ ነው? ለግንኙነት የበለጸጉ ባለብዙ-ደረጃ ተግባራት ወደ GR00T N1.7፣ ትዕይንቱ ሲቀየር ደግሞ ወደ Pi0.5 ያሳድጉ።

የመድረክ አጠቃላይ እይታ: የመጀመሪያውን ፖሊሲዎን ያሰልጥኑ, ከዚያም የመጀመሪያውን ፖሊሲዎን ያሂዱየስልጠና ሰነዶች እና የውሂብ ስብስብ ሰነዶች ቅጽ እና ቅርጸትን ይሸፍናሉ፤ የ SO-100 ገጽ እና የ SO-100 ሙሉ መመሪያ ግንባታን እና ልኬትን ይሸፍናሉ። ዳራ: የ VLA አጠቃላይ እይታ እና የ Pi0 ፍሰት-ማዛመጃ ጽሑፍ። የስኬት መጠንዎን የሚያሳድገው የውሂብ ጥራት መመሪያ ነው።

በSO-100 ላይ መጀመሪያ የትኛውን VLA ፖሊሲ ማሰልጠን አለብኝ?

ACT፣ ከዚያ SmolVLA። ACT ከመጀመሪያው ስለሚያሰልጥን መጥፎ የውሂብ ስብስብን መሸፈን አይችልም፣ እና አንድ ሩጫ በ24 ጊባ ካርድ ላይ ከ1 እስከ 3 ዶላር ያስከፍላል። ACT ስራውን ከሰራ፣ ለGR00T N1.7 ወይም Pi0.5 ሩጫ የሚወጣው ከ4 እስከ 12 ዶላር አይባክንም።

GR00T N1.7 ከPi0.5 በእርግጥ የተሻለ ነው?

በLIBERO ላይ በድምፅ ደረጃ ውስጥ ናቸው: ለGR00T N1.7 በአራት ስብስቦች ላይ 97.0%፣ በopenpi ውስጥ በ30k እርምጃዎች ለPi0.5 96.85%፣ ለLeRobot ፖርት 97.5%፣ ሁሉም ከተለያዩ መሣሪያዎች የተገኙ ናቸው። ትክክለኛው ልዩነቶች በአንድ የድርጊት እርምጃ 152 ms ከ485 ms፣ v2.1 የውሂብ ስብስቦች ከv3.0፣ እና የቤንችማርክ ትክክለኛነት ከክፍት-ዓለም አጠቃላይነት ጋር ናቸው።

ከእነዚህ ውስጥ የትኛውንም በአንድ RTX 4090 ላይ ማስተካከል እችላለሁ?

SmolVLA እና ACT፣ አዎ፤ ሁለቱም ለRTX 4090 ወይም ለማንኛውም 24 ጊባ ካርድ የተዘረዘሩ ሲሆን በአካባቢው ይሰራሉ። GR00T N1.7፣ N1.5 እና Pi0.5 A100 ወይም H100 80 ጊባ ያስፈልጋቸዋል እና እዚህ በክላውድ ላይ ብቻ ይሰራሉ። NVIDIA ለGR00T ጥሩ ማስተካከያ 40 ጊባ ወይም ከዚያ በላይ ይመክራል። ለሙሉ Pi0.5 ጥሩ ማስተካከያ የopenpi ዝቅተኛው መስፈርት ከ70 ጊባ በላይ ሲሆን፣ ለLoRA ደግሞ 22.5 ጊባ ነው።

ከእነዚህ አምስት ውስጥ የትኛውን በንግድ መጠቀም እችላለሁ?

የGR00T N1.7 ክብደቶች በNVIDIA Open Model License Agreement ስር ናቸው፣ ይህም ካርዱ የንግድ አጠቃቀምን እንደሚሸፍን ይገልጻል። የN1.5 ክብደቶች ለንግድ ያልሆኑ ናቸው። የSmolVLA ኮድ በLeRobot ውስጥ Apache 2.0 ነው፣ ነገር ግን የlerobot/smolvla_base ካርድ የፍቃድ መስክ የለውም፣ ስለዚህ ክብደቶቹ አልተገለጹም። ACT ፈቃድ የሚሰጣቸው መሰረታዊ ክብደቶች የሉትም። Pi0.5 ግልጽ አይደለም: የLeRobot ሰነዶች Apache 2.0 ይላሉ፣ የካርዱ ሜታዳታ ደግሞ license: gemma ይላል።

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started