
GR00T N1.7፣ Pi0.5፣ SmolVLA፣ ACT ወይስ GR00T N1.5? ከእውነተኛ ሁኔታዎች ጋር የተጣመረ የመወሰኛ ሰንጠረዥ፣ ከታተሙት የቤንችማርክ ቁጥሮች፣ መዘግየት (latency)፣ ለእያንዳንዱ አሂድ ወጪ እና ከእያንዳንዱ ምርጫ ጀርባ ባሉ ፈቃዶች ጋር።
ዛሬ በአንድ SO-100 ክፍል ክንድ ላይ አምስት ፖሊሲዎች ማሰልጠን ይቻላል። እነዚህም በ24 እጥፍ የኢንፈረንስ መዘግየት፣ በ37 እጥፍ የፓራሜትር ብዛት እና በ12 እጥፍ የአንድ ሩጫ ወጪ፣ እንዲሁም ውጤቱን መላክ ይቻል እንደሆነ ይለያያሉ። አምስት ሞዴል ካርዶች ይህን ጥያቄ አይመልሱትም፡ የትኛውን መጀመሪያ ላስኬድ የሚለውን ጥያቄዎትን አንዳቸውም አይመልሱም።
ከታች ያሉት ሁሉም ቁጥሮች ከወረቀቶች፣ ሪፖዎች እና ካርዶች በነሐሴ 2026 የተነበቡ ናቸው። የፕላትፎርም ቁጥሮች የመጡት ከ የAY-Robots ፖሊሲ ካታሎግ፤ ሁለቱ የማይስማሙ ከሆነ፣ ሁለቱም ይታያሉ።
አጭር ማብራሪያ
- •የእርስዎን የውሂብ ስብስብ የሚጠራጠሩ ከሆነ መጀመሪያ ACTን ያሰልጥኑ፡ ለአንድ ሩጫ ከ1 እስከ 3 ዶላር፣ መጥፎ መረጃን ለመሸፈን ምንም ቅድመ-የሰለጠነ ነገር የለም።
- •GR00T N1.7 እና Pi0.5 በLIBERO ላይ ከግማሽ ነጥብ ውስጥ ይገኛሉ፣ 97.0 ከ96.85 እስከ 97.5። ይህ አንዱን ለመምረጥ ምክንያት አይደለም።
- •Pi0.5 የአጠቃላይ የማድረግ እንጂ የትክክለኛነት ጉዳይ አይደለም፣ እና በ485 ms በጣም ቀርፋፋ ነው።
- •SmolVLA፣ በ450 M ፓራሜትሮች፣ በአንድ 24 ጊባ ካርድ ላይ ብቻ የሚስተካከል ብቸኛው VLA ነው።
- •ACT በ20 ms ለፈጣን ምላሽ ሰጪ እንቅስቃሴ ብቸኛው አማራጭ ነው። ፈቃዶች ቀሪውን ይወስናሉ።
የውሳኔ ሰንጠረዥ
| የእርስዎ ሁኔታ | ይህን ያሰልጥኑ | ለምን |
|---|---|---|
| የመረጃ ስብስብ ጥራት ያልተረጋገጠ | ACT | ምንም ቅድመ-የሰለጠነ ነገር የተበላሸ የመረጃ ስብስብን አይሰውርም፣ እና አለመሳካት ከ1 እስከ 3 USD ያስከፍላል። |
| ግንኙነት የበዛበት፣ ባለብዙ ደረጃ፣ በቋንቋ የተመሰረተ | GR00T N1.7 | በአራት LIBERO ስብስቦች ላይ 97.0%፣ በተጨማሪም አንጻራዊ የመጨረሻ-አስፈጻሚ የእንቅስቃሴ ቦታ። |
| ፈጣን ምላሽ ሰጪ እንቅስቃሴ፣ በሰርቮስ ላይ ግምት | ACT | 20 ms. ቀጣዩ ፈጣን 7.6 እጥፍ ቀርፋፋ ነው። |
| አዲስ ነገሮች፣ አዲስ ትዕይንት፣ ክፍት ዓለም | Pi0.5 | ከስርጭት ውጪ ለሆኑ ባህሪያት የተገነባ፣ እስከ 104 ቦታዎች ላይ። |
| አንድ 24 GB ካርድ፣ አሁንም ቋንቋ ይፈልጋሉ | SmolVLA | 450 M መለኪያዎች፣ 30 የትዕይንት ክፍል ወለል፣ በአካባቢው ይሰራል። |
| በ2025 የተቀዳ ሩጫን እንደገና ማባዛት | GR00T N1.5 | ግድ ከሆነ ብቻ: LeRobot አሁን አይቀበለውም፣ ክብደቶች ለንግድ ያልሆኑ ናቸው። |
| ይህ እንደ ምርት ይላካል | N1.7, SmolVLA or ACT | N1.5 ለንግድ ያልሆነ ነው፣ Pi0.5 የGemma ውሎችን ይይዛል፣ የSmolVLA ካርድ ምንም አይገልጽም። |
አምስቱ እጩዎች
አምስቱም ፖሊሲዎች ናቸው: የካሜራ ፍሬሞች፣ የመገጣጠሚያ ቦታዎች እና፣ ከአራቱ ውስጥ፣ የቋንቋ መመሪያ፣ ለወደፊት የመገጣጠሚያ ኢላማዎች ክፍል የተመደበ። የሚለያቸው ነገር እርስዎ ከመምጣትዎ በፊት ምን ያህል እንደተማሩ ነው።
| ፖሊሲ | መለኪያዎች | መዘግየት | ጂፒዩ ደረጃ | አካባቢያዊ? | ዝቅተኛ ክፍሎች | ቅርጸት | ዋጋ |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | አዎ | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | አዎ | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | አይ | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | አይ | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | አይ | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
የNVIDIA የአሁኑ የእይታ-ቋንቋ-ድርጊት ሞዴል፣ ወደ 3 ቢሊዮን የሚጠጉ መለኪያዎች ያሉት፣ ከ40 ሚሊዮን የሚጠጉት በጥሩ ማስተካከያ ወቅት የሰለጠኑ ናቸው። ማከማቻው ከN1.6 የተደረጉ ለውጦችን ይዘረዝራል፡ የጀርባ አጥንት ከEagle ሞዴል ወደ Cosmos-Reason2-2B በQwen3-VL፣ የስርጭት ንብርብሮች ከ32 ወደ 16፣ የሁኔታ እና የድርጊት ልኬቶች ከ29 ወደ 132፣ የድርጊት አድማስ ከ16 ወደ 40።
በትንሽ ክንድ ላይ አስፈላጊው ነገር አንጻራዊው የመጨረሻ-ተፅዕኖ ፈጣሪ የድርጊት ቦታ ነው፡ N1.7 ከአሁን ካለው አቀማመጥ ለውጦችን ይተነብያል፣ ይህም 20K ሰዓታት የEgoScale የሰው ቪዲዮ ወደ ሮቦት ፖሊሲ እንዲተላለፍ ያስችላል። ዝርዝር መግለጫው በየN1.7 ገጽ ላይ፣ አሰራሩ በየN1.7 በSO-100 መመሪያ።
የIsaac-GR00T README N1.7ን እንደ አጠቃላይ ተገኝነት ልቀት፣ ሙሉ መለኪያዎች እና ድጋፍ ያለው መሆኑን ያውጃል። የHugging Face ካርዱ ገና አልተዘመነም፡ የModel Version መስክ አሁንም GR00T N1.7 EA ይላል። ማከማቻው አዲሱ ሰነድ ነው።
GR00T N1.5
ተመሳሳይ 3 ቢ ስኬል፣ Eagle 2 ባክቦን፣ SigLip2 እና T5፣ ፍሎው-ማችንግ ዲአይቲ ሄድ። አስቀድሞ ያለዎትን ለማስፋት ያለ ነው። ሁለት ነገሮች ደካማ ነባሪ ያደርጉታል፡ ክብደቶቹ NVIDIA's የአንድ-መንገድ ለንግድ ያልሆነ ፈቃድ ይዘዋል፣ እና የአሁኑ የLeRobot ልቀቶች የN1.5 ድጋፍን አስወግደዋል። ይመልከቱ .
Pi0.5
Physical Intelligence's ቪኤልኤ፣ የፖሊሲ አይነት pi05. ወረቀቱ ከPaliGemma የተጀመረ 2 ቢ ቪኤልኤም እና 300 ኤም የአክሽን ኤክስፐርት ይሰጣል፣ ሮቦቱን በ50 ኸርዝ ያንቀሳቅሳል፤ የLeRobot's pi05 ኮንፊግ ነባሪው 50-ደረጃ ቸንክ ነው፣ በዚያ ፍጥነት አንድ ሰከንድ። የሽያጭ ነጥቡ ያልታዩ ቦታዎች ናቸው፡ በእውነተኛ ቤቶች ውስጥ ወደ 400 ሰዓታት የሚጠጋ የሞባይል ማኒፑሌሽን፣ እና በ3፣ 12፣ 22፣ 53፣ 82 እና 104 ቦታዎች ላይ የተደረገ የስኬሊንግ ጥናት፣ በዚህም የ104-ቦታ ሞዴል በራሳቸው የሙከራ ቤቶች ላይ የሰለጠነ ቁጥጥርን አዛምዷ።
አንድ ገደብ፣ በlerobot/pi05_base ካርድ ላይ የተገለጸው: ወደቡ የሚያስተላልፈው ፍሰት-ተዛማጅ የሆነውን የድርጊት ራስን ብቻ ነው። ንዑስ ተግባር ትንበያ፣ የድርጊት ቶከን ማድረግ እና RL ከላይ አልተለቀቁም፣ እና openpi የራሱ ማከማቻም ተመሳሳይ እንደሆነ ይናገራል። የPi0.5 ገጽ እና የPi0.5 በSO-100 ላይ ያለው መመሪያ ቀሪውን ይዘዋል።
Pi0.5 የተገደበውን google/paligemma-3b-pt-224 ቶከናይዘር ይፈልጋል (gated: manual፣ ምንም እንኳን Google ጥያቄዎች ወዲያውኑ እንደሚሰሩ ቢናገርም)። ይህን ተቀብሎ በስልጠና አካባቢው ውስጥ hf auth login ሳያካሂዱ፣ ስራው ይጀምራል፣ ለተወሰነ ጊዜ ያወርዳል፣ ከዚያም እንደ አውታረ መረብ ስህተት በሚነበብ የፍቃድ ስህተት ይቋረጣል። nvidia/GR00T-N1.7-3B የተገደበ አይደለም፣ ነገር ግን የእሱ nvidia/Cosmos-Reason2-2B የጀርባ አጥንት የተገደበ ነው (gated: auto)። ወደ ወረፋ ከማስገባትዎ በፊት ሁለቱንም ያጽዱ፤ አንድ ሩጫ ስራ ፈትቶ ከቆየ፣ የተጣበቀው-ወረፋ ገጽ ምን ማረጋገጥ እንዳለቦት ይዘረዝራል።
SmolVLA
450 M ፓራሜትሮች፣ ከ100 M የሚሆኑት በድርጊት ኤክስፐርት ውስጥ፣ በSmolVLM-2 ላይ VLMው ቀዝቅዞ እና የእሱ የመጀመሪያዎቹ 16 የቋንቋ-ሞዴል ንብርብሮች ብቻ ጥቅም ላይ ውለዋል። ቅድመ-ስልጠናው የማህበረሰብ ዳታ ነበር: 481 የዳታ ስብስቦች፣ 10.6 M ፍሬሞች፣ ከእርስዎ ከሚጠቀሙባቸው ተመሳሳይ ርካሽ ክንዶች የተገኙ። እዚህ አንድ 24 GB ካርድ የሚመጥን ብቸኛው VLA፣ እና ብቸኛው 30 ክፍል ወለል። ይመልከቱ የSmolVLA ገጽ.
ACT
መሰረታዊ ሞዴል አይደለም። ከALOHA የመጣው Action Chunking Transformer ለእያንዳንዱ ተግባር ከባዶ የሰለጠነ ወደ 80 M ፓራሜትሮች አሉት፣ በ50 ማሳያዎች በ50 Hz። ወረቀቱ ስድስት እውነተኛ የሁለት እጅ ተግባራትን ሪፖርት ያደርጋል፣ እያንዳንዳቸው ከአስር ደቂቃ ማሳያዎች የተገኙ ናቸው፣ በሚያጎላባቸው ምሳሌዎች ላይ ከ80 እስከ 90 በመቶ ስኬት አለው። የእሱ ሀሳብ፣ የድርጊት ክፍፍል፣ በዚህ ገጽ ላይ ባሉ ሁሉም ሞዴሎች ውስጥ ይገኛል፣ እና የእሱ አብሌሽን አሁንም ውጤቱን የሚለካው በጣም በተሻለ ሁኔታ ነው፡ ጊዜያዊ ስብስብ ጠፍቶ በሁለት አስመሳይ ተግባራት ላይ፣ ስኬት ከ1 በመቶ (k=1) ወደ 44 በመቶ (k=100) ከፍ ይላል። የACT ገጽ ቀሪውን ይዟል።
የመለኪያ መመዘኛዎቹ በትክክል የሚሉት
LIBERO ከእነዚህ አምስት ውስጥ ሦስቱ ሪፖርት የሚያደርጉበት አንድ የመለኪያ መመዘኛ ነው፡ በቋንቋ የተመሰረቱ ተግባራት በአስመሳይ Franka Panda ላይ፣ ከታች ባሉት አራት ስብስቦች የተከፋፈሉ ሲሆን እያንዳንዳቸው አስር ተግባራት አሏቸው። NVIDIA ለእያንዳንዱ ስብስብ 200 ሙከራዎችን አድርጓል።
| ሞዴል | ቦታዊ | ዕቃ | ግብ | 10 (ረጅም) | አማካይ |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
እያንዳንዱ ቁጥር ከተለያዩ የሙከራ ስርዓቶች እና በጀቶች የመጣ ነው። GR00T በ20K እርምጃዎች በ640 ግሎባል ባች ላይ ሰርቷል፤ የopenpi አሃዝ የ30K ቼክፖይንት ነው፤ የLeRobot ፖርት በLIBERO መሰረታዊ ሞዴል ላይ 6K እርምጃዎችን ጨምሯል። SmolVLA ተጨማሪ አለመጣጣም ነው: የእሱ ወረቀት ያንን ረድፍ በLIBERO ላይ ከባዶ ያሰለጥናል፣ ያለ VLA ቅድመ-ስልጠና፣ ከሱ በላይ ያሉት ሶስቱ ግን ቅድመ-የሰለጠኑ ቼክፖይንቶችን ያጣራሉ። ከ96.85 እስከ 97.5 እንደ አንድ ስብስብ ይቁጠሩት፣ እና ወደ 87.3% ያለው ክፍተት እውነት ቢሆንም በ6.7x የፓራሜትሮች ብዛት የተገኘ ነው።
SimplerEnv ስርጭቱን ያሳያል፣ LIBERO ግን አያሳይም። NVIDIA N1.7ን ከN1.6 ጋር ያነፃፅራል፣ ይህም ለgenerational delta. በጣም ቅርብ የሆነ የህዝብ ነገር ነው።
| SimplerEnv ስብስብ | N1.6 አማካይ | N1.7 አማካይ | ምርጥ መወዛወዝ | በጣም መጥፎ መወዛወዝ |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | ምንም፣ እያንዳንዱ ተግባር ተሻሽሏል |
የብሪጅ ረድፍ ጠቃሚው ነው፡ በአማካይ 5.7 ነጥብ ሲገኝ put_eggplant_in_basket 36 አጥቷል እና put_eggplant_in_sink ከ33 ወደ 2 ወርዷል። አዲስ ትውልድ ስርጭቱን ከማንሳት ይልቅ ያንቀሳቅሰዋል፣ ስለዚህ ስራዎ N1.7 ወደ ኋላ በቀረበት ቦታ ከሆነ፣ አማካዩ ምንም አይናገርም።

ከአምስቱ ውስጥ፣ የSmolVLA ወረቀት ብቻ ነው ስለ SO-100 ክፍል ክንድ ሪፖርት የሚያደርገው፡ ለSmolVLA 78.3 በመቶ እና ለPi0 በሶስት ተግባራት ላይ 61.7፣ ሁለቱም ባለብዙ ተግባር፣ ከ48.3 ለACT በአንድ ተግባር የሰለጠነ ጋር ሲነጻጸር፣ ይህም ተመሳሳይ አይደለም። ንጹህ ጥምረት በSO-101 መርጦ ማስቀመጥ ላይ ሁለቱም ነጠላ ተግባር ናቸው፡ በስርጭት ውስጥ 90 ከ70፣ ከስርጭት ውጪ 50 ከ40። ከሱ ውጪ። ያወዳድሩ በ ACT ከSmolVLA ጋር እና Pi0.5 ከSmolVLA ጋር፣ ወይም ያስሱ አሬናውን.
መዘግየት እና ወጪ መዘርጋትን ይወስናሉ
የግምት መዘግየት ሰዎች በመጨረሻ የሚያገኙት እና በመጀመሪያ የሚጸጸቱበት ገደብ ነው። በአንድ መለኪያ ላይ በአምስት ነጥብ የተሻለ ፖሊሲ ግን በአንድ የድርጊት እርምጃ ግማሽ ሰከንድ የሚወስድ ከሆነ በጠረጴዛዎ ላይ የከፋ ይመስላል: የግንኙነት ተለዋዋጭነት አይጠብቅም።
አንድ ማስጠንቀቂያ: የGR00T አሃዝ ከNVIDIA ካርድ ጋር አይስማማም, ይህም 4 የድምፅ ቅነሳ ደረጃዎችን እና አንድ ካሜራ በH100 ላይ በ85.8 ms በ eager mode, በtorch.compile 48.6 ms, እና ሙሉ TensorRTን በመጠቀም 27.9 ms ይወስዳል። እዚህ ያለው 152 ms የአገልግሎት ወጪን እና ከአንድ በላይ ካሜራዎችን ያካተተ አጠቃላይ የሲስተም አሃዝ ነው, እንጂ forward pass አይደለም።
ከ20 እስከ 485 ms ያለው ዑደት የሞዴሉ ነው, እና የህዝብ-ኢንተርኔት የጉዞ ጊዜዎች ይጨምሩበታል። የርቀት ግምት ለቀርፋፋ pick-and-place ተግባራት ተስማሚ ነው, ፈጣን ምላሽ ለሚሹ እንቅስቃሴዎች ግን አይደለም። ተግባርዎ ፍጥነት የሚፈልግ ከሆነ, ግምቱ ከሰርቮስ አጠገብ ይቀመጣል: ACT ወይም SmolVLA, በአካባቢው። ተዛማጅ: ፖሊሲው በእንቅስቃሴ መካከል ይቀዘቅዛል።
ሞዴሉን ሳይቀይሩ ጊዜ ለመግዛት አንድ መንገድ: የSmolVLA ወረቀት synchronous executionን ይለካል, በዚህም ፖሊሲው ቀጣዩን ከመተንበዩ በፊት አንድ ክፍል ያጠናቅቃል, ከ asynchronous ጋር ሲነጻጸር, በዚህም ትንበያ ከ execution ጋር ይደራረባል። ስኬት ተመሳሳይ ነው, 78.3 ከ 73.3 ጋር ሲነጻጸር, ነገር ግን ተመሳሳይ pick-and-place 13.75 ፈንታ 9.7 ሰከንዶች ይወስዳል, እና በ ቋሚ መስኮት ውስጥ ሮቦቱ 9 ፈንታ 19 ዑደቶችን ያስተዳድራል።
ፈቃዶች፣ ማንም ስለማይፈትሻቸው ተፈትሸዋል
| ሞዴል | የክብደት ፈቃድ | የኮድ ፈቃድ | የንግድ አጠቃቀም |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; ካርዱ ለንግድ አገልግሎት ይፈቅዳል | Apache 2.0 | አዎ |
| GR00T N1.5 | NVIDIA የአንድ-መንገድ ለንግድ ያልሆነ ፈቃድ | Apache 2.0 | አይ |
| Pi0.5 | pi05_base ካርድ ሜታዳታ ፈቃድ: gemma ይላል | Apache 2.0 (openpi, LeRobot ሰነዶች) | ሁለቱንም ያንብቡ, አይስማሙም |
| SmolVLA | በ smolvla_base ካርዱ ላይ የፈቃድ መስክ የለም | Apache 2.0 (LeRobot) | ኮድ አዎ, ክብደቶች አልተገለጹም |
| ACT | ምንም መሰረታዊ ክብደቶች የሉም | Apache 2.0 (LeRobot) | አዎ |
የ Pi0.5 ረድፍ ጥንቃቄ ያስፈልገዋል። የ LeRobot pi05 ሰነድ ከ openpi ጋር በሚስማማ መልኩ Apache 2.0 ይላል፣ የ Hub ካርዱ ለ lerobot/pi05_base ሲይዝ license: gemma። ሁለቱም ንቁ ናቸው። GR00T N1.7 ደግሞ የቀለለ ስሪት አለው፡ የ Isaac-GR00T README N1.7 በ Apache 2.0 ስር ሙሉ በሙሉ ለንግድ አገልግሎት ፈቃድ ሊሰጥ እንደሚችል በነገራችን ላይ ይገልጻል፣ የራሱ የፈቃድ ክፍል እና የሞዴል ካርዱ ኮዱን ብቻ በ Apache 2.0 ስር ሲያስቀምጡ ክብደቶቹን ደግሞ በ NVIDIA Open Model License ስር አስቀምጠዋል።
በእርግጥ የሚያስኬዷቸው ነባሪዎች
እያንዳንዱ የትሬነር ፎርም ነባሪ ቅንብር ይዞ ይመጣል፣ እና እነዚህም በዘፈቀደ የተመረጡ አይደሉም። ACT's are LeRobot's own: batch 8, lr 1e-5, 100000 የሥልጠና ደረጃዎች፣ የቁራጭ መጠን 100፣ ከ ACTConfig አፕስትሪም ጋር የሚዛመድ እና k=100 from the ACT paper. ከታች ካሉት ዓምዶች አንዱ ወጥመድ ነው።
| ፖሊሲ | ባች | LR | ከፍተኛ ደረጃዎች | ግራድ አኩም | ይሠራል? | ተጨማሪ መቆጣጠሪያዎች |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | አዎ | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | አዎ | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | አይ (ለሮቦት 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | አይ | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | አይ | chunkSize, nActionSteps, seed, logFreq |
የGR00T የፋይን-ቲዩኒንግ መግቢያ ነጥብ (launch_finetune.py፣ ታይሮ CLI) በኮንፊግ ዳታክላሱ ውስጥ የሲድ መስክ የለውም፣ ስለዚህ ሩጫዎች ቢት-ለ-ቢት ሊባዙ አይችሉም። ሪፖው በተጨማሪም ከማይወሰኑ የምስል ማበልጸጊያዎች የተነሳ በሩጫዎች መካከል ከ5 እስከ 6 በመቶ ልዩነት እንዳለ ያስጠነቅቃል፣ ይህም በመስመር ላይ ከሚከራከሩባቸው አብዛኛዎቹ የቤንችማርክ ክፍተቶች ይበልጣል። የLeRobot ነባሪ ሲድ 1000 ነው። የግራድ-አኩም ዓምድ ለሮቦት 0.5.1ን ይገልጻል፤ አፕስትሪም 0.6.2 ደግሞ እንደ --accelerator.gradient_accumulation.steps ያሳያል።
ከሞዴል ምርጫ በላይ አስፈላጊ የሆነው መቆጣጠሪያ
ይህ የድርጊት ክፍል ነው። ረዘም ያሉ ክፍሎች ለስላሳ እንቅስቃሴ እና አነስተኛ ስህተቶችን ይሰጣሉ፣ ነገር ግን ፖሊሲው ብሎኩ በሚሰራበት ጊዜ የተወሰነ ስለሆነ፣ ለሚንቀሳቀስ ማንኛውም ነገር ዘግይቶ ምላሽ ይሰጣል፡ በማይንቀሳቀስ ኪዩብ ላይ በራስ መተማመን ሲኖረው፣ በሚንከባለል ላይ ተስፋ የለውም። ከልክ በላይ ከሄደ፣ የተሰራውን ክፍል ማሳጠር እንደገና ከማሰልጠን የተሻለ እና ነፃ ነው። ቀደም ብሎ የሚቆም መገጣጠሚያ የተለየ ችግር ነው፤ ይመልከቱ .
- ACT: ACTConfig በነባሪነት
chunk_size 100እናn_action_steps 100ይጠቀማል። ጊዜያዊ ስብስብ ጠፍቷል እናn_action_steps 1ያስፈልገዋል። - GR00T N1.7: ውስጣዊው አድማስ ከ16 ወደ 40 ቢሄድም፣ የLeRobot SO-101 ምሳሌ አሁንም
--policy.chunk_size=16 --policy.n_action_steps=16ን ያካሂዳል። የrollout ባንዲራ ወደ--execution-horizonተቀይሯል። - Pi0.5: 50-ደረጃ ያለው ክፍል ሲሆን፣ የLeRobot LIBERO የምግብ አሰራር 10ቱን በ
--policy.n_action_steps=10በኩል ያከናውናል።--policy.pretrained_pathሲኖር ባንዲራውን ከዘለሉ ወደ 50 ይመለሳል። - SmolVLA: 50-ድርጊት ክፍሎች፣ ሁለቱም መቆጣጠሪያዎች ክፍት ናቸው።
አምስቱንም በአንድ ከሰዓት በኋላ እንዴት ማጣራት ይቻላል
ርካሹ መልስ ብዙ ማንበብ አይደለም። ወደ 15 USD ያህል አውጥተው ክንዱ እንዲነግርዎት ያድርጉ፡ አንድ ጊዜ ይመዝግቡ፣ መጀመሪያ ርካሹን ሞዴል ያሰለጥኑ፣ መረጃው ትክክል መሆኑን ካረጋገጠ በኋላ ያሳድጉ። መዋቅር ከብዛት ይበልጣል፣ የ እና የ .
- 150 ክፍሎችን አንድ ጊዜ ይመዝግቡ
ሃምሳ ለGR00T፣ Pi0.5 እና ACT፣ እንዲሁም ለSmolVLA 30 መንገድ ይከፍታል። እያንዳንዱን ልዩነት ደጋግመው ይስሩ እንጂ አያዳርሱት፡ 50 ክፍሎች በ5 የኩብ አቀማመጦች ላይ የሰለጠኑ ሲሆን 25ቱ ግን አልሰለጠኑም። የመጀመሪያውን የውሂብ ስብስብዎን ይመዝግቡ።
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ACTን መጀመሪያ ያሰልጥኑ፣ ምክንያቱም ሊዋሽዎት አይችልም
ቅድመ-የሰለጠኑ ክብደቶች የሉም፣ ስለዚህ ስራውን ከሰራ፣ የውሂብ ስብስብዎ ስራውን ይዟል። ACT ከቀዘቀዘ፣ ውሂቡን ያስተካክሉ። 1 to 3 USD፣ 2 to 5 ሰዓታት በ24 GB ካርድ ላይ።
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLAን በተመሳሳይ የውሂብ ስብስብ ላይ ያሂዱ፣ ሳይቀየር
ተመሳሳይ ውሂብ፣ ተመሳሳይ ክንድ፣ ከ80 M ይልቅ 450 M መለኪያዎች፣ በተጨማሪም የቋንቋ ሁኔታ። LeRobot 20K እርምጃዎችን በአንድ A100 ላይ በግምት 4 ሰዓታት ይወስዳል። ይህ ቅድመ-ስልጠና ምንም ነገር እንደሚያመጣ ይነግርዎታል።
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00Tን ከመንካትዎ በፊት ወደ v2.1 ይቀይሩ
GR00T የLeRobot v2 ቅርጸት አይነትን እና የተጨመረ
meta/modality.jsonየተዋሃዱ የሁኔታ እና የድርጊት ድርድሮች ወደ ስም ያላቸው መስኮች እንዴት እንደሚከፋፈሉ የሚያሳይ ካርታ ያነባል። v3.0 የውሂብ ስብስብ ያንን ጫኝ ያበላሸዋል፣ ምክንያቱም v3.0 ብዙ ክፍሎችን ወደ የጋራ ፋይሎች ስለሚያስገባ v2 ግን ለእያንዳንዱ ክፍል አንድ ፋይል ይጽፍ ነበር። Isaac-GR00T የማውረድ ረዳቱን እንደscripts/lerobot_conversion/convert_v3_to_v2.pyያቀርባል፤ የv3 ውድቅ ገጽ ፈጣን መንገድ ነው።text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5የመጀመሪያዎቹ ሁለቱ ምንም ካልሰሩ ወደ GR00T N1.7 ብቻ ያሳድጉ
እዚህ በሚታየው በNVIDIA CLI በኩል፣ ወይም በLeRobot
grootፖሊሲ አይነት። NVIDIA ለጥሩ ማስተካከያ 40 GB ወይም ከዚያ በላይ VRAM፣ ለመገመት ደግሞ 16 GB ይመክራል። በOOM ላይ፣ የOOM ገጽን ይመልከቱ።bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
ያንን የማጣሪያ ማለፊያ ለማስኬድ ሁለት መንገዶች
ሶስት አካባቢዎች፣ ምክንያቱም የመሳሪያ ሰንሰለቶቹ አብረው አይኖሩም። በዋናው ላይ ያለው LeRobot 0.6.2 ሲሆን Python 3.12 ወይም ከዚያ በላይ ያስፈልገዋል፤ Isaac-GR00T እና openpi የተለዩ በuv የሚተዳደሩ ማከማቻዎች ናቸው።
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0ን እንደ ብቸኛ የቪዲዮ የኋላ ክፍል ይጠቀማል፣ FFmpeg 4 እስከ 7 ያስፈልገዋል። FFmpeg 8 አይደገፍም፣ AV1 ዋስትና የለውም። - openpi የማህደረ ትውስታ ገደቦች፡ መገመት ከ8 GB በላይ፣ LoRA ከ22.5 GB በላይ፣ ሙሉ ጥሩ ማስተካከያ ከ70 GB በላይ። ይህ የመጨረሻው Pi0.5 የA100 ስራ የሆነበት ምክንያት ነው።
- ጂፒዩውን እራስዎ ይከራዩ፣ በኋላ ያጥፉት፣ ሶስት የፍተሻ ነጥብ መንገዶችን በእጅ ያስተካክሉ።
ተመሳሳይ አምስት ሞዴሎች፣ አንድ ቅጽ። ሞዴል፣ የውሂብ ስብስብ እና ሃይፐርፓራሜትሮችን ይምረጡ፤ የኋላ ክፍሉ በሚያስፈልገው VRAM መጠን ጂፒዩ ይከራያል፣ አሰልጣኙን ያካሂዳል እና ወደ ዕቃ ማከማቻ ይጽፋል።
- የስልጠና ማትሪክስ አምስት ሞዴሎች በአራት ክንዶች ሲሆኑ፣ እያንዳንዱ ሕዋስ መመሪያ ነው፡ SmolVLA በSO-100 ላይ፣ ACT በSO-101 ላይ።
- የመገመቻ ፖዶች በ
/api/inference/podበኩል በስራ ፈት የጥበቃ ሰዓት በራስ-ሰር ይቀርባሉ፣ ስለዚህ የተረሳ ፖድ በጸጥታ ክፍያ አያስከፍልም። - መሰረታዊ የፍተሻ ነጥቦች የሻጮቹ የራሳቸው ናቸው፡
nvidia/GR00T-N1.7-3B፣nvidia/GR00T-N1.5-3B፣lerobot/pi05_base። ACT የለውም። - ተመሳሳይ ስራዎች ከCLI እና ከAI ወኪሎች በMCP አገልጋይ በኩል።
- ሃርድዌር የለም? ቀጥታ ክንድ አካላዊ SO-100ን ያለ ምዝገባ ያስተላልፋል፤ የሙከራ ገጹ የመግቢያ መንገዶችን ያሳያል።
መሰረታዊ ሞዴል ወይም ከባዶ
ትክክለኛው ምርጫ የትኛውን 3 B ሞዴል መምረጥ አይደለም። ይልቁንም ቅድመ-ስልጠና የወሰደ VLA መጠቀም አለመጠቀም ነው፣ ምክንያቱም ACT እያንዳንዳቸው ከአስር ደቂቃ በሚበልጡ ማሳያዎች ስድስት እውነተኛ የሁለት እጅ ስራዎችን የተማረው በ80 M ፓራሜትሮች እና ምንም ቅድመ-ስልጠና ሳይወስድ ነው።
- የቋንቋ ማስተካከያ። ACT የለውም፤ አንድ የACT ቼክፖይንት አንድ ተግባር ያከናውናል።
- ከማሳያዎችዎ ውጪ ባሉ ነገሮች ላይ የተሻለ: በSO-101 ላይ፣ 50% ከACT 40% ከስርጭት ውጪ።
- በአጠቃላይ ብዙ ተግባር: SmolVLA በሶስት SO-100 ተግባራት ላይ በአንድ ቼክፖይንት 78.3% ይደርሳል፤ ACT የተካሄደው ለአንድ ተግባር ብቻ ነበር።
- ከ7.6x እስከ 24x የሚደርስ መዘግየት: በአንድ የድርጊት እርምጃ ከ152 እስከ 485 ms ከACT 20 ms ጋር ሲነጻጸር።
- በአንድ ሩጫ ከ4 እስከ 12 USD ከ1 እስከ 3 ይልቅ፣ እና A100 ደረጃ ከማንኛውም 24 GB ካርድ ይልቅ።
- የፍቃድ ተጋላጭነት፣ በተጨማሪም ከባዶ በማይኖር የተገደበ-ሪፖ ውድቀት ሁነታ።
- ቅድመ-ስልጠና የወሰዱ ክብደቶች መጥፎ የውሂብ ስብስብን ሊሸፍኑ ይችላሉ። በተበላሸ ውሂብ ላይ በከፊል የሚሰራ ማስተካከያ ውሂቡን ከመመልከትዎ በፊት አንድ ሳምንት ያስከፍላል።
የድሮ ሩጫን እንደገና የማባዛት ሁኔታ
የ2025 ቼክፖይንትን መከታተል የሞዴል ምርጫውን ለእርስዎ ያደርገዋል እና ችግሩን ወደ ስሪት ማስተካከል ይለውጠዋል: አሁን ያለው LeRobot N1.5ን አይቀበልም፣ ስለዚህ እርስዎ lerobot==0.5.1. ምንም የዘር መስክ እና ከ5 እስከ 6 በመቶ ልዩነት ሳይኖር በሩጫዎች መካከል፣ ማባዛቱ በመዋቅር ግምታዊ ነው። እና የመድረክ ጎን አላቸው።

ወደ ሁለት ቀንሷል? ACT ከGR00T N1.7 ጋር እና GR00T N1.7 ከSmolVLA ጋር። ጥሬ ረድፎች በአሬና ግቤቶች ውስጥ ይገኛሉ፦ GR00T N1.7, Pi0.5, SmolVLA እና ACT.
ይህ መድረክ የማይረዳዎት ቦታ
- የርቀት ኢንፈረንስን ፈጣን ማድረግ አይችልም። ከ20 እስከ 485 ms ያለው ዑደት የሞዴሉ ሲሆን፤ የኢንተርኔት የጉዞ ጊዜ ደግሞ ይጨምርበታል።
- GR00T ወይም Pi0.5ን በራስዎ ሃርድዌር ላይ ማስተካከል አይችልም። ሁለቱም እዚህ ላይ የደመና-ብቻ ናቸው፤ SmolVLA እና ACT ብቻ በአካባቢው ይሰራሉ።
- ዳታሴትን ማስተካከል አይችልም። ኪሳራው እየቀነሰ ፖሊሲው ምንም አያደርግም የዳታ ችግር ነው፣ በአንድ ቅንብር ውስጥ ብቻ የሚሰራ ፖሊሲ ደግሞ የሽፋን ችግር ነው።
- የGR00T ስራዎችን እንደገና ሊባዙ የሚችሉ ማድረግ አይችልም፦ የላይኛው ኮንፊግ የዘር መስክ የለውም።
85 ሞዴሎች፣ 332 የቤንችማርክ ውጤቶች፣ እያንዳንዱ ቁጥር ወደ ምንጩ የተገናኘ
በዚህ ገጽ ላይ ያሉት ሰንጠረዦች ሊደረደሩ የሚችሉበት ስሪት: 85 የራዕይ-ቋንቋ-ድርጊት ሞዴሎች፣ 332 የቤንችማርክ ውጤቶች፣ እያንዳንዳቸው ወደየወረቀታቸው ወይም ሞዴል ካርዳቸው የተገናኙ ናቸው።
አሬናውን ክፈትአንዱን መርጦ መቀጠል
አንድ ነባሪ: 50 ክፍሎችን ይመዝግቡ፣ የውሂብ ስብስቡን ለማረጋገጥ ACTን ከ1 እስከ 3 USD ያህል ያሰልጥኑ፣ ከዚያም SmolVLAን በተመሳሳይ ውሂብ ላይ ያሰለጥኑ። በአጠቃላይ ከ6 USD በታች፣ እና አስፈላጊውን ጥያቄ ይመልሳሉ: ቅድመ-ስልጠና እዚህ ይረዳል ወይስ የአንገት ማነቆው ውሂቡ ነው? ለግንኙነት የበለጸጉ ባለብዙ-ደረጃ ተግባራት ወደ GR00T N1.7፣ ትዕይንቱ ሲቀየር ደግሞ ወደ Pi0.5 ያሳድጉ።
የመድረክ አጠቃላይ እይታ: የመጀመሪያውን ፖሊሲዎን ያሰልጥኑ, ከዚያም የመጀመሪያውን ፖሊሲዎን ያሂዱ። የስልጠና ሰነዶች እና የውሂብ ስብስብ ሰነዶች ቅጽ እና ቅርጸትን ይሸፍናሉ፤ የ SO-100 ገጽ እና የ SO-100 ሙሉ መመሪያ ግንባታን እና ልኬትን ይሸፍናሉ። ዳራ: የ VLA አጠቃላይ እይታ እና የ Pi0 ፍሰት-ማዛመጃ ጽሑፍ። የስኬት መጠንዎን የሚያሳድገው የውሂብ ጥራት መመሪያ ነው።
በSO-100 ላይ መጀመሪያ የትኛውን VLA ፖሊሲ ማሰልጠን አለብኝ?▾
ACT፣ ከዚያ SmolVLA። ACT ከመጀመሪያው ስለሚያሰልጥን መጥፎ የውሂብ ስብስብን መሸፈን አይችልም፣ እና አንድ ሩጫ በ24 ጊባ ካርድ ላይ ከ1 እስከ 3 ዶላር ያስከፍላል። ACT ስራውን ከሰራ፣ ለGR00T N1.7 ወይም Pi0.5 ሩጫ የሚወጣው ከ4 እስከ 12 ዶላር አይባክንም።
GR00T N1.7 ከPi0.5 በእርግጥ የተሻለ ነው?▾
በLIBERO ላይ በድምፅ ደረጃ ውስጥ ናቸው: ለGR00T N1.7 በአራት ስብስቦች ላይ 97.0%፣ በopenpi ውስጥ በ30k እርምጃዎች ለPi0.5 96.85%፣ ለLeRobot ፖርት 97.5%፣ ሁሉም ከተለያዩ መሣሪያዎች የተገኙ ናቸው። ትክክለኛው ልዩነቶች በአንድ የድርጊት እርምጃ 152 ms ከ485 ms፣ v2.1 የውሂብ ስብስቦች ከv3.0፣ እና የቤንችማርክ ትክክለኛነት ከክፍት-ዓለም አጠቃላይነት ጋር ናቸው።
ከእነዚህ ውስጥ የትኛውንም በአንድ RTX 4090 ላይ ማስተካከል እችላለሁ?▾
SmolVLA እና ACT፣ አዎ፤ ሁለቱም ለRTX 4090 ወይም ለማንኛውም 24 ጊባ ካርድ የተዘረዘሩ ሲሆን በአካባቢው ይሰራሉ። GR00T N1.7፣ N1.5 እና Pi0.5 A100 ወይም H100 80 ጊባ ያስፈልጋቸዋል እና እዚህ በክላውድ ላይ ብቻ ይሰራሉ። NVIDIA ለGR00T ጥሩ ማስተካከያ 40 ጊባ ወይም ከዚያ በላይ ይመክራል። ለሙሉ Pi0.5 ጥሩ ማስተካከያ የopenpi ዝቅተኛው መስፈርት ከ70 ጊባ በላይ ሲሆን፣ ለLoRA ደግሞ 22.5 ጊባ ነው።
ከእነዚህ አምስት ውስጥ የትኛውን በንግድ መጠቀም እችላለሁ?▾
የGR00T N1.7 ክብደቶች በNVIDIA Open Model License Agreement ስር ናቸው፣ ይህም ካርዱ የንግድ አጠቃቀምን እንደሚሸፍን ይገልጻል። የN1.5 ክብደቶች ለንግድ ያልሆኑ ናቸው። የSmolVLA ኮድ በLeRobot ውስጥ Apache 2.0 ነው፣ ነገር ግን የlerobot/smolvla_base ካርድ የፍቃድ መስክ የለውም፣ ስለዚህ ክብደቶቹ አልተገለጹም። ACT ፈቃድ የሚሰጣቸው መሰረታዊ ክብደቶች የሉትም። Pi0.5 ግልጽ አይደለም: የLeRobot ሰነዶች Apache 2.0 ይላሉ፣ የካርዱ ሜታዳታ ደግሞ license: gemma ይላል።
Sources
- NVIDIA Isaac-GR00T ማከማቻ: GA ሁኔታ፣ ከN1.6 ወደ N1.7 ለውጦች፣ የሃርድዌር መስፈርቶች፣ torchcodec እና FFmpeg ገደቦች፣ launch_finetune.py፣ ከሩጫ ወደ ሩጫ ልዩነት
- nvidia/GR00T-N1.7-3B ሞዴል ካርድ: Cosmos-Reason2-2B የጀርባ አጥንት፣ 3 ቢ ፓራሜትሮች፣ የማመዛዘን ጊዜ ሰንጠረዥ፣ NVIDIA Open Model License፣ የሞዴል ስሪት መስክ
- nvidia/GR00T-N1.5-3B ሞዴል ካርድ: Eagle 2 ማጣቀሻ፣ SigLip2 እና T5፣ ፍሰት ማዛመጃ DiT፣ አንድ-መንገድ ለንግድ ያልሆነ ፈቃድ
- Isaac-GR00T LIBERO ምሳሌ: በ20K እርምጃዎች እና በ640 ባች መጠን ለእያንዳንዱ ስብስብ የስኬት መጠኖች፣ ለእያንዳንዱ ስብስብ 200 ሙከራዎች
- Isaac-GR00T SimplerEnv ምሳሌ: ለእያንዳንዱ ተግባር የBridge እና Fractal የስኬት መጠኖች፣ GR00T N1.6 ከN1.7 ጋር ሲነጻጸር
- pi0.5: ክፍት-ዓለም አጠቃላይነት ያለው የእይታ-ቋንቋ-ድርጊት ሞዴል (2 ቢ VLM እና 300 ኤም የድርጊት ኤክስፐርት፣ 50 Hz ቁጥጥር፣ ወደ 400 ሰዓታት የሚጠጋ የሞባይል ማኒፑሌሽን፣ ከ3 እስከ 104 ቦታዎች ላይ የተደረገ የመጠን ጥናት)
- openpi ማከማቻ: የጂፒዩ ማህደረ ትውስታ ዝቅተኛ ገደቦች፣ የፍሰት-ማዛመጃ-ራስ-ብቻ ወሰን፣ እና የPi0.5 LIBERO ውጤቶች በexamples/libero ውስጥ
- lerobot/pi05_base ሞዴል ካርድ: የLeRobot ፖርት ወሰን፣ license: gemma ሜታዳታ፣ lerobot-train አጠቃቀም
- LeRobot pi0.5 ሰነድ: የተገደበ PaliGemma ቶከናይዘር፣ LIBERO የመራባት ሰንጠረዥ፣ n_action_steps የመጠባበቂያ ወጥመድ፣ Apache 2.0 መግለጫ
- SmolVLA: ተመጣጣኝ እና ቀልጣፋ ሮቦቲክስ የእይታ-ቋንቋ-ድርጊት ሞዴል (450 ኤም ፓራሜትሮች፣ LIBERO እና Meta-World ሰንጠረዦች፣ SO-100 እና SO-101 ውጤቶች፣ ያልተመሳሰለ ማመዛዘን)
- LeRobot SmolVLA ሰነድ: በA100 ላይ በግምት በ4 ሰዓታት ውስጥ 50 ክፍሎች በ5 ቦታዎች ከ25 ጋር ሲነጻጸሩ፣ 20k እርምጃዎች
- ዝቅተኛ ወጪ ሃርድዌርን በመጠቀም ጥቃቅን ባለሁለት እጅ ማኒፑሌሽን መማር (ACT እና ALOHA): 6 ተግባራት በ80-90 በመቶ፣ የክፍል መጠን ቅነሳ ከk=1 እስከ k=100
- LeRobot 0.6.2: ACTConfig እና SmolVLAConfig ነባሪዎች፣ ነባሪ ዘር 1000፣ --accelerator.gradient_accumulation.steps፣ Python 3.12 መስፈርት፣ Apache 2.0
- LeRobot GR00T ሰነድ: የፖሊሲ አይነት groot፣ የN1.5 ድጋፍ ተወግዷል፣ pin lerobot==0.5.1፣ SO-101 የክፍል መጠን ምሳሌ
- lerobot/smolvla_base ሞዴል ካርድ: በ--policy.path ጥቅም ላይ የዋለው የSmolVLA መሰረታዊ ቼክፖይንት፣ እና የፍቃድ መስክ የሌለው የካርዱ ሜታዳታ
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started