የ Policy ስልጠና
AY-Robots manipulation policy ዎችን በተያዙ GPU ዎች ላይ ያሰለጥናል፣ ስለዚህ የስልጠና ሃርድዌር ሳይኖርዎት ከተቀረጹ episode ዎች ወደ በእጅዎ ላይ የሚሰራ policy መሄድ ይችላሉ። ይህ ገጽ የተደገፉ policy ዓይነቶችን፣ የስልጠና run ገጹን፣ checkpoint ዎችን፣ ከ episode ብዛትዎ በእውነታ የሚጠበቁ ውጤቶችንም ይሸፍናል።
መጨረሻ የተዘመነው 2026-08-09
ያለ ራስዎ GPU ስልጠና
Manipulation policy ማሰልጠን የ GPU workload ነው፣ ዘመናዊ vision-language-action ሞዴሎችም ተለምዷዊ workstation ካለው በላይ VRAM ያስፈልጋቸዋል። በ AY-Robots ላይ ስልጠናው በመድረኩ በሚተዳደሩ cloud GPU ዎች ላይ ይሮጣል: dataset እና policy ዓይነት ይመርጣሉ፣ run ውን ይጀምራሉ፣ እድገቱንም ከአሳሽ ይከታተላሉ። ምንም CUDA ማዋቀር፣ driver ማዛመድ፣ ወይም የሚጠበቅ environment የለም።
ግቤቱ ሁልጊዜ ከ Dashboard > Datasets የመጣ cloud dataset ነው። በቴሌኦፕሬሽን ክፍለ ጊዜዎች የቀረጹት ወይም በ LeRobot ቅርጸት የሰቀሉት ማንኛውም ነገር ብቁ ነው፣ የተዋሃዱ dataset ዎችንም ጨምሮ። ከማሰልጠንዎ በፊት ያደራጁ: Failure label ያላቸው episode ዎች በተለምዶ ከ training set ውጭ መሆን አለባቸው፣ በ episode browser ውስጥ ያለ አስር ደቂቃ ግምገማም ከመጥፎ ማሳያዎች ለመማር የሚውል የ GPU ጊዜ ሰዓቶችን ያድናል።
የተደገፉ policy ዎች
አራት የ policy ቤተሰቦች ይደገፋሉ። በመጠን፣ በስልጠና ዋጋ፣ ከዳታዎ ምን ያህል መውሰድ እንደሚችሉ ይለያያሉ፣ ስለዚህ ትክክለኛው ምርጫ ከማንኛውም አጠቃላይ ደረጃ ይልቅ በስራዎና dataset ዎ ላይ የተመሰረተ ነው።
| Policy | ዓይነት | ባህርያት |
|---|---|---|
| ACT | Transformer, action chunking | ነጠላ ደረጃዎችን ከመተንበይ ይልቅ አጭር ወደፊት-ድርጊት chunk ዎችን ይተነብያል። Compact ነው፣ በአንጻራዊ ፍጥነት ያሰለጥናል፣ ለአንድ በደንብ ለተገለጸ ስራ ጠንካራ የመጀመሪያ ምርጫም ነው። |
| Diffusion Policy | Diffusion ከድርጊት sequences ላይ | የተሟላውን የተማከሩ ድርጊቶች ስርጭት ይመስላል፣ ይህም ማሳያዎችዎ ስራውን ከአንድ በላይ ትክክለኛ መንገድ ሲፈቱ ይረዳል። ከ ACT ይልቅ ለማሰልጠን ከባድና በ inference ላይ ቀርፋፋ ነው። |
| SmolVLA | ትንሽ vision-language-action ሞዴል | በቋንቋ የተስተካከለ: ከ episode ዎችዎ የመጣው የስራ string የግቤቱ ክፍል ይሆናል። ትልቅ foundation model ሳያስፈልግ የቋንቋ ማስተካከያ ከፈለጉ ጥሩ መካከለኛ ነጥብ ነው። |
| GR00T fine-tune | የ foundation model fine-tune | ትልቅ pretrained የሮቦቲክስ foundation model በ episode ዎችዎ ላይ fine-tune ያደርጋል። ከአራቱ ከፍተኛው ጣሪያ ነው፣ ከፍተኛው የስልጠና ዋጋ ጋር፣ ጥብቅ የ dataset ቅርጸት መስፈርትም አለው። |
GR00T fine-tuning በ LeRobot ቅርጸት version 2.1 ውስጥ ያሉ dataset ዎችን ብቻ ይቀበላል። የ v3.0 dataset በ data loading ጊዜ ይወድቃል፣ በ submission ጊዜ አይደለም፣ ስለዚህ run ውን ከመጀመርዎ በፊት የ version ቁጥሩን ያረጋግጡ። በመድረኩ ላይ የተቀረጹ dataset ዎች እንዳሉ ጥቅም ላይ ሊውሉ ይችላሉ፤ ለውጫዊ ስቀላዎች፣ በ meta/info.json ውስጥ version ውን መጀመሪያ ያረጋግጡ።
Run መጀመር
- 1Dataset ውን ይምረጡ
Dashboard > Training ን ይክፈቱ ለማሰልጠን ያለውን dataset ይምረጡ። ትክክለኛውን መምረጥዎን ማረጋገጥ እንዲችሉ የ episode ብዛትና የሮቦት ዓይነት ይታያሉ።
- 2Policy ውን ይምረጡ
ከተደገፉት policy ዓይነቶች አንዱን ይምረጡ። እርግጠኛ ካልሆኑ፣ በ ACT ይጀምሩ: dataset ዎ ማንኛውንም ነገር ለማሰልጠን በቂ መልካም መሆኑን ለማወቅ ርካሹ መንገድ ነው።
- 3ያስጀምሩ
Run ውን ይጀምሩ። Job id እና የራሱ run ገጽ ያገኛል፣ አሳሹንም መዝጋት ይችላሉ: ስልጠናው server-side ይቀጥላል ገጹም ሲመለሱ ቀጥታ ሁኔታውን ያሳያል።
የ training run ገጽ
እያንዳንዱ run በስልጠና ወቅት በእውነት ያሏቸውን ሁለት ጥያቄዎች የሚመልስ ራሱን የቻለ ገጽ አለው: እየተማረ ነው ወይ፣ ማሽኑም ጤናማ ነው ወይ። የመማር እድገት እንደ loss፣ የ learning rate ስኬጁል፣ የ gradient norm ገበታዎች ይታያል። ወዲያውኑ plateau የሚያደርግ loss ወይም የሚፈነዳ gradient norm run ው መጠበቅ የማይገባው መሆኑን ገና ይነግርዎታል።
የማሽን ጤንነት ከጎን ይታያል: የ GPU አጠቃቀምና memory፣ ከስልጠናው ማሽን host metrics ጋር። Phase timeline run ው አሁን የት እንዳለ ያሳያል፣ ከ environment ዝግጅት ጀምሮ በ data loading፣ በስልጠናው loop ራሱ፣ በ checkpoint ስቀላ ድረስ። ነገር ትክክል ያልመሰለ ጊዜ፣ የተገነባው log viewer ምንም SSH access ሳያስፈልገው ጥሬ የስልጠና logs ይሰጥዎታል፣ ይህም ውድቀቱ የ dataset ዎ ወይም የ run ው ራሱ መሆኑን ለማየት በተለምዶ በቂ ነው።
Checkpoint ዎችና መቀጠል
Checkpoint ዎች በ run ተከማችተዋል፣ በተጋራ pool ውስጥ አይደለም፣ ስለዚህ በ run ገጽ ላይ የተዘረዘሩት checkpoint ዎች ሁልጊዜ ለዚያው ራሱ run እና ማዋቀሩ ናቸው። ይህ ከሚመስለው በላይ አስፈላጊ ነው: በተለያዩ ቅንብሮች ባላቸው run ዎች መካከል checkpoint ዎችን መቀላቀል በጸጥታ ለሚበላሹ policy ዎች ክላሲክ ምንጭ ነው።
Run ከተቋረጠ፣ ከመጀመሪያ ከመጀመር ይልቅ ከቅርብ checkpoint ው መቀጠል ይችላሉ። Intermediate checkpoint ዎችም በራሳቸው ጠቃሚ ናቸው: ረዥም run ወደ መጨረሻ overfitting ሲጀምር፣ ቀደም ያለ checkpoint ብዙ ጊዜ ከመጨረሻው ይልቅ በእውነተኛው እጅ ላይ በተሻለ ይሰራል።
የሰለጠነውን policy በእጅዎ ላይ ማሂድ
የተጠናቀቀ policy ወደ ሮቦትዎ በቀጥታ ሊላክ ይችላል። በ cockpit ውስጥ፣ ለተገናኘው እጅዎ የሰለጠነውን policy ይምረጡ inference ንም ይጀምሩ: policy ው አሁን ቀደም ብለው በቴሌኦፕሬሽን ያመረቷቸውን የመገጣጠሚያ ትዕዛዞች ያመርታል። እጁ dataset ው የተቀረጸበት ተመሳሳይ የሮቦት ዓይነት መሆን አለበት፣ ትዕይንቱም የካሜራ አቀማመጥን ጨምሮ የስልጠና ትዕይንቶችን መምሰል አለበት።
የመጀመሪያዎቹን inference run ዎች እንደ ሙከራዎች ይያዙ፣ እንደ demo ዎች አይደለም። የአደጋ ማቆሚያውን በእጅ ርቀት ያቆዩ፣ ካሳዩት ጋር ቅርብ ከሆነ መነሻ ሁኔታ ይጀምሩ፣ policy ውም ላይገነዘቧቸው ለሚችሉ ነገሮች ስሜታዊ እንደሚሆን ይጠብቁ: የተንቀሳቀሰ ካሜራ፣ የተለየ ብርሃን፣ ወይም dataset ው በፍጹም ያልያዘው ነገር።
ስንት episode ዎች እንደሚያስፈልግዎት
በመድረኩ ላይ በጣም የተለመደው የስልጠና ስህተት የተሳሳተ hyperparameter አይደለም፣ በጣም ትንሽ ዳታ ላይ ማሰልጠንና policy ዓይነቱ አይሰራም ብሎ መደምደም ነው። ለአንድ tabletop ስራ እንደ ግምታዊ ደንብ: በግምት 50 episode ዎች ካሳዩዋቸው መነሻ ሁኔታዎች ቅርብ ከሆኑ የሚሳካ ጠባብ generalization ያለው policy ይሰጥዎታል። በግምት 100 እስከ 200 episode ዎች፣ በ episode ዎች መካከል የነገር አቀማመጥ ካለያዩ፣ ለዚያ አንድ ስራ በ workspace ውስጥ ጥቅም ላይ የሚውል ጥንካሬ ይሰጣል።
ይበልጥ ብቁ የሆኑ policy ዓይነቶች ይህንን አይሽሩትም። በ 20 episode ዎች ላይ የ GR00T fine-tune አሁንም በደካማ ይማከራል፤ ትልልቆቹ ሞዴሎች የሚገዙት ዳታው ሲኖር የተሻለ ጣሪያ ነው። በጀትዎ የተወሰነ ከሆነ፣ ትልቅ ሞዴል ከመጠቀም በፊት በተለያዩ episode ዎች ላይ ያውሉት።
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
የስልጠና run ምን ያህል ጊዜ ይወስዳል?▾
በ policy ዓይነትና በ dataset መጠን ላይ የተመሰረተ ነው፣ ስለዚህ ታማኝ ነጠላ ቁጥር የለም። ACT በተለምዶ ከአራቱ ፈጣኑ ነው፣ GR00T fine-tune ዎች ደግሞ ቀርፋፋው ናቸው። በ run ገጹ ላይ ያለው phase timeline እና loss charts run ው እየገፋ መሆኑን ገና ያሳያሉ።
በተዋሃደ dataset ላይ ማሰልጠን እችላለሁ?▾
አዎ። የተዋሃዱ dataset ዎች መደበኛ dataset ዎች ናቸው፤ የውህደት validation ወጥ fps፣ features፣ የሮቦት ዓይነት አስቀድሞ አረጋግጧል። የተመሳሳይ ስራ ቀረጻዎችን ማዋሃድ ወደ 100 እስከ 200 episode ክልል ለመድረስ ከጥሩ መንገዶች አንዱ ነው።
የ GR00T run ዬ በ data loading ጊዜ ይወድቃል። መጀመሪያ ምን ማየት አለብኝ?▾
የ dataset ቅርጸት version ውን። GR00T fine-tuning LeRobot v2.1 ይፈልጋል፣ የ v3.0 dataset ደግሞ በትክክል እዚያ ይወድቃል። በ dataset ዎ meta/info.json ውስጥ version ውን ያረጋግጡ።
ከማሰልጠን በፊት ያልተሳኩ episode ዎችን ማስወገድ አለብኝ?▾
በተለምዶ አዎ። Failure label ያላቸው episode ዎች policy ን የሚያዋርድ ባህሪ ያስተምራሉ። Recovery episode ዎች የተለዩ ናቸው: ስህተት እንዴት እንደሚስተካከል ያሳያሉ ብዙ ጊዜም ማቆየት ተገቢ ናቸው።
በስልጠና ወቅት አሳሹን ክፍት ማድረግ አለብኝ?▾
አይደለም። Run ዎች server-side ይፈጸማሉ። Run ገጹ ሲመለሱ የአሁኑን ሁኔታ፣ charts፣ logs ያሳያል፣ checkpoint ዎችም ማንም ቢመለከትም ባይመለከትም ይቀመጣሉ።