policy ስህተት ሲሰራ ይረከቡ፣ ከዚያም በራስዎ ማስተካከያ ላይ ያሰለጥኑት።
በ behavior cloning የሰለጠነ policy የሚያውቀው እርስዎ ማሳያ ባደረጉባቸው ሁኔታዎች ብቻ ነው። DAgger ይህን ክፍተት policy ራሱ በሚደርስባቸው ሁኔታዎች ከተገኘ መረጃ ጋር ይዘጋዋል። AY-Robots ሙሉውን loop በ SO-100 ላይ ያሂዳል፦ checkpoint ያሽከርክሩ፣ በሩጫው መሃል ይረከቡ፣ የተስተካከሉ episodes ያቆዩ፣ ድብልቁን ያዘጋጁ፣ ገና ካሽከረከሩት checkpoint ስልጠናውንም ይቀጥሉ።
- HG-DAgger፣ ሰው-ተቆጣጣሪ
- SO-100 / SO-101
- ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
- በእያንዳንዱ ዙር የጣልቃ ገብነት መጠን
የሰለጠነ policy ፈጽሞ ያልታየ ነገር የሚያደርገው ለምንድን ነው
Behavior cloning ቁጥጥርን እንደ ተራ supervised learning ይይዘዋል፦ observation ይገባል፣ የመገጣጠሚያ ኢላማ ይወጣል፣ ሰው በቀዳቸው ፍሬሞች ላይ ተስተካክሎ። ይህ የሚሰራው ሮቦቱ ያ ሰው በደረሰባቸው ሁኔታዎች ላይ ብቻ እስከቆየ ድረስ ነው፣ ነገር ግን አይቆይም። አርባ ሚሊሰከንድ ቀድሞ የሚዘጋ መያዣ ኩቡን ከታየው አቀማመጥ ሁለት ሚሊሜትር ይገፋዋል። ቀጣዩ observation የስልጠናው ስብስብ የማይይዘው ነው፣ ስለዚህ እዚያ ያለው action ግምት (extrapolation) ብቻ ነው፣ ከዚያ በኋላ ያለው ሁኔታም የበለጠ ወጣ ብሎ ይገኛል። የስልጠናው distribution እና የተማረው policy በተግባር የሚፈጥረው distribution ሁለት የተለያዩ ነገሮች ናቸው፣ episode ው ሲሄድ ደግሞ ሁለተኛው ከመጀመሪያው እየራቀ ይሄዳል።
Ross, Gordon እና Bagnell ይህንኑ ውድቀት በ2011 በትክክል ገልጸው ልኩንም አስቀምጠዋል፦ በ expert distribution ስር በ e እድል የሚሳሳት classifier፣ ራሱ በሚፈጥረው distribution ስር በ T እርምጃዎች horizon ውስጥ በግምት T ስኩዌር ማባዛት e የሚያክል ስህተት ሊሰራ ይችላል፣ ምክንያቱም አንድ ስህተት expert ፈጽሞ ያላመነጨውን observation ስለሚፈጥር እና ስህተቶቹ እየተደራረቡ ስለሚሄዱ ነው። መፍትሄያቸው ይህ ገጽ የሚያወራበት algorithm ነው። አሁን ያለውን policy ያሂዱ፣ ለሚደርስባቸው ሁኔታዎች የ expert labels ይሰብስቡ፣ እስካሁን ከተሰበሰበው ጋር ያዋህዷቸው፣ እንደገና ያሰልጥኑ፣ ይድገሙት። ተመሳሳይ አይነት ተጨማሪ ማሳያዎች አይረዱም፣ ምክንያቱም ተመሳሳዩን distribution ብቻ ስለሚደግሙ ነው። policy በሚደርስባቸው ሁኔታዎች ላይ ያሉ labels ግን ይረዳሉ። እዚህ ላይ የተተገበረው ስሪት ሰው-ተቆጣጣሪ (HG-DAgger, Kelly et al.) ነው፦ policy ቁጥጥሩን የሚይዘው አንድ ሰው ስህተት እየሆነ መሆኑን እስኪወስን እና እስኪረከብ ድረስ ብቻ ነው፣ ስለዚህ ማስተካከያዎች የሚፈጠሩት በሚያስፈልጉበት ቦታ ብቻ ነው፣ ክንዱም ኦፕሬተሩ ወደማይፈቅደው ሁኔታ እንዲነዳ ፈጽሞ አይጠየቅም።
- Behavior cloning የሚሰራው በሰለጠነበት distribution ላይ ብቻ ነው።
- ውድቀቱ ራሱን የሚያጎላ ነው፦ ትንሽ ልዩነት የማይታወቅ ሁኔታ ይፈጥራል፣ ያ ደግሞ ትልቅ ልዩነት ይፈጥራል።
- መፍትሄው ተጨማሪ ማሳያዎች ሳይሆኑ policy ራሱ በሚደርስባቸው ሁኔታዎች ላይ ያሉ labels ናቸው።
- ሰው-ተቆጣጣሪ ማለት መቼ ጣልቃ መግባት እንዳለበት የሚወስነው ኦፕሬተሩ ነው፣ የ autonomy ነጥብ አይደለም ማለት ነው።
ስህተቱ ለምን እየተደራረበ ይሄዳል
horizon ውን ይጎትቱ። በ behavior cloning ስር የሚጠበቀው ተጨማሪ ወጪ በግምት ከእርምጃዎች ብዛት ስኩዌር ጋር እኩል ያድጋል፣ ምክንያቱም እያንዳንዱ ስህተት ማሳያዎቹ ፈጽሞ ያልሸፈኑት ሁኔታ ስለሚፈጥር ነው፤ የ aggregation loop ግን እድገቱን ወደ linear ጠጋ አድርጎ ይይዘዋል (Ross et al., 2011)።
ከ Ross et al. (2011) ወሰኖች የተወሰዱ ገላጭ ኩርባዎች እንጂ ከእርስዎ ሮቦት የተለኩ አይደሉም። ነጥቡ ቅርጹ ነው እንጂ ቁጥሮቹ አይደሉም።
አንድ የDAgger ዙር፣ ስድስት እርምጃዎች
ይህ መድረኩ በተግባር የሚያሂደው loop ነው፣ ንድፍ ብቻ አይደለም። ከታች ያለው እያንዳንዱ እርምጃ በ cockpit ውስጥ ካለ መቆጣጠሪያ ጋር ይዛመዳል።
loop ውን በደረጃ ይመልከቱ
ተመሳሳዩ ስድስት እርምጃዎች፣ አንድ በአንድ፣ በእያንዳንዳቸው ላይ በክንዱና በ dataset ውስጥ ከሚሆነው ጋር።
policy ን ያሂዱ እና ይቅዱ
እርስዎ ባሰለጠኑት checkpoint ላይ የ inference ሩጫ ይጀምሩ። ሩጫው በሚካሄድበት ጊዜ ራሱ ከሩጫው task ጽሑፍ ጋር ይቀዳል፣ ስለዚህ ፍሬሞቹ በኋላ ማየት ብቻ ከሚቻል ቪዲዮ ይልቅ እንደ ስልጠና መረጃ ሊያገለግሉ ይችላሉ።
ይረከቡ እና ያስተካክሉ
ክንዱ የተሳሳተ ነገር እንዳደረገ Take over ን ይጫኑ። ሯጩ ይቆማል፣ ክንዱም የእርስዎ ይሆናል። በ leader arm ከሆነ መጀመሪያ ወደ follower pose ይነዳና ቁጥጥሩን ያስተላልፋል፤ ሩጫው ሲጀምር በተመረጠ ኪቦርድ ወይም ስላይደር ግብዓት ግን ርክክቡ ወዲያውኑ በእጅ ይሆናል። እንቅስቃሴውን ያስተካክሉ፣ ከዚያም ቁጥጥሩን ወደ policy ይመልሱ። በርክክቡ ወቅት የተቀዱ ፍሬሞች በራስ-ሰር እንደ ጣልቃ ገብነት ይመዘገባሉ።
ሩጫውን ይመድቡ
በእያንዳንዱ ሩጫ ምን እንደነበር ይወስኑ፦ እንደ ማስተካከያ መዝግቡት፣ እንደ ግምገማ ሩጫ አቆዩት፣ ወይም አስወግዱት። በርክክብ ዙሪያ ያሉ የቆሙ ፍሬሞች በ raw ማውጫ ውስጥ ይቀራሉ እንጂ ወደ dataset ፈጽሞ አይገቡም።
የማስተካከያ dataset ን Sync ያድርጉ
ማስተካከያዎች በእያንዳንዱ policy ለብቻው ባለ dataset ውስጥ ይሰበሰባሉ፣ በራስ-ሰር cloud sync በኩልም ወደ bucket እርስዎ ይሄዳሉ። በዚህ ደረጃ ምንም ነገር ከምንም ጋር አይዋሃድም፤ ማስተካከያዎቹ ለብቻቸው ያለ dataset ብቻ ናቸው።
ድብልቁን እራስዎ ያዘጋጁ
ለቀጣዩ ዙር የስልጠና ስብስብ ለመገንባት Compose dataset ን ይጠቀሙ፦ የመጀመሪያውን dataset ከማስተካከያዎቹ ጋር፣ episodes በእያንዳንዱ ምንጭ በግልጽ ተመርጠው። ውጤቱ እንደ ማንኛውም ሌላ dataset sync የሚደረግ እና የሚሰለጥን ተራ dataset ነው። ከጀርባዎ ምንም ነገር አይቀላቀልም፣ simulation መረጃም በራስ-ሰር አይጨመርም።
ከ checkpoint ስልጠናውን ይቀጥሉ
ከ base model ከመጀመር ይልቅ የተዘጋጀውን dataset በ Continue from checkpoint ያሰልጥኑ፣ ስለዚህ ዙሩ ገና ካሽከረከሩት policy ይጀምራል። ይህ ምን እንደሆነ በትክክል ይወቁ፦ weights ን ከዚያ checkpoint ብቻ ያስጀምራል፣ የ optimizer resume አይደለም።
መድረኩ ከእጅዎ የሚያነሳው ምንድን ነው
እዚህ ያለው እያንዳንዱ ነገር ያለበለዚያ እርስዎ ራስዎ መገንባትና መንከባከብ የሚገባዎት የ loop ው እርምጃ ነው።
ያለ leader arm ርክክብ
በሩጫው መጀመሪያ ኪቦርድ ወይም ስላይደር ግብዓት ይምረጡ፣ በላፕቶፕ ብቻም ማስተካከል ይችላሉ። የኪቦርድ ግፊቶች በእያንዳንዱ መገጣጠሚያ ላይ ወደ ሁለት ዲግሪ፣ በ መያዣው ላይ ወደ አራት ዲግሪ ሰርቨሩ ራሱ ላይ ተገድበዋል፤ የስላይደር ኢላማዎች absolute ናቸው፣ ሰርቨሩም በእያንዳንዱ ጥሪ ወደነሱ ቢበዛ ስድስት ዲግሪ ይንቀሳቀሳል። ገደቦቹ የሚተገበሩት በ ሰርቨሩ እንጂ በ UI አይደለም፣ ስለዚህ የተጣበቀ ቁልፍ ክንዱን ሊጥለው አይችልም።
Teleoperation docsጣልቃ ገብነት በእያንዳንዱ ፍሬም የተመዘገበ
ክንዱን በያዙበት ጊዜ የተቀዳ እያንዳንዱ ፍሬም የጣልቃ ገብነት ምልክት ይይዛል፣ የ action ዓምድም ሙሉውን የታዘዘ pose ይይዛል። የ ምልክት ዓምድን በእጅ አይንከባከቡም ወይም በኋላ ከ frame indices ጋር አያስተካክሉትም።
LeRobot dataset formatመመዘኛ፦ ማስተካከያ፣ ግምገማ ወይም ማስወገጃ
እያንዳንዱ ሩጫ በ save card ላይ አንድ ውሳኔ ያገኛል። የማስተካከያ ሩጫዎች ቀጣዩን የስልጠና ዙር ይመግባሉ፣ የግምገማ ሩጫዎች ንጹህ መለኪያ ሆነው እንዲቆዩ ከስልጠና ውጭ ይቀራሉ፣ መጥፎ ሩጫዎችም ድብልቁን በጸጥታ ከመመረዝ ይልቅ ይወገዳሉ።
Sessions እና episodesድብልቁን በግልጽ ያዘጋጁ
የዙር n የስልጠና ስብስብ በእርስዎ ይሰበሰባል፦ የመጀመሪያው dataset ከማስተካከያዎቹ ጋር፣ episodes በእያንዳንዱ ምንጭ ተመርጠው። ራስ-ሰር መቀላቀል የለም፣ የተደበቀ simulation መረጃም የለም፣ የተዘጋጀው ውጤትም እንደ ማንኛውም ሌላ dataset ይሰራል።
Datasetsከ checkpoint ይቀጥሉ
ከ base model ይልቅ የስልጠና ሩጫን ገና ወደ ነዱት checkpoint ይምሩ፣ ስለዚህ እያንዳንዱ ዙር ያለፈው ያበቃበት ቦታ ይጀምራል። የሚያስጀምረው weights ን ብቻ ነው፤ የ optimizer ሁኔታ አይመለስም፣ ለዚህም ነው ዙር አንድ እንደ feasibility ፈተና ተደርጎ ቢታይ የሚሻለው።
Trainingበዙር የሚከራዩ GPU ዎች
ACT እና SmolVLA በ 4090 ላይ፣ Pi0 እና GR00T N1.5 ወይም N1.7 ደግሞ 80 GB ባለው A100 ላይ። ዙር ይጀምራሉ፣ pod ይነሳል፣ checkpoints ወደ bucket እርስዎ ይደርሳሉ፣ ዙሩ የፈጀውን ሰዓት ብቻ ይከፍላሉ።
የ GPU ዋጋዎችዙሮችዎን ያቅዱ
የጣልቃ ገብነት መጠን የ loop ው የእድገት መለኪያ ነው፦ የተስተካከሉ ፍሬሞች በሩጫው ፍሬሞች ተካፍለው። የት እንደሚጀምሩ እና እያንዳንዱ ዙር ምን ያህል እንደሚያተርፍልዎት ያስቀምጡ፣ ወደ ፈለጉት ቦታ ለመድረስ ስንት ዙር እንደሚያስፈልግ ይመልከቱ።
| ዙር | የጣልቃ ገብነት መጠን | የተስተካከሉ ፍሬሞች |
|---|---|---|
| 1 | 30.0 % | 900 |
| 2 | 22.5 % | 675 |
| 3 | 16.9 % | 506 |
| 4 | 12.7 % | 380 |
| 5 | 9.5 % | 285 |
| 6 | 7.1 % | 214 |
| Σ | 2 960 | |
ትንበያ ሳይሆን ሞዴል ብቻ ነው። እውነተኛ ዙሮች ወጥ አይደሉም፣ መጠኑን የማያንቀሳቅስ ዙር ምንም አላተረፈልዎትም፤ ይህ በትክክል ልብ ሊባል የሚገባው ምልክት ነው።
loop ውን እራስዎ መገንባት ወይስ እዚህ ማሂድ
ይህ ሁሉ በእጅ የማይቻል አይደለም። ጥያቄው ስንት ምሽቶች ወደ መሰረተ-ልማት ስራ እንደሚሄዱ ከዙሮች ይልቅ ነው፣ አንድ ረድፍም ራስዎ ማድረግ በግልጽ የተሻለ መልስ የሆነበት አለ።
| የ loop ው እርምጃ | በእጅ ማዘጋጀት | በ AY-Robots |
|---|---|---|
| በሩጫ መሃል መረከብ | leader arm ወይም በ servo bus ላይ የራስዎ code። የኪቦርድና የስላይደር ርክክብ፣ ደህንነቱ የተጠበቁ ገደቦችን ጨምሮ፣ እርስዎ የሚጽፉት እና በእውነተኛ hardware ላይ debug የሚያደርጉት ነገር ነው። | Leader arm፣ ኪቦርድ ወይም ስላይደሮች፣ ሩጫው ሲጀምር ይመረጣሉ። የማዕዘን ገደቦች ሰርቨሩ ውስጥ ይኖራሉ። |
| ጣልቃ ገብነቶችን መመዝገብ | የ ምልክት ዓምዱን እርስዎ ይጨምራሉ፣ ከ frame index ጋር አስተካክለው ያቆያሉ፣ የመቅጃው ፎርማት በተቀየረ ቁጥርም እንደገና ያረጋግጣሉ። | በርክክብ ወቅት የተቀዳ እያንዳንዱ ፍሬም በራስ-ሰር ይመዘገባል፣ የታዘዘውም pose በ action ዓምድ ውስጥ ይገኛል። |
| ሩጫዎችን መደርደር | የማውጫ ስምምነቶች እና የ shell scripts። በርክክብ ዙሪያ ያሉ የቆሙ ፍሬሞችን የማግኘትና የማጣራት ስራ የእርስዎ ነው። | በ save card ላይ በእያንዳንዱ ሩጫ አንድ ውሳኔ። የርክክብ ፍሬሞች raw ማውጫ ውስጥ ይቀራሉ። |
| የተቀላቀለውን dataset መገንባት | በእያንዳንዱ ፎርማት ስሪት የ merge scripts። የ episode indices፣ metadata እና የቪዲዮ ማጣቀሻዎችን ወጥ ማድረግ አድካሚው ክፍል ነው። | ከመጀመሪያው dataset ከማስተካከያዎቹ ጋር በእያንዳንዱ ምንጭ episode ምርጫ ያዋህዱ፤ ውጤቱ ተራ dataset ነው። |
| ቀጣዩን ዙር ካለፈው policy መጀመር | checkpoint ን ራስዎ ወደ trainer ያገናኙታል፣ እውነተኛ resume ከፈለጉም የ optimizer ሁኔታን መመለስ ይችላሉ። | ለ base checkpoint አንድ መስክ ብቻ። Weights ብቻ፦ ከ checkpoint ብቻ ያስጀምራል፣ የ optimizer resume አይደለም። |
| በ training loop ላይ ቁጥጥር | ሙሉ በሙሉ። የራስዎ loss፣ የራስዎ schedule፣ የራስዎ ablations፣ የራስዎ instrumentation፣ በመንገድ ላይ ምንም መድረክ የለም። የምርምር ጥያቄው ራሱ training loop ከሆነ በእጅ ያድርጉት። | የተወሰነ የ policies ዝርዝርና ቅጹ የሚያሳያቸው hyperparameters ያለው ቋሚ መንገድ፣ የዘፈቀደ code አይደለም። |
ይህ የተገነባባቸው ጽሁፎች
ከ loop ው ጋር ከመከራከርዎ በፊት እነዚህን ያንብቡ። እያንዳንዱ link ወደ abstract ገጽ ነው የሚወስደው፣ ወደ paywall አይደለም።
- A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)
የመጀመሪያው DAgger ጽሁፍ፦ የ compounding-error ችግርን ይገልጻል፣ ለ ተራ supervised አካሄድ የ T-ስኩዌር ወሰን ይሰጣል፣ ተማሪው ራሱ ከሚደርስባቸው ሁኔታዎች መረጃ ማዋሃድንም ይጠቁማል።
- HG-DAgger: Interactive Imitation Learning with Human Experts
Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019
ሰው-ተቆጣጣሪ ስሪት፦ ባለሙያው policy በመረጣቸው ሁኔታዎች ላይ ከመጠየቅ ይልቅ መቼ ቁጥጥር እንደሚይዝ ይወስናል፣ ይህ መድረክ የሚተገብረው ይህንኑ ሁናቴ ነው።
- EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning
Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019
interventions ን ለመቆጣጠር ሌላኛው መንገድ፦ ተማሪው ብቻውን መስራት የሚችልበትን ጊዜ ለማወቅ የ ensemble አለመስማማትን እንደ እምነት ምልክት መጠቀም። ሰው ራሱ እንዲፈርድ ከመፍቀድ ጋር ለማነጻጸር ጠቃሚ ነው።
- ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021
የሰውን ትኩረት እንደ ውስን ሀብት ይይዘዋል፣ እርዳታ የሚጠይቀውም አዲስ ወይም አደገኛ በሆኑ ሁኔታዎች ላይ ብቻ ነው፤ አንድ ሰው ቀኑን ሙሉ ክንዱን ሲቆጣጠር ተስማሚው አካሄድ ይህ ነው።
- DART: Noise Injection for Robust Imitation Learning
Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017
ሐቀኛው አማራጭ፦ policy ን በቀጥታ ከማስተካከል ይልቅ ማሳያዎቹን ማወክ፣ ባለሙያውም መልሶ መገኘትን እንዲያሳይ ማድረግ። ወደ ጣልቃ ገብነት ከመግባትዎ በፊት ማወቅ ተገቢ ነው።
- Interactive Imitation Learning in Robotics: A Survey
Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600
የመስኩ ካርታ፦ ምን አይነት የሰው feedback ዓይነቶች እንዳሉ፣ የትኞቹ interfaces እንደሚያስተላልፏቸው፣ እና DAgger-አይነት ጣልቃ ገብነት ከነሱ መካከል የት እንደሚገኝ።
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705
የ ACT ጽሁፍ። ርካሽ ክንድ በ imitation policy ጨርሶ ሊነዳ የቻለው በ action chunking ምክንያት ነው፣ ACT ም የ DAgger ዙርን በፍጥነት ለመድገም የሚያስችል policy ነው።
- π0: A Vision-Language-Action Flow Model for General Robot Control
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164
በቅድሚያ በሰለጠነ vision-language model ላይ የተገነባ flow-matching VLA፣ እዚህም fine-tune ማድረግ ከሚችሏቸው checkpoints አንዱ ነው፤ ጽሁፉ አዲስ ክህሎቶች ከ fine-tuning እንደሚመጡ እንጂ ከ base model ብቻ እንዳልሆኑ በግልጽ ይናገራል።
ሰዎች በእውነት የሚጠይቋቸው ጥያቄዎች
ለ DAgger leader arm ያስፈልገኛል?
አያስፈልግም። ሩጫውን ሲጀምሩ ኪቦርድ ወይም ስላይደር ግብዓት ይምረጡ፣ ርክክቡም ከመጀመሪያው ፍሬም ጀምሮ ከ browser የሚነዳ በእጅ ይሆናል። leader arm ለጥቃቅን እንቅስቃሴ የተሻለ ስሜት ይሰጣል፣ ክንዱ ራሱን ካስተካከለ በኋላ ርክክብ የሚያደርግበትም ብቸኛ ሁናቴ ነው፣ ነገር ግን loop ው ያለ እሱም ይሰራል።
ስንት የ DAgger ዙሮች ያስፈልጉኛል?
ሐቀኛ የሆነ ቋሚ ቁጥር የለም። የጣልቃ ገብነት መጠንን ይከታተሉ፦ ከአንድ ዙር ወደ ቀጣዩ ካልቀነሰ ያ ዙር ምንም አላተረፈልዎትም፣ ችግሩም አብዛኛውን ጊዜ በ task ዝግጅት፣ በካሜራዎቹ ወይም በመጀመሪያው dataset ላይ ነው እንጂ በዙሮች ብዛት አይደለም።
ይህ እውነተኛ DAgger ነው ወይስ ላላ ያለ ነገር?
HG-DAgger ነው፣ ሰው-ተቆጣጣሪ ስሪቱ። ክላሲክ DAgger policy በመረጣቸው ሁኔታዎች ላይ ባለሙያውን ይጠይቃል፣ ማንኛውም ጤናማ ኦፕሬተር እውነተኛ ክንድ እንዲደርስበት የማይፈቅድላቸውን ሁኔታዎች ጨምሮ። እዚህ ግን ሰው መቼ ጣልቃ መግባት እንዳለበት ይወስናል፣ labels የሚሆኑትም እነዚያ ክፍሎች ብቻ ናቸው።
የማሰለጥነው በማስተካከያዎቹ ላይ ብቻ ነው?
አይደለም፣ እና ማድረግም የለብዎትም። በማስተካከያዎች ብቻ ማሰልጠን መልሶ መገኘትን ብቻ የሚያውቅ policy ይሰጥዎታል። የተዘጋጀው dataset የመጀመሪያውን መረጃ ከማስተካከያዎቹ ጋር ነው፣ episodes ከእያንዳንዱ ምንጭ በግልጽ ተመርጠው።
ከ checkpoint መቀጠል የስልጠና ሩጫውን resume ያደርጋል?
weights ን ከዚያ checkpoint ያስጀምራል ብቻ። የ optimizer ሁኔታ አይመለስም፣ ስለዚህ በጥብቅ አነጋገር resume አይደለም። በተግባር የተማረውን ባህርይ ከዙር ወደ ዙር የሚያሸጋግረው weights ነው፣ ነገር ግን ከሁለቱ የትኛውን እያገኙ እንደሆነ ማወቅ ተገቢ ነው።
የጣልቃ ገብነት መጠን እንዴት ይሰላል?
እንደ ጣልቃ ገብነት የተመዘገቡ ፍሬሞች በጠቅላላው የሩጫው ፍሬሞች ተካፍለው። በ takeover status ውስጥ ይታያል፣ ካሽከረከሩት checkpoint እና ካሰለጠኑት ድብልቅ ጎን ለጎን በእያንዳንዱ ዙር ተመዝግቦ ሊቆይ የሚገባው ብቸኛው ቁጥርም ይህ ነው።
ይህን loop በየትኞቹ policies ማሂድ እችላለሁ?
ACT፣ SmolVLA፣ Pi0፣ እና GR00T N1.5 ወይም N1.7። loop ው ራሱ datasets እና checkpoints ብቻ ስለሚያመነጭ ከ policy ነጻ ነው፤ በተግባር የሚለያየው ዙር ምን ያህል ጊዜ እንደሚፈጅ እና የትኛው GPU እንደሚያስፈልገው ብቻ ነው።
ሮቦት ሳይኖረኝ ይህን ማድረግ እችላለሁ?
በ marketplace ላይ datasets በመግዛት ወይም ኦፕሬተሮችን በማዘዝ ያለ ሮቦት መቅዳትና ማሰልጠን ይችላሉ፣ እውነተኛ SO-100 ንም በ live ገጽ ላይ በ browser ማሽከርከር ይችላሉ። የ DAgger ዙር ግን የተለየ ነው፦ በሩጫ መሃል ሊረከቡት የሚችሉት ክንድ ያስፈልገዋል፣ ስለዚህ ለ loop ው ራሱ hardware በራስዎ ጠረጴዛ ላይ ሊኖርዎት ይገባል።
A real SO-100, live in the browser. No signup, no hardware needed.
የመጀመሪያ ዙርዎን በዚህ ሳምንት ያሂዱ
client ን ይጫኑ፣ አስቀድመው ያለዎትን checkpoint ያሽከርክሩ፣ ክንዱ ኩቡን አልፎ ሲደርስ ለመጀመሪያ ጊዜ ይረከቡ። ያ አንድ ሩጫ በትንሹ የ DAgger ዙር ነው፤ ከዚያ በኋላ ያለው ሁሉ ድብልቁን ማዘጋጀትና የ GPU ሰዓቶችን መክፈል ብቻ ነው።