ሰው-ተቆጣጣሪ DAgger፣ ከጫፍ እስከ ጫፍ

policy ስህተት ሲሰራ ይረከቡ፣ ከዚያም በራስዎ ማስተካከያ ላይ ያሰለጥኑት።

በ behavior cloning የሰለጠነ policy የሚያውቀው እርስዎ ማሳያ ባደረጉባቸው ሁኔታዎች ብቻ ነው። DAgger ይህን ክፍተት policy ራሱ በሚደርስባቸው ሁኔታዎች ከተገኘ መረጃ ጋር ይዘጋዋል። AY-Robots ሙሉውን loop በ SO-100 ላይ ያሂዳል፦ checkpoint ያሽከርክሩ፣ በሩጫው መሃል ይረከቡ፣ የተስተካከሉ episodes ያቆዩ፣ ድብልቁን ያዘጋጁ፣ ገና ካሽከረከሩት checkpoint ስልጠናውንም ይቀጥሉ።

  • HG-DAgger፣ ሰው-ተቆጣጣሪ
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • በእያንዳንዱ ዙር የጣልቃ ገብነት መጠን

የሰለጠነ policy ፈጽሞ ያልታየ ነገር የሚያደርገው ለምንድን ነው

Behavior cloning ቁጥጥርን እንደ ተራ supervised learning ይይዘዋል፦ observation ይገባል፣ የመገጣጠሚያ ኢላማ ይወጣል፣ ሰው በቀዳቸው ፍሬሞች ላይ ተስተካክሎ። ይህ የሚሰራው ሮቦቱ ያ ሰው በደረሰባቸው ሁኔታዎች ላይ ብቻ እስከቆየ ድረስ ነው፣ ነገር ግን አይቆይም። አርባ ሚሊሰከንድ ቀድሞ የሚዘጋ መያዣ ኩቡን ከታየው አቀማመጥ ሁለት ሚሊሜትር ይገፋዋል። ቀጣዩ observation የስልጠናው ስብስብ የማይይዘው ነው፣ ስለዚህ እዚያ ያለው action ግምት (extrapolation) ብቻ ነው፣ ከዚያ በኋላ ያለው ሁኔታም የበለጠ ወጣ ብሎ ይገኛል። የስልጠናው distribution እና የተማረው policy በተግባር የሚፈጥረው distribution ሁለት የተለያዩ ነገሮች ናቸው፣ episode ው ሲሄድ ደግሞ ሁለተኛው ከመጀመሪያው እየራቀ ይሄዳል።

Ross, Gordon እና Bagnell ይህንኑ ውድቀት በ2011 በትክክል ገልጸው ልኩንም አስቀምጠዋል፦ በ expert distribution ስር በ e እድል የሚሳሳት classifier፣ ራሱ በሚፈጥረው distribution ስር በ T እርምጃዎች horizon ውስጥ በግምት T ስኩዌር ማባዛት e የሚያክል ስህተት ሊሰራ ይችላል፣ ምክንያቱም አንድ ስህተት expert ፈጽሞ ያላመነጨውን observation ስለሚፈጥር እና ስህተቶቹ እየተደራረቡ ስለሚሄዱ ነው። መፍትሄያቸው ይህ ገጽ የሚያወራበት algorithm ነው። አሁን ያለውን policy ያሂዱ፣ ለሚደርስባቸው ሁኔታዎች የ expert labels ይሰብስቡ፣ እስካሁን ከተሰበሰበው ጋር ያዋህዷቸው፣ እንደገና ያሰልጥኑ፣ ይድገሙት። ተመሳሳይ አይነት ተጨማሪ ማሳያዎች አይረዱም፣ ምክንያቱም ተመሳሳዩን distribution ብቻ ስለሚደግሙ ነው። policy በሚደርስባቸው ሁኔታዎች ላይ ያሉ labels ግን ይረዳሉ። እዚህ ላይ የተተገበረው ስሪት ሰው-ተቆጣጣሪ (HG-DAgger, Kelly et al.) ነው፦ policy ቁጥጥሩን የሚይዘው አንድ ሰው ስህተት እየሆነ መሆኑን እስኪወስን እና እስኪረከብ ድረስ ብቻ ነው፣ ስለዚህ ማስተካከያዎች የሚፈጠሩት በሚያስፈልጉበት ቦታ ብቻ ነው፣ ክንዱም ኦፕሬተሩ ወደማይፈቅደው ሁኔታ እንዲነዳ ፈጽሞ አይጠየቅም።

  • Behavior cloning የሚሰራው በሰለጠነበት distribution ላይ ብቻ ነው።
  • ውድቀቱ ራሱን የሚያጎላ ነው፦ ትንሽ ልዩነት የማይታወቅ ሁኔታ ይፈጥራል፣ ያ ደግሞ ትልቅ ልዩነት ይፈጥራል።
  • መፍትሄው ተጨማሪ ማሳያዎች ሳይሆኑ policy ራሱ በሚደርስባቸው ሁኔታዎች ላይ ያሉ labels ናቸው።
  • ሰው-ተቆጣጣሪ ማለት መቼ ጣልቃ መግባት እንዳለበት የሚወስነው ኦፕሬተሩ ነው፣ የ autonomy ነጥብ አይደለም ማለት ነው።

ስህተቱ ለምን እየተደራረበ ይሄዳል

horizon ውን ይጎትቱ። በ behavior cloning ስር የሚጠበቀው ተጨማሪ ወጪ በግምት ከእርምጃዎች ብዛት ስኩዌር ጋር እኩል ያድጋል፣ ምክንያቱም እያንዳንዱ ስህተት ማሳያዎቹ ፈጽሞ ያልሸፈኑት ሁኔታ ስለሚፈጥር ነው፤ የ aggregation loop ግን እድገቱን ወደ linear ጠጋ አድርጎ ይይዘዋል (Ross et al., 2011)።

200
1.0 %
Behavior cloning
400
DAgger
2.00
200×
Behavior cloning ÷ DAgger
0.000100200300400050100150200የሚጠበቅ ተጨማሪ ወጪ (ወሰን)
Task Horizon (እርምጃዎች)

ከ Ross et al. (2011) ወሰኖች የተወሰዱ ገላጭ ኩርባዎች እንጂ ከእርስዎ ሮቦት የተለኩ አይደሉም። ነጥቡ ቅርጹ ነው እንጂ ቁጥሮቹ አይደሉም።

አንድ የDAgger ዙር፣ ስድስት እርምጃዎች

ይህ መድረኩ በተግባር የሚያሂደው loop ነው፣ ንድፍ ብቻ አይደለም። ከታች ያለው እያንዳንዱ እርምጃ በ cockpit ውስጥ ካለ መቆጣጠሪያ ጋር ይዛመዳል።

loop ውን በደረጃ ይመልከቱ

ተመሳሳዩ ስድስት እርምጃዎች፣ አንድ በአንድ፣ በእያንዳንዳቸው ላይ በክንዱና በ dataset ውስጥ ከሚሆነው ጋር።

01

policy ን ያሂዱ እና ይቅዱ

እርስዎ ባሰለጠኑት checkpoint ላይ የ inference ሩጫ ይጀምሩ። ሩጫው በሚካሄድበት ጊዜ ራሱ ከሩጫው task ጽሑፍ ጋር ይቀዳል፣ ስለዚህ ፍሬሞቹ በኋላ ማየት ብቻ ከሚቻል ቪዲዮ ይልቅ እንደ ስልጠና መረጃ ሊያገለግሉ ይችላሉ።

1 6

መድረኩ ከእጅዎ የሚያነሳው ምንድን ነው

እዚህ ያለው እያንዳንዱ ነገር ያለበለዚያ እርስዎ ራስዎ መገንባትና መንከባከብ የሚገባዎት የ loop ው እርምጃ ነው።

ያለ leader arm ርክክብ

በሩጫው መጀመሪያ ኪቦርድ ወይም ስላይደር ግብዓት ይምረጡ፣ በላፕቶፕ ብቻም ማስተካከል ይችላሉ። የኪቦርድ ግፊቶች በእያንዳንዱ መገጣጠሚያ ላይ ወደ ሁለት ዲግሪ፣ በ መያዣው ላይ ወደ አራት ዲግሪ ሰርቨሩ ራሱ ላይ ተገድበዋል፤ የስላይደር ኢላማዎች absolute ናቸው፣ ሰርቨሩም በእያንዳንዱ ጥሪ ወደነሱ ቢበዛ ስድስት ዲግሪ ይንቀሳቀሳል። ገደቦቹ የሚተገበሩት በ ሰርቨሩ እንጂ በ UI አይደለም፣ ስለዚህ የተጣበቀ ቁልፍ ክንዱን ሊጥለው አይችልም።

Teleoperation docs

ጣልቃ ገብነት በእያንዳንዱ ፍሬም የተመዘገበ

ክንዱን በያዙበት ጊዜ የተቀዳ እያንዳንዱ ፍሬም የጣልቃ ገብነት ምልክት ይይዛል፣ የ action ዓምድም ሙሉውን የታዘዘ pose ይይዛል። የ ምልክት ዓምድን በእጅ አይንከባከቡም ወይም በኋላ ከ frame indices ጋር አያስተካክሉትም።

LeRobot dataset format

መመዘኛ፦ ማስተካከያ፣ ግምገማ ወይም ማስወገጃ

እያንዳንዱ ሩጫ በ save card ላይ አንድ ውሳኔ ያገኛል። የማስተካከያ ሩጫዎች ቀጣዩን የስልጠና ዙር ይመግባሉ፣ የግምገማ ሩጫዎች ንጹህ መለኪያ ሆነው እንዲቆዩ ከስልጠና ውጭ ይቀራሉ፣ መጥፎ ሩጫዎችም ድብልቁን በጸጥታ ከመመረዝ ይልቅ ይወገዳሉ።

Sessions እና episodes

ድብልቁን በግልጽ ያዘጋጁ

የዙር n የስልጠና ስብስብ በእርስዎ ይሰበሰባል፦ የመጀመሪያው dataset ከማስተካከያዎቹ ጋር፣ episodes በእያንዳንዱ ምንጭ ተመርጠው። ራስ-ሰር መቀላቀል የለም፣ የተደበቀ simulation መረጃም የለም፣ የተዘጋጀው ውጤትም እንደ ማንኛውም ሌላ dataset ይሰራል።

Datasets

ከ checkpoint ይቀጥሉ

ከ base model ይልቅ የስልጠና ሩጫን ገና ወደ ነዱት checkpoint ይምሩ፣ ስለዚህ እያንዳንዱ ዙር ያለፈው ያበቃበት ቦታ ይጀምራል። የሚያስጀምረው weights ን ብቻ ነው፤ የ optimizer ሁኔታ አይመለስም፣ ለዚህም ነው ዙር አንድ እንደ feasibility ፈተና ተደርጎ ቢታይ የሚሻለው።

Training

በዙር የሚከራዩ GPU ዎች

ACT እና SmolVLA በ 4090 ላይ፣ Pi0 እና GR00T N1.5 ወይም N1.7 ደግሞ 80 GB ባለው A100 ላይ። ዙር ይጀምራሉ፣ pod ይነሳል፣ checkpoints ወደ bucket እርስዎ ይደርሳሉ፣ ዙሩ የፈጀውን ሰዓት ብቻ ይከፍላሉ።

የ GPU ዋጋዎች

ዙሮችዎን ያቅዱ

የጣልቃ ገብነት መጠን የ loop ው የእድገት መለኪያ ነው፦ የተስተካከሉ ፍሬሞች በሩጫው ፍሬሞች ተካፍለው። የት እንደሚጀምሩ እና እያንዳንዱ ዙር ምን ያህል እንደሚያተርፍልዎት ያስቀምጡ፣ ወደ ፈለጉት ቦታ ለመድረስ ስንት ዙር እንደሚያስፈልግ ይመልከቱ።

30 %
25 %
3 000
ዙርየጣልቃ ገብነት መጠንየተስተካከሉ ፍሬሞች
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

ትንበያ ሳይሆን ሞዴል ብቻ ነው። እውነተኛ ዙሮች ወጥ አይደሉም፣ መጠኑን የማያንቀሳቅስ ዙር ምንም አላተረፈልዎትም፤ ይህ በትክክል ልብ ሊባል የሚገባው ምልክት ነው።

loop ውን እራስዎ መገንባት ወይስ እዚህ ማሂድ

ይህ ሁሉ በእጅ የማይቻል አይደለም። ጥያቄው ስንት ምሽቶች ወደ መሰረተ-ልማት ስራ ​​እንደሚሄዱ ከዙሮች ይልቅ ነው፣ አንድ ረድፍም ራስዎ ማድረግ በግልጽ የተሻለ መልስ የሆነበት አለ።

የ loop ው እርምጃበእጅ ማዘጋጀትበ AY-Robots
በሩጫ መሃል መረከብleader arm ወይም በ servo bus ላይ የራስዎ code። የኪቦርድና የስላይደር ርክክብ፣ ደህንነቱ የተጠበቁ ገደቦችን ጨምሮ፣ እርስዎ የሚጽፉት እና በእውነተኛ hardware ላይ debug የሚያደርጉት ነገር ነው።Leader arm፣ ኪቦርድ ወይም ስላይደሮች፣ ሩጫው ሲጀምር ይመረጣሉ። የማዕዘን ገደቦች ሰርቨሩ ውስጥ ይኖራሉ።
ጣልቃ ገብነቶችን መመዝገብየ ምልክት ዓምዱን እርስዎ ይጨምራሉ፣ ከ frame index ጋር አስተካክለው ያቆያሉ፣ የመቅጃው ፎርማት በተቀየረ ቁጥርም እንደገና ያረጋግጣሉ።በርክክብ ወቅት የተቀዳ እያንዳንዱ ፍሬም በራስ-ሰር ይመዘገባል፣ የታዘዘውም pose በ action ዓምድ ውስጥ ይገኛል።
ሩጫዎችን መደርደርየማውጫ ስምምነቶች እና የ shell scripts። በርክክብ ዙሪያ ያሉ የቆሙ ፍሬሞችን የማግኘትና የማጣራት ስራ የእርስዎ ነው።በ save card ላይ በእያንዳንዱ ሩጫ አንድ ውሳኔ። የርክክብ ፍሬሞች raw ማውጫ ውስጥ ይቀራሉ።
የተቀላቀለውን dataset መገንባትበእያንዳንዱ ፎርማት ስሪት የ merge scripts። የ episode indices፣ metadata እና የቪዲዮ ማጣቀሻዎችን ወጥ ማድረግ አድካሚው ክፍል ነው።ከመጀመሪያው dataset ከማስተካከያዎቹ ጋር በእያንዳንዱ ምንጭ episode ምርጫ ያዋህዱ፤ ውጤቱ ተራ dataset ነው።
ቀጣዩን ዙር ካለፈው policy መጀመርcheckpoint ን ራስዎ ወደ trainer ያገናኙታል፣ እውነተኛ resume ከፈለጉም የ optimizer ሁኔታን መመለስ ይችላሉ።ለ base checkpoint አንድ መስክ ብቻ። Weights ብቻ፦ ከ checkpoint ብቻ ያስጀምራል፣ የ optimizer resume አይደለም።
በ training loop ላይ ቁጥጥርሙሉ በሙሉ። የራስዎ loss፣ የራስዎ schedule፣ የራስዎ ablations፣ የራስዎ instrumentation፣ በመንገድ ላይ ምንም መድረክ የለም። የምርምር ጥያቄው ራሱ training loop ከሆነ በእጅ ያድርጉት።የተወሰነ የ policies ዝርዝርና ቅጹ የሚያሳያቸው hyperparameters ያለው ቋሚ መንገድ፣ የዘፈቀደ code አይደለም።

ይህ የተገነባባቸው ጽሁፎች

ከ loop ው ጋር ከመከራከርዎ በፊት እነዚህን ያንብቡ። እያንዳንዱ link ወደ abstract ገጽ ነው የሚወስደው፣ ወደ paywall አይደለም።

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    የመጀመሪያው DAgger ጽሁፍ፦ የ compounding-error ችግርን ይገልጻል፣ ለ ተራ supervised አካሄድ የ T-ስኩዌር ወሰን ይሰጣል፣ ተማሪው ራሱ ከሚደርስባቸው ሁኔታዎች መረጃ ማዋሃድንም ይጠቁማል።

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    ሰው-ተቆጣጣሪ ስሪት፦ ባለሙያው policy በመረጣቸው ሁኔታዎች ላይ ከመጠየቅ ይልቅ መቼ ቁጥጥር እንደሚይዝ ይወስናል፣ ይህ መድረክ የሚተገብረው ይህንኑ ሁናቴ ነው።

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    interventions ን ለመቆጣጠር ሌላኛው መንገድ፦ ተማሪው ብቻውን መስራት የሚችልበትን ጊዜ ለማወቅ የ ensemble አለመስማማትን እንደ እምነት ምልክት መጠቀም። ሰው ራሱ እንዲፈርድ ከመፍቀድ ጋር ለማነጻጸር ጠቃሚ ነው።

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    የሰውን ትኩረት እንደ ውስን ሀብት ይይዘዋል፣ እርዳታ የሚጠይቀውም አዲስ ወይም አደገኛ በሆኑ ሁኔታዎች ላይ ብቻ ነው፤ አንድ ሰው ቀኑን ሙሉ ክንዱን ሲቆጣጠር ተስማሚው አካሄድ ይህ ነው።

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    ሐቀኛው አማራጭ፦ policy ን በቀጥታ ከማስተካከል ይልቅ ማሳያዎቹን ማወክ፣ ባለሙያውም መልሶ መገኘትን እንዲያሳይ ማድረግ። ወደ ጣልቃ ገብነት ከመግባትዎ በፊት ማወቅ ተገቢ ነው።

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    የመስኩ ካርታ፦ ምን አይነት የሰው feedback ዓይነቶች እንዳሉ፣ የትኞቹ interfaces እንደሚያስተላልፏቸው፣ እና DAgger-አይነት ጣልቃ ገብነት ከነሱ መካከል የት እንደሚገኝ።

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    የ ACT ጽሁፍ። ርካሽ ክንድ በ imitation policy ጨርሶ ሊነዳ የቻለው በ action chunking ምክንያት ነው፣ ACT ም የ DAgger ዙርን በፍጥነት ለመድገም የሚያስችል policy ነው።

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    በቅድሚያ በሰለጠነ vision-language model ላይ የተገነባ flow-matching VLA፣ እዚህም fine-tune ማድረግ ከሚችሏቸው checkpoints አንዱ ነው፤ ጽሁፉ አዲስ ክህሎቶች ከ fine-tuning እንደሚመጡ እንጂ ከ base model ብቻ እንዳልሆኑ በግልጽ ይናገራል።

ሰዎች በእውነት የሚጠይቋቸው ጥያቄዎች

ለ DAgger leader arm ያስፈልገኛል?

አያስፈልግም። ሩጫውን ሲጀምሩ ኪቦርድ ወይም ስላይደር ግብዓት ይምረጡ፣ ርክክቡም ከመጀመሪያው ፍሬም ጀምሮ ከ browser የሚነዳ በእጅ ይሆናል። leader arm ለጥቃቅን እንቅስቃሴ የተሻለ ስሜት ይሰጣል፣ ክንዱ ራሱን ካስተካከለ በኋላ ርክክብ የሚያደርግበትም ብቸኛ ሁናቴ ነው፣ ነገር ግን loop ው ያለ እሱም ይሰራል።

ስንት የ DAgger ዙሮች ያስፈልጉኛል?

ሐቀኛ የሆነ ቋሚ ቁጥር የለም። የጣልቃ ገብነት መጠንን ይከታተሉ፦ ከአንድ ዙር ወደ ቀጣዩ ካልቀነሰ ያ ዙር ምንም አላተረፈልዎትም፣ ችግሩም አብዛኛውን ጊዜ በ task ዝግጅት፣ በካሜራዎቹ ወይም በመጀመሪያው dataset ላይ ነው እንጂ በዙሮች ብዛት አይደለም።

ይህ እውነተኛ DAgger ነው ወይስ ላላ ያለ ነገር?

HG-DAgger ነው፣ ሰው-ተቆጣጣሪ ስሪቱ። ክላሲክ DAgger policy በመረጣቸው ሁኔታዎች ላይ ባለሙያውን ይጠይቃል፣ ማንኛውም ጤናማ ኦፕሬተር እውነተኛ ክንድ እንዲደርስበት የማይፈቅድላቸውን ሁኔታዎች ጨምሮ። እዚህ ግን ሰው መቼ ጣልቃ መግባት እንዳለበት ይወስናል፣ labels የሚሆኑትም እነዚያ ክፍሎች ብቻ ናቸው።

የማሰለጥነው በማስተካከያዎቹ ላይ ብቻ ነው?

አይደለም፣ እና ማድረግም የለብዎትም። በማስተካከያዎች ብቻ ማሰልጠን መልሶ መገኘትን ብቻ የሚያውቅ policy ይሰጥዎታል። የተዘጋጀው dataset የመጀመሪያውን መረጃ ከማስተካከያዎቹ ጋር ነው፣ episodes ከእያንዳንዱ ምንጭ በግልጽ ተመርጠው።

ከ checkpoint መቀጠል የስልጠና ሩጫውን resume ያደርጋል?

weights ን ከዚያ checkpoint ያስጀምራል ብቻ። የ optimizer ሁኔታ አይመለስም፣ ስለዚህ በጥብቅ አነጋገር resume አይደለም። በተግባር የተማረውን ባህርይ ከዙር ወደ ዙር የሚያሸጋግረው weights ነው፣ ነገር ግን ከሁለቱ የትኛውን እያገኙ እንደሆነ ማወቅ ተገቢ ነው።

የጣልቃ ገብነት መጠን እንዴት ይሰላል?

እንደ ጣልቃ ገብነት የተመዘገቡ ፍሬሞች በጠቅላላው የሩጫው ፍሬሞች ተካፍለው። በ takeover status ውስጥ ይታያል፣ ካሽከረከሩት checkpoint እና ካሰለጠኑት ድብልቅ ጎን ለጎን በእያንዳንዱ ዙር ተመዝግቦ ሊቆይ የሚገባው ብቸኛው ቁጥርም ይህ ነው።

ይህን loop በየትኞቹ policies ማሂድ እችላለሁ?

ACT፣ SmolVLA፣ Pi0፣ እና GR00T N1.5 ወይም N1.7። loop ው ራሱ datasets እና checkpoints ብቻ ስለሚያመነጭ ከ policy ነጻ ነው፤ በተግባር የሚለያየው ዙር ምን ያህል ጊዜ እንደሚፈጅ እና የትኛው GPU እንደሚያስፈልገው ብቻ ነው።

ሮቦት ሳይኖረኝ ይህን ማድረግ እችላለሁ?

በ marketplace ላይ datasets በመግዛት ወይም ኦፕሬተሮችን በማዘዝ ያለ ሮቦት መቅዳትና ማሰልጠን ይችላሉ፣ እውነተኛ SO-100 ንም በ live ገጽ ላይ በ browser ማሽከርከር ይችላሉ። የ DAgger ዙር ግን የተለየ ነው፦ በሩጫ መሃል ሊረከቡት የሚችሉት ክንድ ያስፈልገዋል፣ ስለዚህ ለ loop ው ራሱ hardware በራስዎ ጠረጴዛ ላይ ሊኖርዎት ይገባል።

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

የመጀመሪያ ዙርዎን በዚህ ሳምንት ያሂዱ

client ን ይጫኑ፣ አስቀድመው ያለዎትን checkpoint ያሽከርክሩ፣ ክንዱ ኩቡን አልፎ ሲደርስ ለመጀመሪያ ጊዜ ይረከቡ። ያ አንድ ሩጫ በትንሹ የ DAgger ዙር ነው፤ ከዚያ በኋላ ያለው ሁሉ ድብልቁን ማዘጋጀትና የ GPU ሰዓቶችን መክፈል ብቻ ነው።