Апстрактно прикажување на сцена за манипулација со робот, што ја илустрира дистрибуцијата на состојби која научена политика ја посетува за време на извршување
DAggerImitation LearningBehavior CloningRobot LearningТеорија

DAgger Објаснено: Зошто Behavior Cloning се Отклонува и Што Dataset Aggregation Вакаливно Докажува

AY-Robots ResearchAugust 27, 202615 минути читање

Behavior cloning монтира политика врз дистрибуцијата на состојби на експертот и потоа се распределува самостојно. Разликата помеѓу овие две дистрибуции е зошто политика која изгледа добра при валидација исчезнува од маса на чекор 300. Ова е теориската поглавја од нашата DAgger серија: од каде доаѓа членот со квадратна грешка, што се менува при dataset aggregation, што го претпоставува доказот без жалење, и кој дел од сметката човечкиот експерт мораше да плати.

Постои одредено отказивање коешто секој кој обучува политика за манипулација посетува порано или подоцна. Политиката допира до коцка, се приближува за два сантиметра, хезитира, се поместува странично, потоа прави нешто без врска со задачата. Валидациониот загуб беше добар. Отворена повратна репрезентација против одложени епизоди беше добра. И сепак раката завршува во поза која нигде не се појавува во обучувачките податоци, и од таму нема ништо паметно што да каже.

Тое отказивање има име и утврдена теорија зад неа. Ова е првиот од четири написи на DAgger, и се однесува на аргументот самиот: зошто поместување на политика врз сопствените траекторијалите на демонстраторот создава грешка која може да расте со квадратот на должината на епизодата, што промени dataset aggregation, и што обещанието без жалење не ветува. Циклусот на вистинскиот хардвер е опфатен во извршување на DAgger циклус на SO-100, варијантата со човечка врата во HG-DAgger и интервенции со човечка врата, и прашањето за мерење во мерење на DAgger циклус.

Краткото издание

  • Behavior cloning обучува врз дистрибуцијата на состојбите на експертот и се евалуира врз сопствената. Несовпадувањето се наслоју над епизодата.
  • Ross и Bagnell покажаа дека дополнителниот трошок може да расте како T квадрат пати грешката по чекор; DAgger написот го повторува тоа врзување и забележува дека е тесно.
  • DAgger означува состојби коишто политиката самата ја посетува, и преквалификува врз секој собран датотека досега, не само новото.
  • Гаранцијата е намалување на no-regret онлајн учење: агрегирање и преквалификување е Следи-го-Лидерот.
  • Тоа держи релативно на најдобриот загуб достижен во класа политики, не релативно на нула - и експертот сепак мораше да означува состојби коишто никогаш не би произведено.

Претпоставката коју behavior cloning шумно прави

Датотеката за демонстрирање е куп парови набљудување-акција. Behavior cloning монтира функција на тој куп со обично надзорно учење и запира таму. Тоа е најстарата идеја во полето. Pomerleau's ALVINN, во 1988, беше тринаслојна мрежа за враќање што земаше слики од камера и лазер опсег찾器 и произведува насока коју возилото требало да патува; беше обучена врз симулирани слики на пат и следеше вистински патни услови под некои услови на ткаење. Рецептот не се изменил многу; мрежите имаат.

Што се прескокува е контрола каде дошле парови. Секој од нив лежи врз траекторија коју произведе демонстраторот. Политиката коју ја распределуваш производи сопствена. Во моментот кога отстапува, таа се запрашува за состојби коишто не беа во дистрибуцијата на обука, и нејзиниот одговор ја движи понатаму. Ross, Gordon и Bagnell го отворивает DAgger написот токму со ова: секвенцијално предвидување нарушува i.i.d. претпоставката под статистичко учење, затоа што предвидувањата на самиот берач одредуваат ги влезовите коишто го видува следен.

Најјасниот приказ во тој напис не е робот воопште. Клонирањето на скоро-оптимална планериште за Super Mario Bros. создаде политика која неодамна вставаше против препрека наместо да скоче. Причината е целиот аргумент во една реченица: експертот секогаш скачаше од удобна растојание, па датотеката не содржеше состојба во која Mario беше притиснат против препрека, и затоа не имаше ознака за што да прави откако беше.

Замени Mario за SO-100 рака и структурата е идентична. Вашите демонстрации покажуваат чист приход и чист захват, не затворач две сантиметри кратко - па политиката нема идеја што да прави од таму, и што е не погрешно ја движи понатаму. Covariate shift е својство на постапка за собирање на податоци, не на архитектурата на мрежата.

Откаде доаѓа квадратниот член

Написот 2010 AISTATS од Ross и Bagnell, Efficient Reductions for Imitation Learning, прави сложеното прецизно. Нека T е хоризонт на задачата, нека трошокот на задачата е врзан во единица интервал, и нека epsilon е заменешкиот загуб измерен под експертов дистрибуција на состојбите - бројот што вашиот валидационен сет го извештува. Потоа дополнителниот трошок од извршување на таа политика за T чекори, релативно на експертот, е врзан од T квадрат пати epsilon. Ross, Gordon и Bagnell го повторува ова како Теорема 2.1 во DAgger написот и го додава предложението коешто има значење: врзувањето е тесно. Проблемите постојат каде политика со epsilon загуб врз дистрибуција на експертот вакаливно повлекува дополнителен трошок растејќи се квадратно во T.

Тесното не значи типично. Квадратниот член е најлош случај преку класа на проблеми, не предвидување за твојата задача за подигање и поставување. Што го утврдува е дека повеќе демонстрирање од експертот не може да ја отстрани проблемот: само го заострува процена на epsilon врз дистрибуција на која политиката нема да биде тестирана.

Излезниот пат е во истиот напис, повторен како Теорема 2.2. Ако политика ја постигне загубата epsilon под сопствена дистрибуција на состојбите, и една погрешна акција чини најмногу u во трошок-до-го во експертот, дополнителниот трошок е врзан од u пати T пати epsilon - линеарно во хоризонт. Константата u е занимливата количина: најмногу 1 за 0-1 неслога со експертот, и O(1) кога експертот може да се врати во неколку чекори. Во најлош случај тоа е O(T), и линеарното врзување потоа не е подобро од квадратното.

ПоставувањеВрзување на дополнителниот трошок врз експертотШто рели врата на
Behavior cloning (Ross & Bagnell 2010, повторено како Thm. 2.1 во Ross et al. 2011)T квадрат пати epsilonepsilon измерено врз дистрибуција на експертот на состојби; трошок во [0,1]; врзување е тесно
Која било политика со epsilon загуб под сопствената дистрибуција (Thm. 2.2)u пати T пати epsilonu врза ги трошоците-до-го казна на една погрешна акција; најмногу 1 за 0-1 загуб, O(T) најлош случај
Напредна обука (Ross & Bagnell 2010)u пати T пати epsilonедна политика по временска мара; треба T политики и познат, конечен T
SMILe (Ross & Bagnell 2010)близу-линеарно во T и epsilon врз некои класи на проблемиalpha во O(1/T квадрат), N во O(T квадрат логирање T); дава стохастичка мешавина
DAgger (Thm. 3.2, Ross et al. 2011)u пати T пати epsilon_N, плус O(1)N на редослед на uT; силно конвексна врзана загуба; no-regret берач; epsilon_N е најдобриот загуб во хинdsight
Робот работна просторија што претставува состојби коишто политика ги посетува коишто никогаш не се појавиле во подготвувачкиот сет
Состојбите коишто имаат значење за DAgger круг се оние коишто никој не покажа: скоро-мисс захват, полу-отворен затворач, рака минула од објектот.

Двата обида коишто дошле пред DAgger

Напредна обука е чесна но непрактична одговор. Обучи одделна политика за секоја временска мара, по редослед, секоја врз дистрибуција на состојби која индуцирана од политиките веќе фиксирани за порани чекори, па секоја политика вида точно дистрибуција коју ќе го дочека. Уловот е во описот: T политики, обучени последователно, без рана запирање. За манипулација епизода во 30 кадри во секунда, T е во стотини.

SMILe, од истиот напис, и SEARN, од работата на Daume, Langford и Marcu врз структурирана предвидување, ја земаат другата рута: една стационарна политика, но стохастичка. Секоја итерација обучува компонента и ја додава на мешавина, поместувајќи ја веројатносната маса далеку од експертот. Резултатот е мешавина во која некои компоненти се полоши од други - врз физичка рака, контролер што може да земе лоша компонента за време на движење. Тоа е утврдената мотивација за сакање стационарна детерминистичка политика наместо.

DAgger: една идеја, една кутија

Dataset Aggregation го чува детерминистичката политика и го движи исправката во собирање на податоци. Секој круг: распологи на моментната политика, забележи состојби коишто ја посетува, прашај експертот што би била правилна акција во секоја, додај парови во датотеката коју веќе имаш, преквалификувај врз синдикатот. Името е алгоритмот - агрегираш, никогаш не отстрануваш.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Meta-алгоритмот DAgger, Алгоритам 3.1 на Ross, Gordon & Bagnell (2011).

Три деталји имаат повеќе тежина отколку што изгледаат. Етикетите се за состојби посетени од страна на мешаната политика, но акциите доаѓаат од експертот - политиката ги обезбедува прашањата, експертот одговорите. Преквалификувањето е врз целиот агрегат, што прави секој круг Follow-The-Leader чекор: во круг n избираш најдобра политика во хинdsight преку секоја траекторија досега. Тоа е оквир на кој доказот се зависи. И алгоритмот завршува со враќање најдобра политика во секвенца како избрана врз валидационен сет, затоа што теоремите гарантираат дека некоја политика во секвенца е добра, не дека последната е.

Бета распоред, и зошто не е клучка за подесување

Мешаната политика е beta_i пати експертот плус еден минус beta_i пати берачот. Поентата е практична: первачките научени политики се обучени врз многу мали податоци, прават многу грешки, и иначе би потрошиле распологување во состојби коишто станало неважно откако политиката се подобрува.

Теоријата налагува точно една услова: трчачката просечна на betasите мораше да одеја на нула. Анализата работи со beta_i врзана од (1 - алфа) до моќта i-1, за константа алфа независна од T.

РаспоредШто правиШто написот извештува
beta_1 = 1Первиот круг е чиста демонстрирање од експертот; начална политика не е потребнаПрепорачаната почетна точка во секоја варијанта
beta_i = 1 ако i = 1, инаку 0Експертот само во првиот круг; без слободен параметарБеспараметарската верзија на написот, која вели често перформа најдобро во практика; 2980 врз Super Mario Bros. после 20 итерации
beta_i = p^(i-1) со p = 0.5Експертна веројатност се распаѓа геометриски3030 врз исто мерило, малку напред од беспараметарската верзија
beta_i = p^(i-1) со p = 0.9Експертот останува во циклусот далеку подолгНазначено поспоро конвергирање; сепак се подобрува кога 20 итерации завршија

Разликата помеѓу 2980 и 3030 врз скала трчаща до грубо 4300 е мала, но объаснението на написот за неа е најкорисната практична забелешка во делот. Со беспараметарскиот распоред, Mario вставаше во исто место порано и генерираше маса скоро-дуплично податоци од таа една локација; дозволување експертот да ја вози удела на време Нее двајцата обиде неговегодината и проширена разноликост на состојби. Распоредот е помалку за коефициентот за мешање отколку за ответност збирањето на твои податоци произведува нови состојби или исто отказивање.

Зошто распоредот не се премести на физичка рака како написано

Стохастичка по-временска мешавина значи смена на контролната власт во контролна мара, 30 пати во секунда врз типичен SO-100 постав. Ниедна телеоперирана интерфејс го прави тоа безбедно или смислено. Врз вистински хардвер бета распоред дава пат на човечка одлука за кога да биде во контрола: различит алгоритам со различито анализа.

Гаранцијата: намалување на no-regret онлајн учење

Ево потег кој го прави написот што е. Третирај секој DAgger круг како еден пример во онлајн учење проблем, каде загубата во круг i е заменешката загуба под дистрибуција на состојби на политиката користена во круг i. Берачот се обврзува на политика пред видување таа загуба, и секвенца е нестационарна затоа што зависи од политиките произведени досега.

Алгоритмот е no-regret ако неговата просечна загуба преку N круги се приближува на оние од најдобра единечна политика во хинdsight. Follow-The-Leader врз силно конвексни загуби е таков алгоритам, со просечно жалење се намалува врз редослед од 1/N - и преквалификување врз целиот агрегат е точно Follow-The-Leader. Која било друга no-regret берач би служила: анализата е намалување, не својство од еден оптимизатор.

Една лема ги мостува јазот помеѓу мешаната политика што ги собра податоци и научената политика што би била распределена: Лема 4.1 врза ја L1 растојаност меѓу нивни дистрибуции на состојби од 2 T beta_i. Ова е зошто betasите мораат да се распаѓаат - додека експертот сепак има апреци контролна власт, состојбите што собираш не се состојбите коишто твојата политика ќе произведе. Комбинирај лема со врзување на жалење и главниот резултат следува: после грубо T итерации, некоја политика во секвенца има заменешката загуба под сопствената дистрибуција во O(1/T) од epsilon_N. Напојувај тоа во линеарното врзување и сте соба во Теорема 3.2.

Емпириската страна е скромна врз моментни стандарди. Во Super Tux Kart надзорната основа не се подобри неговиот просечен падаше по лап кога повеќе податоци дошле, DAgger достигна политика која никогаш не падна од писта после петнаесет итерации, и SMILe после дваесет сепак падна грубо двојно по лап. Врз рачно пишување мерило, знакова точност трча 82 процент без структура, 83.6 процент надзорно, 85.5 процент со DAgger. Ниедно од овие не е манипулацииски резултат.

Што доказот не ветува

Утврдувањата на теорема се условни, и условите се товари-носачи.

DAgger гаранција, читајќи блиску
Што те дава
  • Врзување линеарно наместо квадратно во T, под наведените предпоставки.
  • Стационарна детерминистичка политика наместо стохастичка мешавина.
  • Вистинско намалување: која била no-regret онлајн берач вклучува во.
  • Конкретна број итерација - грубо T круги пред жалење член престанува да има значење.
  • Гаранција за барем една политика во секвенца, оттаму затворана валидациона пас.
Што не те дава
  • Тоа е релативно на epsilon_N, најдобриот загуб во класа во хинdsight, не на нула. Ако твојата класа не може да го претстави експертот, таа е празна во практика.
  • Таа треба a no-regret метод или силно конвексна заменешка загуба - посилна од класификациони редукција што го гради врата, како го забележуваат авторите.
  • Константата u може да биде O(T) во најлош случај, и линеарното врзување потоа се сломува назад во квадратно.
  • Таа врза итерации, не експертни етикети. Врз робот, етикети се буџет.
  • Таа претпоставува експертот може да биде прашан во секоја посетена состојба и одговара правилно таму. Таа претпоставка е целиот трошок.

Еден понатамошен резултат често е наведен како опреченција и не е еден. Rajaraman, Yang, Jiao и Ramachandran учат на minimax границите на imitation learning во епизодични MDPs со конечна состојба простор S и хоризонт H, и докажуваат подоптимална долна врзување врз редослед од |S| H квадрат врз N што држи дури и кога берачот може активно да го прашаше експертот во посетени состојби. Таа е најлош-случај стапка преку класа на MDPs во фиксен епизоден буџет, и што ја исклучува е идејата дека интеракција ја подобрува minimax стапката; DAgger теорема е различно утврдување, врзување распределена политика релативно на што нејзина сопствена политика класа може да достигне.

Swamy, Choudhury, Bagnell и Wu подоцна класификувале овие алгоритми по кои моменти на експертско однесување коишто се поклопуваат, и воведоа поим на момент опоравливост што диференцира колку добро секое семејство смалува сложена грешка. Проверки од Osa и од Celemin го покриваат алгоритмичкиот пејзаж и хуманата-повратна интерфејси.

Сметката: означување на состојби експертот никогаш не произведе

Сè горево претпоставува експертот што може да биде прашан навсекаде. Во симулација со планериште што е скоро слободна - експериментите Mario користеја скоро-оптимална планериште со целосен пристап до стање на игра. Со човек врз робот е доминантен трошок, и особен: човекот мораше да произведе правилна акција во конфигурација твоја сопствена компетентност никогаш не би создала.

Kelly, Sidrane, Driggs-Campbell и Kochenderfer ја постават противречката директно во HG-DAgger написот. Ванилична DAgger бара експертот да обезбеди акционо обелешја додека не е целосно во контрола на системот. Ова го намалува безбедностат, и со човечки експерти веројатно ќе ја деградира квалитетот на собраните обелешја, коишто ги приписуваат на перцепирана актуатор заостаток. Обелешјето коешто добиваш назад не е обелешјето алгоритмот го претпостави.

Laskey и колеги ја нападаат проблемот од другата страна со DART, и нивната рамка е директна: on-policy техники се досадни за човечки наспротивставувачи, додај компјутерски товар, и може да посетат опасни состојби за време на обука. Нивна алтернатива вбризгува калибрирана бука во сопствените демонстрирања на супервизор, па опоравување ја добива демонстрирана без робот икогаш запредела недоверена политика. Врз MuJoCo Humanoid ја извештуваат DART намалување супервизор кумулативна награда од 5 процент за време на обука, додека DAgger извршува политики со 80 процент помалку кумулативна награда од супервизор; врз захватување во неред со Toyota HSR, просечно 62 процент зголемување врз поведенско клонирање.

Zhang и Cho's SafeDAgger ги третираат прашања до референца политика како скапа ресурс: одделна безбедност политика предвидува, без прашување, дали примарна политика е за отстапување од референца надвор од прак, и само тие состојби се кренат врата. Сите три реактивни во исто факт - DAgger анализа наплати ништо за експертни обелешја, и реалност наплати голем износ.

Делот никој не те предупредува за

Обелешје од-дистрибуција состојби е менталното потешко од демонстрирање на задачата. Нормална демонстрирање значи извршување моторен план коишто веќе имаш. Корекција на политика коју е ставила затворач некаде би никогаш не значи конструирање опоравување на место, под временски притисок, со робот сепак движи. Очекување помалку корисни минути по сесија отколку во простојна запис сесија, и гледајте твој сопствен корекција квалитет распад преку курс на еден.

LeRobot датотека структура показување епизоди, кадри и по-кадар колона како сохранена врз диск
Коригирања станале датотека само откако интервенција кадри се обелешени - во LeRobot формат, по-кадар колона по опажање и акција.

Што ова значи за SO-100 врз твојата маса

Преведи хоризонт во твои единици. Дваесет-втор епизода во 30 кадри во секунда е 600 одлука чекори, и T во секое врзување горево е таа број. На T = 600, разликата помеѓу термин мер со T и еден мер со T квадрат е разликата помеѓу политика што се опоравува од лош приход и еден што не.

Ово е дел од зошто акција chunking помага: кога политика емитува кратка секвенца акција по чекор за оспособување, бројот на одлука точката падаат, и исто напаѓање допринес. Zhao, Kumar, Levine и Finn го имену сложена грешка како мотивација за Action Chunking со Transformers, и извештај 80 до 90 процент успех врз шест потешка вистинска-свет задачи, врз ниско-трошок bimanual хардвер, од десет минути вредност од демонстрирања. Chunking не отстрану covariate shift - состојбите сепак се сопствена политика - но скратување ефективен хоризонт. Видете акција chunking и SO-100 imitation learning водич.

Втора превод е напредок метрика. Не можеш мерка epsilon под сопствена политика дистрибуција директно - таа треба вистински експертни акции за секоја посетена состојба, работ ти си пробувач избегни производ. Што човечка-врата циклус те дава наместо е интервенција стапка: удел од кадри во трчање за време на човек беше преземе. Таа е прокси, и се движи за разлика без врска на политика - пациентен оператор интервенирање помалку. Користено конзистентно, таа е еден број коешто казува или круг вредна од попладнина.

Трета превод е податоци-квалитет предупредување анализа не го покрива. Mandlekar и колеги учеа шест офлајн учење алгоритми врз пет симулирана и три вистински-свет мулти-сцена манипулација задачи, и извештај чувствителност на алгоритмични дизајн избори, пореден врз квалитет од демонстрирања, и варијабилност причина од запирање критериј. Belkhale, Cui и Sadigh спорадуваат датотека квалитет требало биде формализирана преку акција дивергенција и преход разноликост, и забелешке таа состојба разноликост не е секогаш подобра. DAgger круг додава состојби никој не избра намерно: некои се опоравување податоци требача требаш, некои се робот flailing додека ти fumble за преземе контрола.

Механички круг е шест чекори: трчање оспособување со запис врата, преземе кога политика мисбеhaves, ревидира трчање и датотека секоја епизода, sync коригирања, составување мешан датотека од оригинали плус коригирања со епизода селекција направена експлицитно по извор, и продолжува обука од предноемонен checkpoint наместо база модел. На ay-robots тие чекори постојат како копче, коишто отстрану водовод но не судење. Две опасности: продолжување од checkpoint инициализирање тежина и не е оптимизатор резиме, и лидер-рака поврзување движење е сепак светло тестирана врз хардвер. Видете обука и датотеки.

DAgger циклус, веќе жичана врата

Преземе за време на живо оспособување трчање, по-кадар интервенција обелешје, датотека епизоди како коригирања или евалуации, составување мешан датотека со експлицитна епизода селекција по извор, и продолжување обука од постоечка checkpoint сите се вградена. Ти сепак одлучиш кога преземе и што задржи - таа дел не автомати.

Видете како DAgger циклус работи

Семејство дрво, во еден табела

МетодКој избира состојбиШто експертот обезбедуваГлавен трошок
Behavior cloningЕкспертотЧиста демонстрирањаНема опоравување податоци; грешка може сложена квадратно во T
Напредна обукаБерачот, по временска мараОбелешја по индуцирана дистрибуцијаT одделни политики; неупотреблива за долг хоризонт
SMILe / SEARNСтохастичка мешавина експертот и берачотОбелешја по мешавина дистрибуцијаКомпоненти од мешавина разликуват во квалитет
DAggerМешана политика, бета пада на нулаПравилна акција за секоја посетена состојбаОбелешје состојби експертот никогаш не произведе, додека не е контрола
DARTЕкспертот, нарушена со вбризгана букаДемонстрирања под калибрирана букаБука мораше биде калибрирана на берачот грешка
HG-DAggerБерачот, додека човек преземеКоригирања само човечка-врата сегментиЗависи на човечко судење за кога интервенирање
SafeDAggerБерачот, филтрирана безбедност вратаОбелешја само кога врата прашашеВрата се мораше биде обучена и доверена

Често постављени прашања

Ќе го видам вакаливно квадратна грешка раст врз мој робот?

Не како чист крива. Врзување е најлош случај: тесно во таа некои проблем достига тоа, не твој. Што видиш е последица - политика што резултат добро врз одложена кадри, неуспеа врз вистинска задачата, и не подобри кога запис повеќе исто. Ако повеќе чиста податоци престану помагање, таа е covariate shift, не податоци-волумен проблем.

Правам ли биде имплементирам бета мешавина да го повика тоа DAgger?

Беспараметарската верзија - експертот во круг еден, чиста берачот позади - е легитимна специјална случај и често перформа најдобро во оригинално експериментите. Што не можеш уроди је агрегација: преквалификување само врз новите коригирања ломи Follow-The-Leader интерпретација, коешто е каде no-regret аргумент доаѓа од. Обука врз коригирања алт е многу полаба постапка.

Зошто враќ најдобра политика врз валидациона сет наместо последна?

Затоа што теоремите гаранција добра политика постои негде во секвенца, не дека тоа е финал итерирање - врзување е на минимум преку секвенца. Отпратување кој излезе од последната рунда отстрану наведена услова од резултат, и последна рунда не е веријатно најдобра.

Колку кругови требало план за?

Теоријата сака итерации врз редослед од T, коишто за 600-чекор епизода не е број секој трча врз хардвер. Оригиналните експериментите трча дваесет итерации врз секое мерило. Во практика ти трчам кругови додека интервенција стапка престану падаат, далеку под броју анализа претпоставува - вистински јаз помеѓу теорија и практика.

Што ако мој политика класа едноставно не може да го претстави експертот?

Потоа DAgger не те спасува, и врзување казива така - тоа е изразена релативно на epsilon_N, најдобриот загуб во класа во hindsight. Ако таа е голема затоја архитектура грешка, недостасување набљудување или камера што не може видете сцена, агрегација те дава политика таа е оптимална во класа што не може направи задачата. Трчам отворена-циклус пренос врз одложена епизоди пред соберете коригирања.

Каде да одеш од овде

Ако не си обучи политика сепак, таа теорија е предвремено: запис датотека првиот, почнувајќи од обука твои прв политика и desktop клиент. Ако си тежа друго сто чисти демонстрирања против почнување коригирања: чиста демонстрирања не исправи дистрибуција проблем. За механика, продолжи со човечка-врата варијанта и потоа SO-100 пролетање.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started