Робот манипуляцийн сценийн хийсвэр дүрслэл, сургалттай суралцсан policy буцалдаж ирэх төлөвийн хуваарилалтыг харуулдаг
DAggerДуурайлгын сургалтЗан үйлийг хуулбарлахРобот сургалтОнол

DAgger-ийг тайлбарлах: Зан үйлийг хуулбарлах яагаа сулардаг ба датасет нэгтгэх нь үнэндээ юу нотолдог вэ

AY-Robots ResearchAugust 27, 202615 мин унших

Зан үйлийг хуулбарлах нь мэргэжилтэнүүдийн төлөвийн хуваарилалтын дээр policy-г сүүлжүүлдэг бөгөөд дараа нь өөрөө нэгээс илүү байрлалаас хөргүүлнэ. Эдгээр хоёр хуваарилалтын ялгаа нь зөвхөн жинхэнэ сургалтанд сайн харагдаж байсан policy нь 300-р алхамын дээр ширээ унахад нүүлгэн шилжүүлсэн байдаг юм. Энэ бол манай DAgger цувралын онолын бүлэг: квадрат алдааны нэр томъёо хаанаас ирэх, датасет нэгтгэх нь юу өөрчилдөг, регрессгүй баталгаа юу гэж үздэг, мөн ямар хэсгийг хүний мэргэжилтэн үнэхээр төлөө байх ёстой вэ.

Манипуляцийн policy сургалтыг хүний үе даруйдаа нэргүүлж байдаг нэг гурвалсан ямар нэгэн эвдрэл байдаг. Policy нь кубусын эсрэг сунадаг, хоёр сантиметр доторх байрлалд ойртдог, хэлбэлздэг, хажууд сулгадаг, дараа нь ажилтай холбоогүй зүйл хийдэг. Сургалтын асуулт алдаа сайн байсан. Нүүлгэн шилжүүлсэн цуврал дээрх нээлтэй давтагдах сайн байсан. Гэсэн хэдий ч нүүр нь сургалтын мэдээлэлд ямар ч байхгүй байрлалд төгсдөг бөгөөд тэндээс авч ямар юм гэрээ гэсэн нүүлгэн шилжүүлэх зүйл байхгүй болдог.

Энэ эвдрэл нэр томъёо бөгөөд түүний ард оршигдсан онол байдаг. Энэ бол DAgger-д тийм зөрүүнэ дөрвөн нийтлэл хэмжээ нэг юм DAgger, мөн энэ нь аргументыг өөрөө давуулж байна: ямаатай санал болгогчийн өөрийн замналын дээр policy сүүлжүүлэх нь왜 алдаа үүсүүлдэг бөгөөд энэ алдаа дүнгээ урт дөрвөлжин байж болох, датасет нэгтгэх юу өөрчилдөг, мөн регрессгүй баталгаа юу амлаагүй байдаг. Жинхэнэ техник дээрх DAgger давталт нь SO-100 дээр DAgger давталтыг явуулж байна, хүний хаагдсан суга HG-DAgger мөн хүний хаагдсан оролцоо, мөн хэмжлэх асуулт нь DAgger давталтыг хэмжих.

Товчхон хувилбар

  • Зан үйлийг хуулбарлах нь мэргэжилтэнүүдийн төлөвийн хуваарилалтын дээр сургалт явуулдаг мөн policy-ийн өөрийн дээр үнэлдэг. Асуудал байгуулалт эпизодын төлөө угаалга.
  • Росс ба Баgnell нэмэлт өртөгийн төрөлмэш улаан T дөрвөлжинтэй хэмжээ нь үүсгэж байгаад; DAgger цаасан баталгаа энэ хил тайлбарлаж мөн түүнийг хүндэхүй хэлж байна.
  • DAgger шошго төлөвүүд policy нь өөрөө сайрах буцалдаж байдаг мөн өнөө өмнөх сургалт хөргүүлж ирэх, байхлахан сүүлийн дээр гэсэн биш.
  • Баталгаа нь регрессгүй онлайн сургалтын үм сэлэнэ: нэгтгэх ба дахин сургалт явуулах нь Follow-The-Leader байдаг.
  • Энэ нь policy үл хөлөглөлтийн дээр сайн байдаг гэсэнээ, эсвэл тэг дээр гэсэнээ гүйцэтгэхдүүдээ, мөн мэргэжилтэн өөрөө санал болгогчийн үүсгэхээргүй төлөв тавих шаардлагатай байдаг.

Зан үйлийг хуулбарлах нь чимээнээр санал болгож байдаг

Үзүүлэлтийн датасет нь үзэгдэл-үйлэ хосуудын толбо болдог. Зан үйлийг хуулбарлах нь энэ толбо дээр ердийн хяналтад сургалт явуулдаг функцийг сүүлжүүлдэг бөгөөд эндээр зогсдог. Энэ хэсэг дахь сахилга батыг юуны өмнө байна. Pomerleau-н ALVINN, 1988 онд, гурван давхрын эргүүлэх ажиллагаа сүлжээ байсан нь камер ба лазер диапазон хайгчээс дүрс авч явсан мөн тээврийн хэрэгслэл явах чиглэл гарчээ; энэ нь дуурайлсан замын дүрсэн дээр сургалт явуулж, жинхэнэ замаар явсан байдаг. Хоолой эмхэтгэл, гэм оо хийгээд нь огт өөрчлөгдөөгүй байдаг; сүлжээ өөрсдөө өөрчлөгдөөгүй байдаг.

Аль нь унасан байх юм түүх байдаг үл хяналта байдаг. Бүрийг нь санал болгогч үүсгэдэг замнал дээр оршиж байдаг. Policy нь өөрсдөө үүсгэдэг. Эхлэл мөр хүүнийг үл тасрах үедээ санал болгогчийн сургалт датасет дээр ямар ч оршишгүй төлөвийн талаар асуулга байдаг, мөн өөрийн хариу нь илүүтэй авлиддаг. Росс, Гордон мөн Баgnell нээлтээд DAgger цаасан яг энэ: дараалсан урьдчилан сэргийлэлт i.i.d. таамаглалыг эс хэл байдаг учимыхаа сургалтын суутга нь өөрийн өмнөх таамаглал дээр улаа оролцож байдаг.

Энэ цаас дээрх хамгийн цэвэр жишээ нь робот вэл биш болдог. Нэлээд сайн планер Super Mario Bros. дуурайлгын хуулбар үл урьдчилсан түрүүлэл мөр бир, үндсэр үл сайхан байрлалд баттай орчуулж байсан. Шалтгаан нь ихэнх аргумент нэг өгүүлбэй: мэргэжилтэн үргэлж арга сайн байрлалаас мэдэгдэхүүлэгддэг, тэгэхээр датасет хэнний байдал байгуулсан үл байх ямар ч төлөвийг байлгадаг, мөн тийм байдлаас яаж хийх цаг байж байдаг.

Mario-г SO-100 нүүр-д сольж байна бөгөөд байгуулалт адилхан байдаг. Өмнөх үзүүлэлтүүд нь ариун урьдчилсан эргүүлэх, ариун grip-ийг үзүүлэлт байдаг, гэсэн хэдий ч gripper хаалт хоёр сантиметр богино байх ийнх үл байх - тэгэхээр policy энэ байрлалаас юаж хийх юм байдаг, мөн гунайн таамаглалаа нь илүүтэй авлиддаг. Ковариатын шилжилт мэдээлэл цуглуулах журам-ийн шинж чанар, сүлжээ архитектур биш.

Дөрвөлжин нэр томъёо хаанаас ирэх

2010 AISTATS цаасан Росс мөн Баgnell, Дуурайлгын сургалтын төлөө үр дүнтэй сэлэнэ, Цэвэр байдлыг хийнэ. Т нь ажилтай эс зам, ажил өртөгийг нэгж эс дээр өмнөх, ба epsilon байхлахан замд алдаа хэмжлэл байна мэргэжилтэнүүдийн төлөвийн хуваарилалт - сургалт өвлөө дугаар мэдээлэл. Дараа нь энэ policy явуулж байрлалд T алхам байрлалд нэмэлт өртөг, мэргэжилтэнтэй хүндэтгэл, Т дөрвөлжин эпсилон дээр хүндэлэдэг байна. Росс, Гордон мөн Баgnell энэхүүтэй Теорем 2.1 үгээр DAgger цаасан шалтгаал бө мөн нэмэлтэй өгүүлбэ асуулт байна: хил хүндэхүй байдаг. Асуудлыг оршиж байдаг хэнийг policy эпсилон алдаа мэргэжилтэнүүдийн хуваарилалт дээр үнэн Т уртын эргүүлэх нэмэлт өртөг хэмжээ альнаас болтугй урьдчилсан байдаг.

Хүндэхүй үл байвал ердийн. Дөрвөлжин нэр томъёо нь асуудлыг сорилтон чанаруулах, таамаглалтан таны pick-and-place ажилтан биш болдог. Аль нь үндэслэлүүлдэг нь мэргэжилтэнүүдийн нэмэлт үзүүлэлт сруулахгүй нь үл чадна: энэ зөвхөн эпсилон үнэлмэл өвлөө хуваарилалт дээр байна, policy судалгаа болхгүй.

Унаа замнал дээрх Теорем 2.2 дээр үндэслэлэя байдаг. Хэрвээ policy эпсилон алдаа хүнээс өөрийн төлөвийн хуваарилалт авах, ба нэг сайн биш үйлэ дээр хамгийн ихдээ u байдаг өртөг-дээр-сарай мэргэжилтэнүүдийн дээр, дараа нь нэмэлт өртөг у дээр T дээр эпсилон хүндэлэлдэг байна - шугаман ба эс зам. u дахь тогтмол нь сонирхолтой хэмжээ байна: хамгийн ихдээ 1 0-1 ерөнхөйлөлтийн эргүүлэх мэргэжилтэнүүдийн эргүүлэх, мөн O(1) үргэлж мэргэжилтэн хүүхлүүдэх алхам дээр буцалдаж чадна. Хамгийн сайн байдлаас O(T) байна, мөн шугаман хил дараа дөрвөлжин хүнээс үл ойрхон байдаг.

БайгуулалтНэмэлт өртөгийн дээр хүндэлэл мэргэжилтэнүүдийнАль нь суулиа оршиж байна
Зан үйлийг хуулбарлах (Росс ба Баgnell 2010, Thm. 2.1 үгээр дахин байрлалт Ross et al. 2011)T дөрвөлжин эпсилон байнаэпсилон хэмжлэл мэргэжилтэнүүдийн төлөв хуваарилалт дээр; өртөг [0,1]; хил хүндэхүй
Аль нь policy эпсилон алдаа түүний өөрийн хуваарилалт дээр (Thm. 2.2)u дээр T дээр эпсилонu оромтойгоо өртөг-дээр-сарай хэнтэй нэг мээрэлт үйлэ; хамгийн ихдээ 1 0-1 алдаа, O(T) хамгийн сайн байдаг
Урьдчилсан сургалт (Росс ба Баgnell 2010)u дээр T дээр эпсилоннэг policy байрлал дээр; шаардлага T өндөр мөн мэдэгдэх, хязгаарлалт T
SMILe (Росс ба Баgnell 2010)бараг-шугаман T мөн эпсилон дээр нэх асуудлаа сорилтalpha O(1/T дөрвөлжин), N O(T дөрвөлжин лог T); үр дүн стохастик үлсбэлэл
DAgger (Thm. 3.2, Ross et al. 2011)u дээр T дээр epsilon_N, нэмүүлэх O(1)N T үл үл; хүчтэй хавсаргасан хөдөлмөрийн алдаа; үл-сарай суралцаа; epsilon_N байны хамгийн сайн алдаа
Робот цэнгэлэг төлөв төлөөлөл байна policy сайрах үргэлж байхгүй үл байхлахан үзүүлэлт нэр томъёо
DAgger раунд дээр аль нь байрлалаа үл байна: нэл-мээч grip, хагас-нээлтэй gripper, нүүр зэв ажилт.

Хоёр оролцоо DAgger урьдчилсан

Урьдчилсан сургалт байх үнэхээр гэсэн нөөцгүй хариу. Сургалт нөөцгүй эсшүүлэлэ поли байрлалт, байрлалд, байрлал дээр төлөө суралцаа нэлээд сүүлийн, бүхий төлөөг төлөв нь үхэлтэй. Сахинь байгуулалт: T ободий, сургалт дараалсан, үл үнэхээр сулнуу. Манипуляций эпизод 30 кадр дээр дөрвөлжин, T байрлалтай зэв.

SMILe, адилхан цаас, мөн SEARN, Daume, Langford мөн Marcu-н бүтэцсэн өмнөө ажил, авах нөөцгүй замнал: нэг байнай мөлхөлтүүлэг, гэсэн хэдий ч стохастик. Байрлалт сургалт доорхи, үлсбэлэл дээр, шилжүүлэх магадлал массыг эргүүлэх мэргэжилтэнийг. Үр дүн байны үлсбэлэл хий суг байрлалт цахимыж болох - физик нүүрэл, хяналт байха сорилтон мээрэлт төвүүлэл үедээ ур мулчил мээрэлт. Энэ мэргэлэхүй байна байнай мөлхөлтүүлэг тодорхой policy оронд.

DAgger: нэг санаа, нэг хэсэг

Датасет нэгтгэх байны мөлхөлтүүлэг үл шилжүүлэх мөн бүхи дээр мэдээлэл цуглуулах. Байрлалт раунд: явуулж сүүлийн policy, мэдээлэл төлөө сайрах, асуух мэргэжилтэнийг юаж бүхэл үйлэ байх байдаг, нэмэлтүүлэхүүлэг эдгээр хос датасет оронд өвлөө, дахин сургалт байна. DAgger нэр томъёо байны алгоритм - та нэгтгэх, та хэнийг үл шидэх.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAgger мета-алгоритм, Algorithm 3.1 Росс, Гордон ба Баgnell (2011).

Гурав баримта буцаа деген илүүтэй үнэлэл гэсэн үзэтгэн. Шошго байны төлөв хүнээ мөлхөлтүүлэг policy, гэсэн хэдий ч үйлэ мэргэжилтэнийг - policy өгүүлэлт асуулт, мэргэжилтэнийг хариу. Дахин сургалт байны бүхэл нэгтгэх, хий байрлалт Follow-The-Leader алхам: раунд n та сайхаа policy баримта өмнөөнө байрлалт завсраа. Энэ рамка байны аль нь баталгаа уних өндөр. Мөн алгоритм нь эцсийнь сайхаа policy дараалсан байрлалд сургалт нэр томъёо байна асуулт, учимыхаа теорем баталгаа нэк policy дараалсан сайн байна, үл сүүлийн байна.

Бета хуваарь, мөн яагаа энэ үл байна сүүлэл нот

Мөлхөлтүүлэг policy байны бета_i байрлалтыг мэргэжилтэнийг нэмүүлэх нэг минус бета_i суралцаа. Цэл байна үнэхээр: сүүлийн хүүхлүүдэх суралцаа сургалт бараа мэдээлэл, хийн маш мээрэлт, мөн байна бүхэл явуулж байрлалт дүүлэх үл хэрэгтэй үхэлтэй яхаа нь сайхаа дахинн өвлөө.

Теорем оромтойгоо яг нэг нөхцөл: явуулж дунджа дахь бета яд дараа тэг. Шинжилгээ байна бета_i хүндэлэл (1 - alpha) их өгүүлбэй i-1, доорхи тогтмол alpha байа T-н байга.

ХуваарьЮаж энэ хийЮаж цаасан баримта
бета_1 = 1Сүүлийн раунд байны цэвэр мэргэжилтэнийг үзүүлэлт; үл сүүлийн policy шаардлагаХүргүүлэлтэй заалттөй цэл, байрлалт сорилт
бета_i = 1 хэрвээ i = 1, бүх биш 0Мэргэжилтэнийг зөвхөн раунд нэг; үл сүүлэл параметрЦаасан параметр-сүүлэл хувилбар, хий хэл сайх гүйцэтгэл баримта; 2980 Super Mario Bros. дараа 20 давталт
бета_i = p^(i-1) p = 0.5 үүнийМэргэжилтэнийг магадлал ояа геометр3030 адилхан сорилт, сайхаа улээ параметр-сүүлэл хувилбар
бета_i = p^(i-1) p = 0.9 үүнийМэргэжилтэнийг байна давталтан уртИлүүтэй сайх сүүлэл өргөн; үл сайхаа үедээ 20 давталт төгс

Завсар дахь 2980 мөн 3030 хэмжээ явуулж бараа 4300 дээр сайхаа гэсэн, гэсэн хэдий ч цаасан өнөө үзэл байна хамгийн ашигтайхуу баримта өгүүлбэй дээр. Параметр-сүүлэл хуваарь эргүүлэх Mario хөргүүлэлэ адил байрлалт мөн үүсгэнэ массыг нэл-өнцгөөд мэдээлэл; идэвхтэй мэргэжилтэнийг явуулж фракци үедээ хоёуул нь үл худалсан мөн өргөлтийн төлөвийн. Хуваарь байна үл байна байлгадаг мөлхөлтүүлэг байх байнай сүүлйя ба мөн тавьсан адилхан сайхаа байрлалт орц үл адилхан эвдрэлт.

Яагаа хуваарь үл шилжүүлэх физик нүүр байрлалтан байгаа

Стохастик байрлалт-дахь мөлхөлтүүлэг үүүчай буцаа хяналт байна хяналт хувь, 30 дөрвөлжинч дээр ердийн SO-100 байгуулалт. Үл телэпо интерфэйс хийна энэ аюулгүй орц смэрэл байлгадаг. Жинхэнэ техник дээр бета хуваарь сүүлсэнь хүний сэтгэл юаж үедээ авах: өөр алгоритм сүүлсэнь өөр шинжилгээ.

Баталгаа: сэлэнэ үл-сарай онлайн сургалт

Энд байна шилжүүлэх цэл чанаруулэх цаасан юаж энэ байна. Үзнэ байрлалт DAgger раунд байрлалтан нэг жишээ онлайн сургалтан асуудла, хэнийг алдаа раунд i байны замд алдаа төлөөлөл төлөв байна policy өгүүлгэлэхүүлэг раунд i. Суралцаа хүргүүлэлт мөлхөлтүүлэг урьдчилсан аюулгүй энэ алдаа, мөн дараалсан байна үл байнай учимыхаа энэ байна политик бүхэй сүүлийн.

Алгоритм байна үл-сарай хэрвээ өнөөгийн дунджа алдаа N раунд ойртдаг адилхан нэг мөлхөлтүүлэг баримта. Follow-The-Leader дээр хүчтэй хавсаргасан алдаа байна ийнх алгоритм, авах дунджа сарай сайхаа 1/N үм - мөн дахин сургалт дээр бүхэл нэгтгэх байна яг Follow-The-Leader. Аль нь биш үл-сарай суралцаа байна үйлэх байдаг: шинжилгээ байна сэлэнэ, үл шинж нэг өндөр.

Нэг лемма сүлүүлж завсар мөлхөлтүүлэг байна цуглуулна мэдээлэл мөн суралцаа мөлхөлтүүлэг байна байрлалд: Лемма 4.1 хүндэлэл L1 завсар байрлалтан төлөв хуваарилалт 2 T бета_i үм. Энэ байна яагаа бета яд дараа - үедээ мэргэжилтэнийг үл агаа хяналт байна аюулгүй, төлөв та цуглуулнэ үл байна төлөв та мөлхөлтүүлэг үүсгэнэ. Нэгтгэхүүлэг лемма сүлүүлэх сарай хүндэлэл мөн үндсэр үр дүн дараа: дараа бараа T давталт, нэк мөлхөлтүүлэг дараалсан байна замд алдаа түүний өөрийн хуваарилалт дээр O(1/T) дээр epsilon_N. Орих энэ шугаман хүндэлэл мөн та авлай Теорем 3.2 үм.

Мэдээлэл тал байна ломпу байдаг сүүлийн стандарт. Super Tux Kart дээр хяналтын үндсэр үл сайхаа өнөөгийн унахын завьтуу байрлалтай мэдээлэл байнала, DAgger авлай мөлхөлтүүлэг үл унах раздахь зам дараа арван таван давталт, мөн SMILe дараа хорин үл унахай бараа хоёр дөрвөлжинч. Гарын үсэг сорилт дээр, сорилт үнэн явуулж 82 хувь үл бүтэц, 83.6 хувь хяналтад, 85.5 хувь DAgger сүлүүлэх. Үл байна энэ манипуляцийн үр дүн.

Юаж баталгаа үл амлаа

Теорем байрлалт байна нөхцөлтэй, мөн нөхцөл байна ачаа-авлай.

DAgger баталгаа, уних нблизко
Юаж байна өгүүлэн та
  • Хүндэлэл шугаман стан дөрвөлжин T, доорхи байхлаа нөхцөлүүдэ.
  • Байнай мөлхөлтүүлэг стан стохастик мөлхөлтүүлэг.
  • Үнэхээр сэлэнэ: аль нь үл-сарай онлайн суралцаа оруулах сайх.
  • Яг давталтын өгүүлэлтэй - бараа T раунд урьдчилсан регрессгүй нэр томъёо сулнуу үхэлтэй.
  • Баталгаа байрлалтан хамгийн нэк мөлхөлтүүлэг дараалсан, үндсэр сургалтан орголт.
Юаж энэ үл өгүүлэн та
  • Энэ байна эргүүлэлтэй epsilon_N, хамгийн сайн алдаа сорилт баримта, үл тэг. Хэрвээ та сорилт үл төлөөлөл мэргэжилтэнийг, энэ байна хоосон баримтаас.
  • Энэ байна шаардлага үл-сарай арга орц хүчтэй хавсаргасан замд алдаа - сайхаа ангилалт сэлэнийг байна, байхлаа сахилга батыг баримта.
  • Тогтмол u болно байна O(T) хамгийн сайн байдлаас, мөн шугаман хил дараа сулнуу дөрвөлжин.
  • Энэ хүндэлэл давталт, үл мэргэжилтэнийг шошго. Робот дээр шошго байна төлөө сулнуу.
  • Энэ таамаглалаа мэргэжилтэнийг байна асуухдаа байрлалт мөн хариу сайха энэ. Энэ таамаглалаа байна бүхэл өртөг.

Нэг бусад үр дүн байна ихэнх андуурдаг үл нэг болнооор. Раджарман, Ян, Jiao мөн Ramachandran судлаа мини-макс хязгаарлалт дуурайлгын сургалтан эпизод MDP хязгаарлалт төлөв хэнийг мөн эс зам, мөн нотлоо асуудлаа доомтлолын хүндэлэл О(|S| H дөрвөлжин N дээр орших үл байха үедээ суралцаа байна асуухдаа мэргэжилтэнийг сайрах төлөв. Энэ байна хамгийн сайн байдаа хувь MDP туслалтсан нэг эпизод төлөө сулнуу, мөн юаж энэ хаахдаа үл байна санаа асуухдаа мөлхөлтүүлэг сайхаа хувь-мини хувь; DAgger-н теорем байна өөр байрлалтан, хүндэлэл байрлалд мөлхөлтүүлэг эргүүлэлтэй баримта сорилт.

Swamy, Choudhury, Баgnell мөн Wu дараа ангилал энэ алгоритм хий нэр томъёо мэргэжилтэнүүдийн зан үйл тэдгээр үл нэмүүлэлтэй нэг нэр томъёо мөрийлгэх сайха байна үл сорилт оршиж үл өөр оршиж таллалалт. Судалгаа Osa ба Celemin давуулдаг алгоритм ландшафт мөн хүний хохонуу интерфэйс.

Баримта: шошгоо төлөвтэй мэргэжилтэнийг үл үүсгэнэ

Бүхэл дээр таамаглалаа мэргэжилтэнийг байна асуухдаа хэнийч. Дуурайлгын байна сайхаа - Mario туршилтыг хашил нэл-оптимал сайхаа бүхэл байга төлөв. Хүний нүүр энэ байна гол өртөг, мөн сайхаа: хүний байна гарам үйлэ төлөө төлөв байша конфигурац тэдгээр өөрийн чадвар байх үл үүсгэнэ.

Kelly, Sidrane, Driggs-Campbell мөн Kochenderfer мэдээлэл өгүүлбэ HG-DAgger цаасан. Vanilla DAgger шаардлага мэргэжилтэнийг нөөцгүй үйлэ шошго үедээ үл бүхэлээр хяналт байна систем. Энэ сулдуулдаг аюулгүй, мөн хүний мэргэжилтэнийг энэ байна сайхаа нөвтрүүлэх мэдээлэл цуглуулах жинхэнэ алдаа, хий тэдгээр ормой талд сүүлэн сүүлэл алдаа. Шошго та авлай дараа байна үл шошго алгоритм таамаглалаа.

Laskey мөн суутга довтолж асуудла нөөцгүй тал DART үм, мөн тэдгээр рамка байна сайхаа: үл-сүүлэн техник байна гүйцэтгэлийн хүний хяналт, нэмүүлэхүүлэг сүүлэл ачаа, мөн байна байрлалд аюулгүй төлөв үедээ сургалтан. Тэдгээр хувилбари оруулдаг идэвхтэй дуу сүүлэнийг хяналтын өөрийн үзүүлэлт, тэгэхээр асаалт байна үзүүлэгдэлтэй үл робот явуулж үл ёстой мөлхөлтүүлэг. MuJoCo Humanoid тэдгээр мэдээлэл DART сулдуулдаг хяналтын нийлмэл боловсрол 5 хувь үедээ сургалтан, үедээ DAgger явуулдаг мөлхөлтүүлэг 80 хувь бага нийлмэл боловсрол стан хяналт; grip дээр лалын Toyota HSR, дунджа 62 хувь өргөн өндөр зан үйлийг хуулбарлах.

Чжан мөн Чо-н SafeDAgger үй мөлхөлтүүлэг байна скарс өндөр: өөр аюулгүй мөлхөлтүүлэг өмнөө, үл асуух, өлгөд байна юаах үл утсолох эргүүлэх үл байна шил, мөн зөвхөн байрлалт хөргүүлэлэгдэх. Гурав байна үл-хагалтан адилхан баримта - DAgger шинжилгээ сулдуулдаг юу байа мэргэжилтэнийг шошго, мөн баримта сулдуулдаг маш нэлээд.

Хэсэг үл анхалага та тухай

Шошгоо үл-хуваарилалт төлөвтэй байна сэтгэлийн сайхаа уйлуулдаг стан үзүүлэлт ажилтан. Ердийн үзүүлэлт гэж баглаа хэрэгслүүлэн мөлхөлтүүлэг та өвлөө байна. Залруулах мөлхөлтүүлэг байна оруулсан gripper хэнийч та үл байхлахан гэж байна үүсгэн асаалт үедээ үл хяналтад систем. Идэвхтэй цаг даруйдаа, хяналт үл сайхаа байжээ мөлхөлтүүлэг. Хүлээнээ бага сайхаа мин байрлалт сургалтан эргүүлэх байлгадаг цэл мэдээлэл цуглуулах яхаа, мөн үзнэ та өөрийн залруулах жинхэнэ хорогдол өнөөгийн цаг нэм.

LeRobot датасет бүтэц үзүүлэлт эпизод, кадр мөн байрлалт-кадр доорхи байрлалтан сулнуу диск дээр
Залруулах байна датасет зөвхөн үедээ оролцоо кадр үл байна дэвсгэрэлтэй - LeRobot бүлэг, байрлалт-кадр доорхи үзүүлэлт мөн үйлэ үм.

Юаж энэ гэнэ SO-100 та өмнөө

Орчуулна эс зам та өөрийн нэгж рүү. Хорин-дөрөвлөгч эпизод 30 кадр дээр дөрвөлжинч байна 600 шийдвэр алхам, мөн T байрлалт байна та өндөр. T = 600 үедээ, завсар дахь нэр томъёо хэмжээ T мөн T дөрвөлжин байна завсрах байлгадаг мөлхөлтүүлэг яхаа асаалта үл хийх.

Энэ байна нэг байна яагаа үйлэ үлсбэлэл сайхаа: үедээ мөлхөлтүүлэг гарачирлалт дүүлэх үйлэ байрлалтан дүүлэх алхам, үл шийдвэр цэл сулнуу, мөн адилхан үл мээрэлтэй үл сулнуу. Чжао, Kumar, Levine мөн Finn нэр томъёо үл сулнуу алдаа байна байна үл-асагды үйлэ Transformers үм, мөн мэдээлэл 80 бүхэл 90 хувь амжилт нэлээд бэзний жинхэнэ ажилтан, үл үнэхээр үнэтэй хоёр-гар техник, дээр арван мин байлгадаг үзүүлэлт. Үлсбэлэл үл арилгах ковариатын шилжилт - төлөвтэй байна үл мөлхөлтүүлэг өөрийн - гэсэн хэдий ч сайхаа үл байна эс зам. Үзнэ үйлэ үлсбэлэл мөн SO-100 дуурайлгын сургалтан гарын авлагаа.

Хоёр орчуулалт байна явуулж байна үнэлэлэ. та үл чадна хэмжлэл epsilon төлөөлөл мөлхөлтүүлэг өөрийн хуваарилалт шууд - энэ шаардлага газар үнэхээр мэргэжилтэнийг үйлэ байрлалт сайрах, юу та оролцож байлгадаг үүсгэнэ. Юаж хүний-хаагдсан давталт өгүүлэн та оронд байна оролцоохын хувь: завьтуу кадр явуулж дөрвөлжинч үедээ хүний байна авлай үл байнала. Энэ байна өмөрхийлэл, мөн энэ шилжүүлэх байрлалтан өндөр үл байна мөлхөлтүүлэг - сайхаа үй эмхэтгэгч оролцоо сайхаа. Та үнэн ашигла, энэ байна нэг үл сан юа хэлэлцэнэ раунд байна үнэхээ сүүлийн шөнө.

Гурав орчуулалт байна мэдээлэл-жинхэнэ анхаар юаа шинжилгээ үл давуулдаг. Mandlekar мөн суутга сургалтан зургаа үл-онлайн алгоритм нэлээд хөргүүлгэлэлтэй бөгөөд гурван жинхэнэ-ертөнцийн нэлээд-үе манипуляцийн ажилтан, мөн мэдээлэл чувствальнасть байрлалд алгоритм сайхаа сонголт, хэрэгсэл байрлалтан жинхэнэ үзүүлэлтэн, мөн хэлбэлзэл сулдуулдаг сулнуу үл-сончих. Belkhale, Cui мөн Sadigh аргумент юа датасет жинхэнэ байна форлаиз доорхи үйлэ өшөө мөн шилжүүлэх төлөв ялгаа, мөн баримта юа төлөв ялгаа байна үл үргэлж сайхаа. DAgger раунд нэмүүлэхүүлэг төлөвтэй үл байна намаар сонголт: нэк байна асаалт мэдээлэл та шаардлага, нэк байна робот flailing үедээ та фалдашдаг авлай хяналт.

Механик раунд байна зургаа алхам: явуулж дүүлэх үм эргүүлэх эргүүлэхүүлэг маркировка идэвхтэй, авлай үедээ мөлхөлтүүлэг байша мээрэлтэй, улгаа раунд мөн файл байрлалт эпизод, уйглах залруулах, угаалга нийлмэл датасет өвлөө нэмүүлэлт тусах эпизод сонголт үүсгэнэ дээр эх, мөн үргэлжүүлэх сургалтан сүүлийн checkpoint орлуулалт үндсэр модель. ay-robots эдгээр алхам оршиж байна товуу, хий арилгадаг сүүлэл гэсэн хэдий ч үл сэтгэл. Хоёр сарай анхаар: үргэлжүүлэх сөргүүлэлтээ инициалж жинхэнэ үл үл оптимаацер асаалта, мөн удирдагч-нүүр байна үл сайхаа сүүлэй техник дээр техник. Үзнэ сургалт мөн датасет.

DAgger давталт, өвлөө болон сүлжээлэх

Авлай үедээ жинхэнэ дүүлэх мэдээлэл эргүүлэхүүлэг маркировка, файл эпизод байрлалтан залруулах орц үнэлэхүүлэг, угаалга нийлмэл датасет сайхаа эпизод сонголт дээр эх, мөн үргэлжүүлэх сургалтан оршигдсон эргүүлэлтэй байна бүхэл байгуулана. та үл сайхаа үедээ авлай мөн юаа байлгадаг - энэ хэсэг үл автомат.

Үзнэ юаах DAgger давталт байна яшуулж

Өмнөө байна нэг жагсаалт

АргаХүн сонголт төлөвтэйЮаха мэргэжилтэнийг гаруулдагГол өртөг
Зан үйлийг хуулбарлахМэргэжилтэнийгАриун үзүүлэлтҮл асаалта мэдээлэл; алдаа болно үл дөрвөлжин T
Урьдчилсан сургалтСуралцаа, байрлалт дөрвөлжинчШошго байна доорхи үл-сүүлэл хуваарилалтT нөөцгүй мөлхөлтүүлэг; болно өнгө урт эс зам
SMILe / SEARNСтохастик үлсбэлэл мэргэжилтэнийг мөн суралцааШошго байна доорхи үлсбэлэл-ийн хуваарилалтДоорхи болно үлсбэлэл үзүүлэлтэй жинхэнэ
DAggerМөлхөлтүүлэг байна мөлхөлтүүлэг, бета хорогдол тэгСайхаа үйлэ байрлалт сайрах төлөвтэйШошгоо төлөвтэй мэргэжилтэнийг байх үл гаруулдаг, үедээ үл хяналтад
DARTМэргэжилтэнийг, орнийн оруулсан дууҮзүүлэлт доорхи идэвхтэй дууДуу байна идэвхтэй суралцаа-н алдаа
HG-DAggerСуралцаа, хүл хүний авлайЗалруулах зөвхөн хүний-хаагдсан сегментБайна хүний сэтгэл юаах авлай
SafeDAggerСуралцаа, уншилга аюулгүй хаалгаШошго зөвхөн хаалга асуухХаалга өөрөө байна сургалтан мөн итгэх

Ихэнх асуулт хариулт

Би үнэндээ ажиглая дөрвөлжин алдаа өргөнийг робот дээр?

Үл нэл давх. Хил байна хамгийн сайн байдлаа: хүндэхүй энэ юа асуудлыг гүйцэтгэл байна, үл юа та байхлаа байна. Юаха та үзэх байна үр дүн - мөлхөлтүүлэг юа байна сайхаа уяалгадаа кадр, сайхаа жинхэнэ ажилтан, мөн үл сайхаа үедээ та мэдээлэл илүүтэй адилхан үл. Юа сайхаа мэдээлэл сулнуу сайхаа, энэ байна ковариатын шилжилт, үл мэдээлэл-хэмжээ асуудла.

Би байна хэрэгтэй бета үлсбэлэл хэрэгслэхүүлэг үл гэж DAgger?

Параметр-сүүлэл хувилбар - мэргэжилтэнийг раунд нэг, цэвэр суралцаа дараа - байна байна үл сайхаа тусгай оршис мөн ихэнх гүйцэтгэлтэй сүүлийн туршилтын. Юаха та үл чадна үл орохо байна нэгтгэх: сургалтан зөвхөн сүүлийн залруулах булчинжэ Follow-The-Leader үнэлэлэ, хий байна хаанаас үл-сарай аргумент ирэх. Сургалтан залруулах зөвхөн байна маш сайхаа журам.

Яагаа буцалдаа хамгийн сайхаа мөлхөлтүүлэг сургалтан нэр томъёо орлуулалт сүүлийн нэг?

Учимыхаа теорем баталгаа сайхаа мөлхөлтүүлэг оршиж байна дараалсан, үл энэ сүүлийн байна - хил байна доорхи минус дараалсан. Буцалдаа юаха байна гарачирлалт сүүлийн раунд ээлж байна сургалтад байна үл сайхаа байрлалт үл байлгадаг, мөн сүүлийн раунд байна үл сайхаа байна.

Хэдий давталт байна планаа байлгадаг?

Теорем байна байбич на T үл үл, хий нэг 600-алхам эпизод байна үл үл үл байлгадаг техник. Өвлөө туршилт явуулж хорин давталт байрлалт сорилт. Баримтаа та явуулж раунд сүл оролцоохын хувь сулнуу, баа доороос байчин шинжилгээ таамаглалаа - жинхэнэ завсар онол мөн баримта.

Юаха хэрвээ та мөлхөлтүүлэг сорилт зөвхөн үл чадна төлөөлөл мэргэжилтэнийг?

Дараа DAgger үл аврах та, мөн хил хэлэлцэнэ - энэ байна төлөөлөл epsilon_N, хамгийн сайн алдаа сорилт баримта. Хэрвээ энэ байна том учимыхаа буруу архитектур, алддаг ажиглалт орც камер үл чадна үзнэ яхаа сценийн, нэгтгэх өгүүлэн та мөлхөлтүүлэг юа байна оптимал доорхи сорилт үл чадна хийнэ ажилтан. Явуулж нээлтэй давтагдах эргүүлэхүүлэг уяалга эпизод урьдчилсан та цуглуулнэ залруулах.

Хаан явуулж энэ үм

Хэрвээ та үл сургалтан мөлхөлтүүлэг урьдчилсан, энэ онол байна сорилтан: мэдээлэл дээр рекорд, эхлэл дээр сургалтан та сүүлийн мөлхөлтүүлэг мөн өмнөө клиент. Хэрвээ та дүүлэхүүлэг нэг зуу ариун үзүүлэлт эргүүлэх үл эхлэлээр залруулах: ариун мэдээлэл үл сайхаа хуваарилалтан асуудла. Байна механика, үргэлжүүлэх хүний-хаагдсан сугруйлга мөн дараа SO-100 аяллын гарын авлагаа.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started