Human-gated DAgger, эхнээс эцэс хүртэл

Policy буруу зүйл хийх үед удирдлагыг гараар аваад, засвараа шууд сургаарай.

Behavior cloning-оор сургасан policy зөвхөн танай демонстрацууд очиж үзсэн төлвүүдийг л мэддэг. DAgger энэ зөрүүг policy өөрөө хүрдэг төлвүүдийн өгөгдлөөр нөхдөг. AY-Robots энэ давталтыг SO-100 дээр бүхэлд нь ажиллуулна: checkpoint-оо ажиллуулаад, дундаас нь удирдлагыг гараар аваад, засварласан episode-уудаа хадгалаад, хольцоо өөрөө бүрдүүлээд, дөнгөж жолоодсон checkpoint-оосоо сургалтаа үргэлжлүүлнэ.

  • HG-DAgger, хүн-хаалттай
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • Раунд тутмын оролцооны хувь

Сургасан policy яагаад хэзээ ч үзүүлээгүй зүйл хийдэг вэ

Behavior cloning нь удирдлагыг ердийн хяналттай сургалт мэт авч үздэг: ажиглалт орж ирнэ, үений зорилтот утга гарч ирнэ, хүний бичсэн frame-үүд дээр тохируулагдана. Энэ нь робот хүний очиж үзсэн төлвүүд дээр л байх үед л зөв ажилладаг, харин бодит байдал дээр тийм байдаггүй. Дөчин миллисекундээр эрт хаагдсан gripper нь шоог демонстрацлагдсан байрлалаас нь хоёр миллиметрээр гажуудуулна. Дараагийн ажиглалт сургалтын өгөгдөлд байхгүй тохиолдол болно, тэнд хийх action нь экстраполяци болно, харин үүний дараах төлөв бол бүр ч холдох болно. Сургалтын тархалт болон сурсан policy-гийн бодитоор үүсгэдэг тархалт хоёр өөр зүйл бөгөөд episode үргэлжлэх тусам хоёр дахь нь эхнийхээс улам холддог.

Ross, Gordon, Bagnell нар яг энэ бууралтын алдааг 2011 онд тодорхойлж, хохирлыг тоон утгаар илэрхийлсэн: экспертийн тархалтын дор e магадлалтай алддаг классификатор нь өөрийн үүсгэсэн тархалтын дор T алхамтай horizon дээр ойролцоогоор T-ийн квадрат ба e-ийн үржвэрийн хэмжээний алдаа гаргаж болно, учир нь нэг алдаа нь экспертийн хэзээ ч үүсгэж байгаагүй ажиглалтуудыг үүсгэдэг бөгөөд алдаанууд хуримтлагддаг. Тэдний шийдэл нь энэ хуудсын өгүүлж буй алгоритм: одоогийн policy-г ажиллуул, түүний очсон төлвүүдэд зориулж экспертийн label цуглуул, өнөөг хүртэл цугласан бүх зүйлтэй нэгтгэ, дахин сургаад, давт. Ижил төрлийн илүү олон демонстраци тус болохгүй, учир нь тэдгээр нь яг тэр л тархалтаас дахин түүвэрлэдэг. Харин policy хүрдэг төлвүүд дээрх label тус болно. Энд хэрэгжүүлсэн хувилбар нь хүн-хаалттай (HG-DAgger, Kelly нар): хэн нэгэн буруу байна гэж шийдэж удирдлагыг авах хүртэл policy удирдлагыг барьсаар байдаг, ингэснээр засвар зөвхөн хэрэгтэй газар л үүсдэг бөгөөд гар нь оператор зөвшөөрөхгүй төлөв рүү хэзээ ч чиглүүлэгддэггүй.

  • Behavior cloning нь зөвхөн өөрийг нь сургасан төлвийн тархалт дээр л хүчинтэй байдаг.
  • Алдаа өөрөө өөрийгөө хүчжүүлдэг: бага зөрүү танил бус төлөв үүсгэж, тэр нь улам том зөрүү үүсгэдэг.
  • Эмчилгээ нь илүү олон демонстраци биш, харин policy өөрөө хүрдэг төлвүүд дээрх label юм.
  • Хүн-хаалттай гэдэг нь автономийн оноо биш, оператор өөрөө хэзээ оролцохоо шийддэг гэсэн үг.

Алдаа яагаад хуримтлагддаг вэ

Horizon-ийг чирж тохируул. Behavior cloning дор хүлээгдэж буй нэмэлт зардал алхмын тооны ойролцоогоор квадратаар өсдөг, учир нь алдаа тутам демонстрацууд хэзээ ч хамраагүй төлвүүд үүсдэг; харин нэгтгэлийн давталт өсөлтийг шугаманд ойртуулж барьдаг (Ross нар, 2011).

200
1.0 %
Behavior cloning
400
DAgger
2.00
200×
Behavior cloning ÷ DAgger
0.000100200300400050100150200Хүлээгдэж буй нэмэлт зардал (хязгаар)
Даалгаврын horizon (алхам)

Ross нарын (2011) хязгаараас гаргасан харуулах график, таны робот дээрх хэмжилт биш. Гол нь тоо биш, муруйн хэлбэр юм.

DAgger-ийн нэг раунд, зургаан алхам

Энэ бол платформ бодитоор ажиллуулдаг давталт, схем биш. Доорх алхам тус бүр cockpit доторх нэг товчлууртай тохирдог.

Давталтыг алхам алхмаар үзэх

Ижил зургаан алхам, нэг нэгээр нь, тус бүр дээр гар болон dataset-д юу болдгийн хамт.

01

Policy-г ажиллуулж, бичлэг хий

Өөрийн сургасан checkpoint дээр inference ажиллуулалт эхлүүл. Уг ажиллуулалт болж байх зуур, өөрийнх нь даалгаврын текстийн хамт бичигддэг тул frame-үүд нь зөвхөн үзэх боломжтой видео биш, дараа нь сургалтын өгөгдөл болгон ашиглах боломжтой болно.

1 / 6

Платформ таны ачааг юугаар хөнгөвчилдөг вэ

Энд байгаа зүйл бүр бол та өөрөө байгуулж, арчлах байсан давталтын алхам юм.

Leader гаргүйгээр удирдлага авах

Ажиллуулалт эхлэхэд гар товчлуур эсвэл слайдер оролтыг сонговол зөвхөн laptop-оор засварлах боломжтой. Гар товчлуурын түлхэлтийг server тал дээр үе тутамд хоёр градус, gripper дээр дөрвөн градусаар хязгаарладаг; слайдерийн зорилтууд нь абсолют бөгөөд server дуудлага бүрд тэдгээр рүү хамгийн ихдээ зургаан градус хөдөлдөг. Хязгаарлалтыг UI биш server хэрэгжүүлдэг тул наалдсан товчлуур гарыг шидэж чадахгүй.

Teleoperation docs

Intervention frame бүрд тэмдэглэгддэг

Таны гар барьж байх үед бичигдсэн frame бүр intervention флагтай байдаг, action багана нь бүрэн тушаасан pose-ыг агуулдаг. Та флаг баганыг гараар арчлах, хожим нь frame индекстэй тохируулах шаардлагагүй.

LeRobot dataset формат

Ангилал: засвар, evaluation, эсвэл хогийн сав

Ажиллуулалт бүр save карт дээр нэг шийдвэр авдаг. Засварын ажиллуулалт дараагийн сургалтын раундад ордог, evaluation ажиллуулалт сургалтаас гадуур үлдэж цэвэр хэмжилт хэвээрээ байдаг, муу ажиллуулалт бол хольцыг чимээгүйхэн муутгах оронд арилдаг.

Sessions ба episode-ууд

Хольцоо тодорхой бүрдүүлэх

n дэх раундын сургалтын багцыг та өөрөө бүрдүүлнэ: анхны dataset дээр засваруудыг нэмж, эх сурвалж тус бүрээс episode сонгоно. Автомат холилт байхгүй, нуугдмал simulation өгөгдөл байхгүй, бүрдүүлсэн үр дүн бол бусад ямар ч dataset шиг ажилладаг.

Dataset-ууд

Checkpoint-оос үргэлжлүүлэх

Сургалтын ажиллуулалтыг base model биш, дөнгөж жолоодсон checkpoint луу чиглүүл, ингэснээр раунд бүр өмнөх нь дуусан газраас эхэлнэ. Зөвхөн жингүүдийг л initialize хийдэг; optimizer төлөв сэргээгддэггүй, тиймээс эхний раундыг боломжийн шалгалт гэж авч үзэх нь зүйтэй.

Training

Раунд тутам GPU түрээслэх

ACT, SmolVLA нь 4090 дээр, Pi0 болон GR00T N1.5 эсвэл N1.7 нь 80 GB-тай A100 дээр ажилладаг. Раунд эхлүүлэхэд pod асаж, checkpoint-ууд таны bucket-д ирж, раундад зарцуулсан цагаар нь л төлбөр төлдөг.

GPU-ийн үнэ

Раундуудаа төлөвлө

Intervention хувь бол давталтын явцын метрик: засварласан frame-үүдийг ажиллуулалтын нийт frame-д харьцуулсан харьцаа. Эхлэх цэгээ болон раунд бүр хэр их сайжруулалт өгөхийг тохируулаад, зорьсон түвшинд хүрэхэд хэдэн раунд хэрэгтэйг харна уу.

30 %
25 %
3 000
РаундIntervention хувьЗасварласан frame
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

Энэ бол загвар, урьдчилсан таамаг биш. Бодит раундууд жигд бус явдаг, харин хувийг хөдөлгөөгүй раунд юу ч өгөөгүй хэрэг; яг энэ дохиог л ажиглах хэрэгтэй.

Давталтыг өөрөө байгуулах эсвэл эндээс ажиллуулах

Үүнийг гараар хийхэд боломжгүй зүйл гэж юу ч алга. Асуудал нь хэдэн орой раунд дээр биш дэд бүтэц дээр зарцуулагдах вэ гэдэгт байгаа бөгөөд нэг мөрөнд гараар хийх нь тодорхой илүү сайн хариулт байдаг.

Давталтын алхамГараар байгуулахAY-Robots дээр
Ажиллуулалтын дунд удирдлага авахLeader гар, эсвэл servo bus дээрх өөрийн код. Гар товчлуур, слайдерийн удирдлага авах, аюулгүй хязгаар зэргийг та өөрөө бичиж, бодит hardware дээр debug хийнэ.Ажиллуулалт эхлэхэд сонгосон leader гар, гар товчлуур, эсвэл слайдер. Өнцгийн хязгаарлалт server дотор байрладаг.
Intervention тэмдэглэхТа флаг баганыг өөрөө нэмж, frame индекстэй тохируулж, бичлэгийн формат өөрчлөгдөх бүрд дахин шалгана.Удирдлага авсан үеийн frame бүр автоматаар тэмдэглэгддэг, action баганад тушаасан pose нь бий.
Ажиллуулалтуудыг эрэмбэлэхХавтасны конвенц болон shell script. Шилжилтийн эргэн тойрны хөлдсөн frame-үүдийг та өөрөө олж, шүүж хаях хэрэгтэй.Save карт дээр ажиллуулалт тутамд нэг шийдвэр. Шилжилтийн frame-үүд raw хавтаст үлддэг.
Холимог dataset байгуулахФормат хувилбар тус бүрд зориулсан merge script. Episode индекс, metadata, видео холбоосуудыг тохирч байлгах нь уйтгартай ажил.Анхны dataset дээр засваруудыг эх сурвалж тус бүрээс episode сонгож нэмнэ; үр дүн нь ердийн dataset.
Дараагийн раундыг сүүлийн policy-гоос эхлүүлэхТа checkpoint-ыг trainer руу өөрөө холбож, жинхэнэ үргэлжлүүлэлт хүсвэл optimizer төлвийг ч сэргээж болно.Base checkpoint-д зориулсан нэг талбар. Зөвхөн жингүүд: checkpoint-оос initialize хийдэг, optimizer-ийг үргэлжлүүлдэггүй.
Сургалтын давталт дээрх хяналтБүрэн. Өөрийн loss, өөрийн хуваарь, өөрийн ablation, өөрийн instrumentation, зам дунд ямар ч платформ саад болохгүй. Хэрэв судалгааны асуулт нь яг сургалтын давталт өөрөө байвал гараар хий.Тогтмол зам, тогтоосон policy-гийн жагсаалт, форм дээр гарган өгсөн hyperparameter-ууд, дурын код биш.

Энэ юун дээр суурилсан бэ

Давталттай маргахаасаа өмнө эдгээрийг унш. Холбоос бүр abstract хуудас руу очдог, төлбөртэй хаалт руу биш.

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    DAgger-ийн эх бүтээл: алдааны хуримтралын асуудлыг томьёолж, цэвэр хяналттай аргад зориулсан T-квадрат хязгаарыг гаргаж, сурагч өөрөө очсон төлвүүдээс өгөгдөл нэгтгэхийг санал болгодог.

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    Хүн-хаалттай хувилбар: policy-ийн сонгосон төлвүүдийн талаар асуулга авахын оронд, эксперт өөрөө хэзээ удирдлагаа авахаа шийддэг; яг энэ горимыг платформ хэрэгжүүлдэг.

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    Интервенцийг хаах өөр арга: сурагч ганцаараа ажиллаж болох эсэхийг ensemble-ийн санал зөрөлдөөнөөр итгэлийн дохио болгон ашиглах. Хүнээр шийдүүлэхтэй харьцуулах сонирхолтой жишээ.

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    Хүний анхаарлыг хомс нөөц гэж үзэж, зөвхөн шинэлэг эсвэл эрсдэлтэй төлвүүдэд тусламж хүсдэг; нэг хүн бүх өдрийн турш гарыг хянадаг тохиолдолд яг зөв хандлага.

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    Шударга өөр хувилбар: policy-г online засварлахын оронд, эксперт сэргэн засрахыг үзүүлэхийн тулд демонстрацуудыг эвдэж (perturb) өгдөг. Интервенц рүү орохоосоо өмнө мэдэж байх нь зүйтэй.

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    Салбарын газрын зураг: хүний feedback-ийн ямар хэлбэрүүд байдаг, тэдгээрийг ямар interface дамжуулдаг, DAgger маягийн интервенц тэдгээрийн дунд хаана оршдог.

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    ACT-ийн бүтээл. Action chunking яг тэр шалтгаанаар л хямд гар дуурайлган policy-гоор жолоодогдох боломжтой болдог, мөн ACT бол DAgger раундыг хамгийн хурдан давтах боломжтой policy юм.

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    Урьдчилан сургасан vision-language загвар дээр суурилсан flow-matching VLA, мөн эндээс fine-tune хийж болох checkpoint-уудын нэг; бүтээл нь шинэ ур чадвар зөвхөн base model-оос биш, fine-tuning-аас гардаг гэдгийг тодорхой хэлдэг.

Хүмүүсийн бодитоор асуудаг асуултууд

DAgger хийхэд leader гар хэрэгтэй юу?

Үгүй. Ажиллуулалт эхлэхэд гар товчлуур эсвэл слайдер оролтыг сонгоход удирдлага авах нь эхний frame-ээс л гараар, browser-оос удирдагдана. Leader гар нарийн хөдөлгөөнд илүү тохиромжтой бөгөөд удирдлага шилжүүлэхээсээ өмнө гар өөрийгөө тохируулдаг цорын ганц горим, гэхдээ давталт үүнгүйгээр ч ажилладаг.

Хэдэн DAgger раунд хэрэгтэй вэ?

Шударга тогтмол тоо гэж байхгүй. Intervention хувийг ажигла: раунд дараалан буурахгүй бол тэр раунд юу ч өгөөгүй хэрэг, ихэвчлэн асуудал раундын тоонд биш, харин даалгаврын тохиргоо, камер, эсвэл анхны dataset-д байдаг.

Энэ жинхэнэ DAgger мөн үү, эсвэл сул хувилбар уу?

Энэ бол HG-DAgger, хүн-хаалттай хувилбар. Сонгодог DAgger нь policy-ийн сонгосон төлвүүдийн талаар, тэр дундаа ямар ч эрүүл ухаантай оператор бодит гарыг хүргэхгүй байх төлвүүдийн талаар ч эксперт асуулга авдаг. Энд хүн хэзээ оролцохоо шийддэг бөгөөд зөвхөн тэр хэсгүүд л label болдог.

Зөвхөн засваруудаар л сургах уу?

Үгүй, тийм хийх ч ёсгүй. Зөвхөн засваруудаар сургавал зөвхөн сэргэж засрахаа мэддэг policy гарна. Бүрдүүлсэн dataset бол анхны өгөгдөл дээр засваруудыг нэмсэн, эх сурвалж тус бүрээс episode-ийг тодорхой сонгосон зүйл юм.

Checkpoint-оос үргэлжлүүлэх нь сургалтын ажиллуулалтыг үнэхээр үргэлжлүүлдэг үү?

Энэ нь жингүүдийг тухайн checkpoint-оос initialize хийдэг. Optimizer төлөв сэргэдэггүй тул нарийн утгаараа үргэлжлүүлэлт биш. Практикт сурсан зан төлөвийг раунд даяар зөөдөг зүйл нь яг л жингүүд, гэхдээ та аль нэгийг нь авч байгаагаа мэдэж байх хэрэгтэй.

Intervention хувь яаж тооцогддог вэ?

Intervention гэж тэмдэглэгдсэн frame-үүдийг ажиллуулалтын нийт frame-д харьцуулна. Энэ нь takeover статус дээр харагддаг бөгөөд раунд бүрийн хувьд, жолоодсон checkpoint, сургасан хольцын хамт тэмдэглэж байх ёстой цорын ганц тоо юм.

Ямар policy-нуудтай энэ давталтыг ажиллуулж болох вэ?

ACT, SmolVLA, Pi0, мөн GR00T N1.5 эсвэл N1.7. Давталт өөрөө зөвхөн dataset болон checkpoint үүсгэдэг тул policy-с хамаардаггүй; практик ялгаа нь раунд хэр удах, ямар GPU шаардлагатай вэ гэдэгт л байна.

Робот эзэмшихгүйгээр үүнийг хийж болох уу?

Marketplace дээр dataset худалдан авах, эсвэл оператор хөлслөх замаар роботгүйгээр бичлэг хийж, сургаж болно, мөн live хуудсан дээр browser-оор бодит SO-100 гарыг жолоодож болно. DAgger раунд бол өөр: ажиллуулалтын дунд удирдлага авч болох гар хэрэгтэй, тиймээс давталт өөрийг нь хийхийн тулд hardware өөрийн ширээн дээр байх шаардлагатай.

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

Энэ долоо хоногт эхний раундаа хий

Client-аа суулгаад, аль хэдийн байгаа checkpoint-оо жолоодоод, гар шоог алгасах анхны удаад удирдлагыг гараар ав. Энэ ганц ажиллуулалт бол жижигрүүлсэн DAgger раунд юм: үүнээс хойшхи бүх зүйл бол хольц бүрдүүлэх, GPU цагийн төлбөр төлөх л үлдэнэ.