Телеудирдлагын интерфэйсээр робот гарыг хянаж буй оператор, гар нь удирдлагын хэрэгсэл дээр, хяналтыг авахад бэлэн байгаа нь
DAggerИнтерактив дуурайлган сургалтHG-DAggerРобот бодлогуудSO-100

HG-DAgger ба хаалттай хувилбарууд: Робот бодлогын хяналтыг хэн, хэзээ авах вэ

AY-Robots ResearchAugust 27, 2026Уншихад 15 минут

Энгийн DAgger нь робот өөрөө хөдөлж байх зуур хүнээс төлөв бүрд шошго өгөхийг шаарддаг. Бодит тоног төхөөрөмж дээр энэ нь аюулгүй бус бөгөөд чанар муутай шошго үүсгэдэг. Хаалттай хувилбарууд хараагүй шошголтыг хэн нэгний барих ёстой хаалтаар сольдог: HG-DAgger дээр хүн, SafeDAgger дээр аюулгүй байдлын ангилагч, EnsembleDAgger дээр ансамблийн санал зөрөлдөөн, ThriftyDAgger дээр төсөвлөгдсөн шинэлэг байдал-эрсдэлийн үнэлгээ. Энэ өгүүлэлд эдгээрийг хаалтыг хэн эзэмшдэг, ямар дохио үүнийг нээдэг, тус бүр нь ямар үнэ цэнэ шаарддаг гэдгээр нь харьцуулж, хүнээр хаалттай хэлбэр яагаад бодит робот гар дээр амьд үлддэгийг тайлбарлана.

Дуурайлган хуулбарласан бодлого нь сургалтын өгөгдөл нь дуусч байсан газраа бүтэлгүйтдэг. Үүнийг засах арга нь өгөгдлийг үзүүлэгчийн бус бодлого өөрийнх нь төлвийн тархалтын дор цуглуулсаар байх явдал бөгөөд энэ нь яг DAgger-ийн хийдэг зүйл юм, мөн энэ талаар өгөгдлийн санг нэгтгэх аргын танилцуулга нь эхлэлийн зарчмуудаас нь эхлэн авч үздэг. Гэхдээ энэ нь анхны алгоритмын эвгүй хэсгийг нээлттэй үлдээдэг: сурагч бодлого удирдаж байх зуур, мэргэжилтэн хяналтгүй байхдаа төлөв бүрд өөрөө яаж хийх байсныг хэлэх ёстой.

Скрипт бичсэн мэргэжилтэнтэй симулятор дотор энэ нь үнэ төлбөргүй. Бодит гартай ширээн дээр энэ нь үнэ төлбөргүй ч биш, аюулгүй ч биш. HG-DAgger-ийн зохиогчид энэ эсэргүүцлийг нарийн тодорхойлдог: ийм түүврийн схемүүд нь "мэргэжилтнийг системийг бүрэн хянахгүйгээр үйлдлийн шошго өгөхийг шаарддаг" бөгөөд энэ нь "аюулгүй байдлыг бууруулж, хүнийг мэргэжилтнээр ашиглах үед мэдрэгдэх ажиллагуурын хоцролтын улмаас цуглуулсан шошгын чанарыг доройтуулах магадлалтай" (Kelly et al., 2019). Энэ өгүүлбэрт хоёр алдаа далд байна: бодлого нь хэний ч хүсээгүй төлөврүү үргэлжлүүлэн орсоор байдаг, мөн энэ эрсдэлээр олж авсан шошгууд нь хүн удирдлагыг барьж байхдаа гаргасан шошгуудаас муу байдаг. Доорх хувилбар бүр яг ижил асуултад хариулдаг — удирдлага дээр хаалт тавьж, хэзээ нээгдэхийг хэн нэгэнд шийдүүлэх. Тэдний ялгаа нь тэр хэн нэгэн нь хэн болохоор л ялгаатай.

Товч хувилбар

  • Хаалттай хувилбарууд хараагүй шошголтыг бодлогын хяналт ба мэргэжилтний хяналтын хоорондох сэлгүүрээр сольдог. Тэднийг ялгаж буй зүйл бол сэлгүүрийг хэн эзэмшдэг вэ гэдэг.
  • HG-DAgger сэлгүүрийг хүнд өгч, зөвхөн хүн тасралтгүй хяналттай байх үед бичигдсэн өгөгдлийг л нэгтгэдэг.
  • SafeDAgger үүнийг лавлагаа бодлогоос хазайлтыг таамаглагч хоёртын ангилагчид өгдөг; EnsembleDAgger ансамблийн бага зөрүү болон мэргэжилтний үйлдэлтэй бага зайг нэгэн зэрэг шаарддаг.
  • LazyDAgger нь удирдлага цохилуулахгүй байхын тулд гистерезис нэмдэг; ThriftyDAgger нь тодорхой интервенцийн төсвийн дор шинэлэг байдал эсвэл тооцоолсон эрсдэлээр хаалтаа тавьдаг.
  • Роботоор хаалттай дохионуудад сонирхогчийн зэрэглэлийн гар дээрх нарийн тохируулсан VLA-д ихэвчлэн дутдаг зүйл хэрэгтэй: лавлагаа бодлого, хямд ансамбль, эсвэл тохируулагдсан эпистемик тодорхойгүй байдал.
  • Хаалт бол аргын тал хувь юм. Интервенцийн сегментүүдэд дараа нь юу тохиолдох нь — холих, жинлэх, нэгтгэх — тухайн раунд ямар нэг зүйлийг сайжруулсан эсэхийг шийддэг.

Хүнээр хаалттай ба роботоор хаалттай: чухал ялгаа

Интерактив дуурайлган сургалт өөрийн гэсэн судалгааны тоймтой; Celemin болон хамтран зохиогчид үүнийг санал хүсэлтийн төрөл, интерфэйс, сургалтын загвар, хэрэглэгчийн туршлага, хэрэглээ, эталон гэсэн тэнхлэгүүдээр каталогжуулдаг. Таны инженерчлэлийг шийддэг ялгаа нь эдгээр тэнхлэгүүдийн алинаас нь ч илүү энгийн бөгөөд сүүлийн үеийн ажлууд үүнийг шууд нэрлэдэг: хүнээр хаалттай гэдэг нь хянагч хэзээ хөндлөнгөөс оролцохоо шийддэг арга, роботоор хаалттай гэдэг нь агент хэзээ тусламж хүсэхээ шийддэг арга (Cai et al., 2025). Бусад бүх зүйл нь эдгээр хоёр сонголтын аль нэгэнд үйлчилдэг механизм юм. Худалдаа эхнээсээ л харагдаж байна: хүний хаалт тасралтгүй анхаарал шаарддаг бол робот хаалт тэр анхаарлыг буцааж өгнө гэж амладаг — гэхдээ зөвхөн хаалт нь суурилдаг дохио нь итгэмжлэгдэхүйц байх нөхцөлд л, тэр дохиог бий болгох нь өөрөө судалгааны асуудал юм.

SafeDAgger: өөрийн хазайлтыг таамаглагч ангилагч

Zhang, Cho нарын SafeDAgger (2016) нь эдгээр хаалтуудын хамгийн эртнийх юм. Лавлагаа бодлогоос лавлах нь өртөгтэй хэсэг тул хоёр дахь, жижиг сүлжээ — аюулгүй байдлын бодлого — лавлах нь ерөнхийдөө үнэ цэнэтэй эсэхийг таамаглана. Энэ нь "үндсэн бодлого лавлахгүйгээр лавлагаа бодлогоос хазайх магадлалтай эсэхийг заасан хоёртын шошго буцаадаг". Шошгыг хоёр бодлогын үйлдлүүдийн хоорондох квадрат L2 хазайлтыг tau гэсэн босго утгатай харьцуулан тодорхойлдог бөгөөд ангилагчийг хоёртын кросс-энтропиор тохируулдаг. Ажиллах үедээ энэ нь сурагч жолоодоод байх уу, эсвэл лавлагаа хяналтыг авах уу гэдгийг төлөв бүрээр шийддэг. Хураангуйд машины уралдааны симуляторт лавлагаанд хандах тоо цөөрсөн, мөн зохиогчид автоматжуулсан хичээлийн хөтөлбөрийн нөлөөнд холбож буй нэгдлийн хурд нэмэгдсэн гэж мэдээлсэн боловч аль алинд нь тоон үзүүлэлт өгөөгүй.

Гол бэрхшээл нь үр дүнд бус, тодорхойлолтод байна. Ангилагчийг сургахын тулд түүнийг тохируулахад ашигласан төлөв бүр дээр лавлагаа бодлогын үйлдэл хэрэгтэй бөгөөд энэ нь лавлагаа нь өөр нэгэн программ гэдгийг таамаглаж байна. Хэрэв таны лавлагаа нь leader гартай хүн бол тэр шошгын багц хямд биш бөгөөд арга нь өөрийн зорилтот шинж чанараа алддаг.

EnsembleDAgger: эргэлзээ ба зөрүү — хоёул

Menda, Driggs-Campbell, Kochenderfer нар (2019) хаалтыг магадлалын асуулт гэж үздэг. EnsembleDAgger "мэдрэлийн сүлжээнүүдийн ансамблийг ашиглан Гауссын процессыг ойролцоолдог" бөгөөд ансамблийн зөрүүг итгэлцлийн орлуулагч гэж тайлбарладаг: өндөр зөрүү нь сургалтын өгөгдлөөс ялгаатай бүс гэсэн үг бөгөөд — мэргэжилтэн бүтэлгүйтлийн төлвөөс зайлсхийдэг гэж үзвэл — энэ нь бүтэлгүйтэлд ойрхон байхтай хамааралтай. Дүрэм нь нэгэн зэрэг биелэх нөхцөл юм. Сурагч зөвхөн дундаж үйлдэл нь мэргэжилтний үйлдэлтэй харьцуулсан L2 зай нэг босгоос (зөрүү) бага байх үед л мөн таамагласан үйлдлийнхээ зөрүү хоёр дахь босгоос (эргэлзээ) бага байх үед л үйлдэл хийж болно. Аль нэг нь биелэхгүй бол мэргэжилтэн хяналтыг авна. Зорилго нь бүтэлгүйтлийн магадлалыг хязгаарлахын зэрэгцээ сурагчийн үйлдлийн эзлэх хувийг хамгийн ихээр нэмэгдүүлэх явдал юм; өгүүлэлд эргүүлсэн дүлий (inverted pendulum) болон MuJoCo HalfCheetah дээр бусад DAgger хувилбаруудтай харьцуулахад аюулгүй байдал болон сургалт сайжирсан гэж мэдээлсэн байна.

Зөрүүгийн гишүүн нь мэргэжилтний үйлдлийг шаарддаг

Энэ нь бүрэн дүрмийг гар хөндлөнгийн оролцоогүй хяналтад ашиглах боломжийг чимээгүйхэн үгүйсгэдэг. Сурагчийн үйлдэл ба мэргэжилтний үйлдлийн хоорондох зай нь тухайн төлөв, тухайн мөчид мэргэжилтний үйлдлийг шаарддаг. Скрипт бичсэн мэргэжилтэнтэй бол сайн. Хүнтэй бол хүн тасралтгүй үйлдэл гаргаж байх ёстой — энэ нь яг л хаалттай хувилбаруудын арилгах гэж байсан ачаалал юм. Ганцаараа авч үзвэл эргэлзээний гишүүн нь гар хөндлөнгийн оролцоогүй; харин нэгэн зэрэг биелэх нөхцөл тийм биш.

LazyDAgger: сэлгүүрийг чичрэхээс нь зогсоох

Hoque болон хамтран зохиогчид (2021) өмнөх өгүүллүүд хэмжиж үзээгүй нэгэн зардлыг — сэлгүүр өөрийг нь — авч үзсэн. Интервенц бүр "хүний хийж буй бусад ажлыг тасалдуулж, хянагч ба автономит удирдлагын хооронд шилжих бүрд саатал үүсгэж, гүйцэтгэхэд цаг хугацаа шаарддаг". Минутанд арван удаа нээгдэж хаагддаг хаалт нь ижил автономит хувьтай үед арван секундэд нэг удаа нээгддэг хаалтаас муу байдаг. LazyDAgger нь SafeDAgger-ийг тэгш бус босго утгаар — хянагчийн удирдлагад орохоос илүү түүнд үлдэх амархан байхаар — өргөтгөж, ингэснээр систем хилийн ойролцоо савладаггүй. Симуляцид энэ нь "3 тасралтгүй удирдлагын даалгавар дээр SafeDAgger-тэй харьцуулахад дундажаар 60% -иар контекст сэлгэлтийг бууруулж, шилдэг түвшний бодлогын гүйцэтгэлийг хадгалж чадна"; ABB YuMi-тай даавуу боловсруулах ажилд "гүйцэтгэлийн үед SafeDAgger-ээс 60% өндөр амжилтын хувь гаргахын зэрэгцээ контекст сэлгэлтийг 60% -иар бууруулдаг".

ThriftyDAgger: төсвийн дор шинэлэг байдал эсвэл эрсдэл

ThriftyDAgger (Hoque et al., CoRL 2021) нь бодлогоос биш харин хянагчийн төсвөөс эхэлдэг. Энэ нь эрсдэлийг тооцоолох шинэ хэмжигдэхүүнтэйгээр "робот бодлого дуурайх лавлагаа зан үйлгүй хангалттай (1) шинэлэг, эсвэл робот даалгавраа биелүүлэхэд итгэлцэл багатай хангалттай (2) эрсдэлтэй төлвүүдэд л интервенц хийхийг санал болгохын тулд сурсан сэлгэх бодлогыг ашигладаг". Төсөв нь үр дүн биш, оролт юм: та хэр их хүний цаг зарцуулахаа заана. Гүйцэтгэх үед хэрэглэхэд арга нь "симуляц болон бодит даалгавар хоёуланд нь 100% амжилтын хувь гаргадаг", мөн гурван роботын бүлгийг нэгэн зэрэг анхаарал шаардсан даалгавартай зэрэгцүүлэн удирдсан арван оролцогчтой хэрэглэгчийн судалгаагаар энэ нь "хянагчийн ачааллыг бууруулахын зэрэгцээ хүн болон роботын гүйцэтгэлийг дараагийн шилдэг алгоритмтой харьцуулахад тус тус 58%, 80%-иар нэмэгдүүлдэг" гэж мэдээлсэн байна. Бүлгийн тохиргоо бол энэ ажлын жам ёсны орчин юм; Fleet-DAgger хожим олон робот, олон хянагчтай интерактив бүлгийн сургалтыг албажуулж, оновчлох хэмжигдэхүүн болгож Хүний Хүчин Чармайлтын Өгөөжийг санал болгосон.

HG-DAgger: хаалтыг хүн барьдаг

Kelly et al. (2019) эсрэг замаар явдаг. Энд ямар ч сэлгэх бодлого байхгүй. Сурагчийг "мэргэжилтэн эхлэгч төлвийн орон зайн аюулгүй бус бүсэд орсныг ажиглах хүртэл" ажиллуулдаг бөгөөд тэр үед мэргэжилтэн хяналтыг авч, системийг буцаан удирддаг. Нэгтгэх дүрэм нь хатуу хэсэг юм: "Мэргэжилтний үйлдлийн шошго нь зөвхөн эдгээр сэргээх траекторийн үед, өөрөөр хэлбэл хүн мэргэжилтэн системийг тасралтгүй хянаж байх үед л цуглуулагдаж, өгөгдлийн санд нэмэгддэг." Хүн зөвхөн ажиглагч байх зуур юуг ч шошголдоггүй.

Энэ нь сэлгүүрээр зогсдоггүй. HG-DAgger мөн "төлөвийн орон зайн янз бүрийн бүс дэх бүрэн сургагдсан эхлэгчийн гүйцэтгэлийг таамаглахад ашиглаж болох загварын тодорхойгүй байдалд суурилсан эрсдэлийн хэмжигдэхүүний аюулгүй байдлын босгыг сурдаг": энэ нь хүн интервенц хийсэн мөчүүдэд сурагч хэр тодорхойгүй байсныг бүртгэж, эдгээр бичлэгийн сүүлийн дөрөвний нэгийг дунджаар бодож, тэнд сурагч эцсийн хэлбэртээ хамгийн ойр байдаг. Энэ нь робот ажиллуулдаг хаалт биш, харин дуусгасан бодлого хаана хадгалагдана гэж хүлээгдэж байгааг хэлж буй оношилгоо юм. Үнэлгээ нь симуляцчилсан болон бодит ертөнцийн жолоодлогын даалгаврыг хамардаг бөгөөд DAgger болон behavior cloning хоёуланг нь давсан гүйцэтгэл гаргасан гэж мэдээлсэн байна.

Нэгэн холбоотой чиглэл нь юуг шошго гэж тооцохыг өөрчилдөг. Spencer болон хамтран зохиогчдын Мэргэжилтний Интервенцийн Сургалт (Expert Intervention Learning) нь "мэргэжилтний ямар ч хэмжээний санал хүсэлт — интервенц эсвэл интервенц хийгээгүй байдал ч бай — одоогийн төлвийн чанар, үйлдлийн оновчтой байдал, эсвэл хоёуланых нь талаар мэдээлэл өгдөг" гэж үздэг бөгөөд үүнийг сурагчийн үнэ цэнийн функц дээрх хязгаарлалт болгон албажуулж, харамсалгүй (no-regret) онлайн сургалтаар шийддэг. Ийм тайлбарын дагуу хүн ажиглаад юу ч хийгээгүй хэсгүүд нь хоосон бус, харин сул эерэг нотолгоо болдог. EIL нь мөргөлдөөнөөс зайлсхийхийг ойролцоогоор нэг минутын мэргэжилтний удирдлагаас сурдаг.

Хянагдсан бодлогын ажиллагааны үед өгөгдөл цуглуулах зориулалттай камерууд байрлуулсан робот гарын ажлын орон зай
Хүнээр хаалттай раунд бол бичлэгийн төхөөрөмж залгасан энгийн inference ажиллагаа юм. Оператор өөрөө удирдсан кадрууд тэмдэглэгддэг; үлдсэн нь хэвээрээ үлддэг.

Хувилбаруудыг зэрэгцүүлэн харах

АргаХаалтыг хэн нээдэгДохиоШаардлагатай нөөцМэдээлсэн үр дүн
DAgger (Ross et al., 2011)Хэн ч биш — сурагч үргэлж удирддагБайхгүй; мэргэжилтэн зочилсон төлөв бүрийг шошгодогХяналтгүй байхдаа off-policy төлвүүдийг шошголж чадах мэргэжилтэнСурагчийн төлвийн тархалтын дор баталгаатай харамсалгүй (no-regret) бууралт
HG-DAgger (Kelly et al., 2019)Хүн хянагчТөлөв аюултай гэсэн хянагчийн дүгнэлтАжиглаж буй хэн нэгэн, мөн удирдлагын цэвэр шилжүүлэлтСимуляцчилсан болон бодит жолоодлогын даалгавар дээр DAgger болон behavior cloning-ыг давдаг; мөн эрсдэлийн босго утгыг сурдаг
SafeDAgger (Zhang & Cho, 2016)РоботЛавлагаанаас tau-с дээш L2 хазайлтыг илрүүлэх хоёртын ангилагчАнгилагчийн шошгонд зориулсан лавлах боломжтой лавлагаа бодлогоУралдааны симуляторт лавлагаанд хандах тоо цөөрсөн, нэгдэл хурдассан (тоон үзүүлэлт өгөөгүй)
EnsembleDAgger (Menda et al., 2019)РоботАнсамблийн зөрүү болон мэргэжилтний үйлдэлтэй зай — хоёул босгоос доогуурСүлжээнүүдийн ансамбль, нэмж алхам бүрд мэргэжилтний үйлдэлДүлий (pendulum) болон HalfCheetah дээр сайжирсан аюулгүй байдал ба сургалт
LazyDAgger (Hoque et al., 2021)Робот, гистерезистэйSafeDAgger-ийн дохио, орох болон гарах тусдаа босго утгатайSafeDAgger-т хэрэгтэй бүхэн, нэмж тохируулах хоёр дахь босго утга3 даалгавар дээр ~60% бага контекст сэлгэлт; YuMi даавуун ажилд 60% өндөр амжилт
ThriftyDAgger (Hoque et al., 2021)Робот, төсвийн дорШинэлэг байдал, эсвэл даалгаврыг гүйцэтгэхгүй байх тооцоолсон эрсдэлСурсан эрсдэлийн үнэлгээ ба тодорхойлсон интервенцийн төсөвГүйцэтгэлийн үед 100% амжилт; хэрэглэгчийн судалгаа (N=10): дараагийн шилдгээс 58%, 80%-иар давуу
EIL (Spencer et al., 2020)Хүн — интервенц хийгээгүй байдал ч тооцогддогИнтервенц ба түүний үгүйлэгдэл нь үнэ цэнийн функц дээрх хязгаарлалт болноҮнэ цэнийн хязгаарлалт дээрх онлайн харамсалгүй сургалтОйролцоогоор нэг минутын мэргэжилтний удирдлагаас мөргөлдөөнөөс зайлсхийхийг сурсан

Хаалт бүр юу авчирдаг, түүний хариуд юу шаарддаг

"Шаардлагатай нөөц" баганыг доош нь уншвал нэгэн загвар илэрдэг: роботоор хаалттай дохио бүр бол зохиомлоор бүтээх ёстой орлуулагч бөгөөд орлуулагч бүр өөрийн гэсэн үнэ төлбөртэй.

  • Зөрүүний дохио (SafeDAgger, LazyDAgger, EnsembleDAgger-ийн дүрмийн тал хувь) лавлагаа бодлогыг шаарддаг. Аль эсвэл танд скрипт бичсэн мэргэжилтэн байгаа бөгөөд энэ тохиолдолд сонирхолтой асуудал аль хэдийн шийдэгдсэн байна, эсвэл хүн зайг тооцоолж болохоор ард талд нь тасралтгүй үйлдэл гаргасаар байх ёстой.
  • Эргэлзээний дохио тохируулагдсан эпистемик тодорхойгүй байдлыг шаарддаг. Жижиг удирдлагын сүлжээнүүдийн ансамбль үүнийг ойролцоолж чаддаг; харин гурван тэрбум параметртэй vision-language-action загварын ансамбль нь эхлээд санах ой болон саатлын асуудал болдог.
  • Шинэлэг байдал ба эрсдэлийн дохио нь хангалттай амжилттай болон бүтэлгүйтсэн ажиллагаан дээр тохируулсан, даалгавар дуусгах чадварыг сурсан үнэлгээ шаарддаг. Та ажиллуулах гэж яг зүтгэж байгаа даалгавар дээр эхний раундад тийм өгөгдөл байдаггүй.
  • Хүний хаалтад анхаарал л хэрэгтэй, өөр юу ч биш — энэ нь ямар ч бодлогын архитектур дээр, нэмэлт загвар сургахгүйгээр эхний өдрөөс л боломжтой цорын ганц дохио юм.
  • Ямар ч робот хаалт хүнийг өрөөнөөс зайлуулдаггүй. Тэдгээр нь хүн байгаа эсэхийг биш, хэр олон удаа үйлдэл хийх ёстойг л багасгадаг.

Хаалт юу үүсгэдэг талаар илүү нам гүм ялгаа бий. Траекторийн дунд идэвхжсэн робот хаалт нь хүнд дурын байрлал дахь хөдөлж буй гарыг гардуулдаг. Хүний хаалт нь операторт мөчийг өөрөө сонгох боломж олгодог — хүрч очсоны дараа, барихаас өмнө, савлалтын дундаас биш. Хоёулангийнх нь сэргээх сегментүүд адилхан цэвэр байдаггүй бөгөөд эдгээр сегментүүд бол раундын бүхий л бүтээгдэхүүн юм.

Бодит тоног төхөөрөмж дээр хүнээр хаалттай хэлбэр яагаад давуу байдаг вэ

Энэ бол эталон судалгааны үр дүн биш, харин инженерийн үндэслэл — бид олсон ямар ч өгүүлэл таван хаалтыг бүгдийг нь ижил манипулятор дээр ижил бодлогын ангиллаар ажиллуулаагүй байна. Энэ нь дөрвөн цэг дээр тулгуурладаг.

Нэгдүгээрт, хянагч ямар ч тохиолдолд байдаг. Хэн ч SO-100 гар-ыг унагааж болох эд зүйлсийн хажууд хянагчгүй орхидоггүй. Хэн нэгэн ажиглаж байгаа л бол түүнд хяналт авах товч өгөх нэмэлт зардал бараг тэг байдаг; харин тохируулагдсан эрсдэлийн үнэлгээг бүтээх нь нэг том төсөл юм.

Хоёрдугаарт, орчин үеийн бодлого дээр бодитоор хэмжиж болох тодорхойгүй байдал нь ихэвчлэн буруу хэмжигдэхүүн байдаг. Diffusion эсвэл flow-matching толгой нь түүвэрлэсэн үйлдлийн хэсгүүдийн (action chunks) хооронд зөрүү үүсгэдэг бөгөөд энэ зөрүү нь толгойг илэрхийлэхээр сургасан олон талт байдлыг (multimodality) харуулдаг, төлвийн талаарх эпистемик мэдэхгүй байдлыг биш. EnsembleDAgger-ийн эргэлзээний гишүүн яг сүүлийнхийг барихын тулд ансамбль ашигладаг. Эдгээр хоёр нь ижил тоо мэт харагддаг ч ийм биш; action chunking ба flow matching тухайн нийтлэлүүд эдгээр толгойнууд анхнаасаа хэрхэн үйлдэл гаргадаг тухай авч үздэг.

Гуравдугаарт, манипуляцид чухал ач холбогдолтой бүтэлгүйтлүүд нь статистикийн хувьд ер бусын байхаас илүү утга агуулгын хувьд байдаг. Барьцаагаа хоёр сантиметрийн өмнө хаадаг, эсвэл ижил хоёр шоог ялгахгүйгээр итгэлтэйгээр буруу шоо руу хүрдэг бодлого нь өндөр зөрүүтэй төлөвт байдаггүй — энэ нь итгэлтэй, гэхдээ буруу байгаа явдал юм. Ямар ч зөрүүний босго үүнийг барьж чаддаггүй; харин ажиглаж буй хүн үүнийг тэр даруй анзаардаг.

Дөрөвдүгээрт, шошгын чанар — энэ бол HG-DAgger-ийн анхны санаа бөгөөд хамгийн олон удаа алгасагддаг цэг. Хүн тасралтгүй хяналттай байхдаа цуглуулсан шошгууд нь хөдөлж буй системд дуут тайлбарладаг шошгуудаас илүү байдаг. Хэрэв зорилго нь нэгтгэхэд үнэ цэнэтэй залруулах өгөгдөл олж авах бол нотлох үүрэг нь автоматжуулсан хаалт дээр л ноогддог.

Робот хаалт хаана үнэхээр өгөөжтэй байдаг вэ

Ганц хянагч олон роботыг хариуцах үед дүр зураг эргэдэг — энэ бол ThriftyDAgger-ийн хэрэглэгчийн судалгаа болон Fleet-DAgger-ийн албажуулалт зорьж буй горим юм. Бүлэгтэй үед хүний анхаарал бол хомс нөөц бөгөөд төгс бус хуваарилалт ч огт хуваарилалтгүйгээс дээр. Нэг ширээн дээрх нэг гартай үед та энэ горимд байдаггүй.

Хүнээр хаалттай давталт — аль хэдийн бэлэн холбогдсон

Ажиллаж буй inference сессийн үеэр хяналт авах, залруулсан сегментүүд дээрх кадр бүрийн интервенцийн тэмдэг, ажиллагаа бүрийг залруулга эсвэл үнэлгээ болгон куратор хийх, өөрийн сонгосон эх сурвалжуудаас холимог өгөгдлийн сан бүрдүүлэх, одоо байгаа checkpoint-оос сургалтыг үргэлжлүүлэх зэрэг нь гараар скрипт бичихийн оронд суулгагдсан байдаг. Хяналт авалт нь leader гартай ажилладаг, эсвэл leader гар байхгүй бол гарын товчлуур болон слайдераар ажилладаг.

DAgger давталт хэрхэн ажилладгийг харах

Хаалт бол аргын тал хувь; өгөгдлийн боловсруулалт бол нөгөө тал хувь

Хаалт нь хүн аль кадрыг удирдсаныг л шийддэг, тэдгээртэй юу хийхийг биш, харин энэ хоёр дахь шийдвэр дээр раундууд хамгийн олон удаа дэмий үрэгддэг. Эхний дүрэм бол DAgger дэх D үсгийн илэрхийлдэг зүйл: нэгтгэ, бүү сольж орлуул. checkpoint-ийг зөвхөн хэдэн зуун залруулгын кадр дээр нарийн тохируулах нь танд бараг л зөвхөн сэргээлт л харсан, хэвийн траекторио мартсан загварыг өгдөг.

Хоёр дахь дүрэм бол интервенцийн кадрууд энгийн кадрууд биш гэдэг явдал юм. Mandlekar et al. нар операторуудад бодлогыг хянаж, бүтэлгүйтэл гарвал хяналт авах боломж олгодог 6 эрх чөлөөний зэрэгтэй (6-DoF) манипуляцид зориулсан алсын телеудирдлагын систем бүтээж, дараа нь "интервенцээр дамжуулан хавчаа цэгүүдийг хэрхэн давахыг сурахад бодлогыг өдөөдөг" алгоритмоор давталттайгаар сургасан; тэр өгөгдөл дээр сургагдсан агентууд ижил тооны энгийн жишээ дээр сургагдсан агентуудаас илүү гүйцэтгэл үзүүлсэн. Sirius энэ санааг бодит хэрэглээ рүү түлхэж, "ойролцоолсон хүний итгэлээр сургалтын жишээнүүдийг дахин жинлэж, жинлэсэн behavioral cloning-оор бодлогуудыг оновчлодог". Хоёулаа кадр бүрд юу нь хүнээр удирдагдсаныг заасан тэмдэг шаарддаг, тиймээс intervention тэмдэг харагдаж байгаагаас илүү чухал байдаг.

Гурав дахь дүрэм бол автомат холилт нь урхи болдог гэдэг явдал юм. Эх сурвалжийг нь жагсааж чадахгүй холимог өгөгдлийн сан бол дараагийн раунд муудахад дибаг хийж чадахгүй сан юм. Энэ платформ дээр нэгтгэх алхам яг тодорхой шалтгаанаар ил тод байдаг — анхны өгөгдлийн сан нэмэх залруулгууд, эх сурвалж тус бүрийн episode сонголт, үр дүн нь ямар ч бусад санг адил синк хийж, сурч чаддаг энгийн LeRobot өгөгдлийн сан юм; өгөгдлийн санг тайлбарласан баримт бичиг нь форматын талыг авч үздэг.

Раундын алхамЮу үүсгэдэгХамгийн түгээмэл алдаа гарах хэлбэр
Бичлэгийг асаалттай inference ажиллуулахБодлогын өөрийн төлвийн тархалтын дор ажиллагааЭнгийн телеудирдлага мэтээр бичигдэж, бодлого удирдаж байсныг алддаг
Бүтэлгүйтэл гарахад хяналт авахКадр бүрийн интервенцийн тэмдэгтэй залруулгын сегментүүдСэргээлт биш харин гаднын жижиг савааг засаж, хэв маягийг сургах
Episode бүрийг куратор хийхЗалруулга, үнэлгээ, эсвэл хаяхБүгдийг хадгалах; амжилтгүй хяналт авалт нь episode-ийн үнэ цэнээс илүү зардал шаарддаг
Залруулгуудыг синк хийхАнхныхын хажууд хувилбартай өгөгдлийн санЛокал компьютерээс хэзээ ч гарч чадаагүй залруулгууд
Холимог өгөгдлийн сан бүрдүүлэхАнхных нэмэх залруулгууд, ил тод сонголтДуугүй автомат холилт, ингэснээр хожмын доройтлыг эх сурвалж хүртэл мөшгих боломжгүй болдог
Checkpoint-оос үргэлжлүүлэхӨмнөхөөс эхлүүлсэн checkpointOptimizer үргэлжлэнэ гэж хүлээх; жингүүд загварыг эхлүүлдэг л болохоос optimizer-ийн төлвийг сэргээдэггүй

Хүн бодитоор барьж чадах хаалт тохируулах

"Хүн шийддэг" гэдэг нь тодорхойлолт биш. Өөр өөр босго утгатай хоёр оператор харьцуулшгүй раундууд гаргадаг, мөн хазайж буй босго утга уншиж болохгүй чиг хандлага гаргадаг. Эхний ажиллагаанаас өмнө өдөөгчүүдийг бичиж тэмдэглэ.

  1. Хаалтыг нээдэг нөхцлүүдийг нэрлэ — тогтмол хязгаараас илүү хазайсан ойртолт, юу ч барихгүй барьцаа хаагдах, хязгаар руу хазайж буй үений, нэг-хоёр секундээс их зогсонги байдал — мөн жагсаалтыг раундын турш өөрчлөлтгүй байлга.
  2. Юу үүнийг нээдэггүйг нэрлэ. Бодлого өөрөө сэргэдэг хэт давалт бол сургалтын дохио юм; тэнд хяналт авах нь бодлогын аль хэдийн мэддэг сэргэлтийг устгадаг.
  3. Цэвэр шилжүүлэлт хийхийн тулд хангалттай эрт хяналтыг ав, төлөв сэргэх боломжтой болмогц буцааж өг.
  4. Episode бүрд яагаад хяналт авснаа тэмдэглэ. Гурван раундын дараа энэ бол ижил бүтэлгүйтэл давтагдаж байгаа эсэхийн цорын ганц бичлэг байх болно.
  5. Камерууд, даалгаврын текст болон операторыг раундуудын турш тогтмол байлга. Аль нэгийг өөрчилбөл тоонууд харьцуулшгүй болно.

Механикийн хувьд шилжүүлэлт хоёр хувилбартай. Leader гартай үед моментийг шилжүүлэхээс өмнө leader нь follower-ийн одоогийн байрлалд хүрэх ёстой, эс тэгвээс гар үсэрдэг; энэ зэрэгцүүлэх хөдөлгөөн нь бодит тоног төхөөрөмж дээрх хэлхээний хамгийн бага туршигдсан хэсэг юм. Leader гаргүй үед хяналт авалт нь эхний товчлуураас л гараар хийгддэг: follower-ийг барьж, оператор гарын товчлуураас үе бүрээр нь жаахан хөдөлгөх, эсвэл слайдер чирдэг бөгөөд сервер талын хязгаарлалт бүх оролт бүрийг жижиг хэмжээгээр — товчлуур бүрд хэдхэн градус, слайдер шинэчлэлт бүрд цөөхөн градус — байлгадаг, учир нь барьсан байрлал руу том алхам хийх нь сервог гэмтээх шалтгаан болдог. Товчлуурын холбоос бүхий алхам алхмаар хувилбар нь SO-100 дээрх DAgger раундын алхам алхмаар заавар; хоёр телеудирдлагын горимын талаарх дэвсгэр мэдээлэл нь телеудирдлагын баримт бичигт мөн leader-follower нийтлэлд байна.

Дэмжигдсэн бодлогын архитектурууд болон тэдгээрийн сургалт, inference-ийн шинж чанаруудын харьцуулалт
Хаалт нь архитектураас хамааралгүй. Аль бодлогыг засаж байгаагаас хамаарч раундын сургалтын зардал өөрчлөгддөг, харин хяналт авалт хэрхэн ажилладаг нь өөрчлөгддөггүй.

Хаалт ямар нэг зүйл хийсэн эсэхийг уншиж дүгнэх

Хүнээр хаалттай раундын хэмжигдэхүүн бол интервенцийн хувь: интервенцийн кадрыг ажиллагааны нийт кадрт хуваасан утга. Үүнд нэг л үүрэг бий — хэрэв раундуудын турш буурахгүй бол раунд юу ч авчрахгүй, мөн дараагийн раунд өгөгдлийн хэмжээнээс өөр зүйлийг өөрчлөх ёстой.

Энэ бол хазайлттай хэмжигдэхүүн бөгөөд яагаад гэдгийг мэдэх хэрэгтэй. Энэ нь бодлогын чадварыг адилхан хэмжээгээр операторын босго утгыг хэмждэг, тиймээс өдөөгчийн жагсаалт тогтмол байх ёстой; сессийн турш сулраад ирдэг оператор ард нь юу ч байхгүй буурч буй муруй гаргадаг. Мөн энэ нь ноцтой байдлыг тооцдоггүй — мөргөлдөөнийг зогсоох арван кадр, барилтыг жаахан тохируулах арван кадр адилхан харагддаг. Үүнийг залруулгын өгөгдөл хэзээ ч татагдаж байгаагүй тогтмол үнэлгээний багцтай хослуул. DAgger давталтыг хэмжих тухай өгүүлэл нь үнэлгээний загварыг, үнэлгээний episode-үүдийг сургалтын холимжоос хэрхэн гадуур байлгах талаар багтаан авч үздэг.

Хүний хаалт — үнэнээрээ хэлэхэд
Юу өгдөг
  • Ямар ч бодлогын архитектур дээр, тохируулах нэмэлт загваргүйгээр эхний өдрөөс л ажилладаг
  • Ямар ч зөрүүний босго илрүүлдэггүй итгэлтэй боловч буруу бүтэлгүйтлүүдийг барьдаг
  • Оператор бүрэн хяналттай байхдаа, өөрийн сонгосон мөчид бичигдсэн залруулгуудыг үүсгэдэг
  • IWR, Sirius зэрэг интервенц-жинлэсэн аргуудын ашигладаг кадр бүрийн тэмдгийг өгдөг
Юу өгдөггүй
  • Тасралтгүй хяналт шаарддаг; нэг хүн олон роботтой байх тохиолдолд өргөжихгүй
  • Операторын тогтвортой байдлаас хамаарна — хазайж буй босго утга интервенцийн хувийг гэмтээдэг
  • Өөрөө ямар ч эрсдэлийн загвар үүсгэдэггүй; HG-DAgger-ийн сурсан босго утга, ThriftyDAgger-ийн үнэлгээ нь нэмэлт механизм юм
  • Үр дагаврыг биш, кадрыг тоолдог
  • Сольсон камер эсвэл буруу шошголсон даалгаврын текст мэт удирдлагаас өмнөх шаталбарт үүссэн бүтэлгүйтэлтэй бодлогыг аврах чадваргүй

Анхаарч байх ёстой нээлттэй асуултууд

Эталон судалгаанууд сул байна. Spencer болон хамтран зохиогчид дуурайлган сургалтын аргуудыг туршихад ашигладаг эдгээр эталонуудыг судалж, тэдгээрийг "хэрэгжихүйц, энгийн тул бодит ертөнцийн шийдвэр гаргах асуудлуудад ажиглагддаг алдаа хуримтлагдах илүү хэцүү горимуудыг барихад хангалтгүй" гэж дүгнэсэн — мөн эргэн тойрны судалгааны бүтээлүүдтэй харьцуулахад энгийн behavior cloning эдгээр дээр сайн үзүүлэлт гаргасныг олж мэдсэн. Энэ нь дээрх хүснэгт дэх зарим тоог оруулаад, эдгээр даалгавар дээр тулгуурласан DAgger хувилбаруудын аливаа эрэмбэлэлтэд эргэлзэх шалтгаан болдог.

Том бодлогууд дээрх робот хаалт ч мөн шийдэгдээгүй хэвээр байна. AIM ажил нь тодорхойгүй байдлыг хүний интервенцийн дүрмийг дуурайсан орлуулагч Q-функцээр сольж, ThriftyDAgger-тэй харьцуулахад хяналт авалтын зардал болон сургалтын үр ашигт 40% сайжруулалт гаргасан гэж мэдээлдэг — гэхдээ энэ нь манипулятор удирдаж буй vision-language-action загвар дээр биш, тасралтгүй ба тасалдалтай удирдлага дээр юм. Эдгээр хаалтын аль нь ч нарийн тохируулсан VLA руу дамжих эсэх нь нээлттэй асуудал хэвээр байна. Судалгааны тойм нэгэн холбоотой санааг дэвшүүлдэг: салбарын нэр томьёо, бүтэц нь судалгааны бүтээлүүдийн хооронд нэгдмэл биш тул аргуудыг харьцуулахад хэцүү болгодог. Өөрийн гар дээр таны цорын ганц нотолгоо бол таны бичсэн лог юм.

Хэрэв хүн зөвхөн интервенцийн үед л шошго өгдөг бол HG-DAgger нь бодитоор DAgger мөн үү?

Энэ нь чухал хэсгийг хадгалдаг — сурагчийн бий болгодог төлвийн тархалтын дор цуглуулсан, өмнөх өгөгдөлтэй нэгтгэсэн — мөн тоног төхөөрөмжтэй харьцахад тэсэж чаддаггүй хэсгийг хаядаг. Kelly et al. үүнийг хувилбар гэж танилцуулдаг; 2011 оны харамсалгүй (no-regret) баталгаа өөрчлөгдөлгүй шилжиж ирдэггүй.

SO-100 дээрх нарийн тохируулсан VLA бодлого дээр робот хаалт ашиглаж болох уу?

Тийм ч энгийнээр биш. SafeDAgger-ийн ангилагчид танд байхгүй лавлах боломжтой лавлагаа бодлого хэрэгтэй. EnsembleDAgger ансамбль шаарддаг бөгөөд олон тэрбум параметртэй загварын хувьд энэ нь санах ойд хэд хэдэн хуулбар нэмж тэдгээрийн inference зардлыг гэсэн үг юм. ThriftyDAgger нь таны эхний раундуудаас өмнө байхгүй амжилт, бүтэлгүйтэл дээр тохируулсан эрсдэлийн үнэлгээ шаарддаг.

Нэг удаагийн хяналт авалт хэр удаан байх ёстой вэ?

Бодлого үргэлжлүүлж чадах төлөвт хүрэхэд хангалттай, түүнээс их биш: сунжирсан хяналт авалт нь ажиллагааг жишээ үзүүлбэрийн сесс болгож хувиргаж, залруулгын багцыг хэвийн зан үйлээр дүүргэдэг. LazyDAgger-ийн олсон үр дүн ч эсрэг талаас нь харуулдаг — маш олон богино сэлгэлт өөрийн гэсэн зардалтай.

Зөвхөн залруулсан сегментүүд дээр сургах ёстой юу?

Үгүй — энэ бол раундыг дэмий үрэх хамгийн түгээмэл арга юм. Зөвхөн сэргээлт дээр нарийн тохируулсан загвар бараг зөвхөн сэргээлт л харсан байдаг. Залруулгуудыг эх сурвалжийг нь ил тод сонгож анхны өгөгдлийн сантай хол; цаашид явахын тулд хүнээр удирдагдсан кадруудыг тусгаарлахын оронд жинг нь нэмдэг IWR, Sirius зэрэг интервенц-жинлэсэн аргуудыг судал.

Раундын дараа интервенцийн хувь буурахгүй бол яах вэ?

Үүнийг шууд утгаар нь ав: раунд тус болоогүй гэсэн үг. Залруулга нэмэхийн өмнө хямд тайлбаруудыг шалга — операторын босго утга хазайсан уу, залруулгууд зөвхөн гаднын байдал нь байсан уу, бүрдүүлсэн өгөгдлийн сан тэдгээрийг бодитоор агуулсан уу, сургалт зорьсон checkpoint-оос эхэлсэн үү. Дуугүйхнээр суурь загвараас эхэлсэн раунд нь сурч чадаагүй раундтай яг адилхан харагддаг.

Интервенц хийгээгүй байдал мэдээлэл агуулдаг уу?

Мэргэжилтний Интервенцийн Сургалтын (Expert Intervention Learning) хувьд тийм: хянагч ажиглаад үйлдэл хийгээгүй хэсгүүдийг төлөв, үйлдэл хоёулаа хүлээн зөвшөөрөгдсөн гэсэн сул нотолгоо гэж уншиж, үнэ цэнийн функц дээрх хязгаарлалт болгон албажуулдаг. Энэ нэг зэрэг ихэнх практик хэрэгжилтүүд зөвхөн хүн юу удирдсаныг л тэмдэглэдэг.

Ширээн дээрх ганц гарны хувьд сонголт хийгдсэн: хаалтыг өөрөө бар, юу нээдгийг нь бичиж тэмдэглэ, мөн хүчин чармайлтаа сэлгүүрийг автоматжуулахын оронд түүний ард байгаа өгөгдлийн боловсруулалт дээр зарцуул. Платформын тал талыг DAgger давталтын хуудсанд-д тайлбарласан бол, бодлогын гэр бүл тус бүрийн сургалтын сонголтуудыг сургалт ба үнийн мэдээлэл-д багтаасан байна. Дэвсгэр мэдээллийг дуурайлган сургалт болон SO-100 дээрх дуурайлган сургалт-аас эхэл; эхний ажиллагаанд, анхны бодлогоо ажиллуул гэдэг богино зам юм.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started