
Maelezo ya hatua kwa hatua ya raundi moja ya DAgger inayodhibitiwa na binadamu kwenye mkono wa SO-100: endesha sera na uirekodi, chukua udhibiti pale tabia inapoharibika, weka rekodi hiyo kama marekebisho, unda seti ya data iliyochanganywa, kisha endelea na mafunzo kutoka kwa hatua ya ukaguzi (checkpoint). Inajumuisha njia ya kuchukua udhibiti kwa kibodi na vitelezi kwa wale wasio na mkono wa kiongozi (leader arm), pamoja na makosa manne yanayofanya raundi kuwa bure kabisa.
Sera yako inaendesha. Inanyoosha kufikia kijiwe (cube), inafunga gripper sentimita moja mapema mno, kisha inaendelea kana kwamba imekishika. Hakuna hitilafu inayoonekana, na kukazana kutazama training loss hakuelezi tatizo. Suluhisho si hatua nyingine 20 000 za gradient kwenye maonyesho (demonstrations) yaleyale. Ni kurudisha mkono wako kwenye mkono wa roboti mahususi pale inapokwenda vibaya, kurekodi ulichofanya badala yake, kisha kufunza hatua ya ukaguzi inayofuata kwa data ya zamani pamoja na marekebisho hayo. Hiyo ndiyo raundi ya DAgger, na hivi ndivyo inavyoendeshwa kwenye SO-100 kwa kutumia sera ya vision-language-action (VLA).
Nadharia iko mahali pengine: kwa nini uunganishaji wa seti za data unafanya kazi kabisa na ni nini kinachobadilika pale binadamu anapodhibiti mchakato huo. Hii ni mwongozo wa uendeshaji, na inadhania kuwa una hatua ya ukaguzi iliyofunzwa tayari, seti ya kamera inayofanya kazi, na mkono unaosogea. Hatua sita zilizo hapa chini ni mzunguko kama ulivyotekelezwa kwenye ukurasa wa DAgger wa jukwaa hili, lakini mfululizo ni uleule hata ukitumia hati zako mwenyewe.
Raundi moja kwa ufupi
- •Endesha sera iliyofunzwa na uirekodi, ukitumia maandishi ya kazi (task text) ya mwendo huo badala ya lebo ya jumla ya uendeshaji wa mbali.
- •Chukua udhibiti mara tabia inapoanza kuharibika: kupokezana kwa njia ya kioo (mirror) ukiwa na mkono wa kiongozi, au kwa njia ya moja kwa moja na ya mikono kupitia kibodi au vitelezi ikiwa huna mkono huo.
- •Chambua kila mwendo: uweke kama marekebisho, uubaki kama kipindi cha tathmini, au uutupe.
- •Unda mchanganyiko kwa mkono - maonyesho asilia pamoja na marekebisho, huku vipindi vikichaguliwa kulingana na chanzo chake. Kamwe usifunze kwa kutumia marekebisho pekee.
- •Endelea na mafunzo kutoka hatua ya ukaguzi ya mwisho, na andika ni hatua ipi ya ukaguzi iliyozalisha mchanganyiko upi.
- •Nambari inayosema kama raundi ilikuwa na thamani yoyote ni kiwango cha kuingilia kati, si training loss.
Kwa nini raundi ya pili si data zaidi tu
Behavior cloning inafunza kwa kutumia hali (states) ambazo binadamu alizipitia. Wakati wa jaribio, sera hupitia hali ambazo yenyewe imezisababisha, na makosa madogo ya vitendo hujilimbikiza na kuzalisha hali ambazo hakuna onyesho lolote lililowahi kuzifikia. Ross, Gordon na Bagnell walirasimisha kasoro hiyo kwa ajili ya AISTATS 2011 na kuijibu kwa algoriti ya kurudia inayofunza sera thabiti na ya kudhamiria (deterministic), ambayo, chini ya upunguzaji wao (reduction), ni lazima ifanye vizuri chini ya mgawanyo wa hali inaouzalisha yenyewe: endesha sera ya sasa, mtaalamu aweke lebo kwenye hali alizozifikia kwa hakika, ziongeze kwenye seti ya data, funza upya, kisha rudia. Kelly na wenzake waliifanya hoja hiyo iwe ya vitendo kupitia HG-DAgger, ambapo binadamu ndiye anayeamua lini achukue udhibiti badala ya kuweka lebo kwenye hali bila kushika vidhibiti; wanaripoti utendaji ulioboreshwa zaidi ya DAgger na behavior cloning zote mbili, kwenye kazi ya uendeshaji-otomatiki iliyoigwa na nyingine halisi. Udhibiti wa binadamu (human gating) ndio unaofanya mzunguko huu uvumilike kwenye mkono wa dawati - unahamisha mikono yako tu pale jambo linapoanza kuharibika.
Kuna matokeo mawili ambayo kivitendo ni muhimu zaidi kuliko nadharia yenyewe. Marekebisho si maonyesho ya kawaida: yanajikita katika maeneo ya kizuizi (bottleneck regions) ambayo Mandlekar na wenzake wanayaeleza, ambapo mkengeuko mdogo unaisukuma sera kwenye hali ambazo maonyesho hayakuwahi kuzifikia. Na seti ya data iliyoundwa kwa sehemu hizo ngumu pekee ni seti ya data yenye umbo baya - Belkhale, Cui na Sadigh wanahoji kutoka upande wa data kwamba tofauti za hali si daima jambo la manufaa, na kwamba tofauti za vitendo (action divergence) pamoja na tofauti za mpito (transition diversity) ndizo kwa pamoja zinazoamua ubora wa seti ya data. Seti ya data iliyochanganywa si maafikiano tu, ndiyo hoja yenyewe.
Ganda (freeze) mambo haya kabla ya raundi ya kwanza
Raundi ya DAgger inalinganisha sera dhidi ya yenyewe kwa muda. Kitu chochote unachokibadilisha kati ya raundi mbili ambacho si seti ya data kinafanya ulinganisho huo kuwa hauna maana.
- Nafasi na vishikizo vya kamera, ikiwa ni pamoja na kamera ya kifundo cha mkono. Legeza kibano kimoja tu na utakuwa umebadilisha mgawanyo wa uchunguzi (observation distribution), si sera.
- Mwangaza (exposure) na mizani nyeupe (white balance), iwapo mfumo wako wa kunasa picha unakuruhusu kuvifunga. Auto-exposure inayoteleza kati ya raundi ni mabadiliko ya taratibu na yasiyoonekana ya uwanja (domain shift).
- Uratibu (calibration) wa mkono na nafasi za sifuri za servo. Ikiwa lazima uratibu upya, chukulia kila kilichorekodiwa kabla ya hapo kama seti ya data tofauti.
- Maandishi ya kazi (task text). Kila VLA hapa inategemea maandishi hayo; kuyabadilisha maneno katikati ya mzunguko ni kazi tofauti kabisa.
- Mwanga, uso wa meza, seti ya vitu. Kitu kipya ni jaribio jipya, si raundi inayofuata.
- Kiwango cha fremu za urekodiaji (frame rate). Kulinganisha viwango vya kuingilia kati kati ya rasta mbili tofauti za sampuli kunazalisha tofauti zinazotokana na rasta yenyewe.
Hsu na wenzake walilinganisha mtazamo unaozingatia mkono (hand-centric) dhidi ya mtazamo wa kawaida wa mtu wa tatu, na wakagundua kuwa mtazamo wa aina ya eye-in-hand uliboresha kwa uthabiti ufanisi wa mafunzo na uwezo wa kujumlisha nje ya mgawanyo wa data (out-of-distribution generalisation), licha ya kuona sehemu ndogo tu ya eneo. Kwenye mkono wenye viungo vitano, muda wa kufunga na kufungua gripper (gripper timing) ndio kitu ambacho marekebisho yako mara nyingi yanakirekebisha, na muda huo wa gripper ndio unaobebwa na mtazamo wa kamera ya kifundo cha mkono.
Raundi, mwanzo hadi mwisho
- 1Endesha inference na uirekodi
Anzisha mwendo dhidi ya hatua ya ukaguzi unayotaka kuiboresha, kisha anzisha urekodiaji kuelekea kwenye inference root. Ukirekodiwa hivyo, mwendo huo unarithi maandishi yake mwenyewe ya kazi (task text), ambayo ndiyo yale sera ilifunzwa nayo, badala ya lebo chaguo-msingi ya uendeshaji wa mbali. Bila rekodi, unaweza kuona kushindwa huko lakini huwezi kufunza kwa kutumia rekodi hiyo.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Chukua udhibiti pale inapoharibika
Bonyeza Take over kisha chagua hali ya uingizaji (input mode): mkono wa kiongozi, kibodi au vitelezi. Kiendeshaji (runner) kinasitisha, wewe unarekebisha, kisha unarudisha udhibiti. Fremu zilizorekodiwa wakati ukiwa unaendesha zinawekewa lebo ya kuingilia kati kiotomatiki.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Chambua vipindi
Amua kwa kila kipindi: kiweke kama marekebisho, kibaki kama tathmini, au kitupwe. Mwendo ambao sera iliukamilisha bila msaada ni data ya tathmini.
- 4Sawazisha seti ya data ya marekebisho
Marekebisho hukusanyika kwenye seti ya data ya ndani kwa kila sera, kisha huenda kwenye hifadhi ya wingu (cloud storage) kupitia usawazishaji wa kiotomatiki. Hakuna kitu kinachochanganywa humo ambacho wewe hukukiweka.
- 5Unda seti ya data iliyochanganywa
Unganisha seti ya data asilia na marekebisho, ukichagua vipindi wazi kwa kila chanzo. Matokeo yake ni seti ya data ya kawaida kuanzia hapo.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Endelea na mafunzo kutoka hatua ya ukaguzi
Funza mchanganyiko huo kuanzia hatua ya ukaguzi iliyotangulia badala ya modeli ya msingi (base model). Andika ni hatua ipi ya ukaguzi na mchanganyiko upi; bila jozi hiyo raundi haiwezi kurudufiwa.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Hatua ya 2 kwa kina: njia mbili za kuchukua udhibiti
Ukiwa na mkono wa kiongozi
Katika hali ya kiongozi-mfuasi (leader-follower), kuchukua udhibiti ni upokezanaji kati ya mikono miwili ambayo hayapo katika mkao uleule. Kubonyeza Take over kunasitisha kiendeshaji na kuusukuma mkono wa kiongozi kuelekea mkao wa sasa wa mfuasi, ili kisiwe na mruko wakati torque inapohamishwa. Iwapo usukumaji huo wa upatanishi unaisha muda wake (times out), unapatanisha mkono wa kiongozi kwa mkono mwenyewe na kuachia tu pale mikono miwili yanapokuwa ndani ya digrii tano. Kuanzia hapo unaendesha kwa njia ya mbali kama kawaida, na safu ya vitendo inarekodi ulichokiamuru.
Kuwa mkweli kuhusu njia hii: usukumaji wa upatanishi na upokezanaji wa torque ndiyo sehemu iliyojaribiwa kidogo zaidi ya mzunguko huu kwenye maunzi halisi (real hardware). Jaribu upokezanaji huo kwenye mkao wa taratibu na usio na madhara kabla ya kuutegemea katika mwendo unaokujali. Mkono wa kiongozi hutoa marekebisho laini zaidi kati ya hali tatu hizo, lakini pia ndio wenye uwezekano mkubwa zaidi wa kuharibika kimitambo.
Bila mkono wa kiongozi: kibodi na vitelezi
Watu wengi wanaosoma haya wana mkono mmoja tu. Hilo linatosha. Chagua uingizaji wa kibodi au vitelezi wakati unapobonyeza Take over, na kuchukua udhibiti hufanyika mara moja na kwa mkono - hakuna mkono wa pili wa kupatanisha, hivyo hakuna hatua ya upatanishi. Mfuasi hubaki katika mkao wake na kusubiri uingizaji.
| Hali ya uingizaji | Jinsi mkono unavyosogea | Kikomo kwa kila wito, kinachotekelezwa na seva | Imefungwa lini |
|---|---|---|---|
| Mkono wa kiongozi | Kioo (mirror) kinaendesha mfuasi kutoka pembe za viungo za mkono wa kiongozi | Hakuna wito wa nudge au set katika hali hii; kioo kinaandika malengo ya mfuasi kwa mfululizo | Haifungwi kamwe, na ndiyo chaguo-msingi ikiwa hakuna hali ya uingizaji iliyotolewa - lakini inahitaji mkono wa pili; bila leader id kuchukua udhibiti kunakataliwa |
| Kibodi | Msukumo wa jamaa (relative nudge) kwa kila mbofyo wa kitufe, unaotumwa kwenye endpoint ya takeover nudge | Kikomo kigumu cha digrii 2 kwa kila kiungo, digrii 4 kwa gripper | Inakataliwa kwa 409 iwapo kuchukua udhibiti kulianzishwa katika hali ya leader |
| Vitelezi | Mkao lengwa kamili (absolute), unaotumwa kwenye endpoint ya takeover set | Digrii 6 kwa upeo za msogeo kuelekea lengo kwa kila wito; kiolesura kinaendelea kutuma karibu mara kumi kwa sekunde | Inakataliwa kwa 409 iwapo kuchukua udhibiti kulianzishwa katika hali ya leader |
Vikomo hivyo vinatekelezwa upande wa seva, si kwenye kiolesura, kwa sababu delta iliyoandikwa vibaya kwenye mkono wa bus-servo ni mgongano. Marekebisho ya kibodi hutoka kwa hatua (stepwise) na kwa ukakamavu kidogo; marekebisho ya vitelezi ni laini zaidi, kwa sababu seva inatembea taratibu kuelekea lengo huku kiolesura kikiendelea kutuma mkondo. Katika hali zote mbili, safu ya vitendo hupokea vekta kamili ya mkao ulioamriwa, na uwekaji lebo wa kuingilia kati ni sawa kabisa na njia ya leader, hivyo marekebisho ya kibodi hutua kwenye seti ya data ileile bila tofauti ya umbizo.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Lini ubonyeze kitufe
Mapema badala ya kuchelewa. Marekebisho yanayoanza baada ya gripper kufunga bila kushika chochote yanafundisha jinsi ya kupona (recovery) kutoka kwenye hitilafu ambayo sera isingepaswa kuingia kabisa, na data ya kupona ina thamani ndogo zaidi kuliko data ya kuepuka (avoidance). Katiza mara ya kwanza unapokuwa na uhakika kuwa mkondo (trajectory) ni mbaya, rekebisha katika sehemu ngumu, kisha rudisha udhibiti mara hali inapokuwa ile ambayo sera iliwahi kuishughulikia kabla. ThriftyDAgger inaotomatisha uamuzi huo kwa kudhibiti kuingilia kati kulingana na upya (novelty) na hatari inayokadiriwa chini ya bajeti maalum ya binadamu, lakini kwenye mkono mmoja ukiwa na binadamu tayari anayeangalia, udhibiti wa binadamu ni wa gharama nafuu zaidi na uliorekebishwa vizuri zaidi kuliko chochote utakachokiweka wewe mwenyewe.
Inawezekana kwa kutumia mfumo wa open-source na hati chache. Gharama yake ni uwekaji kumbukumbu (bookkeeping), na hapo ndipo raundi za DAgger hufa.
- Andika fremu kutoka hati yako mwenyewe ya inference kuingia kwenye seti ya data ya LeRobot, ukitumia mfuatano wa maandishi wa kazi (task string) ambao sera ilifunzwa nao.
- Simamisha kwa muda mzunguko wa sera, badilisha chanzo cha amri, kisha weka lebo kwa kila fremu unayoiendesha kama kuingilia kati. Bila lebo hiyo, marekebisho yanaonekana kama maonyesho ya kawaida.
- Amua kwa makusudi kinachotokea kwa fremu za mpito (transition frames) kati ya sera kuachia udhibiti na uingizaji wako wa kwanza.
- Weka marekebisho kwenye seti ya data yao wenyewe kwa kila sera, na fuatilia fahirisi za vipindi kwa mkono ili mchanganyiko uweze kujengwa upya.
- Elekeza kiingilio (entry point) cha fine-tuning kwenye hatua ya ukaguzi iliyotangulia, kisha thibitisha kwenye log kuwa uzito huo umepakiwa.
Hatua zileziile sita zipo kama vitufe. Kilichoautomatishwa ni kile ambacho ni rahisi kukosea ukifanya kwa mkono: lebo ya kuingilia kati kwa kila fremu, mgawanyo kati ya marekebisho na tathmini, na rekodi ya ni hatua ipi ya ukaguzi iliyozalisha mchanganyiko upi. Hakuna kinachoingia kwenye seti ya data iliyoundwa ambacho wewe hukukichagua.
Halikuamulii wewe. Ni mwendo upi unahesabika kama marekebisho, ni vipindi vipi vinaingia kwenye mchanganyiko, na lini usimame - haya yanabaki maamuzi ya uamuzi wako mwenyewe. Sehemu hizo zimeelezwa chini ya mafunzo, na hali za uingizaji chini ya uendeshaji wa mbali.
Hatua ya 3 kwa kina: uchambuzi (triage) ndio unaoamua ubora
Baada ya mwendo, unabaki na rekodi yenye baadhi ya fremu zilizowekewa lebo ya kuingilia kati. Kuna maeneo matatu ya kuelekeza, na kuchagua lisilofaa kunaharibu kimya kimya raundi inayofuata.
- Weka kama marekebisho pale kuingilia kati kulikuwa ni suluhisho la kweli: sera ilikuwa inaelekea mahali pabaya na uingizaji wako ulionyesha jambo sahihi kutoka kwenye hali ambayo sera yenyewe ilikuwa imeizalisha.
- Baki nayo kama tathmini kwa miendo safi ya kiotomatiki na kwa miendo uliyoichukua udhibiti kwa tahadhari tu. Vipindi vya tathmini ndivyo unavyopimia hatua ya ukaguzi inayofuata, na kamwe visifunzwe kwazo.
- Tupa miendo iliyoharibiwa na jambo lisilohusiana - fremu ya kamera iliyoruka, servo iliyokwama, kitu ulichokigonga. Marekebisho yaliyoharibika ni mabaya zaidi kuliko kutokuwa na marekebisho kabisa.
Kati ya sera kuachia udhibiti na uingizaji wako wa kwanza, mkono hubaki tuli huku kirekodi kikiendelea kuandika - mfululizo wa mikao inayofanana ikiwa imeoanishwa na picha tofauti kidogo kidogo. Hapa, fremu hizo za upokezanaji hubaki kwenye rekodi ghafi na nje ya seti ya data ya marekebisho. Ikiwa unajenga mzunguko wako mwenyewe, zikate kwa makusudi: sera iliyofunzwa kwa fremu hizo hujifunza kusimama pale ambapo ilipaswa kutenda.
Hatua ya 5 kwa kina: kuunda mchanganyiko
Uundaji huchukua seti ya data asilia pamoja na seti ya data ya marekebisho na kuzalisha seti ya data ya LeRobot mpya na ya kawaida inayofunzwa kama nyingine yoyote. Sifa muhimu ni kwamba uchaguzi wa vipindi ni wazi kwa kila chanzo - hakuna kinachochanganywa kiotomatiki. Hilo linaonekana dogo mpaka mara ya kwanza sera inapofanya tabia za ajabu na unalazimika kujenga upya ilichofunzwa nacho.
Swali ambalo bado halijafungwa ni uwiano (ratio), na hakuna anayekuwa na nambari inayohamishika kutoka mfumo mmoja hadi mwingine. Jambo ambalo maandiko ya kitaaluma yanakubaliana nalo ni kwamba marekebisho yanapaswa kuhesabiwa zaidi ya sehemu yao ya fremu. Mandlekar na wenzake wanafunza upya kwa kurudia kwa kutumia data ambazo mfumo wao wa kuingilia kati unazikusanya, ili sera ijifunze kupita kwenye vizuizi (bottlenecks), na wanaripoti kuwa mawakala waliofunzwa kwa njia hiyo wanapita katika utendaji mawakala waliofunzwa kwa idadi sawa ya sampuli kutoka kwa waonyeshaji wasio na kuingilia kati. Sirius inaenda mbali zaidi na kupanga uzito upya wa sampuli za mafunzo kulingana na kiwango cha kukadiriwa cha imani ya binadamu (approximated human trust), ikiripoti ongezeko la asilimia 8 katika uigaji (simulation) na asilimia 27 kwenye maunzi halisi katika kiwango cha mafanikio ya sera, ukilinganisha na mbinu inazozilinganisha nazo, kwa kasi ya muunganiko mara mbili zaidi. Hakuna hata kimoja cha viingilio vya mafunzo hapa kinachotoa kitufe cha kupanga uzito wa sampuli, hivyo suluhisho duni ni kuweka kila kipindi cha marekebisho huku ukipunguza sampuli za maonyesho asilia - na kuandika ulichofanya.

Hatua ya 6 kwa kina: maana halisi ya kuendelea kutoka hatua ya ukaguzi
Kufunza mchanganyiko kuanzia modeli ya msingi kunafanya kazi lakini kunatupa raundi iliyotangulia na kunagharimu mwendo mzima. Kuendelea kutoka hatua ya ukaguzi iliyotangulia ni haraka zaidi na kwa kawaida ni bora zaidi. Pia ni jambo lenye ukomo zaidi kuliko linavyodokezwa na msemo huo.
Hatua ya ukaguzi yenye uzito pekee (weights-only checkpoint) ina vigezo na hakuna kitu kingine. Kuipakia kunampa mwendo unaofuata mwanzo bora zaidi kuliko modeli ya msingi, lakini nyakati za optimizer, nafasi ya ratiba ya learning-rate, na mpangilio wa data - vyote hivi vinaanza kutoka sifuri. Tarajia mruko wa loss mwanzoni mwa mwendo unaoendelea, usiusome kama kushindwa, wala usiuite raundi hiyo 'resume'. Ni 'warm start'.
| Sera | Ukubwa | Kiwango cha GPU | Inference kwa kila hatua ya kitendo | Umbizo la seti ya data | Idadi ya vipindi kabla haijafaa kujaribiwa |
|---|---|---|---|---|---|
| GR00T N1.7 | karibu 3 B, takriban 40 M zilizofunzwa wakati wa fine-tuning | A100 80 GB au H100 80 GB | karibu 152 ms | LeRobot v2.0 au v2.1 | 50 |
| GR00T N1.5 | karibu 3 B | A100 80 GB au H100 80 GB | karibu 165 ms | LeRobot v2.0 au v2.1 | 50 |
| Pi0.5 | karibu 3 B juu ya msingi (backbone) wa PaliGemma | A100 80 GB au H100 80 GB | karibu 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | karibu 450 M | RTX 4090 au kadi yoyote ya 24 GB | karibu 245 ms | LeRobot v3.0 | 30 |
| ACT | karibu 80 M, iliyofunzwa kutoka mwanzo kabisa | RTX 4090 au kadi yoyote ya 24 GB | karibu 20 ms | LeRobot v3.0 | 50 |
Latency hujilimbikiza ndani ya mzunguko wa DAgger kwa namna ambayo haifanyi hivyo wakati wa onyesho la kawaida (demo): kwa karibu 485 ms kwa kila hatua ya kitendo, unachukua udhibiti kwa sababu mkono ulisitasita, si kwa sababu ulikosea, na marekebisho ya kusitasita si data yenye manufaa ya mafunzo. Ikiwa unarudia kwenye data badala ya kufuatilia kiwango cha mwisho cha mafanikio, rudia kwa modeli yenye kasi. Shukor na wenzake wanaieleza SmolVLA kama iliyoundwa kufunzwa kwa GPU moja na kutumika kwenye GPU za watumiaji wa kawaida au CPU, ikiwa na mfumo wa inference wa asynchronous unaotenganisha ubashiri wa kitendo na utekelezaji ili kuruhusu viwango vya juu zaidi vya udhibiti - sifa inayofanya mzunguko wa kuchukua udhibiti kubaki na mwitikio wa haraka.
Umbizo za seti za data pia hazibadilishani. GR00T inachukua LeRobot v2.0 au v2.1, na hazina ya Isaac-GR00T inaeleza uingizaji wake kama aina fulani ya umbizo la LeRobot v2 lenye faili la ziada la maelezo ya modality; vifunzaji vipya zaidi hapa vinatarajia v3.0. Mchanganyiko ulioundwa kwa toleo lisilo sahihi unashindwa wakati wa kupakia (load time) badala ya kuzalisha sera mbaya - hali bora zaidi ya kushindwa, ingawa bado ni nafasi ya foleni (queue slot) iliyopotea bure. nyaraka za seti ya data zinaorodhesha ni umbizo lipi kila kifunzaji kinachukua.
Mzunguko, ukiwa na uwekaji kumbukumbu tayari umefanyika
Kuchukua udhibiti kwa mkono wa kiongozi, kibodi au vitelezi; kuweka lebo ya kuingilia kati kwa kila fremu; kuweka miendo kama marekebisho au tathmini; kuunda seti ya data iliyochanganywa kwa uchaguzi wazi wa vipindi kwa kila chanzo; na kuendelea na mafunzo kutoka hatua ya ukaguzi badala ya modeli ya msingi. Kinachobaki kuwa uamuzi wako ni ni mwendo upi unahesabika kama marekebisho, ni nini kinachoingia kwenye mchanganyiko, na ni lini kiwango cha kuingilia kati kimekoma kushuka.
Angalia jinsi mzunguko wa DAgger ulivyounganishwaNjia nne za kupoteza raundi bure
1. Kufunza kwa marekebisho pekee
Kasoro inayojitokeza zaidi na njia ya mkato inayovutia zaidi. Seti ya data ya marekebisho pekee karibu yote ni sehemu ngumu ya katikati ya kazi, huku sehemu za kukaribia na kurudi nyuma zikikosekana; sera inaboreka kwenye sehemu ngumu lakini inasahau jinsi ya kufika hapo. Uunganishaji (aggregation) si undani wa kiutekelezaji wa mbinu, ni utaratibu wenyewe: data ya zamani ndiyo inayoshikilia sehemu nyingine ya tabia mahali pake huku marekebisho yakisogeza sehemu moja tu yake.
2. Kuhamisha kamera kati ya raundi
Kamera inayohama sentimita mbili kati ya raundi inazalisha sera mbaya zaidi kuliko ile uliyoanza nayo, na uchunguzi wa tatizo unaogharimu siku nzima. Kila VLA hapa inategemea picha; hali ya viungo (joint state) pekee haiwezi kubainisha wazi mahali kitu kilipo. Piga picha ya mpangilio kabla ya raundi ya kwanza na uangalie picha hiyo kabla ya kila raundi inayofuata.
3. Kuruhusu mabaki ya upokezanaji kuingia kwenye mafunzo
Imeshughulikiwa hapo juu, na ipo kwenye orodha kwa sababu haionekani kwa urahisi. Dalili yake ni sera inayosita kwa sehemu ndogo ya sekunde mahususi pale mwendeshaji wa raundi iliyopita alipochukua udhibiti. Inaonekana kama kusitasita; kumbe ni kuiga.
4. Kuita 'warm start' kuwa 'resume'
Ikiwa unaamini kuwa hali ya optimizer iliendelea kubebwa, mruko wa mwanzo wa loss unasomeka kama hitilafu (bug) na unaanza kutafuta data iliyoharibika. Ikiwa unajua kuwa optimizer ilianza upya kabisa, mruko huo ni wa kutarajiwa na unatazama kinachofuata baada yake. Nambari zilezile, hitimisho kinyume.
Kupima raundi
Kipimo cha mzunguko unaodhibitiwa na binadamu ni kiwango cha kuingilia kati: fremu zilizorekodiwa wakati ukiwa kwenye udhibiti, zikigawanywa kwa jumla ya fremu za mwendo huo. Kipimo hiki kinapatikana kwenye hali ya takeover (takeover status), na ndicho nambari pekee inayojibu swali ambalo raundi iliuliza. Training loss hushuka bila kujali kama sera imeboreka au la; kiwango cha mafanikio (success rate) ni cha kibinary na chenye kelele kwenye idadi ndogo za sampuli anazozizalisha mkono wa dawati. Kiwango cha kuingilia kati ni endelevu, kinapimwa kwenye hali ambazo sera yenyewe ilizisababisha, na hushuka kadiri sera inavyokuhitaji wewe kidogo zaidi.
Kilinganishe tu kati ya miendo iliyorekodiwa chini ya masharti yanayofanana kabisa. Hoja kamili, na jinsi ya kujenga seti ya tathmini inayodumu zaidi ya raundi mbili, ipo katika makala kuhusu kupima mzunguko wa DAgger. Raundi ya kwanza kihalisia ni jaribio la uwezekano (feasibility test): unahakikisha kwamba kuchukua udhibiti kunafanya kazi kwenye maunzi yako, kwamba marekebisho yanatua na lebo zake, na kwamba mwendo ulioendelea umepakia hatua ya ukaguzi uliyoitaja. Raundi ya pili na ya tatu ndizo ambapo kiwango kinapaswa kuanza kubadilika. Ikiwa hakijabadilika kufikia raundi ya nne, tatizo liko juu zaidi ya DAgger yenyewe (upstream).
| Andika kwa kila raundi | Kwa nini ni muhimu baadaye |
|---|---|
| Hatua ya ukaguzi iliyoendeshwa | Bila hiyo huwezi kuhusisha uboreshaji wowote na mchanganyiko fulani |
| Hali ya uingizaji iliyotumika kwa kuchukua udhibiti | Marekebisho ya kibodi ni makali zaidi kuliko marekebisho ya kiongozi, na hilo linaonekana kwenye data |
| Idadi ya miendo na jinsi kila mmoja ulivyochambuliwa | Kama raundi ilikuwa na marekebisho ya kutosha kuwa na maana |
| Kiwango cha kuingilia kati kwa kila mwendo, na wastani wake | Kipimo cha maendeleo cha mzunguko |
| Uchaguzi kamili wa vipindi kwa kila chanzo | Njia pekee ya kurudufu au kutengua raundi |
| Warm start au mafunzo mapya kabisa | Inaeleza mkondo wa loss utakaoutazama baada ya wiki moja |
Ikiwa bado huna hatua ya ukaguzi
Mzunguko huu hauna kiingilio bila hiyo. Rekodi seti ya kwanza ya data, funza sera ya kwanza, iendeshe - urekodiaji, mafunzo na kuendesha sera vinashughulikia njia hiyo. Kiteja (client) cha kurekodi kipo kwenye ukurasa wa kupakua, viwango vya GPU na bei za kila saa zipo kwenye ukurasa wa bei, na jinsi kipindi kinachoweza kutumika kinavyoonekana katika mwongozo wa ukusanyaji data wa SO-100. Hakikisha maonyesho ni sahihi kabla ya marekebisho: DAgger ni utaratibu wa ukarabati, na unafanya kazi vizuri zaidi kwenye kitu ambacho kilikuwa tayari karibu sahihi.
Je, ninaweza kuendesha mzunguko wa DAgger bila mkono wa kiongozi?▾
Ndiyo. Chagua uingizaji wa kibodi au vitelezi unapobonyeza Take over: kuchukua udhibiti hufanyika mara moja na kwa mkono, bila mkono wa pili wa kupatanisha. Kibodi hutuma misukumo ya jamaa (relative nudges) ambayo seva inaikomesha kwa ukali kwenye digrii 2 kwa kila kiungo na digrii 4 kwa gripper; vitelezi hutuma lengo kamili na seva husogea kwa upeo wa digrii 6 kuelekea lengo hilo kwa kila wito, huku kiolesura kikiendelea kutuma mkondo. Safu ya vitendo na uwekaji lebo wa kuingilia kati ni sawa kama katika hali ya kiongozi, hivyo marekebisho hayatofautiani kwenye seti ya data.
Raundi moja inahitaji marekebisho mangapi?▾
Hakuna nambari ya kiulimwengu inayoweza kutetewa, na idadi ya fremu ina umuhimu zaidi kuliko idadi ya vipindi. Kanuni ya vitendo ni kwamba marekebisho yasipotee ndani ya mchanganyiko: ukiwa na vipindi 200 vya asili na vipindi vitatu tu vya marekebisho, hakuna kitakachobadilika. Lenga marekebisho yanayoshughulikia tabia inayoshindwa kutoka mipangilio kadhaa tofauti ya kuanzia, badala ya marudio matatu ya uokozi uleule.
Kwa nini kufunza kwa marekebisho pekee ni wazo baya kiasi hicho?▾
Kwa sababu marekebisho karibu yote ni sehemu ngumu ya katikati ya kazi. Sehemu za kukaribia, kupatanisha na kurudi nyuma zinakosekana, hivyo sera inapoteza kile ilichokuwa ikifanya vizuri tayari huku ikiboreka kwenye sehemu uliyoirekebisha. Kuendelea kutunza data ya zamani na kuiongezea ndio utaratibu wenyewe, si nyongeza ya hiari.
Je, kuendelea kutoka hatua ya ukaguzi kunarudisha mwendo wa mafunzo uliopita?▾
Hapana. Hatua ya ukaguzi yenye uzito pekee inarejesha vigezo tu na hakuna kingine: nyakati za optimizer, nafasi ya ratiba ya learning-rate, na mpangilio wa data huanza upya kabisa. Ni 'warm start', na mruko wa mwanzo wa loss ni jambo la kutarajiwa badala ya dalili ya tatizo. Andika ni ipi kati ya hizo mbili uliyoifanya kwa hakika, ili uweze kusoma mkondo huo kwa usahihi baada ya wiki moja.
Itakuwaje ikiwa kiwango cha kuingilia kati hakishuki?▾
Acha kuongeza raundi. Kiwango kilichokaa tuli kinamaanisha kuwa marekebisho hayafundishi kile unachodhani. Sababu za kawaida ziko juu zaidi katika mchakato (upstream): kamera imehama, marekebisho yanaanza kuchelewa mno kuwa data ya kuepuka, fremu za upokezanaji zipo ndani ya seti ya mafunzo, au kazi haijabainishwa vya kutosha kutokana na uchunguzi ambao sera inaupata kwa hakika.
Hakuna hata mojawapo ya haya iliyo tatizo lililotatuliwa kikamilifu, wala hakuna hata moja linalofanyika kwa mbofyo mmoja tu. Ujifunzaji wa kuiga wa kimaingiliano (interactive imitation learning) ni eneo la utafiti linaloendelea kwa nguvu hasa kwa sababu maswali yake - lini kuingilia kati, jinsi ya kupanga uzito wa kile alichofanya binadamu, ni kiasi gani cha data ya zamani cha kuendelea kukitunza - hayana majibu yaliyokaa imara; uchunguzi wa jumla wa Celemin na wenzake unaonyesha ramani ya yale ambayo bado ni maswali wazi. Kilicho na uhakika ni kwamba mzunguko huu una muunganiko unaoweza kupimwa endapo unaendeshwa kwa uangalifu, kwenye maunzi yanayogharimu mamia machache ya euro. Ganda mpangilio, ingilia kati mapema, chambua kwa uaminifu, changanya kwa makusudi, na rekodi kiwango cha kuingilia kati kila wakati.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started