Mkono wa roboti wa bei nafuu wa SO-100 juu ya dawati, ukiwa tayari kwa uendeshaji wa mbali na mafunzo ya sera
DAggerSO-100Ujifunzaji wa KuigaVLAUendeshaji wa Mbali

Kuendesha Mzunguko wa DAgger kwenye SO-100 kwa Sera ya VLA

AY-Robots ResearchAugust 27, 2026Dakika 15 za kusoma

Maelezo ya hatua kwa hatua ya raundi moja ya DAgger inayodhibitiwa na binadamu kwenye mkono wa SO-100: endesha sera na uirekodi, chukua udhibiti pale tabia inapoharibika, weka rekodi hiyo kama marekebisho, unda seti ya data iliyochanganywa, kisha endelea na mafunzo kutoka kwa hatua ya ukaguzi (checkpoint). Inajumuisha njia ya kuchukua udhibiti kwa kibodi na vitelezi kwa wale wasio na mkono wa kiongozi (leader arm), pamoja na makosa manne yanayofanya raundi kuwa bure kabisa.

Sera yako inaendesha. Inanyoosha kufikia kijiwe (cube), inafunga gripper sentimita moja mapema mno, kisha inaendelea kana kwamba imekishika. Hakuna hitilafu inayoonekana, na kukazana kutazama training loss hakuelezi tatizo. Suluhisho si hatua nyingine 20 000 za gradient kwenye maonyesho (demonstrations) yaleyale. Ni kurudisha mkono wako kwenye mkono wa roboti mahususi pale inapokwenda vibaya, kurekodi ulichofanya badala yake, kisha kufunza hatua ya ukaguzi inayofuata kwa data ya zamani pamoja na marekebisho hayo. Hiyo ndiyo raundi ya DAgger, na hivi ndivyo inavyoendeshwa kwenye SO-100 kwa kutumia sera ya vision-language-action (VLA).

Nadharia iko mahali pengine: kwa nini uunganishaji wa seti za data unafanya kazi kabisa na ni nini kinachobadilika pale binadamu anapodhibiti mchakato huo. Hii ni mwongozo wa uendeshaji, na inadhania kuwa una hatua ya ukaguzi iliyofunzwa tayari, seti ya kamera inayofanya kazi, na mkono unaosogea. Hatua sita zilizo hapa chini ni mzunguko kama ulivyotekelezwa kwenye ukurasa wa DAgger wa jukwaa hili, lakini mfululizo ni uleule hata ukitumia hati zako mwenyewe.

Raundi moja kwa ufupi

  • Endesha sera iliyofunzwa na uirekodi, ukitumia maandishi ya kazi (task text) ya mwendo huo badala ya lebo ya jumla ya uendeshaji wa mbali.
  • Chukua udhibiti mara tabia inapoanza kuharibika: kupokezana kwa njia ya kioo (mirror) ukiwa na mkono wa kiongozi, au kwa njia ya moja kwa moja na ya mikono kupitia kibodi au vitelezi ikiwa huna mkono huo.
  • Chambua kila mwendo: uweke kama marekebisho, uubaki kama kipindi cha tathmini, au uutupe.
  • Unda mchanganyiko kwa mkono - maonyesho asilia pamoja na marekebisho, huku vipindi vikichaguliwa kulingana na chanzo chake. Kamwe usifunze kwa kutumia marekebisho pekee.
  • Endelea na mafunzo kutoka hatua ya ukaguzi ya mwisho, na andika ni hatua ipi ya ukaguzi iliyozalisha mchanganyiko upi.
  • Nambari inayosema kama raundi ilikuwa na thamani yoyote ni kiwango cha kuingilia kati, si training loss.

Kwa nini raundi ya pili si data zaidi tu

Behavior cloning inafunza kwa kutumia hali (states) ambazo binadamu alizipitia. Wakati wa jaribio, sera hupitia hali ambazo yenyewe imezisababisha, na makosa madogo ya vitendo hujilimbikiza na kuzalisha hali ambazo hakuna onyesho lolote lililowahi kuzifikia. Ross, Gordon na Bagnell walirasimisha kasoro hiyo kwa ajili ya AISTATS 2011 na kuijibu kwa algoriti ya kurudia inayofunza sera thabiti na ya kudhamiria (deterministic), ambayo, chini ya upunguzaji wao (reduction), ni lazima ifanye vizuri chini ya mgawanyo wa hali inaouzalisha yenyewe: endesha sera ya sasa, mtaalamu aweke lebo kwenye hali alizozifikia kwa hakika, ziongeze kwenye seti ya data, funza upya, kisha rudia. Kelly na wenzake waliifanya hoja hiyo iwe ya vitendo kupitia HG-DAgger, ambapo binadamu ndiye anayeamua lini achukue udhibiti badala ya kuweka lebo kwenye hali bila kushika vidhibiti; wanaripoti utendaji ulioboreshwa zaidi ya DAgger na behavior cloning zote mbili, kwenye kazi ya uendeshaji-otomatiki iliyoigwa na nyingine halisi. Udhibiti wa binadamu (human gating) ndio unaofanya mzunguko huu uvumilike kwenye mkono wa dawati - unahamisha mikono yako tu pale jambo linapoanza kuharibika.

Kuna matokeo mawili ambayo kivitendo ni muhimu zaidi kuliko nadharia yenyewe. Marekebisho si maonyesho ya kawaida: yanajikita katika maeneo ya kizuizi (bottleneck regions) ambayo Mandlekar na wenzake wanayaeleza, ambapo mkengeuko mdogo unaisukuma sera kwenye hali ambazo maonyesho hayakuwahi kuzifikia. Na seti ya data iliyoundwa kwa sehemu hizo ngumu pekee ni seti ya data yenye umbo baya - Belkhale, Cui na Sadigh wanahoji kutoka upande wa data kwamba tofauti za hali si daima jambo la manufaa, na kwamba tofauti za vitendo (action divergence) pamoja na tofauti za mpito (transition diversity) ndizo kwa pamoja zinazoamua ubora wa seti ya data. Seti ya data iliyochanganywa si maafikiano tu, ndiyo hoja yenyewe.

Ganda (freeze) mambo haya kabla ya raundi ya kwanza

Raundi ya DAgger inalinganisha sera dhidi ya yenyewe kwa muda. Kitu chochote unachokibadilisha kati ya raundi mbili ambacho si seti ya data kinafanya ulinganisho huo kuwa hauna maana.

  • Nafasi na vishikizo vya kamera, ikiwa ni pamoja na kamera ya kifundo cha mkono. Legeza kibano kimoja tu na utakuwa umebadilisha mgawanyo wa uchunguzi (observation distribution), si sera.
  • Mwangaza (exposure) na mizani nyeupe (white balance), iwapo mfumo wako wa kunasa picha unakuruhusu kuvifunga. Auto-exposure inayoteleza kati ya raundi ni mabadiliko ya taratibu na yasiyoonekana ya uwanja (domain shift).
  • Uratibu (calibration) wa mkono na nafasi za sifuri za servo. Ikiwa lazima uratibu upya, chukulia kila kilichorekodiwa kabla ya hapo kama seti ya data tofauti.
  • Maandishi ya kazi (task text). Kila VLA hapa inategemea maandishi hayo; kuyabadilisha maneno katikati ya mzunguko ni kazi tofauti kabisa.
  • Mwanga, uso wa meza, seti ya vitu. Kitu kipya ni jaribio jipya, si raundi inayofuata.
  • Kiwango cha fremu za urekodiaji (frame rate). Kulinganisha viwango vya kuingilia kati kati ya rasta mbili tofauti za sampuli kunazalisha tofauti zinazotokana na rasta yenyewe.
Kamera ya kifundo cha mkono si kifaa cha hiari

Hsu na wenzake walilinganisha mtazamo unaozingatia mkono (hand-centric) dhidi ya mtazamo wa kawaida wa mtu wa tatu, na wakagundua kuwa mtazamo wa aina ya eye-in-hand uliboresha kwa uthabiti ufanisi wa mafunzo na uwezo wa kujumlisha nje ya mgawanyo wa data (out-of-distribution generalisation), licha ya kuona sehemu ndogo tu ya eneo. Kwenye mkono wenye viungo vitano, muda wa kufunga na kufungua gripper (gripper timing) ndio kitu ambacho marekebisho yako mara nyingi yanakirekebisha, na muda huo wa gripper ndio unaobebwa na mtazamo wa kamera ya kifundo cha mkono.

Raundi, mwanzo hadi mwisho

  1. 1
    Endesha inference na uirekodi

    Anzisha mwendo dhidi ya hatua ya ukaguzi unayotaka kuiboresha, kisha anzisha urekodiaji kuelekea kwenye inference root. Ukirekodiwa hivyo, mwendo huo unarithi maandishi yake mwenyewe ya kazi (task text), ambayo ndiyo yale sera ilifunzwa nayo, badala ya lebo chaguo-msingi ya uendeshaji wa mbali. Bila rekodi, unaweza kuona kushindwa huko lakini huwezi kufunza kwa kutumia rekodi hiyo.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Chukua udhibiti pale inapoharibika

    Bonyeza Take over kisha chagua hali ya uingizaji (input mode): mkono wa kiongozi, kibodi au vitelezi. Kiendeshaji (runner) kinasitisha, wewe unarekebisha, kisha unarudisha udhibiti. Fremu zilizorekodiwa wakati ukiwa unaendesha zinawekewa lebo ya kuingilia kati kiotomatiki.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Chambua vipindi

    Amua kwa kila kipindi: kiweke kama marekebisho, kibaki kama tathmini, au kitupwe. Mwendo ambao sera iliukamilisha bila msaada ni data ya tathmini.

  4. 4
    Sawazisha seti ya data ya marekebisho

    Marekebisho hukusanyika kwenye seti ya data ya ndani kwa kila sera, kisha huenda kwenye hifadhi ya wingu (cloud storage) kupitia usawazishaji wa kiotomatiki. Hakuna kitu kinachochanganywa humo ambacho wewe hukukiweka.

  5. 5
    Unda seti ya data iliyochanganywa

    Unganisha seti ya data asilia na marekebisho, ukichagua vipindi wazi kwa kila chanzo. Matokeo yake ni seti ya data ya kawaida kuanzia hapo.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Endelea na mafunzo kutoka hatua ya ukaguzi

    Funza mchanganyiko huo kuanzia hatua ya ukaguzi iliyotangulia badala ya modeli ya msingi (base model). Andika ni hatua ipi ya ukaguzi na mchanganyiko upi; bila jozi hiyo raundi haiwezi kurudufiwa.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Hatua ya 2 kwa kina: njia mbili za kuchukua udhibiti

Ukiwa na mkono wa kiongozi

Katika hali ya kiongozi-mfuasi (leader-follower), kuchukua udhibiti ni upokezanaji kati ya mikono miwili ambayo hayapo katika mkao uleule. Kubonyeza Take over kunasitisha kiendeshaji na kuusukuma mkono wa kiongozi kuelekea mkao wa sasa wa mfuasi, ili kisiwe na mruko wakati torque inapohamishwa. Iwapo usukumaji huo wa upatanishi unaisha muda wake (times out), unapatanisha mkono wa kiongozi kwa mkono mwenyewe na kuachia tu pale mikono miwili yanapokuwa ndani ya digrii tano. Kuanzia hapo unaendesha kwa njia ya mbali kama kawaida, na safu ya vitendo inarekodi ulichokiamuru.

Kuwa mkweli kuhusu njia hii: usukumaji wa upatanishi na upokezanaji wa torque ndiyo sehemu iliyojaribiwa kidogo zaidi ya mzunguko huu kwenye maunzi halisi (real hardware). Jaribu upokezanaji huo kwenye mkao wa taratibu na usio na madhara kabla ya kuutegemea katika mwendo unaokujali. Mkono wa kiongozi hutoa marekebisho laini zaidi kati ya hali tatu hizo, lakini pia ndio wenye uwezekano mkubwa zaidi wa kuharibika kimitambo.

Bila mkono wa kiongozi: kibodi na vitelezi

Watu wengi wanaosoma haya wana mkono mmoja tu. Hilo linatosha. Chagua uingizaji wa kibodi au vitelezi wakati unapobonyeza Take over, na kuchukua udhibiti hufanyika mara moja na kwa mkono - hakuna mkono wa pili wa kupatanisha, hivyo hakuna hatua ya upatanishi. Mfuasi hubaki katika mkao wake na kusubiri uingizaji.

Hali ya uingizajiJinsi mkono unavyosogeaKikomo kwa kila wito, kinachotekelezwa na sevaImefungwa lini
Mkono wa kiongoziKioo (mirror) kinaendesha mfuasi kutoka pembe za viungo za mkono wa kiongoziHakuna wito wa nudge au set katika hali hii; kioo kinaandika malengo ya mfuasi kwa mfululizoHaifungwi kamwe, na ndiyo chaguo-msingi ikiwa hakuna hali ya uingizaji iliyotolewa - lakini inahitaji mkono wa pili; bila leader id kuchukua udhibiti kunakataliwa
KibodiMsukumo wa jamaa (relative nudge) kwa kila mbofyo wa kitufe, unaotumwa kwenye endpoint ya takeover nudgeKikomo kigumu cha digrii 2 kwa kila kiungo, digrii 4 kwa gripperInakataliwa kwa 409 iwapo kuchukua udhibiti kulianzishwa katika hali ya leader
ViteleziMkao lengwa kamili (absolute), unaotumwa kwenye endpoint ya takeover setDigrii 6 kwa upeo za msogeo kuelekea lengo kwa kila wito; kiolesura kinaendelea kutuma karibu mara kumi kwa sekundeInakataliwa kwa 409 iwapo kuchukua udhibiti kulianzishwa katika hali ya leader

Vikomo hivyo vinatekelezwa upande wa seva, si kwenye kiolesura, kwa sababu delta iliyoandikwa vibaya kwenye mkono wa bus-servo ni mgongano. Marekebisho ya kibodi hutoka kwa hatua (stepwise) na kwa ukakamavu kidogo; marekebisho ya vitelezi ni laini zaidi, kwa sababu seva inatembea taratibu kuelekea lengo huku kiolesura kikiendelea kutuma mkondo. Katika hali zote mbili, safu ya vitendo hupokea vekta kamili ya mkao ulioamriwa, na uwekaji lebo wa kuingilia kati ni sawa kabisa na njia ya leader, hivyo marekebisho ya kibodi hutua kwenye seti ya data ileile bila tofauti ya umbizo.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Mpangilio uleule wa vitufe kama sehemu nyingine yoyote ya mfumo huu, hivyo kumbukumbu ya misuli kutoka wakati wa kurekodi inabaki ileile.
Mwongozo wa mafunzo unaoonyesha hatua zilizopangwa za mwendo wa fine-tuning wa GR00T kwenye seti ya data ya SO-100
Upande wa mafunzo wa raundi ni mfululizo uleule unaoongozwa kama mwendo wa kwanza; ni sehemu ya checkpoint pekee inayotofautiana.

Lini ubonyeze kitufe

Mapema badala ya kuchelewa. Marekebisho yanayoanza baada ya gripper kufunga bila kushika chochote yanafundisha jinsi ya kupona (recovery) kutoka kwenye hitilafu ambayo sera isingepaswa kuingia kabisa, na data ya kupona ina thamani ndogo zaidi kuliko data ya kuepuka (avoidance). Katiza mara ya kwanza unapokuwa na uhakika kuwa mkondo (trajectory) ni mbaya, rekebisha katika sehemu ngumu, kisha rudisha udhibiti mara hali inapokuwa ile ambayo sera iliwahi kuishughulikia kabla. ThriftyDAgger inaotomatisha uamuzi huo kwa kudhibiti kuingilia kati kulingana na upya (novelty) na hatari inayokadiriwa chini ya bajeti maalum ya binadamu, lakini kwenye mkono mmoja ukiwa na binadamu tayari anayeangalia, udhibiti wa binadamu ni wa gharama nafuu zaidi na uliorekebishwa vizuri zaidi kuliko chochote utakachokiweka wewe mwenyewe.

Inawezekana kwa kutumia mfumo wa open-source na hati chache. Gharama yake ni uwekaji kumbukumbu (bookkeeping), na hapo ndipo raundi za DAgger hufa.

  1. Andika fremu kutoka hati yako mwenyewe ya inference kuingia kwenye seti ya data ya LeRobot, ukitumia mfuatano wa maandishi wa kazi (task string) ambao sera ilifunzwa nao.
  2. Simamisha kwa muda mzunguko wa sera, badilisha chanzo cha amri, kisha weka lebo kwa kila fremu unayoiendesha kama kuingilia kati. Bila lebo hiyo, marekebisho yanaonekana kama maonyesho ya kawaida.
  3. Amua kwa makusudi kinachotokea kwa fremu za mpito (transition frames) kati ya sera kuachia udhibiti na uingizaji wako wa kwanza.
  4. Weka marekebisho kwenye seti ya data yao wenyewe kwa kila sera, na fuatilia fahirisi za vipindi kwa mkono ili mchanganyiko uweze kujengwa upya.
  5. Elekeza kiingilio (entry point) cha fine-tuning kwenye hatua ya ukaguzi iliyotangulia, kisha thibitisha kwenye log kuwa uzito huo umepakiwa.

Hatua ya 3 kwa kina: uchambuzi (triage) ndio unaoamua ubora

Baada ya mwendo, unabaki na rekodi yenye baadhi ya fremu zilizowekewa lebo ya kuingilia kati. Kuna maeneo matatu ya kuelekeza, na kuchagua lisilofaa kunaharibu kimya kimya raundi inayofuata.

  • Weka kama marekebisho pale kuingilia kati kulikuwa ni suluhisho la kweli: sera ilikuwa inaelekea mahali pabaya na uingizaji wako ulionyesha jambo sahihi kutoka kwenye hali ambayo sera yenyewe ilikuwa imeizalisha.
  • Baki nayo kama tathmini kwa miendo safi ya kiotomatiki na kwa miendo uliyoichukua udhibiti kwa tahadhari tu. Vipindi vya tathmini ndivyo unavyopimia hatua ya ukaguzi inayofuata, na kamwe visifunzwe kwazo.
  • Tupa miendo iliyoharibiwa na jambo lisilohusiana - fremu ya kamera iliyoruka, servo iliyokwama, kitu ulichokigonga. Marekebisho yaliyoharibika ni mabaya zaidi kuliko kutokuwa na marekebisho kabisa.
Fremu zilizosimama (freeze frames) zinapaswa kubaki kwenye rekodi ghafi, si kwenye data ya mafunzo

Kati ya sera kuachia udhibiti na uingizaji wako wa kwanza, mkono hubaki tuli huku kirekodi kikiendelea kuandika - mfululizo wa mikao inayofanana ikiwa imeoanishwa na picha tofauti kidogo kidogo. Hapa, fremu hizo za upokezanaji hubaki kwenye rekodi ghafi na nje ya seti ya data ya marekebisho. Ikiwa unajenga mzunguko wako mwenyewe, zikate kwa makusudi: sera iliyofunzwa kwa fremu hizo hujifunza kusimama pale ambapo ilipaswa kutenda.

Hatua ya 5 kwa kina: kuunda mchanganyiko

Uundaji huchukua seti ya data asilia pamoja na seti ya data ya marekebisho na kuzalisha seti ya data ya LeRobot mpya na ya kawaida inayofunzwa kama nyingine yoyote. Sifa muhimu ni kwamba uchaguzi wa vipindi ni wazi kwa kila chanzo - hakuna kinachochanganywa kiotomatiki. Hilo linaonekana dogo mpaka mara ya kwanza sera inapofanya tabia za ajabu na unalazimika kujenga upya ilichofunzwa nacho.

Swali ambalo bado halijafungwa ni uwiano (ratio), na hakuna anayekuwa na nambari inayohamishika kutoka mfumo mmoja hadi mwingine. Jambo ambalo maandiko ya kitaaluma yanakubaliana nalo ni kwamba marekebisho yanapaswa kuhesabiwa zaidi ya sehemu yao ya fremu. Mandlekar na wenzake wanafunza upya kwa kurudia kwa kutumia data ambazo mfumo wao wa kuingilia kati unazikusanya, ili sera ijifunze kupita kwenye vizuizi (bottlenecks), na wanaripoti kuwa mawakala waliofunzwa kwa njia hiyo wanapita katika utendaji mawakala waliofunzwa kwa idadi sawa ya sampuli kutoka kwa waonyeshaji wasio na kuingilia kati. Sirius inaenda mbali zaidi na kupanga uzito upya wa sampuli za mafunzo kulingana na kiwango cha kukadiriwa cha imani ya binadamu (approximated human trust), ikiripoti ongezeko la asilimia 8 katika uigaji (simulation) na asilimia 27 kwenye maunzi halisi katika kiwango cha mafanikio ya sera, ukilinganisha na mbinu inazozilinganisha nazo, kwa kasi ya muunganiko mara mbili zaidi. Hakuna hata kimoja cha viingilio vya mafunzo hapa kinachotoa kitufe cha kupanga uzito wa sampuli, hivyo suluhisho duni ni kuweka kila kipindi cha marekebisho huku ukipunguza sampuli za maonyesho asilia - na kuandika ulichofanya.

Mwonekano wa urekodiaji wa seti ya data unaoonyesha vipindi vya seti ya data ya SO-100 pamoja na mikondo ya kamera
Vipindi vya marekebisho ni vipindi vya kawaida vyenye lebo ya kuingilia kati kwa kila fremu, hivyo vinaungana na seti ya data asilia bila kuhitaji ubadilishaji.

Hatua ya 6 kwa kina: maana halisi ya kuendelea kutoka hatua ya ukaguzi

Kufunza mchanganyiko kuanzia modeli ya msingi kunafanya kazi lakini kunatupa raundi iliyotangulia na kunagharimu mwendo mzima. Kuendelea kutoka hatua ya ukaguzi iliyotangulia ni haraka zaidi na kwa kawaida ni bora zaidi. Pia ni jambo lenye ukomo zaidi kuliko linavyodokezwa na msemo huo.

Uanzishaji wa uzito si kuendelea kwa optimizer (optimizer resume)

Hatua ya ukaguzi yenye uzito pekee (weights-only checkpoint) ina vigezo na hakuna kitu kingine. Kuipakia kunampa mwendo unaofuata mwanzo bora zaidi kuliko modeli ya msingi, lakini nyakati za optimizer, nafasi ya ratiba ya learning-rate, na mpangilio wa data - vyote hivi vinaanza kutoka sifuri. Tarajia mruko wa loss mwanzoni mwa mwendo unaoendelea, usiusome kama kushindwa, wala usiuite raundi hiyo 'resume'. Ni 'warm start'.

SeraUkubwaKiwango cha GPUInference kwa kila hatua ya kitendoUmbizo la seti ya dataIdadi ya vipindi kabla haijafaa kujaribiwa
GR00T N1.7karibu 3 B, takriban 40 M zilizofunzwa wakati wa fine-tuningA100 80 GB au H100 80 GBkaribu 152 msLeRobot v2.0 au v2.150
GR00T N1.5karibu 3 BA100 80 GB au H100 80 GBkaribu 165 msLeRobot v2.0 au v2.150
Pi0.5karibu 3 B juu ya msingi (backbone) wa PaliGemmaA100 80 GB au H100 80 GBkaribu 485 msLeRobot v3.050
SmolVLAkaribu 450 MRTX 4090 au kadi yoyote ya 24 GBkaribu 245 msLeRobot v3.030
ACTkaribu 80 M, iliyofunzwa kutoka mwanzo kabisaRTX 4090 au kadi yoyote ya 24 GBkaribu 20 msLeRobot v3.050

Latency hujilimbikiza ndani ya mzunguko wa DAgger kwa namna ambayo haifanyi hivyo wakati wa onyesho la kawaida (demo): kwa karibu 485 ms kwa kila hatua ya kitendo, unachukua udhibiti kwa sababu mkono ulisitasita, si kwa sababu ulikosea, na marekebisho ya kusitasita si data yenye manufaa ya mafunzo. Ikiwa unarudia kwenye data badala ya kufuatilia kiwango cha mwisho cha mafanikio, rudia kwa modeli yenye kasi. Shukor na wenzake wanaieleza SmolVLA kama iliyoundwa kufunzwa kwa GPU moja na kutumika kwenye GPU za watumiaji wa kawaida au CPU, ikiwa na mfumo wa inference wa asynchronous unaotenganisha ubashiri wa kitendo na utekelezaji ili kuruhusu viwango vya juu zaidi vya udhibiti - sifa inayofanya mzunguko wa kuchukua udhibiti kubaki na mwitikio wa haraka.

Umbizo za seti za data pia hazibadilishani. GR00T inachukua LeRobot v2.0 au v2.1, na hazina ya Isaac-GR00T inaeleza uingizaji wake kama aina fulani ya umbizo la LeRobot v2 lenye faili la ziada la maelezo ya modality; vifunzaji vipya zaidi hapa vinatarajia v3.0. Mchanganyiko ulioundwa kwa toleo lisilo sahihi unashindwa wakati wa kupakia (load time) badala ya kuzalisha sera mbaya - hali bora zaidi ya kushindwa, ingawa bado ni nafasi ya foleni (queue slot) iliyopotea bure. nyaraka za seti ya data zinaorodhesha ni umbizo lipi kila kifunzaji kinachukua.

Mzunguko, ukiwa na uwekaji kumbukumbu tayari umefanyika

Kuchukua udhibiti kwa mkono wa kiongozi, kibodi au vitelezi; kuweka lebo ya kuingilia kati kwa kila fremu; kuweka miendo kama marekebisho au tathmini; kuunda seti ya data iliyochanganywa kwa uchaguzi wazi wa vipindi kwa kila chanzo; na kuendelea na mafunzo kutoka hatua ya ukaguzi badala ya modeli ya msingi. Kinachobaki kuwa uamuzi wako ni ni mwendo upi unahesabika kama marekebisho, ni nini kinachoingia kwenye mchanganyiko, na ni lini kiwango cha kuingilia kati kimekoma kushuka.

Angalia jinsi mzunguko wa DAgger ulivyounganishwa

Njia nne za kupoteza raundi bure

1. Kufunza kwa marekebisho pekee

Kasoro inayojitokeza zaidi na njia ya mkato inayovutia zaidi. Seti ya data ya marekebisho pekee karibu yote ni sehemu ngumu ya katikati ya kazi, huku sehemu za kukaribia na kurudi nyuma zikikosekana; sera inaboreka kwenye sehemu ngumu lakini inasahau jinsi ya kufika hapo. Uunganishaji (aggregation) si undani wa kiutekelezaji wa mbinu, ni utaratibu wenyewe: data ya zamani ndiyo inayoshikilia sehemu nyingine ya tabia mahali pake huku marekebisho yakisogeza sehemu moja tu yake.

2. Kuhamisha kamera kati ya raundi

Kamera inayohama sentimita mbili kati ya raundi inazalisha sera mbaya zaidi kuliko ile uliyoanza nayo, na uchunguzi wa tatizo unaogharimu siku nzima. Kila VLA hapa inategemea picha; hali ya viungo (joint state) pekee haiwezi kubainisha wazi mahali kitu kilipo. Piga picha ya mpangilio kabla ya raundi ya kwanza na uangalie picha hiyo kabla ya kila raundi inayofuata.

3. Kuruhusu mabaki ya upokezanaji kuingia kwenye mafunzo

Imeshughulikiwa hapo juu, na ipo kwenye orodha kwa sababu haionekani kwa urahisi. Dalili yake ni sera inayosita kwa sehemu ndogo ya sekunde mahususi pale mwendeshaji wa raundi iliyopita alipochukua udhibiti. Inaonekana kama kusitasita; kumbe ni kuiga.

4. Kuita 'warm start' kuwa 'resume'

Ikiwa unaamini kuwa hali ya optimizer iliendelea kubebwa, mruko wa mwanzo wa loss unasomeka kama hitilafu (bug) na unaanza kutafuta data iliyoharibika. Ikiwa unajua kuwa optimizer ilianza upya kabisa, mruko huo ni wa kutarajiwa na unatazama kinachofuata baada yake. Nambari zilezile, hitimisho kinyume.

Kupima raundi

Kipimo cha mzunguko unaodhibitiwa na binadamu ni kiwango cha kuingilia kati: fremu zilizorekodiwa wakati ukiwa kwenye udhibiti, zikigawanywa kwa jumla ya fremu za mwendo huo. Kipimo hiki kinapatikana kwenye hali ya takeover (takeover status), na ndicho nambari pekee inayojibu swali ambalo raundi iliuliza. Training loss hushuka bila kujali kama sera imeboreka au la; kiwango cha mafanikio (success rate) ni cha kibinary na chenye kelele kwenye idadi ndogo za sampuli anazozizalisha mkono wa dawati. Kiwango cha kuingilia kati ni endelevu, kinapimwa kwenye hali ambazo sera yenyewe ilizisababisha, na hushuka kadiri sera inavyokuhitaji wewe kidogo zaidi.

Kilinganishe tu kati ya miendo iliyorekodiwa chini ya masharti yanayofanana kabisa. Hoja kamili, na jinsi ya kujenga seti ya tathmini inayodumu zaidi ya raundi mbili, ipo katika makala kuhusu kupima mzunguko wa DAgger. Raundi ya kwanza kihalisia ni jaribio la uwezekano (feasibility test): unahakikisha kwamba kuchukua udhibiti kunafanya kazi kwenye maunzi yako, kwamba marekebisho yanatua na lebo zake, na kwamba mwendo ulioendelea umepakia hatua ya ukaguzi uliyoitaja. Raundi ya pili na ya tatu ndizo ambapo kiwango kinapaswa kuanza kubadilika. Ikiwa hakijabadilika kufikia raundi ya nne, tatizo liko juu zaidi ya DAgger yenyewe (upstream).

Andika kwa kila raundiKwa nini ni muhimu baadaye
Hatua ya ukaguzi iliyoendeshwaBila hiyo huwezi kuhusisha uboreshaji wowote na mchanganyiko fulani
Hali ya uingizaji iliyotumika kwa kuchukua udhibitiMarekebisho ya kibodi ni makali zaidi kuliko marekebisho ya kiongozi, na hilo linaonekana kwenye data
Idadi ya miendo na jinsi kila mmoja ulivyochambuliwaKama raundi ilikuwa na marekebisho ya kutosha kuwa na maana
Kiwango cha kuingilia kati kwa kila mwendo, na wastani wakeKipimo cha maendeleo cha mzunguko
Uchaguzi kamili wa vipindi kwa kila chanzoNjia pekee ya kurudufu au kutengua raundi
Warm start au mafunzo mapya kabisaInaeleza mkondo wa loss utakaoutazama baada ya wiki moja

Ikiwa bado huna hatua ya ukaguzi

Mzunguko huu hauna kiingilio bila hiyo. Rekodi seti ya kwanza ya data, funza sera ya kwanza, iendeshe - urekodiaji, mafunzo na kuendesha sera vinashughulikia njia hiyo. Kiteja (client) cha kurekodi kipo kwenye ukurasa wa kupakua, viwango vya GPU na bei za kila saa zipo kwenye ukurasa wa bei, na jinsi kipindi kinachoweza kutumika kinavyoonekana katika mwongozo wa ukusanyaji data wa SO-100. Hakikisha maonyesho ni sahihi kabla ya marekebisho: DAgger ni utaratibu wa ukarabati, na unafanya kazi vizuri zaidi kwenye kitu ambacho kilikuwa tayari karibu sahihi.

Je, ninaweza kuendesha mzunguko wa DAgger bila mkono wa kiongozi?

Ndiyo. Chagua uingizaji wa kibodi au vitelezi unapobonyeza Take over: kuchukua udhibiti hufanyika mara moja na kwa mkono, bila mkono wa pili wa kupatanisha. Kibodi hutuma misukumo ya jamaa (relative nudges) ambayo seva inaikomesha kwa ukali kwenye digrii 2 kwa kila kiungo na digrii 4 kwa gripper; vitelezi hutuma lengo kamili na seva husogea kwa upeo wa digrii 6 kuelekea lengo hilo kwa kila wito, huku kiolesura kikiendelea kutuma mkondo. Safu ya vitendo na uwekaji lebo wa kuingilia kati ni sawa kama katika hali ya kiongozi, hivyo marekebisho hayatofautiani kwenye seti ya data.

Raundi moja inahitaji marekebisho mangapi?

Hakuna nambari ya kiulimwengu inayoweza kutetewa, na idadi ya fremu ina umuhimu zaidi kuliko idadi ya vipindi. Kanuni ya vitendo ni kwamba marekebisho yasipotee ndani ya mchanganyiko: ukiwa na vipindi 200 vya asili na vipindi vitatu tu vya marekebisho, hakuna kitakachobadilika. Lenga marekebisho yanayoshughulikia tabia inayoshindwa kutoka mipangilio kadhaa tofauti ya kuanzia, badala ya marudio matatu ya uokozi uleule.

Kwa nini kufunza kwa marekebisho pekee ni wazo baya kiasi hicho?

Kwa sababu marekebisho karibu yote ni sehemu ngumu ya katikati ya kazi. Sehemu za kukaribia, kupatanisha na kurudi nyuma zinakosekana, hivyo sera inapoteza kile ilichokuwa ikifanya vizuri tayari huku ikiboreka kwenye sehemu uliyoirekebisha. Kuendelea kutunza data ya zamani na kuiongezea ndio utaratibu wenyewe, si nyongeza ya hiari.

Je, kuendelea kutoka hatua ya ukaguzi kunarudisha mwendo wa mafunzo uliopita?

Hapana. Hatua ya ukaguzi yenye uzito pekee inarejesha vigezo tu na hakuna kingine: nyakati za optimizer, nafasi ya ratiba ya learning-rate, na mpangilio wa data huanza upya kabisa. Ni 'warm start', na mruko wa mwanzo wa loss ni jambo la kutarajiwa badala ya dalili ya tatizo. Andika ni ipi kati ya hizo mbili uliyoifanya kwa hakika, ili uweze kusoma mkondo huo kwa usahihi baada ya wiki moja.

Itakuwaje ikiwa kiwango cha kuingilia kati hakishuki?

Acha kuongeza raundi. Kiwango kilichokaa tuli kinamaanisha kuwa marekebisho hayafundishi kile unachodhani. Sababu za kawaida ziko juu zaidi katika mchakato (upstream): kamera imehama, marekebisho yanaanza kuchelewa mno kuwa data ya kuepuka, fremu za upokezanaji zipo ndani ya seti ya mafunzo, au kazi haijabainishwa vya kutosha kutokana na uchunguzi ambao sera inaupata kwa hakika.

Hakuna hata mojawapo ya haya iliyo tatizo lililotatuliwa kikamilifu, wala hakuna hata moja linalofanyika kwa mbofyo mmoja tu. Ujifunzaji wa kuiga wa kimaingiliano (interactive imitation learning) ni eneo la utafiti linaloendelea kwa nguvu hasa kwa sababu maswali yake - lini kuingilia kati, jinsi ya kupanga uzito wa kile alichofanya binadamu, ni kiasi gani cha data ya zamani cha kuendelea kukitunza - hayana majibu yaliyokaa imara; uchunguzi wa jumla wa Celemin na wenzake unaonyesha ramani ya yale ambayo bado ni maswali wazi. Kilicho na uhakika ni kwamba mzunguko huu una muunganiko unaoweza kupimwa endapo unaendeshwa kwa uangalifu, kwenye maunzi yanayogharimu mamia machache ya euro. Ganda mpangilio, ingilia kati mapema, chambua kwa uaminifu, changanya kwa makusudi, na rekodi kiwango cha kuingilia kati kila wakati.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started