Antrenarea policy
AY-Robots antrenează policy de manipulare pe GPU-uri gestionate, astfel încât puteți ajunge de la episoade înregistrate la o policy care rulează pe brațul dumneavoastră fără a deține hardware de antrenare. Această pagină acoperă tipurile de policy suportate, pagina de rulare a antrenării, checkpoint-urile și la ce rezultate se poate aștepta realist în funcție de numărul de episoade.
Ultima actualizare 2026-08-09
Antrenare fără propriul GPU
Antrenarea unei policy de manipulare este o sarcină pentru GPU, iar modelele moderne vision-language-action au nevoie de mai mult VRAM decât are o stație de lucru obișnuită. Pe AY-Robots, antrenarea rulează pe GPU-uri în cloud gestionate de platformă: alegeți un set de date și un tip de policy, porniți rularea și urmăriți progresul din browser. Nu este nevoie de configurare CUDA, de potrivirea driverelor sau de întreținerea unui mediu.
Intrarea este întotdeauna un set de date din cloud, din Dashboard > Datasets. Orice ați înregistrat prin sesiuni de teleoperare sau ați încărcat în format LeRobot este eligibil, inclusiv seturile de date îmbinate. Curatoriați înainte de a antrena: episoadele etichetate Failure de regulă nu au ce căuta în setul de antrenare, iar zece minute de revizuire în browserul de episoade economisesc ore de timp GPU cheltuit pe învățarea din demonstrații proaste.
Policy suportate
Sunt suportate patru familii de policy. Diferă prin dimensiune, cost de antrenare și cât de mult pot absorbi din datele dumneavoastră, deci alegerea corectă depinde mai mult de sarcina și setul dumneavoastră de date decât de orice clasament general.
| Policy | Tip | Caracteristici |
|---|---|---|
| ACT | Transformer, action chunking | Prezice blocuri scurte de acțiuni viitoare în loc de pași individuali. Compactă, se antrenează relativ rapid și este o primă alegere solidă pentru o singură sarcină bine definită. |
| Diffusion Policy | Diffusion pe secvențe de acțiuni | Modelează întreaga distribuție a acțiunilor demonstrate, ceea ce ajută atunci când demonstrațiile dumneavoastră rezolvă sarcina în mai multe moduri valide. Mai grea la antrenare și mai lentă la inferență decât ACT. |
| SmolVLA | Model vision-language-action mic | Condiționat lingvistic: textul sarcinii din episoadele dumneavoastră devine parte din intrare. O opțiune bună de mijloc dacă vreți condiționare lingvistică fără un model foundation mare. |
| Fine-tune GR00T | Fine-tuning al unui model foundation | Face fine-tuning unui model foundation mare, preantrenat pentru robotică, pe episoadele dumneavoastră. Cel mai înalt plafon dintre cele patru, la cel mai mare cost de antrenare, cu o cerință strictă privind formatul setului de date. |
Fine-tuning-ul GR00T acceptă exclusiv seturi de date în versiunea de format LeRobot 2.1. Un set de date v3.0 va eșua la încărcarea datelor, nu la trimitere, deci verificați versiunea formatului înainte de a porni rularea. Seturile de date înregistrate pe platformă pot fi folosite ca atare; pentru încărcările externe, verificați mai întâi versiunea din meta/info.json.
Pornirea unei rulări
- 1Alegeți setul de date
Deschideți Dashboard > Training și selectați setul de date pe care vreți să antrenați. Numărul de episoade și tipul robotului sunt afișate pentru a confirma că ați ales cel corect.
- 2Alegeți policy
Selectați unul dintre tipurile de policy suportate. Dacă nu sunteți sigur, începeți cu ACT: este cea mai ieftină cale de a afla dacă setul dumneavoastră de date este suficient de bun pentru a antrena orice.
- 3Lansați
Porniți rularea. Aceasta primește un job id și o pagină proprie de rulare, iar dumneavoastră puteți închide browserul: antrenarea continuă pe server, iar pagina arată starea live de fiecare dată când reveniți.
Pagina rulării de antrenare
Fiecare rulare are o pagină dedicată care răspunde la cele două întrebări pe care le aveți de fapt în timpul antrenării: învață și este mașina sănătoasă. Progresul învățării este afișat ca grafice ale loss-ului, ale programului learning rate și ale normei gradientului. Un loss care se stabilizează imediat sau o normă a gradientului care explodează vă spun devreme că nu merită să așteptați rularea respectivă.
Alături este afișată sănătatea mașinii: utilizarea și memoria GPU, plus metricile hostului mașinii de antrenare. O cronologie a fazelor arată unde se află rularea în prezent, de la pregătirea mediului, prin încărcarea datelor și bucla de antrenare propriu-zisă, până la încărcarea checkpoint-ului. Când ceva pare în neregulă, vizualizatorul de jurnale integrat oferă jurnalele brute de antrenare fără niciun acces SSH, ceea ce este de obicei suficient pentru a vedea dacă eșecul provine din setul dumneavoastră de date sau din rularea în sine.
Checkpoint-uri și reluare
Checkpoint-urile sunt stocate per rulare, nu într-un pool comun, astfel încât checkpoint-urile listate pe o pagină de rulare aparțin întotdeauna exact acelei rulări și configurației sale. Acest lucru contează mai mult decât pare: amestecarea checkpoint-urilor între rulări cu setări diferite este o sursă clasică de policy stricate silențios.
Dacă o rulare este întreruptă, puteți relua de la ultimul ei checkpoint, în loc să porniți de la zero. Checkpoint-urile intermediare sunt utile și de sine stătător: când o rulare lungă începe să supraînvețe spre final, un checkpoint anterior funcționează adesea mai bine pe brațul real decât cel final.
Rularea policy antrenate pe brațul dumneavoastră
O policy finalizată poate fi redistribuită direct pe robotul dumneavoastră. În cockpit, selectați policy antrenată pentru brațul dumneavoastră conectat și porniți inferența: policy produce acum comenzile de articulații pe care înainte le produceați dumneavoastră prin teleoperare. Brațul trebuie să fie de același tip de robot pe care a fost înregistrat setul de date, iar scena ar trebui să semene cu scenele de antrenare, inclusiv poziționarea camerelor.
Tratați primele rulări de inferență ca experimente, nu ca demonstrații. Țineți oprirea de urgență la îndemână, porniți dintr-o stare inițială apropiată de ceea ce ați demonstrat și așteptați-vă ca policy să fie sensibilă la lucruri pe care nu le-ați observa: o cameră mutată, o iluminare diferită sau un obiect pe care setul de date nu l-a conținut niciodată.
Câte episoade aveți nevoie
Cea mai frecventă greșeală de antrenare pe platformă nu este un hiperparametru greșit, ci antrenarea pe prea puține date, urmată de concluzia că tipul de policy nu funcționează. Ca regulă generală pentru o singură sarcină pe masă: în jur de 50 de episoade produc o policy cu generalizare îngustă, care reușește din stări inițiale apropiate de cele demonstrate. Aproximativ 100 până la 200 de episoade oferă o robustețe utilizabilă în tot spațiul de lucru pentru sarcina respectivă, cu condiția să fi variat poziționarea obiectelor între episoade.
Tipurile de policy mai capabile nu anulează această regulă. Un fine-tune GR00T pe 20 de episoade tot va generaliza slab; ceea ce modelele mai mari vă oferă este un plafon mai ridicat odată ce datele există. Dacă bugetul dumneavoastră este limitat, cheltuiți-l mai întâi pe episoade mai numeroase și mai variate, abia apoi pe un model mai mare.
Întrebări frecvente
Cât durează o rulare de antrenare?▾
Depinde de tipul de policy și de dimensiunea setului de date, deci nu există o cifră unică onestă. ACT este de obicei cea mai rapidă dintre cele patru, fine-tune-urile GR00T cele mai lente. Cronologia fazelor și graficele de loss de pe pagina rulării arată devreme dacă o rulare progresează.
Pot antrena pe un set de date îmbinat?▾
Da. Seturile de date îmbinate sunt seturi de date obișnuite; validarea de îmbinare a garantat deja fps, feature-uri și tip de robot consistente. Îmbinarea înregistrărilor aceleiași sarcini este una dintre cele mai eficiente metode de a ajunge în intervalul de 100 până la 200 de episoade.
Rularea mea GR00T eșuează la încărcarea datelor. Ce verific mai întâi?▾
Versiunea formatului setului de date. Fine-tuning-ul GR00T necesită LeRobot v2.1, iar un set de date v3.0 eșuează exact aici. Verificați versiunea în meta/info.json al setului dumneavoastră de date.
Ar trebui să elimin episoadele eșuate înainte de antrenare?▾
De obicei da. Episoadele etichetate Failure învață policy comportamentul eșuat. Episoadele Recovery sunt diferite: arată cum se corectează o greșeală și adesea merită păstrate.
Trebuie să țin browserul deschis în timpul antrenării?▾
Nu. Rulările se execută pe server. Pagina rulării arată starea curentă, graficele și jurnalele de fiecare dată când reveniți, iar checkpoint-urile sunt salvate indiferent dacă cineva urmărește sau nu.
Cum stochează AY-Robots înregistrările de teleoperare în format LeRobot: structura episoadelor, browserul de episoade, îmbinarea și piața de date.
Fiecare braț robotic suportat pe AY-Robots cu specificațiile sale: SO-100, Koch v1.1, Franka FR3, FP3 și Panda, WidowX-250 și ALOHA ViperX-300.