Blog
Insights on robotics, AI, and data collection

Rulare a unui ciclu DAgger pe SO-100 cu o politică VLA
Un raport pas-cu-pas al unei runde DAgger controlate de om pe un braț SO-100: rulează politica și înregistreaz-o, preia controlul când merge prost, clasifică rularea ca o corectare, compune un dataset mixt și continuă antrenamentul dintr-un punct de control. Include calea de preluare prin tastatură și glisor pentru cei fără un braț lider, și cele patru greșeli care fac o rundă nefolositoare.

Măsurarea unei bucle DAgger: rata de intervenție, protocol de evaluare și capcane din cale
Rata de intervenție - cadre de intervenție împărțite la cadrele rulării - este semnalul cel mai ieftin și onest de progres pe care o buclă DAgger controlată de om o poate avea. Acest articol o definește pentru ca doi oameni să calculeze aceeași valoare, arată cum s-o înregistreze, și trece prin patru moduri în care te induce în eroare: habituarea operatorului, o metodă de evaluare care se deplasează, antrenarea numai pe corecții, și un om care corectează diferit marți decât luni.

HG-DAgger și variantele Gated: Cine hotărăște când să preia o politică de robot
DAgger simplu cere unui om să eticheteze stări în timp ce robotul încă se mișcă. Pe hardware real asta e nesigur și produce etichete proaste. Variantele gated înlocuiesc etichetarea oarbă cu o poartă pe care cineva trebuie să o țină: omul în HG-DAgger, un clasificator de siguranță în SafeDAgger, dezacordul unui ensemble în EnsembleDAgger, o estimare a novelității și riscului cu buget în ThriftyDAgger. Acest articol le compară după cine deține poarta, ce semnal o deschide și ce costă fiecare — și de ce forma cu poartă umană e cea care supraviețuiește contactul cu un braț real.

DAgger Explicat: De ce Behavior Cloning Se Abate și Ce Dovedește Agregarea Setului de Date
Behavior cloning se potrivește o politică pe distribuția stării expertului și este apoi implementată de la sine. Diferența dintre acele două distribuții este motivul pentru care o politică care pare bună în validare se cade de pe masă la pasul 300. Acesta este capitolul de teorie din seria noastră DAgger: de unde provine termenul de eroare pătratică, ce schimbă agregarea setului de date, ce presupune dovada de non-regret, și ce parte din cost trebuie încă plătită de expertul uman.

Utilizarea DROID, BridgeData V2 și Open X pe un SO-100
DROID, BridgeData V2 și Open X-Embodiment se convertesc în acțiuni de efector final 7-D pe brațe cu 6 și 7 grade de libertate. Un SO-100 preia 6 poziții de articulație. Ce se transferă, ce nu, ce să faci în schimb.

Date Sintetice pentru Politici Robotice: Unde Simulația Ajută
Simulația poate multiplica o mână de demonstrații în mii. Iată ce spun cu adevărat numerele publicate, unde decalajul sim-to-real se face simțit și ce trebuie încă înregistrat.

Modele VLA Mici: TinyVLA, SmolVLA și Cazul Sub-1B
TinyVLA și SmolVLA aduc un VLA funcțional sub 1 miliard de parametri. Numere reale din ambele lucrări, setările implicite lerobot, latența măsurată și costul unei rulări pe o placă de 24 GB.

Rulează inferența GR00T Fără un GPU Local
Mașina ta robotică nu are GPU. Pune serverul de politici GR00T pe un GPU în cloud închiriat, transmite pachete de acțiuni către braț și află exact cât te costă rețeaua.

Cum să antrenezi ACT pe SO-100 de la zero
Antrenează un Action Chunking Transformer de la zero pe un SO-100 cu lerobot: configurația act, chunk_size și n_action_steps, programul de 100000 de pași, inferență de 20 ms.

Ce politică VLA ar trebui să antrenați în 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT sau GR00T N1.5? Un tabel de decizie adaptat la situații reale, cu numerele de referință publicate, latența, costul per rulare și licențele din spatele fiecărei alegeri.

Costul Antrenamentului VLA: Cât Costă cu Adevărat o Rulare de Fine-Tuning
Prețuri reale ale GPU-urilor pe piața spot, cât durează rularea fiecăreia dintre cele cinci politici, cât costă brațul și demonstrațiile, și cele patru locuri unde banii dispar în liniște.

Înregistrează Primul Tău Set de Date LeRobot cu un SO-100
Înregistrează un set de date LeRobot utilizabil cu un SO-100: calibrare, teleoperare lider-urmăritor, flag-urile și valorile implicite reale ale lerobot-record, configurația camerei, numărul de episoade și defectele care compromit o rulare.

Cum să antrenezi SmolVLA pe un GPU de 24 GB (lerobot 0.6.1)
SmolVLA este un VLA cu 450 M parametri care se reglează fin pe o singură placă de 24 GB. Comenzi reale lerobot 0.6.1, setările implicite efective, capcanele care au costat o zi și costul unei rulări.

Cum să antrenezi Pi0.5 pe propriile date de robot
Reglează fin Pi0.5, VLA-ul de tip flow-matching de la Physical Intelligence, pe propriile date de robot. Comenzi reale pentru openpi și lerobot pi05, capcanele formatului setului de date, limitele VRAM și ale latenței.

Cum să antrenezi GR00T N1.7 pe propriul tău set de date SO-100
Un ghid testat pentru reglarea fină a NVIDIA GR00T N1.7 pe un set de date LeRobot SO-100: flag-uri reale, modality.json, cerința v2.1, cât costă o rulare și capcanele.
RoboTurk: Învățare Robotică prin Crowdsourcing prin Teleoperație de la Distanță
Descoperiți cum RoboTurk revoluționează învățarea robotică prin crowdsourcing de date de înaltă calitate prin teleoperație de la distanță, permițând seturi de date scalabile pentru modelele AI în robotică. Explorați impactul său asupra învățării prin imitație, modelelor VLA și ROI pentru companiile de robotică.
Politici Robotizate Pi-Zero de Potrivire a Fluxului: Revoluționarea Controlului Dexter cu Inițializare VLM
Descoperiți cum tehnica de potrivire a fluxului Pi-Zero, combinată cu inițializarea VLM, transformă politicile robotizate generaliste pentru controlul dexter. Aflați despre avantajele sale față de metodele tradiționale, eficiența în datele de antrenament AI pentru robotică și implicațiile pentru implementarea scalabilă a roboților în industrii.
Isaac Lab: Simulare GPU de ultimă generație pentru învățarea multimodală a roboților
Descoperiți cum Isaac Lab de la NVIDIA revoluționează învățarea multimodală a roboților prin simulări accelerate de GPU, permițând antrenarea mai rapidă a AI, implementarea scalabilă și rentabilitatea optimizată a investiției pentru cercetătorii și companiile din domeniul roboticii.
Isaac Gym: Simulare fizică nativă GPU pentru învățarea roboților - Scalarea a mii de medii paralele
Descoperiți cum Isaac Gym revoluționează învățarea roboților cu simularea fizică nativă GPU, permițând mii de medii paralele pentru învățarea rapidă prin consolidare, antrenarea modelelor VLA și teleoperația eficientă a roboților AI. Explorați benchmark-uri, integrarea cu PyTorch și aplicații din lumea reală care reduc decalajul sim-to-real.
BridgeData V2: Date de robot la scară redusă - Ce metode de învățare prin imitație și RL offline beneficiază de fapt
Explorați modul în care BridgeData V2 oferă date de robot la scară redusă, îmbunătățind metodele de învățare prin imitație și învățarea prin consolidare offline. Descoperiți reperele cheie, modelele VLA în robotică și fluxurile de lucru eficiente de teleoperație robot pentru colectarea datelor de antrenament AI.
Politici de potrivire a fluxului Pi-Zero: Revoluționarea controlului dexter cu inițializarea VLM
Descoperiți modul în care tehnica de potrivire a fluxului Pi-Zero, combinată cu inițializarea VLM, transformă politicile robotice generaliste pentru controlul dexter. Aflați despre avantajele sale față de metodele tradiționale, eficiența în datele de instruire AI pentru robotică și implicațiile pentru implementarea scalabilă a roboților în industrii.
RT-2: De ce datele de antrenament de înaltă calitate pentru roboți depășesc algoritmii – Perspectivele revoluționare ale Google DeepMind
Descoperiți cum modelul RT-2 de la Google DeepMind revoluționează robotica AI, subliniind rolul critic al datelor de antrenament de înaltă calitate în detrimentul algoritmilor avansați. Acest articol analizează experimentele care demonstrează de ce colectarea eficientă a datelor este esențială pentru performanța roboților în lumea reală. Aflați cum platforme precum AY-Robots pot ajuta la reducerea decalajului în datele de antrenament pentru inovațiile viitoare.
RT-2 de la Google DeepMind: Cum Acest Model Viziune-Limbaj-Acțiune Transformă Învățarea Robotică
Descoperiți cum modelul Viziune-Limbaj-Acțiune (VLA) RT-2 de la Google remodelează învățarea robotică prin integrarea datelor vizuale, a limbajului natural și a acțiunilor în timp real. Această tehnologie AI inovatoare îmbunătățește colectarea de date pentru teleoperatori și crește eficiența în aplicațiile robotice. Explorați impactul său potențial asupra viitorului roboților conduși de AI la AY-Robots.