Blog
Insights on robotics, AI, and data collection

Drejtimi i një DAgger Loop në një SO-100 me një VLA Policy
Një përshkrim hap pas hapi i një raundi DAgger me kontroll njerëzor në një krah SO-100: drejtoje politikën dhe regjistroje atë, merre kontrollin kur shkon gabim, regjistroje si korrigjim, kombinoj një grup të dhënash të përzier, dhe vazhdo trajnimin nga një kontrol. Përfshin shtegën e marrjes së kontrollit me tastierë dhe rrëshqitëse për njerëzit pa një krah udhëheqës, dhe katër gabimet që bëjnë një raund të padobishëm.

Matja e një Sylfate DAgger: Shpejtësia e Intervenimit, Protokolli i Vlerësimit dhe Kurthot në Mes
Shpejtësia e intervenimit - kornizat e intervenimit të ndarë me kornizat e drejtimit - është sinjali më i lirë i përparimit të sinqertë që ka një sylfate DAgger e kontrolluar nga njerëz. Ky artikull e përcakton atë në mënyrë që dy njerëz të llogarisin të njëjtën vlerë, tregon se si ta regjistrojnë atë dhe kalon përmes katër mënyrave sesi e mashtron jua: habituimi i operatorit, një rregullim vlerësimi në lëvizje, trajnimi vetëm në korrigjime dhe një njeri që korrigjon ndryshe të martën se sa të hënën.

HG-DAgger dhe Variantet e Portës: Kush Vendos Kur të Merr Kontrollin e Një Politike Roboti
DAgger i thjeshtë kërkon nga një njeri të etiketojë gjendjet ndërsa roboti po vozit ende. Në harduerin real, kjo është e pasigurt dhe prodhon etiketa të dobëta. Variantet e portës zëvendësojnë etiketimin verbë me një portë që dikush duhet të mbajë: njeriu në HG-DAgger, një klasifikator sigurie në SafeDAgger, mospajtimet e një ansambli në EnsembleDAgger, një vlerësim të buxhetuar të novezes dhe riskut në ThriftyDAgger. Ky artikull i krahason ato sipas kujt i përket porta, çfarë sinjali e hap atë dhe sa kushton secila — dhe pse forma e kontrolluar nga njeriu është ajo që mbijetoi kontaktin me një krah real.

DAgger Shpjeguar: Pse Behavior Cloning Zhvendoset dhe Çfarë Vërtetojnë në të Vërtetë Dataset Aggregation-i
Behavior cloning përshtatet një politikë në shpërndarjen e gjendjeve të ekspertit dhe më pas vendoset në vetvete. Hendeku midis atyre dy shpërndarjeve është arsyeja pse një politikë që duket mirë në validim bie nga tabela në hapin 300. Ky është kapitulli i teorisë të serisë tonë të DAgger: ku vjen termi i gabimit kuadratik, çfarë ndryshon agregimi i të dhënave, çfarë supozon prova pa pendim, dhe cili është pjesa e faturës që eksperti njerëzor ende duhet të paguajë.

Përdorimi i DROID, BridgeData V2 dhe Open X në një SO-100
DROID, BridgeData V2 dhe Open X-Embodiment konvertohen në veprime të fund-efektorit 7-D në krahë me 6 dhe 7-DoF. Një SO-100 merr 6 pozicione nyjesh. Çfarë transferohet, çfarë jo, çfarë të bëni në vend të kësaj.

Të Dhëna Sintetike për Politikat e Robotëve: Ku Ndihmon Simulimi
Simulimi mund të shumëzojë një grusht demonstrimesh në mijëra. Këtu është ajo që thonë vërtet numrat e publikuar, ku ndikon hendeku sim-në-real, dhe çfarë duhet ende të regjistrohet.

Modele të Vogla VLA: TinyVLA, SmolVLA dhe Rasti Nën-1B
TinyVLA dhe SmolVLA vendosin një VLA funksional nën 1 miliard parametra. Numra realë nga të dyja punimet, parametrat e paracaktuar të lerobot, vonesa e matur, dhe sa kushton një ekzekutim në një kartë 24 GB.

Ekzekutoni Inferencën GR00T Pa një GPU Lokale
Makina juaj robotike nuk ka GPU. Vendosni serverin e politikave GR00T në një GPU të marrë me qira në re, transmetoni pjesë veprimesh te krahu dhe mësoni saktësisht se çfarë ju kushton rrjeti.

Si të Trajnosh ACT në SO-100 nga Zero
Trajnoni një Action Chunking Transformer nga zero në një SO-100 me lerobot: konfigurimi i act, chunk_size dhe n_action_steps, orari i 100000 hapave, inferenca 20 ms.

Cilën Politikë VLA Duhet të Trajnoni në 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT apo GR00T N1.5? Një tabelë vendimmarrjeje e përshtatur me situata reale, me numrat e publikuar të benchmark-ut, latencën, koston për ekzekutim dhe licencat pas çdo zgjedhjeje.

Kostoja e Trajnimit VLA: Sa Kushton Vërtet një Rul Fine-Tuning
Çmimet reale të GPU-ve në tregun spot, sa kohë zgjat ekzekutimi i secilës prej pesë politikave, sa kushton krahu dhe demonstrimet, dhe katër vendet ku paratë zhduken në heshtje.

Regjistroni Setin tuaj të Parë të Dhënave LeRobot Me një SO-100
Regjistroni një set të dhënash LeRobot të përdorshëm me një SO-100: kalibrimi, teleoperimi udhëheqës-ndjekës, parametrat dhe vlerat e paracaktuara reale të lerobot-record, konfigurimi i kamerës, numri i episodeve dhe defektet që prishin një ekzekutim.

Si të Trajnosh SmolVLA në një GPU 24 GB (lerobot 0.6.1)
SmolVLA është një VLA me 450 M parametra që përshtatet imët në një kartë të vetme 24 GB. Komanda reale të lerobot 0.6.1, parametrat e paracaktuar aktualë, kurthet që kushtojnë një ditë, dhe sa kushton një ekzekutim.

Si të trajnoni Pi0.5 në të dhënat tuaja të robotit
Rregulloni imët Pi0.5, VLA-në e përputhjes së fluksit nga Physical Intelligence, në të dhënat tuaja të robotit. Komanda reale për openpi dhe lerobot pi05, kurthe të formatit të grupit të të dhënave, kufizime të VRAM-it dhe vonesës.

Si të Trajnoni GR00T N1.7 në Setin Tuaj të të Dhënave SO-100
Një udhëzues i testuar për rregullimin e imët të NVIDIA GR00T N1.7 në një set të dhënash LeRobot SO-100: flag-et reale, modality.json, kërkesa v2.1, sa kushton një ekzekutim, dhe kurthet.
RoboTurk: Mësimi i Robotëve me Burime të Jashtme Përmes Teleoperacionit të Largët
Zbuloni se si RoboTurk revolucionarizon mësimin e robotëve duke siguruar të dhëna me cilësi të lartë përmes teleoperacionit të largët, duke mundësuar grupe të dhënash të shkallëzueshme për modelet AI në robotikë. Eksploroni ndikimin e tij në mësimin e imitimit, modelet VLA dhe ROI për kompanitë e robotikës.
Politikat Robotike Pi-Zero për Përputhjen e Rrjedhës: Revolucionarizimi i Kontrollit të Shkathët me Inicializimin VLM
Zbuloni se si teknika e përputhjes së rrjedhës Pi-Zero, e kombinuar me inicializimin VLM, po transformon politikat robotike të përgjithshme për kontroll të shkathët. Mësoni rreth avantazheve të saj ndaj metodave tradicionale, efikasitetit në të dhënat e trajnimit të AI për robotikë dhe implikimeve për vendosjen e robotëve të shkallëzueshëm në industri.
RT-2: Pse Të Dhënat Cilësore të Trajnimit të Robotëve Eklipsojnë Algoritmet – Zbulimet Që Ndryshojnë Loën e Google DeepMind
Zbuloni se si modeli RT-2 i Google DeepMind revolucionarizon robotikën e AI duke theksuar rolin kritik të të dhënave cilësore të trajnimit mbi algoritmet e avancuara. Ky artikull analizon eksperimentet që demonstrojnë pse mbledhja efektive e të dhënave është thelbësore për performancën e robotëve në botën reale. Mësoni se si platformat si AY-Robots mund të ndihmojnë në mbylljen e hendekut në të dhënat e trajnimit për inovacione të ardhshme.
RT-2 nga Google DeepMind: Si Ky Model Vizioni-Gjuhë-Veprim po Transformon Mësimin e Robotëve
Zbuloni se si modeli Vizioni-Gjuhë-Veprim (VLA) RT-2 i Google po riformëson mësimin e robotëve duke integruar të dhëna vizuale, gjuhë natyrore dhe veprime në kohë reale. Kjo teknologji inovative e AI përmirëson mbledhjen e të dhënave për teleoperatorët dhe rrit efikasitetin në aplikimet e robotikës. Eksploroni ndikimin e tij të mundshëm në të ardhmen e robotëve të drejtuar nga AI në AY-Robots.