Blog
Insights on robotics, AI, and data collection

DAgger-ciklus futtatása SO-100 karon VLA-policyval
Lépésről lépésre bemutatott, emberi kapuzású DAgger-kör egy SO-100 karon: futtasd a policyt és rögzítsd, vedd át az irányítást, amikor elromlik, jelöld meg a futást korrekcióként, állíts össze egy kevert adathalmazt, és folytasd a tréninget egy checkpointból. Tartalmazza a billentyűzetes és csúszkás átvételi utat azoknak, akiknek nincs leader karjuk, valamint azt a négy hibát, amelyektől egy kör értéktelenné válik.

DAgger-hurok mérése: Intervention Rate, Evaluációs protokoll és közötte lévő csapda
Az intervention rate - intervention frame-ek osztva a futás frame-jeivel - a legolcsóbb őszinte haladási jel, amit egy emberi kapuval felügyelt DAgger-hurok rendelkezhet. Ez a cikk úgy definiálja, hogy két ember ugyanazt az értéket számítja ki, bemutatja, hogyan kell naplózni, és végigmegy a négy módon, ahogyan megtéveszti: operátor szokásosság, sodródó értékelési beállítás, csak korrektálással történő tanulás és egy olyan ember, aki hétfőn másként korrigál, mint kedden.

A HG-DAgger és a kapu variánsai: Ki dönt a robot policy átvételéről
A sima DAgger azt kéri, hogy egy ember címkézze a államokat, miközben a robot még vezet. Valódi hardveren ez nem biztonságos és rossz címkéket termel. Az adapost variánsai az őszinte címkézést egy kapu helyettesítik, amelyet valakinek meg kell tartania: a humán a HG-DAggerben, egy biztonsági osztályozó a SafeDAggerben, egy ensemble ellentmondása az EnsembleDAggerben, egy költségvetés-korlátozott újdonság- és kockázatbecslés a ThriftyDAggerben. Ez a cikk összehasonlítja őket aszerint, hogy ki tulajdonosa a kapunak, milyen jel nyitja meg, és mennyibe kerül mindegyik — és miért a humán-felügyelt forma az, amely túlél a valódi kar kontaktusát.

DAgger Magyarázata: Miért csúszik el a Behavior Cloning és Mit Bizonyít Ténylegesen az Adatsor Aggregáció
A behavior cloning egy háziállamot a szakértő állapot-eloszlásán illeszkedik, majd az önmaga helyén telepítik. A két eloszlás közötti rés az oka annak, hogy egy háziállam, amely validáláskor rendben néz ki, a 300. lépésben leesik az asztalról. Ez az elméleti fejezet a DAgger-sorozatunkban: ahonnan a négyzetes hibatag származik, mit változtat az adatsor aggregáció, mit feltételez a no-regret bizonyítás, és a számlának mely részét kell még a humán szakértőnek fizetnie.

DROID, BridgeData V2 és Open X használata SO-100-on
A DROID, BridgeData V2 és Open X-Embodiment 7 dimenziós végrehajtó (end-effector) műveletekké alakul át 6 és 7 szabadságfokú karokon. Egy SO-100 6 ízületi pozíciót fogad. Mi vihető át, mi nem, és mit tegyünk helyette.

Szintetikus adatok robotpolitikákhoz: Ahol a szimuláció segít
A szimuláció néhány demonstrációt ezrekké sokszorozhat. Íme, mit mondanak valójában a publikált számok, hol harap a szimuláció-valóság rés, és mit kell még rögzíteni.

Kis VLA modellek: TinyVLA, SmolVLA és az 1 milliárd paraméter alatti eset
A TinyVLA és a SmolVLA működő VLA-t helyez 1 milliárd paraméter alá. Valós számok mindkét tanulmányból, a lerobot alapértelmezései, mért késleltetés, és mennyibe kerül egy futtatás egy 24 GB-os kártyán.

GR00T következtetés futtatása helyi GPU nélkül
A robotgépe nem rendelkezik GPU-val. Helyezze a GR00T irányelv szervert egy bérelt felhő alapú GPU-ra, streamelje az akciócsomagokat a karra, és tudja meg pontosan, mennyibe kerül a hálózati forgalom.

Hogyan képezzünk ACT-t az SO-100-on a nulláról
Képezzünk egy Action Chunking Transformert a nulláról egy SO-100-on a lerobot segítségével: az act config, chunk_size és n_action_steps, a 100000 lépéses ütemezés, 20 ms-os következtetés.

Melyik VLA irányelvet érdemes betanítani 2026-ban?
GR00T N1.7, Pi0.5, SmolVLA, ACT vagy GR00T N1.5? Egy döntési táblázat valós helyzetekhez igazítva, a közzétett benchmark számokkal, késleltetéssel, futásonkénti költséggel és az egyes választások mögötti licencekkel.

VLA Képzési Költség: Mennyibe Kerül Valójában Egy Finomhangolási Futtatás
Valós spot-piaci GPU árak, mennyi ideig fut mind az öt irányelv, mennyibe kerül a kar és a demonstrációk, és az a négy hely, ahol a pénz csendben eltűnik.

Rögzítse első LeRobot adatkészletét egy SO-100-zal
Rögzítsen egy használható LeRobot adatkészletet egy SO-100-zal: kalibrálás, vezető-követő távvezérlés, a valós lerobot-record jelzők és alapértelmezések, kamera beállítása, epizódok száma, és a hibák, amelyek tönkretesznek egy futtatást.

Hogyan képezzük a SmolVLA-t egy 24 GB-os GPU-n (lerobot 0.6.1)
A SmolVLA egy 450 millió paraméteres VLA, amely egyetlen 24 GB-os kártyán finomhangolható. Valós lerobot 0.6.1 parancsok, a tényleges alapértelmezések, az egy napba kerülő csapdák, és mennyibe kerül egy futtatás.

Hogyan képezzük a Pi0.5-öt saját robotadatainkon
Finomhangolja a Pi0.5-öt, a Physical Intelligence áramlás-illesztő VLA-ját, saját robotadataival. Valós parancsok az openpi és lerobot pi05 számára, adathalmaz formátum csapdák, VRAM és késleltetési korlátok.

Hogyan képezzük a GR00T N1.7-et saját SO-100 adatkészletünkön
Egy tesztelt útmutató az NVIDIA GR00T N1.7 finomhangolásához egy SO-100 LeRobot adatkészleten: valós flag-ek, modality.json, a v2.1 követelmény, egy futtatás költségei és a buktatók.
RT-2: Hogyan viszik át a látás-nyelv-akció modellek a webes tudást a robotvezérlésbe
Fedezze fel, hogyan forradalmasítja a Google RT-2 látás-nyelv-akció modellje a robotvezérlést azáltal, hogy webes tudást visz át fizikai cselekvésekbe. Ismerje meg architektúráját, képzési módszereit, újonnan megjelenő képességeit és a robotikai vállalatokra és operátorokra gyakorolt hatásait, beleértve a teleoperációval való integrációt a hatékony AI képzés érdekében.
RoboTurk: Robot Tanulás Közösségi Beszerzése Távoli Teleoperációval
Fedezze fel, hogyan forradalmasítja a RoboTurk a robot tanulást azáltal, hogy kiváló minőségű adatokat szerez be közösségi forrásból távoli teleoperációval, lehetővé téve a skálázható adatkészleteket a robotika AI modelljei számára. Fedezze fel a hatását az utánzó tanulásra, a VLA modellekre és a robotikai vállalatok ROI-jára.
Pi-Zero Flow-Matching Robotirányelvek: A VLK Inicializálással Forradalmasítják a Ügyes Vezérlést
Fedezze fel, hogyan alakítja át a Pi-Zero flow-matching technikája, a VLK inicializálással kombinálva, az általános robotirányelveket az ügyes vezérléshez. Ismerje meg a hagyományos módszerekkel szembeni előnyeit, a robotika AI képzési adatainak hatékonyságát és a skálázható robottelepítés iparágakra gyakorolt hatásait.
RT-2: Miért múlja felül a kiváló minőségű robotikai képzési adat az algoritmusokat – A Google DeepMind korszakalkotó meglátásai
Fedezze fel, hogyan forradalmasítja a Google DeepMind RT-2 modellje a mesterséges intelligencia robotikát azáltal, hogy a fejlett algoritmusok helyett a kiváló minőségű képzési adatok kritikus szerepét hangsúlyozza. Ez a cikk lebontja azokat a kísérleteket, amelyek bemutatják, hogy a hatékony adatgyűjtés miért elengedhetetlen a valós robotikai teljesítményhez. Ismerje meg, hogyan segíthetnek az olyan platformok, mint az AY-Robots áthidalni a képzési adatok hiányát a jövőbeli innovációkhoz.
RT-2 a Google DeepMind-től: Hogyan alakítja át ez a látás-nyelv-akció modell a robotok tanulását
Fedezze fel, hogyan formálja át a Google RT-2 látás-nyelv-akció (VLA) modellje a robotok tanulását a vizuális adatok, a természetes nyelv és a valós idejű akciók integrálásával. Ez az innovatív AI technológia javítja a teleoperátorok adatgyűjtését és növeli a hatékonyságot a robotikai alkalmazásokban. Fedezze fel a mesterséges intelligencia által vezérelt robotok jövőjére gyakorolt potenciális hatását az AY-Robots-nál.