Blog
Insights on robotics, AI, and data collection

Kørsel af en DAgger Loop på en SO-100 med en VLA-politik
En trin-for-trin-fremstilling af én human-gated DAgger-runde på en SO-100-arm: kør politikken og optag den, overtag når den løber skævt, arkivér kørslen som en rettelse, sammensæt et blandet datasæt og fortsæt træning fra et checkpoint. Inkluderer tastatur- og skyderstien for overtag for mennesker uden en leader-arm, og de fire fejl, der gør en runde værdiløs.

Måling af en DAgger-løkke: Interventionsfrekvens, evalueringsprotokol og faldgruberne imellem
Interventionsfrekvensen - interventionsframes divideret med framene i kørslen - er det billigeste ærlige fremgangssignal, en human-gated DAgger-løkke har. Denne artikel definerer den således, at to mennesker beregner den samme værdi, viser, hvordan man logger den, og gennemgår de fire måder, den vildleder dig på: operatørens vænning, et drivende evalueringssæt, træning kun på rettelser, og en menneske, der retter anderledes tirsdag end mandag.

HG-DAgger og de gatede varianter: Hvem beslutter hvornår man overtager en robotpolitik
Plain DAgger beder en menneske om at mærke tilstande, mens robotten stadig kører. På rigtig hardware er det usikkert og producerer dårlige mærkninger. De gatede varianter erstatter blind mærkning med en gate, som nogen skal holde: mennesket i HG-DAgger, en sikkerhedsklassificerer i SafeDAgger, uenighed blandt ensemblets medlemmer i EnsembleDAgger, et budgetteret estimat over nyhed og risiko i ThriftyDAgger. Denne artikel sammenligner dem efter hvem der ejer gaten, hvad signal åbner den, og hvad hver enkelt koster — og hvorfor den menneske-gatede form er den, som overlever kontakt med en rigtig arm.

DAgger forklaret: Hvorfor Behavior Cloning Mistes og Hvad Dataset Aggregation Faktisk Beviser
Behavior cloning tilpasser en policy til ekspertens tilstandsfordeling og implementeres derefter på egen hånd. Gabet mellem disse to fordelinger er grunden til, at en policy, der ser fin ud i validering, falder af bordet på trin 300. Dette er teoridelkapitlet i vores DAgger-serie: hvor det kvadratiske fejlled kommer fra, hvad dataset-aggregation ændrer, hvad no-regret-beviset forudsætter, og hvilken del af regningen den menneskelige ekspert stadig skal betale.

Brug af DROID, BridgeData V2 og Open X på en SO-100
DROID, BridgeData V2 og Open X-Embodiment konverterer til 7-D end-effector handlinger på 6 og 7-DoF arme. En SO-100 tager 6 ledpositioner. Hvad der overføres, hvad der ikke gør, hvad man skal gøre i stedet.

Syntetiske Data til Robotpolitikker: Hvor Simulation Hjælper
Simulation kan mangedoble en håndfuld demonstrationer til tusinder. Her er, hvad de publicerede tal virkelig siger, hvor sim-til-virkeblighed-gabet bider, og hvad der stadig skal optages.

Små VLA-modeller: TinyVLA, SmolVLA og tilfældet under 1 milliard parametre
TinyVLA og SmolVLA placerer en fungerende VLA under 1 milliard parametre. Reelle tal fra begge artikler, LeRobot-standardindstillingerne, målt latenstid, og hvad en kørsel koster på et 24 GB kort.

Kør GR00T Inferens Uden en Lokal GPU
Din robotmaskine har ingen GPU. Placer GR00T politikserveren på en lejet cloud GPU, stream handlingsklumper til armen, og lær præcis hvad netværket koster dig.

Sådan træner du ACT på SO-100 fra bunden
Træn en Action Chunking Transformer fra bunden på en SO-100 med lerobot: act-konfigurationen, chunk_size og n_action_steps, 100000-trinsplanen, 20 ms inferens.

Hvilken VLA-politik skal du træne i 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT eller GR00T N1.5? En beslutningstabel matchet til virkelige situationer, med de offentliggjorte benchmark-tal, latenstid, omkostninger pr. kørsel og licenser bag hvert valg.

VLA Træningsomkostninger: Hvad en finjusteringskørsel virkelig koster
Reelle spotmarkeds-GPU-priser, hvor længe hver af de fem politikker kører, hvad armen og demonstrationerne koster, og de fire steder pengene stille forsvinder.

Optag dit første LeRobot-datasæt med en SO-100
Optag et brugbart LeRobot-datasæt med en SO-100: kalibrering, leder-følger teleoperation, de rigtige lerobot-record-flags og standardindstillinger, kameraopsætning, antal episoder og de fejl, der ødelægger en kørsel.

Sådan træner du SmolVLA på en 24 GB GPU (lerobot 0.6.1)
SmolVLA er en VLA med 450 M parametre, der finjusteres på et enkelt 24 GB kort. Rigtige lerobot 0.6.1 kommandoer, de faktiske standardindstillinger, faldgruberne, der kostede en dag, og hvad en kørsel koster.

Sådan træner du Pi0.5 med dine egne robotdata
Finjuster Pi0.5, den flow-matching VLA fra Physical Intelligence, med dine egne robotdata. Reelle kommandoer til openpi og lerobot pi05, faldgruber i datasætformat, VRAM- og latenstbegrænsninger.

Sådan træner du GR00T N1.7 på dit eget SO-100 datasæt
En gennemtestet vejledning til finjustering af NVIDIA GR00T N1.7 på et SO-100 LeRobot datasæt: faktiske flags, modality.json, v2.1-kravet, hvad en kørsel koster, og faldgruberne.
Isaac Lab: Næste generations GPU-simulering til multimodal robotlæring
Opdag, hvordan NVIDIAs Isaac Lab revolutionerer multimodal robotlæring gennem GPU-accelererede simuleringer, hvilket muliggør hurtigere AI-træning, skalerbar implementering og optimeret ROI for robotforskere og -virksomheder.
Isaac Gym: GPU-Native Physics Simulation for Robot Learning - Scaling Thousands of Parallel Environments
Discover how Isaac Gym revolutionizes robot learning with GPU-native physics simulation, enabling thousands of parallel environments for rapid reinforcement learning, VLA models training, and efficient AI robot teleoperation. Explore benchmarks, integration with PyTorch, and real-world applications that bridge the sim-to-real gap.
RoboTurk: Crowdsourcing Robot Learning Through Remote Teleoperation
Discover how RoboTurk revolutionizes robot learning by crowdsourcing high-quality data through remote teleoperation, enabling scalable datasets for AI models in robotics. Explore its impact on imitation learning, VLA models, and ROI for robotics companies.
BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning - What Scale Really Means
Explore how BC-Z revolutionizes robotic imitation learning by enabling zero-shot task generalization through scaled demonstration data. Discover scaling laws, VLA models, teleoperation best practices, and ROI benefits for robotics companies and AI engineers.
BridgeData V2: Lavprisrobotdata i stor skala - hvilke metoder til efterligningslæring og offline RL gavner egentlig
Udforsk, hvordan BridgeData V2 leverer lavprisrobotdata i stor skala, hvilket forbedrer metoder til efterligningslæring og offline reinforcement learning. Opdag vigtige benchmarks, VLA-modeller inden for robotteknologi og effektive robotteleoperationsworkflows til indsamling af AI-træningsdata.
Pi-Zero Flow-Matching Robot Policies: Revolutionizing Dexterous Control with VLM Initialization
Discover how Pi-Zero's flow-matching technique, combined with VLM initialization, is transforming generalist robot policies for dexterous control. Learn about its advantages over traditional methods, efficiency in AI training data for robotics, and implications for scalable robot deployment in industries.
RT-2: Hvordan Vision-Language-Action-modeller overfører webviden til robotstyring
Opdag, hvordan Googles RT-2 Vision-Language-Action-model revolutionerer robotstyring ved at overføre webviden til fysiske handlinger. Lær om dens arkitektur, træningsmetoder, nye muligheder og implikationer for robotvirksomheder og -operatører, herunder integration med teleoperation for effektiv AI-træning.
RT-2: Hvorfor Robottræningsdata af høj kvalitet overstråler algoritmer – Google DeepMinds banebrydende indsigt
Opdag hvordan Google DeepMinds RT-2 model revolutionerer AI-robotteknologi ved at understrege den kritiske rolle af træningsdata af høj kvalitet frem for avancerede algoritmer. Denne artikel nedbryder de eksperimenter, der demonstrerer, hvorfor effektiv dataindsamling er afgørende for robotters ydeevne i den virkelige verden. Lær hvordan platforme som AY-Robots kan hjælpe med at bygge bro over kløften i træningsdata for fremtidige innovationer.
RT-2 fra Google DeepMind: Hvordan Denne Vision-Sprog-Handling Model Transformerer Robotlæring
Opdag hvordan Googles RT-2 Vision-Sprog-Handling (VLA) model omformer robotlæring ved at integrere visuelle data, naturligt sprog og realtids handlinger. Denne innovative AI-teknologi forbedrer dataindsamling for teleoperatører og øger effektiviteten i robotteknologiske applikationer. Udforsk dens potentielle indvirkning på fremtidens AI-drevne robotter hos AY-Robots.