Blog
Insights on robotics, AI, and data collection

SO-100 पर DAgger लूप चलाना VLA Policy के साथ
SO-100 आर्म पर एक मानव-gated DAgger राउंड का step-by-step विवरण: policy चलाएँ और record करें, जब गलत हो तो take over करें, run को correction के रूप में file करें, mixed dataset बनाएँ, और checkpoint से continue training करें। Leader arm न होने वाले लोगों के लिए keyboard और slider takeover path शामिल है, और चार गलतियाँ जो एक राउंड को worthless बना देती हैं।

एक DAgger लूप को मापना: हस्तक्षेप दर, मूल्यांकन प्रोटोकॉल, और बीच के जाल
हस्तक्षेप दर - हस्तक्षेप फ्रेम को रन के फ्रेम से विभाजित - सबसे सस्ता ईमानदार प्रगति संकेत है जो एक मानव-गेटेड DAgger लूप के पास है। यह लेख इसे परिभाषित करता है ताकि दो लोग समान मान की गणना कर सकें, दिखाता है कि इसे कैसे लॉग करें, और चार तरीकों से काम करता है जो इसे गुमराह करते हैं: ऑपरेटर आदत, बहती हुई मूल्यांकन सेटअप, केवल सुधार पर प्रशिक्षण, और एक मानव जो मंगलवार को सोमवार की तुलना में अलग तरीके से सुधार करता है।

HG-DAgger और Gated Variants: कौन तय करता है कि Robot Policy को कब Take Over करें
Plain DAgger एक मानव को states को label करने के लिए कहता है जबकि robot अभी भी चल रहा है। Real hardware पर यह असुरक्षित है और बुरे labels देता है। Gated variants blind labelling को एक gate से बदलते हैं जिसे किसी को hold करना होता है: HG-DAgger में मानव, SafeDAgger में एक safety classifier, EnsembleDAgger में एक ensemble की disagreement, ThriftyDAgger में एक budgeted novelty-and-risk estimate। यह article उन्हें compare करता है कि gate को कौन own करता है, कौन सी signal उसे खोलती है, और प्रत्येक की क्या कीमत है — और क्यों human-gated form ही एक real arm के साथ contact में survive करता है।

डीएजर समझाया: व्यवहार क्लोनिंग कैसे विचलित होता है और डेटासेट एकत्रीकरण वास्तव में क्या सिद्ध करता है
व्यवहार क्लोनिंग विशेषज्ञ के अवस्था वितरण पर एक नीति को फिट करता है और फिर इसे स्वतंत्र रूप से तैनात किया जाता है। उन दोनों वितरणों के बीच का अंतर यह है कि क्यों एक नीति जो सत्यापन में ठीक दिखती है वह चरण 300 पर मेज से गिरती है। यह हमारी डीएजर श्रृंखला का सिद्धांत अध्याय है: द्विघातीय त्रुटि पद कहाँ से आता है, डेटासेट एकत्रीकरण क्या बदलता है, कोई-पश्चाताप प्रमाण क्या मानता है, और बिल का कौन सा हिस्सा मानव विशेषज्ञ को अभी भी भुगतान करना पड़ता है।

SO-100 पर DROID, BridgeData V2 और Open X का उपयोग करना
DROID, BridgeData V2 और Open X-Embodiment 6 और 7-DoF भुजाओं पर 7-D एंड-इफेक्टर क्रियाओं में परिवर्तित होते हैं। एक SO-100 6 जॉइंट पोजीशन लेता है। क्या स्थानांतरित होता है, क्या नहीं होता, और इसके बजाय क्या करना चाहिए।

रोबोट नीतियों के लिए सिंथेटिक डेटा: जहाँ सिमुलेशन मदद करता है
सिमुलेशन मुट्ठी भर प्रदर्शनों को हजारों में बदल सकता है। यहाँ बताया गया है कि प्रकाशित संख्याएँ वास्तव में क्या कहती हैं, जहाँ सिम-टू-रियल गैप समस्या पैदा करता है, और अभी भी क्या रिकॉर्ड किया जाना बाकी है।

छोटे VLA मॉडल: TinyVLA, SmolVLA और सब-1B केस
TinyVLA और SmolVLA 1 बिलियन पैरामीटर के तहत एक कार्यशील VLA प्रदान करते हैं। दोनों पेपरों से वास्तविक संख्याएँ, lerobot डिफ़ॉल्ट, मापी गई विलंबता, और 24 GB कार्ड पर एक रन की लागत।

स्थानीय GPU के बिना GR00T इन्फेरेंस चलाएँ
आपकी रोबोट मशीन में कोई GPU नहीं है। GR00T पॉलिसी सर्वर को किराए के क्लाउड GPU पर रखें, आर्म को एक्शन चंक्स स्ट्रीम करें, और जानें कि नेटवर्क पर आपको कितना खर्च आता है।

SO-100 पर ACT को स्क्रैच से कैसे प्रशिक्षित करें
lerobot के साथ SO-100 पर एक एक्शन चंकिंग ट्रांसफार्मर को स्क्रैच से प्रशिक्षित करें: ACT कॉन्फ़िग, chunk_size और n_action_steps, 100000 स्टेप शेड्यूल, 20 ms इन्फेरेंस।

आपको 2026 में कौन सी VLA पॉलिसी प्रशिक्षित करनी चाहिए?
GR00T N1.7, Pi0.5, SmolVLA, ACT या GR00T N1.5? वास्तविक स्थितियों से मेल खाने वाली एक निर्णय तालिका, जिसमें प्रकाशित बेंचमार्क संख्याएँ, विलंबता, प्रति रन लागत और प्रत्येक विकल्प के पीछे के लाइसेंस शामिल हैं।

VLA प्रशिक्षण लागत: एक फाइन-ट्यूनिंग रन की वास्तविक लागत क्या है
वास्तविक स्पॉट-मार्केट GPU कीमतें, पाँचों नीतियों में से प्रत्येक को चलाने में कितना समय लगता है, आर्म और प्रदर्शनों की लागत क्या है, और वे चार स्थान जहाँ पैसा चुपचाप गायब हो जाता है।

SO-100 के साथ अपना पहला LeRobot डेटासेट रिकॉर्ड करें
SO-100 के साथ एक प्रयोग करने योग्य LeRobot डेटासेट रिकॉर्ड करें: कैलिब्रेशन, लीडर-फॉलोअर टेलीऑपरेशन, वास्तविक lerobot-record फ़्लैग और डिफ़ॉल्ट, कैमरा सेटअप, एपिसोड गणना, और वे दोष जो एक रन को बर्बाद कर देते हैं।

SmolVLA को 24 GB GPU पर कैसे प्रशिक्षित करें (lerobot 0.6.1)
SmolVLA एक 450 M पैरामीटर VLA है जो एक सिंगल 24 GB कार्ड पर फाइन-ट्यून होता है। वास्तविक lerobot 0.6.1 कमांड, वास्तविक डिफ़ॉल्ट, वे जाल जिनमें एक दिन लग गया, और एक रन की लागत क्या है।

अपने रोबोट डेटा पर Pi0.5 को कैसे प्रशिक्षित करें
फिजिकल इंटेलिजेंस के फ्लो-मैचिंग VLA, Pi0.5 को अपने रोबोट डेटा पर फाइन-ट्यून करें। openpi और lerobot pi05 के लिए वास्तविक कमांड, डेटासेट प्रारूप की चुनौतियाँ, VRAM और विलंबता सीमाएँ।

अपने SO-100 डेटासेट पर GR00T N1.7 को कैसे प्रशिक्षित करें
SO-100 LeRobot डेटासेट पर NVIDIA GR00T N1.7 को फाइन-ट्यून करने के लिए एक परीक्षित मार्गदर्शिका: वास्तविक फ़्लैग, modality.json, v2.1 की आवश्यकता, एक रन की लागत क्या है, और इसमें आने वाली बाधाएँ।
रोबोटर्क: रिमोट टेलीऑपरेशन के माध्यम से क्राउडसोर्सिंग रोबोट लर्निंग
जानें कि कैसे रोबोटर्क रिमोट टेलीऑपरेशन के माध्यम से उच्च-गुणवत्ता वाले डेटा को क्राउडसोर्स करके रोबोट लर्निंग में क्रांति लाता है, जिससे रोबोटिक्स में एआई मॉडल के लिए स्केलेबल डेटासेट सक्षम होते हैं। इमिटेशन लर्निंग, वीएलए मॉडल और रोबोटिक्स कंपनियों के लिए आरओआई पर इसके प्रभाव का अन्वेषण करें।
पाई-ज़ीरो फ्लो-मैचिंग रोबोट नीतियाँ: वीएलएम इनिशियलाइज़ेशन के साथ कुशल नियंत्रण में क्रांति
जानें कि कैसे पाई-ज़ीरो की फ्लो-मैचिंग तकनीक, वीएलएम इनिशियलाइज़ेशन के साथ मिलकर, कुशल नियंत्रण के लिए सामान्य रोबोट नीतियों को बदल रही है। पारंपरिक तरीकों पर इसके फायदे, रोबोटिक्स के लिए एआई प्रशिक्षण डेटा में दक्षता, और उद्योगों में स्केलेबल रोबोट परिनियोजन के निहितार्थों के बारे में जानें।
BridgeData V2: कम लागत वाला रोबोट डेटा बड़े पैमाने पर - कौन सी इमिटेशन लर्निंग और ऑफलाइन आरएल विधियाँ वास्तव में लाभान्वित होती हैं
अन्वेषण करें कि BridgeData V2 कैसे कम लागत पर बड़े पैमाने पर रोबोट डेटा प्रदान करता है, जिससे इमिटेशन लर्निंग विधियों और ऑफ़लाइन सुदृढीकरण सीखने को बढ़ावा मिलता है। एआई प्रशिक्षण डेटा संग्रह के लिए प्रमुख बेंचमार्क, रोबोटिक्स में वीएलए मॉडल और कुशल रोबोट टेलीऑपरेशन वर्कफ़्लो की खोज करें।
RT-2: क्यों उच्च-गुणवत्ता वाला रोबोट प्रशिक्षण डेटा एल्गोरिदम से बेहतर है – Google DeepMind की गेम-चेंजिंग अंतर्दृष्टि
जानें कि कैसे Google DeepMind का RT-2 मॉडल उन्नत एल्गोरिदम पर उच्च-गुणवत्ता वाले प्रशिक्षण डेटा की महत्वपूर्ण भूमिका पर जोर देकर AI रोबोटिक्स में क्रांति लाता है। यह लेख उन प्रयोगों को तोड़ता है जो दिखाते हैं कि वास्तविक दुनिया के रोबोट प्रदर्शन के लिए प्रभावी डेटा संग्रह क्यों आवश्यक है। जानें कि AY-Robots जैसे प्लेटफ़ॉर्म भविष्य के नवाचारों के लिए प्रशिक्षण डेटा में अंतर को पाटने में कैसे मदद कर सकते हैं।
गूगल डीपमाइंड द्वारा RT-2: यह विजन-लैंग्वेज-एक्शन मॉडल रोबोट लर्निंग को कैसे बदल रहा है
जानें कि कैसे गूगल का RT-2 विजन-लैंग्वेज-एक्शन (VLA) मॉडल दृश्य डेटा, प्राकृतिक भाषा और वास्तविक समय की क्रियाओं को एकीकृत करके रोबोट लर्निंग को नया आकार दे रहा है। यह अभिनव AI तकनीक टेलीऑपरेटरों के लिए डेटा संग्रह को बढ़ाती है और रोबोटिक्स अनुप्रयोगों में दक्षता को बढ़ाती है। AY-Robots पर AI-संचालित रोबोटों के भविष्य पर इसके संभावित प्रभाव का अन्वेषण करें।