Blog
Insights on robotics, AI, and data collection

SO-100 वर VLA Policy सह DAgger Loop चालवणे
एक SO-100 आर्मवर एक मानव-गेटेड DAgger राउंडचे चरण-दर-चरण विवरण: धोरण चलवा आणि रेकॉर्ड करा, जेव्हा वर्तन गलत होते तेव्हा ताबा घेणे, धावा सुधारणे म्हणून फाइल करणे, मिश्र डेटासेट तयार करणे, आणि चेकपॉइंटवरून प्रशिक्षण सुरू ठेवणे. लीडर आर्मशिवाय लोकांसाठी कीबोर्ड आणि स्लाइडर ताबा मार्ग समाविष्ट आहे, आणि चार चुका जे एक राउंड अमूल्य बनवतात.

DAgger लूप मापन: हस्तक्षेप दर, मूल्यांकन प्रोटोकॉल, आणि दरम्यानचे जाळे
हस्तक्षेप दर - फेरीचे हस्तक्षेप फ्रेम्स भागिले रनचे फ्रेम्स - हे सर्वात स्वस्त प्रामाणिक प्रगति सिग्नल आहे जी मानवी-गेटेड DAgger लूपला आहे. हा लेख त्याची व्याख्या करतो ताकि दोन व्यक्तींना समान मूल्य मिळेल, त्याची लॉगिंग कशी करायची हे दर्शवतो, आणि चारही मार्गांवरून काम करतो जिथे ते तुम्हाला भरामते: ऑपरेटर सवयीचा प्रभाव, ड्रिफ्टिंग मूल्यांकन सेटअप, केवळ सुधारांवर प्रशिक्षण, आणि एक मानव जो सोमवारच्या तुलनेत मंगळवारी वेगळ्याप्रकारे सुधार करतो.

HG-DAgger आणि गेटेड व्यतिक्रम: रोबोट पॉलिसी कधी ओव्हरटेक करायचे हे कोण ठरवते
साधारण DAgger एखाद्या मानवाला रोबोट अजूनही चालत असताना स्थितींना लेबल करण्यास सांगते. वास्तविक हार्डवेअरवर हे असुरक्षित आहे आणि ते खराब लेबल तयार करते. गेटेड व्यतिक्रम अंध लेबलिंगला गेटने बदलतात ज्याला कोणी धरून ठेवले पाहिजे: HG-DAgger मध्ये मानव, SafeDAgger मध्ये सुरक्षा वर्गीकारक, EnsembleDAgger मध्ये ensemble चे मतभेद, ThriftyDAgger मध्ये बजेटेड नवीनता-आणि-जोखीम अनुमान. हा लेख त्यांची तुलना करतो कोण गेट मालकी करतो, कोणता सिग्नल ते उघडतो, आणि प्रत्येकाचा खर्च किती आहे - आणि वास्तविक बाहूसह संपर्क सुरक्षित राहणारा मानव-गेटेड फॉर्म का आहे.

DAgger स्पष्ट केले: Behavior Cloning का विचलित होते आणि Dataset Aggregation वास्तविकपणे काय सिद्ध करते
Behavior cloning expert च्या state distribution वर policy फिट करते आणि नंतर स्वतःवर तैनात केले जाते. त्या दोन वितरणांमधील अंतर हेच कारण आहे की validation मध्ये ठीक दिसणारी policy step 300 वर टेबलवरून पडते. हा आमच्या DAgger मालिकेचा सिद्धांत अध्याय आहे: quadratic error term कुठून येत आहे, dataset aggregation काय बदलते, no-regret proof काय गृहीत धरते, आणि मानवी तज्ञाला अजूनही काय भरावे लागते याचे.

SO-100 वर DROID, BridgeData V2 आणि Open X वापरणे
DROID, BridgeData V2 आणि Open X-Embodiment हे 6 आणि 7-DoF आर्म्सवरील 7-D एंड-इफेक्टर ॲक्शन्समध्ये रूपांतरित होतात. SO-100 हे 6 जॉइंट पोझिशन्स घेते. काय हस्तांतरित होते, काय होत नाही आणि त्याऐवजी काय करावे.

रोबोट धोरणांसाठी कृत्रिम डेटा: जिथे सिम्युलेशन मदत करते
सिम्युलेशन काही प्रात्यक्षिकांचे हजारोमध्ये रूपांतर करू शकते. प्रकाशित आकडेवारी काय सांगते, सिम-टू-रिअल गॅप कुठे त्रासदायक ठरते आणि अजून काय रेकॉर्ड करणे बाकी आहे ते येथे दिले आहे.

लहान VLA मॉडेल्स: TinyVLA, SmolVLA आणि 1B पेक्षा कमी पॅरामीटर्सची स्थिती
TinyVLA आणि SmolVLA 1 अब्ज पॅरामीटर्सखाली कार्यरत VLA आणतात. दोन्ही पेपर्समधील वास्तविक आकडे, lerobot डीफॉल्ट्स, मोजलेली लेटन्सी आणि 24 GB कार्डवर एका रनचा खर्च किती येतो.

स्थानिक जीपीयूशिवाय GR00T अनुमान चालवा
तुमच्या रोबोट मशीनमध्ये जीपीयू नाही. GR00T पॉलिसी सर्व्हर भाड्याच्या क्लाउड जीपीयूवर ठेवा, ॲक्शन चंक्स आर्मला स्ट्रीम करा आणि नेटवर्कचा तुम्हाला नेमका किती खर्च येतो ते जाणून घ्या.

सुरुवातीपासून SO-100 वर ACT कसे प्रशिक्षित करावे
lerobot वापरून SO-100 वर सुरुवातीपासून ॲक्शन चंकिंग ट्रान्सफॉर्मर प्रशिक्षित करा: ॲक्ट कॉन्फिग, chunk_size आणि n_action_steps, 100000 स्टेप शेड्यूल, 20 ms इन्फरन्स.

2026 मध्ये तुम्ही कोणती VLA पॉलिसी प्रशिक्षित करावी?
GR00T N1.7, Pi0.5, SmolVLA, ACT किंवा GR00T N1.5? वास्तविक परिस्थितीशी जुळणारी एक निर्णय सारणी, प्रकाशित बेंचमार्क संख्या, विलंबता, प्रत्येक रनचा खर्च आणि प्रत्येक निवडीमागील परवाने यासह.

VLA प्रशिक्षण खर्च: फाइन-ट्यूनिंग रनला खरोखर किती खर्च येतो
वास्तविक स्पॉट-मार्केट GPU किमती, प्रत्येक पाच पॉलिसी किती वेळ चालतात, आर्म आणि प्रदर्शनांचा खर्च काय आहे आणि पैसे शांतपणे गायब होणारी चार ठिकाणे.

तुमचा पहिला LeRobot डेटासेट SO-100 सह रेकॉर्ड करा
SO-100 सह वापरण्यायोग्य LeRobot डेटासेट रेकॉर्ड करा: कॅलिब्रेशन, लीडर-फॉलोअर टेलिऑपरेशन, खरे lerobot-record फ्लॅग आणि डिफॉल्ट्स, कॅमेरा सेटअप, एपिसोडची संख्या आणि रन खराब करणारे दोष.

SmolVLA ला 24 GB GPU वर कसे प्रशिक्षित करावे (lerobot 0.6.1)
SmolVLA हे 450 M पॅरामीटरचे VLA आहे जे एकाच 24 GB कार्डवर फाइन-ट्यून होते. वास्तविक lerobot 0.6.1 कमांड्स, प्रत्यक्ष डीफॉल्ट्स, दिवसभर वेळ खाणारे अडथळे आणि एका रनचा खर्च किती येतो.

तुमच्या स्वतःच्या रोबोट डेटावर Pi0.5 कसे प्रशिक्षित करावे
तुमच्या स्वतःच्या रोबोट डेटावर Pi0.5, फिजिकल इंटेलिजन्सचे फ्लो-मॅचिंग VLA, फाइन-ट्यून करा. openpi आणि lerobot pi05 साठी वास्तविक कमांड्स, डेटासेट फॉरमॅटमधील अडचणी, VRAM आणि लेटन्सी मर्यादा.

तुमच्या स्वतःच्या SO-100 डेटासेटवर GR00T N1.7 कसे प्रशिक्षित करावे
SO-100 LeRobot डेटासेटवर NVIDIA GR00T N1.7 च्या फाइन-ट्यूनिंगसाठी एक तपासलेली मार्गदर्शिका: वास्तविक फ्लॅग्स, modality.json, v2.1 ची आवश्यकता, एका रनचा खर्च किती येतो, आणि अडचणी.
पाई-झीरो फ्लो-मॅचिंग रोबोट धोरणे: व्हीएलएम इनिशियलायझेशनसह कुशल नियंत्रणात क्रांती
पाई-झीरोचे फ्लो-मॅचिंग तंत्र, व्हीएलएम इनिशियलायझेशनच्या संयोगाने, कुशल नियंत्रणासाठी सामान्य रोबोट धोरणे कशी बदलत आहे ते शोधा. पारंपारिक पद्धतींपेक्षा त्याचे फायदे, रोबोटिक्ससाठी एआय प्रशिक्षण डेटाची कार्यक्षमता आणि उद्योगांमध्ये स्केलेबल रोबोट उपयोजनासाठी त्याचे परिणाम जाणून घ्या.
Isaac Gym: रोबोट लर्निंगसाठी GPU-नेटिव्ह फिजिक्स सिम्युलेशन - हजारो समांतर वातावरणांचे स्केलिंग
Isaac Gym GPU-नेटिव्ह फिजिक्स सिम्युलेशनसह रोबोट लर्निंगमध्ये कशी क्रांती घडवते ते शोधा, जलद रीइन्फोर्समेंट लर्निंग, VLA मॉडेल प्रशिक्षण आणि कार्यक्षम AI रोबोट टेलीऑपरेशनसाठी हजारो समांतर वातावरण सक्षम करते. सिम-टू-रिअल अंतर कमी करणारे बेंचमार्क, पायटॉर्चसह एकत्रीकरण आणि वास्तविक-जगातील ॲप्लिकेशन्स एक्सप्लोर करा.
BridgeData V2: कमी खर्चातील रोबोट डेटा मोठ्या प्रमाणावर - कोणते इमिटेशन लर्निंग आणि ऑफलाइन आरएल पद्धतींना खरोखर फायदा होतो
BridgeData V2 कशा प्रकारे कमी खर्चात मोठ्या प्रमाणात रोबोट डेटा प्रदान करते, इमिटेशन लर्निंग पद्धती आणि ऑफलाइन रीइन्फोर्समेंट लर्निंग कसे वाढवते ते एक्सप्लोर करा. एआय प्रशिक्षण डेटा संकलनासाठी रोबोटिक्समधील मुख्य बेंचमार्क, व्हीएलए मॉडेल्स आणि कार्यक्षम रोबोट टेलीऑपरेशन वर्कफ्लो शोधा.
RT-2: व्हिजन-लँग्वेज-ॲक्शन मॉडेल वेबवरील ज्ञान रोबोट नियंत्रणात कसे रूपांतरित करतात
गुगलचे RT-2 व्हिजन-लँग्वेज-ॲक्शन मॉडेल वेबवरील ज्ञान प्रत्यक्ष कृतींमध्ये रूपांतरित करून रोबोट नियंत्रणात क्रांती कशी घडवते ते शोधा. त्याचे आर्किटेक्चर, प्रशिक्षण पद्धती, उदयोन्मुख क्षमता आणि रोबोटिक्स कंपन्या आणि ऑपरेटर्ससाठी त्याचे परिणाम, कार्यक्षम AI प्रशिक्षणासाठी टेलीऑपरेशनसह एकत्रीकरणासह जाणून घ्या.
RT-2: उच्च-गुणवत्तेचे रोबोट प्रशिक्षण डेटा अल्गोरिदमपेक्षा सरस ठरतो – Google DeepMind चे गेम-चेंजिंग इनसाइट्स
Google DeepMind च्या RT-2 मॉडेलने प्रगत अल्गोरिदमपेक्षा उच्च-गुणवत्तेच्या प्रशिक्षण डेटाच्या महत्त्वपूर्ण भूमिकेवर जोर देऊन AI रोबोटिक्समध्ये क्रांती कशी घडवली ते शोधा. हा लेख अशा प्रयोगांचे विश्लेषण करतो जे दर्शवतात की वास्तविक जगात रोबोटच्या कामगिरीसाठी प्रभावी डेटा संकलन का आवश्यक आहे. भविष्यातील नवकल्पनांसाठी AY-Robots सारखी प्लॅटफॉर्म प्रशिक्षण डेटातील अंतर भरून काढण्यास कशी मदत करू शकतात ते जाणून घ्या.
गूगल डीपमाइंडद्वारे RT-2: हे व्हिजन-लँग्वेज-ॲक्शन मॉडेल रोबोट लर्निंगमध्ये कसे बदल घडवत आहे
गूगलचे RT-2 व्हिजन-लँग्वेज-ॲक्शन (VLA) मॉडेल व्हिज्युअल डेटा, नैसर्गिक भाषा आणि रिअल-टाइम क्रिया एकत्रित करून रोबोट लर्निंगला कशा प्रकारे नव्याने आकार देत आहे ते शोधा. हे अभिनव AI तंत्रज्ञान टेलीऑपरेटर्ससाठी डेटा संकलन वाढवते आणि रोबोटिक्स ॲप्लिकेशन्समध्ये कार्यक्षमतेत वाढ करते. AY-Robots येथे AI-आधारित रोबोट्सच्या भविष्यावर त्याचा संभाव्य प्रभाव एक्सप्लोर करा.