Blog
Insights on robotics, AI, and data collection

SO-100 پر VLA پالیسی کے ساتھ DAgger لوپ چلانا
SO-100 آرم پر ایک انسانی گیٹ شدہ DAgger راؤنڈ کا مرحلہ وار بیان: پالیسی چلائیں اور ریکارڈ کریں، غلط ہونے پر ٹیک اوور کریں، رن کو درستگی کے طور پر فائل کریں، ملی جلی ڈیٹاسیٹ کمپوز کریں، اور چیک پوائنٹ سے ٹریننگ جاری رکھیں۔ لیڈر آرم کے بغیر لوگوں کے لیے کی بورڈ اور سلائڈر ٹیک اوور پاتھ، اور چار غلطیاں جو ایک راؤنڈ کو بیکار بناتی ہیں۔

ایک DAgger Loop کی پیمائش: Intervention Rate، Evaluation Protocol اور درمیان کے خطرات
Intervention rate - intervention frames کو run کے frames سے تقسیم کیا جائے - ایک انسان کے قابو میں DAgger loop کا سب سے سستا ایمانداری سے پیش رفت کا اشارہ ہے۔ یہ مضمون اسے اس طریقے سے متعریف کرتا ہے کہ دو لوگ ایک جیسی قیمت حاصل کریں، اسے لاگ کرنے کا طریقہ دکھاتا ہے، اور چار طریقے واضح کرتا ہے جو اسے آپ کو گمراہ کرتے ہیں: آپریٹر کی عادت، Evaluation setup میں تبدیلی، صرف اصلاحات پر تربیت، اور ایک انسان جو منگل کو پیر سے مختلف طریقے سے اصلاح کرتا ہے۔

HG-DAgger اور Gated Variants: روبوٹ پالیسی پر کنٹرول کب لیں یہ کون فیصلہ کرتا ہے
سادہ DAgger ایک انسان سے کہتا ہے کہ حالات پر لیبل لگائے جبکہ روبوٹ ابھی چل رہا ہے۔ حقیقی ہارڈویئر پر یہ غیر محفوظ ہے اور اچھے لیبل نہیں بناتا۔ Gated variants بغیر سوچے سمجھے لیبل لگانے کو ایک گیٹ سے بدل دیتے ہیں جسے کوئی سنبھالتا ہے: HG-DAgger میں انسان، SafeDAgger میں حفاظتی classifier، EnsembleDAgger میں ensemble کے اختلاف سے، ThriftyDAgger میں بجٹ بندی شدہ نیا پن اور خطرے کے تخمینے سے۔ یہ مضمون ان کا موازنہ کرتا ہے کہ گیٹ کا مالک کون ہے، اس کو کیا signal کھولتا ہے، اور ہر ایک کی کیا قیمت ہے — اور کیوں انسان-gated صورت ہی وہ ہے جو حقیقی بازو سے رابطے میں قائم رہتی ہے۔

DAgger کی تشریح: Behavior Cloning کیوں انحراف کرتی ہے اور ڈیٹاسیٹ Aggregation واقعی کیا ثابت کرتی ہے
Behavior cloning ماہر کی حالت کی تقسیم پر ایک policy کو فٹ کرتا ہے اور پھر اسے اپنے طور پر تعینات کیا جاتا ہے۔ ان دونوں تقسیموں کے درمیان فاصلہ یہ ہے کہ ایک policy جو validation میں بہتر لگتی ہے قدم 300 پر میز سے باہر چلی جاتی ہے۔ یہ ہماری DAgger سیریز کے نظریاتی باب میں ہے: جہاں quadratic error term آتی ہے، dataset aggregation کیا تبدیل کرتی ہے، no-regret proof کیا فرض کرتا ہے، اور بل کا کون سا حصہ انسانی ماہر کو ابھی بھی ادا کرنا ہے۔

DROID، BridgeData V2 اور Open X کا SO-100 پر استعمال
DROID، BridgeData V2 اور Open X-Embodiment 6 اور 7-DoF بازوؤں پر 7-D اینڈ-ایفیکٹر ایکشنز میں تبدیل ہوتے ہیں۔ ایک SO-100 چھ جوائنٹ پوزیشنز لیتا ہے۔ کیا منتقل ہوتا ہے، کیا نہیں ہوتا، اور اس کے بجائے کیا کرنا چاہیے۔

روبوٹ پالیسیوں کے لیے مصنوعی ڈیٹا: جہاں سمولیشن مدد کرتا ہے
سمولیشن چند مظاہروں کو ہزاروں میں ضرب دے سکتا ہے۔ یہاں وہ ہے جو شائع شدہ اعداد و شمار واقعی کہتے ہیں، جہاں سم-ٹو-ریل کا فرق کاٹتا ہے، اور کیا ابھی بھی ریکارڈ کرنا باقی ہے۔

چھوٹے VLA ماڈلز: TinyVLA, SmolVLA اور 1B سے کم کا معاملہ
TinyVLA اور SmolVLA نے ایک فعال VLA کو 1 بلین پیرامیٹرز سے کم میں پیش کیا ہے۔ دونوں پیپرز سے حقیقی اعداد و شمار، LeRobot کے ڈیفالٹس، پیمائش شدہ لیٹنسی، اور 24 GB کارڈ پر ایک رن کی لاگت کیا ہے۔

لوکل GPU کے بغیر GR00T انفرنس چلائیں
آپ کی روبوٹ مشین میں GPU نہیں ہے۔ GR00T پالیسی سرور کو کرائے کے کلاؤڈ GPU پر رکھیں، ایکشن چنکس کو آرم پر سٹریم کریں، اور بالکل جانیں کہ نیٹ ورک پر آپ کا کتنا خرچ آتا ہے۔

SO-100 پر ACT کو شروع سے کیسے تربیت دیں
SO-100 پر lerobot کے ساتھ ایک Action Chunking Transformer کو شروع سے تربیت دیں: act config، chunk_size اور n_action_steps، 100000 سٹیپ کا شیڈول، 20 ms انفرنس۔

2026 میں آپ کو کون سی VLA پالیسی کی تربیت دینی چاہیے؟
GR00T N1.7، Pi0.5، SmolVLA، ACT یا GR00T N1.5؟ ایک فیصلہ کن جدول جو حقیقی حالات سے مماثل ہے، شائع شدہ بینچ مارک نمبرز، لیٹنسی، فی رن لاگت اور ہر انتخاب کے پیچھے لائسنسز کے ساتھ۔

VLA ٹریننگ لاگت: ایک فائن ٹیوننگ رن کی اصل لاگت کیا ہے
حقیقی سپاٹ مارکیٹ GPU کی قیمتیں، پانچوں پالیسیوں میں سے ہر ایک کتنی دیر چلتی ہے، بازو اور مظاہروں کی لاگت کیا ہے، اور وہ چار جگہیں جہاں پیسہ خاموشی سے غائب ہو جاتا ہے۔

اپنا پہلا LeRobot ڈیٹا سیٹ ایک SO-100 کے ساتھ ریکارڈ کریں
ایک SO-100 کے ساتھ ایک قابل استعمال LeRobot ڈیٹا سیٹ ریکارڈ کریں: کیلیبریشن، لیڈر-فالور ٹیلی آپریشن، حقیقی lerobot-record فلیگز اور ڈیفالٹس، کیمرہ سیٹ اپ، ایپیسوڈ کی گنتی، اور وہ نقائص جو ایک رن کو خراب کرتے ہیں۔

SmolVLA کو 24 GB GPU پر کیسے تربیت دیں (lerobot 0.6.1)
SmolVLA ایک 450 M پیرامیٹر VLA ہے جو ایک ہی 24 GB کارڈ پر فائن ٹیون ہوتا ہے۔ حقیقی lerobot 0.6.1 کمانڈز، اصل ڈیفالٹس، وہ مشکلات جن پر ایک دن صرف ہوتا ہے، اور ایک رن کی لاگت کیا ہے۔

اپنے روبوٹ ڈیٹا پر Pi0.5 کو کیسے تربیت دیں
Physical Intelligence کے فلو میچنگ VLA، Pi0.5 کو اپنے روبوٹ ڈیٹا پر فائن ٹیون کریں۔ openpi اور lerobot pi05 کے لیے حقیقی کمانڈز، ڈیٹا سیٹ فارمیٹ کی مشکلات، VRAM اور لیٹنسی کی حدود۔

اپنے SO-100 ڈیٹا سیٹ پر GR00T N1.7 کو تربیت کیسے دیں
SO-100 LeRobot ڈیٹا سیٹ پر NVIDIA GR00T N1.7 کی فائن ٹیوننگ کے لیے ایک آزمائشی گائیڈ: حقیقی فلیگز، modality.json، v2.1 کی ضرورت، ایک رن کی لاگت کیا ہے، اور مشکلات۔
روبو ترک: ریموٹ ٹیلی آپریشن کے ذریعے کراؤڈ سورسنگ روبوٹ لرننگ
دریافت کریں کہ روبو ترک کس طرح ریموٹ ٹیلی آپریشن کے ذریعے اعلیٰ معیار کے ڈیٹا کی کراؤڈ سورسنگ کرکے روبوٹ لرننگ میں انقلاب برپا کرتا ہے، جو روبوٹکس میں اے آئی ماڈلز کے لیے اسکیل ایبل ڈیٹا سیٹس کو فعال کرتا ہے۔ نقلی سیکھنے، وی ایل اے ماڈلز، اور روبوٹکس کمپنیوں کے لیے آر او آئی پر اس کے اثرات کو دریافت کریں۔
Pi-Zero فلو میچنگ روبوٹ پالیسیاں: VLM انیشیئلائزیشن کے ساتھ مہارت والے کنٹرول میں انقلاب
دریافت کریں کہ کس طرح Pi-Zero کی فلو میچنگ تکنیک، VLM انیشیئلائزیشن کے ساتھ مل کر، مہارت والے کنٹرول کے لیے جنرلسٹ روبوٹ پالیسیوں کو تبدیل کر رہی ہے۔ روایتی طریقوں پر اس کے فوائد، روبوٹکس کے لیے AI تربیتی ڈیٹا میں کارکردگی، اور صنعتوں میں اسکیل ایبل روبوٹ کی تعیناتی کے مضمرات کے بارے میں جانیں۔
DROID Dataset: Revolutionizing Large-Scale Robot Manipulation for AI Training
Discover how the DROID Dataset, a large-scale robot manipulation dataset, is transforming AI training for robots with over 76,000 demonstrations from real-world environments. Learn about its impact on VLA models, benchmarks, and scalable data collection methods for robotics companies.
RT-2: How Vision-Language-Action Models Transfer Web Knowledge to Robot Control
Discover how Google's RT-2 Vision-Language-Action Model revolutionizes robot control by transferring web knowledge to physical actions. Learn about its architecture, training methods, emergent capabilities, and implications for robotics companies and operators, including integration with teleoperation for efficient AI training.
آر ٹی-2: کیوں اعلیٰ معیار کا روبوٹ ٹریننگ ڈیٹا الگورتھم سے بہتر ہے – گوگل ڈیپ مائنڈ کی گیم بدل دینے والی بصیرتیں
دریافت کریں کہ کس طرح گوگل ڈیپ مائنڈ کا آر ٹی-2 ماڈل جدید الگورتھم کے مقابلے میں اعلیٰ معیار کے تربیتی ڈیٹا کے اہم کردار پر زور دے کر اے آئی روبوٹکس میں انقلاب برپا کرتا ہے۔ یہ مضمون ان تجربات کو توڑتا ہے جو یہ ظاہر کرتے ہیں کہ حقیقی دنیا میں روبوٹ کی کارکردگی کے لیے مؤثر ڈیٹا اکٹھا کرنا کیوں ضروری ہے۔ جانیں کہ AY-Robots جیسے پلیٹ فارم مستقبل کی اختراعات کے لیے تربیتی ڈیٹا میں فرق کو پُر کرنے میں کس طرح مدد کر سکتے ہیں۔
گوگل ڈیپ مائنڈ کی جانب سے آر ٹی-2: یہ ویژن-لینگویج-ایکشن ماڈل کس طرح روبوٹ لرننگ کو تبدیل کر رہا ہے
دریافت کریں کہ گوگل کا آر ٹی-2 ویژن-لینگویج-ایکشن (VLA) ماڈل بصری ڈیٹا، قدرتی زبان اور ریئل ٹائم ایکشنز کو مربوط کر کے روبوٹ لرننگ کو کس طرح نئی شکل دے رہا ہے۔ یہ جدید اے آئی ٹیکنالوجی ٹیلی آپریٹرز کے لیے ڈیٹا اکٹھا کرنے میں اضافہ کرتی ہے اور روبوٹکس ایپلی کیشنز میں کارکردگی کو بڑھاتی ہے۔ اے وائی-روبوٹس پر اے آئی سے چلنے والے روبوٹس کے مستقبل پر اس کے ممکنہ اثرات کو دریافت کریں۔