Blog
Insights on robotics, AI, and data collection

একটি VLA নীতির সাথে SO-100-এ একটি DAgger লুপ চালান
একটি SO-100 বাহু তে একটি মানব-নিয়ন্ত্রিত DAgger রাউন্ডের ধাপে-ধাপে বর্ণনা: নীতি চালান এবং এটি রেকর্ড করুন, এটি ভুল হলে প্রভার নিন, রানটি একটি সংশোধন হিসাবে ফাইল করুন, একটি মিশ্র ডেটাসেট সংমিশ্রণ করুন এবং একটি চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান। একটি লিডার বাহু ছাড়াই মানুষের জন্য কীবোর্ড এবং স্লাইডার প্রভারের পথ অন্তর্ভুক্ত করে এবং একটি রাউন্ডকে অপ্রয়োজনীয় করে তোলে এমন চারটি ভুল অন্তর্ভুক্ত করে।
![[অনুবাদ প্রয়োজন: Tabletop robot workspace of th...]](/_next/image?url=%2Fimages%2Fblog%2Fsections%2Fbridgedata-v2-low-cost-robot-data-at-scale-which-imitation-learning-and-offline-rl-methods-actually-_section_1.webp&w=3840&q=70)
একটি DAgger লুপ পরিমাপ করা: হস্তক্ষেপ হার, মূল্যায়ন প্রোটোকল এবং মাঝের ফাঁদগুলি
হস্তক্ষেপ হার - রানের ফ্রেম দ্বারা বিভক্ত হস্তক্ষেপ ফ্রেম - একটি মানব-গেটেড DAgger লুপের সবচেয়ে সস্তা সৎ অগ্রগতি সংকেত। এই নিবন্ধ এটিকে সংজ্ঞায়িত করে যাতে দুই ব্যক্তি একই মান গণনা করে, এটি কীভাবে লগ করতে হয় তা দেখায় এবং চারটি উপায়ের মধ্য দিয়ে কাজ করে যা এটি আপনাকে বিভ্রান্ত করে: অপারেটর অভ্যাস, একটি সামঞ্জস্যপূর্ণ মূল্যায়ন সেটআপ, শুধুমাত্র সংশোধনগুলিতে প্রশিক্ষণ এবং একজন মানুষ যিনি সোমবারের চেয়ে মঙ্গলবারে ভিন্নভাবে সংশোধন করেন।

HG-DAgger এবং গেটেড ভেরিয়েন্টস: রোবট পলিসি দখল করার সময় কে সিদ্ধান্ত নেয়
সাধারণ DAgger একজন মানুষকে অবস্থা লেবেল করতে বলে যখন রোবট এখনও চলছে। প্রকৃত হার্ডওয়্যারে এটি অনিরাপদ এবং খারাপ লেবেল তৈরি করে। গেটেড ভেরিয়েন্টগুলি অন্ধ লেবেলিং কে একটি গেট দিয়ে প্রতিস্থাপন করে যা কেউ ধরে রাখতে হবে: HG-DAgger তে মানুষ, SafeDAgger তে একটি নিরাপত্তা শ্রেণীবদ্ধকারী, EnsembleDAgger এ একটি ensemble এর মতভেদ, ThriftyDAgger এ একটি বাজেটেড অভিনবত্ব এবং ঝুঁকি অনুমান। এই নিবন্ধটি তাদের তুলনা করে যে কে গেটের মালিক, কি সংকেত এটি খোলে এবং প্রতিটি একটি খরচ কত — এবং কেন মানব-গেটেড ফর্মটি একটি প্রকৃত arm এর সাথে যোগাযোগে টিকে থাকে।

DAgger ব্যাখ্যা করা হয়েছে: কেন আচরণ ক্লোনিং বিচলিত হয় এবং ডেটাসেট সমন্বয় প্রকৃতপক্ষে কী প্রমাণ করে
আচরণ ক্লোনিং বিশেষজ্ঞের অবস্থা বিতরণে একটি নীতি ফিট করে এবং তারপর এটি নিজের উপর স্থাপন করা হয়। এই দুটি বিতরণের মধ্যে ব্যবধান হল কেন একটি নীতি যা যাচাইকরণে ভাল দেখায় ধাপ ৩০০ এ টেবিল থেকে পড়ে যায়। এটি আমাদের DAgger সিরিজের তাত্ত্বিক অধ্যায়: দ্বিঘাত ত্রুটি পদ কোথা থেকে আসে, ডেটাসেট সমন্বয় কী পরিবর্তন করে, না-অনুশোচনা প্রমাণ কী অনুমান করে এবং মানুষ বিশেষজ্ঞকে এখনও কোন বিল দিতে হয়।

SO-100-এ DROID, BridgeData V2 এবং Open X ব্যবহার করা
DROID, BridgeData V2 এবং Open X-Embodiment 6 এবং 7-DoF আর্মগুলিতে 7-D এন্ড-ইফেক্টর অ্যাকশনে রূপান্তরিত হয়। একটি SO-100 6টি জয়েন্ট পজিশন নেয়। কী স্থানান্তরিত হয়, কী হয় না, এবং এর পরিবর্তে কী করতে হবে।

রোবট পলিসির জন্য সিন্থেটিক ডেটা: যেখানে সিমুলেশন সাহায্য করে
সিমুলেশন মুষ্টিমেয় কিছু ডেমোনস্ট্রেশনকে হাজারে গুণিত করতে পারে। প্রকাশিত সংখ্যাগুলি আসলে কী বলে, যেখানে সিম-টু-রিয়েল গ্যাপ সমস্যা তৈরি করে, এবং কী এখনও রেকর্ড করতে হবে, তা এখানে দেওয়া হলো।

ছোট VLA মডেল: TinyVLA, SmolVLA এবং সাব-১বি কেস
TinyVLA এবং SmolVLA ১ বিলিয়ন প্যারামিটারের নিচে একটি কার্যকরী VLA স্থাপন করে। উভয় গবেষণাপত্র থেকে বাস্তব সংখ্যা, lerobot ডিফল্ট, পরিমাপকৃত ল্যাটেন্সি, এবং একটি ২৪ জিবি কার্ডে একটি রানের খরচ কত।

স্থানীয় GPU ছাড়া GR00T ইনফারেন্স চালান
আপনার রোবট মেশিনে কোনো GPU নেই। GR00T পলিসি সার্ভার একটি ভাড়া করা ক্লাউড GPU-তে রাখুন, অ্যাকশন চাঙ্কগুলি আর্ম-এ স্ট্রিম করুন এবং নেটওয়ার্কের জন্য আপনার ঠিক কত খরচ হয় তা জানুন।

শুরু থেকে SO-100-এ ACT-কে কীভাবে প্রশিক্ষণ দেবেন
lerobot ব্যবহার করে SO-100-এ শুরু থেকে একটি Action Chunking Transformer-কে প্রশিক্ষণ দিন: act config, chunk_size এবং n_action_steps, 100000 ধাপের সময়সূচী, 20 ms ইনফারেন্স।

2026 সালে আপনার কোন VLA নীতি প্রশিক্ষণ করা উচিত?
GR00T N1.7, Pi0.5, SmolVLA, ACT নাকি GR00T N1.5? বাস্তব পরিস্থিতির সাথে মিলে যাওয়া একটি সিদ্ধান্ত সারণী, প্রকাশিত বেঞ্চমার্ক সংখ্যা, ল্যাটেন্সি, প্রতি রান খরচ এবং প্রতিটি পছন্দের পিছনের লাইসেন্স সহ।

VLA প্রশিক্ষণের খরচ: একটি ফাইন-টিউনিং রান-এর আসল খরচ কত
বাস্তব স্পট-মার্কেট GPU মূল্য, পাঁচটি পলিসির প্রতিটির রান করার সময়, আর্ম এবং প্রদর্শনীগুলির খরচ কত, এবং চারটি জায়গা যেখানে টাকা নীরবে অদৃশ্য হয়ে যায়।

একটি SO-100 দিয়ে আপনার প্রথম LeRobot ডেটাসেট রেকর্ড করুন
একটি SO-100 দিয়ে একটি ব্যবহারযোগ্য LeRobot ডেটাসেট রেকর্ড করুন: ক্যালিব্রেশন, লিডার-ফলোয়ার টেলিপেরেশন, আসল lerobot-record ফ্ল্যাগ এবং ডিফল্ট, ক্যামেরা সেটআপ, এপিসোড গণনা, এবং যে ত্রুটিগুলি একটি রান নষ্ট করে।

কীভাবে একটি 24 GB GPU-তে SmolVLA প্রশিক্ষণ দেবেন (lerobot 0.6.1)
SmolVLA একটি 450 M প্যারামিটার VLA যা একটি একক 24 GB কার্ডে ফাইন-টিউন করা যায়। প্রকৃত lerobot 0.6.1 কমান্ড, প্রকৃত ডিফল্ট, যে ফাঁদগুলি একদিন নষ্ট করে, এবং একটি রানের খরচ কত।

আপনার নিজস্ব রোবট ডেটা ব্যবহার করে Pi0.5-কে কীভাবে প্রশিক্ষণ দেবেন
ফিজিক্যাল ইন্টেলিজেন্সের ফ্লো-ম্যাচিং VLA, Pi0.5-কে আপনার নিজস্ব রোবট ডেটা ব্যবহার করে ফাইন-টিউন করুন। openpi এবং lerobot pi05-এর জন্য বাস্তব কমান্ড, ডেটা সেট ফরম্যাটের সমস্যা, VRAM এবং ল্যাটেন্সি সীমাবদ্ধতা।

আপনার নিজস্ব SO-100 ডেটাসেটে GR00T N1.7 কীভাবে প্রশিক্ষণ দেবেন
একটি SO-100 LeRobot ডেটাসেটে NVIDIA GR00T N1.7 ফাইন-টিউনিংয়ের জন্য একটি পরীক্ষিত ওয়াকথ্রু: বাস্তব ফ্ল্যাগ, modality.json, v2.1 প্রয়োজনীয়তা, একটি রানের খরচ এবং ফাঁদগুলি।
রোবোটর্ক: রিমোট টেলিপারেশনের মাধ্যমে ক্রাউডসোর্সিং রোবট লার্নিং
আবিষ্কার করুন কিভাবে রোবোটর্ক রিমোট টেলিপারেশনের মাধ্যমে উচ্চ-গুণমান সম্পন্ন ডেটা ক্রাউডসোর্স করে রোবট লার্নিং-এ বিপ্লব ঘটায়, যা রোবোটিক্সের এআই মডেলগুলির জন্য স্কেলেবল ডেটাসেট তৈরি করতে সক্ষম করে। অনুকরণ লার্নিং, ভিএলএ মডেল এবং রোবোটিক্স সংস্থাগুলির জন্য এর ROI-এর উপর প্রভাব অন্বেষণ করুন।
BridgeData V2: কম খরচের রোবট ডেটা স্কেলে - কোন ইমিটেশন লার্নিং এবং অফলাইন আরএল পদ্ধতিগুলো আসলে উপকৃত হয়
BridgeData V2 কীভাবে কম খরচে বৃহৎ পরিসরে রোবট ডেটা সরবরাহ করে, যা ইমিটেশন লার্নিং পদ্ধতি এবং অফলাইন রিইনফোর্সমেন্ট লার্নিংকে উন্নত করে তা জানুন। এআই প্রশিক্ষণ ডেটা সংগ্রহের জন্য মূল বেঞ্চমার্ক, রোবোটিক্সে ভিএলএ মডেল এবং দক্ষ রোবট টেলিপারেশন ওয়ার্কফ্লো আবিষ্কার করুন।
Pi-Zero ফ্লো-ম্যাচিং রোবট নীতি: ভিএলএম ইনিশিয়ালাইজেশন সহ দক্ষ নিয়ন্ত্রণকে বিপ্লবী করা
আবিষ্কার করুন কিভাবে Pi-Zero-এর ফ্লো-ম্যাচিং কৌশল, ভিএলএম ইনিশিয়ালাইজেশনের সাথে মিলিত হয়ে, দক্ষ নিয়ন্ত্রণের জন্য সাধারণ রোবট নীতিগুলিকে রূপান্তরিত করছে। প্রথাগত পদ্ধতির তুলনায় এর সুবিধা, রোবোটিক্সের জন্য এআই প্রশিক্ষণ ডেটার দক্ষতা এবং শিল্পে স্কেলেবল রোবট স্থাপনার প্রভাব সম্পর্কে জানুন।
আরটি-২: কেন উচ্চ-মানের রোবট প্রশিক্ষণ ডেটা অ্যালগরিদমকে ছাড়িয়ে যায় - গুগল ডিপমাইন্ডের গেম-পরিবর্তনকারী অন্তর্দৃষ্টি
গুগল ডিপমাইন্ডের আরটি-২ মডেল কীভাবে উন্নত অ্যালগরিদমের চেয়ে উচ্চ-মানের প্রশিক্ষণ ডেটার গুরুত্বপূর্ণ ভূমিকার উপর জোর দিয়ে এআই রোবোটিক্সকে বিপ্লব করে তা আবিষ্কার করুন। এই নিবন্ধটি সেই পরীক্ষাগুলি ভেঙে দেখায় যা বাস্তব-বিশ্বের রোবট পারফরম্যান্সের জন্য কেন কার্যকর ডেটা সংগ্রহ অপরিহার্য। ভবিষ্যতের উদ্ভাবনের জন্য এওয়াই-রোবটসের মতো প্ল্যাটফর্মগুলি কীভাবে প্রশিক্ষণ ডেটার ব্যবধান পূরণ করতে সহায়তা করতে পারে তা জানুন।
Google DeepMind-এর RT-2: এই ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেলটি কীভাবে রোবট শিক্ষাকে রূপান্তরিত করছে
Google-এর RT-2 ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন (VLA) মডেলটি কীভাবে ভিজ্যুয়াল ডেটা, স্বাভাবিক ভাষা এবং রিয়েল-টাইম অ্যাকশনগুলিকে একত্রিত করে রোবট শিক্ষাকে নতুন আকার দিচ্ছে তা আবিষ্কার করুন। এই উদ্ভাবনী এআই প্রযুক্তি টেলিঅপারেটরদের জন্য ডেটা সংগ্রহকে উন্নত করে এবং রোবোটিক্স অ্যাপ্লিকেশনগুলিতে দক্ষতা বৃদ্ধি করে। AY-Robots-এ AI-চালিত রোবটগুলির ভবিষ্যতের উপর এর সম্ভাব্য প্রভাব অন্বেষণ করুন।