தொலிக்குறிப்பு இடைமுகத்தின் மூலம் ரோபோ கையை மேற்பார்வை செய்யும் இயக்குநர், கட்டுப்பாடுகளின் மீது கைகள் மற்றும் கையகப்படுத்தத் தயாரா
DAggerইন্টারঅ্যাক্টিভ অনুকরণ শেখাHG-DAggerரோபோ கொள்கைகள்SO-100

HG-DAgger மற்றும் கேட் செய்யப்பட்ட பதிப்புகள்: ரோபோ கொள்கையை யார் கையகப்படுத்தலாம் என்பதை யார் தீர்மானிக்கிறது

AY-Robots ResearchAugust 27, 202615 நிமிட படிக்க

சாধாரண DAgger ரோபோ இன்னும் ஓடிக்கொண்டிருக்கும் போது ஒரு நபரை நிலைகளைப் பெயரிடச் சொல்கிறது. உண்மையான வன்பொருளில் இது பாதுரக்ஷணமற்றது மற்றும் மோசமான பெயரிடுதலை உருவாக்குகிறது. கேட்ட பதிப்புகள் பின்னணி பெயரிடலை ஒரு கேட்டால் மாற்றுகின்றன, அதை யாரோ பிடிக்க வேண்டும்: HG-DAggerஇல் மனிதன், SafeDAggerஇல் ஒரு பாதுகாப்பு வகைப்படுத்தி, EnsembleDAggerஇல் ஒரு கூட்டத்தின் கருத்து வேறுபாடு, ThriftyDAggerஇல் ஒரு பட்ஜெட் செய்யப்பட்ட புதியது மற்றும் ঝுக்கம் மதிப்பீடு. இந்தக் கட்டுரை யார் கேட்டை சொந்தமாக வைத்திருக்கிறது, என்ன சமிக்ஞை அதை திறக்கிறது, மற்றும் ஒவ்வொன்று செலவு செய்யும் - மற்றும் ஏன் மனிত-கேட்ட வடிவம் உண்மையான கையுடன் தொடர்பு வைத்துக் கொள்ளும் ஒன்று.

একটি ক্লোন নীতি যেখানে তার প্রশিক্ষণ তথ্য দৌড়িয়েছে সেখানে ব্যর্থ হয়। মেরামত প্রদর্শনকারীর পরিবর্তে নীতির নিজের অবস্থা বিতরণের অধীনে তথ্য সংগ্রহ করতে রাখছে, যা DAgger করে এবং কি ডেটাসেট সমন্বয়ের প্রবর্তন প্রথম নীতি থেকে কভার করে। এটি মূল অ্যালগরিদমের বিশ্রাম অংশটি খোলা রেখে যায়: শিক্ষাবিদ চালিত হওয়ার সময়, বিশেষজ্ঞ কি তারা করেছেন বলতে সন্নিবেশিত হয়, প্রতিটি রাজ্যের জন্য, নিয়ন্ত্রণে না থাকলে।

একটি সিমুলেটরে একটি স্ক্রিপ্ট করা বিশেষজ্ঞ সঙ্গে যা বিনামূল্যে। এটা যে একটি টেবিলে একটি বাস্তব হাতকে না বিনামূল্যে বা নিরাপদ। HG-DAgger লেখকরা আপত্তি সুনির্দিষ্টভাবে বিবৃতি: যেমন নমুনা স্কিম "বিশেষজ্ঞদের সিস্টেম সম্পূর্ণ নিয়ন্ত্রণে ছাড়াই অ্যাকশন লেবেল প্রদান করতে প্রয়োজন", যা "নিরাপত্তা হ্রাস করতে পারে এবং, মানুষ হিসাবে বিশেষজ্ঞ ব্যবহার করার সময়, মনে করা অ্যাকচুয়েটর বিলম্বের কারণে সংগৃহীত লেবেলগুলির গুণমান হ্রাস করতে সম্ভবত" (কেলি এট আল।, 2019)। দুটি ব্যর্থতা সেই বাক্যে লুকানো: নীতি চালিত হতে থাকে যেখানে কেউ এটি চায় না, এবং সেই ঝুঁকির সঙ্গে ক্রয় করা লেবেলগুলি একটি মানুষের চেয়ে খারাপ যা নিয়ন্ত্রণ ধরে রেখে উত্পাদিত। নিম্নোক্ত প্রতিটি বৈকল্পিক একই প্রশ্নের উত্তর - নিয়ন্ত্রণে একটি গেট রাখুন এবং যখন এটি খোলে তা সিদ্ধান্ত নেওয়ার অনুমতি দিন। তারা যারা সেই কেউ তা আলাদা করে।

সংক্ষিপ্ত সংস্করণ

  • গেট সংস্করণগুলি পিছনে নীতি নিয়ন্ত্রণ এবং বিশেষজ্ঞ নিয়ন্ত্রণের মধ্যে একটি সুইচ সঙ্গে অন্ধ পরিবর্তন প্রতিস্থাপন। কি তাদের আলাদা করে সে সুইচ মালিক।
  • HG-DAgger মানুষ সুইচ দেয় এবং শুধুমাত্র তথ্য aggregates মানুষ ঐতিহ্যহীন নিয়ন্ত্রণ ছিল যখন রেকর্ড করা হয়েছে।
  • SafeDAgger একটি বাইনারি শ্রেণীকরণকারীকে দেয় যা একটি রেফারেন্স নীতি থেকে বিচলন পূর্বাভাস দেয়; EnsembleDAgger কম সমষ্টি পার্থক্য এবং একই সময়ে বিশেষজ্ঞ অ্যাকশন জন্য ছোট দূরত্ব প্রয়োজন।
  • LazyDAgger নিয়ন্ত্রণ ping-pong না করা hysteresis যোগ করে; ThriftyDAgger ঘটনা বা একটি স্পষ্ট হস্তক্ষেপ বাজেট অধীন অনুমান ঝুঁকি উপর গেট।
  • রোবট-গেট সংকেত কিছু প্রয়োজন যা সূক্ষ্ম-tuned VLA একটি শখ-শ্রেণী বাহুতে সাধারণত অভাব: একটি রেফারেন্স নীতি, একটি সস্তা সমষ্টি, বা যাঁচাই করা বোধগম্য অনিশ্চয়তা।
  • গেট অর্ধেক পদ্ধতি। পরে হস্তক্ষেপ সেগমেন্ট কি - মিশ্রণ, ওজন, একত্রিত - সিদ্ধান্ত দেয় রাউন্ড উন্নত কিছু।

মনুষ্য-গেটড এবং রোবট-গেটড: বিভাজন যে গুরুত্ব পায়

ইন্টারঅ্যাক্টিভ অনুকরণ শেখা তার নিজের জরিপ আছে; Celemin এবং সহকর্মীরা প্রতিক্রিয়া প্রকার, ইন্টারফেস, শেখা মডেল, ব্যবহারকারী অভিজ্ঞতা, আবেদন এবং benchmark সঙ্গে এটি ক্যাটালগ করুন। বিভাজন যা আপনার প্রকৌশল সিদ্ধান্ত সেই axes যেকোনো সহজ এবং সাম্প্রতিক কাজ নাম এটি সরাসরি: একটি পদ্ধতি মনুষ্য-গেটড যখন তত্ত্বাবধানকারী হস্তক্ষেপ সময় সিদ্ধান্ত, এবং রোবট-গেটড যখন এজেন্ট সাহায্যের জন্য জিজ্ঞাসা সময় সিদ্ধান্ত (Cai এবং অন্যরা, 2025)। সবকিছু অন্যথায় যন্ত্র সেই দুটি পছন্দের মধ্যে একটি পরিবেশন করছে। বাণিজ্য শুরু থেকে দৃশ্যমান: একটি মানুষ গেট ক্রমাগত মনোযোগ খরচ, এবং একটি রোবট গেট মনোযোগ ফিরিয়ে দিতে প্রতিশ্রুতি - কিন্তু শুধুমাত্র যদি সঙ্গে গেট সঙ্গে সংকেত বিশ্বাসযোগ্য, এবং যে সঙ্গত তৈরি তার নিজের গবেষণা সমস্যা।

SafeDAgger: একটি শ্রেণীকরণকারী যা তার নিজের বিচলন পূর্বাভাস

Zhang এবং Cho এর SafeDAgger (2016) এই গেট সবচেয়ে আগাম। রেফারেন্স নীতি জিজ্ঞাসা ব্যয়বহুল অংশ, তাই একটি দ্বিতীয়, ছোট নেটওয়ার্ক - নিরাপত্তা নীতি - ভবিষ্যদ্বাণী করে জিজ্ঞাসা করা মূল্যবান কিনা সব একেবারে। এটি "একটি বাইনারি লেবেল রিটার্ন যে প্রাথমিক নীতি সম্ভবত একটি রেফারেন্স নীতি থেকে বিচলন করবে এটি ছাড়া জিজ্ঞাসা করা"। লেবেল দুটি নীতি অ্যাকশন সঙ্গে দুই মধ্যে বর্গক্ষেত্র L2 বিচলন বিরুদ্ধে সংজ্ঞায়িত করা হয় একটি threshold tau, এবং শ্রেণীকরণকারী বাইনারি ক্রস-এন্ট্রপি সঙ্গে ফিট করা হয়। রান সময়ে এটি প্রতিটি রাজ্য সিদ্ধান্ত করে পাওয়া শিক্ষাবিদ চালনা করে বা রেফারেন্স দখল করে। বিমূর্ত রিপোর্ট কম রেফারেন্স কুয়েরি একটি গাড়ি রেসিং সিমুলেটর প্লাস একটি অভিসরণ গতি-আপ লেখক একটি স্বয়ংক্রিয় পাঠ্যক্রম প্রভাব প্রদান করতে হিসাব, কোনো আংশ দেওয়া ছাড়াই।

ধরা ফলাফল না সংজ্ঞা মধ্যে। প্রশিক্ষণ শ্রেণীকরণকারী রেফারেন্স নীতি এর অ্যাকশন প্রতিটি রাজ্য এটি ফিট করতে প্রয়োজন, যা রেফারেন্স অন্য প্রোগ্রাম অনুমান। আপনার রেফারেন্স একজন নেতা হাত একটি ব্যক্তি হয়, যে লেবেল সেট সস্তা না এবং পদ্ধতি হারায় সম্পত্তি এটি জন্য ডিজাইন করা হয়েছিল।

EnsembleDAgger: সন্দেহ এবং বৈষম্য, উভয়

Menda, Driggs-ক্যাম্পবেল এবং Kochenderfer (2019) গেট একটি probabilistic প্রশ্ন হিসাবে বিবেচনা। EnsembleDAgger "একটি Gaussian প্রক্রিয়া ব্যবহার করে স্নায়ু নেটওয়ার্ক একটি সমষ্টি" এবং পড়ে সমষ্টি ভিত্তি একটি আত্মবিশ্বাস প্রক্সি হিসাবে: উচ্চ ভিত্তি মানে একটি অঞ্চল প্রশিক্ষণ তথ্য অনন্য, যা - অনুমান বিশেষজ্ঞ ব্যর্থতা রাজ্য এড়ায় - সম্পর্ক ব্যর্থতা খরচ সাথে। নিয়ম একটি সংমিশ্রণ। শিক্ষাবিদ হতে পারে শুধুমাত্র অর্জন যখন L2 দূরত্ব মানে অ্যাকশন বিশেষজ্ঞ অ্যাকশন থাকে প্রথম থ্রেশহোল্ড নিচে (বৈষম্য) এবং তার পূর্বাভাস অ্যাকশন বিভিন্নতা একটি দ্বিতীয় (সন্দেহ) দোষ নিচে থাকে। হয় ব্যর্থ হয়, বিশেষজ্ঞ নিয়ন্ত্রণ নেয়। লক্ষ্য শিক্ষাবিদ শেয়ার সর্বাধিক করা যখন ব্যর্থতা সম্ভাবনা সীমাবদ্ধতা করা; কাগজ রিপোর্ট উন্নত নিরাপত্তা এবং শেখা বিরুদ্ধে অন্যান্য DAgger বৈকল্পিক একটি inverted pendulum এবং MuJoCo HalfCheetah।

বৈষম্য শব্দ বিশেষজ্ঞ অ্যাকশন প্রয়োজন

এটি নির্বিঘ্নে হাতমুক্ত তত্ত্বাবধান জন্য সম্পূর্ণ নিয়ম disqualifies। শিক্ষাবিদ অ্যাকশন বিশেষজ্ঞ অ্যাকশন মধ্যে দূরত্ব যে রাজ্য, সেই মুহূর্ত বিশেষজ্ঞ অ্যাকশন প্রয়োজন। একটি স্ক্রিপ্ট করা বিশেষজ্ঞ, ঠিক। একটি মানুষ, মানুষ ক্রমাগত অ্যাকশন উত্পাদিত করা চাই - যথাযথ বোঝা গেট বৈকল্পিক দূর করার জন্য বোঝানো হয়েছিল। সন্দেহ শব্দ একা হাতমুক্ত; সংমিশ্রণ না।

LazyDAgger: সুইচ থেকে থেমে যান chattering

Hoque এবং সহকর্মীরা (2021) পূর্ববর্তী কাগজ পরিমাপ না খরচ আক্রমণ: সুইচ নিজেই। প্রতিটি হস্তক্ষেপ "অন্যান্য কাজ তত্ত্বাবধানকারী করছেন interrupts, প্রতিটি প্রসঙ্গ সুইচ তত্ত্বাবধানকারী এবং স্বায়ত্তশাসিত নিয়ন্ত্রণ মধ্যে অব্যাহতি incurs, এবং কর্মক্ষমতা জন্য সময় প্রয়োজন". একটি গেট যে খোলে এবং বন্ধ করে দশ বার একটি মিনিট এক দশ সেকেন্ডের জন্য খোলা এক খারাপ, একই স্বায়ত্তশাসিত শেয়ার। LazyDAgger SafeDAgger এক্সটেন্ড asymmetric থ্রেশহোল্ড - তত্ত্বাবধানকারী নিয়ন্ত্রণ এন্টার কঠিন এটি থাকার চেয়ে - তাই সিস্টেম সীমানা oscillate না। সিমুলেশন এটি "প্রসঙ্গ সুইচ হ্রাস করতে পারেন গড় SafeDAgger 60% দ্বারা 3 ক্রমাগত নিয়ন্ত্রণ কাজ যখন বজায় রেখে অত্যাধুনিক নীতি কর্মক্ষমতা"; ফ্যাব্রিক ম্যানিপুলেশন একটি ABB YuMi সঙ্গে এটি "প্রসঙ্গ সুইচ হ্রাস করে 60% SafeDAgger উপর সম্পাদন সময় 60% উচ্চতর সাফল্য হার অর্জন অর্জনের যখন"।

ThriftyDAgger: প্রাচুর্য বা ঝুঁকি, একটি বাজেট অধীন

ThriftyDAgger (Hoque এবং অন্যরা, CoRL 2021) তত্ত্বাবধানকারী বাজেট থেকে শুরু করা নীতি পরিবর্তে। এটি "ব্যবহার করে একটি শেখার সুইচিং নীতি প্রতিশ্রুতি শুধুমাত্র রাজ্য তারা যথেষ্ট (1) নতুন, যেখানে রোবোট নীতি কোনো রেফারেন্স আচরণ নকল করতে, বা (2) ঝুঁকিপূর্ণ, যেখানে রোবোট কাজ সম্পাদন কম আত্মবিশ্বাস থাকে", একটি নতুন মেট্রিক সেই ঝুঁকি অনুমান সঙ্গে। বাজেট একটি ইনপুট, ফলাফল না: তুমি বিবৃতি আপনি কত মানুষ সময় ব্যয় করবেন। সম্পাদন সময় প্রয়োগ পদ্ধতি "কৃতিত্ব লাভ করে 100% সাফল্য হার উভয় সিমুলেশন এবং শারীরিক কাজ", এবং দশ অংশগ্রহণকারী নিয়ন্ত্রণ একটি তিন-রোবট বহর সঙ্গে একটি ব্যবহারকারী অধ্যয়ন ঘনত্ব কাজ সাথে রিপোর্ট যে এটি "মানুষ এবং রোবট কর্মক্ষমতা বৃদ্ধি করে 58% এবং 80% যথাক্রমে পরবর্তী সেরা অ্যালগরিদম তুলনায় যখন হ্রাস তত্ত্বাবধানকারী বোঝা". বহর সেটিং এই কাজ জন্য প্রাকৃতিক বাড়ি; বহর-DAgger পরে formalised ইন্টারঅ্যাক্টিভ বহর শেখা একাধিক রোবোট এবং তত্ত্বাবধানকারী, প্রস্তাব রিটার্ন মানুষ প্রচেষ্টা উপর হিসাবে পরিমাণ অপ্টিমাইজ করা।

HG-DAgger: মানুষ গেট ধারণ করে

কেলি এবং অন্যরা (2019) অন্যান্য উপায় যান। কোনো সুইচিং নীতি নেই। শিক্ষাবিদ রোল আউট হয় "যতক্ষণ না বিশেষজ্ঞ লক্ষ্য যে শিক্ষানবিস রাজ্য স্থান একটি অনিরাপদ অঞ্চল প্রবেশ করেছে", যখন বিশেষজ্ঞ নিয়ন্ত্রণ নেয় এবং গাইড সিস্টেম ফিরে। একত্রিত নিয়ম কঠোর অংশ: "বিশেষজ্ঞ অ্যাকশন লেবেল শুধুমাত্র সংগৃহীত এবং ডেটাসেট যোগ করা হয় এই পুনরুদ্ধার trajectories সময়ে, যখন মানুষ বিশেষজ্ঞ বিরামহীন নিয়ন্ত্রণ করেছেন সিস্টেম।" কিছু লেবেল করা হয় যখন মানুষ দর্শক।

এটি সুইচ থেমে যায় না। HG-DAgger এছাড়াও "একটি নিরাপত্তা থ্রেশহোল্ড শিখে একটি মডেল-অনিশ্চয়তা-ভিত্তিক ঝুঁকি মেট্রিক যে পূর্বাভাস ব্যবহার করা যেতে পারে কর্মক্ষমতা সম্পূর্ণ প্রশিক্ষিত শিক্ষাবিদ রাজ্য স্থান বিভিন্ন অঞ্চল": এটি লগ করে শিক্ষাবিদ কেমন নিশ্চিত ছিল মুহূর্ত বিশেষজ্ঞ হস্তক্ষেপ করা এবং সেই রেকর্ড এর শেষ ত্রৈমাসিক গড়, যেখানে শিক্ষাবিদ সবচেয়ে সদৃশ চূড়ান্ত ফর্ম। যে না একটি গেট রোবোট পরিচালনা কিন্তু একটি ডায়াগনস্টিক আপনি বলা সমাপ্ত নীতি প্রত্যাশিত ধারণ। মূল্যায়ন আবরণ একটি simulated এবং একটি বাস্তব-বিশ্ব ড্রাইভিং কাজ এবং রিপোর্ট উন্নত কর্মক্ষমতা উপর উভয় DAgger এবং আচরণ ক্লোনিং।

একটি সম্পর্কিত লাইন লেবেল পরিবর্তন কি গণনা। Spencer এবং সহকর্মী বিশেষজ্ঞ হস্তক্ষেপ শেখা ধারণ "যেকোনো পরিমাণ বিশেষজ্ঞ প্রতিক্রিয়া, হস্তক্ষেপ বা অ-হস্তক্ষেপ কিনা, তথ্য প্রদান করে মানের বর্তমান রাজ্য সম্পর্কে, optimality অ্যাকশন, বা উভয়", formalised একটি সীমাবদ্ধতা হিসাবে শিক্ষাবিদ মূল্য ফাংশন এবং সমাধান কোনো অনুশোচনা অনলাইন শেখার সঙ্গে। যে পড়া অধীন, বিস্তৃত যেখানে মানুষ দেখেছি এবং কিছু না করেননি দুর্বল ইতিবাচক প্রমাণ অনলা শক্তিশালী। EIL সংঘর্ষ সংঘর্ষ এড়ানো শিখে প্রায় এক মিনিট বিশেষজ্ঞ নিয়ন্ত্রণ।

রোবোট আর্ম কর্মক্ষেত্র ক্যামেরা অবস্থান তথ্য সংগ্রহের সময় একটি তত্ত্বাবধান নীতি রোলআউট
একটি মানুষ-গেটড রাউন্ড একটি সাধারণ অনুমান চালানো একটি রেকর্ডার সংযুক্ত সঙ্গে। ফ্রেম অপারেটর চালিত ছিল ফ্ল্যাগ করা হয়; বিশ্রাম বজায় থাকে যেমন ছিল।

পাশে পাশে বৈকল্পিক

পদ্ধতিযারা গেট খোলেসঙ্গেপ্রয়োজনীয় উপলব্ধপ্রতিবেদিত
DAgger (রস এবং অন্যরা, 2011)কেউ না - শিক্ষাবিদ সবসময় চালিতকোনো; বিশেষজ্ঞ প্রতিটি পরিদর্শন অফ-নীতি রাজ্য লেবেলএকটি বিশেষজ্ঞ সক্ষম করা হয় অফ-নীতি রাজ্য লেবেল যখন নিয়ন্ত্রণে নাকোনো-অনুশোচনা হ্রাস গ্যারান্টি সঙ্গে শিক্ষাবিদ স্টেট বিতরণ অধীনে
HG-DAgger (কেলি এবং অন্যরা, 2019)মানুষ তত্ত্বাবধানকারীতত্ত্বাবধানকারী এর বিচার রাজ্য অনিরাপদকেউ পর্যবেক্ষণ, এবং একটি পরিষ্কার নিয়ন্ত্রণ হ্যান্ডওভারবীট DAgger এবং আচরণ ক্লোনিং একটি simulated এবং একটি বাস্তব ড্রাইভিং কাজ; এছাড়াও শিখে একটি ঝুঁকি থ্রেশহোল্ড
SafeDAgger (Zhang & Cho, 2016)রোবোটবাইনারি শ্রেণীকরণকারী L2 বিচলন জন্য রেফারেন্স উপরে tauএকটি queryable রেফারেন্স নীতি শ্রেণীকরণকারী লেবেল জন্যকম রেফারেন্স কুয়েরি একটি রেসিং সিমুলেটর, দ্রুততর অভিসরণ (কোনো আংশ দেওয়া)
EnsembleDAgger (Menda এবং অন্যরা, 2019)রোবোটসমষ্টি ভিত্তি এবং দূরত্ব বিশেষজ্ঞ অ্যাকশন, উভয় থ্রেশহোল্ড অধীনএকটি সমষ্টি নেটওয়ার্ক প্লাস বিশেষজ্ঞ অ্যাকশন প্রতিটি পদক্ষেপউন্নত নিরাপত্তা এবং শেখা pendulum এবং HalfCheetah উপর
LazyDAgger (Hoque এবং অন্যরা, 2021)রোবোট, hysteresis সঙ্গেSafeDAgger এর সঙ্গে আলাদা এন্ট্রি এবং বর্ষার থ্রেশহোল্ডকি SafeDAgger প্রয়োজন, প্লাস একটি দ্বিতীয় থ্রেশহোল্ড টিউন করার জন্য~60% কম প্রসঙ্গ সুইচ 3 কাজ; 60% উচ্চতর সাফল্য YuMi ফ্যাব্রিক উপর
ThriftyDAgger (Hoque এবং অন্যরা, 2021)রোবোট, একটি বাজেট অধীনপ্রাচুর্য, বা অনুমান ঝুঁকি কাজ সম্পাদন নাএকটি শেখা ঝুঁকি নির্ধারক এবং একটি বিবৃত হস্তক্ষেপ বাজেট100% সাফল্য সম্পাদন সময় উপর; ব্যবহারকারী অধ্যয়ন (N=10): 58% এবং 80% লাভ পরবর্তী-সেরা
EIL (স্পেন্সার এবং অন্যরা, 2020)মানুষ - অ-হস্তক্ষেপ বিবেচনা করেন খুবহস্তক্ষেপ এবং এর অনুপস্থিতি মূল্য ফাংশন সীমাবদ্ধতা হিসাবেঅনলাইন কোনো অনুশোচনা শেখা মূল্য সীমাবদ্ধতা উপরসংঘর্ষ এড়ানো প্রায় এক মিনিট বিশেষজ্ঞ নিয়ন্ত্রণ

প্রতিটি গেট ক্রয় কি, এবং এটি চার্জ কি

প্রয়োজন" কলাম নিচে পড়ুন এবং একটি প্যাটার্ন পড়ে যায়: প্রতিটি রোবোট-গেট সঙ্গে সেখানে একটি প্রক্সি যা তৈরি করা ছাড়া মিলিত হওয়ার জন্য, এবং প্রতিটি প্রক্সি তার নিজস্ব বিল।

  • বৈষম্য সঙ্গে (SafeDAgger, LazyDAgger, অর্ধ EnsembleDAgger এর নিয়ম) একটি রেফারেন্স নীতি প্রয়োজন। হয় আপনার একটি স্ক্রিপ্ট করা বিশেষজ্ঞ, যে ক্ষেত্রে আগ্রহ সমস্যা ইতিমধ্যে সমাধান বা একটি মানুষ দূরে একটি দূরত্ব পরিসংখ্যান করা যায় ক্রমাগত অ্যাকশন উত্পাদিত।
  • সন্দেহ সঙ্গে যাঁচাই অবিশ্বাস্য। একটি ছোট নিয়ন্ত্রণ নেটওয়ার্ক একটি সমষ্টি সঠিক সামঞ্জস্য; একটি তিন-বিলিয়ন-প্যারামিটার vision-ভাষা-কর্ম মডেলের একটি সমষ্টি একটি স্মৃতি এবং latency সমস্যা প্রথম।
  • প্রাচুর্য এবং ঝুঁকি সঙ্গে একটি শেখা নির্ধারক সফল এবং ব্যর্থ rollouts যথেষ্ট ফিট। একটি কাজ তুমি এখনও পায় কাজ করছে, যে তথ্য রাউন্ড এক মধ্যে বিদ্যমান না।
  • মানুষ গেট মনোযোগ প্রয়োজন এবং কিছু অন্যথায় না - একমাত্র সঙ্গে দিন এক উপলব্ধ, কোনো নীতি স্থাপত্য, কোনো অতিরিক্ত মডেল প্রশিক্ষণ।
  • কোনো রোবোট গেট মানুষ সরায়। তারা হ্রাস কিভাবে প্রায়ই মানুষ অবশ্যই অধিনিয়ম, না আছে তারা উপস্থিত থাকা চাই।

একটি শান্ত পার্থক্য কি গেট উৎপাদিত। একটি রোবোট গেট মধ্য-trajectory ফায়ার একটি ব্যক্তি একটি গতিশীল বাহু মধ্য-trajectory একটি মনস্বেচ্ছ pose হ্যান্ড। একটি মানুষ গেট লেটস অপারেটর পিক মুহূর্ত - পৌঁছান পরে, grasp আগে, না অর্ধপথ একটি সুইং মাধ্যমে। পুনরুদ্ধার সেগমেন্ট দুটি থেকে না সমানভাবে পরিষ্কার, এবং সেই সেগমেন্ট রাউন্ড এর সম্পূর্ণ পণ্য।

কেন মানুষ-গেটড ফর্ম জয় বাস্তব হার্ডওয়্যার উপর

এটি একটি প্রকৌশল যুক্তি, না একটি বেঞ্চমার্ক ফলাফল না কাগজ চালিত সব পাঁচ গেট একই manipulator একই নীতি শ্রেণী সঙ্গে। এটি বিশ্রাম চারটি পয়েন্ট।

প্রথম, তত্ত্বাবধানকারী সেখানে যখন। কেউ লাভ একটি SO-100 বাহু অপারেটেড পরবর্তী বস্তু এটি knock করতে পারেন নির্বাচন। একবার কেউ পর্যবেক্ষণ হয়, মার্জিনাল দেওয়া প্রদান একটি takeover বোতাম কাছাকাছি শূন্য; নির্মাণ একটি কৃত করা ঝুঁকি নির্ধারক একটি প্রকল্প।

দ্বিতীয়, অনিশ্চয়তা তুমি প্রকৃতপক্ষে একটি আধুনিক নীতিতে পরিমাপ করতে পারেন প্রায়ই ভুল পরিমাণ। একটি diffusion বা প্রবাহ-মিলান মাথা উৎপাদিত ভিত্তি জুড়ে নমুনা করা পদক্ষেপ, এবং যে ভিত্তি প্রতিফলিত multimodality মাথা ছিল প্রশিক্ষিত উপস্থাপন, না অবিজ্ঞতা অনিশ্চয়তা রাজ্য সম্পর্কে। EnsembleDAgger এর সন্দেহ শব্দ ব্যবহার একটি সমষ্টি সুনির্দিষ্টভাবে ধরতে পরবর্তী। দুটি একই সংখ্যা মত দেখায় এবং করি না; অ্যাকশন chunking এবং প্রবাহ মিলান এন্ট্রি কভার কিভাবে সেই মাথা নিঃসরণ করা নীতিবাক্য প্রথম স্থানে।

তৃতীয়, ব্যর্থতা যা বিষয় ম্যানিপুলেশন প্রায়ই semantic পার্থক্য পরিবর্তে সাংখ্যিক উপায় অসাধারণ। একটি নীতি gripper বন্ধ করা দুই সেন্টিমিটার প্রাথমিক, বা পৌঁছানো আত্মবিশ্বাস জন্য ভুল একটি দুই identical cubes, কোনো উচ্চ-ভিত্তি রাজ্য - এটি আত্মবিশ্বাস এবং ভুল। কোনো ভিত্তি থ্রেশহোল্ড ধরা যে; কোনো ব্যক্তি পর্যবেক্ষণ ধরা এটি অবিলম্বে।

চতুর্থ, লেবেল গুণমান - মূল HG-DAgger পয়েন্ট, এবং সবচেয়ে প্রায়ই মুক্তা। লেবেল সংগৃহীত যখন মানুষ বিরামহীন নিয়ন্ত্রণ ছিল মানুষ বীট একটি গতিশীল সিস্টেম উপর narrated। যদি লক্ষ্য corrective ডেটা সার্থক aggregating, বোঝা প্রমাণ থেকে স্বয়ংক্রিয় গেট লাই।

যেখানে রোবোট গেট করি পে

ছবি উল্টে যখন এক তত্ত্বাবধানকারী অনেক রোবোট জন্য দায়বদ্ধ - শাসন ThriftyDAgger এর ব্যবহারকারী অধ্যয়ন এবং বহর-DAgger এর formalization লক্ষ্য। একটি বহর, মানুষ মনোযোগ বিরল সম্পদ এবং একটি অসম্পূর্ণ বরাদ্দ কাটায়। একটি বাহু একটি ডেস্ক আপনি যে শাসন না।

মানুষ-গেটড লুপ, ইতিমধ্যে তার সঙ্গে যুক্ত

একটি চলমান অনুমান সেশন কমান্ড তথ্য, প্রতি-ফ্রেম হস্তক্ষেপ ফ্ল্যাগ সংশোধন সেগমেন্ট উপর, curating প্রতিটি চালান মধ্যে অপারেটর চালিত ফ্রেম মধ্যে সংশোধন বা মূল্যায়ন, রচনা ছিল একটি মিশ্র ডেটাসেট উৎস আপনি পিক থেকে, এবং অব্যাহত প্রশিক্ষণ একটি বিদ্যমান checkpoint থেকে হয় নির্মিত পরিবর্তে স্ক্রিপ্ট করা। Takeover কাজ একটি নেতা বাহু, বা কীবোর্ড এবং স্লাইডার আপনি এক না।

দেখা DAgger লুপ কিভাবে চালিত

গেট অর্ধেক পদ্ধতি; তথ্য পরিচালনা অন্য অর্ধেক

একটি গেট সিদ্ধান্ত যা ফ্রেম একটি মানুষ চালিত, না কি তাদের সঙ্গে করতে, এবং যে দ্বিতীয় সিদ্ধান্ত যেখানে রাউন্ড সবচেয়ে প্রায়ই বর্জিত হয়। প্রথম নিয়ম যা D DAgger দাঁড়ায় জন্য: একত্রিত, মুক্তি না। সূক্ষ্ম-tuning একটি checkpoint বিশুদ্ধভাবে কয়েক শত সংশোধন ফ্রেম দেখেছি প্রায় কিছু না এবং ভুলে গেছি নীতি প্রদান করেন সংজ্ঞায়িত trajectory।

দ্বিতীয় নিয়ম যা হস্তক্ষেপ ফ্রেম না সাধারণ ফ্রেম। Mandlekar এবং অন্যরা একটি দূর-teleoperation সিস্টেম নির্মাণ করেছেন 6-DoF ম্যানিপুলেশন জন্য অপারেটর নীতি নিরীক্ষণ করতে এবং ব্যর্থতায় নিয়ন্ত্রণ সাহায্য, তারপর পুনরাবৃত্তি প্রশিক্ষণ একটি অ্যালগরিদম যে "উত্সাহিত করে নীতি শিখতে কিভাবে bottleneck অতিক্রম মাধ্যমে হস্তক্ষেপ"; এজেন্ট প্রশিক্ষিত যে তথ্য outperformed এজেন্ট প্রশিক্ষিত উপর একটি সমান অনেক সাধারণ প্রদর্শন নমুনা। Sirius ধারণা ঠেলে মধ্যে মোতায়েন, "পুনর্-ওজন প্রশিক্ষণ নমুনা অনুমান মানুষ বিশ্বাস এবং অপ্টিমাইজেশন নীতি ওজন আচরণগত ক্লোনিং সঙ্গে". উভয় প্রয়োজন একটি প্রতি-ফ্রেম মার্কার কি মানুষ-চালিত ছিল, যা কেন হস্তক্ষেপ ফ্ল্যাগ বিষয় আরও এটি লাগে।

তৃতীয় নিয়ম যা স্বয়ংক্রিয় মিশ্রণ একটি ফাঁদ। একটি রচিত ডেটাসেট যার উৎস তুমি enumerate ফাঁদ না করতে পারে এটি তুমি debug যখন পরবর্তী রাউন্ড পায় খারাপ। প্ল্যাটফর্মে রচনা পদক্ষেপ স্পষ্ট সেই কারণ - মূল ডেটাসেট প্লাস সংশোধন, পর্ব নির্বাচন প্রতিটি উৎস, এবং ফলাফল একটি সাধারণ LeRobot ডেটাসেট যা syncs এবং প্রশিক্ষণ যে কোনো অন্যান্য মত; ডেটাসেট ডকুমেন্টেশন কভার ফর্ম্যাট পক্ষ।

ধাপ একটি রাউন্ডকি এটি উৎপাদিতসবচেয়ে সাধারণ উপায় এটা সব ভুল যায়
রেকর্ডিং চালান অনুমানএকটি রান অধীন নীতি স্টেট বিতরণ নিজেররেকর্ড করা সাধারণ teleoperation, হারানো যে একটি নীতি চালিত ছিল
ব্যর্থতা উপর দখল নিনসংশোধন সেগমেন্ট একটি প্রতি-ফ্রেম হস্তক্ষেপ ফ্ল্যাগ সঙ্গেসংশোধন সৌন্দর্য wobble, শিক্ষা শৈলী পরিবর্তে পুনরুদ্ধার একটি
Curate প্রতিটি পর্বসংশোধন, মূল্যায়ন, বা জলাতিরাখা সবকিছু; একটি botched takeover খরচ আরও পর্ব মূল্যবান।
সংশোধন সিঙ্ক করুনএকটি সংস্করণ ডেটাসেট পাশে মূলসংশোধন যা কখনো স্থানীয় মেশিন ছেড়ে যান
মিশ্র ডেটাসেট রচনা করুনমূল প্লাস সংশোধন, স্পষ্ট নির্বাচননীরব স্বয়ংক্রিয়-মিশ্রণ, তাই একটি পরবর্তী regress করতে পারে না একটি উৎস দায়বদ্ধ ট্রেস।
একটি checkpoint থেকে অব্যাহত রাখুনএকটি checkpoint প্রাক্ষেপিত থেকে পূর্ববর্তীএকটি অপ্টিমাইজার পুনরায় প্রত্যাশা করছে; ওজন initialise মডেল, তারা পুনরুদ্ধার অপ্টিমাইজার স্টেট না।

একটি গেট সেট একটি ব্যক্তি প্রকৃত পারে ধারণ করুন

"মানুষ সিদ্ধান্ত" একটি স্পেসিফিকেশন না। দুটি অপারেটর বিভিন্ন থ্রেশহোল্ড অতুলনীয় রাউন্ড উৎপাদিত, এবং একটি ড্রিফটিং থ্রেশহোল্ড একটি ট্রেন্ড তুমি পড়ুন না পড়তে পারে। লিখুন ট্রিগার নিচে প্রথম চালান আগে।

  1. নাম শর্তাবলী যে গেট খোলে - পদ্ধতি একটি নির্ধারিত মার্জিন ফাঁক, gripper বন্ধ করা কিছু উপর না, একটি যৌথ ড্রিফটিং একটি সীমা, একটি stall দুই সেকেন্ড একাধিক বা - রাখুন তালিকা অপরিবর্তিত রাউন্ড জন্য।
  2. নাম কি না খোলে এটা। Overshoot নীতি পুনরুদ্ধার করে নিজের প্রশিক্ষণ প্রতিশ্রুতি; নিয়ন্ত্রণ সেখানে মুছে দেয় পুনরুদ্ধার এটি ইতিমধ্যে জানে।
  3. Takeover যথেষ্ট তাড়াতাড়ি নিষ্কাশন একটি পরিষ্কার হাতে দিয়ে, হ্যান্ড ফিরিয়ে দিন যত তাড়াতাড়ি রাজ্য পুনরুদ্ধারযোগ্য।
  4. লগ কেন তুমি নিয়ন্ত্রণ নিয়েছেন, প্রতিটি পর্ব। তিন রাউন্ড পরে এটি একমাত্র রেকর্ড আছে ব্যর্থতা একই রিটার্ন।
  5. রাখুন ক্যামেরা, কাজ পাঠ এবং অপারেটর রাউন্ড জুড়ে ধ্রুবক। পরিবর্তন একটি এবং সংখ্যা থামিয়ে তুলনীয়।

যান্ত্রিকভাবে হাতে নিয়ে দুটি বৈকল্পিক। একটি নেতা বাহু, নেতা উপস্থিতি অনুসরণকারী এর বর্তমান ভঙ্গি আগে torque বিস্তার বা বাহু জম্প; এই সারিবদ্ধকরণ পদ্ধতি যদি না যাচাই অংশ শৃঙ্খলার উপর বাস্তব হার্ডওয়্যার। ছাড়া নেতা বাহু takeover ম্যানুয়াল প্রথম keypress থেকে: অনুসরণকারী অনুষ্ঠিত এবং অপারেটর nudges এটি যৌথ যৌথ কীবোর্ড থেকে বা ড্র্যাগ স্লাইডার, সার্ভার-দিক কল রাখা প্রতিটি ইনপুট ছোট - দম্পতি ডিগ্রি প্রতি keypress, মুঠোয় প্রতি স্লাইডার আপডেট, কারণ একটি বৃহৎ পদক্ষেপ একটি পরিধারিত ভঙ্গি কিভাবে আপনি স্ট্রিপ একটি servo। ধাপ-দ্বারা-ধাপ সংস্করণ কীবাইন্ডিং একটি DAgger রাউন্ড একটি SO-100 এর অনুষ্ঠানী; পটভূমি উভয় teleoperation মোড পরিসীমা teleoperation ডকুমেন্টেশন এবং নেতা-অনুসরণকারী প্রবিষ্টি

সমর্থিত নীতি স্থাপত্য তুলনা তাদের প্রশিক্ষণ এবং অনুমান বৈশিষ্ট্য সহ
গেট আর্কিটেকচার-agnostic। নীতি আপনি কোন সংশোধন রাউন্ড প্রশিক্ষণ খরচ পরিবর্তন, না কিভাবে takeover কাজ।

পড়া যদি গেট কিছু

মেট্রিক একটি মানুষ-গেটড রাউন্ড হস্তক্ষেপ হার: হস্তক্ষেপ ফ্রেম দ্বারা বিভক্ত ফ্রেম রান। এটা একটি কাজ - যদি তা ড্রপ না রাউন্ড, রাউন্ড কিনেছে কিছু, এবং পরবর্তী রাউন্ড পরিবর্তন কিছু অন্যথায় ডেটা পরিমাণ।

এটা একটি biased মেট্রিক এবং আপনার কিভাবে জানা উচিত। এটা পরিমাপ অপারেটর এর থ্রেশহোল্ড অনেক যেমন নীতি competence, যা কেন ট্রিগার তালিকা সবুজ সবসময়; অপারেটর যারা শিথিল একটি সেশন একটি ভঙ্গি তৈরি বক্ররেখা পতন এটা পিছনে কিছু ছাড়াই। এটা উপেক্ষা মাত্রা - দশ ফ্রেম থামাতে একটি সংঘর্ষ এবং দশ nudge একটি grasp দেখায় একমাত্র। দম্পতি একটি নির্ধারিত মূল্যায়ন সেট কোনো সংশোধন ডেটা যখন ঠেলে দেওয়া হয়েছিল। মাপার DAgger লুপ নিবন্ধ কাজ মাধ্যমে মূল্যায়ন ডিজাইন, সহ কিভাবে মূল্যায়ন পর্ব রাখতে বিরত প্রশিক্ষণ মিশ্রণ।

মানুষ গেট, সৎভাবে
কি এটা দেয়
  • কাজ দিন এক, কোনো নীতি আর্কিটেকচার, কোনো অতিরিক্ত মডেল যাঁচাই করতে
  • ধরা আত্মবিশ্বাস-এবং-ভুল ব্যর্থতা কোনো ভিত্তি থ্রেশহোল্ড সনাক্ত করে
  • উৎপাদিত সংশোধন রেকর্ড যখন অপারেটর সম্পূর্ণ নিয়ন্ত্রণ ছিল, মুহূর্ত তারা নির্বাচিত
  • বৃদ্ধি পায় একটি প্রতি-ফ্রেম মার্কার যে হস্তক্ষেপ-ওজন পদ্ধতি যেমন IWR এবং Sirius গ্রাস করে
কি এটা না
  • খরচ ক্রমাগত তত্ত্বাবধান; এটা স্কেল না একটি ব্যক্তি এবং অনেক রোবোট
  • নির্ভর অপারেটর সামঞ্জস্য - একটি ড্রিফটিং থ্রেশহোল্ড দুর্নীতি হস্তক্ষেপ হার
  • উৎপাদিত কোনো ঝুঁকি মডেল নিজেই; HG-DAgger এর শিখা থ্রেশহোল্ড এবং ThriftyDAgger এর নির্ধারক অতিরিক্ত যন্ত্র
  • সংখ্যার ফ্রেম, পরিণতি না
  • ব্যর্থ ঐতিহ্যবাহী যার ব্যর্থতা নিয়ন্ত্রণ আপস্ট্রিম, যেমন একটি অদলবদল ক্যামেরা বা একটি কাজ mislabelled স্ট্রিং

প্রশ্ন খোলে সার্থক রাখা প্রাসঙ্গিক দৃশ্যমান

বেঞ্চমার্ক দুর্বল। Spencer এবং সহকর্মী পরীক্ষা করা যে পরীক্ষা imitation শেখা পদ্ধতি এবং তারা খুঁজে "wieldable এবং সহজ এবং সুতরাং অপ্রয়োজনীয় ক্যাপচার শক্ত শাসন ত্রুটি compounding বাস্তব-বিশ্ব সিদ্ধান্ত নেওয়া সমস্যা" - এবং, চারপাশে সাহিত্য, খুঁজে প্লেইন আচরণ ক্লোনিং ভাল করা তারা। যে কারণ সন্ধিসন্ধান্ত DAgger বৈকল্পিক র‍্যাঙ্কিং তারা কাজ, সহ কিছু সংখ্যা টেবিল উপরে।

রোবোট গেট বড় নীতি না সমাধান হয়। AIM কাজ বিস্থাপিত নিশ্চয়তা একটি প্রক্সি Q-ফাংশন মিমিক মানুষ হস্তক্ষেপ নিয়ম এবং রিপোর্ট একটি 40% উন্নতি নিয়ে-উপর খরচ এবং শেখা দক্ষতা থেকে ThriftyDAgger - ক্রমাগত এবং বিচ্ছিন্ন নিয়ন্ত্রণে, না একটি vision-ভাষা-কর্ম মডেল চালিত একটি manipulator। আছে কি এই গেট স্থানান্তর একটি সূক্ষ্ম-tuned VLA খোলা। জরিপ একটি সম্পর্কিত পয়েন্ট করে: ক্ষেত্র এর পরিভাষা এবং গঠন না unified সাহিত্য জুড়ে, যা করে পদ্ধতি তুলনা কঠিন। আপনার নিজের বাহু, আপনার লগ প্রমাণ আপনার করেছি।

HG-DAgger সত্যিই DAgger যদি মানুষ শুধুমাত্র লেবেল হস্তক্ষেপ সময়?

এটা রাখে অংশ যে বিষয় - ডেটা সংগৃহীত অধীন রাজ্য বিতরণ শিক্ষাবিদ নিযুক্ত, aggregated যা অগ্রসর - এবং ড্রপ অংশ না বাস্তব হার্ডওয়্যার সঙ্গে সম্পর্ক টিকে। কেলি এবং অন্যরা উপস্থাপন এটি একটি বৈকল্পিক; 2011 কোনো-অনুশোচনা গ্যারান্টি না বহন পরিবর্তিত।

আমি ব্যবহার করতে পারেন একটি রোবোট গেট একটি সূক্ষ্ম-tuned VLA নীতি একটি SO-100 এ?

না straightforwardly। SafeDAgger এর শ্রেণীকরণকারী প্রয়োজন একটি queryable রেফারেন্স নীতি তুমি করি না। EnsembleDAgger প্রয়োজন একটি সমষ্টি, যা একটি মাল্টি-বিলিয়ন-প্যারামিটার মডেল মানে একাধিক কপি স্মৃতি প্লাস তাদের অনুমান খরচ। ThriftyDAgger প্রয়োজন একটি ঝুঁকি নির্ধারক ফিট সাফল্য এবং ব্যর্থতা যা বিদ্যমান না আগে রাউন্ড।

কত দীর্ঘ হওয়া উচিত একটি একক takeover?

দীর্ঘ যথেষ্ট পৌঁছাতে একটি রাজ্য নীতি পারে অব্যাহত রাখুন থেকে, এবং কোনো দীর্ঘতর: বর্ধিত takeover চালান একটি প্রদর্শন সেশন রূপান্তরিত এবং বন্যা সংশোধন নির্ধারিত আচরণ। LazyDAgger এর উপলব্ধি অন্য উপায় কেটে - অনেক অত্যন্ত কম সুইচ তাদের নিজস্ব খরচ।

আমি প্রশিক্ষণ করা উচিত শুধুমাত্র সংশোধিত সেগমেন্ট?

না - যে সবচেয়ে সাধারণ উপায় বর্জিত একটি রাউন্ড। একটি মডেল সূক্ষ্ম-tuned শুধুমাত্র পুনরুদ্ধার সম্পর্কে অনেক দেখেছি পুনরুদ্ধার। মিশ্রণ সংশোধন মূল ডেটাসেট উৎস স্পষ্টভাবে নির্বাচিত হয়; আরও যেতে, লাগেজ হস্তক্ষেপ-ওজন পদ্ধতি যেমন IWR বা Sirius, যে আপ-ওজন মানুষ-চালিত ফ্রেম বরং অনুভব তাদের।

কি যদি হস্তক্ষেপ হার ড্রপ না একটি রাউন্ড পরে?

নিন এটা মুখ্য: রাউন্ড করি না সাহায্য। সংশোধন যোগ করার আগে, পরীক্ষা সস্তা ব্যাখ্যা - এটা অপারেটর এর থ্রেশহোল্ড ড্রিফট, সংশোধন সৌন্দর্য ছিল, রচিত ডেটাসেট সত্যিই তাদের রয়েছে, ছিল প্রশিক্ষণ সংশোধনীকৃত checkpoint থেকে আরম্ভ করা। একটি রাউন্ড যে নীরবে ভিত্তি মডেল থেকে শুরু চেহারা যথাযথভাবে একটি রাউন্ড যে ব্যর্থ শিখতে।

করি না-হস্তক্ষেপ বহন করা তথ্য?

অধীন বিশেষজ্ঞ হস্তক্ষেপ শেখা, হ্যাঁ: বিস্তৃত যেখানে তত্ত্বাবধানকারী দেখেছি এবং যা করি না অভিনয় দুর্বল প্রমাণ অনুমান তৈরি করা হয় রাজ্য এবং অ্যাকশন গ্রহণযোগ্য ছিল, formalised একটি মূল্য ফাংশন সীমাবদ্ধতা হিসাবে। বেশিরভাগ ব্যবহারিক pipeline, এই অন্তর্ভুক্ত, মার্ক শুধুমাত্র কি মানুষ চালিত।

একটি একক বাহু একটি ডেস্ক পছন্দ করা হয়েছে: গেট ধরুন নিজেই, লিখুন নিচে কি খোলে এটা, এবং ব্যয় প্রচেষ্টা প্রকৃত তথ্য হ্যান্ডলিং এটার চেয়ে স্বয়ংক্রিয় সুইচ। প্ল্যাটফর্ম পক্ষ পরিবর্তে করা হয় DAgger লুপ পৃষ্ঠা, প্রশিক্ষণ বিকল্প প্রতিটি নীতি পরিবার অধীন প্রশিক্ষণ এবং মূল্য নির্ধারণ. পটভূমির জন্য, শুরু করুন অনুকরণ শেখা এবং অনুকরণ শেখা SO-100 উপর; একটি প্রথম চালান, চালান আপনার প্রথম নীতি ছোটোট পথ।

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started