একটি রোবট ম্যানিপুলেশন দৃশ্যের বিমূর্ত প্রতিফলন, যা একটি শেখা নীতি সম্পাদনের সময় পরিদর্শন করা অবস্থা বিতরণকে চিত্রিত করে
DAggerঅনুকরণ শিক্ষাআচরণ ক্লোনিংরোবট শেখাতত্ত্ব

DAgger ব্যাখ্যা করা হয়েছে: কেন আচরণ ক্লোনিং বিচলিত হয় এবং ডেটাসেট সমন্বয় প্রকৃতপক্ষে কী প্রমাণ করে

AY-Robots ResearchAugust 27, 2026১৫ মিনিটের পাঠ

আচরণ ক্লোনিং বিশেষজ্ঞের অবস্থা বিতরণে একটি নীতি ফিট করে এবং তারপর এটি নিজের উপর স্থাপন করা হয়। এই দুটি বিতরণের মধ্যে ব্যবধান হল কেন একটি নীতি যা যাচাইকরণে ভাল দেখায় ধাপ ৩০০ এ টেবিল থেকে পড়ে যায়। এটি আমাদের DAgger সিরিজের তাত্ত্বিক অধ্যায়: দ্বিঘাত ত্রুটি পদ কোথা থেকে আসে, ডেটাসেট সমন্বয় কী পরিবর্তন করে, না-অনুশোচনা প্রমাণ কী অনুমান করে এবং মানুষ বিশেষজ্ঞকে এখনও কোন বিল দিতে হয়।

একটি নির্দিষ্ট ব্যর্থতা রয়েছে যা প্রত্যেকে যারা একটি ম্যানিপুলেশন নীতি প্রশিক্ষণ দেয় তারা আগে বা পরে সম্মুখীন হয়। নীতিটি ঘনককে ধরার জন্য পৌঁছায়, দুই সেন্টিমিটারের মধ্যে পৌঁছায়, দ্বিধা করে, পাশে বিচলিত হয় এবং তারপর কাজের সাথে সম্পর্কহীন কিছু করে। যাচাইকরণ ক্ষতি ভাল ছিল। ধরা পড়া এপিসোডের বিরুদ্ধে ওপেন-লুপ পুনরাবৃত্তি ভাল ছিল। এবং তবুও বাহুটি প্রশিক্ষণ ডেটায় কোথাও প্রদর্শিত হয় এমন একটি ভঙ্গিতে শেষ হয় এবং সেখান থেকে এটি বলার জন্য কিছুই বোধগম্য নয়।

এই ব্যর্থতার একটি নাম এবং এটির পিছনে তত্ত্বের একটি প্রতিষ্ঠিত অংশ রয়েছে। এটি DAgger এ চারটি নিবন্ধের প্রথমটি, এবং এটি যুক্তিটি নিজেই কভার করে: কেন একটি নীতি প্রদর্শনকারীর নিজের গতিপথে ফিট করা একটি ত্রুটি তৈরি করে যা এপিসোডের দৈর্ঘ্যের বর্গ সহ বৃদ্ধি পেতে পারে, ডেটাসেট সমন্বয় কী পরিবর্তন করে এবং না-অনুশোচনা প্রমাণ কী প্রতিশ্রুতি দেয় না। বাস্তব হার্ডওয়্যারে লুপ কভার করা হয় একটি SO-100 এ DAgger লুপ চালনা করা এ, মানুষ-গেটেড ভেরিয়েন্ট HG-DAgger এবং মানুষ-গেটেড হস্তক্ষেপ এ এবং পরিমাপ প্রশ্ন একটি DAgger লুপ পরিমাপ করা এ।

সংক্ষিপ্ত সংস্করণ

  • আচরণ ক্লোনিং বিশেষজ্ঞের অবস্থা বিতরণে প্রশিক্ষণ দেয় এবং নীতির নিজের উপর মূল্যায়ন করা হয়। অসামঞ্জস্য এপিসোড জুড়ে সংকলিত হয়।
  • রস এবং বাগনেল দেখিয়েছেন অতিরিক্ত খরচ T বর্গ বার প্রতি-ধাপ ত্রুটির সাথে বৃদ্ধি পেতে পারে; DAgger কাগজ সেই বাউন্ড পুনরায় বলে এবং এটি দৃঢ় তা নোট করে।
  • DAgger লেবেলস রাজ্যগুলি নীতি নিজে পরিদর্শন করে এবং এখন পর্যন্ত সংগৃহীত প্রতিটি ডেটাসেটে পুনঃপ্রশিক্ষণ দেয়, শুধুমাত্র সর্বশেষ নয়।
  • গ্যারান্টি না-অনুশোচনা অনলাইন শিক্ষার একটি হ্রাস: সমন্বয় এবং পুনঃপ্রশিক্ষণ অনুসরণ-দ্য-নেতা।
  • এটি নীতি শ্রেণীতে অর্জনযোগ্য সেরা ক্ষতির ক্ষেত্রে রাখে, শূন্যের ক্ষেত্রে নয় - এবং বিশেষজ্ঞকে এখনও এমন রাজ্যগুলি লেবেল করতে হবে যা এটি কখনও উত্পাদন করত না।

অনুমান আচরণ ক্লোনিং নিঃশব্দে করে

একটি প্রদর্শনী ডেটাসেট পর্যবেক্ষণ-কর্ম জোড়ের একটি স্তূপ। আচরণ ক্লোনিং সাধারণ তদারকিকৃত শিক্ষা সহ সেই স্তূপের জন্য একটি ফাংশন ফিট করে এবং সেখানে থেমে যায়। এটি এই ক্ষেত্রের সবচেয়ে পুরানো ধারণা। পোমারলিউ এর ALVINN, ১৯৮৮ সালে, একটি তিন-স্তরের ব্যাক-প্রোপাগেশন নেটওয়ার্ক ছিল যা একটি ক্যামেরা এবং একটি লেজার রেঞ্জ ফাইন্ডার থেকে ছবি নিয়েছিল এবং যানবাহনটি ভ্রমণ করা উচিত এমন দিক তৈরি করেছিল; এটি অনুকৃত রাস্তার ছবিতে প্রশিক্ষিত হয়েছিল এবং কিছু ক্ষেত্রের অবস্থার অধীনে বাস্তব রাস্তা অনুসরণ করেছিল। রেসিপিটি অনেক পরিবর্তন হয়নি; নেটওয়ার্কগুলি আছে।

যা এড়িয়ে যাওয়া হয় তা হল এই জোড়গুলি কোথা থেকে এসেছে তা পরীক্ষা করা। তাদের প্রত্যেকটি একটি গতিপথে রয়েছে যা প্রদর্শক তৈরি করেছে। আপনি স্থাপন করেন এমন নীতি এটি নিজের তৈরি করে। মুহূর্তটি এটি বিচলিত হয়, এটি প্রশিক্ষণ বিতরণে ছিল না এমন রাজ্যগুলি সম্পর্কে অনুসন্ধান করা হচ্ছে এবং এর উত্তর এটিকে আরও বেরিয়ে নিয়ে যায়। রস, গর্ডন এবং বাগনেল ঠিক এটির সাথে DAgger কাগজ খোলেন: ক্রমিক পূর্বাভাস পরিসংখ্যান শিক্ষার অধীনে i.i.d অনুমান লঙ্ঘন করে, কারণ শিক্ষার্থীর নিজের পূর্বাভাসগুলি এটি পরবর্তী যে ইনপুটগুলি দেখে তা নির্ধারণ করে।

সেই কাগজটিতে সবচেয়ে স্পষ্ট চিত্রটি একটি রোবট নয়। সুপার মারিও ব্রস্ এর জন্য একটি কাছাকাছি-সর্বোত্তম পরিকল্পনা ক্লোনিং একটি নীতি তৈরি করেছিল যা বারবার একটি বাধার বিরুদ্ধে আটকে যায় এর পরিবর্তে এটি লাফিয়ে যায়। কারণটি একটি বাক্যে সম্পূর্ণ যুক্তি: বিশেষজ্ঞ সর্বদা একটি আরামদায়ক দূরত্ব থেকে লাফিয়েছেন, তাই ডেটাসেটে মারিও একটি বাধার বিরুদ্ধে চাপা দেওয়ার একটি রাজ্য ছিল না এবং তাই একবার তিনি সেখানে পৌঁছেছিলেন তা করতে কোন লেবেল ছিল না।

মারিওকে একটি SO-100 বাহু দিয়ে বিনিময় করুন এবং কাঠামোটি অভিন্ন। আপনার প্রদর্শনগুলি একটি পরিষ্কার পদ্ধতি এবং একটি পরিষ্কার গ্রাস দেখায়, দুই সেন্টিমিটার ছোট ক্লিপ করা গ্রিপার নয় - তাই নীতিটি সেখান থেকে কী করতে হবে তা জানে না এবং যা কিছু অনুমান করে তা এটিকে আরও বেরিয়ে নিয়ে যায়। সহ-পরিবর্তনশীল পরিবর্তন হল ডেটা সংগ্রহ পদ্ধতির একটি সম্পত্তি, নেটওয়ার্ক আর্কিটেকচারের নয়।

দ্বিঘাত পদ কোথা থেকে আসে

২০১০ AISTATS কাগজ রস এবং বাগনেল দ্বারা, অনুকরণ শিক্ষার জন্য দক্ষ হ্রাস, যৌগিকটি নির্ভুল করে তোলে। T কে কাজের দিগন্ত হতে দিন, কাজের খরচ ইউনিট ব্যবধানে বাঁধা হতে দিন এবং epsilon হতে দিন বিশেষজ্ঞের অবস্থা বিতরণের অধীনে পরিমাপ করা প্রক্সি ক্ষতি - সংখ্যা আপনার যাচাইকরণ সেট রিপোর্ট। তারপর সেই নীতিটি T ধাপের জন্য চালনার অতিরিক্ত খরচ, বিশেষজ্ঞের সাথে সম্পর্কিত, T বর্গ বার epsilon দ্বারা বাঁধা হয়। রস, গর্ডন এবং বাগনেল এটিকে DAgger কাগজে তত্ত্ব ২.১ হিসাবে পুনরায় বলে এবং যা বিষয়টি গুরুত্বপূর্ণ বাক্যটি যোগ করে: বাউন্ডটি দৃঢ়। সমস্যাগুলি বিদ্যমান যেখানে বিশেষজ্ঞের বিতরণের অধীনে epsilon ক্ষতি সহ একটি নীতি সত্যিই T-তে চতুর্ভুজভাবে বৃদ্ধি পাওয়ার অতিরিক্ত খরচ করে।

দৃঢ় মানে সাধারণ নয়। দ্বিঘাত পদ সমস্যাগুলির একটি শ্রেণীতে একটি সবচেয়ে খারাপ ক্ষেত্র, আপনার পিক-এবং-প্লেস কাজ সম্পর্কে একটি পূর্বাভাস নয়। এটি যা প্রতিষ্ঠা করে তা হল আরও বিশেষজ্ঞ প্রদর্শন সমস্যাটি সরাতে পারে না: এটি শুধুমাত্র epsilon এর অনুমানকে তীক্ষ্ণ করে যা নীতি পরীক্ষা করা হবে না।

পালানোর পথটি একই কাগজে রয়েছে, তত্ত্ব ২.২ হিসাবে পুনরায় বলা হয়েছে। যদি একটি নীতি epsilon ক্ষতি অর্জন করে এর নিজের অবস্থা বিতরণের অধীনে এবং একটি একক ভুল কর্ম বিশেষজ্ঞের অধীনে খরচ-থেকে-যাওয়ার সর্বাধিক u খরচ করে, অতিরিক্ত খরচ u বার T বার epsilon দ্বারা বাঁধা হয় - দিগন্তে রৈখিক। ধ্রুবক u আকর্ষণীয় পরিমাণ: বিশেষজ্ঞের সাথে ০-১ মতবিরোধের জন্য সর্বাধিক ১ এবং O(1) যখনই বিশেষজ্ঞ কয়েকটি ধাপের মধ্যে পুনরুদ্ধার করতে পারে। সবচেয়ে খারাপ ক্ষেত্রে এটি O(T) এবং রৈখিক বাউন্ড দ্বিঘাত একের চেয়ে ভাল নয়।

সেটিংবিশেষজ্ঞের উপর অতিরিক্ত খরচের বাউন্ডএটি কী রাখে তা
আচরণ ক্লোনিং (রস এবং বাগনেল ২০১০, রস এট অ্যাল। ২০১১ তে তত্ত্ব ২.১ হিসাবে পুনরায় বলা হয়েছে)T বর্গ বার epsilonepsilon বিশেষজ্ঞের অবস্থা বিতরণে পরিমাপ করা হয়; খরচ [0,1] এ; বাউন্ড দৃঢ়
যে কোনও নীতি এর নিজের বিতরণের অধীনে epsilon ক্ষতি সহ (থ্যাম। ২.२)u বার T বার epsilonu একটি ভুল কর্মের খরচ-থেকে-যাওয়ার জরিমানা বাঁধে; ০-१ ক্ষতির জন্য সর্বাধিক ১, O(T) সবচেয়ে খারাপ ক্ষেত্র
ফরোয়ার্ড প্রশিক্ষণ (রস এবং বাগনেল २०१०)u বার T বার epsilonপ্রতিটি সময়ধাপে একটি নীতি; T নীতি এবং পরিচিত, সীমিত T প্রয়োজন
SMILe (রস এবং বাগনেল २०१०)T এবং epsilon এর নিকট-রৈখিক কিছু সমস্যা শ্রেণীalpha O(1/T বর্গ) এ, N O(T বর্গ log T) এ; একটি stochastic মিশ্রণ ফলাফল
DAgger (থ্যাম। ३.२, রস এট অ্যাল। २०११)u বার T বার epsilon_N, প্লাস O(1)N uT এর ক্রমে; strongly convex সীমিত ক্ষতি; না-অনুশোচনা শিক্ষার্থী; epsilon_N পূর্ববর্তীতে সেরা ক্ষতি
একটি রোবট কর্মক্ষেত্র প্রতিনিধিত্ব করা রাজ্যগুলি একটি নীতি পরিদর্শন করে যা প্রদর্শন সেটে কখনও উপস্থিত হয়নি
DAgger রাউন্ডের জন্য যে রাজ্যগুলি গুরুত্বপূর্ণ তা হল যা কেউ প্রদর্শন করেনি: কাছাকাছি-মিস গ্রাস, অর্ধ-খোলা গ্রিপার, বস্তুর অতীত বাহু।

DAgger এর আগে আসা দুটি প্রচেষ্টা

ফরোয়ার্ড প্রশিক্ষণ হল সৎ কিন্তু অব্যবহারিক উত্তর। প্রতিটি সময়ধাপের জন্য আলাদা নীতি প্রশিক্ষণ দিন, ক্রমে, প্রতিটি ইতিমধ্যে নির্ধারিত আগের ধাপের নীতিগুলির দ্বারা প্ররোচিত অবস্থা বিতরণে, যাতে প্রতিটি নীতি ঠিক সেই বিতরণ দেখে যা এটি মুখোমুখি হবে। ক্যাচটি বর্ণনায়: T নীতি, ক্রমিকভাবে প্রশিক্ষিত, কোন প্রাথমিক থামার। একটি ম্যানিপুলেশন এপিসোড এ ৩০ ফ্রেম প্রতি সেকেন্ড, T শত শত মধ্যে।

SMILe, একই কাগজ থেকে এবং SEARN, Daume, Langford এবং Marcu এর কাঠামোগত পূর্বাভাস কাজ থেকে, অন্য পথ নিতে: একটি স্থির নীতি, কিন্তু stochastic। প্রতিটি পুনরাবৃত্তি একটি উপাদান প্রশিক্ষণ দেয় এবং এটিকে একটি মিশ্রণে যোগ করে, বিশেষজ্ঞ থেকে দূরে সম্ভাবনা ভর পরিবর্তন করে। ফলাফল হল একটি মিশ্রণ যেখানে কিছু উপাদান অন্যদের চেয়ে খারাপ - একটি শারীরিক বাহুতে, একটি নিয়ন্ত্রক যা গতির মধ্য দিয়ে একটি খারাপ উপাদান নমুনা করতে পারে। এটি একটি স্থির পরিবর্তে একটি স্থির নির্ধারক নীতি চাওয়ার বলা প্রেরণা।

DAgger: একটি ধারণা, একটি বাক্স

ডেটাসেট সমন্বয় নির্ধারক নীতি রাখে এবং ডেটা সংগ্রহে ফিক্স করে। প্রতিটি রাউন্ড: বর্তমান নীতি রোল আউট করুন, রাজ্যগুলি রেকর্ড করুন এটি পরিদর্শন করে, প্রতিটিতে সঠিক কর্ম কী হবে তা বিশেষজ্ঞকে জিজ্ঞাসা করুন, সেই জোড়গুলি আপনার ইতিমধ্যে যে ডেটাসেটটি আছে তাতে যোগ করুন, ইউনিয়নে পুনঃপ্রশিক্ষণ দিন। নামটি হল অ্যালগরিদম - আপনি সমন্বয় করেন, আপনি কখনও বাতিল করবেন না।

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAgger মেটা-অ্যালগরিদম, রস, গর্ডন এবং বাগনেল (२०११) এর অ্যালগরিদম ३.१।

তিনটি বিবরণ তারা কীভাবে দেখায় তার চেয়ে বেশি ওজন বহন করে। লেবেলগুলি মিশ্র নীতি দ্বারা পরিদর্শিত অবস্থার জন্য হয়, তবে কর্মগুলি বিশেষজ্ঞের কাছ থেকে আসে - নীতিটি প্রশ্নগুলি প্রদান করে, বিশেষজ্ঞ উত্তর। পুনঃপ্রশিক্ষণটি সম্পূর্ণ সমন্বয়ে রয়েছে, যা প্রতিটি রাউন্ডকে একটি ফলো-দ্য-লিডার ধাপ করে তোলে: রাউন্ড n এ আপনি এখন পর্যন্ত প্রতিটি গতিপথের উপর পূর্বপূর্ব সেরা নীতি বেছে নিন। যে ফ্রেমিং হল প্রমাণ যা হ্যাঙ্গ করে। এবং অ্যালগরিদম ক্রম হিসাবে সেরা নীতি ফেরত দ্বারা শেষ হয় যা একটি যাচাইকরণ সেটে নির্বাচিত হয়, কারণ উপপাদ্যগুলি গ্যারান্টি দেয় যে কিছু ক্রমে নীতি ভাল, শেষটি নয়।

বিটা সূচী এবং কেন এটি একটি টিউনিং নব নয়

মিশ্র নীতি হল beta_i বার বিশেষজ্ঞ প্লাস এক বিটা_i বার শিক্ষার্থী বার নয়। পয়েন্টটি অনুশীলন: প্রথম কয়েকটি শেখা নীতি প্রশিক্ষণ দেওয়া হয় খুব কম ডেটায়, অনেক ভুল করে এবং অন্যথায় রোলআউটে ব্যয় করবে এমন রাজ্যগুলিতে অপ্রাসঙ্গিক হয়ে ওঠে একবার নীতি উন্নত হয়।

তত্ত্ব ঠিক একটি শর্ত আরোপ করে: বিটা চলার গড়কে শূন্যে যেতে হবে। বিশ্লেষণটি beta_i সীমাবদ্ধ সহ কাজ করে (1 - alpha) থেকে শক্তি i-1, একটি ধ্রুবক alpha T এ স্বাধীন।

সূচীএটি কী করেকাগজ যা রিপোর্ট করে
beta_1 = 1প্রথম রাউন্ড বিশুদ্ধ বিশেষজ্ঞ প্রদর্শন; কোন প্রাথমিক নীতি প্রয়োজন হয় নাপ্রতিটি ভেরিয়েন্টে সুপারিশকৃত শুরু বিন্দু
beta_i = 1 যদি i = 1, অন্যথায় 0বিশেষজ্ঞ শুধুমাত্র রাউন্ডে; কোন বিনামূল্যে প্যারামিটারকাগজের প্যারামিটার-মুক্ত সংস্করণ, যা এটি প্রায়শই অনুশীলনে সেরা করে বলে; সুপার মারিও ব্রস্ এ २98० २० পুনরাবৃত্তি পরে
beta_i = p^(i-1) p = 0.5 সহবিশেষজ্ঞ সম্ভাবনা geometrically ক্ষয়একই বেঞ্চমার্কে ३०३०, প্যারামিটার-মুক্ত সংস্করণের চেয়ে সামান্য এগিয়ে
beta_i = p^(i-1) p = 0.9 সহবিশেষজ্ঞ লুপে অনেক দীর্ঘ থাকেউল্লেখযোগ্যভাবে ধীর সংমিশ্রণ; ২० পুনরাবৃত্তি শেষ হলেও উন্নতি করছেন

२98० এবং ३०३० মধ্যে ফাঁক প্রায় ४३०० চলমান একটি স্কেলে ছোট, কিন্তু এটি সম্পর্কে কাগজের ব্যাখ্যা অংশে সবচেয়ে উপকারী ব্যবহারিক নোট। প্যারামিটার-মুক্ত সূচী সহ, মারিও এক জায়গায় প্রাথমিকভাবে আটকে গেলেন এবং সেই এক অবস্থান থেকে কাছাকাছি-ডুপ্লিকেট ডেটার একটি ভর তৈরি করেছিলেন; বিশেষজ্ঞকে সময়ের একটি অংশ চালনা করতে দেওয়া তাকে উভয় unstuck করেছিল এবং রাজ্যের বৈচিত্র্য বিস্তৃত করেছিল। সূচী মিশ্রণ অনুপাত সম্পর্কে কম আপনার ডেটা সংগ্রহ নতুন রাজ্য উত্পাদন রাখে বা একই ব্যর্থতা সম্পর্কে।

সূচী একটি শারীরিক বাহুতে লেখা হিসাবে হস্তান্তর না কেন

একটি stochastic প্রতি-সময় মিশ্রণ মানে সিদ্ধান্ত নিচে নিয়ন্ত্রণ কর্তৃপক্ষ সুইচিং, একটি সাধারণ SO-100 সেটআপে ৩০ বার প্রতি সেকেন্ড। কোন teleoperation ইন্টারফেস যে নিরাপদ বা অর্থপূর্ণ করে তোলে। বাস্তব হার্ডওয়্যারে বিটা সূচী মানুষ সিদ্ধান্ত দ্বারা কখন দিতে এ পাথর: একটি ভিন্ন অ্যালগরিদম একটি ভিন্ন বিশ্লেষণ সঙ্গে।

গ্যারান্টি: না-অনুশোচনা অনলাইন শিক্ষার একটি হ্রাস

এখানে এমন পদক্ষেপ যা কাগজটি কী করে তোলে। প্রতিটি DAgger রাউন্ডকে একটি অনলাইন শিক্ষা সমস্যায় একটি উদাহরণ হিসাবে বিবেচনা করুন, যেখানে রাউন্ড i তে ক্ষতি রাউন্ড i এ ব্যবহৃত নীতির অবস্থা বিতরণের অধীনে প্রক্সি ক্ষতি। শিক্ষার্থী সেই ক্ষতি দেখার আগে একটি নীতির জন্য প্রতিশ্রুতিবদ্ধ এবং ক্রমটি অ-স্থির কারণ এটি এখন পর্যন্ত উত্পাদিত নীতির উপর নির্ভর করে।

একটি অ্যালগরিদম না-অনুশোচনা যদি এর গড় ক্ষতি N রাউন্ড জুড়ে পূর্বাভাস মধ্যে সেরা একটি একক নীতি পদ্ধতি। ফলো-দ্য-লিডার strongly convex ক্ষতিতে এমন একটি অ্যালগরিদম, গড় অনুশোচনা ১/N এর ক্রমে সংকুচিত - এবং পূর্ণ সমন্বয়ে পুনঃপ্রশিক্ষণ ঠিক ফলো-দ্য-লিডার। অন্য কোনও না-অনুশোচনা শিক্ষার্থী কাজ করবে: বিশ্লেষণ একটি হ্রাস, একটি অপ্টিমাইজারের সম্পত্তি নয়।

একটি লেম্মা মিশ্র নীতি যা ডেটা সংগৃহীত এবং শেখা নীতি যা স্থাপিত হবে মধ্যে ফাঁক সেতু। লেম্মা ४.१ তাদের অবস্থা বিতরণ মধ্যে L1 দূরত্ব সীমাবদ্ধ २ T beta_i দ্বারা। এটি কেন বিটা ক্ষয় - যখন বিশেষজ্ঞ এখনও উল্লেখযোগ্য নিয়ন্ত্রণ কর্তৃপক্ষ রাখেন, আপনি সংগৃহ করেন রাজ্য আপনার নীতি উত্পাদন হবে না। লেম্মাটি অনুশোচনা সীমাবদ্ধ সহ একত্রিত করুন এবং প্রধান ফলাফল অনুসরণ করে: প্রায় T পুনরাবৃত্তি পরে, ক্রমে কিছু নীতি তার নিজের বিতরণের অধীনে প্রক্সি ক্ষতি epsilon_N এর মধ্যে O(1/T)। যে রৈখিক সীমাবদ্ধ ফিড এবং আপনি উপপাদ্য ३.२ এ অবতরণ।

অভিজ্ঞতামূলক পক্ষ বর্তমান মান দ্বারা বিনয়ী। সুপার টাক্স কার্টে তদারকিকৃত বেসলাইন ল্যাপ প্রতি এর গড় পড়া উন্নত করেনি যেমন আরও ডেটা এসেছে, DAgger পৌঁছেছেন একটি নীতি পনের পুনরাবৃত্তি পরে ট্র্যাক বন্ধ কখনও পড়ল না এবং SMILe পরে বিশ বছর এখনও প্রায় দ্বিগুণ ল্যাপ প্রতি পড়ল। হাতের লেখার বেঞ্চমার্ক, চরিত্র নির্ভুলতা ৮२ শতাংশ কাঠামো ছাড়াই, ८३.६ শতাংশ তদারকিকৃত, ८५.५ শতাংশ DAgger সহ। এটি ম্যানিপুলেশন ফলাফল কোন।

প্রমাণ কী প্রতিশ্রুতি দেয় না

উপপাদ্য বিবৃতি শর্তসাপেক্ষ এবং শর্ত লোডিং হয়।

DAgger গ্যারান্টি, ঘনিষ্ঠভাবে পড়া
এটি আপনাকে কী দেয়
  • একটি রৈখিক বাউন্ড বরং দ্বিঘাত T, নির্দিষ্ট অনুমান অধীনে।
  • একটি stochastic মিশ্রণ বরং একটি স্থির নির্ধারক নীতি।
  • একটি প্রকৃত হ্রাস: যে কোনও না-অনুশোচনা অনলাইন শিক্ষার স্লট ইন।
  • একটি কংক্রিট পুনরাবৃত্তি গণনা - প্রায় T রাউন্ড অনুশোচনা পদ থেমে গেলে আগে।
  • ক্রমে কমপক্ষে একটি নীতি জন্য একটি গ্যারান্টি, তাই ক্লোজিং যাচাইকরণ পাস।
এটি আপনাকে কী দেয় না
  • এটি epsilon_N, শ্রেণীতে সেরা ক্ষতি পূর্বাভাস সম্পর্কিত, শূন্য নয়। আপনার শ্রেণী বিশেষজ্ঞ প্রতিনিধিত্ব করতে পারে না, এটি অনুশীলনে খালি।
  • এটি একটি না-অনুশোচনা পদ্ধতি বা strongly convex প্রক্সি ক্ষতি প্রয়োজন - শক্তিশালী তুলনায় শ্রেণীবিভাগ হ্রাস এটি তৈরি করে, লেখক যেমন নোট।
  • ধ্রুবক u হতে পারে O(T) সবচেয়ে খারাপ ক্ষেত্রে এবং রৈখিক বাউন্ড তারপর ফিরে দ্বিঘাত সংহত।
  • এটি পুনরাবৃত্তি সীমাবদ্ধ, বিশেষজ্ঞ লেবেল নয়। একটি রোবট উপর, লেবেল বাজেট।
  • এটি অনুমান করে বিশেষজ্ঞ প্রতিটি পরিদর্শন অবস্থায় অনুসন্ধান করা যায় এবং সেখানে সঠিকভাবে উত্তর। যে অনুমান সম্পূর্ণ খরচ।

এক আরও ফলাফল প্রায়শই একটি প্রত্যাখ্যান হিসাবে উদ্ধৃত এবং এক নয়। Rajaraman, Yang, Jiao এবং Ramachandran অধ্যয়ন imitation শিক্ষা minimax সীমা episodic MDPs একটি সীমিত অবস্থা স্থান S এবং দিগন্ত H এবং প্রমাণ একটি suboptimality নিম্ন বাউন্ড |S| H বর্গ N অর্ডার এমনকি যখন শিক্ষার্থী সক্রিয়ভাবে অনুসন্ধান বিশেষজ্ঞ পরিদর্শন রাজ্য পদ্ধতি। এটি একটি MDPs ক্লাস জুড়ে একটি সবচেয়ে খারাপ মূল্য একটি নির্ধারিত এপিসোড বাজেট, এবং এটি শাসন কি ধারণা যে ইন্টারঅ্যাকশন উন্নত minimax হার; DAgger এর উপপাদ্য একটি ভিন্ন বিবৃতি, তার নিজের নীতি শ্রেণী অর্জন করতে পারে আপেক্ষিক স্থাপিত নীতি সীমাবদ্ধ।

Swamy, Choudhury, Bagnell এবং Wu পরে শ্রেণীবিভাগ এই অ্যালগরিদম দ্বারা বিশেষজ্ঞ আচরণ যে মুহূর্ত তারা মিল এবং প্রবর্তন করা একটি ধারণা moment recoverability যে delineates কত ভাল প্রতিটি পরিবার যৌগিক ত্রুটি করে তোলে। সমীক্ষা দ্বারা Osa এবং দ্বারা Celemin কভার অ্যালগরিদমিক ল্যান্ডস্কেপ এবং মানুষ-প্রতিক্রিয়া ইন্টারফেস।

বিল: লেবেলিং রাজ্য বিশেষজ্ঞ কখনও উত্পাদিত

সবকিছু উপরে অনুমান একটি বিশেষজ্ঞ যে অনুসন্ধান করা যায় যেকোনো জায়গায়। অনুকরণ একটি পরিকল্পক যা প্রায় বিনামূল্যে - মারিও পরীক্ষা ব্যবহৃত একটি কাছাকাছি-সর্বোত্তম পরিকল্পক সম্পূর্ণ অ্যাক্সেস গেম অবস্থা। একটি মানুষ একটি রোবট এটি প্রধান খরচ এবং একটি কিউ এক: মানুষ সরবরাহ করতে হবে সঠিক কর্ম একটি কনফিগারেশন তাদের নিজস্ব দক্ষতা কখনও তৈরি করত।

Kelly, Sidrane, Driggs-Campbell এবং Kochenderfer রাজ্য আপত্তি সরাসরি HG-DAgger কাগজ। ভ্যানিলা DAgger প্রয়োজন বিশেষজ্ঞ সরবরাহ কর্ম লেবেল সম্পূর্ণভাবে সিস্টেম নিয়ন্ত্রণে সময় না হয়। এটি হ্রাস নিরাপত্তা এবং মানুষ বিশেষজ্ঞ এটি সম্ভব হ্রাস সংগৃহীত লেবেল মান যা তারা বৈশিষ্ট্যযুক্ত অনুভূত অ্যাকচুয়েটর পিছিয়ে। লেবেল আপনি ফিরে পান না লেবেল অ্যালগরিদম অনুমান।

Laskey এবং সহকর্মী আক্রমণ সমস্যা অন্যদিক থেকে DART সঙ্গে এবং তাদের ফ্রেমিং স্পষ্ট: অন-নীতি কৌশল জন্য tedious মানুষ supervisors, যোগ করুন গণনাগত বোঝা এবং সম্ভব পরিদর্শন বিপজ্জনক রাজ্য প্রশিক্ষণ সময়। তাদের বিকল্প injects ক্যালিব্রেটেড শব্দ supervisor নিজস্ব প্রদর্শন মধ্যে, তাই পুনরুদ্ধার পায় প্রদর্শন কখনও রোবট চালানো একটি অবিশ্বাসী নীতি। MuJoCo মানব তারা রিপোর্ট DART হ্রাস তত্ত্বাবধায়ক cumulative পুরস্কার ৫ শতাংশ প্রশিক্ষণ সময়, যখন DAgger এক্সিকিউট নীতি ৮० শতাংশ কম cumulative পুরস্কার তত্ত্বাবধায়ক; grasping মধ্যে ধাঁধা সঙ্গে একটি Toyota HSR, একটি গড় ६२ শতাংশ বৃদ্ধি আচরণ ক্লোনিং উপর।

Zhang এবং Cho এর SafeDAgger আচরণ রেফারেন্স নীতি ক্যোয়ারি স্কার্স সম্পদ: আলাদা সুরক্ষা নীতি ভবিষ্যদ্বাণী, ক্যোয়ারি ছাড়াই যদি প্রাথমিক নীতি প্রায় বিচলিত রেফারেন্স বাইরে একটি থ্রেশহোল্ড এবং শুধুমাত্র সেই রাজ্য হস্তান্তর। তিনটি প্রতিক্রিয়া একই সত্য - DAgger বিশ্লেষণ চার্জ কিছুই বিশেষজ্ঞ লেবেল এবং বাস্তবতা চার্জ অনেক।

অংশ কেউ সতর্ক করে না আপনার

লেবেলিং বন্ধ-বিতরণ রাজ্য মানসিকভাবে harder চেয়ে কার্যাধারী কাজ। একটি স্বাভাবিক প্রদর্শন মানে এক্সিকিউটিং একটি মোটর পরিকল্পনা আপনি ইতিমধ্যে আছেন। সংশোধন একটি নীতি যা রেখেছেন গ্রিপার কোথাও আপনি কখনও করবেন মানে নির্মাণ একটি পুনরুদ্ধার তাত্ক্ষণিক, সময়ের চাপ অধীনে রোবট এখনও চলন্ত সঙ্গে। প্রত্যাশা ফিউয়ার usable মিনিট প্রতি সেশন চেয়ে একটি সরল রেকর্ডিং সেশন এবং ঘড়ি আপনার সংশোধন মান ক্ষয় এক কোর্সে।

LeRobot ডেটাসেট কাঠামো দেখাচ্ছে এপিসোড, ফ্রেম এবং প্রতি-ফ্রেম কলাম হিসাবে সংরক্ষিত ডিস্কে
সংশোধন হয়ে একটি ডেটাসেট শুধুমাত্র একবার হস্তক্ষেপ ফ্রেম চিহ্নিত - LeRobot ফরম্যাটে একটি প্রতি-ফ্রেম কলাম পাশাপাশি পর্যবেক্ষণ এবং কর্ম।

এটি একটি SO-100 মানে আপনার ডেস্ক

অনুবাদ দিগন্ত আপনার নিজের ইউনিট মধ্যে। একটি বিশ সেকেন্ড এপিসোড ৩० ফ্রেম প্রতি সেকেন্ড ६०० সিদ্ধান্ত পদক্ষেপ এবং T উপরে প্রতিটি বাউন্ড যে সংখ্যা। T = 600, পার্থক্য একটি মেয়াদ স্কেলিং T এবং একটি স্কেলিং T বর্গ মধ্যে পার্থক্য একটি নীতি যা পুনরুদ্ধার ছাড়া খারাপ পদ্ধতির এবং একটি যা না।

এটি কেন কর্ম চাঙ্কিং সাহায্য অংশ: যখন একটি নীতি একটি সংক্ষিপ্ত সিরিজ কর্ম প্রতি অনুমান ধাপ, সিদ্ধান্ত পয়েন্ট সংখ্যা ড্রপ করে এবং তাই সংখ্যা সুযোগ যৌগিক। Zhao, Kumar, Levine এবং Finn নাম যৌগিক ত্রুটি অনুপ্রেরণা হিসাবে কর্ম চাঙ্কিং সঙ্গে রূপান্তর এবং রিপোর্ট ८० থেকে ९০ শতাংশ সাফল্য ছয় কঠিন বাস্তব-বিশ্ব কাজ উপর কম-খরচ দ্বিহাতি হার্ডওয়্যার, দশ মিনিট মূল্য প্রদর্শন থেকে। চাঙ্কিং সরানো না সহ-পরিবর্তনশীল পরিবর্তন - রাজ্য এখনও নীতি নিজের - কিন্তু এটি সংক্ষিপ্ত কার্যকর দিগন্ত। দেখুন কর্ম চাঙ্কিং এবং SO-100 অনুকরণ শিক্ষা গাইড

দ্বিতীয় অনুবাদ অগ্রগতি মেট্রিক। আপনি পরিমাপ করতে পারেন না epsilon নীতি নিজের বিতরণ অধীনে সরাসরি - যা প্রয়োজন ভূমি-সত্য বিশেষজ্ঞ কর্ম প্রতিটি পরিদর্শন অবস্থায়, এটি আপনি চেষ্টা করছেন এড়াতে উত্পাদন। কি একটি মানুষ-গেটেড লুপ দেয় আপনি পরিবর্তে হস্তক্ষেপ হার: ভগ্নাংশ ফ্রেম একটি রান সময় যা মানুষ হয়েছে। এটি একটি প্রক্সি এবং এটি চলন্ত কারণ সম্পর্কহীন নীতিতে - একটি রোগী অপারেটর intervenes কম। সামঞ্জস্য ব্যবহার করা হয়, এটি এক সংখ্যা যা বলে একটি রাউন্ড ছিল মূল্যবান সন্ধ্যায়।

একটি তৃতীয় অনুবাদ একটি ডেটা-মান সতর্কতা বিশ্লেষণ কভার না। Mandlekar এবং সহকর্মী অধ্যয়ন ছয় অফলাইন শিক্ষা অ্যালগরিদম পাঁচ অনুকৃত এবং তিন বাস্তব-বিশ্ব মাল্টি-পর্যায় ম্যানিপুলেশন কাজ এবং রিপোর্ট একটি সংবেদনশীলতা অ্যালগরিদমিক ডিজাইন পছন্দ একটি নির্ভরতা প্রদর্শন মান গুণমান এবং variability সৃষ্ট থামিয়ে দেওয়া মানদণ্ড। Belkhale, Cui এবং Sadigh যুক্তি যে ডেটাসেট মান formalised করা উচিত মাধ্যমে কর্ম divergence এবং রূপান্তর বৈচিত্র্য এবং নোট যে রাজ্য বৈচিত্র্য সর্বদা উপকারী না। একটি DAgger রাউন্ড যোগ করে রাজ্য কেউ deliberately নির্বাচন: কিছু পুনরুদ্ধার ডেটা আপনি প্রয়োজন, কিছু রোবট flailing যখন আপনি grope থামিয়ে দেওয়া নিয়ন্ত্রণ জন্য।

mechanically একটি রাউন্ড ছয় ধাপ: রান অনুমান রেকর্ডিং সঙ্গে, গ্রহণ নীতি misbehaves যখন, পর্যালোচনা রান এবং ফাইল প্রতিটি এপিসোড, সিঙ্ক সংশোধন, রচনা একটি মিশ্র ডেটাসেট মূল সংশোধন প্লাস এপিসোড নির্বাচন সঙ্গে স্পষ্টভাবে প্রতি উৎস এবং অব্যাহত প্রশিক্ষণ একটি আগের চেকপয়েন্ট চেয়ে বেস মডেল। ay-robots সেই ধাপ বিদ্যমান বোতাম হিসাবে, যা প্লাম্বিং সরানো কিন্তু বিচার না। দুই caveats: অব্যাহত একটি চেকপয়েন্ট initialises ওজন এবং একটি অপ্টিমাইজার পুনরায় শুরু না এবং নেতা-বাহু সারিবদ্ধতা পদক্ষেপ এখনও হালকা হার্ডওয়্যারে পরীক্ষা। দেখুন প্রশিক্ষণ এবং ডেটাসেট

DAgger লুপ, ইতিমধ্যে wired

Takeover সময় একটি লাইভ অনুমান চালানো, প্রতি-ফ্রেম হস্তক্ষেপ চিহ্নিত করা, ফাইলিং এপিসোড সংশোধন বা মূল্যায়ন হিসাবে, রচনা একটি মিশ্র ডেটাসেট স্পষ্ট এপিসোড নির্বাচন প্রতি উৎস এবং অব্যাহত প্রশিক্ষণ একটি বিদ্যমান চেকপয়েন্ট সব অন্তর্ভুক্ত। আপনি এখনও সিদ্ধান্ত যখন পাবেন এবং কি রাখেন - যে অংশ automate করে না।

DAgger লুপ কাজ করে দেখুন

পরিবার গাছ, একটি টেবিল

পদ্ধতিকে রাজ্য চয়ন করেবিশেষজ্ঞ সরবরাহ কিপ্রধান খরচ
আচরণ ক্লোনিংবিশেষজ্ঞপরিষ্কার প্রদর্শনকোন পুনরুদ্ধার ডেটা; ত্রুটি যৌগিক করতে পারেন quadratically T
ফরোয়ার্ড প্রশিক্ষণশিক্ষার্থী, প্রতি সময়ধাপলেবেল alongthe সংহত বিতরণT আলাদা নীতি; দীর্ঘ দিগন্ত জন্য ব্যবহারযোগ্য না
SMILe / SEARNএকটি stochastic মিশ্রণ বিশেষজ্ঞ এবং শিক্ষার্থীলেবেল alongthe মিশ্রণ বিতরণমিশ্রণ উপাদান গুণমান ভিন্ন
DAggerমিশ্র নীতি, বিটা ক্ষয় শূন্যেএকটি সঠিক কর্ম প্রতিটি পরিদর্শন অবস্থায়লেবেলিং রাজ্য বিশেষজ্ঞ কখনও উত্পাদিত, সম্পূর্ণ নিয়ন্ত্রণ না
DARTবিশেষজ্ঞ, বিঘ্নিত injected শব্দ দ্বারাপ্রদর্শন calibrated শব্দ অধীনেশব্দ করা করা উচিত calibrated শিক্ষার্থী এর ত্রুটি
HG-DAggerশিক্ষার্থী, যতক্ষণ মানুষ গ্রহণ করেসংশোধন শুধুমাত্র মানুষ-গেটেড সেগমেন্টনির্ভর করে মানুষ এর বিচার যখন intervene
SafeDAggerশিক্ষার্থী, নিরাপত্তা গেট দ্বারা ফিল্টারলেবেল শুধুমাত্র যখন গেট জিজ্ঞাসাগেট নিজেই করা করা উচিত প্রশিক্ষিত এবং বিশ্বস্ত

সাধারণত জিজ্ঞাসা প্রশ্ন

আমি সত্যিই পর্যবেক্ষণ করব quadratic ত্রুটি বৃদ্ধি আমার রোবট উপর?

না একটি পরিষ্কার বক্ররেখা হিসাবে। বাউন্ড একটি সবচেয়ে খারাপ ক্ষেত্র: আপটাইট সেই কিছু সমস্যা অর্জন এটি, না আপনার করবে। আপনি দেখুন ফলাফল - একটি নীতি যা স্কোর ভাল ধরা পড়া ফ্রেমে, ব্যর্থতা প্রকৃত কাজ এবং উন্নত না যখন রেকর্ড করতে আরও একই। যদি আরও পরিষ্কার ডেটা থেমে যায় সাহায্য করছি, যা সহ-পরিবর্তনশীল পরিবর্তন, না একটি ডেটা-ভলিউম সমস্যা।

আমি করা আছে বাস্তবায়ন বিটা মিশ্রণ এটি DAgger ডাকার জন্য?

প্যারামিটার-মুক্ত সংস্করণ - বিশেষজ্ঞ রাউন্ড এক শুদ্ধ শিক্ষার্থী পরে - একটি বৈধ বিশেষ ক্ষেত্র এবং প্রায়শই পূর্বে পরীক্ষা সেরা পারফর্ম করেছে। কী আপনি করতে পারেন না ড্রপ হল সমন্বয়: পুনঃপ্রশিক্ষণ শুধুমাত্র সর্বশেষ সংশোধন ভেঙে ফলো-দ্য-লিডার ব্যাখ্যা যা যেখানে না-অনুশোচনা যুক্তি আসে থেকে। প্রশিক্ষণ সংশোধন এক একটি অনেক দুর্বল পদ্ধতি।

কেন রিটার্ন সেরা নীতি একটি যাচাইকরণ সেট বরং শেষ এক?

কারণ উপপাদ্য গ্যারান্টি একটি ভাল নীতি বিদ্যমান কোথাও ক্রমে, যে এটি চূড়ান্ত iterate - বাউন্ড ক্রমে উপর ন্যূনতম হয়। চালান যা কিছু বাইরে এক্সট বলা রাউন্ড ফলাফল একটি নির্দিষ্ট অবস্থা চাওয়া এবং শেষ রাউন্ড reliably সেরা না।

কতটা রাউন্ড আমি পরিকল্পনা করা উচিত?

তত্ত্ব চায় পুনরাবৃত্তি একটি ৬०० ধাপ এপিসোড জন্য একটি সংখ্যা যে কেউ হার্ডওয়্যারে চলায় না। মূল পরীক্ষা বিশ পুনরাবৃত্তি চালানো প্রতিটি বেঞ্চমার্ক উপর। অনুশীলনে আপনি চালানো রাউন্ড যতক্ষণ হস্তক্ষেপ হার থেমে যায় পড়া, অনেক বেলো গণনা বিশ্লেষণ অনুমান করে - বাস্তব ব্যবধান তত্ত্ব এবং অনুশীলন মধ্যে।

কি যদি আমার নীতি শ্রেণী সহজে প্রতিনিধিত্ব করতে পারে না বিশেষজ্ঞ?

তখন DAgger সংরক্ষণ করে না আপনি এবং বাউন্ড বলে তাই - এটি প্রকাশ করা হয় আপেক্ষিক epsilon_N, শ্রেণীতে সেরা ক্ষতি পূর্বাভাস। যদি যা বড় কারণ ভুল আর্কিটেকচার একটি পর্যবেক্ষণ একটি ক্যামেরা যা দেখতে পারে না দৃশ্য, সমন্বয় দেয় আপনি একটি নীতি যা সর্বোত্তম মধ্যে একটি শ্রেণী যে করতে পারে না কাজ। এক্সিকিউট ওপেন-লুপ রিপ্লে বিরুদ্ধে ধরা পড়া এপিসোড আগে সংশোধন সংগ্রহ।

কোথায় যেতে এখান থেকে

যদি আপনি প্রশিক্ষণ দিয়েছি না একটি নীতি এখনও, এই তত্ত্ব অকাল: রেকর্ড একটি ডেটাসেট প্রথম, সূচনা থেকে আপনার প্রথম নীতি প্রশিক্ষণ এবং ডেস্কটপ ক্লায়েন্ট ও। যদি আপনি weighing অন্য শত পরিষ্কার প্রদর্শন বিরুদ্ধে সূচনা সংশোধন: পরিষ্কার প্রদর্শন না ঠিক একটি বিতরণ সমস্যা। মেকানিক্স জন্য, অব্যাহত সঙ্গে মানুষ-গেটেড ভেরিয়েন্ট এবং তারপর SO-100 walkthrough

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started