
একটি SO-100 বাহু তে একটি মানব-নিয়ন্ত্রিত DAgger রাউন্ডের ধাপে-ধাপে বর্ণনা: নীতি চালান এবং এটি রেকর্ড করুন, এটি ভুল হলে প্রভার নিন, রানটি একটি সংশোধন হিসাবে ফাইল করুন, একটি মিশ্র ডেটাসেট সংমিশ্রণ করুন এবং একটি চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান। একটি লিডার বাহু ছাড়াই মানুষের জন্য কীবোর্ড এবং স্লাইডার প্রভারের পথ অন্তর্ভুক্ত করে এবং একটি রাউন্ডকে অপ্রয়োজনীয় করে তোলে এমন চারটি ভুল অন্তর্ভুক্ত করে।
আপনার নীতি চলে। এটি ঘনক্ষেত্রটির জন্য পৌঁছায়, গ্রিপারটি একটি সেন্টিমিটার খুব তাড়াতাড়ি বন্ধ করে এবং এটি যেন পেয়েছে তার মতো চলে। কোনো ত্রুটি ঘটে না এবং প্রশিক্ষণের ক্ষতির দিকে তাকান কোনো পরিমাণ এটি ব্যাখ্যা করে না। সংশোধনটি একই প্রদর্শনে আরও ২০,০০০ গ্রেডিয়েন্ট পদক্ষেপ নয়। এটি আপনার হাতটি বাহুতে ফিরিয়ে আনা ঠিক যেখানে এটি ভুল হয়, আপনি যা করেছেন তা রেকর্ড করা এবং পুরানো ডেটা প্লাস সেই সংশোধনে পরবর্তী চেকপয়েন্টে প্রশিক্ষণ দেওয়া। এটি একটি DAgger রাউন্ড এবং এটি একটিতে কীভাবে চলে SO-100 একটি দৃষ্টি-ভাষা-ক্রিয়া নীতির সাথে।
তত্ত্বটি অন্য কোথাও রয়েছে: ডেটাসেট সংগ্রহ কেন কাজ করে এবং মানব নিয়ন্ত্রণ এটি সম্পর্কে কী পরিবর্তন করে। এটি অপারেটিং ম্যানুয়াল এবং এটি প্রশিক্ষিত চেকপয়েন্ট, কাজ করা ক্যামেরা সেট এবং একটি বাহু যা সরানো হয় অনুমান করে। নীচের ছয়টি পদক্ষেপ এই প্ল্যাটফর্মের DAgger পৃষ্ঠা বাস্তবায়ন করা লুপ কিন্তু ক্রম আপনার নিজের স্ক্রিপ্ট থেকে একই।
সংক্ষিপ্তভাবে এক রাউন্ড
- •প্রশিক্ষিত নীতি চালান এবং এটি রেকর্ড করুন, রানের কাজের পাঠ্যের সাথে একটি সাধারণ টেলিঅপারেশন লেবেলের পরিবর্তে।
- •আচরণ ভুল হওয়ার মুহূর্তে প্রভার নিন: একটি লিডার বাহুর সাথে একটি আয়না হ্যান্ডওভার, বিনা লিডারের কীবোর্ড বা স্লাইডারের উপর তাত্ক্ষণিক এবং ম্যানুয়াল।
- •প্রতিটি রান পরীক্ষা করুন: এটি একটি সংশোধন হিসাবে ফাইল করুন, এটি একটি মূল্যায়ন পর্ব হিসাবে রাখুন বা এটি বাতিল করুন।
- •মিশ্রণটি হাতে দিয়ে সংমিশ্রণ করুন - মূল প্রদর্শন প্লাস সংশোধন, প্রতিটি উত্সের জন্য নির্বাচিত পর্ব। কখনই শুধুমাত্র সংশোধনে প্রশিক্ষণ করবেন না।
- •শেষ চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান এবং নোট করুন কোন চেকপয়েন্ট কোন মিশ্রণ তৈরি করেছে।
- •যে সংখ্যা বলে যে রাউন্ডটি মূল্যবান ছিল তা হস্তক্ষেপ হার, প্রশিক্ষণের ক্ষতি নয়।
দ্বিতীয় রাউন্ড কেন শুধু আরও ডেটা নয়
আচরণ ক্লোনিং প্রশিক্ষণ যেমন রাজ্যে একটি মানুষ পরিদর্শন করেছেন। পরীক্ষার সময় নীতি রাজ্যে পরিদর্শন করে এটি কারণ করে এবং ছোট ক্রিয়া ত্রুটি রাজ্যের মধ্যে যৌগিক যা কোনো প্রদর্শন কভার করে নি। রস, গর্ডন এবং বাগনেল AISTATS 2011 এর জন্য সেই ব্যর্থতা ফর্মালাইজ করেছেন এবং এটি একটি পুনরাবৃত্তিমূলক অ্যালগরিদম দিয়ে উত্তর দিয়েছেন যা একটি স্থির নির্ধারণমূলক নীতি প্রশিক্ষণ দেয় এবং তাদের হ্রাসের অধীনে, এটি রাজ্য বন্টনের অধীনে ভাল পরিবেশন করতে হবে এটি ঘটায়: বর্তমান নীতি চালান, বিশেষজ্ঞটি যে রাজ্যগুলি এটি আসলে পৌঁছেছে তার লেবেল করুন, সেগুলি ডেটাসেটে যোগ করুন, রিট্রেইন, পুনরাবৃত্তি করুন। কেলি এট আল। HG-DAgger দিয়ে প্রশ্নটি ব্যবহারিক করেছেন যেখানে মানুষ নিয়ন্ত্রণের সময় নেওয়ার সিদ্ধান্ত নেয় নিয়ন্ত্রণ ছাড়াই রাজ্যের লেবেল করার পরিবর্তে; তারা DAgger এবং আচরণ ক্লোনিং উভয়ের চেয়ে উন্নত কর্মক্ষমতা রিপোর্ট করে একটি অনুকরণ এবং একটি বাস্তব স্বায়ত্তশাসিত ড্রাইভিং কাজে। মানব নিয়ন্ত্রণ একটি ডেস্ক বাহুতে লুপকে সহনীয় করে তোলে - আপনি শুধুমাত্র কিছু ভুল হলে আপনার হাতগুলি সরান।
অনুশীলনে দুটি পরিণতি তত্ত্বের চেয়ে বেশি গুরুত্বপূর্ণ। সংশোধনগুলি সাধারণ প্রদর্শন নয়: তারা বটলনেক অঞ্চলে ঘনীভূত হয় Mandlekar এট আল। বর্ণনা করেন যেখানে একটি ছোট বিচ্যুতি নীতিটিকে রাজ্যে ফেলে দেয় প্রদর্শন কখনও কভার করে নি। এবং শুধুমাত্র সেই কঠিন অংশগুলি থেকে তৈরি একটি ডেটাসেট খারাপভাবে গঠিত ডেটাসেট - বেলখেল, কুই এবং সাদিঘ যুক্তি দেন ডেটা পক্ষ থেকে যে রাজ্য বৈচিত্র্য সবসময় উপকারী নয় এবং ক্রিয়া বিচ্যুতি এবং রূপান্তর বৈচিত্র্য একসাথে ডেটাসেট গুণমান সিদ্ধান্ত। মিশ্র ডেটাসেট একটি আপস নয়, এটি পয়েন্ট।
এক রাউন্ডের আগে এগুলি হিমায়ন করুন
একটি DAgger রাউন্ড সময়ের সাথে একটি নীতি নিজের বিরুদ্ধে তুলনা করে। আপনি যে কোনো কিছু পরিবর্তন করেন রাউন্ডগুলির মধ্যে যা ডেটাসেট নয় সেই তুলনা অর্থপূর্ণ করে তোলে।
- ক্যামেরার অবস্থান এবং মাউন্ট, কব্জি ক্যামেরা অন্তর্ভুক্ত। একটি ক্ল্যাম্প ঢিলে করুন এবং আপনি পর্যবেক্ষণ বন্টন পরিবর্তন করেছেন, নীতি নয়।
- এক্সপোজার এবং সাদা ভারসাম্য যদি আপনার ক্যাপচার স্ট্যাক আপনাকে তাদের পিন করতে দেয়। স্বয়ংক্রিয় এক্সপোজার রাউন্ডের মধ্যে বৃদ্ধি একটি ধীর অদৃশ্য ডোমেইন শিফট।
- বাহু ক্যালিব্রেশন এবং সার্ভো শূন্য অবস্থান। যদি আপনাকে পুনরায় ক্যালিব্রেট করতে হয় তবে এটির আগে রেকর্ড করা সবকিছু আলাদা ডেটাসেট হিসাবে বিবেচনা করুন।
- কাজের পাঠ্য। প্রতিটি VLA এখানে এটিতে শর্তসাপেক্ষ; মধ্য-লুপে পুনরায় লেখা এটি একটি ভিন্ন কাজ।
- আলো, টেবিল পৃষ্ঠ, বস্তু সেট। একটি নতুন বস্তু একটি নতুন পরীক্ষা, পরবর্তী রাউন্ড নয়।
- রেকর্ডিং ফ্রেম হার। দুটি নমুনা রাস্টার জুড়ে হস্তক্ষেপ হার তুলনা করা পার্থক্য তৈরি করে যা রাস্টার থেকে আসে।
হসু এট আল। একটি হাতের কেন্দ্রিক দৃষ্টিভঙ্গি সাধারণ তৃতীয় ব্যক্তির দৃষ্টিভঙ্গির বিরুদ্ধে তুলনা করেছেন এবং চোখ-ইন-হ্যান্ড দৃষ্টিভঙ্গি ধারাবাহিকভাবে প্রশিক্ষণ দক্ষতা এবং বিতরণ বহির্গমন সাধারণীকরণ উন্নত করেছেন, দৃশ্যের কম দেখা সত্ত্বেও। পাঁচ-যৌথ বাহুতে গ্রিপার সময় সাধারণত আপনি যা সংশোধন করছেন এবং গ্রিপার সময় যা কব্জি দৃষ্টিভঙ্গি বহন করে।
শেষ থেকে শেষ রাউন্ড
- 1অনুমান চালান এবং এটি রেকর্ড করুন
আপনি উন্নত করতে চান এমন চেকপয়েন্টের বিরুদ্ধে রান শুরু করুন তারপর অনুমান রুটে রেকর্ডিং শুরু করুন। এভাবে রেকর্ড করা হলে এটি রানের নিজের কাজের পাঠ্য উত্তরাধিকার দেয় যা নীতি প্রশিক্ষিত ছিল ডিফল্ট টেলিঅপারেশন লেবেলের পরিবর্তে। রেকর্ডিং ছাড়াই আপনি ব্যর্থতা দেখতে পারেন কিন্তু এটিতে প্রশিক্ষণ করতে পারবেন না।
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2এটি ভুল হলে প্রভার নিন
প্রভার টিপুন এবং ইনপুট মোড নির্বাচন করুন: লিডার বাহু কীবোর্ড বা স্লাইডার। রানার পজ অপেক্ষা করে আপনি সংশোধন করেন আপনি হাতে। আপনি ড্রাইভ করার সময় রেকর্ড করা ফ্রেমগুলি স্বয়ংক্রিয়ভাবে হস্তক্ষেপ হিসাবে ফ্ল্যাগ করা হয়।
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3পর্যায়গুলি পরীক্ষা করুন
প্রতি পর্ব সিদ্ধান্ত নিন: সংশোধন হিসাবে ফাইল করুন, মূল্যায়ন হিসাবে রাখুন বা বাতিল করুন। নীতিটি সম্পূর্ণ করা ছাড়াই একটি রান মূল্যায়ন ডেটা।
- 4সংশোধন ডেটাসেট সিঙ্ক করুন
সংশোধনগুলি নীতি প্রতি স্থানীয় ডেটাসেটে সংগ্রহ করে এবং স্বয়ংক্রিয় সিঙ্কের মাধ্যমে ক্লাউড স্টোরেজে যায়। আপনি যা রাখেননি তা কিছুই মিশ্রিত হয় না।
- 5মিশ্র ডেটাসেট সংমিশ্রণ করুন
মূল ডেটাসেটটিকে সংশোধন ডেটাসেটের সাথে একত্রিত করুন প্রতিটি উত্সের পর্বগুলি স্পষ্টভাবে বেছে নিয়ে। ফলাফলটি সেই পয়েন্ট থেকে একটি সাধারণ ডেটাসেট।
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান
বেস মডেলের পরিবর্তে পূর্ববর্তী চেকপয়েন্ট থেকে মিশ্রণটি প্রশিক্ষণ দিন। নোট করুন কোন চেকপয়েন্ট এবং কোন মিশ্রণ; সেই জোড়া ছাড়া রাউন্ডটি পুনরুৎপাদনযোগ্য নয়।
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
ধাপ ২ বিস্তারিত: প্রভারের দুটি উপায়
লিডার বাহু দিয়ে
মধ্যে লিডার-অনুসারী মোডে প্রভার একটি হ্যান্ডওভার দুটি বাহুর মধ্যে যা একই ভঙ্গিতে নয়। প্রভার টিপুন পজকে পরিবহন করে লিডারকে অনুসরণকারীর বর্তমান ভঙ্গিতে ড্রাইভ করে তাই সামর্থ্য স্থানান্তর হওয়ার সময় কিছু লাফায় না। যদি সেই সারিবদ্ধকরণ ড্রাইভ সময়সীমা অতিক্রম করে আপনি লিডারটি হাতে দিয়ে সারিবদ্ধ করেন এবং শুধুমাত্র মুক্তি দেন দুজন পাঁচ ডিগ্রির মধ্যে। সেখান থেকে আপনি সাধারণত টেলিঅপারেট করেন এবং ক্রিয়া কলামটি রেকর্ড করে আপনি আদেশ করেছেন।
এই পথ সম্পর্কে সৎ হন: সারিবদ্ধকরণ ড্রাইভ এবং সামর্থ্য হ্যান্ডওভার লুপের সবচেয়ে কম পরীক্ষিত অংশ বাস্তব হার্ডওয়্যারে। একটি ধীর নিরীহ ভঙ্গিতে হ্যান্ডওভার পরীক্ষা করুন যা আপনি এটিতে নির্ভর করার আগে আপনি যত্ন করেন এমন রান। একটি লিডার বাহু তিনটি মোডের মসৃণ সংশোধন তৈরি করে এবং যান্ত্রিক ভুলের জন্য সবচেয়ে বেশি আছে।
লিডার বাহু ছাড়া: কীবোর্ড এবং স্লাইডার
বেশিরভাগ মানুষ এটি পড়ছেন একটি বাহু মালিক। সেটা যথেষ্ট। প্রভার টিপুন এবং ইনপুট মোড নির্বাচন করুন এমন মুহূর্তে কীবোর্ড বা স্লাইডার এবং প্রভার তাৎক্ষণিক এবং ম্যানুয়াল - দ্বিতীয় বাহু সারিবদ্ধ করার কোনো সারিবদ্ধকরণ ধাপ নেই। অনুসরণকারী তার ভঙ্গি ধরে রাখে এবং ইনপুটের জন্য অপেক্ষা করে।
| ইনপুট মোড | বাহু কীভাবে সরানো হয় | সার্ভার দ্বারা প্রয়োগ করা প্রতি-কল সীমা | যখন লক করা হয় |
|---|---|---|---|
| লিডার বাহু | দর্পণটি লিডারের যৌথ কোণ থেকে অনুসরণকারীটি চালিত করে | এই মোডে কোনো ন্যাজ বা সেট কল নেই; দর্পণ ক্রমাগত অনুসরণকারী লক্ষ্যগুলি লেখে | কখনও লক করা হয় না এবং ডিফল্ট যদি কোনো ইনপুট মোড দেওয়া হয় না - কিন্তু এটির একটি দ্বিতীয় বাহু দরকার; লিডার আইডি ছাড়াই প্রভার অস্বীকৃত |
| কীবোর্ড | প্রতি মূল প্রেস সম্পর্কিত ন্যাজ প্রভার ন্যাজ শেষ পয়েন্টে পাঠানো | কঠোর ক্ল্যাম্প ২ ডিগ্রি প্রতি যৌথ ৪ ডিগ্রি গ্রিপারের জন্য | প্রভার লিডার মোডে শুরু করা হলে ৪০৯ দিয়ে প্রত্যাখ্যাত |
| স্লাইডার | নিরপেক্ষ লক্ষ্য ভঙ্গি প্রভার সেট শেষ পয়েন্টে পাঠানো | সর্বোচ্চ ৬ ডিগ্রি ভ্রমণ লক্ষ্যের দিকে প্রতি কল; ইন্টারফেসটি প্রতি সেকেন্ডে প্রায় দশবার পাঠায় | প্রভার লিডার মোডে শুরু করা হলে ৪০৯ দিয়ে প্রত্যাখ্যাত |
ক্ল্যাম্পগুলি সার্ভার-সাইড প্রয়োগ করা হয় ইন্টারফেসে নয় কারণ বাস-সার্ভো বাহুতে একটি ভুলভাবে টাইপ করা ডেল্টা একটি সংঘর্ষ। কীবোর্ড সংশোধনগুলি ধাপে বেরিয়ে আসে এবং কিছুটা মোটা; স্লাইডার সংশোধনগুলি মসৃণ কারণ সার্ভার লক্ষ্যের দিকে হাঁটে ইন্টারফেসটি স্ট্রিম করে। যেকোনো উপায়ে ক্রিয়া কলামটি পূর্ণ আদেশকৃত ভঙ্গি ভেক্টর পায় এবং হস্তক্ষেপ চিহ্নিতকরণ নেতা পথের সাথে অভিন্ন তাই কীবোর্ড সংশোধনগুলি বিন্যাস পার্থক্য ছাড়াই একই ডেটাসেটে অবতরণ করে।
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
বোতাম কখন টিপুন
দেরীর চেয়ে তাড়াতাড়ি। একটি সংশোধন যা গ্রিপার কিছুতে বন্ধ হওয়ার পরে শুরু হয় নীতিটিকে একটি ব্যর্থতা থেকে পুনরুদ্ধার করে শেখায় প্রবেশ করা উচিত ছিল না এবং পুনরুদ্ধার ডেটা মূল্যবান এড়ান ডেটা চেয়ে অনেক কম। সামর্থ্য যেখানে বিশ্বাস করেন যে গতিপথ ভুল পদক্ষেপটি ব্যাহত করুন কঠিন অংশটি সংশোধন করুন হাতে যেখানে নীতি পরিচালনা করেছে। থ্রিফটিডিএগার সেই সিদ্ধান্তটি স্বয়ংক্রিয় করে নতুনত্ব এবং অনুমানকৃত ঝুঁকিতে হস্তক্ষেপ গেটিং করে একটি নির্দিষ্ট মানব বাজেটের অধীনে কিন্তু একটি একক বাহুতে একটি মানুষ ইতিমধ্যে দেখছে মানব গেট সস্তা এবং আরও ভালভাবে ক্যালিব্রেট করা হয়েছে যা কিছু আপনি সুর করবেন।
খোলা উত্স স্ট্যাক এবং কয়েকটি স্ক্রিপ্ট দিয়ে সম্ভব। এটি খরচ কি বুককিপিং এবং বুককিপিং যেখানে DAgger রাউন্ড মরে।
- আপনার নিজের অনুমান স্ক্রিপ্ট থেকে একটি LeRobot ডেটাসেটে ফ্রেম লিখুন নীতি প্রশিক্ষিত ছিল কাজের স্ট্রিং দিয়ে।
- নীতি লুপ বিরাম কমান্ড উত্স এবং প্রতিটি ফ্রেম আপনি ড্রাইভ হিসাবে সংগ্রহ করুন। পতাকা ছাড়াই সংশোধনগুলি সাধারণ প্রদর্শন দেখায়।
- নীতি নিয়ন্ত্রণ মুক্তি এবং আপনার প্রথম ইনপুটের মধ্যে রূপান্তর ফ্রেম কী ঘটে সেই সম্পর্কে উদ্দেশ্যমূলক সিদ্ধান্ত নিন।
- প্রতি নীতি প্রতি আলাদা ডেটাসেটে সংশোধনগুলি রাখুন এবং পর্বের সূচকগুলি হাতে ট্র্যাক করুন যাতে মিশ্রণটি পুনর্নির্মাণ করা যায়।
- সূক্ষ্ম-সুর প্রবেশ পয়েন্ট পূর্ববর্তী চেকপয়েন্টের দিকে নির্দেশ করুন এবং লগে সেই ওজনগুলি লোড করা হয়েছে তা পরীক্ষা করুন।
একই ছয়টি পদক্ষেপ বোতাম হিসাবে বিদ্যমান। স্বয়ংক্রিয় যা সহজে হাতে পেতে পারে ভুল: প্রতি-ফ্রেম হস্তক্ষেপ পতাকা সংশোধন এবং মূল্যায়ন মধ্যে বিভাজন এবং রেকর্ড কোন চেকপয়েন্ট কোন মিশ্রণ তৈরি। কিছুই একটি রচিত ডেটাসেট প্রবেশ করে যা আপনি নির্বাচন করেননি।
এটি আপনার জন্য সিদ্ধান্ত নেয় না। কোন রানটি সংশোধন মিশ্রণে কী যায় এবং কখন হস্তক্ষেপ হার পড়ে যায় তা রায় কল থেকে যায়। ক্ষেত্রগুলি নথিভুক্ত করা হয় প্রশিক্ষণ ইনপুট মোড অধীন টেলিঅপারেশন।
ধাপ ৩ বিস্তারিত: পরীক্ষা গুণমান সিদ্ধান্ত
রানের পরে আপনার একটি রেকর্ডিং আছে কিছু ফ্রেম হস্তক্ষেপ হিসাবে চিহ্নিত। তিনটি গন্তব্য বিদ্যমান এবং ভুল একটি চুপচাপ পরবর্তী রাউন্ড বিষ করে।
- সংশোধন হিসাবে ফাইল করুন যখন হস্তক্ষেপ একটি খাঁটি ঠিক ছিল: নীতি কোথাও ভুল যাচ্ছিল এবং আপনার ইনপুট দেখিয়েছে নীতি নিজে উৎপাদিত একটি রাজ্য থেকে সঠিক জিনিস।
- পরিচ্ছন্ন স্বায়ত্তশাসিত রান হিসাবে রাখুন এবং সাবধানতার বাইরে আপনি নিয়েছেন যে রান। মূল্যায়ন পর্বগুলি পরবর্তী চেকপয়েন্ট পরিমাপ করা এবং তারা কখনও প্রশিক্ষিত হয় না।
- বাতিল করুন কিছু সম্পর্কিত - একটি ড্রপ ক্যামেরা ফ্রেম একটি স্থির সার্ভো একটি বস্তু আপনি knocked রান। একটি মেসি সংশোধন কোনো সংশোধন চেয়ে খারাপ।
নীতি নিয়ন্ত্রণ মুক্তি এবং আপনার প্রথম ইনপুটের মধ্যে বাহু শান্ত রাখে রেকর্ডার রাখে লেখা - একটি পরিচয় ভঙ্গি রান সামান্য ভিন্ন ছবি পেয়ারড। এখানে সেই হ্যান্ডওভার ফ্রেমগুলি কাঁচা রেকর্ডিংয়ে থাকে এবং সংশোধন ডেটাসেটের বাইরে। আপনি লুপটি নিজে তৈরি করেন তাদের অপসারণ করুন উদ্দেশ্যমূলকভাবে: একটি নীতি প্রশিক্ষিত আইটি পজ শিখে যেখানে এটি অভিনয় করা উচিত।
ধাপ ৫ বিস্তারিত: মিশ্র সংমিশ্রণ
সংমিশ্রণটি মূল ডেটাসেট প্লাস সংশোধন ডেটাসেট নেয় এবং একটি নতুন সাধারণ তৈরি করে LeRobot ডেটাসেট যা অন্য যে কোনো মত প্রশিক্ষণ। গুরুত্বপূর্ণ সম্পত্তি যে পর্ব নির্বাচন স্পষ্ট প্রতি উত্স - কিছুই স্বয়ংক্রিয়ভাবে মিশ্রিত হয়। সেই ছোট শোনায় যতক্ষণ না প্রথম বার একটি নীতি অদ্ভুত আচরণ করে এবং আপনি পুনর্নির্মাণ করতে হবে এটি প্রশিক্ষিত।
খোলা প্রশ্ন অনুপাত এবং কেউ একটি সংখ্যা নেই যা স্থানান্তর। সাহিত্য একমত হয় যে সংশোধনগুলি ফ্রেম শেয়ার চেয়ে আরও গণনা করা উচিত। Mandlekar এট আল। তাদের হস্তক্ষেপ সিস্টেম সংগ্রহ করে ডেটা পুনরাবৃত্তিমূলক প্রশিক্ষণ দেন যাতে নীতি বটলনেক অতিক্রম শিখে এবং রিপোর্ট যে এজেন্ট প্রশিক্ষিত সেই উপায় অনিয়ন্ত্রক প্রদর্শনকারীদের কাছ থেকে সমান নমুনা সংখ্যায় প্রশিক্ষিত এজেন্ট। Sirius আরও যায় এবং প্রশিক্ষণ নমুনা পুনরায় ওজন অনুমানিত মানব বিশ্বাস দ্বারা সাফল্য হার রিপোর্টিং ৮ শতাংশ লাভ অনুকরণ এবং ২৭ শতাংশ বাস্তব হার্ডওয়্যার নীতি এবং দ্বিগুণ সংকুচনতা এটি তুলনা করে পদ্ধতি। প্রশিক্ষণ প্রবেশ পয়েন্ট কোনো নমুনা ওজন knob এক্সপোজ তাই কঠোর বিকল্প শেষ প্রতিটি সংশোধন পর্ব যখন subsampling মূল প্রদর্শন - এবং লেখা আপনি করেছেন।

ধাপ ৬ বিস্তারিত: একটি চেকপয়েন্ট থেকে প্রকৃতপক্ষে অব্যাহত থাকে মানে
বেস মডেল থেকে মিশ্রণটি প্রশিক্ষণ কাজ করে তবে পূর্ববর্তী রাউন্ড ফেলে এবং একটি সম্পূর্ণ রান খরচ। অবিরত পূর্ববর্তী থেকে চেকপয়েন্ট দ্রুততর এবং সাধারণত ভাল। এটি ফ্রেজ পরামর্শ চেয়ে আরও সীমিত।
একটি শুধুমাত্র ওজন চেকপয়েন্ট পরামিতি এবং অন্য কিছু নেই রয়েছে। এটি লোডিং পরবর্তী চালান একটি ভাল শুরু পয়েন্ট বেস মডেল চেয়ে দেয় কিন্তু অপ্টিমাইজার মুহূর্ত শেখার হার সময়সূচী অবস্থান এবং ডেটা অর্ডার সব শূন্য থেকে শুরু। চলমান রান শুরু একটি ক্ষতি স্পাইক আশা করি এটি একটি ব্যর্থতা হিসাবে পড়তে না এবং করবেন না রাউন্ড একটি সংরক্ষণ কল। এটি একটি উষ্ণ শুরু।
| নীতি | আকার | GPU স্তর | প্রতি ক্রিয়া পদক্ষেপ অনুমান | ডেটাসেট ফর্ম্যাট | চেষ্টা মূল্য আগে পর্ব |
|---|---|---|---|---|---|
| GR00T N1.7 | প্রায় ৩ বি প্রায় ৪০ এম সূক্ষ্ম সুর সময় প্রশিক্ষিত | A100 ৮০ GB বা H100 ৮০ GB | প্রায় ১৫२ এমএস | LeRobot v2.0 বা v2.1 | ৫০ |
| GR00T N1.5 | প্রায় ৩ B | A100 ৮০ GB বা H100 ৮০ GB | প্রায় ১৬५ এমএস | LeRobot v2.0 বা v2.1 | ৫० |
| Pi0.5 | একটি PaliGemma মেরুদণ্ড প্রায় ৩ B | A100 ৮० GB বা H100 ৮० GB | প্রায় ४८५ এমএস | LeRobot v3.0 | ५० |
| SmolVLA | প্রায় ४५० এম | RTX ४०९० বা যে কোনো २४ GB কার্ড | প্রায় २४५ এমএস | LeRobot v3.0 | ३० |
| ACT | প্রায় ८० এম স্ক্র্যাচ থেকে প্রশিক্ষিত | RTX ४०९० বা যে কোনো २४ GB কার্ড | প্রায় २० এমএস | LeRobot v3.0 | ५० |
বিলম্ব একটি DAgger লুপ ভিতরে যৌগিক একটি উপায় এটি একটি ডেমো সময় নয়: প্রায় ४८५ এমএস প্রতি ক্রিয়া পদক্ষেপ আপনি প্রভার নিন কারণ বাহু দ্বিধা নেই কারণ এটি ভুল ছিল এবং দ্বিধা সংশোধন সম্পদ প্রশিক্ষণ ডেটা। যদি আপনি ডেটা চূড়ান্ত সাফল্য হার চেষ্টা করছেন পুনরাবৃত্তি এক দ্রুত মডেল। Shukor এট আল। SmolVLA হিসাবে বর্ণনা একটি একক GPU এবং স্থাপনা ভোক্তা GPUs বা CPUs পরিকল্পনা ডিজাইন একটি অ্যাসিঙ্ক্রোনাস অনুমান স্ট্যাক যা ক্রিয়া পূর্বাভাস থেকে সম্পাদন decouples উচ্চতর নিয়ন্ত্রণ হার অনুমতি - সম্পত্তি যা প্রভার লুপ প্রতিক্রিয়াশীল রাখে।
ডেটাসেট ফর্ম্যাট পারস্পরিক বিনিময়যোগ্য হয় না। GR00T LeRobot v2.0 বা v2.1 লেয় এবং Isaac-GR00T ভান্ডার তার ইনপুট বর্ণনা করে LeRobot v2 ফর্ম্যাট একটি স্বাদ একটি সংযুক্ত মাধ্যমে বর্ণনা ফাইল; আধুনিক প্রশিক্ষক এখানে v3.0 আশা করি। একটি মিশ্র রচনা ভুল সংস্করণ লোড সময় ব্যর্থ হয় পরিবর্তে একটি খারাপ নীতি উৎপাদন - ভাল ব্যর্থতা মোড এখনও বর্জ্য সারিবদ্ধ স্লট। ডেটাসেট ডকুমেন্টেশন তালিকা যা ফর্ম্যাট প্রতিটি প্রশিক্ষক গ্রহণ করে।
লুপ বুককিপিং ইতিমধ্যে করা
লিডার বাহু কীবোর্ড বা স্লাইডার সহ প্রভার; প্রতি ফ্রেম হস্তক্ষেপ চিহ্নিতকরণ; সংশোধন বা মূল্যায়ন হিসাবে ফাইলিং রান; মিশ্র ডেটাসেট একটি স্পষ্ট পর্ব নির্বাচন সংমিশ্রণ প্রতি উত্স; এবং বেস মডেল পরিবর্তে একটি চেকপয়েন্ট থেকে প্রশিক্ষণ অব্যাহত। কোন রান সংশোধন গণনা করে যা মিশ্র মধ্যে যায় এবং যখন হস্তক্ষেপ হার পড়ে আপনার সিদ্ধান্ত থেকে যায়।
কীভাবে DAgger লুপ তার সাথে দেখুনএকটি রাউন্ড বর্জ্য চার উপায়
१. শুধুমাত্র সংশোধন প্রশিক্ষণ
সবচেয়ে সাধারণ ব্যর্থতা এবং সবচেয়ে আকর্ষণীয় শর্টকাট। একটি সংশোধন-কেবলমাত্র ডেটাসেট প্রায় সম্পূর্ণভাবে কাজের কঠিন মধ্যম পদ্ধতি এবং পিছুটান অনুপস্থিত; নীতি কঠিন অংশ এ ভাল হয়ে যায় এবং সেখানে পৌঁছাতে কীভাবে ভুলে যায়। সংগ্রহ একটি বাস্তবায়ন বিবরণ পদ্ধতি নয় এটি ঘটনাক্রম: পুরানো ডেটা কি তার অবস্থান আচরণ রাখে ওয়াইল সংশোধন একটি অংশ।
२. রাউন্ড মধ্যে ক্যামেরা মুভিং
একটি ক্যামেরা যা দুই সেন্টিমিটার মধ্যে রাউন্ড শিফট একটি নীতি খারাপ হয় একটি দিন খরচ রোগনির্ণয় শুরু করেছেন। প্রতিটি VLA এখানে ছবি শর্তসাপেক্ষ; যৌথ রাজ্য একা অস্পষ্ট নয় যেখানে বস্তু। প্রথম রাউন্ড আগে সেটআপ ফটোগ্রাফ এবং পরে প্রতিটি আগে সেই ফটোগ্রাফ চেক করুন।
३. হ্যান্ডওভার নিদর্শন প্রশিক্ষণ মধ্যে পেতে দেওয়া
উপরে কভার এবং তালিকায় কারণ এটি অদৃশ্য। উপসর্গ একটি নীতি যা ঠিক এক ভগ্নাংশ দ্বিধা যেখানে পূর্ববর্তী রাউন্ড অপারেটর সময় গ্রহণ। এটি মতো দেখায় দ্বিধা; এটি অনুকরণ।
४. উষ্ণ শুরু একটি সংরক্ষণ কল
যদি আপনি অপ্টিমাইজার রাজ্য বহন বিশ্বাস বাস্তবায়ন ক্ষতি স্পাইক একটি বাগ হিসাবে পড়ে এবং আপনি দুর্নীতিগ্রস্ত ডেটা শিকার চলে যান। যদি আপনি অপ্টিমাইজার তাজা শুরু জানেন স্পাইক প্রত্যাশিত এবং আপনি দেখেন এটি অনুসরণ। একই সংখ্যা বিপরীত সিদ্ধান্ত।
রাউন্ড পরিমাপ
একটি মানব নিয়ন্ত্রিত লুপ জন্য মেট্রিক হস্তক্ষেপ হার: ফ্রেম রেকর্ড যখন আপনি নিয়ন্ত্রণ সর্বমোট ফ্রেম রান ভাগ করে। এটি প্রভার অবস্থান এবং এটি একমাত্র সংখ্যা যা রাউন্ড জিজ্ঞাসা প্রশ্নের উত্তর দেয়। প্রশিক্ষণ ক্ষতি ফল নীতি উন্নত কিনা; সাফল্য হার বাইনারি এবং শব্দ ডেস্ক বাহু উত্পাদন নমুনা আকার। হস্তক্ষেপ হার ক্রমাগত যে রাজ্য নীতি নিজে কারণ পরিমাপ এবং এটি ড্রপ নীতি আপনি কম প্রয়োজন।
শুধুমাত্র অভিন্ন ব্যবস্থায় রেকর্ড রান জুড়ে তুলনা করুন। সম্পূর্ণ যুক্তি এবং একটি মূল্যায়ন সেট যা দুই রাউন্ড বেশি বেঁচে নির্মাণ করা হয় একটি DAgger লুপ পরিমাপ নিবন্ধ। রাউন্ড এক বাস্তবসম্মত একটি সম্ভাব্যতা পরীক্ষা: আপনি হ্যান্ডওভার হার্ডওয়্যারে সংশোধন অবতরণ পতাকা এবং দেখছেন যে অব্যাহত চেকপয়েন্ট নাম লোড করা হয়। রাউন্ড দুই এবং তিন হয় যেখানে হার অনুমান শুরু চলতে। যদি চার রাউন্ড দ্বারা সরানো হয় না সমস্যা upstream DAgger হয়।
| প্রতি রাউন্ড লিখুন | কেন এটি পরে গুরুত্বপূর্ণ |
|---|---|
| চেকপয়েন্ট যা ড্রাইভ করা হয়েছিল | এটি ছাড়া আপনি একটি উন্নতি মিশ্র বৈশিষ্ট্য করতে পারবেন না |
| টেকওভারের জন্য ব্যবহৃত ইনপুট মোড | কীবোর্ড সংশোধন নেতা সংশোধন চেয়ে মোটা এবং এটি ডেটা দেখায় |
| রান সংখ্যা এবং প্রতিটি কীভাবে পরীক্ষা করা হয়েছিল | রাউন্ড গুরুত্বপূর্ণ করার জন্য যথেষ্ট সংশোধন ছিল |
| হস্তক্ষেপ হার প্রতি রান এবং অর্থ | লুপ অগ্রগতি মেট্রিক |
| প্রতি উত্স সঠিক পর্ব নির্বাচন | একমাত্র উপায় পুনরুৎপাদন বা পূর্ববর্তী রাউন্ড |
| উষ্ণ শুরু বা তাজা প্রশিক্ষণ | লোকসান বক্ররেখা একটি সপ্তাহ ব্যাখ্যা করে আপনি তাকাবেন |
যদি আপনি একটি চেকপয়েন্ট নেই এখনো
লুপ কোনো প্রবেশ পয়েন্ট একটি ছাড়াই। একটি প্রথম ডেটাসেট রেকর্ড একটি প্রথম নীতি প্রশিক্ষণ এটি চালান - রেকর্ডিং, প্রশিক্ষণ এবং নীতি চালান সেই পথ কভার। রেকর্ডিং ক্লায়েন্ট হল ডাউনলোড পৃষ্ঠা, GPU স্তর এবং ঘন্টায় হার মূল্য নির্ধারণ পৃষ্ঠা, এবং একটি ব্যবহারযোগ্য পর্ব কি দেখায় SO-100 ডেটা সংগ্রহ গাইড। সংশোধন আগে প্রদর্শন পান: DAgger একটি মেরামত ব্যবস্থা এবং এটি অনেক ভালো কাজ করে কিছু যা প্রায় সঠিক ছিল।
আমি একটি লিডার বাহু ছাড়াই একটি DAgger লুপ চালাতে পারি?▾
হ্যাঁ। প্রভার টিপুন যখন কীবোর্ড বা স্লাইডার ইনপুট নির্বাচন করুন: প্রভার তাৎক্ষণিক এবং ম্যানুয়াল অন্য বাহু সারিবদ্ধ অনুপস্থিত। কীবোর্ড সম্পর্কিত ন্যাজ পাঠায় যা সার্ভার কঠোর २ ডিগ্রি প্রতি যৌথ ४ গ্রিপার জন্য; স্লাইডার একটি পাঠায় পরম লক্ষ্য এবং সার্ভার সর্বোচ্চ ६ ডিগ্রি লক্ষ্য প্রতি কল করে যখন ইন্টারফেস স্ট্রিম রাখে। ক্রিয়া কলাম এবং হস্তক্ষেপ চিহ্নিতকরণ নেতা মোডে একই তাই সংশোধন অপ্রতিদ্বন্দ্বী ডেটাসেট বিন্যাস পার্থক্য।
এক রাউন্ড কত সংশোধন প্রয়োজন?▾
নেই কোনো রক্ষা সর্বজনীন সংখ্যা এবং ফ্রেম গণনা পর্ব গণনা আরও গুরুত্বপূর্ণ। কর্মশীল নিয়ম সংশোধন হারিয়ে যাবে না মিশ্রণ: २०० মূল পর্ব এবং তিন সংশোধন পর্ব কিছু সরবে। লক্ষ্য সংশোধন যে কভার আচরণ ব্যর্থতা থেকে বেশ কয়েক শুরু কনফিগারেশন বনাম তিন পুনরাবৃত্তি একই বাঁচা।
শুধুমাত্র সংশোধন প্রশিক্ষণ কেন এমন একটি খারাপ ধারণা?▾
কারণ সংশোধন প্রায় সম্পূর্ণভাবে কাজের কঠিন মধ্যম। পদ্ধতি সারিবদ্ধকরণ এবং পিছিয়ে অনুপস্থিত তাই নীতি হারায় এটি ভাল ইতিমধ্যে কি করেছিল অংশ উন্নত সময় আপনি সংশোধন। পুরানো ডেটা রাখা এবং যোগ করা ঘটনাক্রম নিজেই অপশনাল অতিরিক্ত নয়।
একটি চেকপয়েন্ট থেকে ক্রমাগত পূর্ববর্তী প্রশিক্ষণ রান সংরক্ষণ?▾
না। একটি শুধুমাত্র ওজন চেকপয়েন্ট পুনরুদ্ধার পারামিটার এবং অন্য কিছু: অপ্টিমাইজার মুহূর্ত শেখার হার সময়সূচী অবস্থান এবং ডেটা অর্ডার তাজা শুরু। এটি একটি উষ্ণ শুরু এবং একটি প্রাথমিক ক্ষতি স্পাইক প্রত্যাশিত বনাম একটি সমন্ধান। লিখুন যা দুই আপনি আসলে করেছিল তাই আপনি বক্ররেখা সঠিক এক সপ্তাহ পড়া।
হস্তক্ষেপ হার যদি পতিত হয় না?▾
থামান রাউন্ড যোগ করা। সমতল হার অর্থ সংশোধন শেখা নয় যা আপনি চিন্তা করেন। সাধারণ কারণ upstream: একটি ক্যামেরা সরানো সংশোধন শুরু খুব দেরী এড়ান ডেটা, হ্যান্ডওভার ফ্রেম প্রশিক্ষণ সেট বা কাজ নির্ধারিত পর্যবেক্ষণ নীতি আসলে পায়।
কোনো এই একটি সমাধান সমস্যা এবং এক ক্লিক কোনো এটি। ইন্টারেক্টিভ অনুকরণ শিক্ষা সক্রিয় গবেষণা এলাকায় ঠিক এর প্রশ্নগুলি - যখন হস্তক্ষেপ কীভাবে ওজন মানব কত পুরানো ডেটা রাখতে - নেই নিষ্পত্তি উত্তর; Celemin এট আল মূলক তারা ম্যাপ কি এখনও খোলা। যা লুপ সম্পত্তি যা পরিমাপ করার সংকুচিত সাবধানে হার্ডওয়্যার যে খরচ কয়েক শত ইউরো। সেটআপ ফ্রিজ করুন প্রাথমিক হস্তক্ষেপ ট্রিয়াজ সৎভাবে মিশ্রণ উদ্দেশ্যমূলকভাবে এবং রেকর্ড হস্তক্ষেপ হার প্রতিবার।
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started