টেলিঅপারেশন এবং নীতি প্রশিক্ষণের জন্য সেট আপ করা একটি ডেস্ক পর একটি SO-100 সাশ্রয়ী রোবোট বাহু
DAggerSO-100অনুকরণ শিক্ষাVLAটেলিঅপারেশন

একটি VLA নীতির সাথে SO-100-এ একটি DAgger লুপ চালান

AY-Robots ResearchAugust 27, 2026১৫ মিনিটের পড়া

একটি SO-100 বাহু তে একটি মানব-নিয়ন্ত্রিত DAgger রাউন্ডের ধাপে-ধাপে বর্ণনা: নীতি চালান এবং এটি রেকর্ড করুন, এটি ভুল হলে প্রভার নিন, রানটি একটি সংশোধন হিসাবে ফাইল করুন, একটি মিশ্র ডেটাসেট সংমিশ্রণ করুন এবং একটি চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান। একটি লিডার বাহু ছাড়াই মানুষের জন্য কীবোর্ড এবং স্লাইডার প্রভারের পথ অন্তর্ভুক্ত করে এবং একটি রাউন্ডকে অপ্রয়োজনীয় করে তোলে এমন চারটি ভুল অন্তর্ভুক্ত করে।

আপনার নীতি চলে। এটি ঘনক্ষেত্রটির জন্য পৌঁছায়, গ্রিপারটি একটি সেন্টিমিটার খুব তাড়াতাড়ি বন্ধ করে এবং এটি যেন পেয়েছে তার মতো চলে। কোনো ত্রুটি ঘটে না এবং প্রশিক্ষণের ক্ষতির দিকে তাকান কোনো পরিমাণ এটি ব্যাখ্যা করে না। সংশোধনটি একই প্রদর্শনে আরও ২০,০০০ গ্রেডিয়েন্ট পদক্ষেপ নয়। এটি আপনার হাতটি বাহুতে ফিরিয়ে আনা ঠিক যেখানে এটি ভুল হয়, আপনি যা করেছেন তা রেকর্ড করা এবং পুরানো ডেটা প্লাস সেই সংশোধনে পরবর্তী চেকপয়েন্টে প্রশিক্ষণ দেওয়া। এটি একটি DAgger রাউন্ড এবং এটি একটিতে কীভাবে চলে SO-100 একটি দৃষ্টি-ভাষা-ক্রিয়া নীতির সাথে।

তত্ত্বটি অন্য কোথাও রয়েছে: ডেটাসেট সংগ্রহ কেন কাজ করে এবং মানব নিয়ন্ত্রণ এটি সম্পর্কে কী পরিবর্তন করে। এটি অপারেটিং ম্যানুয়াল এবং এটি প্রশিক্ষিত চেকপয়েন্ট, কাজ করা ক্যামেরা সেট এবং একটি বাহু যা সরানো হয় অনুমান করে। নীচের ছয়টি পদক্ষেপ এই প্ল্যাটফর্মের DAgger পৃষ্ঠা বাস্তবায়ন করা লুপ কিন্তু ক্রম আপনার নিজের স্ক্রিপ্ট থেকে একই।

সংক্ষিপ্তভাবে এক রাউন্ড

  • প্রশিক্ষিত নীতি চালান এবং এটি রেকর্ড করুন, রানের কাজের পাঠ্যের সাথে একটি সাধারণ টেলিঅপারেশন লেবেলের পরিবর্তে।
  • আচরণ ভুল হওয়ার মুহূর্তে প্রভার নিন: একটি লিডার বাহুর সাথে একটি আয়না হ্যান্ডওভার, বিনা লিডারের কীবোর্ড বা স্লাইডারের উপর তাত্ক্ষণিক এবং ম্যানুয়াল।
  • প্রতিটি রান পরীক্ষা করুন: এটি একটি সংশোধন হিসাবে ফাইল করুন, এটি একটি মূল্যায়ন পর্ব হিসাবে রাখুন বা এটি বাতিল করুন।
  • মিশ্রণটি হাতে দিয়ে সংমিশ্রণ করুন - মূল প্রদর্শন প্লাস সংশোধন, প্রতিটি উত্সের জন্য নির্বাচিত পর্ব। কখনই শুধুমাত্র সংশোধনে প্রশিক্ষণ করবেন না।
  • শেষ চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান এবং নোট করুন কোন চেকপয়েন্ট কোন মিশ্রণ তৈরি করেছে।
  • যে সংখ্যা বলে যে রাউন্ডটি মূল্যবান ছিল তা হস্তক্ষেপ হার, প্রশিক্ষণের ক্ষতি নয়।

দ্বিতীয় রাউন্ড কেন শুধু আরও ডেটা নয়

আচরণ ক্লোনিং প্রশিক্ষণ যেমন রাজ্যে একটি মানুষ পরিদর্শন করেছেন। পরীক্ষার সময় নীতি রাজ্যে পরিদর্শন করে এটি কারণ করে এবং ছোট ক্রিয়া ত্রুটি রাজ্যের মধ্যে যৌগিক যা কোনো প্রদর্শন কভার করে নি। রস, গর্ডন এবং বাগনেল AISTATS 2011 এর জন্য সেই ব্যর্থতা ফর্মালাইজ করেছেন এবং এটি একটি পুনরাবৃত্তিমূলক অ্যালগরিদম দিয়ে উত্তর দিয়েছেন যা একটি স্থির নির্ধারণমূলক নীতি প্রশিক্ষণ দেয় এবং তাদের হ্রাসের অধীনে, এটি রাজ্য বন্টনের অধীনে ভাল পরিবেশন করতে হবে এটি ঘটায়: বর্তমান নীতি চালান, বিশেষজ্ঞটি যে রাজ্যগুলি এটি আসলে পৌঁছেছে তার লেবেল করুন, সেগুলি ডেটাসেটে যোগ করুন, রিট্রেইন, পুনরাবৃত্তি করুন। কেলি এট আল। HG-DAgger দিয়ে প্রশ্নটি ব্যবহারিক করেছেন যেখানে মানুষ নিয়ন্ত্রণের সময় নেওয়ার সিদ্ধান্ত নেয় নিয়ন্ত্রণ ছাড়াই রাজ্যের লেবেল করার পরিবর্তে; তারা DAgger এবং আচরণ ক্লোনিং উভয়ের চেয়ে উন্নত কর্মক্ষমতা রিপোর্ট করে একটি অনুকরণ এবং একটি বাস্তব স্বায়ত্তশাসিত ড্রাইভিং কাজে। মানব নিয়ন্ত্রণ একটি ডেস্ক বাহুতে লুপকে সহনীয় করে তোলে - আপনি শুধুমাত্র কিছু ভুল হলে আপনার হাতগুলি সরান।

অনুশীলনে দুটি পরিণতি তত্ত্বের চেয়ে বেশি গুরুত্বপূর্ণ। সংশোধনগুলি সাধারণ প্রদর্শন নয়: তারা বটলনেক অঞ্চলে ঘনীভূত হয় Mandlekar এট আল। বর্ণনা করেন যেখানে একটি ছোট বিচ্যুতি নীতিটিকে রাজ্যে ফেলে দেয় প্রদর্শন কখনও কভার করে নি। এবং শুধুমাত্র সেই কঠিন অংশগুলি থেকে তৈরি একটি ডেটাসেট খারাপভাবে গঠিত ডেটাসেট - বেলখেল, কুই এবং সাদিঘ যুক্তি দেন ডেটা পক্ষ থেকে যে রাজ্য বৈচিত্র্য সবসময় উপকারী নয় এবং ক্রিয়া বিচ্যুতি এবং রূপান্তর বৈচিত্র্য একসাথে ডেটাসেট গুণমান সিদ্ধান্ত। মিশ্র ডেটাসেট একটি আপস নয়, এটি পয়েন্ট।

এক রাউন্ডের আগে এগুলি হিমায়ন করুন

একটি DAgger রাউন্ড সময়ের সাথে একটি নীতি নিজের বিরুদ্ধে তুলনা করে। আপনি যে কোনো কিছু পরিবর্তন করেন রাউন্ডগুলির মধ্যে যা ডেটাসেট নয় সেই তুলনা অর্থপূর্ণ করে তোলে।

  • ক্যামেরার অবস্থান এবং মাউন্ট, কব্জি ক্যামেরা অন্তর্ভুক্ত। একটি ক্ল্যাম্প ঢিলে করুন এবং আপনি পর্যবেক্ষণ বন্টন পরিবর্তন করেছেন, নীতি নয়।
  • এক্সপোজার এবং সাদা ভারসাম্য যদি আপনার ক্যাপচার স্ট্যাক আপনাকে তাদের পিন করতে দেয়। স্বয়ংক্রিয় এক্সপোজার রাউন্ডের মধ্যে বৃদ্ধি একটি ধীর অদৃশ্য ডোমেইন শিফট।
  • বাহু ক্যালিব্রেশন এবং সার্ভো শূন্য অবস্থান। যদি আপনাকে পুনরায় ক্যালিব্রেট করতে হয় তবে এটির আগে রেকর্ড করা সবকিছু আলাদা ডেটাসেট হিসাবে বিবেচনা করুন।
  • কাজের পাঠ্য। প্রতিটি VLA এখানে এটিতে শর্তসাপেক্ষ; মধ্য-লুপে পুনরায় লেখা এটি একটি ভিন্ন কাজ।
  • আলো, টেবিল পৃষ্ঠ, বস্তু সেট। একটি নতুন বস্তু একটি নতুন পরীক্ষা, পরবর্তী রাউন্ড নয়।
  • রেকর্ডিং ফ্রেম হার। দুটি নমুনা রাস্টার জুড়ে হস্তক্ষেপ হার তুলনা করা পার্থক্য তৈরি করে যা রাস্টার থেকে আসে।
কব্জি ক্যামেরা ঐচ্ছিক আসবাবপত্র নয়

হসু এট আল। একটি হাতের কেন্দ্রিক দৃষ্টিভঙ্গি সাধারণ তৃতীয় ব্যক্তির দৃষ্টিভঙ্গির বিরুদ্ধে তুলনা করেছেন এবং চোখ-ইন-হ্যান্ড দৃষ্টিভঙ্গি ধারাবাহিকভাবে প্রশিক্ষণ দক্ষতা এবং বিতরণ বহির্গমন সাধারণীকরণ উন্নত করেছেন, দৃশ্যের কম দেখা সত্ত্বেও। পাঁচ-যৌথ বাহুতে গ্রিপার সময় সাধারণত আপনি যা সংশোধন করছেন এবং গ্রিপার সময় যা কব্জি দৃষ্টিভঙ্গি বহন করে।

শেষ থেকে শেষ রাউন্ড

  1. 1
    অনুমান চালান এবং এটি রেকর্ড করুন

    আপনি উন্নত করতে চান এমন চেকপয়েন্টের বিরুদ্ধে রান শুরু করুন তারপর অনুমান রুটে রেকর্ডিং শুরু করুন। এভাবে রেকর্ড করা হলে এটি রানের নিজের কাজের পাঠ্য উত্তরাধিকার দেয় যা নীতি প্রশিক্ষিত ছিল ডিফল্ট টেলিঅপারেশন লেবেলের পরিবর্তে। রেকর্ডিং ছাড়াই আপনি ব্যর্থতা দেখতে পারেন কিন্তু এটিতে প্রশিক্ষণ করতে পারবেন না।

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    এটি ভুল হলে প্রভার নিন

    প্রভার টিপুন এবং ইনপুট মোড নির্বাচন করুন: লিডার বাহু কীবোর্ড বা স্লাইডার। রানার পজ অপেক্ষা করে আপনি সংশোধন করেন আপনি হাতে। আপনি ড্রাইভ করার সময় রেকর্ড করা ফ্রেমগুলি স্বয়ংক্রিয়ভাবে হস্তক্ষেপ হিসাবে ফ্ল্যাগ করা হয়।

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    পর্যায়গুলি পরীক্ষা করুন

    প্রতি পর্ব সিদ্ধান্ত নিন: সংশোধন হিসাবে ফাইল করুন, মূল্যায়ন হিসাবে রাখুন বা বাতিল করুন। নীতিটি সম্পূর্ণ করা ছাড়াই একটি রান মূল্যায়ন ডেটা।

  4. 4
    সংশোধন ডেটাসেট সিঙ্ক করুন

    সংশোধনগুলি নীতি প্রতি স্থানীয় ডেটাসেটে সংগ্রহ করে এবং স্বয়ংক্রিয় সিঙ্কের মাধ্যমে ক্লাউড স্টোরেজে যায়। আপনি যা রাখেননি তা কিছুই মিশ্রিত হয় না।

  5. 5
    মিশ্র ডেটাসেট সংমিশ্রণ করুন

    মূল ডেটাসেটটিকে সংশোধন ডেটাসেটের সাথে একত্রিত করুন প্রতিটি উত্সের পর্বগুলি স্পষ্টভাবে বেছে নিয়ে। ফলাফলটি সেই পয়েন্ট থেকে একটি সাধারণ ডেটাসেট।

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    চেকপয়েন্ট থেকে প্রশিক্ষণ চালিয়ে যান

    বেস মডেলের পরিবর্তে পূর্ববর্তী চেকপয়েন্ট থেকে মিশ্রণটি প্রশিক্ষণ দিন। নোট করুন কোন চেকপয়েন্ট এবং কোন মিশ্রণ; সেই জোড়া ছাড়া রাউন্ডটি পুনরুৎপাদনযোগ্য নয়।

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

ধাপ ২ বিস্তারিত: প্রভারের দুটি উপায়

লিডার বাহু দিয়ে

মধ্যে লিডার-অনুসারী মোডে প্রভার একটি হ্যান্ডওভার দুটি বাহুর মধ্যে যা একই ভঙ্গিতে নয়। প্রভার টিপুন পজকে পরিবহন করে লিডারকে অনুসরণকারীর বর্তমান ভঙ্গিতে ড্রাইভ করে তাই সামর্থ্য স্থানান্তর হওয়ার সময় কিছু লাফায় না। যদি সেই সারিবদ্ধকরণ ড্রাইভ সময়সীমা অতিক্রম করে আপনি লিডারটি হাতে দিয়ে সারিবদ্ধ করেন এবং শুধুমাত্র মুক্তি দেন দুজন পাঁচ ডিগ্রির মধ্যে। সেখান থেকে আপনি সাধারণত টেলিঅপারেট করেন এবং ক্রিয়া কলামটি রেকর্ড করে আপনি আদেশ করেছেন।

এই পথ সম্পর্কে সৎ হন: সারিবদ্ধকরণ ড্রাইভ এবং সামর্থ্য হ্যান্ডওভার লুপের সবচেয়ে কম পরীক্ষিত অংশ বাস্তব হার্ডওয়্যারে। একটি ধীর নিরীহ ভঙ্গিতে হ্যান্ডওভার পরীক্ষা করুন যা আপনি এটিতে নির্ভর করার আগে আপনি যত্ন করেন এমন রান। একটি লিডার বাহু তিনটি মোডের মসৃণ সংশোধন তৈরি করে এবং যান্ত্রিক ভুলের জন্য সবচেয়ে বেশি আছে।

লিডার বাহু ছাড়া: কীবোর্ড এবং স্লাইডার

বেশিরভাগ মানুষ এটি পড়ছেন একটি বাহু মালিক। সেটা যথেষ্ট। প্রভার টিপুন এবং ইনপুট মোড নির্বাচন করুন এমন মুহূর্তে কীবোর্ড বা স্লাইডার এবং প্রভার তাৎক্ষণিক এবং ম্যানুয়াল - দ্বিতীয় বাহু সারিবদ্ধ করার কোনো সারিবদ্ধকরণ ধাপ নেই। অনুসরণকারী তার ভঙ্গি ধরে রাখে এবং ইনপুটের জন্য অপেক্ষা করে।

ইনপুট মোডবাহু কীভাবে সরানো হয়সার্ভার দ্বারা প্রয়োগ করা প্রতি-কল সীমাযখন লক করা হয়
লিডার বাহুদর্পণটি লিডারের যৌথ কোণ থেকে অনুসরণকারীটি চালিত করেএই মোডে কোনো ন্যাজ বা সেট কল নেই; দর্পণ ক্রমাগত অনুসরণকারী লক্ষ্যগুলি লেখেকখনও লক করা হয় না এবং ডিফল্ট যদি কোনো ইনপুট মোড দেওয়া হয় না - কিন্তু এটির একটি দ্বিতীয় বাহু দরকার; লিডার আইডি ছাড়াই প্রভার অস্বীকৃত
কীবোর্ডপ্রতি মূল প্রেস সম্পর্কিত ন্যাজ প্রভার ন্যাজ শেষ পয়েন্টে পাঠানোকঠোর ক্ল্যাম্প ২ ডিগ্রি প্রতি যৌথ ৪ ডিগ্রি গ্রিপারের জন্যপ্রভার লিডার মোডে শুরু করা হলে ৪০৯ দিয়ে প্রত্যাখ্যাত
স্লাইডারনিরপেক্ষ লক্ষ্য ভঙ্গি প্রভার সেট শেষ পয়েন্টে পাঠানোসর্বোচ্চ ৬ ডিগ্রি ভ্রমণ লক্ষ্যের দিকে প্রতি কল; ইন্টারফেসটি প্রতি সেকেন্ডে প্রায় দশবার পাঠায়প্রভার লিডার মোডে শুরু করা হলে ৪০৯ দিয়ে প্রত্যাখ্যাত

ক্ল্যাম্পগুলি সার্ভার-সাইড প্রয়োগ করা হয় ইন্টারফেসে নয় কারণ বাস-সার্ভো বাহুতে একটি ভুলভাবে টাইপ করা ডেল্টা একটি সংঘর্ষ। কীবোর্ড সংশোধনগুলি ধাপে বেরিয়ে আসে এবং কিছুটা মোটা; স্লাইডার সংশোধনগুলি মসৃণ কারণ সার্ভার লক্ষ্যের দিকে হাঁটে ইন্টারফেসটি স্ট্রিম করে। যেকোনো উপায়ে ক্রিয়া কলামটি পূর্ণ আদেশকৃত ভঙ্গি ভেক্টর পায় এবং হস্তক্ষেপ চিহ্নিতকরণ নেতা পথের সাথে অভিন্ন তাই কীবোর্ড সংশোধনগুলি বিন্যাস পার্থক্য ছাড়াই একই ডেটাসেটে অবতরণ করে।

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
একই মূল বিন্যাস স্ট্যাক জুড়ে অন্যত্র তাই রেকর্ডিং থেকে পেশী স্মৃতি বহন করে।
একটি SO-100 ডেটাসেটে একটি GR00T সূক্ষ্ম-সুর রানের অর্ডারকৃত পদক্ষেপগুলি দেখায় প্রশিক্ষণ গাইড
রাউন্ডের প্রশিক্ষণ দিক একটি প্রথম রানের মতো একই নির্দেশিত ক্রম; শুধুমাত্র চেকপয়েন্ট ক্ষেত্র পার্থক্য।

বোতাম কখন টিপুন

দেরীর চেয়ে তাড়াতাড়ি। একটি সংশোধন যা গ্রিপার কিছুতে বন্ধ হওয়ার পরে শুরু হয় নীতিটিকে একটি ব্যর্থতা থেকে পুনরুদ্ধার করে শেখায় প্রবেশ করা উচিত ছিল না এবং পুনরুদ্ধার ডেটা মূল্যবান এড়ান ডেটা চেয়ে অনেক কম। সামর্থ্য যেখানে বিশ্বাস করেন যে গতিপথ ভুল পদক্ষেপটি ব্যাহত করুন কঠিন অংশটি সংশোধন করুন হাতে যেখানে নীতি পরিচালনা করেছে। থ্রিফটিডিএগার সেই সিদ্ধান্তটি স্বয়ংক্রিয় করে নতুনত্ব এবং অনুমানকৃত ঝুঁকিতে হস্তক্ষেপ গেটিং করে একটি নির্দিষ্ট মানব বাজেটের অধীনে কিন্তু একটি একক বাহুতে একটি মানুষ ইতিমধ্যে দেখছে মানব গেট সস্তা এবং আরও ভালভাবে ক্যালিব্রেট করা হয়েছে যা কিছু আপনি সুর করবেন।

খোলা উত্স স্ট্যাক এবং কয়েকটি স্ক্রিপ্ট দিয়ে সম্ভব। এটি খরচ কি বুককিপিং এবং বুককিপিং যেখানে DAgger রাউন্ড মরে।

  1. আপনার নিজের অনুমান স্ক্রিপ্ট থেকে একটি LeRobot ডেটাসেটে ফ্রেম লিখুন নীতি প্রশিক্ষিত ছিল কাজের স্ট্রিং দিয়ে।
  2. নীতি লুপ বিরাম কমান্ড উত্স এবং প্রতিটি ফ্রেম আপনি ড্রাইভ হিসাবে সংগ্রহ করুন। পতাকা ছাড়াই সংশোধনগুলি সাধারণ প্রদর্শন দেখায়।
  3. নীতি নিয়ন্ত্রণ মুক্তি এবং আপনার প্রথম ইনপুটের মধ্যে রূপান্তর ফ্রেম কী ঘটে সেই সম্পর্কে উদ্দেশ্যমূলক সিদ্ধান্ত নিন।
  4. প্রতি নীতি প্রতি আলাদা ডেটাসেটে সংশোধনগুলি রাখুন এবং পর্বের সূচকগুলি হাতে ট্র্যাক করুন যাতে মিশ্রণটি পুনর্নির্মাণ করা যায়।
  5. সূক্ষ্ম-সুর প্রবেশ পয়েন্ট পূর্ববর্তী চেকপয়েন্টের দিকে নির্দেশ করুন এবং লগে সেই ওজনগুলি লোড করা হয়েছে তা পরীক্ষা করুন।

ধাপ ৩ বিস্তারিত: পরীক্ষা গুণমান সিদ্ধান্ত

রানের পরে আপনার একটি রেকর্ডিং আছে কিছু ফ্রেম হস্তক্ষেপ হিসাবে চিহ্নিত। তিনটি গন্তব্য বিদ্যমান এবং ভুল একটি চুপচাপ পরবর্তী রাউন্ড বিষ করে।

  • সংশোধন হিসাবে ফাইল করুন যখন হস্তক্ষেপ একটি খাঁটি ঠিক ছিল: নীতি কোথাও ভুল যাচ্ছিল এবং আপনার ইনপুট দেখিয়েছে নীতি নিজে উৎপাদিত একটি রাজ্য থেকে সঠিক জিনিস।
  • পরিচ্ছন্ন স্বায়ত্তশাসিত রান হিসাবে রাখুন এবং সাবধানতার বাইরে আপনি নিয়েছেন যে রান। মূল্যায়ন পর্বগুলি পরবর্তী চেকপয়েন্ট পরিমাপ করা এবং তারা কখনও প্রশিক্ষিত হয় না।
  • বাতিল করুন কিছু সম্পর্কিত - একটি ড্রপ ক্যামেরা ফ্রেম একটি স্থির সার্ভো একটি বস্তু আপনি knocked রান। একটি মেসি সংশোধন কোনো সংশোধন চেয়ে খারাপ।
ফ্রিজ ফ্রেম কাঁচা রেকর্ডিং মধ্যে প্রশিক্ষণ ডেটা নয়

নীতি নিয়ন্ত্রণ মুক্তি এবং আপনার প্রথম ইনপুটের মধ্যে বাহু শান্ত রাখে রেকর্ডার রাখে লেখা - একটি পরিচয় ভঙ্গি রান সামান্য ভিন্ন ছবি পেয়ারড। এখানে সেই হ্যান্ডওভার ফ্রেমগুলি কাঁচা রেকর্ডিংয়ে থাকে এবং সংশোধন ডেটাসেটের বাইরে। আপনি লুপটি নিজে তৈরি করেন তাদের অপসারণ করুন উদ্দেশ্যমূলকভাবে: একটি নীতি প্রশিক্ষিত আইটি পজ শিখে যেখানে এটি অভিনয় করা উচিত।

ধাপ ৫ বিস্তারিত: মিশ্র সংমিশ্রণ

সংমিশ্রণটি মূল ডেটাসেট প্লাস সংশোধন ডেটাসেট নেয় এবং একটি নতুন সাধারণ তৈরি করে LeRobot ডেটাসেট যা অন্য যে কোনো মত প্রশিক্ষণ। গুরুত্বপূর্ণ সম্পত্তি যে পর্ব নির্বাচন স্পষ্ট প্রতি উত্স - কিছুই স্বয়ংক্রিয়ভাবে মিশ্রিত হয়। সেই ছোট শোনায় যতক্ষণ না প্রথম বার একটি নীতি অদ্ভুত আচরণ করে এবং আপনি পুনর্নির্মাণ করতে হবে এটি প্রশিক্ষিত।

খোলা প্রশ্ন অনুপাত এবং কেউ একটি সংখ্যা নেই যা স্থানান্তর। সাহিত্য একমত হয় যে সংশোধনগুলি ফ্রেম শেয়ার চেয়ে আরও গণনা করা উচিত। Mandlekar এট আল। তাদের হস্তক্ষেপ সিস্টেম সংগ্রহ করে ডেটা পুনরাবৃত্তিমূলক প্রশিক্ষণ দেন যাতে নীতি বটলনেক অতিক্রম শিখে এবং রিপোর্ট যে এজেন্ট প্রশিক্ষিত সেই উপায় অনিয়ন্ত্রক প্রদর্শনকারীদের কাছ থেকে সমান নমুনা সংখ্যায় প্রশিক্ষিত এজেন্ট। Sirius আরও যায় এবং প্রশিক্ষণ নমুনা পুনরায় ওজন অনুমানিত মানব বিশ্বাস দ্বারা সাফল্য হার রিপোর্টিং ৮ শতাংশ লাভ অনুকরণ এবং ২৭ শতাংশ বাস্তব হার্ডওয়্যার নীতি এবং দ্বিগুণ সংকুচনতা এটি তুলনা করে পদ্ধতি। প্রশিক্ষণ প্রবেশ পয়েন্ট কোনো নমুনা ওজন knob এক্সপোজ তাই কঠোর বিকল্প শেষ প্রতিটি সংশোধন পর্ব যখন subsampling মূল প্রদর্শন - এবং লেখা আপনি করেছেন।

ক্যামেরা স্ট্রিম একটি SO-100 ডেটাসেট এর পর্যায় দেখায় ডেটাসেট রেকর্ডিং দৃশ্য
সংশোধন পর্যায় একটি প্রতি ফ্রেম হস্তক্ষেপ পতাকা সাধারণ পর্ব তাই তারা মূল ডেটাসেট রূপান্তর ছাড়াই রচনা।

ধাপ ৬ বিস্তারিত: একটি চেকপয়েন্ট থেকে প্রকৃতপক্ষে অব্যাহত থাকে মানে

বেস মডেল থেকে মিশ্রণটি প্রশিক্ষণ কাজ করে তবে পূর্ববর্তী রাউন্ড ফেলে এবং একটি সম্পূর্ণ রান খরচ। অবিরত পূর্ববর্তী থেকে চেকপয়েন্ট দ্রুততর এবং সাধারণত ভাল। এটি ফ্রেজ পরামর্শ চেয়ে আরও সীমিত।

ওজন শুরু অপ্টিমাইজার রিজিউম নয়

একটি শুধুমাত্র ওজন চেকপয়েন্ট পরামিতি এবং অন্য কিছু নেই রয়েছে। এটি লোডিং পরবর্তী চালান একটি ভাল শুরু পয়েন্ট বেস মডেল চেয়ে দেয় কিন্তু অপ্টিমাইজার মুহূর্ত শেখার হার সময়সূচী অবস্থান এবং ডেটা অর্ডার সব শূন্য থেকে শুরু। চলমান রান শুরু একটি ক্ষতি স্পাইক আশা করি এটি একটি ব্যর্থতা হিসাবে পড়তে না এবং করবেন না রাউন্ড একটি সংরক্ষণ কল। এটি একটি উষ্ণ শুরু।

নীতিআকারGPU স্তরপ্রতি ক্রিয়া পদক্ষেপ অনুমানডেটাসেট ফর্ম্যাটচেষ্টা মূল্য আগে পর্ব
GR00T N1.7প্রায় ৩ বি প্রায় ৪০ এম সূক্ষ্ম সুর সময় প্রশিক্ষিতA100 ৮০ GB বা H100 ৮০ GBপ্রায় ১৫२ এমএসLeRobot v2.0 বা v2.1৫০
GR00T N1.5প্রায় ৩ BA100 ৮০ GB বা H100 ৮০ GBপ্রায় ১৬५ এমএসLeRobot v2.0 বা v2.1৫०
Pi0.5একটি PaliGemma মেরুদণ্ড প্রায় ৩ BA100 ৮० GB বা H100 ৮० GBপ্রায় ४८५ এমএসLeRobot v3.0५०
SmolVLAপ্রায় ४५० এমRTX ४०९० বা যে কোনো २४ GB কার্ডপ্রায় २४५ এমএসLeRobot v3.0३०
ACTপ্রায় ८० এম স্ক্র্যাচ থেকে প্রশিক্ষিতRTX ४०९० বা যে কোনো २४ GB কার্ডপ্রায় २० এমএসLeRobot v3.0५०

বিলম্ব একটি DAgger লুপ ভিতরে যৌগিক একটি উপায় এটি একটি ডেমো সময় নয়: প্রায় ४८५ এমএস প্রতি ক্রিয়া পদক্ষেপ আপনি প্রভার নিন কারণ বাহু দ্বিধা নেই কারণ এটি ভুল ছিল এবং দ্বিধা সংশোধন সম্পদ প্রশিক্ষণ ডেটা। যদি আপনি ডেটা চূড়ান্ত সাফল্য হার চেষ্টা করছেন পুনরাবৃত্তি এক দ্রুত মডেল। Shukor এট আল। SmolVLA হিসাবে বর্ণনা একটি একক GPU এবং স্থাপনা ভোক্তা GPUs বা CPUs পরিকল্পনা ডিজাইন একটি অ্যাসিঙ্ক্রোনাস অনুমান স্ট্যাক যা ক্রিয়া পূর্বাভাস থেকে সম্পাদন decouples উচ্চতর নিয়ন্ত্রণ হার অনুমতি - সম্পত্তি যা প্রভার লুপ প্রতিক্রিয়াশীল রাখে।

ডেটাসেট ফর্ম্যাট পারস্পরিক বিনিময়যোগ্য হয় না। GR00T LeRobot v2.0 বা v2.1 লেয় এবং Isaac-GR00T ভান্ডার তার ইনপুট বর্ণনা করে LeRobot v2 ফর্ম্যাট একটি স্বাদ একটি সংযুক্ত মাধ্যমে বর্ণনা ফাইল; আধুনিক প্রশিক্ষক এখানে v3.0 আশা করি। একটি মিশ্র রচনা ভুল সংস্করণ লোড সময় ব্যর্থ হয় পরিবর্তে একটি খারাপ নীতি উৎপাদন - ভাল ব্যর্থতা মোড এখনও বর্জ্য সারিবদ্ধ স্লট। ডেটাসেট ডকুমেন্টেশন তালিকা যা ফর্ম্যাট প্রতিটি প্রশিক্ষক গ্রহণ করে।

লুপ বুককিপিং ইতিমধ্যে করা

লিডার বাহু কীবোর্ড বা স্লাইডার সহ প্রভার; প্রতি ফ্রেম হস্তক্ষেপ চিহ্নিতকরণ; সংশোধন বা মূল্যায়ন হিসাবে ফাইলিং রান; মিশ্র ডেটাসেট একটি স্পষ্ট পর্ব নির্বাচন সংমিশ্রণ প্রতি উত্স; এবং বেস মডেল পরিবর্তে একটি চেকপয়েন্ট থেকে প্রশিক্ষণ অব্যাহত। কোন রান সংশোধন গণনা করে যা মিশ্র মধ্যে যায় এবং যখন হস্তক্ষেপ হার পড়ে আপনার সিদ্ধান্ত থেকে যায়।

কীভাবে DAgger লুপ তার সাথে দেখুন

একটি রাউন্ড বর্জ্য চার উপায়

१. শুধুমাত্র সংশোধন প্রশিক্ষণ

সবচেয়ে সাধারণ ব্যর্থতা এবং সবচেয়ে আকর্ষণীয় শর্টকাট। একটি সংশোধন-কেবলমাত্র ডেটাসেট প্রায় সম্পূর্ণভাবে কাজের কঠিন মধ্যম পদ্ধতি এবং পিছুটান অনুপস্থিত; নীতি কঠিন অংশ এ ভাল হয়ে যায় এবং সেখানে পৌঁছাতে কীভাবে ভুলে যায়। সংগ্রহ একটি বাস্তবায়ন বিবরণ পদ্ধতি নয় এটি ঘটনাক্রম: পুরানো ডেটা কি তার অবস্থান আচরণ রাখে ওয়াইল সংশোধন একটি অংশ।

२. রাউন্ড মধ্যে ক্যামেরা মুভিং

একটি ক্যামেরা যা দুই সেন্টিমিটার মধ্যে রাউন্ড শিফট একটি নীতি খারাপ হয় একটি দিন খরচ রোগনির্ণয় শুরু করেছেন। প্রতিটি VLA এখানে ছবি শর্তসাপেক্ষ; যৌথ রাজ্য একা অস্পষ্ট নয় যেখানে বস্তু। প্রথম রাউন্ড আগে সেটআপ ফটোগ্রাফ এবং পরে প্রতিটি আগে সেই ফটোগ্রাফ চেক করুন।

३. হ্যান্ডওভার নিদর্শন প্রশিক্ষণ মধ্যে পেতে দেওয়া

উপরে কভার এবং তালিকায় কারণ এটি অদৃশ্য। উপসর্গ একটি নীতি যা ঠিক এক ভগ্নাংশ দ্বিধা যেখানে পূর্ববর্তী রাউন্ড অপারেটর সময় গ্রহণ। এটি মতো দেখায় দ্বিধা; এটি অনুকরণ।

४. উষ্ণ শুরু একটি সংরক্ষণ কল

যদি আপনি অপ্টিমাইজার রাজ্য বহন বিশ্বাস বাস্তবায়ন ক্ষতি স্পাইক একটি বাগ হিসাবে পড়ে এবং আপনি দুর্নীতিগ্রস্ত ডেটা শিকার চলে যান। যদি আপনি অপ্টিমাইজার তাজা শুরু জানেন স্পাইক প্রত্যাশিত এবং আপনি দেখেন এটি অনুসরণ। একই সংখ্যা বিপরীত সিদ্ধান্ত।

রাউন্ড পরিমাপ

একটি মানব নিয়ন্ত্রিত লুপ জন্য মেট্রিক হস্তক্ষেপ হার: ফ্রেম রেকর্ড যখন আপনি নিয়ন্ত্রণ সর্বমোট ফ্রেম রান ভাগ করে। এটি প্রভার অবস্থান এবং এটি একমাত্র সংখ্যা যা রাউন্ড জিজ্ঞাসা প্রশ্নের উত্তর দেয়। প্রশিক্ষণ ক্ষতি ফল নীতি উন্নত কিনা; সাফল্য হার বাইনারি এবং শব্দ ডেস্ক বাহু উত্পাদন নমুনা আকার। হস্তক্ষেপ হার ক্রমাগত যে রাজ্য নীতি নিজে কারণ পরিমাপ এবং এটি ড্রপ নীতি আপনি কম প্রয়োজন।

শুধুমাত্র অভিন্ন ব্যবস্থায় রেকর্ড রান জুড়ে তুলনা করুন। সম্পূর্ণ যুক্তি এবং একটি মূল্যায়ন সেট যা দুই রাউন্ড বেশি বেঁচে নির্মাণ করা হয় একটি DAgger লুপ পরিমাপ নিবন্ধ। রাউন্ড এক বাস্তবসম্মত একটি সম্ভাব্যতা পরীক্ষা: আপনি হ্যান্ডওভার হার্ডওয়্যারে সংশোধন অবতরণ পতাকা এবং দেখছেন যে অব্যাহত চেকপয়েন্ট নাম লোড করা হয়। রাউন্ড দুই এবং তিন হয় যেখানে হার অনুমান শুরু চলতে। যদি চার রাউন্ড দ্বারা সরানো হয় না সমস্যা upstream DAgger হয়।

প্রতি রাউন্ড লিখুনকেন এটি পরে গুরুত্বপূর্ণ
চেকপয়েন্ট যা ড্রাইভ করা হয়েছিলএটি ছাড়া আপনি একটি উন্নতি মিশ্র বৈশিষ্ট্য করতে পারবেন না
টেকওভারের জন্য ব্যবহৃত ইনপুট মোডকীবোর্ড সংশোধন নেতা সংশোধন চেয়ে মোটা এবং এটি ডেটা দেখায়
রান সংখ্যা এবং প্রতিটি কীভাবে পরীক্ষা করা হয়েছিলরাউন্ড গুরুত্বপূর্ণ করার জন্য যথেষ্ট সংশোধন ছিল
হস্তক্ষেপ হার প্রতি রান এবং অর্থলুপ অগ্রগতি মেট্রিক
প্রতি উত্স সঠিক পর্ব নির্বাচনএকমাত্র উপায় পুনরুৎপাদন বা পূর্ববর্তী রাউন্ড
উষ্ণ শুরু বা তাজা প্রশিক্ষণলোকসান বক্ররেখা একটি সপ্তাহ ব্যাখ্যা করে আপনি তাকাবেন

যদি আপনি একটি চেকপয়েন্ট নেই এখনো

লুপ কোনো প্রবেশ পয়েন্ট একটি ছাড়াই। একটি প্রথম ডেটাসেট রেকর্ড একটি প্রথম নীতি প্রশিক্ষণ এটি চালান - রেকর্ডিং, প্রশিক্ষণ এবং নীতি চালান সেই পথ কভার। রেকর্ডিং ক্লায়েন্ট হল ডাউনলোড পৃষ্ঠা, GPU স্তর এবং ঘন্টায় হার মূল্য নির্ধারণ পৃষ্ঠা, এবং একটি ব্যবহারযোগ্য পর্ব কি দেখায় SO-100 ডেটা সংগ্রহ গাইড। সংশোধন আগে প্রদর্শন পান: DAgger একটি মেরামত ব্যবস্থা এবং এটি অনেক ভালো কাজ করে কিছু যা প্রায় সঠিক ছিল।

আমি একটি লিডার বাহু ছাড়াই একটি DAgger লুপ চালাতে পারি?

হ্যাঁ। প্রভার টিপুন যখন কীবোর্ড বা স্লাইডার ইনপুট নির্বাচন করুন: প্রভার তাৎক্ষণিক এবং ম্যানুয়াল অন্য বাহু সারিবদ্ধ অনুপস্থিত। কীবোর্ড সম্পর্কিত ন্যাজ পাঠায় যা সার্ভার কঠোর २ ডিগ্রি প্রতি যৌথ ४ গ্রিপার জন্য; স্লাইডার একটি পাঠায় পরম লক্ষ্য এবং সার্ভার সর্বোচ্চ ६ ডিগ্রি লক্ষ্য প্রতি কল করে যখন ইন্টারফেস স্ট্রিম রাখে। ক্রিয়া কলাম এবং হস্তক্ষেপ চিহ্নিতকরণ নেতা মোডে একই তাই সংশোধন অপ্রতিদ্বন্দ্বী ডেটাসেট বিন্যাস পার্থক্য।

এক রাউন্ড কত সংশোধন প্রয়োজন?

নেই কোনো রক্ষা সর্বজনীন সংখ্যা এবং ফ্রেম গণনা পর্ব গণনা আরও গুরুত্বপূর্ণ। কর্মশীল নিয়ম সংশোধন হারিয়ে যাবে না মিশ্রণ: २०० মূল পর্ব এবং তিন সংশোধন পর্ব কিছু সরবে। লক্ষ্য সংশোধন যে কভার আচরণ ব্যর্থতা থেকে বেশ কয়েক শুরু কনফিগারেশন বনাম তিন পুনরাবৃত্তি একই বাঁচা।

শুধুমাত্র সংশোধন প্রশিক্ষণ কেন এমন একটি খারাপ ধারণা?

কারণ সংশোধন প্রায় সম্পূর্ণভাবে কাজের কঠিন মধ্যম। পদ্ধতি সারিবদ্ধকরণ এবং পিছিয়ে অনুপস্থিত তাই নীতি হারায় এটি ভাল ইতিমধ্যে কি করেছিল অংশ উন্নত সময় আপনি সংশোধন। পুরানো ডেটা রাখা এবং যোগ করা ঘটনাক্রম নিজেই অপশনাল অতিরিক্ত নয়।

একটি চেকপয়েন্ট থেকে ক্রমাগত পূর্ববর্তী প্রশিক্ষণ রান সংরক্ষণ?

না। একটি শুধুমাত্র ওজন চেকপয়েন্ট পুনরুদ্ধার পারামিটার এবং অন্য কিছু: অপ্টিমাইজার মুহূর্ত শেখার হার সময়সূচী অবস্থান এবং ডেটা অর্ডার তাজা শুরু। এটি একটি উষ্ণ শুরু এবং একটি প্রাথমিক ক্ষতি স্পাইক প্রত্যাশিত বনাম একটি সমন্ধান। লিখুন যা দুই আপনি আসলে করেছিল তাই আপনি বক্ররেখা সঠিক এক সপ্তাহ পড়া।

হস্তক্ষেপ হার যদি পতিত হয় না?

থামান রাউন্ড যোগ করা। সমতল হার অর্থ সংশোধন শেখা নয় যা আপনি চিন্তা করেন। সাধারণ কারণ upstream: একটি ক্যামেরা সরানো সংশোধন শুরু খুব দেরী এড়ান ডেটা, হ্যান্ডওভার ফ্রেম প্রশিক্ষণ সেট বা কাজ নির্ধারিত পর্যবেক্ষণ নীতি আসলে পায়।

কোনো এই একটি সমাধান সমস্যা এবং এক ক্লিক কোনো এটি। ইন্টারেক্টিভ অনুকরণ শিক্ষা সক্রিয় গবেষণা এলাকায় ঠিক এর প্রশ্নগুলি - যখন হস্তক্ষেপ কীভাবে ওজন মানব কত পুরানো ডেটা রাখতে - নেই নিষ্পত্তি উত্তর; Celemin এট আল মূলক তারা ম্যাপ কি এখনও খোলা। যা লুপ সম্পত্তি যা পরিমাপ করার সংকুচিত সাবধানে হার্ডওয়্যার যে খরচ কয়েক শত ইউরো। সেটআপ ফ্রিজ করুন প্রাথমিক হস্তক্ষেপ ট্রিয়াজ সৎভাবে মিশ্রণ উদ্দেশ্যমূলকভাবে এবং রেকর্ড হস্তক্ষেপ হার প্রতিবার।

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started