পলিসি ট্রেনিং
AY-Robots ম্যানেজড GPU-তে ম্যানিপুলেশন পলিসি ট্রেন করে, তাই আপনি ট্রেনিং হার্ডওয়্যারের মালিক না হয়েও রেকর্ড করা এপিসোড থেকে আপনার আর্মে চলা একটি পলিসিতে পৌঁছাতে পারেন। এই পাতায় সমর্থিত পলিসি টাইপ, ট্রেনিং রান পাতা, চেকপয়েন্টস, এবং আপনার এপিসোড সংখ্যা থেকে বাস্তবসম্মতভাবে কী ফলাফল আশা করা উচিত তা আলোচনা করা হয়েছে।
সর্বশেষ আপডেট 2026-08-09
নিজের GPU ছাড়াই ট্রেনিং
ম্যানিপুলেশন পলিসি ট্রেন করা একটি GPU ওয়ার্কলোড, এবং আধুনিক ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেলগুলোর একটি সাধারণ ওয়ার্কস্টেশনের চেয়ে বেশি VRAM প্রয়োজন। AY-Robots-এ, প্ল্যাটফর্ম দ্বারা পরিচালিত ক্লাউড GPU-তে ট্রেনিং চলে: আপনি একটি ডেটাসেট এবং পলিসি টাইপ বেছে নেন, রান শুরু করেন, এবং ব্রাউজার থেকে এর অগ্রগতি দেখেন। কোনো CUDA সেটআপ নেই, ড্রাইভার মেলানোর প্রয়োজন নেই, এবং রক্ষণাবেক্ষণের জন্য কোনো এনভায়রনমেন্ট নেই।
ইনপুট সবসময় Dashboard > Datasets থেকে একটি ক্লাউড ডেটাসেট। টেলিঅপারেশন সেশনের মাধ্যমে আপনি যা কিছু রেকর্ড করেছেন বা LeRobot ফরম্যাটে আপলোড করেছেন, মার্জ করা ডেটাসেটসহ, সবই যোগ্য। ট্রেন করার আগে কিউরেট করুন: Failure লেবেলযুক্ত এপিসোডগুলো সাধারণত ট্রেনিং সেটের বাইরে রাখা উচিত, এবং এপিসোড ব্রাউজারে দশ মিনিটের রিভিউ খারাপ ডেমোনস্ট্রেশন থেকে শেখার জন্য ব্যয় হওয়া GPU সময়ের ঘণ্টাগুলো বাঁচায়।
সমর্থিত পলিসিস
চারটি পলিসি পরিবার সমর্থিত। তারা আকার, ট্রেনিং খরচ, এবং আপনার ডেটা থেকে কতটা শোষণ করতে পারে তাতে ভিন্ন, তাই সঠিক পছন্দ কোনো সাধারণ র্যাঙ্কিংয়ের চেয়ে আপনার টাস্ক এবং ডেটাসেটের উপর বেশি নির্ভর করে।
| পলিসি | ধরন | বৈশিষ্ট্য |
|---|---|---|
| ACT | ট্রান্সফরমার, অ্যাকশন চাংকিং | একক ধাপের বদলে ভবিষ্যতের অ্যাকশনের ছোট চাংক পূর্বাভাস দেয়। কমপ্যাক্ট, তুলনামূলকভাবে দ্রুত ট্রেন হয়, এবং একটি নির্দিষ্ট ভালো-সংজ্ঞায়িত টাস্কের জন্য একটি শক্তিশালী প্রথম পছন্দ। |
| Diffusion Policy | অ্যাকশন সিকোয়েন্সের উপর ডিফিউশন | ডেমোনস্ট্রেট করা অ্যাকশনের পুরো ডিস্ট্রিবিউশন মডেল করে, যা সাহায্য করে যখন আপনার ডেমোনস্ট্রেশনগুলো টাস্কটি একাধিক বৈধ উপায়ে সমাধান করে। ACT-এর চেয়ে ট্রেন করতে ভারী এবং ইনফারেন্সে ধীর। |
| SmolVLA | ছোট ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন মডেল | ল্যাঙ্গুয়েজ-কন্ডিশনড: আপনার এপিসোডের টাস্ক স্ট্রিং ইনপুটের অংশ হয়ে যায়। একটি বড় ফাউন্ডেশন মডেল ছাড়া ল্যাঙ্গুয়েজ কন্ডিশনিং চাইলে একটি ভালো মধ্যম পথ। |
| GR00T ফাইন-টিউন | ফাউন্ডেশন মডেল ফাইন-টিউন | আপনার এপিসোডের উপর একটি বড় প্রি-ট্রেইনড রোবোটিক্স ফাউন্ডেশন মডেল ফাইন-টিউন করে। চারটির মধ্যে সর্বোচ্চ সিলিং, সর্বোচ্চ ট্রেনিং খরচে, এবং কঠোর ডেটাসেট ফরম্যাট প্রয়োজনীয়তা সহ। |
GR00T ফাইন-টিউনিং শুধুমাত্র LeRobot ফরম্যাট ভার্সন 2.1-এর ডেটাসেট গ্রহণ করে। একটি v3.0 ডেটাসেট সাবমিশনের সময় নয়, ডেটা লোডিংয়ের সময় ব্যর্থ হবে, তাই রান শুরু করার আগে ফরম্যাট ভার্সন চেক করুন। প্ল্যাটফর্মে রেকর্ড করা ডেটাসেট যেমন আছে তেমন ব্যবহার করা যায়; বাইরের আপলোডের জন্য, প্রথমে meta/info.json-এ ভার্সন যাচাই করুন।
একটি রান শুরু করা
- 1ডেটাসেট বেছে নিন
Dashboard > Training খুলুন এবং যে ডেটাসেটে ট্রেন করতে চান তা নির্বাচন করুন। এপিসোড কাউন্ট এবং রোবট টাইপ দেখানো হয় যাতে আপনি নিশ্চিত হতে পারেন যে সঠিকটি বেছে নিয়েছেন।
- 2পলিসি বেছে নিন
সমর্থিত পলিসি টাইপগুলোর একটি নির্বাচন করুন। নিশ্চিত না হলে, ACT দিয়ে শুরু করুন: আপনার ডেটাসেট কিছু ট্রেন করার জন্য যথেষ্ট ভালো কিনা তা জানার এটাই সবচেয়ে সস্তা উপায়।
- 3লঞ্চ করুন
রান শুরু করুন। এটি একটি জব আইডি এবং নিজস্ব রান পাতা পায়, এবং আপনি ব্রাউজার বন্ধ করতে পারেন: ট্রেনিং সার্ভার-সাইডে চলতে থাকে এবং আপনি ফিরে এলে পাতাটি লাইভ অবস্থা দেখায়।
ট্রেনিং রান পাতা
প্রতিটি রানের একটি নিবেদিত পাতা আছে যা ট্রেনিংয়ের সময় আপনার আসলেই থাকা দুটো প্রশ্নের উত্তর দেয়: এটা কি শিখছে, এবং মেশিন কি সুস্থ। শেখার অগ্রগতি loss-এর চার্ট, লার্নিং রেট শিডিউল, এবং গ্রেডিয়েন্ট নর্ম হিসেবে দেখানো হয়। একটি loss যা তৎক্ষণাৎ প্লাটিয়ু করে বা একটি গ্রেডিয়েন্ট নর্ম যা বিস্ফোরিত হয় তা আপনাকে আগেই বলে দেয় যে রানের জন্য অপেক্ষা করা মূল্যবান নয়।
মেশিনের স্বাস্থ্য পাশাপাশি দেখানো হয়: GPU ব্যবহার এবং মেমরি, সঙ্গে ট্রেনিং মেশিনের হোস্ট মেট্রিক্স। একটি ফেজ টাইমলাইন দেখায় রানটি বর্তমানে কোথায় আছে, এনভায়রনমেন্ট প্রস্তুতি থেকে শুরু করে ডেটা লোডিং, ট্রেনিং লুপ নিজে, এবং চেকপয়েন্ট আপলোড পর্যন্ত। কিছু ভুল মনে হলে, বিল্ট-ইন লগ ভিউয়ার আপনাকে কোনো SSH অ্যাক্সেস ছাড়াই কাঁচা ট্রেনিং লগ দেয়, যা সাধারণত বুঝতে যথেষ্ট যে ব্যর্থতা আপনার ডেটাসেটের নাকি রান নিজেই।
চেকপয়েন্টস এবং পুনরায় শুরু করা
চেকপয়েন্টগুলো প্রতি রান অনুযায়ী সংরক্ষিত হয়, কোনো শেয়ার্ড পুলে নয়, তাই একটি রান পাতায় তালিকাভুক্ত চেকপয়েন্টগুলো সবসময় সেই একটিমাত্র রান এবং তার কনফিগারেশনের অন্তর্গত। এটি যতটা মনে হয় তার চেয়ে বেশি গুরুত্বপূর্ণ: ভিন্ন সেটিং সহ রানের মধ্যে চেকপয়েন্ট মেশানো নীরবে ভাঙা পলিসির একটি ক্লাসিক উৎস।
একটি রান বাধাগ্রস্ত হলে, আপনি নতুন করে শুরু করার বদলে তার সর্বশেষ চেকপয়েন্ট থেকে পুনরায় শুরু করতে পারেন। ইন্টারমিডিয়েট চেকপয়েন্টগুলোও নিজে থেকে কার্যকর: যখন একটি দীর্ঘ রান শেষের দিকে ওভারফিট হতে শুরু করে, একটি আগের চেকপয়েন্ট প্রায়ই চূড়ান্তটির চেয়ে প্রকৃত আর্মে ভালো চলে।
আপনার আর্মে ট্রেন করা পলিসি চালানো
একটি সম্পন্ন পলিসি সরাসরি আপনার রোবটে ডিপ্লয় করা যায়। ককপিটে, আপনার কানেক্ট করা আর্মের জন্য ট্রেন করা পলিসি নির্বাচন করুন এবং ইনফারেন্স শুরু করুন: এখন পলিসি সেই জয়েন্ট কমান্ডগুলো তৈরি করে যা আগে আপনি টেলিঅপারেশনের মাধ্যমে তৈরি করতেন। আর্মটি অবশ্যই সেই রোবট টাইপের হতে হবে যাতে ডেটাসেট রেকর্ড করা হয়েছিল, এবং দৃশ্যটি ট্রেনিং দৃশ্যগুলোর অনুরূপ হওয়া উচিত, ক্যামেরার অবস্থান সহ।
প্রথম ইনফারেন্স রানগুলোকে ডেমোর মতো নয়, পরীক্ষার মতো বিবেচনা করুন। ইমার্জেন্সি স্টপ নাগালে রাখুন, আপনি যা ডেমোনস্ট্রেট করেছেন তার কাছাকাছি একটি শুরুর অবস্থা থেকে শুরু করুন, এবং আশা করুন পলিসি এমন জিনিসের প্রতি সংবেদনশীল হবে যা আপনি লক্ষ্যই করবেন না: একটি সরানো ক্যামেরা, ভিন্ন আলো, বা এমন একটি বস্তু যা ডেটাসেটে কখনো ছিল না।
আপনার কত এপিসোড দরকার
প্ল্যাটফর্মে সবচেয়ে সাধারণ ট্রেনিং ভুল কোনো ভুল হাইপারপ্যারামিটার নয়, এটি খুব কম ডেটায় ট্রেন করে এই সিদ্ধান্তে পৌঁছানো যে পলিসি টাইপটি কাজ করে না। একটি একক টেবিলটপ টাস্কের জন্য একটি সাধারণ নিয়ম হিসেবে: প্রায় 50টি এপিসোড আপনাকে এমন একটি পলিসি দেয় যার সংকীর্ণ জেনারালাইজেশন আছে যা আপনার ডেমোনস্ট্রেট করা অবস্থাগুলোর কাছাকাছি শুরুর অবস্থা থেকে সফল হয়। 100 থেকে 200টি এপিসোড সেই একটি টাস্কের জন্য পুরো ওয়ার্কস্পেসে ব্যবহারযোগ্য দৃঢ়তা দেয়, যদি আপনি এপিসোডগুলোর মধ্যে বস্তুর অবস্থান পরিবর্তন করে থাকেন।
আরও সক্ষম পলিসি টাইপগুলো এটি বাতিল করে না। 20টি এপিসোডে GR00T ফাইন-টিউন এখনও দুর্বলভাবে জেনারালাইজ করবে; বড় মডেলগুলো যা কিনে দেয় তা হলো ডেটা থাকলে একটি ভালো সিলিং। আপনার বাজেট সীমিত হলে, বড় মডেলে খরচ করার আগে আরও বৈচিত্র্যময় এপিসোডে খরচ করুন।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
একটি ট্রেনিং রান কতক্ষণ লাগে?▾
এটি পলিসি টাইপ এবং ডেটাসেট আকারের উপর নির্ভর করে, তাই কোনো একক সৎ সংখ্যা নেই। ACT সাধারণত চারটির মধ্যে সবচেয়ে দ্রুত, GR00T ফাইন-টিউন সবচেয়ে ধীর। রান পাতায় ফেজ টাইমলাইন এবং loss চার্ট আগেই দেখায় একটি রান অগ্রসর হচ্ছে কিনা।
আমি কি মার্জ করা ডেটাসেটে ট্রেন করতে পারি?▾
হ্যাঁ। মার্জ করা ডেটাসেট সাধারণ ডেটাসেট; মার্জ ভ্যালিডেশন ইতিমধ্যে সামঞ্জস্যপূর্ণ fps, ফিচার, এবং রোবট টাইপ নিশ্চিত করেছে। একই টাস্কের রেকর্ডিং মার্জ করা 100 থেকে 200 এপিসোডের রেঞ্জে পৌঁছানোর সবচেয়ে কার্যকর উপায়গুলোর একটি।
আমার GR00T রান ডেটা লোডিংয়ের সময় ব্যর্থ হয়। প্রথমে কী চেক করা উচিত?▾
ডেটাসেট ফরম্যাট ভার্সন। GR00T ফাইন-টিউনিংয়ের জন্য LeRobot v2.1 প্রয়োজন, এবং একটি v3.0 ডেটাসেট ঠিক সেখানেই ব্যর্থ হয়। আপনার ডেটাসেটের meta/info.json-এ ভার্সন চেক করুন।
ট্রেনিংয়ের আগে কি আমার ব্যর্থ এপিসোডগুলো সরিয়ে ফেলা উচিত?▾
সাধারণত হ্যাঁ। Failure লেবেলযুক্ত এপিসোড পলিসিকে ব্যর্থ আচরণ শেখায়। Recovery এপিসোড ভিন্ন: এগুলো দেখায় কীভাবে একটি ভুল সংশোধন করতে হয় এবং প্রায়ই রাখার যোগ্য।
ট্রেনিংয়ের সময় কি আমাকে ব্রাউজার খোলা রাখতে হবে?▾
না। রান সার্ভার-সাইডে চলে। আপনি ফিরে এলে রান পাতা বর্তমান অবস্থা, চার্ট, এবং লগ দেখায়, এবং কেউ দেখুক বা না দেখুক, চেকপয়েন্টগুলো সংরক্ষিত হয়।
AY-Robots কীভাবে টেলিঅপারেশন রেকর্ডিং LeRobot ফরম্যাটে সংরক্ষণ করে: এপিসোড স্ট্রাকচার, ড্যাশবোর্ড এপিসোড ব্রাউজার, আপলোড মার্জ করা, এবং মার্কেটপ্লেস।
AY-Robots-এ সমর্থিত প্রতিটি রোবট আর্ম তার স্পেসিফিকেশনসহ: SO-100, Koch v1.1, Franka FR3, FP3 এবং Panda, WidowX-250, এবং ALOHA ViperX-300।