පොලිසි පුහුණුව
AY-Robots කළමනාකරණය කරන GPU මත මෙහෙයුම් පොලිසි පුහුණු කරයි, එබැවින් ඔබට පුහුණු දෘඩාංගයක් නොමැතිව පටිගත කළ එපිසෝඩ්වල සිට ඔබේ අත මත ධාවනය වන පොලිසියක් දක්වා යා හැක. මෙම පිටුව සහාය දක්වන පොලිසි වර්ග, පුහුණු run පිටුව, checkpoints, ඔබේ එපිසෝඩ් ගණනින් යථාර්ථවාදීව අපේක්ෂා කළ යුතු ප්රතිඵල ආවරණය කරයි.
අවසන් යාවත්කාලීන 2026-08-09
ඔබේම GPU එකක් නොමැතිව පුහුණුව
මෙහෙයුම් පොලිසියක් පුහුණු කිරීම GPU workload එකකි, නවීන vision-language-action models සඳහා සාමාන්ය workstation එකකට ඇති VRAM ප්රමාණයට වඩා අවශ්ය වේ. AY-Robots හි, පුහුණුව වේදිකාව කළමනාකරණය කරන ක්ලවුඩ් GPU මත ධාවනය වේ: ඔබ ඩේටාසෙට් එකක් හා පොලිසි වර්ගයක් තෝරා, run එක ආරම්භ කර, එහි ප්රගතිය බ්රවුසරයෙන් නරඹයි. CUDA සැකසුමක් නැත, driver ගැලපීමක් නැත, නඩත්තු කළ යුතු environment එකක් නැත.
input එක සැමවිටම Dashboard > Datasets වෙතින් ලැබෙන ක්ලවුඩ් ඩේටාසෙට් එකකි. දුරස්ථ මෙහෙයුම් සැසි හරහා පටිගත කළ හෝ LeRobot ආකෘතියෙන් උඩුගත කළ ඕනෑම දෙයක්, ඒකාබද්ධ ඩේටාසෙට් ඇතුළුව, සුදුසුකම් ලබයි. පුහුණු කිරීමට පෙර සකසන්න: Failure ලේබල් කළ එපිසෝඩ් සාමාන්යයෙන් පුහුණු කට්ටලයෙන් ඉවත් විය යුතුය, එපිසෝඩ් බ්රවුසරයේ මිනිත්තු දහයක සමාලෝචනයකින් නරක ප්රදර්ශනවලින් ඉගෙනීමට වැය වන පැය ගණනක GPU කාලය ඉතිරි වේ.
සහාය දක්වන පොලිසි
පොලිසි පවුල් හතරකට සහාය දක්වයි. ඒවා ප්රමාණය, පුහුණු පිරිවැය, ඔබේ දත්තවලින් කොපමණ ග්රහණය කරගත හැකිද යන්නෙන් වෙනස් වන අතර, එබැවින් නිවැරදි තේරීම කිසිදු සාමාන්ය ශ්රේණිගත කිරීමකට වඩා ඔබේ කාර්යය හා ඩේටාසෙට් එක මත රඳා පවතී.
| පොලිසිය | වර්ගය | ලක්ෂණ |
|---|---|---|
| ACT | Transformer, action chunking | තනි පියවර වෙනුවට අනාගත ක්රියාවල කෙටි chunks අනාවැකි කියයි. සංයුක්තයි, සාපේක්ෂව ඉක්මනින් පුහුණු වන අතර, පැහැදිලිව අර්ථ දක්වා ඇති තනි කාර්යයක් සඳහා හොඳ පළමු තේරීමකි. |
| Diffusion Policy | action sequences මත diffusion | ප්රදර්ශනය කළ ක්රියාවල සම්පූර්ණ ව්යාප්තිය model කරයි, එය ඔබේ ප්රදර්ශන කාර්යය වලංගු ආකාරවලින් එකකට වඩා විසඳන විට උපකාරී වේ. ACT ට වඩා පුහුණු වීමට බර හා inference එකේදී වඩා මන්දගාමී. |
| SmolVLA | කුඩා vision-language-action model එකක් | භාෂාව මත සකසන ලද: ඔබේ එපිසෝඩ්වල කාර්ය string එක input එකේ කොටසක් වේ. විශාල foundation model එකකින් තොරව භාෂා සකසුම අවශ්ය අයට හොඳ මධ්ය මාවතකි. |
| GR00T fine-tune | Foundation model fine-tune | ඔබේ එපිසෝඩ් මත විශාල, පෙර-පුහුණු කළ රොබෝ තාක්ෂණික foundation model එකක් fine-tune කරයි. හතරෙන් ඉහළම සීමාව, ඉහළම පුහුණු පිරිවැයෙන්, දැඩි ඩේටාසෙට් ආකෘති අවශ්යතාවයක් සමඟ. |
GR00T fine-tuning LeRobot ආකෘති සංස්කරණය 2.1 හි ඩේටාසෙට් පමණක් පිළිගනී. v3.0 ඩේටාසෙට් එකක් submission එකේදී නොව දත්ත load කිරීමේදී අසාර්ථක වේ, එබැවින් run එක ආරම්භ කිරීමට පෙර ආකෘති සංස්කරණය පරීක්ෂා කරන්න. වේදිකාවේ පටිගත කළ ඩේටාසෙට් ඇති ආකාරයෙන්ම භාවිත කළ හැක; බාහිර උඩුගත කිරීම් සඳහා, මුලින්ම meta/info.json හි සංස්කරණය තහවුරු කරන්න.
run එකක් ආරම්භ කිරීම
- 1ඩේටාසෙට් එක තෝරන්න
Dashboard > Training විවෘත කර පුහුණු වීමට ඩේටාසෙට් එක තෝරන්න. ඔබ නිවැරදි එක තෝරාගත් බව තහවුරු කිරීමට එපිසෝඩ් ගණන හා රොබෝ වර්ගය පෙන්වයි.
- 2පොලිසිය තෝරන්න
සහාය දක්වන පොලිසි වර්ග වලින් එකක් තෝරන්න. ඔබට විශ්වාස නැත්නම්, ACT සමඟ ආරම්භ කරන්න: ඔබේ ඩේටාසෙට් එක කිසිවක් පුහුණු කිරීමට ප්රමාණවත්ද යන්න සොයාගැනීමට ලාභදායීම ක්රමය එයයි.
- 3ආරම්භ කරන්න
run එක ආරම්භ කරන්න. එයට job id එකක් සහ තමන්ගේම run පිටුවක් ලැබෙන අතර, ඔබට බ්රවුසරය වසා දැමිය හැක: පුහුණුව server-side එකේ දිගටම කරගෙන යන අතර, ඔබ ආපසු පැමිණෙන විට පිටුව සජීවී තත්ත්වය පෙන්වයි.
පුහුණු run පිටුව
සෑම run එකකටම, පුහුණුව අතරතුර ඔබට සැබවින්ම ඇති ප්රශ්න දෙකට පිළිතුරු දෙන කැපවූ පිටුවක් ඇත: එය ඉගෙන ගනීද, යන්ත්රය සෞඛ්ය සම්පන්නද. ඉගෙනුම් ප්රගතිය loss, learning rate schedule, gradient norm හි ප්රස්ථාර ලෙස පෙන්වයි. වහාම plateau වන loss එකක් හෝ පුපුරන gradient norm එකක් run එක ලැබෙන තෙක් රැඳී සිටීමට වටින්නේ නැති බව ඉක්මනින් කියයි.
යන්ත්ර සෞඛ්යය ඊට යාබදව පෙන්වයි: GPU භාවිතය හා මතකය, පුහුණු යන්ත්රයේ host metrics ද සමඟ. phase timeline එකක් run එක දැනට කොහේද යන්න පෙන්වයි, environment සකස් කිරීමේ සිට දත්ත load කිරීම, පුහුණු loop එකම, checkpoint upload දක්වා. යමක් වැරදී පෙනෙන විට, ගොඩනගා ඇති log viewer එක SSH access එකකින් තොරව raw පුහුණු logs ලබා දෙයි, එය සාමාන්යයෙන් අසාර්ථකත්වය ඔබේ ඩේටාසෙට් එකෙන්ද run එකෙන්ම දැයි බැලීමට ප්රමාණවත් වේ.
Checkpoints සහ නැවත ආරම්භ කිරීම
Checkpoints, බෙදාගත් pool එකක නොව, run එකක් සඳහාම ගබඩා කෙරේ, එබැවින් run පිටුවක ලැයිස්තුගත checkpoints සැමවිටම එම run එකට හා එහි configuration එකට අයත් වේ. මෙය ශබ්දයට වඩා වැදගත් වේ: වෙනස් සැකසුම් සහිත runs අතර checkpoints මිශ්ර කිරීම නිහඬව බිඳුණු පොලිසිවල සම්භාව්ය මූලාශ්රයකි.
run එකක් බාධා වුවහොත්, ඔබට යළි ආරම්භ කිරීම වෙනුවට එහි නවතම checkpoint එකෙන් නැවත ආරම්භ කළ හැක. අතරමැදි checkpoints ඒවා තනිවම ද ප්රයෝජනවත් වේ: දිගු run එකක් අවසානය ළඟදී overfit වීමට පටන් ගන්නා විට, අවසාන checkpoint එකට වඩා පෙර checkpoint එකක් සැබෑ අත මත බොහෝ විට වඩා හොඳින් ධාවනය වේ.
පුහුණු කළ පොලිසිය ඔබේ අත මත ධාවනය කිරීම
සම්පූර්ණ කළ පොලිසියක් කෙලින්ම ඔබේ රොබෝවට නැවත deploy කළ හැක. කොක්පිට් එකේ, ඔබේ සම්බන්ධිත අත සඳහා පුහුණු කළ පොලිසිය තෝරා inference ආරම්භ කරන්න: දැන් පොලිසිය, ඔබ පෙර දුරස්ථ මෙහෙයුමෙන් නිපදවූ සන්ධි commands නිපදවයි. අත ඩේටාසෙට් එක පටිගත කළ එකම රොබෝ වර්ගය විය යුතු අතර, දර්ශනය කැමරා තැබීම ඇතුළුව පුහුණු දර්ශනවලට සමාන විය යුතුය.
මුල් inference runs ආදර්ශන ලෙස නොව, පරීක්ෂණ ලෙස සලකන්න. හදිසි නැවැත්වීම ළඟින් තබා ගන්න, ඔබ ප්රදර්ශනය කළ ස්ථානයට සමීප ආරම්භක තත්ත්වයකින් ආරම්භ කරන්න, ඔබ නොදැනෙන දේවලට පොලිසිය සංවේදී වේ යැයි අපේක්ෂා කරන්න: චලනය කළ කැමරාවක්, වෙනස් ආලෝකයක්, හෝ ඩේටාසෙට් එකෙහි කිසිදා නොතිබූ වස්තුවක්.
ඔබට කී එපිසෝඩ් අවශ්යද
වේදිකාවේ වඩාත් සුලභ පුහුණු වැරැද්ද වැරදි hyperparameter එකක් නොව, ඉතා අඩු දත්තවලින් පුහුණු කර පොලිසි වර්ගය ක්රියා නොකරන බව නිගමනය කිරීමයි. එක් මේස කාර්යයක් සඳහා සාමාන්ය නීතියක් ලෙස: එපිසෝඩ් 50ක් පමණින් ඔබට ප්රදර්ශනය කළ ඒවාට සමීප ආරම්භක තත්ත්වවලින් සාර්ථක වන පටු සාමාන්යකරණයක් සහිත පොලිසියක් ලැබේ. එපිසෝඩ් 100 සිට 200 පමණින්, එපිසෝඩ් අතර වස්තු තැබීම වෙනස් කර ඇත්නම්, එම එක් කාර්යය සඳහා වැඩ ප්රදේශය පුරාවට භාවිතයට ගැලපෙන ස්ථාවරත්වයක් ලැබේ.
වඩාත් හැකියාවෙන් යුත් පොලිසි වර්ග මෙය අහෝසි නොකරයි. එපිසෝඩ් 20ක් මත GR00T fine-tune එකක් තවමත් දුර්වලව සාමාන්යකරණය වේ; දත්ත තිබෙන විට ලොකු models ලබා දෙන්නේ වඩා හොඳ සීමාවකි. ඔබේ අයවැය සීමිත නම්, ලොකු model එකකට වඩා විවිධ එපිසෝඩ් වැඩි ප්රමාණයකට වියදම් කරන්න.
නිතර අසන පැන
පුහුණු run එකකට කොපමණ කාලයක් ගතවේද?▾
එය පොලිසි වර්ගය හා ඩේටාසෙට් ප්රමාණය මත රඳා පවතින බැවින්, එකම අවංක අංකයක් නැත. ACT සාමාන්යයෙන් හතරෙන් වේගවත්ම එකයි, GR00T fine-tune වඩාත් මන්දගාමීයි. run පිටුවේ phase timeline එක හා loss ප්රස්ථාර run එකක් ප්රගතියක් ලබන්නේද යන්න මුල් අවධියේම පෙන්වයි.
මට ඒකාබද්ධ කළ ඩේටාසෙට් එකක් මත පුහුණු කළ හැකිද?▾
ඔව්. ඒකාබද්ධ ඩේටාසෙට් සාමාන්ය ඩේටාසෙට් ම වේ; ඒකාබද්ධ කිරීමේ validation එක fps, features, රොබෝ වර්ගය ස්ථාවර බව දැනටමත් සහතික කර ඇත. එකම කාර්යයක පටිගත කිරීම් ඒකාබද්ධ කිරීම එපිසෝඩ් 100 සිට 200 පරාසයට ළඟාවීමට වඩාත් ඵලදායී ක්රමයකි.
මගේ GR00T run එක දත්ත load කිරීමේදී අසාර්ථක වේ. මුලින්ම මම කුමක් පරීක්ෂා කළ යුතුද?▾
ඩේටාසෙට් ආකෘති සංස්කරණය. GR00T fine-tuning ට LeRobot v2.1 අවශ්ය වන අතර, v3.0 ඩේටාසෙට් එකක් හරියටම එහිදී අසාර්ථක වේ. ඔබේ ඩේටාසෙට් එකේ meta/info.json හි සංස්කරණය පරීක්ෂා කරන්න.
පුහුණුවීමට පෙර මම අසාර්ථක එපිසෝඩ් ඉවත් කළ යුතුද?▾
සාමාන්යයෙන් ඔව්. Failure ලේබල් කළ එපිසෝඩ් පොලිසියට අසාර්ථක හැසිරීම ඉගැන්වයි. Recovery එපිසෝඩ් වෙනස්ය: ඒවා වැරැද්දක් නිවැරදි කරන ආකාරය පෙන්වන අතර, බොහෝ විට තබා ගැනීමට වටී.
පුහුණුව අතරතුර මම බ්රවුසරය විවෘතව තබා ගත යුතුද?▾
නැත. runs server-side එකේ ක්රියාත්මක වේ. ඔබ ආපසු පැමිණෙන ඕනෑම විටක run පිටුව වර්තමාන තත්ත්වය, ප්රස්ථාර, logs පෙන්වන අතර, කවුරුන් හෝ නරඹනවාද යන්න නොසලකා checkpoints save වේ.
AY-Robots දුරස්ථ මෙහෙයුම් පටිගත කිරීම් LeRobot ආකෘතියෙන් ගබඩා කරන ආකාරය: එපිසෝඩ් ව්යුහය, ඩෑෂ්බෝඩ් එපිසෝඩ් බ්රවුසරය, උඩුගත කිරීම් ඒකාබද්ධ කිරීම, වෙළඳපොළ.
AY-Robots හි සහාය දක්වන සෑම රොබෝ අතක්ම එහි විශේෂාංග සමඟ: SO-100, Koch v1.1, Franka FR3, FP3 සහ Panda, WidowX-250, ALOHA ViperX-300.