Тренирање на policy
AY-Robots тренира policy за манипулација на управувани GPU, па можете да поминете од снимени епизоди до policy која работи на вашата рака без да поседувате хардвер за тренирање. Оваа страница ги опфаќа поддржаните типови policy, страницата за тренинг сесија, checkpoint-ите и какви резултати реално да очекувате од бројот епизоди што ги имате.
Последно ажурирано 2026-08-09
Тренирање без сопствен GPU
Тренирањето policy за манипулација е GPU оптоварување, а современите vision-language-action модели бараат повеќе VRAM отколку што има типична работна станица. На AY-Robots тренирањето се извршува на облак GPU управувани од платформата: изберете dataset и тип policy, стартувајте ја сесијата и следете го напредокот од прелистувачот. Нема поставување CUDA, нема усогласување драјвери и нема опкружување за одржување.
Влезот е секогаш dataset во облак од Dashboard > Datasets. Сѐ што сте снимиле преку сесии за телеоперација или прикачиле во LeRobot формат е соодветно, вклучувајќи споени dataset-и. Уредете пред да тренирате: епизодите означени Failure обично не му припаѓаат на збирот за тренирање, а десет минути преглед во прегледувачот на епизоди заштедуваат часови GPU време потрошени на учење од лоши демонстрации.
Поддржани policy
Поддржани се четири семејства policy. Тие се разликуваат по големина, трошок на тренирање и колку можат да апсорбираат од вашите податоци, па правилниот избор зависи повеќе од вашата задача и dataset отколку од каква било општа рангирачка листа.
| Policy | Вид | Карактеристики |
|---|---|---|
| ACT | Transformer, групирање на акции | Предвидува кратки групи идни акции наместо поединечни чекори. Компактна, тренира споредливо брзо и е солиден прв избор за една добро дефинирана задача. |
| Diffusion Policy | Дифузија врз секвенци акции | Го моделира целосниот распоред на демонстрираните акции, што помага кога вашите демонстрации ја решаваат задачата на повеќе од еден валиден начин. Потешка за тренирање и побавна во inference од ACT. |
| SmolVLA | Мал vision-language-action модел | Language-conditioned: текстот на задачата од вашите епизоди станува дел од влезот. Добра средна опција кога сакате условување со јазик без голем foundation модел. |
| GR00T fine-tune | Fine-tune на foundation модел | Fine-tune-ира голем претходно тренирани foundation модел за роботика врз вашите епизоди. Највисок таван од четирите, по највисока цена на тренирање и со строго барање за форматот на dataset. |
Fine-tune-ирањето на GR00T прифаќа само dataset-и во LeRobot формат верзија 2.1. Dataset во v3.0 ќе падне при вчитување податоци, не при поднесување, па проверете ја верзијата на форматот пред да ја стартувате сесијата. Dataset-ите снимени на платформата можат да се користат такви какви се; за надворешни прикачувања, прво проверете ја верзијата во meta/info.json.
Стартување сесија
- 1Изберете dataset
Отворете Dashboard > Training и изберете го dataset-от врз кој ќе тренирате. Бројот на епизоди и типот робот се прикажани за да потврдите дека сте го избрале правилниот.
- 2Изберете policy
Изберете еден од поддржаните типови policy. Ако не сте сигурни, почнете со ACT: тоа е најевтиниот начин да дознаете дали вашиот dataset е доволно добар воопшто за да се тренира нешто.
- 3Стартувајте
Стартувајте ја сесијата. Добива job id и своја страница за сесијата, а можете да го затворите прелистувачот: тренирањето продолжува на серверот, а страницата ја прикажува тековната состојба секогаш кога ќе се вратите.
Страницата на тренинг сесијата
Секоја сесија има посветена страница која одговара на двете прашања што навистина ги имате за време на тренирањето: дали учи и дали машината е здрава. Напредокот во учењето е прикажан како графикони на loss, распоредот на learning rate и нормата на градиентот. Loss кој веднаш стагнира или норма на градиент која експлодира ви кажува рано дека сесијата не вреди да се чека.
Здравјето на машината е прикажано покрај тоа: искористеност и меморија на GPU, плус метриките на хостот на машината за тренирање. Временска линија на фази покажува каде тековно се наоѓа сесијата, од подготовка на опкружувањето преку вчитување податоци, самиот циклус на тренирање, до прикачување checkpoint-и. Кога нешто изгледа чудно, вградениот прегледувач на записи ви ги дава суровите записи од тренирањето без каков било SSH пристап, што обично е доволно за да видите дали пропустот е во вашиот dataset или во самата сесија.
Checkpoint-и и продолжување
Checkpoint-ите се чуваат по сесија, не во заеднички пул, па checkpoint-ите наведени на страница за сесија секогаш припаѓаат точно на таа сесија и нејзината конфигурација. Ова значи повеќе отколку што звучи: мешањето checkpoint-и меѓу сесии со различни поставки е класичен извор на тивко расипани policy.
Ако сесијата се прекине, можете да продолжите од нејзиниот последен checkpoint наместо да почнете од почеток. Средните checkpoint-и се исто така корисни сами по себе: кога долга сесија почнува да се преприлагодува (overfitting) кон крајот, порано checkpoint често работи подобро на вистинската рака отколку финалниот.
Извршување на тренираната policy на вашата рака
Завршена policy може директно да се врати назад на вашиот робот. Во кокпитот изберете ја тренираната policy за вашата поврзана рака и стартувајте inference: policy сега ги произведува командите за зглобовите што претходно ги произведувавте преку телеоперација. Раката мора да е истиот тип робот на кој е снимен dataset-от, а сцената треба да наликува на тренинг сцените, вклучувајќи го поставувањето на камерите.
Третирајте ги првите inference сесии како експерименти, не како демонстрации. Држете го итното запирање во дофат, почнете од почетна состојба блиску до онаа што сте ја демонстрирале, и очекувајте policy-та да биде чувствителна на нешта што не би ги забележале: поместена камера, различно осветлување или предмет што dataset-от никогаш не го содржел.
Колку епизоди ви требаат
Најчестата грешка при тренирање на платформата не е погрешен хиперпараметар, туку тренирање врз премалку податоци и заклучок дека типот policy не работи. Како практично правило за една задача на маса: околу 50 епизоди ви даваат policy со тесна генерализација која успева од почетни состојби блиску до оние што сте ги демонстрирале. Околу 100 до 200 епизоди даваат употреблива робусност низ работниот простор за таа една задача, под услов да сте варирале распоред на предмети меѓу епизодите.
Способни типови policy не го отфрлаат ова правило. GR00T fine-tune врз 20 епизоди сепак ќе генерализира слабо; она што поголемите модели ви го даваат е повисок таван штом податоците ги имате. Ако вашиот буџет е ограничен, потрошете го на повеќе разновидни епизоди пред да го потрошите на поголем модел.
Често поставувани прашања
Колку долго трае една тренинг сесија?▾
Зависи од типот policy и големината на dataset-от, па нема искрен единствен број. ACT е обично најбрзиот од четирите, GR00T fine-tune-овите се најбавни. Временската линија на фази и графиконите на loss на страницата за сесија рано покажуваат дали сесијата напредува.
Можам ли да тренирам врз споен dataset?▾
Да. Споените dataset-и се обични dataset-и; валидацијата при спојувањето веќе гарантирала конзистентни fps, карактеристики и тип робот. Спојувањето снимки од истата задача е еден од најефикасните начини да се достигне опсегот од 100 до 200 епизоди.
Мојата GR00T сесија паѓа при вчитување податоци. Што прво да проверам?▾
Верзијата на форматот на dataset. Fine-tune-ирањето на GR00T бара LeRobot v2.1, а dataset во v3.0 паѓа токму таму. Проверете ја верзијата во meta/info.json на вашиот dataset.
Дали треба да отстранам неуспешни епизоди пред тренирање?▾
Обично да. Епизодите означени Failure ја учат policy-та на однесувањето кое пропаѓа. Епизодите Recovery се различни: тие покажуваат како да се исправи грешка и често вреди да се задржат.
Дали треба да го држам прелистувачот отворен за време на тренирањето?▾
Не. Сесиите се извршуваат на серверот. Страницата за сесија ги прикажува тековната состојба, графиконите и записите секогаш кога ќе се вратите, а checkpoint-ите се зачувуваат без разлика дали некој гледа.
Како AY-Robots ги чува снимките во LeRobot формат: структура на епизода, прегледувачот на епизоди, спојување на прикачувања и пазарот за dataset-и.
Секоја рака на робот поддржана на AY-Robots со нејзините спецификации: SO-100, Koch v1.1, Franka FR3, FP3 и Panda, WidowX-250 и ALOHA ViperX-300.