Обучение policy
AY-Robots обучает policy манипуляции на управляемых GPU, поэтому вы можете пройти путь от записанных эпизодов до policy, работающей на вашей руке, не владея железом для обучения. Эта страница описывает поддерживаемые типы policy, страницу запуска обучения, чекпоинты и то, каких результатов реалистично ожидать при вашем количестве эпизодов.
Обновлено 2026-08-09
Обучение без собственного GPU
Обучение policy манипуляции представляет собой нагрузку на GPU, а современным vision-language-action моделям нужно больше VRAM, чем есть в типичной рабочей станции. На AY-Robots обучение идёт на облачных GPU, которыми управляет платформа: вы выбираете датасет и тип policy, запускаете обучение и наблюдаете за прогрессом из браузера. Не нужно настраивать CUDA, подбирать драйверы и поддерживать окружение.
Входными данными всегда служит облачный датасет из Dashboard > Datasets. Подходит всё, что вы записали через сессии телеоперации или загрузили в формате LeRobot, включая объединённые датасеты. Курируйте перед обучением: эпизоды с меткой Failure обычно должны оставаться вне обучающей выборки, а десять минут просмотра в браузере эпизодов экономят часы времени GPU, потраченного на обучение по плохим демонстрациям.
Поддерживаемые policy
Поддерживается четыре семейства policy. Они различаются по размеру, стоимости обучения и тому, сколько способны впитать из ваших данных, поэтому правильный выбор зависит скорее от вашей задачи и датасета, чем от какого-либо общего рейтинга.
| Policy | Тип | Особенности |
|---|---|---|
| ACT | Трансформер, чанкинг действий | Предсказывает короткие блоки будущих действий вместо отдельных шагов. Компактная, обучается сравнительно быстро и служит надёжным первым выбором для одной чётко определённой задачи. |
| Diffusion Policy | Диффузия по последовательностям действий | Моделирует полное распределение продемонстрированных действий, что помогает, когда ваши демонстрации решают задачу более чем одним допустимым способом. Тяжелее в обучении и медленнее на инференсе, чем ACT. |
| SmolVLA | Небольшая vision-language-action модель | Обусловлена языком: строка задачи из ваших эпизодов становится частью входных данных. Хороший компромисс, когда нужна языковая обусловленность без крупной базовой модели. |
| Дообучение GR00T | Дообучение базовой модели | Дообучает крупную предобученную базовую модель робототехники на ваших эпизодах. Самый высокий потолок из четырёх, при самой высокой стоимости обучения и со строгим требованием к формату датасета. |
Дообучение GR00T принимает только датасеты в формате LeRobot версии 2.1. Датасет v3.0 упадёт на этапе загрузки данных, а не при отправке, поэтому проверьте версию формата, прежде чем запускать обучение. Датасеты, записанные на платформе, можно использовать как есть; для внешних загрузок сначала проверьте версию в meta/info.json.
Запуск обучения
- 1Выберите датасет
Откройте Dashboard > Training и выберите датасет для обучения. Показаны количество эпизодов и тип робота, чтобы вы могли убедиться, что выбрали нужный.
- 2Выберите policy
Выберите один из поддерживаемых типов policy. Если не уверены, начните с ACT: это самый дешёвый способ узнать, достаточно ли хорош ваш датасет, чтобы вообще что-то на нём обучить.
- 3Запустите
Запустите обучение. Оно получает job id и собственную страницу запуска, и вы можете закрыть браузер: обучение продолжается на сервере, а страница показывает текущее состояние, когда бы вы ни вернулись.
Страница запуска обучения
У каждого запуска есть отдельная страница, которая отвечает на два вопроса, которые действительно возникают во время обучения: обучается ли модель и здорова ли машина. Прогресс обучения показан графиками loss, расписания learning rate и нормы градиента. Loss, который сразу выходит на плато, или взрывающаяся норма градиента, говорят рано, что запуск не стоит дожидаться.
Здоровье машины показано рядом: загрузка и память GPU, плюс метрики хоста машины обучения. Временная шкала фаз показывает, на каком этапе сейчас находится запуск, от подготовки окружения через загрузку данных и сам цикл обучения до загрузки чекпоинта. Когда что-то выглядит не так, встроенный просмотрщик логов даёт вам сырые логи обучения без какого-либо SSH-доступа, чего обычно достаточно, чтобы понять, в датасете дело или в самом запуске.
Чекпоинты и возобновление
Чекпоинты хранятся по запускам, а не в общем пуле, поэтому чекпоинты, перечисленные на странице запуска, всегда принадлежат именно этому запуску и его конфигурации. Это важнее, чем кажется: смешивание чекпоинтов между запусками с разными настройками это классический источник незаметно сломанных policy.
Если запуск прерывается, вы можете возобновить его с последнего чекпоинта, вместо того чтобы начинать заново. Промежуточные чекпоинты полезны и сами по себе: когда долгий запуск начинает переобучаться к концу, более ранний чекпоинт часто работает на настоящей руке лучше, чем финальный.
Запуск обученной policy на вашей руке
Готовую policy можно развернуть прямо обратно на вашего робота. В кокпите выберите обученную policy для подключённой руки и запустите инференс: теперь policy производит команды на суставы, которые раньше производили вы посредством телеоперации. Рука должна быть того же типа робота, на котором записан датасет, а сцена должна напоминать обучающие сцены, включая расположение камер.
Относитесь к первым запускам инференса как к экспериментам, а не как к демонстрациям. Держите аварийную остановку под рукой, начинайте с начального состояния, близкого к тому, что вы демонстрировали, и ожидайте, что policy окажется чувствительна к вещам, которые вы бы не заметили: сдвинутая камера, другое освещение или предмет, которого в датасете никогда не было.
Сколько эпизодов нужно
Самая частая ошибка обучения на платформе это не неверный гиперпараметр, а обучение на слишком малом количестве данных с выводом, что данный тип policy не работает. Как эмпирическое правило для одной задачи на столе: около 50 эпизодов дают policy с узкой генерализацией, которая справляется, начиная из состояний, близких к продемонстрированным. Около 100–200 эпизодов дают пригодную устойчивость по всему рабочему пространству для этой одной задачи, при условии что вы варьировали расположение объектов между эпизодами.
Более способные типы policy этого не отменяют. Дообучение GR00T на 20 эпизодах всё равно будет плохо генерализоваться; что дают более крупные модели, так это более высокий потолок, когда данные уже есть. Если бюджет ограничен, потратьте его сначала на более разнообразные эпизоды, а не на более крупную модель.
Частые вопросы
Сколько времени занимает запуск обучения?▾
Это зависит от типа policy и размера датасета, поэтому честной единой цифры нет. ACT обычно самый быстрый из четырёх, дообучение GR00T самое медленное. Временная шкала фаз и графики loss на странице запуска рано показывают, продвигается ли обучение.
Могу ли я обучаться на объединённом датасете?▾
Да. Объединённые датасеты это обычные датасеты; валидация при слиянии уже гарантировала согласованность fps, признаков и типа робота. Объединение записей одной задачи, один из самых эффективных способов достичь диапазона 100–200 эпизодов.
Мой запуск GR00T падает на этапе загрузки данных. Что проверить в первую очередь?▾
Версию формата датасета. Дообучение GR00T требует LeRobot v2.1, и датасет v3.0 падает именно там. Проверьте версию в meta/info.json вашего датасета.
Стоит ли удалять неудачные эпизоды перед обучением?▾
Обычно да. Эпизоды с меткой Failure учат policy неудачному поведению. Эпизоды Recovery это другое дело: они показывают, как исправить ошибку, и часто стоит их оставить.
Нужно ли держать браузер открытым во время обучения?▾
Нет. Запуски выполняются на сервере. Страница запуска показывает текущее состояние, графики и логи всякий раз, когда вы возвращаетесь, а чекпоинты сохраняются независимо от того, смотрит кто-то или нет.
Как AY-Robots хранит записи телеоперации в формате LeRobot: структура эпизодов, браузер эпизодов в дашборде, слияние загрузок и маркетплейс датасетов.
Все руки роботов, поддерживаемые на AY-Robots, с их характеристиками: SO-100, Koch v1.1, Franka FR3, FP3 и Panda, WidowX-250 и ALOHA ViperX-300.