Навчання policy
AY-Robots навчає policy маніпуляції на керованих GPU, тож ви можете пройти шлях від записаних епізодів до policy, що працює на вашій руці, не володіючи залізом для навчання. Ця сторінка описує підтримувані типи policy, сторінку запуску навчання, чекпоінти і те, яких результатів реалістично очікувати за вашої кількості епізодів.
Оновлено 2026-08-09
Навчання без власного GPU
Навчання policy маніпуляції є навантаженням на GPU, а сучасним vision-language-action моделям потрібно більше VRAM, ніж є в типовій робочій станції. На AY-Robots навчання йде на хмарних GPU, якими керує платформа: ви обираєте датасет і тип policy, запускаєте навчання і спостерігаєте за прогресом із браузера. Не потрібно налаштовувати CUDA, підбирати драйвери і підтримувати середовище.
Вхідними даними завжди слугує хмарний датасет із Dashboard > Datasets. Підходить усе, що ви записали через сесії телеоперації або завантажили у форматі LeRobot, зокрема об'єднані датасети. Куруйте перед навчанням: епізоди з міткою Failure зазвичай мають лишатися поза навчальною вибіркою, а десять хвилин перегляду в переглядачі епізодів економлять години часу GPU, витраченого на навчання за поганими демонстраціями.
Підтримувані policy
Підтримується чотири родини policy. Вони різняться розміром, вартістю навчання і тим, скільки здатні увібрати з ваших даних, тож правильний вибір залежить радше від вашого завдання й датасету, ніж від якогось загального рейтингу.
| Policy | Тип | Особливості |
|---|---|---|
| ACT | Трансформер, чанкінг дій | Передбачає короткі блоки майбутніх дій замість окремих кроків. Компактна, навчається порівняно швидко і є надійним першим вибором для одного чітко визначеного завдання. |
| Diffusion Policy | Дифузія за послідовностями дій | Моделює повний розподіл продемонстрованих дій, що допомагає, коли ваші демонстрації розв'язують завдання більш ніж одним допустимим способом. Важча в навчанні і повільніша на інференсі, ніж ACT. |
| SmolVLA | Невелика vision-language-action модель | Обумовлена мовою: рядок завдання з ваших епізодів стає частиною вхідних даних. Гарний компроміс, коли потрібна мовна обумовленість без великої базової моделі. |
| Донавчання GR00T | Донавчання базової моделі | Донавчає велику попередньо навчену базову модель робототехніки на ваших епізодах. Найвища стеля з чотирьох, за найвищої вартості навчання і з суворою вимогою до формату датасету. |
Донавчання GR00T приймає лише датасети у форматі LeRobot версії 2.1. Датасет v3.0 впаде на етапі завантаження даних, а не при відправленні, тож перевірте версію формату, перш ніж запускати навчання. Датасети, записані на платформі, можна використовувати як є; для зовнішніх завантажень спершу перевірте версію в meta/info.json.
Запуск навчання
- 1Оберіть датасет
Відкрийте Dashboard > Training і оберіть датасет для навчання. Показано кількість епізодів і тип робота, щоб ви могли переконатися, що обрали потрібний.
- 2Оберіть policy
Оберіть один із підтримуваних типів policy. Якщо не впевнені, почніть з ACT: це найдешевший спосіб дізнатися, чи достатньо хороший ваш датасет, щоб на ньому взагалі щось навчити.
- 3Запустіть
Запустіть навчання. Воно отримує job id і власну сторінку запуску, і ви можете закрити браузер: навчання триває на сервері, а сторінка показує поточний стан щоразу, коли ви повертаєтеся.
Сторінка запуску навчання
У кожного запуску є окрема сторінка, яка відповідає на два питання, що справді виникають під час навчання: чи навчається модель і чи здорова машина. Прогрес навчання показано графіками loss, розкладу learning rate і норми градієнта. Loss, що одразу виходить на плато, або норма градієнта, що вибухає, рано підказують, що запуск не варто чекати.
Здоров'я машини показано поруч: завантаження і пам'ять GPU, плюс метрики хоста машини навчання. Часова шкала фаз показує, на якому етапі зараз перебуває запуск, від підготовки середовища через завантаження даних і сам цикл навчання до завантаження чекпоінта. Коли щось виглядає не так, вбудований переглядач логів дає вам сирі логи навчання без будь-якого SSH-доступу, чого зазвичай досить, щоб зрозуміти, чи справа в датасеті, чи в самому запуску.
Чекпоінти і відновлення
Чекпоінти зберігаються за запусками, а не в спільному пулі, тому чекпоінти, перелічені на сторінці запуску, завжди належать саме цьому запуску і його конфігурації. Це важливіше, ніж здається: змішування чекпоінтів між запусками з різними налаштуваннями це класичне джерело непомітно зламаних policy.
Якщо запуск переривається, ви можете відновити його з останнього чекпоінта, замість того щоб починати спочатку. Проміжні чекпоінти корисні й самі собою: коли довгий запуск починає перенавчатися ближче до кінця, більш ранній чекпоінт часто працює на справжній руці краще, ніж фінальний.
Запуск навченої policy на вашій руці
Готову policy можна розгорнути прямо назад на вашого робота. У кокпіті оберіть навчену policy для підключеної руки і запустіть інференс: тепер policy виробляє команди на суглоби, які раніше виробляли ви через телеоперацію. Рука має бути того самого типу робота, на якому записано датасет, а сцена має нагадувати навчальні сцени, зокрема розташування камер.
Ставтеся до перших запусків інференсу як до експериментів, а не як до демонстрацій. Тримайте аварійну зупинку напоготові, починайте з початкового стану, близького до того, що ви демонстрували, і очікуйте, що policy виявиться чутливою до речей, яких ви б не помітили: зсунута камера, інше освітлення чи предмет, якого в датасеті ніколи не було.
Скільки епізодів потрібно
Найпоширеніша помилка навчання на платформі це не неправильний гіперпараметр, а навчання на занадто малій кількості даних із висновком, що цей тип policy не працює. Як емпіричне правило для одного завдання на столі: близько 50 епізодів дають policy з вузькою генералізацією, яка справляється, починаючи зі станів, близьких до продемонстрованих. Близько 100–200 епізодів дають придатну стійкість по всьому робочому простору для цього одного завдання, за умови що ви варіювали розташування об'єктів між епізодами.
Більш здатні типи policy цього не скасовують. Донавчання GR00T на 20 епізодах усе одно погано генералізуватиметься; що дають більші моделі, так це вищу стелю, коли дані вже є. Якщо бюджет обмежений, витратьте його спершу на різноманітніші епізоди, а не на більшу модель.
Часті запитання
Скільки часу займає запуск навчання?▾
Це залежить від типу policy і розміру датасету, тож чесної єдиної цифри немає. ACT зазвичай найшвидший із чотирьох, донавчання GR00T найповільніше. Часова шкала фаз і графіки loss на сторінці запуску рано показують, чи просувається навчання.
Чи можу я навчатися на об'єднаному датасеті?▾
Так. Об'єднані датасети є звичайними датасетами; валідація при злитті вже гарантувала узгодженість fps, ознак і типу робота. Об'єднання записів одного завдання, один із найефективніших способів досягти діапазону 100–200 епізодів.
Мій запуск GR00T падає на етапі завантаження даних. Що перевірити насамперед?▾
Версію формату датасету. Донавчання GR00T потребує LeRobot v2.1, і датасет v3.0 падає саме там. Перевірте версію в meta/info.json вашого датасету.
Чи варто видаляти невдалі епізоди перед навчанням?▾
Зазвичай так. Епізоди з міткою Failure вчать policy невдалої поведінки. Епізоди Recovery це інша справа: вони показують, як виправити помилку, і часто варті того, щоб їх залишити.
Чи потрібно тримати браузер відкритим під час навчання?▾
Ні. Запуски виконуються на сервері. Сторінка запуску показує поточний стан, графіки й логи щоразу, коли ви повертаєтеся, а чекпоінти зберігаються незалежно від того, дивиться хтось чи ні.
Як AY-Robots зберігає записи телеоперації у форматі LeRobot: структура епізодів, переглядач епізодів у дашборді, злиття завантажень і маркетплейс датасетів.
Усі руки роботів, підтримувані на AY-Robots, з їхніми характеристиками: SO-100, Koch v1.1, Franka FR3, FP3 і Panda, WidowX-250 та ALOHA ViperX-300.