Таблица сравнения политик AY-Robots, показывающая GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT бок о бок с количеством параметров, уровнем GPU, задержкой инференса и минимальным количеством эпизодов
vla-моделиобучение-политикивыбор-моделиlerobotso-100

Какую политику VLA следует обучать в 2026 году?

AY-Robots ResearchAugust 23, 202618 мин чтения

GR00T N1.7, Pi0.5, SmolVLA, ACT или GR00T N1.5? Таблица решений, соответствующая реальным ситуациям, с опубликованными бенчмарками, задержкой, стоимостью за запуск и лицензиями для каждого выбора.

Сегодня на манипуляторе класса SO-100 можно обучить пять политик. Они отличаются в 24 раза по задержке вывода, в 37 раз по количеству параметров и в 12 раз по стоимости одного запуска, а также по возможности поставки результата. Пять карточек моделей не решат проблему: ни одна из них не отвечает на ваш вопрос, какую из них запускать первой?

Все приведенные ниже цифры были взяты из статей, репозиториев и карточек в августе 2026 года. Данные по платформам взяты из каталога политик AY-Robots; если данные расходятся, показаны оба значения.

Краткая версия

  • Обучайте ACT первым, если сомневаетесь в своем наборе данных: 1–3 USD за запуск, нет предварительно обученных моделей, чтобы скрыть плохие данные.
  • GR00T N1.7 и Pi0.5 находятся в пределах половины балла по LIBERO: 97.0 против 96.85–97.5. Это не повод выбирать ни один из них.
  • Pi0.5 — это ставка на обобщение, а не на точность, и самый медленный вариант с задержкой 485 мс.
  • SmolVLA, с 450 млн параметров, является единственной VLA здесь, которая дообучается на одной 24 ГБ карте.
  • ACT с задержкой 20 мс — единственный вариант для быстрого реактивного движения. Лицензии определяют остальное.

Таблица решений

Ваша ситуацияОбучите этоПочему
Качество набора данных не доказаноACTПредварительное обучение не скроет поврежденный набор данных, а неудача стоит от 1 до 3 USD.
Богатый контактами, многошаговый, с языковым обусловливаниемGR00T N1.797.0% по четырем наборам LIBERO, плюс относительное пространство действий концевого эффектора.
Быстрое реактивное движение, инференс на сервоприводахACT20 мс. Следующий по скорости в 7.6 раза медленнее.
Новые объекты, новая сцена, открытый мирPi0.5Создан для поведения вне распределения, вплоть до 104 локаций.
Одна карта на 24 ГБ, все еще нужен языкSmolVLA450 млн параметров, минимум 30 эпизодов, работает локально.
Воспроизведение запуска, записанного в 2025 годуGR00T N1.5Только если необходимо: LeRobot теперь отклоняет его, веса некоммерческие.
Это будет поставляться как продуктN1.7, SmolVLA or ACTN1.5 некоммерческий, Pi0.5 использует условия Gemma, карта SmolVLA не указывает никаких.

Пять кандидатов

Все пять — это политики: кадры с камеры, положения суставов и, для четырех из них — языковая инструкция, сопоставленная с частью будущих целевых положений суставов. Что их отличает, так это объем изученного до вашего прихода.

ПолитикаПараметрыЗадержкаУровень GPUЛокально?Мин. эпизодовФорматСтоимость
ACT~80 M20 ms24 GB cardда50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardда30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBнет50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBнет50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBнет50v3.04 to 12 USD

GR00T N1.7

Текущая NVIDIA модель зрения, языка и действий, около 3 миллиардов параметров, примерно 40 миллионов обучено во время дообучения. Репозиторий перечисляет изменения по сравнению с N1.6: архитектура изменена с проприетарной модели Eagle на Cosmos-Reason2-2B на Qwen3-VL, слои диффузии с 32 до 16, размерности состояния и действия с 29 до 132, горизонт действия с 16 до 40.

Что важно для небольшой руки, так это относительное пространство действий концевого эффектора: N1.7 предсказывает дельты от текущей позы, что позволяет переносить 20 тысяч часов человеческого видео EgoScale в политику робота. Спецификация на странице N1.7, процедура в руководстве по N1.7 на SO-100.

GA в репозитории, EA на карточке модели

Файл README Isaac-GR00T объявляет N1.7 General Availability релизом, с полными бенчмарками и поддержкой. Его карточка Hugging Face еще не обновлена: поле Model Version по-прежнему содержит GR00T N1.7 EA. Репозиторий является более новым документом.

GR00T N1.5

Та же шкала 3 B, архитектура Eagle 2, SigLip2 и T5, голова DiT с flow-matching. Он существует для расширения контрольной точки которую вы уже имеете. Две вещи делают его плохим вариантом по умолчанию: веса имеют NVIDIA's one-way non-commercial licence, а текущие версии LeRobot удалили поддержку N1.5. См. N1.7 против N1.5.

Pi0.5

VLA от Physical Intelligence с сопоставлением потоков, тип политики pi05. В статье описывается VLM размером 2 B, инициализированный из PaliGemma плюс эксперт по действиям размером 300 M, управляющий роботом на частоте 50 Гц; конфигурация pi05 LeRobot по умолчанию использует 50-шаговый фрагмент, одну секунду при такой скорости. Главное преимущество — это невиданные ранее места: около 400 часов мобильных манипуляций в реальных домах и исследование масштабирования по 3, 12, 22, 53, 82 и 104 локациям, где модель со 104 локациями соответствовала контрольной модели, обученной на самих тестовых домах.

Одно ограничение, указанное на lerobot/pi05_base карте: порт передает только согласованную по потоку action head. Предсказание подзадач, токенизация действий и RL не были выпущены вышестоящими разработчиками, и openpi заявляет то же самое о своем собственном репозитории. Страница Pi0.5 и руководство по Pi0.5 на SO-100 содержат остальное.

Ловушка, которая съедает полдня: закрытые репозитории

Для Pi0.5 требуется закрытый токенизатор google/paligemma-3b-pt-224 (gated: manual, хотя Google заявляет, что запросы обрабатываются немедленно). Без его принятия и запуска hf auth login в среде обучения, задача запускается, некоторое время загружается, а затем завершается с ошибкой авторизации, которая выглядит как сбой сети. nvidia/GR00T-N1.7-3B не является закрытым, но его основа nvidia/Cosmos-Reason2-2B является (gated: auto). Очистите оба перед постановкой в очередь; если запуск простаивает, страница зависшей очереди перечисляет, что нужно проверить.

SmolVLA

450 млн параметров, около 100 млн в эксперте действий, на SmolVLM-2 с замороженным VLM и использованием только его первых 16 слоев языковой модели. Предварительное обучение проводилось на общедоступных данных: 481 набор данных, 10,6 млн кадров, с использованием тех же дешевых манипуляторов, которые вы используете. Единственный VLA здесь, который помещается на одну 24 ГБ карту, и единственный с порогом в 30 эпизодов. См. страницу SmolVLA.

ACT

Не является базовой моделью. Трансформер Action Chunking Transformer от ALOHA имеет около 80 млн параметров, обученных с нуля для каждой задачи, на 50 демонстрациях с частотой 50 Гц. В статье сообщается о шести реальных бимануальных задачах, каждая из которых основана примерно на десяти минутах демонстраций, с успешностью от 80 до 90 процентов на выделенных примерах. Его идея, фрагментирование действий, присутствует в каждой модели на этой странице, и его абляция по-прежнему измеряет эффект лучше всего: в двух симулированных задачах с отключенным временным ансамблированием успешность возрастает с 1 процента при k=1 до 44 процентов при k=100. Страница ACT содержит остальное.

Что на самом деле говорят бенчмарки

LIBERO — это единственный бенчмарк, о котором сообщают три из этих пяти: задачи, обусловленные языком, на симулированном Franka Panda, разделенные на четыре набора по десять задач в каждом. NVIDIA провела 200 испытаний для каждого набора.

МодельПространственнаяОбъектнаяЦелевая10 (Длинная)Средняя
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Эти строки не являются строго сопоставимыми

Каждое число получено из разных тестовых наборов и бюджетов. GR00T выполнил 20K шагов с глобальным пакетом 640; показатель openpi — это контрольная точка 30K; порт LeRobot добавил 6K шагов к базовой модели LIBERO. SmolVLA представляет собой дальнейшее несоответствие: в его статье эта строка обучается на LIBERO с нуля, без предварительного обучения VLA, в то время как три вышеуказанные модели дообучают предварительно обученные контрольные точки. Рассматривайте 96.85 до 97.5 как один кластер, а разрыв до 87.3% как реальный, но достигнутый за счет в 6.7 раза большего количества параметров.

SimplerEnv показывает разброс, чего не делает LIBERO.NVIDIA сравнивает N1.7 с N1.6, что является ближайшим публичным аналогом "generational delta".

Набор SimplerEnvСреднее N1.6Среднее N1.7Лучший размахХудший размах
Bridge (WidowX), 7 задач56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 задач52.0%72.5%open_drawer 0.0 to 65.0нет, каждая задача улучшилась

Строка Bridge является полезной: в среднем получено 5.7 очков, в то время как put_eggplant_in_basket потерял 36, а put_eggplant_in_sink упал с 33 до 2. Новое поколение сдвигает распределение, а не поднимает его, поэтому, если ваша задача находится там, где N1.7 регрессировал, среднее значение ничего не говорит.

Таблица лидеров арены AY-Robots, сортируемая таблица из 85 моделей зрения-языка-действия с 332 результатами бенчмарков, каждое значение связано со статьей или карточкой модели, из которой оно получено
Арена содержит 85 моделей VLA и 332 результата бенчмарков, каждый из которых связан со своей статьей или карточкой модели. Полезно для проверки, является ли число, указанное в сообщении блога, реальным.

Из пяти только статья SmolVLA сообщает о манипуляторе класса SO-100: 78.3 процента для SmolVLA и 61.7 для Pi0 по трем задачам, обе многозадачные, против 48.3 для ACT, обученного однозадачно, что не является сопоставимым. Чистое сравнение — это обе однозадачные на SO-101 захват и размещение: 90 против 70 в распределении, 50 против 40 вне его. Сравните на ACT против SmolVLA и Pi0.5 против SmolVLA, или просмотрите арену.

Задержка и стоимость определяют развертывание

Задержка вывода — это ограничение, которое люди обнаруживают последним и о котором сожалеют в первую очередь. Политика, которая на пять пунктов лучше по бенчмарку, но занимает полсекунды на каждый шаг действия, выглядит хуже на вашем столе: динамика контакта не ждет.

Одно замечание: данные GR00T расходятся с данными карты NVIDIA, которая измеряет 4 шага шумоподавления и одну камеру за 85.8 ms на H100 в eager-режиме, 48.6 ms с torch.compile, 27.9 ms через полный TensorRT. Указанные здесь 152 ms — это показатель всей системы с накладными расходами на обслуживание и более чем одной камерой, а не только прямой проход.

Удаленный вывод имеет жесткий потолок

Цикл от 20 до 485 ms принадлежит модели, и к нему добавляются задержки публичного интернета. Удаленный вывод жизнеспособен для медленных операций типа «взять и положить», но не для быстрых реактивных движений. Если вашей задаче нужна скорость, вывод должен находиться рядом с сервоприводами: ACT или SmolVLA, локально. По теме: политика зависает в середине движения.

Один из способов выиграть время без изменения модели: в статье SmolVLA сравнивается синхронное выполнение, при котором политика завершает обработку одного фрагмента перед предсказанием следующего, с асинхронным, где предсказание перекрывается с выполнением. Успех аналогичен, 78.3 против 73.3, но та же операция «взять и положить» занимает 9.7 seconds вместо 13.75, и в фиксированном окне робот выполняет 19 cycles вместо 9.

Лицензии, проверенные, потому что их никто не проверяет

МодельЛицензия на весаЛицензия на кодКоммерческое использование
GR00T N1.7NVIDIA Open Model License; карта разрешает коммерческое использованиеApache 2.0да
GR00T N1.5Односторонняя некоммерческая лицензия NVIDIAApache 2.0нет
Pi0.5метаданные карты pi05_base указывают лицензию: gemmaApache 2.0 (openpi, LeRobot docs)прочитайте оба, они расходятся
SmolVLAна карте smolvla_base нет поля лицензииApache 2.0 (LeRobot)код да, веса не указаны
ACTбазовые веса отсутствуютApache 2.0 (LeRobot)да

Строка Pi0.5 требует внимания. Документация LeRobot pi05 указывает Apache 2.0, что соответствует openpi, в то время как карта Hub для lerobot/pi05_base содержит license: gemma. Оба активны. GR00T N1.7 имеет более мягкую версию: README Isaac-GR00T вскользь упоминает, что N1.7 полностью лицензируется для коммерческого использования по Apache 2.0, в то время как его собственный раздел лицензии и карта модели относят только код под Apache 2.0, а веса под NVIDIA Open Model License.

Настройки по умолчанию, которые вы фактически будете использовать

Каждая форма тренера поставляется с настройками по умолчанию, и они не являются произвольными. Настройки ACT — это собственные настройки LeRobot: пакет 8, lr 1e-5, 100000 шаги обучения, размер блока 100, соответствующий ACTConfig upstream и k=100 из статьи ACT. Один из столбцов ниже — это ловушка.

ПолитикаПакетLRМакс. шагиНакопление градиентаПрименимо?Дополнительные параметры
GR00T N1.7321e-4200001даsaveSteps
GR00T N1.511e-5200016даsaveSteps
Pi0.515e-53000016нет (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008нетseed, logFreq
ACT81e-51000001нетchunkSize, nActionSteps, seed, logFreq
Воспроизводимость, данные на август 2026 года

Точка входа для донастройки GR00T (launch_finetune.py, CLI tyro) не имеет поля seed в своем классе данных конфигурации, поэтому запуски не являются побитово воспроизводимыми. Репозиторий также предупреждает о 5-6-процентном расхождении между запусками из-за недетерминированных аугментаций изображений, что больше, чем большинство различий в бенчмарках, обсуждаемых в сети. Значение seed по умолчанию для LeRobot — 1000. Столбец накопления градиента описывает lerobot 0.5.1; в версии 0.6.2 он представлен как --accelerator.gradient_accumulation.steps.

Параметр, который важнее выбора модели

Это блок действий. Более длинные блоки обеспечивают более плавное движение и меньше накапливающихся ошибок, но политика фиксируется во время выполнения блока, поэтому она поздно реагирует на любое движущееся: уверенно на статичном кубе, безнадежно на катящемся. Если он перерегулирует, сокращение выполняемой части лучше переобучения и бесплатно. Шарнир, который останавливается раньше времени, — это другая проблема; см. .

  • ACT: ACTConfig по умолчанию использует chunk_size 100 и n_action_steps 100. Временное ансамблирование отключено и требует n_action_steps 1.
  • GR00T N1.7: внутренний горизонт увеличился с 16 до 40, однако пример LeRobot SO-101 все еще запускается с --policy.chunk_size=16 --policy.n_action_steps=16. Флаг развертывания был переименован в --execution-horizon.
  • Pi0.5: блок из 50 шагов, из которых рецепт LeRobot LIBERO выполняет 10 через --policy.n_action_steps=10; с --policy.pretrained_path он возвращается к 50, если вы опустите флаг.
  • SmolVLA: блоки из 50 действий, оба параметра доступны.

Как проверить все пять за один день

Самый дешевый ответ — не читать больше. Потратьте около 15 USD и пусть рука сама вам скажет: запишите один раз, обучите сначала дешевую модель, масштабируйте, как только она подтвердит надежность данных. Структура важнее объема, в этом суть и .

  1. 1
    Запишите 50 эпизодов один раз

    Пятьдесят эпизодов подготавливают почву для GR00T, Pi0.5 и ACT, а также 30 эпизодов для SmolVLA. Повторяйте каждую вариацию, а не распыляйтесь: 50 эпизодов по 5 позициям куба были обучены, в то время как 25 — нет. См. запишите свой первый набор данных.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Сначала обучите ACT, потому что он не может вас обмануть

    Предварительно обученных весов нет, поэтому, если модель вообще выполняет задачу, ваш набор данных содержит эту задачу. Если ACT не показывает прогресса, исправьте данные. От 1 до 3 USD, от 2 до 5 часов на карте 24 ГБ.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Запустите SmolVLA на том же наборе данных, без изменений

    Те же данные, та же рука, 450 млн параметров вместо 80 млн, плюс языковое обусловливание. LeRobot оценивает выполнение 20 тыс. шагов примерно в 4 часа на одной A100. Это покажет, дает ли предварительное обучение какие-либо преимущества.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Конвертируйте до v2.1, прежде чем использовать GR00T

    GR00T читает вариант формата LeRobot v2 плюс дополнительный файл meta/modality.json, который описывает, как объединенные массивы состояний и действий разделяются на именованные поля. Набор данных v3.0 вызывает сбой этого загрузчика, потому что v3.0 упаковывает много эпизодов в общие файлы, тогда как v2 записывал по одному на эпизод. Isaac-GR00T поставляется с утилитой для понижения версии как scripts/lerobot_conversion/convert_v3_to_v2.py; страница об отклонении v3 — это быстрый путь.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Переходите к GR00T N1.7 только в том случае, если первые два варианта не дали полного результата

    Через CLI NVIDIA, показанный здесь, или тип политики groot LeRobot. NVIDIA рекомендует 40 ГБ или более VRAM для дообучения, 16 ГБ для инференса. При ошибке OOM см. страницу OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Два способа выполнить этот скрининговый проход

Три среды, потому что наборы инструментов несовместимы. LeRobot в основной ветке имеет версию 0.6.2 и требует Python 3.12 или новее; Isaac-GR00T и openpi — это отдельные репозитории, управляемые uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T фиксирует torchcodec 0.8.0 как единственный видео-бэкенд, требующий FFmpeg от 4 до 7. FFmpeg 8 не поддерживается, AV1 не гарантируется.
  • Минимальные требования к памяти openpi: инференс выше 8 ГБ, LoRA выше 22.5 ГБ, полная донастройка выше 70 ГБ. Последнее — причина, по которой Pi0.5 требует A100.
  • Арендуйте GPU самостоятельно, уничтожьте его после использования, вручную согласуйте три набора путей к контрольным точкам.

Фундаментальная модель или с нуля

Настоящая дилемма не в том, какую модель 3B выбрать. Она заключается в том, стоит ли вообще использовать предварительно обученную VLA, учитывая, что ACT освоила шесть реальных бимануальных задач примерно за десять минут демонстраций каждую, с 80 миллионами параметров и без предварительного обучения.

Тонкая настройка предварительно обученной VLA вместо обучения ACT с нуля
Что вы получаете
  • Языковое обусловливание. У ACT его нет; один контрольный пункт ACT выполняет одну задачу.
  • Лучше на объектах, отсутствующих в ваших демонстрациях: на SO-101, 50% против 40% у ACT вне распределения.
  • Многозадачность вообще: SmolVLA достигает 78,3% по трем задачам SO-100 с одним контрольным пунктом; ACT запускался только для одной задачи.
Что это вам стоит
  • Задержка в 7,6–24 раза выше: от 152 до 485 мс на шаг действия против 20 мс у ACT.
  • От 4 до 12 USD за запуск вместо 1–3, и уровень A100 вместо любой карты на 24 ГБ.
  • Риски лицензирования, плюс режим отказа из-за закрытого репозитория, которого нет при разработке с нуля.
  • Предварительно обученные веса могут маскировать плохой набор данных. Тонкая настройка, которая наполовину работает на поврежденных данных, стоит недели, прежде чем вы посмотрите на данные.

Случай воспроизведения старого запуска

Погоня за контрольной точкой 2025 года делает выбор модели за вас и превращает проблему в привязку версии: текущий LeRobot отклоняет N1.5, поэтому вы привязываете lerobot==0.5.1. Без поля seed и с 5–6-процентной дисперсией между запусками воспроизведение является приблизительным по своей природе. и содержат информацию о платформе.

Страница сравнения AY-Robots для GR00T N1.7 и Pi0.5, показывающая количество параметров, требования к GPU, задержку вывода, формат набора данных и минимальное количество эпизодов бок о бок.
Сравнение моделей на /compare/groot-n1-7-vs-pi0-5. Две 3 B модели выглядят взаимозаменяемыми в спецификации, но это не так: одна требует LeRobot v2.1, другая — v3.0.

Осталось две? ACT против GR00T N1.7 и GR00T N1.7 против SmolVLA. Необработанные данные находятся в записях арены: GR00T N1.7, Pi0.5, SmolVLA и ACT.

В чем эта платформа вам не поможет

  • Она не может ускорить удаленный вывод. Цикл от 20 до 485 мс относится к модели; интернет-задержки добавляются к этому.
  • Она не может дообучать GR00T или Pi0.5 на вашем собственном оборудовании. Обе модели здесь доступны только в облаке; только SmolVLA и ACT работают локально.
  • Она не может исправить набор данных. Потери падают, но политика ничего не делает — это проблема данных, политика, которая работает только в одной конфигурации — это проблема охвата.
  • Она не может сделать запуски GR00T воспроизводимыми: конфигурация вышестоящего уровня не имеет поля seed.

85 моделей, 332 результата бенчмарков, каждое число со ссылкой на источник

Сортируемая версия таблиц на этой странице: 85 моделей «зрение-язык-действие», 332 результата бенчмарков, каждый из которых ссылается на соответствующую статью или карточку модели.

Открыть арену

Выбираем и двигаемся дальше

Один вариант по умолчанию: запишите 50 эпизодов, обучите ACT за 1–3 USD, чтобы проверить набор данных, затем SmolVLA на тех же данных. Вместе это обойдется менее чем в 6 USD, и они ответят на важный вопрос: помогает ли здесь предварительное обучение или узким местом являются данные. Переходите к GR00T N1.7 для многошаговых задач с интенсивным контактом, к Pi0.5, когда сцена меняется.

Обзор платформы: обучите свою первую политику, затем запустите свою первую политику. документация по обучению и документация по наборам данных охватывают форму и формат; страница SO-100 и полное руководство по SO-100 охватывают сборку и калибровку. Справочная информация: обзор VLA и статья о сопоставлении потоков Pi0. То, что повысит ваш показатель успеха, это руководство по качеству данных.

Какую политику VLA мне следует обучать первой на SO-100?

ACT, затем SmolVLA. ACT обучается с нуля, поэтому не может маскировать плохой набор данных, а один запуск стоит от 1 до 3 USD на карте с 24 ГБ. Если ACT вообще выполняет задачу, то 4–12 USD за запуск GR00T N1.7 или Pi0.5 не будут потрачены впустую.

Действительно ли GR00T N1.7 лучше, чем Pi0.5?

На LIBERO они находятся в пределах шума: 97.0% по четырем наборам для GR00T N1.7, 96.85% для Pi0.5 на 30k шагах в openpi, 97.5% для порта LeRobot, все из разных тестовых стендов. Реальные различия заключаются в 152 ms на шаг действия против 485 ms, наборах данных v2.1 против v3.0, и точности бенчмарка против обобщения в открытом мире.

Могу ли я дообучить любой из них на одной RTX 4090?

SmolVLA и ACT — да; оба указаны для RTX 4090 или любой карты с 24 ГБ и запускаются локально. GR00T N1.7, N1.5 и Pi0.5 требуют A100 или H100 80 ГБ и здесь доступны только в облаке. NVIDIA рекомендует 40 ГБ или более для дообучения GR00T; минимальный объем openpi составляет более 70 ГБ для полного дообучения Pi0.5, 22.5 ГБ для LoRA.

Какой из этих пяти я могу использовать в коммерческих целях?

Веса GR00T N1.7 подпадают под лицензионное соглашение NVIDIA Open Model License Agreement, которое, как указано в карточке, охватывает коммерческое использование. Веса N1.5 являются некоммерческими. Код SmolVLA имеет лицензию Apache 2.0 в LeRobot, но карточка lerobot/smolvla_base не содержит поля лицензии, поэтому веса не указаны. У ACT нет базовых весов для лицензирования. Pi0.5 неоднозначен: документация LeRobot указывает Apache 2.0, а метаданные его карточки содержат license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started