Таблицата за сравнение на политиките на AY-Robots, показваща GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT една до друга с броя на параметрите, ниво на GPU, латентност на инференция и минимален брой епизоди
vla-моделиобучение-на-политикиизбор-на-моделlerobotso-100

Коя VLA политика трябва да обучите през 2026 г.?

AY-Robots ResearchAugust 23, 202618 мин четене

GR00T N1.7, Pi0.5, SmolVLA, ACT или GR00T N1.5? Таблица за решения, съобразена с реални ситуации, с публикуваните бенчмарк резултати, латентност, цена на изпълнение и лицензи зад всеки избор.

Пет политики могат да бъдат обучени на рамо от клас SO-100 днес. Те се различават с фактор 24 по отношение на извода латентност, 37 по брой параметри и 12 по отношение на цената на изпълнение, както и по това дали можете да разпространявате резултата. Пет моделни карти няма да решат въпроса: нито една не отговаря на въпроса, който имате – коя да стартирам първо?

Всяко число по-долу е прочетено от документите, хранилищата и картите през август 2026 г. Номерата на платформите идват от AY-Robots каталог на политиките; където двете не съвпадат, и двете са показани.

Кратката версия

  • Обучете ACT първо, ако се съмнявате в набора си от данни: 1 до 3 USD за изпълнение, нищо предварително обучено, което да прикрие лоши данни.
  • GR00T N1.7 и Pi0.5 са в рамките на половин точка по LIBERO, 97.0 срещу 96.85 до 97.5. Това не е причина да изберете нито едно от двете.
  • Pi0.5 е за обобщение, не за точност, и е най-бавното при 485 ms.
  • SmolVLA, с 450 M параметри, е единственият VLA тук, който се фино настройва на една 24 GB карта.
  • ACT при 20 ms е единствената опция за бързо реактивно движение. Лицензите решават останалото.

Таблицата за решения

Вашата ситуацияОбучете товаЗащо
Качеството на набора от данни е недоказаноACTНищо предварително обучено не скрива повреден набор от данни, а провалът струва 1 до 3 USD.
Богат на контакт, многостъпков, езиково обусловенGR00T N1.797.0% в четири LIBERO пакета, плюс относително пространство за действие на крайния ефектор.
Бързо реактивно движение, извод при сервомоторитеACT20 ms. Следващият най-бърз е 7.6 пъти по-бавен.
Нови обекти, нова сцена, отворен святPi0.5Създаден за поведение извън разпределението, в до 104 локации.
Една 24 GB карта, все още искате езикSmolVLA450 M параметри, минимум 30 епизода, работи локално.
Възпроизвеждане на изпълнение, записано през 2025 г.GR00T N1.5Само ако трябва: LeRobot вече го отхвърля, теглата са нетърговски.
Това ще бъде доставено като продуктN1.7, SmolVLA или ACTN1.5 е нетърговски, Pi0.5 е с условията на Gemma, картата на SmolVLA не посочва нищо.

Петте кандидата

И петте са политики: кадрови изображения от камера, позиции на ставите и, за четири от тях, езикова инструкция, картографирана към част от бъдещи целеви позиции на ставите. Това, което ги отличава, е колко е било научено, преди да пристигнете.

ПолитикаПараметриЛатентностНиво на GPUЛокално?Мин. епизодиФорматЦена
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

Текущият модел за визия, език и действие на NVIDIA, около 3 милиарда параметъра, приблизително 40 милиона обучени по време на фина настройка. Хранилището изброява разликите от N1.6: гръбнак от доставен модел Eagle до Cosmos-Reason2-2B на Qwen3-VL, дифузионни слоеве от 32 на 16, измерения на състоянието и действието от 29 на 132, хоризонт на действието от 16 на 40.

Това, което е важно за малка ръка, е относителното пространство за действие на крайния ефектор: N1.7 предвижда делта от текущата поза, което позволява 20K часа човешко видео от EgoScale да се прехвърлят в политика за робот. Спецификации на страницата на N1.7, процедура в ръководството за N1.7 на SO-100.

GA в хранилището, EA на картата на модела

README файлът на Isaac-GR00T обявява N1.7 за Обща наличност версия, с пълни бенчмаркове и поддръжка. Картата му в Hugging Face не е актуализирана: полето Model Version все още показва GR00T N1.7 EA. Хранилището е по-новият документ.

GR00T N1.5

Същият мащаб от 3 милиарда параметри, архитектура Eagle 2, SigLip2 и T5, глава DiT за съвпадение на потоци. Съществува, за да разшири контролна точка която вече имате. Две неща го правят лош избор по подразбиране: тежестите носят еднопосочен нетърговски лиценз на NVIDIA, а текущите версии на LeRobot премахнаха поддръжката на N1.5. Вижте N1.7 срещу N1.5.

Pi0.5

на Physical Intelligence съвпадение на потоци VLA, тип политика pi05. Документът описва 2 милиарда параметъра VLM, инициализиран от PaliGemma, плюс 300 милиона параметъра експерт по действия, управляващ робота при 50 Hz; конфигурацията pi05 на LeRobot по подразбиране използва 50-стъпков сегмент, една секунда при тази скорост. Продажната точка са непознати места: около 400 часа мобилна манипулация в реални домове и проучване на мащабирането над 3, 12, 22, 53, 82 и 104 локации, където моделът със 104 локации съвпадаше с контрол, обучен върху самите тестови домове.

Едно ограничение, посочено на lerobot/pi05_base карта: портът пренася само съответстващата на потока action head. Прогнозирането на подзадачи, токенизацията на действията и RL не бяха пуснати нагоре по веригата, а openpi казва същото и за собственото си хранилище. Страницата на Pi0.5 и ръководството за Pi0.5 на SO-100 съдържат останалото.

Капанът, който изяжда един следобед: ограничени хранилища

Pi0.5 се нуждае от токенизатора с ограничен достъп google/paligemma-3b-pt-224 (gated: manual, въпреки че Google казва, че заявките се обработват незабавно). Без да го приемете и да изпълните hf auth login в средата за обучение, задачата стартира, изтегля се известно време, след което умира с грешка при оторизация, която прилича на мрежова повреда. nvidia/GR00T-N1.7-3B не е с ограничен достъп, но неговият nvidia/Cosmos-Reason2-2B гръбнак е (gated: auto). Изчистете и двете, преди да поставите на опашка; ако изпълнението стои бездейно, страницата за заседнали задачи изброява какво да проверите.

SmolVLA

450 M параметри, около 100 M в експерта по действия, на SmolVLM-2 със замразен VLM и използвани само неговите първи 16 слоя на езиковия модел. Предварителното обучение е с данни от общността: 481 набора от данни, 10.6 M кадъра, от същите евтини роботизирани ръце, които използвате. Единственият VLA тук, който се побира на една 24 GB карта, и единственият с 30 епизод етаж. Вижте страницата на SmolVLA.

ACT

Не е базов модел. Action Chunking Transformer от ALOHA е с около 80 M параметъра, обучен от нулата за всяка задача, върху 50 демонстрации при 50 Hz. Докладът описва шест реални бимануални задачи от приблизително десет минути демонстрации всяка, с 80 до 90 процента успеваемост на примерите, които подчертава. Неговата идея, групиране на действия, присъства във всеки модел на тази страница, а неговата аблация все още измерва ефекта най-добре: при две симулирани задачи с изключено темпорално ансамблиране, успехът нараства от 1 процент при k=1 до 44 процента при k=100. Страницата на ACT съдържа останалото.

Какво всъщност казват бенчмарковете

LIBERO е единственият бенчмарк, за който докладват три от тези пет: езиково-обусловени задачи на симулирана Franka Panda, разделени на четирите пакета по-долу, с по десет задачи във всеки. NVIDIA проведе 200 опита за всеки пакет.

МоделПространственоОбектЦел10 (Дълго)Средно
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Тези редове не са строго сравними

Всяко число идва от различен тестов стенд и бюджет. GR00T изпълни 20K стъпки при глобален пакет 640; цифрата за openpi е контролна точка от 30K; портът LeRobot добави 6K стъпки към базов модел LIBERO. SmolVLA е допълнително несъответствие: неговият документ обучава този ред на LIBERO от нулата, без предварително обучение на VLA, докато трите над него фино настройват предварително обучени контролни точки. Третирайте 96.85 до 97.5 като един клъстер, а разликата до 87.3% като реална, но постигната с 6.7 пъти повече параметри.

SimplerEnv показва разпределението, което LIBERO не показва. NVIDIA сравнява N1.7 с N1.6, най-близкото публично нещо до поколенческа разлика.

Пакет SimplerEnvСредно за N1.6Средно за N1.7Най-добро отклонениеНай-лошо отклонение
Bridge (WidowX), 7 задачи56.6%62.3%stack_cube 5.0 до 48.0put_eggplant_in_basket 89.0 до 53.0
Fractal (Google Robot), 6 задачи52.0%72.5%open_drawer 0.0 до 65.0няма, всяка задача се подобри

Редът Bridge е полезният: средно 5.7 точки са спечелени, докато put_eggplant_in_basket загуби 36, а put_eggplant_in_sink спадна от 33 на 2. Ново поколение премества разпределението, вместо да го повдига, така че ако вашата задача е там, където N1.7 е регресирал, средната стойност не казва нищо.

Класацията на арената на AY-Robots, сортируема таблица от 85 vision-language-action модела с 332 резултата от бенчмаркове, всяка стойност свързана с документа или моделната карта, от която произлиза
Арената съдържа 85 VLA модела и 332 резултата от бенчмаркове, всеки свързан обратно с неговия документ или моделна карта. Полезно за проверка дали число, цитирано в публикация в блог, е реално.

От петте, само документът на SmolVLA докладва за рамо от клас SO-100: 78.3 процента за SmolVLA и 61.7 за Pi0 в три задачи, и двете многозадачни, срещу 48.3 за ACT, обучен еднозадачно, което не е сравнимо. Чистото сдвояване е и двете еднозадачни на SO-101 pick-and-place: 90 срещу 70 в разпределението, 50 срещу 40 извън него. Сравнете на ACT срещу SmolVLA и Pi0.5 срещу SmolVLA, или разгледайте арената.

Латентността и цената определят внедряването

Латентност на извода е ограничението, което хората откриват последно и съжаляват първо. Политика, която е с пет точки по-добра на бенчмарк, но отнема половин секунда на стъпка на действие, изглежда по-зле на бюрото ви: динамиката на контакта не чака.

Едно уточнение: данните за GR00T не съвпадат с картата на NVIDIA, която отчита 4 стъпки за премахване на шума и една камера при 85.8 ms на H100 в eager режим, 48.6 ms с torch.compile, 27.9 ms през пълен TensorRT. Тук 152 ms е стойност за целия стек с допълнителни разходи за обслужване и повече от една камера, а не само за forward pass.

Отдалеченият извод има твърд таван

Цикълът от 20 до 485 ms е на модела, а пътуванията по публичния интернет добавят към него. Отдалеченият извод е жизнеспособен за бавно вземане и поставяне (pick-and-place), но не и за бързо реактивно движение. Ако задачата ви изисква скорост, изводът е до сервомоторите: ACT или SmolVLA, локално. Свързано: политиката замръзва по средата на движението.

Един начин да спестите време без да променяте модела: документът SmolVLA измерва синхронно изпълнение, при което политиката завършва един сегмент преди да предскаже следващия, спрямо асинхронно, при което предсказването се припокрива с изпълнението. Успехът е сходен, 78.3 срещу 73.3, но същото вземане и поставяне (pick-and-place) отнема 9.7 секунди вместо 13.75, и в фиксиран прозорец роботът управлява 19 цикъла вместо 9.

Лицензи, проверени, защото никой не ги проверява

МоделЛиценз за теглаЛиценз за кодТърговска употреба
GR00T N1.7NVIDIA Open Model License; картата позволява търговска употребаApache 2.0да
GR00T N1.5NVIDIA еднопосочен нетърговски лицензApache 2.0не
Pi0.5метаданните на картата pi05_base гласят license: gemmaApache 2.0 (openpi, LeRobot docs)прочетете и двете, те не съвпадат
SmolVLAняма поле за лиценз на картата smolvla_baseApache 2.0 (LeRobot)код да, теглата не са посочени
ACTняма базови теглаApache 2.0 (LeRobot)да

Редът за Pi0.5 изисква внимание. Документацията на LeRobot pi05 посочва Apache 2.0, съвместим с openpi, докато картата на Hub за lerobot/pi05_base съдържа license: gemma. И двете са активни. GR00T N1.7 има по-мека версия: README файлът на Isaac-GR00T споменава между другото, че N1.7 е напълно лицензируем за търговска употреба под Apache 2.0, докато собствената му секция за лиценз и картата на модела поставят само кода под Apache 2.0, а теглата под NVIDIA Open Model License.

Настройките по подразбиране, които всъщност ще използвате

Всяка форма на обучител идва с настройки по подразбиране и те не са произволни. На ACT са собствени на LeRobot: пакет 8, lr 1e-5, 100000 стъпки на обучение, chunk size 100, съответстващи на ACTConfig нагоре по веригата и k=100 от ACT документа. Една колона по-долу е капан.

ПолитикаПакетLRМакс. стъпкиНатрупване на градиентПрилага ли се?Допълнителни настройки
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Възпроизводимост, от август 2026 г.

Входната точка за фино настройване на GR00T (launch_finetune.py, tyro CLI) няма поле за seed в своя config dataclass, така че изпълненията не са възпроизводими бит по бит. Репозиторито също предупреждава за 5 до 6 процента отклонение между изпълненията от недетерминистични аугментации на изображения, по-голямо от повечето разлики в бенчмарковете, обсъждани онлайн. На LeRobot стандартният seed е 1000. Колоната за натрупване на градиент описва lerobot 0.5.1; версия 0.6.2 нагоре по веригата го излага като --accelerator.gradient_accumulation.steps.

Настройката, която е по-важна от избора на модел

Това е блокът с действия. По-дългите блокове осигуряват по-плавно движение и по-малко натрупващи се грешки, но политиката е фиксирана, докато блокът се изпълнява, така че реагира късно на всичко, което се движи: уверена е при статичен куб, безнадеждна при търкалящ се такъв. Ако превиши целта, скъсяването на изпълнената част е по-добро от преобучение и е безплатно. Става, което спира преждевременно, е различен проблем; вижте .

  • ACT: ACTConfig по подразбиране е chunk_size 100 и n_action_steps 100. Временното ансамблиране е изключено и изисква n_action_steps 1.
  • GR00T N1.7: вътрешният хоризонт е променен от 16 на 40, но примерът SO-101 на LeRobot все още работи с --policy.chunk_size=16 --policy.n_action_steps=16. Флагът за разгръщане е преименуван на --execution-horizon.
  • Pi0.5: блок от 50 стъпки, от които рецептата LIBERO на LeRobot изпълнява 10 чрез --policy.n_action_steps=10; с --policy.pretrained_path се връща към 50, ако пропуснете флага.
  • SmolVLA: блокове от 50 действия, като и двете настройки са достъпни.

Как да прегледате всичките пет за един следобед

Най-евтиният отговор не е повече четене. Похарчете около 15 USD и оставете ръката да ви каже: запишете веднъж, обучете евтиния модел първо, ескалирайте, след като данните се докажат като надеждни. Структурата е по-важна от обема, това е смисълът на и на .

  1. 1
    Запишете 50 епизода еднократно

    Петдесет разчистват пътя за GR00T, Pi0.5 и ACT, и 30 на SmolVLA. Повторете всяка вариация, вместо да се разпростирате твърде много: 50 епизода в 5 позиции на куб, обучени там, където 25 не са. Вижте записване на първия ви набор от данни.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Обучете ACT първо, защото не може да ви излъже

    Без предварително обучени тегла, така че ако изобщо изпълнява задачата, вашият набор от данни съдържа задачата. Ако ACT не показва прогрес, коригирайте данните. 1 до 3 USD, 2 до 5 часа на 24 GB карта.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Изпълнете SmolVLA върху същия набор от данни, непроменен

    Същите данни, същата ръка, 450 M параметри вместо 80 M, плюс езиково кондициониране. LeRobot оценява изпълнение от 20K стъпки на приблизително 4 часа на един A100. Това е, което ви казва дали предварителното обучение носи някаква полза.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Конвертирайте до v2.1, преди да използвате GR00T

    GR00T чете вариант на формата LeRobot v2 плюс допълнителен meta/modality.json, който картографира как конкатенираните масиви от състояния и действия се разделят на именувани полета. Набор от данни v3.0 срива този зареждач, защото v3.0 пакетира много епизоди в споделени файлове, докато v2 записваше по един на епизод. Isaac-GR00T предоставя помощника за понижаване на версията като scripts/lerobot_conversion/convert_v3_to_v2.py; страницата за отхвърляне на v3 е бързият път.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Преминете към GR00T N1.7 само ако първите две не са дали оптимални резултати

    Чрез CLI на NVIDIA, показан тук, или типа политика groot на LeRobot. NVIDIA препоръчва 40 GB или повече VRAM за фино настройване, 16 GB за инференция. При OOM, вижте страницата за OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Два начина за изпълнение на този скрининг

Три среди, защото инструментариумите не съществуват едновременно. LeRobot на main е 0.6.2 и изисква Python 3.12 или по-нова; Isaac-GR00T и openpi са отделни uv-управлявани хранилища.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T фиксира torchcodec 0.8.0 като единствения си видео бекенд, изискващ FFmpeg 4 до 7. FFmpeg 8 не се поддържа, AV1 не е гарантиран.
  • Минимални изисквания за памет на openpi: инференция над 8 GB, LoRA над 22.5 GB, пълно фино настройване над 70 GB. Последното е причината Pi0.5 да е задача за A100.
  • Наемете GPU сами, унищожете го след това, съгласувайте три набора от пътища до контролни точки на ръка.

Фундаментален модел или от нулата

Истинската дилема не е кой 3 B модел да изберете. Тя е дали изобщо да използвате предварително обучен VLA, като се има предвид, че ACT научи шест реални бимануални задачи от около десет минути демонстрации всяка, с 80 M параметъра и нищо предварително обучено.

Фина настройка на предварително обучен VLA вместо обучение на ACT от нулата
Какво печелите
  • Езиково обуславяне. ACT няма такова; един ACT checkpoint изпълнява една задача.
  • По-добро при обекти, липсващи във вашите демонстрации: на SO-101, 50% срещу 40% на ACT извън разпределението.
  • Многозадачност изобщо: SmolVLA достига 78.3% в три SO-100 задачи с един checkpoint; ACT е изпълняван само еднозадачно.
Какво ви струва
  • 7.6x до 24x по-голяма латентност: 152 до 485 ms на стъпка на действие срещу 20 ms на ACT.
  • 4 до 12 USD на изпълнение вместо 1 до 3, и ниво A100 вместо всяка 24 GB карта.
  • Излагане на лицензи, плюс режим на отказ на gated-repo, който не съществува при обучение от нулата.
  • Предварително обучените тегла могат да маскират лош набор от данни. Фина настройка, която работи наполовина с повредени данни, струва седмица, преди да разгледате данните.

Случаят с възпроизвеждане на старо изпълнение

Преследването на checkpoint от 2025 г. прави избора на модел вместо вас и превръща проблема във фиксиране на версия: текущият LeRobot отхвърля N1.5, така че вие фиксирате lerobot==0.5.1. Без поле за seed и с 5 до 6 процента вариация между изпълненията, възпроизвеждането е приблизително по конструкция. и имат платформата.

Страницата за директно сравнение на AY-Robots за GR00T N1.7 срещу Pi0.5, показваща брой параметри, изисквания за GPU, латентност на извода, формат на набора от данни и минимален брой епизоди едно до друго
Директно сравнение на /compare/groot-n1-7-vs-pi0-5. Двата 3 B модела изглеждат взаимозаменяеми в спецификационния лист, но не са: единият изисква LeRobot v2.1, другият – v3.0.

Сведени до два? ACT срещу GR00T N1.7 и GR00T N1.7 срещу SmolVLA. Необработените редове се намират в записите на арената: GR00T N1.7, Pi0.5, SmolVLA и ACT.

Къде тази платформа не ви помага

  • Тя не може да ускори отдалечения извод. Цикълът от 20 до 485 ms принадлежи на модела; интернет пътуванията добавят към него.
  • Тя не може да фино настрои GR00T или Pi0.5 на вашия собствен хардуер. И двете са само в облак тук; само SmolVLA и ACT работят локално.
  • Тя не може да поправи набор от данни. Загубата намалява, но политиката не прави нищо е проблем с данните, политика, която работи само в една настройка е проблем с покритието.
  • Тя не може да направи изпълненията на GR00T възпроизводими: конфигурацията нагоре по веригата няма поле за seed.

85 модела, 332 резултата от бенчмаркове, всяко число свързано с източника си

Подреждаемата версия на таблиците на тази страница: 85 модела за визия-език-действие, 332 резултата от бенчмаркове, всеки свързан обратно към съответния документ или моделна карта.

Отворете арената

Избиране на един и продължаване напред

Една настройка по подразбиране: запишете 50 епизода, обучете ACT за 1 до 3 USD, за да докажете набора от данни, след това SmolVLA върху същите данни. Заедно под 6 USD, и те отговарят на въпроса, който е от значение: дали предварителното обучение помага тук, или дали проблемът е в данните. Преминете към GR00T N1.7 за многостъпкови задачи с интензивен контакт, към Pi0.5, когато сцената се променя.

Преглед на платформата: обучете първата си политика, след това стартирайте първата си политика. документацията за обучение и документацията за набори от данни покриват формата и форматирането; страницата на SO-100 и пълното ръководство за SO-100 покриват изграждането и калибрирането. Предистория: общият преглед на VLA и статията за Pi0 flow-matching. Този, който ще повиши процента ви на успех, е ръководството за качество на данните.

Коя VLA политика трябва да тренирам първо на SO-100?

ACT, след това SmolVLA. ACT тренира от нулата, така че не може да прикрие лош набор от данни, а едно изпълнение струва 1 до 3 USD на 24 GB карта. Ако ACT изобщо изпълни задачата, 4 до 12 USD за изпълнение на GR00T N1.7 или Pi0.5 няма да бъдат пропилени.

GR00T N1.7 наистина ли е по-добър от Pi0.5?

На LIBERO те са в рамките на шума: 97.0% в четири пакета за GR00T N1.7, 96.85% за Pi0.5 при 30k стъпки в openpi, 97.5% за порта на LeRobot, всички от различни тестови среди. Реалните разлики са 152 ms на стъпка на действие срещу 485 ms, набори от данни v2.1 срещу v3.0 и точност на бенчмарка срещу обобщение в отворен свят.

Мога ли да фино настроя някой от тези на една RTX 4090?

SmolVLA и ACT, да; и двете са посочени за RTX 4090 или всяка 24 GB карта и работят локално. GR00T N1.7, N1.5 и Pi0.5 се нуждаят от A100 или H100 80 GB и тук са само за облак. NVIDIA препоръчва 40 GB или повече за фино настройване на GR00T; минималното изискване на openpi е над 70 GB за пълно фино настройване на Pi0.5, 22.5 GB за LoRA.

Кои от тези пет мога да използвам комерсиално?

Тежестите на GR00T N1.7 са под NVIDIA Open Model License Agreement, което според картата покрива търговска употреба. Тежестите на N1.5 са нетърговски. Кодът на SmolVLA е Apache 2.0 в LeRobot, но картата lerobot/smolvla_base не съдържа поле за лиценз, така че тежестите са неуточнени. ACT няма базови тежести за лицензиране. Pi0.5 е двусмислен: документацията на LeRobot казва Apache 2.0, метаданните на картата му гласят license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started