Таблиця порівняння політик AY-Robots, що показує GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA та ACT поруч із кількістю параметрів, рівнем GPU, затримкою висновку та мінімальною кількістю епізодів
vla-моделінавчання-політикивибір-моделіlerobotso-100

Яку політику VLA варто тренувати у 2026 році?

AY-Robots ResearchAugust 23, 202618 хв читання

GR00T N1.7, Pi0.5, SmolVLA, ACT чи GR00T N1.5? Таблиця рішень, адаптована до реальних ситуацій, з опублікованими бенчмарками, затримкою, вартістю за запуск та ліцензіями для кожного вибору.

Сьогодні на маніпуляторі класу SO-100 можна навчити п'ять політик. Вони відрізняються в 24 рази за затримкою висновку, в 37 разів за кількістю параметрів і в 12 разів за вартістю запуску, а також за тим, чи можете ви відвантажувати результат. П'ять карток моделей не вирішать це питання: жодна з них не відповідає на ваше запитання, яку з них запускати першою?

Кожне число нижче було взято з документів, репозиторіїв та карток у серпні 2026 року. Номери платформ походять з каталогу політик AY-Robots; якщо вони не збігаються, показані обидва.

Коротка версія

  • Навчайте ACT першим, якщо сумніваєтеся у своєму наборі даних: 1-3 USD за запуск, нічого попередньо навченого, щоб приховати погані дані.
  • GR00T N1.7 та Pi0.5 знаходяться в межах півбала на LIBERO, 97.0 проти 96.85 до 97.5. Це не є причиною вибирати будь-який з них.
  • Pi0.5 — це гра на узагальнення, а не на точність, і найповільніший з показником 485 мс.
  • SmolVLA, з 450 мільйонами параметрів, є єдиним VLA тут, який донавчається на одній 24 ГБ карті.
  • ACT з 20 мс є єдиним варіантом для швидкого реактивного руху. Ліцензії вирішують решту.

Таблиця рішень

Ваша ситуаціяНавчіть цеЧому
Якість набору даних неперевіренаACTНіщо попередньо навчене не приховає пошкоджений набір даних, а невдача коштує від 1 до 3 USD.
Багатоконтактний, багатоетапний, мовно-обумовленийGR00T N1.797.0% у чотирьох наборах LIBERO, плюс відносний простір дій кінцевого ефектора.
Швидкий реактивний рух, висновок на сервоприводахACT20 мс. Наступний найшвидший у 7.6 разів повільніший.
Нові об'єкти, нова сцена, відкритий світPi0.5Створено для поведінки поза розподілом, у до 104 локаціях.
Одна карта на 24 ГБ, все ще потрібна моваSmolVLA450 М параметрів, мінімум 30 епізодів, працює локально.
Відтворення запуску, записаного у 2025 роціGR00T N1.5Тільки якщо необхідно: LeRobot тепер відхиляє його, ваги некомерційні.
Це буде випущено як продуктN1.7, SmolVLA or ACTN1.5 є некомерційним, Pi0.5 має умови Gemma, карта SmolVLA не вказує жодних.

П'ять кандидатів

Усі п'ять є політиками: кадри з камери, позиції суглобів і, для чотирьох з них, мовна інструкція, відображена на фрагмент майбутніх цілей суглобів. Що їх відрізняє, так це те, скільки було вивчено до вашого прибуття.

ПолітикаПараметриЗатримкаРівень GPUЛокально?Мін. епізодівФорматВартість
ACT~80 M20 ms24 GB cardтак50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardтак30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBні50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBні50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBні50v3.04 to 12 USD

GR00T N1.7

Поточна візуально-мовна модель дій, близько 3 мільярдів параметрів, приблизно 40 мільйонів навчено під час доналаштування. Репозиторій перераховує відмінності від N1.6: архітектура з моделі Eagle від постачальника до Cosmos-Reason2-2B на Qwen3-VL, шари дифузії з 32 до 16, розмірності стану та дії з 29 до 132, горизонт дії з 16 до 40.

Що важливо для невеликого маніпулятора, так це відносний простір дій кінцевого ефектора: N1.7 прогнозує дельти від поточної пози, що дозволяє перенести 20 тисяч годин людського відео EgoScale в політику робота. Специфікація на сторінці N1.7, процедура в посібнику N1.7 на SO-100.

GA в репозиторії, EA на картці моделі

Файл README Isaac-GR00T оголошує N1.7 a загальнодоступним випуском, з повними бенчмарками та підтримкою. Його картка Hugging Face ще не оновилася: поле Версія моделі все ще показує GR00T N1.7 EA. Репозиторій є новішим документом.

GR00T N1.5

Та ж шкала 3 B, основа Eagle 2, SigLip2 та T5, голова DiT з flow-matching. Вона існує для розширення яку ви вже маєте. Дві речі роблять її поганим варіантом за замовчуванням: ваги мають односторонню некомерційну ліцензію NVIDIA, а поточні випуски LeRobot видалили підтримку N1.5. Дивіться .

Pi0.5

Від Physical Intelligence VLA, тип політики pi05. У статті описано 2 B VLM, ініціалізовану з PaliGemma, плюс 300 M експерта з дій, що керує роботом на частоті 50 Гц; конфігурація pi05 LeRobot за замовчуванням використовує 50-кроковий фрагмент, одну секунду з такою швидкістю. Перевага полягає в невідомих місцях: близько 400 годин мобільної маніпуляції в реальних будинках, а також дослідження масштабування понад 3, 12, 22, 53, 82 та 104 локаціях, де модель зі 104 локаціями відповідала контролю, навченому на самих тестових будинках.

Одне обмеження, зазначене на lerobot/pi05_base картці: порт передає лише головку відповідності потоку. Прогнозування підзадач, токенізація дій та RL не були випущені вище за течією, і openpi заявляє те саме про власний репозиторій. Сторінка Pi0.5 та посібник Pi0.5 на SO-100 містять решту інформації.

Пастка, що з'їдає пообіддя: закриті репозиторії

Pi0.5 потребує закритий google/paligemma-3b-pt-224 токенізатор (gated: manual, хоча Google заявляє, що запити обробляються негайно). Без його прийняття та запуску hf auth login у середовищі навчання, завдання запускається, завантажується деякий час, а потім завершується помилкою авторизації, яка виглядає як збій мережі. nvidia/GR00T-N1.7-3B не є закритим, але його nvidia/Cosmos-Reason2-2B основа є (gated: auto). Очистіть обидва перед постановкою в чергу; якщо запуск простоює, сторінка застряглої черги перераховує, що перевірити.

SmolVLA

450 мільйонів параметрів, близько 100 мільйонів у експерті дій, на SmolVLM-2 із замороженим VLM і використанням лише його перших 16 шарів мовної моделі. Попереднє навчання базувалося на даних спільноти: 481 набір даних, 10.6 мільйонів кадрів, з тих самих дешевих маніпуляторів, які ви використовуєте. Єдиний VLA тут, що поміщається на одну 24 ГБ картку, і єдиний з 30 епізод підлоги. Дивіться сторінку SmolVLA.

ACT

Не є базовою моделлю. Action Chunking Transformer від ALOHA має близько 80 мільйонів параметрів, навчених з нуля для кожного завдання, на 50 демонстраціях зі швидкістю 50 Гц. У статті повідомляється про шість реальних бімануальних завдань, кожне з яких базується приблизно на десяти хвилинах демонстрацій, з успішністю від 80 до 90 відсотків на прикладах, які вона висвітлює. Її ідея, розбиття дій на фрагменти, присутня в кожній моделі на цій сторінці, і її абляція все ще найкраще вимірює ефект: у двох симульованих завданнях з вимкненим часовим ансамблюванням успішність зростає з 1 відсотка при k=1 до 44 відсотків при k=100. Сторінка ACT містить решту.

Що насправді говорять бенчмарки

LIBERO — це єдиний бенчмарк, про який повідомляють три з цих п'яти: мовно-орієнтовані завдання на симульованому Franka Panda, розділені на чотири набори по десять завдань у кожному. NVIDIA провела 200 випробувань для кожного набору.

МодельПросторовийОб'єктЦіль10 (Довгий)Середній
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Ці рядки не є строго порівнянними

Кожне число походить з різних тестових наборів та бюджетів. GR00T виконав 20 тис. кроків з глобальним розміром пакету 640; показник openpi — це контрольна точка на 30 тис. кроків; порт LeRobot додав 6 тис. кроків до базової моделі LIBERO. SmolVLA є подальшою невідповідністю: його стаття тренує цей рядок на LIBERO з нуля, без попереднього навчання VLA, тоді як три моделі вище доналаштовують попередньо навчені контрольні точки. Розглядайте 96.85 до 97.5 як один кластер, а розрив до 87.3% як реальний, але досягнутий за рахунок 6.7-кратного збільшення параметрів.

SimplerEnv показує розкид, чого не робить LIBERO. NVIDIA порівнює N1.7 з N1.6, що є найближчим публічним аналогом поколіннєвої дельти.

Набір SimplerEnvСереднє N1.6Середнє N1.7Найкращий розмахНайгірший розмах
Bridge (WidowX), 7 завдань56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 завдань52.0%72.5%open_drawer 0.0 to 65.0немає, кожне завдання покращилося

Рядок Bridge є корисним: в середньому 5.7 балів було отримано, тоді як put_eggplant_in_basket втратив 36, а put_eggplant_in_sink впав з 33 до 2. Нове покоління зміщує розподіл, а не піднімає його, тому якщо ваше завдання знаходиться там, де N1.7 регресував, середнє значення нічого не говорить.

Таблиця лідерів арени AY-Robots, сортована таблиця з 85 моделей зору-мови-дії з 332 результатами бенчмарків, кожне значення пов'язане з документом або карткою моделі, з якої воно походить
Арена містить 85 моделей VLA та 332 результати бенчмарків, кожен з яких посилається на відповідну статтю або картку моделі. Корисно для перевірки, чи є реальним число, цитоване в дописі блогу.

З п'яти, лише стаття SmolVLA повідомляє про руку класу SO-100: 78.3 відсотка для SmolVLA та 61.7 для Pi0 за трьома завданнями, обидва багатозадачні, проти 48.3 для ACT, навченого на одному завданні, що не є порівнянним. Чисте порівняння — це обидва однозадачні на SO-101 pick-and-place: 90 проти 70 у розподілі, 50 проти 40 поза ним. Порівняйте на ACT against SmolVLA та Pi0.5 against SmolVLA, або перегляньте арену.

Затримка та вартість визначають розгортання

Затримка висновку — це обмеження, яке люди виявляють останнім і шкодують про нього першим. Політика, яка на п'ять пунктів краща за бенчмарком, але займає пів секунди на крок дії, виглядає гірше на вашому столі: динаміка контакту не чекає.

Одне застереження: показник GR00T не збігається з даними карти NVIDIA, яка вимірює 4 кроки шумозаглушення та одну камеру за 85.8 ms на H100 в eager mode, 48.6 ms з torch.compile, 27.9 ms через повний TensorRT. 152 ms тут — це показник для всього стеку з накладними витратами на обслуговування та більш ніж однією камерою, а не лише прямий прохід.

Віддалений висновок має жорстку межу

Цикл від 20 до 485 ms належить моделі, і до нього додаються затримки від обміну даними через публічний інтернет. Віддалений висновок є життєздатним для повільних операцій типу «взяти-покласти», але не для швидких реактивних рухів. Якщо ваше завдання потребує швидкості, висновок знаходиться поруч із сервоприводами: ACT або SmolVLA, локально. Пов'язано: політика зависає під час руху.

Один зі способів виграти час без зміни моделі: у статті SmolVLA вимірюється синхронне виконання, де політика завершує один фрагмент перед прогнозуванням наступного, порівняно з асинхронним, де прогнозування перекривається з виконанням. Успішність схожа, 78.3 проти 73.3, але та сама операція «взяти-покласти» займає 9.7 секунд замість 13.75, і в фіксованому вікні робот виконує 19 циклів замість 9.

Ліцензії, перевірені, бо їх ніхто не перевіряє

МодельЛіцензія на вагиЛіцензія на кодКомерційне використання
GR00T N1.7NVIDIA Open Model License; картка дозволяє комерційне використанняApache 2.0так
GR00T N1.5Одностороння некомерційна ліцензія NVIDIAApache 2.0ні
Pi0.5метадані картки pi05_base містять ліцензію: gemmaApache 2.0 (openpi, LeRobot docs)прочитайте обидва, вони суперечать
SmolVLAнемає поля ліцензії на картці smolvla_baseApache 2.0 (LeRobot)код так, ваги не вказані
ACTбазові ваги відсутніApache 2.0 (LeRobot)так

Рядок Pi0.5 потребує уваги. Документація LeRobot pi05 вказує Apache 2.0, що відповідає openpi, тоді як картка Hub для lerobot/pi05_base містить license: gemma. Обидва дійсні. GR00T N1.7 має м'якшу версію: README Isaac-GR00T побіжно зазначає, що N1.7 повністю ліцензується для комерційного використання за Apache 2.0, тоді як його власний розділ ліцензії та картка моделі відносять лише код під Apache 2.0, а ваги під NVIDIA Open Model License.

Налаштування за замовчуванням, які ви фактично використовуватимете

Кожна форма тренера постачається зі значеннями за замовчуванням, і вони не є довільними. Значення ACT є власними для LeRobot: batch 8, lr 1e-5, 100000 кроків навчання, chunk size 100, що відповідає ACTConfig upstream та k=100 from the ACT paper. Один стовпець нижче є пасткою.

ПолітикаПакетLRМакс. кроківНакопичення градієнтаЗастосовується?Додаткові параметри
GR00T N1.7321e-4200001такsaveSteps
GR00T N1.511e-5200016такsaveSteps
Pi0.515e-53000016ні (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008ніseed, logFreq
ACT81e-51000001ніchunkSize, nActionSteps, seed, logFreq
Відтворюваність, станом на серпень 2026

Точка входу для доналаштування GR00T (launch_finetune.py, CLI tyro) не має поля seed у своєму класі даних конфігурації, тому запуски не є побітово відтворюваними. Репозиторій також попереджає про 5-6 відсотків відхилення між запусками через недетерміновані аугментації зображень, що більше, ніж більшість розривів у бенчмарках, які обговорюються онлайн. Значення seed за замовчуванням для LeRobot становить 1000. Стовпець grad-accum описує lerobot 0.5.1; upstream 0.6.2 надає його як --accelerator.gradient_accumulation.steps.

Параметр, який має більше значення, ніж вибір моделі

Це блок дій. Довші блоки забезпечують плавніший рух і менше накопичувальних помилок, але політика фіксується під час виконання блоку, тому вона реагує із запізненням на все, що рухається: впевнено на статичному кубі, безнадійно на тому, що котиться. Якщо він перевищує ціль, скорочення виконаної частини краще, ніж перенавчання, і є безкоштовним. Суглоб, який зупиняється раніше, є іншою проблемою; дивіться .

  • ACT: ACTConfig за замовчуванням використовує chunk_size 100 та n_action_steps 100. Темпоральне ансамблювання вимкнено і вимагає n_action_steps 1.
  • GR00T N1.7: внутрішній горизонт збільшився з 16 до 40, проте LeRobot приклад SO-101 все ще запускається з --policy.chunk_size=16 --policy.n_action_steps=16. Прапор розгортання було перейменовано на --execution-horizon.
  • Pi0.5: 50-кроковий блок, з якого LeRobot рецепт LIBERO виконує 10 через --policy.n_action_steps=10; з --policy.pretrained_path він повертається до 50, якщо ви опустите прапор.
  • SmolVLA: 50-крокові блоки дій, обидва параметри доступні.

Як перевірити всі п'ять за один день

Найдешевша відповідь — не більше читання. Витратьте близько 15 USD і дозвольте руці розповісти вам: запишіть один раз, спочатку навчіть дешеву модель, масштабуйте, як тільки вона доведе достовірність даних. Структура перемагає обсяг, у цьому суть та .

  1. 1
    Запишіть 50 епізодів один раз

    П'ятдесят епізодів звільняють місце для GR00T, Pi0.5 та ACT, а також 30 епізодів для SmolVLA. Повторюйте кожну варіацію, а не розпилюйтесь: 50 епізодів для 5 позицій куба, де 25 не були навчені. Дивіться запис вашого першого набору даних.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Навчіть ACT спочатку, тому що він не може вам брехати

    Без попередньо навчених ваг, тому якщо модель взагалі виконує завдання, ваш набір даних містить це завдання. Якщо ACT не дає результатів, виправте дані. 1 до 3 USD, 2 до 5 годин на карті 24 ГБ.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Запустіть SmolVLA на тому ж наборі даних, без змін

    Ті ж дані, та ж рука, 450 мільйонів параметрів замість 80 мільйонів, плюс мовне кондиціонування. LeRobot оцінює запуск на 20 тисяч кроків приблизно в 4 години на одному A100. Це показує, чи дає попереднє навчання якісь переваги.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Конвертуйте до v2.1, перш ніж використовувати GR00T

    GR00T читає варіант формату LeRobot v2 плюс додатковий файл meta/modality.json, який відображає, як об'єднані масиви стану та дії розділяються на іменовані поля. Набір даних v3.0 призводить до збою цього завантажувача, оскільки v3.0 пакує багато епізодів у спільні файли, тоді як v2 записував один файл на епізод. Isaac-GR00T постачає помічник для пониження версії як scripts/lerobot_conversion/convert_v3_to_v2.py; сторінка відхилення v3 є швидким шляхом.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Переходьте до GR00T N1.7 лише якщо перші два варіанти не дали повного результату

    Через CLI NVIDIA, показаний тут, або тип політики LeRobot groot. NVIDIA рекомендує 40 ГБ або більше VRAM для доналаштування, 16 ГБ для інференсу. У разі OOM дивіться сторінку OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Два способи виконати цей скринінговий прохід

Три середовища, оскільки набори інструментів не співіснують. LeRobot на main має версію 0.6.2 і потребує Python 3.12 або новішої; Isaac-GR00T та openpi є окремими репозиторіями, керованими uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T фіксує torchcodec 0.8.0 як єдиний відео-бек-енд, що потребує FFmpeg 4 до 7. FFmpeg 8 не підтримується, AV1 не гарантується.
  • Мінімальні вимоги до пам'яті openpi: інференс понад 8 ГБ, LoRA понад 22.5 ГБ, повне доналаштування понад 70 ГБ. Остання причина, чому Pi0.5 є завданням для A100.
  • Орендуйте GPU самостійно, знищіть його після використання, вручну узгодьте три набори шляхів до контрольних точок.

Фундаментальна модель або з нуля

Справжня дилема не в тому, яку модель 3 B обрати. Вона полягає в тому, чи варто взагалі використовувати попередньо навчену VLA, враховуючи, що ACT навчилася шести реальних бімануальних завдань приблизно за десять хвилин демонстрацій кожне, з 80 М параметрами та без попереднього навчання.

Доопрацювання попередньо навченої VLA замість навчання ACT з нуля
Що ви отримуєте
  • Мовне кондиціонування. ACT його не має; один чекпоінт ACT виконує одне завдання.
  • Краще працює з об'єктами, відсутніми у ваших демонстраціях: на SO-101, 50% проти 40% у ACT поза розподілом.
  • Багатозадачність взагалі: SmolVLA досягає 78.3% у трьох завданнях SO-100 з одним чекпоінтом; ACT запускався лише для одного завдання.
Що це вам коштує
  • Затримка в 7.6x до 24x: від 152 до 485 мс на крок дії проти 20 мс у ACT.
  • Від 4 до 12 USD за запуск замість 1 до 3, і рівень A100 замість будь-якої карти на 24 ГБ.
  • Ризик ліцензійних обмежень, плюс режим відмови через закритий репозиторій, якого не існує при розробці з нуля.
  • Попередньо навчені ваги можуть маскувати поганий набір даних. Доопрацювання, яке працює наполовину на пошкоджених даних, коштує тиждень, перш ніж ви подивитеся на дані.

Випадок відтворення старого запуску

Погоня за чекпоінтом 2025 року робить вибір моделі за вас і перетворює проблему на фіксацію версії: поточний LeRobot відхиляє N1.5, тому ви фіксуєте lerobot==0.5.1. Без поля seed і з 5-6 відсотками варіації між запусками, відтворення є приблизним за своєю природою. та мають сторону платформи.

Сторінка порівняння AY-Robots для GR00T N1.7 проти Pi0.5, що показує кількість параметрів, вимоги до GPU, затримку висновків, формат набору даних та мінімальну кількість епізодів поруч.
Порівняння на /compare/groot-n1-7-vs-pi0-5. Дві моделі 3 B виглядають взаємозамінними в специфікації, але це не так: одна вимагає LeRobot v2.1, інша — v3.0.

Залишилося два? ACT проти GR00T N1.7 та GR00T N1.7 проти SmolVLA. Необроблені дані знаходяться в записах арени: GR00T N1.7, Pi0.5, SmolVLA та ACT.

У чому ця платформа не допоможе вам

  • Вона не може прискорити віддалений висновок. Цикл від 20 до 485 ms належить моделі; інтернет-запити додають до нього час.
  • Вона не може доналаштувати GR00T або Pi0.5 на вашому власному обладнанні. Обидві тут працюють лише в хмарі; лише SmolVLA та ACT запускаються локально.
  • Вона не може виправити набір даних. Втрати падають, але політика нічого не робить — це проблема даних, політика, яка працює лише в одному налаштуванні — це проблема покриття.
  • Вона не може зробити запуски GR00T відтворюваними: конфігурація вихідного коду не має поля seed.

85 моделей, 332 результати бенчмарків, кожне число посилається на джерело

Сортована версія таблиць на цій сторінці: 85 моделей «зір-мова-дія», 332 результати бенчмарків, кожен з яких посилається на відповідну статтю або картку моделі.

Відкрити арену

Вибір одного та рух далі

Один стандартний варіант: запишіть 50 епізодів, навчіть ACT за 1-3 USD, щоб перевірити набір даних, потім SmolVLA на тих самих даних. Разом менше 6 USD, і вони відповідають на важливе питання: чи допомагає попереднє навчання тут, чи чи вузьким місцем є дані. Переходьте до GR00T N1.7 для багатоетапних завдань з інтенсивним контактом, до Pi0.5, коли змінюється сцена.

Огляд платформи: навчіть свою першу політику, потім запустіть свою першу політику. Документація з навчання та документація з наборів даних охоплюють форму та формат; сторінка SO-100 та повний посібник SO-100 охоплюють збірку та калібрування. Довідкова інформація: огляд VLA та стаття про Pi0 flow-matching. Той, що підвищить ваш показник успішності, це посібник з якості даних.

Яку політику VLA мені слід тренувати першою на SO-100?

ACT, потім SmolVLA. ACT тренується з нуля, тому не може приховати поганий набір даних, а запуск коштує від 1 до 3 USD на карті 24 ГБ. Якщо ACT взагалі виконує завдання, то 4-12 USD за запуск GR00T N1.7 або Pi0.5 не будуть витрачені даремно.

Чи дійсно GR00T N1.7 кращий за Pi0.5?

На LIBERO вони знаходяться в межах шуму: 97.0% у чотирьох наборах для GR00T N1.7, 96.85% для Pi0.5 на 30 тис. кроків в openpi, 97.5% для порту LeRobot, усі з різних тестових стендів. Справжні відмінності полягають у 152 ms на крок дії проти 485 ms, наборах даних v2.1 проти v3.0, та точності бенчмарку проти узагальнення в реальному світі.

Чи можу я доналаштувати будь-яку з них на одній RTX 4090?

SmolVLA та ACT, так; обидва вказані для RTX 4090 або будь-якої карти 24 GB і працюють локально. GR00T N1.7, N1.5 та Pi0.5 потребують A100 або H100 80 GB і тут доступні лише в хмарі. NVIDIA рекомендує 40 GB або більше для доналаштування GR00T; мінімальні вимоги openpi перевищують 70 GB для повного доналаштування Pi0.5, 22.5 GB для LoRA.

Які з цих п'яти я можу використовувати комерційно?

Ваги GR00T N1.7 підпадають під ліцензійну угоду NVIDIA Open Model License Agreement, яка, як зазначено на картці, охоплює комерційне використання. Ваги N1.5 є некомерційними. Код SmolVLA є Apache 2.0 в LeRobot, але картка lerobot/smolvla_base не містить поля ліцензії, тому ваги не вказані. ACT не має базових ваг для ліцензування. Pi0.5 є неоднозначним: документація LeRobot вказує Apache 2.0, а метадані його картки містять license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started