
GR00T N1.7, Pi0.5, SmolVLA, ACT чи GR00T N1.5? Таблиця рішень, адаптована до реальних ситуацій, з опублікованими бенчмарками, затримкою, вартістю за запуск та ліцензіями для кожного вибору.
Сьогодні на маніпуляторі класу SO-100 можна навчити п'ять політик. Вони відрізняються в 24 рази за затримкою висновку, в 37 разів за кількістю параметрів і в 12 разів за вартістю запуску, а також за тим, чи можете ви відвантажувати результат. П'ять карток моделей не вирішать це питання: жодна з них не відповідає на ваше запитання, яку з них запускати першою?
Кожне число нижче було взято з документів, репозиторіїв та карток у серпні 2026 року. Номери платформ походять з каталогу політик AY-Robots; якщо вони не збігаються, показані обидва.
Коротка версія
- •Навчайте ACT першим, якщо сумніваєтеся у своєму наборі даних: 1-3 USD за запуск, нічого попередньо навченого, щоб приховати погані дані.
- •GR00T N1.7 та Pi0.5 знаходяться в межах півбала на LIBERO, 97.0 проти 96.85 до 97.5. Це не є причиною вибирати будь-який з них.
- •Pi0.5 — це гра на узагальнення, а не на точність, і найповільніший з показником 485 мс.
- •SmolVLA, з 450 мільйонами параметрів, є єдиним VLA тут, який донавчається на одній 24 ГБ карті.
- •ACT з 20 мс є єдиним варіантом для швидкого реактивного руху. Ліцензії вирішують решту.
Таблиця рішень
| Ваша ситуація | Навчіть це | Чому |
|---|---|---|
| Якість набору даних неперевірена | ACT | Ніщо попередньо навчене не приховає пошкоджений набір даних, а невдача коштує від 1 до 3 USD. |
| Багатоконтактний, багатоетапний, мовно-обумовлений | GR00T N1.7 | 97.0% у чотирьох наборах LIBERO, плюс відносний простір дій кінцевого ефектора. |
| Швидкий реактивний рух, висновок на сервоприводах | ACT | 20 мс. Наступний найшвидший у 7.6 разів повільніший. |
| Нові об'єкти, нова сцена, відкритий світ | Pi0.5 | Створено для поведінки поза розподілом, у до 104 локаціях. |
| Одна карта на 24 ГБ, все ще потрібна мова | SmolVLA | 450 М параметрів, мінімум 30 епізодів, працює локально. |
| Відтворення запуску, записаного у 2025 році | GR00T N1.5 | Тільки якщо необхідно: LeRobot тепер відхиляє його, ваги некомерційні. |
| Це буде випущено як продукт | N1.7, SmolVLA or ACT | N1.5 є некомерційним, Pi0.5 має умови Gemma, карта SmolVLA не вказує жодних. |
П'ять кандидатів
Усі п'ять є політиками: кадри з камери, позиції суглобів і, для чотирьох з них, мовна інструкція, відображена на фрагмент майбутніх цілей суглобів. Що їх відрізняє, так це те, скільки було вивчено до вашого прибуття.
| Політика | Параметри | Затримка | Рівень GPU | Локально? | Мін. епізодів | Формат | Вартість |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | так | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | так | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | ні | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | ні | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | ні | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Поточна візуально-мовна модель дій, близько 3 мільярдів параметрів, приблизно 40 мільйонів навчено під час доналаштування. Репозиторій перераховує відмінності від N1.6: архітектура з моделі Eagle від постачальника до Cosmos-Reason2-2B на Qwen3-VL, шари дифузії з 32 до 16, розмірності стану та дії з 29 до 132, горизонт дії з 16 до 40.
Що важливо для невеликого маніпулятора, так це відносний простір дій кінцевого ефектора: N1.7 прогнозує дельти від поточної пози, що дозволяє перенести 20 тисяч годин людського відео EgoScale в політику робота. Специфікація на сторінці N1.7, процедура в посібнику N1.7 на SO-100.
Файл README Isaac-GR00T оголошує N1.7 a загальнодоступним випуском, з повними бенчмарками та підтримкою. Його картка Hugging Face ще не оновилася: поле Версія моделі все ще показує GR00T N1.7 EA. Репозиторій є новішим документом.
GR00T N1.5
Та ж шкала 3 B, основа Eagle 2, SigLip2 та T5, голова DiT з flow-matching. Вона існує для розширення яку ви вже маєте. Дві речі роблять її поганим варіантом за замовчуванням: ваги мають односторонню некомерційну ліцензію NVIDIA, а поточні випуски LeRobot видалили підтримку N1.5. Дивіться .
Pi0.5
Від Physical Intelligence VLA, тип політики pi05. У статті описано 2 B VLM, ініціалізовану з PaliGemma, плюс 300 M експерта з дій, що керує роботом на частоті 50 Гц; конфігурація pi05 LeRobot за замовчуванням використовує 50-кроковий фрагмент, одну секунду з такою швидкістю. Перевага полягає в невідомих місцях: близько 400 годин мобільної маніпуляції в реальних будинках, а також дослідження масштабування понад 3, 12, 22, 53, 82 та 104 локаціях, де модель зі 104 локаціями відповідала контролю, навченому на самих тестових будинках.
Одне обмеження, зазначене на lerobot/pi05_base картці: порт передає лише головку відповідності потоку. Прогнозування підзадач, токенізація дій та RL не були випущені вище за течією, і openpi заявляє те саме про власний репозиторій. Сторінка Pi0.5 та посібник Pi0.5 на SO-100 містять решту інформації.
Pi0.5 потребує закритий google/paligemma-3b-pt-224 токенізатор (gated: manual, хоча Google заявляє, що запити обробляються негайно). Без його прийняття та запуску hf auth login у середовищі навчання, завдання запускається, завантажується деякий час, а потім завершується помилкою авторизації, яка виглядає як збій мережі. nvidia/GR00T-N1.7-3B не є закритим, але його nvidia/Cosmos-Reason2-2B основа є (gated: auto). Очистіть обидва перед постановкою в чергу; якщо запуск простоює, сторінка застряглої черги перераховує, що перевірити.
SmolVLA
450 мільйонів параметрів, близько 100 мільйонів у експерті дій, на SmolVLM-2 із замороженим VLM і використанням лише його перших 16 шарів мовної моделі. Попереднє навчання базувалося на даних спільноти: 481 набір даних, 10.6 мільйонів кадрів, з тих самих дешевих маніпуляторів, які ви використовуєте. Єдиний VLA тут, що поміщається на одну 24 ГБ картку, і єдиний з 30 епізод підлоги. Дивіться сторінку SmolVLA.
ACT
Не є базовою моделлю. Action Chunking Transformer від ALOHA має близько 80 мільйонів параметрів, навчених з нуля для кожного завдання, на 50 демонстраціях зі швидкістю 50 Гц. У статті повідомляється про шість реальних бімануальних завдань, кожне з яких базується приблизно на десяти хвилинах демонстрацій, з успішністю від 80 до 90 відсотків на прикладах, які вона висвітлює. Її ідея, розбиття дій на фрагменти, присутня в кожній моделі на цій сторінці, і її абляція все ще найкраще вимірює ефект: у двох симульованих завданнях з вимкненим часовим ансамблюванням успішність зростає з 1 відсотка при k=1 до 44 відсотків при k=100. Сторінка ACT містить решту.
Що насправді говорять бенчмарки
LIBERO — це єдиний бенчмарк, про який повідомляють три з цих п'яти: мовно-орієнтовані завдання на симульованому Franka Panda, розділені на чотири набори по десять завдань у кожному. NVIDIA провела 200 випробувань для кожного набору.
| Модель | Просторовий | Об'єкт | Ціль | 10 (Довгий) | Середній |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Кожне число походить з різних тестових наборів та бюджетів. GR00T виконав 20 тис. кроків з глобальним розміром пакету 640; показник openpi — це контрольна точка на 30 тис. кроків; порт LeRobot додав 6 тис. кроків до базової моделі LIBERO. SmolVLA є подальшою невідповідністю: його стаття тренує цей рядок на LIBERO з нуля, без попереднього навчання VLA, тоді як три моделі вище доналаштовують попередньо навчені контрольні точки. Розглядайте 96.85 до 97.5 як один кластер, а розрив до 87.3% як реальний, але досягнутий за рахунок 6.7-кратного збільшення параметрів.
SimplerEnv показує розкид, чого не робить LIBERO. NVIDIA порівнює N1.7 з N1.6, що є найближчим публічним аналогом поколіннєвої дельти.
| Набір SimplerEnv | Середнє N1.6 | Середнє N1.7 | Найкращий розмах | Найгірший розмах |
|---|---|---|---|---|
| Bridge (WidowX), 7 завдань | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 завдань | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | немає, кожне завдання покращилося |
Рядок Bridge є корисним: в середньому 5.7 балів було отримано, тоді як put_eggplant_in_basket втратив 36, а put_eggplant_in_sink впав з 33 до 2. Нове покоління зміщує розподіл, а не піднімає його, тому якщо ваше завдання знаходиться там, де N1.7 регресував, середнє значення нічого не говорить.

З п'яти, лише стаття SmolVLA повідомляє про руку класу SO-100: 78.3 відсотка для SmolVLA та 61.7 для Pi0 за трьома завданнями, обидва багатозадачні, проти 48.3 для ACT, навченого на одному завданні, що не є порівнянним. Чисте порівняння — це обидва однозадачні на SO-101 pick-and-place: 90 проти 70 у розподілі, 50 проти 40 поза ним. Порівняйте на ACT against SmolVLA та Pi0.5 against SmolVLA, або перегляньте арену.
Затримка та вартість визначають розгортання
Затримка висновку — це обмеження, яке люди виявляють останнім і шкодують про нього першим. Політика, яка на п'ять пунктів краща за бенчмарком, але займає пів секунди на крок дії, виглядає гірше на вашому столі: динаміка контакту не чекає.
Одне застереження: показник GR00T не збігається з даними карти NVIDIA, яка вимірює 4 кроки шумозаглушення та одну камеру за 85.8 ms на H100 в eager mode, 48.6 ms з torch.compile, 27.9 ms через повний TensorRT. 152 ms тут — це показник для всього стеку з накладними витратами на обслуговування та більш ніж однією камерою, а не лише прямий прохід.
Цикл від 20 до 485 ms належить моделі, і до нього додаються затримки від обміну даними через публічний інтернет. Віддалений висновок є життєздатним для повільних операцій типу «взяти-покласти», але не для швидких реактивних рухів. Якщо ваше завдання потребує швидкості, висновок знаходиться поруч із сервоприводами: ACT або SmolVLA, локально. Пов'язано: політика зависає під час руху.
Один зі способів виграти час без зміни моделі: у статті SmolVLA вимірюється синхронне виконання, де політика завершує один фрагмент перед прогнозуванням наступного, порівняно з асинхронним, де прогнозування перекривається з виконанням. Успішність схожа, 78.3 проти 73.3, але та сама операція «взяти-покласти» займає 9.7 секунд замість 13.75, і в фіксованому вікні робот виконує 19 циклів замість 9.
Ліцензії, перевірені, бо їх ніхто не перевіряє
| Модель | Ліцензія на ваги | Ліцензія на код | Комерційне використання |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; картка дозволяє комерційне використання | Apache 2.0 | так |
| GR00T N1.5 | Одностороння некомерційна ліцензія NVIDIA | Apache 2.0 | ні |
| Pi0.5 | метадані картки pi05_base містять ліцензію: gemma | Apache 2.0 (openpi, LeRobot docs) | прочитайте обидва, вони суперечать |
| SmolVLA | немає поля ліцензії на картці smolvla_base | Apache 2.0 (LeRobot) | код так, ваги не вказані |
| ACT | базові ваги відсутні | Apache 2.0 (LeRobot) | так |
Рядок Pi0.5 потребує уваги. Документація LeRobot pi05 вказує Apache 2.0, що відповідає openpi, тоді як картка Hub для lerobot/pi05_base містить license: gemma. Обидва дійсні. GR00T N1.7 має м'якшу версію: README Isaac-GR00T побіжно зазначає, що N1.7 повністю ліцензується для комерційного використання за Apache 2.0, тоді як його власний розділ ліцензії та картка моделі відносять лише код під Apache 2.0, а ваги під NVIDIA Open Model License.
Налаштування за замовчуванням, які ви фактично використовуватимете
Кожна форма тренера постачається зі значеннями за замовчуванням, і вони не є довільними. Значення ACT є власними для LeRobot: batch 8, lr 1e-5, 100000 кроків навчання, chunk size 100, що відповідає ACTConfig upstream та k=100 from the ACT paper. Один стовпець нижче є пасткою.
| Політика | Пакет | LR | Макс. кроків | Накопичення градієнта | Застосовується? | Додаткові параметри |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | так | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | так | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | ні (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | ні | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | ні | chunkSize, nActionSteps, seed, logFreq |
Точка входу для доналаштування GR00T (launch_finetune.py, CLI tyro) не має поля seed у своєму класі даних конфігурації, тому запуски не є побітово відтворюваними. Репозиторій також попереджає про 5-6 відсотків відхилення між запусками через недетерміновані аугментації зображень, що більше, ніж більшість розривів у бенчмарках, які обговорюються онлайн. Значення seed за замовчуванням для LeRobot становить 1000. Стовпець grad-accum описує lerobot 0.5.1; upstream 0.6.2 надає його як --accelerator.gradient_accumulation.steps.
Параметр, який має більше значення, ніж вибір моделі
Це блок дій. Довші блоки забезпечують плавніший рух і менше накопичувальних помилок, але політика фіксується під час виконання блоку, тому вона реагує із запізненням на все, що рухається: впевнено на статичному кубі, безнадійно на тому, що котиться. Якщо він перевищує ціль, скорочення виконаної частини краще, ніж перенавчання, і є безкоштовним. Суглоб, який зупиняється раніше, є іншою проблемою; дивіться .
- ACT: ACTConfig за замовчуванням використовує
chunk_size 100таn_action_steps 100. Темпоральне ансамблювання вимкнено і вимагаєn_action_steps 1. - GR00T N1.7: внутрішній горизонт збільшився з 16 до 40, проте LeRobot приклад SO-101 все ще запускається з
--policy.chunk_size=16 --policy.n_action_steps=16. Прапор розгортання було перейменовано на--execution-horizon. - Pi0.5: 50-кроковий блок, з якого LeRobot рецепт LIBERO виконує 10 через
--policy.n_action_steps=10; з--policy.pretrained_pathвін повертається до 50, якщо ви опустите прапор. - SmolVLA: 50-крокові блоки дій, обидва параметри доступні.
Як перевірити всі п'ять за один день
Найдешевша відповідь — не більше читання. Витратьте близько 15 USD і дозвольте руці розповісти вам: запишіть один раз, спочатку навчіть дешеву модель, масштабуйте, як тільки вона доведе достовірність даних. Структура перемагає обсяг, у цьому суть та .
- 1Запишіть 50 епізодів один раз
П'ятдесят епізодів звільняють місце для GR00T, Pi0.5 та ACT, а також 30 епізодів для SmolVLA. Повторюйте кожну варіацію, а не розпилюйтесь: 50 епізодів для 5 позицій куба, де 25 не були навчені. Дивіться запис вашого першого набору даних.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Навчіть ACT спочатку, тому що він не може вам брехати
Без попередньо навчених ваг, тому якщо модель взагалі виконує завдання, ваш набір даних містить це завдання. Якщо ACT не дає результатів, виправте дані. 1 до 3 USD, 2 до 5 годин на карті 24 ГБ.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Запустіть SmolVLA на тому ж наборі даних, без змін
Ті ж дані, та ж рука, 450 мільйонів параметрів замість 80 мільйонів, плюс мовне кондиціонування. LeRobot оцінює запуск на 20 тисяч кроків приблизно в 4 години на одному A100. Це показує, чи дає попереднє навчання якісь переваги.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Конвертуйте до v2.1, перш ніж використовувати GR00T
GR00T читає варіант формату LeRobot v2 плюс додатковий файл
meta/modality.json, який відображає, як об'єднані масиви стану та дії розділяються на іменовані поля. Набір даних v3.0 призводить до збою цього завантажувача, оскільки v3.0 пакує багато епізодів у спільні файли, тоді як v2 записував один файл на епізод. Isaac-GR00T постачає помічник для пониження версії якscripts/lerobot_conversion/convert_v3_to_v2.py; сторінка відхилення v3 є швидким шляхом.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Переходьте до GR00T N1.7 лише якщо перші два варіанти не дали повного результату
Через CLI NVIDIA, показаний тут, або тип політики LeRobot
groot. NVIDIA рекомендує 40 ГБ або більше VRAM для доналаштування, 16 ГБ для інференсу. У разі OOM дивіться сторінку OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Два способи виконати цей скринінговий прохід
Три середовища, оскільки набори інструментів не співіснують. LeRobot на main має версію 0.6.2 і потребує Python 3.12 або новішої; Isaac-GR00T та openpi є окремими репозиторіями, керованими uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T фіксує
torchcodec0.8.0 як єдиний відео-бек-енд, що потребує FFmpeg 4 до 7. FFmpeg 8 не підтримується, AV1 не гарантується. - Мінімальні вимоги до пам'яті openpi: інференс понад 8 ГБ, LoRA понад 22.5 ГБ, повне доналаштування понад 70 ГБ. Остання причина, чому Pi0.5 є завданням для A100.
- Орендуйте GPU самостійно, знищіть його після використання, вручну узгодьте три набори шляхів до контрольних точок.
Ті ж п'ять моделей, одна форма. Виберіть модель, набір даних та гіперпараметри; бекенд орендує GPU розміром відповідно до необхідної VRAM, запускає тренажер і записує контрольні точки в об'єктне сховище.
- Матриця навчання складається з п'яти моделей для чотирьох рук, кожна клітинка — це посібник: SmolVLA на SO-100, ACT на SO-101.
- Поди для інференсу автоматично надаються за допомогою
/api/inference/podз контролером бездіяльності, тому забутий под не буде тихо виставляти рахунки. - Базові контрольні точки належать самим постачальникам:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT не має жодних. - Ті ж операції з CLI та від агентів ШІ через сервер MCP.
- Немає обладнання? Жива рука транслює фізичний SO-100 без реєстрації; сторінка спроби показує способи доступу.
Фундаментальна модель або з нуля
Справжня дилема не в тому, яку модель 3 B обрати. Вона полягає в тому, чи варто взагалі використовувати попередньо навчену VLA, враховуючи, що ACT навчилася шести реальних бімануальних завдань приблизно за десять хвилин демонстрацій кожне, з 80 М параметрами та без попереднього навчання.
- Мовне кондиціонування. ACT його не має; один чекпоінт ACT виконує одне завдання.
- Краще працює з об'єктами, відсутніми у ваших демонстраціях: на SO-101, 50% проти 40% у ACT поза розподілом.
- Багатозадачність взагалі: SmolVLA досягає 78.3% у трьох завданнях SO-100 з одним чекпоінтом; ACT запускався лише для одного завдання.
- Затримка в 7.6x до 24x: від 152 до 485 мс на крок дії проти 20 мс у ACT.
- Від 4 до 12 USD за запуск замість 1 до 3, і рівень A100 замість будь-якої карти на 24 ГБ.
- Ризик ліцензійних обмежень, плюс режим відмови через закритий репозиторій, якого не існує при розробці з нуля.
- Попередньо навчені ваги можуть маскувати поганий набір даних. Доопрацювання, яке працює наполовину на пошкоджених даних, коштує тиждень, перш ніж ви подивитеся на дані.
Випадок відтворення старого запуску
Погоня за чекпоінтом 2025 року робить вибір моделі за вас і перетворює проблему на фіксацію версії: поточний LeRobot відхиляє N1.5, тому ви фіксуєте lerobot==0.5.1. Без поля seed і з 5-6 відсотками варіації між запусками, відтворення є приблизним за своєю природою. та мають сторону платформи.

Залишилося два? ACT проти GR00T N1.7 та GR00T N1.7 проти SmolVLA. Необроблені дані знаходяться в записах арени: GR00T N1.7, Pi0.5, SmolVLA та ACT.
У чому ця платформа не допоможе вам
- Вона не може прискорити віддалений висновок. Цикл від 20 до 485 ms належить моделі; інтернет-запити додають до нього час.
- Вона не може доналаштувати GR00T або Pi0.5 на вашому власному обладнанні. Обидві тут працюють лише в хмарі; лише SmolVLA та ACT запускаються локально.
- Вона не може виправити набір даних. Втрати падають, але політика нічого не робить — це проблема даних, політика, яка працює лише в одному налаштуванні — це проблема покриття.
- Вона не може зробити запуски GR00T відтворюваними: конфігурація вихідного коду не має поля seed.
85 моделей, 332 результати бенчмарків, кожне число посилається на джерело
Сортована версія таблиць на цій сторінці: 85 моделей «зір-мова-дія», 332 результати бенчмарків, кожен з яких посилається на відповідну статтю або картку моделі.
Відкрити аренуВибір одного та рух далі
Один стандартний варіант: запишіть 50 епізодів, навчіть ACT за 1-3 USD, щоб перевірити набір даних, потім SmolVLA на тих самих даних. Разом менше 6 USD, і вони відповідають на важливе питання: чи допомагає попереднє навчання тут, чи чи вузьким місцем є дані. Переходьте до GR00T N1.7 для багатоетапних завдань з інтенсивним контактом, до Pi0.5, коли змінюється сцена.
Огляд платформи: навчіть свою першу політику, потім запустіть свою першу політику. Документація з навчання та документація з наборів даних охоплюють форму та формат; сторінка SO-100 та повний посібник SO-100 охоплюють збірку та калібрування. Довідкова інформація: огляд VLA та стаття про Pi0 flow-matching. Той, що підвищить ваш показник успішності, це посібник з якості даних.
Яку політику VLA мені слід тренувати першою на SO-100?▾
ACT, потім SmolVLA. ACT тренується з нуля, тому не може приховати поганий набір даних, а запуск коштує від 1 до 3 USD на карті 24 ГБ. Якщо ACT взагалі виконує завдання, то 4-12 USD за запуск GR00T N1.7 або Pi0.5 не будуть витрачені даремно.
Чи дійсно GR00T N1.7 кращий за Pi0.5?▾
На LIBERO вони знаходяться в межах шуму: 97.0% у чотирьох наборах для GR00T N1.7, 96.85% для Pi0.5 на 30 тис. кроків в openpi, 97.5% для порту LeRobot, усі з різних тестових стендів. Справжні відмінності полягають у 152 ms на крок дії проти 485 ms, наборах даних v2.1 проти v3.0, та точності бенчмарку проти узагальнення в реальному світі.
Чи можу я доналаштувати будь-яку з них на одній RTX 4090?▾
SmolVLA та ACT, так; обидва вказані для RTX 4090 або будь-якої карти 24 GB і працюють локально. GR00T N1.7, N1.5 та Pi0.5 потребують A100 або H100 80 GB і тут доступні лише в хмарі. NVIDIA рекомендує 40 GB або більше для доналаштування GR00T; мінімальні вимоги openpi перевищують 70 GB для повного доналаштування Pi0.5, 22.5 GB для LoRA.
Які з цих п'яти я можу використовувати комерційно?▾
Ваги GR00T N1.7 підпадають під ліцензійну угоду NVIDIA Open Model License Agreement, яка, як зазначено на картці, охоплює комерційне використання. Ваги N1.5 є некомерційними. Код SmolVLA є Apache 2.0 в LeRobot, але картка lerobot/smolvla_base не містить поля ліцензії, тому ваги не вказані. ACT не має базових ваг для ліцензування. Pi0.5 є неоднозначним: документація LeRobot вказує Apache 2.0, а метадані його картки містять license: gemma.
Sources
- Репозиторій NVIDIA Isaac-GR00T: статус GA, зміни N1.6 на N1.7, вимоги до обладнання, обмеження torchcodec та FFmpeg, launch_finetune.py, варіативність від запуску до запуску
- Картка моделі nvidia/GR00T-N1.7-3B: основа Cosmos-Reason2-2B, 3 B параметрів, таблиця часу висновку, NVIDIA Open Model License, поле Model Version
- Картка моделі nvidia/GR00T-N1.5-3B: посилання на Eagle 2, SigLip2 та T5, flow matching DiT, одностороння некомерційна ліцензія
- Приклад Isaac-GR00T LIBERO: показники успішності для кожного набору при 20K кроків та розмірі пакету 640, 200 спроб на набір
- Приклад Isaac-GR00T SimplerEnv: показники успішності Bridge та Fractal для кожного завдання, GR00T N1.6 проти N1.7
- pi0.5: модель Vision-Language-Action з узагальненням у відкритому світі (2 B VLM плюс 300 M експерт з дій, керування 50 Hz, близько 400 годин мобільної маніпуляції, дослідження масштабування від 3 до 104 локацій)
- Репозиторій openpi: мінімальні вимоги до пам'яті GPU, область застосування лише для flow-matching-head, та результати Pi0.5 LIBERO у examples/libero
- Картка моделі lerobot/pi05_base: обсяг порту LeRobot, метадані license: gemma, використання lerobot-train
- Документація LeRobot pi0.5: токенізатор PaliGemma з обмеженим доступом, таблиця відтворення LIBERO, пастка n_action_steps fallback, заява Apache 2.0
- SmolVLA: модель Vision-Language-Action для доступної та ефективної робототехніки (450 M параметрів, таблиці LIBERO та Meta-World, результати SO-100 та SO-101, асинхронний висновок)
- Документація LeRobot SmolVLA: 50 епізодів у 5 позиціях проти 25, 20k кроків приблизно за 4 години на A100
- Навчання дрібнозернистої бімануальної маніпуляції з недорогим обладнанням (ACT та ALOHA): 6 завдань на 80-90 відсотків, абляція розміру чанку від k=1 до k=100
- LeRobot 0.6.2: значення за замовчуванням ACTConfig та SmolVLAConfig, початкове значення 1000, --accelerator.gradient_accumulation.steps, вимога Python 3.12, Apache 2.0
- Документація LeRobot GR00T: тип політики groot, підтримка N1.5 видалена, закріпити lerobot==0.5.1, приклад розміру чанку SO-101
- Картка моделі lerobot/smolvla_base: базова контрольна точка SmolVLA, що використовується --policy.path, та її метадані картки, яка не містить поля ліцензії
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started