
GR00T N1.7, Pi0.5, SmolVLA, ACT или GR00T N1.5? Табела за одлучување прилагодена на реални ситуации, со објавените бенчмарк бројки, латентност, цена по извршување и лиценци зад секој избор.
Пет политики може да се тренираат на рака од класа SO-100 денес. Тие се разликуваат за фактор од 24 во инференција латентност, 37 во број на параметри и 12 во тоа колку чини едно извршување, и во тоа дали можете да го испорачате резултатот. Пет картички на модели нема да го решат тоа: ниту една не одговара на прашањето што го имате, која да ја извршам прво?
Секој број подолу е прочитан од трудовите, репозиториумите и картичките во август 2026 година. Броевите на платформата доаѓаат од каталог на политики на AY-Robots; каде што двете не се согласуваат, прикажани се и двете.
Кратката верзија
- •Тренирајте го ACT прво ако се сомневате во вашето множество податоци: 1 до 3 USD по извршување, ништо претходно тренирано за да ги покрие лошите податоци.
- •GR00T N1.7 и Pi0.5 се наоѓаат во рамките на половина поен на LIBERO, 97.0 наспроти 96.85 до 97.5. Тоа не е причина да се избере ниту еден.
- •Pi0.5 е за генерализација, а не за точност, и е најбавен со 485 ms.
- •SmolVLA, со 450 M параметри, е единствениот VLA овде што се дотерува на една 24 GB картичка.
- •ACT со 20 ms е единствената опција за брзо реактивно движење. Лиценците го одлучуваат остатокот.
Табелата за одлучување
| Вашата ситуација | Обучете го ова | Зошто |
|---|---|---|
| Квалитетот на податочното множество е недокажан | ACT | Ништо претходно обучено не крие скршено податочно множество, а неуспехот чини 1 до 3 УСД. |
| Богато со контакт, повеќечекорно, јазично-условено | GR00T N1.7 | 97.0% преку четири LIBERO пакети, плус релативен акционен простор на крајниот ефектор. |
| Брзо реактивно движење, заклучување кај сервомоторите | ACT | 20 ms. Следниот најбрз е 7.6 пати побавен. |
| Нови објекти, нова сцена, отворен свет | Pi0.5 | Изграден за однесување надвор од дистрибуција, низ до 104 локации. |
| Една 24 GB картичка, сè уште сакате јазик | SmolVLA | 450 M parameters, минимум 30 епизоди, работи локално. |
| Репродукција на извршување снимено во 2025 година | GR00T N1.5 | Само ако морате: LeRobot сега го отфрла, тежините се некомерцијални. |
| Ова ќе биде испорачано како производ | N1.7, SmolVLA or ACT | N1.5 е некомерцијален, Pi0.5 ги носи условите на Gemma, картичката на SmolVLA не наведува ништо. |
Петте кандидати
Сите пет се политики: рамки од камера, позиции на зглобови и, за четири од нив, јазична инструкција, мапирана на дел од идни цели на зглобовите. Она што ги одвојува е колку е научено пред да пристигнете.
| Политика | Параметри | Латентност | Ниво на графички процесор | Локално? | Мин. епизоди | Формат | Цена |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Тековниот модел за визија-јазик-акција на NVIDIA, околу 3 милијарди параметри, приближно 40 милиони тренирани за време на фино подесување. Репозиториумот ги наведува разликите од N1.6: основа од Eagle модел од добавувач до Cosmos-Reason2-2B на Qwen3-VL, слоеви на дифузија од 32 на 16, димензии на состојба и акција од 29 на 132, хоризонт на акција од 16 на 40.
Она што е важно за мала рака е релативниот акционен простор на крајниот ефектор: N1.7 предвидува делта од тековната поза, што овозможува 20K часа човечко видео од EgoScale да се пренесе во роботска политика. Спецификации на страницата на N1.7, процедура во водичот за N1.7 на SO-100.
README-то на Isaac-GR00T го прогласува N1.7 за Општа Достапност издание, со целосни бенчмаркови и поддршка. Неговата Hugging Face картичка не е ажурирана: полето Model Version сè уште гласи GR00T N1.7 EA. Репозиториумот е поновиот документ.
GR00T N1.5
Иста скала од 3 B, Eagle 2 основа, SigLip2 и T5, DiT глава за усогласување на проток. Постои за да прошири што веќе го имате. Две работи го прават лош стандард: тежините носат еднонасочна некомерцијална лиценца на NVIDIA, а тековните изданија на LeRobot ја отстранија поддршката за N1.5. Видете .
Pi0.5
На Physical Intelligence VLA, тип на политика pi05. Трудот дава 2 B VLM иницијализиран од PaliGemma плус 300 M експерт за акција, кој го движи роботот со 50 Hz; конфигурацијата pi05 на LeRobot стандардно користи парче од 50 чекори, една секунда со таа брзина. Главната предност се невидени места: околу 400 часа мобилна манипулација во реални домови и студија за скалирање на 3, 12, 22, 53, 82 и 104 локации, каде моделот со 104 локации се совпадна со контрола тренирана на самите тест домови.
Едно ограничување, наведено на lerobot/pi05_base картичката: портот носи само action head. Subtask prediction, action tokenization and RL were not released upstream, and openpi says the same of сопственото складиште. Страницата Pi0.5 и водичот Pi0.5 на SO-100 го имаат остатокот.
Pi0.5 го бара затворениот google/paligemma-3b-pt-224 токенизатор (gated: manual, иако Google вели дека барањата се обработуваат веднаш). Без да го прифатите и да извршите hf auth login во околината за обука, задачата започнува, презема некое време, а потоа умира поради грешка при авторизација што изгледа како мрежен дефект. nvidia/GR00T-N1.7-3B не е затворен, но неговиот nvidia/Cosmos-Reason2-2B бекбон е (gated: auto). Исчистете ги и двете пред да ги ставите во ред; ако извршувањето стои во мирување, страницата за заглавени редици наведува што да проверите.
SmolVLA
450 милиони параметри, околу 100 милиони во експертот за акција, на SmolVLM-2 со замрзнат VLM и користени само неговите први 16 слоеви на јазичниот модел. Предобуката беше податоци од заедницата: 481 збир на податоци, 10,6 милиони рамки, од истите евтини раце што ги користите. Единствениот VLA овде што се вклопува на една 24 GB картичка, и единствениот 30 епизода под. Видете страницата SmolVLA.
ACT
Не е основен модел. Action Chunking Transformer од ALOHA има околу 80 M параметри тренирани од нула по задача, на 50 демонстрации со 50 Hz. Трудот известува за шест реални бимануални задачи од приближно десет минути демонстрации за секоја, со 80 до 90 проценти на примерите што ги истакнува. Неговата идеја, акционо групирање, е во секој модел на оваа страница, а неговата аблација сè уште го мери ефектот најдобро: над две симулирани задачи со исклучено темпорално здружување, успехот се зголемува од 1 процент при k=1 на 44 проценти при k=100. Страницата на ACT го има остатокот.
Што всушност велат бенчмарковите
LIBERO е единствениот бенчмарк за кој известуваат три од овие пет: задачи условени од јазик на симулирана Franka Panda, поделени во четирите пакети подолу со по десет задачи. NVIDIA изврши 200 обиди по пакет.
| Модел | Просторно | Објект | Цел | 10 (Долго) | Просек |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Секој број доаѓа од различен систем и буџет. GR00T изврши 20K чекори со глобална серија од 640; бројката openpi е контролна точка од 30K; портот LeRobot додаде 6K чекори на основниот модел LIBERO. SmolVLA е дополнително несогласување: неговиот труд го тренира тој ред на LIBERO од нула, без претходна обука на VLA, додека трите над него ги дотеруваат претходно обучените контролни точки. Третирајте ги 96.85 до 97.5 како еден кластер, а јазот до 87.3% како реален, но купен со 6.7 пати повеќе параметри.
SimplerEnv го покажува ширењето, што LIBERO не го прави. NVIDIA го споредува N1.7 со N1.6, најблиската јавна работа до генерациска делта.
| SimplerEnv пакет | Просек на N1.6 | Просек на N1.7 | Најдобро отстапување | Најлошо отстапување |
|---|---|---|---|---|
| Мост (WidowX), 7 задачи | 56.6% | 62.3% | stack_cube 5.0 до 48.0 | put_eggplant_in_basket 89.0 до 53.0 |
| Фрактал (Google Robot), 6 задачи | 52.0% | 72.5% | open_drawer 0.0 до 65.0 | ништо, секоја задача се подобри |
Редот Bridge е корисниот: 5.7 поени добиени во просек додека put_eggplant_in_basket изгуби 36, а put_eggplant_in_sink падна од 33 на 2. Нова генерација ја поместува дистрибуцијата наместо да ја подига, па ако вашата задача е таму каде што N1.7 регресираше, просекот не кажува ништо.

Од петте, само трудот на SmolVLA известува за рака од класа SO-100: 78.3 проценти за SmolVLA и 61.7 за Pi0 низ три задачи, и двете повеќезадачни, наспроти 48.3 за ACT обучен за една задача, што не е споредливо. Чистото спарување е и двете еднозадачни на SO-101 pick-and-place: 90 наспроти 70 во дистрибуција, 50 наспроти 40 надвор од неа. Споредете на ACT наспроти SmolVLA и Pi0.5 наспроти SmolVLA, или прелистајте ја арената.
Латентноста и цената одлучуваат за распоредувањето
Латентност на заклучување е ограничувањето што луѓето го откриваат последно и прво го жалат. Политика пет поени подобра на бенчмарк, но половина секунда по чекор на акција изгледа полошо на вашето биро: динамиката на контакт не чека.
Една забелешка: бројката за GR00T не се согласува со картичката на NVIDIA, која мери 4 чекори на деноизирање и една камера на 85.8 ms на H100 во eager режим, 48.6 ms со torch.compile, 27.9 ms преку целосен TensorRT. Овде, 152 ms е бројка за целиот стек со оптоварување на сервисирање и повеќе од една камера, а не само forward pass.
Јамката од 20 до 485 ms е на моделот, а патувањата преку јавниот интернет се додаваат на тоа. Далечинското заклучување е изводливо за бавно земање и поставување (pick-and-place), но не и за брзо реактивно движење. Ако вашата задача бара брзина, заклучувањето се наоѓа до сервомоторите: ACT или SmolVLA, локално. Поврзано: политиката замрзнува среде движење.
Еден начин да се добие време без промена на моделот: трудот SmolVLA мери синхроно извршување, каде што политиката завршува еден дел пред да го предвиди следниот, наспроти асинхроното, каде што предвидувањето се преклопува со извршувањето. Успехот е сличен, 78.3 наспроти 73.3, но истото земање и поставување (pick-and-place) трае 9.7 секунди наместо 13.75, а во фиксен прозорец роботот управува со 19 циклуси наместо 9.
Лиценци, проверени бидејќи никој не ги проверува
| Модел | Лиценца за тежини | Лиценца за код | Комерцијална употреба |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; картичката дозволува комерцијална употреба | Apache 2.0 | да |
| GR00T N1.5 | NVIDIA еднонасочна некомерцијална лиценца | Apache 2.0 | не |
| Pi0.5 | метаподатоците на картичката pi05_base читаат лиценца: gemma | Apache 2.0 (openpi, LeRobot документи) | прочитајте ги двете, не се согласуваат |
| SmolVLA | нема поле за лиценца на картичката smolvla_base | Apache 2.0 (LeRobot) | код да, тежини ненаведени |
| ACT | не постојат основни тежини | Apache 2.0 (LeRobot) | да |
Редот за Pi0.5 бара внимание. Документацијата на LeRobot pi05 наведува Apache 2.0 конзистентно со openpi, додека картичката на Hub за lerobot/pi05_base носи license: gemma. Двете се активни. GR00T N1.7 има поблага верзија: README-то на Isaac-GR00T попатно наведува дека N1.7 е целосно комерцијално лиценциран под Apache 2.0, додека неговиот сопствен дел за лиценца и картичката на моделот го ставаат само кодот под Apache 2.0, а тежините под NVIDIA Open Model License.
Стандардните поставки што всушност ќе ги извршите
Секоја форма на обучувач испорачува стандардна вредност, и тие не се произволни. Оние на ACT се сопствени на LeRobot: серија 8, lr 1e-5, 100000 чекори на обука, големина на парче 100, што одговара на ACTConfig upstream и k=100 од ACT трудот. Една колона подолу е стапица.
| Политика | Серија | LR | Макс. чекори | Акумулација на градиент | Се применува? | Дополнителни параметри |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
Влезната точка за фино подесување на GR00T (launch_finetune.py, tyro CLI) нема поле за семе во својата config dataclass, така што извршувањата не се репродуцибилни бит-по-бит. Репозиториумот исто така предупредува за 5 до 6 проценти варијанса помеѓу извршувањата од недетерминистички аугментации на слики, поголема од повеќето разлики во бенчмарк за кои се расправа онлајн. Стандардното семе на LeRobot е 1000. Колоната за акумулација на градиент го опишува lerobot 0.5.1; upstream 0.6.2 го изложува како --accelerator.gradient_accumulation.steps.
Параметарот што е поважен од изборот на модел
Тоа е акциониот дел. Подолгите делови даваат помазно движење и помалку кумулативни грешки, но политиката е посветена додека блокот се извршува, па реагира доцна на сè што се движи: самоуверена на статична коцка, безнадежна на подвижна. Ако претера, скратувањето на извршениот дел е подобро од претренирање и е бесплатно. Зглоб што застанува прерано е поинаков проблем; видете .
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. Темпоралното ансамблирање е исклучено и бараn_action_steps 1. - GR00T N1.7: внатрешниот хоризонт се зголеми од 16 на 40, но LeRobot's SO-101 example still runs
--policy.chunk_size=16 --policy.n_action_steps=16. Знамето за извршување беше преименувано во--execution-horizon. - Pi0.5: дел од 50 чекори, од кои LeRobot's LIBERO recipe executes 10 via
--policy.n_action_steps=10; со--policy.pretrained_pathсе враќа на 50 ако го изоставите знамето. - SmolVLA: делови од 50 акции, двете контроли се изложени.
Како да ги проверите сите пет за едно попладне
Најевтиниот одговор не е повеќе читање. Потрошете околу 15 USD и дозволете ѝ на раката да ви каже: снимете еднаш, прво тренирајте го евтиниот модел, ескалирајте откако ќе докаже дека податоците се добри. Структурата е поважна од обемот, поентата на и .
- 1Снимете 50 епизоди еднаш
Педесет го расчистува теренот за GR00T, Pi0.5 и ACT, и 30-те на SmolVLA. Повторете ја секоја варијација наместо да се расплинувате: 50 епизоди низ 5 позиции на коцки тренирани таму каде што 25 не беа. Видете снимање на вашето прво множество податоци.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Прво тренирајте го ACT, бидејќи не може да ве лаже
Без претходно тренирани тежини, па ако воопшто ја извршува задачата, вашето множество податоци ја содржи задачата. Ако ACT стагнира, поправете ги податоците. 1 до 3 УСД, 2 до 5 часа на картичка од 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Стартувајте го SmolVLA на истото множество податоци, непроменето
Исти податоци, иста рака, 450 M параметри наместо 80 M, плус јазично условување. LeRobot проценува извршување од 20K чекори на приближно 4 часа на еден A100. Ова е она што ви кажува дали претходното тренирање носи некаква корист.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Конвертирајте на v2.1 пред да го допрете GR00T
GR00T чита варијанта на LeRobot v2 форматот плус дополнителна
meta/modality.jsonмапа која покажува како споените низи на состојби и акции се делат на именувани полиња. Множество податоци од v3.0 го урива тој вчитувач, бидејќи v3.0 пакува многу епизоди во споделени датотеки каде што v2 пишуваше по една за секоја епизода. Isaac-GR00T го испорачува помошникот за намалување на верзијата какоscripts/lerobot_conversion/convert_v3_to_v2.py; страницата за отфрлање на v3 е брзиот пат.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Ескалирајте на GR00T N1.7 само ако првите две оставиле нешто нерешено
Преку CLI на NVIDIA, прикажан овде, или типот на политика
grootна LeRobot. NVIDIA препорачува 40 GB или повеќе VRAM за фино подесување, 16 GB за инференција. При OOM, видете ја страницата за OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Два начини да се изврши тој скрининг премин
Три околини, бидејќи синџирите на алатки не коегзистираат. LeRobot на главната гранка е 0.6.2 и бара Python 3.12 или понов; Isaac-GR00T и openpi се посебни репозиториуми управувани со uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T го фиксира
torchcodec0.8.0 како единствен видео бекенд, барајќи FFmpeg 4 до 7. FFmpeg 8 не е поддржан, AV1 не е загарантиран. - Минимални барања за меморија на openpi: инференција над 8 GB, LoRA над 22.5 GB, целосно фино подесување над 70 GB. Тоа последното е причината зошто Pi0.5 е работа за A100.
- Изнајмете го GPU сами, уништете го потоа, рачно усогласете три множества патеки на контролни точки.
Исти пет модели, една форма. Изберете модел, множество податоци и хиперпараметри; бекендот изнајмува GPU со големина според потребниот VRAM, го извршува тренерот и ги запишува контролните точки во складиштето за објекти.
- Матрицата за тренирање е пет модели со четири раце, секоја ќелија е водич: SmolVLA на SO-100, ACT на SO-101.
- Подовите за инференција се автоматски обезбедени од
/api/inference/podсо надзорник за мирување, така што заборавен под не наплатува тивко. - Основните контролни точки се на самите продавачи:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT нема. - Исти операции од CLI и од AI агенти преку MCP серверот.
- Немате хардвер? Раката во живо стримува физички SO-100 без регистрација; страницата за проба ги покажува начините за пристап.
Фундаментален модел или од нула
Вистинската дилема не е кој 3 B модел да се избере. Туку дали воопшто да се користи претходно трениран VLA, со оглед на тоа што ACT научи шест реални бимануални задачи од околу десет минути демонстрации за секоја, со 80 M параметри и ништо претходно тренирано.
- Јазично условување. ACT нема; една ACT контролна точка извршува една задача.
- Подобро на објекти отсутни од вашите демонстрации: на SO-101, 50% наспроти 40% на ACT надвор од дистрибуцијата.
- Воопшто мултитаскинг: SmolVLA достигнува 78.3% низ три SO-100 задачи со една контролна точка; ACT беше извршен само како единечна задача.
- 7.6x до 24x поголема латенција: 152 до 485 ms по чекор на акција наспроти 20 ms на ACT.
- 4 до 12 USD по извршување наместо 1 до 3, и A100 ниво наместо која било 24 GB картичка.
- Изложеност на лиценца, плус режим на неуспех на затворено складиште што не постои од нула.
- Претходно тренираните тежини може да маскираат лош сет на податоци. Фино подесување што делумно работи на оштетени податоци чини една недела пред да ги погледнете податоците.
Случајот на репродукција на старо извршување
Потрагата по контролна точка од 2025 година го прави изборот на модел за вас и го претвора проблемот во фиксирање на верзијата: тековниот LeRobot го отфрла N1.5, па вие ја фиксирате верзијата lerobot==0.5.1. Без поле за семе и со варијанса од 5 до 6 проценти помеѓу извршувањата, репродукцијата е приближна по конструкција. и ја имаат страната на платформата.

Сведени на два? ACT наспроти GR00T N1.7 и GR00T N1.7 наспроти SmolVLA. Суровите редови се наоѓаат во записите на арената: GR00T N1.7, Pi0.5, SmolVLA и ACT.
Каде оваа платформа не ви помага
- Не може да го забрза далечинското заклучување. Јамката од 20 до 485 ms му припаѓа на моделот; интернет рунд-триповите се додаваат на тоа.
- Не може да ги дотера GR00T или Pi0.5 на вашиот сопствен хардвер. И двата се само во облак овде; само SmolVLA и ACT работат локално.
- Не може да поправи податочно множество. Загубата паѓа, но политиката не прави ништо е проблем со податоците, политика која работи само во едно поставување е проблем со покриеноста.
- Не може да ги направи извршувањата на GR00T репродуктивни: конфигурацијата нагоре нема поле за семе.
85 модели, 332 резултати од бенчмарк, секој број поврзан со неговиот извор
Верзијата на табелите на оваа страница што може да се сортира: 85 модели за визија-јазик-акција, 332 резултати од бенчмарк, секој поврзан со неговиот труд или картичка на моделот.
Отвори ја аренатаИзбирање еден и продолжување
Еден стандард: сними 50 епизоди, тренирај ACT за 1 до 3 УСД за да го докажеш множеството податоци, потоа SmolVLA на истите податоци. Заедно под 6 УСД, и тие одговараат на прашањето што е важно: дали претренингот помага овде, или дали тесното грло се податоците. Ескалирај на GR00T N1.7 за повеќечекорни задачи богати со контакт, на Pi0.5 кога сцената се менува.
Водич за платформата: обучи ја твојата прва политика, потоа изврши ја твојата прва политика. документацијата за обука и документацијата за множества податоци ги покриваат формата и форматот; страницата SO-100 и целосниот водич за SO-100 ги покриваат изградбата и калибрацијата. Позадина: прегледот на VLA и статијата за Pi0 flow-matching. Она што ќе ја зголеми твојата стапка на успех е водичот за квалитет на податоци.
Која VLA политика треба прво да ја тренирам на SO-100?▾
ACT, потоа SmolVLA. ACT тренира од нула, така што не може да маскира лош сет на податоци, а едно извршување чини 1 до 3 USD на картичка од 24 GB. Ако ACT воопшто ја изврши задачата, 4 до 12 USD за извршување на GR00T N1.7 или Pi0.5 не се потрошени залудно.
Дали GR00T N1.7 е навистина подобар од Pi0.5?▾
На LIBERO тие се во рамките на шумот: 97.0% низ четири пакети за GR00T N1.7, 96.85% за Pi0.5 на 30k чекори во openpi, 97.5% за LeRobot портот, сите од различни системи. Вистинските разлики се 152 ms по чекор на акција наспроти 485 ms, v2.1 сетови на податоци наспроти v3.0, и точност на бенчмарк наспроти генерализација во отворен свет.
Можам ли да фино-подесам нешто од ова на една RTX 4090?▾
SmolVLA и ACT, да; и двете се наведени за RTX 4090 или која било картичка од 24 GB и работат локално. GR00T N1.7, N1.5 и Pi0.5 бараат A100 или H100 80 GB и овде се само за облак. NVIDIA препорачува 40 GB или повеќе за GR00T фино-подесување; минимумот на openpi е над 70 GB за целосно Pi0.5 фино-подесување, 22.5 GB за LoRA.
Кој од овие пет можам да го користам комерцијално?▾
Тежините на GR00T N1.7 се под Договорот за лиценца за отворен модел на NVIDIA, кој картичката вели дека покрива комерцијална употреба. Тежините на N1.5 се некомерцијални. Кодот на SmolVLA е Apache 2.0 во LeRobot, но картичката lerobot/smolvla_base не содржи поле за лиценца, така што тежините не се наведени. ACT нема основни тежини за лиценцирање. Pi0.5 е двосмислен: документите на LeRobot велат Apache 2.0, неговите метаподатоци на картичката гласат license: gemma.
Sources
- NVIDIA Isaac-GR00T репозиториум: GA статус, промени од N1.6 во N1.7, хардверски барања, torchcodec и FFmpeg ограничувања, launch_finetune.py, варијанса од извршување до извршување
- nvidia/GR00T-N1.7-3B картичка на моделот: Cosmos-Reason2-2B основа, 3 B параметри, табела за време на заклучување, NVIDIA Open Model License, поле Model Version
- nvidia/GR00T-N1.5-3B картичка на моделот: Eagle 2 референца, SigLip2 и T5, flow matching DiT, еднонасочна некомерцијална лиценца
- Isaac-GR00T LIBERO пример: стапки на успех по пакет на 20K чекори и големина на серија 640, 200 обиди по пакет
- Isaac-GR00T SimplerEnv пример: стапки на успех по задача Bridge и Fractal, GR00T N1.6 наспроти N1.7
- pi0.5: Модел за визија-јазик-акција со генерализација во отворен свет (2 B VLM плус 300 M експерт за акција, 50 Hz контрола, околу 400 часа мобилна манипулација, студија за скалирање над 3 до 104 локации)
- openpi репозиториум: минимуми на GPU меморија, опсег само за flow-matching-head, и резултатите од Pi0.5 LIBERO во examples/libero
- lerobot/pi05_base картичка на моделот: опсег на LeRobot портот, license: gemma метаподатоци, lerobot-train употреба
- LeRobot pi0.5 документација: gated PaliGemma токенизатор, LIBERO табела за репродукција, n_action_steps fallback стапица, Apache 2.0 изјава
- SmolVLA: Модел за визија-јазик-акција за достапна и ефикасна роботика (450 M параметри, LIBERO и Meta-World табели, SO-100 и SO-101 резултати, асинхроно заклучување)
- LeRobot SmolVLA документација: 50 епизоди низ 5 позиции наспроти 25, 20k чекори за околу 4 часа на A100
- Учење на фино-зрнеста бимануелна манипулација со нискобуџетен хардвер (ACT и ALOHA): 6 задачи со 80-90 проценти, аблација на големината на парчето од k=1 до k=100
- LeRobot 0.6.2: ACTConfig и SmolVLAConfig стандардни вредности, стандарден seed 1000, --accelerator.gradient_accumulation.steps, барање за Python 3.12, Apache 2.0
- LeRobot GR00T документација: policy type groot, поддршката за N1.5 отстранета, pin lerobot==0.5.1, SO-101 пример за големина на парче
- lerobot/smolvla_base картичка на моделот: основната контролна точка на SmolVLA користена од --policy.path, и нејзините метаподатоци на картичката, која не содржи поле за лиценца
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started