GR00T N1.7, Pi0.5, SmolVLA, ACT 또는 GR00T N1.5? 실제 상황에 맞춰진 결정 테이블과 함께 각 선택에 대한 공개된 벤치마크 수치, 지연 시간, 실행당 비용 및 라이선스를 제공합니다.
오늘날 SO-100 등급 로봇 팔에서 5가지 정책을 훈련할 수 있습니다. 이들은 추론 지연 시간에서 24배, 파라미터 수에서 37배, 실행 비용에서 12배 차이가 나며, 결과를 배포할 수 있는지 여부도 다릅니다. 5개의 모델 카드로는 해결되지 않습니다. 어떤 것도 '무엇을 먼저 실행해야 하는가?'라는 질문에 답하지 못합니다.
아래의 모든 수치는 2026년 8월에 논문, 저장소 및 카드에서 발췌한 것입니다. 플랫폼 수치는 AY-Robots 정책 카탈로그에서 가져왔습니다. 둘이 일치하지 않는 경우, 둘 다 표시됩니다.
요약
- •데이터셋을 의심한다면 ACT를 먼저 훈련하십시오: 실행당 1~3 USD, 나쁜 데이터를 가릴 사전 훈련된 것이 없습니다.
- •GR00T N1.7과 Pi0.5는 LIBERO에서 0.5점 이내(97.0 대 96.85~97.5)에 있습니다. 이는 둘 중 하나를 선택할 이유가 되지 않습니다.
- •Pi0.5는 정확도보다는 일반화에 중점을 두며, 485 ms로 가장 느립니다.
- •4억 5천만 개의 파라미터를 가진 SmolVLA는 여기에서 24 GB 카드 하나로 미세 조정할 수 있는 유일한 VLA입니다.
- •20 ms의 ACT는 빠른 반응형 동작을 위한 유일한 옵션입니다. 나머지는 라이선스가 결정합니다.
의사 결정 표
| 귀하의 상황 | 이것을 훈련하세요 | 이유 |
|---|---|---|
| 데이터셋 품질 미검증 | ACT | 사전 훈련된 어떤 것도 손상된 데이터셋을 숨길 수 없으며, 실패 시 1~3 USD의 비용이 발생합니다. |
| 접촉이 많고, 다단계이며, 언어 조건부 | GR00T N1.7 | 4개의 LIBERO 스위트에서 97.0%를 달성했으며, 상대적인 말단 효과기 동작 공간을 포함합니다. |
| 빠른 반응 동작, 서보에서의 추론 | ACT | 20 ms. 다음으로 빠른 것은 7.6배 느립니다. |
| 새로운 객체, 새로운 장면, 개방형 세계 | Pi0.5 | 최대 104개 위치에 걸쳐 분포 외 동작을 위해 구축되었습니다. |
| 24 GB 카드 하나, 여전히 언어를 원함 | SmolVLA | 450 M 매개변수, 30 에피소드 최소치, 로컬에서 실행됩니다. |
| 2025년에 기록된 실행 재현 | GR00T N1.5 | 꼭 필요한 경우에만: LeRobot은 이제 이를 거부하며, 가중치는 비상업적입니다. |
| 이것은 제품으로 출시될 것입니다 | N1.7, SmolVLA or ACT | N1.5는 비상업적이며, Pi0.5는 Gemma 약관을 따르고, SmolVLA의 카드에는 아무것도 명시되어 있지 않습니다. |
다섯 가지 후보
다섯 가지 모두 정책입니다: 카메라 프레임, 조인트 위치 및 그 중 네 가지의 경우, 미래 조인트 목표의 덩어리에 매핑된 언어 지침입니다. 이들을 구분하는 것은 귀하가 도착하기 전에 얼마나 많이 학습되었는지입니다.
| 정책 | 매개변수 | 지연 시간 | GPU 티어 | 로컬? | 최소 에피소드 | 형식 | 비용 |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | 예 | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | 예 | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | 아니요 | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | 아니요 | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | 아니요 | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA의 현재 비전-언어-액션 모델, 약 30억 개의 매개변수를 가지며, 약 4천만 개는 미세 조정 중에 훈련되었습니다. 저장소에는 N1.6과의 차이점이 나열되어 있습니다: 백본은 벤더 Eagle 모델에서 Qwen3-VL의 Cosmos-Reason2-2B로 변경되었고, 확산 레이어는 32에서 16으로, 상태 및 액션 차원은 29에서 132로, 액션 호라이즌은 16에서 40으로 변경되었습니다.
작은 로봇 팔에서 중요한 것은 상대적인 엔드 이펙터 액션 공간입니다: N1.7은 현재 자세로부터의 델타를 예측하며, 이는 2만 시간의 EgoScale 인간 비디오가 로봇 정책으로 전이될 수 있도록 합니다. 사양은 N1.7 페이지, 절차는 SO-100 가이드의 N1.7.
Isaac-GR00T README는 N1.7을 일반 가용성 릴리스로 선언하며, 완전한 벤치마크와 지원을 제공합니다. Hugging Face 카드는 아직 업데이트되지 않았습니다: Model Version 필드에는 여전히 GR00T N1.7 EA라고 표시되어 있습니다. 저장소가 더 최신 문서입니다.
GR00T N1.5
동일한 3B 스케일, Eagle 2 백본, SigLip2 및 T5, 플로우 매칭 DiT 헤드. 이는 이미 가지고 있는 를 확장하기 위해 존재합니다. 다음 두 가지 이유로 인해 기본값으로 사용하기에 부적합합니다. 가중치는 NVIDIA의 일방적인 비상업적 라이선스를 따르며, 현재 LeRobot 릴리스에서 N1.5 지원이 제거되었습니다. 다음을 참조하십시오. .
Pi0.5
Physical Intelligence의 VLA, 정책 유형 pi05. 이 논문은 PaliGemma로 초기화된 2B VLM과 300M 액션 전문가를 제시하며, 로봇을 50Hz로 구동합니다. LeRobot의 pi05 구성은 기본적으로 50단계 청크(해당 속도로 1초)를 사용합니다. 주요 판매 포인트는 이전에 보지 못한 장소입니다. 실제 가정에서 약 400시간의 모바일 조작과 3, 12, 22, 53, 82, 104개 위치에 대한 스케일링 연구를 통해, 104개 위치 모델이 테스트 가정 자체에서 훈련된 제어 모델과 일치했습니다.
하나의 제한 사항은 lerobot/pi05_base 카드에 명시되어 있습니다: 포트는 흐름 일치 action head만 전달합니다. 하위 작업 예측, 액션 토큰화 및 RL은 업스트림에서 릴리스되지 않았으며, openpi도 자체 저장소에 대해 동일하게 말합니다. Pi0.5 페이지 및 SO-100에서 Pi0.5 가이드에 나머지가 있습니다.
Pi0.5는 게이트된 google/paligemma-3b-pt-224 토크나이저를 필요로 합니다 (gated: manual이지만 Google은 요청이 즉시 처리된다고 말합니다). 이를 수락하고 훈련 환경에서 hf auth login을 실행하지 않으면, 작업이 시작되어 한동안 다운로드되다가 네트워크 오류처럼 보이는 인증 오류로 중단됩니다. nvidia/GR00T-N1.7-3B는 게이트되지 않았지만, 그 백본인 nvidia/Cosmos-Reason2-2B는 게이트되어 있습니다 (gated: auto). 큐에 넣기 전에 둘 다 확인하십시오; 실행이 유휴 상태로 남아 있다면, 정지된 큐 페이지에 확인할 사항이 나열되어 있습니다.
SmolVLA
4억 5천만 개의 매개변수, 그 중 약 1억 개는 액션 전문가에 해당하며, VLM이 고정되고 첫 16개 언어 모델 레이어만 사용된 SmolVLM-2에서 작동합니다. 사전 훈련은 커뮤니티 데이터로 이루어졌습니다: 481개의 데이터셋, 1,060만 프레임, 여러분이 사용하는 것과 동일한 저렴한 로봇 팔에서 가져왔습니다. 여기 있는 VLA 중 유일하게 24GB 카드 하나에 들어가며, 유일하게 30 에피소드 바닥입니다. 자세한 내용은 SmolVLA 페이지.
ACT
기초 모델이 아닙니다. ALOHA의 Action Chunking Transformer는 약 80M개의 매개변수를 가지며, 각 작업당 50Hz로 50개의 시연을 통해 처음부터 훈련되었습니다. 이 논문은 약 10분 분량의 시연을 통해 6가지 실제 양손 작업을 보고하며, 각 작업당 80~90%의 성공률을 보인 예시들을 강조합니다. 이 아이디어는 액션 청킹, 이 페이지의 모든 모델에 적용되어 있으며, 그 제거 연구(ablation)는 여전히 그 효과를 가장 잘 측정합니다: 시간적 앙상블(temporal ensembling)을 끈 두 가지 시뮬레이션 작업에서 성공률은 k=1일 때 1%에서 k=100일 때 44 퍼센트까지 상승합니다. ACT 페이지에서 나머지를 확인할 수 있습니다.
벤치마크가 실제로 말하는 것
LIBERO는 이 다섯 가지 중 세 가지가 보고하는 벤치마크입니다: 시뮬레이션된 Franka Panda에서 언어 조건부 작업을 수행하며, 아래의 네 가지 스위트로 나뉘어 각 스위트당 10개의 작업이 있습니다. NVIDIA는 스위트당 200회의 실험을 실행했습니다.
| 모델 | 공간 | 객체 | 목표 | 10 (장기) | 평균 |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
각 숫자는 다른 하네스와 예산에서 나옵니다. GR00T는 글로벌 배치 640으로 20K 스텝을 실행했습니다. openpi 수치는 30K 체크포인트입니다. LeRobot 포트는 LIBERO 기본 모델에 6K 스텝을 추가했습니다. SmolVLA는 더 나아가 불일치가 있습니다. 해당 논문은 VLA 사전 훈련 없이 LIBERO에서 처음부터 해당 행을 훈련하는 반면, 그 위의 세 모델은 사전 훈련된 체크포인트를 미세 조정합니다. 96.85에서 97.5를 하나의 클러스터로 취급하고, 87.3%와의 격차는 실제이지만 6.7배 많은 매개변수로 얻어진 것으로 간주합니다.
SimplerEnv는 LIBERO가 보여주지 않는 확산을 보여줍니다. NVIDIA는 N1.7을 N1.6과 비교하는데, 이는 "세대적 변화"에 가장 가까운 공개적인 것입니다.
| SimplerEnv 스위트 | N1.6 평균 | N1.7 평균 | 최고 개선 | 최악 개선 |
|---|---|---|---|---|
| Bridge (WidowX), 7가지 작업 | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6가지 작업 | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
Bridge 행이 유용한 행입니다: put_eggplant_in_basket이 평균 5.7점을 얻은 반면 36점을 잃었고 put_eggplant_in_sink는 33점에서 2점으로 떨어졌습니다. 새로운 세대는 분포를 들어 올리기보다는 이동시키므로, N1.7이 퇴보한 위치에 작업이 있다면 평균은 아무것도 말해주지 않습니다.

다섯 가지 중 SmolVLA 논문만이 SO-100 클래스 암에 대해 보고합니다: SmolVLA는 78.3%, Pi0는 세 가지 작업에서 61.7%를 기록했으며, 둘 다 멀티태스크입니다. 이는 싱글태스크로 훈련된 ACT의 48.3%와는 비교할 수 없습니다. 깔끔한 비교는 SO-101 픽앤플레이스에서 둘 다 싱글태스크로 진행했을 때입니다: 분포 내에서는 90대 70, 분포 밖에서는 50대 40입니다. 다음에서 비교하거나 ACT 대 SmolVLA 및 Pi0.5 대 SmolVLA, 또는 아레나.
지연 시간과 비용이 배포를 결정합니다
추론 지연 시간은 사람들이 가장 나중에 발견하고 가장 먼저 후회하는 제약입니다. 벤치마크에서 5점 더 좋지만 동작 단계당 0.5초가 걸리는 정책은 실제 작업 환경에서 더 나쁘게 보입니다: 접촉 역학은 기다려주지 않습니다.
한 가지 주의할 점: GR00T 수치는 NVIDIA 카드와 다릅니다. NVIDIA 카드는 4단계 디노이징과 카메라 1대를 H100에서 이저 모드로 85.8 ms, torch.compile 사용 시 48.6 ms, 전체 TensorRT 사용 시 27.9 ms로 측정합니다. 여기서 152 ms는 순방향 패스가 아니라 서빙 오버헤드와 여러 대의 카메라를 포함한 전체 스택 수치입니다.
20에서 485 ms 루프는 모델의 것이며, 공용 인터넷 왕복 시간이 여기에 추가됩니다. 원격 추론은 느린 픽앤플레이스에는 가능하지만, 빠른 반응형 움직임에는 적합하지 않습니다. 작업에 속도가 필요하다면, 추론은 서보 옆에 위치해야 합니다: ACT 또는 SmolVLA, 로컬에서. 관련: 정책이 동작 중에 멈춤.
모델을 변경하지 않고 시간을 절약하는 한 가지 방법: SmolVLA 논문은 동기식 실행(정책이 다음을 예측하기 전에 한 덩어리를 완료하는 방식)을 측정하고, 비동기식 실행(예측이 실행과 겹치는 방식)과 비교합니다. 성공률은 78.3 대 73.3으로 비슷하지만, 동일한 픽앤플레이스 작업이 13.75초 대신 9.7초가 걸리며, 고정된 시간 창에서 로봇은 9회 대신 19회 주기를 관리합니다.
라이선스, 아무도 확인하지 않으므로 확인했습니다
| 모델 | 가중치 라이선스 | 코드 라이선스 | 상업적 사용 |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; 카드에 상업적 사용 허용됨 | Apache 2.0 | 예 |
| GR00T N1.5 | NVIDIA 일방향 비상업적 라이선스 | Apache 2.0 | 아니요 |
| Pi0.5 | pi05_base 카드 메타데이터에 license: gemma로 명시됨 | Apache 2.0 (openpi, LeRobot docs) | 둘 다 읽어보세요, 서로 다릅니다 |
| SmolVLA | smolvla_base 카드에 라이선스 필드 없음 | Apache 2.0 (LeRobot) | 코드 예, 가중치 미표기 |
| ACT | 기본 가중치 없음 | Apache 2.0 (LeRobot) | 예 |
Pi0.5 행은 주의가 필요합니다. LeRobot pi05 문서는 openpi와 일치하게 Apache 2.0을 명시하고 있으며, 한편 허브 카드에는 lerobot/pi05_base에 license: gemma라고 명시되어 있습니다. 둘 다 현재 유효합니다. GR00T N1.7은 더 완화된 버전입니다. Isaac-GR00T README는 N1.7이 Apache 2.0에 따라 상업적으로 완전히 라이선스 가능하다고 언급하고 있지만, 자체 라이선스 섹션과 모델 카드에는 코드만 Apache 2.0으로, 가중치는 NVIDIA Open Model License에 따라 라이선스되어 있습니다.
실제로 실행할 기본값
각 트레이너 폼은 기본값을 제공하며, 이는 임의적이지 않습니다. ACT의 기본값은 LeRobot 자체의 것입니다: 배치 8, lr 1e-5, 100000 학습 단계, 청크 크기 100, ACTConfig 업스트림과 일치하며 k=100 from the ACT paper. 아래 한 열은 함정입니다.
| 정책 | 배치 | LR | 최대 단계 | 경사 누적 | 적용됨? | 추가 설정 |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | 예 | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | 예 | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | 아니요 (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | 아니요 | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | 아니요 | chunkSize, nActionSteps, seed, logFreq |
GR00T의 미세 조정 진입점(launch_finetune.py, tyro CLI)은 구성 데이터클래스에 시드 필드 없음이므로, 실행은 비트 단위로 재현할 수 없습니다. 리포지토리는 또한 비결정론적 이미지 증강으로 인한 실행 간 5~6%의 편차에 대해 경고하며, 이는 온라인에서 논의되는 대부분의 벤치마크 격차보다 큽니다. LeRobot의 기본 시드는 1000입니다. 경사 누적 열은 lerobot 0.5.1을 설명합니다; 업스트림 0.6.2는 이를 --accelerator.gradient_accumulation.steps로 노출합니다.
모델 선택보다 더 중요한 설정
이것은 액션 청크입니다. 청크가 길수록 움직임이 더 부드러워지고 누적 오류가 줄어들지만, 블록이 실행되는 동안 정책이 커밋되므로 움직이는 모든 것에 늦게 반응합니다. 정지된 큐브에는 자신감을 보이지만, 굴러가는 큐브에는 무력합니다. 만약 오버슈트한다면, 실행된 부분을 단축하는 것이 재훈련보다 낫고 비용이 들지 않습니다. 관절이 짧게 멈추는 것은 다른 문제입니다. 다음을 참조하십시오: .
- ACT: ACTConfig는 기본적으로
chunk_size 100및n_action_steps 100입니다. 시간 앙상블은 비활성화되어 있으며n_action_steps 1이 필요합니다. - GR00T N1.7: 내부 호라이즌이 16에서 40으로 변경되었지만, LeRobot의 SO-101 예제는 여전히
--policy.chunk_size=16 --policy.n_action_steps=16으로 실행됩니다. 롤아웃 플래그는--execution-horizon으로 이름이 변경되었습니다. - Pi0.5: 50단계 청크이며, LeRobot의 LIBERO 레시피는
--policy.n_action_steps=10을 통해 10단계를 실행합니다.--policy.pretrained_path를 사용하면 플래그를 생략할 경우 50으로 되돌아갑니다. - SmolVLA: 50-액션 청크, 두 가지 조절 기능 모두 노출됨.
오후 한나절에 다섯 가지 모두를 선별하는 방법
가장 저렴한 답은 더 많이 읽는 것이 아닙니다. 약 15 USD를 지출하고 로봇 팔이 알려주도록 하십시오: 한 번 기록하고, 먼저 저렴한 모델을 훈련시킨 다음, 데이터가 건전하다고 입증되면 확장하십시오. 구조가 양보다 중요하며, 이는 및 의 핵심입니다.
- 150개 에피소드를 한 번에 기록
GR00T, Pi0.5, ACT 및 SmolVLA의 30을 위해 50이 바닥을 정리합니다. 얇게 퍼뜨리기보다는 각 변형을 반복하십시오: 25개는 훈련되지 않은 5개의 큐브 위치에 걸쳐 50개의 에피소드를 훈련했습니다. 첫 데이터셋 기록하기를 참조하십시오.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ACT를 먼저 훈련하십시오. ACT는 거짓말을 할 수 없기 때문입니다.
사전 훈련된 가중치가 없으므로, 작업이 수행된다면 데이터셋에 해당 작업이 포함되어 있습니다. ACT가 정체되면 데이터를 수정하십시오. 1~3 USD, 24GB 카드에서 2~5시간.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3동일한 데이터셋에서 SmolVLA를 변경 없이 실행
동일한 데이터, 동일한 암, 80M 대신 450M 매개변수, 그리고 언어 조건화. LeRobot은 A100 하나에서 약 4시간 동안 20K 스텝 실행을 수행합니다. 이것이 사전 훈련이 어떤 이점을 제공하는지 알려줍니다.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T를 사용하기 전에 v2.1로 다운그레이드
GR00T는 LeRobot v2 형식의 변형과 연결된 상태 및 액션 배열이 명명된 필드로 분할되는 방식을 매핑하는 추가
meta/modality.json을 읽습니다. v3.0 데이터셋은 해당 로더를 충돌시킵니다. v3.0은 많은 에피소드를 공유 파일에 묶는 반면 v2는 에피소드당 하나를 작성했기 때문입니다. Isaac-GR00T는 다운그레이드 헬퍼를scripts/lerobot_conversion/convert_v3_to_v2.py로 제공합니다. v3 거부 페이지가 빠른 경로입니다.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5처음 두 가지가 미흡할 경우에만 GR00T N1.7로 전환
여기에 표시된 NVIDIA의 CLI를 통하거나 LeRobot의
groot정책 유형을 통해. NVIDIA는 미세 조정을 위해 40GB 이상의 VRAM을, 추론을 위해 16GB를 권장합니다. OOM 발생 시 OOM 페이지를 참조하십시오.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
스크리닝 패스를 실행하는 두 가지 방법
툴체인이 공존하지 않으므로 세 가지 환경이 필요합니다. 메인의 LeRobot은 0.6.2 버전이며 Python 3.12 이상이 필요합니다. Isaac-GR00T와 openpi는 별도의 uv 관리 저장소입니다.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T는
torchcodec0.8.0을 유일한 비디오 백엔드로 고정하며, FFmpeg 4~7이 필요합니다. FFmpeg 8은 지원되지 않으며, AV1은 보장되지 않습니다. - openpi 메모리 요구 사항: 추론 8GB 이상, LoRA 22.5GB 이상, 전체 미세 조정 70GB 이상. 마지막 항목이 Pi0.5가 A100 작업인 이유입니다.
- GPU를 직접 대여하고, 사용 후 파괴하며, 세 가지 체크포인트 경로 세트를 수동으로 조정하십시오.
동일한 다섯 가지 모델, 하나의 양식. 모델, 데이터셋 및 하이퍼파라미터를 선택하십시오. 백엔드는 필요한 VRAM 크기에 맞춰 GPU를 대여하고, 트레이너를 실행하며, 체크포인트를 객체 스토리지에 기록합니다.
- 훈련 매트릭스는 5개 모델과 4개 암으로 구성되며, 각 셀은 가이드입니다: SO-100의 SmolVLA, SO-101의 ACT.
- 추론 파드는 유휴 감시자와 함께
/api/inference/pod에 의해 자동 프로비저닝되므로, 잊혀진 파드가 조용히 요금을 청구하지 않습니다. - 기본 체크포인트는 공급업체 자체의 것입니다:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT는 없습니다. - CLI 및 MCP 서버를 통한 AI 에이전트로부터 동일한 작업.
- 하드웨어가 없습니까? 라이브 암은 가입 없이 물리적 SO-100을 스트리밍합니다. 시도 페이지는 진입 방법을 보여줍니다.
파운데이션 모델 또는 처음부터
진정한 갈림길은 어떤 3B 모델을 선택할지가 아닙니다. 오히려 사전 훈련된 VLA를 사용할지 여부입니다. ACT가 각각 약 10분 분량의 시연으로 6가지 실제 양손 작업을 학습했으며, 80M 매개변수를 사용하고 사전 훈련된 것은 아무것도 없다는 점을 고려하면 말이죠.
- 언어 조건화. ACT는 이것이 없습니다. 하나의 ACT 체크포인트는 하나의 작업만 수행합니다.
- 시연에 없는 객체에 더 우수함: SO-101에서 ACT의 분포 외 40%에 비해 50%.
- 다중 작업 가능: SmolVLA는 하나의 체크포인트로 세 가지 SO-100 작업에서 78.3%에 도달합니다. ACT는 단일 작업으로만 실행되었습니다.
- 7.6배에서 24배 더 높은 지연 시간: ACT의 20ms에 비해 액션 단계당 152ms에서 485ms.
- 실행당 1~3 USD 대신 4~12 USD, 그리고 24GB 카드 대신 A100 티어.
- 라이선스 노출, 그리고 처음부터는 존재하지 않는 게이트된 저장소 실패 모드.
- 사전 훈련된 가중치는 잘못된 데이터셋을 가릴 수 있습니다. 손상된 데이터에서 절반만 작동하는 미세 조정은 데이터를 확인하기 전에 일주일의 비용이 듭니다.
이전 실행 재현 사례
2025년 체크포인트를 추적하면 모델 선택이 정해지고 문제는 버전 고정으로 바뀝니다. 현재 LeRobot은 N1.5를 거부하므로, lerobot==0.5.1을 고정합니다. 시드 필드가 없고 실행 간 5~6%의 편차가 있어 재현은 본질적으로 근사치입니다. 및 에서 플랫폼 측면을 다룹니다.

두 가지로 좁혀졌나요? 및 . 원본 데이터는 다음 아레나 항목에 있습니다: , , 및 .
이 플랫폼이 도움이 되지 않는 경우
- 원격 추론을 빠르게 할 수 없습니다. 20~485 ms의 루프는 모델에 속하며, 인터넷 왕복 시간은 여기에 추가됩니다.
- 자체 하드웨어에서 GR00T 또는 Pi0.5를 미세 조정할 수 없습니다. 여기서는 둘 다 클라우드 전용이며, SmolVLA와 ACT만 로컬에서 실행됩니다.
- 데이터셋을 수정할 수 없습니다. 손실은 감소하지만 정책은 아무것도 하지 않습니다는 데이터 문제이며, 특정 설정에서만 작동하는 정책은 커버리지 문제입니다.
- GR00T 실행을 재현 가능하게 만들 수 없습니다. 업스트림 구성에 시드 필드가 없습니다.
85개 모델, 332개 벤치마크 결과, 모든 숫자는 출처에 연결됨
이 페이지의 정렬 가능한 테이블 버전: 85개의 비전-언어-액션 모델, 332개의 벤치마크 결과, 각각 논문 또는 모델 카드에 연결되어 있습니다.
아레나 열기하나를 선택하고 진행하기
기본 설정: 50개의 에피소드를 기록하고, 데이터셋을 검증하기 위해 ACT를 1~3 USD로 훈련한 다음, SmolVLA를 동일한 데이터로 훈련합니다. 총 6 USD 미만으로, 이들은 중요한 질문에 답합니다: 사전 훈련이 여기서 도움이 되는지, 아니면 병목 현상이 데이터에 있는지 여부입니다. 접촉이 많은 다단계 작업에는 GR00T N1.7로, 장면이 변경될 때는 Pi0.5로 확장하십시오.
플랫폼 둘러보기: 첫 번째 정책 훈련하기, 다음 첫 번째 정책 실행하기. 훈련 문서 및 데이터셋 문서는 형식과 포맷을 다루고; SO-100 페이지 및 완벽한 SO-100 가이드는 빌드 및 보정을 다룹니다. 배경 정보: VLA 개요 및 Pi0 플로우 매칭 아티클. 성공률을 높이는 것은 데이터 품질 가이드입니다.
SO-100에서 어떤 VLA 정책을 먼저 훈련해야 하나요?▾
ACT, 그 다음 SmolVLA입니다. ACT는 처음부터 훈련하므로, 좋지 않은 데이터셋을 가릴 수 없으며, 24GB 카드에서 한 번 실행하는 데 1~3 USD가 소요됩니다. 만약 ACT가 작업을 수행한다면, GR00T N1.7 또는 Pi0.5 실행에 드는 4~12 USD는 낭비되지 않습니다.
GR00T N1.7이 Pi0.5보다 실제로 더 좋은가요?▾
LIBERO에서는 노이즈 범위 내에 있습니다: GR00T N1.7의 경우 4개 스위트에서 97.0%, openpi에서 30k 스텝의 Pi0.5는 96.85%, LeRobot 포트는 97.5%로, 모두 다른 하네스에서 나온 결과입니다. 실제 차이점은 액션 스텝당 152 ms 대 485 ms, v2.1 데이터셋 대 v3.0, 그리고 벤치마크 정확도 대 개방형 세계 일반화 능력입니다.
이 중 어떤 것이든 단일 RTX 4090에서 미세 조정할 수 있나요?▾
SmolVLA와 ACT는 가능합니다. 둘 다 RTX 4090 또는 모든 24GB 카드에서 로컬로 실행됩니다. GR00T N1.7, N1.5 및 Pi0.5는 A100 또는 H100 80GB가 필요하며 여기서는 클라우드 전용입니다. NVIDIA는 GR00T 미세 조정을 위해 40GB 이상을 권장합니다. openpi의 경우 전체 Pi0.5 미세 조정을 위해 70GB 이상, LoRA의 경우 22.5GB 이상이 필요합니다.
이 다섯 가지 중 어떤 것을 상업적으로 사용할 수 있나요?▾
GR00T N1.7 가중치는 NVIDIA Open Model License Agreement에 따라 상업적 사용이 가능하다고 명시되어 있습니다. N1.5 가중치는 비상업적입니다. SmolVLA의 코드는 LeRobot에서 Apache 2.0이지만, lerobot/smolvla_base 카드에는 라이선스 필드가 없어 가중치에 대한 언급이 없습니다. ACT는 라이선스할 기본 가중치가 없습니다. Pi0.5는 모호합니다: LeRobot의 문서는 Apache 2.0이라고 하지만, 카드 메타데이터에는 license: gemma라고 되어 있습니다.
Sources
- NVIDIA Isaac-GR00T 저장소: GA 상태, N1.6에서 N1.7로의 변경 사항, 하드웨어 요구 사항, torchcodec 및 FFmpeg 제약 조건, launch_finetune.py, 실행 간 편차
- nvidia/GR00T-N1.7-3B 모델 카드: Cosmos-Reason2-2B 백본, 30억 매개변수, 추론 시간표, NVIDIA Open Model License, Model Version 필드
- nvidia/GR00T-N1.5-3B 모델 카드: Eagle 2 참조, SigLip2 및 T5, 플로우 매칭 DiT, 일방적 비상업적 라이선스
- Isaac-GR00T LIBERO 예제: 20K 스텝 및 배치 크기 640에서의 스위트별 성공률, 스위트당 200회 시도
- Isaac-GR00T SimplerEnv 예제: 작업별 Bridge 및 Fractal 성공률, GR00T N1.6 대 N1.7
- pi0.5: 개방형 세계 일반화 기능을 갖춘 비전-언어-액션 모델 (20억 VLM 및 3억 액션 전문가, 50Hz 제어, 약 400시간의 모바일 조작, 3개에서 104개 위치에 대한 스케일링 연구)
- openpi 저장소: GPU 메모리 하한, 플로우 매칭 헤드 전용 범위, examples/libero에 있는 Pi0.5 LIBERO 결과
- lerobot/pi05_base 모델 카드: LeRobot 포트의 범위, license: gemma 메타데이터, lerobot-train 사용법
- LeRobot pi0.5 문서: 게이트형 PaliGemma 토크나이저, LIBERO 재현 테이블, n_action_steps 폴백 트랩, Apache 2.0 선언
- SmolVLA: 저렴하고 효율적인 로봇 공학을 위한 비전-언어-액션 모델 (4억 5천만 매개변수, LIBERO 및 Meta-World 테이블, SO-100 및 SO-101 결과, 비동기 추론)
- LeRobot SmolVLA 문서: 25개 대비 5개 위치에서 50개 에피소드, A100에서 약 4시간 동안 20k 스텝
- 저가 하드웨어로 미세 양손 조작 학습 (ACT 및 ALOHA): 80-90% 성공률의 6가지 작업, k=1에서 k=100까지의 청크 크기 절제 연구
- LeRobot 0.6.2: ACTConfig 및 SmolVLAConfig 기본값, 기본 시드 1000, --accelerator.gradient_accumulation.steps, Python 3.12 요구 사항, Apache 2.0
- LeRobot GR00T 문서: 정책 유형 groot, N1.5 지원 제거됨, lerobot==0.5.1 고정, SO-101 청크 크기 예제
- lerobot/smolvla_base 모델 카드: --policy.path에 사용되는 SmolVLA 기본 체크포인트 및 라이선스 필드가 없는 카드 메타데이터
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started