AY-Robots 정책 비교 테이블은 GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA 및 ACT를 파라미터 수, GPU 티어, 추론 지연 시간 및 최소 에피소드 수와 함께 나란히 보여줍니다
vla 모델정책 훈련모델 선택lerobotso-100

2026년에 어떤 VLA 정책을 훈련해야 할까요?

AY-Robots ResearchAugust 23, 202618분 읽기

GR00T N1.7, Pi0.5, SmolVLA, ACT 또는 GR00T N1.5? 실제 상황에 맞춰진 결정 테이블과 함께 각 선택에 대한 공개된 벤치마크 수치, 지연 시간, 실행당 비용 및 라이선스를 제공합니다.

오늘날 SO-100 등급 로봇 팔에서 5가지 정책을 훈련할 수 있습니다. 이들은 추론 지연 시간에서 24배, 파라미터 수에서 37배, 실행 비용에서 12배 차이가 나며, 결과를 배포할 수 있는지 여부도 다릅니다. 5개의 모델 카드로는 해결되지 않습니다. 어떤 것도 '무엇을 먼저 실행해야 하는가?'라는 질문에 답하지 못합니다.

아래의 모든 수치는 2026년 8월에 논문, 저장소 및 카드에서 발췌한 것입니다. 플랫폼 수치는 AY-Robots 정책 카탈로그에서 가져왔습니다. 둘이 일치하지 않는 경우, 둘 다 표시됩니다.

요약

  • 데이터셋을 의심한다면 ACT를 먼저 훈련하십시오: 실행당 1~3 USD, 나쁜 데이터를 가릴 사전 훈련된 것이 없습니다.
  • GR00T N1.7과 Pi0.5는 LIBERO에서 0.5점 이내(97.0 대 96.85~97.5)에 있습니다. 이는 둘 중 하나를 선택할 이유가 되지 않습니다.
  • Pi0.5는 정확도보다는 일반화에 중점을 두며, 485 ms로 가장 느립니다.
  • 4억 5천만 개의 파라미터를 가진 SmolVLA는 여기에서 24 GB 카드 하나로 미세 조정할 수 있는 유일한 VLA입니다.
  • 20 ms의 ACT는 빠른 반응형 동작을 위한 유일한 옵션입니다. 나머지는 라이선스가 결정합니다.

의사 결정 표

귀하의 상황이것을 훈련하세요이유
데이터셋 품질 미검증ACT사전 훈련된 어떤 것도 손상된 데이터셋을 숨길 수 없으며, 실패 시 1~3 USD의 비용이 발생합니다.
접촉이 많고, 다단계이며, 언어 조건부GR00T N1.74개의 LIBERO 스위트에서 97.0%를 달성했으며, 상대적인 말단 효과기 동작 공간을 포함합니다.
빠른 반응 동작, 서보에서의 추론ACT20 ms. 다음으로 빠른 것은 7.6배 느립니다.
새로운 객체, 새로운 장면, 개방형 세계Pi0.5최대 104개 위치에 걸쳐 분포 외 동작을 위해 구축되었습니다.
24 GB 카드 하나, 여전히 언어를 원함SmolVLA450 M 매개변수, 30 에피소드 최소치, 로컬에서 실행됩니다.
2025년에 기록된 실행 재현GR00T N1.5꼭 필요한 경우에만: LeRobot은 이제 이를 거부하며, 가중치는 비상업적입니다.
이것은 제품으로 출시될 것입니다N1.7, SmolVLA or ACTN1.5는 비상업적이며, Pi0.5는 Gemma 약관을 따르고, SmolVLA의 카드에는 아무것도 명시되어 있지 않습니다.

다섯 가지 후보

다섯 가지 모두 정책입니다: 카메라 프레임, 조인트 위치 및 그 중 네 가지의 경우, 미래 조인트 목표의 덩어리에 매핑된 언어 지침입니다. 이들을 구분하는 것은 귀하가 도착하기 전에 얼마나 많이 학습되었는지입니다.

정책매개변수지연 시간GPU 티어로컬?최소 에피소드형식비용
ACT~80 M20 ms24 GB card50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB card30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GB아니요50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GB아니요50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GB아니요50v3.04 to 12 USD

GR00T N1.7

NVIDIA의 현재 비전-언어-액션 모델, 약 30억 개의 매개변수를 가지며, 약 4천만 개는 미세 조정 중에 훈련되었습니다. 저장소에는 N1.6과의 차이점이 나열되어 있습니다: 백본은 벤더 Eagle 모델에서 Qwen3-VL의 Cosmos-Reason2-2B로 변경되었고, 확산 레이어는 32에서 16으로, 상태 및 액션 차원은 29에서 132로, 액션 호라이즌은 16에서 40으로 변경되었습니다.

작은 로봇 팔에서 중요한 것은 상대적인 엔드 이펙터 액션 공간입니다: N1.7은 현재 자세로부터의 델타를 예측하며, 이는 2만 시간의 EgoScale 인간 비디오가 로봇 정책으로 전이될 수 있도록 합니다. 사양은 N1.7 페이지, 절차는 SO-100 가이드의 N1.7.

저장소에서는 GA, 모델 카드에서는 EA

Isaac-GR00T README는 N1.7을 일반 가용성 릴리스로 선언하며, 완전한 벤치마크와 지원을 제공합니다. Hugging Face 카드는 아직 업데이트되지 않았습니다: Model Version 필드에는 여전히 GR00T N1.7 EA라고 표시되어 있습니다. 저장소가 더 최신 문서입니다.

GR00T N1.5

동일한 3B 스케일, Eagle 2 백본, SigLip2 및 T5, 플로우 매칭 DiT 헤드. 이는 이미 가지고 있는 를 확장하기 위해 존재합니다. 다음 두 가지 이유로 인해 기본값으로 사용하기에 부적합합니다. 가중치는 NVIDIA의 일방적인 비상업적 라이선스를 따르며, 현재 LeRobot 릴리스에서 N1.5 지원이 제거되었습니다. 다음을 참조하십시오. .

Pi0.5

Physical Intelligence의 VLA, 정책 유형 pi05. 이 논문은 PaliGemma로 초기화된 2B VLM과 300M 액션 전문가를 제시하며, 로봇을 50Hz로 구동합니다. LeRobot의 pi05 구성은 기본적으로 50단계 청크(해당 속도로 1초)를 사용합니다. 주요 판매 포인트는 이전에 보지 못한 장소입니다. 실제 가정에서 약 400시간의 모바일 조작과 3, 12, 22, 53, 82, 104개 위치에 대한 스케일링 연구를 통해, 104개 위치 모델이 테스트 가정 자체에서 훈련된 제어 모델과 일치했습니다.

하나의 제한 사항은 lerobot/pi05_base 카드에 명시되어 있습니다: 포트는 흐름 일치 action head만 전달합니다. 하위 작업 예측, 액션 토큰화 및 RL은 업스트림에서 릴리스되지 않았으며, openpi도 자체 저장소에 대해 동일하게 말합니다. Pi0.5 페이지SO-100에서 Pi0.5 가이드에 나머지가 있습니다.

오후를 잡아먹는 함정: 게이트된 저장소

Pi0.5는 게이트된 google/paligemma-3b-pt-224 토크나이저를 필요로 합니다 (gated: manual이지만 Google은 요청이 즉시 처리된다고 말합니다). 이를 수락하고 훈련 환경에서 hf auth login을 실행하지 않으면, 작업이 시작되어 한동안 다운로드되다가 네트워크 오류처럼 보이는 인증 오류로 중단됩니다. nvidia/GR00T-N1.7-3B는 게이트되지 않았지만, 그 백본인 nvidia/Cosmos-Reason2-2B는 게이트되어 있습니다 (gated: auto). 큐에 넣기 전에 둘 다 확인하십시오; 실행이 유휴 상태로 남아 있다면, 정지된 큐 페이지에 확인할 사항이 나열되어 있습니다.

SmolVLA

4억 5천만 개의 매개변수, 그 중 약 1억 개는 액션 전문가에 해당하며, VLM이 고정되고 첫 16개 언어 모델 레이어만 사용된 SmolVLM-2에서 작동합니다. 사전 훈련은 커뮤니티 데이터로 이루어졌습니다: 481개의 데이터셋, 1,060만 프레임, 여러분이 사용하는 것과 동일한 저렴한 로봇 팔에서 가져왔습니다. 여기 있는 VLA 중 유일하게 24GB 카드 하나에 들어가며, 유일하게 30 에피소드 바닥입니다. 자세한 내용은 SmolVLA 페이지.

ACT

기초 모델이 아닙니다. ALOHA의 Action Chunking Transformer는 약 80M개의 매개변수를 가지며, 각 작업당 50Hz로 50개의 시연을 통해 처음부터 훈련되었습니다. 이 논문은 약 10분 분량의 시연을 통해 6가지 실제 양손 작업을 보고하며, 각 작업당 80~90%의 성공률을 보인 예시들을 강조합니다. 이 아이디어는 액션 청킹, 이 페이지의 모든 모델에 적용되어 있으며, 그 제거 연구(ablation)는 여전히 그 효과를 가장 잘 측정합니다: 시간적 앙상블(temporal ensembling)을 끈 두 가지 시뮬레이션 작업에서 성공률은 k=1일 때 1%에서 k=100일 때 44 퍼센트까지 상승합니다. ACT 페이지에서 나머지를 확인할 수 있습니다.

벤치마크가 실제로 말하는 것

LIBERO는 이 다섯 가지 중 세 가지가 보고하는 벤치마크입니다: 시뮬레이션된 Franka Panda에서 언어 조건부 작업을 수행하며, 아래의 네 가지 스위트로 나뉘어 각 스위트당 10개의 작업이 있습니다. NVIDIA는 스위트당 200회의 실험을 실행했습니다.

모델공간객체목표10 (장기)평균
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
이 행들은 엄격하게 비교할 수 없습니다

각 숫자는 다른 하네스와 예산에서 나옵니다. GR00T는 글로벌 배치 640으로 20K 스텝을 실행했습니다. openpi 수치는 30K 체크포인트입니다. LeRobot 포트는 LIBERO 기본 모델에 6K 스텝을 추가했습니다. SmolVLA는 더 나아가 불일치가 있습니다. 해당 논문은 VLA 사전 훈련 없이 LIBERO에서 처음부터 해당 행을 훈련하는 반면, 그 위의 세 모델은 사전 훈련된 체크포인트를 미세 조정합니다. 96.85에서 97.5를 하나의 클러스터로 취급하고, 87.3%와의 격차는 실제이지만 6.7배 많은 매개변수로 얻어진 것으로 간주합니다.

SimplerEnv는 LIBERO가 보여주지 않는 확산을 보여줍니다. NVIDIA는 N1.7을 N1.6과 비교하는데, 이는 "세대적 변화"에 가장 가까운 공개적인 것입니다.

SimplerEnv 스위트N1.6 평균N1.7 평균최고 개선최악 개선
Bridge (WidowX), 7가지 작업56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6가지 작업52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Bridge 행이 유용한 행입니다: put_eggplant_in_basket이 평균 5.7점을 얻은 반면 36점을 잃었고 put_eggplant_in_sink는 33점에서 2점으로 떨어졌습니다. 새로운 세대는 분포를 들어 올리기보다는 이동시키므로, N1.7이 퇴보한 위치에 작업이 있다면 평균은 아무것도 말해주지 않습니다.

AY-Robots 아레나 리더보드, 85개의 비전-언어-액션 모델과 332개의 벤치마크 결과가 포함된 정렬 가능한 표이며, 각 값은 해당 논문 또는 모델 카드에 연결되어 있습니다.
아레나에는 85개의 VLA 모델과 332개의 벤치마크 결과가 있으며, 각 결과는 해당 논문 또는 모델 카드에 연결되어 있습니다. 블로그 게시물에 인용된 숫자가 실제인지 확인하는 데 유용합니다.

다섯 가지 중 SmolVLA 논문만이 SO-100 클래스 암에 대해 보고합니다: SmolVLA는 78.3%, Pi0는 세 가지 작업에서 61.7%를 기록했으며, 둘 다 멀티태스크입니다. 이는 싱글태스크로 훈련된 ACT의 48.3%와는 비교할 수 없습니다. 깔끔한 비교는 SO-101 픽앤플레이스에서 둘 다 싱글태스크로 진행했을 때입니다: 분포 내에서는 90대 70, 분포 밖에서는 50대 40입니다. 다음에서 비교하거나 ACT 대 SmolVLAPi0.5 대 SmolVLA, 또는 아레나.

지연 시간과 비용이 배포를 결정합니다

추론 지연 시간은 사람들이 가장 나중에 발견하고 가장 먼저 후회하는 제약입니다. 벤치마크에서 5점 더 좋지만 동작 단계당 0.5초가 걸리는 정책은 실제 작업 환경에서 더 나쁘게 보입니다: 접촉 역학은 기다려주지 않습니다.

한 가지 주의할 점: GR00T 수치는 NVIDIA 카드와 다릅니다. NVIDIA 카드는 4단계 디노이징과 카메라 1대를 H100에서 이저 모드로 85.8 ms, torch.compile 사용 시 48.6 ms, 전체 TensorRT 사용 시 27.9 ms로 측정합니다. 여기서 152 ms는 순방향 패스가 아니라 서빙 오버헤드와 여러 대의 카메라를 포함한 전체 스택 수치입니다.

원격 추론의 명확한 한계

20에서 485 ms 루프는 모델의 것이며, 공용 인터넷 왕복 시간이 여기에 추가됩니다. 원격 추론은 느린 픽앤플레이스에는 가능하지만, 빠른 반응형 움직임에는 적합하지 않습니다. 작업에 속도가 필요하다면, 추론은 서보 옆에 위치해야 합니다: ACT 또는 SmolVLA, 로컬에서. 관련: 정책이 동작 중에 멈춤.

모델을 변경하지 않고 시간을 절약하는 한 가지 방법: SmolVLA 논문은 동기식 실행(정책이 다음을 예측하기 전에 한 덩어리를 완료하는 방식)을 측정하고, 비동기식 실행(예측이 실행과 겹치는 방식)과 비교합니다. 성공률은 78.3 대 73.3으로 비슷하지만, 동일한 픽앤플레이스 작업이 13.75초 대신 9.7초가 걸리며, 고정된 시간 창에서 로봇은 9회 대신 19회 주기를 관리합니다.

라이선스, 아무도 확인하지 않으므로 확인했습니다

모델가중치 라이선스코드 라이선스상업적 사용
GR00T N1.7NVIDIA Open Model License; 카드에 상업적 사용 허용됨Apache 2.0
GR00T N1.5NVIDIA 일방향 비상업적 라이선스Apache 2.0아니요
Pi0.5pi05_base 카드 메타데이터에 license: gemma로 명시됨Apache 2.0 (openpi, LeRobot docs)둘 다 읽어보세요, 서로 다릅니다
SmolVLAsmolvla_base 카드에 라이선스 필드 없음Apache 2.0 (LeRobot)코드 예, 가중치 미표기
ACT기본 가중치 없음Apache 2.0 (LeRobot)

Pi0.5 행은 주의가 필요합니다. LeRobot pi05 문서는 openpi와 일치하게 Apache 2.0을 명시하고 있으며, 한편 허브 카드에는 lerobot/pi05_baselicense: gemma라고 명시되어 있습니다. 둘 다 현재 유효합니다. GR00T N1.7은 더 완화된 버전입니다. Isaac-GR00T README는 N1.7이 Apache 2.0에 따라 상업적으로 완전히 라이선스 가능하다고 언급하고 있지만, 자체 라이선스 섹션과 모델 카드에는 코드만 Apache 2.0으로, 가중치는 NVIDIA Open Model License에 따라 라이선스되어 있습니다.

실제로 실행할 기본값

각 트레이너 폼은 기본값을 제공하며, 이는 임의적이지 않습니다. ACT의 기본값은 LeRobot 자체의 것입니다: 배치 8, lr 1e-5, 100000 학습 단계, 청크 크기 100, ACTConfig 업스트림과 일치하며 k=100 from the ACT paper. 아래 한 열은 함정입니다.

정책배치LR최대 단계경사 누적적용됨?추가 설정
GR00T N1.7321e-4200001saveSteps
GR00T N1.511e-5200016saveSteps
Pi0.515e-53000016아니요 (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008아니요seed, logFreq
ACT81e-51000001아니요chunkSize, nActionSteps, seed, logFreq
재현성, 2026년 8월

GR00T의 미세 조정 진입점(launch_finetune.py, tyro CLI)은 구성 데이터클래스에 시드 필드 없음이므로, 실행은 비트 단위로 재현할 수 없습니다. 리포지토리는 또한 비결정론적 이미지 증강으로 인한 실행 간 5~6%의 편차에 대해 경고하며, 이는 온라인에서 논의되는 대부분의 벤치마크 격차보다 큽니다. LeRobot의 기본 시드는 1000입니다. 경사 누적 열은 lerobot 0.5.1을 설명합니다; 업스트림 0.6.2는 이를 --accelerator.gradient_accumulation.steps로 노출합니다.

모델 선택보다 더 중요한 설정

이것은 액션 청크입니다. 청크가 길수록 움직임이 더 부드러워지고 누적 오류가 줄어들지만, 블록이 실행되는 동안 정책이 커밋되므로 움직이는 모든 것에 늦게 반응합니다. 정지된 큐브에는 자신감을 보이지만, 굴러가는 큐브에는 무력합니다. 만약 오버슈트한다면, 실행된 부분을 단축하는 것이 재훈련보다 낫고 비용이 들지 않습니다. 관절이 짧게 멈추는 것은 다른 문제입니다. 다음을 참조하십시오: .

  • ACT: ACTConfig는 기본적으로 chunk_size 100n_action_steps 100입니다. 시간 앙상블은 비활성화되어 있으며 n_action_steps 1이 필요합니다.
  • GR00T N1.7: 내부 호라이즌이 16에서 40으로 변경되었지만, LeRobot의 SO-101 예제는 여전히 --policy.chunk_size=16 --policy.n_action_steps=16으로 실행됩니다. 롤아웃 플래그는 --execution-horizon으로 이름이 변경되었습니다.
  • Pi0.5: 50단계 청크이며, LeRobot의 LIBERO 레시피는 --policy.n_action_steps=10을 통해 10단계를 실행합니다. --policy.pretrained_path를 사용하면 플래그를 생략할 경우 50으로 되돌아갑니다.
  • SmolVLA: 50-액션 청크, 두 가지 조절 기능 모두 노출됨.

오후 한나절에 다섯 가지 모두를 선별하는 방법

가장 저렴한 답은 더 많이 읽는 것이 아닙니다. 약 15 USD를 지출하고 로봇 팔이 알려주도록 하십시오: 한 번 기록하고, 먼저 저렴한 모델을 훈련시킨 다음, 데이터가 건전하다고 입증되면 확장하십시오. 구조가 양보다 중요하며, 이는 및 의 핵심입니다.

  1. 1
    50개 에피소드를 한 번에 기록

    GR00T, Pi0.5, ACT 및 SmolVLA의 30을 위해 50이 바닥을 정리합니다. 얇게 퍼뜨리기보다는 각 변형을 반복하십시오: 25개는 훈련되지 않은 5개의 큐브 위치에 걸쳐 50개의 에피소드를 훈련했습니다. 첫 데이터셋 기록하기를 참조하십시오.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ACT를 먼저 훈련하십시오. ACT는 거짓말을 할 수 없기 때문입니다.

    사전 훈련된 가중치가 없으므로, 작업이 수행된다면 데이터셋에 해당 작업이 포함되어 있습니다. ACT가 정체되면 데이터를 수정하십시오. 1~3 USD, 24GB 카드에서 2~5시간.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    동일한 데이터셋에서 SmolVLA를 변경 없이 실행

    동일한 데이터, 동일한 암, 80M 대신 450M 매개변수, 그리고 언어 조건화. LeRobot은 A100 하나에서 약 4시간 동안 20K 스텝 실행을 수행합니다. 이것이 사전 훈련이 어떤 이점을 제공하는지 알려줍니다.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T를 사용하기 전에 v2.1로 다운그레이드

    GR00T는 LeRobot v2 형식의 변형과 연결된 상태 및 액션 배열이 명명된 필드로 분할되는 방식을 매핑하는 추가 meta/modality.json을 읽습니다. v3.0 데이터셋은 해당 로더를 충돌시킵니다. v3.0은 많은 에피소드를 공유 파일에 묶는 반면 v2는 에피소드당 하나를 작성했기 때문입니다. Isaac-GR00T는 다운그레이드 헬퍼를 scripts/lerobot_conversion/convert_v3_to_v2.py로 제공합니다. v3 거부 페이지가 빠른 경로입니다.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    처음 두 가지가 미흡할 경우에만 GR00T N1.7로 전환

    여기에 표시된 NVIDIA의 CLI를 통하거나 LeRobot의 groot 정책 유형을 통해. NVIDIA는 미세 조정을 위해 40GB 이상의 VRAM을, 추론을 위해 16GB를 권장합니다. OOM 발생 시 OOM 페이지를 참조하십시오.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

스크리닝 패스를 실행하는 두 가지 방법

툴체인이 공존하지 않으므로 세 가지 환경이 필요합니다. 메인의 LeRobot은 0.6.2 버전이며 Python 3.12 이상이 필요합니다. Isaac-GR00T와 openpi는 별도의 uv 관리 저장소입니다.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T는 torchcodec 0.8.0을 유일한 비디오 백엔드로 고정하며, FFmpeg 4~7이 필요합니다. FFmpeg 8은 지원되지 않으며, AV1은 보장되지 않습니다.
  • openpi 메모리 요구 사항: 추론 8GB 이상, LoRA 22.5GB 이상, 전체 미세 조정 70GB 이상. 마지막 항목이 Pi0.5가 A100 작업인 이유입니다.
  • GPU를 직접 대여하고, 사용 후 파괴하며, 세 가지 체크포인트 경로 세트를 수동으로 조정하십시오.

파운데이션 모델 또는 처음부터

진정한 갈림길은 어떤 3B 모델을 선택할지가 아닙니다. 오히려 사전 훈련된 VLA를 사용할지 여부입니다. ACT가 각각 약 10분 분량의 시연으로 6가지 실제 양손 작업을 학습했으며, 80M 매개변수를 사용하고 사전 훈련된 것은 아무것도 없다는 점을 고려하면 말이죠.

ACT를 처음부터 훈련하는 대신 사전 훈련된 VLA 미세 조정하기
얻는 것
  • 언어 조건화. ACT는 이것이 없습니다. 하나의 ACT 체크포인트는 하나의 작업만 수행합니다.
  • 시연에 없는 객체에 더 우수함: SO-101에서 ACT의 분포 외 40%에 비해 50%.
  • 다중 작업 가능: SmolVLA는 하나의 체크포인트로 세 가지 SO-100 작업에서 78.3%에 도달합니다. ACT는 단일 작업으로만 실행되었습니다.
감수해야 할 것
  • 7.6배에서 24배 더 높은 지연 시간: ACT의 20ms에 비해 액션 단계당 152ms에서 485ms.
  • 실행당 1~3 USD 대신 4~12 USD, 그리고 24GB 카드 대신 A100 티어.
  • 라이선스 노출, 그리고 처음부터는 존재하지 않는 게이트된 저장소 실패 모드.
  • 사전 훈련된 가중치는 잘못된 데이터셋을 가릴 수 있습니다. 손상된 데이터에서 절반만 작동하는 미세 조정은 데이터를 확인하기 전에 일주일의 비용이 듭니다.

이전 실행 재현 사례

2025년 체크포인트를 추적하면 모델 선택이 정해지고 문제는 버전 고정으로 바뀝니다. 현재 LeRobot은 N1.5를 거부하므로, lerobot==0.5.1을 고정합니다. 시드 필드가 없고 실행 간 5~6%의 편차가 있어 재현은 본질적으로 근사치입니다. 및 에서 플랫폼 측면을 다룹니다.

AY-Robots의 GR00T N1.7과 Pi0.5의 정면 비교 페이지로, 파라미터 수, GPU 요구 사항, 추론 지연 시간, 데이터셋 형식 및 최소 에피소드 수를 나란히 보여줍니다.
Head to head on /compare/groot-n1-7-vs-pi0-5. 두 3B 모델은 사양서상으로는 상호 교환 가능한 것처럼 보이지만 실제로는 그렇지 않습니다. 하나는 LeRobot v2.1을 필요로 하고, 다른 하나는 v3.0을 필요로 합니다.

두 가지로 좁혀졌나요? 및 . 원본 데이터는 다음 아레나 항목에 있습니다: , , 및 .

이 플랫폼이 도움이 되지 않는 경우

  • 원격 추론을 빠르게 할 수 없습니다. 20~485 ms의 루프는 모델에 속하며, 인터넷 왕복 시간은 여기에 추가됩니다.
  • 자체 하드웨어에서 GR00T 또는 Pi0.5를 미세 조정할 수 없습니다. 여기서는 둘 다 클라우드 전용이며, SmolVLA와 ACT만 로컬에서 실행됩니다.
  • 데이터셋을 수정할 수 없습니다. 손실은 감소하지만 정책은 아무것도 하지 않습니다는 데이터 문제이며, 특정 설정에서만 작동하는 정책은 커버리지 문제입니다.
  • GR00T 실행을 재현 가능하게 만들 수 없습니다. 업스트림 구성에 시드 필드가 없습니다.

85개 모델, 332개 벤치마크 결과, 모든 숫자는 출처에 연결됨

이 페이지의 정렬 가능한 테이블 버전: 85개의 비전-언어-액션 모델, 332개의 벤치마크 결과, 각각 논문 또는 모델 카드에 연결되어 있습니다.

아레나 열기

하나를 선택하고 진행하기

기본 설정: 50개의 에피소드를 기록하고, 데이터셋을 검증하기 위해 ACT를 1~3 USD로 훈련한 다음, SmolVLA를 동일한 데이터로 훈련합니다. 총 6 USD 미만으로, 이들은 중요한 질문에 답합니다: 사전 훈련이 여기서 도움이 되는지, 아니면 병목 현상이 데이터에 있는지 여부입니다. 접촉이 많은 다단계 작업에는 GR00T N1.7로, 장면이 변경될 때는 Pi0.5로 확장하십시오.

플랫폼 둘러보기: 첫 번째 정책 훈련하기, 다음 첫 번째 정책 실행하기. 훈련 문서데이터셋 문서는 형식과 포맷을 다루고; SO-100 페이지완벽한 SO-100 가이드는 빌드 및 보정을 다룹니다. 배경 정보: VLA 개요Pi0 플로우 매칭 아티클. 성공률을 높이는 것은 데이터 품질 가이드입니다.

SO-100에서 어떤 VLA 정책을 먼저 훈련해야 하나요?

ACT, 그 다음 SmolVLA입니다. ACT는 처음부터 훈련하므로, 좋지 않은 데이터셋을 가릴 수 없으며, 24GB 카드에서 한 번 실행하는 데 1~3 USD가 소요됩니다. 만약 ACT가 작업을 수행한다면, GR00T N1.7 또는 Pi0.5 실행에 드는 4~12 USD는 낭비되지 않습니다.

GR00T N1.7이 Pi0.5보다 실제로 더 좋은가요?

LIBERO에서는 노이즈 범위 내에 있습니다: GR00T N1.7의 경우 4개 스위트에서 97.0%, openpi에서 30k 스텝의 Pi0.5는 96.85%, LeRobot 포트는 97.5%로, 모두 다른 하네스에서 나온 결과입니다. 실제 차이점은 액션 스텝당 152 ms 대 485 ms, v2.1 데이터셋 대 v3.0, 그리고 벤치마크 정확도 대 개방형 세계 일반화 능력입니다.

이 중 어떤 것이든 단일 RTX 4090에서 미세 조정할 수 있나요?

SmolVLA와 ACT는 가능합니다. 둘 다 RTX 4090 또는 모든 24GB 카드에서 로컬로 실행됩니다. GR00T N1.7, N1.5 및 Pi0.5는 A100 또는 H100 80GB가 필요하며 여기서는 클라우드 전용입니다. NVIDIA는 GR00T 미세 조정을 위해 40GB 이상을 권장합니다. openpi의 경우 전체 Pi0.5 미세 조정을 위해 70GB 이상, LoRA의 경우 22.5GB 이상이 필요합니다.

이 다섯 가지 중 어떤 것을 상업적으로 사용할 수 있나요?

GR00T N1.7 가중치는 NVIDIA Open Model License Agreement에 따라 상업적 사용이 가능하다고 명시되어 있습니다. N1.5 가중치는 비상업적입니다. SmolVLA의 코드는 LeRobot에서 Apache 2.0이지만, lerobot/smolvla_base 카드에는 라이선스 필드가 없어 가중치에 대한 언급이 없습니다. ACT는 라이선스할 기본 가중치가 없습니다. Pi0.5는 모호합니다: LeRobot의 문서는 Apache 2.0이라고 하지만, 카드 메타데이터에는 license: gemma라고 되어 있습니다.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started