
시뮬레이션은 소수의 시연을 수천 개로 늘릴 수 있습니다. 여기서는 공개된 수치가 실제로 무엇을 말하는지, sim-to-real 격차가 어디에서 문제가 되는지, 그리고 여전히 기록되어야 할 것이 무엇인지 설명합니다.
몇 달에 한 번씩 누군가는 50개의 에피소드를 수동으로 기록하는 것이 느리다는 것을 깨닫고, 시뮬레이터가 대신 생성할 수 있는지 묻습니다. 이는 타당한 질문입니다. 솔직한 답변은 세 가지로 나뉩니다: 생성된 데이터는 도움이 되지만, 실제 기록을 대체하지는 않으며, 이 두 사실 간의 비율은 어떤 종류의 합성 데이터를 의미하는지에 전적으로 달려 있습니다.
이 페이지에서는 발표된 연구가 실제로 무엇을 측정했는지, SO-100과 같은 저가형 암에서 오늘날 무엇을 실행할 수 있는지, 그리고 시뮬레이션-실제 간극이 이득을 잠식하는 지점을 다룹니다. 자세한 내용에 앞서 요약하자면: 가장 큰 배율을 보고하는 시스템은 소수의 실제 인간 시연을 증폭시킵니다. 이는 인간 시연의 필요성을 없애지 않습니다.
알아야 할 사항
- •조작 분야에서 합성 데이터라고 불리는 네 가지 관련 없는 기술이 있습니다: 궤적 증식, 물리 롤아웃, 비디오 세계 모델, 이미지 공간 증강. 이들은 서로 다른 방식으로 실패하며 가치도 다릅니다.
- •MimicGen은 200개 미만의 인간 시연을 18개 작업에 걸쳐 50,000개 이상의 생성된 시연으로 전환했습니다. Square D0 작업에서 10개의 인간 시연에서 생성된 200개의 시연은 79%의 성공률을 보였고, 200개의 실제 인간 시연은 84%의 성공률을 보였습니다.
- •RoboCasa는 반대 사례입니다: 72,000개의 생성된 시연은 47.6%의 점수를 기록했으며, 1,250개의 인간 시연은 28.8%를 기록했습니다. 이는 58x의 볼륨 이점이지, 동등한 승리가 아닙니다.
- •시뮬레이션-실제 공동 훈련 연구는 실제 작업 성능에서 평균 38%의 개선을 보고합니다. 이 방법은 시뮬레이션 전용 전이가 아닌 혼합 데이터에 대한 공동 훈련입니다.
- •GR00T N1은 780,000개의 시뮬레이션 궤적(6,500시간 상당, 11시간 만에 생성)과 88시간의 실제 데이터에서 성장한 827시간의 신경 궤적을 기반으로 합니다. 이 88시간의 실제 데이터는 여전히 피라미드의 정점입니다.
- •SO-101의 경우 오늘날 작동하는 공개 파이프라인이 있습니다: Isaac Lab 내의 LeIsaac, 물리적 리더 암으로 원격 조작, Isaac Lab Mimic으로 증식, LeRobot 형식으로 내보내기, GR00T 미세 조정.
- •AY-Robots는 합성 데이터를 생성하지 않습니다. 이 데이터셋이 어떤 방식으로 생성되었든, 제공된 LeRobot 데이터셋으로 훈련하며, 훈련자는 모델에 따라 최소 30~50개의 에피소드가 필요합니다.
네 가지 다른 합성 데이터
숫자를 비교하기 전에 계열을 구분하는 것이 좋습니다. 100배의 승수를 보고하는 논문과 5점의 성공률 증가를 보고하는 논문은 종종 동일한 파이프라인을 다른 관점에서 설명하기 때문입니다. 공통점은 LeRobot 데이터셋의 무언가가 물리적 팔에서 기록된 것이 아니라 기계에 의해 생성되었다는 것입니다. 다른 점은 어떤 부분인지입니다.
| 계열 | 무엇이 실제 상태로 유지되는가 | 무엇이 생성되는가 | 보고된 승수 | 주요 실패 모드 |
|---|---|---|---|---|
| 궤적 증식 (MimicGen, DexMimicGen, Isaac Lab Mimic) | 소수의 인간 데모, 객체 메시, 물리 엔진 | 새로운 객체 포즈 및 장면 레이아웃에 맞춰 조정된 새로운 궤적 | 리셋 분포당 인간 데모 10개에서 1,000개; 60개에서 21,000개; 200개 미만에서 50,000개 이상 | 생성 시도 실패. Isaac Lab은 간단한 경우 후보 성공률을 70%까지, 어려운 경우 1% 미만으로 제시합니다. |
| 작업 시뮬레이터에서의 물리 롤아웃 (Isaac Lab, robosuite, RoboCasa) | 물리 엔진 및 자산 라이브러리 | 스크립트 컨트롤러, 플래너 또는 RL에 의해 구동되는 전체 에피소드 | GPU 시간으로만 제한됨 | 시뮬레이션된 팔은 실제 팔이 아닙니다. 접촉 및 서보 역학은 근사치입니다. |
| 비디오 월드 모델 (DreamGen, Cosmos Transfer) | 컨디셔닝으로 사용된 몇 가지 실제 원격 조작 에피소드 | 새로운 행동의 사실적인 비디오와 이후 복구된 의사(pseudo) 액션 | GR00T N1에서 88시간에서 827시간, 약 10배 | 액션은 측정된 것이 아니라 추론된 것입니다. 그럴듯한 비디오가 그럴듯하지 않은 액션을 포함할 수 있습니다. |
| 이미지 공간 증강 (랜덤 크롭, 색상 지터) | 픽셀을 제외한 모든 것 | 이미 가지고 있는 에피소드의 교란된 뷰 | 1x, 새로운 궤적을 생성하지 않음 | 기하학적 증강은 이미지와 액션 레이블 간의 연결을 끊습니다. |
이 글에서 의미하는 합성 데이터는 처음 세 가지뿐입니다. 네 번째는 같은 대화에 묶이고 목록에서 가장 저렴한 것이기 때문에 언급할 가치가 있습니다. 트레이너에 포함된 증강 기능을 아직 켜지 않았다면 시뮬레이터를 설치하기 전에 먼저 켜십시오.
NVIDIA는 GR00T N1 후처리 훈련에 사용된 시뮬레이션 궤적을 Hugging Face에 nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim으로 게시했으며, cc-by-4.0 라이선스 하에 약 1.87 TB에 달합니다. 이는 9,000개의 교차 구현 양손 팬더 및 GR1 궤적, 240,000개의 휴머노이드 테이블탑 궤적, 72,000개의 단일 팬더 주방 궤적, 그리고 102개의 Unitree G1 로코-조작 궤적으로 나뉩니다. huggingface-cli download --include "gr1_arms_only.CanSort/**" 명령어로 한 서브셋을 다운로드하고 몇몇 에피소드를 시청하는 것이 생성된 궤적이 어떻게 생겼는지 파악하는 가장 빠른 방법이며, 대역폭 외에는 비용이 들지 않습니다.
공개된 수치들이 실제로 말하는 바
다음은 증거 기반입니다. 보도 자료가 요약한 방식이 아니라 출처가 명시한 그대로의 수치들을 담고 있습니다. 아래의 모든 행은 2026년 8월 23일에 읽은 논문 또는 프로젝트 페이지에서 가져온 것입니다.
| 시스템 | 입력 | 생성됨 | 보고된 결과 |
|---|---|---|---|
| MimicGen, CoRL 2023 | 200개 미만의 인간 데모; 일대일 비교에서 10개의 인간 데모 | 50,000개 이상의 데모, 18개 작업, 4개의 로봇 팔 (Panda, Sawyer, IIWA, UR5e) | Square D0: 10개의 인간 데모에서 생성된 200개의 데모로 79%, 200개의 인간 데모로 84% |
| DexMimicGen, 2024 | 60개의 원본 인간 데모 | 양손 능숙 로봇을 위한 21,000개의 데모 | 시뮬레이션에서의 양손 능숙 작업, 실제-시뮬레이션-실제 휴머노이드 캔 분류 배포 포함 |
| RoboCasa, 2024 | 1,250개의 인간 데모 (25개 원자 작업당 50개), 100개의 평가 작업, 150개 이상의 객체 범주 | 100,000개의 MimicGen 궤적; 72,000개 데모 하위 집합이 주요 비교를 이끌어냄 | 인간 세트에서 전체 28.8% 대 완전 생성 세트에서 47.6%, 보지 못한 객체 인스턴스에 대해서만 평가됨 |
| Sim-and-real co-training, 2025 | 실제 데모와 시뮬레이션 데이터셋, 두 가지 도메인 (로봇 팔 및 휴머노이드) | 대체가 아닌 혼합 | 시뮬레이션 데이터는 실제 작업 성능을 평균 38% 향상시켰습니다 |
| DreamGen, 2025 | 하나의 환경에서 단일 픽앤플레이스 작업의 원격 조작 데이터 | 잠재 액션 모델 또는 역동역학 모델에서 생성된 합성 비디오 및 의사 액션 | 휴머노이드에서 22가지 새로운 행동, 본 환경 및 보지 못한 환경에서 |
| GR00T N1 data pyramid, 2025 | 88시간의 사내 GR-1 원격 조작 | 827시간의 신경 궤적 (약 10배); 780,000개의 시뮬레이션 궤적, 6,500시간 상당, 11시간 만에 생성 | 신경 궤적은 RoboCasa에서 30, 100, 300 데모/작업 체제에서 4.2, 8.8, 6.8점을 추가했으며, 8개의 실제 GR-1 작업에서 평균 5.8점을 추가했습니다. |
승수는 행의 개수입니다. MimicGen 자체의 일대일 비교에서는 생성된 데이터가 동일한 수의 인간 데이터보다 약간 낮은 성능을 보였고 (79% 대 84%), GR00T N1 제거 연구는 이미 실제 시간을 가진 모델에 한 자릿수 퍼센트 포인트를 추가했습니다. RoboCasa는 인간 데이터를 47.6% 대 28.8%로 능가했지만, 이는 1,250개의 인간 데모에 비해 72,000개의 생성된 데모를 사용한 결과입니다. 볼륨은 커버리지를 구매합니다. 하지만 귀하의 데모가 결코 포함하지 않았던 정보를 구매하지는 않습니다.
모든 정직한 절제 연구에서 패턴은 동일합니다. 합성 데이터는 저렴하게 커버리지를 확장합니다. 이는 실제 시연 어딘가에 없었던 그리퍼, 서보 처짐, 조명 또는 테이블 높이에 대한 정보를 생성하지 않습니다. 만약 정책이 실패하는 이유는 말단 효과기가 0.5초 늦게 닫히기 때문이라면, 아무리 많은 시뮬레이션 변형도 이를 해결할 수 없습니다. 그것은 실제 녹화에서 발생한 그리퍼 타이밍 문제입니다.
MimicGen의 한 가지 발견은 일반적인 조언과 상반되기 때문에 여러분의 녹화 세션에 적용할 가치가 있습니다. 이 프로젝트는 Square D2에서 두 가지 데이터셋을 생성했습니다. 하나는 더 나은 품질의 인간 작업자로부터 얻은 10개의 데모로 시드되었고, 다른 하나는 더 낮은 품질의 작업자로부터 얻은 10개의 데모로 시드되었으며, 둘 다 robomimic 다중 인간 Square 데이터셋에서 가져왔습니다. 각각으로 훈련된 정책들은 유사한 결과를 달성했으며, 저자들은 이를 대규모 데이터 체제에서는 데이터 품질이 그리 중요하지 않을 수 있다는 신호로 해석했습니다. 주의 깊게 읽어보면, 이는 10개의 시드 데모에 대한 진술이지, 여러분의 50개 실제 에피소드에 대한 진술이 아닙니다. 이는 약간 허술한 시드 세트가 여러분과 사용 가능한 생성된 데이터셋 사이에 놓인 장애물이 아니라는 것을 의미합니다. 시뮬레이터가 가지고 있지 않은 정보를 담고 있는 것은 실제 에피소드이기 때문에, 공동 훈련하는 실제 에피소드가 허술해도 된다는 의미는 아닙니다.

시뮬레이션-실제 간극, 구체적으로
이 격차는 보통 단일 양으로 논의되는데, 이는 도움이 되지 않습니다. 이는 최소한 다섯 가지 별개의 불일치이며, 110에서 150 EUR의 취미용 로봇 팔에서는 Franka 로봇 팔에서와는 다른 크기를 가집니다.
- 접촉 및 마찰. Isaac Lab은 동일한 하드웨어와 동일한 Isaac Sim 및 PhysX 버전을 사용할 경우 시뮬레이션이 재현 가능하다고 명시하지만, 부동 소수점 정밀도 및 반올림 오류로 인해 하드웨어 구성에 따라 결과가 달라질 수 있으며, PhysX는 천이나 연체와 같은 비강체(non-rigid bodies)가 있는 장면에 대해 결정론(determinism)을 보장하지 않는다고 밝힙니다.
- 구동. 7.4 V에서 작동하는 Feetech STS3215 버스 서보는 부하 시 처지고, 백래시가 있으며, 가열됨에 따라 동작이 변합니다. SO-101의 MJCF 모델은 로봇 팔에서 모터 매개변수를 직접 식별하는 대신 관련 없는 프로젝트에서 가져옵니다.
- 렌더링. 카메라 노이즈, 롤링 셔터, 자동 노출, 그리고 테이블의 정확한 색조는 렌더링에 포함되지 않습니다. 이것은 Cosmos-Transfer1이 닫기 위해 만들어진 격차의 절반입니다. 이 로봇 공학 증강 워크플로는 하나의 로봇 공학 합성 예제를 분할, 깊이 또는 에지 조건화로부터 여러 현실적인 예제로 매핑합니다.
- 타이밍. 시뮬레이터는 고정된 속도로 스텝을 진행합니다. 실제 제어 루프는 그렇지 않으며, 선택한 모델에 따라 모델 자체는 액션 스텝당 20에서 485 ms가 소요됩니다. 추론 지연 시간을 참조하십시오.
- 객체 통계. 시뮬레이션된 장면은 누군가가 기록한 분포에서 샘플링됩니다. 당신의 주방 테이블은 그렇지 않습니다.
시뮬레이션된 SO-100이 로봇 팔에 대해 실제로 아는 것
이것은 위 내용 중 어떤 것이 주말을 투자할 가치가 있는지 결정하는 부분이며, 첫 번째 놀라운 점은 SO-100과 SO-101이 동등하게 제공되지 않는다는 것입니다. TheRobotStudio의 SO-ARM100 저장소는 시뮬레이션 자산을 다음 경로에 보관합니다: Simulation/. SO100 폴더에는 단일 URDF 파일만 포함되어 있습니다. SO101 폴더에는 URDF 및 MuJoCo 파일(scene.xml, so101_new_calib.xml, so101_old_calib.xml, 일치하는 URDF 및 joints_properties.xml)이 모두 포함되어 있습니다. 운동학적 체인(kinematic chain)이 아닌 물리 모델을 원한다면 SO-101 파일이 필요합니다.
이 파일들은 Onshape에서 설계된 CAD 모델로부터 onshape-to-robot 플러그인을 사용하여 생성되었으며, 이는 운동학과 시각적 메시가 CAD만큼 정확하다는 것을 의미합니다. 동역학은 다른 이야기이며, 저장소의 README는 세 가지 사항에 대해 솔직하게 언급합니다. 시뮬레이션 및 계획 중 문제가 있는 충돌 동작으로 인해 기본 충돌 메시가 제거되었습니다. STS3215 모터 속성은 SO-101에서 측정된 것이 아니라 Open Duck Mini 프로젝트에서 가져왔습니다. 그리고 LeRobot 그리퍼 규칙(0이 완전히 닫히고 100이 완전히 열림)은 URDF 및 MuJoCo 파일에 아직 명시적으로 반영되지 않았습니다. 이 모든 것은 해당 모델에서만 훈련된 정책이 실제 환경에서 다르게 동작할 수 있는 지점입니다.
제공된 MuJoCo 파일에는 두 가지 영점 규칙이 있으며, scene.xml은 포함하는 로봇 파일에 따라 이들 중 하나를 선택합니다. 기본값인 so101_new_calib.xml에서는 각 조인트의 가상 영점이 조인트 범위의 중앙에 위치합니다. so101_old_calib.xml에서는 로봇이 수평으로 완전히 확장된 구성이 영점입니다. 시뮬레이션된 에피소드가 한 규칙을 사용하고 기록된 실제 에피소드가 다른 규칙을 사용한다면, 혼합된 데이터셋의 모든 조인트 각도는 수십 도씩 오프셋되며, 손실은 여전히 감소하지만 정책은 자신감 있게 잘못된 동작을 수행합니다. 공동 훈련 전에 양쪽의 규칙을 확인하고, 먼저 캘리브레이션 및 손실은 감소하지만 정책은 아무것도 하지 않음을 읽어보십시오.
도메인 무작위화, 그리고 그것이 해결하지 못하는 것
이러한 격차에 대한 표준적인 답변은 현실과 일치시키려는 노력을 멈추고 대신 현실이 그 안에 포함될 만큼 충분히 넓은 분포에 걸쳐 훈련하는 것입니다. Tobin과 동료들은 2017년에 이 강력한 버전을 보여주었습니다. 비현실적인 무작위 텍스처를 가진 시뮬레이션 이미지로만 훈련되고 실제 이미지에 대한 사전 훈련이 전혀 없는 객체 감지기가 실제 객체를 1.5 cm의 정확도로 지역화하고 방해물 및 부분적인 가려짐에 대해 견고함을 유지했습니다.
Isaac Lab은 환경 구성에 연결하는 이벤트 용어와 동일한 아이디어를 제공합니다. 다음은 실제 함수 이름으로 된 조정 가능한 매개변수입니다. isaaclab.envs.mdp, 따라서 추측하는 대신 직접 찾아 읽을 수 있습니다.
| 이벤트 함수 | 교란 대상 |
|---|---|
| randomize_rigid_body_material | 접촉 마찰 및 복원력 |
| randomize_rigid_body_mass, randomize_rigid_body_com | 객체 및 링크 질량, 질량 중심 오프셋 |
| randomize_actuator_gains | 조인트 컨트롤러 강성 및 댐핑 |
| randomize_joint_parameters, randomize_fixed_tendon_parameters | 조인트 마찰, 전기자 및 한계 |
| randomize_visual_texture_material, randomize_visual_color | 외관, 간격의 광도 측정 절반 |
| randomize_physics_scene_gravity | 중력 벡터 |
| apply_external_force_torque, push_by_setting_velocity | 런타임 교란 |
| reset_root_state_uniform, reset_joints_by_offset | 각 에피소드 재설정 시 초기 상태 확산 |
여기에 한계가 있으며, 사람들이 흔히 실수하는 부분입니다. 무작위화는 구축한 모델 내에서 정책이 본 분포를 넓힙니다. 시뮬레이터가 표현하지 않는 물리적 효과를 도입할 수는 없습니다. PhysX가 STS3215 서보의 백래시와 열 처짐을 모델링하지 않는다면, 서보의 강성을 무작위화하는 것은 정책에 백래시에 대해 아무것도 가르쳐주지 않습니다. 이것이 시뮬레이션으로 훈련된 정책 하에서 팔이 경련하다가 처지는 것은 무작위화 예산 문제가 아닙니다. 그것은 모델링 문제입니다.
수동 경로: Isaac Lab에서 데이터 생성
Isaac Gym은 레거시 소프트웨어입니다. NVIDIA 자체 페이지에는 "Isaac Gym - 이제 사용 중단됨"이라는 제목이 붙어 있으며, 개발자는 이를 다운로드하여 계속 사용할 수 있지만 더 이상 지원되지 않으며 대신 Isaac Lab을 가리킨다고 명시되어 있습니다. 역사를 알고 싶다면, 저희는 다음 두 가지를 다루었습니다: 및 . 2026년의 새로운 작업은 Isaac Lab에서 시작하십시오.
- 1Isaac Sim 및 Isaac Lab 설치
pip 설치 페이지에는 지침이 Python 3.11을 필요로 하는 Isaac Sim 5.X용이라고 명시되어 있습니다. 소스 클론은 다음 단계에 필요한 스크립트를 제공합니다.
bashpip install "isaacsim[all,extscache]==5.1.0" \ --extra-index-url https://pypi.nvidia.com git clone https://github.com/isaac-sim/IsaacLab.git --branch main cd IsaacLab sudo apt install cmake build-essential ./isaaclab.sh --install # smoke test ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py - 2약 10개의 인간 데모 기록
Isaac Lab 문서는 구체적입니다: 다음 단계가 성공하려면 약 10개의 성공적인 데모가 필요합니다. 팁 또한 구체적입니다. 데모를 짧게 유지하고, 임의의 축을 따라 이동하기보다는 직접적인 경로를 택하며, 정책이 언제 왜 일시 중지해야 하는지 명확하지 않으므로 일시 중지하지 마십시오.
bash./isaaclab.sh -p scripts/tools/record_demos.py \ --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \ --device cpu \ --teleop_device spacemouse \ --dataset_file ./datasets/dataset.hdf5 \ --num_demos 10 - 3서브태스크 경계 주석 달기
Mimic은 입력 데모를 서브태스크로 분할하여 세그먼트의 시간을 재조정하고 대상을 재설정할 수 있습니다. --auto 플래그는 자동 주석을 정의하는 태스크의 경우 사람의 개입 없이 이 작업을 수행합니다. 이 플래그가 없으면 B로 일시 중지하고, N으로 계속하며, S로 경계를 표시합니다. 태스크 ID에 -Mimic 접미사가 붙는다는 점에 유의하십시오.
bash./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \ --device cpu \ --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \ --auto \ --input_file ./datasets/dataset.hdf5 \ --output_file ./datasets/annotated_dataset.hdf5 - 4증가된 데이터셋 생성
이것은 10을 1000으로 바꾸는 단계입니다. Mimic은 각 후보에 부울 성공 기준을 적용하고 작업을 완료한 후보만 유지하므로 출력 수는 시도 횟수보다 적습니다. 문서에 따르면 간단한 경우 후보 성공률은 최대 70%이며, 어려운 작업과 복잡한 로봇의 경우 1% 미만입니다. Franka 큐브 스택의 경우 약 50%, GR1T2 픽앤플레이스의 경우 65~80%이며, 1000개의 데모는 18~40분(RTX ADA 6000에서 80% 사용 시 19분)이 소요됩니다.
bash./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \ --device cpu \ --num_envs 10 \ --generation_num_trials 1000 \ --headless \ --input_file ./datasets/annotated_dataset.hdf5 \ --output_file ./datasets/generated_dataset.hdf5 - 5HDF5를 LeRobot 데이터셋으로 변환
위의 모든 것은 robomimic 형식의 HDF5를 생성하며, Isaac Lab 코어는 자체 LeRobot 변환기를 제공하지 않습니다. 문서에는 생성된 데이터셋을 LeRobot 형식으로 변환할 수 있다고만 명시되어 있습니다. 두 프로젝트가 실제 변환기를 제공합니다. IsaacLab-Arena는 YAML 구성으로 완전히 구동되는 GR00T 대상 변환기를 제공하며, LeIsaac은 SO-101 경로를 위한 자체 쌍을 제공합니다(아래 참조).
bash# IsaacLab-Arena, GR00T LeRobot format python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \ --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
2026년 8월 23일 현재, main의 Isaac Lab 문서에는 Isaac Sim 6.0.1 배지가 있으며, 버전 전환기에서 v2.3.2와 함께 release/3.0.0 및 v3.0.0-beta2를 제공합니다. 반면, 동일한 트리의 pip 설치 페이지는 여전히 isaacsim[all,extscache]==5.1.0을 고정하고 지침이 Isaac Sim 5.X용이라고 설명합니다. NVIDIA synthetic-manipulation-motion-generation 청사진 컨테이너는 다시 더 오래된 버전입니다: Isaac Sim 4.5.0의 Isaac Lab 2.0.2. LeIsaac 자체 호환성 표는 Isaac Sim 5.1과 Isaac Lab v2.3.0을 짝지어 놓습니다. 이러한 트리는 문서가 일치하는 것보다 빠르게 움직입니다. 하나의 릴리스를 선택하고 기록해 두십시오. 그리고 3개월 전에 작성된 튜토리얼을 따른다면 스크립트 경로와 플래그 이름이 변경되었을 수 있습니다.
생성 시도가 실패하는 이유와 변경할 사항
성공률이 70%에서 1% 미만으로 오르내리는 것은 미스터리가 아니며, Isaac Lab은 여러분이 추측하게 두는 대신 일반적인 함정들을 문서화합니다. 이 모든 함정은 녹화 시점에 여러분이 제어할 수 있는 것들이므로, 첫 번째 실망스러운 생성 실행 후에 읽는 것보다 10개의 시드 데모를 녹화하기 전에 이 목록을 읽는 것이 좋습니다.
- 데모가 너무 깁니다. 시간 범위가 길수록 정책이 학습하기 더 어렵습니다. 첫 번째 객체에 가깝게 시작하고 움직임을 최소화하십시오.
- 데모가 부드럽지 않습니다. 불규칙한 움직임은 정책이 해독하기 어렵고, 더 나은 원격 조작 하드웨어는 더 좋은 데이터를 제공합니다. 문서에는 SpaceMouse가 키보드보다 낫다고 명시되어 있습니다.
- 일시 정지. 일시 정지는 정책이 언제 왜 일시 정지해야 하는지 명확하지 않기 때문에 학습하기 어렵습니다. 움직임을 유연하게 유지하십시오.
- 너무 많은 하위 작업. 하위 작업이 많을수록 궤적 세그먼트 간의 연결이 많아져 움직임이 덜 부드러워지고 생성 성공률이 낮아집니다. 팔이 어떤 것과도 충돌할 가능성이 없는 경계를 주석 처리하십시오.
- 동작 노이즈 없음. 동작 노이즈는 결과 정책을 더 견고하게 만듭니다.
- 녹화가 너무 타이트하게 잘림. 성공 조건이 트리거되는 정확한 프레임에서 녹화가 중지되면 재생 중에 다시 트리거되지 않을 수 있습니다. 끝에 버퍼를 남겨두십시오.
- 비결정적 재생. Isaac Lab의 물리학은 env.reset 전반에 걸쳐 결정적으로 재현되지 않으므로 일부 인간 데모는 재생 시 실패합니다. 필요한 것보다 더 많이 수집하고 주석 처리를 통과한 것들을 유지하십시오. Mimic으로 생성된 HDF5 파일에 저장되는 모든 것은 성공적인 데모이며 나중에 재생이 실패하더라도 훈련에 사용할 수 있습니다.
연결된 하위 작업 세그먼트 간의 보간 단계에는 자체 튜닝 노브가 있으며, 필요한 보간 단계 수는 로봇이 움직이는 속도와 객체 재설정 분포의 폭에 따라 달라집니다. 재설정 분포가 큰 복잡한 작업은 세그먼트 사이에 더 큰 간격을 남기므로, 연속적인 움직임으로 나타나기 위해 더 많은 보간 단계가 필요합니다. 생성된 비디오에서 팔이 단계 사이에서 갑자기 움직이는 것을 보인다면, 시드 데모를 탓하기 전에 살펴봐야 할 매개변수입니다.
실제 리더 암을 사용하는 SO-101의 동일한 파이프라인
이 페이지를 읽는 모든 분들에게 흥미로운 부분입니다. 왜냐하면 이것은 을 Isaac Lab 안에 넣고 이미 소유하고 있는 물리적 리더 암으로 구동할 수 있는 유일한 오픈 파이프라인이기 때문입니다. 작성 시점 기준 버전 0.4.0인 LeIsaac은 LeRobot의 EnvHub에 통합된 공식 모방 학습 시뮬레이션 플레이그라운드입니다. 호환성 표에는 세 가지 작동 조합이 나열되어 있습니다. 최신 조합은 Isaac Sim 5.1과 Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 및 Python 3.11을 짝지으며, 문서는 50-시리즈 카드에 Isaac Sim 5.0 이상을 권장합니다.
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
--index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0설치가 완료되면, /dev/ttyACM0의 리더 암이 시뮬레이션된 팔로워를 구동하고 HDF5에 직접 기록합니다. 이 루프는 실제 녹화에서 이미 알고 있는 것과 동일하며, 팔로워만 PhysX의 강체입니다.
python scripts/environments/teleoperation/teleop_se3_agent.py \
--task=LeIsaac-SO101-PickOrange-v0 \
--teleop_device=so101leader \
--port=/dev/ttyACM0 \
--num_envs=1 \
--device=cuda \
--enable_cameras \
--record \
--dataset_file=./datasets/dataset.hdf5| 환경 ID | 작업 설명 | 로봇 |
|---|---|---|
| LeIsaac-SO101-PickOrange-v0 | 오렌지 세 개를 집어 접시에 넣은 다음, 팔을 휴식 상태로 재설정합니다. | 단일 팔 SO101 팔로워 |
| LeIsaac-SO101-LiftCube-v0 | 빨간색 큐브를 들어 올립니다. | 단일 팔 SO101 팔로워 |
| LeIsaac-SO101-CleanToyTable-v0 | 두 개의 'e' 글자 모양 물체를 상자에 넣은 다음, 팔을 휴식 상태로 재설정합니다. | 단일 팔 SO101 팔로워 |
| LeIsaac-SO101-CleanToyTable-BiArm-v0 | 두 팔로 동일한 작업 수행 | 양팔 SO101 팔로워 |
| LeIsaac-SO101-FoldCloth-BiArm-v0 | 천을 접은 다음, 팔을 휴식 상태로 재설정합니다. DirectEnv 변형만 check_success를 지원합니다. | 양팔 SO101 팔로워 |
| LeIsaac-LeKiwi-CleanupTrash-v0 | 바닥에 있는 휴지 쓰레기를 집어 쓰레기통에 버립니다. | LeKiwi |
대부분의 ID는 다음으로도 존재합니다: -Direct-v0, 그리고 python scripts/environments/list_envs.py는 현재 목록을 출력합니다. 또한 HDF5 우회를 완전히 건너뛰고 세 가지 플래그를 추가하여 원격 조작 중에 LeRobot 형식으로 작성할 수 있습니다. 두 가지 주의사항은 문서 자체에서 비롯됩니다. 레코더는 초기 상태의 불안정성을 피하기 위해 각 에피소드의 첫 5프레임을 자동으로 건너뛰며, 이는 원격 조작에 약간의 지연을 유발할 수 있습니다. 이는 데모의 특성을 미묘하게 변화시키는 종류의 문제입니다. 또한 작업이 성공으로 표시된 에피소드만 플러시합니다.
python scripts/environments/teleoperation/teleop_se3_agent.py \
--task=LeIsaac-SO101-PickOrange-v0 \
--teleop_device=so101leader \
--port=/dev/ttyACM0 \
--num_envs=1 --device=cuda --enable_cameras --record \
--use_lerobot_recorder \
--lerobot_dataset_repo_id=<your-user>/<dataset-name> \
--lerobot_dataset_fps=30곱셈 단계는 해당 녹화본에서 실행됩니다. LeIsaac은 Isaac Lab Mimic을 네 가지 명령으로 래핑합니다. Mimic은 엔드 이펙터 및 객체 포즈에서 궤적을 일반화하기 때문입니다. 즉, 조인트 공간 동작을 IK 기반 동작으로 변환하고, 주석을 달고, 생성한 다음, 다시 조인트 공간으로 변환합니다.
python scripts/mimic/eef_action_process.py \
--input_file ./datasets/mimic-lift-cube-example.hdf5 \
--output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
--to_ik --headless
python scripts/mimic/annotate_demos.py --device cuda \
--task LeIsaac-SO101-LiftCube-Mimic-v0 \
--input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
--output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
--enable_cameras
python scripts/mimic/generate_dataset.py --device cuda \
--num_envs 1 --generation_num_trials 10 \
--input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
--output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
--enable_cameras
python scripts/mimic/eef_action_process.py \
--input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
--output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
--to_joint --headless그 다음 LeRobot으로 변환합니다. 이 단계는 플랫폼의 형식 규칙이 적용되는 부분이며, LeIsaac은 필요한 두 가지 변환기를 정확히 제공합니다: isaaclab2lerobot.py는 GR00T 로더가 사용하는 LeRobot v2를 작성하고, isaaclab2lerobotv3.py는 Pi0.5, SmolVLA 및 ACT를 위한 v3를 작성합니다. 두 스크립트는 동일한 인수를 사용하지만 다른 lerobot 버전을 고정하며, 성공적인 에피소드만 변환됩니다.
pip install lerobot==0.3.3
pip install numpy==1.26.0
python scripts/convert/isaaclab2lerobot.py \
--task_name=LeIsaac-SO101-PickOrange-v0 \
--repo_id=<your-user>/so101_pick_orange_sim \
--hdf5_root=./datasets \
--hdf5_files=dataset.hdf5LeIsaac은 NVIDIA Brev에서 전체 스택을 실행하는 방법을 문서화합니다: 배포하고, 포트 80 링크를 클릭하여 브라우저 기반 VS Code 서버를 열고, --kit_args="--no-window --enable omni.kit.livestream.webrtc"를 사용하여 사전 설치된 네 가지 시나리오를 구동하며, /viewer를 추가하여 동일한 주소에서 렌더링을 볼 수 있습니다. 책상 아래에 워크스테이션 카드가 없다면, 하드웨어를 투입하기 전에 시뮬레이션된 작업 버전이 실제와 근접한지 확인하는 더 저렴한 방법입니다.
훈련된 정책을 얻는 두 가지 경로
장면을 구축하고, 데이터를 생성하고, GPU를 임대하며, 서빙을 직접 설정합니다. 이 방법은 물리적으로 구현할 수 없는 환경 변화가 작업에 필요하거나 반복 가능한 평가를 원할 때 올바른 선택입니다.
- Isaac Sim 5.1 및 Isaac Lab을 설치하거나, 로봇이 SO-101인 경우 LeIsaac 스택을 설치합니다.
- 장면을 모델링하거나 가져옵니다. 이 단계는 아무도 예산을 책정하지 않지만 일반적으로 가장 오래 걸립니다.
- 시뮬레이션된 팔로워를 통해 약 10개의 깨끗한 시연을 기록합니다.
- 하위 작업을 주석 처리하고, generate_dataset.py를 실행하며, 실패가 폐기됨을 받아들입니다.
- HDF5를 LeRobot 형식으로 변환하되, GR00T에는 v2를, 다른 모델에는 v3를 선택합니다.
- 어쨌든 실제 팔에서 실제 에피소드를 기록한 다음, 혼합 데이터로 공동 훈련합니다.
- GPU를 임대하고, 미세 조정을 실행하며, 팔 옆에 체크포인트를 서빙합니다.
| 자원 | 출처에서 명시하는 내용 |
|---|---|
| 로컬 시뮬레이션 GPU | NVIDIA 합성 조작 청사진은 Ubuntu 22.04 및 48GB VRAM을 갖춘 NVIDIA RTX A6000을 요구합니다. |
| 월드 모델 노드 | 동일한 청사진은 Isaac Lab 시뮬레이션과 별도의 노드에서 80GB 이상의 H100을 요구합니다. |
| 컨테이너 버전 | 해당 청사진 이미지 내의 Isaac Sim 4.5.0에서 실행되는 Isaac Lab 2.0.2 |
| 생성 처리량 | Isaac Lab은 1000개의 GR1T2 픽앤플레이스 데모를 18분에서 40분 안에, RTX ADA 6000에서 80% 성공률로 19분 만에 생성한다고 보고합니다. |
| 신경 궤적 비용 | GR00T N1은 827시간의 꿈을 위해 약 105,000 L40 GPU 시간, 즉 3,600 L40에서 약 1.5일이 소요된다고 보고합니다. |
1000개의 궤적을 생성하는 것은 오후 한나절이면 됩니다. 하지만 장면, 카메라 외부 매개변수, 객체 메시, 서보 모델을 궤적이 전이될 수 있을 만큼 충분히 가깝게 만드는 데 몇 주가 걸립니다. 샘플링이 아닌 모델링에 예산을 책정하십시오.
이 플랫폼은 의도적으로 범위가 좁습니다. 시뮬레이터를 실행하지 않으며 합성 데이터를 생성하지도 않습니다. 이 플랫폼은 사용자가 어떤 방식으로든 생성한 LeRobot 데이터셋을 가져와 서빙되는 로 변환합니다. Isaac Lab 출력은 깨끗하게 변환되는 한 유효한 입력입니다.
- 1데이터셋 가져오기
데스크톱 클라이언트로 원격 조작 세션에서 직접 기록하거나, Hugging Face 저장소 ID를 지정하거나, 변환된 시뮬레이터 내보내기를 업로드합니다.
- 2모델 및 팔 선택
/train 페이지의 매트릭스는 훈련 가능한 다섯 가지 정책 각각을 지원되는 각 팔과 연결하고 해당 정확한 가이드로 연결됩니다.
- 3백엔드가 GPU를 임대하도록 허용
트레이너는 필요한 VRAM에 따라 스팟 시장 GPU를 선택하고, 작업을 실행하며, 체크포인트를 객체 스토리지에 기록합니다. 유지할 클러스터가 없습니다.
- 4팔로 다시 서빙
추론 파드는 자동 프로비저닝되며, 로컬 로봇 클라이언트는 해당 엔드포인트와 통신하고, 유휴 감시자가 파드를 파괴하여 아무것도 조용히 청구되지 않도록 합니다.
| 모델 | GPU 티어 | 최소 에피소드 | 데이터셋 형식 | 일반적인 실행 비용 |
|---|---|---|---|---|
| GR00T N1.7 | A100 80 GB or H100 80 GB | 50 | LeRobot v2.0 or v2.1 | 4 to 12 USD |
| GR00T N1.5 | A100 80 GB or H100 80 GB | 50 | LeRobot v2.0 or v2.1 | 4 to 12 USD |
| Pi0.5 | A100 80 GB or H100 80 GB | 50 | LeRobot v3.0 | 4 to 12 USD |
| SmolVLA | RTX 4090 or any 24 GB card | 30 | LeRobot v3.0 | 1 to 3 USD |
| ACT | RTX 4090 or any 24 GB card | 50 | LeRobot v3.0 | 1 to 3 USD |
형식 열에 유의하고, 이것이 LeIsaac이 두 가지 변환기를 제공하는 이유입니다. LeRobot v3.0 데이터셋은 GR00T 로더를 충돌시키므로 먼저 v2.1로 변환해야 하며, 이는 가장 흔한 거부 사유입니다. 만약 이 문제에 부딪혔다면, 페이지를 참조하십시오.
비디오 월드 모델: 가장 새로운 계층이자 가장 적게 측정된
DreamGen의 아이디어는 대상 로봇 구현에 맞춰 조정된 비디오 생성 모델이 한 번도 방문하지 않은 장면에서 그럴듯한 에피소드를 상상할 수 있다는 것입니다. 파이프라인은 네 단계로 구성됩니다: 비디오 월드 모델 미세 조정, 사실적인 합성 로봇 비디오 생성, 잠재 액션 모델 또는 역동학 모델을 사용하여 의사 액션 시퀀스 복구, 그리고 그 결과로 로봇 정책 훈련. NVIDIA의 GR00T-dreams 저장소가 바로 이를 구현합니다.
헤드라인 결과는 실제이며 진지하게 받아들일 가치가 있습니다. 단일 환경에서 단 하나의 픽앤플레이스 작업에서 얻은 원격 조작 데이터가 알려진 환경과 알려지지 않은 환경 모두에서 휴머노이드 로봇에 22가지 새로운 행동을 생성했습니다. 단점 또한 실제이며 세 번째 단계에 있습니다.
- 이들은 실제 세계에서 진정으로 비용이 많이 드는 축을 따라 확장됩니다: 새로운 장면, 새로운 객체 배치, 새로운 지시어 표현.
- GR00T-dreams는 행동 추출 및 미세 조정 스크립트를 위해 franka, gr1, robocasa, so100의 네 가지 지원되는 구현체를 나열합니다. 이는 휴머노이드 전용 기술이 아닙니다.
- Cosmos-Transfer1은 분할, 깊이 또는 에지 조건화를 통해 하나의 로봇 공학 합성 예제를 여러 현실적인 예제로 매핑하여 간극의 광도 측정 절반을 직접 공략합니다. Isaac Lab 자체는 scripts/tools/cosmos 아래에 이를 위한 프롬프트 도구를 제공합니다.
- DreamGen 작업은 DreamGen Bench를 제공합니다. 이는 벤치마크 성능과 다운스트림 정책 성공 간의 강한 상관관계를 보여주는 비디오 생성 벤치마크이므로, 학습 전에 생성을 선별할 수 있습니다.
- 행동은 인코더로 측정되는 것이 아니라 모델에 의해 복구됩니다. 올바르게 보이는 비디오라도 팔이 실행할 수 없는 관절 궤적을 포함할 수 있습니다.
- 생성은 비용이 많이 듭니다. GR00T N1은 L40에서 1초 분량의 비디오를 생성하는 데 2분이 걸린다고 보고하며, 이는 약 105,000 L40 GPU 시간, 즉 3,600 L40 GPU로 약 1.5일에 해당하며, 827시간의 신경 궤적을 생성하는 데 사용됩니다.
- 측정된 이득은 한 자릿수에 불과합니다: 세 가지 데이터 체제에 걸쳐 RoboCasa에서 4.2, 8.8, 6.8점, 그리고 이미 실제 데이터를 가지고 있던 모델 위에 8개의 실제 GR-1 작업에서 평균 5.8점입니다.
- 7.4 V 취미용 서보 암에 대해 이 방법을 처음부터 끝까지 검증하는 공개된 레시피는 없습니다. 당신은 포팅하는 것이지, 따르는 것이 아닙니다.
시뮬레이션과는 관련이 없지만, 시뮬레이션된 팔에서 실제 팔로 옮겨가면서 전원 공급 장치를 즉흥적으로 만들 때마다 발생하는 문제입니다. SO-100, SO-101 및 LeKiwi 팔은 모두 Feetech STS3215 서보를 7.4 V로 작동합니다. 12 V를 공급하면 서보가 손상되며, LeKiwi는 베이스 레일이 12 V이기 때문에 특히 주의해야 합니다. 배선하기 전에 SO-100 하드웨어 페이지를 참조하십시오.
코트레이닝은 실제로 이득을 보여주는 레시피입니다
문헌에서 한 가지 운영 교훈을 얻는다면, 이것을 기억하십시오. 시뮬레이션 및 실제 공동 훈련 연구(Maddukuri 외, 2025)는 로봇 팔과 휴머노이드라는 두 가지 도메인에 걸쳐 시뮬레이션 데이터를 사용하여 비전 기반 로봇 조작 작업을 해결하기 위한 간단한 방법을 찾고자 했으며, 그 결론은 혼합 데이터로 훈련해야 한다는 것입니다. 시뮬레이션 데이터는 실제 작업 성능을 평균 38% 향상시켰으며, 이 논문은 시뮬레이션과 실제 데이터 사이에 상당한 차이가 있었음에도 불구하고 이러한 결과가 유지되었다고 명시하고 있습니다.
마지막 문구는 38%보다 더 중요합니다. 이는 실제 데이터가 혼합되어 시뮬레이션을 고정하는 역할을 한다면, 시뮬레이션이 유용하기 위해 완벽한 디지털 트윈일 필요는 없다는 것을 의미합니다. 시뮬레이션 단독 전이는 비용이 많이 드는 경로입니다. 동일한 논문은 정책을 시뮬레이션에서만 훈련하고 실제 세계로 전이하는 것이 현실 격차를 해소하기 위해 상당한 인적 노력을 요구하는 경우가 많다고 명시합니다. 공동 훈련은 정책이 스스로 격차를 해소하도록 요구하지 않음으로써 대부분의 노력을 건너뜁니다.

실질적으로, 이 플랫폼에서 공동 훈련은 한 가지를 의미합니다: 두 에피소드 세트를 동일한 LeRobot dataset에 일관된 카메라 키, 일관된 조인트 순서 및 일관된 단위를 사용하여 넣은 다음, 일반적인 미세 조정을 실행하는 것입니다. 훈련 양식에는 혼합 가중치 조절기가 없습니다. 3:1의 시뮬레이션 대 실제 비율을 원한다면, 각 에피소드를 데이터셋에 얼마나 많이 넣는지로 표현합니다.
시뮬레이션에서 얻을 수 있는 가장 저렴한 이점은 훈련 데이터가 아닙니다
그것은 평가입니다. 두 가지를 비교하기 위해 작업당 수십 번의 실제 시험을 실행하는 것은 하루 종일 로봇 팔을 사용해야 하며, 로봇 팔은 시험마다 오차가 발생합니다. SIMPLER(Li 외, 2024)는 실제 정책을 훈련하는 대신 점수를 매기는 것을 목적으로 하는 시뮬레이션 환경을 구축했으며, 시뮬레이션 순위가 실제 순위를 얼마나 잘 예측하는지 측정했습니다. 단일 SIMPLER 환경은 소비자용 RTX 4090에서 640x512 해상도로 초당 3,500 시뮬레이션 단계를 렌더링하며, 이는 500Hz 시뮬레이션 주파수에서 실제 평가보다 7배 빠른 속도입니다.
| 평가 프로토콜 | MMRV (낮을수록 좋음) | Pearson r (높을수록 좋음) |
|---|---|---|
| 검증 MSE | 0.375 | 0.308 |
| SIMPLER, 변형 집계 | 0.143 | 0.778 |
| SIMPLER, 시각적 매칭 | 0.056 | 0.924 |
이는 세 가지 Google Robot 작업 그룹에 대한 여섯 가지 일반적인 오픈 소스 체크포인트(서로 다른 훈련 단계의 세 가지 RT-1 체크포인트, RT-1-X, RT-2-X 및 Octo-Base)의 평균입니다. 실제 시험 횟수는 균일하지 않으며, 이를 인용하기 전에 알아둘 가치가 있습니다: 콜라 캔 집기 75회, 근처로 이동 60회, 서랍 열고 닫기 작업 54회, 더 긴 서랍-사과 작업 27회. 검증 MSE와의 비교가 유용한 부분입니다. 검증 손실에 의한 모델 선택은 이러한 체크포인트의 순위를 낮게 매기며, 시각적 매칭에서 Pearson r이 0.924라는 것은 체크포인트가 SIMPLER에서 더 좋은 점수를 얻으면 실제 벤치에서도 더 좋은 점수를 얻을 가능성이 매우 높다는 것을 의미합니다. 이는 반복 가능한 야간 스코어보드이며, 시뮬레이션-실제 훈련 전이에 대해 어떤 것도 믿을 필요가 없습니다.

이러한 벤치마크 수치가 시각-언어-행동 모델에 대해 무엇을 알려주고 무엇을 알려주지 않는지에 대한 더 넓은 맥락을 원하시면, 저희는 이를 VLA 개요에서 별도로 다루었습니다.
이 플랫폼이 도움이 되지 않는 경우
경계를 명확히 하는 것은 모두의 시간을 절약합니다. AY-Robots는 기록, 훈련 및 서빙 플랫폼입니다. 시뮬레이터는 포함되어 있지 않습니다.
- Isaac Lab, MimicGen, 월드 모델, 씬 저작 기능이 없습니다. 생성된 데이터가 필요하다면 다른 곳에서 생성하여 결과를 가져와야 합니다.
- 트레이너는 LeRobot 데이터셋만 사용합니다. 시뮬레이터 내보내기 파일은 입력으로 사용되기 전에 변환되어야 하며, 올바른 버전이어야 합니다: GR00T N1.5 및 N1.7의 경우 v2.0 또는 v2.1, Pi0.5, SmolVLA 및 ACT의 경우 v3.0.
- GR00T의 미세 조정 진입점은 시드를 노출하지 않는 tyro CLI이므로, GR00T 실행은 비트 단위로 재현 가능하지 않습니다. 신중한 시뮬레이션 대 실제 환경 비교 분석을 실행하는 경우 이는 실제적인 한계입니다. lerobot 자체의 기본 시드는 1000이며, ACT, SmolVLA 및 Pi0.5 형식은 시드 필드를 노출합니다.
- 그라디언트 누적은 두 GR00T 트레이너에만 실제로 적용됩니다. Pi0.5 및 SmolVLA의 경우 필드는 형식에 존재하지만 lerobot 0.5.1에는 그러한 플래그가 없으므로 아무것도 하지 않습니다.
- 빠른 작업을 위해서는 추론이 서보 옆에 있어야 합니다. 제어 루프는 모델에 따라 액션 단계당 20에서 485 ms이며, 공용 인터넷 왕복 시간을 추가하면 작동하는 정책이 주저하는 정책으로 변합니다. 원격 추론은 느린 픽앤플레이스에는 가능하지만 빠른 반응성 동작에는 적합하지 않습니다.
방어할 수 있는 예산
두 경로를 나란히 놓고 각 경로가 실제로 게시하는 숫자를 비교하면, 저비용 로봇 팔을 사용하는 단일 작업 프로젝트의 경우 결정이 저절로 내려지는 경우가 많습니다.
| 항목 | 시뮬레이션 우선 | 기록 우선 |
|---|---|---|
| 사전 모델링 | 장면, 메시, 카메라 배치, 서보 모델. 며칠에서 몇 주 소요 | 없음 |
| 데이터 수집 | 시뮬레이션에서 약 10개의 데모, 그 다음 생성 | 30~50개의 실제 에피소드, 몇 시간의 원격 조작 |
| 소유할 하드웨어 | Isaac Lab 청사진용 48GB 카드, Cosmos 스테이지용 80GB | 로봇 팔과 노트북 |
| 훈련 비용 | 오른쪽 열과 동일, 트레이너는 데이터 출처에 신경 쓰지 않음 | 4090 티어에서 1~3 USD, A100 또는 H100 티어에서 4~12 USD |
| 투자 회수 최고의 증거 | 공동 훈련 시 평균 38% 실제 성능 향상, 신경 궤적에서 4~9점 | 위 모든 것이 측정되는 기준선 |
| 실패하는 경우 | 작업이 접촉, 변형 가능한 물체 또는 서보 컴플라이언스에 의존하는 경우 | 물리적으로 구현할 수 없는 환경 변화가 필요한 경우 |
SO-100에 대한 첫 번째 정책의 경우, 기록하십시오. 과 을 통해 커피 한 잔 값으로 서비스되는 체크포인트를 얻을 수 있으며, 향후 모든 공동 훈련 혼합의 실제 절반을 갖게 될 것입니다. 작동하는 기준선과 다음과 같이 명확히 설명할 수 있는 특정 일반화 실패가 있을 때 시뮬레이터를 사용하십시오. .
아직 책상에 로봇 팔이 없으신가요?
브라우저에서 실제 SO-100을 운전해 보세요. 대기열 기반이며 가입이 필요 없습니다. 시뮬레이터에서 모델링하며 주말을 보내기 전에 실제 에피소드가 어떻게 생겼는지 확인하십시오.
실제 로봇 팔 운전하기증거를 존중하는 레시피
- 1실제 기준선 먼저 기록
SmolVLA는 30 에피소드, ACT는 50 에피소드, GR00T N1.7 및 Pi0.5는 50 에피소드입니다. 한 번 훈련합니다. 해당 정책이 실패하는 모든 것이 합성 데이터에 대한 사양입니다.
- 2일반화 실패 명명
객체 포즈? 조명? 테이블 높이? 방해물? 지시문의 다른 표현? 합성 데이터는 이 중 한 가지에만 정확히 능숙하며, 어떤 것인지 말할 수 없다면 쓸모가 없습니다.
- 3이를 포괄하는 가장 저렴한 계열 선택
포즈 및 레이아웃 변화: 궤적 증식. 조명 및 텍스처: 이미지 증강 우선, 월드 모델 다음. 완전히 새로운 장면: 물리 롤아웃, 그리고 모델링 비용 수용.
- 4생성한 다음 과감하게 버리기
생성 시도는 실패하며, Isaac Lab 자체의 후보 성공률은 작업에 따라 70퍼센트에서 1퍼센트 미만까지 다양합니다. 성공적이고 작업을 완료하는 궤적만 유지하고, 배치(batch)를 신뢰하기 전에 샘플을 비디오로 육안 검사하십시오.
bashpython scripts/mimic/generate_dataset.py --device cuda \ --num_envs 8 --generation_num_trials 500 \ --input_file ./datasets/annotated.hdf5 \ --output_file ./datasets/generated.hdf5 --enable_cameras - 5공동 훈련, 대체하지 않음
생성된 에피소드를 실제 에피소드와 동일한 카메라 키와 조인트 순서로 단일 LeRobot 데이터셋에 병합합니다. 38퍼센트 수치는 공동 훈련 수치입니다.
- 6실제 로봇 팔에서만 평가
시뮬레이션 평가는 좋은 순위 신호이지만 (SIMPLER의 시각 매칭 설정에서 Pearson r 0.924) 합격 테스트는 아닙니다. 신뢰하기 전에 벤치에서 체크포인트를 실행하십시오.
실제 녹화 자체에 대한 체크리스트부터 시작하고 싶다면, 데이터 수집 가이드는 카메라 배치, 액션 청킹의 의미와 모방 학습 데이터셋을 사용할 수 없게 만드는 실패 모드를 다룹니다. 형식 자체에 대한 자세한 내용은 데이터셋 문서, 그리고 하이퍼파라미터 측면은 훈련 문서에 있습니다.
합성 데이터만으로 로봇 정책을 완전히 훈련할 수 있습니까?▾
실제 로봇 팔의 조작 작업의 경우, 신뢰할 수 없습니다. 강력한 수치를 가진 모든 발표된 결과는 공동 훈련 결과이거나 실제 데이터 위에 증강된 결과입니다. MimicGen 자체 비교에 따르면 동일한 작업에서 200개의 생성된 데모는 79퍼센트, 200개의 인간 데모는 84퍼센트의 성능을 보였으며, 2025년 시뮬레이션-실제 공동 훈련 논문은 시뮬레이션에서만 훈련하고 전이하는 것이 현실 격차를 해소하기 위해 상당한 인간 노력을 요구한다고 명시합니다. RoboCasa는 생성된 데이터가 인간 데이터를 47.6대 28.8퍼센트로 능가함을 보여주지만, 이는 두 데이터를 모두 생성한 시뮬레이터 내에서 72,000개의 생성된 데모와 1,250개의 인간 데모를 사용했을 때만 해당합니다.
합성 에피소드를 생성하더라도 실제 에피소드는 여전히 몇 개나 필요합니까?▾
AY-Robots에서 트레이너는 SmolVLA에 최소 30 에피소드, ACT, GR00T N1.5, GR00T N1.7 및 Pi0.5에 50 에피소드가 필요하며, 에피소드의 출처와는 무관합니다. Isaac Lab의 Mimic 문서에 따르면 생성 시드(seed)로 약 10개의 성공적인 인간 데모가 필요합니다. 이들은 서로 다른 질문에 답하는 다른 숫자입니다. 10은 생성기가 필요로 하는 것이고, 30에서 50은 트레이너가 필요로 하는 것입니다.
시뮬레이션 데이터는 LeRobot 형식이어야 합니까?▾
이 플랫폼에서 훈련하려면 그렇습니다. Isaac Lab과 LeIsaac은 모두 robomimic 형식의 HDF5를 생성합니다. Isaac Lab 코어는 LeRobot 변환기를 제공하지 않지만, LeIsaac은 LeRobot v2용 isaaclab2lerobot.py와 v3용 isaaclab2lerobotv3.py를 제공하며, IsaacLab-Arena는 YAML 구성으로 구동되는 GR00T 대상 convert_hdf5_to_lerobot.py를 제공합니다. 버전에 유의하십시오. GR00T N1.5 및 N1.7은 LeRobot v2.0 또는 v2.1을 사용하고, Pi0.5, SmolVLA 및 ACT는 v3.0을 사용합니다. v3.0 데이터셋은 GR00T 로더를 충돌시키므로 v2.1로 변환해야 합니다.
2026년에도 Isaac Gym을 배우는 것이 여전히 올바른 일입니까?▾
아니요. NVIDIA 자체 제품 페이지는 "Isaac Gym - 이제 사용 중단됨"이라는 제목으로, 이는 레거시 소프트웨어이며 개발자가 다운로드하여 계속 사용할 수 있지만 더 이상 지원되지 않으며 Isaac Lab이 대체품이라고 명시합니다. Isaac Lab은 IsaacGymEnvs, OmniIsaacGymEnvs 및 Orbit에서 마이그레이션 가이드를 제공하므로 기존 환경은 손실되지 않고 이식 가능합니다.
SO-100 또는 SO-101을 Isaac Lab에 넣을 수 있습니까?▾
SO-101은 제대로 가능합니다. TheRobotStudio 저장소는 Onshape CAD 모델에서 onshape-to-robot으로 생성된 SO-101용 URDF 및 MJCF 파일을 모두 제공하며, LeIsaac은 물리적 SO101 리더 암(arm)에서 원격 조작하는 LeIsaac-SO101-PickOrange-v0와 같은 기성 Isaac Lab 작업을 제공합니다. SO-100의 경우 동일한 저장소는 단일 URDF만 제공하며 MuJoCo 모델은 없습니다. 어떤 경우든 SO-101 README에 명시된 제한 사항에 유의하십시오. 문제가 있는 충돌 동작으로 인해 베이스 충돌 메시가 제거되었고, STS3215 모터 속성은 SO-101에서 식별된 것이 아니라 Open Duck Mini 프로젝트에서 가져왔으며, 0-닫힘에서 100-열림 그리퍼 규칙은 아직 모델 파일에 반영되지 않았습니다.
플랫폼이 시뮬레이션을 실행해 줍니까?▾
아니요. AY-Robots는 실제 원격 조작에서 LeRobot 데이터셋을 기록하고, 임대 GPU에서 지원되는 5가지 정책을 미세 조정하며, 결과 체크포인트를 로봇 팔로 다시 제공합니다. 여기에는 시뮬레이터, 합성 데이터 생성 및 장면 저작 기능이 없습니다. 다른 곳에서 데이터를 생성하여 유효한 LeRobot 데이터셋으로 변환하면, 트레이너는 이를 실제 녹화와 똑같이 받아들일 것입니다.
Sources
- MimicGen project page (CoRL 2023): fewer than 200 human demos to over 50,000 across 18 tasks, Panda/Sawyer/IIWA/UR5e, Square D0 79 percent generated against 84 percent human
- DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning (Jiang et al., 2024), 21K demos from 60 source human demos
- RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots (Nasiriany et al., 2024), 100 tasks, 150+ object categories, 100K MimicGen trajectories, 28.8 vs 47.6 percent
- Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation (Maddukuri et al., 2025), average 38 percent real-world improvement
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (NVIDIA, 2025), data pyramid, 780,000 sim trajectories in 11 hours, 88 to 827 hours of neural trajectories, ablations
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models (Jang et al., 2025), 22 new behaviours from one task, DreamGen Bench
- Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, Li et al., 2024), MMRV and Pearson r for visual matching and variant aggregation, 7x speedup over real eval
- Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (Tobin et al., 2017), 1.5 cm real-world localisation from random textures
- Isaac Lab docs: record_demos.py, annotate_demos.py, generate_dataset.py, the about-10-demos guidance and the candidate success rates, read 23 Aug 2026
- Isaac Lab pip installation: isaacsim[all,extscache]==5.1.0, Isaac Sim 5.X requires Python 3.11, ./isaaclab.sh --install
- Isaac Lab reproducibility and determinism: identical on identical hardware, varies across hardware, no determinism guarantee for non-rigid bodies
- Isaac Lab events API: randomize_rigid_body_material, randomize_actuator_gains, randomize_visual_texture_material and the related randomisation terms
- NVIDIA Isaac Gym product page: now deprecated, legacy software, no longer supported, Isaac Lab is the replacement
- LeIsaac documentation: installation and compatibility table, SO101 teleoperation, available environments, LeRobot recorder, MimicGen env, isaaclab2lerobot converters, NVIDIA Brev
- SO-ARM100 Simulation/SO101: scene.xml, so101_new_calib.xml, so101_old_calib.xml, onshape-to-robot origin, borrowed Open Duck Mini motor parameters, gripper mapping caveat
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started