Blog
Insights on robotics, AI, and data collection

VLA 정책으로 SO-100에서 DAgger 루프 실행하기
SO-100 로봇팔에서 사람이 게이팅하는 DAgger 라운드 한 번을 단계별로 다룬다: 정책을 실행하고 기록하고, 잘못될 때 개입하고, 실행 결과를 교정 데이터로 등록하고, 혼합 데이터셋을 구성하고, 체크포인트에서 학습을 이어간다. 리더 암이 없는 사람을 위한 키보드·슬라이더 개입 경로와, 라운드를 무의미하게 만드는 네 가지 실수도 함께 다룬다.

DAgger 루프 측정하기: 개입률, 평가 프로토콜, 그리고 그 사이의 함정들
개입률 - 개입 프레임을 해당 실행(run)의 전체 프레임 수로 나눈 값 - 은 사람이 제어권을 넘겨주고 넘겨받는 DAgger 루프가 가질 수 있는 가장 저렴하면서도 정직한 진행 신호다. 이 글은 두 사람이 계산해도 같은 값이 나오도록 개입률을 정의하고, 이를 기록하는 방법을 보여주며, 개입률이 사람을 오도하는 네 가지 방식을 다룬다: 조작자의 습관화, 흔들리는 평가 환경, 보정 데이터만으로 학습하기, 그리고 화요일과 월요일에 다르게 보정하는 사람.

HG-DAgger 및 게이트형 변형: 누가 로봇 정책 인수를 결정하는가
순수 DAgger는 로봇이 아직 운전 중일 때 인간이 상태에 라벨을 지정하도록 요청합니다. 실제 하드웨어에서 그것은 안전하지 않으며 좋지 않은 라벨을 생성합니다. 게이트 변형은 누군가 들고 있어야 하는 게이트로 맹목적 라벨 지정을 교체합니다: HG-DAgger의 인간, SafeDAgger의 안전 분류기, EnsembleDAgger의 앙상블 불일치, ThriftyDAgger의 예산 신규성 및 위험 추정. 이 기사는 게이트를 소유한 사람, 게이트를 열 신호, 각각의 비용을 비교합니다. 그리고 왜 인간 게이트형이 실제 팔과의 접촉에서 생존하는 형태인지를 설명합니다.

DAgger Explained: Behavior Cloning이 표류하는 이유와 Dataset Aggregation이 실제로 증명하는 것
Behavior cloning은 전문가의 상태 분포에 정책을 맞추고 자신의 배포에서 실행합니다. 이 두 분포 사이의 차이가 검증에서 정상으로 보이는 정책이 단계 300에서 테이블을 벗어나는 이유입니다. 이것은 우리 DAgger 시리즈의 이론 장입니다: 2차 오류항이 어디서 나오는지, Dataset aggregation이 무엇을 변경하는지, no-regret 증명이 무엇을 가정하는지, 그리고 인간 전문가가 아직도 어떤 대가를 치르는지에 대한 내용입니다.

SO-100에서 DROID, BridgeData V2 및 Open X 사용하기
DROID, BridgeData V2 및 Open X-Embodiment는 6자유도 및 7자유도 로봇 팔에서 7차원 말단 효과기 동작으로 변환됩니다. SO-100은 6개의 관절 위치를 사용합니다. 무엇이 전이되고, 무엇이 전이되지 않으며, 대신 무엇을 해야 하는가.

로봇 정책을 위한 합성 데이터: 시뮬레이션이 도움이 되는 곳
시뮬레이션은 소수의 시연을 수천 개로 늘릴 수 있습니다. 여기서는 공개된 수치가 실제로 무엇을 말하는지, sim-to-real 격차가 어디에서 문제가 되는지, 그리고 여전히 기록되어야 할 것이 무엇인지 설명합니다.

소형 VLA 모델: TinyVLA, SmolVLA 및 10억 미만 사례
TinyVLA와 SmolVLA는 10억 개 미만의 매개변수로 작동하는 VLA를 구현합니다. 두 논문의 실제 수치, LeRobot 기본값, 측정된 지연 시간, 그리고 24GB 카드에서 실행하는 데 드는 비용을 다룹니다.

로컬 GPU 없이 GR00T 추론 실행
로봇 머신에 GPU가 없습니다. GR00T 정책 서버를 임대한 클라우드 GPU에 배치하고, 액션 청크를 로봇 팔로 스트리밍하며, 네트워크 비용이 얼마나 드는지 정확히 알아보세요.

SO-100에서 ACT를 처음부터 훈련하는 방법
lerobot을 사용하여 SO-100에서 Action Chunking Transformer를 처음부터 훈련합니다: act config, chunk_size 및 n_action_steps, 100000 스텝 스케줄, 20 ms 추론.

2026년에 어떤 VLA 정책을 훈련해야 할까요?
GR00T N1.7, Pi0.5, SmolVLA, ACT 또는 GR00T N1.5? 실제 상황에 맞춰진 결정 테이블과 함께 각 선택에 대한 공개된 벤치마크 수치, 지연 시간, 실행당 비용 및 라이선스를 제공합니다.

VLA 훈련 비용: 미세 조정 실행에 실제로 드는 비용
실제 현물 시장 GPU 가격, 5가지 정책 각각의 실행 시간, 로봇 팔과 데모 비용, 그리고 돈이 조용히 사라지는 네 가지 지점.

SO-100으로 첫 LeRobot 데이터셋 기록하기
SO-100으로 사용 가능한 LeRobot 데이터셋을 기록합니다: 캘리브레이션, 리더-팔로워 원격 조작, 실제 lerobot-record 플래그 및 기본값, 카메라 설정, 에피소드 수, 그리고 실행을 망치는 결함.

24GB GPU에서 SmolVLA 훈련하는 방법 (lerobot 0.6.1)
SmolVLA는 단일 24GB 카드에서 미세 조정할 수 있는 4억 5천만 개의 파라미터를 가진 VLA입니다. 실제 lerobot 0.6.1 명령어, 실제 기본값, 하루를 낭비하게 만드는 함정, 그리고 실행 비용에 대해 다룹니다.

자체 로봇 데이터로 Pi0.5 훈련하는 방법
Physical Intelligence의 플로우 매칭 VLA인 Pi0.5를 자체 로봇 데이터로 미세 조정하세요. openpi 및 lerobot pi05를 위한 실제 명령어, 데이터셋 형식 함정, VRAM 및 지연 시간 제한.
Pi-Zero 플로우 매칭 로봇 정책: VLM 초기화를 통한 정교한 제어 혁신
Pi-Zero의 플로우 매칭 기술이 VLM 초기화와 결합하여 어떻게 정교한 제어를 위한 범용 로봇 정책을 변화시키고 있는지 알아보세요. 기존 방법 대비 장점, 로봇 공학을 위한 AI 학습 데이터의 효율성, 산업 전반의 확장 가능한 로봇 배치에 대한 영향에 대해 알아보세요.
Isaac Lab: 차세대 GPU 시뮬레이션 기반 멀티모달 로봇 학습
NVIDIA의 Isaac Lab이 GPU 가속 시뮬레이션을 통해 멀티모달 로봇 학습을 혁신하여 로봇 공학 연구원과 기업을 위한 더 빠른 AI 학습, 확장 가능한 배포 및 최적화된 ROI를 가능하게 하는 방법을 알아보세요.
Isaac Gym: 로봇 학습을 위한 GPU 네이티브 물리 시뮬레이션 - 수천 개의 병렬 환경 확장
Isaac Gym이 GPU 네이티브 물리 시뮬레이션을 통해 로봇 학습을 혁신하여 빠른 강화 학습, VLA 모델 훈련 및 효율적인 AI 로봇 원격 조작을 위해 수천 개의 병렬 환경을 지원하는 방법을 알아보세요. Sim-to-real 격차를 해소하는 벤치마크, PyTorch와의 통합 및 실제 애플리케이션을 살펴보세요.
BC-Z: 로봇 모방 학습을 통한 제로샷 작업 일반화 - 규모가 실제로 의미하는 것
확장된 데모 데이터를 통해 제로샷 작업 일반화를 가능하게 함으로써 BC-Z가 로봇 모방 학습을 어떻게 혁신하는지 살펴보십시오. 로봇 회사 및 AI 엔지니어를 위한 스케일링 법칙, VLA 모델, 원격 조작 모범 사례 및 ROI 이점을 알아보십시오.
BridgeData V2: 저비용 로봇 데이터 대규모 활용 - 어떤 모방 학습 및 오프라인 RL 방법이 실제로 이점을 얻는가
BridgeData V2가 저비용 로봇 데이터를 대규모로 제공하여 모방 학습 방법과 오프라인 강화 학습을 향상시키는 방법을 살펴보세요. 로봇 공학의 주요 벤치마크, VLA 모델, AI 학습 데이터 수집을 위한 효율적인 로봇 원격 조작 워크플로를 알아보세요.
Pi-Zero Flow-Matching Robot Policies: Revolutionizing Dexterous Control with VLM Initialization
Discover how Pi-Zero's flow-matching technique, combined with VLM initialization, is transforming generalist robot policies for dexterous control. Learn about its advantages over traditional methods, efficiency in AI training data for robotics, and implications for scalable robot deployment in industries.
RT-2: 고품질 로봇 훈련 데이터가 알고리즘보다 중요한 이유 – Google DeepMind의 획기적인 통찰력
Google DeepMind의 RT-2 모델이 고급 알고리즘보다 고품질 훈련 데이터의 중요한 역할을 강조하여 AI 로봇 공학을 어떻게 혁신하는지 알아보세요. 이 기사에서는 효과적인 데이터 수집이 실제 로봇 성능에 필수적인 이유를 보여주는 실험을 분석합니다. AY-Robots와 같은 플랫폼이 미래 혁신을 위한 훈련 데이터의 격차를 해소하는 데 어떻게 도움이 되는지 알아보세요.
Google DeepMind의 RT-2: 시각-언어-행동 모델이 로봇 학습을 혁신하는 방법
Google의 RT-2 시각-언어-행동(VLA) 모델이 시각 데이터, 자연어 및 실시간 행동을 통합하여 로봇 학습을 어떻게 재구성하는지 알아보세요. 이 혁신적인 AI 기술은 텔레오퍼레이터를 위한 데이터 수집을 향상시키고 로봇 공학 애플리케이션의 효율성을 높입니다. AY-Robots에서 AI 기반 로봇의 미래에 대한 잠재적 영향을 살펴보세요.