정책 학습

AY-Robots는 관리형 GPU에서 조작 정책을 학습시키므로, 학습 하드웨어를 소유하지 않고도 녹화된 에피소드에서 암 위에서 동작하는 정책까지 갈 수 있습니다. 이 페이지는 지원되는 정책 유형, 학습 실행 페이지, 체크포인트, 그리고 에피소드 수에 따라 현실적으로 기대할 수 있는 결과를 다룹니다.

마지막 업데이트 2026-08-09

자체 GPU 없이 학습하기

조작 정책 학습은 GPU 작업이며, 현대 vision-language-action 모델은 일반적인 워크스테이션보다 훨씬 많은 VRAM을 필요로 합니다. AY-Robots에서는 학습이 플랫폼이 관리하는 클라우드 GPU에서 실행됩니다. 데이터셋과 정책 유형을 선택하고 실행을 시작한 뒤 브라우저에서 진행 상황을 지켜보면 됩니다. CUDA 설정도, 드라이버 맞추기도, 유지 관리할 환경도 필요 없습니다.

입력은 항상 Dashboard > Datasets의 클라우드 데이터셋입니다. 원격 조작 세션으로 녹화했든 LeRobot 형식으로 업로드했든, 병합된 데이터셋을 포함해 모두 사용할 수 있습니다. 학습 전에 정리하십시오. 실패로 라벨된 에피소드는 대개 학습 세트에서 제외해야 하며, 에피소드 브라우저에서 10분간 검토하면 나쁜 시연에서 배우느라 낭비되는 GPU 시간을 몇 시간이나 아낄 수 있습니다.

지원되는 정책

네 가지 정책 계열을 지원합니다. 크기, 학습 비용, 데이터에서 얼마나 많은 것을 흡수할 수 있는지가 서로 다르므로, 일반적인 우선순위보다는 사용자의 작업과 데이터셋에 맞는 선택이 중요합니다.

정책종류특징
ACT트랜스포머, 액션 청킹단일 스텝 대신 미래 액션의 짧은 청크를 예측합니다. 작고, 비교적 빠르게 학습되며, 명확히 정의된 단일 작업에 적합한 첫 선택입니다.
Diffusion Policy액션 시퀀스에 대한 확산 모델시연된 액션의 전체 분포를 모델링하므로, 시연이 하나 이상의 유효한 방식으로 작업을 해결할 때 도움이 됩니다. ACT보다 학습이 무겁고 추론도 느립니다.
SmolVLA소형 vision-language-action 모델언어 조건부입니다. 에피소드의 작업 문자열이 입력의 일부가 됩니다. 대형 파운데이션 모델 없이 언어 조건화를 원할 때 좋은 절충안입니다.
GR00T 파인튜닝파운데이션 모델 파인튜닝사전 학습된 대형 로보틱스 파운데이션 모델을 에피소드로 파인튜닝합니다. 네 가지 중 가장 높은 잠재력을 가지며, 학습 비용도 가장 높고, 데이터셋 형식 요건도 엄격합니다.
GR00T는 LeRobot v2.1 데이터셋이 필요합니다

GR00T 파인튜닝은 LeRobot 형식 버전 2.1의 데이터셋만 받아들입니다. v3.0 데이터셋은 제출 시점이 아니라 데이터 로딩 중에 실패하므로, 실행을 시작하기 전에 형식 버전을 확인하십시오. 플랫폼에서 녹화한 데이터셋은 그대로 사용할 수 있으며, 외부 업로드라면 먼저 meta/info.json에서 버전을 확인하십시오.

실행 시작하기

  1. 1
    데이터셋 선택

    Dashboard > Training을 열고 학습에 사용할 데이터셋을 선택합니다. 에피소드 수와 로봇 유형이 표시되므로 올바른 것을 선택했는지 확인할 수 있습니다.

  2. 2
    정책 선택

    지원되는 정책 유형 중 하나를 선택합니다. 확신이 없다면 ACT부터 시작하십시오. 데이터셋이 무언가를 학습시킬 만큼 좋은지 확인하는 가장 저렴한 방법입니다.

  3. 3
    실행

    실행을 시작합니다. 작업 ID와 전용 실행 페이지가 생성되며, 브라우저를 닫아도 됩니다. 학습은 서버 측에서 계속되며, 다시 돌아오면 페이지가 실시간 상태를 보여줍니다.

학습 실행 페이지

모든 실행에는 학습 중 실제로 궁금한 두 가지 질문에 답하는 전용 페이지가 있습니다: 학습이 되고 있는가, 그리고 머신은 건강한가. 학습 진행 상황은 손실, 학습률 스케줄, 그래디언트 노름 차트로 표시됩니다. 손실이 곧바로 정체되거나 그래디언트 노름이 폭발한다면 그 실행을 기다릴 가치가 없다는 것을 일찍 알 수 있습니다.

머신 상태는 그 옆에 표시됩니다. GPU 사용률과 메모리, 그리고 학습 머신의 호스트 지표입니다. 단계 타임라인은 실행이 환경 준비부터 데이터 로딩, 학습 루프, 체크포인트 업로드까지 어느 단계에 있는지 보여줍니다. 무언가 이상해 보이면 내장 로그 뷰어가 SSH 접근 없이 원시 학습 로그를 보여주며, 대부분의 경우 문제가 데이터셋에 있는지 실행 자체에 있는지 판단하기에 충분합니다.

체크포인트와 재개

체크포인트는 공유 풀이 아니라 실행마다 저장됩니다. 그래서 실행 페이지에 나열된 체크포인트는 항상 정확히 그 실행과 그 설정에 속합니다. 이는 보기보다 중요합니다. 설정이 다른 실행들 사이에서 체크포인트를 섞는 것은 조용히 망가진 정책의 전형적인 원인입니다.

실행이 중단되면 처음부터 다시 시작하는 대신 가장 최근 체크포인트에서 재개할 수 있습니다. 중간 체크포인트도 그 자체로 유용합니다. 긴 실행이 막바지에 과적합되기 시작할 때, 더 이른 체크포인트가 실제 암에서는 최종 체크포인트보다 더 잘 동작하는 경우가 종종 있습니다.

학습된 정책을 암에서 실행하기

완성된 정책은 그대로 로봇에 다시 배포할 수 있습니다. 콕핏에서 연결된 암에 대해 학습된 정책을 선택하고 추론을 시작하면, 이전에 원격 조작으로 만들어 내던 관절 명령을 이제 정책이 만들어 냅니다. 암은 데이터셋을 녹화한 것과 같은 로봇 유형이어야 하며, 장면은 카메라 배치를 포함해 학습 장면과 비슷해야 합니다.

첫 추론 실행은 데모가 아니라 실험처럼 다루십시오. 비상 정지를 손이 닿는 곳에 두고, 시연했던 것과 가까운 시작 상태에서 시작하며, 카메라 위치 이동, 다른 조명, 데이터셋에 없던 물체처럼 사용자가 눈치채지 못할 요소에 정책이 민감할 수 있다는 점을 예상하십시오.

필요한 에피소드 수

플랫폼에서 가장 흔한 학습 실수는 잘못된 하이퍼파라미터가 아니라, 데이터가 너무 적은 상태에서 학습시켜 놓고 정책 유형 자체가 동작하지 않는다고 결론짓는 것입니다. 단일 테이블 작업에 대한 대략적인 기준으로, 약 50개의 에피소드는 시연한 것과 가까운 시작 상태에서 성공하는, 좁은 일반화 범위를 가진 정책을 만들어 줍니다. 약 100개에서 200개의 에피소드는 에피소드 사이에 물체 배치를 다양하게 했다면 그 작업에 대해 작업 공간 전반에서 사용 가능한 수준의 견고함을 만들어 줍니다.

더 강력한 정책 유형이라고 해서 이 원칙이 사라지지는 않습니다. 20개의 에피소드로 파인튜닝한 GR00T도 여전히 일반화가 잘 되지 않습니다. 더 큰 모델이 사 주는 것은 데이터가 충분할 때의 더 높은 상한선입니다. 예산이 제한적이라면 더 큰 모델보다 더 다양한 에피소드에 먼저 투자하십시오.

자주 묻는 질문

학습 실행은 얼마나 걸리나요?

정책 유형과 데이터셋 크기에 따라 다르므로 정직하게 하나의 숫자로 답할 수는 없습니다. ACT가 대체로 네 가지 중 가장 빠르고, GR00T 파인튜닝이 가장 느립니다. 실행 페이지의 단계 타임라인과 손실 차트를 보면 실행이 잘 진행되고 있는지 초기에 알 수 있습니다.

병합된 데이터셋으로 학습할 수 있나요?

예. 병합된 데이터셋도 일반 데이터셋과 같으며, 병합 검증이 이미 fps, 피처, 로봇 유형의 일관성을 보장했습니다. 같은 작업의 녹화를 병합하는 것은 100개에서 200개 에피소드 범위에 도달하는 가장 효과적인 방법 중 하나입니다.

GR00T 실행이 데이터 로딩 중에 실패합니다. 무엇부터 확인해야 하나요?

데이터셋 형식 버전입니다. GR00T 파인튜닝은 LeRobot v2.1을 요구하며, v3.0 데이터셋은 바로 그 지점에서 실패합니다. 데이터셋의 meta/info.json에서 버전을 확인하십시오.

학습 전에 실패한 에피소드를 제거해야 하나요?

대개는 그렇습니다. 실패로 라벨된 에피소드는 정책에게 실패하는 행동을 가르칩니다. 복구 에피소드는 다릅니다. 실수를 바로잡는 방법을 보여주므로 보통 유지할 가치가 있습니다.

학습 중에 브라우저를 계속 열어 두어야 하나요?

아니요. 실행은 서버 측에서 진행됩니다. 다시 돌아오면 실행 페이지가 현재 상태, 차트, 로그를 보여주며, 누군가 지켜보고 있는지와 관계없이 체크포인트는 저장됩니다.