AY-Robots 비용 표는 5가지 정책 각각에 필요한 GPU, 일반적인 실행 시간 및 실행당 가격, 그리고 정책이 유용해지기 전에 필요한 에피소드 수를 보여줍니다.
VLA 훈련GPU 비용SO-100미세 조정로봇 학습예산 책정

VLA 훈련 비용: 미세 조정 실행에 실제로 드는 비용

AY-Robots ResearchAugust 23, 202623분 읽기

실제 현물 시장 GPU 가격, 5가지 정책 각각의 실행 시간, 로봇 팔과 데모 비용, 그리고 돈이 조용히 사라지는 네 가지 지점.

요약

  • A100 80GB 또는 H100 티어에서의 실행은 3~6시간이 소요되며 약 4~12 USD의 비용이 듭니다. RTX 4090 티어에서는 2~5시간이 소요되며 약 1~3 USD입니다.
  • 2026년 8월 23일 13:44 UTC vast.ai에서 측정: 온디맨드 풀 RTX 4090은 시간당 0.13~0.38 USD, A100 80GB는 0.44~0.67 USD, H100 80GB는 1.34~2.34 USD입니다. 80GB 풀 카드는 희귀하며, 각각 두 개와 다섯 개의 단일 카드만 제공됩니다.
  • GPU는 가장 저렴한 항목입니다. SO-ARM100 BOM(자재 명세서)에 따르면 리더 및 팔로워 페어는 229.88 USD이며, 이는 24GB 티어에서 77~230회 실행에 해당합니다.
  • 한 사람이 50개의 에피소드를 녹화하는 데 드는 2시간의 비용은 해당 에피소드가 사용되는 훈련 실행 비용보다 더 많이 듭니다.
  • 비용은 네 가지 경우에 낭비됩니다: 손상된 데이터로 실행, 80M 정책으로 처리할 수 있는 작업에 3B 모델 사용, 아무도 파괴하지 않은 GPU, 그리고 보관하지 못한 결과에 대한 재실행.
  • AY-Robots는 모델이 필요로 하는 VRAM에 따라 카드를 크기 조정하고 동일한 현물 시장에서 대여하므로, 실행 비용은 시장 비용입니다.

청구서에는 네 가지 항목이 있으며, GPU가 가장 작은 항목입니다.

사람들이 SO-100용 비전-언어-액션 모델을(를) 미세 조정하는 데 드는 비용을 물을 때, 거의 항상 GPU 대여 비용을 의미합니다. 이 비용은 카드 청구서에 나타나는 금액이므로 실제 비용처럼 느껴집니다. 또한, 작동하는 정책이 실제로 얼마의 비용이 드는지 결정하는 네 가지 숫자 중 가장 작은 부분입니다.

항목내용하나의 작동하는 정책에 대한 일반적인 규모
GPU 시간실행을 위한 카드 대여실행당 1~12 USD, 3~5회 실행
로봇서보, 프린트된 프레임, 카메라, 케이블, 전원일회성, 팔당 110~500 EUR
인력 시간데모 녹화를 위해 팔을 조작하는 사람데이터셋당 1~4시간, 작업당 반복
낭비불량 데이터, 과도한 크기의 모델, 잊혀진 파드무제한이며, 유일하게 제어할 수 있는 항목

아래 훈련 시간은 다섯 가지 모델의 자체 논문 및 저장소에서 가져왔으며, 하드웨어 비용은 공개된 자재 명세서에서, 플랫폼 수치는 AY-Robots의 정책 카탈로그가격 페이지에서 가져왔습니다. 플랫폼이 도움이 되지 않는 경우, 이 글에서 명시합니다.

스팟 시장에서 GPU 시간당 실제 비용

A100 시간당 단일 가격은 없습니다. vast.ai와 같은 마켓플레이스에서는 모든 호스트가 자체 요율을 설정하며, 훈련 실행은 해당 순간에 저렴하고 사용 가능한 머신에 할당됩니다. 솔직한 답변은 분포입니다. 다음은 2026년 8월 23일 13:44 UTC에 측정된 결과입니다: 단일 풀 카드, 온디맨드, 실제 VRAM으로 필터링됨.

카드vast.ai 온디맨드 USD/h (최저 / 중앙값 / 최고)풀 카드 제공vast.ai 입찰 최저가RunPod 커뮤니티 / 보안Hugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74제공되지 않음
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99제공되지 않음
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 (Space로)
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 (엔드포인트로)
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19제공되지 않음
이 스냅샷이 어떻게 촬영되었고, 무엇이 아닌지

vast.ai 공개 번들 API(계정 불필요)에서 단일 전체 GPU(gpu_frac == 1.0)에 대한 온디맨드 오퍼를 gpu_ram으로 필터링하여 실제 80GB 카드만 80GB 행에 표시되도록 했습니다. 이 필터는 중요합니다. 이 판독에서 세 개의 단일 카드 A100 SXM4 오퍼는 모두 40GB 부품이었고, 네 개의 A100 PCIE 오퍼 중 두 개도 마찬가지였습니다. 따라서 이들을 하나의 "A100" 행으로 통합했다면 여기에 보고된 가격이 절반으로 줄었을 것입니다. Hugging Face 열은 두 가지 제품을 혼합합니다. 2.50 USD/h는 Nvidia A100 - large Spaces 하드웨어이고, 4.50 USD/h는 Spaces에서 제공하지 않는 Inference Endpoints의 단일 H100 80GB입니다. 중앙값을 참고 자료로 간주하십시오. A100 80GB 행은 두 개의 오퍼를 기반으로 하고 H100 행은 다섯 개의 오퍼를 기반으로 하며, 36초 후에 동일한 쿼리를 실행했을 때 4090 개수가 다르게 나왔고 다섯 개 행 중 세 개에서 최고 가격이 다르게 나왔습니다. RunPod 정가는 계획을 세우는 데 더 안정적인 숫자입니다.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
위 표의 정확한 쿼리로, 이 섹션을 작성하는 동안 두 번 실행되었습니다. 이 글을 포함하여 어떤 GPU 가격 책정 기사도 신뢰하기 전에 이 쿼리를 실행해 보십시오.
AY-Robots cost table showing which GPU each policy needs, typical run time and price per run, and how many episodes are needed before the policy is useful
The cost table on /try: card, run time, price per run and minimum episodes per policy.

3B 모델이 저렴한 카드를 사용할 수 없는 이유

위 중앙값에서 4090 시간과 H100 80GB 시간은 대략 6배 정도 차이가 납니다. 고가의 카드를 사용하게 만드는 것은 속도가 아니라 메모리입니다. openpi는 전체 Pi0.5 미세 조정에 70GB를 최소 요구 사항으로 제시하며, NVIDIA는 GR00T에 40GB 이상을 권장합니다. GR00T 숫자가 의미하지 않는 바에 주목하십시오. 기본적으로 미세 조정 구성은 언어 모델과 시각 인코더를 고정합니다 (tune_llmtune_visual이 False이고, 프로젝터와 확산 헤드는 True입니다). 이것이 카탈로그에 30억 개 중 약 4천만 개의 훈련된 매개변수가 나열되는 이유입니다. 40GB는 30억 개의 가중치에 대한 옵티마이저 상태가 아니라, 고정된 백본과 활성화입니다. 범위가 축소된 변형은 더 낮은 요구 사항을 가집니다: openpi의 LoRA 경로는 22.5GB를 요구하며 4090을 지목하고, NVIDIA의 Isaac Lab Arena 워크플로우는 GR00T 후처리 훈련을 위해 24GB 단일 GPU 옵션을 나열합니다. 플랫폼은 각 공급업체가 실제로 실행하는 구성에 대해 게시하는 최소 요구 사항을 기반으로 계층을 나눕니다. pi0 플로우 매칭 설명서는 해당 플로우 매칭의 메모리 사용량이 어디에서 오는지 설명합니다.

작업업스트림 프로젝트에서 요구하는 메모리출처
pi0 / pi0.5 추론8GB 이상, 예시 RTX 4090openpi
pi0 / pi0.5 LoRA 미세 조정22.5GB 이상, 예시 RTX 4090openpi
pi0 / pi0.5 전체 미세 조정70GB 이상, 예시 A100 80GB 또는 H100openpi
GR00T N1.7 추론16GB 이상 GPU 1개Isaac-GR00T
GR00T N1.7 미세 조정40GB 이상 권장, H100 또는 L40 노드Isaac-GR00T
GR00T 미세 조정, 훈련 대상프로젝터 및 확산 헤드; LLM 및 시각 인코더는 기본적으로 고정됨finetune_config.py
GR00T 후처리 훈련, 축소24GB GPU 1개, 언어 모델 고정Isaac Lab Arena
SmolVLA 미세 조정참조 20,000단계 실행을 위한 단일 A100lerobot docs
ACT 훈련단일 11GB RTX 2080 TiACT paper

이 표가 플랫폼이 다섯 가지 모델을 두 가지 계층으로 나누는 이유입니다. GR00T N1.7, GR00T N1.5Pi0.5는 공급업체가 요구하는 사양에 따라 A100 80GB 또는 H100에서 실행됩니다. SmolVLAACT는 RTX 4090 또는 24GB 카드에서 실행됩니다. 이는 해당 모델에 충분한 사양이기 때문입니다.

하루를 잡아먹는 함정: 대규모 모델에 저렴한 카드 대여하기

24GB 카드에서 GR00T 또는 Pi0.5를 실행하면 즉시 실패하지 않습니다. 기본 체크포인트를 다운로드하고, 데이터셋 인덱스를 구축하고, 첫 번째 순방향 패스를 시작한 후 몇백 단계 만에 CUDA 메모리 부족 오류로 중단됩니다. 다운로드와 설정에 비용을 지불했지만 아무것도 얻지 못하게 됩니다. 해결책: 훈련 중 메모리 부족.

다섯 가지 모델 각각의 실제 실행 시간

실행 시간은 비용의 나머지 절반입니다. 작업이 40분이라면 시간당 2.00 USD는 무의미하며, 40시간이라면 파멸적입니다. 다음은 AY-Robots가 트레이너에게 실제로 보내는 기본값이며, 각 티어별 실행 시간 범위와 비용을 포함합니다.

정책GPU 티어기본 최대 스텝기본 배치 (경사 누적)실행 시간 범위실행당 비용
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
AY-Robots의 훈련 가능한 다섯 가지 정책을 비교한 표로, 파라미터 수, 필요한 GPU, 추론 지연 시간 및 최소 에피소드 수를 보여줍니다.
다섯 가지 정책 비교: 파라미터, GPU 티어, 액션 스텝당 지연 시간, 최소 에피소드.

이러한 실행 시간 범위는 어디에서 오는가

  • SmolVLA: lerobot 문서에 따르면 단일 A100에서 20,000단계는 대략 4시간이 소요됩니다. 플랫폼은 더 저렴한 24GB 티어에서 동일한 20,000단계를 실행하므로, 고정된 4시간이 아닌 시간 범위가 발생합니다.
  • ACT: 원본 ALOHA 논문은 8천만 매개변수 모델의 경우 단일 11GB RTX 2080 Ti에서 약 5시간이 소요된다고 보고합니다. 4090은 여러 세대 더 최신이지만, 플랫폼은 100,000단계를 예산으로 책정하므로 시간 범위는 동일하게 유지됩니다.
  • GR00T: NVIDIA의 N1.6 세대 참조 워크플로우는 8개의 L40S 카드에서 배치 24로 20,000단계에 대해 대략 4~8시간, 단일 Ada 6000에서 배치 16으로 30,000단계에 대해 2~3시간을 인용합니다. 몇 시간 내에 3B VLA를 단일 카드로 미세 조정하는 것은 일반적이며 낙관적인 것이 아닙니다.
  • Pi0.5: openpi는 실제 소요 시간을 공개하지 않지만, 전체 미세 조정을 위한 70GB의 최소 요구 사항을 공개하여 카드와 그에 따른 속도를 결정합니다.

지불하지 않는 숫자에 대해 잠시 생각해 볼 가치가 있습니다. GR00T N1 논문은 최대 1024개의 GPU 클러스터에서 2.2B 모델을 사전 훈련하는 데 약 50,000 H100 GPU 시간이 소요되며, 사전 훈련 배치 크기는 16,384이고 200,000 그래디언트 단계를 거친다고 보고합니다. 위에서 측정된 시간당 1.34~2.34 USD로 계산하면, 이는 대략 67,000~117,000 USD에 해당하는 임대 컴퓨팅 비용입니다. SmolVLA 논문은 481개의 커뮤니티 데이터셋, 22.9K 에피소드, 10.6M 프레임에 걸쳐 약 30,000 GPU 시간이 소요되었다고 프로젝트를 설명합니다. 이 모든 것을 다운로드 비용으로 상속받으며, 8 USD로 마지막 20,000단계를 구매하는 것입니다. VLA가 이런 방식으로 구축되는 이유에서 그 분할을 다룹니다.

로봇 팔: GPU 비용을 압도하는 일회성 비용

훈련 실행 비용은 점심값보다 저렴합니다. 로봇은 그렇지 않습니다. 그것이 바로 SO-100이 중요한 이유입니다. 이는 전체 모방 학습 툴체인이 실제로 지원하는 가장 저렴한 암이기 때문입니다.

서보전압부품 비용AY-Robots 지원
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EUR완전한, 레퍼런스 암
SO-101Feetech STS32157.4 V130 to 170 EUR완전한
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EUR호환
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EUR호환

SO-ARM100 저장소의 상위 BOM(자재 명세서)은 더 세분화되어 있으며 지역별로 확인해 볼 가치가 있습니다. 그 두 개의 암을 위한 부품 목록은 리더 및 팔로워 설정에 대해 총 229.88 USD 또는 226.30 EUR이며, 그 하나의 팔로워 암을 위한 부품 목록은 총 121.94 USD 또는 124.30 EUR입니다. 개당 13.89 USD인 6개의 STS3215 서보는 121.94 중 83.34를 차지하므로, 서보가 암의 핵심입니다. SmolVLA 또는 ACT 실행당 1~3 USD로, 한 쌍의 암은 77~230회 훈련 실행의 가치가 있습니다. 여전히 선택 중이라면, SO-100과 SO-101 비교이 중요한 비교입니다. 두 모델이 충분히 비슷하여 결정은 기능보다는 가용성에 관한 것이기 때문입니다.

7.4 V, 12 V 아님

STS3215는 7.4 V 및 12 V 변형으로 제공됩니다. 저장소에는 12 V 부품이 5 V 대신 12 V 5 A 전원 공급 장치도 필요하다고 명시되어 있으므로, 두 가지는 상호 교환할 수 없습니다. 7.4 V 서보에 12 V를 공급하면 서보가 손상되며, 6개의 서보는 팔로워 암 부품 비용의 3분의 2를 차지합니다. 첫 전원 공급 전에 모든 서보의 라벨을 확인하십시오. 서보가 이미 이상하게 작동하는 경우: 서보 응답 없음, 암이 경련하다가 처짐.

인력 시간: 아무도 스프레드시트에 넣지 않는 항목

이 숫자는 비용 논의를 완전히 뒤집어 놓습니다. 데모를 기록하는 것은 사람이 로봇 팔을 한 번에 한 에피소드씩 실시간으로 움직이는 것입니다. 일괄 처리하거나 초 단위로 대여할 수 없습니다. LeRobot 데이터셋 레코더는 계산을 쉽게 하는 기본값과 함께 제공되며, 이 세 가지는 모두 DatasetRecordConfig에서 확인됩니다. 에피소드당 60초, 장면 재설정에 60초, 총 50개의 에피소드입니다. 아래의 비용 열은 한 사람의 시간당 15 USD를 가정하며, 이는 플랫폼 숫자가 아닌 가정입니다. 자신의 요율을 대입하십시오. 비율이 중요합니다.

  1. 1
    실제로 청구될 기본값으로 데이터셋 기록하기

    이것은 2026년 8월 3일 현재 PyPI에 있는 lerobot 0.6.1 버전입니다. CLI 형태에 유의하십시오. 기록은 이전의 python -m lerobot.scripts.record 모듈 경로가 아닌 lerobot-record 콘솔 진입점(lerobot.scripts.lerobot_record)을 통해 실행됩니다. AY-Robots는 0.5.1을 대상으로 하며, 0.5.1 휠은 동일한 lerobot-recordlerobot-train 진입점을 선언하므로 아래 형태는 두 버전 모두에서 안정적입니다. 세 가지 타이밍 플래그는 업스트림 기본값이므로, 이는 다음 표의 계산이 가정하는 명령이기도 합니다.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    단 한 분의 GPU도 대여하기 전에 기록한 내용을 확인하십시오

    데이터셋을 검사하는 데는 시간당 0 USD가 듭니다. 손실 곡선에서 동일한 문제를 발견하는 데는 H100 티어에서 시간당 2.00 USD가 들고, 4시간 늦게 알려줍니다. 데이터셋을 푸시하고 LeRobot 뷰어에서 확인하거나, AY-Robots 데이터셋 디렉토리를 찾아보십시오.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    학습하고, 체크포인트가 파드보다 오래 지속되도록 하십시오

    대여한 머신은 정의상 임시적이므로, 실행 중에 체크포인트를 영구적인 어딘가에 기록하십시오. 두 개의 플래그가 지불한 것을 유지할지 여부를 결정합니다. --save_freq는 기본적으로 20,000단계이므로, 기본 20,000단계 SmolVLA 실행은 실행이 이미 끝났을 때 첫 번째 체크포인트를 기록합니다. 중단 가능한 것을 대여하기 전에 이 값을 낮추십시오. --save_checkpoint_to_hub--policy.repo_id를 필요로 하며 lerobot 0.5.1에는 존재하지 않으므로, 해당 버전에서는 출력 디렉토리를 직접 머신에서 복사해야 합니다. 아래의 배치 크기는 업스트림 문서의 예시이며, AY-Robots 양식은 SmolVLA에 대해 2를 보내고 체크포인트가 나타날 때 객체 저장소에 기록합니다.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
에피소드60초 기록60초 재설정실제 시간20% 재기록 추가인력 시간당 15 USD
30, SmolVLA 최소30분30분1시간 00분1시간 12분약 18 USD
50, 다른 네 가지 최소50분50분1시간 40분2시간 00분약 30 USD
100, 편안한 데이터셋100분100분3시간 20분4시간 00분약 60 USD

오른쪽 열을 실행 비용인 1~12 USD와 비교하십시오. 이 가정된 비율로 보면, 50개 에피소드 데이터셋은 보정, 카메라 설정 및 버려지는 에피소드를 제외하고 훈련하는 데 드는 비용보다 기록하는 데 2~7배 더 많은 비용이 듭니다. 이것이 이 직접적인 금전적 가치를 가지는 이유입니다. LeRobot 가이드에서는 객체 위치당 10개씩 최소 50개의 에피소드를 제안하며, SmolVLA 문서는 동일한 작업의 25개 에피소드 버전으로는 충분하지 않았다고 보고합니다.

실제로 돈이 새는 곳

1. 애초에 작동하지 않을 데이터로 실행

두 개의 카메라 스트림이 뒤바뀐 데이터셋에서 20,000단계 GR00T를 실행하는 것은 깨끗한 데이터셋에서 실행하는 것과 동일한 비용이 들고, 동일한 시간이 소요되며, 괜찮아 보이는 손실 곡선을 생성합니다. 실패는 몇 시간 후에 로봇 팔에서 나타납니다. 는 시간 단위로 청구되며 진단은 일 단위로 청구됩니다. 기억해 둘 만한 두 가지 증상은 다음과 같습니다: 는 일반적으로 관측값이 작업에 필요한 정보를 전달하지 않음을 의미하며, 는 데이터셋이 생각보다 다양성이 부족했음을 의미합니다.

2. 고정 카메라 작업에 파운데이션 모델 가격 지불하기

ACT는 약 8천만 개의 매개변수를 가지며 하나의 작업에 대한 50개의 데모를 통해 처음부터 훈련되도록 설계되었습니다. GR00T N1.7은 사전 훈련된 백본을 포함하여 약 30억 개의 매개변수를 가집니다. 고정된 카메라, 고정된 테이블 및 하나의 객체에 대해 8천만 개의 모델은 자주 목표를 달성하며, 152 ms 대신 약 20 ms의 액션 단계당 실행 시간을 가지며, 4~12 USD 대신 실행당 1~3 USD의 비용이 듭니다. 비싼 모델에 12 USD를 지출하기 전에 저렴한 모델이 작동하는지 확인하는 데 3 USD를 지출하십시오. ACT 대 SmolVLAGR00T N1.7 대 Pi0.5는 각각 언제 적절한 답이 아닌지 보여줍니다. 모델 아레나에는 85개의 모델과 332개의 벤치마크 결과가 있습니다.

3. 잊어버린 GPU

가장 저렴하게 예방할 수 있는 실수이자 가장 흔하게 저지르는 실수입니다. 금요일에 디버깅을 위해 시작된 인스턴스는 실제 실행과 동일한 요율로 주말 내내 청구됩니다.

카드스냅샷 기준 중간 요금24시간 유휴7일 유휴그 가치는
RTX 40900.32 USD/h7.68 USD53.76 USD약 27회 SmolVLA 또는 ACT 실행 (각 2 USD)
A100 80 GB0.56 USD/h13.44 USD94.08 USD약 12회 GR00T 실행 (각 8 USD)
H100 80 GB1.80 USD/h43.20 USD302.40 USD약 38회 GR00T 실행 (각 8 USD)

AY-Robots에서는 추론 시 이러한 실패가 발생하지 않도록 설계되었습니다. 추론 API에 의해 프로비저닝된 파드는 유휴 감시자를 포함하며 유휴 기간이 지나면 스스로 파괴됩니다. 카드를 직접 대여하는 경우, 이 감시자는 사용자의 캘린더 알림이 됩니다.

4. 동일한 답변에 두 번 비용 지불하기

GR00T의 미세 조정 진입점은 시드를 노출하지 않는 tyro CLI입니다. 이는 플랫폼 제한이 아니라 업스트림 도구의 문제입니다. gr00t/configs/finetune_config.py에는 시드 필드가 없으며, 저장소 자체의 훈련 팁은 이미지 증강이 비결정적이기 때문에 실행 결과가 5~6% 달라질 수 있다고 경고합니다. lerobot은 0.5.1과 0.6.1 버전 모두에서 시드 1000을 기본값으로 사용하므로, ACT, SmolVLA 및 Pi0.5 실행은 최소한 동일한 초기화 및 데이터 순서로 다시 실행할 수 있습니다. 이는 GPU에서 비트 단위로 동일한 가중치를 보장하는 것은 아니지만, 재실행과 새로운 실험 간의 차이입니다. 만약 GR00T 실행이 작동하는 정책을 생성했는데 체크포인트를 보관하지 않았다면, 당신이 추구하던 차이보다 더 큰 차이가 있을 수 있는 결과에 대해 전액을 지불하게 됩니다. 비용을 지불한 체크포인트를 잃을 수 있는 두 번째 방법은 CLI가 --save-total-limit 5를 기본값으로 사용한다는 것입니다. 이는 이전 체크포인트가 삭제되기 전에 유지되는 최대 체크포인트 수로 문서화되어 있습니다. 저장 공간은 몇 센트밖에 안 되지만, 재실행은 4~12 USD와 6시간이 소요됩니다.

중단 가능한 용량은 반값이며 실행을 중단시킬 수 있습니다

위의 입찰 최저가는 온디맨드 요금의 일부이며, vast.ai는 입찰 시스템이 고객 비용을 50% 이상 절감할 수 있다고 말합니다. vast.ai의 설명에 따르면, 중단 가능한 인스턴스는 다른 사용자가 더 높은 가격으로 입찰하거나 동일한 리소스에 대한 온디맨드 대여가 생성되면 언제든지 일시 중지될 수 있으며, 이 일시 중지는 "실행 중인 모든 프로세스를 중단"시킵니다. 온디맨드가 항상 우선합니다. 수백 단계마다 체크포인트를 작성하는 실행에는 괜찮지만, 마지막에 작성하는 실행에는 완전히 손실됩니다. 기본 설정이 바로 그렇습니다. Isaac-GR00T CLI는 --save-steps(기본값 1000)마다 작성하지만, lerobot의 --save_freq는 기본값이 20,000단계이므로 기본 SmolVLA 실행은 결승선에서 한 번 체크포인트를 작성합니다. 값을 낮추거나 입찰하지 마십시오. AY-Robots 훈련 양식은 GR00T 설정을 saveSteps로 노출합니다.

직접 카드 대여하기
장점
  • 가장 낮은 시간당 요금입니다.
  • 이미지, CUDA 버전, lerobot 또는 Isaac-GR00T 개정판 및 모든 플래그에 대한 완전한 제어.
  • 실행이 일시 중지를 견딜 만큼 충분히 자주 체크포인트를 작성한다면 중단 가능한 입찰은 요금을 절반으로 줄입니다.
  • 아무것도 추상화되지 않으므로, 실행이 이상하게 작동할 때 그 이유를 알 수 있습니다.
장단점
  • 설정 비용은 GPU 요율로 청구됩니다: 드라이버, 종속성, 수 기가바이트의 기본 체크포인트 및 데이터셋 다운로드 모두 훈련과 동일한 시간당 비용이 발생합니다.
  • 입찰에서 밀린 중단 가능한 인스턴스는 일시 중지되고 프로세스가 종료됩니다. 저장되지 않은 실행은 돈을 낭비하는 것이며, lerobot 기본값은 20,000단계에서 첫 번째 체크포인트를 작성합니다.
  • 아무것도 자동으로 파드를 파괴하지 않습니다. 위의 유휴 테이블은 잊어버렸을 때의 청구서입니다.
  • 단일 전체 80GB 카드 공급은 부족합니다: 이 글을 읽는 시점에 A100 80GB 2개와 H100 80GB 5개의 전체 카드 제안이 있습니다. 목록도 계속 변동하므로, 가장 저렴하게 표시된 가격과 실제로 대여할 수 있는 가격은 다릅니다.
  • 인프라에 소비하는 매 시간은 정책 작동 여부를 결정하는 에피소드를 기록하는 데 사용되지 않는 시간입니다.

직접 하는 것과 플랫폼이 카드를 대여하도록 하는 것

머신을 선택하고, 환경을 구축하며, 파드를 파괴합니다. 시간당 요금은 위의 시장 요율이며, 그 외 모든 것은 사용자의 시간입니다.

  1. 모델에 필요한 VRAM에 맞는 카드를 찾으십시오: ACT 및 SmolVLA의 경우 24GB, GR00T 및 Pi0.5의 경우 80GB.
  2. 실행이 일시 중지를 견딜 수 없다면 온디맨드로 대여하고, 자주 체크포인트를 작성한다면 중단 가능한 인스턴스를 대여하십시오.
  3. 도구 체인을 설치하십시오: ACT, SmolVLA 및 Pi0.5용 lerobot, GR00T용 자체 tyro 런처가 있는 Isaac-GR00T 저장소.
  4. 필요한 경우 데이터셋을 변환하십시오. LeRobot v3.0 데이터셋은 GR00T 로더를 충돌시키므로 v2.1로 다운그레이드해야 합니다.
  5. 실행하고, 손실을 관찰하며, 체크포인트가 작성될 때 내구성이 있는 곳으로 푸시하십시오.
  6. 인스턴스를 파괴한 다음, 파괴되었는지 확인하십시오.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
현재 Isaac-GR00T 미세 조정 진입점은 저장소 README의 명령과 일치합니다. 이 CLI에는 시드 플래그가 없으므로 GR00T 실행은 비트 단위로 재현할 수 없습니다.

GR00T 실행 한 번에 대한 현실적인 비용: H100 80GB에서 시간당 1.34~2.34 USD로 3~6시간은 4~14 USD이며, 청구되는 20~40분의 설정 시간과 사용자의 시간을 더해야 합니다.

플랫폼 요금 및 카드 선택 방식

로직은 의도적으로 단순합니다. 카탈로그의 모든 모델은 GPU 티어를 선언합니다. 백엔드는 필요한 VRAM을 가져와 위에서 측정된 동일한 현물 시장에서 일치하는 카드를 임대합니다. 이것이 인용된 비용이 가격이 아닌 범위인 이유입니다. GR00T 및 Pi0.5는 40 GB 및 70 GB의 최소 요구 사항 때문에 여기서는 클라우드 전용입니다. SmolVLA 및 ACT는 또한 자체 24 GB 카드에서 로컬로 실행될 수 있으며, 이 경우 클라우드 비용은 0이고 전기는 사용자의 문제입니다.

AY-Robots 가격 책정 페이지에서 훈련 실행 및 플랫폼 액세스 비용을 보여줍니다.
가격 책정 페이지. 실행당 비용은 고정된 정가가 아닌 현물 시장을 추적합니다.

한 가지 설정에 대한 경고가 필요합니다. 그래디언트 누적은 GR00T의 두 가지 변형 모두에 실제로 적용되므로, 이를 높이면 동일한 카드에서 더 큰 유효 배치 크기를 얻을 수 있습니다. Pi0.5 및 SmolVLA의 경우 전혀 적용되지 않습니다. lerobot 0.5.1에는 훈련 구성에 그래디언트 누적 옵션이 없으므로, 해당 필드를 16으로 설정해도 비용이 들지 않고 아무것도 얻지 못합니다. 대기 중인 작업이 시작되지 않는 경우, 대기열에 멈춘 작업 페이지에서 확인할 사항을 다룹니다. 실행이 시작되기 전에 데이터셋이 거부되는 경우, 거의 항상 v3.0 형식 문제입니다.

이 플랫폼이 해결하지 못하는 한계: 지연 시간

공용 인터넷을 통해 정책을 제공하는 임대 GPU는 이미 액션 단계당 20~485ms인 제어 루프에 왕복 시간을 추가합니다. 느린 픽앤플레이스에는 적합하지만, 빠른 반응형 동작에는 적합하지 않습니다. 클라우드 추론은 체크포인트를 잘 평가하지만, 실제 조작은 제대로 수행하지 못합니다. 작업에 속도가 필요하다면 컴퓨팅 장치가 서보 옆에 있어야 하며, 이는 이 글에서 없앨 수 없는 비용입니다. 추론 지연 시간을 참조하십시오.

첫 번째 작동 정책을 위한 예산 분석

아무것도 없는 상태에서 시작하는 네 가지 항목을 모두 합한 것입니다. GPU 총액은 3~5회 실행을 가정합니다. 첫 번째 실행은 파이프라인이 작동함을 증명하고, 두 번째 실행은 데이터 문제를 드러내며, 세 번째 또는 네 번째 실행이 유지하는 것입니다.

항목린 경로편안한 경로
SO-100 팔로워 전용, BOM에 121.94 USD리더 및 팔로워, BOM에 229.88 USD
모델SmolVLA 또는 ACT, 24 GB 티어GR00T N1.7, A100 80 GB 또는 H100 티어
기록된 에피소드30, SmolVLA 최소50~100
기록에 필요한 사람 시간약 1시간 12분2~4시간
1회 실행 비용1~3 USD4~12 USD
작동 전 실행 횟수3~5회3~5회
총 GPU 지출3~15 USD12~60 USD
청구서에서 가장 큰 항목팔, 그 다음은 당신의 시간팔, 그 다음은 당신의 시간

이 크기의 로봇에서도 패턴은 동일합니다: 컴퓨팅은 반올림 오차에 불과하며, 하드웨어는 실제 일회성 비용이고, 인력 시간은 반복적인 지출입니다. 어떤 것도 구매하기 전에 훈련 부분을 테스트하려면, 을 통해 팔 없이 모델을 비교하고 GPU를 대여할 수 있으며, 은 가입 없이 브라우저에서 조작할 수 있는 실제 SO-100입니다. 전체 파이프라인을 처음부터 끝까지 다루는 는 설정, 및 훈련을 다루며, 는 요약 버전입니다.

The AY-Robots training matrix with five policies as rows and four robot arms as columns, every cell linking to a specific training guide
The /train matrix: row for your budget, column for your arm, cell for the guide with that pairing's defaults and cost.
VLA 미세 조정 실행 한 번에 드는 총 비용은 얼마인가요?

A100 80 GB 또는 H100 티어에서 GR00T N1.7, GR00T N1.5 또는 Pi0.5의 경우 약 4~12 USD (시간당 1.20~2.00 USD로 3~6시간), 그리고 RTX 4090 티어에서 SmolVLA 또는 ACT의 경우 약 1~3 USD (시간당 0.30~0.60 USD로 2~5시간)입니다. 카드를 직접 대여하는 경우, 설정 시간을 고려하면 훈련 요율로 청구되므로 비용은 동일한 범위에 속합니다.

A100 80 GB 대신 H100에 비용을 지불할 가치가 있나요?

단일 SO-100 정책의 경우, 일반적으로 그렇지 않습니다. 둘 다 GR00T와 Pi0.5에 필요한 메모리 한도를 충족하며, 2026년 8월 23일 기준으로 A100 80 GB는 시간당 0.44 USD, H100 80 GB는 1.34 USD였습니다. H100이 더 빨리 완료되므로, 일부 요율은 더 적은 시간으로 상쇄되지만, 이처럼 작은 실행의 경우 총 비용은 여전히 더 높습니다. H100의 진정한 장점은 가용성입니다. 해당 시장에서 A100 80 GB는 두 개에 불과한 반면, H100 80 GB는 다섯 개가 제공되며, 대여할 수 없는 카드는 가격이 없습니다.

정책이 실제로 작동하기까지 몇 번의 실행이 필요한가요?

3~5번을 계획하십시오. 첫 번째 실행은 파이프라인이 올바르게 연결되었음을 증명합니다. 두 번째 실행은 도중에 중단된 카메라 스트림과 같은 데이터셋 문제를 흔히 드러냅니다. 세 번째 또는 네 번째 실행이 최종적으로 사용하게 될 실행입니다.

대여하는 대신 제 GPU로 SmolVLA 또는 ACT를 훈련할 수 있나요?

네. 둘 다 AY-Robots에서 로컬로 지원되며 24 GB에 충분히 들어맞습니다. 원래 ACT 논문은 11 GB RTX 2080 Ti에서 약 5시간 만에 80M 모델을 훈련했습니다. GR00T와 Pi0.5는 공급업체가 명시한 미세 조정 최소 사양이 40 GB와 70 GB이고, 시장에서 가장 큰 소비자용 카드가 32 GB RTX 5090이기 때문에 여기서는 클라우드 전용입니다.

동일한 스텝 수가 모델마다 비용이 다른 이유는 무엇인가요?

스텝 수는 정책마다 비교할 수 없습니다. ACT는 24 GB 카드에서 배치 8로 100,000 스텝이 기본값이며, GR00T N1.5는 80 GB 카드에서 배치 1, 그래디언트 누적 16으로 2,000 스텝이 기본값입니다. 청구 비용은 스텝 수가 아니라 메모리 사용량으로 인해 사용해야 하는 카드의 시간당 요율에 시간을 곱한 값입니다.

시작하기 전에 실행 비용을 확인하세요

다섯 가지 정책 각각은 GPU 티어, 실행 시간 및 실행당 가격을 명시하며, 훈련 백엔드는 이 수치들이 측정된 동일한 현물 시장에서 카드를 대여합니다.

가격 확인하기

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started