AY-Robotsのコスト表。5つのポリシーそれぞれに必要なGPU、一般的な実行時間と1回あたりの価格、ポリシーが有用になるまでに必要なエピソード数を示す。
VLAトレーニングGPUコストSO-100ファインチューニングロボット学習予算編成

VLAトレーニングコスト:ファインチューニングの実行にかかる実際の費用

AY-Robots ResearchAugust 23, 202623分読了

実際のスポット市場GPU価格、5つのポリシーそれぞれの実行時間、アームとデモンストレーションの費用、そして静かに費用が消えていく4つの場所。

概要

  • A100 80 GBまたはH100ティアでの実行は3〜6時間かかり、費用は約4〜12 USDです。RTX 4090ティアでは2〜5時間で、費用は約1〜3 USDです。
  • vast.aiで2026年8月23日13:44 UTCに測定:RTX 4090のオンデマンドは0.13〜0.38 USD/h、A100 80 GBは0.44〜0.67、H100 80 GBは1.34〜2.34。80 GBカードは希少で、それぞれ2件と5件のシングルカード提供がありました。
  • GPUは最も安価な項目です。SO-ARM100の部品表では、リーダーとフォロワーのペアは229.88 USDで、これは24 GBティアでの77〜230回の実行に相当します。
  • 50エピソードを記録する2時間の作業は、それらのエピソードが供給するトレーニング実行よりも費用がかかります。
  • 費用は4つの場所で消えます:破損したデータでの実行、80Mポリシーが処理するタスクでの3Bモデル、誰も破壊しなかったGPU、そして保持できなかった結果の再実行。
  • AY-Robotsはモデルが必要とするVRAMに応じてカードのサイズを決定し、同じスポット市場でレンタルするため、実行コストは市場価格となります。

請求書には4つの項目があり、GPUは最も小さいものです

SO-100向けに視覚言語行動モデルの費用について尋ねる際、ほとんどの場合、GPUレンタルを意味します。これはカードに請求として表示される数字なので、現実味を帯びています。また、実際に機能するポリシーがどれだけかかるかを決定する4つの数字の中で、圧倒的に最も小さいものです。

項目内容機能するポリシー1つあたりの一般的な規模
GPU時間実行のためのカードレンタル1回の実行あたり1〜12 USD、3〜5回実行します
ロボットサーボ、プリントフレーム、カメラ、ケーブル、電源1回限り、アームあたり110〜500 EUR
人件時間デモを記録するためにアームを操作する人データセットあたり1〜4時間、タスクごとに繰り返し
無駄不良データ、過大なモデル、忘れられたポッド無制限、そして唯一制御できる項目

以下のトレーニング時間は、5つのモデルそれぞれの論文とリポジトリから、ハードウェアコストは公開されている部品表から、プラットフォームの数値はAY-Robotsのポリシーカタログおよび料金ページから引用しています。プラットフォームが役立たない場合、この記事はその旨を明記しています。

スポット市場でのGPU時間あたりの実際のコスト

A100の1時間あたりの価格は一つではありません。vast.aiのようなマーケットプレイスでは、各ホストが独自の料金を設定しており、トレーニング実行を起動すると、その瞬間に安価で空いているマシンに割り当てられます。正直な答えは分布です。以下に、2026年8月23日13:44 UTCに測定された、単一のフルカード、オンデマンド、実際のVRAMでフィルタリングされた結果を示します。

カードvast.ai オンデマンド USD/h (低 / 中央値 / 高)フルカード提供数vast.ai 最低入札額RunPod コミュニティ / セキュアHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74提供なし
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99提供なし
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19提供なし
このスナップショットの取得方法とその限界

vast.aiの公開バンドルAPIから取得した、アカウント不要の単一フルGPU (gpu_frac == 1.0) のオンデマンドオファーを、gpu_ramでフィルタリングし、真の80 GBカードのみが80 GBの行に表示されるようにしました。このフィルタリングは重要です。今回の調査では、3つの単一カードA100 SXM4オファーすべてが40 GBパーツであり、4つのA100 PCIEオファーのうち2つもそうでした。そのため、これらを1つの「A100」行にまとめた場合、ここで報告される価格は半分になっていたでしょう。Hugging Faceの列は2つの製品を組み合わせています。2.50 USD/hはNvidia A100 - large Spacesハードウェアであり、4.50 USD/hはSpacesでは提供されていないInference Endpointsでの単一H100 80 GBです。中央値はあくまで目安として扱ってください。A100 80 GBの行は2つのオファーに基づき、H100の行は5つのオファーに基づいています。また、36秒後に同じクエリを実行したところ、4090のカウントと5つの行のうち3つの最高価格が異なりました。RunPodの定価は、計画を立てる上でより安定した数値です。

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
上記の表の背後にある正確なクエリ。このセクションの執筆中に2回実行されました。この記事を含め、GPU価格に関する記事を信頼する前に、これを実行してください。
AY-Robots cost table showing which GPU each policy needs, typical run time and price per run, and how many episodes are needed before the policy is useful
The cost table on /try: card, run time, price per run and minimum episodes per policy.

3Bモデルが安価なカードを使用できない理由

上記のメディアンでは、4090時間とH100 80 GB時間にはおよそ6倍の差があります。高価なカードの使用を余儀なくされるのは速度ではなく、メモリです。openpiは、完全なPi0.5のファインチューンには最低70 GBが必要であるとし、NVIDIAはGR00Tには40 GB以上を推奨しています。GR00Tの数値が何を意味しないかに注意してください。そのファインチューン設定では、デフォルトで言語モデルとビジュアルエンコーダーがフリーズされ(tune_llmtune_visualはFalse、プロジェクターと拡散ヘッドはTrue)、そのためカタログには3 Bのうち約40 Mの学習済みパラメータが記載されています。40 GBは3 Bの重みに対するオプティマイザの状態ではなく、フリーズされたバックボーンとアクティベーションです。範囲を縮小したバリアントではさらに低くなり、openpiのLoRAパスは22.5 GBを要求し4090を挙げており、NVIDIAのIsaac Lab ArenaワークフローではGR00Tのポストトレーニング用に24 GBのシングルGPUオプションが記載されています。プラットフォームは、各ベンダーが実際に実行する構成について公開している最低要件に基づいて階層化されています。pi0フローマッチングの解説記事では、そのフローマッチングのフットプリントがどこから来るのかを説明しています。

ジョブアップストリームプロジェクトが要求するメモリソース
pi0 / pi0.5 推論8 GB以上、例:RTX 4090openpi
pi0 / pi0.5 LoRA ファインチューン22.5 GB以上、例:RTX 4090openpi
pi0 / pi0.5 フルファインチューン70 GB以上、例:A100 80 GBまたはH100openpi
GR00T N1.7 推論16 GB以上のGPU 1基Isaac-GR00T
GR00T N1.7 ファインチューン40 GB以上推奨、H100またはL40ノードIsaac-GR00T
GR00T ファインチューン、学習対象プロジェクターと拡散ヘッド;LLMとビジュアルエンコーダーはデフォルトでフリーズfinetune_config.py
GR00T ポストトレーニング、縮小版24 GBのGPU 1基、言語モデルはフリーズIsaac Lab Arena
SmolVLA ファインチューンリファレンスの20,000ステップ実行にはA100 1基lerobot docs
ACT トレーニング11 GBのRTX 2080 Ti 1基ACT paper

この表が、プラットフォームが5つのモデルを2つのティアに分割する理由です。GR00T N1.7GR00T N1.5、およびPi0.5は、ベンダーが要求するためA100 80 GBまたはH100で実行されます。SmolVLAおよびACTは、RTX 4090または任意の24 GBカードで実行されます。これは、それが本当に十分だからです。

一日を無駄にする罠:大規模モデルのために安価なカードを借りる

24 GBカードでGR00TまたはPi0.5を実行しても、開始直後に失敗することはありません。ベースチェックポイントをダウンロードし、データセットインデックスを構築し、最初の順伝播を開始しますが、数百ステップでCUDAメモリ不足エラーにより停止します。ダウンロードとセットアップに費用を払ったのに、何も得られません。解決策:トレーニング中のメモリ不足

5つのモデルが実際にどれくらいの時間実行されるか

実行時間はコストのもう半分です。1時間あたり2.00 USDという料金は、ジョブが40分であれば関係なく、40時間であれば破滅的です。これらはAY-Robotsが実際にトレーナーに送信するデフォルト設定であり、各ティアの実行ウィンドウとコストが含まれています。

ポリシーGPUティアデフォルトの最大ステップ数デフォルトのバッチサイズ (勾配蓄積)実行ウィンドウ実行あたりのコスト
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
AY-Robotsにおける5つの学習可能なポリシーの比較表。パラメータ数、必要なGPU、推論レイテンシ、最小エピソード数を示す。
5つのポリシーを並べて比較:パラメータ、GPUティア、アクションステップあたりのレイテンシ、最小エピソード数。

これらの実行ウィンドウはどこから来るのか

  • SmolVLA: lerobotのドキュメントによると、20,000ステップの実行には単一のA100で約4時間かかります。プラットフォームは、より安価な24 GBティアで同じ20,000ステップを実行するため、一律4時間ではなく、幅のある時間枠となります。
  • ACT: オリジナルのALOHA論文では、80Mパラメータモデルの場合、単一の11 GB RTX 2080 Tiで約5時間と報告されています。4090は数世代新しいですが、プラットフォームは100,000ステップを予算としているため、時間枠は同じ範囲に収まります。
  • GR00T: NVIDIAのN1.6世代のリファレンスワークフローでは、8枚のL40Sカードでバッチ24で20,000ステップに約4~8時間、単一のAda 6000でバッチ16で30,000ステップに2~3時間とされています。数時間での3B VLAのシングルカードファインチューニングは通常であり、楽観的ではありません。
  • Pi0.5: openpiは実測時間を公表していませんが、フルファインチューンの70 GBの最低要件を公表しており、これによりカードとレートが特定されます。

支払っていない金額について少し考えてみましょう。GR00T N1の論文によると、2.2Bモデルの事前学習には、最大1024個のGPUクラスタで、事前学習バッチサイズ16,384、200,000勾配ステップで、約50,000 H100 GPU時間かかると報告されています。上記の測定値である1時間あたり1.34~2.34 USDで計算すると、これは67,000~117,000 USD相当のレンタル計算資源に相当します。SmolVLAの論文では、そのプロジェクトは481のコミュニティデータセット、22.9Kエピソード、10.6Mフレームにわたって約30,000 GPU時間とされています。あなたはダウンロードの価格でそのすべてを継承します。あなたの8 USDは最後の20,000ステップを購入するものです。なぜVLAはこのように構築されるのかで、その分割について説明しています。

アーム:GPU費用をはるかに上回る一度限りのコスト

トレーニングの実行費用はランチよりも安価です。ロボットはそうではありません。だからこそSO-100が重要なのです。これは、模倣学習ツールチェーンが実際にサポートする中で最も安価なアームだからです。

アームサーボ電圧部品費用AY-Robotsでのサポート
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURフル、リファレンスアーム
SO-101Feetech STS32157.4 V130 to 170 EURフル
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EUR互換性あり
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EUR互換性あり

SO-ARM100リポジトリにある上位の部品表はより詳細で、お住まいの地域と照らし合わせて確認する価値があります。そのParts For Two Armsリストは、リーダーとフォロワーのセットアップで合計229.88 USDまたは226.30 EURです。また、そのParts for One Follower Armリストは合計121.94 USDまたは124.30 EURです。1個あたり13.89 USDのSTS3215サーボ6個で83.34 USDとなり、この121.94 USDのうちの大部分を占めるため、サーボがアームの主要部品です。SmolVLAまたはACTの実行1回あたり1から3 USDで、1組のアームは77回から230回のトレーニング実行に相当します。まだ選択中であれば、SO-100とSO-101の比較が重要な比較です。この2つは非常に似ているため、決定は機能ではなく入手可能性に基づきます。

7.4 V、12 Vではありません

STS3215には7.4 Vと12 Vのバリアントがあります。リポジトリには、12 V部品には5 V電源の代わりに12 V 5 A電源も必要であると記載されており、両者は互換性がありません。7.4 Vサーボに12 Vを供給すると破損し、サーボ6個はフォロワーアームの部品費用の3分の2を占めます。最初の電源投入前に、すべてのサーボのラベルを確認してください。サーボがすでに異常な動作をする場合:サーボが応答しないアームが痙攣してから垂れ下がる

人件費:誰もスプレッドシートに記載しない項目

これは、コストに関する議論を根底から覆す数字です。デモンストレーションの記録は、人がロボットアームをリアルタイムで、1エピソードずつ動かす作業です。バッチ処理も秒単位でのレンタルもできません。 LeRobot dataset レコーダーは、計算を容易にするデフォルト設定で出荷されており、これら3つはすべて DatasetRecordConfig で確認されています。1 episode あたり60秒、シーンのリセットに60秒、50エピソードです。以下の金額の列は、1時間あたりの人件費を15 USDと仮定していますが、これはプラットフォームの数値ではなく仮定です。ご自身のレートに置き換えてください。重要なのは比率です。

  1. 1
    実際に請求されるデフォルト設定でデータセットを記録する

    これは2026年8月3日時点のPyPI上のバージョンであるlerobot 0.6.1です。CLIの形式に注意してください。記録は、古いpython -m lerobot.scripts.recordモジュールパスではなく、lerobot-recordコンソールエントリーポイント(lerobot.scripts.lerobot_record)を介して実行されます。AY-Robotsは0.5.1をターゲットとしており、0.5.1のホイールも同じlerobot-recordおよびlerobot-trainエントリーポイントを宣言しているため、以下の形式は両方で安定しています。3つのタイミングフラグはアップストリームのデフォルトであるため、これは次の表の計算が前提とするコマンドでもあります。

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    GPUを1分でもレンタルする前に、記録した内容を確認する

    データセットの検査には1時間あたり0 USDの費用がかかります。損失曲線から同じ問題を発見すると、H100ティアで1時間あたり2.00 USDかかり、4時間遅れて知ることになります。データセットをプッシュしてLeRobotビューアで確認するか、AY-Robotsのデータセットディレクトリを参照してください。

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    トレーニングを実行し、チェックポイントがポッドよりも長く存続することを確認する

    レンタルされたマシンは定義上、一時的なものであるため、実行中にチェックポイントを永続的な場所に書き込む必要があります。支払ったものを保持するかどうかは、2つのフラグで決まります。--save_freqはデフォルトで20,000ステップなので、デフォルトの20,000ステップのSmolVLA実行では、実行がすでに終了したときに最初のチェックポイントが書き込まれます。中断可能なものをレンタルする前に、これを下げてください。--save_checkpoint_to_hub--policy.repo_idを必要とし、lerobot 0.5.1には存在しないため、そのバージョンでは出力ディレクトリを自分でマシンからコピーする必要があります。以下のバッチサイズはアップストリームのドキュメントの例です。AY-RobotsのフォームはSmolVLAに2を送信し、チェックポイントが出現するたびにオブジェクトストレージに書き込みます。

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
エピソード60秒での記録60秒でのリセット実時間再記録20%増人件費1時間あたり15 USD
30、SmolVLAの最小値30 min30 min1 h 00 min1 h 12 minabout 18 USD
50、その他の4つの最小値50 min50 min1 h 40 min2 h 00 minabout 30 USD
100、十分なデータセット100 min100 min3 h 20 min4 h 00 minabout 60 USD

右側の列と、実行にかかる1~12 USDのコストを比較してください。この仮定されたレートでは、キャリブレーション、カメラ設定、および破棄するエピソードを除くと、50エピソードのデータセットは、トレーニングにかかるコストの2~7倍の記録コストがかかります。だからこそ、は直接的な金銭的価値を持つのです。lerobotガイドでは、オブジェクトの場所ごとに10エピソード、合計で少なくとも50エピソードを推奨しています。SmolVLAのドキュメントでは、同じタスクの25エピソード版では不十分であったと報告されています。

実際にお金が失われる場所

1. 決して機能しないデータでの実行

2つのカメラストリームが入れ替わったデータセットでの20,000ステップのGR00T実行は、クリーンなデータセットでの実行と同じコストがかかり、同じ時間がかかり、見た目は問題ない損失曲線が生成されます。失敗は数時間後にアーム上で現れます。は時間単位で課金され、診断は日単位で課金されます。記憶しておくべき2つの症状:は通常、観測値がタスクに必要な情報を持っていないことを意味し、は、データセットのバリエーションが思ったよりも少なかったことを意味します。

2. 固定カメラタスクに基盤モデルの価格を支払う

ACTは約80Mのパラメータを持ち、1つのタスクの50回のデモンストレーションからスクラッチで学習するように設計されています。GR00T N1.7は約3Bのパラメータを持ち、事前学習済みのバックボーンを備えています。固定されたカメラ、固定されたテーブル、1つのオブジェクトの場合、80Mモデルは頻繁に目標を達成し、152 msではなく約20 msでアクションステップを実行し、4から12 USDではなく1から3 USDのコストで実行できます。高価なモデルに12 USDを費やす前に、安価なモデルが機能するかどうかを3 USDで確認してください。 ACTとSmolVLAの比較GR00T N1.7とPi0.5の比較は、それぞれが適切な答えでなくなる場所を示しています。モデルアリーナには85のモデルと332のベンチマーク結果があります。

3. 忘れ去られたGPU

防ぐのが最も安価で、最も犯しやすい間違いです。金曜日にデバッグのために起動されたインスタンスは、実際の実行と同じ料金で週末を通して課金されます。

カードスナップショットの中央値レート24時間アイドル7日間アイドルその価値
RTX 40900.32 USD/h7.68 USD53.76 USDSmolVLAまたはACTの実行約27回分(2 USD)
A100 80 GB0.56 USD/h13.44 USD94.08 USDGR00Tの実行約12回分(8 USD)
H100 80 GB1.80 USD/h43.20 USD302.40 USDGR00Tの実行約38回分(8 USD)

AY-Robotsでは、この障害は推論用に設計されており、推論APIによってプロビジョニングされたポッドはアイドル状態のウォッチドッグを搭載し、アイドル期間後に自己破壊します。カードを自分でレンタルする場合、そのウォッチドッグはカレンダーのリマインダーとなります。

4. 同じ答えに二度支払う

GR00Tのファインチューニングのエントリポイントは、シードを公開しないtyro CLIです。これはプラットフォームの制限ではなく、アップストリームのツールです。つまり、gr00t/configs/finetune_config.pyにはシードフィールドがなく、リポジトリ自身のトレーニングのヒントでは、画像拡張が非決定論的であるため、実行結果が5〜6パーセント変動すると警告されています。lerobotは0.5.1と0.6.1の両方でシード1000をデフォルトとしているため、ACT、SmolVLA、Pi0.5の実行は、少なくとも同じ初期化とデータ順序から再実行できます。これはGPU上でのビット単位で同一の重みを保証するものではありませんが、再実行と新しい実験との違いです。GR00Tの実行で機能するポリシーが生成され、チェックポイントを保持していなかった場合、あなたが追い求めていた差以上に異なる可能性のある結果に対して全額を支払うことになります。支払ったチェックポイントを失う2つ目の方法があります。CLIはデフォルトで--save-total-limit 5となっており、これは古いチェックポイントが削除される前に保持されるチェックポイントの最大数として文書化されています。ストレージは数セントです。再実行には4〜12 USDと6時間かかります。

割り込み可能な容量は半額ですが、実行を停止させる可能性があります

上記の入札フロアはオンデマンド料金の一部であり、vast.aiは入札システムによってクライアントのコストを50%以上削減できると述べています。ただし、vast.ai自身の言葉を借りれば、割り込み可能なインスタンスは、他のユーザーがより高い入札をした場合や、同じリソースに対してオンデマンドレンタルが作成された場合、いつでも一時停止される可能性があり、その一時停止は「実行中のすべてのプロセスを停止」します。オンデマンドは常に優先されます。数百ステップごとにチェックポイントを書き込む実行には問題ありませんが、最後に書き込む実行では完全に損失となります。これはまさにデフォルト設定が提供するものです。Isaac-GR00T CLIは--save-steps(デフォルト1000)ごとに書き込みますが、lerobotの--save_freqはデフォルトで20,000ステップなので、デフォルトのSmolVLA実行では、終了時に一度だけチェックポイントが作成されます。これを下げるか、入札しないでください。AY-Robotsのトレーニングフォームでは、GR00Tの調整項目がsaveStepsとして公開されています。

カードを自分でレンタルする
利点
  • 最も低い時間単価です。
  • イメージ、CUDAバージョン、lerobotまたはIsaac-GR00Tのリビジョン、およびすべてのフラグを完全に制御できます。
  • 実行が一時停止に耐えられるほど頻繁にチェックポイントを作成する場合、割り込み可能な入札は料金を半額にします。
  • 何も抽象化されていないため、実行が異常な動作をした場合でもその理由を確認できます。
トレードオフ
  • セットアップはGPU料金で請求されます。ドライバー、依存関係、数ギガバイトのベースチェックポイント、データセットのダウンロードはすべて、トレーニングと同じ時間単価で費用がかかります。
  • 入札で負けた割り込み可能なインスタンスは一時停止され、そのプロセスは強制終了されます。保存されていない実行は無駄な費用となり、lerobotのデフォルトでは最初のチェックポイントが20,000ステップで書き込まれます。
  • ポッドは自動的に破棄されません。上記のアイドル状態の表は、忘れられた場合の請求額です。
  • 単一のフル80 GBカードの供給は薄いです。この読み取りでは、A100 80 GBが2つ、H100 80 GBのフルカードが5つの提供がありました。リストも頻繁に変動するため、表示されている最安値と実際にレンタルできる価格は同じではありません。
  • インフラに費やす1時間は、ポリシーが機能するかどうかを決定するエピソードを記録しない1時間です。

自分でやるか、プラットフォームにカードを借りさせるか

自分でマシンを選び、環境を構築し、ポッドを破棄します。時間料金は上記の市場レートであり、それ以外はすべてあなたの時間です。

  1. モデルが必要とするVRAMに合ったカードを見つけます。ACTとSmolVLAには24 GB、GR00TとPi0.5には80 GBです。
  2. 実行が一時停止に耐えられない場合はオンデマンドでレンタルし、頻繁にチェックポイントを作成する場合は中断可能にします。
  3. ツールチェーンをインストールします。ACT、SmolVLA、Pi0.5にはlerobotを、GR00Tには独自のtyroランチャーを備えたIsaac-GR00Tリポジトリをインストールします。
  4. 必要に応じてデータセットを変換します。LeRobot v3.0データセットはGR00Tローダーをクラッシュさせるため、v2.1に変換する必要があります。
  5. 起動し、損失を監視し、チェックポイントが書き込まれたら耐久性のある場所にプッシュします。
  6. インスタンスを破棄し、その後、破棄したことを確認します。
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
現在のIsaac-GR00Tファインチューンエントリーポイント。リポジトリのREADMEのコマンドと一致します。このCLIにはシードフラグがないため、GR00Tの実行はビット単位で再現可能ではありません。

GR00Tの1回の実行にかかる現実的なコスト:H100 80 GBで1時間あたり1.34から2.34 USDで3から6時間かかるため、4から14 USDになります。これに、課金対象となる20から40分のセットアップ時間と、あなたの時間が加わります。

プラットフォームの課金方法とカードの選択方法

ロジックは意図的に単純です。各モデルはカタログでGPUティアを宣言します。バックエンドは必要なVRAMを取得し、上記で測定された同じスポット市場で一致するカードをレンタルします。そのため、提示されるコストは価格ではなく範囲です。GR00TとPi0.5は、40 GBと70 GBという最低要件があるため、ここではクラウド専用です。SmolVLAとACTは、ご自身の24 GBカードでローカルに実行することもでき、その場合クラウド費用はゼロで、電気代はご自身の負担となります。

AY-Robotsの料金ページ。トレーニング実行とプラットフォームアクセスにかかる費用を示しています。
料金ページ。実行ごとの料金は固定価格ではなくスポット市場を追跡します。

1つの設定には注意が必要です。勾配蓄積はGR00Tのどちらのバリアントにも実際に適用されるため、これを増やすと、同じカードでより大きな実効バッチサイズが得られます。Pi0.5とSmolVLAには全く適用されません。lerobot 0.5.1のトレーニング設定には勾配蓄積オプションがないため、このフィールドを16に設定しても費用はかからず、何も得られません。キューに入ったジョブが開始されない場合、キューで停止したジョブのページで確認すべき事項が説明されています。実行開始前にデータセットが拒否された場合、それはほとんどの場合v3.0形式の問題です。

このプラットフォームが解決しない限界:レイテンシ

公衆インターネット経由でポリシーを提供するレンタルGPUは、すでに1アクションステップあたり20〜485 msの制御ループにラウンドトリップを追加します。低速なピックアンドプレースには適していますが、高速な反応動作には適していません。クラウド推論はチェックポイントの評価には優れていますが、本番環境での操作には不向きです。タスクに速度が必要な場合、計算リソースはサーボの近くに配置する必要があり、それはこの記事では解消できないコストです。推論レイテンシを参照してください。

最初の動作ポリシーのための予算例

何もない状態から始める、これら4つのラインすべてを合わせて。GPUの合計は3〜5回の実行を想定しています。最初の実行でパイプラインが機能することを確認し、2番目の実行でデータの問題を露呈させ、3番目または4番目の実行が最終的に採用されるものです。

項目リーンパス快適パス
アームSO-100 フォロワーのみ、BOMで121.94 USDリーダーとフォロワー、BOMで229.88 USD
モデルSmolVLA または ACT、24 GBティアGR00T N1.7、A100 80 GB または H100ティア
記録されたエピソード数30、SmolVLAの最小値50から100
記録にかかる人間の時間約1時間12分2から4時間
1回の実行コスト1から3 USD4から12 USD
動作するまでの実行回数3から53から5
GPU総費用3から15 USD12から60 USD
請求書で最大の項目アーム、次にあなたの時間アーム、次にあなたの時間

このサイズのロボットでもパターンは同じです。計算は誤差の範囲であり、ハードウェアは実際の1回限りのコストであり、人件費は継続的な費用です。何も購入する前にトレーニング部分をテストするには、ハードウェア不要のエントリーポイント を使用すると、モデルを比較し、アームなしでGPUをレンタルできます。そして、ライブアーム は、サインアップなしでブラウザから操作できる物理的なSO-100です。パイプライン全体をエンドツーエンドで実行するには、完全なSO-100ガイド がセットアップ、テレオペレーション およびトレーニングをカバーしており、最初のポリシーをトレーニングする はその短縮版です。

AY-Robotsトレーニングマトリックス。5つのポリシーを行に、4つのロボットアームを列に配置し、各セルが特定のトレーニングガイドにリンクしています。
The /train matrix: 予算ごとの行、アームごとの列、その組み合わせのデフォルト設定とコストが記載されたガイドへのセル。
VLAのファインチューニング1回あたりの総コストはいくらですか?

GR00T N1.7、GR00T N1.5、またはPi0.5をA100 80 GBまたはH100ティアで実行する場合、約4~12 USD(1時間あたり1.20~2.00 USDで3~6時間)。SmolVLAまたはACTをRTX 4090ティアで実行する場合、約1~3 USD(1時間あたり0.30~0.60 USDで2~5時間)です。カードを自分でレンタルする場合も、セットアップ時間を考慮するとトレーニング料金で請求されるため、同じ範囲になります。

H100はA100 80 GBよりも費用を払う価値がありますか?

単一のSO-100ポリシーの場合、通常はそうではありません。どちらもGR00TとPi0.5が必要とするメモリ要件を満たしており、2026年8月23日の時点では、A100 80 GBは1時間あたり0.44 USDから、H100 80 GBは1.34 USDからでした。H100はより早く完了するため、料金の一部は時間の短縮として戻ってきますが、この規模の実行では合計コストは依然として高くなります。H100の真の利点は可用性です。その市場ではH100 80 GBの単一オファーが5件に対し、A100 80 GBは2件しかなく、レンタルできないカードには価格がありません。

ポリシーが実際に機能するまでに何回実行が必要ですか?

3回から5回を計画してください。1回目でパイプラインが正しく配線されていることを確認します。2回目では、途中で停止したカメラストリームのようなデータセットの問題がよく明らかになります。3回目または4回目が最終的に採用するものです。

SmolVLAやACTをレンタルではなく自分のGPUでトレーニングできますか?

はい、可能です。どちらもAY-Robotsでローカルにサポートされており、24 GBに快適に収まります。オリジナルのACT論文では、11 GBのRTX 2080 Tiで80Mモデルを約5時間でトレーニングしました。GR00TとPi0.5は、ベンダーが文書化したファインチューニングの最低要件が40 GBと70 GBであり、市場で最大の消費者向けカードが32 GBのRTX 5090であるため、ここではクラウド専用です。

同じステップ数なのにモデルによってコストが異なるのはなぜですか?

ステップ数はポリシー間で比較できません。ACTは24 GBカードでバッチ8、100,000ステップがデフォルトです。GR00T N1.5は80 GBカードでバッチ1、勾配蓄積16、2,000ステップがデフォルトです。請求は、メモリフットプリントによって使用を余儀なくされたカードの料金に時間を乗じたものであり、ステップ数ではありません。

実行を開始する前に、そのコストを確認してください

5つのポリシーそれぞれに、GPUティア、実行時間、実行あたりの価格が記載されており、トレーニングバックエンドはこれらの数値が測定されたのと同じスポット市場でカードをレンタルします。

料金を確認する

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started