
実際のスポット市場GPU価格、5つのポリシーそれぞれの実行時間、アームとデモンストレーションの費用、そして静かに費用が消えていく4つの場所。
概要
- •A100 80 GBまたはH100ティアでの実行は3〜6時間かかり、費用は約4〜12 USDです。RTX 4090ティアでは2〜5時間で、費用は約1〜3 USDです。
- •vast.aiで2026年8月23日13:44 UTCに測定:RTX 4090のオンデマンドは0.13〜0.38 USD/h、A100 80 GBは0.44〜0.67、H100 80 GBは1.34〜2.34。80 GBカードは希少で、それぞれ2件と5件のシングルカード提供がありました。
- •GPUは最も安価な項目です。SO-ARM100の部品表では、リーダーとフォロワーのペアは229.88 USDで、これは24 GBティアでの77〜230回の実行に相当します。
- •50エピソードを記録する2時間の作業は、それらのエピソードが供給するトレーニング実行よりも費用がかかります。
- •費用は4つの場所で消えます:破損したデータでの実行、80Mポリシーが処理するタスクでの3Bモデル、誰も破壊しなかったGPU、そして保持できなかった結果の再実行。
- •AY-Robotsはモデルが必要とするVRAMに応じてカードのサイズを決定し、同じスポット市場でレンタルするため、実行コストは市場価格となります。
請求書には4つの項目があり、GPUは最も小さいものです
SO-100向けに視覚言語行動モデルの費用について尋ねる際、ほとんどの場合、GPUレンタルを意味します。これはカードに請求として表示される数字なので、現実味を帯びています。また、実際に機能するポリシーがどれだけかかるかを決定する4つの数字の中で、圧倒的に最も小さいものです。
| 項目 | 内容 | 機能するポリシー1つあたりの一般的な規模 |
|---|---|---|
| GPU時間 | 実行のためのカードレンタル | 1回の実行あたり1〜12 USD、3〜5回実行します |
| ロボット | サーボ、プリントフレーム、カメラ、ケーブル、電源 | 1回限り、アームあたり110〜500 EUR |
| 人件時間 | デモを記録するためにアームを操作する人 | データセットあたり1〜4時間、タスクごとに繰り返し |
| 無駄 | 不良データ、過大なモデル、忘れられたポッド | 無制限、そして唯一制御できる項目 |
以下のトレーニング時間は、5つのモデルそれぞれの論文とリポジトリから、ハードウェアコストは公開されている部品表から、プラットフォームの数値はAY-Robotsのポリシーカタログおよび料金ページから引用しています。プラットフォームが役立たない場合、この記事はその旨を明記しています。
スポット市場でのGPU時間あたりの実際のコスト
A100の1時間あたりの価格は一つではありません。vast.aiのようなマーケットプレイスでは、各ホストが独自の料金を設定しており、トレーニング実行を起動すると、その瞬間に安価で空いているマシンに割り当てられます。正直な答えは分布です。以下に、2026年8月23日13:44 UTCに測定された、単一のフルカード、オンデマンド、実際のVRAMでフィルタリングされた結果を示します。
| カード | vast.ai オンデマンド USD/h (低 / 中央値 / 高) | フルカード提供数 | vast.ai 最低入札額 | RunPod コミュニティ / セキュア | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | 提供なし |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | 提供なし |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | 提供なし |
vast.aiの公開バンドルAPIから取得した、アカウント不要の単一フルGPU (gpu_frac == 1.0) のオンデマンドオファーを、gpu_ramでフィルタリングし、真の80 GBカードのみが80 GBの行に表示されるようにしました。このフィルタリングは重要です。今回の調査では、3つの単一カードA100 SXM4オファーすべてが40 GBパーツであり、4つのA100 PCIEオファーのうち2つもそうでした。そのため、これらを1つの「A100」行にまとめた場合、ここで報告される価格は半分になっていたでしょう。Hugging Faceの列は2つの製品を組み合わせています。2.50 USD/hはNvidia A100 - large Spacesハードウェアであり、4.50 USD/hはSpacesでは提供されていないInference Endpointsでの単一H100 80 GBです。中央値はあくまで目安として扱ってください。A100 80 GBの行は2つのオファーに基づき、H100の行は5つのオファーに基づいています。また、36秒後に同じクエリを実行したところ、4090のカウントと5つの行のうち3つの最高価格が異なりました。RunPodの定価は、計画を立てる上でより安定した数値です。
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
3Bモデルが安価なカードを使用できない理由
上記のメディアンでは、4090時間とH100 80 GB時間にはおよそ6倍の差があります。高価なカードの使用を余儀なくされるのは速度ではなく、メモリです。openpiは、完全なPi0.5のファインチューンには最低70 GBが必要であるとし、NVIDIAはGR00Tには40 GB以上を推奨しています。GR00Tの数値が何を意味しないかに注意してください。そのファインチューン設定では、デフォルトで言語モデルとビジュアルエンコーダーがフリーズされ(tune_llmとtune_visualはFalse、プロジェクターと拡散ヘッドはTrue)、そのためカタログには3 Bのうち約40 Mの学習済みパラメータが記載されています。40 GBは3 Bの重みに対するオプティマイザの状態ではなく、フリーズされたバックボーンとアクティベーションです。範囲を縮小したバリアントではさらに低くなり、openpiのLoRAパスは22.5 GBを要求し4090を挙げており、NVIDIAのIsaac Lab ArenaワークフローではGR00Tのポストトレーニング用に24 GBのシングルGPUオプションが記載されています。プラットフォームは、各ベンダーが実際に実行する構成について公開している最低要件に基づいて階層化されています。pi0フローマッチングの解説記事では、そのフローマッチングのフットプリントがどこから来るのかを説明しています。
| ジョブ | アップストリームプロジェクトが要求するメモリ | ソース |
|---|---|---|
| pi0 / pi0.5 推論 | 8 GB以上、例:RTX 4090 | openpi |
| pi0 / pi0.5 LoRA ファインチューン | 22.5 GB以上、例:RTX 4090 | openpi |
| pi0 / pi0.5 フルファインチューン | 70 GB以上、例:A100 80 GBまたはH100 | openpi |
| GR00T N1.7 推論 | 16 GB以上のGPU 1基 | Isaac-GR00T |
| GR00T N1.7 ファインチューン | 40 GB以上推奨、H100またはL40ノード | Isaac-GR00T |
| GR00T ファインチューン、学習対象 | プロジェクターと拡散ヘッド;LLMとビジュアルエンコーダーはデフォルトでフリーズ | finetune_config.py |
| GR00T ポストトレーニング、縮小版 | 24 GBのGPU 1基、言語モデルはフリーズ | Isaac Lab Arena |
| SmolVLA ファインチューン | リファレンスの20,000ステップ実行にはA100 1基 | lerobot docs |
| ACT トレーニング | 11 GBのRTX 2080 Ti 1基 | ACT paper |
この表が、プラットフォームが5つのモデルを2つのティアに分割する理由です。GR00T N1.7、GR00T N1.5、およびPi0.5は、ベンダーが要求するためA100 80 GBまたはH100で実行されます。SmolVLAおよびACTは、RTX 4090または任意の24 GBカードで実行されます。これは、それが本当に十分だからです。
24 GBカードでGR00TまたはPi0.5を実行しても、開始直後に失敗することはありません。ベースチェックポイントをダウンロードし、データセットインデックスを構築し、最初の順伝播を開始しますが、数百ステップでCUDAメモリ不足エラーにより停止します。ダウンロードとセットアップに費用を払ったのに、何も得られません。解決策:トレーニング中のメモリ不足。
5つのモデルが実際にどれくらいの時間実行されるか
実行時間はコストのもう半分です。1時間あたり2.00 USDという料金は、ジョブが40分であれば関係なく、40時間であれば破滅的です。これらはAY-Robotsが実際にトレーナーに送信するデフォルト設定であり、各ティアの実行ウィンドウとコストが含まれています。
| ポリシー | GPUティア | デフォルトの最大ステップ数 | デフォルトのバッチサイズ (勾配蓄積) | 実行ウィンドウ | 実行あたりのコスト |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

これらの実行ウィンドウはどこから来るのか
- SmolVLA: lerobotのドキュメントによると、20,000ステップの実行には単一のA100で約4時間かかります。プラットフォームは、より安価な24 GBティアで同じ20,000ステップを実行するため、一律4時間ではなく、幅のある時間枠となります。
- ACT: オリジナルのALOHA論文では、80Mパラメータモデルの場合、単一の11 GB RTX 2080 Tiで約5時間と報告されています。4090は数世代新しいですが、プラットフォームは100,000ステップを予算としているため、時間枠は同じ範囲に収まります。
- GR00T: NVIDIAのN1.6世代のリファレンスワークフローでは、8枚のL40Sカードでバッチ24で20,000ステップに約4~8時間、単一のAda 6000でバッチ16で30,000ステップに2~3時間とされています。数時間での3B VLAのシングルカードファインチューニングは通常であり、楽観的ではありません。
- Pi0.5: openpiは実測時間を公表していませんが、フルファインチューンの70 GBの最低要件を公表しており、これによりカードとレートが特定されます。
支払っていない金額について少し考えてみましょう。GR00T N1の論文によると、2.2Bモデルの事前学習には、最大1024個のGPUクラスタで、事前学習バッチサイズ16,384、200,000勾配ステップで、約50,000 H100 GPU時間かかると報告されています。上記の測定値である1時間あたり1.34~2.34 USDで計算すると、これは67,000~117,000 USD相当のレンタル計算資源に相当します。SmolVLAの論文では、そのプロジェクトは481のコミュニティデータセット、22.9Kエピソード、10.6Mフレームにわたって約30,000 GPU時間とされています。あなたはダウンロードの価格でそのすべてを継承します。あなたの8 USDは最後の20,000ステップを購入するものです。なぜVLAはこのように構築されるのかで、その分割について説明しています。
アーム:GPU費用をはるかに上回る一度限りのコスト
トレーニングの実行費用はランチよりも安価です。ロボットはそうではありません。だからこそSO-100が重要なのです。これは、模倣学習ツールチェーンが実際にサポートする中で最も安価なアームだからです。
| アーム | サーボ | 電圧 | 部品費用 | AY-Robotsでのサポート |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | フル、リファレンスアーム |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | フル |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | 互換性あり |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | 互換性あり |
SO-ARM100リポジトリにある上位の部品表はより詳細で、お住まいの地域と照らし合わせて確認する価値があります。そのParts For Two Armsリストは、リーダーとフォロワーのセットアップで合計229.88 USDまたは226.30 EURです。また、そのParts for One Follower Armリストは合計121.94 USDまたは124.30 EURです。1個あたり13.89 USDのSTS3215サーボ6個で83.34 USDとなり、この121.94 USDのうちの大部分を占めるため、サーボがアームの主要部品です。SmolVLAまたはACTの実行1回あたり1から3 USDで、1組のアームは77回から230回のトレーニング実行に相当します。まだ選択中であれば、SO-100とSO-101の比較が重要な比較です。この2つは非常に似ているため、決定は機能ではなく入手可能性に基づきます。
STS3215には7.4 Vと12 Vのバリアントがあります。リポジトリには、12 V部品には5 V電源の代わりに12 V 5 A電源も必要であると記載されており、両者は互換性がありません。7.4 Vサーボに12 Vを供給すると破損し、サーボ6個はフォロワーアームの部品費用の3分の2を占めます。最初の電源投入前に、すべてのサーボのラベルを確認してください。サーボがすでに異常な動作をする場合:サーボが応答しない、アームが痙攣してから垂れ下がる。
人件費:誰もスプレッドシートに記載しない項目
これは、コストに関する議論を根底から覆す数字です。デモンストレーションの記録は、人がロボットアームをリアルタイムで、1エピソードずつ動かす作業です。バッチ処理も秒単位でのレンタルもできません。 LeRobot dataset レコーダーは、計算を容易にするデフォルト設定で出荷されており、これら3つはすべて DatasetRecordConfig で確認されています。1 episode あたり60秒、シーンのリセットに60秒、50エピソードです。以下の金額の列は、1時間あたりの人件費を15 USDと仮定していますが、これはプラットフォームの数値ではなく仮定です。ご自身のレートに置き換えてください。重要なのは比率です。
- 1実際に請求されるデフォルト設定でデータセットを記録する
これは2026年8月3日時点のPyPI上のバージョンであるlerobot 0.6.1です。CLIの形式に注意してください。記録は、古い
python -m lerobot.scripts.recordモジュールパスではなく、lerobot-recordコンソールエントリーポイント(lerobot.scripts.lerobot_record)を介して実行されます。AY-Robotsは0.5.1をターゲットとしており、0.5.1のホイールも同じlerobot-recordおよびlerobot-trainエントリーポイントを宣言しているため、以下の形式は両方で安定しています。3つのタイミングフラグはアップストリームのデフォルトであるため、これは次の表の計算が前提とするコマンドでもあります。bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2GPUを1分でもレンタルする前に、記録した内容を確認する
データセットの検査には1時間あたり0 USDの費用がかかります。損失曲線から同じ問題を発見すると、H100ティアで1時間あたり2.00 USDかかり、4時間遅れて知ることになります。データセットをプッシュしてLeRobotビューアで確認するか、AY-Robotsのデータセットディレクトリを参照してください。
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3トレーニングを実行し、チェックポイントがポッドよりも長く存続することを確認する
レンタルされたマシンは定義上、一時的なものであるため、実行中にチェックポイントを永続的な場所に書き込む必要があります。支払ったものを保持するかどうかは、2つのフラグで決まります。
--save_freqはデフォルトで20,000ステップなので、デフォルトの20,000ステップのSmolVLA実行では、実行がすでに終了したときに最初のチェックポイントが書き込まれます。中断可能なものをレンタルする前に、これを下げてください。--save_checkpoint_to_hubは--policy.repo_idを必要とし、lerobot 0.5.1には存在しないため、そのバージョンでは出力ディレクトリを自分でマシンからコピーする必要があります。以下のバッチサイズはアップストリームのドキュメントの例です。AY-RobotsのフォームはSmolVLAに2を送信し、チェックポイントが出現するたびにオブジェクトストレージに書き込みます。bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| エピソード | 60秒での記録 | 60秒でのリセット | 実時間 | 再記録20%増 | 人件費1時間あたり15 USD |
|---|---|---|---|---|---|
| 30、SmolVLAの最小値 | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50、その他の4つの最小値 | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100、十分なデータセット | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
右側の列と、実行にかかる1~12 USDのコストを比較してください。この仮定されたレートでは、キャリブレーション、カメラ設定、および破棄するエピソードを除くと、50エピソードのデータセットは、トレーニングにかかるコストの2~7倍の記録コストがかかります。だからこそ、は直接的な金銭的価値を持つのです。lerobotガイドでは、オブジェクトの場所ごとに10エピソード、合計で少なくとも50エピソードを推奨しています。SmolVLAのドキュメントでは、同じタスクの25エピソード版では不十分であったと報告されています。
実際にお金が失われる場所
1. 決して機能しないデータでの実行
2つのカメラストリームが入れ替わったデータセットでの20,000ステップのGR00T実行は、クリーンなデータセットでの実行と同じコストがかかり、同じ時間がかかり、見た目は問題ない損失曲線が生成されます。失敗は数時間後にアーム上で現れます。は時間単位で課金され、診断は日単位で課金されます。記憶しておくべき2つの症状:は通常、観測値がタスクに必要な情報を持っていないことを意味し、は、データセットのバリエーションが思ったよりも少なかったことを意味します。
2. 固定カメラタスクに基盤モデルの価格を支払う
ACTは約80Mのパラメータを持ち、1つのタスクの50回のデモンストレーションからスクラッチで学習するように設計されています。GR00T N1.7は約3Bのパラメータを持ち、事前学習済みのバックボーンを備えています。固定されたカメラ、固定されたテーブル、1つのオブジェクトの場合、80Mモデルは頻繁に目標を達成し、152 msではなく約20 msでアクションステップを実行し、4から12 USDではなく1から3 USDのコストで実行できます。高価なモデルに12 USDを費やす前に、安価なモデルが機能するかどうかを3 USDで確認してください。 ACTとSmolVLAの比較とGR00T N1.7とPi0.5の比較は、それぞれが適切な答えでなくなる場所を示しています。モデルアリーナには85のモデルと332のベンチマーク結果があります。
3. 忘れ去られたGPU
防ぐのが最も安価で、最も犯しやすい間違いです。金曜日にデバッグのために起動されたインスタンスは、実際の実行と同じ料金で週末を通して課金されます。
| カード | スナップショットの中央値レート | 24時間アイドル | 7日間アイドル | その価値 |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | SmolVLAまたはACTの実行約27回分(2 USD) |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | GR00Tの実行約12回分(8 USD) |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | GR00Tの実行約38回分(8 USD) |
AY-Robotsでは、この障害は推論用に設計されており、推論APIによってプロビジョニングされたポッドはアイドル状態のウォッチドッグを搭載し、アイドル期間後に自己破壊します。カードを自分でレンタルする場合、そのウォッチドッグはカレンダーのリマインダーとなります。
4. 同じ答えに二度支払う
GR00Tのファインチューニングのエントリポイントは、シードを公開しないtyro CLIです。これはプラットフォームの制限ではなく、アップストリームのツールです。つまり、gr00t/configs/finetune_config.pyにはシードフィールドがなく、リポジトリ自身のトレーニングのヒントでは、画像拡張が非決定論的であるため、実行結果が5〜6パーセント変動すると警告されています。lerobotは0.5.1と0.6.1の両方でシード1000をデフォルトとしているため、ACT、SmolVLA、Pi0.5の実行は、少なくとも同じ初期化とデータ順序から再実行できます。これはGPU上でのビット単位で同一の重みを保証するものではありませんが、再実行と新しい実験との違いです。GR00Tの実行で機能するポリシーが生成され、チェックポイントを保持していなかった場合、あなたが追い求めていた差以上に異なる可能性のある結果に対して全額を支払うことになります。支払ったチェックポイントを失う2つ目の方法があります。CLIはデフォルトで--save-total-limit 5となっており、これは古いチェックポイントが削除される前に保持されるチェックポイントの最大数として文書化されています。ストレージは数セントです。再実行には4〜12 USDと6時間かかります。
上記の入札フロアはオンデマンド料金の一部であり、vast.aiは入札システムによってクライアントのコストを50%以上削減できると述べています。ただし、vast.ai自身の言葉を借りれば、割り込み可能なインスタンスは、他のユーザーがより高い入札をした場合や、同じリソースに対してオンデマンドレンタルが作成された場合、いつでも一時停止される可能性があり、その一時停止は「実行中のすべてのプロセスを停止」します。オンデマンドは常に優先されます。数百ステップごとにチェックポイントを書き込む実行には問題ありませんが、最後に書き込む実行では完全に損失となります。これはまさにデフォルト設定が提供するものです。Isaac-GR00T CLIは--save-steps(デフォルト1000)ごとに書き込みますが、lerobotの--save_freqはデフォルトで20,000ステップなので、デフォルトのSmolVLA実行では、終了時に一度だけチェックポイントが作成されます。これを下げるか、入札しないでください。AY-Robotsのトレーニングフォームでは、GR00Tの調整項目がsaveStepsとして公開されています。
- 最も低い時間単価です。
- イメージ、CUDAバージョン、lerobotまたはIsaac-GR00Tのリビジョン、およびすべてのフラグを完全に制御できます。
- 実行が一時停止に耐えられるほど頻繁にチェックポイントを作成する場合、割り込み可能な入札は料金を半額にします。
- 何も抽象化されていないため、実行が異常な動作をした場合でもその理由を確認できます。
- セットアップはGPU料金で請求されます。ドライバー、依存関係、数ギガバイトのベースチェックポイント、データセットのダウンロードはすべて、トレーニングと同じ時間単価で費用がかかります。
- 入札で負けた割り込み可能なインスタンスは一時停止され、そのプロセスは強制終了されます。保存されていない実行は無駄な費用となり、lerobotのデフォルトでは最初のチェックポイントが20,000ステップで書き込まれます。
- ポッドは自動的に破棄されません。上記のアイドル状態の表は、忘れられた場合の請求額です。
- 単一のフル80 GBカードの供給は薄いです。この読み取りでは、A100 80 GBが2つ、H100 80 GBのフルカードが5つの提供がありました。リストも頻繁に変動するため、表示されている最安値と実際にレンタルできる価格は同じではありません。
- インフラに費やす1時間は、ポリシーが機能するかどうかを決定するエピソードを記録しない1時間です。
自分でやるか、プラットフォームにカードを借りさせるか
自分でマシンを選び、環境を構築し、ポッドを破棄します。時間料金は上記の市場レートであり、それ以外はすべてあなたの時間です。
- モデルが必要とするVRAMに合ったカードを見つけます。ACTとSmolVLAには24 GB、GR00TとPi0.5には80 GBです。
- 実行が一時停止に耐えられない場合はオンデマンドでレンタルし、頻繁にチェックポイントを作成する場合は中断可能にします。
- ツールチェーンをインストールします。ACT、SmolVLA、Pi0.5にはlerobotを、GR00Tには独自のtyroランチャーを備えたIsaac-GR00Tリポジトリをインストールします。
- 必要に応じてデータセットを変換します。LeRobot v3.0データセットはGR00Tローダーをクラッシュさせるため、v2.1に変換する必要があります。
- 起動し、損失を監視し、チェックポイントが書き込まれたら耐久性のある場所にプッシュします。
- インスタンスを破棄し、その後、破棄したことを確認します。
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>GR00Tの1回の実行にかかる現実的なコスト:H100 80 GBで1時間あたり1.34から2.34 USDで3から6時間かかるため、4から14 USDになります。これに、課金対象となる20から40分のセットアップ時間と、あなたの時間が加わります。
フォームでモデル、データセット、ハイパーパラメータを選択します。バックエンドは、モデルが必要とするVRAMサイズのスポットGPUをレンタルし、トレーナーを実行し、チェックポイントをオブジェクトストレージに書き込みます。
- トレーニングマトリックスで組み合わせを選択します。5つのモデル、4つのアーム、セルごとに1つのガイドがあります。
- データセットを指定します。デスクトップクライアントで記録したもの、Hugging FaceのリポジトリID、または自分のマシンからのものです。
- デフォルトを受け入れるか、調整します。上記の表は、実際にトレーナーに送信される内容です。
- バックエンドが必要なVRAMに基づいてカードを選択するため、GPUを探す必要はありません。
- チェックポイントは書き込まれるとオブジェクトストレージに保存されるため、中断された実行は失われた実行ではありません。
| ティア | モデル | 実行時間 | 実行あたりのコスト |
|---|---|---|---|
| A100 80 GBまたはH100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3から6時間 | 約4から12 USD |
| RTX 4090または任意の24 GBカード | SmolVLA, ACT | 2から5時間 | 約1から3 USD |
できないこと:悪いデータセットを良くすること、GR00Tにこれまでなかったシードを与えること、または以下に説明するレイテンシ制限を削除すること。GPUの選定、環境構築、破棄し忘れたポッドの心配をなくします。仕組みはトレーニングドキュメントに記載されています。
プラットフォームの課金方法とカードの選択方法
ロジックは意図的に単純です。各モデルはカタログでGPUティアを宣言します。バックエンドは必要なVRAMを取得し、上記で測定された同じスポット市場で一致するカードをレンタルします。そのため、提示されるコストは価格ではなく範囲です。GR00TとPi0.5は、40 GBと70 GBという最低要件があるため、ここではクラウド専用です。SmolVLAとACTは、ご自身の24 GBカードでローカルに実行することもでき、その場合クラウド費用はゼロで、電気代はご自身の負担となります。

1つの設定には注意が必要です。勾配蓄積はGR00Tのどちらのバリアントにも実際に適用されるため、これを増やすと、同じカードでより大きな実効バッチサイズが得られます。Pi0.5とSmolVLAには全く適用されません。lerobot 0.5.1のトレーニング設定には勾配蓄積オプションがないため、このフィールドを16に設定しても費用はかからず、何も得られません。キューに入ったジョブが開始されない場合、キューで停止したジョブのページで確認すべき事項が説明されています。実行開始前にデータセットが拒否された場合、それはほとんどの場合v3.0形式の問題です。
公衆インターネット経由でポリシーを提供するレンタルGPUは、すでに1アクションステップあたり20〜485 msの制御ループにラウンドトリップを追加します。低速なピックアンドプレースには適していますが、高速な反応動作には適していません。クラウド推論はチェックポイントの評価には優れていますが、本番環境での操作には不向きです。タスクに速度が必要な場合、計算リソースはサーボの近くに配置する必要があり、それはこの記事では解消できないコストです。推論レイテンシを参照してください。
最初の動作ポリシーのための予算例
何もない状態から始める、これら4つのラインすべてを合わせて。GPUの合計は3〜5回の実行を想定しています。最初の実行でパイプラインが機能することを確認し、2番目の実行でデータの問題を露呈させ、3番目または4番目の実行が最終的に採用されるものです。
| 項目 | リーンパス | 快適パス |
|---|---|---|
| アーム | SO-100 フォロワーのみ、BOMで121.94 USD | リーダーとフォロワー、BOMで229.88 USD |
| モデル | SmolVLA または ACT、24 GBティア | GR00T N1.7、A100 80 GB または H100ティア |
| 記録されたエピソード数 | 30、SmolVLAの最小値 | 50から100 |
| 記録にかかる人間の時間 | 約1時間12分 | 2から4時間 |
| 1回の実行コスト | 1から3 USD | 4から12 USD |
| 動作するまでの実行回数 | 3から5 | 3から5 |
| GPU総費用 | 3から15 USD | 12から60 USD |
| 請求書で最大の項目 | アーム、次にあなたの時間 | アーム、次にあなたの時間 |
このサイズのロボットでもパターンは同じです。計算は誤差の範囲であり、ハードウェアは実際の1回限りのコストであり、人件費は継続的な費用です。何も購入する前にトレーニング部分をテストするには、ハードウェア不要のエントリーポイント を使用すると、モデルを比較し、アームなしでGPUをレンタルできます。そして、ライブアーム は、サインアップなしでブラウザから操作できる物理的なSO-100です。パイプライン全体をエンドツーエンドで実行するには、完全なSO-100ガイド がセットアップ、テレオペレーション およびトレーニングをカバーしており、最初のポリシーをトレーニングする はその短縮版です。

VLAのファインチューニング1回あたりの総コストはいくらですか?▾
GR00T N1.7、GR00T N1.5、またはPi0.5をA100 80 GBまたはH100ティアで実行する場合、約4~12 USD(1時間あたり1.20~2.00 USDで3~6時間)。SmolVLAまたはACTをRTX 4090ティアで実行する場合、約1~3 USD(1時間あたり0.30~0.60 USDで2~5時間)です。カードを自分でレンタルする場合も、セットアップ時間を考慮するとトレーニング料金で請求されるため、同じ範囲になります。
H100はA100 80 GBよりも費用を払う価値がありますか?▾
単一のSO-100ポリシーの場合、通常はそうではありません。どちらもGR00TとPi0.5が必要とするメモリ要件を満たしており、2026年8月23日の時点では、A100 80 GBは1時間あたり0.44 USDから、H100 80 GBは1.34 USDからでした。H100はより早く完了するため、料金の一部は時間の短縮として戻ってきますが、この規模の実行では合計コストは依然として高くなります。H100の真の利点は可用性です。その市場ではH100 80 GBの単一オファーが5件に対し、A100 80 GBは2件しかなく、レンタルできないカードには価格がありません。
ポリシーが実際に機能するまでに何回実行が必要ですか?▾
3回から5回を計画してください。1回目でパイプラインが正しく配線されていることを確認します。2回目では、途中で停止したカメラストリームのようなデータセットの問題がよく明らかになります。3回目または4回目が最終的に採用するものです。
SmolVLAやACTをレンタルではなく自分のGPUでトレーニングできますか?▾
はい、可能です。どちらもAY-Robotsでローカルにサポートされており、24 GBに快適に収まります。オリジナルのACT論文では、11 GBのRTX 2080 Tiで80Mモデルを約5時間でトレーニングしました。GR00TとPi0.5は、ベンダーが文書化したファインチューニングの最低要件が40 GBと70 GBであり、市場で最大の消費者向けカードが32 GBのRTX 5090であるため、ここではクラウド専用です。
同じステップ数なのにモデルによってコストが異なるのはなぜですか?▾
ステップ数はポリシー間で比較できません。ACTは24 GBカードでバッチ8、100,000ステップがデフォルトです。GR00T N1.5は80 GBカードでバッチ1、勾配蓄積16、2,000ステップがデフォルトです。請求は、メモリフットプリントによって使用を余儀なくされたカードの料金に時間を乗じたものであり、ステップ数ではありません。
実行を開始する前に、そのコストを確認してください
5つのポリシーそれぞれに、GPUティア、実行時間、実行あたりの価格が記載されており、トレーニングバックエンドはこれらの数値が測定されたのと同じスポット市場でカードをレンタルします。
料金を確認するSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started