
Reale Spotmarkt-GPU-Preise, wie lange jede der fünf Policies läuft, was der Arm und die Demonstrationen kosten und die vier Stellen, an denen das Geld still und leise verschwindet.
Die Kurzfassung
- •Ein Durchlauf auf der A100 80 GB oder H100 Stufe dauert 3 bis 6 Stunden und kostet etwa 4 bis 12 USD. Auf der RTX 4090 Stufe sind es 2 bis 5 Stunden und etwa 1 bis 3 USD.
- •Gemessen auf vast.ai um 13:44 UTC am 23. August 2026: eine volle RTX 4090 on demand für 0.13 bis 0.38 USD/h, eine A100 80 GB für 0.44 bis 0.67, eine H100 80 GB für 1.34 bis 2.34. Volle 80 GB Karten sind rar, jeweils zwei und fünf Einzelkartenangebote.
- •Die GPU ist der günstigste Posten. Die Stückliste des SO-ARM100 beziffert ein Leader-plus-Follower-Paar auf 229.88 USD, was 77 bis 230 Durchläufen auf der 24 GB Stufe entspricht.
- •Zwei Stunden, in denen eine Person 50 Episoden aufzeichnet, kosten mehr als der Trainingslauf, den diese Episoden speisen.
- •Geld verschwindet an vier Stellen: Läufe mit fehlerhaften Daten, 3B-Modelle für Aufgaben, die eine 80M-Policy bewältigt, GPUs, die niemand zerstört hat, und Wiederholungen eines Ergebnisses, das Sie nicht gespeichert haben.
- •AY-Robots dimensioniert die Karte nach dem vom Modell benötigten VRAM und mietet sie auf demselben Spotmarkt, sodass die Laufkosten den Marktkosten entsprechen.
Die Rechnung hat vier Posten, und die GPU ist der kleinste davon
Wenn Leute fragen, was es kostet, ein Vision-Sprach-Aktionsmodell für einen SO-100 zu feinabzustimmen, meinen sie fast immer die GPU-Miete. Das ist die Zahl, die als Belastung auf einer Karte erscheint, also diejenige, die sich real anfühlt. Sie ist auch, mit großem Abstand, die kleinste der vier Zahlen, die entscheiden, was eine funktionierende Policy tatsächlich kostet.
| Posten | Was es ist | Typische Größe für eine funktionierende Policy |
|---|---|---|
| GPU-Zeit | Miete einer Karte für den Durchlauf | 1 bis 12 USD pro Durchlauf, und Sie werden 3 bis 5 durchführen |
| Der Roboter | Servos, gedruckter Rahmen, Kameras, Kabel, Stromversorgung | einmalig, 110 bis 500 EUR pro Arm |
| Menschliche Arbeitsstunden | eine Person, die den Arm steuert, um Demos aufzuzeichnen | 1 bis 4 Stunden pro Datensatz, wiederholt pro Aufgabe |
| Verschwendung | schlechte Daten, überdimensionierte Modelle, vergessene Pods | unbegrenzt, und der einzige Posten, den Sie kontrollieren |
Die unten angegebenen Trainingszeiten stammen aus den eigenen Papieren und Repositories der fünf Modelle, die Hardwarekosten aus der veröffentlichten Stückliste, die Plattformzahlen von den AY-Robots Richtlinienkatalog und Preisseite. Wo die Plattform nicht hilft, wird dies in diesem Artikel erwähnt.
Was eine GPU-Stunde auf dem Spotmarkt tatsächlich kostet
Es gibt keinen einzelnen Preis für eine A100-Stunde. Auf einem Marktplatz wie vast.ai legt jeder Host seinen eigenen Tarif fest, und der Trainingslauf, den Sie starten, landet auf der Maschine, die in diesem Moment günstig und frei ist. Die ehrliche Antwort ist eine Verteilung. Hier ist sie, gemessen am 23. August 2026 um 13:44 UTC: einzelne volle Karten, auf Abruf, gefiltert nach echtem VRAM.
| Karte | vast.ai On-Demand USD/h (niedrig / Median / hoch) | Angebote für ganze Karten | vast.ai Gebotsuntergrenze | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | nicht angeboten |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | nicht angeboten |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 als Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 als Endpunkt |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | nicht angeboten |
On-demand-Angebote für eine einzelne vollständige GPU (gpu_frac == 1.0) von der öffentlichen vast.ai Bundle-API, die kein Konto benötigt, gefiltert nach gpu_ram, sodass nur echte 80-GB-Karten in den 80-GB-Zeilen landen. Dieser Filter ist wichtig: Bei dieser Abfrage waren alle drei Einzelkarten-A100 SXM4-Angebote 40-GB-Teile, ebenso wie zwei der vier A100 PCIE-Angebote. Eine Zusammenfassung in einer einzigen "A100"-Zeile hätte den hier angegebenen Preis halbiert. Die Hugging Face-Spalte mischt zwei Produkte: 2.50 USD/h ist die Nvidia A100 - large Spaces-Hardware und 4.50 USD/h ist eine einzelne H100 80 GB unter Inference Endpoints, die Spaces nicht anbietet. Betrachten Sie die Mediane als indikativ: Die A100 80 GB-Zeile basiert auf zwei Angeboten und die H100-Zeile auf fünf, und die identische Abfrage 36 Sekunden später lieferte eine andere 4090-Anzahl und einen anderen Höchstpreis in drei der fünf Zeilen. Die RunPod-Listenpreise sind die stabilere Zahl, mit der man planen kann.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Warum die 3B-Modelle die günstige Karte nicht nutzen können
Eine 4090-Stunde und eine H100 80 GB-Stunde unterscheiden sich bei den oben genannten Medianwerten um etwa das Sechsfache. Was Sie auf die teure Karte zwingt, ist nicht die Geschwindigkeit, sondern der Speicher. openpi setzt die Untergrenze für ein vollständiges Pi0.5 Fine-Tuning bei 70 GB an, und NVIDIA empfiehlt 40 GB oder mehr für GR00T. Beachten Sie, was die GR00T-Zahl nicht ist. Die Fine-Tune-Konfiguration friert das Sprachmodell und den visuellen Encoder standardmäßig ein (tune_llm und tune_visual sind False, der Projektor und der Diffusionskopf True), weshalb der Katalog etwa 40 Millionen trainierte Parameter von 3 Milliarden auflistet. Die 40 GB sind kein Optimizer-Zustand für 3 Milliarden Gewichte, sondern das eingefrorene Backbone plus Aktivierungen. Varianten mit reduziertem Umfang fallen niedriger aus: openpis LoRA-Pfad benötigt 22,5 GB und nennt die 4090, und NVIDIAs Isaac Lab Arena-Workflow listet eine 24 GB Single-GPU-Option für GR00T nach dem Training auf. Die Plattform staffelt sich nach der Untergrenze, die jeder Anbieter für die tatsächlich ausgeführte Konfiguration veröffentlicht. Der pi0 Flow-Matching-Bericht erklärt, woher dieser Flow-Matching-Fußabdruck stammt.
| Aufgabe | Speicher, den das Upstream-Projekt anfordert | Quelle |
|---|---|---|
| pi0 / pi0.5 Inferenz | more than 8 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 LoRA Fine-Tuning | more than 22.5 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 vollständiges Fine-Tuning | more than 70 GB, example A100 80 GB or H100 | openpi |
| GR00T N1.7 Inferenz | 1 GPU with 16 GB or more | Isaac-GR00T |
| GR00T N1.7 Fine-Tuning | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| GR00T Fine-Tuning, was trainiert wird | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| GR00T Nach-Training, reduziert | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| SmolVLA Fine-Tuning | single A100 for the reference 20,000-step run | lerobot docs |
| ACT Training | a single 11 GB RTX 2080 Ti | ACT paper |
Diese Tabelle erklärt, warum die Plattform die fünf Modelle in zwei Stufen unterteilt. GR00T N1.7, GR00T N1.5 und Pi0.5 laufen auf A100 80 GB oder H100, weil dies von den Anbietern gefordert wird. SmolVLA und ACT laufen auf einer RTX 4090 oder jeder 24 GB Karte, weil das tatsächlich ausreicht.
Ein GR00T- oder Pi0.5-Lauf auf einer 24 GB-Karte schlägt nicht sofort fehl. Er lädt den Basis-Checkpoint herunter, erstellt den Datensatzindex, startet den ersten Forward-Pass und stirbt nach einigen hundert Schritten mit einem CUDA-Out-of-Memory-Fehler. Sie haben für den Download und die Einrichtung bezahlt und nichts erhalten. Lösungen: Speicherüberlauf während des Trainings.
Wie lange jedes der fünf Modelle tatsächlich läuft
Die Laufzeit ist die andere Hälfte der Kosten: 2.00 USD pro Stunde sind irrelevant, wenn der Auftrag 40 Minuten dauert, und ruinös, wenn er 40 Stunden dauert. Dies sind die Standardwerte, die AY-Robots tatsächlich an den Trainer sendet, zusammen mit dem Laufzeitfenster und den Kosten für jede Stufe.
| Richtlinie | GPU-Stufe | Standard maximale Schritte | Standard-Batch (Grad-Akkumulation) | Laufzeitfenster | Kosten pro Lauf |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, Akkumulation 1, angewendet | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, Akkumulation 16, angewendet | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, Akkumulation 16, keine Auswirkung | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, Akkumulation 8, keine Auswirkung | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, Akkumulation 1 | 2 to 5 h | 1 to 3 USD |

Woher diese Laufzeitfenster stammen
- SmolVLA: Die lerobot-Dokumentation besagt, dass 20.000 Schritte auf einer einzelnen A100 ungefähr 4 Stunden dauern. Die Plattform führt dieselben 20.000 Schritte auf der günstigeren 24-GB-Stufe aus, daher ein Zeitfenster statt pauschal 4 Stunden.
- ACT: Das ursprüngliche ALOHA-Paper berichtet von etwa 5 Stunden auf einer einzelnen 11 GB RTX 2080 Ti für ein Modell mit 80 Millionen Parametern. Eine 4090 ist mehrere Generationen neuer, aber die Plattform budgetiert 100.000 Schritte, sodass das Zeitfenster am selben Punkt landet.
- GR00T: NVIDIAs Referenz-Workflow für die N1.6-Generation gibt ungefähr 4 bis 8 Stunden für 20.000 Schritte bei Batch 24 auf acht L40S-Karten und 2 bis 3 Stunden für 30.000 Schritte bei Batch 16 auf einer einzelnen Ada 6000 an. Das Fine-Tuning eines 3B VLA auf einer einzelnen Karte in wenigen Stunden ist normal, nicht optimistisch.
- Pi0.5: openpi veröffentlicht keine tatsächliche Laufzeit, aber es veröffentlicht die 70 GB Untergrenze für ein vollständiges Fine-Tuning, was die Karte und damit die Rate festlegt.
Es lohnt sich, einen Moment innezuhalten und über die Kosten nachzudenken, die Sie nicht tragen. Das GR00T N1-Paper berichtet von ungefähr 50.000 H100 GPU-Stunden, um das 2.2B-Modell vorzutrainieren, auf einem Cluster von bis zu 1024 GPUs, mit einer Pretraining-Batch-Größe von 16.384 für 200.000 Gradientenschritte. Bei den oben gemessenen 1.34 bis 2.34 USD pro Stunde entspricht das einer Größenordnung von 67.000 bis 117.000 USD an gemieteter Rechenleistung. Das SmolVLA-Paper beziffert sein Projekt auf ungefähr 30.000 GPU-Stunden über 481 Community-Datensätze, 22.9K Episoden und 10.6M Frames. Sie erben all dies zum Preis eines Downloads; Ihre 8 USD kaufen die letzten 20.000 Schritte. Warum VLAs so aufgebaut sind behandelt diese Aufteilung.
Der Arm: eine einmalige Investition, die die GPU-Kosten in den Schatten stellt
Ein Trainingslauf kostet weniger als ein Mittagessen. Der Roboter nicht. Deshalb ist der SO-100 wichtig: Er ist der günstigste Arm, den die gesamte Imitationslernen Toolchain tatsächlich unterstützt.
| Arm | Servos | Spannung | Teilekosten | Unterstützung auf AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | vollständig, Referenzarm |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | vollständig |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | kompatibel |
| LeKiwi | Feetech STS3215 Arm, Fahrgestell | 7.4 V Arm, 12 V Basis | 400 to 500 EUR | kompatibel |
Die vorgelagerte Stückliste im SO-ARM100 Repository ist detaillierter und sollte mit Ihrer Region abgeglichen werden: Die Liste Teile für zwei Arme beläuft sich auf insgesamt 229.88 USD oder 226.30 EUR für ein Leader-plus-Follower-Setup, und die Liste Teile für einen Follower-Arm beläuft sich auf insgesamt 121.94 USD oder 124.30 EUR. Sechs STS3215 Servos zu je 13.89 USD machen 83.34 von diesen 121.94 aus, die Servos sind also der Arm. Bei 1 bis 3 USD pro SmolVLA oder ACT Lauf ist ein Armpaar zwischen 77 und 230 Trainingsläufe wert. Wenn Sie noch am Auswählen sind, ist SO-100 gegen SO-101 der Vergleich, der zählt, denn die beiden sind sich so ähnlich, dass die Entscheidung eher von der Verfügbarkeit als von der Leistungsfähigkeit abhängt.
Der STS3215 wird in einer 7.4 V und einer 12 V Variante geliefert; das Repository weist darauf hin, dass das 12 V Teil auch eine 12 V 5 A Versorgung anstelle der 5 V Versorgung benötigt, sodass die beiden nicht austauschbar sind. Das Einspeisen von 12 V in 7.4 V Servos zerstört diese, und sechs Servos machen zwei Drittel der Teilekosten eines Follower-Arms aus. Überprüfen Sie das Etikett jedes Servos vor der ersten Inbetriebnahme. Wenn Servos bereits seltsam reagieren: Servo reagiert nicht, Arm zuckt und sackt dann ab.
Menschliche Arbeitsstunden: die Zeile, die niemand in die Tabelle einträgt
Dies ist die Zahl, die die Kostendiskussion auf den Kopf stellt. Das Aufzeichnen von Demonstrationen bedeutet, dass eine Person einen Roboterarm bewegt, eine Episode nach der anderen, in Echtzeit. Es gibt keine Stapelverarbeitung und keine sekundengenaue Miete. Der LeRobot-Datensatz Rekorder wird mit Standardeinstellungen geliefert, die die Berechnung vereinfachen, alle drei bestätigt in DatasetRecordConfig: 60 Sekunden pro Episode, 60 Sekunden zum Zurücksetzen der Szene, 50 Episoden. Die Spalte für die Kosten unten geht von 15 USD für eine Stunde Arbeitszeit aus, was eine Annahme und keine Plattformzahl ist. Ersetzen Sie Ihren eigenen Satz; das Verhältnis ist der entscheidende Punkt.
- 1Zeichnen Sie den Datensatz mit den Standardeinstellungen auf, die Ihnen tatsächlich in Rechnung gestellt werden
Dies ist lerobot 0.6.1, die Version auf PyPI vom 3. August 2026. Beachten Sie die CLI-Form: Die Aufzeichnung erfolgt über den Konsoleneinstiegspunkt
lerobot-record(lerobot.scripts.lerobot_record), nicht über den alten Modulpfadpython -m lerobot.scripts.record. AY-Robots zielt auf 0.5.1 ab, und das 0.5.1-Wheel deklariert dieselben Einstiegspunktelerobot-recordundlerobot-train, sodass die unten gezeigte Form über beide Versionen hinweg stabil ist. Die drei Zeit-Flags sind die Upstream-Standardwerte, daher ist dies auch der Befehl, den die Berechnung in der nächsten Tabelle annimmt.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Sehen Sie sich an, was Sie aufgenommen haben, bevor Sie eine einzige GPU-Minute mieten
Die Inspektion eines Datensatzes kostet null USD pro Stunde. Das Entdecken desselben Problems anhand einer Verlustkurve kostet 2.00 USD pro Stunde auf der H100-Stufe und sagt es Ihnen vier Stunden zu spät. Laden Sie den Datensatz hoch und überprüfen Sie ihn im LeRobot-Viewer, oder durchsuchen Sie das AY-Robots Datensatzverzeichnis.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Trainieren Sie und stellen Sie sicher, dass der Checkpoint den Pod überlebt
Eine gemietete Maschine ist per Definition temporär, daher sollten Sie während des Laufs Checkpoints an einem dauerhaften Ort speichern. Zwei Flags entscheiden, ob Sie behalten, wofür Sie bezahlt haben.
--save_freqist standardmäßig auf 20.000 Schritte eingestellt, sodass ein standardmäßiger 20.000-Schritte-SmolVLA-Lauf seinen ersten Checkpoint schreibt, wenn der Lauf bereits beendet ist; senken Sie diesen Wert, bevor Sie etwas Unterbrechbares mieten.--save_checkpoint_to_huberfordert--policy.repo_idund existiert nicht in lerobot 0.5.1, daher müssen Sie in dieser Version das Ausgabeverzeichnis selbst von der Maschine kopieren. Die unten angegebene Batch-Größe ist das Beispiel der Upstream-Dokumentation; das AY-Robots-Formular sendet 2 für SmolVLA und schreibt Checkpoints in den Objektspeicher, sobald sie erscheinen.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episoden | Aufnahme bei 60 s | Zurücksetzen bei 60 s | Gesamtzeit | Plus 20 Prozent Neuaufnahmen | Bei 15 USD pro menschlicher Arbeitsstunde |
|---|---|---|---|---|---|
| 30, das SmolVLA-Minimum | 30 min | 30 min | 1 h 00 min | 1 h 12 min | etwa 18 USD |
| 50, die anderen vier Minimums | 50 min | 50 min | 1 h 40 min | 2 h 00 min | etwa 30 USD |
| 100, ein komfortabler Datensatz | 100 min | 100 min | 3 h 20 min | 4 h 00 min | etwa 60 USD |
Vergleichen Sie die rechte Spalte mit den 1 bis 12 USD, die der Lauf kostet. Bei dieser angenommenen Rate kostet ein Datensatz mit 50 Episoden zwei- bis siebenmal so viel in der Aufzeichnung wie im Training, vor Kalibrierung, Kamera-Setup und den Episoden, die Sie verwerfen. Deshalb hat einen direkten monetären Wert. Der lerobot-Leitfaden empfiehlt mindestens 50 Episoden mit 10 pro Objektposition; die SmolVLA-Dokumentation berichtet, dass eine 25-Episoden-Version derselben Aufgabe nicht ausreichte.
Wo das Geld tatsächlich verloren geht
1. Läufe mit Daten, die niemals funktionieren würden
Ein 20.000-Schritte GR00T-Lauf auf einem Datensatz mit zwei vertauschten Kamerastreams kostet dasselbe wie einer auf einem sauberen Datensatz, dauert gleich lang und erzeugt eine Verlustkurve, die gut aussieht. Der Fehler zeigt sich erst Stunden später am Arm. werden stundenweise abgerechnet und die Diagnose in Tagen. Zwei Symptome, die man sich merken sollte: bedeutet normalerweise, dass die Beobachtungen nicht das enthalten, was die Aufgabe erfordert, und bedeutet, dass der Datensatz weniger Variation aufwies, als Sie dachten.
2. Preise für Basismodelle für eine Aufgabe mit fester Kamera bezahlen
ACT hat ungefähr 80 Millionen Parameter und wurde entwickelt, um von Grund auf mit 50 Demonstrationen einer Aufgabe trainiert zu werden. GR00T N1.7 hat ungefähr 3 Milliarden Parameter mit einem vortrainierten Backbone. Für eine fest verschraubte Kamera, einen festen Tisch und ein Objekt erreicht das 80M-Modell häufig das Ziel, läuft mit etwa 20 ms pro Aktionsschritt anstatt 152 ms und kostet 1 bis 3 USD pro Lauf anstatt 4 bis 12. Geben Sie 3 USD aus, um herauszufinden, ob das günstige Modell funktioniert, bevor Sie 12 USD für das teure ausgeben. ACT gegen SmolVLA und GR00T N1.7 gegen Pi0.5 zeigen, wo jedes aufhört, die richtige Antwort zu sein; die Modell-Arena hat 85 Modelle und 332 Benchmark-Ergebnisse.
3. Die GPU, die Sie vergessen haben
Der günstigste Fehler, den man vermeiden kann, und der häufigste, den man macht. Eine am Freitag zur Fehlersuche gestartete Instanz wird über das Wochenende zum gleichen Tarif abgerechnet wie ein echter Lauf.
| Karte | Medianrate im Snapshot | 24 h im Leerlauf | 7 Tage im Leerlauf | Das ist wert |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | etwa 27 SmolVLA- oder ACT-Läufe zu je 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | etwa 12 GR00T-Läufe zu je 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | etwa 38 GR00T-Läufe zu je 8 USD |
Bei AY-Robots ist dieser Fehler für die Inferenz ausgeschlossen: Von der Inferenz-API bereitgestellte Pods verfügen über einen Leerlauf-Watchdog und zerstören sich nach einer Leerlaufperiode selbst. Wenn Sie die Karte selbst mieten, ist dieser Watchdog Ihre Kalendererinnerung.
4. Zweimal für dieselbe Antwort bezahlen
GR00Ts Einstiegspunkt für das Fine-Tuning ist ein tyro CLI, das keinen Seed offenlegt. Das ist keine Plattformbeschränkung, sondern das Upstream-Tool: Es gibt kein Seed-Feld in gr00t/configs/finetune_config.py, und die eigenen Trainings-Tipps des Repositories warnen davor, dass Läufe um 5 bis 6 Prozent variieren, da die Bild-Augmentierungen nicht-deterministisch sind. lerobot verwendet standardmäßig Seed 1000 in 0.5.1 und 0.6.1, sodass ACT-, SmolVLA- und Pi0.5-Läufe zumindest mit derselben Initialisierung und Datenreihenfolge erneut ausgeführt werden können. Das ist kein Versprechen bit-identischer Gewichte auf einer GPU, aber es ist der Unterschied zwischen einer Wiederholung und einem neuen Experiment. Wenn ein GR00T-Lauf eine funktionierende Policy erzeugt und Sie den Checkpoint nicht behalten haben, zahlen Sie den vollen Preis für ein Ergebnis, das um mehr abweichen kann, als den Unterschied, den Sie verfolgten. Es gibt eine zweite Möglichkeit, einen bezahlten Checkpoint zu verlieren: Das CLI verwendet standardmäßig --save-total-limit 5, dokumentiert als die maximale Anzahl von Checkpoints, die aufbewahrt werden, bevor ältere gelöscht werden. Speicher kostet Cents; eine Wiederholung kostet 4 bis 12 USD und sechs Stunden.
Die oben genannten Mindestgebote sind ein Bruchteil des On-Demand-Tarifs, und vast.ai sagt, dass das Bietsystem die Kosten für Kunden um fünfzig Prozent oder mehr senken kann. Der Haken, in eigenen Worten: Eine unterbrechbare Instanz kann jederzeit pausiert werden, wenn ein anderer Benutzer höher bietet oder eine On-Demand-Miete für dieselben Ressourcen erstellt wird, und diese Pause "stoppt alle laufenden Prozesse". On-Demand hat immer Vorrang. Gut für einen Lauf, der alle paar hundert Schritte einen Checkpoint schreibt, ein totaler Verlust für einen, der am Ende schreibt, was genau das ist, was die Standardeinstellungen bieten: Die Isaac-GR00T CLI schreibt alle --save-steps (Standard 1000), aber lerobots --save_freq ist standardmäßig auf 20.000 Schritte eingestellt, sodass ein standardmäßiger SmolVLA-Lauf nur einmal, an der Ziellinie, einen Checkpoint erstellt. Reduzieren Sie ihn, oder bieten Sie nicht. Das AY-Robots Trainingsformular stellt den GR00T-Regler als saveSteps zur Verfügung.
- Der niedrigste Stundensatz, den es gibt.
- Volle Kontrolle über das Image, die CUDA-Version, die lerobot- oder Isaac-GR00T-Revision und jedes Flag.
- Unterbrechbares Bieten halbiert den Tarif, wenn Ihr Lauf oft genug Checkpoints erstellt, um eine Pause zu überleben.
- Nichts ist abstrahiert, sodass Sie sehen können, warum ein Lauf sich seltsam verhält.
- Setup wird zu GPU-Tarifen abgerechnet: Treiber, Abhängigkeiten, der Multigigabyte-Basischeckpoint und der Dataset-Download kosten pro Stunde genauso viel wie das Training.
- Eine überbotene unterbrechbare Instanz wird pausiert und ihre Prozesse beendet. Ein nicht gespeicherter Lauf ist verbranntes Geld, und der lerobot-Standard schreibt seinen ersten Checkpoint bei Schritt 20.000.
- Nichts zerstört den Pod für Sie. Die obige Leerlauftabelle ist die Rechnung für das Vergessen.
- Das Angebot an einzelnen vollen 80-GB-Karten ist gering: zwei A100 80 GB und fünf H100 80 GB Vollkartenangebote in dieser Lesung. Die Auflistung ändert sich auch ständig, sodass der günstigste gelistete Preis und der Preis, zu dem Sie tatsächlich mieten können, nicht derselbe sind.
- Jede Stunde für die Infrastruktur ist eine Stunde, die nicht für die Aufzeichnung der Episoden aufgewendet wird, die darüber entscheiden, ob die Policy funktioniert.
Es selbst tun versus die Plattform die Karte mieten lassen
Sie wählen die Maschine, bauen die Umgebung auf und zerstören den Pod. Der Stundensatz ist der oben genannte Marktpreis; alles andere ist Ihre Zeit.
- Finden Sie eine Karte, die dem vom Modell benötigten VRAM entspricht: 24 GB für ACT und SmolVLA, 80 GB für GR00T und Pi0.5.
- Mieten Sie On-Demand, wenn der Lauf eine Pause nicht überleben kann, unterbrechbar, wenn er oft Checkpoints erstellt.
- Installieren Sie die Toolchain: lerobot für ACT, SmolVLA und Pi0.5, das Isaac-GR00T-Repository mit seinem eigenen tyro-Launcher für GR00T.
- Konvertieren Sie das Dataset bei Bedarf. Ein LeRobot v3.0 Dataset lässt den GR00T-Loader abstürzen und muss auf v2.1 herunterkonvertiert werden.
- Starten Sie, beobachten Sie den Verlust, verschieben Sie Checkpoints an einen dauerhaften Speicherort, sobald sie geschrieben werden.
- Zerstören Sie die Instanz und überprüfen Sie dann, ob Sie sie zerstört haben.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Realistische Kosten für einen GR00T-Lauf: 3 bis 6 Stunden auf einer H100 80 GB zu 1.34 bis 2.34 USD pro Stunde sind 4 bis 14 USD, plus 20 bis 40 Minuten Setup, das ebenfalls abgerechnet wird, plus Ihre eigene Zeit.
Sie wählen das Modell, das Dataset und die Hyperparameter in einem Formular aus. Das Backend mietet eine Spot-GPU, die nach dem vom Modell benötigten VRAM dimensioniert ist, führt den Trainer aus und schreibt Checkpoints in den Objektspeicher.
- Wählen Sie Ihre Kombination auf der Trainingsmatrix: fünf Modelle, vier Arme, ein Guide pro Zelle.
- Verweisen Sie auf ein Dataset: eines, das mit dem Desktop-Client aufgezeichnet wurde, eine Hugging Face Repo ID oder eines von Ihrem eigenen Rechner.
- Akzeptieren Sie die Standardeinstellungen oder passen Sie sie an. Die obige Tabelle zeigt, was tatsächlich an den Trainer gesendet wird.
- Das Backend wählt die Karte nach dem benötigten VRAM aus, sodass Sie nie nach GPUs suchen müssen.
- Checkpoints landen im Objektspeicher, sobald sie geschrieben werden, sodass ein unterbrochener Lauf kein verlorener Lauf ist.
| Stufe | Modelle | Laufzeit | Kosten pro Lauf |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
Was es nicht tut: ein schlechtes Dataset gut machen, GR00T einen Seed geben, den es nie hatte, oder die unten beschriebene Latenzgrenze entfernen. Es eliminiert die GPU-Suche, den Umgebungsaufbau und den Pod, den Sie vergessen haben zu zerstören. Die Mechanik ist in den Trainings-Dokumenten.
Was die Plattform berechnet und wie sie die Karte auswählt
Die Logik ist bewusst langweilig. Jedes Modell im Katalog deklariert eine GPU-Stufe; das Backend nimmt den benötigten VRAM und mietet eine passende Karte auf demselben oben gemessenen Spotmarkt. Deshalb ist der angegebene Preis eine Spanne, kein fester Preis. GR00T und Pi0.5 sind hier nur in der Cloud verfügbar, aufgrund der Untergrenzen von 40 GB und 70 GB. SmolVLA und ACT laufen auch lokal auf Ihrer eigenen 24-GB-Karte, wo die Cloud-Kosten null sind und der Strom Ihr Problem ist.

Eine Einstellung verdient eine Warnung. Die Gradientenakkumulation gilt tatsächlich für beide GR00T-Varianten, sodass eine Erhöhung einen größeren effektiven Batch auf derselben Karte ermöglicht. Für Pi0.5 und SmolVLA gilt sie überhaupt nicht: lerobot 0.5.1 hat keine Option zur Gradientenakkumulation in seiner Trainingskonfiguration, daher kostet das Setzen des Feldes auf 16 nichts und bringt auch nichts. Wenn ein in der Warteschlange stehender Job nie startet, die Seite für in der Warteschlange hängengebliebene Jobs erklärt, was zu überprüfen ist; wenn der Datensatz vor Beginn des Laufs abgelehnt wird, ist es fast immer das v3.0 Formatproblem.
Eine gemietete GPU, die Ihre Policy über das öffentliche Internet bereitstellt, fügt einem Regelkreis, der bereits 20 bis 485 ms pro Aktionsschritt beträgt, Roundtrips hinzu. Gut für langsames Pick-and-Place, nicht für schnelle reaktive Bewegungen. Cloud-Inferenz bewertet einen Checkpoint gut und führt Produktionsmanipulationen schlecht aus: Wenn die Aufgabe Geschwindigkeit erfordert, muss die Rechenleistung neben den Servos sitzen, und das sind Kosten, die dieser Artikel nicht verschwinden lassen kann. Siehe Inferenzlatenz.
Ein ausgearbeitetes Budget für eine erste funktionierende Policy
Alle vier Zeilen zusammen, von Grund auf neu. Die GPU-Gesamtsumme geht von 3 bis 5 Läufen aus: der erste beweist, dass die Pipeline funktioniert, der zweite deckt ein Datenproblem auf, der dritte oder vierte ist der, den Sie behalten.
| Posten | Schlanker Pfad | Komfortabler Pfad |
|---|---|---|
| Arm | SO-100 follower only, 121.94 USD in der Stückliste | Leader plus Follower, 229.88 USD in der Stückliste |
| Modell | SmolVLA or ACT, 24 GB tier | GR00T N1.7, A100 80 GB or H100 tier |
| Aufgezeichnete Episoden | 30, das SmolVLA-Minimum | 50 bis 100 |
| Menschliche Aufnahmezeit | ca. 1 h 12 min | 2 bis 4 Stunden |
| Kosten eines Laufs | 1 bis 3 USD | 4 bis 12 USD |
| Läufe bis es funktioniert | 3 bis 5 | 3 bis 5 |
| Gesamte GPU-Ausgaben | 3 bis 15 USD | 12 bis 60 USD |
| Größter Posten auf der Rechnung | der Arm, dann Ihre Zeit | der Arm, dann Ihre Zeit |
Das Muster gilt auch für diese Robotergröße: Rechenleistung ist ein Rundungsfehler, Hardware ist eine echte einmalige Investition, menschliche Arbeitsstunden sind die wiederkehrenden Kosten. Um die Trainingshälfte vor dem Kauf zu testen, können Sie Modelle vergleichen und eine GPU mieten, ohne einen Arm zu besitzen, und ist ein physischer SO-100, den Sie ohne Anmeldung im Browser steuern können. Für die gesamte End-to-End-Pipeline deckt der die Einrichtung, und das Training ab, und ist die Kurzversion.

Was kostet ein VLA-Fine-Tuning-Durchlauf von Anfang bis Ende?▾
Etwa 4 bis 12 USD für GR00T N1.7, GR00T N1.5 oder Pi0.5 auf der A100 80 GB oder H100 Stufe (3 bis 6 Stunden zu 1.20 bis 2.00 USD pro Stunde), und etwa 1 bis 3 USD für SmolVLA oder ACT auf der RTX 4090 Stufe (2 bis 5 Stunden zu 0.30 bis 0.60 USD pro Stunde). Eine selbst gemietete Karte liegt im gleichen Bereich, sobald die Einrichtungszeit berücksichtigt wird, da sie zum Trainingssatz abgerechnet wird.
Lohnt es sich, für eine H100 gegenüber einer A100 80 GB zu bezahlen?▾
Für eine einzelne SO-100-Policy in der Regel nicht. Beide erfüllen den Speicherbedarf, den GR00T und Pi0.5 benötigen, und am 23. August 2026 kostete eine volle A100 80 GB 0.44 USD pro Stunde gegenüber 1.34 USD für eine H100 80 GB. Die H100 ist schneller fertig, sodass ein Teil des Preises durch weniger Stunden kompensiert wird, aber die Gesamtkosten sind für einen so kleinen Durchlauf immer noch höher. Das eigentliche Argument für die H100 ist die Verfügbarkeit: fünf Angebote für einzelne H100 80 GB auf diesem Markt gegenüber zwei A100 80 GB, und eine Karte, die man nicht mieten kann, hat keinen Preis.
Wie viele Durchläufe sind nötig, bevor eine Policy tatsächlich funktioniert?▾
Planen Sie drei bis fünf. Der erste beweist, dass die Pipeline korrekt verdrahtet ist. Der zweite deckt häufig ein Dataset-Problem auf, wie z. B. einen Kamerastream, der mittendrin ausgefallen ist. Der dritte oder vierte ist der, den Sie behalten.
Kann ich SmolVLA oder ACT auf meiner eigenen GPU trainieren, anstatt sie zu mieten?▾
Ja. Beide werden lokal auf AY-Robots unterstützt und passen bequem in 24 GB; das ursprüngliche ACT-Paper trainierte sein 80M-Modell in etwa 5 Stunden auf einer 11 GB RTX 2080 Ti. GR00T und Pi0.5 sind hier nur in der Cloud verfügbar, da die dokumentierten Fine-Tuning-Mindestanforderungen der Anbieter 40 GB und 70 GB betragen und die größte Consumer-Karte auf dem Markt die 32 GB RTX 5090 ist.
Warum kosten die gleiche Anzahl von Schritten bei verschiedenen Modellen unterschiedlich viel?▾
Schritte sind nicht über Policies hinweg vergleichbar. ACT verwendet standardmäßig 100.000 Schritte bei Batch 8 auf einer 24 GB Karte; GR00T N1.5 verwendet standardmäßig 2.000 Schritte bei Batch 1 mit Gradientenakkumulation 16 auf einer 80 GB Karte. Die Abrechnung erfolgt nach Stunden multipliziert mit dem Tarif der Karte, auf die Sie der Speicherbedarf zwingt, nicht nach dem Schrittzähler.
Sehen Sie, was Ihr Durchlauf kosten würde, bevor Sie ihn starten
Jede der fünf Policies listet ihren GPU-Tier, die Laufzeit und den Preis pro Durchlauf auf, und das Trainings-Backend mietet die Karte auf demselben Spotmarkt, auf dem diese Zahlen gemessen wurden.
Preise prüfenQuellen
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Bereit für hochwertige Robotik-Daten?
AY-Robots verbindet Ihre Roboter mit qualifizierten Operatoren weltweit.
Jetzt starten