AY-Robots Kostentabelle, die zeigt, welche GPU jede der fünf Policies benötigt, die typische Laufzeit und der Preis pro Lauf und wie viele Episoden benötigt werden, bevor die Policy nützlich ist
VLA TrainingGPU KostenSO-100Fine-TuningRoboterlernenBudgetierung

VLA Trainingskosten: Was ein Fine-Tuning-Lauf wirklich kostet

AY-Robots Research23. August 202623 min Lesezeit

Reale Spotmarkt-GPU-Preise, wie lange jede der fünf Policies läuft, was der Arm und die Demonstrationen kosten und die vier Stellen, an denen das Geld still und leise verschwindet.

Die Kurzfassung

  • Ein Durchlauf auf der A100 80 GB oder H100 Stufe dauert 3 bis 6 Stunden und kostet etwa 4 bis 12 USD. Auf der RTX 4090 Stufe sind es 2 bis 5 Stunden und etwa 1 bis 3 USD.
  • Gemessen auf vast.ai um 13:44 UTC am 23. August 2026: eine volle RTX 4090 on demand für 0.13 bis 0.38 USD/h, eine A100 80 GB für 0.44 bis 0.67, eine H100 80 GB für 1.34 bis 2.34. Volle 80 GB Karten sind rar, jeweils zwei und fünf Einzelkartenangebote.
  • Die GPU ist der günstigste Posten. Die Stückliste des SO-ARM100 beziffert ein Leader-plus-Follower-Paar auf 229.88 USD, was 77 bis 230 Durchläufen auf der 24 GB Stufe entspricht.
  • Zwei Stunden, in denen eine Person 50 Episoden aufzeichnet, kosten mehr als der Trainingslauf, den diese Episoden speisen.
  • Geld verschwindet an vier Stellen: Läufe mit fehlerhaften Daten, 3B-Modelle für Aufgaben, die eine 80M-Policy bewältigt, GPUs, die niemand zerstört hat, und Wiederholungen eines Ergebnisses, das Sie nicht gespeichert haben.
  • AY-Robots dimensioniert die Karte nach dem vom Modell benötigten VRAM und mietet sie auf demselben Spotmarkt, sodass die Laufkosten den Marktkosten entsprechen.

Die Rechnung hat vier Posten, und die GPU ist der kleinste davon

Wenn Leute fragen, was es kostet, ein Vision-Sprach-Aktionsmodell für einen SO-100 zu feinabzustimmen, meinen sie fast immer die GPU-Miete. Das ist die Zahl, die als Belastung auf einer Karte erscheint, also diejenige, die sich real anfühlt. Sie ist auch, mit großem Abstand, die kleinste der vier Zahlen, die entscheiden, was eine funktionierende Policy tatsächlich kostet.

PostenWas es istTypische Größe für eine funktionierende Policy
GPU-ZeitMiete einer Karte für den Durchlauf1 bis 12 USD pro Durchlauf, und Sie werden 3 bis 5 durchführen
Der RoboterServos, gedruckter Rahmen, Kameras, Kabel, Stromversorgungeinmalig, 110 bis 500 EUR pro Arm
Menschliche Arbeitsstundeneine Person, die den Arm steuert, um Demos aufzuzeichnen1 bis 4 Stunden pro Datensatz, wiederholt pro Aufgabe
Verschwendungschlechte Daten, überdimensionierte Modelle, vergessene Podsunbegrenzt, und der einzige Posten, den Sie kontrollieren

Die unten angegebenen Trainingszeiten stammen aus den eigenen Papieren und Repositories der fünf Modelle, die Hardwarekosten aus der veröffentlichten Stückliste, die Plattformzahlen von den AY-Robots Richtlinienkatalog und Preisseite. Wo die Plattform nicht hilft, wird dies in diesem Artikel erwähnt.

Was eine GPU-Stunde auf dem Spotmarkt tatsächlich kostet

Es gibt keinen einzelnen Preis für eine A100-Stunde. Auf einem Marktplatz wie vast.ai legt jeder Host seinen eigenen Tarif fest, und der Trainingslauf, den Sie starten, landet auf der Maschine, die in diesem Moment günstig und frei ist. Die ehrliche Antwort ist eine Verteilung. Hier ist sie, gemessen am 23. August 2026 um 13:44 UTC: einzelne volle Karten, auf Abruf, gefiltert nach echtem VRAM.

Kartevast.ai On-Demand USD/h (niedrig / Median / hoch)Angebote für ganze Kartenvast.ai GebotsuntergrenzeRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74nicht angeboten
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99nicht angeboten
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 als Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 als Endpunkt
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19nicht angeboten
Wie dieser Schnappschuss erstellt wurde und was er nicht ist

On-demand-Angebote für eine einzelne vollständige GPU (gpu_frac == 1.0) von der öffentlichen vast.ai Bundle-API, die kein Konto benötigt, gefiltert nach gpu_ram, sodass nur echte 80-GB-Karten in den 80-GB-Zeilen landen. Dieser Filter ist wichtig: Bei dieser Abfrage waren alle drei Einzelkarten-A100 SXM4-Angebote 40-GB-Teile, ebenso wie zwei der vier A100 PCIE-Angebote. Eine Zusammenfassung in einer einzigen "A100"-Zeile hätte den hier angegebenen Preis halbiert. Die Hugging Face-Spalte mischt zwei Produkte: 2.50 USD/h ist die Nvidia A100 - large Spaces-Hardware und 4.50 USD/h ist eine einzelne H100 80 GB unter Inference Endpoints, die Spaces nicht anbietet. Betrachten Sie die Mediane als indikativ: Die A100 80 GB-Zeile basiert auf zwei Angeboten und die H100-Zeile auf fünf, und die identische Abfrage 36 Sekunden später lieferte eine andere 4090-Anzahl und einen anderen Höchstpreis in drei der fünf Zeilen. Die RunPod-Listenpreise sind die stabilere Zahl, mit der man planen kann.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Die genaue Abfrage hinter der obigen Tabelle, zweimal ausgeführt während des Schreibens dieses Abschnitts. Führen Sie sie aus, bevor Sie einem GPU-Preisartikel vertrauen, einschließlich diesem.
AY-Robots Kostentabelle, die zeigt, welche GPU jede Policy benötigt, typische Laufzeit und Preis pro Lauf, und wie viele Episoden benötigt werden, bevor die Policy nützlich ist
Die Kostentabelle auf /try: Karte, Laufzeit, Preis pro Lauf und minimale Episoden pro Policy.

Warum die 3B-Modelle die günstige Karte nicht nutzen können

Eine 4090-Stunde und eine H100 80 GB-Stunde unterscheiden sich bei den oben genannten Medianwerten um etwa das Sechsfache. Was Sie auf die teure Karte zwingt, ist nicht die Geschwindigkeit, sondern der Speicher. openpi setzt die Untergrenze für ein vollständiges Pi0.5 Fine-Tuning bei 70 GB an, und NVIDIA empfiehlt 40 GB oder mehr für GR00T. Beachten Sie, was die GR00T-Zahl nicht ist. Die Fine-Tune-Konfiguration friert das Sprachmodell und den visuellen Encoder standardmäßig ein (tune_llm und tune_visual sind False, der Projektor und der Diffusionskopf True), weshalb der Katalog etwa 40 Millionen trainierte Parameter von 3 Milliarden auflistet. Die 40 GB sind kein Optimizer-Zustand für 3 Milliarden Gewichte, sondern das eingefrorene Backbone plus Aktivierungen. Varianten mit reduziertem Umfang fallen niedriger aus: openpis LoRA-Pfad benötigt 22,5 GB und nennt die 4090, und NVIDIAs Isaac Lab Arena-Workflow listet eine 24 GB Single-GPU-Option für GR00T nach dem Training auf. Die Plattform staffelt sich nach der Untergrenze, die jeder Anbieter für die tatsächlich ausgeführte Konfiguration veröffentlicht. Der pi0 Flow-Matching-Bericht erklärt, woher dieser Flow-Matching-Fußabdruck stammt.

AufgabeSpeicher, den das Upstream-Projekt anfordertQuelle
pi0 / pi0.5 Inferenzmore than 8 GB, example RTX 4090openpi
pi0 / pi0.5 LoRA Fine-Tuningmore than 22.5 GB, example RTX 4090openpi
pi0 / pi0.5 vollständiges Fine-Tuningmore than 70 GB, example A100 80 GB or H100openpi
GR00T N1.7 Inferenz1 GPU with 16 GB or moreIsaac-GR00T
GR00T N1.7 Fine-Tuning40 GB or more recommended, H100 or L40 nodesIsaac-GR00T
GR00T Fine-Tuning, was trainiert wirdprojector and diffusion head; LLM and visual encoder frozen by defaultfinetune_config.py
GR00T Nach-Training, reduziert1 GPU with 24 GB, language model frozenIsaac Lab Arena
SmolVLA Fine-Tuningsingle A100 for the reference 20,000-step runlerobot docs
ACT Traininga single 11 GB RTX 2080 TiACT paper

Diese Tabelle erklärt, warum die Plattform die fünf Modelle in zwei Stufen unterteilt. GR00T N1.7, GR00T N1.5 und Pi0.5 laufen auf A100 80 GB oder H100, weil dies von den Anbietern gefordert wird. SmolVLA und ACT laufen auf einer RTX 4090 oder jeder 24 GB Karte, weil das tatsächlich ausreicht.

Die Falle, die einen Tag kostet: die günstige Karte für das große Modell mieten

Ein GR00T- oder Pi0.5-Lauf auf einer 24 GB-Karte schlägt nicht sofort fehl. Er lädt den Basis-Checkpoint herunter, erstellt den Datensatzindex, startet den ersten Forward-Pass und stirbt nach einigen hundert Schritten mit einem CUDA-Out-of-Memory-Fehler. Sie haben für den Download und die Einrichtung bezahlt und nichts erhalten. Lösungen: Speicherüberlauf während des Trainings.

Wie lange jedes der fünf Modelle tatsächlich läuft

Die Laufzeit ist die andere Hälfte der Kosten: 2.00 USD pro Stunde sind irrelevant, wenn der Auftrag 40 Minuten dauert, und ruinös, wenn er 40 Stunden dauert. Dies sind die Standardwerte, die AY-Robots tatsächlich an den Trainer sendet, zusammen mit dem Laufzeitfenster und den Kosten für jede Stufe.

RichtlinieGPU-StufeStandard maximale SchritteStandard-Batch (Grad-Akkumulation)LaufzeitfensterKosten pro Lauf
GR00T N1.7, ~3BA100 80 GB or H10020,00032, Akkumulation 1, angewendet3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, Akkumulation 16, angewendet3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, Akkumulation 16, keine Auswirkung3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, Akkumulation 8, keine Auswirkung2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, Akkumulation 12 to 5 h1 to 3 USD
Vergleichstabelle der fünf trainierbaren Richtlinien auf AY-Robots, die die Parameteranzahl, die benötigte GPU, die Inferenzlatenz und die minimale Episodenanzahl zeigt
Die fünf Richtlinien nebeneinander: Parameter, GPU-Stufe, Latenz pro Aktionsschritt, minimale Episoden.

Woher diese Laufzeitfenster stammen

  • SmolVLA: Die lerobot-Dokumentation besagt, dass 20.000 Schritte auf einer einzelnen A100 ungefähr 4 Stunden dauern. Die Plattform führt dieselben 20.000 Schritte auf der günstigeren 24-GB-Stufe aus, daher ein Zeitfenster statt pauschal 4 Stunden.
  • ACT: Das ursprüngliche ALOHA-Paper berichtet von etwa 5 Stunden auf einer einzelnen 11 GB RTX 2080 Ti für ein Modell mit 80 Millionen Parametern. Eine 4090 ist mehrere Generationen neuer, aber die Plattform budgetiert 100.000 Schritte, sodass das Zeitfenster am selben Punkt landet.
  • GR00T: NVIDIAs Referenz-Workflow für die N1.6-Generation gibt ungefähr 4 bis 8 Stunden für 20.000 Schritte bei Batch 24 auf acht L40S-Karten und 2 bis 3 Stunden für 30.000 Schritte bei Batch 16 auf einer einzelnen Ada 6000 an. Das Fine-Tuning eines 3B VLA auf einer einzelnen Karte in wenigen Stunden ist normal, nicht optimistisch.
  • Pi0.5: openpi veröffentlicht keine tatsächliche Laufzeit, aber es veröffentlicht die 70 GB Untergrenze für ein vollständiges Fine-Tuning, was die Karte und damit die Rate festlegt.

Es lohnt sich, einen Moment innezuhalten und über die Kosten nachzudenken, die Sie nicht tragen. Das GR00T N1-Paper berichtet von ungefähr 50.000 H100 GPU-Stunden, um das 2.2B-Modell vorzutrainieren, auf einem Cluster von bis zu 1024 GPUs, mit einer Pretraining-Batch-Größe von 16.384 für 200.000 Gradientenschritte. Bei den oben gemessenen 1.34 bis 2.34 USD pro Stunde entspricht das einer Größenordnung von 67.000 bis 117.000 USD an gemieteter Rechenleistung. Das SmolVLA-Paper beziffert sein Projekt auf ungefähr 30.000 GPU-Stunden über 481 Community-Datensätze, 22.9K Episoden und 10.6M Frames. Sie erben all dies zum Preis eines Downloads; Ihre 8 USD kaufen die letzten 20.000 Schritte. Warum VLAs so aufgebaut sind behandelt diese Aufteilung.

Der Arm: eine einmalige Investition, die die GPU-Kosten in den Schatten stellt

Ein Trainingslauf kostet weniger als ein Mittagessen. Der Roboter nicht. Deshalb ist der SO-100 wichtig: Er ist der günstigste Arm, den die gesamte Imitationslernen Toolchain tatsächlich unterstützt.

ArmServosSpannungTeilekostenUnterstützung auf AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURvollständig, Referenzarm
SO-101Feetech STS32157.4 V130 to 170 EURvollständig
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURkompatibel
LeKiwiFeetech STS3215 Arm, Fahrgestell7.4 V Arm, 12 V Basis400 to 500 EURkompatibel

Die vorgelagerte Stückliste im SO-ARM100 Repository ist detaillierter und sollte mit Ihrer Region abgeglichen werden: Die Liste Teile für zwei Arme beläuft sich auf insgesamt 229.88 USD oder 226.30 EUR für ein Leader-plus-Follower-Setup, und die Liste Teile für einen Follower-Arm beläuft sich auf insgesamt 121.94 USD oder 124.30 EUR. Sechs STS3215 Servos zu je 13.89 USD machen 83.34 von diesen 121.94 aus, die Servos sind also der Arm. Bei 1 bis 3 USD pro SmolVLA oder ACT Lauf ist ein Armpaar zwischen 77 und 230 Trainingsläufe wert. Wenn Sie noch am Auswählen sind, ist SO-100 gegen SO-101 der Vergleich, der zählt, denn die beiden sind sich so ähnlich, dass die Entscheidung eher von der Verfügbarkeit als von der Leistungsfähigkeit abhängt.

7.4 V, nicht 12 V

Der STS3215 wird in einer 7.4 V und einer 12 V Variante geliefert; das Repository weist darauf hin, dass das 12 V Teil auch eine 12 V 5 A Versorgung anstelle der 5 V Versorgung benötigt, sodass die beiden nicht austauschbar sind. Das Einspeisen von 12 V in 7.4 V Servos zerstört diese, und sechs Servos machen zwei Drittel der Teilekosten eines Follower-Arms aus. Überprüfen Sie das Etikett jedes Servos vor der ersten Inbetriebnahme. Wenn Servos bereits seltsam reagieren: Servo reagiert nicht, Arm zuckt und sackt dann ab.

Menschliche Arbeitsstunden: die Zeile, die niemand in die Tabelle einträgt

Dies ist die Zahl, die die Kostendiskussion auf den Kopf stellt. Das Aufzeichnen von Demonstrationen bedeutet, dass eine Person einen Roboterarm bewegt, eine Episode nach der anderen, in Echtzeit. Es gibt keine Stapelverarbeitung und keine sekundengenaue Miete. Der LeRobot-Datensatz Rekorder wird mit Standardeinstellungen geliefert, die die Berechnung vereinfachen, alle drei bestätigt in DatasetRecordConfig: 60 Sekunden pro Episode, 60 Sekunden zum Zurücksetzen der Szene, 50 Episoden. Die Spalte für die Kosten unten geht von 15 USD für eine Stunde Arbeitszeit aus, was eine Annahme und keine Plattformzahl ist. Ersetzen Sie Ihren eigenen Satz; das Verhältnis ist der entscheidende Punkt.

  1. 1
    Zeichnen Sie den Datensatz mit den Standardeinstellungen auf, die Ihnen tatsächlich in Rechnung gestellt werden

    Dies ist lerobot 0.6.1, die Version auf PyPI vom 3. August 2026. Beachten Sie die CLI-Form: Die Aufzeichnung erfolgt über den Konsoleneinstiegspunkt lerobot-record (lerobot.scripts.lerobot_record), nicht über den alten Modulpfad python -m lerobot.scripts.record. AY-Robots zielt auf 0.5.1 ab, und das 0.5.1-Wheel deklariert dieselben Einstiegspunkte lerobot-record und lerobot-train, sodass die unten gezeigte Form über beide Versionen hinweg stabil ist. Die drei Zeit-Flags sind die Upstream-Standardwerte, daher ist dies auch der Befehl, den die Berechnung in der nächsten Tabelle annimmt.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Sehen Sie sich an, was Sie aufgenommen haben, bevor Sie eine einzige GPU-Minute mieten

    Die Inspektion eines Datensatzes kostet null USD pro Stunde. Das Entdecken desselben Problems anhand einer Verlustkurve kostet 2.00 USD pro Stunde auf der H100-Stufe und sagt es Ihnen vier Stunden zu spät. Laden Sie den Datensatz hoch und überprüfen Sie ihn im LeRobot-Viewer, oder durchsuchen Sie das AY-Robots Datensatzverzeichnis.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Trainieren Sie und stellen Sie sicher, dass der Checkpoint den Pod überlebt

    Eine gemietete Maschine ist per Definition temporär, daher sollten Sie während des Laufs Checkpoints an einem dauerhaften Ort speichern. Zwei Flags entscheiden, ob Sie behalten, wofür Sie bezahlt haben. --save_freq ist standardmäßig auf 20.000 Schritte eingestellt, sodass ein standardmäßiger 20.000-Schritte-SmolVLA-Lauf seinen ersten Checkpoint schreibt, wenn der Lauf bereits beendet ist; senken Sie diesen Wert, bevor Sie etwas Unterbrechbares mieten. --save_checkpoint_to_hub erfordert --policy.repo_id und existiert nicht in lerobot 0.5.1, daher müssen Sie in dieser Version das Ausgabeverzeichnis selbst von der Maschine kopieren. Die unten angegebene Batch-Größe ist das Beispiel der Upstream-Dokumentation; das AY-Robots-Formular sendet 2 für SmolVLA und schreibt Checkpoints in den Objektspeicher, sobald sie erscheinen.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpisodenAufnahme bei 60 sZurücksetzen bei 60 sGesamtzeitPlus 20 Prozent NeuaufnahmenBei 15 USD pro menschlicher Arbeitsstunde
30, das SmolVLA-Minimum30 min30 min1 h 00 min1 h 12 minetwa 18 USD
50, die anderen vier Minimums50 min50 min1 h 40 min2 h 00 minetwa 30 USD
100, ein komfortabler Datensatz100 min100 min3 h 20 min4 h 00 minetwa 60 USD

Vergleichen Sie die rechte Spalte mit den 1 bis 12 USD, die der Lauf kostet. Bei dieser angenommenen Rate kostet ein Datensatz mit 50 Episoden zwei- bis siebenmal so viel in der Aufzeichnung wie im Training, vor Kalibrierung, Kamera-Setup und den Episoden, die Sie verwerfen. Deshalb hat einen direkten monetären Wert. Der lerobot-Leitfaden empfiehlt mindestens 50 Episoden mit 10 pro Objektposition; die SmolVLA-Dokumentation berichtet, dass eine 25-Episoden-Version derselben Aufgabe nicht ausreichte.

Wo das Geld tatsächlich verloren geht

1. Läufe mit Daten, die niemals funktionieren würden

Ein 20.000-Schritte GR00T-Lauf auf einem Datensatz mit zwei vertauschten Kamerastreams kostet dasselbe wie einer auf einem sauberen Datensatz, dauert gleich lang und erzeugt eine Verlustkurve, die gut aussieht. Der Fehler zeigt sich erst Stunden später am Arm. werden stundenweise abgerechnet und die Diagnose in Tagen. Zwei Symptome, die man sich merken sollte: bedeutet normalerweise, dass die Beobachtungen nicht das enthalten, was die Aufgabe erfordert, und bedeutet, dass der Datensatz weniger Variation aufwies, als Sie dachten.

2. Preise für Basismodelle für eine Aufgabe mit fester Kamera bezahlen

ACT hat ungefähr 80 Millionen Parameter und wurde entwickelt, um von Grund auf mit 50 Demonstrationen einer Aufgabe trainiert zu werden. GR00T N1.7 hat ungefähr 3 Milliarden Parameter mit einem vortrainierten Backbone. Für eine fest verschraubte Kamera, einen festen Tisch und ein Objekt erreicht das 80M-Modell häufig das Ziel, läuft mit etwa 20 ms pro Aktionsschritt anstatt 152 ms und kostet 1 bis 3 USD pro Lauf anstatt 4 bis 12. Geben Sie 3 USD aus, um herauszufinden, ob das günstige Modell funktioniert, bevor Sie 12 USD für das teure ausgeben. ACT gegen SmolVLA und GR00T N1.7 gegen Pi0.5 zeigen, wo jedes aufhört, die richtige Antwort zu sein; die Modell-Arena hat 85 Modelle und 332 Benchmark-Ergebnisse.

3. Die GPU, die Sie vergessen haben

Der günstigste Fehler, den man vermeiden kann, und der häufigste, den man macht. Eine am Freitag zur Fehlersuche gestartete Instanz wird über das Wochenende zum gleichen Tarif abgerechnet wie ein echter Lauf.

KarteMedianrate im Snapshot24 h im Leerlauf7 Tage im LeerlaufDas ist wert
RTX 40900.32 USD/h7.68 USD53.76 USDetwa 27 SmolVLA- oder ACT-Läufe zu je 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDetwa 12 GR00T-Läufe zu je 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDetwa 38 GR00T-Läufe zu je 8 USD

Bei AY-Robots ist dieser Fehler für die Inferenz ausgeschlossen: Von der Inferenz-API bereitgestellte Pods verfügen über einen Leerlauf-Watchdog und zerstören sich nach einer Leerlaufperiode selbst. Wenn Sie die Karte selbst mieten, ist dieser Watchdog Ihre Kalendererinnerung.

4. Zweimal für dieselbe Antwort bezahlen

GR00Ts Einstiegspunkt für das Fine-Tuning ist ein tyro CLI, das keinen Seed offenlegt. Das ist keine Plattformbeschränkung, sondern das Upstream-Tool: Es gibt kein Seed-Feld in gr00t/configs/finetune_config.py, und die eigenen Trainings-Tipps des Repositories warnen davor, dass Läufe um 5 bis 6 Prozent variieren, da die Bild-Augmentierungen nicht-deterministisch sind. lerobot verwendet standardmäßig Seed 1000 in 0.5.1 und 0.6.1, sodass ACT-, SmolVLA- und Pi0.5-Läufe zumindest mit derselben Initialisierung und Datenreihenfolge erneut ausgeführt werden können. Das ist kein Versprechen bit-identischer Gewichte auf einer GPU, aber es ist der Unterschied zwischen einer Wiederholung und einem neuen Experiment. Wenn ein GR00T-Lauf eine funktionierende Policy erzeugt und Sie den Checkpoint nicht behalten haben, zahlen Sie den vollen Preis für ein Ergebnis, das um mehr abweichen kann, als den Unterschied, den Sie verfolgten. Es gibt eine zweite Möglichkeit, einen bezahlten Checkpoint zu verlieren: Das CLI verwendet standardmäßig --save-total-limit 5, dokumentiert als die maximale Anzahl von Checkpoints, die aufbewahrt werden, bevor ältere gelöscht werden. Speicher kostet Cents; eine Wiederholung kostet 4 bis 12 USD und sechs Stunden.

Unterbrechbare Kapazität ist zum halben Preis erhältlich und kann Ihren Lauf beenden

Die oben genannten Mindestgebote sind ein Bruchteil des On-Demand-Tarifs, und vast.ai sagt, dass das Bietsystem die Kosten für Kunden um fünfzig Prozent oder mehr senken kann. Der Haken, in eigenen Worten: Eine unterbrechbare Instanz kann jederzeit pausiert werden, wenn ein anderer Benutzer höher bietet oder eine On-Demand-Miete für dieselben Ressourcen erstellt wird, und diese Pause "stoppt alle laufenden Prozesse". On-Demand hat immer Vorrang. Gut für einen Lauf, der alle paar hundert Schritte einen Checkpoint schreibt, ein totaler Verlust für einen, der am Ende schreibt, was genau das ist, was die Standardeinstellungen bieten: Die Isaac-GR00T CLI schreibt alle --save-steps (Standard 1000), aber lerobots --save_freq ist standardmäßig auf 20.000 Schritte eingestellt, sodass ein standardmäßiger SmolVLA-Lauf nur einmal, an der Ziellinie, einen Checkpoint erstellt. Reduzieren Sie ihn, oder bieten Sie nicht. Das AY-Robots Trainingsformular stellt den GR00T-Regler als saveSteps zur Verfügung.

Die Karte selbst mieten
Vorteile
  • Der niedrigste Stundensatz, den es gibt.
  • Volle Kontrolle über das Image, die CUDA-Version, die lerobot- oder Isaac-GR00T-Revision und jedes Flag.
  • Unterbrechbares Bieten halbiert den Tarif, wenn Ihr Lauf oft genug Checkpoints erstellt, um eine Pause zu überleben.
  • Nichts ist abstrahiert, sodass Sie sehen können, warum ein Lauf sich seltsam verhält.
Kompromisse
  • Setup wird zu GPU-Tarifen abgerechnet: Treiber, Abhängigkeiten, der Multigigabyte-Basischeckpoint und der Dataset-Download kosten pro Stunde genauso viel wie das Training.
  • Eine überbotene unterbrechbare Instanz wird pausiert und ihre Prozesse beendet. Ein nicht gespeicherter Lauf ist verbranntes Geld, und der lerobot-Standard schreibt seinen ersten Checkpoint bei Schritt 20.000.
  • Nichts zerstört den Pod für Sie. Die obige Leerlauftabelle ist die Rechnung für das Vergessen.
  • Das Angebot an einzelnen vollen 80-GB-Karten ist gering: zwei A100 80 GB und fünf H100 80 GB Vollkartenangebote in dieser Lesung. Die Auflistung ändert sich auch ständig, sodass der günstigste gelistete Preis und der Preis, zu dem Sie tatsächlich mieten können, nicht derselbe sind.
  • Jede Stunde für die Infrastruktur ist eine Stunde, die nicht für die Aufzeichnung der Episoden aufgewendet wird, die darüber entscheiden, ob die Policy funktioniert.

Es selbst tun versus die Plattform die Karte mieten lassen

Sie wählen die Maschine, bauen die Umgebung auf und zerstören den Pod. Der Stundensatz ist der oben genannte Marktpreis; alles andere ist Ihre Zeit.

  1. Finden Sie eine Karte, die dem vom Modell benötigten VRAM entspricht: 24 GB für ACT und SmolVLA, 80 GB für GR00T und Pi0.5.
  2. Mieten Sie On-Demand, wenn der Lauf eine Pause nicht überleben kann, unterbrechbar, wenn er oft Checkpoints erstellt.
  3. Installieren Sie die Toolchain: lerobot für ACT, SmolVLA und Pi0.5, das Isaac-GR00T-Repository mit seinem eigenen tyro-Launcher für GR00T.
  4. Konvertieren Sie das Dataset bei Bedarf. Ein LeRobot v3.0 Dataset lässt den GR00T-Loader abstürzen und muss auf v2.1 herunterkonvertiert werden.
  5. Starten Sie, beobachten Sie den Verlust, verschieben Sie Checkpoints an einen dauerhaften Speicherort, sobald sie geschrieben werden.
  6. Zerstören Sie die Instanz und überprüfen Sie dann, ob Sie sie zerstört haben.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Der aktuelle Isaac-GR00T Fine-Tune Einstiegspunkt, passend zum Befehl in der Repository-README. Diese CLI hat kein Seed-Flag, daher sind GR00T-Läufe nicht bit-für-bit reproduzierbar.

Realistische Kosten für einen GR00T-Lauf: 3 bis 6 Stunden auf einer H100 80 GB zu 1.34 bis 2.34 USD pro Stunde sind 4 bis 14 USD, plus 20 bis 40 Minuten Setup, das ebenfalls abgerechnet wird, plus Ihre eigene Zeit.

Was die Plattform berechnet und wie sie die Karte auswählt

Die Logik ist bewusst langweilig. Jedes Modell im Katalog deklariert eine GPU-Stufe; das Backend nimmt den benötigten VRAM und mietet eine passende Karte auf demselben oben gemessenen Spotmarkt. Deshalb ist der angegebene Preis eine Spanne, kein fester Preis. GR00T und Pi0.5 sind hier nur in der Cloud verfügbar, aufgrund der Untergrenzen von 40 GB und 70 GB. SmolVLA und ACT laufen auch lokal auf Ihrer eigenen 24-GB-Karte, wo die Cloud-Kosten null sind und der Strom Ihr Problem ist.

Die AY-Robots Preisgestaltungsseite, die die Kosten für einen Trainingslauf und den Plattformzugang zeigt
Die Preisgestaltungsseite. Die Kosten pro Lauf richten sich nach dem Spotmarkt und nicht nach einem festen Listenpreis.

Eine Einstellung verdient eine Warnung. Die Gradientenakkumulation gilt tatsächlich für beide GR00T-Varianten, sodass eine Erhöhung einen größeren effektiven Batch auf derselben Karte ermöglicht. Für Pi0.5 und SmolVLA gilt sie überhaupt nicht: lerobot 0.5.1 hat keine Option zur Gradientenakkumulation in seiner Trainingskonfiguration, daher kostet das Setzen des Feldes auf 16 nichts und bringt auch nichts. Wenn ein in der Warteschlange stehender Job nie startet, die Seite für in der Warteschlange hängengebliebene Jobs erklärt, was zu überprüfen ist; wenn der Datensatz vor Beginn des Laufs abgelehnt wird, ist es fast immer das v3.0 Formatproblem.

Die Grenze, die diese Plattform nicht löst: Latenz

Eine gemietete GPU, die Ihre Policy über das öffentliche Internet bereitstellt, fügt einem Regelkreis, der bereits 20 bis 485 ms pro Aktionsschritt beträgt, Roundtrips hinzu. Gut für langsames Pick-and-Place, nicht für schnelle reaktive Bewegungen. Cloud-Inferenz bewertet einen Checkpoint gut und führt Produktionsmanipulationen schlecht aus: Wenn die Aufgabe Geschwindigkeit erfordert, muss die Rechenleistung neben den Servos sitzen, und das sind Kosten, die dieser Artikel nicht verschwinden lassen kann. Siehe Inferenzlatenz.

Ein ausgearbeitetes Budget für eine erste funktionierende Policy

Alle vier Zeilen zusammen, von Grund auf neu. Die GPU-Gesamtsumme geht von 3 bis 5 Läufen aus: der erste beweist, dass die Pipeline funktioniert, der zweite deckt ein Datenproblem auf, der dritte oder vierte ist der, den Sie behalten.

PostenSchlanker PfadKomfortabler Pfad
ArmSO-100 follower only, 121.94 USD in der StücklisteLeader plus Follower, 229.88 USD in der Stückliste
ModellSmolVLA or ACT, 24 GB tierGR00T N1.7, A100 80 GB or H100 tier
Aufgezeichnete Episoden30, das SmolVLA-Minimum50 bis 100
Menschliche Aufnahmezeitca. 1 h 12 min2 bis 4 Stunden
Kosten eines Laufs1 bis 3 USD4 bis 12 USD
Läufe bis es funktioniert3 bis 53 bis 5
Gesamte GPU-Ausgaben3 bis 15 USD12 bis 60 USD
Größter Posten auf der Rechnungder Arm, dann Ihre Zeitder Arm, dann Ihre Zeit

Das Muster gilt auch für diese Robotergröße: Rechenleistung ist ein Rundungsfehler, Hardware ist eine echte einmalige Investition, menschliche Arbeitsstunden sind die wiederkehrenden Kosten. Um die Trainingshälfte vor dem Kauf zu testen, können Sie Modelle vergleichen und eine GPU mieten, ohne einen Arm zu besitzen, und ist ein physischer SO-100, den Sie ohne Anmeldung im Browser steuern können. Für die gesamte End-to-End-Pipeline deckt der die Einrichtung, und das Training ab, und ist die Kurzversion.

Die AY-Robots Trainingsmatrix mit fünf Policies als Zeilen und vier Roboterarmen als Spalten, wobei jede Zelle auf einen spezifischen Trainingsleitfaden verlinkt
Die /train-Matrix: Zeile für Ihr Budget, Spalte für Ihren Arm, Zelle für den Leitfaden mit den Standardeinstellungen und Kosten dieser Kombination.
Was kostet ein VLA-Fine-Tuning-Durchlauf von Anfang bis Ende?

Etwa 4 bis 12 USD für GR00T N1.7, GR00T N1.5 oder Pi0.5 auf der A100 80 GB oder H100 Stufe (3 bis 6 Stunden zu 1.20 bis 2.00 USD pro Stunde), und etwa 1 bis 3 USD für SmolVLA oder ACT auf der RTX 4090 Stufe (2 bis 5 Stunden zu 0.30 bis 0.60 USD pro Stunde). Eine selbst gemietete Karte liegt im gleichen Bereich, sobald die Einrichtungszeit berücksichtigt wird, da sie zum Trainingssatz abgerechnet wird.

Lohnt es sich, für eine H100 gegenüber einer A100 80 GB zu bezahlen?

Für eine einzelne SO-100-Policy in der Regel nicht. Beide erfüllen den Speicherbedarf, den GR00T und Pi0.5 benötigen, und am 23. August 2026 kostete eine volle A100 80 GB 0.44 USD pro Stunde gegenüber 1.34 USD für eine H100 80 GB. Die H100 ist schneller fertig, sodass ein Teil des Preises durch weniger Stunden kompensiert wird, aber die Gesamtkosten sind für einen so kleinen Durchlauf immer noch höher. Das eigentliche Argument für die H100 ist die Verfügbarkeit: fünf Angebote für einzelne H100 80 GB auf diesem Markt gegenüber zwei A100 80 GB, und eine Karte, die man nicht mieten kann, hat keinen Preis.

Wie viele Durchläufe sind nötig, bevor eine Policy tatsächlich funktioniert?

Planen Sie drei bis fünf. Der erste beweist, dass die Pipeline korrekt verdrahtet ist. Der zweite deckt häufig ein Dataset-Problem auf, wie z. B. einen Kamerastream, der mittendrin ausgefallen ist. Der dritte oder vierte ist der, den Sie behalten.

Kann ich SmolVLA oder ACT auf meiner eigenen GPU trainieren, anstatt sie zu mieten?

Ja. Beide werden lokal auf AY-Robots unterstützt und passen bequem in 24 GB; das ursprüngliche ACT-Paper trainierte sein 80M-Modell in etwa 5 Stunden auf einer 11 GB RTX 2080 Ti. GR00T und Pi0.5 sind hier nur in der Cloud verfügbar, da die dokumentierten Fine-Tuning-Mindestanforderungen der Anbieter 40 GB und 70 GB betragen und die größte Consumer-Karte auf dem Markt die 32 GB RTX 5090 ist.

Warum kosten die gleiche Anzahl von Schritten bei verschiedenen Modellen unterschiedlich viel?

Schritte sind nicht über Policies hinweg vergleichbar. ACT verwendet standardmäßig 100.000 Schritte bei Batch 8 auf einer 24 GB Karte; GR00T N1.5 verwendet standardmäßig 2.000 Schritte bei Batch 1 mit Gradientenakkumulation 16 auf einer 80 GB Karte. Die Abrechnung erfolgt nach Stunden multipliziert mit dem Tarif der Karte, auf die Sie der Speicherbedarf zwingt, nicht nach dem Schrittzähler.

Sehen Sie, was Ihr Durchlauf kosten würde, bevor Sie ihn starten

Jede der fünf Policies listet ihren GPU-Tier, die Laufzeit und den Preis pro Durchlauf auf, und das Trainings-Backend mietet die Karte auf demselben Spotmarkt, auf dem diese Zahlen gemessen wurden.

Preise prüfen

Bereit für hochwertige Robotik-Daten?

AY-Robots verbindet Ihre Roboter mit qualifizierten Operatoren weltweit.

Jetzt starten