Tableau des coûts AY-Robots montrant le GPU requis par chacune des cinq politiques, la durée d'exécution typique et le prix par exécution, et le nombre d'épisodes nécessaires avant que la politique ne soit utile
entraînement VLAcoûts GPUSO-100fine-tuningapprentissage robotiquebudgétisation

Coût de l'entraînement VLA : Ce que coûte réellement une exécution de fine-tuning

AY-Robots ResearchAugust 23, 202623 min de lecture

Les prix réels des GPU sur le marché spot, la durée d'exécution de chacune des cinq politiques, le coût du bras et des démonstrations, et les quatre endroits où l'argent disparaît discrètement.

En bref

  • Une exécution sur un A100 80 GB ou H100 prend 3 à 6 heures et coûte environ 4 à 12 USD. Sur un RTX 4090, cela prend 2 à 5 heures et coûte environ 1 à 3 USD.
  • Mesuré sur vast.ai à 13:44 UTC le 23 août 2026 : un RTX 4090 complet à la demande pour 0.13 à 0.38 USD/h, un A100 80 GB pour 0.44 à 0.67, un H100 80 GB pour 1.34 à 2.34. Les cartes 80 GB complètes sont rares, avec respectivement deux et cinq offres de cartes uniques.
  • Le GPU est la ligne la moins chère. La nomenclature du SO-ARM100 évalue une paire leader plus suiveur à 229.88 USD, ce qui représente 77 à 230 exécutions sur le niveau 24 GB.
  • Deux heures d'une personne enregistrant 50 épisodes coûtent plus cher que l'exécution d'entraînement alimentée par ces épisodes.
  • L'argent disparaît à quatre endroits : les exécutions sur des données corrompues, les modèles 3B sur des tâches qu'une politique 80M gère, les GPU que personne n'a détruits, et les réexécutions d'un résultat que vous n'avez pas réussi à conserver.
  • AY-Robots dimensionne la carte en fonction de la VRAM dont le modèle a besoin et la loue sur le même marché spot, de sorte que le coût d'exécution est le coût du marché.

La facture comporte quatre lignes, et le GPU est la plus petite

Quand les gens demandent ce que coûte l'affinement d'un modèle vision-langage-action pour un SO-100, ils font presque toujours référence à la location de GPU. C'est le chiffre qui apparaît comme un débit sur une carte, c'est donc celui qui semble réel. C'est aussi, de loin, le plus petit des quatre chiffres qui décident du coût réel d'une politique fonctionnelle.

LigneDescriptionTaille typique pour une politique fonctionnelle
Temps GPUlocation d'une carte pour l'exécution1 à 12 USD par exécution, et vous en ferez 3 à 5
Le robotservos, châssis imprimé, caméras, câbles, alimentationune seule fois, 110 à 500 EUR par bras
Heures humainesune personne pilotant le bras pour enregistrer des démos1 à 4 heures par jeu de données, répété par tâche
Gaspillagemauvaises données, modèles surdimensionnés, pods oubliésillimité, et la seule ligne que vous contrôlez

Les temps d'entraînement ci-dessous proviennent des articles et dépôts des cinq modèles, le coût matériel de la nomenclature publiée, les chiffres de la plateforme des AY-Robots catalogue de politiques et de la page de tarification. Lorsque la plateforme n'apporte pas d'aide, cet article le précise.

Ce que coûte réellement une heure de GPU sur le marché spot

Il n'y a pas de prix unique pour une heure d'A100. Sur une place de marché comme vast.ai, chaque hôte fixe son propre tarif, et le lancement d'entraînement que vous lancez atterrit sur la machine la moins chère et disponible à cet instant. La réponse honnête est une distribution. La voici, mesurée le 23 août 2026 à 13:44 UTC : cartes complètes uniques, à la demande, filtrées par VRAM réelle.

Cartevast.ai à la demande USD/h (bas / médian / haut)Offres de cartes complètesPrix plancher vast.aiRunPod Communauté / SécuriséHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74non proposé
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99non proposé
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 en tant qu'Espace
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 en tant que point de terminaison
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19non proposé
Comment cette capture a été prise, et ce qu'elle n'est pas

Offres à la demande pour un seul GPU complet (gpu_frac == 1.0) provenant de l'API publique de vast.ai, qui ne nécessite pas de compte, filtrées sur gpu_ram afin que seules les cartes 80 Go authentiques apparaissent dans les lignes 80 Go. Ce filtre est important : dans cette lecture, les trois offres A100 SXM4 à carte unique étaient des pièces de 40 Go, tout comme deux des quatre offres A100 PCIE, donc les regrouper dans une seule ligne "A100" aurait divisé par deux le prix rapporté ici. La colonne Hugging Face mélange deux produits : 2,50 USD/h correspond au matériel Spaces Nvidia A100 - large et 4,50 USD/h est un seul H100 80 Go sous Inference Endpoints, ce que Spaces ne propose pas. Traitez les médianes comme indicatives : la ligne A100 80 Go repose sur deux offres et la ligne H100 sur cinq, et la même requête 36 secondes plus tard a renvoyé un nombre de 4090 différent et un prix maximum différent sur trois des cinq lignes. Les prix catalogue de RunPod sont le chiffre le plus stable sur lequel s'appuyer pour la planification.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
La requête exacte derrière le tableau ci-dessus, exécutée deux fois lors de la rédaction de cette section. Exécutez-la avant de faire confiance à tout article sur les prix des GPU, y compris celui-ci.
Tableau des coûts AY-Robots montrant le GPU requis par chaque politique, la durée d'exécution typique et le prix par exécution, et le nombre d'épisodes nécessaires avant que la politique ne soit utile
Le tableau des coûts sur /try : carte, durée d'exécution, prix par exécution et nombre minimum d'épisodes par politique.

Pourquoi les modèles 3B ne peuvent pas utiliser la carte bon marché

Une heure de 4090 et une heure de H100 80 Go diffèrent d'environ six fois aux médianes ci-dessus. Ce qui vous force à utiliser la carte coûteuse n'est pas la vitesse, c'est la mémoire. openpi fixe le seuil pour un réglage fin complet de Pi0.5 à 70 Go, et NVIDIA recommande 40 Go ou plus pour GR00T. Notez ce que le chiffre GR00T n'est pas. Sa configuration de réglage fin gèle le modèle de langage et l'encodeur visuel par défaut (tune_llm et tune_visual sont False, le projecteur et la tête de diffusion True), c'est pourquoi le catalogue liste environ 40 M de paramètres entraînés sur 3 B. Les 40 Go ne sont pas l'état de l'optimiseur pour 3 B de poids, c'est le backbone gelé plus les activations. Les variantes à portée réduite descendent plus bas : le chemin LoRA d'openpi demande 22,5 Go et nomme la 4090, et le flux de travail Isaac Lab Arena de NVIDIA liste une option mono-GPU de 24 Go pour le post-entraînement de GR00T. La plateforme se base sur le seuil que chaque fournisseur publie pour la configuration qu'il exécute réellement. L'article sur le flow-matching de pi0 explique d'où vient cette empreinte de flow-matching.

TâcheMémoire requise par le projet amontSource
Inférence pi0 / pi0.5plus de 8 Go, exemple RTX 4090openpi
Réglage fin LoRA pi0 / pi0.5plus de 22,5 Go, exemple RTX 4090openpi
Réglage fin complet pi0 / pi0.5plus de 70 Go, exemple A100 80 Go ou H100openpi
Inférence GR00T N1.71 GPU avec 16 Go ou plusIsaac-GR00T
Réglage fin GR00T N1.740 Go ou plus recommandé, nœuds H100 ou L40Isaac-GR00T
Réglage fin GR00T, ce qu'il entraîneprojecteur et tête de diffusion ; LLM et encodeur visuel gelés par défautfinetune_config.py
Post-entraînement GR00T, réduit1 GPU avec 24 Go, modèle de langage geléIsaac Lab Arena
Réglage fin SmolVLAun seul A100 pour l'exécution de référence de 20 000 étapeslerobot docs
Entraînement ACTun seul RTX 2080 Ti de 11 GoACT paper

Ce tableau explique pourquoi la plateforme divise les cinq modèles en deux niveaux. GR00T N1.7, GR00T N1.5 et Pi0.5 fonctionnent sur A100 80 Go ou H100 parce que c'est ce que les fournisseurs demandent. SmolVLA et ACT fonctionnent sur une RTX 4090 ou toute carte de 24 Go parce que c'est réellement suffisant.

Le piège qui fait perdre une journée : louer la carte bon marché pour le grand modèle

Une exécution de GR00T ou Pi0.5 sur une carte de 24 Go n'échoue pas dès la première seconde. Elle télécharge le point de contrôle de base, construit l'index du jeu de données, démarre la première passe avant et s'arrête après quelques centaines d'étapes avec une erreur CUDA de mémoire insuffisante. Vous avez payé pour le téléchargement et la configuration et n'avez rien obtenu. Solutions : mémoire insuffisante pendant l'entraînement.

Durée d'exécution réelle de chacun des cinq modèles

Le temps d'exécution est l'autre moitié du coût : 2.00 USD par heure est insignifiant si la tâche dure 40 minutes et ruineux si elle dure 40 heures. Ce sont les paramètres par défaut que AY-Robots envoie réellement à l'entraîneur, avec la fenêtre d'exécution et le coût pour chaque niveau.

PolitiqueNiveau de GPUÉtapes max. par défautTaille de lot par défaut (accum. grad.)Fenêtre d'exécutionCoût par exécution
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, s'applique3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, s'applique3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, sans effet3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, sans effet2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Tableau comparatif des cinq politiques entraînables sur AY-Robots montrant le nombre de paramètres, le GPU requis, la latence d'inférence et le nombre minimum d'épisodes
Les cinq politiques côte à côte : paramètres, niveau de GPU, latence par étape d'action, épisodes minimum.

D'où proviennent ces fenêtres d'exécution en amont

  • SmolVLA: la documentation lerobot indique que 20,000 étapes prennent environ 4 heures sur une seule A100. La plateforme exécute les mêmes 20,000 étapes sur le niveau moins cher de 24 GB, d'où une fenêtre plutôt que 4 heures fixes.
  • ACT: le document ALOHA original rapporte environ 5 heures sur une seule RTX 2080 Ti de 11 GB pour un modèle à 80 millions de paramètres. Une 4090 est de plusieurs générations plus récente, mais la plateforme prévoit 100,000 étapes, donc la fenêtre se situe au même endroit.
  • GR00T: le flux de travail de référence de NVIDIA pour la génération N1.6 indique environ 4 à 8 heures pour 20,000 étapes par lot de 24 sur huit cartes L40S, et 2 à 3 heures pour 30,000 étapes par lot de 16 sur une seule Ada 6000. Le réglage fin sur une seule carte d'un VLA de 3B en quelques heures est normal, pas optimiste.
  • Pi0.5: openpi ne publie aucun chiffre de temps réel, mais il publie le seuil de 70 GB pour un réglage fin complet, ce qui détermine la carte et donc le débit.

Il est bon de s'arrêter sur le coût que vous ne payez pas. Le document GR00T N1 rapporte environ 50,000 heures GPU H100 pour pré-entraîner le modèle 2.2B, sur un cluster allant jusqu'à 1024 GPU, avec une taille de lot de pré-entraînement de 16,384 pour 200,000 étapes de gradient. Au tarif de 1.34 à 2.34 USD par heure mesuré ci-dessus, cela représente de l'ordre de 67,000 à 117,000 USD de calcul loué. Le document SmolVLA estime son projet à environ 30,000 heures GPU sur 481 ensembles de données communautaires, 22.9K épisodes et 10.6M images. Vous héritez de tout cela pour le prix d'un téléchargement ; vos 8 USD achètent les 20,000 dernières étapes. Pourquoi les VLA sont construits de cette manière couvre cette répartition.

Le bras : un coût unique qui éclipse la facture GPU

Une session d'entraînement coûte moins cher qu'un déjeuner. Le robot, lui, non. C'est pourquoi le SO-100 est important : c'est le bras le moins cher que toute la apprentissage par imitation chaîne d'outils prend réellement en charge.

BrasServosTensionCoût des piècesSupport sur AY-Robots
SO-100Feetech STS3215 servos de bus7.4 V110 to 150 EURcomplet, bras de référence
SO-101Feetech STS32157.4 V130 to 170 EURcomplet
Koch v1.1Dynamixel XL330 / XL430rails 5 V et 12 V250 to 350 EURcompatible
LeKiwibras Feetech STS3215, base roulantebras 7.4 V, base 12 V400 to 500 EURcompatible

La nomenclature en amont dans le dépôt SO-ARM100 est plus granulaire et mérite d'être vérifiée en fonction de votre région : sa liste Pièces pour deux bras totalise 229.88 USD ou 226.30 EUR pour une configuration leader plus suiveur, et sa liste Pièces pour un bras suiveur totalise 121.94 USD ou 124.30 EUR. Six servos STS3215 à 13.89 USD chacun représentent 83.34 de ces 121.94, donc les servos constituent le bras. À 1 à 3 USD par exécution SmolVLA ou ACT, une paire de bras vaut entre 77 et 230 sessions d'entraînement. Si vous êtes encore en train de choisir, SO-100 contre SO-101 est la comparaison qui compte, car les deux sont suffisamment proches pour que la décision porte sur la disponibilité plutôt que sur la capacité.

7.4 V, pas 12 V

Le STS3215 est livré en variante 7.4 V et 12 V ; le dépôt indique que la pièce 12 V nécessite également une alimentation 12 V 5 A au lieu de celle de 5 V, de sorte que les deux ne sont pas interchangeables. Alimenter des servos 7.4 V avec du 12 V les détruit, et six servos représentent les deux tiers du coût des pièces d'un bras suiveur. Vérifiez l'étiquette de chaque servo avant la première mise sous tension. Si les servos se comportent déjà étrangement : servo ne répond pas, le bras tressaute puis s'affaisse.

Heures humaines : la ligne que personne ne met dans le tableur

C'est le chiffre qui bouleverse la discussion sur les coûts. L'enregistrement de démonstrations implique qu'une personne déplace un bras robotique, un épisode à la fois, en temps réel. Il n'y a pas de traitement par lots ni de location à la seconde. Le jeu de données LeRobot enregistreur est livré avec des valeurs par défaut qui facilitent l'arithmétique, toutes trois confirmées dans DatasetRecordConfig: 60 secondes par épisode, 60 secondes pour réinitialiser la scène, 50 épisodes. La colonne des coûts ci-dessous suppose 15 USD pour une heure de travail d'une personne, ce qui est une hypothèse plutôt qu'un chiffre de plateforme. Remplacez par votre propre taux ; le rapport est l'essentiel.

  1. 1
    Enregistrez le jeu de données avec les valeurs par défaut qui vous seront réellement facturées

    Ceci est lerobot 0.6.1, la version sur PyPI au 3 août 2026. Notez la forme de la CLI : l'enregistrement s'effectue via le point d'entrée de la console lerobot-record (lerobot.scripts.lerobot_record), et non l'ancien chemin de module python -m lerobot.scripts.record. AY-Robots cible la version 0.5.1, et le wheel 0.5.1 déclare les mêmes points d'entrée lerobot-record et lerobot-train, donc la forme ci-dessous est stable pour les deux. Les trois drapeaux de temporisation sont les valeurs par défaut en amont, c'est donc aussi la commande que l'arithmétique du tableau suivant suppose.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Examinez ce que vous avez enregistré avant de louer une seule minute de GPU

    L'inspection d'un jeu de données coûte zéro USD par heure. Découvrir le même problème à partir d'une courbe de perte coûte 2.00 USD par heure sur le niveau H100 et vous le dit quatre heures trop tard. Poussez le jeu de données et examinez-le dans la visionneuse LeRobot, ou parcourez le répertoire de jeux de données d'AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Entraînez-vous et assurez-vous que le point de contrôle survit au pod

    Une machine louée est temporaire par définition, alors écrivez les points de contrôle quelque part de durable pendant l'exécution. Deux drapeaux décident si vous conservez ce pour quoi vous avez payé. --save_freq est par défaut à 20 000 étapes, donc une exécution SmolVLA par défaut de 20 000 étapes écrit son premier point de contrôle lorsque l'exécution est déjà terminée ; réduisez-le avant de louer quoi que ce soit d'interruptible. --save_checkpoint_to_hub nécessite --policy.repo_id et n'existe pas dans lerobot 0.5.1, donc sur cette version, vous copiez vous-même le répertoire de sortie de la machine. La taille de lot ci-dessous est l'exemple de la documentation en amont ; le formulaire AY-Robots envoie 2 pour SmolVLA et écrit dans le stockage d'objets au fur et à mesure que les points de contrôle apparaissent.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
ÉpisodesEnregistrement à 60 sRéinitialisation à 60 sTemps réelPlus 20 pour cent de réenregistrementsÀ 15 USD par heure humaine
30, le minimum SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, les quatre autres minimums50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, un jeu de données confortable100 min100 min3 h 20 min4 h 00 minabout 60 USD

Comparez la colonne de droite avec les 1 à 12 USD que coûte l'exécution. À ce taux supposé, un ensemble de données de 50 épisodes coûte deux à sept fois plus cher à enregistrer qu'à entraîner, avant la calibration, la configuration de la caméra et les épisodes que vous jetez. C'est pourquoi a une valeur monétaire directe. Le guide lerobot suggère au moins 50 épisodes avec 10 par emplacement d'objet ; la documentation SmolVLA rapporte qu'une version de 25 épisodes de la même tâche n'était pas suffisante.

Où l'argent disparaît réellement

1. Exécutions sur des données qui n'auraient jamais fonctionné

Une exécution GR00T de 20 000 étapes sur un ensemble de données avec deux flux de caméra inversés coûte le même prix qu'une exécution sur un ensemble de données propre, prend le même temps et produit une courbe de perte qui semble correcte. La défaillance apparaît sur le bras, des heures plus tard. sont facturées à l'heure et le diagnostic est facturé en jours. Deux symptômes à mémoriser : signifie généralement que les observations ne contiennent pas ce dont la tâche a besoin, et signifie que l'ensemble de données avait moins de variation que vous ne le pensiez.

2. Payer les prix des modèles de fondation pour une tâche à caméra fixe

ACT compte environ 80 millions de paramètres et a été conçu pour être entraîné à partir de zéro sur 50 démonstrations d'une seule tâche. GR00T N1.7 compte environ 3 milliards de paramètres avec un backbone pré-entraîné. Pour une caméra fixe, une table fixe et un seul objet, le modèle de 80 millions de paramètres y parvient fréquemment, s'exécute à environ 20 ms par étape d'action au lieu de 152 ms, et coûte de 1 à 3 USD par exécution au lieu de 4 à 12. Dépensez 3 USD pour savoir si le modèle bon marché fonctionne avant de dépenser 12 USD pour le modèle coûteux. ACT contre SmolVLA et GR00T N1.7 contre Pi0.5 montrent où chacun cesse d'être la bonne réponse ; l'arène des modèles contient 85 modèles et 332 résultats de benchmark.

3. Le GPU que vous avez oublié

L'erreur la moins chère à éviter et la plus courante à commettre. Une instance démarrée un vendredi pour déboguer quelque chose est facturée tout le week-end au même tarif qu'une exécution réelle.

CarteTaux médian dans l'instantanéInactif pendant 24 hInactif pendant 7 joursCela représente
RTX 40900.32 USD/h7.68 USD53.76 USDenviron 27 exécutions SmolVLA ou ACT à 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDenviron 12 exécutions GR00T à 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDenviron 38 exécutions GR00T à 8 USD

Sur AY-Robots, cette défaillance est éliminée pour l'inférence : les pods provisionnés par l'API d'inférence intègrent un chien de garde d'inactivité et se détruisent après une période d'inactivité. Si vous louez la carte vous-même, ce chien de garde est votre rappel de calendrier.

4. Payer deux fois pour la même réponse

Le point d'entrée du fine-tuning de GR00T est une interface CLI tyro qui n'expose aucune graine. Ce n'est pas une limitation de la plateforme, c'est l'outil en amont : il n'y a pas de champ de graine dans gr00t/configs/finetune_config.py, et les conseils d'entraînement du dépôt avertissent que les exécutions varient de 5 à 6 pour cent car les augmentations d'image sont non déterministes. lerobot utilise par défaut la graine 1000 dans les versions 0.5.1 et 0.6.1, de sorte que les exécutions ACT, SmolVLA et Pi0.5 peuvent au moins être relancées à partir de la même initialisation et du même ordre de données. Ce n'est pas une promesse de poids bit-identiques sur un GPU, mais c'est la différence entre une relance et une nouvelle expérience. Si une exécution GR00T produit une politique qui fonctionne et que vous n'avez pas conservé le point de contrôle, vous payez le prix fort pour un résultat qui peut différer de plus que la différence que vous recherchiez. Il existe une deuxième façon de perdre un point de contrôle pour lequel vous avez payé : la CLI utilise par défaut --save-total-limit 5, documenté comme le nombre maximal de points de contrôle conservés avant que les plus anciens ne soient supprimés. Le stockage coûte des centimes ; une relance coûte de 4 à 12 USD et six heures.

La capacité interruptible est à moitié prix et arrêtera votre exécution

Les prix planchers ci-dessus représentent une fraction du tarif à la demande, et vast.ai affirme que le système d'enchères peut réduire les coûts des clients de cinquante pour cent ou plus. L'inconvénient, selon leurs propres termes : une instance interruptible peut être mise en pause à tout moment si un autre utilisateur surenchérit ou si une location à la demande est créée pour les mêmes ressources, et cette pause « arrête tous les processus en cours d'exécution ». La demande a toujours la priorité. C'est acceptable pour une exécution qui écrit un point de contrôle toutes les quelques centaines d'étapes, mais une perte totale pour une exécution qui écrit à la fin, ce qui est exactement ce que les valeurs par défaut vous donnent : l'interface CLI Isaac-GR00T écrit tous les --save-steps (par défaut 1000), mais le --save_freq de lerobot est par défaut à 20 000 étapes, donc une exécution SmolVLA par défaut ne crée un point de contrôle qu'une seule fois, à la fin. Diminuez-le, ou ne faites pas d'enchères. Le formulaire d'entraînement AY-Robots expose le paramètre GR00T sous le nom saveSteps.

Louer la carte vous-même
Avantages
  • Le tarif horaire le plus bas qui soit.
  • Contrôle total de l'image, de la version CUDA, de la révision lerobot ou Isaac-GR00T et de chaque drapeau.
  • Les enchères interruptibles réduisent le tarif de moitié si votre exécution crée des points de contrôle assez souvent pour survivre à une pause.
  • Rien n'est abstrait, donc quand une exécution se comporte étrangement, vous pouvez en voir la raison.
Compromis
  • La configuration est facturée aux tarifs GPU : les pilotes, les dépendances, le point de contrôle de base de plusieurs gigaoctets et le téléchargement du jeu de données coûtent tous le même prix par heure que l'entraînement.
  • Une instance interruptible surenchérie est mise en pause et ses processus sont arrêtés. Une exécution non sauvegardée est de l'argent perdu, et la valeur par défaut de lerobot écrit son premier point de contrôle à l'étape 20 000.
  • Rien ne détruit le pod pour vous. Le tableau des temps d'inactivité ci-dessus est la facture de l'oubli.
  • L'offre de cartes complètes de 80 Go est limitée : deux offres A100 80 Go et cinq offres H100 80 Go de cartes complètes dans cette lecture. La liste change également, de sorte que le prix le plus bas affiché et le prix que vous pouvez réellement louer ne sont pas les mêmes.
  • Chaque heure passée sur l'infrastructure est une heure non consacrée à l'enregistrement des épisodes qui déterminent si la politique fonctionne.

Le faire soi-même ou laisser la plateforme louer la carte

Vous choisissez la machine, construisez l'environnement et détruisez le pod. Le tarif horaire est le tarif du marché ci-dessus ; tout le reste est votre temps.

  1. Trouvez une carte correspondant à la VRAM dont le modèle a besoin : 24 Go pour ACT et SmolVLA, 80 Go pour GR00T et Pi0.5.
  2. Louez à la demande si l'exécution ne peut pas survivre à une pause, interruptible si elle crée souvent des points de contrôle.
  3. Installez la chaîne d'outils : lerobot pour ACT, SmolVLA et Pi0.5, le dépôt Isaac-GR00T avec son propre lanceur tyro pour GR00T.
  4. Convertissez le jeu de données si nécessaire. Un jeu de données LeRobot v3.0 fait planter le chargeur GR00T et doit être converti en v2.1.
  5. Lancez, surveillez la perte, poussez les points de contrôle vers un stockage durable au fur et à mesure qu'ils sont écrits.
  6. Détruisez l'instance, puis vérifiez que vous l'avez détruite.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Le point d'entrée actuel de l'ajustement fin d'Isaac-GR00T, correspondant à la commande dans le README du dépôt. Cette CLI n'a pas de drapeau de graine, donc les exécutions GR00T ne sont pas reproductibles bit par bit.

Coût réaliste pour une exécution GR00T : 3 à 6 heures sur un H100 80 Go à 1.34 à 2.34 USD par heure, soit 4 à 14 USD, plus 20 à 40 minutes de configuration qui sont également facturées, plus votre propre temps.

Ce que la plateforme facture et comment elle choisit la carte

La logique est délibérément simple. Chaque modèle du catalogue, déclare un niveau de GPU ; le backend prend la VRAM requise et loue une carte correspondante sur le même marché spot mesuré ci-dessus. C'est pourquoi le coût indiqué est une fourchette, et non un prix fixe. GR00T et Pi0.5 sont uniquement disponibles dans le cloud ici en raison des seuils de 40 Go et 70 Go. SmolVLA et ACT fonctionnent également localement sur votre propre carte de 24 Go, où le coût du cloud est nul et l'électricité est votre problème.

La page de tarification d'AY-Robots montrant le coût d'une exécution d'entraînement et de l'accès à la plateforme
La page de tarification. Les chiffres par exécution suivent le marché spot plutôt qu'un prix catalogue fixe.

Un paramètre mérite une mise en garde. L'accumulation de gradient s'applique réellement aux deux variantes de GR00T, donc l'augmenter permet d'obtenir un lot effectif plus grand sur la même carte. Pour Pi0.5 et SmolVLA, cela ne s'applique pas du tout : lerobot 0.5.1 n'a pas d'option d'accumulation de gradient dans sa configuration d'entraînement, donc définir le champ à 16 ne coûte rien et n'apporte rien. Si un travail en file d'attente ne démarre jamais, la page des travaux bloqués en file d'attente couvre ce qu'il faut vérifier ; si le jeu de données est rejeté avant le début de l'exécution, il s'agit presque toujours de le problème de format v3.0.

La limite que cette plateforme ne résout pas : la latence

Un GPU loué servant votre politique via l'internet public ajoute des allers-retours à une boucle de contrôle qui est déjà de 20 à 485 ms par étape d'action. Convient pour le pick-and-place lent, pas pour le mouvement réactif rapide. L'inférence dans le cloud évalue bien un point de contrôle mais exécute mal la manipulation en production : si la tâche nécessite de la vitesse, le calcul doit se trouver à côté des servomoteurs, et c'est un coût que cet article ne peut pas faire disparaître. Voir latence d'inférence.

Un budget détaillé pour une première politique fonctionnelle

Les quatre lignes ensemble, en partant de zéro. Le total GPU suppose 3 à 5 exécutions : la première prouve que le pipeline fonctionne, la seconde révèle un problème de données, la troisième ou la quatrième est celle que vous conservez.

LigneChemin économeChemin confortable
BrasSO-100 follower uniquement, 121.94 USD dans la BOMleader plus follower, 229.88 USD dans la BOM
ModèleSmolVLA ou ACT, niveau 24 GoGR00T N1.7, niveau A100 80 Go ou H100
Épisodes enregistrés30, le minimum pour SmolVLA50 à 100
Temps humain pour enregistrerenviron 1 h 12 min2 à 4 heures
Coût d'une exécution1 à 3 USD4 à 12 USD
Exécutions avant que cela ne fonctionne3 à 53 à 5
Dépenses GPU totales3 à 15 USD12 à 60 USD
Poste le plus important de la facturele bras, puis votre tempsle bras, puis votre temps

Le schéma se maintient à cette taille de robot : le calcul est une erreur d'arrondi, le matériel est un coût unique réel, les heures humaines sont la dépense récurrente. Pour tester la partie entraînement avant d'acheter quoi que ce soit, vous permettent de comparer des modèles et de louer un GPU sans bras, et est un SO-100 physique que vous pouvez piloter dans le navigateur sans inscription. Pour l'ensemble du pipeline de bout en bout, le couvre la configuration, et l'entraînement, et est la version courte.

La matrice d'entraînement AY-Robots avec cinq politiques en lignes et quatre bras robotiques en colonnes, chaque cellule renvoyant à un guide d'entraînement spécifique
La matrice /train : ligne pour votre budget, colonne pour votre bras, cellule pour le guide avec les paramètres par défaut et le coût de cette combinaison.
Combien coûte une exécution complète de fine-tuning VLA ?

Environ 4 à 12 USD pour GR00T N1.7, GR00T N1.5 ou Pi0.5 sur le niveau A100 80 GB ou H100 (3 à 6 heures à 1.20 à 2.00 USD par heure), et environ 1 à 3 USD pour SmolVLA ou ACT sur le niveau RTX 4090 (2 à 5 heures à 0.30 à 0.60 USD par heure). Louer la carte vous-même revient dans la même fourchette une fois le temps de configuration pris en compte, car la facturation se fait au tarif d'entraînement.

Vaut-il la peine de payer pour un H100 plutôt qu'un A100 80 GB ?

Pour une seule politique SO-100, généralement non. Les deux dépassent le seuil de mémoire requis par GR00T et Pi0.5, et au 23 août 2026, un A100 80 GB complet coûtait 0.44 USD par heure contre 1.34 pour un H100 80 GB. Le H100 termine plus tôt, donc une partie du coût est compensée par moins d'heures, mais le total reste plus élevé pour une exécution aussi petite. Le véritable argument en faveur du H100 est la disponibilité : cinq offres de H100 80 GB uniques sur ce marché contre deux A100 80 GB, et une carte que vous ne pouvez pas louer n'a pas de prix.

Combien d'exécutions faut-il avant qu'une politique ne fonctionne réellement ?

Prévoyez-en trois à cinq. La première prouve que le pipeline est correctement câblé. La seconde révèle généralement un problème de jeu de données, comme un flux de caméra qui s'est arrêté en cours de route. La troisième ou la quatrième est celle que vous gardez.

Puis-je entraîner SmolVLA ou ACT sur mon propre GPU au lieu de le louer ?

Oui. Les deux sont pris en charge localement sur AY-Robots et les deux tiennent confortablement dans 24 GB ; l'article original sur ACT a entraîné son modèle 80M en environ 5 heures sur une RTX 2080 Ti de 11 GB. GR00T et Pi0.5 sont uniquement disponibles dans le cloud ici car les seuils de fine-tuning documentés par les fournisseurs sont de 40 GB et 70 GB, et la plus grande carte grand public sur le marché est la RTX 5090 de 32 GB.

Pourquoi le même nombre d'étapes coûte-t-il des montants différents selon les modèles ?

Les étapes ne sont pas comparables entre les politiques. ACT utilise par défaut 100 000 étapes avec un batch de 8 sur une carte de 24 GB ; GR00T N1.5 utilise par défaut 2 000 étapes avec un batch de 1 et une accumulation de gradient de 16 sur une carte de 80 GB. La facture est le nombre d'heures multiplié par le tarif de la carte sur laquelle l'empreinte mémoire vous contraint, et non le compteur d'étapes.

Voyez ce que coûterait votre exécution avant de la démarrer

Chacune des cinq politiques liste son niveau de GPU, son temps d'exécution et son prix par exécution, et le backend d'entraînement loue la carte sur le même marché spot où ces chiffres ont été mesurés.

Vérifier les tarifs

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started