Πίνακας κόστους AY-Robots που δείχνει ποια GPU χρειάζεται καθεμία από τις πέντε πολιτικές, τον τυπικό χρόνο εκτέλεσης και την τιμή ανά εκτέλεση, και πόσα επεισόδια απαιτούνται πριν η πολιτική γίνει χρήσιμη
Εκπαίδευση VLAΚόστος GPUSO-100fine-tuningρομποτική μάθησηπροϋπολογισμός

Κόστος Εκπαίδευσης VLA: Τι Κοστίζει Πραγματικά μια Εκτέλεση Fine-Tuning

AY-Robots ResearchAugust 23, 202623 λεπτά ανάγνωσης

Πραγματικές τιμές GPU στην αγορά spot, πόσο διαρκεί η εκτέλεση καθεμιάς από τις πέντε πολιτικές, τι κοστίζει ο ρομποτικός βραχίονας και οι επιδείξεις, και τα τέσσερα σημεία όπου τα χρήματα εξαφανίζονται αθόρυβα.

Η σύντομη εκδοχή

  • Μια εκτέλεση στην κατηγορία A100 80 GB ή H100 διαρκεί 3 έως 6 ώρες και κοστίζει περίπου 4 έως 12 USD. Στην κατηγορία RTX 4090 είναι 2 έως 5 ώρες και περίπου 1 έως 3 USD.
  • Μετρήθηκε στο vast.ai στις 13:44 UTC στις 23 Αυγούστου 2026: μια πλήρης RTX 4090 κατ' απαίτηση για 0.13 έως 0.38 USD/ώρα, μια A100 80 GB για 0.44 έως 0.67, μια H100 80 GB για 1.34 έως 2.34. Οι πλήρεις κάρτες 80 GB είναι σπάνιες, δύο και πέντε προσφορές μονής κάρτας αντίστοιχα.
  • Η GPU είναι η φθηνότερη γραμμή. Ο λογαριασμός υλικών του SO-ARM100 τοποθετεί ένα ζεύγος leader plus follower στα 229.88 USD, το οποίο αντιστοιχεί σε 77 έως 230 εκτελέσεις στην κατηγορία 24 GB.
  • Δύο ώρες ενός ατόμου που καταγράφει 50 επεισόδια κοστίζουν περισσότερο από την εκτέλεση εκπαίδευσης που τροφοδοτούν αυτά τα επεισόδια.
  • Τα χρήματα εξαφανίζονται σε τέσσερα σημεία: εκτελέσεις σε κατεστραμμένα δεδομένα, μοντέλα 3B σε εργασίες που χειρίζεται μια πολιτική 80M, GPUs που κανείς δεν κατέστρεψε, και επανεκτελέσεις ενός αποτελέσματος που δεν καταφέρατε να διατηρήσετε.
  • Η AY-Robots διαστασιολογεί την κάρτα με βάση τη VRAM που χρειάζεται το μοντέλο και την ενοικιάζει στην ίδια spot αγορά, οπότε το κόστος εκτέλεσης είναι το κόστος της αγοράς.

Ο λογαριασμός έχει τέσσερις γραμμές, και η GPU είναι η μικρότερη

Όταν οι άνθρωποι ρωτούν πόσο κοστίζει η λεπτομερής ρύθμιση ενός μοντέλου όρασης-γλώσσας-δράσης για ένα SO-100, σχεδόν πάντα εννοούν την ενοικίαση GPU. Αυτός είναι ο αριθμός που εμφανίζεται ως χρέωση σε μια κάρτα, οπότε είναι αυτός που φαίνεται πραγματικός. Είναι επίσης, με μεγάλη διαφορά, ο μικρότερος από τους τέσσερις αριθμούς που καθορίζουν τι πραγματικά κοστίζει μια λειτουργική πολιτική σε εσάς.

ΓραμμήΤι είναιΤυπικό μέγεθος για μία λειτουργική πολιτική
Χρόνος GPUενοικίαση κάρτας για την εκτέλεση1 έως 12 USD ανά εκτέλεση, και θα κάνετε 3 έως 5
Το ρομπότσέρβο, τυπωμένο πλαίσιο, κάμερες, καλώδια, τροφοδοσίαμία φορά, 110 έως 500 EUR ανά βραχίονα
Ανθρώπινες ώρεςένα άτομο που οδηγεί τον βραχίονα για την καταγραφή επιδείξεων1 έως 4 ώρες ανά σύνολο δεδομένων, επαναλαμβανόμενες ανά εργασία
Σπατάληκακά δεδομένα, υπερμεγέθη μοντέλα, ξεχασμένα podsαπεριόριστη, και η μόνη γραμμή που ελέγχετε

Οι χρόνοι εκπαίδευσης παρακάτω προέρχονται από τις εργασίες και τα αποθετήρια των πέντε μοντέλων, το κόστος υλικού από τον δημοσιευμένο κατάλογο υλικών, οι αριθμοί πλατφόρμας από τον AY-Robots κατάλογο πολιτικών και σελίδα τιμολόγησης. Όπου η πλατφόρμα δεν βοηθά, αυτό το άρθρο το αναφέρει.

Τι κοστίζει πραγματικά μια ώρα GPU στην αγορά spot

Δεν υπάρχει ενιαία τιμή για μια ώρα A100. Σε μια αγορά όπως το vast.ai, κάθε πάροχος ορίζει τη δική του τιμή, και η εκτέλεση εκπαίδευσης που εκκινείτε προσγειώνεται σε όποια μηχανή είναι φθηνή και διαθέσιμη εκείνη τη στιγμή. Η ειλικρινής απάντηση είναι μια κατανομή. Εδώ είναι, μετρημένη στις 23 Αυγούστου 2026 στις 13:44 UTC: μεμονωμένες πλήρεις κάρτες, κατ' απαίτηση, φιλτραρισμένες με βάση την πραγματική VRAM.

Κάρταvast.ai κατ' απαίτηση USD/ώρα (χαμηλή / μέση / υψηλή)Προσφορές πλήρους κάρταςvast.ai κατώτατη προσφοράRunPod Κοινότητα / ΑσφαλέςHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74δεν προσφέρεται
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99δεν προσφέρεται
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 ως Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 ως endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19δεν προσφέρεται
Πώς λήφθηκε αυτό το στιγμιότυπο και τι δεν είναι

Προσφορές κατ' απαίτηση για μία πλήρη GPU (gpu_frac == 1.0) από το δημόσιο API πακέτων του vast.ai, το οποίο δεν απαιτεί λογαριασμό, φιλτραρισμένες βάσει gpu_ram ώστε μόνο γνήσιες κάρτες 80 GB να εμφανίζονται στις σειρές των 80 GB. Αυτό το φίλτρο έχει σημασία: σε αυτή την ανάγνωση και οι τρεις προσφορές μονής κάρτας A100 SXM4 ήταν εξαρτήματα 40 GB, όπως και δύο από τις τέσσερις προσφορές A100 PCIE, οπότε η ομαδοποίησή τους σε μία σειρά "A100" θα είχε μειώσει στο μισό την τιμή που αναφέρεται εδώ. Η στήλη Hugging Face συνδυάζει δύο προϊόντα: 2.50 USD/h είναι το υλικό Nvidia A100 - large Spaces και 4.50 USD/h είναι μία μόνο H100 80 GB κάτω από Inference Endpoints, το οποίο δεν προσφέρεται από τα Spaces. Θεωρήστε τις διάμεσες τιμές ενδεικτικές: η σειρά A100 80 GB βασίζεται σε δύο προσφορές και η σειρά H100 σε πέντε, και το ίδιο ερώτημα 36 δευτερόλεπτα αργότερα επέστρεψε διαφορετικό πλήθος 4090 και διαφορετική κορυφαία τιμή σε τρεις από τις πέντε σειρές. Οι τιμές καταλόγου του RunPod είναι ο πιο σταθερός αριθμός για τον σχεδιασμό.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Το ακριβές ερώτημα πίσω από τον παραπάνω πίνακα, εκτελέστηκε δύο φορές κατά τη συγγραφή αυτής της ενότητας. Εκτελέστε το πριν εμπιστευτείτε οποιοδήποτε άρθρο τιμολόγησης GPU, συμπεριλαμβανομένου αυτού.
Πίνακας κόστους AY-Robots που δείχνει ποια GPU χρειάζεται κάθε πολιτική, τυπικό χρόνο εκτέλεσης και τιμή ανά εκτέλεση, και πόσα επεισόδια απαιτούνται πριν η πολιτική καταστεί χρήσιμη
Ο πίνακας κόστους στο /try: κάρτα, χρόνος εκτέλεσης, τιμή ανά εκτέλεση και ελάχιστα επεισόδια ανά πολιτική.

Γιατί τα μοντέλα 3B δεν μπορούν να χρησιμοποιήσουν τη φθηνή κάρτα

Μια ώρα 4090 και μια ώρα H100 80 GB διαφέρουν περίπου έξι φορές στις παραπάνω διάμεσες τιμές. Αυτό που σας αναγκάζει να χρησιμοποιήσετε την ακριβή κάρτα δεν είναι η ταχύτητα, είναι η μνήμη. Το openpi ορίζει το κατώτατο όριο για ένα πλήρες Pi0.5 λεπτομερής ρύθμιση στα 70 GB, και η NVIDIA συνιστά 40 GB ή περισσότερο για το GR00T. Σημειώστε τι δεν είναι ο αριθμός του GR00T. Η διαμόρφωση fine-tune του παγώνει το γλωσσικό μοντέλο και τον οπτικό κωδικοποιητή από προεπιλογή (tune_llm και tune_visual είναι False, ο προβολέας και η κεφαλή διάχυσης True), γι' αυτό ο κατάλογος αναφέρει περίπου 40 M εκπαιδευμένες παραμέτρους από 3 B. Τα 40 GB δεν είναι κατάσταση βελτιστοποιητή για βάρη 3 B, είναι ο παγωμένος κορμός συν τις ενεργοποιήσεις. Οι παραλλαγές μειωμένου εύρους πέφτουν χαμηλότερα: η διαδρομή LoRA του openpi απαιτεί 22.5 GB και αναφέρει την 4090, και η ροή εργασίας Isaac Lab Arena της NVIDIA αναφέρει μια επιλογή μονής GPU 24 GB για το GR00T μετά την εκπαίδευση. Η πλατφόρμα διαβαθμίζει με βάση το κατώτατο όριο που δημοσιεύει κάθε προμηθευτής για τη διαμόρφωση που πραγματικά εκτελεί. Η ανάλυση του pi0 flow-matching εξηγεί από πού προέρχεται αυτό το flow-matching αποτύπωμα.

ΕργασίαΜνήμη που απαιτεί το upstream projectΠηγή
pi0 / pi0.5 inferenceπερισσότερο από 8 GB, παράδειγμα RTX 4090openpi
pi0 / pi0.5 LoRA fine-tuneπερισσότερο από 22.5 GB, παράδειγμα RTX 4090openpi
pi0 / pi0.5 πλήρης fine-tuneπερισσότερο από 70 GB, παράδειγμα A100 80 GB ή H100openpi
GR00T N1.7 inference1 GPU με 16 GB ή περισσότεροIsaac-GR00T
GR00T N1.7 fine-tune40 GB ή περισσότερο συνιστάται, κόμβοι H100 ή L40Isaac-GR00T
GR00T fine-tune, τι εκπαιδεύειπροβολέας και κεφαλή διάχυσης· LLM και οπτικός κωδικοποιητής παγωμένοι από προεπιλογήfinetune_config.py
GR00T μετά την εκπαίδευση, μειωμένο1 GPU με 24 GB, γλωσσικό μοντέλο παγωμένοIsaac Lab Arena
SmolVLA fine-tuneμία A100 για την αναφορά εκτέλεσης 20.000 βημάτωνlerobot docs
ACT trainingμία 11 GB RTX 2080 TiACT paper

Αυτός ο πίνακας εξηγεί γιατί η πλατφόρμα χωρίζει τα πέντε μοντέλα σε δύο κατηγορίες. GR00T N1.7, GR00T N1.5 και Pi0.5 χρησιμοποιούν A100 80 GB ή H100 επειδή αυτό ζητούν οι προμηθευτές. SmolVLA και ACT χρησιμοποιούν μια RTX 4090 ή οποιαδήποτε κάρτα 24 GB επειδή αυτό είναι πραγματικά αρκετό.

Η παγίδα που τρώει μια μέρα: η ενοικίαση της φθηνής κάρτας για το μεγάλο μοντέλο

Μια εκτέλεση GR00T ή Pi0.5 σε κάρτα 24 GB δεν αποτυγχάνει στο μηδέν δευτερόλεπτα. Κατεβάζει το βασικό checkpoint, δημιουργεί τον δείκτη του συνόλου δεδομένων, ξεκινά την πρώτη forward pass και σταματά μετά από μερικές εκατοντάδες βήματα με σφάλμα CUDA out-of-memory. Πληρώσατε για τη λήψη και τη ρύθμιση και δεν πήρατε τίποτα. Λύσεις: έλλειψη μνήμης κατά την εκπαίδευση.

Πόσο χρόνο τρέχει πραγματικά κάθε ένα από τα πέντε μοντέλα

Ο χρόνος εκτέλεσης είναι το άλλο μισό του κόστους: 2.00 USD ανά ώρα είναι αδιάφορο αν η εργασία είναι 40 λεπτά και καταστροφικό αν είναι 40 ώρες. Αυτές είναι οι προεπιλεγμένες ρυθμίσεις που στέλνει πραγματικά η AY-Robots στον εκπαιδευτή, μαζί με το παράθυρο εκτέλεσης και το κόστος για κάθε βαθμίδα.

ΠολιτικήΒαθμίδα GPUΠροεπιλεγμένα μέγιστα βήματαΠροεπιλεγμένη παρτίδα (grad accum)Παράθυρο εκτέλεσηςΚόστος ανά εκτέλεση
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, ισχύει3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, ισχύει3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, χωρίς αποτέλεσμα3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, χωρίς αποτέλεσμα2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Πίνακας σύγκρισης των πέντε εκπαιδεύσιμων πολιτικών στην AY-Robots που δείχνει τον αριθμό παραμέτρων, την απαιτούμενη GPU, την καθυστέρηση συμπερασματολογίας και τον ελάχιστο αριθμό επεισοδίων
Οι πέντε πολιτικές δίπλα-δίπλα: παράμετροι, βαθμίδα GPU, καθυστέρηση ανά βήμα ενέργειας, ελάχιστα επεισόδια.

Από πού προέρχονται αυτά τα χρονικά παράθυρα εκτέλεσης στην ανάντη ροή

  • SmolVLA: η τεκμηρίωση του lerobot αναφέρει ότι 20.000 βήματα διαρκούν περίπου 4 ώρες σε μία μόνο A100. Η πλατφόρμα εκτελεί τα ίδια 20.000 βήματα στην φθηνότερη βαθμίδα των 24 GB, εξ ου και ένα παράθυρο αντί για σταθερές 4 ώρες.
  • ACT: η αρχική δημοσίευση ALOHA αναφέρει περίπου 5 ώρες σε μία μόνο 11 GB RTX 2080 Ti για ένα μοντέλο 80M παραμέτρων. Μια 4090 είναι αρκετές γενιές νεότερη, αλλά η πλατφόρμα προϋπολογίζει 100.000 βήματα, οπότε το παράθυρο καταλήγει στο ίδιο σημείο.
  • GR00T: η ροή εργασίας αναφοράς της NVIDIA για τη γενιά N1.6 αναφέρει περίπου 4 έως 8 ώρες για 20.000 βήματα σε batch 24 σε οκτώ κάρτες L40S, και 2 έως 3 ώρες για 30.000 βήματα σε batch 16 σε μία μόνο Ada 6000. Η λεπτομερής ρύθμιση (fine-tuning) ενός 3B VLA σε μία κάρτα μέσα σε λίγες ώρες είναι φυσιολογική, όχι αισιόδοξη.
  • Pi0.5: η openpi δεν δημοσιεύει στοιχεία πραγματικού χρόνου (wall-clock), αλλά δημοσιεύει το ελάχιστο όριο των 70 GB για μια πλήρη λεπτομερή ρύθμιση (fine-tune), το οποίο καθορίζει την κάρτα και συνεπώς τον ρυθμό.

Αξίζει να σταθούμε στον αριθμό που δεν πληρώνετε. Η δημοσίευση GR00T N1 αναφέρει περίπου 50.000 ώρες GPU H100 για την προ-εκπαίδευση του μοντέλου 2.2B, σε ένα σύμπλεγμα έως και 1024 GPUs, με μέγεθος batch προ-εκπαίδευσης 16.384 για 200.000 βήματα κλίσης (gradient steps). Με βάση το 1.34 έως 2.34 USD ανά ώρα που μετρήθηκε παραπάνω, αυτό ανέρχεται σε περίπου 67.000 έως 117.000 USD σε ενοικιαζόμενη υπολογιστική ισχύ. Η δημοσίευση SmolVLA τοποθετεί το έργο της σε περίπου 30.000 ώρες GPU σε 481 σύνολα δεδομένων κοινότητας, 22.9K επεισόδια και 10.6M καρέ. Τα κληρονομείτε όλα αυτά στην τιμή μιας λήψης. τα 8 USD σας αγοράζουν τα τελευταία 20.000 βήματα. Γιατί τα VLA κατασκευάζονται με αυτόν τον τρόπο καλύπτει αυτή τη διάσπαση.

Ο βραχίονας: ένα εφάπαξ κόστος που επισκιάζει τον λογαριασμό της GPU

Μια εκπαιδευτική εκτέλεση κοστίζει λιγότερο από το μεσημεριανό γεύμα. Το ρομπότ όχι. Γι' αυτό το SO-100 έχει σημασία: είναι ο φθηνότερος βραχίονας που υποστηρίζει πραγματικά ολόκληρη η μάθηση μέσω μίμησης εργαλειοθήκη.

ΒραχίοναςΣέρβοΤάσηΚόστος εξαρτημάτωνΥποστήριξη σε AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURπλήρης, βραχίονας αναφοράς
SO-101Feetech STS32157.4 V130 to 170 EURπλήρης
Koch v1.1Dynamixel XL330 / XL430ράγες 5 V και 12 V250 to 350 EURσυμβατός
LeKiwiΒραχίονας Feetech STS3215, τροχοφόρα βάσηΒραχίονας 7.4 V, βάση 12 V400 to 500 EURσυμβατός

Ο κατάλογος υλικών (bill of materials) στο αποθετήριο SO-ARM100 είναι πιο αναλυτικός και αξίζει να τον ελέγξετε σε σχέση με την περιοχή σας: η λίστα του Εξαρτήματα για Δύο Βραχίονες ανέρχεται συνολικά σε 229.88 USD ή 226.30 EUR για μια διάταξη leader plus follower, και η λίστα του Εξαρτήματα για Έναν Βραχίονα Follower ανέρχεται συνολικά σε 121.94 USD ή 124.30 EUR. Έξι σέρβο STS3215 προς 13.89 USD το καθένα είναι 83.34 από αυτά τα 121.94, οπότε τα σέρβο είναι ο βραχίονας. Με 1 έως 3 USD ανά εκτέλεση SmolVLA ή ACT, ένα ζεύγος βραχιόνων αξίζει μεταξύ 77 και 230 εκπαιδευτικών εκτελέσεων. Εάν εξακολουθείτε να επιλέγετε, SO-100 έναντι SO-101 είναι η σύγκριση που έχει σημασία, επειδή οι δύο είναι αρκετά κοντά ώστε η απόφαση να αφορά τη διαθεσιμότητα και όχι την ικανότητα.

7.4 V, όχι 12 V

Το STS3215 διατίθεται σε παραλλαγή 7.4 V και 12 V. Το αποθετήριο σημειώνει ότι το εξάρτημα 12 V χρειάζεται επίσης τροφοδοσία 12 V 5 A αντί για την 5 V, οπότε τα δύο δεν είναι εναλλάξιμα. Η τροφοδοσία 12 V σε σέρβο 7.4 V τα καταστρέφει, και έξι σέρβο αποτελούν τα δύο τρίτα του κόστους των εξαρτημάτων ενός βραχίονα follower. Ελέγξτε την ετικέτα σε κάθε σέρβο πριν από την πρώτη ενεργοποίηση. Εάν τα σέρβο συμπεριφέρονται ήδη περίεργα: το σέρβο δεν ανταποκρίνεται, ο βραχίονας τραντάζεται και μετά χαλαρώνει.

Ανθρώπινες ώρες: η γραμμή που κανείς δεν βάζει στο υπολογιστικό φύλλο

Αυτός είναι ο αριθμός που ανατρέπει τη συζήτηση για το κόστος. Η καταγραφή επιδείξεων είναι ένα άτομο που κινεί έναν ρομποτικό βραχίονα, ένα επεισόδιο κάθε φορά, σε πραγματικό χρόνο. Δεν υπάρχει ομαδοποίηση ούτε ενοικίαση ανά δευτερόλεπτο. Ο καταγραφέας συνόλου δεδομένων LeRobot συνοδεύεται από προεπιλογές που διευκολύνουν τους υπολογισμούς, και οι τρεις επιβεβαιωμένες στο DatasetRecordConfig: 60 δευτερόλεπτα ανά επισόδιο, 60 δευτερόλεπτα για επαναφορά της σκηνής, 50 επεισόδια. Η στήλη του κόστους παρακάτω υποθέτει 15 USD για μία ώρα χρόνου κάποιου, κάτι που είναι μια υπόθεση και όχι ένας αριθμός πλατφόρμας. Αντικαταστήστε με τη δική σας τιμή· η αναλογία είναι το ζητούμενο.

  1. 1
    Καταγράψτε το σύνολο δεδομένων με τις προεπιλογές για τις οποίες θα χρεωθείτε στην πραγματικότητα

    Αυτή είναι η έκδοση lerobot 0.6.1, η έκδοση στο PyPI από 3 Αυγούστου 2026. Σημειώστε τη μορφή CLI: η καταγραφή εκτελείται μέσω του σημείου εισόδου κονσόλας lerobot-record (lerobot.scripts.lerobot_record), όχι της παλιάς διαδρομής μονάδας python -m lerobot.scripts.record. Το AY-Robots στοχεύει την έκδοση 0.5.1, και το wheel 0.5.1 δηλώνει τα ίδια σημεία εισόδου lerobot-record και lerobot-train, οπότε η παρακάτω μορφή είναι σταθερή και στις δύο. Οι τρεις σημαίες χρονισμού είναι οι προεπιλογές του upstream, οπότε αυτή είναι επίσης η εντολή που υποθέτει ο υπολογισμός στον επόμενο πίνακα.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Δείτε τι καταγράψατε πριν νοικιάσετε ούτε ένα λεπτό GPU

    Η επιθεώρηση ενός συνόλου δεδομένων κοστίζει μηδέν USD ανά ώρα. Η ανακάλυψη του ίδιου προβλήματος από μια καμπύλη απώλειας κοστίζει 2.00 USD ανά ώρα στην κατηγορία H100 και σας το λέει τέσσερις ώρες αργότερα. Προωθήστε το σύνολο δεδομένων και ελέγξτε το στον προβολέα LeRobot, ή περιηγηθείτε στον κατάλογο συνόλων δεδομένων του AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Εκπαιδεύστε, και βεβαιωθείτε ότι το σημείο ελέγχου επιβιώνει του pod

    Μια ενοικιαζόμενη μηχανή είναι προσωρινή εξ ορισμού, οπότε γράψτε σημεία ελέγχου κάπου ανθεκτικά κατά τη διάρκεια της εκτέλεσης. Δύο σημαίες αποφασίζουν αν θα κρατήσετε αυτό που πληρώσατε. Το --save_freq έχει προεπιλογή 20.000 βήματα, οπότε μια προεπιλεγμένη εκτέλεση SmolVLA 20.000 βημάτων γράφει το πρώτο της σημείο ελέγχου όταν η εκτέλεση έχει ήδη τελειώσει· μειώστε το πριν νοικιάσετε οτιδήποτε διακοπτόμενο. Το --save_checkpoint_to_hub απαιτεί --policy.repo_id και δεν υπάρχει στο lerobot 0.5.1, οπότε σε αυτή την έκδοση αντιγράφετε τον κατάλογο εξόδου από τη μηχανή μόνοι σας. Το μέγεθος παρτίδας παρακάτω είναι το παράδειγμα του upstream εγγράφου· η φόρμα AY-Robots στέλνει 2 για το SmolVLA και γράφει σε αποθήκευση αντικειμένων καθώς εμφανίζονται σημεία ελέγχου.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
ΕπεισόδιαΚαταγραφή στα 60 δευτ.Επαναφορά στα 60 δευτ.Πραγματικός χρόνοςΣυν 20 τοις εκατό επανεγγραφέςΜε 15 USD ανά ανθρώπινη ώρα
30, το ελάχιστο του SmolVLA30 λεπτά30 λεπτά1 ώρα 00 λεπτά1 ώρα 12 λεπτάπερίπου 18 USD
50, τα άλλα τέσσερα ελάχιστα50 λεπτά50 λεπτά1 ώρα 40 λεπτά2 ώρες 00 λεπτάπερίπου 30 USD
100, ένα άνετο σύνολο δεδομένων100 λεπτά100 λεπτά3 ώρες 20 λεπτά4 ώρες 00 λεπτάπερίπου 60 USD

Συγκρίνετε τη δεξιά στήλη με το κόστος εκτέλεσης των 1 έως 12 USD. Με αυτό τον υποτιθέμενο ρυθμό, ένα σύνολο δεδομένων 50 επεισοδίων κοστίζει δύο έως επτά φορές περισσότερο για να καταγραφεί από ό,τι για να εκπαιδευτεί, πριν από τη βαθμονόμηση, τη ρύθμιση της κάμερας και τα επεισόδια που απορρίπτετε. Γι' αυτό έχει άμεση χρηματική αξία. Ο οδηγός του lerobot προτείνει τουλάχιστον 50 επεισόδια με 10 ανά θέση αντικειμένου· τα έγγραφα του SmolVLA αναφέρουν ότι μια έκδοση 25 επεισοδίων της ίδιας εργασίας δεν ήταν αρκετή.

Πού χάνονται πραγματικά τα χρήματα

1. Εκτελέσεις σε δεδομένα που δεν επρόκειτο ποτέ να λειτουργήσουν

Μια εκτέλεση GR00T 20.000 βημάτων σε ένα σύνολο δεδομένων με δύο εναλλαγμένες ροές κάμερας κοστίζει το ίδιο με μια σε ένα καθαρό σύνολο δεδομένων, διαρκεί τον ίδιο χρόνο και παράγει μια καμπύλη απώλειας που φαίνεται εντάξει. Η αποτυχία εμφανίζεται στον βραχίονα, ώρες αργότερα. χρεώνονται ανά ώρα και η διάγνωση χρεώνεται σε ημέρες. Δύο συμπτώματα που αξίζει να απομνημονεύσετε: συνήθως σημαίνει ότι οι παρατηρήσεις δεν μεταφέρουν αυτό που χρειάζεται η εργασία, και σημαίνει ότι το σύνολο δεδομένων είχε λιγότερη ποικιλία από ό,τι νομίζατε.

2. Πληρωμή τιμών μοντέλων βάσης για μια εργασία σταθερής κάμερας

Το ACT έχει περίπου 80 εκατομμύρια παραμέτρους και σχεδιάστηκε για να εκπαιδευτεί από την αρχή σε 50 επιδείξεις μιας εργασίας. Το GR00T N1.7 έχει περίπου 3 δισεκατομμύρια με προεκπαιδευμένο backbone. Για μια βιδωμένη κάμερα, ένα σταθερό τραπέζι και ένα αντικείμενο, το μοντέλο των 80 εκατομμυρίων συχνά τα καταφέρνει, εκτελείται σε περίπου 20 ms ανά βήμα ενέργειας αντί για 152 ms, και κοστίζει 1 έως 3 USD ανά εκτέλεση αντί για 4 έως 12. Ξοδέψτε 3 USD για να μάθετε αν το φθηνό μοντέλο λειτουργεί πριν ξοδέψετε 12 USD για το ακριβό. ACT έναντι SmolVLA και GR00T N1.7 έναντι Pi0.5 δείχνουν πού το καθένα παύει να είναι η σωστή απάντηση· η αρένα μοντέλων έχει 85 μοντέλα και 332 αποτελέσματα συγκριτικής αξιολόγησης.

3. Η GPU που ξεχάσατε

Το φθηνότερο λάθος για να αποφευχθεί και το πιο συνηθισμένο που γίνεται. Μια περίπτωση που ξεκίνησε Παρασκευή για εντοπισμό σφαλμάτων χρεώνεται όλο το Σαββατοκύριακο με τον ίδιο ρυθμό με μια πραγματική εκτέλεση.

ΚάρταΜέση τιμή στο στιγμιότυποΑδρανής για 24 ώρεςΑδρανής για 7 ημέρεςΑυτό αξίζει
RTX 40900.32 USD/h7.68 USD53.76 USDπερίπου 27 εκτελέσεις SmolVLA ή ACT στα 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDπερίπου 12 εκτελέσεις GR00T στα 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDπερίπου 38 εκτελέσεις GR00T στα 8 USD

Στο AY-Robots αυτή η αστοχία έχει σχεδιαστεί ώστε να αποφεύγεται για την εξαγωγή συμπερασμάτων (inference): τα pods που παρέχονται από το API εξαγωγής συμπερασμάτων φέρουν έναν αδρανή φύλακα (idle watchdog) και καταστρέφονται μετά από μια περίοδο αδράνειας. Εάν νοικιάσετε την κάρτα μόνοι σας, αυτός ο φύλακας είναι η υπενθύμιση του ημερολογίου σας.

4. Πληρώνοντας δύο φορές για την ίδια απάντηση

Το σημείο εισόδου fine-tuning του GR00T είναι ένα CLI tyro που δεν εκθέτει κανένα seed. Αυτό δεν είναι περιορισμός της πλατφόρμας, είναι το upstream εργαλείο: δεν υπάρχει πεδίο seed στο gr00t/configs/finetune_config.py, και οι συμβουλές εκπαίδευσης του ίδιου του αποθετηρίου προειδοποιούν ότι οι εκτελέσεις διαφέρουν κατά 5 έως 6 τοις εκατό επειδή οι αυξήσεις εικόνας είναι μη-ντετερμινιστικές. Το lerobot προεπιλέγει το seed 1000 τόσο στις εκδόσεις 0.5.1 όσο και 0.6.1, οπότε οι εκτελέσεις ACT, SmolVLA και Pi0.5 μπορούν τουλάχιστον να επανεκτελεστούν από την ίδια αρχικοποίηση και σειρά δεδομένων. Αυτό δεν είναι υπόσχεση για bit-identical βάρη σε μια GPU, αλλά είναι η διαφορά μεταξύ μιας επανεκτέλεσης και ενός νέου πειράματος. Εάν μια εκτέλεση GR00T παράγει μια πολιτική που λειτουργεί και δεν κρατήσατε το σημείο ελέγχου, πληρώνετε την πλήρη τιμή για ένα αποτέλεσμα που μπορεί να διαφέρει περισσότερο από τη διαφορά που κυνηγούσατε. Υπάρχει ένας δεύτερος τρόπος να χάσετε ένα σημείο ελέγχου για το οποίο πληρώσατε: το CLI προεπιλέγει το --save-total-limit 5, το οποίο τεκμηριώνεται ως ο μέγιστος αριθμός σημείων ελέγχου που διατηρούνται πριν διαγραφούν τα παλαιότερα. Η αποθήκευση κοστίζει λίγα λεπτά. Μια επανεκτέλεση κοστίζει 4 έως 12 USD και έξι ώρες.

Η διακοπτόμενη χωρητικότητα είναι μισή τιμή και θα διακόψει την εκτέλεσή σας

Οι παραπάνω κατώτατες τιμές προσφοράς είναι ένα κλάσμα της τιμής on-demand, και το vast.ai λέει ότι το σύστημα προσφορών μπορεί να μειώσει το κόστος των πελατών κατά πενήντα τοις εκατό ή περισσότερο. Το μειονέκτημα, με τα δικά του λόγια: μια διακοπτόμενη περίπτωση μπορεί να τεθεί σε παύση ανά πάσα στιγμή εάν ένας άλλος χρήστης προσφέρει υψηλότερα ή δημιουργηθεί μια ενοικίαση on-demand για τους ίδιους πόρους, και αυτή η παύση «σταματά όλες τις διεργασίες που εκτελούνται». Το on-demand έχει πάντα προτεραιότητα. Εντάξει για μια εκτέλεση που γράφει ένα σημείο ελέγχου κάθε μερικές εκατοντάδες βήματα, μια ολική απώλεια για μια που γράφει στο τέλος, το οποίο είναι ακριβώς αυτό που σας δίνουν οι προεπιλογές: το Isaac-GR00T CLI γράφει κάθε --save-steps (προεπιλογή 1000), αλλά το --save_freq του lerobot έχει προεπιλογή 20.000 βήματα, οπότε μια προεπιλεγμένη εκτέλεση SmolVLA δημιουργεί σημείο ελέγχου μία φορά, στη γραμμή τερματισμού. Μειώστε το, ή μην υποβάλετε προσφορά. Η φόρμα εκπαίδευσης AY-Robots εκθέτει το ρυθμιστικό GR00T ως saveSteps.

Ενοικίαση της κάρτας από εσάς
Πλεονεκτήματα
  • Η χαμηλότερη ωριαία τιμή που υπάρχει.
  • Πλήρης έλεγχος της εικόνας, της έκδοσης CUDA, της αναθεώρησης lerobot ή Isaac-GR00T και κάθε σημαίας.
  • Η διακοπτόμενη υποβολή προσφορών μειώνει στο μισό την τιμή εάν η εκτέλεσή σας δημιουργεί σημεία ελέγχου αρκετά συχνά ώστε να επιβιώσει μιας παύσης.
  • Τίποτα δεν αφαιρείται, οπότε όταν μια εκτέλεση συμπεριφέρεται περίεργα μπορείτε να δείτε το γιατί.
Αντισταθμίσεις
  • Η εγκατάσταση χρεώνεται με τιμές GPU: οδηγοί, εξαρτήσεις, το σημείο ελέγχου βάσης πολλαπλών gigabyte και η λήψη του συνόλου δεδομένων κοστίζουν όλα το ίδιο ανά ώρα με την εκπαίδευση.
  • Μια διακοπτόμενη περίπτωση που έχει υπερκεραστεί τίθεται σε παύση και οι διεργασίες της τερματίζονται. Μια μη αποθηκευμένη εκτέλεση είναι χαμένα χρήματα, και η προεπιλογή του lerobot γράφει το πρώτο της σημείο ελέγχου στο βήμα 20.000.
  • Τίποτα δεν καταστρέφει το pod για εσάς. Ο παραπάνω πίνακας αδράνειας είναι ο λογαριασμός για την παράλειψη.
  • Η προσφορά για μεμονωμένες πλήρεις κάρτες 80 GB είναι περιορισμένη: δύο προσφορές A100 80 GB και πέντε H100 80 GB πλήρους κάρτας σε αυτή την ανάγνωση. Η λίστα επίσης αλλάζει συνεχώς, οπότε η φθηνότερη αναγραφόμενη τιμή και η τιμή που μπορείτε πραγματικά να νοικιάσετε δεν είναι ο ίδιος αριθμός.
  • Κάθε ώρα σε υποδομή είναι μια ώρα που δεν δαπανάται για την καταγραφή των επεισοδίων που αποφασίζουν αν η πολιτική λειτουργεί.

Το να το κάνετε μόνοι σας έναντι του να αφήσετε την πλατφόρμα να νοικιάσει την κάρτα

Επιλέγετε το μηχάνημα, δημιουργείτε το περιβάλλον και καταστρέφετε το pod. Η ωριαία τιμή είναι η παραπάνω τιμή αγοράς· όλα τα άλλα είναι ο χρόνος σας.

  1. Βρείτε μια κάρτα που να ταιριάζει με τη VRAM που χρειάζεται το μοντέλο: 24 GB για ACT και SmolVLA, 80 GB για GR00T και Pi0.5.
  2. Ενοικιάστε on demand εάν η εκτέλεση δεν μπορεί να επιβιώσει μιας παύσης, διακοπτόμενη εάν δημιουργεί σημεία ελέγχου συχνά.
  3. Εγκαταστήστε την εργαλειοθήκη: lerobot για ACT, SmolVLA και Pi0.5, το αποθετήριο Isaac-GR00T με τον δικό του εκκινητή tyro για GR00T.
  4. Μετατρέψτε το σύνολο δεδομένων εάν χρειάζεται. Ένα σύνολο δεδομένων LeRobot v3.0 προκαλεί σφάλμα στον φορτωτή GR00T και πρέπει να μετατραπεί σε v2.1.
  5. Εκκινήστε, παρακολουθήστε την απώλεια, ωθήστε τα σημεία ελέγχου κάπου ανθεκτικά καθώς γράφονται.
  6. Καταστρέψτε την περίπτωση, και μετά ελέγξτε ότι την καταστρέψατε.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Το τρέχον σημείο εισόδου λεπτομερούς ρύθμισης Isaac-GR00T, που ταιριάζει με την εντολή στο README του αποθετηρίου. Αυτό το CLI δεν έχει σημαία seed, οπότε οι εκτελέσεις GR00T δεν είναι αναπαραγώγιμες bit-for-bit.

Ρεαλιστικό κόστος για μία εκτέλεση GR00T: 3 έως 6 ώρες σε H100 80 GB με 1.34 έως 2.34 USD ανά ώρα είναι 4 έως 14 USD, συν 20 έως 40 λεπτά εγκατάστασης που επίσης χρεώνεται, συν ο δικός σας χρόνος.

Τι χρεώνει η πλατφόρμα και πώς επιλέγει την κάρτα

Η λογική είναι σκόπιμα απλή. Κάθε μοντέλο στον κατάλογο δηλώνει ένα επίπεδο GPU· το backend λαμβάνει την απαιτούμενη VRAM και νοικιάζει μια αντίστοιχη κάρτα στην ίδια αγορά spot που μετρήθηκε παραπάνω. Αυτός είναι ο λόγος που το αναφερόμενο κόστος είναι ένα εύρος, όχι μια τιμή. Τα GR00T και Pi0.5 είναι εδώ μόνο για το cloud λόγω των ορίων 40 GB και 70 GB. Τα SmolVLA και ACT τρέχουν επίσης τοπικά στη δική σας κάρτα 24 GB, όπου το κόστος cloud είναι μηδέν και η ηλεκτρική ενέργεια είναι δικό σας πρόβλημα.

Η σελίδα τιμολόγησης της AY-Robots που δείχνει το κόστος μιας εκτέλεσης εκπαίδευσης και της πρόσβασης στην πλατφόρμα
Η σελίδα τιμολόγησης. Τα στοιχεία ανά εκτέλεση παρακολουθούν την αγορά spot και όχι μια σταθερή τιμή καταλόγου.

Μια ρύθμιση χρήζει προσοχής. Η συσσώρευση κλίσης (gradient accumulation) εφαρμόζεται πραγματικά και για τις δύο παραλλαγές του GR00T, οπότε η αύξησή της αγοράζει ένα μεγαλύτερο αποτελεσματικό batch στην ίδια κάρτα. Για τα Pi0.5 και SmolVLA δεν εφαρμόζεται καθόλου: το lerobot 0.5.1 δεν έχει επιλογή συσσώρευσης κλίσης στη διαμόρφωση εκπαίδευσής του, οπότε η ρύθμιση του πεδίου στο 16 δεν κοστίζει τίποτα και δεν προσφέρει τίποτα. Εάν μια εργασία σε αναμονή δεν ξεκινήσει ποτέ, η σελίδα για τις κολλημένες στην ουρά εργασίες καλύπτει τι πρέπει να ελέγξετε· εάν το σύνολο δεδομένων απορριφθεί πριν ξεκινήσει η εκτέλεση, είναι σχεδόν πάντα το πρόβλημα μορφής v3.0.

Το όριο που αυτή η πλατφόρμα δεν επιλύει: καθυστέρηση

Μια ενοικιαζόμενη GPU που εξυπηρετεί την πολιτική σας μέσω του δημόσιου διαδικτύου προσθέτει καθυστερήσεις (round trips) σε έναν βρόχο ελέγχου που είναι ήδη 20 έως 485 ms ανά βήμα ενέργειας. Εντάξει για αργές εργασίες pick-and-place, όχι για γρήγορη αντιδραστική κίνηση. Η εξαγωγή συμπερασμάτων στο cloud αξιολογεί καλά ένα checkpoint, αλλά εκτελεί άσχημα την παραγωγική χειραγώγηση: αν η εργασία απαιτεί ταχύτητα, η υπολογιστική ισχύς πρέπει να βρίσκεται δίπλα στους σερβοκινητήρες, και αυτό είναι ένα κόστος που αυτό το άρθρο δεν μπορεί να εξαφανίσει. Δείτε καθυστέρηση εξαγωγής συμπερασμάτων.

Ένας επεξεργασμένος προϋπολογισμός για μια πρώτη λειτουργική πολιτική

Και οι τέσσερις γραμμές μαζί, ξεκινώντας από το μηδέν. Το σύνολο της GPU υποθέτει 3 έως 5 εκτελέσεις: η πρώτη αποδεικνύει ότι ο αγωγός λειτουργεί, η δεύτερη αποκαλύπτει ένα πρόβλημα δεδομένων, η τρίτη ή η τέταρτη είναι αυτή που κρατάτε.

ΓραμμήΟικονομική διαδρομήΆνετη διαδρομή
ΒραχίοναςΜόνο SO-100 follower, 121.94 USD στο BOMοδηγός συν ακόλουθος, 229.88 USD στο BOM
ΜοντέλοSmolVLA ή ACT, κατηγορία 24 GBGR00T N1.7, A100 80 GB ή H100 κατηγορία
Καταγεγραμμένα επεισόδια30, το ελάχιστο για SmolVLA50 to 100
Ανθρώπινος χρόνος για καταγραφήπερίπου 1 ώρα 12 λεπτά2 έως 4 ώρες
Κόστος μιας εκτέλεσης1 to 3 USD4 to 12 USD
Εκτελέσεις πριν λειτουργήσει3 to 53 to 5
Συνολική δαπάνη GPU3 to 15 USD12 to 60 USD
Μεγαλύτερη γραμμή στον λογαριασμόο βραχίονας, μετά ο χρόνος σαςο βραχίονας, μετά ο χρόνος σας

Το μοτίβο ισχύει και σε αυτό το μέγεθος ρομπότ: ο υπολογισμός είναι ένα σφάλμα στρογγυλοποίησης, το υλικό είναι ένα πραγματικό εφάπαξ κόστος, οι ανθρώπινες ώρες είναι το επαναλαμβανόμενο έξοδο. Για να δοκιμάσετε το μισό της εκπαίδευσης πριν αγοράσετε οτιδήποτε, σας επιτρέπουν να συγκρίνετε μοντέλα και να νοικιάσετε μια GPU χωρίς ρομποτικό βραχίονα, και είναι ένας φυσικός SO-100 που μπορείτε να χειριστείτε στον περιηγητή χωρίς εγγραφή. Για ολόκληρη την αλυσίδα από την αρχή μέχρι το τέλος, ο καλύπτει τη ρύθμιση, και την εκπαίδευση, και είναι η σύντομη έκδοση.

Ο πίνακας εκπαίδευσης AY-Robots με πέντε πολιτικές ως γραμμές και τέσσερις ρομποτικούς βραχίονες ως στήλες, με κάθε κελί να συνδέεται με έναν συγκεκριμένο οδηγό εκπαίδευσης
Ο πίνακας /train: γραμμή για τον προϋπολογισμό σας, στήλη για τον βραχίονα σας, κελί για τον οδηγό με τις προεπιλογές και το κόστος αυτής της ζεύξης.
Πόσο κοστίζει μια εκτέλεση λεπτομερούς ρύθμισης VLA από την αρχή μέχρι το τέλος;

Περίπου 4 έως 12 USD για GR00T N1.7, GR00T N1.5 ή Pi0.5 στην κατηγορία A100 80 GB ή H100 (3 έως 6 ώρες με 1.20 έως 2.00 USD ανά ώρα), και περίπου 1 έως 3 USD για SmolVLA ή ACT στην κατηγορία RTX 4090 (2 έως 5 ώρες με 0.30 έως 0.60 USD ανά ώρα). Η ενοικίαση της κάρτας από εσάς κυμαίνεται στο ίδιο εύρος μόλις υπολογιστεί ο χρόνος εγκατάστασης, καθώς χρεώνεται με τον ρυθμό εκπαίδευσης.

Αξίζει να πληρώσετε για μια H100 έναντι μιας A100 80 GB;

Για μια ενιαία πολιτική SO-100, συνήθως όχι. Και οι δύο καλύπτουν το ελάχιστο όριο μνήμης που χρειάζονται οι GR00T και Pi0.5, και στην ανάγνωση της 23ης Αυγούστου 2026, μια πλήρης A100 80 GB ξεκινούσε από 0.44 USD ανά ώρα έναντι 1.34 για μια H100 80 GB. Η H100 τελειώνει νωρίτερα, οπότε μέρος του κόστους επιστρέφει ως λιγότερες ώρες, αλλά το σύνολο είναι ακόμα υψηλότερο για μια τόσο μικρή εκτέλεση. Το πραγματικό επιχείρημα για την H100 είναι η διαθεσιμότητα: πέντε προσφορές για μία H100 80 GB σε αυτή την αγορά έναντι δύο A100 80 GB, και μια κάρτα που δεν μπορείτε να νοικιάσετε δεν έχει τιμή.

Πόσες εκτελέσεις χρειάζονται πριν μια πολιτική λειτουργήσει πραγματικά;

Σχεδιάστε για τρεις έως πέντε. Η πρώτη αποδεικνύει ότι η αλυσίδα είναι σωστά συνδεδεμένη. Η δεύτερη συνήθως αποκαλύπτει ένα πρόβλημα στο σύνολο δεδομένων, όπως μια ροή κάμερας που σταμάτησε στη μέση. Η τρίτη ή η τέταρτη είναι αυτή που κρατάτε.

Μπορώ να εκπαιδεύσω SmolVLA ή ACT στη δική μου GPU αντί να νοικιάσω;

Ναι. Και οι δύο υποστηρίζονται τοπικά στα AY-Robots και οι δύο χωράνε άνετα σε 24 GB. Η αρχική εργασία ACT εκπαίδευσε το μοντέλο 80M σε περίπου 5 ώρες σε μια RTX 2080 Ti 11 GB. Οι GR00T και Pi0.5 είναι μόνο για το cloud εδώ επειδή τα τεκμηριωμένα ελάχιστα όρια λεπτομερούς ρύθμισης των προμηθευτών είναι 40 GB και 70 GB, και η μεγαλύτερη κάρτα καταναλωτή στην αγορά είναι η RTX 5090 32 GB.

Γιατί ο ίδιος αριθμός βημάτων κοστίζει διαφορετικά ποσά σε διαφορετικά μοντέλα;

Τα βήματα δεν είναι συγκρίσιμα μεταξύ των πολιτικών. Το ACT προεπιλέγει 100.000 βήματα με batch 8 σε κάρτα 24 GB. Το GR00T N1.5 προεπιλέγει 2.000 βήματα με batch 1 και συσσώρευση κλίσης 16 σε κάρτα 80 GB. Η χρέωση είναι ώρες πολλαπλασιασμένες με τον ρυθμό της κάρτας στην οποία σας αναγκάζει το αποτύπωμα μνήμης, όχι ο μετρητής βημάτων.

Δείτε πόσο θα κόστιζε η εκτέλεσή σας πριν την ξεκινήσετε

Κάθε μία από τις πέντε πολιτικές αναφέρει την κατηγορία GPU, τον χρόνο εκτέλεσης και την τιμή ανά εκτέλεση, και το backend εκπαίδευσης νοικιάζει την κάρτα στην ίδια spot αγορά όπου μετρήθηκαν αυτοί οι αριθμοί.

Ελέγξτε την τιμολόγηση

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started