טבלת עלויות AY-Robots המציגה איזה GPU נדרש לכל אחת מחמש המדיניות, זמן הריצה הטיפוסי והמחיר לריצה, וכמה פרקים נדרשים לפני שהמדיניות שימושית
אימון VLAעלויות GPUSO-100כוונון עדיןלמידת רובוטיםתקצוב

עלות אימון VLA: מה באמת עולה הרצת כוונון עדין

AY-Robots ResearchAugust 23, 202623 דקות קריאה

מחירי GPU אמיתיים בשוק הספוט, כמה זמן רצה כל אחת מחמש המדיניות, מה עולה הזרוע וההדגמות, וארבעת המקומות שבהם הכסף נעלם בשקט.

הגרסה הקצרה

  • הרצה בשכבת A100 80 GB או H100 אורכת 3 עד 6 שעות ועולה כ-4 עד 12 דולר ארה"ב. בשכבת RTX 4090 היא אורכת 2 עד 5 שעות וכ-1 עד 3 דולר ארה"ב.
  • נמדד ב-vast.ai בשעה 13:44 UTC ב-23 באוגוסט 2026: RTX 4090 מלא לפי דרישה ב-0.13 עד 0.38 דולר ארה"ב/שעה, A100 80 GB ב-0.44 עד 0.67, H100 80 GB ב-1.34 עד 2.34. כרטיסי 80 GB מלאים נדירים, שתי וחמש הצעות לכרטיס בודד בהתאמה.
  • ה-GPU הוא השורה הזולה ביותר. רשימת החומרים של SO-ARM100 מעמידה זוג מוביל ועוקב על 229.88 דולר ארה"ב, שזה 77 עד 230 הרצות בשכבת 24 GB.
  • שעתיים של אדם המקליט 50 פרקים עולות יותר מהרצת האימון שאותם פרקים מזינים.
  • כסף נעלם בארבעה מקומות: הרצות על נתונים שבורים, מודלי 3B למשימות שמדיניות 80M מטפלת בהן, GPUs שאף אחד לא השמיד, והרצות חוזרות של תוצאה שלא הצלחת לשמור.
  • AY-Robots מתאימה את הכרטיס לפי ה-VRAM שהמודל דורש ומשכירה אותו באותו שוק ספוט, כך שעלות ההרצה היא עלות השוק.

לחשבון יש ארבע שורות, וה-GPU היא הקטנה ביותר

כשאנשים שואלים כמה עולה לכוונן עדין מודל ראייה-שפה-פעולה, עבור SO-100, הם כמעט תמיד מתכוונים להשכרת ה-GPU. זהו המספר שמופיע כחיוב בכרטיס, ולכן הוא זה שמרגיש אמיתי. הוא גם, בפער גדול, הקטן מבין ארבעת המספרים שמחליטים מהי עלותה האמיתית של מדיניות עובדת.

שורהמה זהגודל טיפוסי למדיניות עובדת אחת
זמן GPUהשכרת כרטיס להרצה1 עד 12 דולר ארה"ב להרצה, ותבצע 3 עד 5
הרובוטסרוואים, מסגרת מודפסת, מצלמות, כבלים, חשמלחד פעמי, 110 עד 500 אירו לזרוע
שעות אדםאדם המפעיל את הזרוע להקלטת הדגמות1 עד 4 שעות לכל מערך נתונים, חוזר על עצמו לכל משימה
בזבוזנתונים גרועים, מודלים גדולים מדי, פודים נשכחיםבלתי מוגבל, והשורה היחידה שאתה שולט בה

זמני האימון שלהלן מגיעים ממאמרים ומאגרי המידע של חמשת המודלים עצמם, עלות החומרה מגיעה מרשימת החומרים שפורסמה, מספרי הפלטפורמה מגיעים מ-AY-Robots קטלוג המדיניות ו-דף התמחור. במקומות שבהם הפלטפורמה אינה מסייעת, מאמר זה מציין זאת.

כמה עולה שעת GPU בפועל בשוק הספוט

אין מחיר יחיד לשעת A100. בשוק כמו vast.ai כל מארח קובע את התעריף שלו, ו-הרצת האימון שאתה משיק נוחתת על המכונה הזולה והפנויה באותו רגע. התשובה הכנה היא התפלגות. הנה היא, נמדדה ב-23 באוגוסט 2026 בשעה 13:44 UTC: כרטיסים מלאים בודדים, לפי דרישה, מסוננים לפי VRAM אמיתי.

כרטיסvast.ai לפי דרישה USD/שעה (נמוך / חציוני / גבוה)הצעות כרטיס מלאמחיר רצפה vast.aiRunPod קהילה / מאובטחHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74לא מוצע
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99לא מוצע
A100 80 GB, PCIe או SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 כ-Space
H100 80 GB, SXM או PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 כנקודת קצה
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19לא מוצע
כיצד צולם צילום מסך זה, ומה הוא אינו

הצעות לפי דרישה עבור GPU מלא יחיד (gpu_frac == 1.0) מ-API החבילות הציבורי של vast.ai, שאינו דורש חשבון, מסוננות לפי gpu_ram כך שרק כרטיסי 80 GB אמיתיים יופיעו בשורות ה-80 GB. מסנן זה חשוב: בקריאה זו, כל שלוש הצעות ה-A100 SXM4 עם כרטיס יחיד היו חלקי 40 GB, וכך גם שתיים מתוך ארבע הצעות ה-A100 PCIE, כך שאיחודן לשורת "A100" אחת היה מוריד בחצי את המחיר המדווח כאן. העמודה של Hugging Face משלבת שני מוצרים: 2.50 USD/h הוא חומרת ה-Nvidia A100 - large Spaces ו-4.50 USD/h הוא H100 80 GB יחיד תחת Inference Endpoints, ש-Spaces אינה מציעה. יש להתייחס לחציונים כאינדיקטיביים: שורת ה-A100 80 GB מבוססת על שתי הצעות ושורת ה-H100 על חמש, ושאילתה זהה 36 שניות לאחר מכן החזירה ספירת 4090 שונה ומחיר שיא שונה בשלוש מתוך חמש השורות. מחירי המחירון של RunPod הם המספר היציב יותר לתכנון מולו.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
השאילתה המדויקת שמאחורי הטבלה לעיל, שהורצה פעמיים במהלך כתיבת קטע זה. הרץ אותה לפני שתסמוך על כל מאמר תמחור GPU, כולל זה.
טבלת עלויות של AY-Robots המציגה איזה GPU כל מדיניות דורשת, זמן ריצה אופייני ומחיר לריצה, וכמה פרקים נדרשים לפני שהמדיניות שימושית.
טבלת העלויות ב-/try: כרטיס, זמן ריצה, מחיר לריצה ומספר פרקים מינימלי למדיניות.

מדוע מודלי ה-3B אינם יכולים להשתמש בכרטיס הזול

שעת 4090 ושעת H100 80 GB נבדלות בערך פי שישה בממוצעים החציוניים לעיל. מה שמאלץ אותך להשתמש בכרטיס היקר הוא לא מהירות, אלא זיכרון. openpi קובע את הרף עבור Pi0.5 מלא כוונון עדין ב-70 GB, ו-NVIDIA ממליצה על 40 GB או יותר עבור GR00T. שימו לב מה המספר של GR00T אינו. תצורת הכוונון העדין שלו מקפיאה את מודל השפה ואת המקודד הוויזואלי כברירת מחדל (tune_llm ו-tune_visual הם False, המקרן וראש הדיפוזיה הם True), ולכן הקטלוג מפרט כ-40 מיליון פרמטרים מאומנים מתוך 3 מיליארד. ה-40 GB אינו מצב אופטימייזר עבור 3 מיליארד משקלים, אלא עמוד השדרה הקפוא בתוספת הפעלות. גרסאות בהיקף מצומצם יורדות נמוך יותר: נתיב ה-LoRA של openpi דורש 22.5 GB ומציין את ה-4090, ותהליך העבודה של Isaac Lab Arena של NVIDIA מפרט אפשרות של 24 GB עם GPU יחיד עבור GR00T לאחר אימון. הפלטפורמה מדורגת לפי הרף שכל ספק מפרסם עבור התצורה שהוא מריץ בפועל. המאמר על התאמת זרימה של pi0 מסביר מאיפה מגיע התאמת זרימה טביעת הרגל הזו.

משימהזיכרון שהפרויקט המקורי דורשמקור
הסקת מסקנות pi0 / pi0.5יותר מ-8 GB, לדוגמה RTX 4090openpi
כוונון עדין LoRA של pi0 / pi0.5יותר מ-22.5 GB, לדוגמה RTX 4090openpi
כוונון עדין מלא של pi0 / pi0.5יותר מ-70 GB, לדוגמה A100 80 GB או H100openpi
הסקת מסקנות GR00T N1.7GPU אחד עם 16 GB או יותרIsaac-GR00T
כוונון עדין GR00T N1.7מומלץ 40 GB או יותר, צמתי H100 או L40Isaac-GR00T
כוונון עדין GR00T, מה הוא מאמןמקרן וראש דיפוזיה; LLM ומקודד ויזואלי קפואים כברירת מחדלfinetune_config.py
GR00T לאחר אימון, מופחתGPU אחד עם 24 GB, מודל שפה קפואIsaac Lab Arena
כוונון עדין SmolVLAA100 יחיד עבור הרצת הייחוס של 20,000 צעדיםlerobot docs
אימון ACTRTX 2080 Ti יחיד של 11 GBACT paper

טבלה זו היא הסיבה לכך שהפלטפורמה מפצלת את חמשת המודלים לשתי רמות. GR00T N1.7, GR00T N1.5 ו-Pi0.5 פועלים על A100 80 GB או H100 מכיוון שזה מה שהספקים דורשים. SmolVLA ו-ACT פועלים על RTX 4090 או כל כרטיס 24 GB מכיוון שזה באמת מספיק.

המלכודת שאוכלת יום: השכרת הכרטיס הזול עבור המודל הגדול

הרצת GR00T או Pi0.5 על כרטיס 24 GB לא נכשלת בשנייה הראשונה. היא מורידה את נקודת הבסיס, בונה את אינדקס מערך הנתונים, מתחילה את המעבר קדימה הראשון ומתה לאחר כמה מאות צעדים עם שגיאת CUDA של חוסר זיכרון. שילמת על ההורדה וההגדרה ולא קיבלת כלום. תיקונים: חוסר זיכרון במהלך אימון.

כמה זמן כל אחד מחמשת המודלים באמת פועל

זמן הריצה הוא החצי השני של העלות: 2.00 דולר לשעה אינו רלוונטי אם העבודה היא 40 דקות והרסני אם היא 40 שעות. אלו הן הגדרות ברירת המחדל ש-AY-Robots באמת שולח למאמן, יחד עם חלון הריצה והעלות עבור כל רמה.

מדיניותרמת GPUמספר צעדים מקסימלי כברירת מחדלגודל אצווה כברירת מחדל (צבירת גרדיאנטים)חלון ריצהעלות לריצה
GR00T N1.7, ~3BA100 80 GB or H10020,00032, צבירה 1, חל3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, צבירה 16, חל3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, צבירה 16, ללא השפעה3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, צבירה 8, ללא השפעה2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, צבירה 12 to 5 h1 to 3 USD
טבלת השוואה של חמש המדיניות הניתנות לאימון ב-AY-Robots המציגה את ספירת הפרמטרים, GPU נדרש, חביון הסקה ומספר פרקים מינימלי
חמש המדיניות זו לצד זו: פרמטרים, רמת GPU, חביון לכל צעד פעולה, מינימום פרקים.

מאיפה מגיעים חלונות ההרצה האלה במעלה הזרם

  • SmolVLA: התיעוד של lerobot מציין ש-20,000 צעדים אורכים כ-4 שעות על A100 יחיד. הפלטפורמה מריצה את אותם 20,000 צעדים על שכבת ה-24 GB הזולה יותר, ולכן מדובר בחלון זמן ולא ב-4 שעות קבועות.
  • ACT: המאמר המקורי של ALOHA מדווח על כ-5 שעות על RTX 2080 Ti יחיד עם 11 GB עבור מודל עם 80 מיליון פרמטרים. כרטיס 4090 חדש יותר בכמה דורות, אך הפלטפורמה מתקצבת 100,000 צעדים, כך שחלון הזמן נוחת באותו מקום.
  • GR00T: זרימת העבודה הייחוסית של NVIDIA עבור דור N1.6 מציינת כ-4 עד 8 שעות עבור 20,000 צעדים באצווה 24 על שמונה כרטיסי L40S, ו-2 עד 3 שעות עבור 30,000 צעדים באצווה 16 על כרטיס Ada 6000 יחיד. כוונון עדין (fine-tuning) של VLA בגודל 3B על כרטיס יחיד תוך מספר שעות הוא נורמלי, לא אופטימי.
  • Pi0.5: openpi אינו מפרסם נתון זמן שעון קיר, אך הוא כן מפרסם את רף ה-70 GB עבור כוונון עדין מלא, מה שמקבע את הכרטיס ולכן את הקצב.

כדאי להתעכב על המספר שאתם לא משלמים עליו. המאמר של GR00T N1 מדווח על כ-50,000 שעות GPU של H100 לאימון מוקדם של מודל ה-2.2B, על אשכול של עד 1024 מעבדי GPU, בגודל אצווה של 16,384 עבור 200,000 צעדי גרדיאנט. במחיר של 1.34 עד 2.34 דולר לשעה שנמדד לעיל, מדובר בסדר גודל של 67,000 עד 117,000 דולר של כוח חישוב שכור. המאמר של SmolVLA מעריך את הפרויקט בכ-30,000 שעות GPU על פני 481 מערכי נתונים קהילתיים, 22.9K פרקים ו-10.6M פריימים. אתם יורשים את כל זה במחיר הורדה; 8 הדולרים שלכם קונים את 20,000 הצעדים האחרונים. מדוע VLAs נבנים באופן זה מכסה את החלוקה הזו.

הזרוע: עלות חד פעמית שמגמדת את חשבון ה-GPU

הרצת אימון עולה פחות מארוחת צהריים. הרובוט לא. זו הסיבה ש-SO-100 חשוב: זוהי הזרוע הזולה ביותר שכל למידת חיקוי שרשרת הכלים תומכת בה בפועל.

זרועסרוויםמתחעלות חלקיםתמיכה ב-AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURמלאה, זרוע ייחוס
SO-101Feetech STS32157.4 V130 to 170 EURמלאה
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURתואמת
LeKiwiזרוע Feetech STS3215, בסיס גלגלים7.4 V arm, 12 V base400 to 500 EURתואמת

רשימת החומרים (BOM) במאגר SO-ARM100 מפורטת יותר ושווה בדיקה מול האזור שלכם: חלקים לשתי זרועות רשימה מסתכמת ב-229.88 USD או 226.30 EUR עבור הגדרת מנהיג ועוקב, ו-חלקים לזרוע עוקבת אחת רשימה מסתכמת ב-121.94 USD או 124.30 EUR. שישה סרווים מסוג STS3215 במחיר 13.89 USD כל אחד הם 83.34 מתוך ה-121.94, כך שהסרווים הם הזרוע. בעלות של 1 עד 3 USD להרצת SmolVLA או ACT, זוג זרועות אחד שווה בין 77 ל-230 הרצות אימון. אם אתם עדיין בוחרים, SO-100 מול SO-101 היא ההשוואה החשובה, מכיוון שהשניים קרובים מספיק כדי שההחלטה תהיה על זמינות ולא על יכולת.

7.4 V, לא 12 V

ה-STS3215 נשלח בגרסת 7.4 V ובגרסת 12 V; המאגר מציין שחלק ה-12 V דורש גם ספק כוח של 12 V 5 A במקום ספק ה-5 V, כך ששניהם אינם ניתנים להחלפה. הזנת 12 V לסרווים של 7.4 V הורסת אותם, ושישה סרווים מהווים שני שלישים מעלות החלקים של זרוע עוקבת. בדקו את התווית על כל סרוו לפני ההפעלה הראשונה. אם הסרווים כבר מתנהגים באופן מוזר: הסרוו אינו מגיב, הזרוע רועדת ואז צונחת.

שעות אדם: השורה שאף אחד לא מכניס לגיליון האלקטרוני

זהו המספר שהופך את דיון העלויות על פיו. הקלטת הדגמות היא אדם המזיז זרוע רובוטית, אפיזודה אחת בכל פעם, בזמן אמת. אין אפשרות לבצע אצווה או לשכור לפי שנייה. מקליט מערך הנתונים של LeRobot מגיע עם ברירות מחדל שמקלות על החישוב, שלושתן מאושרות ב-DatasetRecordConfig: 60 שניות לכל אפיזודה, 60 שניות לאיפוס הסצנה, 50 אפיזודות. עמודת הכסף למטה מניחה 15 דולר לשעת עבודה של אדם, וזוהי הנחה ולא מספר פלטפורמה. החליפו בתעריף שלכם; היחס הוא העיקר.

  1. 1
    הקליטו את מערך הנתונים עם ברירות המחדל שעבורן תחויבו בפועל

    זוהי גרסה 0.6.1 של lerobot, הגרסה ב-PyPI נכון ל-3 באוגוסט 2026. שימו לב למבנה ה-CLI: ההקלטה מתבצעת דרך נקודת הכניסה לקונסולה lerobot-record (lerobot.scripts.lerobot_record), ולא דרך נתיב המודול הישן python -m lerobot.scripts.record. AY-Robots מכוון לגרסה 0.5.1, וגלגל 0.5.1 מצהיר על אותן נקודות כניסה lerobot-record ו-lerobot-train, כך שהמבנה שלהלן יציב בשתיהן. שלושת דגלי התזמון הם ברירות המחדל של ה-upstream, כך שזו גם הפקודה שהחישוב בטבלה הבאה מניח.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    הסתכלו על מה שהקלטתם לפני שאתם שוכרים דקת GPU אחת

    בדיקת מערך נתונים עולה אפס דולר לשעה. גילוי אותה בעיה מעקומת הפסד עולה 2.00 דולר לשעה בשכבת H100 ומודיע לכם באיחור של ארבע שעות. דחפו את מערך הנתונים ובדקו אותו במציג של LeRobot, או עיינו בספריית מערכי הנתונים של AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    אמנו, וודאו שנקודת השמירה שורדת את הפוד

    מכונה שכורה היא זמנית בהגדרה, לכן כתבו נקודות שמירה (checkpoints) למקום עמיד במהלך הריצה. שני דגלים קובעים אם תשמרו את מה ששילמתם עבורו. --save_freq מוגדר כברירת מחדל ל-20,000 צעדים, כך שריצת SmolVLA של 20,000 צעדים כברירת מחדל כותבת את נקודת השמירה הראשונה שלה כשהריצה כבר הסתיימה; הורידו אותה לפני שאתם שוכרים משהו שניתן להפסיק. --save_checkpoint_to_hub דורש --policy.repo_id ואינו קיים ב-lerobot 0.5.1, כך שבגרסה זו תצטרכו להעתיק את ספריית הפלט מהמכונה בעצמכם. גודל האצווה שלהלן הוא הדוגמה של תיעוד ה-upstream; טופס AY-Robots שולח 2 עבור SmolVLA וכותב לאחסון אובייקטים ככל שנקודות השמירה מופיעות.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
אפיזודותהקלטה ב-60 שניותאיפוס ב-60 שניותזמן שעון קירבתוספת 20 אחוז הקלטות חוזרותב-15 דולר לשעת אדם
30, המינימום של SmolVLA30 דקות30 דקותשעה אחתשעה ו-12 דקותכ-18 דולר
50, ארבעת המינימום האחרים50 דקות50 דקותשעה ו-40 דקותשעתייםכ-30 דולר
100, מערך נתונים נוח100 דקות100 דקות3 שעות ו-20 דקות4 שעותכ-60 דולר

השוו את העמודה הימנית עם עלות ההרצה של 1 עד 12 דולר ארה"ב. בשיעור משוער זה, מערך נתונים של 50 פרקים עולה פי שניים עד שבעה יותר להקלטה מאשר לאימון עליו, לפני כיול, הגדרת מצלמה והפרקים שאתם זורקים. זו הסיבה ש יש לה ערך כספי ישיר. מדריך LeRobot מציע לפחות 50 פרקים עם 10 לכל מיקום אובייקט; מסמכי SmolVLA מדווחים שגרסת 25 פרקים של אותה משימה לא הספיקה.

לאן הכסף באמת נעלם

1. הרצות על נתונים שמעולם לא היו עובדים

הרצת GR00T של 20,000 צעדים על מערך נתונים עם שני זרמי מצלמה שהוחלפו עולה כמו הרצה על מערך נתונים נקי, לוקחת את אותו זמן, ומייצרת עקומת הפסד שנראית בסדר. הכשל מופיע על הזרוע, שעות מאוחר יותר. מחויבים לפי שעה ואבחון מחויב בימים. שני סימפטומים שכדאי לזכור: בדרך כלל אומר שהתצפיות אינן נושאות את מה שהמשימה דורשת, ו- אומר שלמערך הנתונים הייתה פחות וריאציה ממה שחשבתם.

2. תשלום מחירי מודל יסוד עבור משימה עם מצלמה קבועה

ACT הוא בערך 80 מיליון פרמטרים ותוכנן להתאמן מאפס על 50 הדגמות של משימה אחת. GR00T N1.7 הוא בערך 3 מיליארד עם עמוד שדרה מאומן מראש. עבור מצלמה מקובעת, שולחן קבוע ואובייקט אחד, מודל ה-80 מיליון לעיתים קרובות מגיע ליעד, פועל בקצב של כ-20 אלפיות השנייה לכל שלב פעולה במקום 152 אלפיות השנייה, ועולה 1 עד 3 דולר לריצה במקום 4 עד 12. הוציאו 3 דולר כדי לגלות אם המודל הזול עובד לפני שתוציאו 12 דולר על היקר. ACT מול SmolVLA ו-GR00T N1.7 מול Pi0.5 מראים היכן כל אחד מפסיק להיות התשובה הנכונה; ה-זירת המודלים מכילה 85 מודלים ו-332 תוצאות בנצ'מרק.

3. ה-GPU ששכחתם

הטעות הזולה ביותר למנוע והנפוצה ביותר לעשות. מופע שהופעל ביום שישי כדי לנפות באגים במשהו מחויב לאורך סוף השבוע באותו קצב כמו ריצה אמיתית.

כרטיסקצב חציוני בצילום המצבבטלה למשך 24 שעותבטלה למשך 7 ימיםשווה ערך ל
RTX 40900.32 USD/h7.68 USD53.76 USDכ-27 הרצות של SmolVLA או ACT בעלות של 2 דולר
A100 80 GB0.56 USD/h13.44 USD94.08 USDכ-12 הרצות של GR00T בעלות של 8 דולר
H100 80 GB1.80 USD/h43.20 USD302.40 USDכ-38 הרצות של GR00T בעלות של 8 דולר

ב-AY-Robots, כשל זה מתוכנן מראש כך שלא יתרחש עבור הסקה (inference): פודים המסופקים על ידי ה-API של ההסקה נושאים 'כלב שמירה' (watchdog) של חוסר פעילות ומשמידים את עצמם לאחר תקופת בטלה. אם אתה שוכר את הכרטיס בעצמך, כלב השמירה הזה הוא תזכורת היומן שלך.

4. תשלום כפול עבור אותה תשובה

נקודת הכניסה לכוונון עדין (fine-tuning) של GR00T היא CLI מסוג tyro שאינו חושף seed. זו אינה מגבלת פלטפורמה, אלא הכלי במעלה הזרם (upstream): אין שדה seed ב-gr00t/configs/finetune_config.py, והטיפים לאימון של המאגר עצמו מזהירים שהרצות משתנות ב-5 עד 6 אחוזים מכיוון שהגדלות התמונה (image augmentations) אינן דטרמיניסטיות. lerobot מוגדר כברירת מחדל ל-seed 1000 גם בגרסאות 0.5.1 וגם ב-0.6.1, כך שהרצות של ACT, SmolVLA ו-Pi0.5 יכולות לפחות להיות מורצות מחדש מאותה אתחול וסדר נתונים. זו אינה הבטחה למשקלים זהים ברמת הביט (bit-identical) על GPU, אך זה ההבדל בין הרצה חוזרת לניסוי חדש. אם הרצת GR00T מייצרת מדיניות שעובדת ולא שמרת את ה-נקודת בקרה, אתה משלם מחיר מלא עבור תוצאה שעשויה להיות שונה ביותר מההבדל שרדפת אחריו. יש דרך שנייה לאבד נקודת בקרה ששילמת עליה: ה-CLI מוגדר כברירת מחדל ל---save-total-limit 5, המתועד כמספר המרבי של נקודות בקרה שנשמרות לפני שמחקות הישנות יותר. אחסון עולה סנטים; הרצה חוזרת עולה 4 עד 12 דולר ושש שעות.

קיבולת ניתנת להפרעה היא בחצי מחיר ותהרוג את הריצה שלך

מחירי המינימום למכרזים לעיל הם שבריר מהתעריף לפי דרישה, ו-vast.ai טוענת שמערכת המכרזים יכולה לחתוך את עלויות הלקוח בחמישים אחוזים או יותר. המלכוד, במילותיהם: מופע הניתן להפרעה יכול להיות מושהה בכל עת אם משתמש אחר מציע מחיר גבוה יותר או אם נוצרת השכרה לפי דרישה עבור אותם משאבים, וההשהיה הזו "עוצרת את כל התהליכים הפועלים". לפי דרישה תמיד קודמת. זה בסדר עבור ריצה שכותבת נקודת שמירה כל כמה מאות צעדים, אך הפסד מוחלט עבור ריצה שכותבת בסוף, וזה בדיוק מה שברירות המחדל נותנות לך: ה-CLI של Isaac-GR00T כותב כל --save-steps (ברירת מחדל 1000), אך --save_freq של lerobot מוגדר כברירת מחדל ל-20,000 צעדים, כך שריצת SmolVLA כברירת מחדל שומרת נקודת שמירה פעם אחת, בקו הסיום. הורד את זה, או אל תציע מחיר. טופס האימון של AY-Robots חושף את כפתור ה-GR00T כ-saveSteps.

השכרת הכרטיס בעצמך
יתרונות
  • התעריף השעתי הנמוך ביותר שיש.
  • שליטה מלאה בתמונה, בגרסת CUDA, בגרסת lerobot או Isaac-GR00T ובכל דגל.
  • הצעות מחיר ניתנות להפרעה חותכות את התעריף בחצי אם הריצה שלך שומרת נקודות שמירה לעיתים קרובות מספיק כדי לשרוד הפסקה.
  • שום דבר לא מופשט, כך שכאשר ריצה מתנהגת באופן מוזר אתה יכול לראות מדוע.
פשרות
  • הגדרת המערכת מחויבת בתעריפי GPU: דרייברים, תלויות, נקודת השמירה הבסיסית בגודל מספר ג'יגה-בייט והורדת מערך הנתונים – כל אלה עולים אותו דבר לשעה כמו האימון.
  • מופע הניתן להפרעה שהוצע עליו מחיר גבוה יותר מושהה ותהליכיו נקטלים. ריצה שלא נשמרה היא כסף שנשרף, וברירת המחדל של lerobot כותבת את נקודת השמירה הראשונה שלה בצעד 20,000.
  • שום דבר לא הורס את ה-pod עבורך. הטבלה הריקה לעיל היא החשבון על השכחה.
  • היצע כרטיסי 80 GB מלאים בודדים דל: שתי הצעות A100 80 GB וחמש הצעות H100 80 GB מלאות בקריאה זו. הרישום גם משתנה, כך שהמחיר הנמוך ביותר הרשום והמחיר שאתה יכול לשכור בפועל אינם אותו מספר.
  • כל שעה על תשתית היא שעה שלא הושקעה בהקלטת הפרקים שמחליטים אם המדיניות עובדת.

לעשות זאת בעצמך לעומת לתת לפלטפורמה לשכור את הכרטיס

אתה בוחר את המכונה, בונה את הסביבה והורס את ה-pod. התעריף השעתי הוא תעריף השוק לעיל; כל השאר הוא הזמן שלך.

  1. מצא כרטיס התואם את ה-VRAM שהמודל דורש: 24 GB עבור ACT ו-SmolVLA, 80 GB עבור GR00T ו-Pi0.5.
  2. שכור לפי דרישה אם הריצה אינה יכולה לשרוד הפסקה, או ניתנת להפרעה אם היא שומרת נקודות שמירה לעיתים קרובות.
  3. התקן את שרשרת הכלים: lerobot עבור ACT, SmolVLA ו-Pi0.5, מאגר Isaac-GR00T עם מפעיל tyro משלו עבור GR00T.
  4. המר את מערך הנתונים אם יש צורך. מערך נתונים LeRobot v3.0 קורס בטוען של GR00T וחייב להיות מומר ל-v2.1.
  5. הפעל, צפה בהפסד, דחוף נקודות שמירה למקום עמיד כשהן נכתבות.
  6. הרוס את המופע, ואז ודא שהרסת אותו.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
נקודת הכניסה הנוכחית לכוונון עדין של Isaac-GR00T, תואמת לפקודה בקובץ ה-README של המאגר. ל-CLI זה אין דגל seed, ולכן ריצות GR00T אינן ניתנות לשחזור ביט-אחר-ביט.

עלות ריאלית לריצת GR00T אחת: 3 עד 6 שעות על H100 80 GB בתעריף של 1.34 עד 2.34 דולר לשעה היא 4 עד 14 דולר, בתוספת 20 עד 40 דקות של הגדרה שמחויבת גם היא, בתוספת הזמן שלך.

מה הפלטפורמה גובה ואיך היא בוחרת את הכרטיס

הלוגיקה משעממת בכוונה. כל מודל ב-קטלוג מצהיר על רמת GPU; ה-backend לוקח את ה-VRAM הנדרש ושוכר כרטיס תואם באותו שוק ספוט שנמדד לעיל. זו הסיבה שהעלות המצוטטת היא טווח, לא מחיר. GR00T ו-Pi0.5 זמינים כאן רק בענן בגלל רצפות ה-40 GB וה-70 GB. SmolVLA ו-ACT פועלים גם מקומית על כרטיס ה-24 GB שלך, כאשר עלות הענן היא אפס והחשמל הוא הבעיה שלך.

עמוד התמחור של AY-Robots המציג את עלות ריצת אימון וגישה לפלטפורמה
עמוד התמחור. נתוני עלות לריצה עוקבים אחר שוק הספוט ולא אחר מחיר מחירון קבוע.

פרמטר אחד ראוי לאזהרה. צבירת גרדיאנטים (Gradient accumulation) אכן חלה על שתי גרסאות GR00T, כך שהעלאתה קונה אצווה אפקטיבית גדולה יותר על אותו כרטיס. עבור Pi0.5 ו-SmolVLA היא אינה חלה כלל: ל-lerobot 0.5.1 אין אפשרות צבירת גרדיאנטים בתצורת האימון שלה, כך שהגדרת השדה ל-16 לא עולה כלום ולא קונה כלום. אם עבודה בתור לא מתחילה לעולם, העמוד על עבודה שנתקעה בתור מכסה מה לבדוק; אם מערך הנתונים נדחה לפני שהריצה מתחילה, זו כמעט תמיד בעיית פורמט v3.0.

המגבלה שפלטפורמה זו אינה פותרת: השהיה

GPU מושאל המשרת את המדיניות שלך דרך האינטרנט הציבורי מוסיף זמני הלוך ושוב ללולאת בקרה שכבר אורכת 20 עד 485 אלפיות השנייה לכל שלב פעולה. זה בסדר עבור איסוף והנחה איטיים, אך לא עבור תנועה תגובתית מהירה. הסקת מסקנות בענן (Cloud inference) מעריכה נקודת ביקורת היטב ומבצעת מניפולציה בייצור בצורה גרועה: אם המשימה דורשת מהירות, החישוב חייב להיות ליד הסרווים, וזו עלות שמאמר זה אינו יכול להעלים. ראה השהיית הסקה.

תקציב מפורט עבור מדיניות עבודה ראשונה

כל ארבעת השורות יחד, החל מכלום. סך ה-GPU מניח 3 עד 5 הרצות: הראשונה מוכיחה שהצינור עובד, השנייה חושפת בעיית נתונים, השלישית או הרביעית היא זו שאתה שומר.

סעיףנתיב רזהנתיב נוח
זרועSO-100 follower בלבד, 121.94 USD ב-BOMleader פלוס follower, 229.88 USD ב-BOM
מודלSmolVLA או ACT, שכבת 24 GBGR00T N1.7, שכבת A100 80 GB או H100
פרקים שהוקלטו30, המינימום של SmolVLA50 עד 100
זמן אנושי להקלטהכשעה ו-12 דקות2 עד 4 שעות
עלות הרצה אחת1 עד 3 USD4 עד 12 USD
הרצות לפני שזה עובד3 עד 53 עד 5
הוצאה כוללת על GPU3 עד 15 USD12 עד 60 USD
הסעיף הגדול ביותר בחשבוןהזרוע, ואז הזמן שלךהזרוע, ואז הזמן שלך

התבנית נשמרת בגודל רובוט זה: כוח חישוב הוא שגיאת עיגול, חומרה היא עלות חד-פעמית אמיתית, שעות אדם הן ההוצאה החוזרת. כדי לבדוק את חצי האימון לפני רכישת משהו, נקודות הכניסה ללא חומרה מאפשרות לך להשוות מודלים ולשכור GPU ללא זרוע, ו-הזרוע החיה היא SO-100 פיזית שתוכל להפעיל בדפדפן ללא הרשמה. עבור הצינור המלא מקצה לקצה, ה-מדריך SO-100 המלא מכסה הגדרה, טלאופרציה ואימון, ו-אמן את המדיניות הראשונה שלך היא הגרסה הקצרה.

מטריצת האימון של AY-Robots עם חמש מדיניות כשורה וארבע זרועות רובוטיות כעמודות, כאשר כל תא מקשר למדריך אימון ספציפי
מטריצת ה-/train: שורה לתקציב שלך, עמודה לזרוע שלך, תא למדריך עם ברירות המחדל והעלות של אותו זיווג.
כמה עולה הרצת כוונון עדין אחת של VLA מקצה לקצה?

כ-4 עד 12 דולר עבור GR00T N1.7, GR00T N1.5 או Pi0.5 בשכבת A100 80 GB או H100 (3 עד 6 שעות ב-1.20 עד 2.00 דולר לשעה), וכ-1 עד 3 דולר עבור SmolVLA או ACT בשכבת RTX 4090 (2 עד 5 שעות ב-0.30 עד 0.60 דולר לשעה). השכרת הכרטיס בעצמך נופלת באותו טווח לאחר שזמן ההגדרה נספר, מכיוון שהיא מחויבת לפי תעריף האימון.

האם H100 שווה את התשלום מעל A100 80 GB?

עבור מדיניות SO-100 בודדת, בדרך כלל לא. שניהם עומדים בדרישות הזיכרון ש-GR00T ו-Pi0.5 זקוקים להן, ובקריאה מ-23 באוגוסט 2026, A100 80 GB מלא החל ב-0.44 דולר לשעה לעומת 1.34 דולר עבור H100 80 GB. ה-H100 מסיים מוקדם יותר, כך שחלק מהתעריף חוזר כפחות שעות, אך הסכום הכולל עדיין גבוה יותר עבור הרצה קטנה זו. הטיעון האמיתי ל-H100 הוא זמינות: חמש הצעות H100 80 GB בודדות בשוק זה לעומת שני A100 80 GB, ולכרטיס שאינך יכול לשכור אין מחיר.

כמה הרצות נדרשות לפני שמדיניות באמת עובדת?

תכנן שלוש עד חמש. הראשונה מוכיחה שהצינור מחובר נכון. השנייה בדרך כלל חושפת בעיית מערך נתונים כגון זרם מצלמה שמת באמצע. השלישית או הרביעית היא זו שאתה שומר.

האם אוכל לאמן את SmolVLA או ACT על ה-GPU שלי במקום לשכור?

כן. שניהם נתמכים מקומית ב-AY-Robots ושניהם נכנסים בנוחות ב-24 GB; מאמר ACT המקורי אימן את מודל ה-80M שלו בכ-5 שעות על RTX 2080 Ti בנפח 11 GB. GR00T ו-Pi0.5 הם רק בענן כאן מכיוון שרצפות הכוונון העדין המתועדות של הספקים הן 40 GB ו-70 GB, וכרטיס הצרכנים הגדול ביותר בשוק הוא RTX 5090 בנפח 32 GB.

מדוע אותו מספר צעדים עולה סכומים שונים בין מודלים?

צעדים אינם ניתנים להשוואה בין מדיניות. ACT מוגדר כברירת מחדל ל-100,000 צעדים באצווה 8 על כרטיס 24 GB; GR00T N1.5 מוגדר כברירת מחדל ל-2,000 צעדים באצווה 1 עם צבירת גרדיאנט 16 על כרטיס 80 GB. החשבון הוא שעות מוכפלות בתעריף הכרטיס שדרישות הזיכרון מכריחות אותך להשתמש בו, לא מונה הצעדים.

ראה כמה תעלה הריצה שלך לפני שתתחיל אותה

כל אחת מחמש המדיניות מפרטת את שכבת ה-GPU שלה, זמן הריצה והמחיר לריצה, וקצה העורפי של האימון שוכר את הכרטיס באותו שוק ספוט שבו נמדדו מספרים אלה.

בדוק את התמחור

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started