Die AY-Robots Policy-Vergleichstabelle, die GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA und ACT nebeneinander mit Parameteranzahlen, GPU-Tier, Inferenzlatenz und minimalen Episodenanzahlen zeigt
vla-modellePolicy-TrainingModellauswahllerobotso-100

Welche VLA-Policy sollten Sie 2026 trainieren?

AY-Robots Research23. August 202618 Min. Lesezeit

GR00T N1.7, Pi0.5, SmolVLA, ACT oder GR00T N1.5? Eine Entscheidungstabelle, abgestimmt auf reale Situationen, mit den veröffentlichten Benchmark-Zahlen, Latenz, Kosten pro Lauf und Lizenzen hinter jeder Wahl.

Fünf Richtlinien sind heute auf einem SO-100-Klasse-Arm trainierbar. Sie unterscheiden sich um den Faktor 24 in der Inferenz-Latenz, 37 in der Parameteranzahl und 12 in den Kosten eines Laufs, und darin, ob Sie das Ergebnis versenden dürfen. Fünf Modellkarten werden es nicht klären: keine beantwortet die Frage, die Sie haben, welche soll ich zuerst ausführen?

Jede der untenstehenden Zahlen wurde im August 2026 aus den Papieren, Repositories und Karten entnommen. Plattformzahlen stammen aus dem AY-Robots Richtlinienkatalog; wo die beiden nicht übereinstimmen, werden beide angezeigt.

Die Kurzversion

  • Trainieren Sie ACT zuerst, wenn Sie an Ihrem Datensatz zweifeln: 1 bis 3 USD pro Lauf, nichts vortrainiert, um schlechte Daten zu überdecken.
  • GR00T N1.7 und Pi0.5 liegen innerhalb eines halben Punktes auf LIBERO, 97.0 gegenüber 96.85 bis 97.5. Das ist kein Grund, eines von beiden zu wählen.
  • Pi0.5 ist die Generalisierungsoption, nicht die Genauigkeitsoption, und mit 485 ms die langsamste.
  • SmolVLA, mit 450 M Parametern, ist das einzige VLA hier, das auf einer 24 GB Karte feintuned.
  • ACT mit 20 ms ist die einzige Option für schnelle reaktive Bewegung. Lizenzen entscheiden den Rest.

Die Entscheidungstabelle

Ihre SituationTrainieren Sie diesWarum
Datenqualität unbewiesenACTNichts Vortrainiertes verbirgt einen fehlerhaften Datensatz, und ein Fehlschlag kostet 1 bis 3 USD.
Kontaktreich, mehrstufig, sprachkonditioniertGR00T N1.797,0 % über vier LIBERO-Suiten, plus ein relativer Endeffektor-Aktionsraum.
Schnelle reaktive Bewegung, Inferenz an den ServosACT20 ms. Der nächstschnellste ist 7,6-mal langsamer.
Neue Objekte, neue Szene, offene WeltPi0.5Entwickelt für Out-of-Distribution-Verhalten, über bis zu 104 Standorte hinweg.
Eine 24 GB Karte, immer noch Sprachunterstützung gewünschtSmolVLA450 Mio. Parameter, eine Untergrenze von 30 Episoden, läuft lokal.
Reproduktion eines 2025 aufgezeichneten LaufsGR00T N1.5Nur wenn unbedingt nötig: LeRobot lehnt es jetzt ab, Gewichte nicht-kommerziell.
Dies wird als Produkt ausgeliefertN1.7, SmolVLA or ACTN1.5 ist nicht-kommerziell, Pi0.5 unterliegt Gemma-Bedingungen, SmolVLAs Karte gibt keine an.

Die fünf Kandidaten

Alle fünf sind Policies: Kamera-Frames, Gelenkpositionen und, für vier von ihnen, eine Sprachanweisung, die auf einen Block zukünftiger Gelenkziele abgebildet wird. Was sie unterscheidet, ist, wie viel gelernt wurde, bevor Sie ankamen.

PolicyParameterLatenzGPU-KlasseLokal?Min. EpisodenFormatKosten
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIAs aktuelles Vision-Sprach-Aktionsmodell, etwa 3 Mrd. Parameter, davon rund 40 Mio. trainiert während des Feintunings. Das Repository listet die Deltas von N1.6 auf: Backbone von einem proprietären Eagle-Modell zu Cosmos-Reason2-2B auf Qwen3-VL, Diffusionsschichten 32 auf 16, Zustands- und Aktionsdimensionen 29 auf 132, Aktionshorizont 16 auf 40.

Was bei einem kleinen Arm zählt, ist der relative Endeffektor-Aktionsraum: N1.7 prognostiziert Deltas von der aktuellen Pose, wodurch 20.000 Stunden menschliches EgoScale-Video in eine Roboterrichtlinie übertragen werden können. Spezifikationen auf der N1.7-Seite, Vorgehensweise im N1.7 auf SO-100 Leitfaden.

GA im Repository, EA auf der Modellkarte

Das Isaac-GR00T README deklariert N1.7 als General Availability Release, mit vollständigen Benchmarks und Support. Die Hugging Face Karte wurde noch nicht aktualisiert: das Model Version Feld zeigt immer noch GR00T N1.7 EA an. Das Repository ist das aktuellere Dokument.

GR00T N1.5

Gleicher 3 B Maßstab, Eagle 2 Backbone, SigLip2 und T5, Flow-Matching DiT Head. Es dient dazu, ein zu erweitern, das Sie bereits haben. Zwei Dinge machen es zu einer schlechten Standardeinstellung: Die Gewichte unterliegen NVIDIAs einseitiger nicht-kommerzieller Lizenz, und aktuelle LeRobot-Veröffentlichungen haben die N1.5-Unterstützung entfernt. Siehe .

Pi0.5

Physical Intelligence's VLA, Richtlinientyp pi05. Das Paper beschreibt ein 2 B VLM, das aus PaliGemma initialisiert wurde, plus einen 300 M Aktions-Experten, der den Roboter mit 50 Hz antreibt; LeRobots pi05-Konfiguration verwendet standardmäßig einen 50-Schritt-Chunk, eine Sekunde bei dieser Rate. Das Verkaufsargument sind ungesehene Orte: etwa 400 Stunden mobile Manipulation in echten Haushalten und eine Skalierungsstudie über 3, 12, 22, 53, 82 und 104 Standorte, wobei das Modell mit 104 Standorten eine Steuerung erreichte, die an den Testhaushalten selbst trainiert wurde.

Eine Grenze, angegeben auf der lerobot/pi05_base Karte: Der Port trägt nur den flussabgleichenden Action-Head. Subtask-Vorhersage, Action-Tokenisierung und RL wurden nicht upstream veröffentlicht, und openpi sagt dasselbe über sein eigenes Repository. Die Pi0.5-Seite und den Pi0.5 auf SO-100 Leitfaden haben den Rest.

Die Falle, die einen Nachmittag frisst: Gated Repositories

Pi0.5 benötigt den gated google/paligemma-3b-pt-224 Tokenizer (gated: manual, obwohl Google angibt, dass Anfragen sofort bearbeitet werden). Ohne ihn zu akzeptieren und hf auth login in der Trainingsumgebung auszuführen, startet der Job, lädt eine Weile herunter und stirbt dann an einem Autorisierungsfehler, der wie ein Netzwerkfehler aussieht. nvidia/GR00T-N1.7-3B ist nicht gated, aber sein nvidia/Cosmos-Reason2-2B Backbone ist es (gated: auto). Löschen Sie beides vor dem Queuing; wenn ein Lauf untätig bleibt, listet die Seite für feststeckende Warteschlangen auf, was zu überprüfen ist.

SmolVLA

450 M Parameter, davon etwa 100 M im Action-Experten, auf SmolVLM-2 mit eingefrorenem VLM und nur seinen ersten 16 Sprachmodell-Layern verwendet. Das Vortraining basierte auf Community-Daten: 481 Datensätze, 10.6 M Frames, von denselben günstigen Armen, die Sie verwenden. Das einzige VLA hier, das auf eine 24 GB Karte passt, und der einzige 30 Episode Floor. Siehe die SmolVLA-Seite.

ACT

Kein Grundmodell. Der Action Chunking Transformer von ALOHA wird mit etwa 80 Millionen Parametern trainiert von Grund auf pro Aufgabe, basierend auf 50 Demonstrationen bei 50 Hz. Das Paper berichtet über sechs reale bimanuelle Aufgaben aus jeweils etwa zehn Minuten an Demonstrationen, mit 80 bis 90 Prozent Erfolg bei den hervorgehobenen Beispielen. Seine Idee, Aktions-Chunking, ist in jedem Modell auf dieser Seite enthalten, und seine Ablation misst immer noch den Effekt am besten: Bei zwei simulierten Aufgaben mit ausgeschaltetem Temporal Ensembling steigt der Erfolg von 1 Prozent bei k=1 auf 44 Prozent bei k=100. Die ACT-Seite enthält den Rest.

Was die Benchmarks tatsächlich aussagen

LIBERO ist der eine Benchmark, über den drei dieser fünf berichten: sprachgesteuerte Aufgaben auf einem simulierten Franka Panda, aufgeteilt in die vier unten genannten Suiten mit jeweils zehn Aufgaben. NVIDIA führte 200 Versuche pro Suite.

ModellRäumlichObjektZiel10 (Lang)Durchschnitt
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Diese Zeilen sind nicht streng vergleichbar

Jede Zahl stammt aus einem anderen Testaufbau und Budget. GR00T lief 20.000 Schritte bei einem globalen Batch von 640; die openpi-Zahl ist ein 30K-Checkpoint; der LeRobot-Port fügte einem LIBERO-Basismodell 6K Schritte hinzu. SmolVLA ist eine weitere Diskrepanz: sein Paper trainiert diese Zeile auf LIBERO von Grund auf neu, ohne VLA-Vortraining, während die drei darüber vortrainierte Checkpoints feinabstimmen. Behandeln Sie 96.85 bis 97.5 als einen Cluster, und die Lücke zu 87.3% als real, aber erkauft mit dem 6.7-fachen der Parameter.

SimplerEnv zeigt die Streuung, was LIBERO nicht tut. NVIDIA vergleicht N1.7 mit N1.6, dem nächstgelegenen öffentlichen Äquivalent zu einem generationsbedingten Delta.

SimplerEnv SuiteN1.6 DurchschnittN1.7 DurchschnittBeste SchwankungSchlechteste Schwankung
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 Aufgaben52.0%72.5%open_drawer 0.0 bis 65.0keine, jede Aufgabe verbessert

Die Bridge-Reihe ist die nützliche: 5.7 Punkte wurden im Durchschnitt gewonnen, während put_eggplant_in_basket 36 verlor und put_eggplant_in_sink von 33 auf 2 fiel. Eine neue Generation verschiebt die Verteilung, anstatt sie zu anzuheben, wenn Ihre Aufgabe also dort liegt, wo N1.7 zurückgegangen ist, sagt der Durchschnitt nichts aus.

Das AY-Robots Arena-Leaderboard, eine sortierbare Tabelle von 85 Vision-Language-Action-Modellen mit 332 Benchmark-Ergebnissen, wobei jeder Wert mit dem Paper oder der Modellkarte verknüpft ist, aus dem er stammt
Die Arena enthält 85 VLA-Modelle und 332 Benchmark-Ergebnisse, die jeweils mit ihrem Paper oder ihrer Modellkarte verknüpft sind. Nützlich, um zu überprüfen, ob eine in einem Blogbeitrag zitierte Zahl real ist.

Von den fünf berichtet nur das SmolVLA-Paper über einen Arm der SO-100-Klasse: 78.3 Prozent für SmolVLA und 61.7 für Pi0 über drei Aufgaben, beide Multi-Task, gegenüber 48.3 für ACT, das Single-Task trainiert wurde, was nicht vergleichbar ist. Die saubere Paarung ist beides Single-Task bei SO-101 Pick-and-Place: 90 gegenüber 70 in der Verteilung, 50 gegenüber 40 außerhalb davon. Vergleichen Sie auf ACT gegen SmolVLA und Pi0.5 gegen SmolVLA, oder durchsuchen Sie die Arena.

Latenz und Kosten entscheiden über den Einsatz

Inferenzlatenz ist die Einschränkung, die man zuletzt entdeckt und zuerst bereut. Eine Richtlinie, die auf einem Benchmark fünf Punkte besser ist, aber eine halbe Sekunde pro Aktionsschritt benötigt, sieht auf Ihrem Schreibtisch schlechter aus: Kontaktdynamik wartet nicht.

Ein Vorbehalt: Die GR00T-Angabe stimmt nicht mit der NVIDIA-Karte überein, die 4 Entrauschungsschritte und eine Kamera mit 85.8 ms auf einer H100 im Eager-Modus, 48.6 ms mit torch.compile, 27.9 ms durch volles TensorRT misst. Die hier angegebenen 152 ms sind ein Wert für den gesamten Stack mit Serving-Overhead und mehr als einer Kamera, nicht nur ein Forward-Pass.

Remote-Inferenz hat eine harte Obergrenze

Der 20 bis 485 ms lange Loop gehört zum Modell, und Roundtrips über das öffentliche Internet kommen hinzu. Remote-Inferenz ist für langsames Pick-and-Place praktikabel, nicht für schnelle reaktive Bewegungen. Wenn Ihre Aufgabe Geschwindigkeit erfordert, sitzt die Inferenz neben den Servos: ACT oder SmolVLA, lokal. Verwandt: Richtlinie friert mitten in der Bewegung ein.

Eine Möglichkeit, Zeit zu gewinnen, ohne das Modell zu ändern: Das SmolVLA-Paper misst die synchrone Ausführung, bei der die Richtlinie einen Block beendet, bevor sie den nächsten vorhersagt, im Vergleich zur asynchronen Ausführung, bei der die Vorhersage die Ausführung überlappt. Der Erfolg ist ähnlich, 78.3 gegenüber 73.3, aber dasselbe Pick-and-Place dauert 9.7 Sekunden statt 13.75, und in einem festen Zeitfenster schafft der Roboter 19 Zyklen statt 9.

Lizenzen, geprüft weil niemand sie prüft

ModellGewichte-LizenzCode-LizenzKommerzielle Nutzung
GR00T N1.7NVIDIA Open Model License; Karte erlaubt kommerzielle NutzungApache 2.0ja
GR00T N1.5NVIDIA einseitige nicht-kommerzielle LizenzApache 2.0nein
Pi0.5Metadaten der pi05_base-Karte lesen Lizenz: gemmaApache 2.0 (openpi, LeRobot docs)beide lesen, sie widersprechen sich
SmolVLAkein Lizenzfeld auf der smolvla_base-KarteApache 2.0 (LeRobot)Code ja, Gewichte nicht angegeben
ACTkeine Basisgewichte vorhandenApache 2.0 (LeRobot)ja

Die Pi0.5-Zeile erfordert Aufmerksamkeit. Die LeRobot pi05-Dokumentation gibt Apache 2.0 an, konsistent mit openpi, während die Hub-Karte für lerobot/pi05_base enthält license: gemma. Beide sind aktiv. GR00T N1.7 hat eine mildere Version: Das Isaac-GR00T README erwähnt beiläufig, dass N1.7 vollständig kommerziell unter Apache 2.0 lizenzierbar ist, während der eigene Lizenzabschnitt und die Modellkarte nur den Code unter Apache 2.0 und die Gewichte unter die NVIDIA Open Model License.

Die Standardeinstellungen, die Sie tatsächlich ausführen werden

Jede Trainerform liefert eine Standardeinstellung, und diese sind nicht willkürlich. Die von ACT sind LeRobots eigene: Batch 8, lr 1e-5, 100000 Trainingsschritte, Chunk-Größe 100, passend zu ACTConfig upstream und k=100 aus dem ACT-Paper. Eine Spalte unten ist eine Falle.

PolicyBatchLRMax. SchritteGrad-Akkum.Anwendbar?Zusätzliche Parameter
GR00T N1.7321e-4200001jasaveSteps
GR00T N1.511e-5200016jasaveSteps
Pi0.515e-53000016nein (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008neinseed, logFreq
ACT81e-51000001neinchunkSize, nActionSteps, seed, logFreq
Reproduzierbarkeit, Stand August 2026

Der Fine-Tuning-Einstiegspunkt von GR00T (launch_finetune.py, ein tyro CLI) hat kein Seed-Feld in seiner Konfigurations-Dataclass, daher sind Läufe nicht bit-für-bit reproduzierbar. Das Repository warnt auch vor einer Varianz von 5 bis 6 Prozent zwischen den Läufen aufgrund nicht-deterministischer Bildaugmentierungen, was größer ist als die meisten Benchmark-Lücken, über die online diskutiert wird. LeRobots Standard-Seed ist 1000. Die Spalte Grad-Akkum. beschreibt lerobot 0.5.1; upstream 0.6.2 stellt sie als --accelerator.gradient_accumulation.steps bereit.

Der Parameter, der wichtiger ist als die Modellwahl

Es ist der Aktions-Chunk. Längere Chunks führen zu flüssigeren Bewegungen und weniger kumulativen Fehlern, aber die Policy ist festgelegt, während der Block ausgeführt wird, sodass sie spät auf alles reagiert, was sich bewegt: zuversichtlich bei einem statischen Würfel, hoffnungslos bei einem rollenden. Wenn es überschießt, ist das Verkürzen des ausgeführten Teils besser als ein erneutes Training und kostenlos. Ein Gelenk, das zu früh stoppt, ist ein anderes Problem; siehe .

  • ACT: ACTConfig defaults to chunk_size 100 and n_action_steps 100. Temporales Ensembling ist deaktiviert und erfordert n_action_steps 1.
  • GR00T N1.7: der interne Horizont ging von 16 auf 40, doch LeRobots SO-101 Beispiel läuft immer noch mit --policy.chunk_size=16 --policy.n_action_steps=16. Das Rollout-Flag wurde umbenannt in --execution-horizon.
  • Pi0.5: ein 50-Schritte-Chunk, von dem LeRobots LIBERO-Rezept 10 über --policy.n_action_steps=10 ausführt; mit --policy.pretrained_path fällt es auf 50 zurück, wenn Sie das Flag weglassen.
  • SmolVLA: 50-Aktions-Chunks, beide Parameter zugänglich.

Wie man alle fünf an einem Nachmittag überprüft

Die günstigste Antwort ist nicht mehr Lesen. Geben Sie etwa 15 USD aus und lassen Sie den Arm es Ihnen sagen: einmal aufzeichnen, trainieren Sie zuerst das günstige Modell, eskalieren Sie, sobald es die Daten als valide erwiesen hat. Struktur schlägt Volumen, der Sinn von und dem .

  1. 1
    50 Episoden einmal aufzeichnen

    Fünfzig macht den Weg frei für GR00T, Pi0.5 und ACT, und SmolVLAs 30. Wiederholen Sie jede Variation, anstatt sich zu verzetteln: 50 Episoden über 5 Würfelpositionen trainiert, wo 25 nicht trainiert wurden. Siehe Ihr erstes Dataset aufzeichnen.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Trainieren Sie ACT zuerst, denn es kann Sie nicht anlügen

    Keine vortrainierten Gewichte, wenn es die Aufgabe überhaupt erledigt, enthält Ihr Dataset die Aufgabe. Wenn ACT stagniert, korrigieren Sie die Daten. 1 bis 3 USD, 2 bis 5 Stunden auf einer 24 GB Karte.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA auf demselben Dataset ausführen, unverändert

    Gleiche Daten, gleicher Arm, 450 M Parameter statt 80 M, plus Sprachkonditionierung. LeRobot schätzt einen 20K-Schritt-Lauf auf etwa 4 Stunden auf einer A100. Dies sagt Ihnen, ob Vortraining etwas bringt.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Vor GR00T auf v2.1 konvertieren

    GR00T liest eine Variante des LeRobot v2-Formats plus eine zusätzliche meta/modality.json, die abbildet, wie verkettete Zustands- und Aktionsarrays in benannte Felder aufgeteilt werden. Ein v3.0-Dataset lässt diesen Loader abstürzen, da v3.0 viele Episoden in gemeinsame Dateien packt, wo v2 eine pro Episode schrieb. Isaac-GR00T liefert den Downgrade-Helfer als scripts/lerobot_conversion/convert_v3_to_v2.py; die v3-Ablehnungsseite ist der schnelle Weg.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Nur auf GR00T N1.7 eskalieren, wenn die ersten beiden etwas ungenutzt ließen

    Über NVIDIAs CLI, hier gezeigt, oder LeRobots groot Policy-Typ. NVIDIA empfiehlt 40 GB oder mehr VRAM für Fine-Tuning, 16 GB für Inferenz. Bei einem OOM, siehe die OOM-Seite.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Zwei Wege, diesen Screening-Durchlauf auszuführen

Drei Umgebungen, da die Toolchains nicht koexistieren. LeRobot auf main ist 0.6.2 und benötigt Python 3.12 oder neuer; Isaac-GR00T und openpi sind separate, uv-verwaltete Repositories.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fixiert torchcodec 0.8.0 als einziges Video-Backend, benötigt FFmpeg 4 bis 7. FFmpeg 8 wird nicht unterstützt, AV1 nicht garantiert.
  • openpi Speicheranforderungen: Inferenz über 8 GB, LoRA über 22.5 GB, vollständiges Fine-Tuning über 70 GB. Letzteres ist der Grund, warum Pi0.5 ein A100-Job ist.
  • Mieten Sie die GPU selbst, zerstören Sie sie danach, gleichen Sie drei Sätze von Checkpoint-Pfaden manuell ab.

Grundlagenmodell oder von Grund auf neu

Die eigentliche Frage ist nicht, welches 3B-Modell man wählen soll. Es ist vielmehr, ob man überhaupt ein vortrainiertes VLA verwenden sollte, angesichts dass ACT sechs echte bimanuelle Aufgaben aus jeweils etwa zehn Minuten Demonstrationen gelernt hat, mit 80 M Parametern und nichts Vortrainiertem.

Feinabstimmung eines vortrainierten VLA anstatt ACT von Grund auf zu trainieren
Was Sie gewinnen
  • Sprachkonditionierung. ACT hat keine; ein ACT-Checkpoint erledigt eine Aufgabe.
  • Besser bei Objekten, die in Ihren Demonstrationen nicht vorhanden sind: bei SO-101, 50% gegenüber 40% von ACT außerhalb der Verteilung.
  • Überhaupt Multi-Task: SmolVLA erreicht 78,3% über drei SO-100-Aufgaben mit einem Checkpoint; ACT wurde nur als Single-Task ausgeführt.
Was es Sie kostet
  • 7,6- bis 24-fache Latenz: 152 bis 485 ms pro Aktionsschritt gegenüber 20 ms bei ACT.
  • 4 bis 12 USD pro Lauf statt 1 bis 3, und eine A100-Stufe anstelle einer beliebigen 24-GB-Karte.
  • Lizenzrisiko, plus ein Fehlerfall durch ein geschütztes Repository, der bei einer Entwicklung von Grund auf nicht existiert.
  • Vortrainierte Gewichte können einen schlechten Datensatz maskieren. Eine Feinabstimmung, die bei fehlerhaften Daten halbwegs funktioniert, kostet eine Woche, bevor man sich die Daten ansieht.

Der Fall der Reproduktion eines alten Laufs

Das Verfolgen eines 2025-Checkpoints trifft die Modellwahl für Sie und verwandelt das Problem in Versions-Pinning: aktuelles LeRobot lehnt N1.5 ab, also pinnen Sie lerobot==0.5.1. Ohne Seed-Feld und mit 5 bis 6 Prozent Varianz zwischen den Läufen ist die Reproduktion konstruktionsbedingt nur annähernd. und haben die Plattformseite.

Die AY-Robots Kopf-an-Kopf-Vergleichsseite für GR00T N1.7 gegen Pi0.5, die Parameteranzahl, GPU-Anforderungen, Inferenzlatenz, Datensatzformat und minimale Episodenanzahl nebeneinander zeigt
Kopf-an-Kopf-Vergleich auf /compare/groot-n1-7-vs-pi0-5. Die beiden 3-B-Modelle sehen auf einem Datenblatt austauschbar aus, sind es aber nicht: eines benötigt LeRobot v2.1, das andere v3.0.

Bleiben zwei übrig? ACT gegen GR00T N1.7 und GR00T N1.7 gegen SmolVLA. Rohdaten finden Sie in den Arena-Einträgen: GR00T N1.7, Pi0.5, SmolVLA und ACT.

Wo diese Plattform Ihnen nicht hilft

  • Sie kann die Remote-Inferenz nicht beschleunigen. Die Schleife von 20 bis 485 ms gehört zum Modell; Internet-Roundtrips kommen hinzu.
  • Sie kann GR00T oder Pi0.5 nicht auf Ihrer eigenen Hardware feinabstimmen. Beide sind hier nur in der Cloud verfügbar; nur SmolVLA und ACT laufen lokal.
  • Sie kann einen Datensatz nicht reparieren. Der Verlust sinkt, aber die Policy tut nichts ist ein Datenproblem, eine Policy, die nur in einem Setup funktioniert ist ein Abdeckungsproblem.
  • Sie kann GR00T-Läufe nicht reproduzierbar machen: Die Upstream-Konfiguration hat kein Seed-Feld.

85 Modelle, 332 Benchmark-Ergebnisse, jede Zahl mit Verweis auf ihre Quelle

Die sortierbare Version der Tabellen auf dieser Seite: 85 Vision-Sprach-Aktionsmodelle, 332 Benchmark-Ergebnisse, jedes mit Verweis auf das zugehörige Paper oder die Modellkarte.

Arena öffnen

Eine auswählen und fortfahren

Eine Standardeinstellung: 50 Episoden aufzeichnen, ACT für 1 bis 3 USD trainieren, um den Datensatz zu validieren, dann SmolVLA auf den gleichen Daten. Zusammen unter 6 USD beantworten sie die entscheidende Frage: ob Vortraining hier hilft oder ob der Engpass die Daten sind. Für kontaktintensive Mehrschrittaufgaben auf GR00T N1.7 eskalieren, auf Pi0.5, wenn sich die Szene ändert.

Plattform-Walkthrough: trainieren Sie Ihre erste Policy, dann führen Sie Ihre erste Policy aus. Die Trainingsdokumentation und Datensatzdokumentation behandeln Form und Format; die SO-100-Seite und der vollständige SO-100-Leitfaden behandeln Aufbau und Kalibrierung. Hintergrund: die VLA-Übersicht und der Pi0 Flow-Matching-Artikel. Derjenige, der Ihre Erfolgsquote steigern wird, ist der Leitfaden zur Datenqualität.

Welche VLA-Policy sollte ich zuerst auf einem SO-100 trainieren?

ACT, dann SmolVLA. ACT trainiert von Grund auf, sodass es einen schlechten Datensatz nicht maskieren kann, und ein Durchlauf kostet 1 bis 3 USD auf einer 24 GB Karte. Wenn ACT die Aufgabe überhaupt bewältigt, sind die 4 bis 12 USD für einen GR00T N1.7 oder Pi0.5 Durchlauf nicht verschwendet.

Ist GR00T N1.7 tatsächlich besser als Pi0.5?

Auf LIBERO liegen sie innerhalb des Rauschens: 97.0% über vier Suiten für GR00T N1.7, 96.85% für Pi0.5 bei 30k Schritten in openpi, 97.5% für den LeRobot Port, alle aus verschiedenen Testumgebungen. Die wirklichen Unterschiede sind 152 ms pro Aktionsschritt gegenüber 485 ms, v2.1 Datensätze gegenüber v3.0, und Benchmark-Genauigkeit gegenüber Open-World-Generalisierung.

Kann ich eines davon auf einer einzelnen RTX 4090 feinabstimmen?

SmolVLA und ACT, ja; beide sind für eine RTX 4090 oder jede 24 GB Karte gelistet und laufen lokal. GR00T N1.7, N1.5 und Pi0.5 benötigen eine A100 oder H100 80 GB und sind hier nur in der Cloud verfügbar. NVIDIA empfiehlt 40 GB oder mehr für das GR00T Fine-Tuning; openpis Untergrenze liegt bei über 70 GB für ein vollständiges Pi0.5 Fine-Tuning, 22.5 GB für LoRA.

Welche dieser fünf kann ich kommerziell nutzen?

GR00T N1.7 Gewichte unterliegen der NVIDIA Open Model License Agreement, die laut Karte die kommerzielle Nutzung abdeckt. N1.5 Gewichte sind nicht-kommerziell. Der Code von SmolVLA ist Apache 2.0 in LeRobot, aber die lerobot/smolvla_base Karte enthält kein Lizenzfeld, daher sind die Gewichte nicht angegeben. ACT hat keine Basisgewichte zur Lizenzierung. Pi0.5 ist mehrdeutig: LeRobots Dokumentation sagt Apache 2.0, seine Kartenmetadaten lesen license: gemma.

Sources

Quellen

Bereit für hochwertige Robotik-Daten?

AY-Robots verbindet Ihre Roboter mit qualifizierten Operatoren weltweit.

Jetzt starten