Entrenamiento de políticas
AY-Robots entrena políticas de manipulación en GPU gestionadas, de modo que puede pasar de episodios grabados a una política ejecutándose en su brazo sin poseer hardware de entrenamiento. Esta página cubre los tipos de política compatibles, la página de la ejecución de entrenamiento, los checkpoints y qué resultados esperar realmente según su número de episodios.
Última actualización 2026-08-09
Entrenar sin una GPU propia
Entrenar una política de manipulación es una carga de trabajo de GPU, y los modelos modernos de vision-language-action necesitan más VRAM de la que tiene una estación de trabajo típica. En AY-Robots, el entrenamiento se ejecuta en GPU en la nube gestionadas por la plataforma: elige un conjunto de datos y un tipo de política, inicia la ejecución y observa su progreso desde el navegador. No hay configuración de CUDA, ni ajuste de drivers, ni entorno que mantener.
La entrada siempre es un conjunto de datos en la nube desde Dashboard > Datasets. Todo lo que haya grabado mediante sesiones de teleoperación o subido en formato LeRobot es elegible, incluidos los conjuntos de datos fusionados. Cure antes de entrenar: los episodios etiquetados como Failure suelen quedar fuera del conjunto de entrenamiento, y diez minutos de revisión en el explorador de episodios ahorran horas de tiempo de GPU dedicadas a aprender de malas demostraciones.
Políticas compatibles
Se admiten cuatro familias de políticas. Difieren en tamaño, coste de entrenamiento y cuánto pueden absorber de sus datos, así que la elección correcta depende más de su tarea y su conjunto de datos que de cualquier clasificación general.
| Política | Tipo | Características |
|---|---|---|
| ACT | Transformer, action chunking | Predice bloques cortos de acciones futuras en lugar de pasos individuales. Compacto, entrena de forma comparativamente rápida y es una primera opción sólida para una única tarea bien definida. |
| Diffusion Policy | Difusión sobre secuencias de acciones | Modela la distribución completa de las acciones demostradas, lo que ayuda cuando sus demostraciones resuelven la tarea de más de una manera válida. Más pesada de entrenar y más lenta en inferencia que ACT. |
| SmolVLA | Modelo pequeño de vision-language-action | Condicionada por lenguaje: la cadena de tarea de sus episodios pasa a formar parte de la entrada. Un buen punto intermedio cuando quiere condicionamiento por lenguaje sin un modelo fundacional grande. |
| Ajuste fino de GR00T | Ajuste fino de modelo fundacional | Ajusta finamente un modelo fundacional de robótica preentrenado y grande sobre sus episodios. El techo más alto de los cuatro, al coste de entrenamiento más alto, y con un requisito estricto de formato de conjunto de datos. |
El ajuste fino de GR00T solo acepta conjuntos de datos en la versión de formato LeRobot 2.1. Un conjunto de datos v3.0 fallará durante la carga de datos, no al enviarlo, así que compruebe la versión de formato antes de iniciar la ejecución. Los conjuntos de datos grabados en la plataforma pueden usarse tal cual; para subidas externas, verifique primero la versión en meta/info.json.
Iniciar una ejecución
- 1Elegir el conjunto de datos
Abra Dashboard > Training y seleccione el conjunto de datos sobre el que entrenar. Se muestran el número de episodios y el tipo de robot para que pueda confirmar que eligió el correcto.
- 2Elegir la política
Seleccione uno de los tipos de política compatibles. Si tiene dudas, empiece con ACT: es la forma más barata de averiguar si su conjunto de datos es lo bastante bueno para entrenar algo en absoluto.
- 3Lanzar
Inicie la ejecución. Obtiene un id de trabajo y su propia página de ejecución, y puede cerrar el navegador: el entrenamiento continúa en el servidor y la página muestra el estado en vivo cuando vuelva.
La página de la ejecución de entrenamiento
Cada ejecución tiene una página dedicada que responde a las dos preguntas que realmente tiene durante el entrenamiento: está aprendiendo, y está sana la máquina. El progreso de aprendizaje se muestra como gráficas de la pérdida, el programa de la tasa de aprendizaje y la norma del gradiente. Una pérdida que se estanca de inmediato o una norma del gradiente que explota le avisan pronto de que no vale la pena esperar esa ejecución.
La salud de la máquina se muestra junto a ello: uso y memoria de GPU, además de las métricas de host de la máquina de entrenamiento. Una línea de tiempo de fases muestra en qué punto está la ejecución, desde la preparación del entorno pasando por la carga de datos, el propio bucle de entrenamiento, hasta la subida del checkpoint. Cuando algo no cuadra, el visor de registros incorporado le da los registros de entrenamiento en bruto sin ningún acceso SSH, lo cual suele bastar para ver si un fallo se debe a su conjunto de datos o a la ejecución en sí.
Checkpoints y reanudación
Los checkpoints se almacenan por ejecución, no en un fondo compartido, así que los checkpoints listados en la página de una ejecución siempre pertenecen exactamente a esa ejecución y su configuración. Esto importa más de lo que parece: mezclar checkpoints entre ejecuciones con configuraciones distintas es una fuente clásica de políticas silenciosamente rotas.
Si una ejecución se interrumpe, puede reanudarla desde su último checkpoint en lugar de empezar de nuevo. Los checkpoints intermedios también son útiles por sí solos: cuando una ejecución larga empieza a sobreajustar hacia el final, un checkpoint anterior a menudo funciona mejor en el brazo real que el final.
Ejecutar la política entrenada en su brazo
Una política terminada puede desplegarse directamente de vuelta en su robot. En la consola, seleccione la política entrenada para su brazo conectado e inicie la inferencia: la política ahora produce los comandos articulares que antes producía usted mediante teleoperación. El brazo debe ser del mismo tipo de robot sobre el que se grabó el conjunto de datos, y la escena debe parecerse a las escenas de entrenamiento, incluida la colocación de la cámara.
Trate las primeras ejecuciones de inferencia como experimentos, no como demostraciones. Mantenga la parada de emergencia al alcance, empiece desde un estado inicial cercano a lo que demostró, y espere que la política sea sensible a cosas que usted ni siquiera notaría: una cámara movida, una iluminación distinta, o un objeto que el conjunto de datos nunca contuvo.
Cuántos episodios necesita
El error de entrenamiento más común en la plataforma no es un hiperparámetro equivocado, es entrenar con muy pocos datos y concluir que el tipo de política no funciona. Como regla general para una única tarea de sobremesa: alrededor de 50 episodios le dan una política con generalización estrecha que tiene éxito desde estados iniciales cercanos a los que demostró. Entre 100 y 200 episodios le dan robustez utilizable en todo el espacio de trabajo para esa única tarea, siempre que haya variado la colocación de objetos entre episodios.
Los tipos de política más capaces no derogan esta regla. Un ajuste fino de GR00T con 20 episodios seguirá generalizando mal; lo que compran los modelos más grandes es un techo mejor una vez que los datos están ahí. Si su presupuesto es limitado, gástelo primero en episodios más variados antes que en un modelo más grande.
Preguntas frecuentes
¿Cuánto tarda una ejecución de entrenamiento?▾
Depende del tipo de política y del tamaño del conjunto de datos, así que no hay una cifra única honesta. ACT suele ser la más rápida de las cuatro, los ajustes finos de GR00T los más lentos. La línea de tiempo de fases y las gráficas de pérdida en la página de la ejecución muestran pronto si una ejecución progresa.
¿Puedo entrenar sobre un conjunto de datos fusionado?▾
Sí. Los conjuntos de datos fusionados son conjuntos de datos ordinarios; la validación de la fusión ya garantizó fps, características y tipo de robot consistentes. Fusionar grabaciones de la misma tarea es una de las formas más eficaces de llegar al rango de 100 a 200 episodios.
Mi ejecución de GR00T falla durante la carga de datos. ¿Qué debo comprobar primero?▾
La versión de formato del conjunto de datos. El ajuste fino de GR00T requiere LeRobot v2.1, y un conjunto de datos v3.0 falla exactamente ahí. Compruebe la versión en meta/info.json de su conjunto de datos.
¿Debo eliminar los episodios fallidos antes de entrenar?▾
Normalmente sí. Los episodios etiquetados como Failure enseñan a la política el comportamiento fallido. Los episodios Recovery son distintos: muestran cómo corregir un error y a menudo vale la pena conservarlos.
¿Necesito mantener el navegador abierto durante el entrenamiento?▾
No. Las ejecuciones se realizan en el servidor. La página de la ejecución muestra el estado actual, las gráficas y los registros cuando vuelva, y los checkpoints se guardan sin importar si alguien está mirando.
Cómo almacena AY-Robots las grabaciones de teleoperación en formato LeRobot: estructura de episodios, el explorador del panel, fusión de subidas y el mercado.
Todos los brazos robóticos compatibles con AY-Robots y sus especificaciones: SO-100, Koch v1.1, Franka FR3, FP3 y Panda, WidowX-250, y el ALOHA ViperX-300.