ฝึก policy
AY-Robots ฝึก policy งานหยิบจับบน GPU ที่มีการจัดการ ดังนั้นคุณจึงสามารถไปจากเอปิโสดที่บันทึกไว้สู่ policy ที่ทำงานบนแขนของคุณได้โดยไม่ต้องมีฮาร์ดแวร์ฝึกฝนเป็นของตัวเอง หน้านี้ครอบคลุมประเภท policy ที่รองรับ หน้ารันการฝึก checkpoint และผลลัพธ์ที่ควรคาดหวังตามจำนวนเอปิโสดของคุณอย่างสมจริง
อัปเดตล่าสุด 2026-08-09
ฝึกโดยไม่ต้องมี GPU ของตัวเอง
การฝึก policy งานหยิบจับเป็นงานหนักด้าน GPU และโมเดล vision-language-action สมัยใหม่ต้องการ VRAM มากกว่าที่เวิร์กสเตชันทั่วไปมี บน AY-Robots การฝึกจะรันบน GPU คลาวด์ที่แพลตฟอร์มจัดการ คุณเลือกชุดข้อมูลและประเภท policy เริ่มการรัน และดูความคืบหน้าจากเบราว์เซอร์ ไม่ต้องตั้งค่า CUDA ไม่ต้องจับคู่ driver และไม่ต้องดูแลรักษาสภาพแวดล้อม
อินพุตจะเป็นชุดข้อมูลบนคลาวด์จาก Dashboard > Datasets เสมอ สิ่งที่คุณบันทึกผ่านเซสชันควบคุมทางไกลหรืออัปโหลดในรูปแบบ LeRobot มีสิทธิ์ทั้งหมด รวมถึงชุดข้อมูลที่รวมแล้วด้วย คัดสรรก่อนที่จะฝึก เอปิโสดที่ติดป้าย Failure โดยทั่วไปควรถูกกันออกจากชุดฝึก และการตรวจสอบสิบนาทีในตัวเรียกดูเอปิโสดจะประหยัดเวลา GPU หลายชั่วโมงที่ใช้ไปกับการเรียนรู้จากการสาธิตที่แย่
Policy ที่รองรับ
มี policy สี่ตระกูลที่รองรับ พวกมันแตกต่างกันในด้านขนาด ค่าใช้จ่ายในการฝึก และปริมาณที่พวกมันสามารถซึมซับจากข้อมูลของคุณ ดังนั้นตัวเลือกที่ถูกต้องจึงขึ้นอยู่กับงานและชุดข้อมูลของคุณมากกว่าการจัดอันดับทั่วไปใด ๆ
| Policy | ประเภท | คุณลักษณะ |
|---|---|---|
| ACT | Transformer, action chunking | ทำนายชุดการกระทำในอนาคตสั้น ๆ แทนที่จะเป็นทีละขั้นตอนเดียว กะทัดรัด ฝึกได้เร็วเมื่อเทียบกัน และเป็นตัวเลือกแรกที่มั่นคงสำหรับงานเดียวที่กำหนดไว้ชัดเจน |
| Diffusion Policy | Diffusion บนลำดับการกระทำ | จำลองการกระจายทั้งหมดของการกระทำที่สาธิต ซึ่งช่วยเมื่อการสาธิตของคุณแก้งานด้วยวิธีที่ถูกต้องมากกว่าหนึ่งวิธี ฝึกหนักกว่าและช้ากว่าในการอนุมานเมื่อเทียบกับ ACT |
| SmolVLA | โมเดล vision-language-action ขนาดเล็ก | มีเงื่อนไขทางภาษา: ข้อความงานจากเอปิโสดของคุณกลายเป็นส่วนหนึ่งของอินพุต ทางเลือกกลาง ๆ ที่ดีเมื่อคุณต้องการเงื่อนไขทางภาษาโดยไม่ต้องมี foundation model ขนาดใหญ่ |
| Fine-tune GR00T | Fine-tune foundation model | ทำ fine-tune foundation model หุ่นยนต์ขนาดใหญ่ที่ฝึกไว้ล่วงหน้าบนเอปิโสดของคุณ มีเพดานสูงสุดในสี่ตัวนี้ ด้วยค่าใช้จ่ายในการฝึกสูงสุด และมีข้อกำหนดรูปแบบชุดข้อมูลที่เข้มงวด |
การ fine-tune GR00T ยอมรับเฉพาะชุดข้อมูลในรูปแบบ LeRobot เวอร์ชัน 2.1 เท่านั้น ชุดข้อมูล v3.0 จะล้มเหลวระหว่างการโหลดข้อมูล ไม่ใช่ตอนส่ง ดังนั้นตรวจสอบเวอร์ชันรูปแบบก่อนที่คุณจะเริ่มการรัน ชุดข้อมูลที่บันทึกบนแพลตฟอร์มสามารถใช้ได้ตามสภาพเดิม สำหรับไฟล์ที่อัปโหลดจากภายนอก ให้ตรวจสอบเวอร์ชันใน meta/info.json ก่อน
เริ่มการรัน
- 1เลือกชุดข้อมูล
เปิด Dashboard > Training และเลือกชุดข้อมูลที่จะใช้ฝึก จำนวนเอปิโสดและประเภทหุ่นยนต์จะแสดงให้คุณยืนยันว่าเลือกถูกต้อง
- 2เลือก policy
เลือกหนึ่งในประเภท policy ที่รองรับ หากคุณไม่แน่ใจ ให้เริ่มด้วย ACT มันเป็นวิธีที่ถูกที่สุดในการรู้ว่าชุดข้อมูลของคุณดีพอที่จะฝึกอะไรได้เลยหรือไม่
- 3เปิดใช้งาน
เริ่มการรัน มันจะได้รับ job id และหน้ารันของตัวเอง และคุณสามารถปิดเบราว์เซอร์ได้ การฝึกจะดำเนินต่อไปฝั่งเซิร์ฟเวอร์และหน้าจะแสดงสถานะสดทุกครั้งที่คุณกลับมา
หน้ารันการฝึก
ทุกการรันมีหน้าเฉพาะที่ตอบคำถามสองข้อที่คุณมีจริง ๆ ระหว่างการฝึก คือ มันกำลังเรียนรู้อยู่ไหม และเครื่องยังแข็งแรงอยู่ไหม ความคืบหน้าการเรียนรู้แสดงเป็นกราฟของ loss ตารางเวลา learning rate และ gradient norm loss ที่ราบเรียบทันทีหรือ gradient norm ที่ระเบิดจะบอกคุณล่วงหน้าว่าการรันนี้ไม่คุ้มที่จะรอ
สุขภาพของเครื่องแสดงควบคู่กัน: การใช้งาน GPU และหน่วยความจำ พร้อมด้วยเมตริก host ของเครื่องฝึก ไทม์ไลน์เฟสแสดงว่าการรันอยู่ที่จุดไหนในตอนนี้ ตั้งแต่การเตรียมสภาพแวดล้อมผ่านการโหลดข้อมูล วงจรการฝึกเอง และการอัปโหลด checkpoint เมื่อมีอะไรดูผิดปกติ ตัวดู log ที่มีอยู่ในตัวจะให้ log การฝึกดิบแก่คุณโดยไม่ต้องมีการเข้าถึง SSH เลย ซึ่งมักจะเพียงพอที่จะเห็นว่าความล้มเหลวมาจากชุดข้อมูลของคุณหรือจากตัวการรันเอง
Checkpoint และการดำเนินการต่อ
Checkpoint ถูกจัดเก็บแยกตามการรัน ไม่ใช่ในพูลที่ใช้ร่วมกัน ดังนั้น checkpoint ที่แสดงในหน้ารันจึงเป็นของการรันนั้นและการตั้งค่าของมันเสมอ สิ่งนี้สำคัญกว่าที่ฟังดู การผสม checkpoint ระหว่างการรันที่มีการตั้งค่าต่างกันเป็นสาเหตุคลาสสิกของ policy ที่เสียหายอย่างเงียบ ๆ
หากการรันหนึ่งถูกขัดจังหวะ คุณสามารถดำเนินการต่อจาก checkpoint ล่าสุดของมันแทนที่จะเริ่มใหม่ตั้งแต่ต้น checkpoint ระหว่างทางก็มีประโยชน์ในตัวเองด้วย เมื่อการรันที่ยาวนานเริ่ม overfitting ใกล้จุดสิ้นสุด checkpoint ก่อนหน้ามักจะทำงานได้ดีกว่าบนแขนจริงเมื่อเทียบกับ checkpoint สุดท้าย
รัน policy ที่ฝึกแล้วบนแขนของคุณ
policy ที่เสร็จสมบูรณ์สามารถนำไปใช้กับหุ่นยนต์ของคุณได้โดยตรง ใน cockpit เลือก policy ที่ฝึกแล้วสำหรับแขนที่เชื่อมต่อของคุณและเริ่ม inference policy จะสร้างคำสั่งข้อต่อที่คุณเคยสร้างเองผ่านการควบคุมทางไกล แขนต้องเป็นประเภทหุ่นยนต์เดียวกับที่ชุดข้อมูลถูกบันทึกไว้ และฉากควรคล้ายกับฉากฝึก รวมถึงตำแหน่งกล้องด้วย
ปฏิบัติต่อการรัน inference ครั้งแรกเหมือนการทดลอง ไม่ใช่การสาธิต เตรียม emergency stop ให้อยู่ในระยะเอื้อม เริ่มจากสถานะเริ่มต้นที่ใกล้เคียงกับสิ่งที่คุณสาธิตไว้ และคาดหวังว่า policy จะไวต่อสิ่งที่คุณอาจไม่สังเกตเห็น เช่น กล้องที่ถูกย้าย แสงที่ต่างไป หรือวัตถุที่ชุดข้อมูลไม่เคยมี
คุณต้องการเอปิโสดกี่รายการ
ความผิดพลาดในการฝึกที่พบบ่อยที่สุดบนแพลตฟอร์มไม่ใช่ไฮเปอร์พารามิเตอร์ที่ผิด แต่คือการฝึกด้วยข้อมูลน้อยเกินไปแล้วสรุปว่าประเภท policy นั้นใช้ไม่ได้ กฎทั่วไปสำหรับงานบนโต๊ะเดียว: ประมาณ 50 เอปิโสดจะให้ policy ที่มีการสรุปทั่วไปแคบ ๆ ซึ่งสำเร็จจากสถานะเริ่มต้นที่ใกล้เคียงกับที่คุณสาธิตไว้ ประมาณ 100 ถึง 200 เอปิโสดจะให้ความทนทานที่ใช้งานได้ทั่วทั้งพื้นที่ทำงานสำหรับงานนั้นหนึ่งงาน หากคุณเปลี่ยนตำแหน่งวัตถุระหว่างแต่ละเอปิโสด
ประเภท policy ที่มีความสามารถมากกว่าไม่ได้เปลี่ยนแปลงสิ่งนี้ fine-tune GR00T บน 20 เอปิโสดก็ยังคงสรุปทั่วไปได้ไม่ดี สิ่งที่โมเดลใหญ่กว่าให้คุณคือเพดานที่สูงกว่าเมื่อมีข้อมูลเพียงพอแล้ว หากงบประมาณของคุณจำกัด ให้ใช้มันกับเอปิโสดที่หลากหลายมากขึ้นก่อนที่จะใช้กับโมเดลที่ใหญ่ขึ้น
คำถามที่พบบ่อย
การรันฝึกใช้เวลานานแค่ไหน▾
ขึ้นอยู่กับประเภท policy และขนาดชุดข้อมูล ดังนั้นจึงไม่มีตัวเลขเดียวที่ตรงไปตรงมา ACT มักจะเร็วที่สุดในสี่ตัวนี้ fine-tune GR00T ช้าที่สุด ไทม์ไลน์เฟสและกราฟ loss บนหน้ารันจะแสดงล่วงหน้าว่าการรันกำลังคืบหน้าหรือไม่
ฉันสามารถฝึกบนชุดข้อมูลที่รวมแล้วได้ไหม▾
ได้ ชุดข้อมูลที่รวมแล้วก็เป็นชุดข้อมูลปกติ การตรวจสอบความถูกต้องของการรวมได้รับประกันความสอดคล้องของ fps ฟีเจอร์ และประเภทหุ่นยนต์ไว้แล้ว การรวมการบันทึกของงานเดียวกันเป็นหนึ่งในวิธีที่มีประสิทธิภาพที่สุดในการเข้าถึงช่วง 100 ถึง 200 เอปิโสด
การรัน GR00T ของฉันล้มเหลวระหว่างการโหลดข้อมูล ฉันควรตรวจสอบอะไรก่อน▾
เวอร์ชันรูปแบบชุดข้อมูล การ fine-tune GR00T ต้องการ LeRobot v2.1 และชุดข้อมูล v3.0 จะล้มเหลวตรงจุดนั้นพอดี ตรวจสอบเวอร์ชันใน meta/info.json ของชุดข้อมูลของคุณ
ฉันควรลบเอปิโสดที่ล้มเหลวก่อนฝึกไหม▾
โดยทั่วไปควรทำ เอปิโสดที่ติดป้าย Failure จะสอนพฤติกรรมที่ล้มเหลวให้กับ policy เอปิโสด Recovery แตกต่างออกไป มันแสดงวิธีแก้ไขข้อผิดพลาดและมักคุ้มค่าที่จะเก็บไว้
ฉันต้องเปิดเบราว์เซอร์ค้างไว้ระหว่างการฝึกไหม▾
ไม่ต้อง การรันทำงานฝั่งเซิร์ฟเวอร์ หน้ารันจะแสดงสถานะปัจจุบัน กราฟ และ log ทุกครั้งที่คุณกลับมา และ checkpoint จะถูกบันทึกไว้ไม่ว่าจะมีใครดูอยู่หรือไม่
AY-Robots จัดเก็บการบันทึกควบคุมทางไกลในรูปแบบ LeRobot อย่างไร: โครงสร้างเอปิโสด ตัวเรียกดูเอปิโสดในแดชบอร์ด การรวมไฟล์ที่อัปโหลด และตลาดกลาง
แขนหุ่นยนต์ทุกตัวที่รองรับบน AY-Robots พร้อมข้อมูลจำเพาะ: SO-100, Koch v1.1, Franka FR3, FP3 และ Panda, WidowX-250 และ ALOHA ViperX-300