ฝึก policy

AY-Robots ฝึก policy งานหยิบจับบน GPU ที่มีการจัดการ ดังนั้นคุณจึงสามารถไปจากเอปิโสดที่บันทึกไว้สู่ policy ที่ทำงานบนแขนของคุณได้โดยไม่ต้องมีฮาร์ดแวร์ฝึกฝนเป็นของตัวเอง หน้านี้ครอบคลุมประเภท policy ที่รองรับ หน้ารันการฝึก checkpoint และผลลัพธ์ที่ควรคาดหวังตามจำนวนเอปิโสดของคุณอย่างสมจริง

อัปเดตล่าสุด 2026-08-09

ฝึกโดยไม่ต้องมี GPU ของตัวเอง

การฝึก policy งานหยิบจับเป็นงานหนักด้าน GPU และโมเดล vision-language-action สมัยใหม่ต้องการ VRAM มากกว่าที่เวิร์กสเตชันทั่วไปมี บน AY-Robots การฝึกจะรันบน GPU คลาวด์ที่แพลตฟอร์มจัดการ คุณเลือกชุดข้อมูลและประเภท policy เริ่มการรัน และดูความคืบหน้าจากเบราว์เซอร์ ไม่ต้องตั้งค่า CUDA ไม่ต้องจับคู่ driver และไม่ต้องดูแลรักษาสภาพแวดล้อม

อินพุตจะเป็นชุดข้อมูลบนคลาวด์จาก Dashboard > Datasets เสมอ สิ่งที่คุณบันทึกผ่านเซสชันควบคุมทางไกลหรืออัปโหลดในรูปแบบ LeRobot มีสิทธิ์ทั้งหมด รวมถึงชุดข้อมูลที่รวมแล้วด้วย คัดสรรก่อนที่จะฝึก เอปิโสดที่ติดป้าย Failure โดยทั่วไปควรถูกกันออกจากชุดฝึก และการตรวจสอบสิบนาทีในตัวเรียกดูเอปิโสดจะประหยัดเวลา GPU หลายชั่วโมงที่ใช้ไปกับการเรียนรู้จากการสาธิตที่แย่

Policy ที่รองรับ

มี policy สี่ตระกูลที่รองรับ พวกมันแตกต่างกันในด้านขนาด ค่าใช้จ่ายในการฝึก และปริมาณที่พวกมันสามารถซึมซับจากข้อมูลของคุณ ดังนั้นตัวเลือกที่ถูกต้องจึงขึ้นอยู่กับงานและชุดข้อมูลของคุณมากกว่าการจัดอันดับทั่วไปใด ๆ

Policyประเภทคุณลักษณะ
ACTTransformer, action chunkingทำนายชุดการกระทำในอนาคตสั้น ๆ แทนที่จะเป็นทีละขั้นตอนเดียว กะทัดรัด ฝึกได้เร็วเมื่อเทียบกัน และเป็นตัวเลือกแรกที่มั่นคงสำหรับงานเดียวที่กำหนดไว้ชัดเจน
Diffusion PolicyDiffusion บนลำดับการกระทำจำลองการกระจายทั้งหมดของการกระทำที่สาธิต ซึ่งช่วยเมื่อการสาธิตของคุณแก้งานด้วยวิธีที่ถูกต้องมากกว่าหนึ่งวิธี ฝึกหนักกว่าและช้ากว่าในการอนุมานเมื่อเทียบกับ ACT
SmolVLAโมเดล vision-language-action ขนาดเล็กมีเงื่อนไขทางภาษา: ข้อความงานจากเอปิโสดของคุณกลายเป็นส่วนหนึ่งของอินพุต ทางเลือกกลาง ๆ ที่ดีเมื่อคุณต้องการเงื่อนไขทางภาษาโดยไม่ต้องมี foundation model ขนาดใหญ่
Fine-tune GR00TFine-tune foundation modelทำ fine-tune foundation model หุ่นยนต์ขนาดใหญ่ที่ฝึกไว้ล่วงหน้าบนเอปิโสดของคุณ มีเพดานสูงสุดในสี่ตัวนี้ ด้วยค่าใช้จ่ายในการฝึกสูงสุด และมีข้อกำหนดรูปแบบชุดข้อมูลที่เข้มงวด
GR00T ต้องการชุดข้อมูล LeRobot v2.1

การ fine-tune GR00T ยอมรับเฉพาะชุดข้อมูลในรูปแบบ LeRobot เวอร์ชัน 2.1 เท่านั้น ชุดข้อมูล v3.0 จะล้มเหลวระหว่างการโหลดข้อมูล ไม่ใช่ตอนส่ง ดังนั้นตรวจสอบเวอร์ชันรูปแบบก่อนที่คุณจะเริ่มการรัน ชุดข้อมูลที่บันทึกบนแพลตฟอร์มสามารถใช้ได้ตามสภาพเดิม สำหรับไฟล์ที่อัปโหลดจากภายนอก ให้ตรวจสอบเวอร์ชันใน meta/info.json ก่อน

เริ่มการรัน

  1. 1
    เลือกชุดข้อมูล

    เปิด Dashboard > Training และเลือกชุดข้อมูลที่จะใช้ฝึก จำนวนเอปิโสดและประเภทหุ่นยนต์จะแสดงให้คุณยืนยันว่าเลือกถูกต้อง

  2. 2
    เลือก policy

    เลือกหนึ่งในประเภท policy ที่รองรับ หากคุณไม่แน่ใจ ให้เริ่มด้วย ACT มันเป็นวิธีที่ถูกที่สุดในการรู้ว่าชุดข้อมูลของคุณดีพอที่จะฝึกอะไรได้เลยหรือไม่

  3. 3
    เปิดใช้งาน

    เริ่มการรัน มันจะได้รับ job id และหน้ารันของตัวเอง และคุณสามารถปิดเบราว์เซอร์ได้ การฝึกจะดำเนินต่อไปฝั่งเซิร์ฟเวอร์และหน้าจะแสดงสถานะสดทุกครั้งที่คุณกลับมา

หน้ารันการฝึก

ทุกการรันมีหน้าเฉพาะที่ตอบคำถามสองข้อที่คุณมีจริง ๆ ระหว่างการฝึก คือ มันกำลังเรียนรู้อยู่ไหม และเครื่องยังแข็งแรงอยู่ไหม ความคืบหน้าการเรียนรู้แสดงเป็นกราฟของ loss ตารางเวลา learning rate และ gradient norm loss ที่ราบเรียบทันทีหรือ gradient norm ที่ระเบิดจะบอกคุณล่วงหน้าว่าการรันนี้ไม่คุ้มที่จะรอ

สุขภาพของเครื่องแสดงควบคู่กัน: การใช้งาน GPU และหน่วยความจำ พร้อมด้วยเมตริก host ของเครื่องฝึก ไทม์ไลน์เฟสแสดงว่าการรันอยู่ที่จุดไหนในตอนนี้ ตั้งแต่การเตรียมสภาพแวดล้อมผ่านการโหลดข้อมูล วงจรการฝึกเอง และการอัปโหลด checkpoint เมื่อมีอะไรดูผิดปกติ ตัวดู log ที่มีอยู่ในตัวจะให้ log การฝึกดิบแก่คุณโดยไม่ต้องมีการเข้าถึง SSH เลย ซึ่งมักจะเพียงพอที่จะเห็นว่าความล้มเหลวมาจากชุดข้อมูลของคุณหรือจากตัวการรันเอง

Checkpoint และการดำเนินการต่อ

Checkpoint ถูกจัดเก็บแยกตามการรัน ไม่ใช่ในพูลที่ใช้ร่วมกัน ดังนั้น checkpoint ที่แสดงในหน้ารันจึงเป็นของการรันนั้นและการตั้งค่าของมันเสมอ สิ่งนี้สำคัญกว่าที่ฟังดู การผสม checkpoint ระหว่างการรันที่มีการตั้งค่าต่างกันเป็นสาเหตุคลาสสิกของ policy ที่เสียหายอย่างเงียบ ๆ

หากการรันหนึ่งถูกขัดจังหวะ คุณสามารถดำเนินการต่อจาก checkpoint ล่าสุดของมันแทนที่จะเริ่มใหม่ตั้งแต่ต้น checkpoint ระหว่างทางก็มีประโยชน์ในตัวเองด้วย เมื่อการรันที่ยาวนานเริ่ม overfitting ใกล้จุดสิ้นสุด checkpoint ก่อนหน้ามักจะทำงานได้ดีกว่าบนแขนจริงเมื่อเทียบกับ checkpoint สุดท้าย

รัน policy ที่ฝึกแล้วบนแขนของคุณ

policy ที่เสร็จสมบูรณ์สามารถนำไปใช้กับหุ่นยนต์ของคุณได้โดยตรง ใน cockpit เลือก policy ที่ฝึกแล้วสำหรับแขนที่เชื่อมต่อของคุณและเริ่ม inference policy จะสร้างคำสั่งข้อต่อที่คุณเคยสร้างเองผ่านการควบคุมทางไกล แขนต้องเป็นประเภทหุ่นยนต์เดียวกับที่ชุดข้อมูลถูกบันทึกไว้ และฉากควรคล้ายกับฉากฝึก รวมถึงตำแหน่งกล้องด้วย

ปฏิบัติต่อการรัน inference ครั้งแรกเหมือนการทดลอง ไม่ใช่การสาธิต เตรียม emergency stop ให้อยู่ในระยะเอื้อม เริ่มจากสถานะเริ่มต้นที่ใกล้เคียงกับสิ่งที่คุณสาธิตไว้ และคาดหวังว่า policy จะไวต่อสิ่งที่คุณอาจไม่สังเกตเห็น เช่น กล้องที่ถูกย้าย แสงที่ต่างไป หรือวัตถุที่ชุดข้อมูลไม่เคยมี

คุณต้องการเอปิโสดกี่รายการ

ความผิดพลาดในการฝึกที่พบบ่อยที่สุดบนแพลตฟอร์มไม่ใช่ไฮเปอร์พารามิเตอร์ที่ผิด แต่คือการฝึกด้วยข้อมูลน้อยเกินไปแล้วสรุปว่าประเภท policy นั้นใช้ไม่ได้ กฎทั่วไปสำหรับงานบนโต๊ะเดียว: ประมาณ 50 เอปิโสดจะให้ policy ที่มีการสรุปทั่วไปแคบ ๆ ซึ่งสำเร็จจากสถานะเริ่มต้นที่ใกล้เคียงกับที่คุณสาธิตไว้ ประมาณ 100 ถึง 200 เอปิโสดจะให้ความทนทานที่ใช้งานได้ทั่วทั้งพื้นที่ทำงานสำหรับงานนั้นหนึ่งงาน หากคุณเปลี่ยนตำแหน่งวัตถุระหว่างแต่ละเอปิโสด

ประเภท policy ที่มีความสามารถมากกว่าไม่ได้เปลี่ยนแปลงสิ่งนี้ fine-tune GR00T บน 20 เอปิโสดก็ยังคงสรุปทั่วไปได้ไม่ดี สิ่งที่โมเดลใหญ่กว่าให้คุณคือเพดานที่สูงกว่าเมื่อมีข้อมูลเพียงพอแล้ว หากงบประมาณของคุณจำกัด ให้ใช้มันกับเอปิโสดที่หลากหลายมากขึ้นก่อนที่จะใช้กับโมเดลที่ใหญ่ขึ้น

คำถามที่พบบ่อย

การรันฝึกใช้เวลานานแค่ไหน

ขึ้นอยู่กับประเภท policy และขนาดชุดข้อมูล ดังนั้นจึงไม่มีตัวเลขเดียวที่ตรงไปตรงมา ACT มักจะเร็วที่สุดในสี่ตัวนี้ fine-tune GR00T ช้าที่สุด ไทม์ไลน์เฟสและกราฟ loss บนหน้ารันจะแสดงล่วงหน้าว่าการรันกำลังคืบหน้าหรือไม่

ฉันสามารถฝึกบนชุดข้อมูลที่รวมแล้วได้ไหม

ได้ ชุดข้อมูลที่รวมแล้วก็เป็นชุดข้อมูลปกติ การตรวจสอบความถูกต้องของการรวมได้รับประกันความสอดคล้องของ fps ฟีเจอร์ และประเภทหุ่นยนต์ไว้แล้ว การรวมการบันทึกของงานเดียวกันเป็นหนึ่งในวิธีที่มีประสิทธิภาพที่สุดในการเข้าถึงช่วง 100 ถึง 200 เอปิโสด

การรัน GR00T ของฉันล้มเหลวระหว่างการโหลดข้อมูล ฉันควรตรวจสอบอะไรก่อน

เวอร์ชันรูปแบบชุดข้อมูล การ fine-tune GR00T ต้องการ LeRobot v2.1 และชุดข้อมูล v3.0 จะล้มเหลวตรงจุดนั้นพอดี ตรวจสอบเวอร์ชันใน meta/info.json ของชุดข้อมูลของคุณ

ฉันควรลบเอปิโสดที่ล้มเหลวก่อนฝึกไหม

โดยทั่วไปควรทำ เอปิโสดที่ติดป้าย Failure จะสอนพฤติกรรมที่ล้มเหลวให้กับ policy เอปิโสด Recovery แตกต่างออกไป มันแสดงวิธีแก้ไขข้อผิดพลาดและมักคุ้มค่าที่จะเก็บไว้

ฉันต้องเปิดเบราว์เซอร์ค้างไว้ระหว่างการฝึกไหม

ไม่ต้อง การรันทำงานฝั่งเซิร์ฟเวอร์ หน้ารันจะแสดงสถานะปัจจุบัน กราฟ และ log ทุกครั้งที่คุณกลับมา และ checkpoint จะถูกบันทึกไว้ไม่ว่าจะมีใครดูอยู่หรือไม่