รายการคำศัพท์ AY-Robots สำหรับรูปแบบชุดข้อมูล LeRobot ซึ่งเป็นรูปแบบที่ผู้ฝึกสอนทุกคนบนแพลตฟอร์มใช้ ไม่ว่าตอนต่าง ๆ จะถูกบันทึกหรือสร้างขึ้นมา
ข้อมูลสังเคราะห์sim-to-realIsaac Labการเรียนรู้แบบเลียนแบบMimicGenSO-101

ข้อมูลสังเคราะห์สำหรับนโยบายหุ่นยนต์: การจำลองช่วยได้อย่างไร

AY-Robots ResearchAugust 23, 202631 นาทีในการอ่าน

การจำลองสามารถเพิ่มจำนวนการสาธิตเพียงไม่กี่ครั้งให้กลายเป็นหลายพันครั้งได้ นี่คือสิ่งที่ตัวเลขที่เผยแพร่ระบุไว้จริง ๆ ช่องว่างระหว่าง sim-to-real ส่งผลกระทบอย่างไร และสิ่งที่ยังคงต้องบันทึก

ทุกๆ สองสามเดือน จะมีคนพบว่าการบันทึกห้าสิบ ตอน ด้วยมือเป็นเรื่องช้า และตั้งคำถามว่าเครื่องจำลองสามารถสร้างข้อมูลเหล่านี้แทนได้หรือไม่ เป็นคำถามที่สมเหตุสมผล คำตอบที่ตรงไปตรงมามีสามส่วน: ข้อมูลที่สร้างขึ้นช่วยได้จริง แต่ไม่สามารถทดแทนการบันทึกจริงได้ และอัตราส่วนระหว่างข้อเท็จจริงทั้งสองนี้ขึ้นอยู่กับประเภทของข้อมูลสังเคราะห์ที่คุณหมายถึงโดยสิ้นเชิง

หน้านี้จะอธิบายถึงสิ่งที่งานวิจัยที่ตีพิมพ์ได้วัดผลจริง สิ่งที่คุณสามารถใช้งานได้ในปัจจุบันบนแขนกลราคาประหยัด เช่น SO-100 และจุดที่ช่องว่างระหว่างการจำลองกับโลกจริง (sim-to-real gap) ทำให้ผลลัพธ์ลดลง สรุปสั้นๆ ก่อนลงรายละเอียด: ระบบที่รายงานตัวคูณที่ใหญ่ที่สุดจะเพิ่มจำนวนการสาธิตของมนุษย์จริงเพียงชุดเล็กๆ พวกมันไม่ได้กำจัดความจำเป็นในการสาธิตเหล่านั้นออกไป

สิ่งที่คุณต้องรู้

  • เทคนิคสี่อย่างที่ไม่เกี่ยวข้องกันถูกเรียกว่าข้อมูลสังเคราะห์ในการจัดการ: การเพิ่มจำนวนวิถีการเคลื่อนที่ (trajectory multiplication), การจำลองทางฟิสิกส์ (physics rollouts), โมเดลโลกจากวิดีโอ (video world models) และการเพิ่มข้อมูลในพื้นที่ภาพ (image-space augmentation) พวกมันล้มเหลวในรูปแบบที่แตกต่างกันและมีคุณค่าต่างกัน
  • MimicGen เปลี่ยนการสาธิตของมนุษย์ไม่ถึง 200 ครั้ง ให้กลายเป็นการสาธิตที่สร้างขึ้นมากกว่า 50,000 ครั้ง ใน 18 งาน สำหรับงาน Square D0 ของมัน การสาธิต 200 ครั้งที่สร้างจาก 10 การสาธิตของมนุษย์ ให้ผลสำเร็จ 79 เปอร์เซ็นต์ เทียบกับ 84 เปอร์เซ็นต์ สำหรับการสาธิตของมนุษย์จริง 200 ครั้ง
  • RoboCasa เป็นตัวอย่างที่ตรงกันข้าม: การสาธิตที่สร้างขึ้น 72,000 ครั้ง ได้คะแนน 47.6 เปอร์เซ็นต์ เทียบกับ 28.8 เปอร์เซ็นต์ สำหรับการสาธิตของมนุษย์ 1,250 ครั้ง นั่นคือความได้เปรียบด้านปริมาณ 58 เท่า ไม่ใช่การชนะแบบเทียบเท่ากัน
  • การศึกษาการฝึกร่วมกันระหว่างการจำลองและโลกจริง (sim-and-real co-training) รายงานการปรับปรุงประสิทธิภาพงานในโลกจริงโดยเฉลี่ย 38 เปอร์เซ็นต์ สูตรคือการฝึกร่วมกันบนข้อมูลผสม ไม่ใช่การถ่ายโอนจากการจำลองเพียงอย่างเดียว
  • GR00T N1 ใช้เส้นทางการจำลอง 780,000 เส้นทาง (เทียบเท่า 6,500 ชั่วโมง สร้างขึ้นใน 11 ชั่วโมง) และเส้นทางประสาท 827 ชั่วโมงที่พัฒนาจากการทำงานจริง 88 ชั่วโมง การทำงานจริง 88 ชั่วโมงเหล่านั้นยังคงเป็นจุดสูงสุดของพีระมิด
  • สำหรับ SO-101 มีไปป์ไลน์แบบเปิดที่ใช้งานได้ในปัจจุบัน: LeIsaac ภายใน Isaac Lab, ควบคุมระยะไกลด้วยแขนกลนำทางจริง, เพิ่มจำนวนด้วย Isaac Lab Mimic, ส่งออกเป็นรูปแบบ LeRobot, ปรับแต่ง GR00T
  • AY-Robots ไม่ได้สร้างข้อมูลสังเคราะห์ มันฝึกฝนจากชุดข้อมูล LeRobot ที่คุณมอบให้ ไม่ว่าชุดข้อมูลนั้นจะถูกสร้างขึ้นด้วยวิธีใด และผู้ฝึกสอนต้องการอย่างน้อย 30 ถึง 50 ตอน ขึ้นอยู่กับโมเดล

สี่สิ่งแตกต่างกันที่ถูกเรียกว่าข้อมูลสังเคราะห์

ก่อนที่จะเปรียบเทียบตัวเลข ควรแยกประเภทของงานออกเป็นกลุ่มๆ เพราะงานวิจัยที่รายงานตัวคูณ 100 เท่า และงานวิจัยที่รายงานการเพิ่มขึ้นของความสำเร็จ 5 จุด มักจะอธิบายไปป์ไลน์เดียวกันจากมุมมองที่ต่างกัน จุดร่วมคือบางสิ่งใน ชุดข้อมูล LeRobot ถูกสร้างขึ้นโดยเครื่องจักร แทนที่จะบันทึกจากแขนหุ่นยนต์จริง สิ่งที่แตกต่างกันคือส่วนไหน

ประเภทสิ่งที่ยังคงเป็นของจริงสิ่งที่ถูกสร้างขึ้นตัวคูณที่รายงานโหมดความล้มเหลวหลัก
การเพิ่มจำนวนวิถีการเคลื่อนที่ (MimicGen, DexMimicGen, Isaac Lab Mimic)การสาธิตของมนุษย์จำนวนหนึ่ง, โมเดลวัตถุ, เอนจินฟิสิกส์วิถีการเคลื่อนที่ใหม่ที่ปรับให้เข้ากับท่าทางวัตถุและการจัดวางฉากใหม่10 human demos to 1,000 per reset distribution; 60 to 21,000; under 200 to over 50,000ความพยายามในการสร้างล้มเหลว Isaac Lab ระบุอัตราความสำเร็จของผู้สมัครสูงถึง 70 เปอร์เซ็นต์ในกรณีง่ายๆ และต่ำกว่า 1 เปอร์เซ็นต์ในกรณีที่ยาก
การจำลองฟิสิกส์ในโปรแกรมจำลองงาน (Isaac Lab, robosuite, RoboCasa)เอนจินฟิสิกส์และไลบรารีสินทรัพย์ทั้งตอนที่ขับเคลื่อนโดยคอนโทรลเลอร์ที่เขียนสคริปต์, ผู้วางแผน หรือ RLจำกัดด้วยชั่วโมงการใช้งาน GPU เท่านั้นแขนจำลองไม่ใช่แขนของคุณ การสัมผัสและไดนามิกของเซอร์โวเป็นเพียงการประมาณค่า
โมเดลโลกวิดีโอ (DreamGen, Cosmos Transfer)ตอนการควบคุมระยะไกลจริงบางส่วนที่ใช้เป็นเงื่อนไขวิดีโอที่สมจริงของพฤติกรรมใหม่ พร้อมกับการกระทำเทียมที่กู้คืนได้ในภายหลัง88 hours to 827 hours in GR00T N1, about 10xการกระทำถูกอนุมาน ไม่ได้วัดผล วิดีโอที่ดูน่าเชื่อถืออาจมีการกระทำที่ไม่น่าเชื่อถือ
การเพิ่มข้อมูลในพื้นที่ภาพ (random crop, colour jitter)ทุกอย่างยกเว้นพิกเซลมุมมองที่ถูกรบกวนของตอนที่คุณมีอยู่แล้ว1x, ไม่สร้างวิถีการเคลื่อนที่ใหม่การเพิ่มข้อมูลทางเรขาคณิตทำลายความเชื่อมโยงระหว่างภาพและป้ายกำกับการกระทำ

มีเพียงสามประเภทแรกเท่านั้นที่เป็นข้อมูลสังเคราะห์ในความหมายของบทความนี้ ประเภทที่สี่ควรกล่าวถึงเพราะมักถูกรวมอยู่ในการสนทนาเดียวกัน และเป็นสิ่งที่ถูกที่สุดในรายการ หากคุณยังไม่ได้เปิดใช้งานการเพิ่มข้อมูลที่มาพร้อมกับเทรนเนอร์ของคุณ ให้ทำเช่นนั้นก่อนที่คุณจะติดตั้งโปรแกรมจำลอง

คุณสามารถดูข้อมูลสังเคราะห์จริงก่อนที่จะสร้างข้อมูลใดๆ

NVIDIA ได้เผยแพร่วิถีการเคลื่อนที่จำลองที่ใช้สำหรับการฝึกหลัง GR00T N1 เป็น nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim บน Hugging Face ขนาดประมาณ 1.87 TB ภายใต้ใบอนุญาต cc-by-4.0 ซึ่งแบ่งออกเป็นวิถีการเคลื่อนที่ของ Panda และ GR1 แบบสองมือที่ข้ามร่าง 9,000 ชุด, วิถีการเคลื่อนที่ของหุ่นยนต์ฮิวแมนนอยด์บนโต๊ะ 240,000 ชุด, วิถีการเคลื่อนที่ของ Panda เดี่ยวในครัว 72,000 ชุด และวิถีการเคลื่อนที่แบบ loco-manipulation ของ Unitree G1 102 ชุด การดาวน์โหลดชุดย่อยหนึ่งด้วย huggingface-cli download --include "gr1_arms_only.CanSort/**" และดูบางตอนเป็นวิธีที่เร็วที่สุดในการปรับเทียบว่าวิถีการเคลื่อนที่ที่สร้างขึ้นมีลักษณะอย่างไร และไม่มีค่าใช้จ่ายใดๆ นอกจากแบนด์วิดท์

สิ่งที่ตัวเลขที่เผยแพร่ระบุไว้จริง ๆ

นี่คือฐานข้อมูลหลักฐาน โดยมีตัวเลขตามที่แหล่งที่มาระบุไว้ แทนที่จะเป็นสรุปจากข่าวประชาสัมพันธ์ แต่ละแถวด้านล่างมาจากเอกสารวิชาการหรือหน้าโครงการที่อ่านเมื่อวันที่ 23 สิงหาคม 2026

ระบบข้อมูลนำเข้าข้อมูลที่สร้างขึ้นผลลัพธ์ที่รายงาน
MimicGen, CoRL 2023การสาธิตโดยมนุษย์น้อยกว่า 200 ครั้ง; การสาธิตโดยมนุษย์ 10 ครั้งในการเปรียบเทียบแบบตัวต่อตัวการสาธิตมากกว่า 50,000 ครั้ง, 18 งาน, แขนหุ่นยนต์สี่แบบ (Panda, Sawyer, IIWA, UR5e)Square D0: 79 เปอร์เซ็นต์จากการสาธิต 200 ครั้งที่สร้างขึ้นจากการสาธิตโดยมนุษย์ 10 ครั้ง เทียบกับ 84 เปอร์เซ็นต์จากการสาธิตโดยมนุษย์ 200 ครั้ง
DexMimicGen, 2024การสาธิตโดยมนุษย์ที่เป็นแหล่งข้อมูล 60 ครั้งการสาธิต 21,000 ครั้งสำหรับหุ่นยนต์สองแขนที่มีความคล่องแคล่วงานที่ต้องใช้ความคล่องแคล่วสองแขนในการจำลอง รวมถึงการปรับใช้หุ่นยนต์ฮิวแมนนอยด์สำหรับการคัดแยกกระป๋องจากโลกจริงสู่การจำลองสู่โลกจริง
RoboCasa, 2024การสาธิตโดยมนุษย์ 1,250 ครั้ง (50 ครั้งต่องานจาก 25 งานย่อย), งานประเมิน 100 งาน, หมวดหมู่วัตถุมากกว่า 150 หมวดหมู่วิถีการเคลื่อนที่ MimicGen 100,000 ชุด; ชุดย่อยของการสาธิต 72,000 ครั้งเป็นตัวขับเคลื่อนการเปรียบเทียบหลัก28.8 เปอร์เซ็นต์โดยรวมในชุดข้อมูลมนุษย์ เทียบกับ 47.6 เปอร์เซ็นต์ในชุดข้อมูลที่สร้างขึ้นทั้งหมด ประเมินเฉพาะกับอินสแตนซ์วัตถุที่ไม่เคยเห็น
Sim-and-real co-training, 2025การสาธิตจริงบวกกับชุดข้อมูลจำลอง, สองโดเมน (แขนหุ่นยนต์และฮิวแมนนอยด์)เป็นการผสมผสาน ไม่ใช่การทดแทนข้อมูลจำลองช่วยเพิ่มประสิทธิภาพงานในโลกจริงโดยเฉลี่ย 38 เปอร์เซ็นต์
DreamGen, 2025ข้อมูลการควบคุมระยะไกลจากงานหยิบและวางเพียงงานเดียวในสภาพแวดล้อมเดียววิดีโอสังเคราะห์บวกกับการกระทำเทียมจากโมเดลการกระทำแฝงหรือโมเดลพลวัตผกผันพฤติกรรมใหม่ 22 อย่างบนหุ่นยนต์ฮิวแมนนอยด์ ทั้งในสภาพแวดล้อมที่เคยเห็นและไม่เคยเห็น
GR00T N1 data pyramid, 2025การควบคุมระยะไกล GR-1 ภายในองค์กร 88 ชั่วโมงวิถีการเคลื่อนที่ของโครงข่ายประสาท 827 ชั่วโมง (ประมาณ 10 เท่า); วิถีการเคลื่อนที่จำลอง 780,000 ชุด, เทียบเท่า 6,500 ชั่วโมง, ผลิตภายใน 11 ชั่วโมงวิถีการเคลื่อนที่ของโครงข่ายประสาทเพิ่ม 4.2, 8.8 และ 6.8 คะแนนบน RoboCasa ที่โหมดการสาธิต 30, 100 และ 300 ครั้งต่องาน และเฉลี่ย 5.8 คะแนนใน 8 งาน GR-1 จริง
อ่านตัวคูณเป็นการนับจำนวนวิถีการเคลื่อนที่ ไม่ใช่ความสามารถ

ตัวคูณคือจำนวนแถว การเปรียบเทียบแบบตัวต่อตัวของ MimicGen เองแสดงให้เห็นว่าข้อมูลที่สร้างขึ้นอยู่ ต่ำกว่า จำนวนข้อมูลมนุษย์ที่เท่ากันเล็กน้อย (79 เทียบกับ 84 เปอร์เซ็นต์) และการตัดส่วนของ GR00T N1 เพิ่มคะแนนเปอร์เซ็นต์หลักเดียวจากโมเดลที่มีชั่วโมงจริงอยู่แล้ว RoboCasa เอาชนะข้อมูลมนุษย์ได้ 47.6 เทียบกับ 28.8 เปอร์เซ็นต์ แต่ด้วยการสาธิตที่สร้างขึ้น 72,000 ครั้ง เทียบกับการสาธิตโดยมนุษย์ 1,250 ครั้ง ปริมาณซื้อความครอบคลุมได้ แต่ไม่ได้ซื้อข้อมูลที่การสาธิตของคุณไม่เคยมี

รูปแบบของการทดสอบ ablation ที่ซื่อสัตย์ทุกครั้งนั้นเหมือนกัน ข้อมูลสังเคราะห์ช่วยขยายขอบเขตการครอบคลุมได้ในราคาถูก มันไม่ได้สร้างข้อมูลเกี่ยวกับกริปเปอร์ของคุณ, การหย่อนของเซอร์โว, แสงสว่าง หรือความสูงของโต๊ะของคุณที่ไม่ได้มีอยู่ในการสาธิตจริงที่ใดที่หนึ่ง หาก นโยบาย ล้มเหลวเนื่องจาก ส่วนปลายแขนกล ปิดช้าไปครึ่งวินาที การจำลองความหลากหลายเท่าใดก็ไม่สามารถแก้ไขได้ นั่นคือ ปัญหาเรื่องเวลาของกริปเปอร์ ในการบันทึกจริง

ข้อค้นพบหนึ่งจาก MimicGen ที่ควรนำไปใช้ในการบันทึกข้อมูลของคุณเอง เพราะมันขัดแย้งกับคำแนะนำทั่วไป โครงการนี้สร้างชุดข้อมูลสองชุดบน Square D2 โดยชุดหนึ่งใช้ข้อมูลเริ่มต้น 10 การสาธิตจากผู้ปฏิบัติงานที่มีคุณภาพดีกว่า และอีกชุดใช้ข้อมูลเริ่มต้น 10 การสาธิตจากผู้ปฏิบัติงานที่มีคุณภาพด้อยกว่า ซึ่งทั้งสองชุดนำมาจากชุดข้อมูล robomimic multi-human Square นโยบายที่ฝึกจากแต่ละชุดข้อมูลให้ผลลัพธ์ที่เทียบเคียงกันได้ ซึ่งผู้เขียนตีความว่าเป็นสัญญาณว่าในระบบข้อมูลขนาดใหญ่ คุณภาพของข้อมูลอาจไม่สำคัญเท่าที่ควร โปรดอ่านอย่างละเอียด นั่นคือข้อความเกี่ยวกับข้อมูลเริ่มต้น 10 การสาธิต ไม่ใช่เกี่ยวกับ 50 ตอนจริงของคุณ นั่นหมายความว่าชุดข้อมูลเริ่มต้นที่อาจไม่สมบูรณ์เล็กน้อยไม่ใช่สิ่งที่จะขัดขวางคุณจากการสร้างชุดข้อมูลที่ใช้งานได้ มันไม่ได้หมายความว่าตอนจริงที่คุณใช้ร่วมฝึกสามารถไม่สมบูรณ์ได้ เพราะตอนเหล่านั้นคือส่วนที่บรรจุข้อมูลที่ตัวจำลองไม่มี

รายการไดเรกทอรีชุดข้อมูลสาธารณะของ AY-Robots ที่แสดงชุดข้อมูล LeRobot ที่บันทึกไว้พร้อมจำนวนตอน
ไดเรกทอรีชุดข้อมูลสาธารณะที่ /directory ทุกรายการที่นี่คือตอนที่บันทึกจริง ข้อมูลสังเคราะห์เป็นตัวคูณที่เสริมจากสิ่งเหล่านี้ ไม่ใช่สิ่งทดแทน

ช่องว่างระหว่างการจำลองกับความเป็นจริงอย่างเป็นรูปธรรม

ช่องว่างมักถูกกล่าวถึงในฐานะปริมาณเดียว ซึ่งไม่เป็นประโยชน์ อันที่จริงแล้วมันคือความไม่ตรงกันอย่างน้อยห้าประการ และแต่ละประการมีขนาดที่แตกต่างกันระหว่างแขนหุ่นยนต์สำหรับงานอดิเรกราคา 110 ถึง 150 EUR กับแขนหุ่นยนต์ Franka

  • การสัมผัสและแรงเสียดทาน. Isaac Lab ระบุไว้อย่างชัดเจนว่า หากใช้ฮาร์ดแวร์เดียวกันและ Isaac Sim กับ PhysX เวอร์ชันเดียวกัน การจำลองสามารถทำซ้ำได้ แต่ผลลัพธ์จะแตกต่างกันไปในแต่ละการกำหนดค่าฮาร์ดแวร์เนื่องจากความแม่นยำของจุดทศนิยมและข้อผิดพลาดในการปัดเศษ และ PhysX ไม่รับประกันความแน่นอนสำหรับฉากใดๆ ที่มีวัตถุที่ไม่แข็ง เช่น ผ้าหรือวัตถุอ่อนนุ่ม
  • การขับเคลื่อน. เซอร์โวบัส Feetech STS3215 ที่ทำงานที่ 7.4 V จะหย่อนคล้อยภายใต้ภาระ มีระยะฟรี และเปลี่ยนพฤติกรรมเมื่อร้อนขึ้น โมเดล MJCF สำหรับ SO-101 ยืมพารามิเตอร์มอเตอร์มาจากโปรเจกต์ที่ไม่เกี่ยวข้อง แทนที่จะระบุพารามิเตอร์เหล่านั้นบนแขนหุ่นยนต์ของคุณ
  • การเรนเดอร์. สัญญาณรบกวนของกล้อง, rolling shutter, การเปิดรับแสงอัตโนมัติ และเฉดสีที่แท้จริงของโต๊ะของคุณไม่ได้อยู่ในภาพเรนเดอร์ นี่คือครึ่งหนึ่งของช่องว่างที่ Cosmos-Transfer1 ถูกสร้างขึ้นมาเพื่อปิด: เวิร์กโฟลว์การเสริมประสิทธิภาพหุ่นยนต์นี้จะแมปตัวอย่างสังเคราะห์ของหุ่นยนต์หนึ่งตัวอย่างไปยังตัวอย่างที่สมจริงหลายตัวอย่างจากการแบ่งส่วน, ความลึก หรือการปรับสภาพขอบ
  • การจับเวลา. ซิมูเลเตอร์จะทำงานตามอัตราที่กำหนด วงจรควบคุมจริงไม่ได้เป็นเช่นนั้น และตัวโมเดลเองมีค่าใช้จ่าย 20 ถึง 485 ms ต่อขั้นตอนการกระทำ ขึ้นอยู่กับว่าคุณเลือกโมเดลใด ดู เวลาแฝงของการอนุมาน
  • สถิติวัตถุ. ฉากจำลองถูกสุ่มตัวอย่างจากการกระจายที่ใครบางคนเขียนขึ้น โต๊ะในครัวของคุณไม่ได้เป็นเช่นนั้น

สิ่งที่ SO-100 จำลองรู้เกี่ยวกับแขนหุ่นยนต์ของคุณจริงๆ

นี่คือส่วนที่ตัดสินว่าสิ่งใดข้างต้นคุ้มค่ากับวันหยุดสุดสัปดาห์ของคุณหรือไม่ และความประหลาดใจแรกคือ SO-100 และ SO-101 ไม่ได้รับการสนับสนุนเท่าเทียมกัน ที่เก็บข้อมูล SO-ARM100 ของ TheRobotStudio เก็บสินทรัพย์การจำลองไว้ภายใต้ Simulation/. โฟลเดอร์ SO100 มีไฟล์ URDF เพียงไฟล์เดียวและไม่มีอะไรอื่น โฟลเดอร์ SO101 มีทั้งไฟล์ URDF และ MuJoCo: scene.xml, so101_new_calib.xml, so101_old_calib.xml, ไฟล์ URDF ที่ตรงกัน และ joints_properties.xml หากคุณต้องการโมเดลฟิสิกส์มากกว่าห่วงโซ่จลนศาสตร์ คุณจะต้องใช้ไฟล์ SO-101

สิ่งเหล่านี้ถูกสร้างขึ้นด้วยปลั๊กอิน onshape-to-robot จากโมเดล CAD ที่ออกแบบใน Onshape ซึ่งหมายความว่าจลนศาสตร์และตาข่ายภาพนั้นดีเท่ากับ CAD พลวัตเป็นอีกเรื่องหนึ่ง และ README ของ repository เองก็ระบุอย่างตรงไปตรงมาเกี่ยวกับสามสิ่ง ตาข่ายการชนของฐานถูกลบออกเนื่องจากพฤติกรรมการชนที่เป็นปัญหาในระหว่างการจำลองและการวางแผน คุณสมบัติของมอเตอร์ STS3215 ถูกปรับมาจากโปรเจกต์ Open Duck Mini แทนที่จะวัดจาก SO-101 และข้อตกลงของ LeRobot gripper ที่ 0 คือปิดสนิทและ 100 คือเปิดสุด ยังไม่ได้สะท้อนอย่างชัดเจนในไฟล์ URDF และ MuJoCo แต่ละจุดเหล่านี้คือที่ที่นโยบายที่ฝึกฝนในโมเดลนั้นอย่างเดียวจะทำงานแตกต่างกันบนโต๊ะของคุณ

ข้อตกลงการปรับเทียบที่ทำให้เสียเวลาไปหนึ่งวัน

มีข้อตกลงศูนย์สองแบบในไฟล์ MuJoCo ที่จัดส่งมา และ scene.xml จะเลือกใช้แบบใดแบบหนึ่งโดยพิจารณาจากไฟล์หุ่นยนต์ที่รวมอยู่ ใน so101_new_calib.xml ซึ่งเป็นค่าเริ่มต้น ศูนย์เสมือนของแต่ละข้อต่อจะอยู่ที่ กึ่งกลาง ของช่วงการเคลื่อนที่ของข้อต่อ ใน so101_old_calib.xml ศูนย์คือการกำหนดค่าที่หุ่นยนต์ยืดออกไปในแนวนอนจนสุด หากตอนจำลองของคุณใช้ข้อตกลงหนึ่ง และตอนจริงที่คุณบันทึกไว้ใช้อีกข้อตกลงหนึ่ง มุมข้อต่อทุกมุมในชุดข้อมูลผสมจะถูกชดเชยไปหลายสิบองศา ค่า loss ยังคงลดลง และนโยบายจะทำสิ่งที่ผิดพลาดอย่างมั่นใจ ตรวจสอบข้อตกลงทั้งสองด้านก่อนที่คุณจะร่วมฝึก และอ่าน การปรับเทียบ และ loss ลดลง แต่นโยบายไม่ทำอะไร ก่อน

การสุ่มโดเมน และสิ่งที่ไม่สามารถแก้ไขได้

คำตอบมาตรฐานสำหรับช่องว่างนี้คือการหยุดพยายามจับคู่ความเป็นจริง และหันไปฝึกฝนในชุดข้อมูลที่มีการกระจายกว้างพอที่ความเป็นจริงจะครอบคลุมอยู่ภายในนั้น Tobin และเพื่อนร่วมงานได้แสดงเวอร์ชันที่แข็งแกร่งของสิ่งนี้ในปี 2017: เครื่องตรวจจับวัตถุที่ฝึกฝนเฉพาะกับภาพจำลองที่มีพื้นผิวสุ่มที่ไม่สมจริง โดยไม่มีการฝึกฝนล่วงหน้าด้วยภาพจริงเลย สามารถระบุตำแหน่งวัตถุจริงได้อย่างแม่นยำถึง 1.5 ซม. และยังคงทนทานต่อสิ่งรบกวนและการบดบังบางส่วน

Isaac Lab นำเสนอแนวคิดเดียวกับเงื่อนไขเหตุการณ์ที่คุณแนบไปกับการกำหนดค่าสภาพแวดล้อม สิ่งเหล่านี้คือตัวปรับแต่ง โดยใช้ชื่อฟังก์ชันจริงใน isaaclab.envs.mdp เพื่อให้คุณสามารถไปอ่านได้แทนที่จะคาดเดา

ฟังก์ชันเหตุการณ์สิ่งที่ถูกรบกวน
randomize_rigid_body_materialแรงเสียดทานจากการสัมผัสและการคืนตัว
randomize_rigid_body_mass, randomize_rigid_body_comมวลของวัตถุและลิงก์, การชดเชยจุดศูนย์ถ่วง
randomize_actuator_gainsความแข็งและแรงหน่วงของตัวควบคุมข้อต่อ
randomize_joint_parameters, randomize_fixed_tendon_parametersแรงเสียดทานข้อต่อ, อาร์มาเจอร์ และขีดจำกัด
randomize_visual_texture_material, randomize_visual_colorลักษณะที่ปรากฏ, ครึ่งหนึ่งของช่องว่างที่เกี่ยวข้องกับแสง
randomize_physics_scene_gravityเวกเตอร์แรงโน้มถ่วง
apply_external_force_torque, push_by_setting_velocityการรบกวนระหว่างรันไทม์
reset_root_state_uniform, reset_joints_by_offsetการกระจายสถานะเริ่มต้นในการรีเซ็ตแต่ละตอน

นี่คือข้อจำกัด และเป็นสิ่งที่ผู้คนมักจะพลาด การสุ่มช่วยขยายการกระจายที่นโยบายได้เห็นภายในโมเดลที่คุณสร้างขึ้น มันไม่สามารถนำเสนอผลกระทบทางกายภาพที่ตัวจำลองไม่ได้แสดง หาก PhysX ไม่ได้จำลองการคลอนตัวและการลดลงจากความร้อนของเซอร์โว STS3215 ของคุณ การสุ่มความแข็งของเซอร์โวนั้นก็ไม่ได้สอนอะไรแก่นโยบายเกี่ยวกับการคลอนตัว นั่นคือเหตุผลว่าทำไมแขนที่ ภายใต้นโยบายที่ฝึกฝนด้วยการจำลองจึงไม่ใช่ปัญหาเรื่องงบประมาณการสุ่ม แต่เป็นปัญหาเรื่องการสร้างแบบจำลอง

เส้นทางแบบแมนนวล: การสร้างข้อมูลใน Isaac Lab

Isaac Gym เป็นซอฟต์แวร์รุ่นเก่า หน้าเว็บของ NVIDIA เองมีหัวข้อว่า "Isaac Gym - ตอนนี้เลิกใช้แล้ว" และระบุว่านักพัฒนาสามารถดาวน์โหลดและใช้งานต่อไปได้ แต่จะไม่ได้รับการสนับสนุนอีกต่อไป โดยแนะนำให้ใช้ Isaac Lab แทน หากคุณต้องการทราบประวัติ เราได้ครอบคลุมทั้งสองอย่างแล้ว: และ . สำหรับงานใหม่ในปี 2026 ให้เริ่มต้นที่ Isaac Lab.

  1. 1
    ติดตั้ง Isaac Sim และ Isaac Lab

    หน้าการติดตั้ง pip ระบุว่าคำแนะนำนี้สำหรับ Isaac Sim 5.X ซึ่งต้องใช้ Python 3.11 การโคลนซอร์สโค้ดจะให้สคริปต์ที่จำเป็นสำหรับขั้นตอนถัดไป

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    บันทึกการสาธิตโดยมนุษย์ประมาณสิบครั้ง

    เอกสารประกอบของ Isaac Lab ระบุไว้อย่างชัดเจนว่า ต้องมีการสาธิตที่สำเร็จประมาณ 10 ครั้งเพื่อให้ขั้นตอนต่อไปสำเร็จ เคล็ดลับก็เฉพาะเจาะจงเช่นกัน: ทำให้การสาธิตสั้นเข้าไว้ เลือกเส้นทางตรงแทนที่จะเคลื่อนที่ไปตามแกนที่กำหนดเอง และอย่าหยุดชั่วคราว เพราะนโยบายไม่สามารถเข้าใจได้ว่าทำไมและเมื่อใดควรหยุด

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    ใส่คำอธิบายประกอบขอบเขตงานย่อย

    Mimic จะแบ่งการสาธิตที่ป้อนเข้าเป็นงานย่อย เพื่อให้สามารถปรับเวลาและกำหนดเป้าหมายส่วนต่างๆ ใหม่ได้ แฟล็ก --auto จะดำเนินการนี้โดยไม่ต้องมีมนุษย์เข้ามาเกี่ยวข้องสำหรับงานที่กำหนดการใส่คำอธิบายประกอบอัตโนมัติ หากไม่มีแฟล็กนี้ คุณจะหยุดชั่วคราวด้วย B, ดำเนินการต่อด้วย N และทำเครื่องหมายขอบเขตด้วย S โปรดทราบว่า ID งานจะได้รับส่วนต่อท้าย -Mimic

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    สร้างชุดข้อมูลที่เพิ่มจำนวน

    นี่คือขั้นตอนที่เปลี่ยน 10 เป็น 1000 Mimic ใช้เกณฑ์ความสำเร็จแบบบูลีนกับผู้สมัครแต่ละราย และเก็บเฉพาะผู้ที่ทำงานสำเร็จเท่านั้น ดังนั้นจำนวนผลลัพธ์จึงน้อยกว่าจำนวนการทดลอง เอกสารระบุว่าอัตราความสำเร็จของผู้สมัครสูงถึง 70 เปอร์เซ็นต์ในกรณีง่ายๆ และต่ำกว่า 1 เปอร์เซ็นต์สำหรับงานที่ยากและหุ่นยนต์ที่ซับซ้อน: ประมาณ 50 เปอร์เซ็นต์สำหรับการวางลูกบาศก์ของ Franka และ 65 ถึง 80 เปอร์เซ็นต์สำหรับการหยิบและวางของ GR1T2 โดยที่การสาธิต 1000 ครั้งใช้เวลา 18 ถึง 40 นาที (19 นาทีบน RTX ADA 6000 ที่ 80 เปอร์เซ็นต์)

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    แปลง HDF5 เป็นชุดข้อมูล LeRobot

    ทุกสิ่งที่กล่าวมาข้างต้นสร้าง robomimic-flavoured HDF5 และ Isaac Lab core ไม่มีตัวแปลง LeRobot ของตัวเอง: เอกสารระบุเพียงว่าคุณสามารถแปลงชุดข้อมูลที่สร้างขึ้นเป็นรูปแบบ LeRobot ได้ มีสองโปรเจกต์ที่จัดหาตัวแปลงจริง IsaacLab-Arena มีตัวแปลงที่มุ่งเป้าไปที่ GR00T ซึ่งขับเคลื่อนโดยการกำหนดค่า YAML ทั้งหมด และ LeIsaac มีคู่ของตัวเองสำหรับเส้นทาง SO-101 (ดูด้านล่าง)

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
ตรึงเวอร์ชันของคุณ และอย่าเชื่อ `main`

ในวันที่ 23 สิงหาคม 2026 เอกสารประกอบของ Isaac Lab สำหรับ main มีป้าย Isaac Sim 6.0.1 และนำเสนอ release/3.0.0 และ v3.0.0-beta2 ในตัวสลับเวอร์ชันควบคู่ไปกับ v2.3.2 ในขณะที่หน้าการติดตั้ง pip บนโครงสร้างเดียวกันยังคงตรึง isaacsim[all,extscache]==5.1.0 และอธิบายคำแนะนำว่าสำหรับ Isaac Sim 5.X คอนเทนเนอร์พิมพ์เขียว synthetic-manipulation-motion-generation ของ NVIDIA เก่ากว่าอีก: Isaac Lab 2.0.2 บน Isaac Sim 4.5.0 ตารางความเข้ากันได้ของ LeIsaac เองจับคู่ Isaac Sim 5.1 กับ Isaac Lab v2.3.0 โครงสร้างเหล่านี้เคลื่อนที่เร็วกว่าที่เอกสารจะปรับให้เข้ากันได้ เลือกเวอร์ชันเดียว จดบันทึกไว้ และคาดว่าเส้นทางสคริปต์และชื่อแฟล็กจะเปลี่ยนไปหากคุณทำตามบทช่วยสอนที่เขียนเมื่อสามเดือนที่แล้ว

เหตุใดความพยายามในการสร้างจึงล้มเหลว และสิ่งที่ต้องเปลี่ยนแปลง

อัตราความสำเร็จของผู้สมัครที่แกว่งไปมาระหว่าง 70 เปอร์เซ็นต์และต่ำกว่า 1 เปอร์เซ็นต์ไม่ใช่เรื่องลึกลับ และ Isaac Lab ได้บันทึกข้อผิดพลาดทั่วไปไว้ แทนที่จะปล่อยให้คุณคาดเดา ข้อผิดพลาดเหล่านี้เป็นสิ่งที่คุณควบคุมได้ในขณะบันทึก ซึ่งเป็นเหตุผลว่าทำไมจึงควรศึกษาข้อมูลในรายการนี้ก่อนที่คุณจะบันทึกการสาธิตเริ่มต้นทั้งสิบครั้ง แทนที่จะเป็นหลังจากรันการสร้างครั้งแรกที่น่าผิดหวัง

  • การสาธิตยาวเกินไป ขอบเขตเวลาที่ยาวขึ้นทำให้ policy เรียนรู้ได้ยากขึ้น เริ่มต้นใกล้กับวัตถุแรกและลดการเคลื่อนไหวให้เหลือน้อยที่สุด
  • การสาธิตไม่ราบรื่น การเคลื่อนไหวที่ไม่สม่ำเสมอทำให้ policy ตีความได้ยาก และฮาร์ดแวร์ teleoperation ที่ดีขึ้นจะให้ข้อมูลที่ดีขึ้น: เอกสารระบุไว้อย่างชัดเจนว่า SpaceMouse ดีกว่าคีย์บอร์ด
  • การหยุดชั่วคราว การหยุดชั่วคราวเป็นเรื่องยากที่จะเรียนรู้ เพราะ policy ไม่สามารถเข้าใจได้ชัดเจนว่าทำไมและเมื่อใดควรหยุดชั่วคราว รักษาการเคลื่อนไหวให้ต่อเนื่อง
  • มีงานย่อยมากเกินไป งานย่อยที่มากขึ้นหมายถึงการเชื่อมต่อระหว่างส่วนของวิถีการเคลื่อนที่มากขึ้น ซึ่งส่งผลให้การเคลื่อนไหวไม่ราบรื่นและอัตราความสำเร็จในการสร้างต่ำลง กำหนดขอบเขตที่แขนไม่น่าจะชนกับสิ่งใดๆ
  • ไม่มี action noise Action noise ทำให้ policy ที่ได้มีความทนทานมากขึ้น
  • การบันทึกถูกตัดสั้นเกินไป หากการบันทึกหยุดลงที่เฟรมที่เงื่อนไขความสำเร็จทำงานพอดี อาจไม่ทำงานซ้ำระหว่างการเล่นซ้ำ ให้เว้นบัฟเฟอร์ไว้ที่ส่วนท้าย
  • การเล่นซ้ำที่ไม่สามารถคาดเดาได้ ฟิสิกส์ใน Isaac Lab ไม่สามารถทำซ้ำได้อย่างแม่นยำเมื่อมีการรีเซ็ตสภาพแวดล้อม (env.reset) ดังนั้นการสาธิตของมนุษย์บางส่วนจึงล้มเหลวในการเล่นซ้ำ รวบรวมให้มากกว่าที่ต้องการและเก็บเฉพาะส่วนที่ผ่านการระบุข้อมูล ทุกสิ่งที่อยู่ในไฟล์ HDF5 ที่สร้างโดย Mimic ถือเป็นการสาธิตที่สำเร็จและสามารถใช้สำหรับการฝึกอบรมได้ แม้ว่าการเล่นซ้ำจะล้มเหลวในภายหลังก็ตาม

ขั้นตอนการประมาณค่าในช่วงระหว่างส่วนของงานย่อยที่เชื่อมต่อกันมีปุ่มปรับแต่งของตัวเอง และจำนวนขั้นตอนการประมาณค่าที่คุณต้องการจะปรับตามความเร็วในการเคลื่อนที่ของหุ่นยนต์และความกว้างของการกระจายการรีเซ็ตวัตถุ งานที่ซับซ้อนซึ่งมีการกระจายการรีเซ็ตที่กว้างจะทำให้เกิดช่องว่างขนาดใหญ่ขึ้นระหว่างส่วนต่างๆ ซึ่งต้องใช้ขั้นตอนการประมาณค่าในช่วงมากขึ้นเพื่อให้ได้การเคลื่อนไหวที่ต่อเนื่อง หากวิดีโอที่คุณสร้างแสดงแขนหุ่นยนต์กระตุกระหว่างเฟส นั่นคือพารามิเตอร์ที่ควรพิจารณาก่อนที่คุณจะตำหนิการสาธิตเริ่มต้น

ไปป์ไลน์เดียวกันบน SO-101 พร้อมแขนผู้นำจริง

นี่เป็นสิ่งที่น่าสนใจสำหรับทุกคนที่อ่านหน้านี้ เพราะเป็นไปป์ไลน์แบบเปิดเพียงหนึ่งเดียวที่นำ เข้าไปใน Isaac Lab และให้คุณขับเคลื่อนมันด้วยแขนผู้นำทางกายภาพที่คุณมีอยู่แล้ว LeIsaac เวอร์ชัน 0.4.0 ณ เวลาที่เขียนนี้ เป็นสนามจำลองการเรียนรู้แบบเลียนแบบอย่างเป็นทางการที่รวมอยู่ใน EnvHub ของ LeRobot ตารางความเข้ากันได้ระบุชุดค่าผสมที่ใช้งานได้สามชุด; ชุดใหม่ล่าสุดจับคู่ Isaac Sim 5.1 กับ Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 และ Python 3.11 และเอกสารแนะนำ Isaac Sim 5.0 หรือใหม่กว่าสำหรับกราฟิกการ์ดซีรีส์ 50

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
LeIsaac จากซอร์สโค้ด การกำหนดเวอร์ชัน numpy อยู่ในคำแนะนำอย่างเป็นทางการ ไม่ใช่การแก้ไขเฉพาะหน้า

เมื่อติดตั้งแล้ว แขนผู้นำบน /dev/ttyACM0 จะขับเคลื่อนหุ่นยนต์ผู้ตามที่จำลองขึ้น และบันทึกข้อมูลลงใน HDF5 โดยตรง ลูปเป็นแบบเดียวกับที่คุณรู้จักจากการบันทึกจริง เพียงแต่ผู้ตามเป็นวัตถุแข็งเกร็งใน PhysX

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
Environment IDคำอธิบายงานหุ่นยนต์
LeIsaac-SO101-PickOrange-v0หยิบส้มสามลูกใส่จาน จากนั้นปรับแขนกลับสู่ท่าพักSingle-arm SO101 follower
LeIsaac-SO101-LiftCube-v0ยกกล่องสี่เหลี่ยมสีแดงขึ้นSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-v0หยิบวัตถุรูปตัวอักษร e สองชิ้นใส่กล่อง จากนั้นปรับแขนกลับสู่ท่าพักSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-BiArm-v0งานเดียวกันแต่ใช้แขนสองข้างBi-arm SO101 follower
LeIsaac-SO101-FoldCloth-BiArm-v0พับผ้า จากนั้นปรับแขนกลับสู่ท่าพัก เฉพาะ DirectEnv variant เท่านั้นที่รองรับ check_successBi-arm SO101 follower
LeIsaac-LeKiwi-CleanupTrash-v0เก็บขยะกระดาษทิชชูจากพื้นแล้วทิ้งลงถังขยะLeKiwi

ID ส่วนใหญ่เหล่านี้ยังมีอยู่ในรูปแบบ -Direct-v0 variant และ python scripts/environments/list_envs.py จะแสดงรายการปัจจุบัน คุณยังสามารถข้ามการใช้ HDF5 ไปได้เลย และเขียนในรูปแบบ LeRobot ระหว่างการควบคุมระยะไกลโดยเพิ่มสามแฟล็ก ข้อควรระวังสองประการมาจากเอกสารประกอบเอง: ตัวบันทึกจะข้าม 5 เฟรมแรกของแต่ละตอนโดยอัตโนมัติเพื่อหลีกเลี่ยงความไม่เสถียรจากสถานะเริ่มต้น และอาจทำให้เกิดความล่าช้าเล็กน้อยในการควบคุมระยะไกล ซึ่งเป็นสิ่งที่เปลี่ยนแปลงลักษณะของการสาธิตของคุณอย่างเงียบๆ นอกจากนี้ยังจะบันทึกตอนที่งานถูกทำเครื่องหมายว่าสำเร็จเท่านั้น

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

ขั้นตอนการคูณจะทำงานบนการบันทึกเหล่านั้น LeIsaac ห่อหุ้ม Isaac Lab Mimic ด้วยสี่คำสั่ง เนื่องจาก Mimic ทำให้วิถีการเคลื่อนที่ทั่วไปจากตำแหน่งปลายแขนและวัตถุ: แปลงการกระทำใน joint-space เป็นการกระทำแบบ IK, ใส่คำอธิบายประกอบ, สร้าง, จากนั้นแปลงกลับเป็น joint-space

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

จากนั้นแปลงเป็น LeRobot นี่คือขั้นตอนที่กฎรูปแบบของแพลตฟอร์มมีผล และ LeIsaac ก็มีตัวแปลงสองตัวที่คุณต้องการพอดี: isaaclab2lerobot.py เขียน LeRobot v2 ซึ่งเป็นสิ่งที่ตัวโหลด GR00T ใช้ และ isaaclab2lerobotv3.py เขียน v3 สำหรับ Pi0.5, SmolVLA และ ACT. สคริปต์ทั้งสองใช้พารามิเตอร์เดียวกัน แต่กำหนดเวอร์ชัน lerobot ที่แตกต่างกัน และจะแปลงเฉพาะตอนที่สำเร็จเท่านั้น

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
ผลลัพธ์ LeRobot v2 สำหรับ GR00T. สลับใช้ isaaclab2lerobotv3.py พร้อม lerobot 0.4.2 สำหรับเทรนเนอร์ v3.
มีทางออกสำหรับผู้ที่ไม่มี GPU

LeIsaac มีเอกสารเกี่ยวกับการรันสแต็กทั้งหมดบน NVIDIA Brev: deploy, คลิกที่ลิงก์พอร์ต 80 เพื่อเปิด VS Code Server ที่ทำงานบนเบราว์เซอร์ และขับเคลื่อนสี่สถานการณ์ที่ติดตั้งไว้ล่วงหน้าด้วย --kit_args="--no-window --enable omni.kit.livestream.webrtc" โดยดูผลลัพธ์ที่อยู่เดียวกันโดยเพิ่ม /viewer หากคุณไม่มีการ์ดเวิร์คสเตชันใต้โต๊ะ นั่นเป็นวิธีที่ถูกกว่าในการค้นหาว่าเวอร์ชันจำลองของงานของคุณใกล้เคียงหรือไม่ ก่อนที่คุณจะลงทุนกับฮาร์ดแวร์

สองเส้นทางสู่โมเดลนโยบายที่ผ่านการฝึกฝน

คุณสร้างฉาก, สร้างข้อมูล, เช่า GPU และตั้งค่าการให้บริการด้วยตัวเอง นี่เป็นทางเลือกที่เหมาะสมหากงานต้องการความหลากหลายของสภาพแวดล้อมที่คุณไม่สามารถจัดเตรียมได้จริง หรือหากคุณต้องการการประเมินที่ทำซ้ำได้

  1. ติดตั้ง Isaac Sim 5.1 และ Isaac Lab หรือ LeIsaac stack หากหุ่นยนต์ของคุณคือ SO-101
  2. สร้างโมเดลหรือนำเข้าฉาก ขั้นตอนนี้มักไม่มีใครตั้งงบประมาณไว้ และมักเป็นขั้นตอนที่ใช้เวลานานที่สุด
  3. บันทึกการสาธิตที่สะอาดประมาณ 10 ครั้งผ่านตัวติดตามจำลอง
  4. ระบุงานย่อย, รัน generate_dataset.py และยอมรับว่าความล้มเหลวจะถูกทิ้งไป
  5. แปลง HDF5 เป็นรูปแบบ LeRobot โดยเลือก v2 สำหรับ GR00T และ v3 สำหรับรุ่นอื่นๆ
  6. บันทึกเหตุการณ์จริงบนแขนกลจริงอยู่ดี จากนั้นฝึกฝนร่วมกันบนข้อมูลผสม
  7. เช่า GPU, รันการปรับแต่งละเอียด, ให้บริการ checkpoint ถัดจากแขนกล
ทรัพยากรสิ่งที่แหล่งข้อมูลระบุ
GPU สำหรับการจำลองในเครื่องพิมพ์เขียวการจัดการสังเคราะห์ของ NVIDIA กำหนดให้ใช้ Ubuntu 22.04 และ NVIDIA RTX A6000 ที่มี VRAM 48 GB
โหนดโมเดลโลกพิมพ์เขียวเดียวกันกำหนดให้ใช้ H100 หรือสูงกว่าที่มี 80 GB บนโหนดที่แยกจากการจำลอง Isaac Lab
เวอร์ชันคอนเทนเนอร์Isaac Lab 2.0.2 บน Isaac Sim 4.5.0 ภายในอิมเมจพิมพ์เขียวนั้น
ปริมาณงานการสร้างIsaac Lab รายงานการสาธิตการหยิบและวาง GR1T2 จำนวน 1000 ครั้งใน 18 ถึง 40 นาที, 19 นาทีบน RTX ADA 6000 ที่มีอัตราความสำเร็จ 80 เปอร์เซ็นต์
ค่าใช้จ่ายวิถีประสาทGR00T N1 รายงานประมาณ 105,000 ชั่วโมง GPU L40 หรือประมาณ 1.5 วันบน L40 จำนวน 3,600 ตัว สำหรับ 827 ชั่วโมงแห่งความฝัน
ต้นทุนที่แท้จริงคือเวลาตามปฏิทิน ไม่ใช่เวลา GPU

การสร้างวิถี 1000 เส้นใช้เวลาช่วงบ่าย การทำให้ฉากของคุณ, ค่า extrinsics ของกล้อง, mesh ของวัตถุ และโมเดลเซอร์โวของคุณใกล้เคียงกันมากพอที่วิถีเหล่านั้นจะถ่ายโอนได้คือส่วนที่ใช้เวลาหลายสัปดาห์ ตั้งงบประมาณสำหรับการสร้างโมเดล ไม่ใช่การสุ่มตัวอย่าง

โมเดลโลกวิดีโอ: เลเยอร์ใหม่ล่าสุด และมีการวัดผลน้อยที่สุด

แนวคิดเบื้องหลัง DreamGen คือโมเดลสร้างวิดีโอที่ปรับให้เข้ากับรูปร่างของหุ่นยนต์เป้าหมาย สามารถจินตนาการถึงเหตุการณ์ที่เป็นไปได้ในฉากที่คุณไม่เคยไปเยี่ยมชมได้ กระบวนการนี้มีสี่ขั้นตอน: ปรับแต่งโมเดลโลกวิดีโอ, สร้างวิดีโอหุ่นยนต์สังเคราะห์ที่สมจริง, กู้คืนลำดับการกระทำเทียมด้วยโมเดลการกระทำแฝงหรือโมเดลพลวัตผกผัน จากนั้นฝึกฝนโมเดลนโยบายหุ่นยนต์จากผลลัพธ์ NVIDIA's GR00T-dreams repository ได้นำแนวคิดนี้ไปใช้จริง

ผลลัพธ์หลักเป็นของจริงและควรพิจารณาอย่างจริงจัง: ข้อมูลการควบคุมระยะไกลจากงานหยิบและวางเพียงงานเดียวในสภาพแวดล้อมเดียว สร้างพฤติกรรมใหม่ 22 อย่างบนหุ่นยนต์ฮิวแมนนอยด์ ทั้งในสภาพแวดล้อมที่เคยเห็นและไม่เคยเห็น ข้อควรระวังก็เป็นของจริงเช่นกันและอยู่ในขั้นตอนที่สาม

โมเดลโลกวิดีโอในฐานะแหล่งข้อมูล
ข้อดี
  • พวกมันปรับขนาดได้ตามแกนที่มีค่าใช้จ่ายสูงอย่างแท้จริงในโลกแห่งความเป็นจริง: ฉากใหม่, การจัดเรียงวัตถุใหม่, การกำหนดคำสั่งใหม่
  • GR00T-dreams ระบุการใช้งานที่รองรับสี่แบบสำหรับสคริปต์การสกัดการกระทำและการปรับแต่ง: franka, gr1, robocasa และ so100 นี่ไม่ใช่เทคนิคสำหรับหุ่นยนต์ฮิวแมนนอยด์เท่านั้น
  • Cosmos-Transfer1 โจมตีครึ่งหนึ่งของช่องว่างด้านโฟโตเมตริกโดยตรง โดยการแมปตัวอย่างสังเคราะห์ทางหุ่นยนต์หนึ่งตัวอย่างไปยังตัวอย่างที่สมจริงหลายตัวอย่างจากการแบ่งส่วน, ความลึก หรือการปรับสภาพขอบ Isaac Lab เองก็มีเครื่องมือพร้อมท์สำหรับสิ่งนี้ภายใต้ scripts/tools/cosmos
  • งาน DreamGen มาพร้อมกับ DreamGen Bench ซึ่งเป็นเกณฑ์มาตรฐานการสร้างวิดีโอที่แสดงความสัมพันธ์ที่แข็งแกร่งระหว่างประสิทธิภาพของเกณฑ์มาตรฐานและความสำเร็จของนโยบายปลายน้ำ ดังนั้นคุณสามารถคัดกรองการสร้างก่อนที่จะนำไปฝึก
ข้อแลกเปลี่ยน
  • การกระทำถูกกู้คืนโดยโมเดล ไม่ได้วัดโดยตัวเข้ารหัส วิดีโอที่ดูถูกต้องอาจมีวิถีการเคลื่อนที่ของข้อต่อที่แขนของคุณไม่สามารถทำตามได้
  • การสร้างมีค่าใช้จ่ายสูง GR00T N1 รายงานว่าใช้เวลาสองนาทีในการสร้างวิดีโอหนึ่งวินาทีบน L40 ซึ่งประมาณ 105,000 ชั่วโมง GPU ของ L40 หรือประมาณ 1.5 วันบน GPU L40 จำนวน 3,600 ตัว สำหรับวิถีประสาท 827 ชั่วโมง
  • ผลกำไรที่วัดได้อยู่ในหลักหน่วย: 4.2, 8.8 และ 6.8 คะแนนบน RoboCasa ในสามระบอบข้อมูล และ 5.8 คะแนนโดยเฉลี่ยจากงาน GR-1 จริง 8 งาน นอกเหนือจากโมเดลที่มีข้อมูลจริงอยู่แล้ว
  • ไม่มีสูตรที่เผยแพร่ใดยืนยันสิ่งนี้สำหรับแขนเซอร์โวงานอดิเรก 7.4 V แบบครบวงจร คุณจะต้องทำการพอร์ต ไม่ใช่แค่ทำตาม
ห้ามป้อนไฟ 12 V ให้กับ STS3215

ไม่เกี่ยวข้องกับการจำลอง แต่เป็นเรื่องที่เกิดขึ้นเมื่อใดก็ตามที่มีคนย้ายจากแขนจำลองไปสู่แขนจริงและปรับปรุงแหล่งจ่ายไฟ แขน SO-100, SO-101 และ LeKiwi ทั้งหมดใช้เซอร์โว Feetech STS3215 ที่ 7.4 V การป้อนไฟ 12 V จะทำลายพวกมัน และ LeKiwi เป็นกับดักโดยเฉพาะเนื่องจากรางฐานของมันคือ 12 V โปรดดู หน้าฮาร์ดแวร์ SO-100 ก่อนที่คุณจะทำการต่อสายใดๆ

การฝึกร่วมเป็นสูตรที่แสดงให้เห็นถึงผลกำไรที่แท้จริง

หากคุณจะนำบทเรียนการปฏิบัติงานจากงานวิจัยไปใช้ ให้เลือกบทเรียนนี้ การศึกษาการฝึกร่วมกันระหว่างการจำลองและโลกจริง (Maddukuri และคณะ, 2025) ได้พยายามหาสูตรสำเร็จง่ายๆ สำหรับการใช้ข้อมูลการจำลองเพื่อแก้ไขงานการควบคุมหุ่นยนต์ที่ใช้การมองเห็น ในสองโดเมน ได้แก่ แขนหุ่นยนต์และหุ่นยนต์ฮิวแมนนอยด์ และข้อสรุปคือคุณควรฝึกด้วยข้อมูลผสม ข้อมูลการจำลองช่วยเพิ่มประสิทธิภาพของงานในโลกจริงโดยเฉลี่ย 38 เปอร์เซ็นต์ และงานวิจัยระบุไว้อย่างชัดเจนว่าสิ่งนี้ยังคงเป็นจริงแม้จะมีความแตกต่างที่เห็นได้ชัดระหว่างข้อมูลการจำลองและข้อมูลในโลกจริง

ข้อความสุดท้ายนั้นสำคัญกว่า 38 เปอร์เซ็นต์ หมายความว่าการจำลองไม่จำเป็นต้องเป็นดิจิทัลทวินที่สมบูรณ์แบบจึงจะมีประโยชน์ โดยมีเงื่อนไขว่าข้อมูลจริงต้องอยู่ในส่วนผสมเพื่อเป็นจุดยึด การถ่ายโอนจากการจำลองเพียงอย่างเดียวเป็นเส้นทางที่สิ้นเปลือง: งานวิจัยเดียวกันระบุว่าการฝึกนโยบายเฉพาะในการจำลองและถ่ายโอนไปยังโลกจริงมักต้องใช้ความพยายามของมนุษย์อย่างมากเพื่อเชื่อมช่องว่างความเป็นจริง การฝึกร่วมกันช่วยลดความพยายามส่วนใหญ่โดยไม่เคยขอให้นโยบายปิดช่องว่างด้วยตัวเอง

The AY-Robots policy comparison table showing parameters, GPU tier, inference latency and minimum episodes for GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA and ACT.
นโยบายที่สามารถฝึกได้ห้าแบบที่ /policies คอลัมน์จำนวนตอนขั้นต่ำคือตัวเลขที่ตัดสินว่าข้อมูลสังเคราะห์เป็นสิ่งที่ดีที่จะมี หรือเป็นวิธีเดียวที่คุณจะเข้าถึงชุดข้อมูลที่สามารถฝึกได้

ในทางปฏิบัติ บนแพลตฟอร์มนี้ การฝึกร่วมกันหมายถึงสิ่งเดียว: ใส่ชุดตอนทั้งสองชุดลงใน ชุดข้อมูล LeRobot โดยมีคีย์กล้องที่สอดคล้องกัน ลำดับข้อต่อที่สอดคล้องกัน และหน่วยที่สอดคล้องกัน จากนั้นเรียกใช้ การปรับแต่งอย่างละเอียด. ไม่มีปุ่มปรับน้ำหนักส่วนผสมในแบบฟอร์มการฝึก หากคุณต้องการอัตราส่วนการจำลองต่อโลกจริง 3:1 คุณสามารถระบุได้ด้วยจำนวนตอนของแต่ละประเภทที่คุณใส่ในชุดข้อมูล

ชัยชนะที่ง่ายที่สุดจากการจำลองไม่ใช่ข้อมูลการฝึกอบรม

มันคือการประเมินผล การทดลองจริงหลายสิบครั้งต่อภารกิจเพื่อเปรียบเทียบ ใช้เวลาหนึ่งวันในการทำงานของแขนกล และแขนกลก็มีการเคลื่อนที่ระหว่างการทดลอง SIMPLER (Li และคณะ, 2024) ได้สร้างสภาพแวดล้อมจำลองที่มีวัตถุประสงค์เพื่อประเมินนโยบายจริงแทนที่จะฝึกอบรม และจากนั้นก็วัดว่าการจัดอันดับจากการจำลองสามารถทำนายผลจริงได้ดีเพียงใด สภาพแวดล้อม SIMPLER เพียงหนึ่งเดียวสามารถเรนเดอร์ได้ 3,500 ขั้นตอนการจำลองต่อวินาทีบนการ์ดจอ RTX 4090 สำหรับผู้บริโภคที่ความละเอียด 640 x 512 ซึ่งภายใต้ความถี่การจำลอง 500 Hz จะเร็วกว่าการประเมินผลจริงถึง 7 เท่า

โปรโตคอลการประเมินMMRV (ค่ายิ่งต่ำยิ่งดี)Pearson r (ค่ายิ่งสูงยิ่งดี)
Validation MSE0.3750.308
SIMPLER, การรวมตัวแปร0.1430.778
SIMPLER, การจับคู่ด้วยภาพ0.0560.924

ค่าเหล่านี้เป็นค่าเฉลี่ยจากกลุ่มงาน Google Robot สามกลุ่มสำหรับเช็คพอยต์โอเพนซอร์สทั่วไปหกรายการ: เช็คพอยต์ RT-1 สามรายการในขั้นตอนการฝึกอบรมที่แตกต่างกัน, RT-1-X, RT-2-X และ Octo-Base ฝั่งการทดลองจริงไม่ใช่จำนวนการทดลองที่สม่ำเสมอ ซึ่งเป็นสิ่งสำคัญที่ควรทราบก่อนนำไปอ้างอิง: 75 การทดลองสำหรับการหยิบกระป๋องโค้ก, 60 สำหรับการเคลื่อนย้ายเข้าใกล้, 54 สำหรับงานเปิดและปิดลิ้นชัก และ 27 สำหรับงานลิ้นชักและแอปเปิลที่ยาวกว่า การเปรียบเทียบกับ Validation MSE เป็นส่วนที่มีประโยชน์ การเลือกโมเดลโดยใช้ Validation Loss จัดอันดับเช็คพอยต์เหล่านี้ได้ไม่ดี และค่า Pearson r ที่ 0.924 ภายใต้การจับคู่ด้วยภาพหมายความว่า หากเช็คพอยต์ใดได้คะแนนดีกว่าใน SIMPLER ก็มีแนวโน้มสูงมากที่จะได้คะแนนดีกว่าในการทดสอบจริง นั่นคือกระดานคะแนนที่สามารถทำซ้ำได้ข้ามคืน และไม่จำเป็นต้องเชื่อสิ่งใดเกี่ยวกับการถ่ายโอนการฝึกอบรมจากจำลองสู่จริง

กระดานผู้นำ AY-Robots Arena ซึ่งเป็นตารางที่จัดเรียงได้ของโมเดลวิสัยทัศน์-ภาษา-การกระทำ 85 โมเดล พร้อมผลการทดสอบมาตรฐาน 332 รายการ โดยแต่ละค่าเชื่อมโยงไปยังเอกสารต้นฉบับหรือการ์ดโมเดล
The Arena ที่ /arena รวบรวมผลการทดสอบมาตรฐาน 332 รายการจาก 85 โมเดล เกือบทั้งหมดเป็นการทดสอบมาตรฐานแบบจำลอง ซึ่งเป็นประเด็นสำคัญของข้อโต้แย้ง SIMPLER: การจำลองเป็นกระดานคะแนนที่ดีนานก่อนที่จะเป็นแหล่งข้อมูลที่ดี

หากคุณต้องการบริบทที่กว้างขึ้นว่าตัวเลขการทดสอบมาตรฐานเหล่านี้บอกอะไรและไม่บอกอะไรเกี่ยวกับ , เราได้เขียนอธิบายแยกไว้ใน .

แพลตฟอร์มนี้ไม่สามารถช่วยคุณได้ในเรื่องใดบ้าง

การระบุขอบเขตให้ชัดเจนช่วยประหยัดเวลาของทุกคน AY-Robots เป็นแพลตฟอร์มสำหรับการบันทึก การฝึกอบรม และการให้บริการ ไม่มีโปรแกรมจำลองอยู่ในตัว

  • ไม่มี Isaac Lab, ไม่มี MimicGen, ไม่มีโมเดลโลก, ไม่มีเครื่องมือสร้างฉาก หากคุณต้องการข้อมูลที่สร้างขึ้น คุณต้องสร้างมันจากที่อื่นแล้วนำผลลัพธ์มาใช้
  • เทรนเนอร์ใช้ชุดข้อมูล LeRobot เท่านั้น การส่งออกข้อมูลจากโปรแกรมจำลองจะต้องถูกแปลงก่อนที่จะนำมาเป็นอินพุต และต้องเป็นเวอร์ชันที่ถูกต้อง: v2.0 หรือ v2.1 สำหรับ GR00T N1.5 และ N1.7, v3.0 สำหรับ Pi0.5, SmolVLA และ ACT
  • จุดเริ่มต้นของการปรับแต่ง GR00T คือ tyro CLI ที่ไม่เปิดเผย seed ทำให้การรัน GR00T ไม่สามารถทำซ้ำได้แบบ bit-for-bit หากคุณกำลังทำการทดลอง ablation ระหว่าง sim กับ real อย่างระมัดระวัง นี่คือข้อจำกัดที่สำคัญ seed เริ่มต้นของ lerobot คือ 1000 และฟอร์มของ ACT, SmolVLA และ Pi0.5 ก็เปิดเผยฟิลด์ seed
  • การสะสม Gradient จะถูกนำไปใช้จริงสำหรับเทรนเนอร์ GR00T สองตัวเท่านั้น สำหรับ Pi0.5 และ SmolVLA ฟิลด์นี้มีอยู่ในฟอร์ม แต่ lerobot 0.5.1 ไม่มีแฟล็กดังกล่าว จึงไม่มีผลใดๆ
  • การอนุมานต้องอยู่ใกล้กับเซอร์โวสำหรับงานที่รวดเร็ว ลูปควบคุมใช้เวลา 20 ถึง 485 ms ต่อขั้นตอนการกระทำ ขึ้นอยู่กับโมเดล และการเพิ่มการเดินทางไปกลับผ่านอินเทอร์เน็ตสาธารณะจะเปลี่ยนนโยบายที่ทำงานได้ให้กลายเป็นนโยบายที่ลังเล การอนุมานระยะไกลสามารถทำได้สำหรับงานหยิบและวางที่ช้า แต่ไม่เหมาะสำหรับการเคลื่อนไหวตอบสนองที่รวดเร็ว
สิ่งที่คุณสามารถทำได้ที่นี่ซึ่งยากที่จะทำที่อื่นอย่างแท้จริง

บันทึกข้อมูลจริงครึ่งหนึ่งของการผสมผสานการฝึกร่วมกันโดยไม่ต้องเป็นเจ้าของแขนกล /live สตรีม SO-100 ทางกายภาพโดยไม่ต้องลงทะเบียน ใช้ระบบคิว และ โปรแกรมผู้ควบคุม มีอยู่เพราะต้องมีคนขับเคลื่อนมัน หากปัญหาคอขวดของคุณคือคุณมีโปรแกรมจำลองแต่ไม่มีเหตุการณ์จริง นี่คือช่องว่างที่แพลตฟอร์มนี้จะช่วยปิดได้

งบประมาณที่คุณสามารถปกป้องได้

นำสองเส้นทางมาเปรียบเทียบกันพร้อมกับตัวเลขที่แต่ละเส้นทางเผยแพร่ออกมาจริง และการตัดสินใจมักจะเกิดขึ้นเองสำหรับโครงการงานเดียวบนแขนกลราคาประหยัด

รายการจำลองก่อนบันทึกก่อน
การสร้างแบบจำลองเบื้องต้นฉาก, เมช, การจัดวางกล้อง, โมเดลเซอร์โว ใช้เวลาหลายวันถึงหลายสัปดาห์ไม่มี
การเก็บข้อมูลสาธิตประมาณ 10 ครั้งในการจำลอง จากนั้นสร้างข้อมูล30 ถึง 50 ตอนจริง, การควบคุมระยะไกลไม่กี่ชั่วโมง
ฮาร์ดแวร์ที่ต้องมีการ์ด 48 GB สำหรับพิมพ์เขียว Isaac Lab, 80 GB สำหรับ Cosmos stageแขนหุ่นยนต์และแล็ปท็อป
ค่าใช้จ่ายในการฝึกเท่ากับคอลัมน์ขวา ผู้ฝึกไม่สนใจว่าข้อมูลมาจากไหน1 ถึง 3 USD สำหรับ 4090 tier, 4 ถึง 12 USD สำหรับ A100 หรือ H100 tier
หลักฐานที่ดีที่สุดของผลตอบแทนเพิ่มขึ้นเฉลี่ย 38 เปอร์เซ็นต์ในโลกจริงเมื่อฝึกร่วมกัน, 4 ถึง 9 จุดจากวิถีประสาทค่าพื้นฐานที่ใช้วัดทุกอย่างข้างต้น
ล้มเหลวเมื่องานของคุณขึ้นอยู่กับการสัมผัส, วัตถุที่เปลี่ยนรูปได้ หรือการปฏิบัติตามเซอร์โวคุณต้องการความหลากหลายของสภาพแวดล้อมที่คุณไม่สามารถจัดฉากทางกายภาพได้

สำหรับการสร้างนโยบายแรกบน SO-100 ให้บันทึกข้อมูล และ จะพาคุณไปสู่จุดตรวจสอบที่พร้อมใช้งานในราคาเท่ากาแฟหนึ่งแก้ว และคุณจะมีข้อมูลจริงครึ่งหนึ่งสำหรับการฝึกร่วมกันในอนาคต ใช้เครื่องจำลองเมื่อคุณมีค่าพื้นฐานที่ใช้งานได้และข้อผิดพลาดในการสรุปผลที่เฉพาะเจาะจงที่คุณสามารถระบุได้ เช่น นโยบายที่ .

ยังไม่มีแขนหุ่นยนต์บนโต๊ะของคุณใช่ไหม?

ควบคุม SO-100 จริงในเบราว์เซอร์ แบบใช้คิว ไม่ต้องลงทะเบียน และดูว่าตอนจริงมีลักษณะอย่างไรก่อนที่คุณจะใช้เวลาช่วงสุดสัปดาห์ในการสร้างแบบจำลองในเครื่องจำลอง

ควบคุมแขนหุ่นยนต์จริง

สูตรที่เคารพหลักฐาน

  1. 1
    บันทึกข้อมูลพื้นฐานจริงก่อน

    30 episodes for SmolVLA, 50 for ACT, GR00T N1.7 and Pi0.5. ฝึกฝนเพียงครั้งเดียว สิ่งที่นโยบายนั้นล้มเหลวคือข้อกำหนดของคุณสำหรับข้อมูลสังเคราะห์

  2. 2
    ระบุความล้มเหลวในการสรุปผล

    ท่าทางของวัตถุ? แสง? ความสูงของโต๊ะ? สิ่งรบกวน? การใช้คำสั่งที่แตกต่างกัน? ข้อมูลสังเคราะห์จะดีเยี่ยมสำหรับสิ่งเหล่านี้เพียงอย่างเดียวในแต่ละครั้ง และจะไร้ประโยชน์หากคุณไม่สามารถระบุได้ว่าคืออะไร

  3. 3
    เลือกกลุ่มวิธีที่ประหยัดที่สุดที่ครอบคลุม

    ความหลากหลายของท่าทางและการจัดวาง: การเพิ่มจำนวนวิถีการเคลื่อนที่ แสงและพื้นผิว: การเพิ่มประสิทธิภาพรูปภาพก่อน ตามด้วยโมเดลโลก ฉากใหม่ทั้งหมด: การจำลองทางฟิสิกส์ และยอมรับค่าใช้จ่ายในการสร้างโมเดล

  4. 4
    สร้างแล้วทิ้งส่วนที่ไม่ต้องการอย่างเด็ดขาด

    ความพยายามในการสร้างข้อมูลล้มเหลว และอัตราความสำเร็จของผู้สมัครของ Isaac Lab เองก็มีตั้งแต่ 70 เปอร์เซ็นต์ลงไปจนถึงต่ำกว่า 1 เปอร์เซ็นต์ ขึ้นอยู่กับงาน เก็บเฉพาะวิถีการเคลื่อนที่ที่สำเร็จและทำงานเสร็จสมบูรณ์ และตรวจสอบตัวอย่างเป็นวิดีโอก่อนที่คุณจะเชื่อถือชุดข้อมูล

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    ฝึกฝนร่วมกัน ไม่ใช่การแทนที่

    รวมตอนที่สร้างขึ้นกับตอนจริงเข้าด้วยกันเป็นชุดข้อมูล LeRobot ชุดเดียว โดยมีคีย์กล้องและการจัดเรียงข้อต่อที่เหมือนกัน ตัวเลข 38 เปอร์เซ็นต์เป็นตัวเลขของการฝึกฝนร่วมกัน

  6. 6
    ประเมินผลบนแขนกลจริง และที่นั่นเท่านั้น

    การประเมินผลจากการจำลองเป็นสัญญาณการจัดอันดับที่ดี (ค่า Pearson r 0.924 ในการตั้งค่าการจับคู่ภาพของ SIMPLER) แต่ไม่ใช่การทดสอบการยอมรับ รันจุดตรวจสอบบนแท่นทดสอบก่อนที่คุณจะเชื่อถือ

หากคุณต้องการเริ่มต้นจากรายการตรวจสอบสำหรับการบันทึกจริง ครอบคลุมการจัดวางกล้อง, ผลกระทบและโหมดความล้มเหลวที่ทำให้ ชุดข้อมูลไม่สามารถใช้งานได้ รายละเอียดเกี่ยวกับรูปแบบข้อมูลอยู่ใน , และด้านไฮเปอร์พารามิเตอร์อยู่ใน .

ฉันสามารถฝึกนโยบายหุ่นยนต์ด้วยข้อมูลสังเคราะห์ทั้งหมดได้หรือไม่?

สำหรับงานการจัดการบนแขนกลจริงนั้น ไม่น่าเชื่อถือ ผลลัพธ์ที่เผยแพร่ทั้งหมดที่มีตัวเลขที่แข็งแกร่งล้วนเป็นผลลัพธ์จากการฝึกฝนร่วมกัน หรือการเพิ่มประสิทธิภาพบนข้อมูลจริง การเปรียบเทียบของ MimicGen เองระบุว่าการสาธิตที่สร้างขึ้น 200 รายการได้ 79 เปอร์เซ็นต์ เทียบกับ 84 เปอร์เซ็นต์สำหรับการสาธิตโดยมนุษย์ 200 รายการในงานเดียวกัน และเอกสารการฝึกฝนร่วมกันระหว่างการจำลองและของจริงในปี 2025 ระบุว่าการฝึกฝนเฉพาะในการจำลองและถ่ายโอนมักต้องการความพยายามอย่างมากจากมนุษย์เพื่อเชื่อมช่องว่างระหว่างความเป็นจริง RoboCasa แสดงให้เห็นว่าข้อมูลที่สร้างขึ้นสามารถเอาชนะข้อมูลของมนุษย์ได้ที่ 47.6 เทียบกับ 28.8 เปอร์เซ็นต์ แต่เฉพาะกับการสาธิตที่สร้างขึ้น 72,000 รายการ เทียบกับการสาธิตโดยมนุษย์ 1,250 รายการ ภายในโปรแกรมจำลองที่สร้างทั้งสองอย่าง

ฉันยังคงต้องการตอนจริงกี่ตอน หากฉันสร้างตอนสังเคราะห์ขึ้นมา?

บน AY-Robots ผู้ฝึกสอนต้องการอย่างน้อย 30 ตอนสำหรับ SmolVLA และ 50 ตอนสำหรับ ACT, GR00T N1.5, GR00T N1.7 และ Pi0.5 โดยไม่คำนึงว่าตอนเหล่านั้นมาจากไหน เอกสาร Mimic ของ Isaac Lab ระบุว่าต้องการการสาธิตโดยมนุษย์ที่สำเร็จประมาณ 10 ครั้งเพื่อเป็นจุดเริ่มต้นในการสร้างข้อมูล ตัวเลขเหล่านี้แตกต่างกันและตอบคำถามที่ต่างกัน: 10 คือสิ่งที่ตัวสร้างข้อมูลต้องการ ส่วน 30 ถึง 50 คือสิ่งที่ผู้ฝึกสอนต้องการ

ข้อมูลจำลองต้องอยู่ในรูปแบบ LeRobot หรือไม่?

หากต้องการฝึกฝนบนแพลตฟอร์มนี้ ใช่ Isaac Lab และ LeIsaac ทั้งคู่สร้าง robomimic-flavoured HDF5. Isaac Lab core ไม่มีตัวแปลง LeRobot แต่ LeIsaac มี isaaclab2lerobot.py สำหรับ LeRobot v2 และ isaaclab2lerobotv3.py สำหรับ v3 และ IsaacLab-Arena มี convert_hdf5_to_lerobot.py ที่มุ่งเป้าไปที่ GR00T ซึ่งขับเคลื่อนด้วยการกำหนดค่า YAML โปรดสังเกตเวอร์ชัน: GR00T N1.5 และ N1.7 ใช้ LeRobot v2.0 หรือ v2.1 ในขณะที่ Pi0.5, SmolVLA และ ACT ใช้ v3.0 ชุดข้อมูล v3.0 จะทำให้ตัวโหลด GR00T ขัดข้องและต้องถูกแปลงกลับเป็น v2.1

Isaac Gym ยังคงเป็นสิ่งที่ถูกต้องที่จะเรียนรู้ในปี 2026 หรือไม่?

ไม่ หน้าผลิตภัณฑ์ของ NVIDIA เองมีหัวข้อว่า "Isaac Gym - ตอนนี้เลิกใช้แล้ว" และระบุว่าเป็นซอฟต์แวร์รุ่นเก่าที่นักพัฒนาสามารถดาวน์โหลดและใช้งานต่อไปได้ แต่ไม่ได้รับการสนับสนุนอีกต่อไป และชี้ไปที่ Isaac Lab เป็นตัวแทน Isaac Lab มีคู่มือการย้ายข้อมูลจาก IsaacGymEnvs, จาก OmniIsaacGymEnvs และจาก Orbit ดังนั้นสภาพแวดล้อมที่มีอยู่จึงสามารถพกพาได้แทนที่จะสูญหายไป

ฉันสามารถนำ SO-100 หรือ SO-101 เข้าไปใน Isaac Lab ได้หรือไม่?

สำหรับ SO-101 ใช่ สามารถทำได้อย่างถูกต้อง คลังเก็บข้อมูล TheRobotStudio มีทั้งไฟล์ URDF และ MJCF สำหรับ SO-101 ซึ่งสร้างขึ้นด้วย onshape-to-robot จากโมเดล CAD ของ Onshape และ LeIsaac มีงาน Isaac Lab ที่พร้อมใช้งาน เช่น LeIsaac-SO101-PickOrange-v0 พร้อมการควบคุมระยะไกลจากแขนนำ SO101 จริง สำหรับ SO-100 คลังเก็บข้อมูลเดียวกันนี้มีเพียงไฟล์ URDF เดียวและไม่มีโมเดล MuJoCo โปรดทราบถึงข้อจำกัดที่ระบุไว้ใน README ของ SO-101 ไม่ว่าในกรณีใด: ตาข่ายการชนของฐานถูกลบออกเนื่องจากพฤติกรรมการชนที่มีปัญหา คุณสมบัติของมอเตอร์ STS3215 ถูกปรับมาจากโปรเจกต์ Open Duck Mini แทนที่จะระบุจาก SO-101 และข้อตกลงการจับจาก 0-ปิด ถึง 100-เปิด ยังไม่สะท้อนในไฟล์โมเดล

แพลตฟอร์มนี้รันการจำลองให้ฉันหรือไม่?

ไม่ AY-Robots บันทึกชุดข้อมูล LeRobot จากการควบคุมระยะไกลจริง ปรับแต่งนโยบายที่รองรับทั้งห้าบน GPU ที่เช่า และส่งจุดตรวจสอบที่ได้กลับไปยังแขนกล ไม่มีโปรแกรมจำลอง ไม่มีการสร้างข้อมูลสังเคราะห์ และไม่มีการสร้างฉากในนั้น หากคุณสร้างข้อมูลจากที่อื่นและแปลงเป็นชุดข้อมูล LeRobot ที่ถูกต้อง ผู้ฝึกสอนจะยอมรับมันเหมือนกับการบันทึกจริงทุกประการ

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started