Blog
Insights on robotics, AI, and data collection

การรันลูป DAgger บนแขนกล SO-100 ด้วยโพลิซี VLA
คำอธิบายทีละขั้นตอนของหนึ่งรอบ DAgger แบบมีมนุษย์คอยกำกับบนแขนกล SO-100: รันโพลิซีแล้วบันทึกไว้ เข้าควบคุมเมื่อมันทำผิดพลาด บันทึกการรันนั้นเป็นการแก้ไข ประกอบชุดข้อมูลผสม แล้วเทรนต่อจากเช็คพอยต์ รวมถึงเส้นทางการเข้าควบคุมด้วยคีย์บอร์ดและสไลเดอร์สำหรับผู้ที่ไม่มีแขน leader และสี่ข้อผิดพลาดที่ทำให้หนึ่งรอบสูญเปล่า

การวัดผลลูป DAgger: อัตราการแทรกแซง โพรโทคอลการประเมิน และกับดักระหว่างทาง
อัตราการแทรกแซง (intervention rate) - จำนวนเฟรมที่มีการแทรกแซงหารด้วยจำนวนเฟรมทั้งหมดของการรัน - เป็นสัญญาณความคืบหน้าที่ตรงไปตรงมาและมีต้นทุนต่ำที่สุดที่ลูป DAgger แบบมีมนุษย์คอยกำกับ (human-gated) มีอยู่ บทความนี้นิยามค่านี้ให้คนสองคนคำนวณได้ค่าเดียวกัน แสดงวิธีบันทึกค่า และไล่เรียงสี่วิธีที่ค่านี้อาจทำให้เข้าใจผิด ได้แก่ การเคยชินของผู้ควบคุม (operator habituation) ชุดการประเมินที่เลื่อนลอย การฝึกด้วยเฉพาะข้อมูลแก้ไข และมนุษย์ที่แก้ไขต่างกันในวันอังคารเทียบกับวันจันทร์

HG-DAgger และตัวแปรแบบมีเกต: ใครเป็นผู้ตัดสินใจว่าจะเข้าควบคุม Robot Policy เมื่อใด
DAgger แบบดั้งเดิมให้มนุษย์ติดป้ายกำกับสถานะต่าง ๆ ในขณะที่หุ่นยนต์ยังขับเคลื่อนอยู่ บนฮาร์ดแวร์จริงวิธีนี้ไม่ปลอดภัยและให้ป้ายกำกับที่คุณภาพต่ำ ตัวแปรแบบมีเกตแทนที่การติดป้ายกำกับแบบไม่มีการควบคุมด้วยเกตที่ต้องมีใครสักคนถือไว้ ได้แก่ มนุษย์ใน HG-DAgger ตัวจำแนกความปลอดภัย (safety classifier) ใน SafeDAgger ความไม่ลงรอยกันของ ensemble ใน EnsembleDAgger และการประเมินความแปลกใหม่และความเสี่ยงภายใต้งบประมาณจำกัดใน ThriftyDAgger บทความนี้เปรียบเทียบวิธีเหล่านี้ตามว่าใครเป็นเจ้าของเกต สัญญาณใดเป็นตัวเปิดเกต และแต่ละวิธีมีต้นทุนเท่าใด พร้อมทั้งอธิบายว่าเหตุใดรูปแบบ human-gated จึงเป็นรูปแบบที่อยู่รอดเมื่อนำไปใช้กับแขนกลจริง

DAgger อธิบาย: ทำไม Behavior Cloning ถึงเบี่ยงเบน และ Dataset Aggregation พิสูจน์อะไรได้จริง
Behavior cloning ปรับพอลิซีให้เข้ากับการกระจายตัวของสถานะของผู้เชี่ยวชาญ แล้วจึงนำไปใช้งานด้วยตัวเอง ช่องว่างระหว่างการกระจายตัวทั้งสองนี้คือสาเหตุที่พอลิซีซึ่งดูดีตอนตรวจสอบ (validation) กลับหลุดออกนอกโต๊ะที่สเต็ปที่ 300 นี่คือบทว่าด้วยทฤษฎีในซีรีส์ DAgger ของเรา: พจน์ข้อผิดพลาดกำลังสองมาจากไหน Dataset Aggregation เปลี่ยนแปลงอะไร ข้อพิสูจน์แบบ no-regret ตั้งสมมติฐานอะไรไว้ และผู้เชี่ยวชาญมนุษย์ยังต้องจ่ายส่วนไหนของ "บิล" อยู่

การใช้ DROID, BridgeData V2 และ Open X บน SO-100
DROID, BridgeData V2 และ Open X-Embodiment แปลงเป็นการกระทำของปลายแขนหุ่นยนต์แบบ 7 มิติ บนแขนหุ่นยนต์ 6 และ 7 องศาอิสระ SO-100 ใช้ตำแหน่งข้อต่อ 6 ตำแหน่ง อะไรที่ถ่ายทอดได้ อะไรที่ถ่ายทอดไม่ได้ และควรทำอย่างไรแทน

ข้อมูลสังเคราะห์สำหรับนโยบายหุ่นยนต์: การจำลองช่วยได้อย่างไร
การจำลองสามารถเพิ่มจำนวนการสาธิตเพียงไม่กี่ครั้งให้กลายเป็นหลายพันครั้งได้ นี่คือสิ่งที่ตัวเลขที่เผยแพร่ระบุไว้จริง ๆ ช่องว่างระหว่าง sim-to-real ส่งผลกระทบอย่างไร และสิ่งที่ยังคงต้องบันทึก

โมเดล VLA ขนาดเล็ก: TinyVLA, SmolVLA และกรณีที่ต่ำกว่า 1 พันล้านพารามิเตอร์
TinyVLA และ SmolVLA ทำให้ VLA ทำงานได้ภายใต้ 1 พันล้านพารามิเตอร์ ตัวเลขจริงจากเอกสารทั้งสองฉบับ, ค่าเริ่มต้นของ lerobot, เวลาแฝงที่วัดได้ และค่าใช้จ่ายในการรันบนการ์ด 24 GB

รัน GR00T Inference โดยไม่ต้องใช้ GPU ในเครื่อง
เครื่องหุ่นยนต์ของคุณไม่มี GPU วางเซิร์ฟเวอร์นโยบาย GR00T บน GPU คลาวด์ที่เช่าไว้ สตรีมกลุ่มการกระทำไปยังแขนหุ่นยนต์ และเรียนรู้ว่าเครือข่ายมีค่าใช้จ่ายเท่าไรสำหรับคุณ

วิธีฝึก ACT บน SO-100 ตั้งแต่เริ่มต้น
ฝึก Action Chunking Transformer ตั้งแต่เริ่มต้นบน SO-100 ด้วย lerobot: การตั้งค่า act config, chunk_size และ n_action_steps, กำหนดการ 100000 ขั้นตอน, การอนุมาน 20 มิลลิวินาที

คุณควรฝึก VLA Policy ตัวไหนในปี 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT หรือ GR00T N1.5? ตารางการตัดสินใจที่ตรงกับสถานการณ์จริง พร้อมด้วยตัวเลขเกณฑ์มาตรฐานที่เผยแพร่, ความหน่วง, ค่าใช้จ่ายต่อการรัน และใบอนุญาตที่อยู่เบื้องหลังแต่ละตัวเลือก

ค่าใช้จ่ายในการฝึก VLA: ค่าใช้จ่ายที่แท้จริงของการปรับแต่งโมเดล
ราคา GPU ในตลาดสปอตจริง, ระยะเวลาที่นโยบายทั้งห้าแต่ละรายการทำงาน, ค่าใช้จ่ายของแขนกลและการสาธิต, และสี่จุดที่เงินหายไปอย่างเงียบๆ

บันทึกชุดข้อมูล LeRobot ชุดแรกของคุณด้วย SO-100
บันทึกชุดข้อมูล LeRobot ที่ใช้งานได้ด้วย SO-100: การปรับเทียบ, การควบคุมระยะไกลแบบผู้นำ-ผู้ตาม, แฟล็กและค่าเริ่มต้นของ lerobot-record ที่แท้จริง, การตั้งค่ากล้อง, จำนวนตอน, และข้อบกพร่องที่ทำให้การทำงานล้มเหลว

วิธีฝึก SmolVLA บน GPU ขนาด 24 GB (lerobot 0.6.1)
SmolVLA เป็น VLA ที่มีพารามิเตอร์ 450 ล้านตัว ซึ่งสามารถปรับแต่งได้บนการ์ดขนาด 24 GB เพียงใบเดียว คำสั่ง lerobot 0.6.1 จริง, ค่าเริ่มต้นที่แท้จริง, ข้อผิดพลาดที่ทำให้เสียเวลาไปหนึ่งวัน และค่าใช้จ่ายในการรันแต่ละครั้ง

วิธีการฝึก Pi0.5 ด้วยข้อมูลหุ่นยนต์ของคุณเอง
ปรับแต่ง Pi0.5 ซึ่งเป็น VLA แบบ flow-matching จาก Physical Intelligence ด้วยข้อมูลหุ่นยนต์ของคุณเอง คำสั่งจริงสำหรับ openpi และ lerobot pi05 ข้อผิดพลาดของรูปแบบชุดข้อมูล ข้อจำกัดของ VRAM และความหน่วง
Isaac Lab: การจำลอง GPU ยุคใหม่สำหรับการเรียนรู้หุ่นยนต์แบบหลายรูปแบบ
ค้นพบว่า Isaac Lab ของ NVIDIA ปฏิวัติการเรียนรู้หุ่นยนต์แบบหลายรูปแบบผ่านการจำลองที่เร่งความเร็วด้วย GPU ได้อย่างไร ทำให้การฝึกอบรม AI เร็วขึ้น การปรับใช้ที่ปรับขนาดได้ และ ROI ที่ปรับให้เหมาะสมสำหรับนักวิจัยและบริษัทด้านหุ่นยนต์
Isaac Gym: การจำลองฟิสิกส์แบบ GPU-Native สำหรับการเรียนรู้ของหุ่นยนต์ - การปรับขนาดสภาพแวดล้อมแบบขนานนับพัน
ค้นพบว่า Isaac Gym ปฏิวัติการเรียนรู้ของหุ่นยนต์ด้วยการจำลองฟิสิกส์แบบ GPU-native ได้อย่างไร ทำให้สามารถสร้างสภาพแวดล้อมแบบขนานนับพันสำหรับการเรียนรู้แบบเสริมกำลังอย่างรวดเร็ว การฝึกอบรมโมเดล VLA และการควบคุมหุ่นยนต์ AI ทางไกลอย่างมีประสิทธิภาพ สำรวจเกณฑ์มาตรฐาน การผสานรวมกับ PyTorch และแอปพลิเคชันในโลกแห่งความเป็นจริงที่เชื่อมช่องว่างระหว่างการจำลองสู่โลกจริง
RoboTurk: Crowdsourcing Robot Learning Through Remote Teleoperation
Discover how RoboTurk revolutionizes robot learning by crowdsourcing high-quality data through remote teleoperation, enabling scalable datasets for AI models in robotics. Explore its impact on imitation learning, VLA models, and ROI for robotics companies.
BridgeData V2: Low-Cost Robot Data at Scale - Which Imitation Learning and Offline RL Methods Actually Benefit
Explore how BridgeData V2 provides low-cost robot data at scale, enhancing imitation learning methods and offline reinforcement learning. Discover key benchmarks, VLA models in robotics, and efficient robot teleoperation workflows for AI training data collection.
Pi-Zero Flow-Matching Robot Policies: Revolutionizing Dexterous Control with VLM Initialization
Discover how Pi-Zero's flow-matching technique, combined with VLM initialization, is transforming generalist robot policies for dexterous control. Learn about its advantages over traditional methods, efficiency in AI training data for robotics, and implications for scalable robot deployment in industries.
RT-2: เหตุใดข้อมูลการฝึกอบรมหุ่นยนต์คุณภาพสูงจึงเหนือกว่าอัลกอริทึม – ข้อมูลเชิงลึกที่เปลี่ยนแปลงเกมของ Google DeepMind
ค้นพบว่าโมเดล RT-2 ของ Google DeepMind ปฏิวัติวงการหุ่นยนต์ AI ได้อย่างไร โดยเน้นย้ำถึงบทบาทสำคัญของข้อมูลการฝึกอบรมคุณภาพสูงมากกว่าอัลกอริทึมขั้นสูง บทความนี้จะแจกแจงการทดลองที่แสดงให้เห็นว่าเหตุใดการเก็บรวบรวมข้อมูลที่มีประสิทธิภาพจึงมีความจำเป็นต่อประสิทธิภาพของหุ่นยนต์ในโลกแห่งความเป็นจริง เรียนรู้ว่าแพลตฟอร์มอย่าง AY-Robots สามารถช่วยลดช่องว่างในข้อมูลการฝึกอบรมสำหรับนวัตกรรมในอนาคตได้อย่างไร
RT-2 โดย Google DeepMind: โมเดล Vision-Language-Action นี้เปลี่ยนแปลงการเรียนรู้ของหุ่นยนต์ได้อย่างไร
ค้นพบว่าโมเดล Vision-Language-Action (VLA) RT-2 ของ Google กำลังปรับเปลี่ยนการเรียนรู้ของหุ่นยนต์อย่างไร โดยการบูรณาการข้อมูลภาพ ภาษาธรรมชาติ และการกระทำแบบเรียลไทม์ เทคโนโลยี AI ที่เป็นนวัตกรรมนี้ช่วยเพิ่มประสิทธิภาพในการเก็บรวบรวมข้อมูลสำหรับผู้ควบคุมระยะไกล และเพิ่มประสิทธิภาพในการใช้งานหุ่นยนต์ สำรวจศักยภาพของมันที่มีต่ออนาคตของหุ่นยนต์ที่ขับเคลื่อนด้วย AI ที่ AY-Robots