Blog
Insights on robotics, AI, and data collection

DAgger-lota keyrð á SO-100 með VLA-stefnu
Skref-fyrir-skref lýsing á einni mannkjörnum DAgger-lotu á SO-100 armi: keyra stefnuna og skrá hana, taka yfir þegar hún fer úrskeiðis, skrá keyrsluna sem leiðréttingu, semja blandaðan gagnasafn og halda áfram þjálfun frá tímapunkti. Nær yfir lyklaborðs- og sleðaaðfangsleiðina fyrir fólk án stýriarma, og fjóra mistök sem gera lotugerðina gagnslaust.

Mæling á DAgger-lykkju: Ingrip tíðni, matsútstöð og gildru á milli
Ingrip tíðnin - ingrip rammar deilt með römmum rekstrarinnar - er ódýrasta sanngjarni framfaramerkið sem DAgger-lykki með mannlegri gátt hefur. Þessi grein skilgreinir það þannig að tveir menn reikni sama gildið, sýnir hvernig á að skrá það, og fer yfir fjórar leiðir þar sem það villir þig: vörnun rekstraraðila, breytilega matsútstöð, þjálfun eingöngu á leiðréttingum, og manneskju sem leiðréttir öðruvísi á þriðjudag en á mánudag.

HG-DAgger og Gated Variants: Hver ákveður hvenær á að taka stjórn á Robot Policy
Venjuleg DAgger biður manneskju um að merkja tilstæður meðan vélmenni er enn að keyra. Á raunvélbúnaði er það óöruggt og framleiðir slæm merki. Gated variantirnir skipta blindri merkingu út fyrir port sem einhver verður að halda: manneskjan í HG-DAgger, öryggisflokkunar í SafeDAgger, ósamþykki samnets í EnsembleDAgger, takmörkuð nýjungs- og áhættumat í ThriftyDAgger. Þessi grein ber þær saman eftir því hver á portið, hvaða merki opnar það og hvað hver og ein kostar — og af hverju mannlega stýrða formið er það sem lifir sambandi við raunverulegan arm.

DAgger útskýrt: Hvers vegna Behavior Cloning skeiðir og hvað Dataset Aggregation sannar í raun
Behavior cloning hentar stefnu á stöðudreifingu sérfræðingsins og er síðan útfærð á sinni eigin. Bilið á milli þessara tveggja dreifinga er ástæðan fyrir því að stefna sem lítur vel út í staðfestingu gengur af borðinu á skrefi 300. Þetta er kenningarkafli okkar DAgger-flokks: hvar veldisvísir villunafnsins kemur frá, hvað Dataset Aggregation breytir, hvað endalaust regreturétti sönnunin gerir ráð fyrir, og hvaða hluta reikningsins manneskjan sérfræðingur þarf enn að greiða.

Að nota DROID, BridgeData V2 og Open X á SO-100
DROID, BridgeData V2 og Open X-Embodiment breytast í 7-D aðgerðir á endabúnaði á 6 og 7-DoF örmum. SO-100 tekur 6 liðstöður. Hvað flyst yfir, hvað ekki, hvað á að gera í staðinn.

Gervigögn fyrir vélmennastefnur: Hvar hermun hjálpar
Hermun getur margfaldað fáeinar sýnikennslur í þúsundir. Hér er það sem birtar tölur segja í raun, hvar bilið milli hermunar og raunveruleika bítur, og hvað þarf enn að skrá.

Lítil VLA líkön: TinyVLA, SmolVLA og tilfellið undir 1 milljarði færibreyta
TinyVLA og SmolVLA setja virkt VLA undir 1 milljarð færibreyta. Rauntölur úr báðum greinum, sjálfgefnar stillingar LeRobot, mældur leyndartími og hvað keyrsla kostar á 24 GB korti.

Keyra GR00T ályktun án staðbundinnar GPU
Vélmennavélin þín hefur enga GPU. Settu GR00T stefnumiðlarann á leigða skýja-GPU, streymdu aðgerðabitum til armsins, og lærðu nákvæmlega hvað netið kostar þig.

Hvernig á að þjálfa ACT á SO-100 frá grunni
Þjálfaðu Action Chunking Transformer frá grunni á SO-100 með lerobot: act config, chunk_size og n_action_steps, 100000 skrefa áætlunin, 20 ms ályktun.

Hvaða VLA stefnu ættir þú að þjálfa árið 2026?
GR00T N1.7, Pi0.5, SmolVLA, ACT eða GR00T N1.5? Ákvarðanatöflur sem passa við raunverulegar aðstæður, með birtum viðmiðunartölum, töf, kostnaði á keyrslu og leyfum á bak við hvern valkost.

VLA Þjálfunarkostnaður: Hvað fínstillingar keyrsla raunverulega kostar
Raunverulegt verð á GPU á spot-markaði, hversu lengi hver af fimm stefnum keyrir, hvað armurinn og sýnikennslurnar kosta, og fjórir staðir þar sem peningarnir hverfa hljóðlega.

Taktu upp fyrsta LeRobot gagnasafnið þitt með SO-100
Taktu upp nothæft LeRobot gagnasafn með SO-100: kvörðun, fjarstýringu leiðtoga-fylgjanda, raunverulegar lerobot-record fánar og sjálfgefnar stillingar, uppsetningu myndavélar, fjölda þátta, og gallana sem eyðileggja keyrslu.

Hvernig á að þjálfa SmolVLA á 24 GB GPU (lerobot 0.6.1)
SmolVLA er 450 M færibreytu VLA sem fínstillist á einu 24 GB korti. Raunverulegar lerobot 0.6.1 skipanir, raunverulegar sjálfgefnar stillingar, fallgildrurnar sem kostuðu heilan dag, og hvað keyrsla kostar.

Hvernig á að þjálfa Pi0.5 á eigin vélmennagögnum
Fínstilltu Pi0.5, flæðisamsvörunar VLA frá Physical Intelligence, á eigin vélmennagögnum. Raunverulegar skipanir fyrir openpi og lerobot pi05, gildrur í gagnasafns sniði, VRAM og leyndarmörk.

Hvernig á að þjálfa GR00T N1.7 á eigin SO-100 gagnasafni
Prófuð leiðbeining fyrir fínstillingu NVIDIA GR00T N1.7 á SO-100 LeRobot gagnasafni: raunverulegir fánar, modality.json, v2.1 krafan, hvað keyrsla kostar, og gildrurnar.
RoboTurk: Fjölmennsi Vélmennanám í gegnum Fjarstýringu
Uppgötvaðu hvernig RoboTurk gjörbyltir vélmennanámi með því að afla hágæða gagna frá fjöldanum í gegnum fjarstýringu, sem gerir kleift að búa til skalanleg gagnasöfn fyrir gervigreindarlíkön í vélfærafræði. Kannaðu áhrif þess á eftirlíkingarnám, VLA líkön og arðsemi fyrir vélmennafyrirtæki.
Pi-Zero Flæðisamsvörunarvélmennastefnur: Bylting á handlaginni stjórnun með VLM upphafsstillingu
Uppgötvaðu hvernig flæðisamsvörunartækni Pi-Zero, ásamt VLM upphafsstillingu, er að umbreyta almennum vélmennastefnum fyrir handlagna stjórnun. Lærðu um kosti þess umfram hefðbundnar aðferðir, skilvirkni í gervigreindarþjálfunargögnum fyrir vélfærafræði og áhrif á stigstærða vélmennaútsetningu í iðnaði.
RT-2: Hvers vegna hágæða þjálfunargögn vélmenna skara fram úr reikniritum – Byltingarkennd innsýn frá Google DeepMind
Uppgötvaðu hvernig RT-2 líkanið frá Google DeepMind gjörbyltir gervigreindarvélmennum með því að leggja áherslu á mikilvægi hágæða þjálfunargagna fram yfir háþróuð reiknirit. Þessi grein sundurliðar tilraunirnar sem sýna hvers vegna árangursrík gagnasöfnun er nauðsynleg fyrir raunverulegan árangur vélmenna. Lærðu hvernig vettvangar eins og AY-Robots geta hjálpað til við að brúa bilið í þjálfunargögnum fyrir framtíðarnýjungar.
RT-2 frá Google DeepMind: Hvernig þetta sjón-mál-aðgerðarlíkan er að umbreyta vélmennanámi
Uppgötvaðu hvernig RT-2 sjón-mál-aðgerðarlíkanið (VLA) frá Google er að endurmóta vélmennanám með því að samþætta sjónræn gögn, náttúrulegt tungumál og rauntímaaðgerðir. Þessi nýstárlega gervigreindartækni eykur gagnasöfnun fyrir fjarstýrendur og eykur skilvirkni í vélmennaforritum. Kannaðu hugsanleg áhrif þess á framtíð gervigreindardrifinna vélmenna hjá AY-Robots.