अवतार वाले VLA: RT-2, OpenVLA, π0, GR00T
Type: Learn
Languages: Python (stdlib, action tokenizer + VLA inference skeleton)
Prerequisites: Phase 12 · 05 (LLaVA), Phase 15 (Autonomous Systems, referenced)
Time: ~180 minutes
सीखने के लक्ष्य
- क्रिया टोकनकरण का वर्णन करेंः डिस्क्रेट बिन एन्कोडिंग (RT-2), फास्ट कुशल क्रिया टोकन, निरंतर प्रवाह-संगत क्रियाएं (π0).
- वेब + रोबोट डेटा पर सह-अच्छी ट्यूनिंग से नए कार्यों में सामान्य ज्ञान हस्तांतरण को क्यों संरक्षित किया जाता है, इसका वर्णन करें।
- एक ही रोबोट कार्य पर OpenVLA (खुला 7B Llama+VLM), π0 (प्रवाह-अनुरूपता), और GR00T N1 (द्वितीय-प्रणाली) की तुलना करें।
- ओपन एक्स-एम्बॉडीमेंट डेटासेट और आरटी-एक्स प्रशिक्षण कॉर्पस के रूप में इसकी भूमिका का नाम बताइए।
समस्या
एक रोबोट जो प्राकृतिक भाषा के निर्देशों से घर का काम करता है, 1970 के दशक से एक शोध लक्ष्य रहा है। 2020 के उत्तरः एक दृष्टि-भाषा-क्रिया (वीएलए) मॉडल। उसी वीएलएम वास्तुकला का उपयोग वीक्यूए के लिए किया जाता है, लेकिन आउटपुट पाठ के बजाय क्रियाएं (संयुक्त टोक़, अंत-इफेक्टर मुद्राएं, अलगाव आदेश) हैं।
VLA के लिए विशिष्ट चुनौतियांः
- क्रिया स्थान निरंतर (संयुक्त कोण, बल) और उच्च आयामी हैं (7-DOF हाथ + 3-DOF पकड़ = 30 हर्ट्ज पर 10 dims) ।
- रोबोट-विशिष्ट प्रशिक्षण डेटा दुर्लभ है। ओपन एक्स-एम्बॉडीमेंट में ~ 1M पटरियां हैं; वेब टेक्स्ट-इमेज 5B + है।
- नियंत्रण आवृत्ति मायने रखता है. 30 हर्ट्ज नियंत्रण लूप प्रति कार्रवाई 33ms बजट का मतलब है.
- सुरक्षा. गलत कार्रवाई हार्डवेयर, इंसानों या संपत्ति को नुकसान पहुंचाती है।
अवधारणा
कार्रवाई टोकन (RT-2)
RT-2 की चालः प्रत्येक संयुक्त लक्ष्य को एक क्वांटिज़्ड टेक्स्ट टोकन के रूप में प्रस्तुत करें। सामान्यीकृत [-1, 1] रेंज को 256 बिन्स में विभाजित करें, प्रत्येक बिन्स को शब्दावली आईडी के लिए मैप करें। प्रत्येक नियंत्रण चरण पर 10-DOF कार्रवाई 10 टोकन बन जाती है।
एक मिश्रण पर एक PaLM-X VLM को सह-अच्छी तरह से समायोजित करेंः
- वेब छवि-पाठ जोड़े (शीर्षक, VQA) ।
- रोबोट प्रदर्शन, टोकन के रूप में कार्रवाई।
मॉडल "लाल घन" (भाषा) → छवि (दृष्टि) → 10-टोकन एक्शन अनुक्रम (विज्ञप्त संयुक्त लक्ष्य) देखता है। वेब प्री-ट्रेनिंग सामान्य ज्ञान हस्तांतरण को संरक्षित करता हैः RT-2 "त्वरित गतिशील वस्तु की ओर कदम" का पालन कर सकता है भले ही "त्वरित गतिशील" प्रशिक्षण डेटा में नहीं है।
आरटी-2 पेपर में 3-5 हर्ट्ज पर इन्फेरेंस, VLM ऑटोरेग्रेसिव डिकोड द्वारा सीमित।
OpenVLA खुला 7B संदर्भ
ओपनवीएलए (किम और सहयोगियों, जून 2024) ओपन-वेट आरटी-2 समकक्ष है। 7 बी लामा रीढ़ की हड्डी, DINOv2 + सिगलिप ड्यूल विजन एन्कोडर, 256 बिन्स पर एक्शन टोकनाइज़ेशन।
ओपन एक्स-एम्बॉडीमेंट (970 हजार पटरियों पर 22 रोबोट) पर प्रशिक्षित। नए रोबोट के अनुकूलन के लिए लोरा बारीक-ट्यूनिंग समर्थन वाले जहाज।
इन्फेरेंसः क्वांटिज़ेशन के साथ A100 पर 4-5 हर्ट्ज. धीमी हेरफेर के लिए पर्याप्त तेज, उच्च आवृत्ति नियंत्रण के लिए नहीं।
फास्ट टोकनराइज़र तेजी से कार्रवाई डिकोड
Pertsch et al. (2024) ने दिखाया कि डिस्क्रिट-बिन टोकनाइजेशन अक्षम है बिन-स्पेस के एक छोटे क्षेत्र में अधिकांश एक्शन क्लस्टर। FAST (फ्रिक्वेन्सी-डोमेन एक्शन सीक्वेंस टोकनाइज़र) DCT के माध्यम से एक्शन अनुक्रमों को संपीड़ित करता है और गुणांक को मात्राबद्ध करता है।
एक 30-चरण कार्रवाई की प्रक्षेपवक्र 300 विवश-बिन टोकन के बजाय ~ 10 फास्ट टोकन बन जाता है। गुण हानि के बिना तर्क 3-5 गुना तेज होता है।
π0 और प्रवाह-समानता कार्य
फिजिकल इंटेलिजेंस का π0 (ब्लैक एट अल, अक्टूबर 2024) एक प्रवाह-अनुरूपता कार्रवाई विशेषज्ञ के साथ अलग-अलग कार्रवाई टोकन को बदल देता हैः
- एक छोटा एक्शन ट्रांसफार्मर VLM की छिपी हुई अवस्थाओं को पढ़ता है और सही प्रवाह के माध्यम से एक निरंतर 50-चरण एक्शन अनुक्रम आउटपुट करता है।
- एक्शन हेड प्रवाह-अनुरूपता हानि के साथ ट्रेन करता है; VLM पूर्व-प्रशिक्षण अपरिवर्तित रहता है।
- इन्फरेंसः ~5 डीनोइंग स्टेप्स में उत्सर्जित पूर्ण एक्शन सीक्वेंस, प्रभावी रूप से 50 हर्ट्ज नियंत्रण।
π0 का दावाः एक व्यापक सेट में हेरफेर कार्यों पर OpenVLA और Octo से बेहतर है। निरंतर कार्रवाई के सूत्र को चिकनाई बनाए रखता है जो विवशता नष्ट करता है।
π0.5 और π0-FAST क्रमिक उन्नयन हैं. π0-FAST FAST टोकनकरण को प्रवाह मिलान के साथ जोड़ता है।
मानवयुक्तों के लिए GR00T N1 दोहरी प्रणाली
NVIDIA का GR00T N1 (मार्च 2025) मानवयुक्त रोबोट (>30 DOF, पूर्ण शरीर) के लिए बनाया गया हैः
- प्रणाली 2: एक बड़ा VLM पढ़ने दृश्य + निर्देश, ~ 1 हर्ट्ज पर उच्च स्तर के उप-लक्ष्य का उत्पादन।
- प्रणाली 1: एक छोटा एक्शन हेड ट्रांसफार्मर जो उप-लक्ष्य पर कंडीशनिंग वाले कम-स्तरीय 50-100 हर्ट्ज संयुक्त कमांड का उत्पादन करता है।
कैनेमैन के तेज और धीमी सोच के लिए विभाजित नक्शेः सिस्टम 2 योजनाएं, सिस्टम 1 कार्य करता है। लाभः धीमी VLM आकार की योजना तेजी से नियंत्रण को अवरुद्ध नहीं करती है; सिस्टम 1 विलंबता के लिए छोटा रहता है।
GR00T N1.7 (अंतिम 2025) डेटा स्केलिंग में सुधार करता है। GR00T ओम्निवर्स से सिम-टू-रियल डेटा के साथ ठीक-ठाक करता है।
खुला एक्स-बॉडीमेंट
प्रशिक्षण डेटा। RT-X (अक्टूबर 2023) ने 22 रोबोटों पर 1M पटरियों को कवर करने वाले 22 डेटा सेट इकट्ठा किए। ओपन एक्स-एम्बॉडीमेंट सभी का उपयोग करने वाला कॉर्पस हैः
- ALOHA / ब्रिज V2 / Droid / RT-2 किचन / भाषा तालिका।
- प्रत्येक नमूनाः (रोबोट की स्थिति, कैमरा दृश्य, निर्देश, कार्रवाई अनुक्रम) ।
- प्रशिक्षण स्वच्छताः एक्शन स्पेस को एकजुट करें, संयुक्त रेंज को सामान्य बनाएं, कैमरों का आकार बदलें।
ओपन एक्स-एम्बॉडीमेंट पर ओपनवीएलए और पी0 ट्रेन। किसी भी विशिष्ट रोबोट के लिए डोमेन अंतर 100-1000 कार्य-विशिष्ट डेमो पर लोरा फाइन-ट्यूनिंग द्वारा बंद हो जाता है।
केवल रोबोट के साथ सह-अच्छी ट्यूनिंग
सह-अच्छी ट्यूनिंग वेब VQA डेटा को रोबोट पटरियों के साथ मिलाती है। अनुपात मायने रखता हैः बहुत अधिक VQA और मॉडल कार्यों को भूल जाता है; बहुत अधिक रोबोट डेटा और मॉडल सामान्य ज्ञान खो देता है।
RT-2 का अनुपातः ~1:1. OpenVLA: ~0.5:1 वेब-टू-रोबोट. π0: समान। सटीक अनुपात डेटासेट आकार के अनुसार ट्यून करने के लिए एक हाइपरपैरामीटर है।
केवल रोबोट प्रशिक्षण कार्य-विशिष्ट मॉडल उत्पन्न करता है जो वितरण के बाहर निर्देशों पर विफल रहता है। सह-अच्छी ट्यूनिंग "लाल घन (डेमो में) उठाएं" और "बाएं से तीसरा सबसे बड़ा वस्तु उठाएं (नवीन वाक्यांश) " के बीच अंतर है।
सुरक्षा और कार्रवाई की सीमाएं
प्रत्येक उत्पादन VLA जहाजों के साथः
- हार्ड ज्वाइंट सीमा (स्पेसिफिकेशन के बाद टॉर्क नहीं कर सकता) ।
- गति सीमा (नरम काटने)
- कार्यक्षेत्र की सीमाएँ (अंत-इफेक्टर तालिका से बाहर नहीं निकल सकता है) ।
- नए कार्यों के लिए मानव-सक्रिय अनुमोदन।
ये VLA के बाहर नियंत्रण परत की जांच के रूप में बैठते हैं। VLA का आउटपुट एक सुझाव है, एक आदेश नहीं है।
इसका प्रयोग करें
code/main.py:
- 256-बिन एक्शन टोकनाइजेशन और डिकॉनाइजेशन को लागू करता है।
- DCT + क्वांटिज़ेशन के आधार पर FAST टोकनाइज़र का स्केच।
- प्रति क्रिया चरण पार (विशिष्ट-बिन, फास्ट, निरंतर-प्रवाह) के लिए टोकन-कउंट की तुलना करता है।
- RT-2 → OpenVLA → π0 → GR00T का वंशावली सारांश छापता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-vla-action-format-picker.md. एक रोबोट कार्य (मॅनिपुलेशन, नेविगेशन, ह्यूमनॉइड पूरे शरीर) को देखते हुए, डिस्क्रिट-बिन + RT-2, फास्ट + ओपनवीएलए, प्रवाह-मिलान + π0, या डबल-सिस्टम + GR00T के बीच चयन करें।
व्यायाम
- 10 डीओएफ हाथ 30 हर्ट्ज नियंत्रण दर पर. 256 डिब्बे पर विवश-बिन टोकनकरण प्रति सेकंड कितने टोकन उत्सर्जित करता है? एक 7B VLM के साथ रख सकते हैं?
- फास्ट टोकनकरण 30 चरणों के ट्रैकटोरियों को ~ 10 टोकन तक संपीड़ित करता है। यदि ट्रैकटोरिया में उच्च आवृत्ति आंदोलन (जैसे, ड्रमिंग) है तो उपयोगकर्ता क्या खोता है?
- π0 के प्रवाह-अनुरूप सिर ~ 5 चरणों में denoises. OpenVLA के autoregressive decode के साथ 4-5 हर्ट्ज पर पारगमन की तुलना करें.
- GR00T की प्रणाली 1 / प्रणाली 2 Kahneman के लिए नक्शे विभाजित. एक अलग विभाजन प्रस्तावित (सिस्टम 3?) जो द्विपाद चलने में मदद कर सकता है.
- डाटासेट क्यूरेशन पर ओपन एक्स-एम्बॉडीमेंट सेक्शन 4 पढ़ें। डोमेन लीक को रोकने वाले तीन क्यूरेशन नियम का नाम दें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| VLA | "Vision-language-action" | Model that takes image + instruction and outputs action commands |
| Action tokenization | "Discrete bins" | Quantize continuous joint targets into 256 bins per dim, each a vocab ID |
| FAST tokenizer | "Frequency action tokens" | DCT + quantize to compress 30-step trajectories to ~10 tokens |
| Co-fine-tune | "Mix web + robot" | Train on web VQA data alongside robot demos to preserve general knowledge |
| Flow-matching action head | "π0 continuous output" | Small transformer that outputs a 50-step action sequence via rectified flow |
| System 1 / System 2 | "Dual-system control" | Large VLM plans slowly, small action head acts quickly; GR00T pattern |
| Open X-Embodiment | "RT-X dataset" | 1M-trajectory cross-robot dataset; the training corpus |
आगे पढ़ना
- Brohan et al. — RT-2 (arXiv:2307.15818)
- Kim et al. — OpenVLA (arXiv:2406.09246)
- Black et al. — π0 (arXiv:2410.24164)
- NVIDIA — GR00T N1 (arXiv:2503.14734)
- Open X-Embodiment Collab — RT-X (arXiv:2310.08864)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.