Phase 12: Multimodal AI

अवतार वाले VLA: RT-2, OpenVLA, π0, GR00T

पहली बार एक मॉडल ने एक वेबसाइट से एक नुस्खा पढ़ा और इसे रसोई की रोबोट में निष्पादित किया RT-2 (Google DeepMind, जुलाई 2023) था। RT-2 ने टेक्स्ट टोकन के रूप में कार्यों को गुप्त रखा, वेब डेटा और रोबोट-एक्शन डेटा पर एक VLM को सह-अपरिभाषित किया, और साबित किया कि वेब-स्केल दृष्टि-भाषा ज्ञान रोबोट नियंत्रण में स्थानांतरित होता है। OpenVLA (जून 2024) ने खुला 7B संदर्भ भेजा। फिजिकल इंटेलिजेंस की π0 श्रृंखला (2024-2025) ने प्रवाह-समानता कार्रवाई विशेषज्ञों को जोड़ा। एनवीआईडीआईए के GR00T N1 (मार्च 2025) ने मानवयुक्त रोबोटों के लिए दोहरी प्रणाली (सिस्टम 1 / सिस्टम 2) नियंत्रण प्रदान किया। वीएलए आदिम दृष्टि-भाषा-क्रिया, एक एकल मॉडल जो देखता है, पढ़ता है, और कार्य करता है इस चरण के समझ मॉडल और चरण 15 में स्वायत्त प्रणालियों के बीच पुल है।

Type: Learn

Languages: Python (stdlib, action tokenizer + VLA inference skeleton)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 15 (Autonomous Systems, referenced)

Time: ~180 minutes

सीखने के लक्ष्य

  • क्रिया टोकनकरण का वर्णन करेंः डिस्क्रेट बिन एन्कोडिंग (RT-2), फास्ट कुशल क्रिया टोकन, निरंतर प्रवाह-संगत क्रियाएं (π0).
  • वेब + रोबोट डेटा पर सह-अच्छी ट्यूनिंग से नए कार्यों में सामान्य ज्ञान हस्तांतरण को क्यों संरक्षित किया जाता है, इसका वर्णन करें।
  • एक ही रोबोट कार्य पर OpenVLA (खुला 7B Llama+VLM), π0 (प्रवाह-अनुरूपता), और GR00T N1 (द्वितीय-प्रणाली) की तुलना करें।
  • ओपन एक्स-एम्बॉडीमेंट डेटासेट और आरटी-एक्स प्रशिक्षण कॉर्पस के रूप में इसकी भूमिका का नाम बताइए।

समस्या

एक रोबोट जो प्राकृतिक भाषा के निर्देशों से घर का काम करता है, 1970 के दशक से एक शोध लक्ष्य रहा है। 2020 के उत्तरः एक दृष्टि-भाषा-क्रिया (वीएलए) मॉडल। उसी वीएलएम वास्तुकला का उपयोग वीक्यूए के लिए किया जाता है, लेकिन आउटपुट पाठ के बजाय क्रियाएं (संयुक्त टोक़, अंत-इफेक्टर मुद्राएं, अलगाव आदेश) हैं।

VLA के लिए विशिष्ट चुनौतियांः

  1. क्रिया स्थान निरंतर (संयुक्त कोण, बल) और उच्च आयामी हैं (7-DOF हाथ + 3-DOF पकड़ = 30 हर्ट्ज पर 10 dims) ।
  2. रोबोट-विशिष्ट प्रशिक्षण डेटा दुर्लभ है। ओपन एक्स-एम्बॉडीमेंट में ~ 1M पटरियां हैं; वेब टेक्स्ट-इमेज 5B + है।
  3. नियंत्रण आवृत्ति मायने रखता है. 30 हर्ट्ज नियंत्रण लूप प्रति कार्रवाई 33ms बजट का मतलब है.
  4. सुरक्षा. गलत कार्रवाई हार्डवेयर, इंसानों या संपत्ति को नुकसान पहुंचाती है।

अवधारणा

कार्रवाई टोकन (RT-2)

RT-2 की चालः प्रत्येक संयुक्त लक्ष्य को एक क्वांटिज़्ड टेक्स्ट टोकन के रूप में प्रस्तुत करें। सामान्यीकृत [-1, 1] रेंज को 256 बिन्स में विभाजित करें, प्रत्येक बिन्स को शब्दावली आईडी के लिए मैप करें। प्रत्येक नियंत्रण चरण पर 10-DOF कार्रवाई 10 टोकन बन जाती है।

एक मिश्रण पर एक PaLM-X VLM को सह-अच्छी तरह से समायोजित करेंः

  • वेब छवि-पाठ जोड़े (शीर्षक, VQA) ।
  • रोबोट प्रदर्शन, टोकन के रूप में कार्रवाई।

मॉडल "लाल घन" (भाषा) → छवि (दृष्टि) → 10-टोकन एक्शन अनुक्रम (विज्ञप्त संयुक्त लक्ष्य) देखता है। वेब प्री-ट्रेनिंग सामान्य ज्ञान हस्तांतरण को संरक्षित करता हैः RT-2 "त्वरित गतिशील वस्तु की ओर कदम" का पालन कर सकता है भले ही "त्वरित गतिशील" प्रशिक्षण डेटा में नहीं है।

आरटी-2 पेपर में 3-5 हर्ट्ज पर इन्फेरेंस, VLM ऑटोरेग्रेसिव डिकोड द्वारा सीमित।

OpenVLA खुला 7B संदर्भ

ओपनवीएलए (किम और सहयोगियों, जून 2024) ओपन-वेट आरटी-2 समकक्ष है। 7 बी लामा रीढ़ की हड्डी, DINOv2 + सिगलिप ड्यूल विजन एन्कोडर, 256 बिन्स पर एक्शन टोकनाइज़ेशन।

ओपन एक्स-एम्बॉडीमेंट (970 हजार पटरियों पर 22 रोबोट) पर प्रशिक्षित। नए रोबोट के अनुकूलन के लिए लोरा बारीक-ट्यूनिंग समर्थन वाले जहाज।

इन्फेरेंसः क्वांटिज़ेशन के साथ A100 पर 4-5 हर्ट्ज. धीमी हेरफेर के लिए पर्याप्त तेज, उच्च आवृत्ति नियंत्रण के लिए नहीं।

फास्ट टोकनराइज़र तेजी से कार्रवाई डिकोड

Pertsch et al. (2024) ने दिखाया कि डिस्क्रिट-बिन टोकनाइजेशन अक्षम है बिन-स्पेस के एक छोटे क्षेत्र में अधिकांश एक्शन क्लस्टर। FAST (फ्रिक्वेन्सी-डोमेन एक्शन सीक्वेंस टोकनाइज़र) DCT के माध्यम से एक्शन अनुक्रमों को संपीड़ित करता है और गुणांक को मात्राबद्ध करता है।

एक 30-चरण कार्रवाई की प्रक्षेपवक्र 300 विवश-बिन टोकन के बजाय ~ 10 फास्ट टोकन बन जाता है। गुण हानि के बिना तर्क 3-5 गुना तेज होता है।

π0 और प्रवाह-समानता कार्य

फिजिकल इंटेलिजेंस का π0 (ब्लैक एट अल, अक्टूबर 2024) एक प्रवाह-अनुरूपता कार्रवाई विशेषज्ञ के साथ अलग-अलग कार्रवाई टोकन को बदल देता हैः

  • एक छोटा एक्शन ट्रांसफार्मर VLM की छिपी हुई अवस्थाओं को पढ़ता है और सही प्रवाह के माध्यम से एक निरंतर 50-चरण एक्शन अनुक्रम आउटपुट करता है।
  • एक्शन हेड प्रवाह-अनुरूपता हानि के साथ ट्रेन करता है; VLM पूर्व-प्रशिक्षण अपरिवर्तित रहता है।
  • इन्फरेंसः ~5 डीनोइंग स्टेप्स में उत्सर्जित पूर्ण एक्शन सीक्वेंस, प्रभावी रूप से 50 हर्ट्ज नियंत्रण।

π0 का दावाः एक व्यापक सेट में हेरफेर कार्यों पर OpenVLA और Octo से बेहतर है। निरंतर कार्रवाई के सूत्र को चिकनाई बनाए रखता है जो विवशता नष्ट करता है।

π0.5 और π0-FAST क्रमिक उन्नयन हैं. π0-FAST FAST टोकनकरण को प्रवाह मिलान के साथ जोड़ता है।

मानवयुक्तों के लिए GR00T N1 दोहरी प्रणाली

NVIDIA का GR00T N1 (मार्च 2025) मानवयुक्त रोबोट (>30 DOF, पूर्ण शरीर) के लिए बनाया गया हैः

  • प्रणाली 2: एक बड़ा VLM पढ़ने दृश्य + निर्देश, ~ 1 हर्ट्ज पर उच्च स्तर के उप-लक्ष्य का उत्पादन।
  • प्रणाली 1: एक छोटा एक्शन हेड ट्रांसफार्मर जो उप-लक्ष्य पर कंडीशनिंग वाले कम-स्तरीय 50-100 हर्ट्ज संयुक्त कमांड का उत्पादन करता है।

कैनेमैन के तेज और धीमी सोच के लिए विभाजित नक्शेः सिस्टम 2 योजनाएं, सिस्टम 1 कार्य करता है। लाभः धीमी VLM आकार की योजना तेजी से नियंत्रण को अवरुद्ध नहीं करती है; सिस्टम 1 विलंबता के लिए छोटा रहता है।

GR00T N1.7 (अंतिम 2025) डेटा स्केलिंग में सुधार करता है। GR00T ओम्निवर्स से सिम-टू-रियल डेटा के साथ ठीक-ठाक करता है।

खुला एक्स-बॉडीमेंट

प्रशिक्षण डेटा। RT-X (अक्टूबर 2023) ने 22 रोबोटों पर 1M पटरियों को कवर करने वाले 22 डेटा सेट इकट्ठा किए। ओपन एक्स-एम्बॉडीमेंट सभी का उपयोग करने वाला कॉर्पस हैः

  • ALOHA / ब्रिज V2 / Droid / RT-2 किचन / भाषा तालिका।
  • प्रत्येक नमूनाः (रोबोट की स्थिति, कैमरा दृश्य, निर्देश, कार्रवाई अनुक्रम) ।
  • प्रशिक्षण स्वच्छताः एक्शन स्पेस को एकजुट करें, संयुक्त रेंज को सामान्य बनाएं, कैमरों का आकार बदलें।

ओपन एक्स-एम्बॉडीमेंट पर ओपनवीएलए और पी0 ट्रेन। किसी भी विशिष्ट रोबोट के लिए डोमेन अंतर 100-1000 कार्य-विशिष्ट डेमो पर लोरा फाइन-ट्यूनिंग द्वारा बंद हो जाता है।

केवल रोबोट के साथ सह-अच्छी ट्यूनिंग

सह-अच्छी ट्यूनिंग वेब VQA डेटा को रोबोट पटरियों के साथ मिलाती है। अनुपात मायने रखता हैः बहुत अधिक VQA और मॉडल कार्यों को भूल जाता है; बहुत अधिक रोबोट डेटा और मॉडल सामान्य ज्ञान खो देता है।

RT-2 का अनुपातः ~1:1. OpenVLA: ~0.5:1 वेब-टू-रोबोट. π0: समान। सटीक अनुपात डेटासेट आकार के अनुसार ट्यून करने के लिए एक हाइपरपैरामीटर है।

केवल रोबोट प्रशिक्षण कार्य-विशिष्ट मॉडल उत्पन्न करता है जो वितरण के बाहर निर्देशों पर विफल रहता है। सह-अच्छी ट्यूनिंग "लाल घन (डेमो में) उठाएं" और "बाएं से तीसरा सबसे बड़ा वस्तु उठाएं (नवीन वाक्यांश) " के बीच अंतर है।

सुरक्षा और कार्रवाई की सीमाएं

प्रत्येक उत्पादन VLA जहाजों के साथः

  • हार्ड ज्वाइंट सीमा (स्पेसिफिकेशन के बाद टॉर्क नहीं कर सकता) ।
  • गति सीमा (नरम काटने)
  • कार्यक्षेत्र की सीमाएँ (अंत-इफेक्टर तालिका से बाहर नहीं निकल सकता है) ।
  • नए कार्यों के लिए मानव-सक्रिय अनुमोदन।

ये VLA के बाहर नियंत्रण परत की जांच के रूप में बैठते हैं। VLA का आउटपुट एक सुझाव है, एक आदेश नहीं है।

इसका प्रयोग करें

code/main.py:

  • 256-बिन एक्शन टोकनाइजेशन और डिकॉनाइजेशन को लागू करता है।
  • DCT + क्वांटिज़ेशन के आधार पर FAST टोकनाइज़र का स्केच।
  • प्रति क्रिया चरण पार (विशिष्ट-बिन, फास्ट, निरंतर-प्रवाह) के लिए टोकन-कउंट की तुलना करता है।
  • RT-2 → OpenVLA → π0 → GR00T का वंशावली सारांश छापता है।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-vla-action-format-picker.md. एक रोबोट कार्य (मॅनिपुलेशन, नेविगेशन, ह्यूमनॉइड पूरे शरीर) को देखते हुए, डिस्क्रिट-बिन + RT-2, फास्ट + ओपनवीएलए, प्रवाह-मिलान + π0, या डबल-सिस्टम + GR00T के बीच चयन करें।

व्यायाम

  1. 10 डीओएफ हाथ 30 हर्ट्ज नियंत्रण दर पर. 256 डिब्बे पर विवश-बिन टोकनकरण प्रति सेकंड कितने टोकन उत्सर्जित करता है? एक 7B VLM के साथ रख सकते हैं?
  1. फास्ट टोकनकरण 30 चरणों के ट्रैकटोरियों को ~ 10 टोकन तक संपीड़ित करता है। यदि ट्रैकटोरिया में उच्च आवृत्ति आंदोलन (जैसे, ड्रमिंग) है तो उपयोगकर्ता क्या खोता है?
  1. π0 के प्रवाह-अनुरूप सिर ~ 5 चरणों में denoises. OpenVLA के autoregressive decode के साथ 4-5 हर्ट्ज पर पारगमन की तुलना करें.
  1. GR00T की प्रणाली 1 / प्रणाली 2 Kahneman के लिए नक्शे विभाजित. एक अलग विभाजन प्रस्तावित (सिस्टम 3?) जो द्विपाद चलने में मदद कर सकता है.
  1. डाटासेट क्यूरेशन पर ओपन एक्स-एम्बॉडीमेंट सेक्शन 4 पढ़ें। डोमेन लीक को रोकने वाले तीन क्यूरेशन नियम का नाम दें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
VLA"Vision-language-action"Model that takes image + instruction and outputs action commands
Action tokenization"Discrete bins"Quantize continuous joint targets into 256 bins per dim, each a vocab ID
FAST tokenizer"Frequency action tokens"DCT + quantize to compress 30-step trajectories to ~10 tokens
Co-fine-tune"Mix web + robot"Train on web VQA data alongside robot demos to preserve general knowledge
Flow-matching action head"π0 continuous output"Small transformer that outputs a 50-step action sequence via rectified flow
System 1 / System 2"Dual-system control"Large VLM plans slowly, small action head acts quickly; GR00T pattern
Open X-Embodiment"RT-X dataset"1M-trajectory cross-robot dataset; the training corpus

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.