VLA های موجود: RT-2, OpenVLA, π0, GR00T
Type: Learn
Languages: Python (stdlib, action tokenizer + VLA inference skeleton)
Prerequisites: Phase 12 · 05 (LLaVA), Phase 15 (Autonomous Systems, referenced)
Time: ~180 minutes
اهداف یادگیری
- توکن عمل را شرح دهید: کد بندی کناره ای متمایز (RT-2) ، توکن عمل موثر FAST، اقدامات تطابق جریان مداوم (π0).
- توضیح دهید که چرا تنظیم مشترک در وب + داده های ربات انتقال دانش عمومی را به وظایف جدید حفظ می کند.
- مقایسه OpenVLA (آفتاب 7B Llama + VLM) ، π0 (تلاش جریان) و GR00T N1 (سیستم دوگانه) در همان کار ربات.
- مجموعه داده های Open X-Embodiment و نقش آن به عنوان کورپوس آموزش RT-X را ذکر کنید.
مشکل
یک ربات که کارهای خانگی را از دستورالعمل های زبان طبیعی انجام می دهد از دهه 1970 هدف تحقیقاتی بوده است. پاسخ سال 2020: یک مدل عمل زبان بینایی (VLA). همان معماری VLM برای VQA استفاده می شود، اما تولید عمل (تورک های مشترک، حالت اثر نهایی، دستورات متمایز) به جای متن است.
چالش های خاص VLA:
- فضاهای عملیاتی مستمر (زاویه های مشترک، نیروهای) و ابعاد بالا (دست 7 DOF + گیرنده 3 DOF = 10 dims در 30 Hz) هستند.
- داده های آموزش مخصوص ربات کمیاب است. X-Embodiment باز دارای مسیرهای ~ 1M است؛ تصویر متن وب 5B + است.
- کنترل فرکانس مهمه. 30 هرتز کنترل لوپ به معنی 33ms بودجه هر عمل.
- ایمنی. یک اقدام اشتباه به تجهیزات، انسان ها یا اموال آسیب می رساند.
مفهوم
توکن سازی اقدام (RT-2)
ترفند RT-2: هر هدف مشترک را به عنوان یک توکن متن کوانتزی نشان دهید. محدوده نرمال شده [-1, 1] را به 256 سطل تقسیم کنید، هر سطل را به یک شناسه لغت نقشه برداری کنید. یک عمل 10 DOF در هر مرحله کنترل به 10 نشانه تبدیل می شود.
هم سازش یک VLM PaLM-X در یک مخلوط:
- جفت های تصویر وب و متن (تکتیون، VQA).
- روبات ها، عمل به عنوان توکن ها
مدل می بیند "کوب قرمز را بالا ببرید" (زبان) → تصویر (رؤیا) → 10 توکن عمل (هدف مشترک مختص) . پیش از آموزش وب انتقال دانش عمومی را حفظ می کند: RT-2 می تواند "حرکت به سمت شی سریع حرکت" را دنبال کند حتی اگر "رفتار سریع" در داده های آموزش وجود نداشته باشد.
بازتاب در 3-5 Hz در کاغذ RT-2، محدود شده توسط VLM خودکد بازخورد.
OpenVLA باز کردن 7B
OpenVLA (Kim et al., ژوئن 2024) معادل RT-2 با وزن باز است. ستون فقرات Llama 7B، کدگر DINOv2 + SigLIP دوگانه بینایی، نشانه گذاری عمل بیش از 256 سطل.
در حال آموزش در Open X-Embodiment (970 هزار مسیر در 22 ربات) ، کشتی ها با حمایت از تنظیم دقیق LoRA برای سازگاری با ربات های جدید.
انفرنس: 4-5 هرتز در A100 با کوانتيزيشن، به اندازه کافی سريع براي دستکاری آهسته، نه براي کنترل فرکانس بالا
توکنيزر سریع کدگذاری عمل سریعتر
Pertsch و همکاران (2024) نشان داد که توکن سازی بین متمایز ناکارآمد است اکثر کلستر عمل در یک منطقه کوچک از فضای بین. FAST (Tokener Sequence Action Sequence) از طریق DCT دنباله های عمل را فشرده می کند و معادلات را مقداری می کند.
یک مسیر عمل 30 مرحله ای به جای 300 توکن بین متمایز تبدیل می شود. سرعت تعبیر 3-5 برابر بدون از دست دادن کیفیت.
π0 و اقدامات تطابق جریان
π0 هوش فیزیکی (Black et al., اکتبر 2024) توکن های عمل متمایز را با یک متخصص عمل تطابق جریان جایگزین می کند:
- یک ترانسفورماتور کوچک عمل حالت پنهان VLM را می خواند و یک دنباله عمل 50 مرحله ای مداوم را از طریق جریان اصلاح شده تولید می کند.
- حرکت سر قطار با جریان مطابقت از دست دادن VLM پیش از تمرین باقی مانده است.
- انفرنس: یک سری عمل کامل در ~ 5 مرحله ای که نشان دهنده آن است، به طور موثر کنترل 50 Hz.
ادعای π0: در مجموعه گسترده ای از وظایف دستکاری OpenVLA و Octo را شکست می دهد. فرمولا عمل مداوم باعث حفظ یکپارچه بودن است که تباه سازی نابود می کند.
π0.5 و π0-FAST ارتقااتی تدریجی هستند. π0-FAST توکن سازی FAST را با تطابق جریان ترکیب می کند.
GR00T N1 سیستم دوگانه برای انسان ها
GR00T N1 NVIDIA (مارس 2025) برای روبات های انسانی ساخته شده است (> 30 DOF، کل بدن):
- سیستم 2: یک صحنه بزرگ VLM خواندن + دستورالعمل، تولید زیرهدف سطح بالا در ~ 1 Hz.
- سیستم ۱: یک ترانسفورماتور کوچک با سر عمل که دستورات مشترک 50-100 هرتز سطح پایین را در مورد اهداف زیر تولید می کند.
نقشه های تقسیم شده به تفکر سریع و آهسته Kahneman: سیستم 2 برنامه ریزی می کند، سیستم 1 عمل می کند. مزایای: برنامه ریزی آهسته در اندازه VLM کنترل سریع را مسدود نمی کند؛ سیستم 1 برای تاخیر کوچک باقی می ماند.
GR00T N1.7 ( اواخر 2025) مقیاس بندی داده ها را بهبود می بخشد. GR00T با داده های سیم به واقعی از Omniverse تنظیم می کند.
شكل باز X
داده های آموزش. RT-X (اکتبر 2023) 22 مجموعه داده را جمع آوری کرد که 1 میلیون مسیر را در 22 ربات پوشش می دهد. Open X-Embodiment corpus همه استفاده می کنند:
- ALOHA / پل V2 / Droid / RT-2 آشپزخانه / میز زبان.
- هر نمونه: (حال روبات، دید دوربین، دستورالعمل، ترتیب عمل).
- بهداشت آموزش: فضای عمل را متحد کنید، دامنه های مشترک را عادی کنید، دوربین ها را تغییر دهید.
OpenVLA و π0 در Open X-Embodiment راه اندازی می شوند. شکاف دامنه برای هر ربات خاص با تنظیم دقیق LoRA در 100-1000 نمایشگاه خاص وظیفه بسته می شود.
تنظیمات همکار با روبات ها
تنظیمات همکار داده های VQA وب را با مسیرهای ربات ترکیب می کند. نسبت مهم است: بیش از حد VQA و مدل اقدامات را فراموش می کند؛ بیش از حد داده های ربات و مدل دانش عمومی را از دست می دهد.
نسبت RT-2: ~1:1. OpenVLA: ~0.5:1 وب به ربات. π0: مشابه. نسبت دقیق یک پارامتر فوق العاده برای تنظیم در هر اندازه مجموعه داده است.
آموزش تنها روبات مدل های خاص وظیفه را تولید می کند که در دستورالعمل های خارج از توزیع شکست می خورند. هماهنگ سازی دقیق تفاوت بین "کوب قرمز را انتخاب کنید (در نمایش) " و "تین بزرگترین شی را از سمت چپ انتخاب کنید (فصله سازی جدید). "
محدودیت های ایمنی و فعالیت
هر کشتی VLA تولید با:
- محدودیت های سخت مفاصل (نمی تواند در حال حرکت بیش از مشخصات باشد).
- محدودیت سرعت (کلیک نرم)
- محدودیت فضای کار (فکتور آخر نمی تواند از جدول خارج شود).
- مجوز انسانی در حال اجرا برای وظایف جدید
این ها خارج از VLA به عنوان چک های لایه کنترل قرار دارند. خروجی VLA یک پیشنهاد است، نه یک فرمان.
ازش استفاده کن
code/main.py:
- انجام توکنز و تخفیف توکنز عمل 256bin
- یک توکنایزر FAST را بر اساس DCT + کوانتاسیون طراحی می کند.
- مقایسه تعداد توکن ها در هر مرحله عمل (بین متمایز، FAST، جریان مداوم)
- خلاصه ای از کرسی RT-2 → OpenVLA → π0 → GR00T را چاپ می کند.
-باده
این درس به ما کمک می کندoutputs/skill-vla-action-format-picker.md. در صورتی که یک کار رباتیک انجام شود (تحریف، ناوبری، کل بدن انسان نما) ، بین بین بین بین + RT-2، FAST + OpenVLA، جریان مطابقت + π0 یا سیستم دوگانه + GR00T انتخاب می کند.
تمرینات
- دست 10 DOF با سرعت کنترل 30 هرتز. توکنز باين با 256 سطل در هر ثانیه چند توکن منتشر می کند؟
- توکن سازی سریع مسیرهای 30 مرحله را به ~ 10 توکن فشرده می کند. کاربر چه چیزی را از دست می دهد اگر مسیر دارای حرکت فرکانس بالا (به عنوان مثال، طبل) باشد؟
- در طول طول طول و عرض در طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول طول و عرض در طول طول طول طول طول و عرض در طول طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول و عرض در طول و عرض در طول و عرض در طول و عرض در طول و عرض در طول و عرض 5 Hz.
- سیستم 1 / سیستم 2 GR00T نقشه های تقسیم به Kahneman را ارائه می دهد. تقسیم متفاوتی (سیستم 3?) که ممکن است به دوپاده رفتن کمک کند.
- بخش 4 "X-Embodiment Open" را در مورد حفاظت از مجموعه داده ها بخوانید. سه قانون حفاظت را که از انتشار دامنه جلوگیری می کند، نام ببرید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| VLA | "Vision-language-action" | Model that takes image + instruction and outputs action commands |
| Action tokenization | "Discrete bins" | Quantize continuous joint targets into 256 bins per dim, each a vocab ID |
| FAST tokenizer | "Frequency action tokens" | DCT + quantize to compress 30-step trajectories to ~10 tokens |
| Co-fine-tune | "Mix web + robot" | Train on web VQA data alongside robot demos to preserve general knowledge |
| Flow-matching action head | "π0 continuous output" | Small transformer that outputs a 50-step action sequence via rectified flow |
| System 1 / System 2 | "Dual-system control" | Large VLM plans slowly, small action head acts quickly; GR00T pattern |
| Open X-Embodiment | "RT-X dataset" | 1M-trajectory cross-robot dataset; the training corpus |
خواندن بیشتر
- Brohan et al. — RT-2 (arXiv:2307.15818)
- Kim et al. — OpenVLA (arXiv:2406.09246)
- Black et al. — π0 (arXiv:2410.24164)
- NVIDIA — GR00T N1 (arXiv:2503.14734)
- Open X-Embodiment Collab — RT-X (arXiv:2310.08864)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.