Phase 12: Multimodal AI

VLA های موجود: RT-2, OpenVLA, π0, GR00T

اولین بار که یک مدل یک دستور را از یک وب سایت خواند و آن را در یک ربات آشپزخانه اجرا کرد RT-2 (گوگل DeepMind، ژوئیه 2023) بود. RT-2 اقدامات را به عنوان توکن های متنی به صورت مخفیانه تشخیص داد، یک VLM را بر روی داده های وب و همچنین داده های عمل ربات تنظیم کرد و ثابت کرد که دانش زبان بینایی در مقیاس وب به کنترل ربات منتقل می شود. OpenVLA (جون 2024) مرجع 7B را ارسال کرد. مجموعه π0 هوش فیزیکی (2024-2025) کارشناسان عمل تطابق جریان را اضافه کرد. GR00T N1 (مارس 2025) NVIDIA کنترل دو سیستم (سیستم 1 / سیستم 2) را برای روبات های انسانی در مقیاس ارائه داد. مدل اولیه VLA زبان دید-عمل، یک مدل واحد که می بیند، می خواند و عمل می کند پل بین مدل های درک این مرحله و سیستم های مستقل در مرحله 15 است.

Type: Learn

Languages: Python (stdlib, action tokenizer + VLA inference skeleton)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 15 (Autonomous Systems, referenced)

Time: ~180 minutes

اهداف یادگیری

  • توکن عمل را شرح دهید: کد بندی کناره ای متمایز (RT-2) ، توکن عمل موثر FAST، اقدامات تطابق جریان مداوم (π0).
  • توضیح دهید که چرا تنظیم مشترک در وب + داده های ربات انتقال دانش عمومی را به وظایف جدید حفظ می کند.
  • مقایسه OpenVLA (آفتاب 7B Llama + VLM) ، π0 (تلاش جریان) و GR00T N1 (سیستم دوگانه) در همان کار ربات.
  • مجموعه داده های Open X-Embodiment و نقش آن به عنوان کورپوس آموزش RT-X را ذکر کنید.

مشکل

یک ربات که کارهای خانگی را از دستورالعمل های زبان طبیعی انجام می دهد از دهه 1970 هدف تحقیقاتی بوده است. پاسخ سال 2020: یک مدل عمل زبان بینایی (VLA). همان معماری VLM برای VQA استفاده می شود، اما تولید عمل (تورک های مشترک، حالت اثر نهایی، دستورات متمایز) به جای متن است.

چالش های خاص VLA:

  1. فضاهای عملیاتی مستمر (زاویه های مشترک، نیروهای) و ابعاد بالا (دست 7 DOF + گیرنده 3 DOF = 10 dims در 30 Hz) هستند.
  2. داده های آموزش مخصوص ربات کمیاب است. X-Embodiment باز دارای مسیرهای ~ 1M است؛ تصویر متن وب 5B + است.
  3. کنترل فرکانس مهمه. 30 هرتز کنترل لوپ به معنی 33ms بودجه هر عمل.
  4. ایمنی. یک اقدام اشتباه به تجهیزات، انسان ها یا اموال آسیب می رساند.

مفهوم

توکن سازی اقدام (RT-2)

ترفند RT-2: هر هدف مشترک را به عنوان یک توکن متن کوانتزی نشان دهید. محدوده نرمال شده [-1, 1] را به 256 سطل تقسیم کنید، هر سطل را به یک شناسه لغت نقشه برداری کنید. یک عمل 10 DOF در هر مرحله کنترل به 10 نشانه تبدیل می شود.

هم سازش یک VLM PaLM-X در یک مخلوط:

  • جفت های تصویر وب و متن (تکتیون، VQA).
  • روبات ها، عمل به عنوان توکن ها

مدل می بیند "کوب قرمز را بالا ببرید" (زبان) → تصویر (رؤیا) → 10 توکن عمل (هدف مشترک مختص) . پیش از آموزش وب انتقال دانش عمومی را حفظ می کند: RT-2 می تواند "حرکت به سمت شی سریع حرکت" را دنبال کند حتی اگر "رفتار سریع" در داده های آموزش وجود نداشته باشد.

بازتاب در 3-5 Hz در کاغذ RT-2، محدود شده توسط VLM خودکد بازخورد.

OpenVLA باز کردن 7B

OpenVLA (Kim et al., ژوئن 2024) معادل RT-2 با وزن باز است. ستون فقرات Llama 7B، کدگر DINOv2 + SigLIP دوگانه بینایی، نشانه گذاری عمل بیش از 256 سطل.

در حال آموزش در Open X-Embodiment (970 هزار مسیر در 22 ربات) ، کشتی ها با حمایت از تنظیم دقیق LoRA برای سازگاری با ربات های جدید.

انفرنس: 4-5 هرتز در A100 با کوانتيزيشن، به اندازه کافی سريع براي دستکاری آهسته، نه براي کنترل فرکانس بالا

توکنيزر سریع کدگذاری عمل سریعتر

Pertsch و همکاران (2024) نشان داد که توکن سازی بین متمایز ناکارآمد است اکثر کلستر عمل در یک منطقه کوچک از فضای بین. FAST (Tokener Sequence Action Sequence) از طریق DCT دنباله های عمل را فشرده می کند و معادلات را مقداری می کند.

یک مسیر عمل 30 مرحله ای به جای 300 توکن بین متمایز تبدیل می شود. سرعت تعبیر 3-5 برابر بدون از دست دادن کیفیت.

π0 و اقدامات تطابق جریان

π0 هوش فیزیکی (Black et al., اکتبر 2024) توکن های عمل متمایز را با یک متخصص عمل تطابق جریان جایگزین می کند:

  • یک ترانسفورماتور کوچک عمل حالت پنهان VLM را می خواند و یک دنباله عمل 50 مرحله ای مداوم را از طریق جریان اصلاح شده تولید می کند.
  • حرکت سر قطار با جریان مطابقت از دست دادن VLM پیش از تمرین باقی مانده است.
  • انفرنس: یک سری عمل کامل در ~ 5 مرحله ای که نشان دهنده آن است، به طور موثر کنترل 50 Hz.

ادعای π0: در مجموعه گسترده ای از وظایف دستکاری OpenVLA و Octo را شکست می دهد. فرمولا عمل مداوم باعث حفظ یکپارچه بودن است که تباه سازی نابود می کند.

π0.5 و π0-FAST ارتقااتی تدریجی هستند. π0-FAST توکن سازی FAST را با تطابق جریان ترکیب می کند.

GR00T N1 سیستم دوگانه برای انسان ها

GR00T N1 NVIDIA (مارس 2025) برای روبات های انسانی ساخته شده است (> 30 DOF، کل بدن):

  • سیستم 2: یک صحنه بزرگ VLM خواندن + دستورالعمل، تولید زیرهدف سطح بالا در ~ 1 Hz.
  • سیستم ۱: یک ترانسفورماتور کوچک با سر عمل که دستورات مشترک 50-100 هرتز سطح پایین را در مورد اهداف زیر تولید می کند.

نقشه های تقسیم شده به تفکر سریع و آهسته Kahneman: سیستم 2 برنامه ریزی می کند، سیستم 1 عمل می کند. مزایای: برنامه ریزی آهسته در اندازه VLM کنترل سریع را مسدود نمی کند؛ سیستم 1 برای تاخیر کوچک باقی می ماند.

GR00T N1.7 ( اواخر 2025) مقیاس بندی داده ها را بهبود می بخشد. GR00T با داده های سیم به واقعی از Omniverse تنظیم می کند.

شكل باز X

داده های آموزش. RT-X (اکتبر 2023) 22 مجموعه داده را جمع آوری کرد که 1 میلیون مسیر را در 22 ربات پوشش می دهد. Open X-Embodiment corpus همه استفاده می کنند:

  • ALOHA / پل V2 / Droid / RT-2 آشپزخانه / میز زبان.
  • هر نمونه: (حال روبات، دید دوربین، دستورالعمل، ترتیب عمل).
  • بهداشت آموزش: فضای عمل را متحد کنید، دامنه های مشترک را عادی کنید، دوربین ها را تغییر دهید.

OpenVLA و π0 در Open X-Embodiment راه اندازی می شوند. شکاف دامنه برای هر ربات خاص با تنظیم دقیق LoRA در 100-1000 نمایشگاه خاص وظیفه بسته می شود.

تنظیمات همکار با روبات ها

تنظیمات همکار داده های VQA وب را با مسیرهای ربات ترکیب می کند. نسبت مهم است: بیش از حد VQA و مدل اقدامات را فراموش می کند؛ بیش از حد داده های ربات و مدل دانش عمومی را از دست می دهد.

نسبت RT-2: ~1:1. OpenVLA: ~0.5:1 وب به ربات. π0: مشابه. نسبت دقیق یک پارامتر فوق العاده برای تنظیم در هر اندازه مجموعه داده است.

آموزش تنها روبات مدل های خاص وظیفه را تولید می کند که در دستورالعمل های خارج از توزیع شکست می خورند. هماهنگ سازی دقیق تفاوت بین "کوب قرمز را انتخاب کنید (در نمایش) " و "تین بزرگترین شی را از سمت چپ انتخاب کنید (فصله سازی جدید). "

محدودیت های ایمنی و فعالیت

هر کشتی VLA تولید با:

  • محدودیت های سخت مفاصل (نمی تواند در حال حرکت بیش از مشخصات باشد).
  • محدودیت سرعت (کلیک نرم)
  • محدودیت فضای کار (فکتور آخر نمی تواند از جدول خارج شود).
  • مجوز انسانی در حال اجرا برای وظایف جدید

این ها خارج از VLA به عنوان چک های لایه کنترل قرار دارند. خروجی VLA یک پیشنهاد است، نه یک فرمان.

ازش استفاده کن

code/main.py:

  • انجام توکنز و تخفیف توکنز عمل 256bin
  • یک توکنایزر FAST را بر اساس DCT + کوانتاسیون طراحی می کند.
  • مقایسه تعداد توکن ها در هر مرحله عمل (بین متمایز، FAST، جریان مداوم)
  • خلاصه ای از کرسی RT-2 → OpenVLA → π0 → GR00T را چاپ می کند.

-باده

این درس به ما کمک می کندoutputs/skill-vla-action-format-picker.md. در صورتی که یک کار رباتیک انجام شود (تحریف، ناوبری، کل بدن انسان نما) ، بین بین بین بین + RT-2، FAST + OpenVLA، جریان مطابقت + π0 یا سیستم دوگانه + GR00T انتخاب می کند.

تمرینات

  1. دست 10 DOF با سرعت کنترل 30 هرتز. توکنز باين با 256 سطل در هر ثانیه چند توکن منتشر می کند؟
  1. توکن سازی سریع مسیرهای 30 مرحله را به ~ 10 توکن فشرده می کند. کاربر چه چیزی را از دست می دهد اگر مسیر دارای حرکت فرکانس بالا (به عنوان مثال، طبل) باشد؟
  1. در طول طول طول و عرض در طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول طول و عرض در طول طول طول طول طول و عرض در طول طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول طول و عرض در طول طول و عرض در طول و عرض در طول و عرض در طول و عرض در طول و عرض در طول و عرض 5 Hz.
  1. سیستم 1 / سیستم 2 GR00T نقشه های تقسیم به Kahneman را ارائه می دهد. تقسیم متفاوتی (سیستم 3?) که ممکن است به دوپاده رفتن کمک کند.
  1. بخش 4 "X-Embodiment Open" را در مورد حفاظت از مجموعه داده ها بخوانید. سه قانون حفاظت را که از انتشار دامنه جلوگیری می کند، نام ببرید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
VLA"Vision-language-action"Model that takes image + instruction and outputs action commands
Action tokenization"Discrete bins"Quantize continuous joint targets into 256 bins per dim, each a vocab ID
FAST tokenizer"Frequency action tokens"DCT + quantize to compress 30-step trajectories to ~10 tokens
Co-fine-tune"Mix web + robot"Train on web VQA data alongside robot demos to preserve general knowledge
Flow-matching action head"π0 continuous output"Small transformer that outputs a 50-step action sequence via rectified flow
System 1 / System 2"Dual-system control"Large VLM plans slowly, small action head acts quickly; GR00T pattern
Open X-Embodiment"RT-X dataset"1M-trajectory cross-robot dataset; the training corpus

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.