Phase 12: Multimodal AI

المواصفات المتعلقة بالشيوخ المتداولة: RT-2، OpenVLA، π0، GR00T

أول مرة قرأت فيها نموذج وصفة من موقع ويب و نفذها في روبوت مطبخ كانت RT-2 (Google DeepMind ، يوليو 2023). قام RT-2 بتخفيف الإجراءات كرموز نصية، ووضع إضافة لتحديدات VLM على بيانات الويب بالإضافة إلى بيانات عمل الروبوت، وأثبت أن المعرفة في لغة الرؤية على نطاق الويب تنتقل إلى التحكم الروبوتي. أرسلت OpenVLA (يونيو 2024) مرجع 7B المفتوح. إضافة سلسلة π0 من الذكاء الجسدي (2024-2025) خبراء في العمل المتناسبة التدفق. أصدرت GR00T N1 (مارس 2025) من NVIDIA سيطرة نظامية مزدوجة (النظام 1 / النظام 2) للروبوتات الروحية على نطاق واسع. إن VLA البدائي العمل اللغة الرؤية، نموذج واحد يرى ويقرأ ويعمل هو الجسر بين نماذج الفهم هذه المرحلة والأنظمة المستقلة في المرحلة 15.

Type: Learn

Languages: Python (stdlib, action tokenizer + VLA inference skeleton)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 15 (Autonomous Systems, referenced)

Time: ~180 minutes

أهداف التعلم

  • وصف رمزية العمل: تشفير الحطام المفرد (RT-2) ، ورمز العمل الفعال FAST، عمليات مطابقة التدفق المستمرة (π0).
  • شرح لماذا تحافظ التنسيق المشترك على بيانات الويب + الروبوت على نقل المعرفة العامة إلى مهام جديدة.
  • مقارنة OpenVLA (فتح 7B Llama + VLM) ، π0 (تطابق التدفق) ، و GR00T N1 (النظام المزدوج) على نفس المهمة الروبوتية.
  • أسمي مجموعة بيانات Open X-Embodiment ودورها كـ RT-X training corpus.

المشكلة

كان الروبوت الذي يقوم بأعماله المنزلية من تعليمات اللغة الطبيعية هدفاً للبحوث منذ السبعينيات. الجواب في 2020s: نموذج عمل اللغة الرؤية (VLA). نفس معماري VLM المستخدم لـ VQA ، ولكن الخروج هو الإجراءات (توركات مشتركة ، وضعيات المصدر النهائي ، أوامر منفصلة) بدلاً من النص.

التحديات المحددة لـ VLA:

  1. مساحات العمل متواصلة (زوايا المشتركة، القوى) ومتعددة في الأبعاد العالية (7-DOF الذراع + 3-DOF الوقود = 10 dims عند 30 Hz).
  2. البيانات التدريبية الخاصة بالروبوت نادرة. يملك X-Embodiment المفتوح مسارات 1 مليون، وصورة نصية على شبكة الإنترنت 5B+.
  3. التدريبات تتطلب تعدد التحكم
  4. السلامة، الإجراء الخطأ يضر بالأجهزة، البشر، أو الممتلكات

المفهوم

إضفاء الوضوح على العمل (RT-2)

خدعة RT-2: تمثيل كل هدف مشترك كرمز نصي مقياس. قم بتخصيص النطاق المعايش [-1, 1] إلى 256 حاوية، ورسم كل حاوية إلى معرف المفردات. تصبح عملية 10-DOF 10 رمزا في كل خطوة تحكم.

إضافة المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة إلى المزيفات المضافة.

  • أزواج الصور والنص على شبكة الإنترنت (تدوين، VQA).
  • مظاهرات الروبوتات، العمل كرموز.

يرى النموذج "التقاط الكوب الأحمر" (اللغة) → الصورة (الرؤية) → تسلسل عمل 10 رموز (الاهداف المشتركة المفصلة). يحافظ التدريب المسبق على شبكة الإنترنت على نقل المعرفة العامة: يمكن أن تتبع RT-2 "تحرك نحو الكائن سريع الحركة" على الرغم من أن "التحرك السريع" ليس في بيانات التدريب.

الإستدلال عند 3-5 هرتز في ورقة RT-2، محدودة بواسطة VLM الترميز السريع.

OpenVLA الإشارة مفتوحة 7B

OpenVLA (Kim et al., يونيو 2024) هو معادل RT-2 المفتوح. 7B Llama backbone، DINOv2 + SigLIP مرموز الرؤية المزدوجة، رمزية العمل على 256 حاوية.

تدرب على Open X-Embodiment (970 ألف مسار عبر 22 روبوت) ، سفن مع دعم تحسين LoRA للتكيف مع روبوتات جديدة.

الإستدلال: 4-5 هرتز على A100 مع تعريف الكميات. سريع بما فيه الكفاية للتلاعب بطيء، وليس للسيطرة عالية التردد.

تكوينات سريعة تسريع عملية فك

أظهرت بيرتش وزملاؤها (2024) أن توكيينيزة الحزمة المفصلة غير فعالة معظم مجموعة الإجراءات في منطقة صغيرة من الفضاء الحزمي. FAST (Frequency-domain Action Sequence Tokenizer) تضغط على تسلسلات الإجراء عن طريق DCT وتقوم بتعظيم الكميات.

تتحول مسار العمل في 30 خطوة إلى 10 رموز FAST بدلاً من 300 رمزاً متفرقة. يتسارع التأثير 3-5x دون فقدان الجودة.

π0 وفعال مطابقة التدفق

تحل علامات العمل المفصلة محل علامات العمل المفصلة خبيرًا في تطابق التدفق:

  • تحويل عمل صغير يقرأ الحالات الخفية لـ VLM ويخرج تسلسل عمل مستمر من 50 خطوة عبر التدفق المصلح.
  • تتدرب الرأس الحركية مع فقدان مطابقة التدفق؛ VLM قبل التدريب لا يتغير.
  • الإستدلال: تسلسل عمل كامل ينبعث في ~ 5 خطوات تُخفف، تحكم فعال في 50 هرتز.

دعوى π0: يضرب OpenVLA و Octo على مجموعة واسعة من مهام التلاعب. صيغة العمل المستمر يحافظ على السلاسة التي تدمرها التخفيف.

π0.5 و π0-FAST هي تحديثات تدريجية. π0-FAST يجمع بين إشارة FAST مع مطابقة التدفق.

GR00T N1 نظام مزدوج للأناس

تم بناء GR00T N1 (مارس 2025) من NVIDIA للروبوتات الروحية (> 30 DOF، كامل الجسم):

  • النظام 2: مشهد قراءة VLM كبير + تعليمات، وتنتج أهداف فرعية عالية المستوى عند ~ 1 Hz.
  • النظام 1: محول صغير للقمة التنفيذية ينتج أوامر مشتركة منخفضة المستوى 50-100 هرتز مشروطة على الأهداف الفرعية.

الخرائط المقسمة إلى التفكير السريع والبطيء من كاهينمان: خطط النظام 2 ، يعمل النظام 1. الفوائد: التخطيط بطيء بحجم VLM لا يمنع التحكم السريع. النظام 1 يبقى صغيرًا بسبب التأخير.

GR00T N1.7 (أواخر 2025) تحسن من مقياس البيانات. GR00T تحسين مع Sim- إلى بيانات حقيقية من Omniverse.

المفتوحة (X-Body)

بيانات التدريب. جمعت RT-X (أكتوبر 2023) 22 مجموعة بيانات تغطي مسارات 1 مليون على 22 روبوتًا. Open X-Embodiment هي الجسم الذي يستخدمه الجميع:

  • ALOHA / الجسر V2 / Droid / RT-2 المطبخ / طاولة اللغة.
  • كل عينة: (حالة الروبوت، مشاهدة الكاميرا، تعليمات، تسلسل العمل).
  • تنظيف التدريب: توحيد مساحة العمل، وتطبيع النطاق المشترك، وتغيير حجم الكاميرات.

OpenVLA و π0 تدرب على Open X-Embodiment. يتم إغلاق الفجوة في المجال لأي روبوت محدد عن طريق ضبط LoRA على 100-1000 عرض معين لمهمة محددة.

التنسيق المشترك مقابل الروبوتات فقط

يخلط التنسيق المشترك بيانات VQA على شبكة الإنترنت مع مسارات الروبوتات. النسبة مهمة: الكثير من VQA والنموذج ينسى الإجراءات؛ الكثير من بيانات الروبوتات والنموذج يفقد المعرفة العامة.

نسبة RT-2: ~1:1. OpenVLA: ~0.5:1 شبكة إلى روبوت. π0: مماثلة. النسبة الدقيقة هي مفاتيح فائقة للتنسيق لكل حجم مجموعة البيانات.

إن التدريب على الروبوتات فقط ينتج نماذج محددة للمهمة التي تفشل في تعليمات خارج التوزيع. التنسيق المشترك هو الفرق بين "التقاط الكوب الأحمر (في التجربة) " و"التقاط الكائن الثالث الأكبر من اليسار (عبارة جديدة). "

حدود السلامة والعمل

كل سفينة VLA الإنتاجية مع:

  • حدود المفاصل الصلبة (لا يمكن أن تتجاوز معدل الدوران).
  • حدود السرعة (تقطيع ناعم).
  • حدود مساحة العمل (لا يمكن للعامل النهائي مغادرة الجدول).
  • الموافقة على استخدام البشر في الحلقة للمهام الجديدة.

هذه تقع خارج VLA كتحقق من طبقة التحكم. إنخراج VLA هو اقتراح، وليس أمر.

استخدمها

code/main.py:

  • تنفذ إشارة عمل 256 بن وإزالة إشارة.
  • رسم رمز FAST على أساس DCT + الكميات.
  • مقارنة عدد الرمز لكل خطوة من خلال العمل (مقطوعة التفريق، FAST، تدفق مستمر).
  • يطبخ ملخصاً للسلسلة من RT-2 → OpenVLA → π0 → GR00T.

أرسله

هذا الدرس يُنتجoutputs/skill-vla-action-format-picker.md. في ظل مهمة الروبوت (التلاعب، التنقل، الجسم كله البشري) ، تختار بين الجهاز المتفرد + RT-2، FAST + OpenVLA، وتطابق التدفق + π0، أو نظام مزدوج + GR00T.

التمارين

  1. ذراع 10 دولف عند معدل التحكم في 30 هرتز، إشارة الحزمة المختلفة عند 256 حاوية تنبعث كم رمز في الثانية؟
  1. تكوين رمزية سريعة يضغط مسارات 30 خطوة إلى ~ 10 رموز. ماذا يفقد المستخدم إذا كانت المسارية لديها حركة عالية التردد (على سبيل المثال ، الطبول) ؟
  1. يختلف رأس مقارنة تدفق π0 في ~ 5 خطوات. مقارنة التوصيل مع تشفير OpenVLA التراجعي عند 4-5 هرتز.
  1. نظام GR00T 1 / نظام 2 تقسيم الخرائط إلى كاهنيمان. اقترح تقسيم مختلف (النظام 3؟) قد يساعد على المشي على الأقدام الثنائية.
  1. اقرأ قسم 4 من Open X-Embodiment حول إدارة مجموعة البيانات. أسمائ قواعد الإدارة الثلاثة التي تمنع تسريب المجال.

الشروط الرئيسية

TermWhat people sayWhat it actually means
VLA"Vision-language-action"Model that takes image + instruction and outputs action commands
Action tokenization"Discrete bins"Quantize continuous joint targets into 256 bins per dim, each a vocab ID
FAST tokenizer"Frequency action tokens"DCT + quantize to compress 30-step trajectories to ~10 tokens
Co-fine-tune"Mix web + robot"Train on web VQA data alongside robot demos to preserve general knowledge
Flow-matching action head"π0 continuous output"Small transformer that outputs a 50-step action sequence via rectified flow
System 1 / System 2"Dual-system control"Large VLM plans slowly, small action head acts quickly; GR00T pattern
Open X-Embodiment"RT-X dataset"1M-trajectory cross-robot dataset; the training corpus

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.