Phase 16: Multi-Agent & Swarms

مارل MADDPG، QMIX، MAPPO

التراث التعلمي للتعزيز لتنسيق متعدد الوكلاء، الذي لا يزال يبلغ أنظمة الوكلاء في القانون في عام 2026 MADDPG(لو وآخرون ، نيوريبس 2017 ، arXiv: 1706.02275) قدم التدريب المركزي ، التنفيذ اللامركزي (CTDE): يرى كل نقدي جميع حالات وكلاء وأفعالهم أثناء التدريب. في وقت الاختبار لا يعمل سوى الجهات الفاعلة المحلية. يعمل في إعدادات تعاونية وتنافسية ومختلطة. QMIX(Rashid et al., ICML 2018, arXiv:1803.11485) هو التفكك القيم مع شبكة خلط واحدة؛ كل عامل Qs يجمع في Q so argmaxيوزع بسهولة المهيمن على تحدي StarCraft Multi-Agent Challenge (SMAC). MAPPO(يو وآخرون ، نيوريبس 2022 ، arXiv: 2103.01955) هو PPO مع وظيفة قيمة مركزية ؛ "فعالة بشكل مفاجئ" على عالم الجسيمات ، SMAC ، كرة القدم البحثية جوجل ، حنابي مع تحديد الحد الأدنى. هذه تدعم سياسات التدريب لفرق الوكلاء التي يجب أن تتصرف بشكل لامركزي.default 2026 cooperative-MARL baselineهذه الدروس تبني كل منها من لعبة صغيرة في عالم الشبكة وتحوط الأفكار الثلاثة في الذاكرة العضلية قبل أن تلمس تدريب الوكيل LLM.

Type: Learn

Languages: Python (stdlib, small NumPy-free implementations)

Prerequisites: Phase 09 (Reinforcement Learning), Phase 16 · 09 (Parallel Swarm Networks)

Time: ~90 minutes

المشكلة

تدرب أنظمة الـ LLM-agent سياسات التنسيق بين الوكلاء بشكل متزايد: متى تأجيل، متى التصرف، من هم الأقران للاتصال. الأدب الذي يخبرك كيفية تدريب هذه السياسات هو التعلم المتعدد الوكلاء (MARL) ، الذي يسبق موجة الـ LLM ويتمتع بمجموعة صغيرة من الخوارزميات المهيمنة.

قراءة ورق مارل دون مخزون لغوي نمط مؤلم. التدريب المركزي مع التنفيذ اللامركزي (CTDE) ، وتفكيك القيمة ، والنقاد المركزيين ليسوا كلمات عبارة إنها إجابات محددة لمشاكل محددة:

  • الـ (ر) المستقل (كل عميل يتعلم بمفرده) غير ثابت من منظور كل عميل
  • لا تتحكم الـ RL المركزية (وكيل واحد في كل شيء) في النطاق و تنتهك قيود التنفيذ.
  • CTDE يحصل على أفضل ما في كلتا الحالتين: تدريب مع المعلومات العالمية، نشر مع السياسات المحلية.

المفهوم

ثلاثة بيئات تستخدم الأوراق

  • Particle World (multi-agent particle env).الفيزياء الثنائية الأبعاد البسيطة مع مهام تعاونية / تنافسية.
  • StarCraft Multi-Agent Challenge (SMAC).التعاونية الإدارة الصغيرة، الملاحظة الجزئية، مقعد اختبار QMIX، الإجراءات المتفصّلة، الحالات المستمرة.
  • Google Research Football, Hanabi, MPE.خطوط أساسية من خريطة.

الحوائط المختلفة لها أنواع مختلفة من العمل / الملاحظة. الخوارزميات تختار وفقا لذلك.

MADDPG (2017) نمط CTDE

كل عميلiلديه ممثلmu_i(o_i)وكل عميل لديه أيضاً ناقدQ_i(x, a_1, ..., a_n)يرى كل الملاحظات وكل الإجراءات خلال التدريب. يتم تحديث الممثل عن طريق تراجع السياسة مقابل تقييم النقاد.

actor update:    grad_theta_i J = E[grad_theta mu_i(o_i) * grad_a_i Q_i(x, a_1..n) at a_i=mu_i(o_i)]
critic update:   TD on Q_i(x, a_1..n) given next-state joint estimate

لماذا CTDE: في وقت التدريب، نحن نعرف أفعال الجميع؛ نحن نستخدم ذلك لتقليل التباين في كل نقدي. في وقت نشر، كل وكيل يرى فقط o_iوالمكالماتmu_i(o_i). . .

وضع الفشل: النقاد ينمو مع عوامل N (التدخيل يشمل جميع الإجراءات). لا يتجاوز ~ 10 عوامل دون تقارب.

QMIX (2018) تحلل القيمة

التعاون فقط. الجائزة العالمية هي جمع وظيفة واحدة من قيم Q لكل عامل:

Q_tot(tau, a) = f(Q_1(tau_1, a_1), ..., Q_n(tau_n, a_n)),   df/dQ_i >= 0

الاحتمالات الموحدة تضمنargmax_a Q_totيمكن حسابها من قبل كل وكيل يختارargmax_{a_i} Q_iبشكل مستقل، هذا هوexactly the decentralized execution propertyفي وقت التدريب، شبكة الاختلاط تنتجQ_totمن كل عامل

لماذا يفوز QMIX على SMAC: التعاونية StarCraft إدارة صغيرة لديها وكلاء متجانسين، مقامي عمل، مكافأة عالمية مناسبة تماما للتحلل القيمة.

وضع الفشل: القيود الموحدة تقييد؛ بعض المهام لديها هيكلات مكافأة غير قابلة للتحلل الموحدة (وكيل واحد يتضحى بالفريق). التوسعات (QTRAN، QPLEX) تخفف هذا.

MAPPO (2022) عدم الوفاء

PPO متعدد الوكلاء: PPO مع وظيفة قيمة مركزية. لكل وكيل سياسة خاصة بها. جميع الوكلاء يشتركون (أو لديهم لكل وكيل) وظائف قيمة ترى الحالة الكاملة. يوت وزملاء 2022 مقارنة MAPPO ضد MADDPG، QMIX، وتوسيعاتها على خمسة مقارنات ووجدوا:

  • يطابق MAPPO أو يفوق أساليب MARL غير السياسية على عالم الجسيمات، SMAC، Google Research Football، Hanabi، MPE.
  • الحد الأدنى من ضبط المعلمات المضطربة مطلوب.
  • تدريب مستقر، يمكن إعادة إنتاجها عبر البذور.

وقد أسأت المجتمع قيمة مارل على السياسة حتى هذه الورقة. في عام 2026، فإن MAPPO هي خط الأساس الافتراضي للمؤسسات التعاونية، يجب أن تتغلب على أي طريقة جديدة.

لماذا يجب أن يهتم مهندسو الجامعة

ثلاثة استخدامات مباشرة:

  1. Router training.وكيل الميتا يختار أي وكيل فرعي يتعامل مع مهمة. هذه مشكلة MARL مع N وكلاء فرعي لامركزي ومركز واحد توجيه مركزي. MAPPO يتناسب.
  2. Role emergence.في محاكاة العملاء التوليد، تعتبر العملاء التدريبية لتبني أدوار متكاملة مع مرور الوقت مشكلة MARL مخفية.
  3. Multi-agent tool use.عندما يتشارك العملاء الأدوات وينافسون على الميزانية، فإن تدريبهم عبر CTDE ينتج سياسات محلية قابلة للتنفيذ تحترم قيود الموارد.

تحذير عملي: في عام 2026، تُحث معظم أنظمة وكلاء ماجستير في الإنتاج على سياساتها بدلاً من تدريبها. تأتي مارل عندما يكون لديك (أ) الكثير من بيانات التفاعل، (ب) إشارة مكافأة واضحة، و (ج) استعداد للاستثمار في البنية التحتية للتدريب.

CTDE كنموذج تصميم خارج RL

حتى بدون تدريب، CTDE هي نمط معماري مفيد:

  • أثناء التصميم، افترض رؤية كاملة للطاقم.
  • في وقت تشغيل، فرض تنفيذ لامركزي: كل وكيل يرى فقط o_i. . .

النمط يضطرك للحفاظ على حالة كل وكيل صريحة والتفكير في قابلية الملاحظة الجزئية في وقت سابق. العديد من أنظمة الإنتاج متعددة الوكلاء تفترض بصمت حالة مشتركة في كل مكان تمارين CTDE تمنع ذلك.

مشكلة عدم الثبات

عندما يتعلم العديد من العاملين في وقت واحد، فإن بيئة كل عميل (التي تشمل سياسات الآخرين) غير ثابتة. تكسور أدلة RL الكلاسيكية من العامل الواحد. خوارزميات MARL في هذه الدروس جميعها تعالج هذا:

  • المنتقد العالمي يرى جميع الإجراءات، لذا تقدير قيمتها ثابت.
  • QMIX: تحلل القيمة يُحرك التعلم إلى مساحة Q المشتركة حيث يكون الإيجابية محدداً جيداً.
  • خريطة: وظيفة القيمة المركزية تخفف التباين عن تغييرات سياسة الآخرين.

في أنظمة الوكيل LLM، تظهر عدم الاستقرار على أنه "عمل وكيلي الشهر الماضي، والآن أن وكيل آخر فوق التيار تغيرت، سلوكيات المنجم السيئة". تدريب MARL مع CTDE هو الثابت المبدأي؛ تصحيحات المستوى السريع هي أسرع ولكن أقل استدامة.

ما لا يشمله هذا الدروس

تدريب الشبكات الفعلية هو موضوع المرحلة 9. هذه الدروس تبني نسخات سياسة مكتوبة تظهر CTDE ، وتفكيك القيمة ، وأنماط القيمة المركزية دون تحديثات التراجع. الهدف هو تعميم الأنماط قبل اختيار مكتبة MARL كاملة (PyMARL ، MARLlib ، RLlib متعدد الوكلاء).

بناءها

code/main.pyيطبق ثلاثة نماذج نمطية، كل ذلك على شبكة تعاونية صغيرة من 2 عملاء:

  • البيئة: 2 عاملين على شبكة 4x4، واحد مكافأة اللحظة. مكافأة = 1 إذا أي عامل يصل إلى اللحظة؛ المهمة تنتهي.
  • IndependentAgentsكل عامل يعامل الآخرين كبيئة.
  • MADDPGStyle النقاد المركزي يحسب القيمة المشتركة؛ تحديث سياسات الممثلين من ذلك. تحسين السياسة المخطوطة.
  • QMIXStyle التفكك القيم مع مزيج واحد الصوت.
  • MAPPOStyle وظيفة القيمة المركزية؛ تحديث السياسات مقابل خط الأساس المشترك.

جميع الحلقات الأربعة تشغيل نفس الحلقات وتبلغ عن متوسط الخطوات إلى الهدف. تلتقي خيارات CTDE إلى مسارات أقصر من خط الأساس المستقل.

أركض

python3 code/main.py

الناتج المتوقع: يأخذ العملاء المستقلون ~ 6 خطوات في المتوسط؛ تتقارب فاريان CTDE نحو ~ 3.5 خطوة (المتحسن لشبكة 4x4 هو 3). يظهر الفرق في النمط على الرغم من السياسات المخطوطة.

استخدمها

outputs/skill-marl-picker.mdهي مهارة تختار خوارزمية MARL لمهمة متعددة الوكلاء: التعاون مقابل المنافسة، المتنوع ضد المتعدد، نوع مساحة العمل، النطاق، إشارة المكافأة.

أرسله

المارل في الإنتاج نادر عندما تستخدمها

  • Start with MAPPO.وقد وضعت ورقة 2022 هذا الأمر كخط أساسي، وتوفيرها أولاً يوفّر أسابيع من مطاردة الطرق الأكثر خيالية.
  • Log every agent's observation and action stream.إزالة الخطأ من (مارل) دون وجود أثر لكل عميل هو بلا أمل
  • Separate training code from execution code.CTDE هي تخصص، دع طريق الإجراء فقط يرى حقا o_i. . .
  • Reward shaping warning.مارل حساس جداً لتصميم المكافآت، هناك خطأ في التنسيق في التشكيل، ويتعلم العملاء استغلال ذلك،
  • For LLM agents، فكر في السياسات على مستوى السرعة أولاً. لا تستثمر في تدريب MARL إلا عندما تكون بيانات التفاعل + إشارة مكافأة + البنية التحتية موجودة.

التمارين

  1. أركضcode/main.py. قياس الفجوة بين الخطوات إلى الأهداف بين وكلاء مستقلين ونمط MAPPO. هل تتزايد الفجوة أم تتقلص على شبكة 6 × 6؟
  2. تنفيذ تنافسية: اثنين من الوكلاء، واحد اللقطة، فقط أول شخص يصل للحصول على مكافأة. أي نمط يتعامل مع المنافسة نظيفة؟ MADDPG تاريخيا.
  3. اقرأ MADDPG (arXiv:1706.02275) القسم 3. تنفيذ قاعدة تحديث النقد الدقيق بشكل رمزي في رمزية مزيفة بكلماتك الخاصة.
  4. قراءة MAPPO (arXiv:2103.01955). لماذا يجادل المؤلفون القيمة المركزية + PPO يفوق MARL خارج السياسة على مقاييسهم؟ قم بتعريف ثلاثة أقوى ادعاءات.
  5. تطبيق CTDE كنمط تصميم لنظام افتراضي للوكيل LLM (على سبيل المثال، وكيل البحث + المختصر + المبرمج). ما هي المعلومات المشتركة المتاحة في وقت التصميم التي لا تتوفر في وقت التشغيل؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
MARL"Multi-Agent RL"Reinforcement learning for multi-agent systems.
CTDE"Centralized Training, Decentralized Execution"Train with global info; deploy with local policies.
MADDPG"Multi-Agent DDPG"CTDE with per-agent critic seeing all observations + actions.
QMIX"Value decomposition"Monotonic mixing of per-agent Qs. Cooperative.
MAPPO"Multi-Agent PPO"PPO with centralized value function. 2026 default baseline.
Value decomposition"Sum of individual Qs"Joint Q represented as a monotone function of per-agent Qs.
Non-stationarity"Moving targets"Each agent's env changes as others learn. The core MARL problem.
On-policy / off-policy"Learn from current / replay"PPO is on-policy (MAPPO); DDPG and Q-learning are off-policy.
SMAC"StarCraft Multi-Agent Challenge"Cooperative micromanagement benchmark; QMIX's homegrown ground.

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.