Phase 16: Multi-Agent & Swarms

MARL MADDPG, QMIX, MAPPO

बहु-एजेंट समन्वय की सुदृढीकरण-शिक्षा विरासत, जो 2026 में भी एलएलएम-एजेंट प्रणालियों को सूचित करती है। MADDPG(लो और अन्य, न्यूरआईपीएस 2017, arXiv:1706.02275) ने केंद्रीकृत प्रशिक्षण, विकेंद्रीकृत निष्पादन (CTDE) पेश कियाः प्रत्येक आलोचक प्रशिक्षण के दौरान सभी एजेंटों के राज्यों और कार्यों को देखता है; परीक्षण के समय केवल स्थानीय अभिनेताओं को चलाया जाता है। सहकारी, प्रतिस्पर्धी और मिश्रित सेटिंग्स के लिए काम करता है। QMIX(राशीद और अन्य, आईसीएमएल 2018, arXiv:1803.11485) एक एकांत मिश्रण नेटवर्क के साथ मूल्य-विघटन है; प्रति एजेंट Qs संयुक्त Q के रूप में संयुक्त argmax स्टारक्राफ्ट मल्टी एजेंट चैलेंज (एसएमएसी) पर हावी है। MAPPO(यू एट अल, न्यूरआईपीएस 2022, arXiv:2103.01955) एक केंद्रीकृत मूल्य समारोह के साथ पीपीओ है; कण-दुनिया, एसएमएसी, गूगल रिसर्च फुटबॉल, हनाबी पर न्यूनतम ट्यूनिंग के साथ "अद्भुत रूप से प्रभावी" है। ये एजेंट टीमों के लिए प्रशिक्षण नीतियों का आधार हैं जिन्हें विकेंद्रीकृत रूप से कार्य करना चाहिए।default 2026 cooperative-MARL baselineयह सबक एक छोटे से ग्रिड-वर्ल्ड खिलौना से बना है और LLM एजेंट प्रशिक्षण को छूने से पहले मांसपेशियों की स्मृति में तीनों विचारों को भूमि देता है।

Type: Learn

Languages: Python (stdlib, small NumPy-free implementations)

Prerequisites: Phase 09 (Reinforcement Learning), Phase 16 · 09 (Parallel Swarm Networks)

Time: ~90 minutes

समस्या

एलएलएम एजेंट सिस्टम तेजी से एजेंटों के बीच समन्वय के लिए नीतियां प्रशिक्षित करते हैंः कब स्थगित करना, कब कार्य करना, किस सहकर्मी को कॉल करना। साहित्य जो आपको बताता है कि ऐसी नीतियों को कैसे प्रशिक्षित किया जाए, मल्टी-एजेंट रिफोर्सेशन लर्निंग (एमएआरएल) है, जो एलएलएम लहर से पहले है और इसमें एक छोटा सेट प्रमुख एल्गोरिदम है।

पैटर्न शब्दावली के बिना मार्ल पेपर पढ़ना दर्दनाक है। विकेंद्रीकृत निष्पादन (CTDE), मूल्य विघटन और केंद्रीकृत आलोचक के साथ केंद्रीकृत प्रशिक्षण विशिष्ट समस्याओं के विशिष्ट उत्तर हैं।

  • स्वतंत्र आरएल (प्रत्येक एजेंट अकेले सीखता है) प्रत्येक एजेंट के दृष्टिकोण से गैर-स्थिर है. बुरा.
  • केंद्रीकृत आरएल (एक एजेंट सभी को नियंत्रित करता है) स्केल नहीं करता है और निष्पादन प्रतिबंधों का उल्लंघन करता है।
  • CTDE दोनों का सबसे अच्छा लाभ उठाता हैः वैश्विक जानकारी के साथ प्रशिक्षण, स्थानीय नीतियों के साथ तैनाती।

अवधारणा

तीन वातावरण कागजातों का उपयोग

  • Particle World (multi-agent particle env).सहयोग/प्रतिस्पर्धी कार्यों के साथ सरल 2D भौतिकी. MADDPG के मूल परीक्षण बिस्तर.
  • StarCraft Multi-Agent Challenge (SMAC).सहकारी सूक्ष्म प्रबंधन, आंशिक अवलोकन, QMIX के परीक्षण बिस्तर, निर्विवाद कार्रवाई, निरंतर अवस्थाएं।
  • Google Research Football, Hanabi, MPE.मैपओ बेसलाइन।

विभिन्न वातावरण में विभिन्न क्रिया/निरीक्षण प्रकार होते हैं। एल्गोरिदम तदनुसार चुनते हैं।

MADDPG (2017) CTDE पैटर्न

प्रत्येक एजेंट iएक अभिनेता है mu_i(o_i)प्रत्येक एजेंट के पास एक आलोचक भी होता है।Q_i(x, a_1, ..., a_n)जो प्रशिक्षण के दौरान सभी अवलोकनों और सभी कार्यों को देखता है। अभिनेता को आलोचक के मूल्यांकन के खिलाफ नीतिगत ग्रेडिएंट द्वारा अद्यतन किया जाता है।

actor update:    grad_theta_i J = E[grad_theta mu_i(o_i) * grad_a_i Q_i(x, a_1..n) at a_i=mu_i(o_i)]
critic update:   TD on Q_i(x, a_1..n) given next-state joint estimate

क्यूं सीटीडीईः प्रशिक्षण के समय, हम सभी के कार्यों को जानते हैं; हम प्रत्येक आलोचक में भिन्नता को कम करने के लिए इसका उपयोग करते हैं। तैनाती के समय, प्रत्येक एजेंट केवल देखता है o_iऔर कॉलmu_i(o_i). .

विफलता मोडः N एजेंटों के साथ आलोचक बढ़ते हैं (इनपुट में सभी क्रियाएं शामिल हैं) । अनुमान के बिना ~ 10 एजेंटों से परे नहीं पैमाने।

QMIX (2018) मूल्य विघटन

केवल सहकारी। वैश्विक पुरस्कार प्रति एजेंट क्यू-मूल्यों के एक एकांत समारोह का योग हैः

Q_tot(tau, a) = f(Q_1(tau_1, a_1), ..., Q_n(tau_n, a_n)),   df/dQ_i >= 0

एकांतता गारंटी argmax_a Q_totप्रत्येक एजेंट द्वारा चुना जा सकता हैargmax_{a_i} Q_iस्वतंत्र रूप से।exactly the decentralized execution propertyप्रशिक्षण के समय, एक मिश्रण नेटवर्क उत्पादन करता हैQ_totप्रति एजेंट Qs से।

क्यूएमआईएक्स एसएमएसी पर क्यों जीतता हैः सहकारी स्टारक्राफ्ट माइक्रो-प्रबंधन में समान एजेंट, स्थानीय ओब्स, वैश्विक इनाम हैं मूल्य विघटन के लिए एकदम सही फिट।

विफलता मोडः एकतरफाता प्रतिबंध प्रतिबंधात्मक है; कुछ कार्यों में इनाम संरचनाएं होती हैं जो एकतरफा नहीं होती हैं (एक एजेंट टीम के लिए बलिदान करता है) । विस्तार (QTRAN, QPLEX) इसे आराम करते हैं।

MAPPO (2022) अनदेखा किया गया चूक

मल्टी-एजेंट पीपीओः एक केंद्रीकृत मूल्य समारोह के साथ पीपीओ। प्रत्येक एजेंट की अपनी नीति है; सभी एजेंटों को मूल्य फ़ंक्शन साझा (या प्रति एजेंट) होती है जो पूर्ण स्थिति को देखते हैं। यू और अन्य ने 2022 में मैडडपीजी, क्यूएमआईएक्स और उनके विस्तारों के खिलाफ मैपपो का बेंचमार्क किया और पांच बेंचमार्क पर पायाः

  • MAPPO पार्टिकल वर्ल्ड, SMAC, Google रिसर्च फुटबॉल, हनाबी, MPE पर गैर-नीतिगत MARL तरीकों से मेल खाता है या इससे बेहतर है।
  • न्यूनतम हाइपरपरपरमीटर ट्यूनिंग की आवश्यकता है।
  • स्थिर प्रशिक्षण; बीजों में पुनः उत्पन्न हो सकता है।

इस पेपर तक समुदाय ने नीतिगत मार्ल को कम महत्व दिया। 2026 में, मैपपो सहकारी मार्ल के लिए डिफ़ॉल्ट आधार रेखा है; किसी भी नई विधि को इसे हरा देना चाहिए।

एमएलए एजेंट इंजीनियरों को क्यों परवाह करनी चाहिए

तीन प्रत्यक्ष उपयोगः

  1. Router training.एक मेटा एजेंट चुनता है कि कौन सा उप एजेंट एक कार्य को संभालता है। यह N विकेन्द्रीकृत उप एजेंटों और एक केंद्रीकृत राउटर के साथ एक MARL समस्या है। MAPPO फिट बैठता है।
  2. Role emergence.जनरेटिव-एजेंट सिमुलेशन में, समय के साथ पूरक भूमिकाओं को अपनाने के लिए प्रशिक्षित एजेंट एक लुप्तप्राय MARL समस्या है। QMIX शैली मूल्य विघटन निर्माण द्वारा पूरकता को मजबूर करता है।
  3. Multi-agent tool use.जब एजेंट उपकरण साझा करते हैं और बजट के लिए प्रतिस्पर्धा करते हैं, तो CTDE के माध्यम से उन्हें प्रशिक्षण देने से संसाधनों की सीमाओं का सम्मान करने वाली स्थानीय नीतियां उत्पन्न होती हैं।

व्यावहारिक चेतावनीः 2026 में, अधिकांश उत्पादन एलएलएम एजेंट सिस्टम उन्हें प्रशिक्षित करने के बजाय अपनी नीतियों को प्रेरित करते हैं। MARL तब आता है जब आपके पास (ए) बहुत सारे बातचीत डेटा, (बी) एक स्पष्ट इनाम संकेत, और (सी) प्रशिक्षण बुनियादी ढांचे में निवेश करने की इच्छा होती है।

आरएल से परे डिजाइन पैटर्न के रूप में सीटीडीई

प्रशिक्षण के बिना भी, CTDE एक उपयोगी वास्तुकला पैटर्न हैः

  • डिजाइन के दौरान पूरी टीम की दृश्यता को स्वीकार करें।
  • runtime पर, विकेंद्रीकृत निष्पादन लागू करेंः प्रत्येक एजेंट केवल o_i. .

यह पैटर्न आपको प्रति एजेंट स्थिति को स्पष्ट रखने और आंशिक अवलोकनशीलता के बारे में सोचने के लिए मजबूर करता है। कई उत्पादन मल्टी-एजेंट सिस्टम चुपचाप हर जगह साझा स्थिति का अनुमान लगाते हैं।

नॉन-स्टेशनरीटी समस्या

जब कई एजेंट एक साथ सीखते हैं, तो प्रत्येक एजेंट का वातावरण (जो दूसरों की नीतियों को शामिल करता है) गैर-स्थिर होता है। शास्त्रीय एकल एजेंट आरएल सबूत टूट जाते हैं। इस पाठ में एमएआरएल एल्गोरिदम सभी इस पर ध्यान देते हैंः

  • MADDPG: वैश्विक आलोचक सभी कार्यों को देखता है, इसलिए इसका मूल्य अनुमान स्थिर है।
  • QMIX: मूल्य विघटन सीखने को संयुक्त-Q स्थान पर ले जाता है जहां अनुकूलता अच्छी तरह से परिभाषित है।
  • मानचित्रः केंद्रीकृत मूल्य कार्य दूसरों की नीतिगत परिवर्तनों से भिन्नता को कम करता है।

एलएलएम एजेंट सिस्टम में, गैर-स्थिरता इस प्रकार प्रकट होती है "मेरे एजेंट ने पिछले महीने काम किया, अब जब अन्य एजेंट अपस्ट्रीम बदल गया, तो मेरा गलत व्यवहार होता है।" सीटीडीई के साथ प्रशिक्षण मार्ल सिद्धांत रूप में तय है; शीघ्र-स्तर के सुधार तेज हैं लेकिन कम टिकाऊ हैं।

इस पाठ में क्या नहीं बताया गया है

वास्तविक नेटवर्क का प्रशिक्षण चरण 09 विषय है। यह पाठ स्क्रिप्ट-नीति संस्करणों का निर्माण करता है जो ग्रेडिएंट अपडेट के बिना CTDE, मूल्य-विघटन और केंद्रीकृत-मूल्य पैटर्न का प्रदर्शन करते हैं। लक्ष्य एक पूर्ण MARL पुस्तकालय (PyMARL, MARLlib, RLlib मल्टी-एजेंट) लेने से पहले पैटर्न को आंतरिक बनाना है।

इसे बनाओ

code/main.pyतीन पैटर्न प्रदर्शन करता है, सभी एक छोटे से 2-एजेंट सहकारी ग्रिड-दुनिया परः

  • पर्यावरणः 4x4 ग्रिड पर 2 एजेंट, एक इनाम गोली. इनाम = 1 यदि कोई एजेंट गोली तक पहुंचता है; कार्य समाप्त होता है।
  • IndependentAgents प्रत्येक एजेंट दूसरों को पर्यावरण के रूप में व्यवहार करता है।
  • MADDPGStyle केंद्रीकृत आलोचक एक संयुक्त मूल्य की गणना करता है; अभिनेता की नीतियों को इससे अपडेट किया जाता है।
  • QMIXStyle एक एकांत मिक्सर के साथ मूल्य विघटन।
  • MAPPOStyle केंद्रीकृत मूल्य फ़ंक्शन; साझा बेसलाइन के मुकाबले नीति अद्यतन।

सभी चार एपिसोड एक ही भाग में चलते हैं और औसत चरण-लक्ष्य रिपोर्ट करते हैं। सीटीडीई संस्करण स्वतंत्र बेसलाइन की तुलना में कम पथों के लिए अभिसरण करते हैं।

दौड़ें:

python3 code/main.py

अपेक्षित आउटपुटः स्वतंत्र एजेंटों को औसतन ~ 6 कदम लगते हैं; CTDE वेरिएंट ~ 3.5 कदम की ओर अभिसरण करते हैं (4x4 ग्रिड के लिए इष्टतम 3 है) । स्क्रिप्ट की नीतियों के बावजूद पैटर्न अंतर दिखाई देता है।

इसका प्रयोग करें

outputs/skill-marl-picker.mdएक कौशल है जो एक दिए गए मल्टी-एजेंट कार्य के लिए एक MARL एल्गोरिथ्म चुनता हैः सहकारी बनाम प्रतिस्पर्धी, समान बनाम विषम, कार्रवाई-स्थान प्रकार, पैमाने, इनाम संकेत।

इसे भेजें

उत्पादन में मार्ल दुर्लभ है। जब आप इसका उपयोग करते हैंः

  • Start with MAPPO.2022 के पेपर ने इसे आधार रेखा के रूप में स्थापित किया; इसे पुनः पेश करने से पहले अधिक परिष्कृत तरीकों का पीछा करने के हफ्तों की बचत होती है।
  • Log every agent's observation and action stream.प्रति एजेंट के निशान के बिना मार्ल डिबग करना निराशाजनक है।
  • Separate training code from execution code.CTDE एक अनुशासन है; निष्पादन पथ वास्तव में केवल देखने दो o_i. .
  • Reward shaping warning.मार्ल इनाम डिजाइन के लिए अति संवेदनशील है. एक समन्वय बग में आकार और एजेंटों को इसका शोषण करने के लिए सीखते हैं. प्रतिकूल परीक्षण चलाएं.
  • For LLM agentsकेवल तभी MARL प्रशिक्षण में निवेश करें जब इंटरैक्शन डेटा + इनाम सिग्नल + बुनियादी ढांचा सभी मौजूद हों।

व्यायाम

  1. दौड़ेंcode/main.py. स्वतंत्र और MAPPO शैली के एजेंटों के बीच चरण-दर-लक्ष्य अंतर को मापें. क्या 6x6 ग्रिड पर अंतर बढ़ता है या छोटा होता है?
  2. एक प्रतिस्पर्धी संस्करण लागू करेंः दो एजेंट, एक गोली, केवल पहला जो पहुंचता है उसे इनाम मिलता है। कौन सा पैटर्न प्रतिस्पर्धा को साफ तरीके से संभालता है? MADDPG ऐतिहासिक रूप से।
  3. MADDPG (arXiv:1706.02275) धारा 3 पढ़ें। अपने शब्दों में छद्म कोड में सटीक क्रिटिकल अपडेट नियम को प्रतीकात्मक रूप से लागू करें।
  4. MAPPO (arXiv:2103.01955) पढ़ें। लेखक अपने बेंचमार्क पर केंद्रीकृत मूल्य + पीपीओ को नीतिगत MARL से क्यों हराते हैं? तीन सबसे मजबूत दावों की सूची दें।
  5. एक परिकल्पनात्मक LLM-एजेंट प्रणाली (जैसे, अनुसंधान एजेंट + सारांशकर्ता + कोडर) के लिए CTDE को डिजाइन पैटर्न के रूप में लागू करें। डिजाइन के समय उपलब्ध संयुक्त जानकारी क्या है जो रनटाइम में उपलब्ध नहीं है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
MARL"Multi-Agent RL"Reinforcement learning for multi-agent systems.
CTDE"Centralized Training, Decentralized Execution"Train with global info; deploy with local policies.
MADDPG"Multi-Agent DDPG"CTDE with per-agent critic seeing all observations + actions.
QMIX"Value decomposition"Monotonic mixing of per-agent Qs. Cooperative.
MAPPO"Multi-Agent PPO"PPO with centralized value function. 2026 default baseline.
Value decomposition"Sum of individual Qs"Joint Q represented as a monotone function of per-agent Qs.
Non-stationarity"Moving targets"Each agent's env changes as others learn. The core MARL problem.
On-policy / off-policy"Learn from current / replay"PPO is on-policy (MAPPO); DDPG and Q-learning are off-policy.
SMAC"StarCraft Multi-Agent Challenge"Cooperative micromanagement benchmark; QMIX's homegrown ground.

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.