Phase 16: Multi-Agent & Swarms

मतदान, आत्म-समन्वय और बहस स्थलाकृति

सबसे सस्ता संश्लेषणः नमूना N स्वतंत्र एजेंट, बहुमत-मत। वांग एट अल. 2022 आत्म-समंजस्य ने एक मॉडल के साथ ऐसा किया नमूना N बार। मल्टी-एजेंट इसे बढ़ाता है heterogeneousमोनोकल्चर से बचने के लिए विभिन्न मॉडल, विभिन्न संकेत, विभिन्न तापमान, विभिन्न संदर्भ। बहुमत के मतदान के अलावा, चर्चा टॉपॉलजी के मुद्देः MultiAgentBench (arXiv:2503.01935, ACL 2025) ने स्टार / चेन / पेड़ / ग्राफ समन्वय का मूल्यांकन किया और पाया।graph best for researchएजेंटवर्स (ICLR 2024) दो उभरते पैटर्नों को दस्तावेज करता है स्वयंसेवक व्यवहार और अनुपालन व्यवहार और अनुपालन एक विशेषता (समझौता ढूंढना) और एक जोखिम दोनों है (समूहिक सोच, पाठ 24) । यह पाठ टोपोलॉजी अंतरिक्ष का नक्शा बनाता है, प्रत्येक संस्करण का निर्माण करता है, और समन्वय कर को मापता है।

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 16 · 07 (Society of Mind and Debate), Phase 16 · 14 (Consensus and BFT)

Time: ~75 minutes

समस्या

बहस सटीकता में सुधार कर सकती है (Du et al., arXiv:2305.14325) । यह इसे भी कम कर सकती है। बहस की मदद करने पर चार संरचनात्मक विकल्प निर्भर करते हैंः

  1. कौन किससे बात करता है (टॉपॉलजी) ।
  2. कितने राउंड (Du 2023: राउंड और एजेंट दोनों स्वतंत्र रूप से मायने रखते हैं) ।
  3. क्या एजेंट विषम हैं (विभिन्न आधार मॉडल मोनोकल्चर को तोड़ते हैं) ।
  4. क्या कोई विरोधी आवाज मौजूद है (स्टील-मैनिंग बनाम स्ट्रॉ-मैनिंग) ।

एक कार्य पर "पांच एजेंट चलाएं और वोट दें" टीम अक्सर एक एजेंट के खिलाफ पीछे हट जाती है। विफलताएं यादृच्छिक नहीं होती हैं। वे टोपोलॉजी और विषमता का ट्रैक करते हैं। यह सबक टोपोलॉजी नक्शा है।

अवधारणा

आत्म-समरूपता, एकल मॉडल आधार

वांग एट अल. 2022 ("स्वतः संगतता विचार तर्क की श्रृंखला में सुधार करती है") ने तापमान > 0 पर एक ही मॉडल N बार का नमूना लिया और तर्क-पथ उत्तरों पर बहुमत-वोट दिया। जीएसएम 8 के परिणामः एक एकल लालची डिकोड पर N = 40 नमूनों के साथ महत्वपूर्ण लाभ। स्व-संगति बहु-एजेंट मतदान का एकल-एजेंट अग्रदूत है।

सीमाः आत्म-समरूपता एक आधार मॉडल का उपयोग करती है। त्रुटियां निर्माण द्वारा सहसंबंधित होती हैं। यदि मॉडल में एक व्यवस्थित पूर्वाग्रह है, तो सभी N नमूने इसे साझा करते हैं।

बहु-एजेंट वोट, विषम विस्तार

N नमूनों को N विभिन्न एजेंटों से बदलें। विभिन्न आधार मॉडल (क्लाउड, GPT, Llama), विभिन्न संकेत, विभिन्न उपकरण पहुंच। लाभः असंगत त्रुटियां। लागतः विभिन्न एजेंटों की लागत अलग-अलग राशि है; उन्हें समन्वयित करने से ओवरहेड होता है।

विषम बहस के लिए 2026 का वैदिक नाम है A-HMAD विरोधी विभेदक बहु-एजेंट बहस। सार्वभौमिक रूप से अपनाया नहीं गया है, लेकिन पत्र "विभिन्न मॉडल बहस के लिए शब्द का उपयोग करते हैं, जो एकाधिकार के पतन से संबंधित त्रुटियों को कम करता है।"

चार टोपोलॉजीज

star                chain               tree                graph

    ┌─A─┐           A─B─C─D         ┌──A──┐              A───B
    │   │                           │     │              │ × │
    B   C                           B     C              D───C
    │   │                          / \   / \
    D   E                         D   E F   G           (fully connected)

एक हब, बाकी सभी केवल हब से बात करते हैं। बिना बैक-चैनल के पर्यवेक्षक-कार्यकर्ता के बराबर।

श्रृंखलाः रैखिक, प्रत्येक एजेंट पिछले एक के आउटपुट को देखता है. पाइपलाइन की तरह.

पेड़ः पदानुक्रमिक, पदानुक्रमिक एजेंट प्रणालियों द्वारा उपयोग किया जाता है (पाठ 06) ।

ग्राफः किसी भी किसी भी. पूर्ण कनेक्टेड क्लिक और मनमानी DAGs शामिल है.

समन्वय कर (मल्टिएजेंटबेंच)

मल्टीएजेंटबेंच (मार्बल, एसीएल 2025, arXiv:2503.01935) ने अनुसंधान, कोडिंग और योजना सहित एक कार्य सूट पर सितारा, श्रृंखला, पेड़, ग्राफ को बेंचमार्क किया। प्रमुख मापा परिणामः

  • Graphउपरोक्त सभी विषयों में, एक व्यक्ति एक दूसरे की आलोचना कर सकता है।
  • Starतेजी से प्रतिक्रिया तथ्यात्मक कार्यों पर जीत. हब फ़िल्टर और समेकित.
  • Chainचरणबद्ध पाइपलाइनों पर जीत (चरणबद्ध परिष्करण) ।
  • Coordination taxवॉल क्लॉक और टोकन लागत गुणवत्ता से तेजी से बढ़ रही है।

4-एजेंट की छत अनुभवजन्य है, मौलिक नहीं है। यह 2026 LLM संदर्भ क्षमता को दर्शाता हैः प्रत्येक एजेंट का संदर्भ समकक्ष के आउटपुट से भर जाता है, और सभी को देखने के बाद जोड़ने वाले एजेंट N + 1 का मार्जिनल मूल्य गिर जाता है।

बहु-एजेंट बहस रणनीतियाँ ("क्या हमें पागल होना चाहिए? ")

arXiv:2311.17371 MAD रणनीतियों का 2023 सर्वेक्षण है। अन्य द्वारा दोहराए गए प्रमुख निष्कर्षः MAD वेरिएंट जो संरचनात्मक रूप से आत्म-समरूपता (स्वतंत्र नमूना + संश्लेषण) के साथ होते हैं, अक्सर एक ही बजट का उपयोग करते समय आत्म-समरूपता से कम प्रदर्शन करते हैं। MAD सबसे अधिक तब मदद करता है जब एजेंट वास्तव में विषम हैं और बहस में विरोधाभासी संरचना होती है (एक एजेंट इसके खिलाफ तर्क देता है) ।

एजेंटवर्स उभरते पैटर्न

एजेंटवर्स (ICLR 2024, https://proceedings.iclr.cc/paper_files/paper/2024/file/578e65cdee35d00c708d4c64bce32971-Paper-Conference.pdf) दो व्यवहारों को दस्तावेज करता है जो स्पष्ट रूप से डिजाइन किए बिना भी बहु-एजेंट बहस से उभरते हैंः

  • Volunteer.एक एजेंट सहायता प्रदान करता है ("मैं अगले कदम को ले सकता हूं") अप्रत्याशित रूप से। उपयोगीः यह एक उप-कार्य के लिए सबसे सक्षम एजेंट को काम आवंटित करता है।
  • Conformity.एक एजेंट एक आलोचक के अनुरूप होने के लिए अपने रुख को समायोजित करता है, भले ही आलोचक गलत हो। यह बहस-समतुल्य है (पाठ 14)

अनुपालन ही कारण है कि बहस-अवधि-समझौता-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मु-सी-सी-मु-सी-सी-मु-सी-सी-मु-सी-मु-सी-मु-सी-मु-मु-सी-मु-मु-सी-मु-मु-सी-मु-मु-मु-सी-मु-मु-मु-मु-मु-सी-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-

विभेदीताः वास्तविक बटन जो सटीकता को स्थानांतरित करता है

व्यावहारिक साहित्य में 2024-2026 पैटर्नः अपने N एजेंटों में से एक को एक अलग आधार मॉडल के लिए आदान-प्रदान करना N को 1 से बढ़ाने की तुलना में अधिक सटीकता बूम देता है। अंतर्ज्ञान है कि मोनोकल्चर प्रत्येक नए स्वतंत्र-त्रुटि स्रोत का मूल्य अतिरिक्त संबद्ध नमूने से अधिक है।

सीमा में, विषमता संख्या से अधिक होती है। तीन अलग-अलग मॉडल एक मॉडल की पांच प्रतियों को अधिकतर कार्यों पर हरा देते हैं जिनमें शुद्ध जमीन सत्य होती है।

जूरी की विधि

सिबिल ढांचे (मिन्स्की-एलएलएम साहित्य में उद्धृत) एक "ज्यूरी" को औपचारिक बनाता है विशेषज्ञ एजेंटों का एक छोटा सेट जो प्रत्येक चरण में मतदान करके उत्तरों को परिष्कृत करते हैं। साधारण बहुमत वोट के विपरीत, एक जूरी की भूमिकाएं हैंः एक एजेंट क्रॉस-परीक्षा करता है, एक संदर्भ प्रदान करता है, एक विश्वसनीयता का स्कोर करता है। जूरी विधियां साधारण वोट (सस्ते, एकाधिकार-संवेदनशील) और पूर्ण एमएडी (महंगी, अनुरूपता-संवेदनशील) के बीच एक मध्य बिंदु हैं।

जब बहस के साथ मतदान हावी होता है

  • प्रश्न में मूल सत्य (वास्तव, गणित, कोड व्यवहार) है। मत अभिसरण सार्थक है।
  • एजेंट विभिन्न स्रोतों या उपकरणों तक पहुँच सकते हैं (विभिन्नता उपलब्ध है) ।
  • गोलियां सीमांत हैं (2-3 विशिष्ट) और एक अलग न्यायाधीश या सत्यापितकर्ता है।
  • बजट 3-5 एजेंटों की अनुमति देता है। 5-7 के अलावा ग्राफ टॉपॉलजी पर समन्वय कर हावी है।

जब बहस के साथ मतदान दर्द होता है

  • यह प्रश्न राय के रूप में है. एजेंटों को जो भी उत्तर सबसे अधिक आश्वस्त लगता है, सबसे सही नहीं है के लिए अभिसरण.
  • सभी एजेंटों के पास एक आधार मॉडल है।
  • राउंड असीमित हैं, अनुरूपता हर बार जीतती है।
  • यह काम सरल है, N=5 पर आत्म-समर्पण वाला एक ही एजेंट सस्ता और सटीक है।

इसे बनाओ

code/main.pyकार्य करता हैः

  • run_star(agents, hub, question) केंद्र सर्वेक्षण प्रत्येक कार्यकर्ता, संचयी।
  • run_chain(agents, question) क्रमशः परिष्करण।
  • run_tree(root, children, question) गहराई-2 संश्लेषण के साथ पदानुक्रमिक।
  • run_graph(agents, question, rounds) सभी के लिए बहस, सीमित राउंड।
  • एक स्क्रिप्ट heterogeneity डायलः प्रत्येक एजेंट एक है error_biasइसकी व्यवस्थित गलतियों का संकेत दे रहा है।
  • एक माप हर्नस जो प्रत्येक टोपोलॉजी को N=3, 5, 7 पर चलाता है और रिपोर्ट करता है (सटीकता, total_tokens, wallclock_simulated) ।

दौड़ें:

python3 code/main.py

अपेक्षित आउटपुटः टॉपलॉजी × N → (सटीकता, टोकन, विलंबता) की एक तालिका। ग्राफ अनुसंधान शैली के कार्यों पर N=3-5 पर जीतता है; स्टार तेजी से वास्तविक कार्यों पर जीतता है; N=7 पर ग्राफ समन्वय कर दिखाता है (विलंबता सटीकता से तेजी से बढ़ जाती है) ।

इसका प्रयोग करें

outputs/skill-topology-picker.mdएक कौशल है जो एक कार्य विवरण पढ़ता है और एक टोपोलॉजी (तारा / श्रृंखला / पेड़ / ग्राफ), एक N (एजेंट की संख्या), एक विषमता प्रोफ़ाइल (उपयोग करने के लिए आधार मॉडल) और एक गोल सीमा की सिफारिश करता है।

इसे भेजें

किसी भी समूह के लिएः

  • से शुरू करेंself-consistency at N=5एक मजबूत आधार मॉडल का उपयोग कर. यह सस्ता आधार रेखा है.
  • में उन्नयनheterogeneous voting at N=3यदि सटीकता मायने रखती है तो डेल्टा को मापें।
  • केवल debate topologyयदि कार्य संरचना (अनुसंधान, बहु-चरण) है और सीमांत दौर संभव हैं।
  • हमेशा अल्पसंख्यक समूह को लॉग करें जब अल्पसंख्यक लगातार सही है, तो आपके पास विविधता संकेत है।
  • "10 गुना की लागत पर बेहतर सटीकता" एक व्यावसायिक निर्णय है।

व्यायाम

  1. दौड़ेंcode/main.py. ग्राफ टॉपलॉजी के लिए समन्वय-कर वक्र का ग्राफः सटीकता बनाम N, टोकन बनाम N. वक्र किस N पर झुकाता है?
  2. A-HMAD को लागू करेंः जानबूझकर अलग-अलग पूर्वाग्रह वाले तीन एजेंट। पाठ 14 के मोनोकल्चर हमले पर A-HMAD की तुलना में सभी समान पूर्वाग्रह मूल रेखा कैसे होती है?
  3. ग्राफ टॉपलॉजी में एक "जज" भूमिका जोड़ें जो वोट नहीं देता है, केवल अंतिम सहमति को स्कोर करता है। क्या यह उभरते अनुरूप व्यवहार को बदलता है?
  4. एजेंटवर्स पेपर (ICLR 2024) पढ़ें। पहचानें कि आपके कार्यान्वयन में कौन सा उभरता हुआ व्यवहार सबसे अधिक प्रदर्शित होता है। क्या आप त्वरित परिवर्तन से विपरीत व्यवहार को उकसाने में सक्षम हैं?
  5. मल्टीएजेंटबेंच (arXiv:2503.01935) धारा 4 (टॉपॉलॉजी प्रयोग) पढ़ें। अपने हर्नस का उपयोग करके एक कार्य पर "ग्राफ-विन-रिच" परिणाम को पुनः प्रस्तुत करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Self-consistency"Sample N times, vote"Wang 2022. Single model, N temperature>0 samples, majority vote on reasoning paths.
Heterogeneity"Different models"Ensemble of different base models or prompt families. Breaks monoculture.
MAD"Multi-agent debate"Generic term for agents exchanging critiques over rounds. See Du 2023.
A-HMAD"Adversarial Heterogeneous MAD"MAD variant emphasizing different models + adversarial structure.
Topology"Who talks to whom"Star, chain, tree, graph. Determines information flow.
Coordination tax"Diminishing returns"Above ~4 agents on graph, cost grows faster than quality.
Volunteer behavior"Unprompted help"AgentVerse emergent pattern: an agent offers to take a step.
Conformity behavior"Agreement under pressure"AgentVerse emergent pattern: an agent aligns with a critic.
Jury"Small specialized panel"Sibyl-style ensemble with roles (examiner, context, scorer).

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.