मतदान, आत्म-समन्वय और बहस स्थलाकृति
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 07 (Society of Mind and Debate), Phase 16 · 14 (Consensus and BFT)
Time: ~75 minutes
समस्या
बहस सटीकता में सुधार कर सकती है (Du et al., arXiv:2305.14325) । यह इसे भी कम कर सकती है। बहस की मदद करने पर चार संरचनात्मक विकल्प निर्भर करते हैंः
- कौन किससे बात करता है (टॉपॉलजी) ।
- कितने राउंड (Du 2023: राउंड और एजेंट दोनों स्वतंत्र रूप से मायने रखते हैं) ।
- क्या एजेंट विषम हैं (विभिन्न आधार मॉडल मोनोकल्चर को तोड़ते हैं) ।
- क्या कोई विरोधी आवाज मौजूद है (स्टील-मैनिंग बनाम स्ट्रॉ-मैनिंग) ।
एक कार्य पर "पांच एजेंट चलाएं और वोट दें" टीम अक्सर एक एजेंट के खिलाफ पीछे हट जाती है। विफलताएं यादृच्छिक नहीं होती हैं। वे टोपोलॉजी और विषमता का ट्रैक करते हैं। यह सबक टोपोलॉजी नक्शा है।
अवधारणा
आत्म-समरूपता, एकल मॉडल आधार
वांग एट अल. 2022 ("स्वतः संगतता विचार तर्क की श्रृंखला में सुधार करती है") ने तापमान > 0 पर एक ही मॉडल N बार का नमूना लिया और तर्क-पथ उत्तरों पर बहुमत-वोट दिया। जीएसएम 8 के परिणामः एक एकल लालची डिकोड पर N = 40 नमूनों के साथ महत्वपूर्ण लाभ। स्व-संगति बहु-एजेंट मतदान का एकल-एजेंट अग्रदूत है।
सीमाः आत्म-समरूपता एक आधार मॉडल का उपयोग करती है। त्रुटियां निर्माण द्वारा सहसंबंधित होती हैं। यदि मॉडल में एक व्यवस्थित पूर्वाग्रह है, तो सभी N नमूने इसे साझा करते हैं।
बहु-एजेंट वोट, विषम विस्तार
N नमूनों को N विभिन्न एजेंटों से बदलें। विभिन्न आधार मॉडल (क्लाउड, GPT, Llama), विभिन्न संकेत, विभिन्न उपकरण पहुंच। लाभः असंगत त्रुटियां। लागतः विभिन्न एजेंटों की लागत अलग-अलग राशि है; उन्हें समन्वयित करने से ओवरहेड होता है।
विषम बहस के लिए 2026 का वैदिक नाम है A-HMAD विरोधी विभेदक बहु-एजेंट बहस। सार्वभौमिक रूप से अपनाया नहीं गया है, लेकिन पत्र "विभिन्न मॉडल बहस के लिए शब्द का उपयोग करते हैं, जो एकाधिकार के पतन से संबंधित त्रुटियों को कम करता है।"
चार टोपोलॉजीज
star chain tree graph
┌─A─┐ A─B─C─D ┌──A──┐ A───B
│ │ │ │ │ × │
B C B C D───C
│ │ / \ / \
D E D E F G (fully connected)एक हब, बाकी सभी केवल हब से बात करते हैं। बिना बैक-चैनल के पर्यवेक्षक-कार्यकर्ता के बराबर।
श्रृंखलाः रैखिक, प्रत्येक एजेंट पिछले एक के आउटपुट को देखता है. पाइपलाइन की तरह.
पेड़ः पदानुक्रमिक, पदानुक्रमिक एजेंट प्रणालियों द्वारा उपयोग किया जाता है (पाठ 06) ।
ग्राफः किसी भी किसी भी. पूर्ण कनेक्टेड क्लिक और मनमानी DAGs शामिल है.
समन्वय कर (मल्टिएजेंटबेंच)
मल्टीएजेंटबेंच (मार्बल, एसीएल 2025, arXiv:2503.01935) ने अनुसंधान, कोडिंग और योजना सहित एक कार्य सूट पर सितारा, श्रृंखला, पेड़, ग्राफ को बेंचमार्क किया। प्रमुख मापा परिणामः
- Graphउपरोक्त सभी विषयों में, एक व्यक्ति एक दूसरे की आलोचना कर सकता है।
- Starतेजी से प्रतिक्रिया तथ्यात्मक कार्यों पर जीत. हब फ़िल्टर और समेकित.
- Chainचरणबद्ध पाइपलाइनों पर जीत (चरणबद्ध परिष्करण) ।
- Coordination taxवॉल क्लॉक और टोकन लागत गुणवत्ता से तेजी से बढ़ रही है।
4-एजेंट की छत अनुभवजन्य है, मौलिक नहीं है। यह 2026 LLM संदर्भ क्षमता को दर्शाता हैः प्रत्येक एजेंट का संदर्भ समकक्ष के आउटपुट से भर जाता है, और सभी को देखने के बाद जोड़ने वाले एजेंट N + 1 का मार्जिनल मूल्य गिर जाता है।
बहु-एजेंट बहस रणनीतियाँ ("क्या हमें पागल होना चाहिए? ")
arXiv:2311.17371 MAD रणनीतियों का 2023 सर्वेक्षण है। अन्य द्वारा दोहराए गए प्रमुख निष्कर्षः MAD वेरिएंट जो संरचनात्मक रूप से आत्म-समरूपता (स्वतंत्र नमूना + संश्लेषण) के साथ होते हैं, अक्सर एक ही बजट का उपयोग करते समय आत्म-समरूपता से कम प्रदर्शन करते हैं। MAD सबसे अधिक तब मदद करता है जब एजेंट वास्तव में विषम हैं और बहस में विरोधाभासी संरचना होती है (एक एजेंट इसके खिलाफ तर्क देता है) ।
एजेंटवर्स उभरते पैटर्न
एजेंटवर्स (ICLR 2024, https://proceedings.iclr.cc/paper_files/paper/2024/file/578e65cdee35d00c708d4c64bce32971-Paper-Conference.pdf) दो व्यवहारों को दस्तावेज करता है जो स्पष्ट रूप से डिजाइन किए बिना भी बहु-एजेंट बहस से उभरते हैंः
- Volunteer.एक एजेंट सहायता प्रदान करता है ("मैं अगले कदम को ले सकता हूं") अप्रत्याशित रूप से। उपयोगीः यह एक उप-कार्य के लिए सबसे सक्षम एजेंट को काम आवंटित करता है।
- Conformity.एक एजेंट एक आलोचक के अनुरूप होने के लिए अपने रुख को समायोजित करता है, भले ही आलोचक गलत हो। यह बहस-समतुल्य है (पाठ 14)
अनुपालन ही कारण है कि बहस-अवधि-समझौता-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मुक्ति-मु-सी-सी-मु-सी-सी-मु-सी-सी-मु-सी-मु-सी-मु-सी-मु-मु-सी-मु-मु-सी-मु-मु-सी-मु-मु-मु-सी-मु-मु-मु-मु-मु-सी-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-मु-
विभेदीताः वास्तविक बटन जो सटीकता को स्थानांतरित करता है
व्यावहारिक साहित्य में 2024-2026 पैटर्नः अपने N एजेंटों में से एक को एक अलग आधार मॉडल के लिए आदान-प्रदान करना N को 1 से बढ़ाने की तुलना में अधिक सटीकता बूम देता है। अंतर्ज्ञान है कि मोनोकल्चर प्रत्येक नए स्वतंत्र-त्रुटि स्रोत का मूल्य अतिरिक्त संबद्ध नमूने से अधिक है।
सीमा में, विषमता संख्या से अधिक होती है। तीन अलग-अलग मॉडल एक मॉडल की पांच प्रतियों को अधिकतर कार्यों पर हरा देते हैं जिनमें शुद्ध जमीन सत्य होती है।
जूरी की विधि
सिबिल ढांचे (मिन्स्की-एलएलएम साहित्य में उद्धृत) एक "ज्यूरी" को औपचारिक बनाता है विशेषज्ञ एजेंटों का एक छोटा सेट जो प्रत्येक चरण में मतदान करके उत्तरों को परिष्कृत करते हैं। साधारण बहुमत वोट के विपरीत, एक जूरी की भूमिकाएं हैंः एक एजेंट क्रॉस-परीक्षा करता है, एक संदर्भ प्रदान करता है, एक विश्वसनीयता का स्कोर करता है। जूरी विधियां साधारण वोट (सस्ते, एकाधिकार-संवेदनशील) और पूर्ण एमएडी (महंगी, अनुरूपता-संवेदनशील) के बीच एक मध्य बिंदु हैं।
जब बहस के साथ मतदान हावी होता है
- प्रश्न में मूल सत्य (वास्तव, गणित, कोड व्यवहार) है। मत अभिसरण सार्थक है।
- एजेंट विभिन्न स्रोतों या उपकरणों तक पहुँच सकते हैं (विभिन्नता उपलब्ध है) ।
- गोलियां सीमांत हैं (2-3 विशिष्ट) और एक अलग न्यायाधीश या सत्यापितकर्ता है।
- बजट 3-5 एजेंटों की अनुमति देता है। 5-7 के अलावा ग्राफ टॉपॉलजी पर समन्वय कर हावी है।
जब बहस के साथ मतदान दर्द होता है
- यह प्रश्न राय के रूप में है. एजेंटों को जो भी उत्तर सबसे अधिक आश्वस्त लगता है, सबसे सही नहीं है के लिए अभिसरण.
- सभी एजेंटों के पास एक आधार मॉडल है।
- राउंड असीमित हैं, अनुरूपता हर बार जीतती है।
- यह काम सरल है, N=5 पर आत्म-समर्पण वाला एक ही एजेंट सस्ता और सटीक है।
इसे बनाओ
code/main.pyकार्य करता हैः
run_star(agents, hub, question)केंद्र सर्वेक्षण प्रत्येक कार्यकर्ता, संचयी।run_chain(agents, question)क्रमशः परिष्करण।run_tree(root, children, question)गहराई-2 संश्लेषण के साथ पदानुक्रमिक।run_graph(agents, question, rounds)सभी के लिए बहस, सीमित राउंड।- एक स्क्रिप्ट heterogeneity डायलः प्रत्येक एजेंट एक है
error_biasइसकी व्यवस्थित गलतियों का संकेत दे रहा है। - एक माप हर्नस जो प्रत्येक टोपोलॉजी को N=3, 5, 7 पर चलाता है और रिपोर्ट करता है (सटीकता, total_tokens, wallclock_simulated) ।
दौड़ें:
python3 code/main.pyअपेक्षित आउटपुटः टॉपलॉजी × N → (सटीकता, टोकन, विलंबता) की एक तालिका। ग्राफ अनुसंधान शैली के कार्यों पर N=3-5 पर जीतता है; स्टार तेजी से वास्तविक कार्यों पर जीतता है; N=7 पर ग्राफ समन्वय कर दिखाता है (विलंबता सटीकता से तेजी से बढ़ जाती है) ।
इसका प्रयोग करें
outputs/skill-topology-picker.mdएक कौशल है जो एक कार्य विवरण पढ़ता है और एक टोपोलॉजी (तारा / श्रृंखला / पेड़ / ग्राफ), एक N (एजेंट की संख्या), एक विषमता प्रोफ़ाइल (उपयोग करने के लिए आधार मॉडल) और एक गोल सीमा की सिफारिश करता है।
इसे भेजें
किसी भी समूह के लिएः
- से शुरू करेंself-consistency at N=5एक मजबूत आधार मॉडल का उपयोग कर. यह सस्ता आधार रेखा है.
- में उन्नयनheterogeneous voting at N=3यदि सटीकता मायने रखती है तो डेल्टा को मापें।
- केवल debate topologyयदि कार्य संरचना (अनुसंधान, बहु-चरण) है और सीमांत दौर संभव हैं।
- हमेशा अल्पसंख्यक समूह को लॉग करें जब अल्पसंख्यक लगातार सही है, तो आपके पास विविधता संकेत है।
- "10 गुना की लागत पर बेहतर सटीकता" एक व्यावसायिक निर्णय है।
व्यायाम
- दौड़ें
code/main.py. ग्राफ टॉपलॉजी के लिए समन्वय-कर वक्र का ग्राफः सटीकता बनाम N, टोकन बनाम N. वक्र किस N पर झुकाता है? - A-HMAD को लागू करेंः जानबूझकर अलग-अलग पूर्वाग्रह वाले तीन एजेंट। पाठ 14 के मोनोकल्चर हमले पर A-HMAD की तुलना में सभी समान पूर्वाग्रह मूल रेखा कैसे होती है?
- ग्राफ टॉपलॉजी में एक "जज" भूमिका जोड़ें जो वोट नहीं देता है, केवल अंतिम सहमति को स्कोर करता है। क्या यह उभरते अनुरूप व्यवहार को बदलता है?
- एजेंटवर्स पेपर (ICLR 2024) पढ़ें। पहचानें कि आपके कार्यान्वयन में कौन सा उभरता हुआ व्यवहार सबसे अधिक प्रदर्शित होता है। क्या आप त्वरित परिवर्तन से विपरीत व्यवहार को उकसाने में सक्षम हैं?
- मल्टीएजेंटबेंच (arXiv:2503.01935) धारा 4 (टॉपॉलॉजी प्रयोग) पढ़ें। अपने हर्नस का उपयोग करके एक कार्य पर "ग्राफ-विन-रिच" परिणाम को पुनः प्रस्तुत करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Self-consistency | "Sample N times, vote" | Wang 2022. Single model, N temperature>0 samples, majority vote on reasoning paths. |
| Heterogeneity | "Different models" | Ensemble of different base models or prompt families. Breaks monoculture. |
| MAD | "Multi-agent debate" | Generic term for agents exchanging critiques over rounds. See Du 2023. |
| A-HMAD | "Adversarial Heterogeneous MAD" | MAD variant emphasizing different models + adversarial structure. |
| Topology | "Who talks to whom" | Star, chain, tree, graph. Determines information flow. |
| Coordination tax | "Diminishing returns" | Above ~4 agents on graph, cost grows faster than quality. |
| Volunteer behavior | "Unprompted help" | AgentVerse emergent pattern: an agent offers to take a step. |
| Conformity behavior | "Agreement under pressure" | AgentVerse emergent pattern: an agent aligns with a critic. |
| Jury | "Small specialized panel" | Sibyl-style ensemble with roles (examiner, context, scorer). |
आगे पढ़ना
- Wang et al. — Self-Consistency Improves Chain of Thought Reasoning एकल मॉडल आधार
- Du et al. — Improving Factuality and Reasoning via Multiagent Debate दोनों एजेंट और राउंड स्वतंत्र रूप से मायने रखते हैं
- MultiAgentBench / MARBLE टॉपॉलॉजी बेंचमार्क जो शोध के लिए सबसे अच्छा ग्राफ दिखाता है, पाइपलाइन के लिए श्रृंखला
- Should we be going MAD? एमएडी-स्ट्रैटेजी सर्वेक्षण; पाया कि एमएडी अक्सर समान बजट पर आत्म-समर्पण से हार जाता है
- AgentVerse (ICLR 2024) स्वयंसेवक और अनुपालन के नए पैटर्न
- MARBLE repo संदर्भ बेंचमार्क कार्यान्वयन
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.