बहु-एजेंट बहस और सहयोग
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 14 · 12 (Workflow Patterns), Phase 14 · 05 (Self-Refine and CRITIC)
Time: ~60 minutes
सीखने के लक्ष्य
- बहस प्रोटोकॉल की व्याख्या करेंः N प्रस्ताव, R राउंड, एक साझा उत्तर पर अभिसरण करते हैं।
- तर्क-वितर्क से तथ्य, नियम और तर्क-वितर्क में सुधार क्यों होता है?
- दुर्लभ टोपोलॉजी की व्याख्या करेंः हर बहस करने वाले को एक दूसरे को देखने की आवश्यकता नहीं है।
- पूर्ण-जाल और दुर्लभ संस्करणों के साथ स्क्रिप्टेड एलएलएम पर एक स्टडीलिब बहस लागू करें; टोकन लागत बनाम सटीकता को मापें।
समस्या
आत्म-संशोधन (पाठ 05) एक मॉडल है जो खुद की आलोचना करता है समूह सोच जोखिम। क्रिटिक्स (पाठ 05) बाहरी उपकरणों में आलोचना का आधार है हमेशा उपलब्ध नहीं है। बहस एक तीसरा मोड पेश करती हैः कई उदाहरण, क्रॉस-क्रिटिक्स, असहमति द्वारा अभिसरण।
अवधारणा
सोसाइटी ऑफ माइंड्स (Du et al., ICML 2024)
- N मॉडल उदाहरण स्वतंत्र रूप से एक ही प्रश्न के उत्तर प्रस्तावित करते हैं।
- आर राउंड के दौरान, प्रत्येक मॉडल अन्य के प्रस्तावों को पढ़ता है और उनकी आलोचना करता है।
- मॉडल आलोचनाओं के आधार पर अपने उत्तरों को अपडेट करते हैं।
- आर राउंड के बाद, अभिसरण उत्तर लौटाएं।
मूल प्रयोगों में लागत के कारण N=3, R=2 का उपयोग किया गया था। अधिक एजेंटों और कठिन समस्याओं (MMLU, GSM8K, शतरंज मूव वैधता, जीवनी पीढ़ी) पर अधिक राउंड के साथ सटीकता में सुधार होता है।
क्रॉस-मॉडल संयोजन एकल-मॉडल बहसों को हराता हैः चैटजीपीटी + बारड एक साथ > या अकेले।
स्पायर टॉपॉलजी
"स्पायर कम्युनिकेशन टॉपलॉजी के साथ मल्टी-एजेंट बहस में सुधार" (arXiv:2406.11776, 2024-2025) ने दिखाया कि पूर्ण-मेश बहस हमेशा इष्टतम नहीं होती है। स्पायर टॉपलॉजी (सितारा, अंगूठी, हब-एंड-स्पोक) कम टोकन लागत पर सटीकता से मेल खा सकती है। प्रत्येक बहसकर्ता केवल समकक्षों के एक उपसमूह को देखता है।
प्रभाव:
- पूर्ण जाल N=5, R=3 = 5 × 3 = 15 प्रस्ताव, प्रत्येक पढ़ने 4 समकक्ष = 60 आलोचनात्मक संचालन।
- स्टार N=5, R=3 (एक हब + 4 स्पोक) = 15 प्रस्ताव, स्पोक केवल हब को पढ़ते हैं = 12 आलोचनात्मक ऑपरेशन।
जब बहस मदद करती है
- Factuality.स्वतंत्र प्रस्तावों के साथ, क्रॉस-चेक भ्रम को कम करता है।
- Rule-following.शतरंज चाल वैधता एक मॉडल एक नियम को याद करता है, अन्य इसे पकड़ते हैं।
- Open-ended reasoning.सही उत्तर के लिए कई रूपरेखा संकीर्ण हैं।
जब बहस दर्द करती है
- Latency-sensitive UX.N × R सीरियल राउंड की देरी आप नहीं हो सकता है.
- Cost-sensitive scale.प्रति प्रश्न N × R टोकन।
- Simple factual lookups.एक खोज पांच बहसों से सस्ता है।
2026 व्यावहारिक उदाहरण
- Anthropic orchestrator-workers(पाठ 12) संश्लेषण चरण के साथ बहस का एक संस्करण।
- LangGraph supervisor(पाठ 13) केंद्रीय राउटर + विशेषज्ञ एजेंट एक नोड के रूप में बहस को लागू कर सकते हैं।
- OpenAI Agents SDK(पाठ 16) पुनरावर्ती आलोचना के लिए एजेंट आगे-पीछे हाथ-पाँव करते हैं।
- Multi-agent evals जोड़ी बहस + मूल्यांकन संकेत के लिए मूल्यांकनकर्ता-अनुकूलन।
जहां यह पैटर्न गलत हो जाता है
- Convergence collapse.सभी एजेंटों को पहले गलत उत्तर पर एक साथ मिलते हैं।
- Hub failure.एक स्टार टॉपॉलजी में, एक बुरा केंद्र सभी को भ्रष्ट करता है। घूम या कई केंद्रों का उपयोग करें।
- Prompt homogenization.सभी एजेंट एक ही संकेत का उपयोग करते हैं; वे एक ही उत्तर का उत्पादन करते हैं। विभिन्न संकेत और/या मॉडल का उपयोग करें।
इसे बनाओ
code/main.pyइस विषय पर चर्चा करता हैः
Debaterवर्ग (प्रति बहसकर्ता राय बहाव के साथ लिखित LLM) ।FullMeshDebateऔरSparseDebateधावक।- तीन प्रश्नः एक तथ्यगत, एक नियम आधारित, एक तर्क।
- मीट्रिकः अभिसरण उत्तर, अभिसरण के लिए राउंड, कुल आलोचना संचालन।
इसे चलाओः
python3 code/main.pyआउटपुटः प्रति प्रोटोकॉल सटीकता और लागत; कम लागत पर 2/3 प्रश्नों पर पूर्ण जाल के साथ दुर्लभ मैच।
इसका प्रयोग करें
- Anthropic orchestrator-workers2-3 श्रमिकों के सरल बहस के लिए।
- LangGraphराज्य के लिए बहुराउंड बहस के लिए चेकपोइंटिंग के साथ।
- Customअनुसंधान या विशिष्ट सटीकता गारंटी के लिए।
इसे भेजें
outputs/skill-debate.mdN, R, और एक अभिसरण नियम के साथ एक बहु-एजेंट बहस के साथ एक सेटअप टॉपलॉजी,
व्यायाम
- "जबरदस्ती असहमति" नियम लागू करेंः पहले दौर में, प्रत्येक बहसकर्ता को एक अलग प्रस्ताव प्रस्तुत करना होगा।
- विश्वास-वजनित संश्लेषण जोड़ेंः बहस करने वाले लौटते हैं (जवाब, विश्वास); संश्लेषक विश्वास द्वारा वजन करता है। क्या यह मदद करता है?
- क्या विषमता सटीकता में सुधार करती है?
- अपने 3 सवालों पर पूर्ण जाल बनाम दुर्लभ के लिए टोकन लागत मापें। प्लॉट लागत बनाम सटीकता।
- सोसाइटी ऑफ माइंड्स के पेपर को पढ़ें. अपने खिलौने को N=5, R=3 पर ले जाएं। क्या ब्रेक होता है? क्या बेहतर होता है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Debate | "Multi-agent critique" | N proposers, R rounds of cross-critique, converge |
| Full mesh | "Everyone reads everyone" | Every debater reads every peer each round |
| Sparse topology | "Limited peer view" | Debaters read only a subset of peers |
| Hub-and-spoke | "Star topology" | One central debater, N-1 spokes read only the hub |
| Convergence | "Agreement" | Debaters converge on a shared answer |
| Society of Minds | "Du et al. debate paper" | ICML 2024 multi-agent debate method |
आगे पढ़ना
- Du et al., Society of Minds (arXiv:2305.14325) बहु-एजेंट बहस
- Sparse Communication Topology (arXiv:2406.11776) दुर्लभ टॉपॉलजी परिणाम
- Anthropic, Building Effective Agents बहस के रूप में संगीतकार-कर्मियों
- Madaan et al., Self-Refine (arXiv:2303.17651) एकल मॉडल स्व-आलोचना प्रतिद्वंद्वी
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.