Phase 14: Agent Engineering

बहु-एजेंट बहस और सहयोग

Du et al. (ICML 2024, "सामाजिक ऑफ माइंड्स") N मॉडल उदाहरण चलाते हैं जो स्वतंत्र रूप से उत्तर प्रस्तावित करते हैं, फिर आर राउंड पर अभिसरण करने के लिए पुनरावृत्त रूप से एक दूसरे की आलोचना करते हैं। तथ्य, नियम का पालन, तर्क में सुधार करता है। स्पार्स टोपोलॉजी टोकन लागत पर पूर्ण जाल को हराती है।

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 14 · 12 (Workflow Patterns), Phase 14 · 05 (Self-Refine and CRITIC)

Time: ~60 minutes

सीखने के लक्ष्य

  • बहस प्रोटोकॉल की व्याख्या करेंः N प्रस्ताव, R राउंड, एक साझा उत्तर पर अभिसरण करते हैं।
  • तर्क-वितर्क से तथ्य, नियम और तर्क-वितर्क में सुधार क्यों होता है?
  • दुर्लभ टोपोलॉजी की व्याख्या करेंः हर बहस करने वाले को एक दूसरे को देखने की आवश्यकता नहीं है।
  • पूर्ण-जाल और दुर्लभ संस्करणों के साथ स्क्रिप्टेड एलएलएम पर एक स्टडीलिब बहस लागू करें; टोकन लागत बनाम सटीकता को मापें।

समस्या

आत्म-संशोधन (पाठ 05) एक मॉडल है जो खुद की आलोचना करता है समूह सोच जोखिम। क्रिटिक्स (पाठ 05) बाहरी उपकरणों में आलोचना का आधार है हमेशा उपलब्ध नहीं है। बहस एक तीसरा मोड पेश करती हैः कई उदाहरण, क्रॉस-क्रिटिक्स, असहमति द्वारा अभिसरण।

अवधारणा

सोसाइटी ऑफ माइंड्स (Du et al., ICML 2024)

  • N मॉडल उदाहरण स्वतंत्र रूप से एक ही प्रश्न के उत्तर प्रस्तावित करते हैं।
  • आर राउंड के दौरान, प्रत्येक मॉडल अन्य के प्रस्तावों को पढ़ता है और उनकी आलोचना करता है।
  • मॉडल आलोचनाओं के आधार पर अपने उत्तरों को अपडेट करते हैं।
  • आर राउंड के बाद, अभिसरण उत्तर लौटाएं।

मूल प्रयोगों में लागत के कारण N=3, R=2 का उपयोग किया गया था। अधिक एजेंटों और कठिन समस्याओं (MMLU, GSM8K, शतरंज मूव वैधता, जीवनी पीढ़ी) पर अधिक राउंड के साथ सटीकता में सुधार होता है।

क्रॉस-मॉडल संयोजन एकल-मॉडल बहसों को हराता हैः चैटजीपीटी + बारड एक साथ > या अकेले।

स्पायर टॉपॉलजी

"स्पायर कम्युनिकेशन टॉपलॉजी के साथ मल्टी-एजेंट बहस में सुधार" (arXiv:2406.11776, 2024-2025) ने दिखाया कि पूर्ण-मेश बहस हमेशा इष्टतम नहीं होती है। स्पायर टॉपलॉजी (सितारा, अंगूठी, हब-एंड-स्पोक) कम टोकन लागत पर सटीकता से मेल खा सकती है। प्रत्येक बहसकर्ता केवल समकक्षों के एक उपसमूह को देखता है।

प्रभाव:

  • पूर्ण जाल N=5, R=3 = 5 × 3 = 15 प्रस्ताव, प्रत्येक पढ़ने 4 समकक्ष = 60 आलोचनात्मक संचालन।
  • स्टार N=5, R=3 (एक हब + 4 स्पोक) = 15 प्रस्ताव, स्पोक केवल हब को पढ़ते हैं = 12 आलोचनात्मक ऑपरेशन।

जब बहस मदद करती है

  • Factuality.स्वतंत्र प्रस्तावों के साथ, क्रॉस-चेक भ्रम को कम करता है।
  • Rule-following.शतरंज चाल वैधता एक मॉडल एक नियम को याद करता है, अन्य इसे पकड़ते हैं।
  • Open-ended reasoning.सही उत्तर के लिए कई रूपरेखा संकीर्ण हैं।

जब बहस दर्द करती है

  • Latency-sensitive UX.N × R सीरियल राउंड की देरी आप नहीं हो सकता है.
  • Cost-sensitive scale.प्रति प्रश्न N × R टोकन।
  • Simple factual lookups.एक खोज पांच बहसों से सस्ता है।

2026 व्यावहारिक उदाहरण

  • Anthropic orchestrator-workers(पाठ 12) संश्लेषण चरण के साथ बहस का एक संस्करण।
  • LangGraph supervisor(पाठ 13) केंद्रीय राउटर + विशेषज्ञ एजेंट एक नोड के रूप में बहस को लागू कर सकते हैं।
  • OpenAI Agents SDK(पाठ 16) पुनरावर्ती आलोचना के लिए एजेंट आगे-पीछे हाथ-पाँव करते हैं।
  • Multi-agent evals जोड़ी बहस + मूल्यांकन संकेत के लिए मूल्यांकनकर्ता-अनुकूलन।

जहां यह पैटर्न गलत हो जाता है

  • Convergence collapse.सभी एजेंटों को पहले गलत उत्तर पर एक साथ मिलते हैं।
  • Hub failure.एक स्टार टॉपॉलजी में, एक बुरा केंद्र सभी को भ्रष्ट करता है। घूम या कई केंद्रों का उपयोग करें।
  • Prompt homogenization.सभी एजेंट एक ही संकेत का उपयोग करते हैं; वे एक ही उत्तर का उत्पादन करते हैं। विभिन्न संकेत और/या मॉडल का उपयोग करें।

इसे बनाओ

code/main.pyइस विषय पर चर्चा करता हैः

  • Debaterवर्ग (प्रति बहसकर्ता राय बहाव के साथ लिखित LLM) ।
  • FullMeshDebateऔर SparseDebateधावक।
  • तीन प्रश्नः एक तथ्यगत, एक नियम आधारित, एक तर्क।
  • मीट्रिकः अभिसरण उत्तर, अभिसरण के लिए राउंड, कुल आलोचना संचालन।

इसे चलाओः

python3 code/main.py

आउटपुटः प्रति प्रोटोकॉल सटीकता और लागत; कम लागत पर 2/3 प्रश्नों पर पूर्ण जाल के साथ दुर्लभ मैच।

इसका प्रयोग करें

  • Anthropic orchestrator-workers2-3 श्रमिकों के सरल बहस के लिए।
  • LangGraphराज्य के लिए बहुराउंड बहस के लिए चेकपोइंटिंग के साथ।
  • Customअनुसंधान या विशिष्ट सटीकता गारंटी के लिए।

इसे भेजें

outputs/skill-debate.mdN, R, और एक अभिसरण नियम के साथ एक बहु-एजेंट बहस के साथ एक सेटअप टॉपलॉजी,

व्यायाम

  1. "जबरदस्ती असहमति" नियम लागू करेंः पहले दौर में, प्रत्येक बहसकर्ता को एक अलग प्रस्ताव प्रस्तुत करना होगा।
  2. विश्वास-वजनित संश्लेषण जोड़ेंः बहस करने वाले लौटते हैं (जवाब, विश्वास); संश्लेषक विश्वास द्वारा वजन करता है। क्या यह मदद करता है?
  3. क्या विषमता सटीकता में सुधार करती है?
  4. अपने 3 सवालों पर पूर्ण जाल बनाम दुर्लभ के लिए टोकन लागत मापें। प्लॉट लागत बनाम सटीकता।
  5. सोसाइटी ऑफ माइंड्स के पेपर को पढ़ें. अपने खिलौने को N=5, R=3 पर ले जाएं। क्या ब्रेक होता है? क्या बेहतर होता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Debate"Multi-agent critique"N proposers, R rounds of cross-critique, converge
Full mesh"Everyone reads everyone"Every debater reads every peer each round
Sparse topology"Limited peer view"Debaters read only a subset of peers
Hub-and-spoke"Star topology"One central debater, N-1 spokes read only the hub
Convergence"Agreement"Debaters converge on a shared answer
Society of Minds"Du et al. debate paper"ICML 2024 multi-agent debate method

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.