मन का समाज और बहु-एजेंट बहस
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 04 (Primitive Model)
Time: ~60 minutes
समस्या
आत्म-समन्वय एक मॉडल का कई बार नमूना लें और बहुमत का उत्तर लें सबसे सस्ता तर्क सुधार है जिसे आप परलट कर सकते हैं। यह काम करता है, लेकिन यह तेजी से संतृप्त होता है। आप अपने नमूनों को दोगुना कर सकते हैं और एक और सार्थक छलांग नहीं देख सकते हैं।
बहस संतृप्ति को तोड़ती है। एक मॉडल से N स्वतंत्र नमूनों के बजाय, N एजेंट एक दूसरे के तर्क और संशोधन को पढ़ते हैं। नमूनों के बीच संबंध गिरता है (वे अब आईआईडी नहीं हैं), और अभिसरण बिंदु अक्सर सही होता है जहां आईआईडी मतदान आत्मविश्वास से गलत था।
अवधारणा
डु एट अल. 2023 एल्गोरिथ्म
arXiv:2305.14325 (ICML 2024) सेः
- N एजेंटों में से प्रत्येक प्रश्न का प्रारंभिक उत्तर देता है।
- राउंड r = 2..R: प्रत्येक एजेंट को दूसरे एजेंटों के राउंड r-1 उत्तर दिखाए जाते हैं और पूछा जाता है "इन पर विचार करते हुए, अपना अद्यतन उत्तर दें।"
- आर राउंड के बाद, अंतिम उत्तरों को बहुमत-वोट दिया जाए।
एमएमएलयू, जीएसएम8के, जीवनी, एमएटीएच और तथ्यों के बेंचमार्क पर पेपर टेस्ट। बहस लगातार कोट और सेल्फ रिफ्लेक्शन से आगे निकलती है।
दो स्वतंत्र बटन
उसी पेपर से अपवादः
- Agent count alone(एक दौर, N के बहुमत के साथ) अधिकांश कार्यों पर एकल एजेंट को हराता है, लेकिन पठारों पर।
- Round count alone(एक एजेंट अपनी पूर्व तर्क को देखते हुए) शायद ही प्रतिबिंब की ज्ञात कमजोरी को मदद करता है।
- Both togetherकई एजेंटों के बीच बहु-राउंड विनिमय लाभ को चलाता है।
यह काम क्यों करता है
दो तंत्र:
- Exposure to disagreement.जब एक एजेंट दूसरे एजेंट की तर्क श्रृंखला को एक अलग निष्कर्ष के साथ देखता है, तो उसे या तो सही ठहराया जाना चाहिए या अपडेट करना चाहिए। किसी भी तरह से, गोल r + 1 के लिए संदर्भ गोल r से समृद्ध है।
- Correlated error reduction.आत्म-समरूपता में, सभी नमूने एक ही मॉडल से आते हैं, इसलिए त्रुटियां सहसंबंधित हैं आप आत्मविश्वास से गलत उत्तर में औसत बनाते हैं। विभिन्न मॉडल या विभिन्न बीज विकोरेल करते हैं। विभिन्न विवादित विचार आगे विकोरेल करते हैं।
विभेदपूर्ण बहस
ए-एचएमएडी और संबंधित अनुवर्ती विभिन्न एजेंटों के लिए विभिन्न आधार मॉडल का उपयोग करते हैं। एलम्मा + क्लाउड + जीपीटी बहस एक-संस्कृति के पतन को कम करती है (पाठ 26) क्योंकि एक मॉडल परिवार की संबद्ध त्रुटियों को अन्य लोगों द्वारा साझा नहीं किया जाता है।
नकारात्मक पक्षः बहस में भाग लेने वाला कमजोर मॉडल सहमति को गलत उत्तर की ओर खींच सकता है (देखें "क्या हमें पागल होना चाहिए?
एनएलएसओएम 129-एजेंट एक्सटेंशन
Zhuge et al. ("प्राकृतिक भाषा आधारित मानसिक समाजों में मन की तूफान", arXiv:2305.17066) ने इस विचार को 129 सदस्यीय समाजों तक बढ़ाया। परिणामः विशेषज्ञता और स्व-संगठन पैमाने के साथ सामने आते हैं, और प्रणाली दृश्य प्रश्नों के उत्तर जैसे कार्यों पर एकल एजेंट से बेहतर प्रदर्शन करती है।
विफलता मोड
- Sycophancy cascade.सभी एजेंटों को उस एजेंट के लिए स्थगित किया जाता है जो सबसे अधिक आत्मविश्वास से लगता है। बहस सबसे जोर से आवाज में गिर जाती है। विरोधी भूमिकाओं के लिए प्रमोशन ("एक एजेंट को विपरीत स्थिति पर बहस करनी चाहिए") मदद करता है।
- Topic drift.कई राउंड में बहस मूल प्रश्न से बहती है।
- Compute blowup.N एजेंट × R राउंड = N·R LLM कॉल, प्रत्येक में एक बढ़ता हुआ संदर्भ होता है। 5 एजेंट, 5 राउंड बहस बढ़ते संदर्भ में 25 कॉल होती है। प्रति प्रश्न लागत 10x एक एकल CoT कॉल से अधिक हो सकती है।
इसे बनाओ
code/main.pyएक गणित प्रश्न पर एक 3-एजेंट × 3-राउंड बहस चलाता है जहां प्रत्येक एजेंट एक अलग (संभवतः गलत) उत्तर के साथ शुरू होता है। एजेंटों को स्क्रिप्ट किया जाता है प्रत्येक "अपडेट" द्वारा एक स्क्रिप्ट किए गए विश्वास द्वारा भारित पड़ोसियों के उत्तरों का औसत। अभिसरण गोल-दर-गोल लॉग में दिखाई देता है।
डेमो में दो प्रमुख प्रभाव दिखाए गए हैंः
- एक ही दौर के आदान-प्रदान एजेंटों को सही उत्तर के करीब ले जाता है।
- दूसरे दौर के बाद अतिरिक्त राउंड में घटती हुई रिटर्न दिखती है (डु और अन्य के पठार से मेल खाती है) ।
दौड़ें:
python3 code/main.pyइसका प्रयोग करें
outputs/skill-debate-configurator.mdएक नए कार्य के लिए बहस को कॉन्फ़िगर करता हैः एजेंटों की संख्या, राउंड की संख्या, विषमता (एक ही मॉडल बनाम मिश्रित), भूमिका असाइनमेंट (सामितीय बनाम एक-विपक्षीय) । यह दौड़ने से पहले टोकन लागत का भी अनुमान लगाता है।
इसे भेजें
यदि आप बहस जहाजः
- Cap rounds at 3.दो और सहयोगियों ने दिखाया कि तीन राउंड से अधिक लाभ मिलता है। अधिक लागत है, गुणवत्ता नहीं।
- Cap agents at 5.5 के बाद, संदर्भ और लागत का अधिग्रहण होता है।
- Heterogeneous by default.कम से कम दो अलग-अलग बेस मॉडल पूल में.
- Adversarial slot.एक एजेंट ने किसी भी तरह से असहमत होने के लिए प्रेरित किया।
- Log every round.मध्यवर्ती राउंड छिपाने वाले बहस प्रणाली को डिबग या ऑडिट नहीं किया जा सकता है।
व्यायाम
- दौड़ें
code/main.py, फिर 5 पर गोल गिनती सेट करें और घटती रिटर्न देखें। किस दौर में अतिरिक्त अभिसरण बंद हो जाता है? - एक चौथा एजेंट जोड़ा जाए जिसमें एक विरोधी भूमिका हो: हमेशा वर्तमान बहुमत से असहमत रहें। क्या इससे अभिसरण टूट जाता है या सुधार होता है?
- प्रति राउंड समझौते स्कोर (बहुमत के जवाब पर एजेंटों का अंश) को स्क्रॉल (प्रिंट) करें। यह 1.0 तक कब पहुंचता है और क्या यह "सही" के बराबर है?
- खंड 4 के अपवर्तन पढ़ें। इस कोड का उपयोग करके "केवल एजेंट" बनाम "केवल राउंड" बनाम "दोनों" परिणाम दोहराएं।
- "क्या हमें पागल होना चाहिए? " (arXiv:2311.17371) पढ़ें और राउंड-रोबिन के अलावा दो बहस संस्करणों को सूचीबद्ध करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Society of Mind | "Minsky's idea" | Intelligence as interacting specialists; 1986 framing now operationalized via LLM debate. |
| Multi-agent debate | "Agents argue" | N agents propose, critique each other, revise over R rounds, majority-vote. |
| Consensus | "They agree" | Not epistemic truth — just fraction-on-majority-answer. Can be confidently wrong. |
| Rounds | "Exchange steps" | One round = each agent reads the others and updates once. |
| Heterogeneous debate | "Mix model families" | Using different base models to decorrelate errors. |
| Sycophancy cascade | "Everyone agrees with the loud one" | Debate failure where agents defer to the most confident agent regardless of correctness. |
| NLSOM | "129-agent society" | Natural-language society of mind; Zhuge et al.'s scaled version. |
| Correlated error | "Same model, same bug" | Why self-consistency saturates; debate across different views decorrelates. |
आगे पढ़ना
- Du et al. — Improving Factuality and Reasoning in Language Models through Multiagent Debate संदर्भ पत्र, आईसीएमएल 2024
- Zhuge et al. — Mindstorms in Natural Language-Based Societies of Mind 129-एजेंट एनएलएसओएम
- Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs बेंचमार्क बहस वैरिएंट
- Debate project page डु एट एल्स का कोड, डेमो और एब्लेशन विवरण
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.