Phase 16: Multi-Agent & Swarms

वार्ता और सौदा

एजेंट संसाधनों, कीमतों, कार्य आवंटन और शर्तों पर बातचीत करते हैं। 2026 बेंचमार्क सेट स्पष्ट हैः वार्तालापअरेना (arXiv:2402.05863) दिखाता है कि एलएलएम व्यक्ति हेरफेर ("उत्साह" के माध्यम से ~ 20% तक भुगतान में सुधार कर सकते हैं; "विनिमय क्षमताओं को मापने" (arXiv:2402.15813) से पता चलता है कि खरीदार विक्रेता से कठिन है और पैमाने उनकी मदद नहीं करता है OG-Narrator(निर्धारक प्रस्ताव जनरेटर + LLM कथाकार) ने सौदे की दर को 26.67% से बढ़ाकर 88.88% कर दिया; बड़े पैमाने पर स्वायत्त वार्ता प्रतियोगिता (arXiv:2503.06416) ने ~ 180k वार्ताएं आयोजित कीं और पाया किchain-of-thought-concealingअभिकर्ता अपने समकक्षों से तर्क छिपाने से जीतते हैं; भट्टाचार्य एट अल. 2025 पर हार्वर्ड वार्ता परियोजना मीट्रिक्स ने एलएमए-3 को सबसे प्रभावी, क्लाउड-3 आक्रामक, जीपीटी-4 को सबसे निष्पक्ष रैंक किया। यह पाठ अनुबंध नेट प्रोटोकॉल (एफआईपीए पूर्वज, पाठ 02) को लागू करता है, एलएलएम शैली के खरीदार / विक्रेता को तार करता है, ओजी-नारटर शैली का विघटन करता है, और मापता है कि प्रत्येक संरचनात्मक विकल्प के साथ सौदा दर कैसे बदलती है।

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 16 · 02 (FIPA-ACL Heritage), Phase 16 · 09 (Parallel Swarm Networks)

Time: ~75 minutes

समस्या

दो एजेंटों को एक मूल्य पर सहमत होना चाहिए। शुद्ध भाषा के संकेतों के साथ अपने लिए छोड़ दिया गया, 2024-2026 एलएलएम आश्चर्यजनक रूप से कम दरों (ArXiv में सख्त पैरामीटर वाले सौदों पर ~ 27%) पर सौदे बंद करते हैं। पैमाने इसे तय नहीं करता हैः जीपीटी -4 संरचनात्मक रूप से जीपीटी -3.5 से बेहतर नहीं है; यह भाषा में बेहतर है सौदेबाजी।

मूल मुद्दा यह है कि एलएलएम दो नौकरियों को मिलाते हैं प्रस्ताव का निर्णय लेने और प्रस्ताव को बताने। ओजी-नारायटर ने इन लोगों को अलग कियाः एक निर्धारात्मक प्रस्ताव जनरेटर संख्यात्मक चालों की गणना करता है; एलएलएम केवल कथा करता है। सौदे की दर ~89% तक कूदती है।

यह एक क्लासिक मल्टी-एजेंट निष्कर्ष को दर्शाता हैः संचार परत से तंत्र को अलग करना जीतता है। अनुबंध नेट प्रोटोकॉल (FIPA, 1996; स्मिथ, 1980) संदर्भ कार्य बाजार तंत्र है। कथा स्लॉट में एलएलएम प्लग करें और आपको एक आधुनिक एलएलएम-संचालित कार्य बाजार मिलता है।

अवधारणा

अनुबंध नेट, एक पैराग्राफ में

स्मिथ के 1980 के कॉन्ट्रैक्ट नेट प्रोटोकॉलः एक managerप्रसारण करता है call for proposals (cfp)biddersproposeउनके प्रस्तावों को युक्त संदेश; प्रबंधक एक विजेता चुनता है और भेजता है accept-proposalविजेता को और reject-proposalहारने वालों को. विजेता काम करता है. वैकल्पिक संदेशःrefuseFIPA ने इसे संहिताबद्ध किया है कि fipa-contract-netबातचीत प्रोटोकॉल।

ओजी-नेरेटर क्यों जीतता है

"भाषा मॉडल की वार्ता क्षमताओं को मापने" (arXiv:2402.15813) ने कहा किः

  • LLM अक्सर बातचीत के नियमों का उल्लंघन करते हैं (अर्थहीन कीमतों पर पेशकश करते हैं, दूसरे पक्ष के ZOPA को अनदेखा करते हैं) ।
  • वे खराब रूप से लंगर लगाते हैं (बुरे पहले प्रस्तावों को स्वीकार करते हैं; रणनीतिक मात्रा के बजाय प्रतीकात्मक मात्रा में प्रति-प्रस्ताव करते हैं) ।
  • बड़े मॉडल इसी तरह की रणनीतिक त्रुटि के साथ अधिक व्यवहार्य भाषा बनाते हैं।

ओजी-नारायटर विघटनः

           ┌──────────────────┐        ┌──────────────────┐
  state  → │ offer generator  │ price → │  LLM narrator    │ → message
           │  (deterministic) │        │  (writes the     │
           │                  │        │   human-style    │
           └──────────────────┘        │   accompaniment) │
                                       └──────────────────┘

प्रस्ताव जनरेटर एक क्लासिक वार्ता रणनीति हैः एक रूबिनस्टाइन सौदेबाजी मॉडल, एक ज़्यूथेन रणनीति, या एक साधारण मूल्य पर टिट-टू-टट। एलएलएम कथा है। संदेश में निर्धारात्मक मूल्य और प्राकृतिक भाषा फ्रेमिंग शामिल है।

सौदा दरों में छलांग लगती है क्योंकि:

  • कीमतें सौदेबाजी क्षेत्र में रहेंगी।
  • लंगर रणनीतिक हैं, भावनात्मक नहीं।
  • LLM वह करता है जो वह अच्छा हैः लेखन।

वार्ताअराइन निष्कर्ष

arXiv:2402.05863 कैनोनिक बेंचमार्क प्रदान करता है। शीर्षक निष्कर्षः

  • एलएलएम व्यक्ति को अपनाकर भुगतान में ~20% सुधार कर सकते हैं ("मैं शुक्रवार तक इसे बेचने के लिए बेताब हूं") व्यक्ति हेरफेर एक वास्तविक रणनीति है।
  • निष्पक्ष/सहकारी एजेंटों का विरोधियों द्वारा शोषण किया जाता है; रक्षा के लिए स्पष्ट प्रति-विन्यास की आवश्यकता होती है।
  • सममित जोड़े-अप लगभग 40% बेंचमार्क परिदृश्यों पर असमान परिणामों के लिए अभिसरण करते हैं।

यह "एलएलएम खराब वार्ताकार हैं" नहीं है। यह "एलएलएम मानव की तरह बहुत अधिक बातचीत करते हैं, शोषण योग्य भागों सहित।"

सोच की श्रृंखला से छिपाना

बड़े पैमाने पर स्वायत्त वार्ता प्रतियोगिता (arXiv:2503.06416) ने कई एलएलएम रणनीतियों में लगभग 180k वार्ता की। विजेताओं ने अपने समकक्षों से अपनी तर्क छिपायाः

  • अगर कोई एजेंट प्रिंट करता है "मैं केवल जाने के लिए जाएगा$75; my reservation price is $70 "एक सार्वजनिक रूप से दिखाई स्क्रैचपैड में, प्रतिद्वंद्वी इसे पढ़ता है।
  • विजेता निजी तौर पर रणनीति का गणना करते हैं; आउटपुट चैनल में केवल प्रस्ताव और न्यूनतम आवश्यक कथा शामिल है।

यह क्लासिकल गेम थ्योरी (आमान 1976 पर तर्क और सूचना) का 2026 का प्रतिध्वनित है: अपने निजी मूल्यांकन लागत भुगतान का खुलासा करना। एलएलएम इसे सहज नहीं समझते हैं और खुशी से तर्क के निशान में अपने आरक्षण टाइप करते हैं जो समकक्ष के लिए दिखाई देते हैं।

इंजीनियरिंग लेवः सार्वजनिक संदेश संदर्भ से निजी स्क्रैचपैड संदर्भ को अलग करें। वैकल्पिक नहीं।

भट्टाचार्य एवं अन्य 2025 मॉडल रैंकिंग

हार्वर्ड वार्ता परियोजना के मापदंडों पर (प्रचारात्मक वार्ता, BATNA सम्मान, हित पारस्परिकता):

  • Llama-3सौदेबाजी (ऑर्डर रेट + पेआउट) में सबसे प्रभावी था।
  • Claude-3सबसे आक्रामक वार्ताकार (उच्च एंकर, देर से छूट) था।
  • GPT-4जोड़ी के बीच भुगतान में सबसे कम भिन्नता) थी।

यह 2025 की एक स्नैपशॉट है। यह मुद्दा यह नहीं है कि अप्रैल 2026 में कौन सा मॉडल जीतता है। यह यह है कि विभिन्न आधार मॉडल में निरंतर वार्ता शैली होती है। विषम समूहों (पाठ 15) में विविधता के स्रोत के रूप में यह शामिल है।

अनुबंध नेट + LLM के माध्यम से कार्य आवंटन

एलएलएम मल्टी-एजेंट के लिए कॉन्ट्रैक्ट नेट का आधुनिक पुनः उपयोगः

  1. प्रबंधक एजेंट एक कार्य को इकाइयों में तोड़ देता है।
  2. प्रसारण cfpकार्य एजेंटों को कार्य विवरण के साथ।
  3. प्रत्येक कार्यकर्ता एक प्रस्ताव देता हैः (price, eta, confidence)जहां कीमत टोकन, कम्प्यूटिंग इकाइयां या डॉलर हो सकती है।
  4. प्रबंधक विजेताओं (कार्य के आधार पर एकल या बहुविध) और पुरस्कारों का चयन करता है।
  5. अस्वीकृत श्रमिक अन्य कार्यों पर बोली लगाने के लिए स्वतंत्र हैं।

यह 100 श्रमिकों से अधिक है क्योंकि समन्वय प्रसारण-और-प्रतिक्रिया है, सिंक्रोनस चैट नहीं। उत्पादन में उपयोग किया जाता हैः माइक्रोसॉफ्ट एजेंट फ्रेमवर्क के ऑर्केस्ट्रेशन पैटर्न, कुछ लैंगग्राफ कार्यान्वयन।

LLM-स्टैकहोल्डर्स इंटरैक्टिव बातचीत

न्यूरआईपीएस 2024 (https://proceedings.neurips.cc/paper_files/paper/2024/file/984dd3db213db2d1454a163b65b84d08-Paper-Datasets_and_Benchmarks_Track.pdf) के साथ बहु-पक्षीय स्कोरिंग खेलों की शुरूआत करता है secret scoresऔर minimum-acceptance thresholds. प्रत्येक हितधारक के पास निजी उपयोगिताएं हैं; एलएलएम को उन्हें संदेशों से निष्कर्षण करना चाहिए। यह दो-पक्षीय बातचीत का सामान्यीकरण है N-पक्षीय गठबंधन गठन। विभेदित श्रमिक क्षमताओं वाले उत्पादन कार्य बाजारों के लिए प्रासंगिक है।

कथा-विरोधी तंत्र नियम

2024-2026 के सभी वार्ता बेंचमार्क में, एकਸਾਰ इंजीनियरिंग नियम हैः

एलएलएम को बताने दो, एलएलएम को प्रस्ताव की गणना करने न दें।

यदि प्रस्ताव को एक संख्या (मूल्य, ETA, मात्रा) की आवश्यकता है, तो इसे वार्ता की स्थिति से निर्धारणीय रूप से उत्पन्न करें और एलएलएम को ढांचे का उत्पादन करने दें। यदि प्रस्ताव को प्रस्ताव संरचना (कार्य विघटन, भूमिका असाइनमेंट) की आवश्यकता है, तो एलएलएम को इसे तैयार करने दें, लेकिन इसे भेजने से पहले एक योजना और प्रतिबंध जांच के आधार पर मान्य करें।

इसे बनाओ

code/main.pyकार्य करता हैः

  • ContractNetManager,ContractNetTask,Bid प्रबंधक + बोलीदाता, प्रसारण सीएफपी, प्रस्ताव एकत्र करना, पुरस्कार।
  • og_narrator_bargain(state, rng) ओजी-नारायण खरीदारः मध्य बिंदु की ओर निर्धारक ज़्यूथेन शैली की अनुज्ञा।
  • seller_response(state, rng) विक्रेता प्रति-प्रस्ताव नीति (दोनों शैलियों के लिए संरचनात्मक आधार सत्य) ।
  • naive_llm_bargain(state, rng) एक सभी-एलएलएम सौदागर का अनुकरण करता हैः उच्च भिन्नता के साथ कीमतें चुनता है, अक्सर ZOPA के बाहर।
  • मापः प्रति परीक्षण नए आरक्षण की कीमतों के साथ 1000 से अधिक परीक्षणों के सौदे की दर।

दौड़ें:

python3 code/main.py

अपेक्षित आउटपुटः साफ़-एलएलएम सौदा दर ~ 65-75%; ओजी-नारायटर सौदा दर ~ 85-95%; 15-25 अंक अंतर कथा से प्रस्ताव-उत्पादन को विघटित करने का संरचनात्मक लाभ है। इसके अलावा तीन बोली लगाने वालों और एक कार्य के साथ एक अनुबंध नेट कार्य-बाजार आवंटन उदाहरण।

इसका प्रयोग करें

outputs/skill-bargainer-designer.mdएक सौदेबाजी प्रोटोकॉल डिजाइन करता हैः कौन प्रस्ताव उत्पन्न करता है (निर्णायक या एलएलएम), कौन कथा देता है, निजी स्क्रैचपैड सार्वजनिक संदेशों से कैसे अलग होते हैं, और कैसे सौदे की दर की निगरानी की जाती है।

इसे भेजें

उत्पादन वार्ता की जाँच सूचीः

  • Separate scratchpad.निजी राज्य कभी भी प्रतिद्वंद्वी के संदर्भ तक नहीं पहुंचता है। यह गैर-विमर्श योग्य है।
  • Deterministic offer generation.कीमतें, मात्रा, ETAs: गणना, कोई संकेत नहीं।
  • Validate all incoming offersप्रोटोकॉल सीमा पर बाहर-जोपा प्रस्तावों को अस्वीकार करें।
  • Bound rounds.3-5 राउंड अधिकतम; गतिरोध पर मध्यस्थ के लिए बढ़ोतरी।
  • Measure deal rate and payoff varianceलगातार व्यापार दर में गिरावट एक लक्षण है अक्सर एक त्वरित बहाव या प्रतिपक्ष पक्ष के हमले।
  • Log all rejected proposalsठेकेदार नेटवर्क प्रबंधकों के लिए, हारने वाले बोलीदाताओं को समझने की जरूरत है कि क्यों।

व्यायाम

  1. दौड़ेंcode/main.pyपुष्टि करें ओजी-नारायटर सौदा दर पर भोले-एलएलएम से बेहतर है. कितना?
  2. कार्यान्वयनpersona-based payoff improvement(arXiv:2402.05863) खरीदार केवल कथा में "इस सप्ताह खरीदने के लिए बेताब" चरित्र को अपनाता है, परिवर्तन के बिना जनरेटर की पेशकश करता है। क्या सौदा दर या भुगतान बदलता है?
  3. विचार श्रृंखला को लागू करें concealmentयदि आप गलती से इसे लीक करते हैं (चैनल को swapping करके सिमुलेट करें) तो क्या होता है?
  4. जब सभी बोली भंडार से अधिक हो जाती है, तो प्रबंधक सबसे कम कीमत और उच्चतम गुणवत्ता के बीच कैसे निर्णय लेता है? आप किस पुरस्कार नियम का चयन करते हैं और क्यों?
  5. हार्वर्ड वार्ता परियोजना मेट्रिक्स पर भट्टाचार्य और अन्य 2025 पढ़ें। विभिन्न शैलियों (आग्रवादी बनाम निष्पक्ष) के साथ दो सौदेबाजी लागू करें। सममित और असमित जोड़े के तहत भुगतान भिन्नता को मापें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Contract Net"Task market"Smith 1980, FIPA 1996. cfp + propose + accept/reject. The canonical task-market.
ZOPA"Zone of possible agreement"Overlap between buyer's max and seller's min. Offers outside it cannot close.
BATNA"Best alternative to a negotiated agreement"Your fallback if this deal fails. Sets your reservation price.
OG-Narrator"Offer generator + narrator"Decomposition: deterministic offer, LLM narration.
Zeuthen strategy"Risk-minimizing concession"Classical offer-generator that concedes based on risk limits.
Rubinstein bargaining"Alternating-offer equilibrium"Game-theoretic model for infinite-horizon bargaining with discounting.
CoT concealment"Hide your reasoning"Winners in arXiv:2503.06416 kept private scratchpads; public channel shows offer only.
Persona manipulation"Emotional posturing"arXiv:2402.05863: ~20% payoff gain from desperation/urgency personas.

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.