वार्ता और सौदा
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 02 (FIPA-ACL Heritage), Phase 16 · 09 (Parallel Swarm Networks)
Time: ~75 minutes
समस्या
दो एजेंटों को एक मूल्य पर सहमत होना चाहिए। शुद्ध भाषा के संकेतों के साथ अपने लिए छोड़ दिया गया, 2024-2026 एलएलएम आश्चर्यजनक रूप से कम दरों (ArXiv में सख्त पैरामीटर वाले सौदों पर ~ 27%) पर सौदे बंद करते हैं। पैमाने इसे तय नहीं करता हैः जीपीटी -4 संरचनात्मक रूप से जीपीटी -3.5 से बेहतर नहीं है; यह भाषा में बेहतर है सौदेबाजी।
मूल मुद्दा यह है कि एलएलएम दो नौकरियों को मिलाते हैं प्रस्ताव का निर्णय लेने और प्रस्ताव को बताने। ओजी-नारायटर ने इन लोगों को अलग कियाः एक निर्धारात्मक प्रस्ताव जनरेटर संख्यात्मक चालों की गणना करता है; एलएलएम केवल कथा करता है। सौदे की दर ~89% तक कूदती है।
यह एक क्लासिक मल्टी-एजेंट निष्कर्ष को दर्शाता हैः संचार परत से तंत्र को अलग करना जीतता है। अनुबंध नेट प्रोटोकॉल (FIPA, 1996; स्मिथ, 1980) संदर्भ कार्य बाजार तंत्र है। कथा स्लॉट में एलएलएम प्लग करें और आपको एक आधुनिक एलएलएम-संचालित कार्य बाजार मिलता है।
अवधारणा
अनुबंध नेट, एक पैराग्राफ में
स्मिथ के 1980 के कॉन्ट्रैक्ट नेट प्रोटोकॉलः एक managerप्रसारण करता है call for proposals (cfp)biddersproposeउनके प्रस्तावों को युक्त संदेश; प्रबंधक एक विजेता चुनता है और भेजता है accept-proposalविजेता को और reject-proposalहारने वालों को. विजेता काम करता है. वैकल्पिक संदेशःrefuseFIPA ने इसे संहिताबद्ध किया है कि fipa-contract-netबातचीत प्रोटोकॉल।
ओजी-नेरेटर क्यों जीतता है
"भाषा मॉडल की वार्ता क्षमताओं को मापने" (arXiv:2402.15813) ने कहा किः
- LLM अक्सर बातचीत के नियमों का उल्लंघन करते हैं (अर्थहीन कीमतों पर पेशकश करते हैं, दूसरे पक्ष के ZOPA को अनदेखा करते हैं) ।
- वे खराब रूप से लंगर लगाते हैं (बुरे पहले प्रस्तावों को स्वीकार करते हैं; रणनीतिक मात्रा के बजाय प्रतीकात्मक मात्रा में प्रति-प्रस्ताव करते हैं) ।
- बड़े मॉडल इसी तरह की रणनीतिक त्रुटि के साथ अधिक व्यवहार्य भाषा बनाते हैं।
ओजी-नारायटर विघटनः
┌──────────────────┐ ┌──────────────────┐
state → │ offer generator │ price → │ LLM narrator │ → message
│ (deterministic) │ │ (writes the │
│ │ │ human-style │
└──────────────────┘ │ accompaniment) │
└──────────────────┘प्रस्ताव जनरेटर एक क्लासिक वार्ता रणनीति हैः एक रूबिनस्टाइन सौदेबाजी मॉडल, एक ज़्यूथेन रणनीति, या एक साधारण मूल्य पर टिट-टू-टट। एलएलएम कथा है। संदेश में निर्धारात्मक मूल्य और प्राकृतिक भाषा फ्रेमिंग शामिल है।
सौदा दरों में छलांग लगती है क्योंकि:
- कीमतें सौदेबाजी क्षेत्र में रहेंगी।
- लंगर रणनीतिक हैं, भावनात्मक नहीं।
- LLM वह करता है जो वह अच्छा हैः लेखन।
वार्ताअराइन निष्कर्ष
arXiv:2402.05863 कैनोनिक बेंचमार्क प्रदान करता है। शीर्षक निष्कर्षः
- एलएलएम व्यक्ति को अपनाकर भुगतान में ~20% सुधार कर सकते हैं ("मैं शुक्रवार तक इसे बेचने के लिए बेताब हूं") व्यक्ति हेरफेर एक वास्तविक रणनीति है।
- निष्पक्ष/सहकारी एजेंटों का विरोधियों द्वारा शोषण किया जाता है; रक्षा के लिए स्पष्ट प्रति-विन्यास की आवश्यकता होती है।
- सममित जोड़े-अप लगभग 40% बेंचमार्क परिदृश्यों पर असमान परिणामों के लिए अभिसरण करते हैं।
यह "एलएलएम खराब वार्ताकार हैं" नहीं है। यह "एलएलएम मानव की तरह बहुत अधिक बातचीत करते हैं, शोषण योग्य भागों सहित।"
सोच की श्रृंखला से छिपाना
बड़े पैमाने पर स्वायत्त वार्ता प्रतियोगिता (arXiv:2503.06416) ने कई एलएलएम रणनीतियों में लगभग 180k वार्ता की। विजेताओं ने अपने समकक्षों से अपनी तर्क छिपायाः
- अगर कोई एजेंट प्रिंट करता है "मैं केवल जाने के लिए जाएगा$75; my reservation price is $70 "एक सार्वजनिक रूप से दिखाई स्क्रैचपैड में, प्रतिद्वंद्वी इसे पढ़ता है।
- विजेता निजी तौर पर रणनीति का गणना करते हैं; आउटपुट चैनल में केवल प्रस्ताव और न्यूनतम आवश्यक कथा शामिल है।
यह क्लासिकल गेम थ्योरी (आमान 1976 पर तर्क और सूचना) का 2026 का प्रतिध्वनित है: अपने निजी मूल्यांकन लागत भुगतान का खुलासा करना। एलएलएम इसे सहज नहीं समझते हैं और खुशी से तर्क के निशान में अपने आरक्षण टाइप करते हैं जो समकक्ष के लिए दिखाई देते हैं।
इंजीनियरिंग लेवः सार्वजनिक संदेश संदर्भ से निजी स्क्रैचपैड संदर्भ को अलग करें। वैकल्पिक नहीं।
भट्टाचार्य एवं अन्य 2025 मॉडल रैंकिंग
हार्वर्ड वार्ता परियोजना के मापदंडों पर (प्रचारात्मक वार्ता, BATNA सम्मान, हित पारस्परिकता):
- Llama-3सौदेबाजी (ऑर्डर रेट + पेआउट) में सबसे प्रभावी था।
- Claude-3सबसे आक्रामक वार्ताकार (उच्च एंकर, देर से छूट) था।
- GPT-4जोड़ी के बीच भुगतान में सबसे कम भिन्नता) थी।
यह 2025 की एक स्नैपशॉट है। यह मुद्दा यह नहीं है कि अप्रैल 2026 में कौन सा मॉडल जीतता है। यह यह है कि विभिन्न आधार मॉडल में निरंतर वार्ता शैली होती है। विषम समूहों (पाठ 15) में विविधता के स्रोत के रूप में यह शामिल है।
अनुबंध नेट + LLM के माध्यम से कार्य आवंटन
एलएलएम मल्टी-एजेंट के लिए कॉन्ट्रैक्ट नेट का आधुनिक पुनः उपयोगः
- प्रबंधक एजेंट एक कार्य को इकाइयों में तोड़ देता है।
- प्रसारण
cfpकार्य एजेंटों को कार्य विवरण के साथ। - प्रत्येक कार्यकर्ता एक प्रस्ताव देता हैः
(price, eta, confidence)जहां कीमत टोकन, कम्प्यूटिंग इकाइयां या डॉलर हो सकती है। - प्रबंधक विजेताओं (कार्य के आधार पर एकल या बहुविध) और पुरस्कारों का चयन करता है।
- अस्वीकृत श्रमिक अन्य कार्यों पर बोली लगाने के लिए स्वतंत्र हैं।
यह 100 श्रमिकों से अधिक है क्योंकि समन्वय प्रसारण-और-प्रतिक्रिया है, सिंक्रोनस चैट नहीं। उत्पादन में उपयोग किया जाता हैः माइक्रोसॉफ्ट एजेंट फ्रेमवर्क के ऑर्केस्ट्रेशन पैटर्न, कुछ लैंगग्राफ कार्यान्वयन।
LLM-स्टैकहोल्डर्स इंटरैक्टिव बातचीत
न्यूरआईपीएस 2024 (https://proceedings.neurips.cc/paper_files/paper/2024/file/984dd3db213db2d1454a163b65b84d08-Paper-Datasets_and_Benchmarks_Track.pdf) के साथ बहु-पक्षीय स्कोरिंग खेलों की शुरूआत करता है secret scoresऔर minimum-acceptance thresholds. प्रत्येक हितधारक के पास निजी उपयोगिताएं हैं; एलएलएम को उन्हें संदेशों से निष्कर्षण करना चाहिए। यह दो-पक्षीय बातचीत का सामान्यीकरण है N-पक्षीय गठबंधन गठन। विभेदित श्रमिक क्षमताओं वाले उत्पादन कार्य बाजारों के लिए प्रासंगिक है।
कथा-विरोधी तंत्र नियम
2024-2026 के सभी वार्ता बेंचमार्क में, एकਸਾਰ इंजीनियरिंग नियम हैः
एलएलएम को बताने दो, एलएलएम को प्रस्ताव की गणना करने न दें।
यदि प्रस्ताव को एक संख्या (मूल्य, ETA, मात्रा) की आवश्यकता है, तो इसे वार्ता की स्थिति से निर्धारणीय रूप से उत्पन्न करें और एलएलएम को ढांचे का उत्पादन करने दें। यदि प्रस्ताव को प्रस्ताव संरचना (कार्य विघटन, भूमिका असाइनमेंट) की आवश्यकता है, तो एलएलएम को इसे तैयार करने दें, लेकिन इसे भेजने से पहले एक योजना और प्रतिबंध जांच के आधार पर मान्य करें।
इसे बनाओ
code/main.pyकार्य करता हैः
ContractNetManager,ContractNetTask,Bidप्रबंधक + बोलीदाता, प्रसारण सीएफपी, प्रस्ताव एकत्र करना, पुरस्कार।og_narrator_bargain(state, rng)ओजी-नारायण खरीदारः मध्य बिंदु की ओर निर्धारक ज़्यूथेन शैली की अनुज्ञा।seller_response(state, rng)विक्रेता प्रति-प्रस्ताव नीति (दोनों शैलियों के लिए संरचनात्मक आधार सत्य) ।naive_llm_bargain(state, rng)एक सभी-एलएलएम सौदागर का अनुकरण करता हैः उच्च भिन्नता के साथ कीमतें चुनता है, अक्सर ZOPA के बाहर।- मापः प्रति परीक्षण नए आरक्षण की कीमतों के साथ 1000 से अधिक परीक्षणों के सौदे की दर।
दौड़ें:
python3 code/main.pyअपेक्षित आउटपुटः साफ़-एलएलएम सौदा दर ~ 65-75%; ओजी-नारायटर सौदा दर ~ 85-95%; 15-25 अंक अंतर कथा से प्रस्ताव-उत्पादन को विघटित करने का संरचनात्मक लाभ है। इसके अलावा तीन बोली लगाने वालों और एक कार्य के साथ एक अनुबंध नेट कार्य-बाजार आवंटन उदाहरण।
इसका प्रयोग करें
outputs/skill-bargainer-designer.mdएक सौदेबाजी प्रोटोकॉल डिजाइन करता हैः कौन प्रस्ताव उत्पन्न करता है (निर्णायक या एलएलएम), कौन कथा देता है, निजी स्क्रैचपैड सार्वजनिक संदेशों से कैसे अलग होते हैं, और कैसे सौदे की दर की निगरानी की जाती है।
इसे भेजें
उत्पादन वार्ता की जाँच सूचीः
- Separate scratchpad.निजी राज्य कभी भी प्रतिद्वंद्वी के संदर्भ तक नहीं पहुंचता है। यह गैर-विमर्श योग्य है।
- Deterministic offer generation.कीमतें, मात्रा, ETAs: गणना, कोई संकेत नहीं।
- Validate all incoming offersप्रोटोकॉल सीमा पर बाहर-जोपा प्रस्तावों को अस्वीकार करें।
- Bound rounds.3-5 राउंड अधिकतम; गतिरोध पर मध्यस्थ के लिए बढ़ोतरी।
- Measure deal rate and payoff varianceलगातार व्यापार दर में गिरावट एक लक्षण है अक्सर एक त्वरित बहाव या प्रतिपक्ष पक्ष के हमले।
- Log all rejected proposalsठेकेदार नेटवर्क प्रबंधकों के लिए, हारने वाले बोलीदाताओं को समझने की जरूरत है कि क्यों।
व्यायाम
- दौड़ें
code/main.pyपुष्टि करें ओजी-नारायटर सौदा दर पर भोले-एलएलएम से बेहतर है. कितना? - कार्यान्वयनpersona-based payoff improvement(arXiv:2402.05863) खरीदार केवल कथा में "इस सप्ताह खरीदने के लिए बेताब" चरित्र को अपनाता है, परिवर्तन के बिना जनरेटर की पेशकश करता है। क्या सौदा दर या भुगतान बदलता है?
- विचार श्रृंखला को लागू करें concealmentयदि आप गलती से इसे लीक करते हैं (चैनल को swapping करके सिमुलेट करें) तो क्या होता है?
- जब सभी बोली भंडार से अधिक हो जाती है, तो प्रबंधक सबसे कम कीमत और उच्चतम गुणवत्ता के बीच कैसे निर्णय लेता है? आप किस पुरस्कार नियम का चयन करते हैं और क्यों?
- हार्वर्ड वार्ता परियोजना मेट्रिक्स पर भट्टाचार्य और अन्य 2025 पढ़ें। विभिन्न शैलियों (आग्रवादी बनाम निष्पक्ष) के साथ दो सौदेबाजी लागू करें। सममित और असमित जोड़े के तहत भुगतान भिन्नता को मापें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Contract Net | "Task market" | Smith 1980, FIPA 1996. cfp + propose + accept/reject. The canonical task-market. |
| ZOPA | "Zone of possible agreement" | Overlap between buyer's max and seller's min. Offers outside it cannot close. |
| BATNA | "Best alternative to a negotiated agreement" | Your fallback if this deal fails. Sets your reservation price. |
| OG-Narrator | "Offer generator + narrator" | Decomposition: deterministic offer, LLM narration. |
| Zeuthen strategy | "Risk-minimizing concession" | Classical offer-generator that concedes based on risk limits. |
| Rubinstein bargaining | "Alternating-offer equilibrium" | Game-theoretic model for infinite-horizon bargaining with discounting. |
| CoT concealment | "Hide your reasoning" | Winners in arXiv:2503.06416 kept private scratchpads; public channel shows offer only. |
| Persona manipulation | "Emotional posturing" | arXiv:2402.05863: ~20% payoff gain from desperation/urgency personas. |
आगे पढ़ना
- NegotiationArena बेंचमार्क; व्यक्तित्व हेरफेर और शोषण के निष्कर्ष
- Measuring Bargaining Abilities of Language Models ओजी-नेरेटर और खरीदार-बिक्रेता से कठिन परिणाम
- Large-Scale Autonomous Negotiation Competition ~ 180k वार्ता; सोच-विचार श्रृंखला छिपाने की जीत
- LLM-Stakeholders Interactive Negotiation (NeurIPS 2024) गुप्त उपयोगिताओं के साथ बहु-पक्षीय स्कोर करने योग्य खेल
- Smith 1980 — The Contract Net Protocol क्लासिकल तंत्र, आईईईई कम्प्यूटर पर लेनदेन
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.