مذاکره و مذاکره
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 02 (FIPA-ACL Heritage), Phase 16 · 09 (Parallel Swarm Networks)
Time: ~75 minutes
مشکل
دو عامل باید در مورد قیمت توافق کنند. با پیام های زبان خالص، LLM 2024-2026 با نرخ های شگفت انگیز پایین (~27٪ در معاملات پارامترهای محکم در arXiv:2402.15813) معامله را بسته اند. مقیاس آن را ثابت نمی کند: GPT-4 از نظر ساختاری در مذاکره بهتر از GPT-3.5 نیست؛ در زبان مذاکره بهتر است.
مسئله اصلی این است که LLM دو شغل را ترکیب می کند تصمیم گیری در مورد پیشنهاد و روایت کردن پیشنهاد. OG-Narrator این موارد را جدا کرد: یک ژنراتور پیشنهاد تعیین کننده حرکات عددی را محاسبه می کند؛ LLM فقط روایت می کند. نرخ معامله به ~89٪ می رسد.
این نشان دهنده یک یافته کلاسیک چند عامل است: جدا کردن مکانیسم از لایه ارتباطی برنده می شود. پروتکل شبکه قرارداد (FIPA، 1996; اسمیت، 1980) مکانیسم بازار کار مرجع است. یک LLM را به سمت روایت وصل کنید و شما یک بازار کار مدرن LLM را دریافت می کنید.
مفهوم
قرارداد شبکه، در یک پاراگراف
پروتکل شبکه قرارداد اسمیت 1980:managerپخش می کندcall for proposals (cfp).biddersپاسخ بدهproposeپيام هاي شامل پیشنهاداتشون، مدیر برنده اي را انتخاب ميکنه و ارسال ميکنه accept-proposalبه برنده وreject-proposalبه بازنده ها، برنده کار رو انجام ميده پيام اختیاري:refuse(مقدمه دهنده از پیشنهادش رد می کند) FIPA این را به عنوانfipa-contract-netپروتکل تعامل
چرا او جی-نرويگر برنده شده
"مقياس توانایی های مذاکره در مدل های زبان" (arXiv:2402.15813) اظهار داشت که:
- LLM ها اغلب قوانین مذاکره را نقض می کنند (به قیمت های بی معنی پیشنهاد می کنند، ZOPA طرف مقابل را نادیده می گیرند).
- آنها ضعیف است (تعارف های اولیه را قبول می کنند؛ پیشنهادات مقابل در مقادیر نمادین به جای استراتژیک).
- مقیاس به تنهایی این مشکلات را حل نمی کند. مدل های بزرگتر زبان را با خطای استراتژیک مشابه قابل قبول تر می کنند.
تجزیه OG-Narrator:
┌──────────────────┐ ┌──────────────────┐
state → │ offer generator │ price → │ LLM narrator │ → message
│ (deterministic) │ │ (writes the │
│ │ │ human-style │
└──────────────────┘ │ accompaniment) │
└──────────────────┘تولید کننده پیشنهادات یک استراتژی مذاکره کلاسیک است: یک مدل مذاکره روبینشتین، یک استراتژی زوتن یا یک قیمت ساده. LLM روایت می کند. پیام حاوی قیمت تعیین کننده و چارچوب زبان طبیعی است.
نرخ معامله بالا مي رود چون:
- قیمت ها در منطقه مذاکره باقی می مانند.
- لنگرها استراتژیک هستند نه عاطفی
- ماجستريايي اون کاري که ميخواد انجام ميده: نوشتن.
مذاکرهآرینا یافته ها
arXiv:2402.05863 معیار قانونی را ارائه می دهد.
- LLM ها می توانند با استفاده از personas (من از فروش این کار تا جمعه) ، پاداش را به ۲۰٪ بهبود بخشند.
- عوامل عادلانه/تعاونی توسط عوامل مخالف مورد بهره برداری قرار می گیرند؛ دفاع نیازمند تعدیل صریح است.
- جفت بندی های همترازی در حدود 40 درصد سناریوهای معیار به نتایج نابرابری نزدیک می شوند.
این "LLM ها مذاکره کننده های بد نیستند" نیست. این "LLM ها مثل انسان ها مذاکره می کنند، از جمله بخش های استثمار پذیر".
پنهان کردن زنجیره ی افکار
رقابت بزرگ مذاکره مستقل (arXiv:2503.06416) در بسیاری از استراتژی های LLM حدود 180 هزار مذاکره را انجام داد. برنده ها استدلال خود را از همتایان خود پنهان کردند:
- اگه يه مامور چاپ کنه "من فقط مي رم به$75; my reservation price is $70" به يه کلاهک سرشويي که براي عموم قابل مشاهده باشه، مخالفش ميخواد
- برنده ها استراتژی را به صورت خصوصی محاسبه می کنند؛ کانال خروجی فقط شامل پیشنهاد و حداقل روایت مورد نیاز است.
این یک بازگشت 2026 از نظریه بازی کلاسیک (Aumann 1976 در مورد عقلانیت و اطلاعات) است: آشکار کردن هزینه های ارزیابی خصوصی شما پرداخت. LLM ها این را حس نمی کنند و با خوشحالی رزروهای خود را در ردیف استدلال می نویسند که برای همتایان قابل مشاهده می شوند.
استفاده از مهندسی: زمینه سکرتچ پد خصوصی را از زمینه پیام عمومی جدا کنید.
بختاچاریا و همکارانش در سال 2025 رتبه بندی مدل
در مورد متریک های پروژه مذاکره هاروارد (مفروضات مذاکره، احترام به BATNA، متقابل بودن منافع):
- Llama-3در معامله ها (سعر معامله + پرداخت) موثرتر بود.
- Claude-3به نظر می رسد که این موضوع در مورد این موضوع بسیار مهم است.
- GPT-4عادلانه ترین (کمترین تفاوت در پرداخت در هر جفت بندی) بود.
این یک عکس فوری سال 2025 است. نکته این نیست که کدام مدل در آوریل 2026 برنده می شود. این است که مدل های پایه مختلف سبک های مذاکره پایدار دارند. مجموعه های متناوب (درس 15) این را به عنوان منبع تنوع در نظر می گیرند.
توزیع وظایف از طریق قرارداد شبکه + LLM
استفاده مجدد مدرن از شبکه قرارداد برای LLM چند نماینده:
- مامور مدير يک کار رو به واحده ها تجزیه ميکنه
- پخش ها
cfpبا شرح وظیفه به ماموران کارگر - هر کارگر يه پیشنهاد رو باز مي کنه:
(price, eta, confidence)که قیمت آن ها می تواند توکن ها، واحد های محاسباتی یا دلار باشد. - مدیر برنده ها (یک یا چند نفر، بسته به وظیفه) و جایزه ها را انتخاب می کند.
- کارگران رد شده آزاد هستند تا در سایر وظایف پیشنهاد دهند.
این مقیاس بیش از 100 کارگر است زیرا هماهنگی پخش و پاسخ است، نه چت همغږي. در تولید استفاده می شود: الگوهای آرکیستراسیون Microsoft Agent Framework، برخی از پیاده سازی های LangGraph.
مذاکره تعاملی شرکت های ذینفع
NeurIPS 2024 (https://proceedings.neurips.cc/paper_files/paper/2024/file/984dd3db213db2d1454a163b65b84d08-Paper-Datasets_and_Benchmarks_Track.pdf) بازی های چند طرفی را معرفی می کند که با secret scoresوminimum-acceptance thresholdsهر طرف ذینفع دارای خدمات عمومی خصوصی است؛ LLM باید از پیام ها نتیجه گیری کند. این یک کلی سازی دو طرفه مذاکره به تشکیل ائتلاف N-پارتی است. برای بازارهای وظیفه تولید با توانایی های مختلف کارگران مرتبط است.
قانون روایت در مقابل مکانیسم
در تمام معیار های مذاکره 2024-2026، قانون مهندسی ثابت این است:
اجازه بده که ماجراجویی داستان رو بگيره. اجازه نده که ماجراجویی پیشنهاد رو محاسبه کنه.
اگر پیشنهاد نیاز به یک عدد (قیمت، ETA، مقدار) باشد، آن را از حالت مذاکره تعیین کننده تولید کنید و LLM را مجبور کنید که چارچوب را تولید کند. اگر پیشنهاد نیاز به یک ساختار پیشنهادی (شکستن وظایف، اختصاص نقش) باشد، اجازه دهید LLM آن را تهیه کند، اما قبل از ارسال آن را با یک طرح و محدودیت تایید کند.
آن را بسازید
code/main.pyابزار:
ContractNetManager،ContractNetTask،Bidمدیر + داوطلبان، پخش cfp، جمع آوری پیشنهادات، جایزه.og_narrator_bargain(state, rng)خریدار OG-Narrator: امتیازات تعیین کننده به سبک Zeuthen به سمت نقطه وسط.seller_response(state, rng)سیاست ضد پیشنهاد فروشنده تعیین کننده (حقایق ساختاری برای هر دو سبک).naive_llm_bargain(state, rng)شبیه ساز یک معامله گر تمام LLM: قیمت ها را با تفاوت بالا انتخاب می کند، اغلب خارج از ZOPA.- اندازه گیری: نرخ معامله بیش از 1000 آزمایش با قیمت رزرو تازه در هر آزمایش نمونه گیری شده است.
راه رفتن:
python3 code/main.pyمحصول انتظار می رود: نرخ سوده های بی سواد LLM ~ 65-75%؛ نرخ سوده های OG-Narrator ~ 85-95%؛ فاصله 15-25 نقطه مزیت ساختاری تجزیه نسل پیشنهاد از روایت است. به علاوه یک مثال تخصیص بازار کار Net قرارداد با سه داوطلب و یک کار.
ازش استفاده کن
outputs/skill-bargainer-designer.mdطراحی پروتکل مذاکره: چه کسی پیشنهادات (دترمینستی یا LLM) را تولید می کند، چه کسی روایت می کند، چگونه سکرتچپد های خصوصی از پیام های عمومی جدا می شوند و چگونه نرخ معاملات نظارت می شود.
-باده
فهرست چک مذاکره تولید:
- Separate scratchpad.دولت خصوصی هرگز به زمینه مقابلش نمی رسد. این غیر قابل مذاکره است.
- Deterministic offer generation.قیمت ها، مقدار ها، زمان رسانی: محاسبه کنید، درخواست نکنید.
- Validate all incoming offersدر حدود پروتکل پیشنهادات خارج از زوبای را رد کنید.
- Bound rounds.حداکثر 3-5 تا گلوله، در حالت تعطیلی به واسطه بروند
- Measure deal rate and payoff varianceنرخ سود کاهش یافته نشانه ای است اغلب حرکت سریع یا حمله طرف مقابل.
- Log all rejected proposalsبراي مدیران شبکه قرارداد، داوطلبان بازنده بايد بفهمن چرا
تمرینات
- فرار کن
code/main.pyتایید کن که او جی-ناریتر از بی منطق و بی منطق در نرخ معامله بر میره - اجراpersona-based payoff improvement(arXiv:2402.05863) خریدار یک شخصیت "آمیز به خرید این هفته" را در روایت فقط اتخاذ می کند، ارائه ژنراتور بدون تغییر. آیا نرخ معامله یا پرداخت تغییر می کند؟
- زنجیره فکر رو اجرا کنconcealment: نگه داشتن یک رشته سکرتچ پد خصوصی که به همتایان منتقل نمی شود. چه اتفاقی می افتد اگر به طور تصادفی آن را نشتید (به تغییر کانال ها شبیه سازی کنید) ؟
- در این مورد، اگر قیمت قرارداد خالص را به قیمت ذخیره ای افزایش دهید، مدیر چگونه بین کمترین قیمت و بالاترین کیفیت تصمیم می گیرد؟
- بختاچاریا و همکارانش را در سال 2025 در برگه های پروژه مذاکره هاروارد بخوانید. دو معامله گر با سبک های مختلف (عداوت آمیز در مقابل عادلانه) را اجرا کنید. تفاوت پرداخت را تحت جفت بندی های هم تراز و غیر هم تراز اندازه گیری کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Contract Net | "Task market" | Smith 1980, FIPA 1996. cfp + propose + accept/reject. The canonical task-market. |
| ZOPA | "Zone of possible agreement" | Overlap between buyer's max and seller's min. Offers outside it cannot close. |
| BATNA | "Best alternative to a negotiated agreement" | Your fallback if this deal fails. Sets your reservation price. |
| OG-Narrator | "Offer generator + narrator" | Decomposition: deterministic offer, LLM narration. |
| Zeuthen strategy | "Risk-minimizing concession" | Classical offer-generator that concedes based on risk limits. |
| Rubinstein bargaining | "Alternating-offer equilibrium" | Game-theoretic model for infinite-horizon bargaining with discounting. |
| CoT concealment | "Hide your reasoning" | Winners in arXiv:2503.06416 kept private scratchpads; public channel shows offer only. |
| Persona manipulation | "Emotional posturing" | arXiv:2402.05863: ~20% payoff gain from desperation/urgency personas. |
خواندن بیشتر
- NegotiationArena شاخص مرجع؛ یافته های دستکاری و بهره برداری از شخصیتی
- Measuring Bargaining Abilities of Language Models OG-Narrator و نتیجه خریدار سخت تر از فروشنده
- Large-Scale Autonomous Negotiation Competition ~ 180 هزار مذاکره؛ پنهان کردن زنجیره فکر برنده می شود
- LLM-Stakeholders Interactive Negotiation (NeurIPS 2024) بازی های چند طرفه ای با ابزار مخفی
- Smith 1980 — The Contract Net Protocol مکانیسم کلاسیک، معاملات IEEE در کامپیوتر
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.