Phase 14: Agent Engineering

بحث و همکاری چند عامل

دو و همکاران (ICML 2024, "جماعه ذهن") نمونه های مدل N را اجرا می کنند که به طور مستقل پاسخ ها را پیشنهاد می کنند، سپس به طور تکراری از یکدیگر در دور های R انتقاد می کنند تا به هم نزدیک شوند. واقعیت، پیروی از قوانین، استدلال را بهبود می بخشد. توپولوژی Sparse در هزینه های رمزنگاری شده کامل میش را شکست می دهد.

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 14 · 12 (Workflow Patterns), Phase 14 · 05 (Self-Refine and CRITIC)

Time: ~60 minutes

اهداف یادگیری

  • پروتکل بحث را توضیح دهید: N پیشنهادات، R دورها، بر روی یک پاسخ مشترک به هم می رسند.
  • توضیح دهید که چرا بحث باعث بهبود واقعیت، پیروی از قوانین و استدلال می شود.
  • توپولوژی نادر را توضیح دهید: نه هر بحث کننده نیاز به دیدن یکدیگر دارد.
  • اجرای یک بحث stdlib بر روی یک LLM نوشته شده با انواع کامل میش و کمیاب؛ هزینه توکن در مقابل دقت اندازه گیری کنید.

مشکل

خود اصلاح (درسی 05) یک مدل است که خود را انتقاد می کند ریسک های گروه تفکر. CRITIC (درسی 05) انتقاد را در ابزارهای خارجی همیشه در دسترس نیست. بحث یک حالت سوم را معرفی می کند: چندین مورد، انتقادی متقابل، نزدیک شدن با اختلاف نظر.

مفهوم

جامعه ی ذهن ها (Du et al., ICML 2024)

  • نمونه های N به طور مستقل پاسخ به همان سوال را پیشنهاد می کنند.
  • در دور های R، هر مدل پیشنهادات دیگران را می خواند و آنها را انتقاد می کند.
  • مدل ها بر اساس انتقادات پاسخ خود را به روز می کنند.
  • پس از دور R، پاسخ متقابل را برگردانید.

آزمایش های اصلی از N=3، R=2 به دلیل هزینه استفاده می کردند. دقت با عوامل بیشتر و دور های بیشتر در مشکلات سخت (MMLU، GSM8K، اعتبار حرکت شطرنج، نسل بیوگرافی) بهبود می یابد.

ترکیب های مدل های مختلف بحث های مدل های تک را شکست می دهد: ChatGPT + Bard با هم > یا به تنهایی.

توپولوژی Sparse

"بهبودی در بحث چند عامل با توپولوژی ارتباطات Sparse" (arXiv:2406.11776, 2024-2025) نشان داد که بحث کامل همیشه مطلوب نیست. توپولوژی های Sparse ( ستاره، حلقه، مرکز و اسپوک) می توانند با دقت با هزینه های کمتر نشان داده شوند. هر بحث کننده فقط زیر مجموعه ای از همسالان را می بیند.

پیامدهای:

  • شبکه کامل N=5, R=3 = 5 × 3 = 15 پیشنهاد، هر خواندن 4 همسال = 60 انتقاد عملیات.
  • ستاره N=5، R=3 (یک مرکز + 4 اسپوک) = 15 پیشنهاد، اسپوک فقط مرکز را می خوانند = 12 عملیات انتقاد.

وقتی بحث کمک می کنه

  • Factuality.در طرح های مستقل، چک های متقابل توهم را کاهش می دهد.
  • Rule-following.اعتبار حرکت شطرنج یک مدل یک قانون را از دست می دهد، دیگران آن را می گیرند.
  • Open-ended reasoning.چند تا چارچوب به جواب درست محدود می شود.

وقتی بحث درد می کنه

  • Latency-sensitive UX.نکس آر سریال دورها تاخیر شما ممکن است نداشته باشید.
  • Cost-sensitive scale.نمرات N × R در هر سوال
  • Simple factual lookups.يه جستجوي ارزان تر از پنج بحثه

2026 نمونه های عملی

  • Anthropic orchestrator-workers(درسی 12) یک نوع بحث با یک مرحله سنتز.
  • LangGraph supervisor(درسه 13) روتر مرکزی + ماموران متخصص می توانند بحث را به عنوان یک گره اجرا کنند.
  • OpenAI Agents SDK(درسه 16) عوامل به سمت و عقب برای انتقاد تکراری منتقل می شوند.
  • Multi-agent evals بحث جفت + ارزیابی کننده- بهینه سازی برای سیگنال ارزیابی.

جایی که این الگوی اشتباه می شود

  • Convergence collapse.تمام ماموران با اولين جواب اشتباه همگام ميشن و با بازي هاي لازم اختلاف نظر رو کاهش ميدن
  • Hub failure.در توپولوژي ستاره اي، يه مرکز بد همه رو خراب ميکنه.
  • Prompt homogenization.همه عوامل از یک دستور کار مشابه استفاده می کنند؛ آنها پاسخ های مشابهی را تولید می کنند. از دستورات و/یا مدل های مختلف استفاده می کنند.

آن را بسازید

code/main.pyبحث های STDlib را اجرا می کند:

  • Debaterکلاس (در رشته های حقوق بشر با انحراف نظر هر مدبر)
  • FullMeshDebateوSparseDebateدوچرخه ها
  • سه سوال: یک سوال واقعیت، یک سوال مبتنی بر قوانین، یک سوال استدلال.
  • متریک: پاسخ متقابل، دور به متقابل، عملیات کل انتقاد

اجرا کن

python3 code/main.py

تولید: دقت و هزینه هر پروتکل؛ مطابقت کم در دو سوم سوالات با هزینه پایین تر.

ازش استفاده کن

  • Anthropic orchestrator-workersبرای بحث های ساده 2-3 کارگر.
  • LangGraphبرای بحث چند دور دولتی با چکپوینت
  • Customبرای تحقیقات یا تضمین های دقیقیت تخصصی.

-باده

outputs/skill-debate.mdیک بحث چند عامل با توپولوژی قابل تنظیم، N، R و یک قانون تقارب را فراهم می کند.

تمرینات

  1. اجرای قانون "اختلاف اجباری": در دور اول، هر مدبر باید یک پیشنهاد مشخص ارائه کند.
  2. اضافه کردن یک جمع بندی با وزن اعتماد: بحث کنندگان بازگشت (جواب، اعتماد) ؛ جمع کننده وزن با اعتماد. آیا این کمک می کند؟
  3. "منتخب"يکي را با نظر هاي مختلف به عنوان يک مدرک نامه ي مختلف تبديل ميکنه.
  4. هزینه توکن ها را برای کامل میش در مقابل کم بر روی 3 سوال خود اندازه گیری کنید. هزینه نقشه در مقابل دقت.
  5. مقاله ی انجمن ذهن ها رو بخونید. بازیک رو به N=5، R=3 منتقل کنید. چه وقفه ای؟ چه چیزی بهتر می شود؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Debate"Multi-agent critique"N proposers, R rounds of cross-critique, converge
Full mesh"Everyone reads everyone"Every debater reads every peer each round
Sparse topology"Limited peer view"Debaters read only a subset of peers
Hub-and-spoke"Star topology"One central debater, N-1 spokes read only the hub
Convergence"Agreement"Debaters converge on a shared answer
Society of Minds"Du et al. debate paper"ICML 2024 multi-agent debate method

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.