Phase 14: Agent Engineering

النقاش والتعاون بين العديد من الوكلاء

دو وآخرون (ICML 2024, "Society of Minds") يديرون محاكمات نموذج N التي تقدم إجابات مستقلة ، ثم تنتقد بعضها البعض بشكل متكرر على مدار R للتقارب. يحسن الواقعية ، ويتبع القواعد ، والحكمة. تطبيق أوضاع التخلص يضرب الشبكة الكاملة على تكلفة الرمز.

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 14 · 12 (Workflow Patterns), Phase 14 · 05 (Self-Refine and CRITIC)

Time: ~60 minutes

أهداف التعلم

  • شرح بروتوكول المناقشة: N المقترحات، R الجولات، تتحرك على إجابة مشتركة.
  • أوضح لماذا يُحسن النقاش في التحقق من الحقائق، وتعقيد القواعد، والحكمة.
  • شرح التوضيحات النادرة: ليس كل من يناقش يحتاج إلى رؤية بعضهما البعض.
  • تنفيذ نقاشات متوقعة على ماجستير في العلوم القانونية المكتوبة مع مختلفات كاملة والنادرة؛ قياس تكلفة الرمز مقابل دقة.

المشكلة

النقاش الذاتي (درس 05) هو نموذج واحد ينتقد نفسه المخاطر التفكير الجماعي. CRITIC (درس 05) يستند النقد في الأدوات الخارجية ليست متوفرة دائما. يقدم النقاش وضع ثالث: حالات متعددة، النقد المتبادل، التقارب عن طريق الخلاف.

المفهوم

مجتمع العقول (Du et al., ICML 2024)

  • N النماذج تقترح بشكل مستقل إجابات على نفس السؤال.
  • خلال جولات R، يقرأ كل نموذج مقترحات الآخرين وينتقدها.
  • النماذج تحديث إجاباتها بناء على النقد.
  • بعد جولات R، أعد الإجابة المتقلبة.

استخدمت التجارب الأصلية N=3 ، R=2 بسبب التكلفة. تحسن الدقة مع المزيد من العاملين وأكثر جولات على المشاكل الصعبة (MMLU ، GSM8K ، اعتبار تحرك الشطرنج ، توليد السيرة الذاتية).

تجميعات النماذج المتعددة تفوق مناقشات النموذج الواحد: ChatGPT + Bard معا > إما وحدها.

أوضاع النفايات

أظهرت "تحسين النقاش متعدد الوكلاء مع توبولوجيات الاتصال المتدفقة" (arXiv:2406.11776, 2024-2025) أن النقاش المتدفق بالكامل ليس دائماً مثالياً. يمكن أن تتطابق توبولوجيات التدفق (النجم والحلقة والمركز والحلقة) دقة بتكلفة رمزية أقل. كل من يناقش يرى مجموعة فرعية من الأقران فقط.

الآثار:

  • شبكة كاملة N=5، R=3 = 5 × 3 = 15 مقترح، كل قراءة 4 أقرانه = 60 عملية انتقاد.
  • النجم N=5، R=3 (مركز واحد + 4 محاور) = 15 مقترحات، محاور تقرأ فقط الركز = 12 عمليات النقد.

عندما يساعد النقاش

  • Factuality.في المقترحات المستقلة، التحقق المتقاطع يقلل من الهلوسة.
  • Rule-following.صحيحة حركة الشطرنج نموذج واحد يفوت قاعدة، الآخرين يلتقطونها.
  • Open-ended reasoning.الإطارات المتعددة تقصر على الإجابة الصحيحة.

عندما يؤلم النقاش

  • Latency-sensitive UX.إطلاق الرصاصات المتسلسلة N × R هو تأخر قد لا يكون لديك.
  • Cost-sensitive scale.رموز N × R لكل سؤال
  • Simple factual lookups.بحث واحد أرخص من خمس مناقشات

2026 المواقع العملية

  • Anthropic orchestrator-workers(دروس 12) نوع واحد من النقاش مع خطوة التوليد.
  • LangGraph supervisor(دروس 13) الجهاز التوجيه المركزي + وكلاء متخصصين يمكن أن تنفيذ النقاش كعقدة.
  • OpenAI Agents SDK(درس 16) العاملين يقدمون اليدين للأمام والخلف للنقد المتكرر.
  • Multi-agent evals نقاش الزوج + تحسين المقيّم لإشارة التقييم.

حيث يذهب هذا النمط خطأ

  • Convergence collapse.جميع العملاء يتجمعون على الإجابة الخاطئة الأولى، ويتخففون من ذلك مع الجولات المطلوبة
  • Hub failure.في التوضيح النجمي، مركز سيء يفسد الجميع، أدوّر أو استخدم مركزين متعددين.
  • Prompt homogenization.جميع الوكلاء يستخدمون نفس الإشارة؛ فإنهم ينتجون نفس الإجابات. يستخدمون العديد من الإشارات و/أو النماذج.

بناءها

code/main.pyتنفيذ نقاش STDlib:

  • Debaterالفئة (مدرسة القانون المكتوبة مع الانحراف من رأي المناقش).
  • FullMeshDebateوSparseDebateالسباقين
  • ثلاثة أسئلة: واحدة حقيقية، واحدة قائمة، واحدة منطقية.
  • المقاييس: الإجابة المتقلبة، الجولات إلى التقارب، العمليات الإجمالية النقدية.

إشغله

python3 code/main.py

الناتج: دقة وتكلفة لكل بروتوكول؛ تطابقات نادرة كاملة على 2/3 من الأسئلة بتكلفة أقل.

استخدمها

  • Anthropic orchestrator-workersمن أجل نقاشات عمال بسيطة
  • LangGraphمن أجل النقاش المتعدد الجولات مع التفتيش.
  • Customلبحث أو ضمانات الدقة المتخصصة.

أرسله

outputs/skill-debate.mdيضع النقاش متعدد الوكلاء مع أوضاع قابلة للتكوين، N، R، وقاعدة التقارب.

التمارين

  1. تنفيذ قاعدة "اختلاف قسري": في الجولة الأولى، يجب على كل من يناقش تقديم اقتراح متميز.
  2. إضافة جمع معزز الثقة: المناقشات العودة (الرد، الثقة) ؛ مجموعات معزز الثقة. هل يساعد؟
  3. تغيير "وكيل" واحد لخطوط مختلفة ماجستير في العلوم مع آراء مختلفة. هل التنوع المختلفة تحسين الدقة؟
  4. قياس تكلفة الرمز للشبكة الكاملة مقابل النقص على أسئلةك الثلاثة.
  5. اقرأ ورقة مجتمع العقول. نقل لعبة إلى N = 5، R = 3. ما هو الراحة؟ ما يحصل على أفضل؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
Debate"Multi-agent critique"N proposers, R rounds of cross-critique, converge
Full mesh"Everyone reads everyone"Every debater reads every peer each round
Sparse topology"Limited peer view"Debaters read only a subset of peers
Hub-and-spoke"Star topology"One central debater, N-1 spokes read only the hub
Convergence"Agreement"Debaters converge on a shared answer
Society of Minds"Du et al. debate paper"ICML 2024 multi-agent debate method

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.