التصويت، التوافق الذاتي، وتوبولوجيا النقاش
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 07 (Society of Mind and Debate), Phase 16 · 14 (Consensus and BFT)
Time: ~75 minutes
المشكلة
يمكن للمناقشة تحسين دقة (Du et al., arXiv:2305.14325). يمكن أن تخفيضها أيضًا. ما إذا كان النقاش يساعد يعتمد على أربعة خيارات هيكلية:
- من يتحدث مع من (التوبولوجيا).
- كم عدد الجولات (Du 2023: كل من الجولات والوكلاء مهمة بشكل مستقل).
- ما إذا كان العوامل متفرقة (أنماط أساسية مختلفة تقطع الزراعة الواحدة).
- ما إذا كان هناك صوت معارض (الاصلب مقابل القش).
الفريق الذي "يدير 5 عملاء ويصوت" على مهمة غالبا ما يتراجع مقابل عميل واحد. الفشل ليس عشوائي. يتتبع التوضيح والتنوع. هذه الدروس هي خريطة التوضيح.
المفهوم
التوافق الذاتي، خط أساس نموذج واحد
وانغ وزملاء 2022 ("تتزامن الذات يحسن سلسلة التفكير") عينة نفس النموذج N مرات عند درجة حرارة > 0 والانتخابات الأغلبية على إجابات طريق التفكير. النتيجة على GSM8K: مكاسب كبيرة مع عينات N = 40 على رمز واحد طموح. التزامن الذاتي هو مقدم عامل واحد للتصويت متعدد الوكلاء.
الحد: التوافق الذاتي يستخدم نموذج أساسي واحد. تتصل الأخطاء بالبناء. إذا كان للنموذج تحيز منهجي، فإن جميع عينات N تشاركها.
التصويت متعدد الوكلاء، التوسع المتعدد
استبدل عينات N بـ N مختلفة العاملين. نماذج أساسية مختلفة (كلود، GPT، Llama) ، إشارات مختلفة، وصول مختلف للأدوات. الفائدة: الأخطاء غير المتصلة. التكلفة: العاملين المختلفين تكلف مبالغ مختلفة؛ وتنسيقهم يضيف التكلفة العامة.
الاسم القنوني لعام 2026 للنقاش المتعدد النوع هو A-HMAD النقاش المتعدد العاملات المتعددة المختلفة المتضاربة. ليس مقبولًا عالمياً، ولكن الأوراق تستخدم المصطلح "النقاش المختلف للنماذج، والذي يقلل من الأخطاء المتصلة من انهيار الحصص الموحدة".
الأماكن الأربعة
star chain tree graph
┌─A─┐ A─B─C─D ┌──A──┐ A───B
│ │ │ │ │ × │
B C B C D───C
│ │ / \ / \
D E D E F G (fully connected)نجم: مركز واحد، كلّ الآخرين يتحدثون فقط إلى المركز، يعادل المدير العامل دون قناة خلفية.
سلسلة: خطية، كل وكيل يرى خروجه السابقة.
شجرة: hierarchical، تستخدم من قبل أنظمة الوكلاء الهيراركية (دروس 06).
الرسم البياني: أي إلى أي. يحتوي على الطائفة المتصلة بالكامل والDAG التعسفي.
ضريبة التنسيق (MultiAgentBench)
MultiAgentBench (MARBLE، ACL 2025, arXiv:2503.01935) مقارنة النجم، السلسلة، الشجرة، الرسم البياني على مجموعة المهام بما في ذلك البحث، التشفير، والتخطيط. النتائج المقياسية الرئيسية:
- Graphحيث أن المعلومات تتدفق من أي مكان إلى أي مكان، ويمكن للعملاء انتقاد بعضهم البعض.
- Starينجح في المهام الفعلية السريعة الإجابة.
- Chainالفوز على خطوط الأنابيب المتدفقة (التكرير المتدريج).
- Coordination taxيظهر ما بعد 4 وكلاء في التطبيقات الجرافية.
السقف الـ 4 عملاء هو تجربي وليس أساسي. إنه يعكس قدرة سياق LLM 2026: يملأ سياق كل عميل بمخرجات زملاءه، ويقلل القيمة الهامشية لضافة العميل N + 1 بمجرد أن يتمكن الجميع من رؤية الجميع.
استراتيجيات النقاش متعددة الوكلاء ("هل يجب أن نصبح جنونيون؟")
arXiv:2311.17371 هو مسح 2023 للاستراتيجيات MAD. وجدت النتائج الرئيسية التي تم تكرارها من قبل آخرين: تغيرات MAD التي تشبه بناءًا التماسك الذاتي (التقاط العينات المستقلة + التجميع) غالبًا ما تكون أقل أداءً للتماسك الذاتي عند استخدام نفس الميزانية. يساعد MAD أكثر عندما يكون الوكلاء متجانسين حقًا والنقاش له بنية معادلة (يتناقض أحد الوكلاء).
الوكيلفيروس النماذج الناشئة
وكيل (ICLR 2024)https://proceedings.iclr.cc/paper_files/paper/2024/file/578e65cdee35d00c708d4c64bce32971-Paper-Conference.pdf) يستند إلى سلوكين ينشأون من النقاش المتعدد الوكلاء حتى دون تصميم صريح:
- Volunteer.يقوم وكيل بتقديم المساعدة ("يمكنني اتخاذ الخطوة التالية") دون تلقاء الإجراء. مفيد: فإنه يخصص العمل إلى وكيل الأكثر قدرة على القيام بمهمة فرعية.
- Conformity.وكيل يعدل موقفه لتتطابق مع النقاد، حتى عندما يكون النقاد مخطئا. هذا هو النقاش-مُتوازي بالانقسام (الدرس 14).
التوافق هو السبب في أن النقاش حتى التوصل إلى اتفاق يكافئ المضطربين.
التنوع النسبي: الزر الفعلي الذي يحرك دقة
نمط 2024-2026 في الأدب العملي: تبادل واحد من عوامل N الخاصة بك لنموذج أساسي مختلف يعطي ارتفاعًا أكبر في الدقة من زيادة N بمقدار 1.
في الحد، التعددية تفوق التعددية. ثلاثة نماذج مختلفة تفوق خمسة نسخ من نموذج واحد في معظم المهام التي لديها الحقيقة الأرض النظيفة.
أساليب هيئة المحلفين
إطار سيبيل (المستشهد في أدب مينسكي-LLM) يضبط "الهيئة المحلفة" مجموعة صغيرة من العملاء المتخصصين الذين يضخمون الإجابات عن طريق التصويت في كل مرحلة. على عكس التصويت الأغلبية العادية، لدى هيئة المحلفين أدوار: يقوم أحد العملاء بإجراء مقابلات، ويمنح أحدهم السياق، ويمنح أحدهم اعتبارًا. تعد أساليب هيئة المحلفين نقطة منتصفية بين التصويت العادي (رخيص ، متواضع للثقافة الواحدة) و MAD الكامل (غالي ، متواضع للتوافق).
عندما يهيمن التصويت مع المناقشة
- السؤال له حقيقة أساسية (الحقيقة والرياضيات وسلوك الرمز).
- يمكن للعوامل الوصول إلى مصادر أو أدوات مختلفة (تتوفر الاختلاف).
- الجولات محدودة (2-3 نموذجيا) وهناك قاض منفصل أو مؤكد.
- الميزانية تسمح بـ 3-5 وكيل، وبالنسبة للجرافات، يتهيمن ضريبة التنسيق على النطاق الخمس والسابع.
عندما يؤلم التصويت مع المناقشة
- السؤال شكله رأي، والعملاء يتقاربون إلى أي إجابة تبدو أكثر ثقة، وليس أكثر صحة.
- كل العملاء يشتركون في نموذج أساسي.
- الجولات لا حدود لها، التوافق يفوز في كل مرة
- المهمة بسيطة. وكيل واحد مع التوافق الذاتي عند N = 5 هو أرخص ودقيق.
بناءها
code/main.pyتطبيقات:
run_star(agents, hub, question)استطلاعات مركز لكل عامل، مجموعات.run_chain(agents, question)التطور المتسلسلrun_tree(root, children, question)تسلسل سلسلي مع جمع عمق-2.run_graph(agents, question, rounds)-المناقشة المشتركة، الجولات المحدودة- رقم التشابه المخطوط: كل وكيل لديه
error_biasيُشير إلى خطأها المنهجي. - حزمة قياس تعمل على كل توبوغية عند N=3، 5، 7 وتقرير (الدقة، مجموع_الرموز، ساعة الحائط_مُحاكاة).
أركض
python3 code/main.pyالناتج المتوقع: جدول من التطبيقات × N → (الدقة والرموز والتمدد). الفوز الرسم البياني عند N=3-5 على المهام في نمط البحث؛ الفوز النجم على المهام الفعلية السريعة؛ الرسم البياني عند N=7 يظهر ضريبة التنسيق (التأخير يتضخم أسرع من الدقة).
استخدمها
outputs/skill-topology-picker.mdهي مهارة تقرأ وصف المهمة وتوصي بتوبولوجيا (نجمة / سلسلة / شجرة / الرسم البياني) ، N (عدد العاملين) ، وملف التنوع المتعدد (نموذج أساسي لاستخدامها) ، وخط مستديرة.
أرسله
لأي مجموعة:
- ابدأ بـself-consistency at N=5يستخدم نموذج أساسي قوي واحد. إنه خط أساسي رخيص.
- تحديث إلى heterogeneous voting at N=3إذا كانت الدقة مهمة، قم بقياس الدلتا.
- فقط تحديث إلى debate topologyإذا كانت المهمة ذات بنية (البحث، متعددة الخطوات) ويمكن القيام بعمليات محددة.
- دائماً تسجيل مجموعة الأقليات عندما تكون الأقلية على حق دائمًا، لديك إشارة التنوع.
- "تدقيق أفضل بتكلفة 10 أضعاف" هو قرار تجاري.
التمارين
- أركض
code/main.py. رسم منحنى التنسيق- الضرائب لعلم الجراف: الدقة مقابل N، الرموز مقابل N. في أي N منحنى منحنى؟ - تنفيذ A-HMAD: ثلاثة عوامل مع تحيزات مختلفة عمدا. كيف يُقارن خط الأساس من التحيزات نفسها مع A-HMAD على هجوم الحصن الواحد من الدروس 14؟
- إضافة دور "القاضي" إلى أوضاع الرسم البياني التي لا تصوت، فقط تسجل الإجماع النهائي. هل هذا يغير سلوك التوافق الناشئ؟
- اقرأ ورقة AgentVerse (ICLR 2024). حدد السلوك الناشئ الذي يظهر فيه تنفيذك بشكل أقوى. هل يمكنك أن تجعل السلوك المعاكس من خلال تغيير سريع؟
- اقرأ MultiAgentBench (arXiv:2503.01935) القسم 4 (تجارب التطبيقات). قم بتكرار نتيجة "الجراف-فوز-البحث" على مهمة واحدة من الورق باستخدام الحزمة الخاصة بك.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Self-consistency | "Sample N times, vote" | Wang 2022. Single model, N temperature>0 samples, majority vote on reasoning paths. |
| Heterogeneity | "Different models" | Ensemble of different base models or prompt families. Breaks monoculture. |
| MAD | "Multi-agent debate" | Generic term for agents exchanging critiques over rounds. See Du 2023. |
| A-HMAD | "Adversarial Heterogeneous MAD" | MAD variant emphasizing different models + adversarial structure. |
| Topology | "Who talks to whom" | Star, chain, tree, graph. Determines information flow. |
| Coordination tax | "Diminishing returns" | Above ~4 agents on graph, cost grows faster than quality. |
| Volunteer behavior | "Unprompted help" | AgentVerse emergent pattern: an agent offers to take a step. |
| Conformity behavior | "Agreement under pressure" | AgentVerse emergent pattern: an agent aligns with a critic. |
| Jury | "Small specialized panel" | Sibyl-style ensemble with roles (examiner, context, scorer). |
المزيد من القراءة
- Wang et al. — Self-Consistency Improves Chain of Thought Reasoning خط أساس نموذج واحد
- Du et al. — Improving Factuality and Reasoning via Multiagent Debateكل من العاملين والجولات مهمة بشكل مستقل
- MultiAgentBench / MARBLE مقياس أساسي للتوبولوجي يظهر الرسم البياني الأفضل للبحث، سلسلة خطوط الأنابيب
- Should we be going MAD? مسح استراتيجية MAD؛ يجد MAD غالبا ما يفقد التوافق الذاتي عند ميزانية متساوية
- AgentVerse (ICLR 2024) أنماط تطوعية وموافقة الوضع الناشئة
- MARBLE repo تنفيذ مؤشر مرجعية
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.