مجتمع العقل والنقاش متعدد الوكلاء
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 04 (Primitive Model)
Time: ~60 minutes
المشكلة
التوافق الذاتي عينة نموذج واحد عدة مرات واتخاذ إجابة الأغلبية هو أرخص تحسين التفكير يمكنك التمسك به. يعمل ، لكنه يشبث بسرعة. يمكنك مضاعفة عيناتك ولا ترى قفزة أخرى ذات مغزى.
ينفذ النقاش الشبع. بدلا من عينات مستقلة N من نموذج واحد، يقرأ عوامل N منطق بعضهم البعض ومراجعته. تنخفض العلاقة بين عينات (لم تعد أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية أية
المفهوم
خوارزمية Du et al. 2023
من arXiv:2305.14325 (ICML 2024):
- كل من العاملين N يقدم إجابة أولية على السؤال.
- بالنسبة لدورة r = 2..R: يتم عرض إجابات الجولة r-1 للعملاء الآخرين لكل وكيل وسؤال "اعتبارًا لهذه ، أعط إجابتك المحدثة".
- بعد جولات R، التصويت بأغلبية الإجابات النهائية.
الاختبارات الورقية على MMLU، GSM8K، السيرة الذاتية، MATH، ومعايير الواقعية. النقاش يتفوق باستمرار على CoT و Self-Reflection.
اثنان من القفاصات المستقلة
الإستثمارات من نفس الورقة:
- Agent count alone(جولة واحدة، أغلبية الأصوات من N) يفوز العامل الواحد في معظم المهام، ولكن مستويات.
- Round count alone(العامل 1 يرى التفكير السابقة الخاصة به) بالكاد يساعد الضعف المعروف للاستعراض.
- Both togetherيسبب القفزات الكبيرة. التبادل المتعدد الجولات بين وكلاء متعددين يقود الربح.
لماذا يعمل
آليات:
- Exposure to disagreement.عندما يرى وكيل سلسلة التفكير الوكيل الآخر بإنتهاء مختلف، فإنه يجب أن يبرر أو يحدد. بأي حال من الأحوال، فإن السياق لدور r + 1 أكثر غنى من دور r.
- Correlated error reduction.في التوافق الذاتي، تأتي جميع العينات من نفس النموذج، لذلك تتصل الأخطاء تتصل متوسطك إلى إجابة خاطئة بشكل مؤكد. تتناقض النماذج المختلفة أو البذور المختلفة. تتناقض وجهات النظر المختلفة المناقشة بشكل أكبر.
النقاش المتباين
تستخدم A-HMAD والمتابعات ذات الصلة نماذج أساسية مختلفة للعوامل المختلفة. يقلل مناقشة Llama + Claude + GPT من انهيار الزراعة الواحدة (الدرس 26) لأن الأخطاء المتصلة لعائلة نموذج واحدة لا تشاركها الآخرون.
الجانب السلبي: يمكن أن يسحب نموذج ضعيف يشارك في نقاش الاتفاق نحو إجابته الخاطئة (انظر "هل يجب أن نصبح جنونيون؟" arXiv:2311.17371).
NLSOM تمديد 129-الوكيل
"تفاجرات العقل في مجتمعات العقل القائمة على اللغة الطبيعية" arXiv:2305.17066) ، قاموا بتوسيع هذه الفكرة إلى مجتمعات تتكون من 129 عضوًا. النتيجة: ظهور التخصص والتنظيم الذاتي مع النطاق ، ويتجاوز النظام عاملًا واحدًا في المهام مثل الإجابة على الأسئلة البصرية.
أساليب الفشل
- Sycophancy cascade.كل العملاء يتأخرون على أي عميل يبدو أكثر ثقة. ينهار النقاش إلى أصوات أكثر صوتًا. يساعد التشجيع على أدوار معادلة ("يجب على أحد العملاء أن يجادل في الموقف المضاد").
- Topic drift.النقاشات على عدة جولات تنتقل عن السؤال الأصلي التخفيف: إعادة حقن السؤال في كل جولة.
- Compute blowup.N وكلاء × R جولات = N·R LLM دعوات، كل منها مع سياق ينمو. 5 وكلاء، 5 جولات مناقشة هو 25 دعوة في سياق ينمو. تكلفة لكل سؤال يمكن أن تتجاوز 10 × دعوة واحدة CoT.
بناءها
code/main.pyيدير نقاش 3 وكلاء × 3 جولات على سؤال رياضي حيث يبدأ كل وكيل بإجابة مختلفة (ربما خاطئة). يتم كتابة وكلاء كل "تحديثات" عن طريق متوسط إجابات الجيران التي تزن ثقة مكتوبة. يمكن رؤية التقارب في سجل الدورية.
الظهور يظهر اثنين من الآثار الرئيسية:
- جولة واحدة من التبادل تحرك العملاء أقرب إلى الإجابة الصحيحة.
- الجولات الإضافية التي تُجري بعد الجولة الثانية تظهر تراجع العائدات (تطابق مع مستوى دو وآخرين).
أركض
python3 code/main.pyاستخدمها
outputs/skill-debate-configurator.mdيضع النقاش على مهام جديدة: عدد الوكلاء، عدد الجولات، التنوع (النموذج نفسه مقابل المختلط) ، وتعيين الدور (التوافق ضد واحد-الخصم). كما يقدر التكلفة الرمزية قبل التجهيز.
أرسله
إذا كنت ترسل النقاش:
- Cap rounds at 3.دو وآخرون يظهرون 3 جولات تلتقط معظم المكاسب أكثر من التكلفة وليس الجودة
- Cap agents at 5.وراء 5، يهيمن التضخم السياقي والتكلفة.
- Heterogeneous by default.على الأقل نموذجين مختلفين في المسبح
- Adversarial slot.أحد العملاء أجبره على عدم الاعتقاد بغض النظر عن ذلك، يقطع التشنج
- Log every round.لا يمكن إصلاح أو تدقيق أنظمة النقاش التي تخفي جولات متوسطة.
التمارين
- أركض
code/main.pyثم تعديل عدد الجولات إلى 5 ومشاهدة انخفاض العائد. في أي جولة يتوقف التقارب الإضافي؟ - إضافة عامل رابع ذو دور معادلة: دائماً ما يختلف مع الأغلبية الحالية. هل هذا يكسر أو يحسن التقارب؟
- خطة (طباعة) درجة الاتفاقية لكل جولة (فصلا من الوكلاء على إجابة الأغلبية). متى يصل إلى 1.0 وهل هذا يعادل "صحيح"؟
- اقرأ دو وآخرين القسم 4 إزالة. كرر "مُجرم فقط" مقابل "مُجرم فقط" مقابل "كلا" النتيجة باستخدام هذا الرمز.
- اقرأ "هل يجب أن نصبح جنونيون؟" (arXiv:2311.17371) وذكر نوعين من النقاشات خارج دورة الاختبار على سبيل المثال، القضاة، سلسلة من النقاش، العدائية.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Society of Mind | "Minsky's idea" | Intelligence as interacting specialists; 1986 framing now operationalized via LLM debate. |
| Multi-agent debate | "Agents argue" | N agents propose, critique each other, revise over R rounds, majority-vote. |
| Consensus | "They agree" | Not epistemic truth — just fraction-on-majority-answer. Can be confidently wrong. |
| Rounds | "Exchange steps" | One round = each agent reads the others and updates once. |
| Heterogeneous debate | "Mix model families" | Using different base models to decorrelate errors. |
| Sycophancy cascade | "Everyone agrees with the loud one" | Debate failure where agents defer to the most confident agent regardless of correctness. |
| NLSOM | "129-agent society" | Natural-language society of mind; Zhuge et al.'s scaled version. |
| Correlated error | "Same model, same bug" | Why self-consistency saturates; debate across different views decorrelates. |
المزيد من القراءة
- Du et al. — Improving Factuality and Reasoning in Language Models through Multiagent Debate ورقة مرجعية، ICML 2024
- Zhuge et al. — Mindstorms in Natural Language-Based Societies of Mind 129-وكيل NLSOM
- Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs النقاشات المتغيرة
- Debate project page رمز دو وآخرين، و التفاصيل التجريبية، و التفاصيل التجريبية
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.