Phase 16: Multi-Agent & Swarms

التخصص في الدور الخطيط ، النقاد ، المنفذ ، المؤكد

تدمير أكثر العمليات شيوعاً في عام 2026: يقوم وكيل واحد بتخطيط، ويقوم أحد بتنفيذ، ويقرر أو يصدق أحد. يعلن MetaGPT (arXiv:2308.00352) هذا على أنه SOPs مشفرة في طلبات الدور مدير المنتجات، المعماري، مدير المشاريع، المهندس، مهندس QA التالي Code = SOP(Team). . . تشاتديف (arXiv:2307.07924) سلسلة المصمم، المبرمج، المراجع، الاختبار من خلال "سلسلة دردشة" مع "التخفيف التواصلية" (المسؤولين يطلبون صراحة التفاصيل المفقودة). المحقق تحمل الحمل: Cemri et al. (MAST، arXiv:2503.13657) يظهر كل فشل متعددة الوكلاء يمكن أن تتبع إلى اختفاء أو خرق التحقق. أبلغت شركة PwC عن زيادة دقة 7 × (10٪ → 70٪) من حلقات التحقق المهيكلة في CrewAI.

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 16 · 04 (Primitive Model), Phase 16 · 05 (Supervisor)

Time: ~60 minutes

المشكلة

النظم الجينرية متعددة الوكلاء تنتج نتائج عامة. ثلاثة مبرمجين في دردشة جماعية يكتبون ثلاثة طعم من نفس الرمز المتوسط. يمكنك إضافة المزيد من العاملين، إضافة المزيد من الجولات، ولا تزال لا تتجاوز عتبة الجودة.

الإصلاح ليس أكثر من العاملين هو مختلفة العاملين. تعيين أدوات مختلفة. أعط الأدوات النقدية المخطط ليس لديها. أعط التحقق مجموعة اختبار موضوعية. الآن النظام لديه خلاف داخلي مع التصحيح المأساسي، وليس مجرد تخمين متوازي.

المفهوم

الأدوار القنونية الأربعة

Planner.يقرأ الهدف، ويُنتج قائمة خطوات أو مواصفات أدوات: استرداد المعرفة، وثائق. الناتج: خطة مُهيّنة.

Executor.يقرأ خطة خطة واحدة في كل مرة، ويُنتج الفن. الأدوات: أدوات العمل الفعلية (مُجمّع الكود، قذيفة، عميل API). الخروج: الفن.

Critic.يقرأ الناتج من المنفذ ضد نية المخطط. أدوات: الوصول القراءة فقط إلى الفن، التحليل الدوري. الناتج: قبول / رفض مع الأسباب.

Verifier.يقرأ الفن ويقوم بفحص تحديد. أدوات: متجربة، فحص النوع، مؤكدة النظام. الناتج: الإجازة / الفشل مع الأدلة.

النقاد هو موضوعي، رأي، غالباً ما يستند إلى LLM. المؤكد هو موضوعي، محدد، غالباً ما يستند إلى الرمز.

نمط SOP من MetaGPT

يرمز MetaGPT (arXiv:2308.00352) SOPs الهندسة البرمجية كطلبات الدور:

  • Product Managerيكتب الـ "PRD".
  • Architectيُنتج تصميم النظام.
  • Project Managerتقسيم المهام
  • Engineerأدوات
  • QA Engineerيدير اختبارات

كل دور لديه مخطط تدخل / خروج صارم. يذكر عرض الدور ما هو الدور * و ما يجب أن ينتج.Code = SOP(Team)صياغة تحويل SOPات تحديدية فريق من LLM إلى خط أنابيب يمكن التنبؤ به.

إنّه من خلال تشاتديف

يضيف ChatDev خطوة رئيسية: عندما يحتاج المنفذ إلى تفاصيل محددة لم تكن في الخطة، فإنه يسأل صراحة المصمم قبل الاستمرار. هذا يمنع فشل LLM الكلاسيكي في اختراع التفاصيل بشكل معقول.

التنفيذ: تشمل طلب الدور "عندما تحتاج إلى معلومات محددة لم تعطيها، اسأل الدور المعني باسم قبل إنتاج الناتج".

لماذا المؤكد مهم جداً

قام Cemri et al. (MAST) بتتبع 1642 فشل في تنفيذ وكالة متعددة. كانت 21.3% ثغرات التحقق أرسل النظام إجابة لم يحقق من أي أحد. وغالبا ما يعود الباقي 79% إلى "كان هناك عملية التحقق التي فشلت بصمت أو لم يتم تشغيلها أبدا". التحقق هو الدور المحمل.

ذكرت PwC (تطبيقات CrewAI ، 2025) أن إضافة حلقة تأكيد مهيكلة قد نقلت دقة من 10% إلى 70%.

النقدي مقابل المؤكد

  • النقاد هو ماجستير في العلوم في مجال التعليمات العليا يراجعون أثاثاً من أجل الجودة، موضوعيّة، يمكن خداعها بالنثر المُصدق.
  • المحقق هو برنامج تحديدية يعمل على الأثاث. هدف. يعطي اختصار / فشل مع الأدلة.

استخدم كلاً منهما. يلتقط النقدي مشاكل الذوق التي لا يستطيع المؤكد التعبير عنها. المؤكد يلتقط الأخطاء التي لا يستطيع النقدي رؤيتها لأنها تظهر فقط في وقت تشغيل.

النمط المضاد

كل دور في نظامك هو ماجستير في إدارة الأعمال والخروج من كل دور هو "يبدو لي جيدا". وضع فشل MAST الكلاسيكي. أضف على الأقل مؤكداً واحد يتم تحديد مرور / فشل من خلال الرمز ، وليس من قبل ماجستير في إدارة الأعمال.

خرائط الإطار

  • CrewAI Agent(role, goal, backstory)هو سطح تخصص الكتب المدرسية.
  • LangGraph يمكن أن يكون لدى العقد إشارات متخصصة؛ الحواف تفرض خط الأنابيب.
  • AutoGen عملاء قابلين للحوار محددين للدور مع أسماء كلمة واحدة في مجموعة المحادثة.
  • OpenAI Agents SDK أدوات التبادل بين العملاء المتخصصين في الدور.

بناءها

code/main.pyينفذ خط أنابيب 4 أدوار يبنيه وظيفة Python بسيطة:

  • Plannerيُنتج المُضمون.
  • Executorيخلق سلسلة رمزية.
  • Critic(مُحاكاة (LLM) تُظهر مشاكل واضحة
  • Verifierيدير الرمز المولد في صندوق رمل (exec) ضد حالة تجريبية.

يتم تشغيل Demo مرتين: مرة حيث ينتج المنفذ رمزًا صحيحًا (المتحقق + المحقق يمر كلاهما) ، مرة حيث ينتج المنفذ رمزًا غير محدد (يتغيب المحقق عن الخطأ لأنه يبدو معقولاً ، ويصطحبه المحقق لأن الاختبار يفشل).

أركض

python3 code/main.py

استخدمها

outputs/skill-role-designer.mdيقوم بتحديد المهام ويقوم بتحديد قائمة الأدوار (3-5 أدوار) ، وخطط الدخول / الخروج لكل دور، وفق الفحص. استخدم هذا قبل أن يتم وضع وكلاء السلك في إطار.

أرسله

قائمة التحقق:

  • At least one deterministic verifier.أبداً كلّاً
  • Explicit I/O schema per role.المخطط يعيد المفردة، وليس النص؛ ويقرأ المنفذ تلك النظام.
  • Communicative dehallucination.يجب على المُجرم أن يسأل المخطط متى تفتقر المعلومات، لا تختلقها أبداً.
  • Critic/verifier ordering.أطلق النقدي أولاً (رخيصاً، يلتقط مشاكل التصميم) ، والتحقق الثاني (ببطء، يلتقط الأخطاء).
  • Loop budget.ماكس 2 إعادة إصلاحات المنتقدين قبل أن تصعد إلى البشر.

التمارين

  1. أركضcode/main.pyولاحظ كيف يكتشف المؤكد الخطأ الذي غاب المنتقد. أضف تحقيقاً تحليلاً ثابتياً (عد حالات حدوثreturn) كمحقق إضافي. ما الذي يلاحظه إذا لم يتم اختبار الوقت؟
  2. إضافة دور خامس: "محلل المتطلبات" الذي يترجم رغبة المستخدم إلى تحديدات جاهزة للمخطط. ما هي طلبات الهلوسة التواصلية التي يجب أن تتدفق إليها؟
  3. اقرأ قسم MetaGPT 3 ("العاملين"). قم بإدراج مخططات الدخول / الخروج لكل من أدوار MetaGPT الخمسة.
  4. اقرأ مخطط سلسلة الدردشة من ChatDev (arXiv:2307.07924 الشكل 3). حدد أين يكسور الهلوسة التواصلية حلقة التي كانت لا نهاية لها.
  5. جاء فائدة دقة PwC 7 × من حلقات التحقق. فرض ثلاثة مهام حيث لا يمكن إضافة مؤكد أن يساعد حيث التحقق من الدستورية من الصواب مستحيل أو مكلف للغاية.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Role specialization"Different agents, different jobs"Distinct system prompts tuned for planner/executor/critic/verifier roles.
SOP pattern"Encoded standard operating procedure"MetaGPT's framing: strict I/O schemas per role turn a team into a pipeline.
Communicative dehallucination"Ask before inventing"ChatDev pattern: executor asks planner when a detail is missing rather than making one up.
Critic"LLM reviewer"Subjective, opinionated reviewer. Catches taste issues. Can be fooled by plausible prose.
Verifier"Deterministic check"Code-based pass/fail. Test runner, type checker, schema validator. Cannot be fooled.
Verification gap"No one checked"21.3% of MAST failures. Answer shipped without a check that would have caught the bug.
Revision loop"Critic sends it back"Critic rejection triggers executor re-run with feedback. Needs a budget.
All-LLM anti-pattern"Looks good to me"Every role is an LLM, no deterministic check. Classic MAST failure.

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.