مقاييس التقييم والتنسيق
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 16 · 15 (Voting and Debate Topology), Phase 16 · 23 (Failure Modes)
Time: ~75 minutes
المشكلة
عندما تقول ورقة "نظامنا متعدد الوكلاء أفضل"، فإن السؤال هو: أفضل من ماذا، على ماذا، مقاس كيف؟ كانت عصر التقييم متعدد الوكلاء 2023-2024 فوضى اختار الجميع قياساتهم الخاصة، خطوطهم الأساسية، ومجموعات مهامهم الخاصة. فرضت معايير 2025-2026 الهيكل.
بدون مقاييس مشتركة، لا يمكنك مقارنة نظامين متعددين الوكلاء بشكل ملموس. أسوأ من ذلك، بدون مقاييس استمرارية، يمكن أن تتلوث النماذج الحدودية. أصبحت SWE-bench Verified تلوثًا جزئيًا في مؤسسات التدريب بحلول منتصف عام 2025؛ ارتفعت درجات الحدود؛ تم تصميم Pro كتحقق واقع غير ملوث.
هذه الدروس تُعد الخمسة المعايير التقديدية لعام 2026، وتُسمّي ما يُقيّم كلّ منها، وتُعلّمك قراءة الادعاءات المُقارنة بشكل متشكك.
المفهوم
المرفق المتعدد العاملين (MARBLE) ACL 2025
arXiv: 2503.01935 تقييم أربع توبولوجيات التنسيق (نجم، سلسلة، شجرة، الرسم البياني) على المهام البحثية، والترميز، والتخطيط. تتبع المؤشرات الرئيسية القائمة على الأهداف الناتجة عن التقدم الجزئي بدلاً من النجاح النهائي فقط.
النتائج المقاسة:
- Graphأفضل أسلوب للتطبيقات الأساسية للسيناريوهات البحثية؛ يدعم أي انتقادات.
- Chainأفضل لتصنيف التكيف التدريجي.
- Starأفضل لتعزيز سريع في الواقع.
- Coordination taxيبدو بعد 4 عوامل على الرسم البياني.
- Cognitive planningيضيف ~ 3٪ تحقيق حجر أساسي عبر التطبيقات.
استخدم عندما تريد مقارنة أوضاع التنسيق من تفاحة إلى تفاحة.https://github.com/ulab-uiuc/MARBLE) يقدم المقيّم.
COMMA معلومات غير متساوية متعددة الحركات
تغطي المهام التي يمتلك فيها العملاء أساليب مراقبة مختلفة ويجب أن ينسقوا دون تبادل كامل للمعلومات. النتيجة المعلنة غير مريحة: نماذج الحدود بما في ذلك GPT-4o تكافح لضربrandom baselineعلى التعاون بين العملاء والوكلاء في COMMA. الإشارة هي أن طرق متعددة العملاء غير متدربة وقلة التقييم تقام برامج التعاون القانونية بممارسة طريقة واحدة بشكل معقول؛ وتنهار التنسيق متعدد الطرق.
استخدم عندما يكون لدى نظامك تنسيق متعدد الحركات أو معلومات غير متساوية. النتيجة الصفرية من COMMA هي تحذير يجب قياسه قبل المطالبة.
اختبار التوتر في النطاقات
arXiv: 2505.12371. أربعة فئات المهام الطبية: التشخيص، تخطيط العلاج، إنتاج التقارير، اتصالات المرضى. مقارنة العاملين المتعددين مقابل العاملين الأحدين مقابل الأنظمة القياسية القائمة على القواعد.
العثور: لم يهيمن الوكيل المتعدد على الـLLM الواحد في معظم الفئات. ميزة الوكيل المتعدد ضيقة تساعد تفكيك المهام عندما تكون المهام الفرعية قابلة للانفصال بوضوح (الاكتشاف + العلاج) ؛ فإنه يؤلم عندما تتجاوز تكلفة التنسيق العامة مكاسب التخصص (إنتاج التقارير).
استخدم عندما: يحتوي مجالك على خطوط أساسية واحدة واضحة لـ LLM. إذا كان درس MedAgentBoard يجميع، فإن العديد من الأنظمة المتعددة الوكلاء المقترحة مُعدة.
العاملات الأرش معمارات المؤسسات
arXiv: 2509.10769. إعدادات المؤسسة مع استخدام الأدوات والذاكرة والترتيبات المطبقة معًا. يفرز معيار المساهمة من كل طبقة: كم يساعد إضافة الأدوات؟ إضافة الذاكرة؟ إضافة ترتيبات متعددة الوكلاء؟
استخدم عندما: كنت تصميم كومة وكيل المؤسسة و تحتاج إلى تبرير كل طبقة.
SWE-bench Pro التحقق من الواقع
arXiv:2509.16941. 1865 مشاكل في 41 مخزن تتراوح بين تطبيقات الأعمال وخدمات B2B وأدوات المطورين.uncontaminatedمع التوقفات التدريبية لاحقاً. النماذج الحدودية تسجل ~23% على Pro مقابل 70%+ على Verified. الفجوة هي إشارة التلوث.
نسبة أبريل 2026:
- كلود أوبوس 4.7 على البرو: 64.3%(تم الإبلاغ عن التنسيق الصريح بين الفريقين الوكلاء، لم يتم نشر مصدر أساسي من الأنثروبيك بعد تعامل كإعدادات أولية).
- (الوساطة الوكالة) على المثبت: 76.1% pass@1(technical report)
- النتائج الخام الحدودي على البرو بدون منصات الوكيل: ~23-35% (SWE-bench Pro paper)
المخرج: "لقد هزمننا SWE-bench Verified" لم يعد دليلًا على القدرة. هو اختبار البوابة الحالية. إن منصة فريق وكيل تنتج مكاسب قابلة للقياس على Pro (~ 30-40 نقطة دلتا) ، وهو أحد أقوى الحجج التجريبية للتنسيق متعدد الوكلاء في عام 2026.
AAAI 2026 WMAC
برنامج الجسر 2026 من AAAI ورشة عمل بشأن التنسيق متعدد الوكلاءhttps://multiagents.org/2026/) نقطة مركزية المجتمع لعام 2026 للبحث عن الذكاء الاصطناعي متعدد الوكلاء. الأوراق المقبولة وإجراءات ورشة عمل هي المكان القنوني لتقييم الطرق الجديدة.
قراءة المطالبات المرجعية بشكل متشكك قائمة التحقق من 2026
عندما يطالب شخص بالنتيجة المتعددة الوكلاء:
- Which benchmark, which split?المجلس الوطني المحقق ضد المؤلف مهم جداً، رقمٌ أُبلغ عنه عن التقسيم الخطأ لا قيمة له
- Contamination check.هل تم إطلاق المعيار بعد وقف التدريب؟
- Baseline comparison.مقابل عمل واحد في الـLLM، مقابل عمل عشوائي، مقابل عمل متعدد الوكلاء السابقين، وليس "في إصدار غير منسجم لنفس النظام".
- Statistical significance.N تجربة، p-قيمة، فترة الثقة. النماذج الحدودي تكون عالية التباين؛ رُكود واحدة مضللة.
- Task diversity.مهمة واحدة أم عدة؟
- Cost disclosure.الوهم لكل مهمة، ساعة جدارية، حل 90% بتكلفة 20x هو قرار تجاري، وليس دعوى قدرة.
ما لا يقيس أي من المعايير بشكل جيد
- Long-horizon coordination.أيام من التفاعل مع الساعة الحائطية كل المعايير الحالية قصيرة
- Adversarial resilience.ماذا يحدث عندما يكون أحد العملاء مخطئاً أو مُتنازل؟
- Drift under deployment.إنّ العلامات المقارنة ثابتة، وتتغير توزيعات الإنتاج.
- Cost-normalized performance.معظم المعايير تشير إلى دقة خامة، وليس دقة لكل دولار.
إن بناء مقياس داخلي خاص بك للمحور الذي تهتم به في الواقع هو غالباً الخطوة الصحيحة.
بناءها
code/main.pyهو طريق متجول غير تفاعلي:
- يحاكي 3 أنظمة متعددة الوكلاء على مهمة لعبة.
- يحسب ملامح حاسوبية على نمط ماربل لكل منها
- يقوم بتفحص التلوث عن طريق منع المهام من مجموعة "التدريب".
- مقارنة مع خط أساسي عشوائي صراحة.
- يطبع بطاقة النتيجة للمطالبات
أركض
bashpython3 code/main.pyالناتج المتوقع: بطاقة النظام مع دقة خامة، تحقيق خطة أساسية، تكلفة لكل مهمة، مقابل دلتا خط أساسية عشوائية، وملاحظة للتحقق من التلوث.
استخدمها
outputs/skill-benchmark-reader.mdيقرأ أي مطالبة مقارنة متعددة الوكلاء ويطبق قائمة التحقق من الاختبار.
أرسله
تأديب تقييم الإنتاج:
- Build an internal benchmarkالتي تعكس توزيع الإنتاج الفعلي.
- Include a random baselineإذا لم تتمكن من هزيمة عشوائية بفارق كبير في مهمة التنسيق، قد تكون المهمة غير موجهة.
- Report cost alongside accuracy.تكلفة الرمز و ساعة الحائط فرق العمليات تحتاج إلى كليهما
- Rebuild the benchmark quarterly.تغيرات في توزيع الإنتاج؛ مستوى الموازين القديم يضلل.
- Avoid published-benchmark overfitting.إذا كان فريقك يُحسن خصيصاً لأرقام SWE-bench Pro، ستعود إلى الإنتاج.
التمارين
- أركض
code/main.pyتحديد أي من النظم المحاكاة الثلاثة لديها أفضل تكلفة لكل خطوة. هل تتطابق مع نظام أعلى دقة خام؟ - اقرأ MultiAgentBench (arXiv:2503.01935). لسيطرتك الخاصة، قم بتحديد أي من الأوضاع الأربعة التي ستوصيها MARBLE.
- اقرأ ورقة SWE-bench Pro ما الذي يجعلها مقاومة للتلوث؟ هل يمكن تطبيق نفس التقنية على مقاييس أخرى تهتم بها؟
- اقرأ نتائج كوما حول التنسيق متعدد الوسائل. صمم مهمة بسيطة للتنسيق متعدد الوسائل يمكنك إضافةها إلى مقياسك الداخلي. ما الذي سيكون بمثابة إشارة مفيدة؟
- تطبيق قائمة التحقق من المطالبات المرجعية على نتيجة رئيسية ورقة متعددة الوكلاء الأخيرة. ما هي الدرجة التي ستعطيها للمطالبة؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| MARBLE | "MultiAgentBench" | ACL 2025; star/chain/tree/graph topologies with milestone KPIs. |
| COMMA | "Multimodal benchmark" | Multimodal asymmetric-info coordination; frontier models struggle vs random. |
| MedAgentBoard | "Domain stress test" | Four medical categories; often finds multi-agent does not dominate single-LLM. |
| AgentArch | "Enterprise benchmark" | Tools + memory + orchestration layered. |
| SWE-bench Pro | "Contamination-resistant" | 1865 problems, 41 repos; ~23% vs 70%+ on Verified (the contamination signal). |
| Milestone achievement | "Partial credit" | Benchmarks that reward progress, not only final success. |
| Contamination | "Benchmark leaked into training" | Post-release, benchmarks drift into training corpora; scores inflate. |
| WMAC | "AAAI 2026 Bridge Program" | Workshop on Multi-Agent Coordination; community focal point. |
المزيد من القراءة
- MultiAgentBench / MARBLE مقياس مقارنة للطوبولوجيات مع مؤشرات الميزات
- MARBLE repository تنفيذ مرجع
- MedAgentBoard اختبار الإجهاد في المجال؛ غالبًا ما لا يهيمن على العاملات المتعددة
- AgentArch معمارات وكيل المؤسسات
- SWE-bench leaderboards نقاط المثبتة والحصول على النتائج المحتملة للنماذج الحدودية
- AAAI 2026 WMAC نقطة التركيز المجتمعية لعام 2026
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.