मूल्यांकन और समन्वय बेंचमार्क
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 16 · 15 (Voting and Debate Topology), Phase 16 · 23 (Failure Modes)
Time: ~75 minutes
समस्या
जब एक पेपर का दावा है कि "हमारी मल्टी-एजेंट प्रणाली बेहतर है", तो सवाल यह हैः क्या से बेहतर, किस पर, कैसे मापा गया? 2023-2024 के मल्टी-एजेंट मूल्यांकन का युग अराजकता था हर किसी ने अपने स्वयं के मीट्रिक, अपने स्वयं के बेसलाइन और अपने स्वयं के कार्य सेट चुने। 2025-2026 बेंचमार्क ने संरचना थोपी।
साझा बेंचमार्क के बिना, आप दो मल्टी-एजेंट सिस्टम की तुलना सार्थक ढंग से नहीं कर सकते। इससे भी बदतर, बिना रोक बेंचमार्क के, सीमा मॉडल दूषित कर सकते हैं। एसवीई-बेंच सत्यापित 2025 के मध्य तक प्रशिक्षण निकायों में आंशिक रूप से दूषित हो गया; सीमा स्कोर फहराया गया; प्रो को एक असंबद्ध वास्तविकता जांच के रूप में डिज़ाइन किया गया था।
यह पाठ 2026 के पांच मान्यता प्राप्त बेंचमार्क को सूचीबद्ध करता है, प्रत्येक माप का नाम देता है, और आपको बेंचमार्क के दावे को संदेह से पढ़ने के लिए सिखाता है।
अवधारणा
मल्टीएजेंटबेंच (मार्बल) ACL 2025
arXiv:2503.01935. अनुसंधान, कोडिंग और योजनाबद्ध कार्यों पर चार समन्वय टॉपलॉजीज (तारा, श्रृंखला, पेड़, ग्राफ) का मूल्यांकन करता है। मील का पत्थर आधारित केपीआई केवल अंतिम सफलता के बजाय आंशिक प्रगति का ट्रैक करते हैं।
मापा गया परिणामः
- Graphअनुसंधान परिदृश्यों के लिए सबसे अच्छा टॉपॉलजी; किसी भी आलोचना का समर्थन करता है।
- Chainचरणबद्ध परिष्करण कोडिंग के लिए सबसे अच्छा।
- Starशीघ्र वास्तविक समेकन के लिए सबसे अच्छा।
- Coordination taxग्राफ पर ~4 एजेंटों के बाद दिखाई देता है।
- Cognitive planningशीर्षिकी में ~3% मील का पत्थर उपलब्धि जोड़ता है।
जब आप समन्वय टॉपॉलजी को सेब से सेब की तुलना करना चाहते हैं तो उपयोग करें।https://github.com/ulab-uiuc/MARBLE) मूल्यांकनकर्ता को प्रदान करता है।
COMMA बहुआयामी असंबद्ध जानकारी
यह उन कार्यों को कवर करता है जहां एजेंटों के विभिन्न अवलोकन मोड होते हैं और उन्हें पूरी जानकारी साझा किए बिना समन्वय करना होता है। रिपोर्ट किए गए परिणाम असहज हैः GPT-4o सहित सीमा मॉडल एक को हराकर संघर्ष करते हैं।random baselineCOMMA में एजेंट-एजेंट सहयोग पर संकेत है कि मल्टी-एजेंट मोडलिटीज कम प्रशिक्षित और कम मूल्यांकन की गई हैं LLM एक-मोडालिटी सहयोग को उचित रूप से संभालते हैं; मल्टी-मोडालिटी समन्वय टूट जाता है।
जब प्रयोग करेंः आपके सिस्टम में मल्टीमोडल या असिमट्रिक-सूचना समन्वय है। COMMA से शून्य परिणाम दावा करने से पहले मापने के लिए चेतावनी है।
MedAgentBoard डोमेन तनाव परीक्षण
arXiv:2505.12371. चार चिकित्सा कार्य श्रेणियाँः निदान, उपचार योजना, रिपोर्ट निर्माण, रोगी संचार। बहु-एजेंट बनाम एकल-एलएलएम बनाम पारंपरिक नियम आधारित प्रणालियों की तुलना करता है।
निष्कर्षः बहु-एजेंट अधिकांश श्रेणियों पर एकल-एलएलएम पर हावी नहीं है। बहु-एजेंट लाभ संकीर्ण है कार्य विघटन तब मदद करता है जब उप-कार्य स्पष्ट रूप से अलग हो सकते हैं (निदान + उपचार); यह चोट करता है जब समन्वय ओवरहेड विशेषज्ञता लाभ से अधिक है (रिपोर्ट जनरेशन) ।
उपयोग कब करेंः आपके डोमेन में एक एलएलएम बेसलाइन स्पष्ट है। यदि मेडएजेंटबोर्ड का पाठ सामान्यीकरण करता है, तो कई प्रस्तावित मल्टी-एजेंट सिस्टम ओवर-इंजीनियरिंग हैं।
एजेंटआर्क उद्यम वास्तुकला
arXiv:2509.10769. उपकरण उपयोग, स्मृति और संगणना के साथ उद्यम सेटिंग्स एक साथ परतबद्ध। बेंचमार्क प्रत्येक परत के योगदान को अलग करता हैः उपकरण जोड़ने में कितना मदद मिलती है? स्मृति जोड़ना? बहु-एजेंट संगणना जोड़ना?
जब उपयोग करेंः आप एक उद्यम एजेंट स्टैक डिजाइन कर रहे हैं और प्रत्येक परत को सही ठहराने की आवश्यकता है। एजेंटआर्च सुविधाओं को खरीदने से बचने में मदद करता है जिसका मूल्य आप माप नहीं सकते हैं।
SWE-बेंच प्रो वास्तविकता जांच
arXiv:2509.16941. व्यापार अनुप्रयोगों, बी 2 बी सेवाओं और डेवलपर टूल से सम्बंधित 41 भंडारों में 1865 समस्याएं।uncontaminatedफ्रंटियर मॉडल प्रो पर ~23% स्कोर करते हैं बनाम सत्यापित पर 70% +। अंतर प्रदूषण संकेत है।
अप्रैल 2026 अंकः
- प्रो पर क्लाउड ओपस 4.7: 64.3%(स्पष्ट एजेंट-टीम समन्वय के साथ रिपोर्ट किया गया; कोई मानव प्राथमिक स्रोत अभी तक प्रकाशित नहीं किया गया है।
- वेरिएंट (एजेंट स्केफॉल्ड) पर सत्यापितः 76.1% pass@1(technical report) ।
- एजेंट के साथ स्टफॉल्डिंग के बिना प्रो पर सीमा कच्चे स्कोरः ~ 23-35% (SWE-bench Pro paper) ।
"हमने एसवीई-बेंच सत्यापित को हराया" अब क्षमता का प्रमाण नहीं है। प्रो वर्तमान गेटिंग परीक्षण है। एजेंट-टीम स्टेफलिंग प्रो (~30-40 बिंदु डेल्टा) पर मापने योग्य लाभ पैदा करता है, जो 2026 में मल्टी-एजेंट समन्वय के लिए सबसे मजबूत अनुभवजन्य तर्कों में से एक है।
एएएआई 2026 WMAC
एएएआई 2026 ब्रिज कार्यक्रम बहु-एजेंट समन्वय पर कार्यशाला (https://multiagents.org/2026/) 2026 में बहु-एजेंट एआई अनुसंधान के लिए सामुदायिक फोकल प्वाइंट। स्वीकृत पेपर और कार्यशाला कार्यवाही नए तरीकों का मूल्यांकन करने के लिए एक वैधानिक स्थल हैं; उत्पादन निर्णयों के लिए arXiv पर WMAC द्वारा स्वीकृत दावे को स्थगित करें।
बेंचमार्क दावों को संदेह से पढ़ें 2026 चेकलिस्ट
जब कोई बहु एजेंट परिणाम का दावा करता हैः
- Which benchmark, which split?SWE-बेंच सत्यापित बनाम प्रो बहुत मायने रखता है। गलत विभाजन पर रिपोर्ट किया गया एक संख्या बेकार है।
- Contamination check.क्या मॉडल के प्रशिक्षण कटऑफ के बाद बेंचमार्क जारी किया गया था? यदि नहीं, तो सावधानी से इलाज करें।
- Baseline comparison.एक एकल एलएलएम आधार लाइन के खिलाफ, बनाम यादृच्छिक, बनाम पूर्व बहु एजेंट काम. "एक ही प्रणाली के असंगत संस्करण के खिलाफ नहीं।"
- Statistical significance.N परीक्षण, p-मूल्य, विश्वास अंतराल. सीमा मॉडल उच्च विविधता हैं; एकल रन भ्रामक हैं।
- Task diversity.सामान्यीकरण उत्पादन के लिए मायने रखता है।
- Cost disclosure.एक 90 प्रतिशत समाधान 20 गुना लागत पर एक व्यावसायिक निर्णय है, एक क्षमता का दावा नहीं है।
क्या कोई भी बेंचमार्क अच्छी तरह से मापने
- Long-horizon coordination.दीवार घड़ी के साथ बातचीत के दिन. सभी वर्तमान बेंचमार्क कम हैं.
- Adversarial resilience.क्या होता है जब एक एजेंट दुर्भावनापूर्ण या समझौता किया जाता है?
- Drift under deployment.बेंचमार्क स्थिर हैं; उत्पादन वितरण बदलते हैं।
- Cost-normalized performance.अधिकांश बेंचमार्क कच्चे सटीकता की रिपोर्ट करते हैं, प्रति डॉलर सटीकता नहीं।
उस अक्ष के लिए अपना आंतरिक बेंचमार्क बनाना जिसे आप वास्तव में परवाह करते हैं अक्सर सही कदम होता है।
इसे बनाओ
code/main.pyएक गैर-आंतरिक पारगमन है
- एक खिलौना कार्य पर 3 बहु-एजेंट सिस्टम का अनुकरण करता है.
- प्रत्येक के लिए मार्बल शैली मील के पत्थर मीट्रिक गणना करता है।
- "प्रशिक्षण" सेट से कार्य रोककर प्रदूषण जांच करता है।
- स्पष्ट रूप से एक यादृच्छिक आधार रेखा के साथ तुलना।
- बेंचमार्क-कमांड स्कोरकार्ड प्रिंट करता है।
दौड़ें:
bashpython3 code/main.pyअपेक्षित आउटपुटः कच्चे सटीकता के साथ सिस्टम स्कोरकार्ड, मील का पत्थर उपलब्धि, प्रति कार्य लागत, बनाम यादृच्छिक बेसलाइन डेल्टा, और एक प्रदूषण जांच नोट।
इसका प्रयोग करें
outputs/skill-benchmark-reader.mdकिसी भी बहु-एजेंट बेंचमार्क दावे को पढ़ता है और जांच चेकलिस्ट को लागू करता है। आउटपुटः एक ग्रेड और चेतावनी।
इसे भेजें
उत्पादन मूल्यांकन अनुशासनः
- Build an internal benchmarkसार्वजनिक बेंचमार्क सूचित करते हैं लेकिन प्रतिस्थापन नहीं करते हैं।
- Include a random baselineयदि आप समन्वय कार्य पर बड़ी मार्जिन से यादृच्छिक को नहीं हरा सकते हैं, तो कार्य गलत तरीके से रखा जा सकता है।
- Report cost alongside accuracy.टोकन लागत और दीवार घड़ी. ऑपरेशन टीमों दोनों की जरूरत है.
- Rebuild the benchmark quarterly.उत्पादन वितरण में बदलाव; पुराने बेंचमार्क भ्रामक हैं।
- Avoid published-benchmark overfitting.यदि आपकी टीम विशेष रूप से SWE-बेंच प्रो नंबरों के लिए अनुकूलन कर रही है, तो आप उत्पादन पर पीछे हट जाएंगे।
व्यायाम
- दौड़ें
code/main.py. तीनों सिमुलेटेड सिस्टम में से किसमें प्रति मील का पत्थर सबसे अच्छी लागत है, यह उच्चतम कच्चे शुद्धता प्रणाली से मेल खाता है? - MultiAgentBench (arXiv:2503.01935) पढ़ें। अपने स्वयं के कार्य डोमेन के लिए, तय करें कि चार टॉपॉलजीज में से कौन सी MARBLE अनुशंसा करेगा। पेपर के परिणामों से सही ठहरें।
- SWE-bench Pro पेपर पढ़ें. क्या यह विशिष्ट रूप से प्रदूषण प्रतिरोधी बनाता है? क्या उसी तकनीक को अन्य बेंचमार्क पर लागू किया जा सकता है जिनकी आपको परवाह है?
- COMMA के मल्टीमोडल समन्वय पर निष्कर्ष पढ़ें। एक सरल मल्टीमोडल समन्वय कार्य डिजाइन करें जिसे आप अपने आंतरिक बेंचमार्क में जोड़ सकते हैं। एक उपयोगी संकेत के रूप में क्या गिना जाएगा?
- बेंचमार्क-कमांड चेकलिस्ट को हाल ही में एक मल्टी-एजेंट पेपर के शीर्षक परिणाम पर लागू करें। आप दावे को किस ग्रेड देंगे?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| MARBLE | "MultiAgentBench" | ACL 2025; star/chain/tree/graph topologies with milestone KPIs. |
| COMMA | "Multimodal benchmark" | Multimodal asymmetric-info coordination; frontier models struggle vs random. |
| MedAgentBoard | "Domain stress test" | Four medical categories; often finds multi-agent does not dominate single-LLM. |
| AgentArch | "Enterprise benchmark" | Tools + memory + orchestration layered. |
| SWE-bench Pro | "Contamination-resistant" | 1865 problems, 41 repos; ~23% vs 70%+ on Verified (the contamination signal). |
| Milestone achievement | "Partial credit" | Benchmarks that reward progress, not only final success. |
| Contamination | "Benchmark leaked into training" | Post-release, benchmarks drift into training corpora; scores inflate. |
| WMAC | "AAAI 2026 Bridge Program" | Workshop on Multi-Agent Coordination; community focal point. |
आगे पढ़ना
- MultiAgentBench / MARBLE मील के पत्थर KPIs के साथ शीर्षिकी बेंचमार्क
- MARBLE repository संदर्भ कार्यान्वयन
- MedAgentBoard डोमेन तनाव परीक्षण; बहु-एजेंट अक्सर हावी नहीं होता है
- AgentArch उद्यम एजेंट वास्तुकला
- SWE-bench leaderboards सीमा मॉडल के लिए सत्यापित और प्रो स्कोर
- AAAI 2026 WMAC 2026 तक सामुदायिक फोकल प्वाइंट
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.