شاخص های ارزیابی و هماهنگی
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 16 · 15 (Voting and Debate Topology), Phase 16 · 23 (Failure Modes)
Time: ~75 minutes
مشکل
وقتی یک مقاله ادعا می کند "سیستم چند عامل ما بهتر است"، سوال این است: بهتر از چه چیزی، بر اساس چه چیزی، چگونه اندازه گیری می شود؟ عصر ارزیابی چند عامل 2023-2024 آشفتگی بود.
بدون معیار های مشترک، نمی توان دو سیستم چند عامل را با معنی مقایسه کرد. بدتر از این، بدون معیار های ثابت، مدل های مرزی می توانند آلوده شوند. SWE-bench Verified تا اواسط سال 2025 در شرکت های آموزشی تا حدی آلوده شد؛ نمرات مرزی افزایش یافت؛ Pro به عنوان یک چک واقعیت آلوده طراحی شد.
این درس پنج معیار استاندارد 2026 را فهرست می کند، نام هایی را که هر یک از آنها اندازه گیری می کند، و به شما یاد می دهد که ادعاهای معیار را با شک و تردید بخوانید.
مفهوم
چند عامل بنچ (MARBLE) ACL 2025
arXiv:2503.01935. چهار توپولوژی هماهنگی ( ستاره، زنجیره، درخت، نمودار) را در مورد وظایف تحقیق، کدگذاری و برنامه ریزی ارزیابی می کند. KPI های مبتنی بر سنگ های مهم پیشرفت جزئی را به جای موفقیت نهایی ردیابی می کنند.
نتایج اندازه گیری شده:
- Graphتوپولوژی بهترین برای سناریوهای تحقیقاتی؛ از هر گونه انتقاد حمایت می کند.
- Chainبهترین برای کدگذاری اصلاحات مرحله ای
- Starبهترین برای یک تثبیت سریع واقعی.
- Coordination taxدر نمودار از 4 عامل گذشته ظاهر می شود.
- Cognitive planningاضافه کردن ~ 3٪ موفقیت سنگ آهنین در سراسر توپولوژی ها.
استفاده کنید: اگر می خواهید توپولوژی های هماهنگی را از سیب به سیب مقایسه کنید.https://github.com/ulab-uiuc/MARBLE) را ارزیابی کننده ارائه می دهد.
COMMA اطلاعات غیر متقابل چند مودالی
این بخش وظایف را پوشش می دهد که در آن عوامل روش های مشاهده متفاوتی دارند و باید بدون اشتراک کامل اطلاعات هماهنگ شوند. نتیجه گزارش شده ناراحت کننده است: مدل های مرزی از جمله GPT-4o برای شکست یکrandom baselineدر مورد همکاری عامل-عامل در COMMA. این نشانه این است که روش های چند عامل به اندازه کافی آموزش دیده و ارزیابی نشده است LLM ها همکاری یک راه را به طور منطقی اداره می کنند؛ هماهنگی چند راه سقوط می کند.
استفاده کنید زمانی که سیستم شما دارای هماهنگی اطلاعات چند حالت یا غیر متقابل است. نتیجه بی فایده از COMMA هشدار برای اندازه گیری قبل از ادعا است.
MedAgentBoard تست استرس دامنه
arXiv:2505.12371. چهار دسته از وظایف پزشکی: تشخیص، برنامه ریزی درمان، تولید گزارش، ارتباطات بیمار. مقایسه سیستم های مبتنی بر قوانین چند عامل با LLM واحد.
یافته: چند عامل بر LLM تک در اکثر دسته ها تسلط ندارد. مزایای چند عامل باریک است تجزیه وظایف در زمانی که ذیلی وظایف به وضوح قابل جداسازی هستند کمک می کند (تشخیص + درمان) ؛ وقتی هزینه های هماهنگی بیش از افزایش تخصص (تولید گزارش) است، درد می کند.
استفاده کنید: دامنه شما دارای خط های پایه یک LLM مشخص است. اگر درس MedAgentBoard عمومی شود، بسیاری از سیستم های چند عامل پیشنهادی بیش از حد مهندسی شده اند.
آرک آرک معماری های شرکت
arXiv:2509.10769. تنظیمات شرکت با استفاده از ابزار، حافظه و آرکیستراسیون به هم لایه شده. معیار کمک هر لایه را جدا می کند: اضافه کردن ابزار چقدر کمک می کند؟ اضافه کردن حافظه؟ اضافه کردن آرکیستراسیون چند عامل؟
استفاده کنید: شما در حال طراحی یک ستک آژانس شرکت هستید و باید هر لایه را توجیه کنید. AgentArch به شما کمک می کند تا از خرید ویژگی هایی که نمی توانید ارزش آن را اندازه گیری کنید، اجتناب کنید.
SWE-bench Pro چک واقعیت
arXiv:2509.16941. 1865 مشکلات در 41 مخزن شامل برنامه های تجاری، خدمات B2B و ابزارهای توسعه دهنده. طراحی شده برای uncontaminatedبا تعویضات بعدی در آموزش. مدل های فرونتری در Pro حدود 23 درصد نسبت به 70 درصد در Verified امتیاز می دهند. شکاف سیگنال آلودگی است.
در آوریل 2026 نمره:
- کلاود اوپوس 4.7 در پرو: 64.3%(با هماهنگی صریح تیم عامل گزارش شده است؛ هنوز هیچ منبع اولیه انتروپک منتشر نشده است)
- وردنت (استاد عامل) در مورد تایید شده: 76.1% pass@1(technical report)
- امتیازات خام مرز در Pro بدون استفادینگ عامل: ~23-35% (SWE-bench Pro paper)
نتیجه گیری: "ما SWE-bench Verified را شکست دادیم" دیگر شواهد توانایی نیست. Pro آزمون گاتینگ فعلی است. استقرار گروه عامل تولیدات قابل اندازه گیری در Pro (~ 30-40 نقطه دلتا) است که یکی از قوی ترین استدلال های تجربی برای هماهنگی چند عامل در سال 2026 است.
AAAI 2026 WMAC
برنامه پل AAAI 2026 کارگاه هماهنگی چند عامل (https://multiagents.org/2026/) نقطه محور جامعه برای تحقیقات AI چند عامل در سال 2026 است. مقالات پذیرفته شده و کارگاه های کارگاهی محل قانونی برای ارزیابی روش های جدید هستند.
ادعاهای معیار را با شک و تردید بخوانید لیست چک 2026
وقتی کسی نتیجه چند عامل رو ادعا میکنه:
- Which benchmark, which split?SWE-Bench Verified vs Pro مهمه يه مقدار خيلي تعداد گزارش شده در قسمت اشتباه بي ارزش است
- Contamination check.پس از توقف تمرین مدل، معیار بازي شده؟
- Baseline comparison.در مقابل واحد-LLM پایه، در مقابل تصادفی، در مقابل قبلی چند عامل کار. نه "در برابر نسخه غیر تنظیم شده از همان سیستم".
- Statistical significance.آزمایشات N، ارزش p، فاصله اعتماد. مدل های خطی با تنوع بالا هستند.
- Task diversity.یک کار یا چند؟ عمومی سازی برای تولید مهم است.
- Cost disclosure.توکن ها به هر وظیفه، ساعت دیواری. یک راه حل 90 درصد با 20 برابر هزینه یک تصمیم تجاری است، نه یک ادعا توانایی.
آنچه که هیچ یک از شاخص های مرجع به خوبی اندازه گیری نمی کنند
- Long-horizon coordination.روزها با ساعت ديواري تعامل ميکنيم تمام مقايسه هاي موجود کم هستند
- Adversarial resilience.چه اتفاقی می افتد وقتی یه مامور بدخواه یا متناوب باشه؟
- Drift under deployment.شاخص های معیاری ثابت هستند؛ توزیع تولید تغییر می کند.
- Cost-normalized performance.بیشتر شاخص های مرجعی دقت خام را گزارش می دهند، نه دقت در هر دلار.
ساختن معیار داخلی خود برای محور که واقعاً به آن اهمیت می دهید اغلب حرکت درست است.
آن را بسازید
code/main.pyیک راه رفتن غیر متقابل است:
- 3تا سیستم چند عامل رو در يک کار اسباب بازي شبیه ساز ميکنه
- برای هر یک از این افراد، معیار های سنگ مرزی به سبک ماربل را محاسبه می کند.
- با بازداشت وظایف از مجموعه "آموزش"، یک بررسی آلودگی را انجام می دهد.
- با يک خط اصلي تصادفي به طور صريح مقایسه مي کنه
- کارت امتیازات مطالبات معیار چاپ می شود.
راه رفتن:
bashpython3 code/main.pyتولید انتظار می رود: کارت امتیاز سیستم با دقت خام، دستیابی به نقطه ی بمی، هزینه در هر کار، دلتای خط پایه به صورت تصادفی و یک یادداشت بررسی آلودگی.
ازش استفاده کن
outputs/skill-benchmark-reader.mdهر ادعای معیار چند عامل را می خواند و لیست چک چک چک بررسی را اعمال می کند.
-باده
رشته ارزیابی تولید:
- Build an internal benchmarkاین شاخص ها نشان دهنده توزیع تولید واقعی شما هستند.
- Include a random baselineاگر شما نمی توانید به طور تصادفی با یک امتیاز بزرگ در یک کار هماهنگی شکست دهید، ممکن است کار اشتباه باشد.
- Report cost alongside accuracy.قیمت توکن و ساعت دیوار، تیم های عملیات هر دو رو میخوان
- Rebuild the benchmark quarterly.تغییر توزیع تولید؛ معیار های قدیمی گمراه کننده است.
- Avoid published-benchmark overfitting.اگر تیم شما به طور خاص برای شماره های SWE-bench Pro بهینه سازی می کند، شما در تولید عقب نشینی خواهید کرد.
تمرینات
- فرار کن
code/main.pyمشخص کنید که کدام از سه سیستم شبیه سازی شده بهترین هزینه در هر نقطه ی مهم را دارد. آیا با بالاترین سیستم دقت خام مطابقت دارد؟ - MultiAgentBench را بخوانید (arXiv:2503.01935). برای دامنه کار خود، تصمیم بگیرید که کدام از چهار توپولوژی را ماربل توصیه می کند. از نتایج مقاله توجیه کنید.
- مقاله SWE-bench Pro رو بخونيد. چه چيزي به طور خاص باعث ميشه که ضد آلودگی باشه؟ ميشه اين روش رو براي مقايسه هاي ديگه اي که به شما اهميت ميده اعمال کرد؟
- یافته های COMMA را در مورد هماهنگی چند مودالی بخوانید. یک کار هماهنگی چند مودالی ساده را طراحی کنید که می توانید به معیار داخلی خود اضافه کنید. چه چیزی به عنوان یک سیگنال مفید حساب می شود؟
- لیست چک مطالبات مرجع را به نتایج اصلی یک مقاله چند نماینده اخیر اعمال کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| MARBLE | "MultiAgentBench" | ACL 2025; star/chain/tree/graph topologies with milestone KPIs. |
| COMMA | "Multimodal benchmark" | Multimodal asymmetric-info coordination; frontier models struggle vs random. |
| MedAgentBoard | "Domain stress test" | Four medical categories; often finds multi-agent does not dominate single-LLM. |
| AgentArch | "Enterprise benchmark" | Tools + memory + orchestration layered. |
| SWE-bench Pro | "Contamination-resistant" | 1865 problems, 41 repos; ~23% vs 70%+ on Verified (the contamination signal). |
| Milestone achievement | "Partial credit" | Benchmarks that reward progress, not only final success. |
| Contamination | "Benchmark leaked into training" | Post-release, benchmarks drift into training corpora; scores inflate. |
| WMAC | "AAAI 2026 Bridge Program" | Workshop on Multi-Agent Coordination; community focal point. |
خواندن بیشتر
- MultiAgentBench / MARBLE شاخص مرجع توپولوژی با شاخص های مهم
- MARBLE repository اجرای مرجع
- MedAgentBoard تست استرس دامنه؛ اغلب عوامل چندگانه تسلط ندارند
- AgentArch معماری های آژانس های تجاری
- SWE-bench leaderboards نمرات تایید شده و حرفه ای برای مدل های مرزی
- AAAI 2026 WMAC نقطه محور جامعه در سال 2026
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.