Değerlendirme ve Koordinasyon Benchmarks
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 16 · 15 (Voting and Debate Topology), Phase 16 · 23 (Failure Modes)
Time: ~75 minutes
Sorun
Bir makalede "çok ajanlı sistemimiz daha iyidir" denildiğinde, soru şu: ne, ne üzerinde, nasıl ölçüldü? 2023-2024 yılları arasında çok ajanlı değerlendirme çağında kaos vardı.
Paylaşılan referanslar olmadan iki çoklu ajan sistemini anlamlı bir şekilde karşılaştıramazsınız. Daha da kötüsü, beklenmedik referanslar olmadan, sınır modelleri kirleştirebilir. SWE-benç Verified 2025 ortalarına kadar eğitim korpuslarında kısmen kirlendi; sınır puanları şişmişti; Pro kirlenmemiş bir gerçeklik kontrolü olarak tasarlandı.
Bu ders, 2026'daki beş kanonik referans değerini sıralar, her birinin ölçümlerini belirler ve referans iddialarını şüpheci bir şekilde okumayı öğretir.
Anlam
MultiAgentBench (MARBLE) ACL 2025
arXiv:2503.01935. Araştırma, kodlama ve planlama görevleri üzerinde dört koordinasyon topolojisini (yıldız, zincir, ağaç, grafik) değerlendirir.
Ölçüm sonuçları:
- GraphTopoloji araştırma senaryoları için en iyi; herhangi bir eleştirileri destekler.
- ChainAdımlı rafine kodlama için en iyi.
- StarHızlı bir gerçekleşme için en iyi.
- Coordination taxGraf üzerinde ~4 ajanın geçtiği görünür.
- Cognitive planningTopolojiler arasında %3'lik bir kilometrelik başarıyı ekler.
Kolportasyon topolojilerini elma-elme karşılaştırmak istediğinizde kullanın.https://github.com/ulab-uiuc/MARBLE) değerlendirici tarafından sağlanır.
COMMA Multimodal asimetrik bilgi
Görevler, ajanların farklı gözlem yöntemleri olan ve tam bilgi paylaşımı olmadan koordinasyon yapmaları gereken görevleri kapsar.random baselineCOMMA'da ajan-ajen işbirliği konusunda.Signal, çoklu ajan modalitelerinin yetersiz eğitilmiş ve değerlendirilmemiş olduğu LLM'ler tek modalitelerle işbirliği makul bir şekilde yönetmektedir.
Sisteminizin multimodal veya asimetrik bilgi koordinasyonu olduğunda kullanın. COMMA'dan gelen sıfır sonuç, talep etmeden önce ölçmek için bir uyarıdır.
MedAgentBoard alan stres testi
ArXiv:2505.12371. Dört tıbbi görev kategorisi: teşhis, tedavi planlaması, rapor oluşturma, hasta iletişim.
Bulma: çoklu ajan çoğu kategoride tek-LLM'de egemenlik göstermiyor. Çoklu ajan avantajı dar alt görevlerin açıkça ayrılabilir olduğunda görev parçalanması yardımcı olur (diagnostik + tedavi); koordinasyon genel maliyeti uzmanlık kazancını (raport oluşturma) aşırırken zarar görür.
MedAgentBoard'un dersi genelleştirirse, önerilen birçok multi-agent sistemi aşırı tasarlanmıştır.
AgentArch Girişimci mimarlıklar
ArXiv:2509.10769. Kullanım, bellek ve orkestrasyonla birlikte katlanmış işletme ayarları. Benchmark her katmanın katkılarını izole eder: araç eklemenin ne kadar yardımı var? bellek eklemek? çoklu ajan orkestrasyonu eklemek?
Bir kurumsal ajan yığınını tasarladığınızda ve her katmanı haklı çıkarmanız gerektiğinde kullanın. AgentArch, değerini ölçemediğiniz özellikleri satın almaktan kaçınmanıza yardımcı olur.
SWE-bench Pro gerçeklik kontrolü
ArXiv:2509.16941. İşletme uygulamaları, B2B hizmetleri ve geliştiriciler aracı kapsamında 41 deposu üzerinde 1865 sorun.uncontaminatedFrontier modelleri Pro'da %23 oranında verified'de %70 oranında puan alıyor.
Nisan 2026 notları:
- Claude Opus 4.7 Pro: 64.3%(Agent-team koordinasyonu ile bildirildi; henüz Anthropic ilk kaynağı yayınlanmadı ön raporu olarak ele alınmıştır).
- Verdent (Agent Eklenti) Verified: 76.1% pass@1(technical report)
- Pro'da ajan asfaltlaması olmayan sınırlı ham puanlar: ~23-35% (SWE-bench Pro paper)
"SWE-bench Verified'i yenmiştik" artık yetenek kanıtı değildir. Pro, mevcut geçit testidir. Ajan-eğitim asfaltlaması, 2026'da çoklu ajan koordinasyonu için en güçlü empirici argümanlardan biri olan Pro'da ölçülebilir kazançlar üretir (~30-40 puan delta).
AAAI 2026 WMAC
AAAI 2026 Köprü Programı Çoklu Ajan Koordinasyonu Atölyesinde (https://multiagents.org/2026/) 2026'da çoklu ajanlı AI araştırmaları için topluluk odak noktası. Kabul edilen makaleler ve atölye işlevleri yeni yöntemlerin değerlendirilmesi için kanonik bir yerlerdir.
Referans iddialarını şüpheci bir şekilde okuyun 2026 kontrol listesini
Birisi çoklu ajanlı bir sonuç talep ettiğinde:
- Which benchmark, which split?SWE-benç Verified vs Pro çok önemli. Yanlış bölünme ile rapor edilen bir sayı değersiz.
- Contamination check.Eğer modelin eğitim kesiminden sonra verildiyse dikkatli olun.
- Baseline comparison.Tek bir LLM başlangıç noktası vs rastgele vs önceki çoklu ajan çalışmaları.
- Statistical significance.N testleri, p değeri, güven aralığı.
- Task diversity.Genelleştirme üretim için önemli.
- Cost disclosure.%90'lık bir çözüm 20 kat daha pahalı bir iş kararı, yetenek iddiası değil.
Benchmarkların hiçbiri neyi iyi ölçmedi
- Long-horizon coordination.Günlerce divar saatleri ile etkileşim.
- Adversarial resilience.Bir ajan kötü niyetli veya tehlikeli olduğunda ne olur?
- Drift under deployment.Benchmarks statik; üretim dağılımları değişir.
- Cost-normalized performance.Çoğu referans, dolar başına doğru değil, çıplak doğruluk rapor ediyor.
Aslında önem verdiğiniz bir eksenizin kendi iç standartınızı oluşturmak genellikle doğru bir adımdır.
Yapın
code/main.pyetkileşimsiz bir geçiş yolu:
- Oyuncak görevinde 3 çoklu ajan sistemi simüle eder.
- Her biri için MARBLE tarzı kilometrelik metrikleri hesaplar.
- "Eğitim" setinden görevleri gizleyerek kirliliği kontrol eder.
- Açıkça rastgele bir başlangıç çizgisi ile karşılaştırılır.
- Referans talepleri puan kartı basar.
Çık:
bashpython3 code/main.pyBeklenen çıkış: çürük doğrulukla sistem puan kartı, ana nokta başarısı, görev başına maliyet, rastgele başlangıç çizgisi delta ile kirlilik kontrol notu.
Kullan
outputs/skill-benchmark-reader.mdBirçok ajanla ilgili referans değerini okumak ve kontrol kontrol listesini uygulamak.
Gönder
Üretim değerlendirme disiplini:
- Build an internal benchmarkHalkın referans değerleri, bilgi verir, fakat değiştirmez.
- Include a random baselineEğer koordinasyon görevinde rastgele bir oranla büyük bir farkla yenemezseniz, görev yanlış bir şekilde ayarlanabilir.
- Report cost alongside accuracy.Token fiyatı ve duvar saati.
- Rebuild the benchmark quarterly.Üretim dağılımında değişiklikler; eski referans değerleri yanıltıcı.
- Avoid published-benchmark overfitting.Takımınız özel olarak SWE-bench Pro numaraları için optimize ediyorsa, üretime geri döneceksiniz.
Egzersizler
- Çık .
code/main.pyÜç simülasyon sistemden hangisinin en iyi maliyetleri olduğu belirlenir. - MultiAgentBench'i okuyun (arXiv:2503.01935). Kendi görev alanınız için, MARBLE'nin önerdiği dört topolojiden hangisini seçin.
- SWE-bench Pro kağıdı okuyun.
- COMMA'nın multimodal koordinasyonla ilgili bulgularını okuyun. İç standart değerinize ekleyebileceğiniz basit bir multimodal koordinasyon görevi tasarlayın.
- Benchmark-davayeleri kontrol listesini son bir çok ajan gazetesinin başlık sonuçlarına uygulayın.
Anahtar Terimler
| Term | What people say | What it actually means |
|---|---|---|
| MARBLE | "MultiAgentBench" | ACL 2025; star/chain/tree/graph topologies with milestone KPIs. |
| COMMA | "Multimodal benchmark" | Multimodal asymmetric-info coordination; frontier models struggle vs random. |
| MedAgentBoard | "Domain stress test" | Four medical categories; often finds multi-agent does not dominate single-LLM. |
| AgentArch | "Enterprise benchmark" | Tools + memory + orchestration layered. |
| SWE-bench Pro | "Contamination-resistant" | 1865 problems, 41 repos; ~23% vs 70%+ on Verified (the contamination signal). |
| Milestone achievement | "Partial credit" | Benchmarks that reward progress, not only final success. |
| Contamination | "Benchmark leaked into training" | Post-release, benchmarks drift into training corpora; scores inflate. |
| WMAC | "AAAI 2026 Bridge Program" | Workshop on Multi-Agent Coordination; community focal point. |
Daha Fazla Okumak
- MultiAgentBench / MARBLE MİLİK'ler ile topoloji referans göstergesi
- MARBLE repository Referans uygulanması
- MedAgentBoard alan stres testi; çoklu ajan genellikle baskın değildir
- AgentArch Girişimci ajan mimarisi
- SWE-bench leaderboards Sınır modelleri için doğrulanmış ve pro puanları
- AAAI 2026 WMAC 2026 yılındaki topluluk odak noktası
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.