विफलता मोड MAST, समूह सोच, एकाई संस्कृति, कैस्केडिंग त्रुटियां
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 16 · 13 (Shared Memory), Phase 16 · 14 (Consensus and BFT), Phase 16 · 15 (Voting and Debate Topology)
Time: ~75 minutes
समस्या
मल्टी-एजेंट सिस्टम वास्तविक कार्यों पर 41-86.7% समय में विफल रहते हैं (सेमरी एट अल 2025 ने इसे 7 ओपन-सोर्स एमएएस में मापा है) । यह "बस अधिक एजेंट जोड़ें" द्वारा डिबग नहीं किया जा सकता है। विफलताओं के संरचनात्मक कारण हैं। एमएएसटी टैक्सोनामी आपको श्रेणियां देती है। यह सबक प्रत्येक श्रेणी को एक ठोस पता लगाने, निदान और mitigation पैटर्न के लिए मैप करता है ताकि संख्याएं मनमाने दिखने से रोके।
2026 उत्पादन अभ्यास विफलता मोड को डिजाइन इनपुट के रूप में व्यवहार करना है। जब तक आप प्रत्येक MAST श्रेणी को इंगित नहीं कर सकते और आपके द्वारा तैनात किए गए mitigation का नाम नहीं रख सकते तब तक आपकी वास्तुकला "पर्याप्त अच्छी" नहीं है।
अवधारणा
MAST श्रेणियाँ
Specification Problems (41.77% of failures).एजेंट का कार्य पर्याप्त रूप से परिभाषित नहीं किया गया था। उदाहरणः
- भूमिका अस्पष्टताः दो एजेंट दोनों ही सोचते हैं कि वे समीक्षक हैं।
- कार्य को नीचे निर्दिष्ट किया गया थाः "इसका सारांश" जब उपयोगकर्ता एक विशिष्ट कोण चाहता था।
- सफलता मानदंड संदिग्ध: एजेंट यह नहीं बता सकता कि यह सफल हुआ या नहीं।
कम करनाः
- प्रत्येक एजेंट के प्रोम्प्ट में यह बताया गया है कि वह क्या करता है और क्या नहीं करता है।
- कार्य के अनुसार स्वीकृति परीक्षण। एजेंट शुरू करने से पहले, "कर लिया X जैसा दिखता है" को परिभाषित करें।
- उड़ान से पहले विनिर्देशों की जांचः एक अलग एजेंट प्रस्थान से पहले कार्य परिभाषा की समीक्षा करता है।
Coordination Failures (36.94%).संचार या राज्य टूटने।
उदाहरण:
- दो एजेंटों को बिना सिंक्रनाइज़ेशन के साझा स्थिति अपडेट करते हैं।
- एजेंटों के बीच संदेश खो गया (सूची विफलता, टाइमआउट) ।
- स्टेट ड्रिफ्ट: एजेंट ए का मानना है कि कार्य पूरा हो गया है; एजेंट बी अभी भी कार्यरत है।
कम करनाः
- आशावादी समवर्तीता के साथ संस्करण साझा स्थिति।
- महत्वपूर्ण संदेशों के लिए स्पष्ट रूप से मान्यता (अंक तक पुनः प्रयास करें) ।
- आवधिक राज्य-समन्वित चेक-पोइंट्स; जल्दी बहाव का पता लगाएं।
Verification Gaps (21.30%).आउटपुट पर कोई स्वतंत्र जांच नहीं।
उदाहरण:
- एक एजेंट सफलता का दावा करता है; कोई भी सत्यापित नहीं करता है।
- एजेंटों की श्रृंखला प्रत्येक पूर्व के उत्पादन पर भरोसा करती है।
- उभरते रचना व्यवहार पर परीक्षण कवरेज गायब है।
कम करनाः
- स्वतंत्र सत्यापन एजेंट (पाठ 13) केवल-पढ़ने, स्वतंत्र स्रोत पहुंच।
- स्पष्ट हस्तान्तरण अनुबंधः "ए का आउटपुट बी शुरू होने से पहले चेकर सी पास करना चाहिए।"
- पोस्ट-होक विश्लेषण के लिए परिणाम लॉगिंग।
समूह विचार परिवार (arXiv:2508.05687)
एजेंटों के एक दूसरे को समान बनाने या अनुकरण करने पर पांच संबंधित विफलताएंः
Monoculture collapse.एक ही आधार मॉडल या प्रशिक्षण डेटा → संबद्ध त्रुटियों। जब तीन एजेंटों LLM साझा करते हैं, तो वे इसके भ्रम साझा करते हैं।
Conformity bias.एजेंटों को सबसे ज्यादा आवाज या सबसे ज्यादा आत्मविश्वास वाले साथी के प्रति अनुकूलित करना चाहिए, भले ही गलत हो।
Deficient ToM.एजेंट एक दूसरे के विश्वासों का नमूना नहीं बनाते हैं; समन्वय टूट जाता है (पाठ 18) ।
Mixed-motive dynamics.आंशिक रूप से संरेखित प्रोत्साहन वाले एजेंट समझौता-मध्यम की ओर बढ़ते हैं, जो किसी को संतुष्ट नहीं करता है।
Cascading reliability failures.एक घटक के त्रुटि पैटर्न निर्भर घटकों में त्रुटि पैटर्न को ट्रिगर करता है।
कैस्केड उदाहरण पुनः प्रयास तूफान
2026 की घटनाओं का एक क्लासिक पैटर्नः
payment service fails 10% of requests
↓
order agent retries payment (exponential backoff but naive)
↓
each retry is a new order-inventory check
↓
inventory service sees 2x normal load
↓
inventory service starts timing out
↓
every order retries inventory check
↓
inventory service sees 10x normal load
↓
cluster goes downफिक्स क्लासिक हैः circuit breakers. जब डाउनस्ट्रीम त्रुटि दर सीमा से अधिक हो, तो कैश या डिफ़ॉल्ट परिणामों के साथ शॉर्ट सर्किट।
सर्किट ब्रेकर उन कुछ मल्टी-एजेंट विफलता कम करने में से एक हैं जिन्हें आप बिना संशोधन के सीधे वितरित प्रणालियों से उधार लेते हैं।
स्मृति विषाक्तता (पुनरावलोकन)
पाठ 13 सेः एक एजेंट का भ्रम साझा स्मृति तथ्य बन जाता है; डाउनस्ट्रीम एजेंट जहर तथ्य पर तर्क देते हैं। MAST शब्दों में, यह साझा स्मृति परत पर सत्यापन अंतर है।
आप दुर्घटना नहीं करते हैं, आप धीमी गति से बहते हैं, जिसका कारण पता लगाना मुश्किल है।
मिटानाः केवल जोड़ लॉग, उत्पत्ति, अलिखित सत्यापनकर्ता। पहले से ही पाठ 13 में कवर किया गया है।
स्ट्रेटस विफलता का पता लगाने के लिए विशेष एजेंट
STRATUS (NeurIPS 2025) रिपोर्ट 1.5x मिट्याग-सफलता में सुधार जब आप तैनात करते हैंः
- Detection agent.लक्षणों के पैटर्न के लिए घड़ियों (उच्च असहमति, पुनः प्रयास की वृद्धि, सटीकता बहाव) ।
- Diagnosis agent.लक्षणों को देखते हुए, MAST वर्गीकरण से संभावित मूल कारण को निकालता है।
- Validation agent.उपचार के बाद लक्षण स्पष्ट हो जाते हैं।
यह एसआरई शैली की घटना प्रतिक्रिया है, एजेंट सिस्टम पर लागू। तीन भूमिकाएं सभी विशेषज्ञ संकेतों के साथ एलएलएम एजेंट हो सकती हैं।
विफलता मोड ऑडिट
2026 के लिए सर्वोत्तम प्रथा वार्षिक (या प्रति प्रमुख रिलीज) विफलता मोड ऑडिट हैः
- Trace sample.~ 1000 वास्तविक निष्पादन निशान एकत्र करें.
- Categorize.प्रत्येक निशान की विफलताओं के लिए, MAST + समूह विचार श्रेणियों का नक्शा।
- Compute failure-by-category rate.आपके सिस्टम में कौन सी श्रेणियां प्रमुख हैं?
- Rank mitigations.किस समाधान से सबसे अधिक विफलताएं समाप्त होंगी?
- Pick 2-3 mitigations.कार्यान्वयन; अगले तिमाही में पुनरीक्षण।
अनुशासन विशिष्ट विकल्पों से अधिक महत्वपूर्ण है। बिना लेखा परीक्षाओं के, विफलताएं शोर में मिश्रित होती हैं और कभी भी व्यवस्थित रूप से संबोधित नहीं होती हैं।
जब सिस्टम चुपचाप विफल हो जाता है
सबसे खतरनाक विफलता श्रेणी चुप्पी सटीकता विफलता है। एक प्रणाली जो जोर से विफल होती है (क्रैश, अपवाद, अलर्ट) की निगरानी की जा सकती है। एक प्रणाली जो विश्वसनीय-लेकिन गलत आउटपुट उत्पन्न करती है, अपवाद लॉग द्वारा पता नहीं लगाया जा सकता है। यही कारण है कि सत्यापन अंतराल प्रति विफलता सबसे महंगी श्रेणी हैं, भले ही वे केवल 21.30% की गणना के आधार पर हों।
निवेश करेंः
- नमूना आधारित मानव समीक्षा।
- गोल्डन डेटासेट रेग्रिशन टेस्ट।
- महत्वपूर्ण आउटपुट पर क्रॉस एजेंट क्रॉस-चेकिंग।
विफलता बनाम धीमी विफलता
कुछ विफलताएं तत्काल हैं; कुछ धीमी हैं। तत्काल विफलताएं (टाइमआउट, स्कीम असंगतता, लेखक त्रुटि) का पता लगाना सस्ता है। धीमी विफलताएं (मेमोरी विषाक्तता, मोनोकल्चर बहाव, भूमिका अस्पष्टता) का पता लगाना और रोकना महंगा है।
2026 इंजीनियरिंग चालः उपकरण धीमी विफलता प्रॉक्सी ताकि आप एक दृश्यमान त्रुटि बनने से पहले बहाव को पकड़ सकें। समझौते की दर, पुनः प्रयास की दर, आउटपुट लंबाई वितरण, और लगातार एजेंट संस्करणों के बीच संपादन-दूरी सभी उपयोगी प्रॉक्सी हैं।
इसे बनाओ
code/main.pyकार्य करता हैः
FailureTaxonomyअनुकरण की गई घटनाओं को MAST + Groupthink श्रेणियों में वर्गीकृत करता है।CircuitBreakerक्लासिक पैटर्न; त्रुटि दर सीमा से अधिक होने पर खुलता है।RetryStormSimulatorकैस्केडिंग विफलता दिखाता है; सर्किट ब्रेकर चालू/बंद करता है।DetectionAgentस्क्रिप्ट STRATUS शैली लक्षण मिलान।
दौड़ें:
python3 code/main.pyअपेक्षित उत्पादनः
- बिना सर्किट ब्रेकर के पुनः प्रयास तूफानः इन्वेंट्री त्रुटियां फट जाती हैं (अनुकरण) ।
- सर्किट ब्रेकर के साथः सीमा पर कैप; गिरावट मोड प्रतिक्रियाएं सेवा दी गई।
- पता लगाने वाले एजेंट पैटर्न को चिह्नित करते हैं और MAST श्रेणी का नाम देते हैं।
इसका प्रयोग करें
outputs/skill-mast-auditor.mdमल्टी-एजेंट सिस्टम पर MAST शैली में विफलता मोड ऑडिट चलाता है।
इसे भेजें
उत्पादन में विफलता मोड अनुशासनः
- MAST audit per quarter.वार्षिक नहीं, आपकी प्रणाली के विकास के साथ श्रेणियां बदलती हैं।
- Circuit breakers everywhere.किसी भी निर्भर सेवा के लिए प्रत्येक आउटबाउंड कॉल। डिफ़ॉल्ट खोलें सीमा 5-10% त्रुटि दर पर।
- Golden datasets.छोटे, उच्च गुणवत्ता वाले, हाथ से ऑडिट, प्रति सप्ताह उनके खिलाफ वापसी परीक्षण.
- STRATUS trio.पता लगाने + निदान + सत्यापन एजेंट उत्पादन की निगरानी करते हैं। केवल पता लगाने वाले एजेंट के साथ शुरू करें; जब लक्षण शोरदार हों तो निदान जोड़ें।
- Failure budget.श्रेणी के अनुसार विफलता दर के लिए स्पष्ट SLO। बजट से अधिक शिपिंग स्टॉप वार्ता को ट्रिगर करता है।
व्यायाम
- दौड़ें
code/main.pyसर्किट ब्रेकर को दोबारा तूफान की जांच करने की पुष्टि करें, विफलता की सीमा को बदल दें और ट्रांजेक्शन का पालन करें। - एक slow-failure proxy: 3 समानांतर एजेंटों में संरेखण दर। जब यह तेजी से गिरता है, तो अलर्ट को ट्रिगर करें। एजेंट आउटपुट को धीरे-धीरे सहसंबंधित करके एक एकाधिकार बहाव का अनुकरण करें।
- Cemri et al. (arXiv:2503.13657) पढ़ें। उनके 7 MAS सिस्टम में से एक चुनें और इसकी शीर्ष 3 विफलता श्रेणियों का नक्शा बनाएं। ये MAST की भविष्यवाणी के साथ कैसे तुलना करते हैं?
- ग्रुप थिंक पेपर (arXiv:2508.05687) पढ़ें। उत्पादन में कौन से पांच पैटर्न का पता लगाना सबसे कठिन है, इसकी पहचान करें। प्रॉक्सी मीट्रिक का प्रस्ताव करें।
- आप किसी विशिष्ट मल्टी-एजेंट सिस्टम के लिए स्ट्रेटस-शैली का डिटेक्शन-डायग्नोसिस-वैलिडेशन ट्रीओ डिज़ाइन करें। आप जानते हैं कि डिटेक्शन किस लक्षण की निगरानी करता है? क्या निदान कम करने की सिफारिश करता है? वैलिडेशन कैसे पुष्टि करता है कि वे काम करते हैं?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| MAST | "The 2026 taxonomy" | Cemri 2025; 3 root categories + 14 sub-types of failures. |
| Specification Problem | "Role ambiguity" | Task or role under-defined; agents do not know what to do. |
| Coordination Failure | "State drift" | Communication or sync breakdown between agents. |
| Verification Gap | "No one checked" | Outputs accepted without independent validation. |
| Groupthink family | "Homogeneity failures" | Monoculture, conformity, deficient ToM, mixed-motive, cascading. |
| Monoculture collapse | "Same model, same hallucinations" | Correlated errors from shared base model or training data. |
| Retry storm | "Cascading error amplification" | One failure triggers retries which amplify load downstream. |
| Circuit breaker | "Fail fast on error rate" | Open when error rate exceeds threshold; short-circuit with default. |
| STRATUS | "Incident response trio" | Detection + diagnosis + validation agents. 1.5x mitigation success. |
| Memory poisoning | "Hallucinations propagate" | Shared-memory fact tainted; downstream agents reason on poison. |
आगे पढ़ना
- Cemri et al. — Why Do Multi-Agent LLM Systems Fail? MAST वर्गीकरण, NeurIPS 2025
- Groupthink failures in multi-agent LLMs एकाई संस्कृति, अनुरूपता और पांच परिवारों का वर्गीकरण
- STRATUS — specialized agents for MAS incident response NeurIPS 2025 प्रक्रिया में प्रवेश (जांच + निदान + सत्यापन)
- Release It! — stability patterns (Nygard) कैनोनिक सर्किट ब्रेकर संदर्भ
- Anthropic — Multi-agent research system उत्पादन विफलता मोड नोट्स
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.