असफलता मोडः एजेंट क्यों टूटते हैं
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 14 · 05 (Self-Refine and CRITIC), Phase 14 · 24 (Observability)
Time: ~60 minutes
सीखने के लक्ष्य
- MASFT की तीन विफलता श्रेणियों और प्रत्येक में कम से कम चार विशिष्ट मोड का नाम दें।
- बताएं कि एजेंटिक विफलता मौजूदा एआई विफलता मोड (पक्षपात, भ्रम) को क्यों बढ़ाती है।
- उद्योग में पुनरावर्ती पांच मोड और उनके उन्मूलन का वर्णन करें।
- एक stdlib डिटेक्टर लागू करें जो टैग एजेंट को विफलता मोड लेबल के साथ ट्रैक करता है।
समस्या
टीमों को जहाज एजेंटों 90% के निशान पर काम करते हैं। 10% विफलताएँ यादृच्छिक शोर नहीं हैं वे कम संख्या में आवर्ती श्रेणियों में आते हैं। एक बार जब आप उन्हें नाम दे सकते हैं, तो आप उनकी निगरानी कर सकते हैं और उन्हें ठीक कर सकते हैं।
अवधारणा
MASFT (बर्केली, arXiv:2503.13657)
मल्टी-एजेंट सिस्टम विफलता वर्गीकरण। 14 विफलता मोड 3 श्रेणियों में समूहित। इंटर-नोटेटर कोहेन का कप्पा 0.88 श्रेणियां विश्वसनीय रूप से अलग हो सकती हैं।
केंद्रीय दावाः मल्टी एजेंट सिस्टम में विफलताएं मौलिक डिजाइन दोष हैं, बेहतर आधार मॉडल के साथ तय किए जाने वाले LLM सीमाओं के बजाय।
एजेंटिक एआई सिस्टम में विफलता मोड की माइक्रोसॉफ्ट टैक्सोनोमी
- मौजूदा एआई विफलताएं (पक्षपात, भ्रम, डेटा रिसाव) एजेंटिक सेटिंग्स में बढ़ जाती हैं।
- स्वायत्तता से नई विफलताएं सामने आती हैंः पैमाने पर अनचाहे कार्रवाई, उपकरण का दुरुपयोग, मिशन ड्रिफ्ट।
- श्वेतपत्र एजेंटिक उत्पादों के लिए जोखिम रजिस्टर है।
एजेंटिक एआई में दोषों की विशेषता (arXiv:2603.06847)
- असफलताएं संगठनात्मक, आंतरिक राज्य विकास और पर्यावरण के परस्पर क्रिया से उत्पन्न होती हैं।
- सिर्फ "खराब कोड" या "खराब मॉडल आउटपुट" नहीं।
एलएलएम एजेंट हलूसिनेशन सर्वे (arXiv:2509.18970)
दो प्राथमिक प्रकटीकरणः
- Instruction-following Deviation एजेंट सिस्टम संकेत का पालन नहीं करता है।
- Long-range Contextual Misuse एजेंट पहले के मोड़ से संदर्भ को भूल जाता है या गलत तरीके से लागू करता है।
उप-उद्देश्य त्रुटियांः चूक (गैर-उद्देश्यपूर्ण कदम), अपर्याप्तता (अधिवर्तित कदम), अव्यवस्था (अपरिवर्तित कदम) ।
उद्योग में पुनरावृत्ति के पांच तरीके
एरीज़, गैलीलियो, निम्बलब्रेन 2024-2026 क्षेत्र विश्लेषण पर अभिसरणः
- Hallucinated actions.एजेंट एक उपकरण का आह्वान करता है जो मौजूद नहीं है या तर्क का निर्माण करता है।
- Scope creep.एजेंट उपयोगकर्ता के अनुरोध से परे कार्य का विस्तार करता है (अतिरिक्त पीआर बनाता है, अतिरिक्त ईमेल भेजता है) ।
- Cascading errors.एक गलत कॉल डाउनस्ट्रीम प्रभाव को ट्रिगर करता है। एक भूत SKU भ्रम चार एपीआई कॉल को ट्रिगर करता है।
- Context loss.लंबी दूरी के कार्यों में समय से पहले की बाधाओं को भूल जाते हैं।
- Tool misuse.गलत तर्क के साथ सही उपकरण को बुलाता है, या गलत उपकरण पूरी तरह से।
एजेंट "मैं असफल" और "कार्य असंभव है" के बीच अंतर नहीं कर सकते हैं और अक्सर लूप को बंद करने के लिए 400 त्रुटियों पर सफलता संदेश का भ्रम बनाते हैं।
हर कदम पर द्वार
तर्क श्रृंखला के प्रत्येक चरण में स्वचालित सत्यापन गेट, पर्यावरण की स्थिति के खिलाफ तथ्य आधारित की जांच।
- प्रति चरण सुरक्षा वर्गीकरण (पाठ 21)
- उपकरण-कॉल तर्क सत्यापन (पाठ 06) ।
- ज्ञात तथ्यों के साथ प्राप्त सामग्री की क्रॉस-चेक (पढ़ें 05, आलोचनात्मक) ।
- पुनः जांच स्थिति द्वारा सफलता का पता लगाएं (क्या फ़ाइल वास्तव में बनाई गई थी?
जहां विफलता निगरानी गलत हो जाता है
- Tagging only crashes.अधिकांश एजेंट विफलताएँ वैध दिखने वाले आउटपुट उत्पन्न करती हैं। सामग्री स्तर की जांच की आवश्यकता होती है।
- No baseline.ड्रिफ्ट डिटेक्शन को अंतिम ज्ञात-अच्छी आवश्यकता होती है; इसके बिना आप नहीं कह सकते कि "यह खराब हो रहा है।"
- Over-alerting.हर विफलता एक पृष्ठ उत्पन्न करती है।
इसे बनाओ
code/main.pyएक stdlib विफलता मोड टैगर लागू करता हैः
- पांच मोडों को कवर करने वाला एक सिंथेटिक निशान डेटासेट।
- डिटेक्टर प्रति मोड (उद्यम कॉल, आउटपुट, दोहराए गए कार्यों पर हस्ताक्षर पैटर्न) कार्य करता है।
- एक टैगर जो प्रत्येक निशान को लेबल करता है और मोड वितरण की रिपोर्ट करता है।
इसे चलाओः
python3 code/main.pyआउटपुटः प्रति-ट्रेस लेबल + समग्र वितरण, फीनिक्स के निशान क्लस्टरिंग सतहों की एक सस्ती पुनरुत्पादन।
इसका प्रयोग करें
- Phoenixउत्पादन बहाव क्लस्टरिंग के लिए (पाठ 24) ।
- Langfuseसत्र रीप्ले + टिप्पणी के लिए।
- Customडोमेन विशिष्ट हस्ताक्षर के लिए अपने अवलोकन मंच का पता नहीं लगा सकता है.
इसे भेजें
outputs/skill-failure-detector.mdआपके डोमेन के अनुरूप विफलता मोड डिटेक्टर उत्पन्न करता है, एक ट्रैस स्टोर के लिए वायर्ड।
व्यायाम
- "सफलता का भ्रम" के लिए एक डिटेक्टर जोड़ेंः एजेंट सफलता देता है लेकिन लक्ष्य स्थिति अपरिवर्तित है।
- आपके द्वारा बनाए गए उत्पाद के 100 वास्तविक निशानों को टैग करें. किस मोड में हावी है? इसे ठीक करने की लागत क्या है?
- "कस्केड रेडियस" मीट्रिक लागू करेंः चरण N में विफलता को देखते हुए, यह कितने डाउनस्ट्रीम चरणों को प्रभावित करता है?
- MASFT के 14 विफलता मोड पढ़ें, अपने उत्पाद के लिए लागू तीन चुनें. डिटेक्टर लिखें.
- एक डिटेक्टर को आईसी कार्य में तार करेंः यदि ट्रैक का >=5% मोड टैग करता है तो बिल्ड विफल हो जाता है।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| MASFT | "Multi-agent failure taxonomy" | Berkeley 14-mode categorization |
| Cascading error | "Ripple failure" | One early mistake propagates through N steps |
| Context loss | "Forgot the constraint" | Long-horizon turn drops early-turn facts |
| Tool misuse | "Wrong tool / wrong args" | Valid call, wrong invocation |
| Success hallucination | "Faked completion" | Agent claims success on a 400; state unchanged |
| Scope creep | "Overreach" | Agent does more than asked |
| Instruction-following deviation | "Disobedience" | Ignores system prompt or user constraint |
| Sub-intention errors | "Plan bugs" | Omission, redundancy, disorder in plan execution |
आगे पढ़ना
- Cemri et al., MASFT (arXiv:2503.13657) 14 विफलता मोड, 3 श्रेणियां
- Microsoft, Taxonomy of Failure Mode in Agentic AI Systems जोखिम रजिस्टर
- Arize Phoenix व्यवहार में बहाव समूह
- Anthropic, Building Effective Agents जब सरल पैटर्न मोड से पूरी तरह बचें
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.