भूमिका विशेषज्ञता योजनाकार, आलोचक, निष्पादक, सत्यापितकर्ता
Code = SOP(Team). . चैटडेव (arXiv:2307.07924) "संचारात्मक प्रलोभन" (एजेंट स्पष्ट रूप से लापता विवरणों की मांग) के साथ "चैट चेन" के माध्यम से डिजाइनर, प्रोग्रामर, समीक्षक, परीक्षक को श्रृंखला देता है। सत्यापनकर्ता लोड सहनशील हैः Cemri et al. (MAST, arXiv:2503.13657) हर बहु एजेंट विफलता को याद या टूट सत्यापन के लिए ट्रैक किया जा सकता है। PwC ने CrewAI में संरचित सत्यापन लूप से 7× सटीकता वृद्धि (10% → 70%) की सूचना दी।Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 04 (Primitive Model), Phase 16 · 05 (Supervisor)
Time: ~60 minutes
समस्या
सामान्य बहु-एजेंट सिस्टम सामान्य आउटपुट उत्पन्न करते हैं। समूह चैट में तीन कोडर एक ही मध्यम कोड के तीन स्वाद लिखते हैं। आप अधिक एजेंट जोड़ सकते हैं, अधिक राउंड जोड़ सकते हैं, और फिर भी गुणवत्ता सीमा को पार नहीं कर सकते हैं।
फिक्स अधिक एजेंट नहीं है यह अलग एजेंट है। अलग-अलग भूमिकाएं सौंपें। आलोचक उपकरण दें जो योजनाकार के पास नहीं है। सत्यापितकर्ता को एक उद्देश्य परीक्षण सूट दें। अब सिस्टम में जमीनी सुधार के साथ आंतरिक असहमति है, न कि केवल समानांतर अनुमान।
अवधारणा
चार धर्मशास्त्रिक भूमिकाएँ
Planner.लक्ष्य को पढ़ता है, एक चरण सूची या एक विनिर्देश बनाता है। उपकरणः ज्ञान प्राप्त करना, डॉक्स। आउटपुटः संरचित योजना।
Executor.एक समय में एक योजना चरण को पढ़ता है, कलाकृतियों का उत्पादन करता है। उपकरणः वास्तविक काम के उपकरण (कोड संकलक, खोल, एपीआई क्लाइंट) । आउटपुटः कलाकृतियों।
Critic.कार्यकारी के इरादे के खिलाफ निष्पादक के आउटपुट को पढ़ता है। उपकरणः कलाकृतियों तक केवल पढ़ने का उपयोग, स्थैतिक विश्लेषण। आउटपुटः कारणों के साथ स्वीकार/ अस्वीकार करें।
Verifier.कलाकृतियों को पढ़ता है और एक निर्धारक जांच चलाता है। उपकरणः परीक्षण रनर, प्रकार परीक्षक, स्कीमा सत्यापनकर्ता। आउटपुटः सबूत के साथ पास / विफलता।
आलोचक व्यक्ति व्यक्तिपरक, विचारशील, अक्सर एलएलएम आधारित होता है। सत्यापितकर्ता वस्तुनिष्ठ, निर्धारक, अक्सर कोड आधारित होता है। वे एक ही भूमिका नहीं हैं।
मेटाजीपीटी का एसओपी पैटर्न
मेटाजीपीटी (arXiv:2308.00352) भूमिका संकेत के रूप में सॉफ्टवेयर इंजीनियरिंग SOP को एन्कोड करता हैः
- Product Managerपीआरडी लिखता है।
- Architectसिस्टम डिजाइन का उत्पादन करता है।
- Project Managerकार्य को विभाजित करता है।
- Engineerउपकरण।
- QA Engineerपरीक्षण चलाता है।
प्रत्येक भूमिका में एक सख्त इनपुट/आउटपुट योजना होती है। भूमिका प्रोंप्ट बताता है कि भूमिका की है और यह क्या उत्पन्न करना चाहिए।Code = SOP(Team)सूत्र निर्धारक एसओपी LLM की एक टीम को एक पूर्वानुमान योग्य पाइपलाइन में बदल देते हैं।
चैटदेव की संचारात्मक प्रलोभन
ChatDev एक महत्वपूर्ण कदम जोड़ता हैः जब एक निष्पादक को एक विशिष्ट विवरण की आवश्यकता होती है जो योजना में नहीं था, तो यह स्पष्ट रूप से डिजाइनर से आगे बढ़ने से पहले पूछता है। यह विवरण का आविष्कार करने की क्लासिक एलएलएम विफलता को रोकता है।
कार्यान्वयनः भूमिका प्रलोभन में "जब आपको विशिष्ट जानकारी की आवश्यकता होती है जिसे आपको नहीं दिया गया था, तो आउटपुट उत्पन्न करने से पहले संबंधित भूमिका के नाम से पूछें।"
सत्यापनकर्ता सबसे महत्वपूर्ण क्यों है
Cemri et al. (MAST) ने 1642 मल्टी-एजेंट निष्पादन विफलताओं का पता लगाया। 21.3% सत्यापन अंतराल थे सिस्टम ने एक उत्तर भेजा था जिसे किसी ने नहीं देखा था। शेष 79% अक्सर "एक चेक था जो चुपचाप विफल रहा या कभी नहीं चलाया गया था।" सत्यापन भार-भार भूमिका है।
PwC ने (CrewAI तैनाती, 2025) में बताया कि एक संरचित सत्यापन लूप जोड़ने से सटीकता 10% से 70% तक बढ़ी।
आलोचक बनाम सत्यापनकर्ता
- आलोचक एक LLM है जो गुणवत्ता के लिए एक कलाकृतियों की समीक्षा करता है। विषयगत।
- एक सत्यापनकर्ता एक निर्धारक कार्यक्रम है जो कलाकृतियों पर चलता है। उद्देश्य। सबूत के साथ पास / विफलता देता है।
दोनों का उपयोग करें। आलोचक स्वाद के मुद्दों को पकड़ता है जो सत्यापनकर्ता व्यक्त नहीं कर सकता है। सत्यापनकर्ता बगों को पकड़ता है जो आलोचक नहीं देख सकता क्योंकि वे केवल रनटाइम में दिखाई देते हैं।
प्रतिरूप
आपके सिस्टम में प्रत्येक भूमिका एक LLM है और प्रत्येक भूमिका का आउटपुट "मुझे अच्छा लगता है।" क्लासिक MAST विफलता मोड। कम से कम एक सत्यापनकर्ता जोड़ा जिसका पास / विफलता कोड द्वारा तय की जाती है, न कि एक LLM द्वारा।
फ्रेमवर्क मैपिंग
- CrewAI
Agent(role, goal, backstory)यह पाठ्यपुस्तक विशेषज्ञता सतह है। - LangGraph नोड्स में विशेष संकेत हो सकते हैं; किनारे पाइपलाइन को लागू करते हैं।
- AutoGen ग्रुपचैट में एक शब्द के नामों के साथ भूमिका-विशिष्ट वार्तालाप एजेंट।
- OpenAI Agents SDK भूमिका-विशेष एजेंटों के बीच हस्तान्तरण उपकरण।
इसे बनाओ
code/main.pyएक सरल पायथन फ़ंक्शन बनाने वाली 4-रोल पाइपलाइन को लागू करता हैः
- Plannerएक विनिर्देश का उत्पादन करता है।
- Executorएक कोड स्ट्रिंग उत्पन्न करता है।
- Critic(LLM-अनुकरण) स्पष्ट मुद्दों को दर्शाता है।
- Verifierउत्पन्न कोड को एक सैंडबॉक्स में चलाता है (
exec) एक परीक्षण मामले के खिलाफ।
डेमो दो बार चलाया जाता हैः एक बार जब निष्पादक सही कोड उत्पन्न करता है (क्रिटिक + सत्यापनकर्ता दोनों पास), एक बार जब निष्पादक ऑफ-स्पेस कोड उत्पन्न करता है (क्रिटिक बग को याद करता है क्योंकि यह विश्वसनीय लगता है, सत्यापनकर्ता इसे पकड़ता है क्योंकि परीक्षण विफल रहता है) ।
दौड़ें:
python3 code/main.pyइसका प्रयोग करें
outputs/skill-role-designer.mdएक कार्य लेता है और भूमिका सूची (3-5 भूमिकाओं), प्रति भूमिका इनपुट/आउटपुट योजना और सत्यापनकर्ता जांच उत्पन्न करता है। एक ढांचे में वायरिंग एजेंटों से पहले इसका उपयोग करें।
इसे भेजें
चेकलिस्टः
- At least one deterministic verifier.कभी भी सभी-LLM.
- Explicit I/O schema per role.नियोजक एक विशिष्टता लौटाता है, गद्य नहीं; निष्पादक उस योजना को पढ़ता है।
- Communicative dehallucination.निष्पादक को योजनाकार से पूछना चाहिए कि सूचना कब गायब है; इसे कभी भी आविष्कार न करें।
- Critic/verifier ordering.पहले क्रिटिकल चलाएं (सस्ते, डिजाइन समस्याएं पकड़ता है), दूसरा सत्यापनकर्ता (धीमी, बग पकड़ता है) ।
- Loop budget.मानव में वृद्धि से पहले मैक्स 2 आलोचक-कार्यकारी संशोधन राउंड।
व्यायाम
- दौड़ें
code/main.pyऔर निरीक्षण कैसे सत्यापनकर्ता की पकड़ की बग आलोचक चूक गया. एक स्थैतिक-विश्लेषण जांच जोड़ें (घटन घटनाओं की गिनतीreturn) के रूप में एक अतिरिक्त सत्यापनकर्ता। यह क्या पकड़ता है कि रनटाइम परीक्षण चूक जाता है? - एक पांचवीं भूमिका जोड़ेंः "आवश्यकता विश्लेषक" जो उपयोगकर्ता की इच्छा को नियोजक के लिए तैयार विनिर्देश में अनुवाद करता है। किस संचारात्मक प्रलोभन अनुरोध को इसके लिए बहना चाहिए?
- मेटाजीपीटी सेक्शन 3 ("एजेंट्स") को पढ़ें। मेटाजीपीटी की 5 भूमिकाओं में से प्रत्येक की इनपुट/आउटपुट योजना को सूचीबद्ध करें।
- चैट डेव के चैट-चेन आरेख को पढ़ें (आर्एक्सआईवीः 2307.07924 चित्र 3) पहचानें कि संचारात्मक निराशाजनकता एक लूप को कहां तोड़ती है जो अन्यथा अनंत होगी।
- प्रूसी की 7 गुना सटीकता लाभ सत्यापन लूप से आया। तीन कार्यों का परिकल्पना करें जहां एक सत्यापनकर्ता जोड़ने से मदद नहीं होगी जहां सटीकता की निर्धारात्मक जांच असंभव या निषेधात्मक रूप से महंगी है।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Role specialization | "Different agents, different jobs" | Distinct system prompts tuned for planner/executor/critic/verifier roles. |
| SOP pattern | "Encoded standard operating procedure" | MetaGPT's framing: strict I/O schemas per role turn a team into a pipeline. |
| Communicative dehallucination | "Ask before inventing" | ChatDev pattern: executor asks planner when a detail is missing rather than making one up. |
| Critic | "LLM reviewer" | Subjective, opinionated reviewer. Catches taste issues. Can be fooled by plausible prose. |
| Verifier | "Deterministic check" | Code-based pass/fail. Test runner, type checker, schema validator. Cannot be fooled. |
| Verification gap | "No one checked" | 21.3% of MAST failures. Answer shipped without a check that would have caught the bug. |
| Revision loop | "Critic sends it back" | Critic rejection triggers executor re-run with feedback. Needs a budget. |
| All-LLM anti-pattern | "Looks good to me" | Every role is an LLM, no deterministic check. Classic MAST failure. |
आगे पढ़ना
- Hong et al. — MetaGPT: Meta Programming for Multi-Agent Collaboration भूमिका के रूप में एसओपी-प्रोम्प्ट संदर्भ पत्र
- Qian et al. — Communicative Agents for Software Development (ChatDev) चैट श्रृंखला + संचारात्मक प्रलोभन
- Cemri et al. — Why Do Multi-Agent LLM Systems Fail? MAST वर्गीकरण; सत्यापन के अंतराल विफलताओं के 21.3% हैं
- CrewAI docs — Agent roles उत्पादन भूमिका विनिर्देश सतह
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.