Phase 16: Multi-Agent & Swarms

पर्यवेक्षक / संगीतकार-कार्यकर्ता पैटर्न

एक प्रमुख एजेंट योजनाएं और प्रतिनिधि; विशेषज्ञ श्रमिक समानांतर संदर्भों में निष्पादित करते हैं और रिपोर्ट करते हैं। यह मानव विज्ञान के अनुसंधान प्रणाली के पीछे का पैटर्न है (क्लाउड ओपस 4 लीड के रूप में, सोनेट 4 उप-संयोजकों के रूप में), आंतरिक अनुसंधान मूल्यांकन पर एकल-एजेंट ओपस 4 पर +90.2% पर मापा गया। एंथ्रोपिक के इंजीनियरिंग पोस्ट में बताया गया है कि ब्राउज़ कॉम्प पर 80% भिन्नता केवल टोकन उपयोग द्वारा समझाया जाता है बहु-एजेंट काफी हद तक जीतता है क्योंकि प्रत्येक उप-एजेंट को एक नया संदर्भ विंडो मिलता है। यह पाठ आदिमों से पर्यवेक्षक पैटर्न का निर्माण करता है और उत्पादन तैनाती से 2026 इंजीनियरिंग पाठों को कवर करता है।

Type: Learn + Build

Languages: Python (stdlib, threading)

Prerequisites: Phase 16 · 04 (Primitive Model)

Time: ~75 minutes

समस्या

अनुसंधान एक प्रोटोटाइप कार्य है कि एकल एजेंट प्रणाली विफल. आप पूछते हैं "2023 और 2026 के बीच बहु-एजेंट प्रणालियों में क्या बदल गया है?" एक एकल एजेंट पांच पत्रों को क्रमशः पढ़ता है, उनके पाठ के साथ इसका आधा संदर्भ भरता है, और फिर उन्हें उन सभी के बारे में एक साथ तर्क देना पड़ता है। यह पांचवें तक पहुंचने तक पहला पेपर भूल जाता है। यह समानांतर नहीं कर सकता है।

पर्यवेक्षक पैटर्न इस को ठीक करता हैः एक लीड एजेंट खोज की योजना बनाता है, प्रत्येक उप-प्रश्न को एक कार्यकर्ता को सौंपता है, और संश्लेषण करता है। प्रत्येक कार्यकर्ता को एक संकीर्ण प्रश्न के लिए अपनी 200k टोकन विंडो मिलती है। लीड कभी भी कच्चे कागजात नहीं देखता है केवल कार्यकर्ता सारांश।

मानव विज्ञान के उत्पादन अनुसंधान प्रणाली आंतरिक अनुसंधान मूल्यांकन पर +90.2% रिपोर्ट करता है बनाम एक एकल Opus 4. उसी पोस्ट में उल्लेख किया गया है कि ब्राउज़ कॉम्प के 80% भिन्नता को * टोकन उपयोग ही से समझाया जाता है।

अवधारणा

पैटर्न

                 ┌──────────────┐
                 │   Lead       │  plans, decomposes,
                 │  (Opus 4)    │  synthesizes
                 └──┬────┬───┬──┘
                    │    │   │
            ┌───────┘    │   └───────┐
            ▼            ▼           ▼
      ┌─────────┐  ┌─────────┐  ┌─────────┐
      │ Worker1 │  │ Worker2 │  │ Worker3 │
      │(Sonnet) │  │(Sonnet) │  │(Sonnet) │
      └─────────┘  └─────────┘  └─────────┘
         fresh       fresh        fresh
         context     context      context

लीड कभी कच्चे माल को नहीं पढ़ता है। जब तक लीड संश्लेषित नहीं होता, तब तक श्रमिकों को एक दूसरे का काम नहीं देखा जाता है। प्रत्येक तीर एक संकीर्ण कलाकृतियों के साथ एक हाथ है।

क्यों यह जीतता है

तीन तंत्र:

  1. Fresh context per subagent."FIPA-ACL विरासत" की खोज करने वाले एक कार्यकर्ता के पास 40k टोकन नहीं हैं जो नेतृत्व योजना में खर्च किए गए हैं। एक प्रश्न के लिए 200k खिड़की मिलती है।
  2. Specialization via prompt."विश्लेषण" नहीं, बल्कि "विश्लेषण" है। प्रत्येक कार्यकर्ता का आग्रह संकीर्ण हैः "एक्स में क्या बदला है खोजें।" केंद्रित संकेत केंद्रित परिणाम देते हैं।
  3. Parallelism.कामगार एक साथ चल रहे हैं. दीवार घड़ी समय लगभग हैmax(worker_times) + plan + synthesisनहींsum(worker_times). .

इंजीनियरिंग पाठ (एंट्रोपिक 2025)

मानव विज्ञान पोस्ट में कई उत्पादन पाठों की सूची दी गई है जो अभी भी 2026 के लिए प्रासंगिक हैंः

  • Scale effort to query complexity.सरल प्रश्नः एक एजेंट, 3-10 उपकरण कॉल. जटिल प्रश्नः 10+ एजेंट. लीड को इसका अनुमान लगाना चाहिए, न कि कॉल करने वाले को।
  • Broad then narrow.पहले व्यापक उप-सवालों में विघटित करें, फिर यदि उत्तर गहराई की गारंटी देता है तो प्रति उप-सवालों के लिए अधिक श्रमिक उत्पन्न करें।
  • Rainbow deployments.एजेंट लंबे समय तक चल रहे हैं और राज्यपूर्ण हैं। पारंपरिक नीला-हरा काम नहीं करता है। मानव जाति का उपयोग करता है। नए संस्करणों का धीरे-धीरे रोलआउट जबकि पुराने खत्म हो जाते हैं।
  • Token usage dominates.मल्टी-एजेंट ~ 15 × एकल-एजेंट के टोकन है. केवल जब कार्य मूल्य लागत को उचित बनाता है इसे चलाएं.

ग्राफ-नेटिव वक्र

LangGraph मूल रूप से एक langgraph-supervisorउच्च स्तरीय पुस्तकालय के साथ create_supervisorसहायक. 2025 में लैंगचेन ने सिफारिश को सीधे टूल-कॉल के माध्यम से पर्यवेक्षक पैटर्न को लागू करने के लिए स्थानांतरित कर दिया, क्योंकि टूल कॉल पर पर्यवेक्षक क्या देखता है पर अधिक नियंत्रण देते हैं (सामग्री इंजीनियरिंग) । पुस्तकालय अभी भी काम करता है; डॉक्स अब टूल-कॉल फॉर्म की सिफारिश करते हैं।

विफलता मोड

  • Lead hallucinates the plan.यदि नेतृत्व से उप-सवाल उत्पन्न होते हैं जो वास्तविक प्रश्न को बिगाड़ नहीं देते हैं, तो श्रमिक गलत लक्ष्य पर सटीक शोध करते हैं।
  • Workers over-explore.कार्यक्षेत्र की स्पष्ट सीमाओं के बिना, श्रमिक अपने सौंपे गए उप-प्रश्न से परे बह जाते हैं और संश्लेषण चरण को प्रदूषित करते हैं।
  • Synthesis conflicts.दो श्रमिक विरोधाभासी तथ्यों को वापस करते हैं। लीड को या तो फिर से पूछना चाहिए (एक राउंड जोड़ें) या स्पष्ट रूप से असहमति को नोट करना चाहिए। एक पक्ष का चुपचाप चयन सबसे बड़ी विफलता हैः उपयोगकर्ता कभी नहीं जानता कि असहमति हुई है।

जब पर्यवेक्षक गलत है

  • Sequential tasks.यदि चरण 2 को सचमुच चरण 1 के आउटपुट की आवश्यकता है, तो समानांतरता कुछ भी नहीं खरीदती है। एक पाइपलाइन (क्रूएआई अनुक्रम, लैंगग्राफ रैखिक ग्राफ) का उपयोग करें।
  • Simple queries.एकल एजेंट उन्हें तेजी से और सस्ता संभालता है। प्रजनन श्रमिकों से पहले नेतृत्व की "पैमाना प्रयास" जांच का उपयोग करें।
  • Strict determinism.पर्यवेक्षक एलएलएम द्वारा चुने गए प्रतिनिधि का उपयोग करता है। जब ऑडिट/पुनरावृत्ति अनुकूलन क्षमता से अधिक मायने रखता है तो स्थैतिक ग्राफ बेहतर होते हैं।

इसे बनाओ

code/main.pythreading. लीड एक क्वेरी को उप-सवाल में तोड़ देता है, श्रमिक प्रत्येक उप-सवाल पर एक साथ चलते हैं, और लीड संश्लेषित करता है। कोई वास्तविक एलएलएम नहीं है श्रमिकों को लाना-और-संक्षेप बनाने का अनुकरण करने के लिए स्क्रिप्ट किया गया है।

मुख्य संरचनाः

  • Lead.plan(query)प्रश्न को 3 उप-सवालों में विभाजित करता है।
  • Worker.run(sub_q)एक नकली सारांश लौटाता है (उत्पादन में किसी भी उपकरण-उपयोगी एजेंट हो सकता है) ।
  • Lead.run(query)थ्रेड में श्रमिकों को निकालता है, जोड़ता है, और संश्लेषित करता है।

दौड़ें:

python3 code/main.py

आउटपुट योजना को दिखाता है, समानांतर कार्यकर्ता शुरुआत / अंत समय टिकटों के साथ ट्रैक करता है, और अंतिम संश्लेषण। आप दीवार घड़ी जीत देख सकते हैंः तीन 0.3-सेकंड के श्रमिक 0.35 सेकंड में दौड़ते हैं, 0.9 नहीं।

इसका प्रयोग करें

outputs/skill-supervisor-designer.mdएक उपयोगकर्ता क्वेरी लेता है और एक पर्यवेक्षक-पैटर्न डिजाइन बनाता हैः लीड सिस्टम प्रॉम्प्ट, कार्यकर्ता भूमिकाएं, उप-सवाल विघटन नियम, और संश्लेषण टेम्पलेट। एक नए शोध शैली एजेंट सिस्टम बनाने से पहले इसका उपयोग करें।

इसे भेजें

पर्यवेक्षक पैटर्न को तैनात करने से पहले चेकलिस्टः

  • Model pairing.तर्क-स्तर मॉडल पर नेतृत्व (ओपस वर्ग, o3एक तेज़, सस्ता मॉडल पर काम करने वाले (सोनेट, o4-mini) ।
  • Worker timeout.जो भी कर्मचारी 2x औसत रनटाइम से अधिक हो जाता है, वह मार दिया जाता है; लीड या तो संकीर्ण दायरे के साथ फिर से पैदा होता है या इसके बिना आगे बढ़ता है।
  • Token cap per worker.कठोर सीमा (कहते हैं कि 10x अपेक्षित संश्लेषण इनपुट) एक भागने वाले श्रमिक को बजट को उड़ा देने से रोकता है।
  • Observability.लीड की योजना, प्रत्येक कार्यकर्ता के उपकरण कॉल, और संश्लेषण का पता लगाएं। यह किसी भी पोस्ट-होक डिबगिंग के लिए आधार है।
  • Rainbow rollout.राज्य के लंबे समय से चल रहे एजेंटों को क्रमिक संस्करण संक्रमण की आवश्यकता है, गर्म स्वैप नहीं।

व्यायाम

  1. दौड़ेंcode/main.py, फिर 3 के बजाय 5 श्रमिकों को स्पैन करने के लिए नेतृत्व को संशोधित करें। दीवार घड़ी प्रभाव देखें। इस डेमो में श्रमिकों की संख्या में स्पैन ओवरहेड समानांतर बचत से अधिक है?
  2. एक कार्यकर्ता टाइमआउट लागू करेंः किसी भी कार्यकर्ता को मारें जो 0.5 सेकंड से अधिक समय तक चलता है और शेष परिणामों को संश्लेषित करने के लिए नेतृत्व करें। आपको यह जानने की क्या आवश्यकता है कि एक कार्यकर्ता को काट दिया गया था?
  3. लीड के संश्लेषण में एक संघर्ष-जांच चरण जोड़ेंः यदि दो कर्मचारी विरोधाभासी उत्तर देते हैं, तो लीड एक को चुनने के बजाय असहमति को नोट करता है। आप एलएलएम को बुलाए बिना विरोधाभास का पता कैसे लगा सकते हैं?
  4. एंथ्रोपिक के रिसर्च-सिस्टम इंजीनियरिंग पोस्ट को पढ़ें। तीन प्रथाओं की सूची दें जिन्हें इस खिलौना डेमो को उत्पादन में चलाने के लिए अपनाने की आवश्यकता होगी।
  5. लैंगग्राफ की तुलना करें create_supervisor(रजाई) बनाम नए उपकरण कॉल सिफारिश. जो आपको बेहतर नियंत्रण देता है कि पर्यवेक्षक क्या देखता है? क्यों मानव स्पष्ट रूप से केवल उप-उत्तर और कच्चे कार्यकर्ता संदर्भ में संश्लेषण में पारित करता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Supervisor"Lead agent"An orchestrator agent that plans, delegates, and synthesizes. Does not do the work itself.
Worker"Subagent"A focused agent invoked by the supervisor with narrow scope and its own context window.
Orchestrator-worker"Supervisor pattern"Same thing, different name. The 2026 literature uses both.
Fresh context"Clean window"A worker's context starts from its system prompt and assigned question, not the lead's history.
Rainbow deployment"Gradual rollout"Long-running stateful agents need versioned drain-and-replace, not blue-green.
Token dominance"Context is the variable"80% of research-eval variance comes from total tokens used, not model choice, per Anthropic.
Scale effort"Match agent count to complexity"Lead estimates query difficulty, spawns 1 vs 10+ workers accordingly.
Synthesis conflict"Workers disagree"Two workers return contradictory facts; the lead must surface disagreement, not silently pick one.

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.