Phase 16: Multi-Agent & Swarms

مدل کارگزار / کارساز

یک عامل اصلی برنامه ها و نمایندگان را انجام می دهد؛ کارگران تخصصی در زمینه های موازی اجرا می کنند و گزارش می دهند. این الگوی پشت سیستم تحقیقاتی آنترپیک است (کلود اپوس ۴ به عنوان سرب، سونت ۴ به عنوان زیرنویس) که در +90.2٪ نسبت به اپوس ۴ یک عامل در ارزیابی های تحقیقاتی داخلی اندازه گیری شده است. پست مهندسی Anthropic گزارش می دهد که 80٪ از تفاوت در BrowseComp تنها با استفاده از توکن توضیح داده می شود چند عامل به طور عمده به دلیل اینکه هر زیرنویس یک پنجره زمینه تازه را دریافت می کند برنده می شود. این درس الگوی نظارت را از ابتدایی ها ایجاد می کند و درس های مهندسی 2026 را از انتشار تولید پوشش می دهد.

Type: Learn + Build

Languages: Python (stdlib, threading)

Prerequisites: Phase 16 · 04 (Primitive Model)

Time: ~75 minutes

مشکل

تحقیقات وظیفه اولیه ای است که سیستم های یک عامل شکست می خورند. شما می پرسید "در سیستم های چند عامل بین سال های 2023 تا 2026 چه تغییری رخ داده است؟" یک عامل تنها پنج مقاله را به ترتیب می خواند، نیمی از زمینه را با متن آنها پر می کند و سپس باید در مورد همه آنها با هم استدلال کند. اولین مقاله را در زمان رسیدن به پنجم فراموش می کند. نمی تواند موازی شود.

الگوی سرپرست این را حل می کند: یک عامل اصلی جستجو را برنامه ریزی می کند، هر زیر سوال را به یک کارگر اختصاص می دهد و ترکیب می کند. هر کارگر پنجره 200k خود را برای یک سوال باریک دریافت می کند. رهبر هرگز کاغذ های خام را نمی بیند فقط خلاصه های کارکن.

سیستم تحقیقات تولید Anthropic گزارش +90.2% در مورد ارزیابی های تحقیقاتی داخلی در مقابل یک Opus 4. همان پست اشاره می کند که 80% از BrowseComp تفاوت به تنهایی توسط استفاده از توکن توضیح داده شده است.

مفهوم

الگوی

                 ┌──────────────┐
                 │   Lead       │  plans, decomposes,
                 │  (Opus 4)    │  synthesizes
                 └──┬────┬───┬──┘
                    │    │   │
            ┌───────┘    │   └───────┐
            ▼            ▼           ▼
      ┌─────────┐  ┌─────────┐  ┌─────────┐
      │ Worker1 │  │ Worker2 │  │ Worker3 │
      │(Sonnet) │  │(Sonnet) │  │(Sonnet) │
      └─────────┘  └─────────┘  └─────────┘
         fresh       fresh        fresh
         context     context      context

.کلاهک هرگز مواد اولیه را نمی خواند .کارگران تا زمانی که سرب ترکیب نشود کار یکدیگر را نمی بینند .هر تیر یک دست دادن با یک اثر باریک است

چرا برنده میشه

سه مکانیسم:

  1. Fresh context per subagent.یک کارگر که "موروثی FIPA-ACL" را کشف می کند، 40 هزار توکن را که برای برنامه ریزی هزینه می کند، ندارد. برای یک سوال، 200 هزار پنجره می گیرد.
  2. Specialization via prompt.دستور کار "شکستن و ترکیب" است نه "تحقیق". دستور کار هر کارگر باریک است: "ببینید چه چیزی در X تغییر کرده است". دستورات متمرکز نتایج متمرکز را تولید می کنند.
  3. Parallelism.کارکن ها همزمان کار ميکنن ساعت ديواري تقريباً زماني هستmax(worker_times) + plan + synthesisنهsum(worker_times). .

درس های مهندسی (انتروپک 2025)

پست انتروپک چندین درس تولید را فهرست می کند که هنوز برای سال 2026 مرتبط هستند:

  • Scale effort to query complexity.سوال ساده: یک عامل، 3-10 تماس ابزار. سوال پیچیده: 10+ عامل. رهبر باید این را تخمین زده، نه تماس گیرنده.
  • Broad then narrow.اول به زیرسوال های گسترده تجزیه کنید، سپس اگر پاسخ به عمق نیاز داشته باشد، به هر زیرسوال کارگران بیشتری تولید کنید.
  • Rainbow deployments.عوامل طولانی مدت و دولت دار هستند. آبی سبز سنتی کار نمی کند. انسان شناسی از قوس قزح استفاده می کند: انتشار تدریجی نسخه های جدید در حالی که نسخه های قدیمی از بین می روند.
  • Token usage dominates.چند عامل (Multi-agent) حدود 15 برابر توکن های یک عامل است. فقط زمانی اجرا کنید که ارزش کار هزینه را توجیه کند.

نوبت گراف-منی

لانگ گراف ابتدا يهlanggraph-supervisorکتابخانه با سطح بالاcreate_supervisorدر سال 2025 LangChain توصیه را به پیاده سازی الگوی نظارت از طریق تماس مستقیم ابزار منتقل کرد، زیرا تماس های ابزار کنترل بیشتری بر آنچه که نظارتگر می بیند (انژینیری زمینه) را فراهم می کند. کتابخانه هنوز کار می کند؛ اسناد اکنون فرم تماس ابزار را توصیه می کنند.

حالت شکست

  • Lead hallucinates the plan.اگر منجر به ایجاد زیر سوال هایی شود که سوال واقعی را تجزیه نمی کند، کارگران تحقیق دقیق در مورد هدف اشتباه انجام می دهند.
  • Workers over-explore.بدون محدودیت های محدودی، کارگران فراتر از زیر سوال اختصاص داده شده خود می روند و مرحله سنتز را آلوده می کنند.
  • Synthesis conflicts.دو کارگر حقایق متناقض را باز می گرداند. سرپرست باید دوباره سوال کند (دو راون را اضافه کند) یا اختلاف را به طور صریح یادداشت کند. انتخاب خاموش از یک طرف بدترین شکست است: کاربر هرگز نمی داند اختلاف اتفاق افتاده است.

وقتی که سرپرست اشتباه می کند

  • Sequential tasks.اگر مرحله 2 به معنای واقعی کلمه نیاز به مرحله 1 دارد، موازی هیچ چیز را نمی خرید. از یک خط لوله استفاده کنید (CrewAI Sequential، گراف خطی LangGraph).
  • Simple queries.يک مامور سریعتر و ارزانتر با آنها برخورد ميکنه
  • Strict determinism.نظارت کننده از نمایندگی های LLM انتخاب شده استفاده می کند. نمودار های استاتیک بهتر هستند زمانی که حسابرسی / بازی مجدد مهم تر از سازگاری است.

آن را بسازید

code/main.pyیک کارگزار سه کارگر موازی را به کار می گیرد که از طریق threading. سرب یک سوال را به زیرسوال ها تجزیه می کند، کارگران همزمان در هر زیرسوال اجرا می کنند و سرب ترکیب می کند. LLM واقعی نیست

ساختار کلیدی:

  • Lead.plan(query)یک سوال را به سه زیر سوال تقسیم می کند.
  • Worker.run(sub_q)خلاصه ی جعلی را باز می گرداند (می تواند هر عامل استفاده کننده از ابزار در تولید باشد).
  • Lead.run(query)کارکن ها را به رشته ها، ترکیب و ترکیب می کند.

راه رفتن:

python3 code/main.py

محصول برنامه را نشان می دهد، ردیابی کارگران موازی با زمان شروع / پایان و سنتز نهایی. می توانید ببینید که ساعت دیواری برنده می شود: سه کارگر 0.3 ثانیه در ~ 0.35 ثانیه، نه 0.9 می شوند.

ازش استفاده کن

outputs/skill-supervisor-designer.mdیک سوال کاربر را می گیرد و یک طرح الگوی نظارت کننده را تولید می کند: پیام رسان سیستم، نقش کارکن، قوانین تجزیه زیر سوال و قالب سنتز. قبل از ساخت یک سیستم جدید در سبک تحقیقاتی، از این استفاده کنید.

-باده

فهرست چک قبل از انتشار یک الگوی نظارت:

  • Model pairing.بر روی یک مدل سطح استدلال (کلاس Opus، o3کارگران در یک مدل سریع تر و ارزان تر (سونت، o4-mini)
  • Worker timeout.هر کارگر که از میانگین زمان اجرا 2x بیشتر شود کشته می شود؛ سرب یا با دامنه محدود تر دوباره می شود یا بدون آن ادامه می یابد.
  • Token cap per worker.محدودیت سخت (بگو 10x ورودی سنتز انتظار می رود) مانع از یک کارگر فرار از انفجار بودجه می شود.
  • Observability.نقشه ي رهبر رو دنبال کنين، هر تماسي که با ابزارها ميکنه و همگيري که ميکنه
  • Rainbow rollout.ماموران بلند مدت دولتی نیاز به انتقال تدریجي به نسخه دارند نه به تبادل گرم

تمرینات

  1. فرار کنcode/main.py، سپس منجر را به 5 کارگر به جای 3 تغییر دهید. اثر ساعت دیواری را مشاهده کنید. در چه تعداد کارگر هزینه های بالای تولید در این نمایش بیشتر از پس انداز موازی است؟
  2. زمان بندی کارکن را اجرا کنید: هر کارگر را که بیش از 0.5 ثانیه کار کند بکشید و اجازه دهید که رهبر نتایج باقیمانده را ترکیب کند. چه قابلیت مشاهده ای برای دانستن اینکه یک کارگر قطع شده است نیاز دارید؟
  3. یک مرحله تشخیص تضاد را به سنتز سرب اضافه کنید: اگر دو کارگر پاسخ های متناقض را ارائه دهند، سربازی اختلاف را به جای انتخاب یکی یادداشت می کند. چگونه بدون تماس با یک LLM متناقض را تشخیص می دهید؟
  4. مقاله مهندسی سیستم تحقیقاتی Anthropic را بخوانید. سه روش را که این نمایش بازی باید برای تولید آن را اتخاذ کند، لیست کنید.
  5. مقایسه ی لینگ گرافcreate_supervisor(موروثی) در مقابل توصیه جدید تماس ابزار. چه چیزی به شما کنترل بهتری بر آنچه که سرپرست می بیند می دهد؟ چرا آنترپیک به طور صریح فقط پاسخ های زیر و نه زمینه کارکن خام را به ترکیب می دهد؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
Supervisor"Lead agent"An orchestrator agent that plans, delegates, and synthesizes. Does not do the work itself.
Worker"Subagent"A focused agent invoked by the supervisor with narrow scope and its own context window.
Orchestrator-worker"Supervisor pattern"Same thing, different name. The 2026 literature uses both.
Fresh context"Clean window"A worker's context starts from its system prompt and assigned question, not the lead's history.
Rainbow deployment"Gradual rollout"Long-running stateful agents need versioned drain-and-replace, not blue-green.
Token dominance"Context is the variable"80% of research-eval variance comes from total tokens used, not model choice, per Anthropic.
Scale effort"Match agent count to complexity"Lead estimates query difficulty, spawns 1 vs 10+ workers accordingly.
Synthesis conflict"Workers disagree"Two workers return contradictory facts; the lead must surface disagreement, not silently pick one.

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.