Phase 16: Multi-Agent & Swarms

تحسين السجائر للاستكشافات العليا (PSO، ACO)

التكامل المستنفذ من الأحياء يعيد إدارة القانونLMPSO(arXiv:2504.09247) يستخدم PSO حيث سرعة كل جزيئة هي محاولة وتوليد LLM المرشح التالي؛ يعمل بشكل جيد على نتائج التسلسل المهيكلة (عبارات الرياضيات، البرامج). Model Swarms(arXiv:2410.11163) يعامل كل خبير في ماجستير في مجال القانون كجزء من PSO على مجموعة متنوعة من الوزن النموذجي ويعطي تقارير 13.3% average gainأكثر من 12 خط أساسي على 9 مجموعات بيانات مع 200 حالة فقط. SwarmPrompt(ICAART 2025) تضمنت PSO + Grey Wolf لتحسين سريع. AMRO-S(arXiv:2603.12933) هو متخصص فيرومونات مستوحاة من ACO لمتصفحات LLM متعددة الوكلاء 4.7x speedup، دليل التوجيه المفسر ، تحديث غير متزامن مع الجودة المحددة التي تفصل الاستنتاج عن التعلم. هذه الدروس تنفيذ PSO على مساحة المعلمات السريعة و ACO على التوجيه الوكيل ، وتقييم لماذا هذه الخوارزميات الكلاسيكية تناسب عصر LLM ، ومتى لا يفعلون ذلك.

Type: Learn + Build

Languages: Python (stdlib)

Prerequisites: Phase 16 · 09 (Parallel Swarm Networks), Phase 16 · 14 (Consensus and BFT)

Time: ~75 minutes

المشكلة

لديك طلب يسجل 62٪ على تقييم المهمة الخاصة بك. تريد تحسينه. التحرك الباهش هو تعديل يدوي خالي من التدفقات، والذي يتحكم بشكل سيء. يتطلب التعلم التمهيدي إشارات مكافأة وتشغيلات كافية للتدريب. لا يمكن التقدم إلى الوراء من خلال طلبات.

التحسين الكلاسيكي المستوحى من الحيوية PSO لمناطق البحث المستمرة، ACO لانتخاب المسار تم تصميمها بالضبط لهذا النظام: خالية من التدفق، على أساس السكان، رخيصة لكل تقييم. مزجها مع LLM لخطوة البحث خالية من التدفق، وتحصل على تحسين عملي بشكل مفاجئ.

نفس الأنماط تنطبق على الوكيل التوجيه في أنظمة متعددة الوكلاء. تسجل فيرمونات في نمط ACO مسار أي وكيل عمل بشكل أفضل على أي نوع من المهام، ويسمح للجهاز التوجيهي باستغلال المسار، وتتفكك الفيرمونات حتى يتم إعادة اكتشاف المسارات.

المفهوم

تحديث PSO (Kennedy & Eberhart 1995)

تحسين حشرة الجسيم: عدد الجسيمات في مساحة بحث مستمرة. لكل جزيئ موقع x_iوسرعةv_iكل إعادة:

v_i <- w * v_i + c1 * r1 * (p_best_i - x_i) + c2 * r2 * (g_best - x_i)
x_i <- x_i + v_i
evaluate fitness(x_i)
update p_best_i if improved
update g_best if global best

أينp_bestهو أفضل الجزيئات الخاصة بها،g_bestهو أفضل من السحرةw, c1, c2هي السخرية + المعرفية + الوزن الاجتماعي،r1, r2العوامل العشوائية

المكتب العام للشركات المتخصصة في نتائج القانون القانوني المكتب العام للشركات المتخصصة في مجال القانون القانوني

arXiv: 2504.09247 يعدل PSO للمخرجات المهيكلة التي يولدها LLM (عبارات الرياضيات ، البرامج). كل جزيئ هو إنتاج مرشح. السرعة هي إنتاج يصف كيفية تعديل الإنتاج الحالي نحو الأفضل الشخصي / العالمي. إن LLM يولد الإنتاج الجديد من إنتاج السرعة. "التخلل" من السرعة هو إنتاج مثل "إجراء تغييرات متزايدة صغيرة".

هذا يعمل بشكل جيد عندما:

  • إن المخرجات مهيكلة (مفتحة، قابلة للتقييم).
  • التناسب هو تلقائي (التجربة، التقييم الحسابي).
  • السكان صغيرون (~ 10-30 جزيئات) لذلك إجمالي مكالمات LLM تظل قابلة للتدبير.

لا يعمل بشكل جيد عندما يحتاج اللياقة البدنية إلى مراجعة بشرية تكلفة التكرار تصبح محظورة.

النموذج السحالي

arXiv:2410.11163 يأخذ PSO من طبقة الخروج إلى طبقة النموذج. كل "جزيئ" هو LLM الخبير (الفقرات). يتحرك السحبة المعايير نحو أفضل جماعي عن طريق تحديث خالي من التدفق. تم الإبلاغ عن: 13.3% متوسط المكاسب على 12 خط أساسي على 9 مجموعات بيانات ، مع 200 حالة فقط لكل تكرار.

المعلومات الرئيسية هي أن نماذج الخبراء في مجال ماجستير في التنمية العلمية القصوى موجودة بالفعل في مكان قريب في مجموعة من المعلمات المشتركة (وزن المعدلات، ديلتا لورا).

إعادة تأهيل ACO (دوريغو 1992)

تعزيز مستعمرة النمل: النمل يعبر الرسم البياني؛ كل مسار لديه مسار فيرومون. النمل يتحرك الاحتمالات وزنه بمقدار قوة فيرومون. النمل الذي ينهي المهمة يضع فيرومون متناسبة مع جودة الحل. يتدهور فيرومون مع مرور الوقت.

AMRO-S ACO للتوجيه للعملاء

arXiv:2603.12933 يستخدم ACO لالتوجيه متعدد الوكلاء. كل نوع من المهام هو "المقصود" ؛ كل وكيل هو طريق ممكن. الفيرومونات تعزز الطرق التي تنتج نتائج جيدة. المساهمات الرئيسية:

  • Interpretable routing evidence.قوة الفيرمونات إشارة يمكن قراءتها من قبل الإنسان
  • Quality-gated asynchronous update.تتحديث الفيرومونات فقط بعد اجتياز عمليات التحقق من الجودة، مما يفرض إستنتاجات عن التعلم.
  • 4.7x speedupعلى مقياس التوجيه متعدد الوكلاء.

البوابة الجودة مهمة: بدونها، العوامل السريعة ولكن الخاطئة تتراكم فيرومون، والنظام يحتجز في المسارات السيئة.

متى تستخدم PSO / ACO للماكن القانونية

Use PSO when:

  • مساحة البحث مستمرة أو خرائط إلى معايير مستمرة (التركيبات السريعة، وزرات LoRA، معايير توليد العددية).
  • التنفس رخيص ومتلقّى
  • السكان قد يكونون صغار (10-30).

Use ACO when:

  • لديك مشكلة في التوجيه أو اختيار المسار
  • القرارات تعزز مع مرور الوقت (تعود نفس أنواع المهام).
  • تحتاج إلى دليل يمكن تفسيره لقرارات التوجيه

Do not use either when:

  • التناسب يتطلب مراجعة بشرية (غالية جداً لكل تكرار).
  • مساحة البحث منفصلة ومزدوجة بطريقة لا تغطي PSO (استخدم خوارزميات وراثية بدلاً من ذلك).
  • تتطلب القرارات في الوقت الحقيقي تأخيرًا صارمًا (تتتقارب PSO/ACO ببطء بالنسبة إلى هيرستيات المرور الواحد).

لماذا لا يزال النجاح في إلهام الحيوية

تحتاج الطرق القائمة على الدرجات إلى إشارات قابلة للتفريق. لا يمكن التفريق بين نتائج LLM وقرارات التوجيه بشكل طفيف. تعمل طرق الدرجات السائدة (المركبات التي تتعلم من تعزيز، ومواصلات التوجيه على النمط DPO) ولكن تحتاج إلى تدريب مكلف.

PSO و ACO تحتاج فقط إلى وظيفة تقييم . إذا كنت تستطيع تسجيل خروج مرشح أو قرار توجيه، يمكنك تحسين المساحة. وهذا يجعل شريط التطبيق أقل بكثير.

الحدود العملية

  • Population budget.N جزيئات × ت التكرار × تكلفة لكل فئة.$0.02 / call, a 20-particle PSO running 50 iterations costs ~$20، خططوا وفقاً لذلك
  • Exploration vs exploitation.معدل تدهور الفيرمونات و سلبية PSO التجارة بعيدا؛ تدهور سريع جدا → نسيان الحلول؛ بطيئ جدا → عالق على الأولميات المحلية المبكرة.
  • Catastrophic drift.يمكن أن تتحرك كلا الخوارزميات ثم تختلف إذا تغيرت المناظر الطبيعية للرياضة (توزيع البيانات الجديدة). مراقبة استقرار أفضل اللياقة البدنية.

بناءها

code/main.pyتطبيقات:

  • LMPSO PSO على معايير الإستعراض العددية (الدرجة الحرارة ، وزن top_k). يتم محاكاة "جيل LLM" لكل جزيئة كعملة تناسبية مكتوبة. يعمل الخوارزمية لمدة 30 تكرارًا ويعرض أفضل التقارب.
  • AMRO_S توجيه على طراز ACO. 3 عوامل، 4 أنواع المهام، ماتريكس الفيرومونات، 100 مهمة توجيه. طباعة (مهمة_نوع → خيارات الوكيل) توزيع عبر الزمن لإظهار تكوين المسار.
  • مقارنة: التوجيه العشوائي مقابل التوجيه ACO على نفس سلسلة المهام. يقيس الجودة والبطء.

أركض

python3 code/main.py

الناتج المتوقع:

  • LMPSO: g_best fitness تحسن من العشوائية إلى شبه المثالي أكثر من 30 تكرار.
  • AMRO-S: جدول الفيرمونات يستقر على العامل الصحيح لكل نوع المهمة؛ يضرب توجيه ACO عشوائيًا بنسبة ~ 30-40٪ على الجودة ويقلل أيضًا من التأخير (قلة التجربات المرتدعة).

استخدمها

outputs/skill-swarm-optimizer.mdيساعد على اختيار بين PSO ، ACO ، الخوارزميات الوراثية ، ومحفزات على أساس التراجع لمشاكل تحسين LLM / وكيل.

أرسله

  • Start small.10-20 جزيئة، 20-50 تكرار. يصل إلى نطاق فقط إذا كان منحنى التقارب يظهر مكاسب واضحة.
  • Log pheromones or g_best per iteration.إزالة أخطاء المُحافظين دون وجود أثر مؤلم
  • Quality-gate updates.خاصة في طريق ACO: لا يجب أن تتراكم العوامل السريعة والخطأ فيرومون.
  • Reset decay on distribution shift.عندما يتغير توزيع تقييمك، فيرومونات الشيخوخة متزمنة؛ إعادة تعيين أو مضاعفة معدل التدهور مؤقتا.
  • Cap the per-iteration cost.إصدار مقياس التكلفة لكل إعادة التكرار. PSO الذي يكلف 500 دولار / إعادة التكرار ويكسب 0.5% لا يمكن شحن.

التمارين

  1. أركضcode/main.pyلاحظ التقارب من LMPSO. حجم السكان مختلف 5, 10, 20, 50. في أي حجم يشبّن الوقت للتقارب؟
  2. تنفيذ تجربة "التحرك الكارثي": بعد التكرار 30، تغيير وظيفة اللياقة البدنية. كم سرعة تكييف PSO؟ هل إعادة التعيين p_best-ساعدت؟
  3. إضافة بوابة جودة إلى AMRO-S: إيداع الفيرمون فقط على الجوائز التي لديها درجة تقييم > 0.7. كيف يغير هذا التقارب مقابل النسخة غير المحددة؟
  4. قراءة LMPSO (arXiv:2504.09247). خريطة "سرعة ورقة كإشارة" مرة أخرى إلى سرعة الرقمية الخاصة بك. ما الذي يفقده في المحاكاة وما الذي يتم الحفاظ عليه؟
  5. قراءة AMRO-S (arXiv:2603.12933). تنفيذ "مسار سريع التأثير" منفصل مع تحديث الفيرمونات غير المزامن. كيف يغير هذا تأخير النظام تحت الحمل المستدام؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
PSO"Particle Swarm Optimization"Kennedy-Eberhart 1995. Population-based gradient-free optimizer.
ACO"Ant Colony Optimization"Dorigo 1992. Path/route optimization via pheromone trails.
LMPSO"PSO with LLM generation"arXiv:2504.09247. Velocity is a prompt; LLM produces candidates.
Model Swarms"PSO on expert weights"arXiv:2410.11163. Gradient-free update on model parameter subspace.
AMRO-S"ACO for agent routing"arXiv:2603.12933. Pheromone matrix over task-type × agent.
p_best / g_best"Personal / global best"Per-particle and swarm-wide best solutions found so far.
Pheromone"Routing memory"Strength on an edge; decays over time; deposits on quality.
Quality-gated update"Only learn from good runs"Pheromone deposit conditioned on quality check.
Catastrophic drift"Distribution shift"Fitness landscape changes; old p_best and pheromones become stale.

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.