رای گیری، خودآزادی و بحث
Type: Learn + Build
Languages: Python (stdlib)
Prerequisites: Phase 16 · 07 (Society of Mind and Debate), Phase 16 · 14 (Consensus and BFT)
Time: ~75 minutes
مشکل
بحث می تواند دقت را بهبود بخشد (Du et al., arXiv:2305.14325). همچنین می تواند آن را کاهش دهد.
- چه كسي با چه كسي صحبت مي كند (تپولوژي).
- چند دور (Du 2023: دور و عوامل به طور مستقل مهم هستند).
- آیا عوامل همجنس هستند (نمادها پایه مختلف یک واحد را شکسته اند).
- آیا صدای مخالف وجود دارد (حجاب ضد سلفی)
تیم هایی که "۵ عامل را اجرا کرده و رای می دهند" را به یک کار اختصاص می دهند، اغلب با یک عامل مخالف هستند. شکست ها تصادفی نیستند. آنها توپولوژی و همجنس را ردیابی می کنند. این درس نقشه توپولوژی است.
مفهوم
خودآمرگی، خط اصلی یک مدل
وانگ و همکاران 2022 ("خودآمرگی باعث بهبود زنجیره استدلال می شود") نمونه های مشابهی N بار در دمای > 0 و اکثریت رای در پاسخ های راه استدلال را انجام دادند. نتیجه در GSM8K: افزایش قابل توجهی با نمونه های N=40 در یک کد طمع آمیز واحد. خودآمرگی پیشگام یک عامل واحد برای رای دادن چند عامل است.
محدودیت: خودآمرگیری از یک مدل پایه استفاده می کند. خطاها با ساخت مرتبط هستند. اگر مدل دارای یک تعصب سیستماتیک باشد، همه نمونه های N آن را به اشتراک می گذارند.
رای چند نماینده، گسترش متغیر
نمونه های N را با عوامل N متفاوت جایگزین کنید. مدل های پایه مختلف (Claude، GPT، Llama) ، پیام های مختلف، دسترسی مختلف به ابزار. مزایای: خطاهای غیر مرتبط. هزینه: عوامل مختلف هزینه های مختلف را دارند؛ هماهنگی آنها هزینه های کلی را اضافه می کند.
نام کاینونیک 2026 برای بحث های مختلفA-HMADبحث متناقض متعدد عوامل. به طور جهانی پذیرفته نشده است، اما مقالات این اصطلاح را برای "مناقشات مدل های مختلف استفاده می کنند که اشتباهات مرتبط با سقوط مونوکلتور را کاهش می دهد".
چهار توپولوژی
star chain tree graph
┌─A─┐ A─B─C─D ┌──A──┐ A───B
│ │ │ │ │ × │
B C B C D───C
│ │ / \ / \
D E D E F G (fully connected)ستاره: يه مرکز، همه ي ديگري ها فقط با مرکز صحبت ميکنن معادل به کارگزار بدون کانال عقب
زنجیره: خطی، هر عامل محصول قبلی را می بیند. مانند خط لوله.
درخت: سلسله مراتبی، که توسط سیستم های ارگانیک ارگانیک استفاده می شود (درسی 06).
گراف: هر کسی به هر کسی شامل کلک کاملاً متصل و DAG های تعسفی است
مالیات هماهنگی (MultiAgentBench)
MultiAgentBench (MARBLE، ACL 2025, arXiv:2503.01935) ستاره، زنجیره، درخت، نمودار را در مجموعه ای از وظایف شامل تحقیق، کدگذاری و برنامه ریزی مقایسه کرد. نتایج اندازه گیری کلیدی:
- Graphتوپولوژی در وظایف تحقیقاتی برنده می شود. اطلاعات به هر کسی جریان می یابد؛ عوامل می توانند یکدیگر را انتقاد کنند.
- Starدر جواب سریع، کار های واقعی موفق می شود. مرکز فیلتر و تحکیم می کند.
- Chainبرنده شدن در خط لوله های مرحله ای (تحسين مرحله ای).
- Coordination taxدر جدول جدول، قیمت ساعت دیواری و توکن سریعتر از کیفیت رشد می کند.
سقف 4 عامل تجربی است، نه اساسی. این منعکس کننده ظرفیت زمینه LLM 2026 است: زمینه هر عامل با تولیدات همسالان پر می شود و ارزش حاشیه ای از اضافه کردن عامل N + 1 هنگامی که همه می توانند همه را ببینند کاهش می یابد.
استراتژی های بحث چند عامل ("می خواهیم دیوانه شویم؟")
arXiv:2311.17371 بررسی سال 2023 استراتژی های MAD است. یافته های کلیدی که توسط دیگران تکرار شده است: انواع MAD که از نظر ساختاری شبیه به خودآزمایی هستند (معمولا نمونه گیری مستقل + جمع آوری) اغلب عملکرد خودآزمایی را در هنگام استفاده از همان بودجه کم می کنند. MAD بیشتر در صورتی کمک می کند که عوامل واقعا متغیر باشند و بحث ساختار متناقض داشته باشد (یک عامل با آن استدلال می کند).
نمره های جدید
AgentVerse (ICLR 2024)https://proceedings.iclr.cc/paper_files/paper/2024/file/578e65cdee35d00c708d4c64bce32971-Paper-Conference.pdf) دو رفتار را که از بحث چند عامل حتی بدون طراحی صریح ظاهر می شود، مستند می کند:
- Volunteer.یک عامل کمک را بدون اطلاع ارائه می دهد ("من می توانم گام بعدی را انجام دهم"). مفید: کار را به نماینده با توانایی برای یک وظیفه زیر اختصاص می دهد.
- Conformity.یک عامل موضع خود را برای مطابقت با یک منتقد تنظیم می کند، حتی اگر منتقد اشتباه باشد. این معادل بحث از سکوفانسی (درسی 14).
مطابقت به خاطر اينه که بحث تا توافق به زور بازيگران پاداش ميده. دورها با قاضي جداگانه کاهش ميده.
متغیر: دکمه واقعی که دقت را حرکت می دهد
یک الگوی 2024-2026 در ادبیات عملی: تغییر یکی از عوامل N خود را برای یک مدل پایه مختلف باعث افزایش دقت بزرگتر از افزایش N توسط 1 می شود.
در حد، همتاییت از تعداد بیشتر است. سه مدل مختلف پنج نسخه از یک مدل را در اکثر وظایف که حقیقت خاک پاک دارند، می پرند.
روش های هیئت منصفه
چارچوب سیبیل (در ادبیات مینسکی-LLM نقل شده) یک "قضایی" را رسمی می کند. مجموعه کوچکی از عوامل تخصصی که با رای دادن در هر مرحله پاسخ را اصلاح می کنند. برخلاف رای اکثریت ساده، قضایی نقش دارد: یک عامل از طریق بررسی های متقابل، یک زمینه را فراهم می کند، یک اعتبار را نمره می دهد. روش های قضایی نقطه وسط بین رای ساده ( ارزان، متأثر با یک فرهنگ) و کامل MAD (مقدره، متأثر با سازگاری) هستند.
وقتی که رأی با بحث برتری پیدا می کند
- این سوال حقیقت اساسی دارد (حقیقت، ریاضیات، رفتار کد).
- عوامل می توانند به منابع یا ابزار های مختلف دسترسی داشته باشند (تغیرات موجود است).
- دورها محدود هستند (2-3 معمول) و یک قاضی یا تأیید کننده جداگانه وجود دارد.
- بودجه اجازه می دهد تا 3-5 عامل. فراتر از 5-7 در توپولوژی نمودار، مالیات هماهنگی تسلط دارد.
وقتی که رای دادن با بحث درد می کند
- اين سوال به شکل نظريه، ماموران به هر جوابي که به نظر مي رسد مطمئن تر باشه، همگام ميشن
- همه ماموران يک مدل پايين دارند. مونوکلتور توافق را بي معنا مي سازد.
- دورها بدون مرز هستن.
- این کار ساده است. یک عامل واحد با ثبات خود در N=5 ارزان تر و درست تر است.
آن را بسازید
code/main.pyابزار:
run_star(agents, hub, question)نظرسنجی های مرکز برای هر کارگر، مجموعrun_chain(agents, question)اصلاحات دنباله دارrun_tree(root, children, question)سلسله مراتب با جمع بندی عمق-2run_graph(agents, question, rounds)بحث همه چیز، دورهای محدود- یک عدد متغیر با اسکریپت: هر عامل دارای
error_biasکه نشان دهنده اشتباهات سیستماتیک آن است. - یک خط اندازه گیری که هر توپولوژی را در N=3, 5, 7 اجرا می کند و گزارش می دهد (درست بودن، total_tokens، wallclock_simulated).
راه رفتن:
python3 code/main.pyتولید انتظار می رود: یک جدول توپولوژی × N → (درست بودن، توکن ها، تاخیر) نمودار در N=3-5 در وظایف سبک تحقیقاتی برنده می شود؛ ستاره در وظایف سریع واقعیت برنده می شود؛ نمودار در N=7 مالیات هماهنگی را نشان می دهد (تخفیف سریعتر از دقت افزایش می یابد).
ازش استفاده کن
outputs/skill-topology-picker.mdاین مهارت است که یک توصیف کار را می خواند و یک توپولوژی ( ستاره / زنجیره / درخت / نمودار) ، یک N (عدد عوامل) ، یک پروفایل همجنس (نمادها پایه برای استفاده) و یک خط گرد را توصیه می کند.
-باده
برای هر گروه:
- از شروع بهself-consistency at N=5با استفاده از یک مدل پایه قوی. این پایه ارزان است.
- به heterogeneous voting at N=3اگه دقت مهم باشه، دلتا رو اندازه بگير
- فقط به debate topologyاگر وظیفه ساختار (تحقیق، چند مرحله ای) و دور های محدود قابل اجرا باشد.
- همیشه گروه اقلیت را ثبت کنید. وقتی که اقلیت به طور مداوم درست است، شما یک سیگنال تنوع دارید.
- ساعت ديواري و توکن ها را همراه با دقت بنچ مارک کنید. "دقيقيت بهتر با هزینه 10 برابر" یک تصميم تجاری است.
تمرینات
- فرار کن
code/main.py. منحنی تحرک و مالیات را برای توپولوژی نمودار نشان دهید: دقت در مقابل N، توکن در مقابل N. در چه N منحنی منحنی می شود؟ - پیاده سازی A-HMAD: سه عامل با تعصب های مختلف عمداً. چگونه خط اصلی تعصب تمام برابر با A-HMAD در حمله یک کشت در درس 14 مقایسه می شود؟
- نقش "قاضیان" را به توپولوژی نمودار اضافه کنید که رای نمی دهد، فقط توافق نهایی را به دست می آورد. آیا این رفتار مطابقت جدید را تغییر می دهد؟
- مقاله ای که در این مقاله منتشر شده است را بخوانید (ICLR 2024) . مشخص کنید که کدام رفتار نوظهور در اجرای شما به شدت نشان داده می شود. آیا می توانید با تغییر سریع رفتار مخالف را ایجاد کنید؟
- بخش 4 (تجربات توپولوژی) MultiAgentBench را بخوانید. نتیجه "گراف برنده-تحقیق" را در یک کار از کاغذ با استفاده از هرنس خود بازیافت کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| Self-consistency | "Sample N times, vote" | Wang 2022. Single model, N temperature>0 samples, majority vote on reasoning paths. |
| Heterogeneity | "Different models" | Ensemble of different base models or prompt families. Breaks monoculture. |
| MAD | "Multi-agent debate" | Generic term for agents exchanging critiques over rounds. See Du 2023. |
| A-HMAD | "Adversarial Heterogeneous MAD" | MAD variant emphasizing different models + adversarial structure. |
| Topology | "Who talks to whom" | Star, chain, tree, graph. Determines information flow. |
| Coordination tax | "Diminishing returns" | Above ~4 agents on graph, cost grows faster than quality. |
| Volunteer behavior | "Unprompted help" | AgentVerse emergent pattern: an agent offers to take a step. |
| Conformity behavior | "Agreement under pressure" | AgentVerse emergent pattern: an agent aligns with a critic. |
| Jury | "Small specialized panel" | Sibyl-style ensemble with roles (examiner, context, scorer). |
خواندن بیشتر
- Wang et al. — Self-Consistency Improves Chain of Thought Reasoning خط اصلی یک مدل
- Du et al. — Improving Factuality and Reasoning via Multiagent Debate هر دو عامل و دور مستقل هستند
- MultiAgentBench / MARBLE شاخص مرجع توپولوژی که نمودار بهترین برای تحقیقات، زنجیره برای خط لوله ها را نشان می دهد
- Should we be going MAD? بررسی استراتژی MAD؛ نشان می دهد که MAD اغلب به دلیل خودآمرگی در بودجه برابر از دست می دهد
- AgentVerse (ICLR 2024) الگوهای تازه ی داوطلبانه و مطابق
- MARBLE repo اجرای معیار مرجع
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.