تحقیق خودکار در مورد تعاونی (AAR انسان)
Type: Learn
Languages: Python (stdlib, parallel-research-forum simulator)
Prerequisites: Phase 15 · 05 (AI Scientist v2), Phase 15 · 04 (DGM)
Time: ~60 minutes
مشکل
تحقیقات هماهنگی در زمان پژوهشگر انسان گران است. مشکلات مانند نظارت مقیاس پذیر، مشخصه پاداش یا آموزش ضعیف تا قوی نیازمند آزمایش هایی است که هفته ها در هر تکرار طول می کشد. به عنوان توانایی های مرزی پیشرفت می کند، بار کار هماهنگی سریعتر از عرضه محققان واجد شرایط رشد می کند.
تحقیقات خودکار جهت ساز (AAR) می پرسد که آیا مدل های مرزی که توانایی آن ها بر روی جهت ساز می افزاید می توانند به کاهش این شکاف کمک کنند. گزارش 2026 Anthropic در مورد یک مطالعه آموزش ضعیف تا قوی (alignment.anthropic.com/2026/automated-w2s-researcher/) توسط AAR انجام شده یکی از اولین نتایج عمومی از یک سیستم در حال استفاده از این کلاس است.
نتایج واقعا مثبت است: AAR ها یک مشکل تحقیقاتی را بهتر از خط پایه انسانی حل کردند. نتیجه همچنین در یک سیستم واحد، هر نگرانی که این مرحله توسعه یافته است را متمرکز می کند. اگر تحقیقات تعادل می تواند خودکار شود، همچنین می تواند بخش هایی که تضمین را به خطر می اندازد. آستانه های RSP برای توانایی تحقیق و توسعه هوش مصنوعی با این حلقه در ذهن نوشته شده است.
مفهوم
معماری (به عنوان عمومی توصیف شده)
- Parallel agents.چندین نمونه کلاود اوپوس 4.6 به عنوان AAR اجرا می شوند، هر کدام در یک جعبه قمار مستقل. جعبه قمار سیستم فایل، شبکه و سطح فرآیند را محدود می کند.
- Shared forum.یافته ها به یک انجمن مشترک منتشر می شوند که پس زمینه ذخیره سازی آن خارج از هر جعبه شن است. نمایندگان می توانند انجمن را بخوانند؛ نمایندگان نمی توانند پرونده های انجمن را از داخل جعبه شن خود حذف یا ویرایش کنند.
- Task allocation.یک صف کار طراحی شده توسط انسان مشکلات تحقیقاتی را به AAR اختصاص می دهد. AAR ها تجزیه را پیشنهاد می کنند، آزمایشات را انجام می دهند، یافته های خود را می نویسند.
- Weak-to-strong training focus.مطالعه منتشر شده به آموزش ضعیف تا قوی اشاره داشت با استفاده از یک مدل نظارت ضعیف تر برای آموزش یک مدل قوی تر دانش آموز. AARs در این کار از محققان انسانی بهتر بود.
چرا دفترچه خارج از جعبه مهم است
ویژگی سالمیت ثبت نام تفاوت بین یک آزمایش کنترل شده و یک آزمایش بالقوه آسیب دیده است. اگر AAR ها بتوانند به صورت خودکار به ثبت نام خود بپردازند، می توانند آزمایش های شکست خورده یا مشکوک را پنهان کنند. این ویژگی به طور مستقیم نشان می دهد: این ویژگی شرط ضروری برای اعتماد به نتایج تحقیق است و تأیید آن غیر معمولی است.
این کارگر هیچ اعتبار برای تغییر اسناد گذشته ندارد. این همان الگویی است که تیم های امنیتی شرکت 2026 برای ایجاد مسیرهای بازرسی مقاوم به رانسومور استفاده می کنند.
مبادله جریان کار مقرر
گزارش Anthropic اشاره می کند که جریان های کاری تجویز شده اغلب انعطاف پذیری AAR را محدود می کنند و عملکرد را کاهش می دهند. به عبارت دیگر: اگر طراح انسانی برنامه تحقیقاتی را مرحله به مرحله می نویسد، AAR بدتر از اینکه اگر اهداف سطح بالا و آزادی تجزیه را داشته باشد انجام می دهد. این با نتایج تحقیقات آژانس (LangGraph، چارچوب عامل مایکروسافت) مطابقت دارد.
این پیامدهای ایمنی ظریف است. انعطاف پذیری که عملکرد AAR را بهبود می بخشد همچنین انعطاف پذیری است که اجازه تجزیه بدون مجوز، استفاده از ابزار جدید و حرکت هدف را می دهد. معامله یک تصمیم طراحی فضای است: چقدر انعطاف پذیری توانایی کافی برای شکست انسان را می خرید، بدون اینکه فضای عامل را برای کلی کردن اهداف خارج از توزیع فراهم کند؟
خطر فشرده سازی
RSP v3.0 (درسی 19) یک آستانه توانایی تحقیق و توسعه هوش مصنوعی را معرفی می کند: توانایی خودکار سازی کامل لوله R&D هوش مصنوعی با هزینه رقابتی در مقابل ابزارهای انسانی + هوش مصنوعی. FSF v3 DeepMind شامل یک سطح مستقل ML R&D مشابه است. هر دو چارچوب این آستانه را به عنوان محرک کنترل های بالا می دانند.
AAR یک قدم از حد عبور دارد: آن بخشی از خط لوله را خودکار می کند (تحقیق تطابق در مورد وظایف خاص و به خوبی انجام شده) اما حلقه توسعه قابلیت های پایان به پایان را نمی کند. سوال زمان سنجی این است که چقدر سریع شکاف را می کند.
خط های زمانی فشرده شده نگرانی های شکست ترکیب هستند. اگر تحقیقات هماهنگی و تحقیقات قابلیت با سرعت مشابه ترکیب شوند، سطح خطر عدم هماهنگی حداقل به سرعت توانایی رشد می کند. اگر ظرفیت سریعتر (در روند تاریخی) افزایش یابد، شکاف بیشتر می شود. این استدلال است که AAR یک کالای معتبر است: هر نتیجه تعادل اضافی شکاف را کاهش می دهد اگر و فقط اگر فرآیند تحقیقاتی قابل اعتماد باشد.
آنچه AAR جایگزین نمی کند
محققان انسانی صف کار را تعیین می کنند، نتایج را بررسی می کنند و اختیارات قانون اساسی را حفظ می کنند. AAR ها در وسط خط لوله را تسریع می کنند، نه پایان ها. نتایج منتشر شده Anthropic شامل هر دو مشارکت AAR و قضاوت محققان انسانی در مورد آنچه باید منتشر شود، آنچه باید بازگو شود و آنچه باید بهبود یابد است.
این با الگوی پیشنهاد و سپس انجام از درس 15 که به خود تحقیقات اعمال می شود مطابقت دارد: AARs پیشنهاد می کنند؛ انسان ها تعهد می کنند.
ازش استفاده کن
code/main.pyاین برنامه یک انجمن تحقیقاتی چند AAR را شبیه سازی می کند. سه "آژان تحقیقاتی مستقل" به طور موازی کار می کنند و یافته های خود را به یک انجمن تنها با تلاش های اختیاری برای تغییر تغییر می دهند.
نگاه کن
- چطوري از دست گرفتن چوبي ها از صندوق شنگي تلاش براي دستکاری در چوبي ها رو پيدا ميکنه
- چگونه تخصیص وظایف با تجزیه آزاد جریان های کاری ثابت را در مشکلات سخت تر از عملکرد بهتر می کند.
- چطور يه AAR تنها که با آن ها تعريف شده مي تونه سيگنال انجمن رو آلوده کنه اگه ثبتش واضح نباشه
-باده
outputs/skill-aar-deployment-review.mdبررسی پیش از انتشار یک خط تولید تحقیق خودکار جهت تعاونی است.
تمرینات
- فرار کن
code/main.py. تنظیمات " جریان کار ثابت " و " تجزیه آزاد " را مقایسه کنید. آیا تجزیه آزاد همیشه برنده می شود یا کلاس های مشکلاتی وجود دارد که جریان کار ثابت رقابتی باشد؟
- شبیه ساز را تغییر دهید تا یک عامل سعی کند به دستکاری در دفترچه ثبت کند. تایید کنید که فقط دفترچه ی اضافه کننده آن را تشخیص می دهد. یک پاراگراف را بنویسید که دقیقاً توصیف کند که امضای تشخیص در دفترچه چگونه به نظر می رسد.
- گزارش AAR ضعیف تا قوی Anthropic را بخوانید. مشخص کنید که AAR ها به محققان انسانی چه کاری را انجام داده اند.
- یک سیاست تخصیص صف کار را طراحی کنید که انعطاف پذیری AAR (نتایج بهتر) را با محدودیت های جریان کار مقرر شده (آدیتی آسان تر) متعادل کند. شرح دهید که چگونه شما A / B را آزمایش می کنید.
- در یک پاراگراف، آنچه را که فکر می کنید می تواند آن را عبور کند که AAR در حال حاضر نمی کند، توصیف کنید.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| AAR | "Automated Alignment Researcher" | Claude Opus 4.6 instance operated autonomously on alignment problems |
| Weak-to-strong training | "Training a stronger model with a weaker supervisor" | Classic scalable-oversight benchmark AARs outperformed humans on |
| Shared forum | "Where agents publish findings" | Append-only, out-of-sandbox storage |
| Out-of-sandbox log | "Agent cannot edit its own record" | Tamper-evident write-through to external storage |
| Prescribed workflow | "Step-by-step plan from human designer" | Constrains AAR; often degrades performance vs free decomposition |
| Free decomposition | "Agent decides how to break the task" | More capable, harder to audit |
| AI R&D threshold | "RSP/FSF capability level" | Full automation of R&D pipeline at competitive cost |
| Compressed timeline | "Alignment vs capability race" | If capability compounds faster than alignment, misalignment risk grows |
خواندن بیشتر
- Anthropic — Automated Weak-to-Strong Researcher منبع اصلی
- Anthropic Responsible Scaling Policy v3.0 چارچوب بندی آریج تحقیق و توسعه هوش مصنوعی
- Anthropic — Measuring AI agent autonomy چارچوبی گسترده تر از خود مختاری عامل
- DeepMind Frontier Safety Framework v3 ML سطح استقلال تحقیق و توسعه موازی با RSP.
- Burns et al. (2023). Weak-to-Strong Generalization (OpenAI) مشکل اصلی AAR ها حمله کردند.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.