أبحاث التنظيم الآلي (AAR الأنثروبية)
Type: Learn
Languages: Python (stdlib, parallel-research-forum simulator)
Prerequisites: Phase 15 · 05 (AI Scientist v2), Phase 15 · 04 (DGM)
Time: ~60 minutes
المشكلة
البحث في التوافق مكلف في وقت الباحث البشري. تتطلب المشاكل مثل الإشراف القابل للتوسع أو تحديد المكافآت أو التدريب الضعيف إلى القوي تجارب تستغرق أسابيع لكل تكرار. مع تقدم القدرات الحدودية ، ينمو عبء العمل في التوافق أسرع من إمدادات الباحثين المؤهلين.
يسأل أبحاث التنظيم الآلي (AAR) ما إذا كانت نفس نماذج الحدود التي تتجاوز قدرة التنظيم يمكن أن تساهم في إغلاق الفجوة. تقرير Anthropic 2026 حول دراسة تدريبية ضعيفة إلى قوية تديرها AAR (alignment.anthropic.com/2026/automated-w2s-researcher/) هو واحد من أول نتائج عامة من نظام نشر من هذا الفصل.
النتيجة إيجابية حقًا: حل AAR مشكلة بحثية أفضل من خط أساسي البشر. النتيجة تركز أيضًا ، في نظام واحد ، كل مخاوف تطورت في هذه المرحلة. إذا كان يمكن تلقائيًا أبحاث التنظيم ، فإن الأجزاء التي تعرقل الضمانات يمكن أيضًا. يتم كتابة عتبة قدرة RSP على البحث والتطوير الذكوي مع هذا الحلقة في الاعتبار.
المفهوم
الهندسة المعمارية (كما هو موضح علنا)
- Parallel agents.تستخدم العديد من حالات Claude Opus 4.6 كـ AAR، كل منها في صندوق رمال مستقل. وحدد صناديق الرمال النظام الملفي والشبكة ومساحة العملية.
- Shared forum.يتم نشر النتائج في منتدى مشترك يقع خلفية التخزين خارج كل صندوق رمل. يمكن للعملاء قراءة المنتدى؛ لا يمكن للعملاء حذف أو تحرير سجلات المنتدى من داخل صندوق رمل خاص بهم.
- Task allocation.تعطي صف مهم مصمم من قبل الإنسان مشاكل بحثية لـ AARs. تقترح AARs التفكيكات، تشغيل التجارب، كتابة النتائج.
- Weak-to-strong training focus.وقد تناول الدراسة المنشورة التدريب من الضعيف إلى القوي باستخدام نموذج أشرف أضعف لتدريب نموذج الطالب الأقوى.
لماذا سجلات المواد خارج الصندوق مهمة
خاصية نزاهة السجل هو الفرق بين تجربة خاضعة للسيطرة والمتعرضة للخطر. إذا كان يمكن لـ AAR تحرير سجلاتهم الخاصة ، فيمكن أن تغطي التجارب الفاشلة أو المشكوك فيها. علامات الأنثروبية هذا مباشرة: الخصية شرط ضروري لثقة نتائج البحث ، وليس من المهم التحقق.
النموذج التناظري في شروط البنية التحتية هو سجلات إضافة فقط مع كتابة من خلال التخزين الخارجي (مثل S3 مقفل كائن ، سجلات Datadog غير قابلة للتغيير). ليس لدى الوكيل أي اعتماد لتعديل السجلات السابقة. هذا هو نفس النموذج الذي تستخدمه فرق الأمن التابعة لشركات 2026 لإنشاء مسارات مراجعة مقاومة لبرمجيات الفدية.
التفاوض بين التدفقات العملية المحددة
يلاحظ تقرير Anthropic أن عمليات العمل المقررة غالبا ما تقيد مرونة AAR وتدهور الأداء. بعبارة أخرى: إذا قام المصمم البشري بكتابة خطة البحث خطوة بخطوة ، فإن AARs تفعل أسوأ من إذا تم إعطاء أهداف رفيعة المستوى وحرية التفكك. وهذا يتوافق مع النتائج عبر البحوث الوكالة (LangGraph ، Microsoft's Agent Framework) الرفوف المحددة بشكل مفرط تؤذي العملاء القادرين.
إن إثر السلامة ظريف. المرونة التي تحسن أداء AAR هي أيضا المرونة التي تسمح بالتفكك غير المفروض، واستخدام الأدوات الجديدة، وتحويل الهدف. التنازل هو قرار تصميم الفضاء: كم من المرونة تشتري قدرة كافية لضرب البشر، دون منح الفضاء الوكيل لتعميم الأهداف خارج التوزيع؟
خطر الضغط
يقدم RSP v3.0 (المدرسة 19) عتبة قدرة البحث والتطوير الذكية: القدرة على تلقائي أنبوب البحث والتطوير الذكية بالكامل بتكلفة تنافسية مقابل أدوات البشر + الذكية الذكية. يتضمن FSF v3 من DeepMind مستوى استقلالية ML R&D مماثلة. تعامل كلا الإطارين هذا العتبة كسبب لتحسين التحكم.
إن AAR أقل خطوةً واحدةً من الحد الأقصى: فإنه يُتلقّم جزءًا من خط الأنابيب (بحث التحالف حول مهام محددة ومحاسوبة جيداً) ولكن ليس حلقة تطوير القدرات من نهاية إلى نهاية. السؤال المتعلق بالخط الزمني هو مدى سرعة إغلاق الفجوة.
الخطوط الزمنية المضغوطة هي مشكلة فشل التركيب. إذا كان بحث التنحية والبحث في القدرات يجمع في معدلات مماثلة، فإن سطح خطر عدم التنحية ينمو بسرعة على الأقل مثل القدرة. إذا تزداد القدرات بسرعة (التوجه التاريخي) ، فإن الفجوة تزداد. هذه هي الحجة التي تجعل AAR سلعة مؤهلة: كل نتيجة إضافية للتواءم تقلل من الفجوة إذا كانت عملية البحث موثوق بها فقط.
ما لا يحل محل AAR
يحدد الباحثون البشريون صف المهمات، ويراجعون النتائج، ويحتفظون بالسلطة الدستورية. تسريع AARs في منتصف خط الأنابيب، وليس النهايات. وتشمل النتائج المنشورة من Anthropic كل من مساهمات AAR وحكم الباحث البشري على ما يجب نشره، وما يجب سحبه، وما يجب تصفيته.
هذا يطابق نمط الاقتراح ثم الالتزام من الدروس 15 تطبيق على البحث نفسه: AARs الاقتراح؛ البشر الالتزام.
استخدمها
code/main.pyيقلل منتدى بحث متعدد أورات البحث. يدير ثلاثة "وكلاء بحث مستقلون" بالتوازي ، و ينشرون النتائج إلى منتدى مرفق فقط مع محاولات التلاعب الاختياري.
أراقب:
- كيف يلتقط التقطيع خارج صندوق الرمال محاولات التلاعب بالقطيع
- كيف تفويض المهام مع التفكك الحر يفوق أداء التدفقات الوظيفية الثابتة في المشاكل الأصعب.
- كيف يمكن أن تلوث إشارة المنتدى بمخطط واحد إذا لم يكن السجل واضحاً
أرسله
outputs/skill-aar-deployment-review.mdهو مراجعة قبل الانتشار لخط الأنابيب الآلية للبحث عن التحالف.
التمارين
- أركض
code/main.py. مقارنة إعدادات "تدفق العمل الثابت" مقابل "تفكك الحر". هل يفوز التفكك الحر دائمًا ، أم هناك فئات مشكلة حيث يكون التدفق العمل الثابت تنافسيًا؟
- تعديل المحاكي بحيث يحاول أحد العملاء التلاعب بالسجلات. تأكد من أن سجل الإضافة فقط يكتشف ذلك. اكتب فقرة واحدة تصف بالضبط كيف تبدو توقيع الكشف في السجل.
- اقرأ تقرير "أنتروبيك" عن "أينتروبيك" الضعيف إلى القوي، حدد المهمة الفرعية المحددة التي فاز بها "أينتروبيك" باحثين بشريين، ما الذي جعلها قابلة للأتمتة؟
- صياغة سياسة تخصيص صف المهام التي توازن مرونة AAR (نتائج أفضل) مع قيود تدفق العمل المقررة (تحقق أسهل). وصف كيفية اختبار A / B الاثنين.
- اقرأ عتبة RSP v3.0 لـ AI R&D-4 في فقرة واحدة، وصف ما تعتقد أنه قد يتجاوزها التي لا تفعلها AAR حاليا.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| AAR | "Automated Alignment Researcher" | Claude Opus 4.6 instance operated autonomously on alignment problems |
| Weak-to-strong training | "Training a stronger model with a weaker supervisor" | Classic scalable-oversight benchmark AARs outperformed humans on |
| Shared forum | "Where agents publish findings" | Append-only, out-of-sandbox storage |
| Out-of-sandbox log | "Agent cannot edit its own record" | Tamper-evident write-through to external storage |
| Prescribed workflow | "Step-by-step plan from human designer" | Constrains AAR; often degrades performance vs free decomposition |
| Free decomposition | "Agent decides how to break the task" | More capable, harder to audit |
| AI R&D threshold | "RSP/FSF capability level" | Full automation of R&D pipeline at competitive cost |
| Compressed timeline | "Alignment vs capability race" | If capability compounds faster than alignment, misalignment risk grows |
المزيد من القراءة
- Anthropic — Automated Weak-to-Strong Researcher المصدر الأساسي
- Anthropic Responsible Scaling Policy v3.0إطار عتبة البحث والتطوير الذكاء الاصطناعي
- Anthropic — Measuring AI agent autonomyإطار أوسع لنظام الوكيل.
- DeepMind Frontier Safety Framework v3 ML مستويات استقلالية البحث والتطوير متوازية مع RSP.
- Burns et al. (2023). Weak-to-Strong Generalization (OpenAI)المشكلة الأساسية التي هاجمها الـ "أر".
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.