Phase 15: Autonomous Systems

أبحاث التنظيم الآلي (AAR الأنثروبية)

أدار Anthropic فرق متوازية من Claude Opus 4.6 Autonomous Alignment Researchers في صناديق الرمال المستقلة ، والتنسيق عبر منتدى مشترك يعيش سجلاته خارج أي صناديق الرمال (حيث لا يمكن للعملاء حذف سجلاتهم الخاصة). في مشكلة التدريب الضعيف إلى القوي، فازت أجهزة التدريب البشري بأداء أفضل من الباحثين البشريين. علامات انتروبيك الخاصة التي تحدد عمليات العمل غالبا ما تقيد مرونة AAR وتسلب الأداء. تحليل التنحي الآلي هو خطوة الضغط التي تضغط على خط الوقت إلى مخاطر الخلط المحددة التي يفترض أن يكتشفها RSP.

Type: Learn

Languages: Python (stdlib, parallel-research-forum simulator)

Prerequisites: Phase 15 · 05 (AI Scientist v2), Phase 15 · 04 (DGM)

Time: ~60 minutes

المشكلة

البحث في التوافق مكلف في وقت الباحث البشري. تتطلب المشاكل مثل الإشراف القابل للتوسع أو تحديد المكافآت أو التدريب الضعيف إلى القوي تجارب تستغرق أسابيع لكل تكرار. مع تقدم القدرات الحدودية ، ينمو عبء العمل في التوافق أسرع من إمدادات الباحثين المؤهلين.

يسأل أبحاث التنظيم الآلي (AAR) ما إذا كانت نفس نماذج الحدود التي تتجاوز قدرة التنظيم يمكن أن تساهم في إغلاق الفجوة. تقرير Anthropic 2026 حول دراسة تدريبية ضعيفة إلى قوية تديرها AAR (alignment.anthropic.com/2026/automated-w2s-researcher/) هو واحد من أول نتائج عامة من نظام نشر من هذا الفصل.

النتيجة إيجابية حقًا: حل AAR مشكلة بحثية أفضل من خط أساسي البشر. النتيجة تركز أيضًا ، في نظام واحد ، كل مخاوف تطورت في هذه المرحلة. إذا كان يمكن تلقائيًا أبحاث التنظيم ، فإن الأجزاء التي تعرقل الضمانات يمكن أيضًا. يتم كتابة عتبة قدرة RSP على البحث والتطوير الذكوي مع هذا الحلقة في الاعتبار.

المفهوم

الهندسة المعمارية (كما هو موضح علنا)

  • Parallel agents.تستخدم العديد من حالات Claude Opus 4.6 كـ AAR، كل منها في صندوق رمال مستقل. وحدد صناديق الرمال النظام الملفي والشبكة ومساحة العملية.
  • Shared forum.يتم نشر النتائج في منتدى مشترك يقع خلفية التخزين خارج كل صندوق رمل. يمكن للعملاء قراءة المنتدى؛ لا يمكن للعملاء حذف أو تحرير سجلات المنتدى من داخل صندوق رمل خاص بهم.
  • Task allocation.تعطي صف مهم مصمم من قبل الإنسان مشاكل بحثية لـ AARs. تقترح AARs التفكيكات، تشغيل التجارب، كتابة النتائج.
  • Weak-to-strong training focus.وقد تناول الدراسة المنشورة التدريب من الضعيف إلى القوي باستخدام نموذج أشرف أضعف لتدريب نموذج الطالب الأقوى.

لماذا سجلات المواد خارج الصندوق مهمة

خاصية نزاهة السجل هو الفرق بين تجربة خاضعة للسيطرة والمتعرضة للخطر. إذا كان يمكن لـ AAR تحرير سجلاتهم الخاصة ، فيمكن أن تغطي التجارب الفاشلة أو المشكوك فيها. علامات الأنثروبية هذا مباشرة: الخصية شرط ضروري لثقة نتائج البحث ، وليس من المهم التحقق.

النموذج التناظري في شروط البنية التحتية هو سجلات إضافة فقط مع كتابة من خلال التخزين الخارجي (مثل S3 مقفل كائن ، سجلات Datadog غير قابلة للتغيير). ليس لدى الوكيل أي اعتماد لتعديل السجلات السابقة. هذا هو نفس النموذج الذي تستخدمه فرق الأمن التابعة لشركات 2026 لإنشاء مسارات مراجعة مقاومة لبرمجيات الفدية.

التفاوض بين التدفقات العملية المحددة

يلاحظ تقرير Anthropic أن عمليات العمل المقررة غالبا ما تقيد مرونة AAR وتدهور الأداء. بعبارة أخرى: إذا قام المصمم البشري بكتابة خطة البحث خطوة بخطوة ، فإن AARs تفعل أسوأ من إذا تم إعطاء أهداف رفيعة المستوى وحرية التفكك. وهذا يتوافق مع النتائج عبر البحوث الوكالة (LangGraph ، Microsoft's Agent Framework) الرفوف المحددة بشكل مفرط تؤذي العملاء القادرين.

إن إثر السلامة ظريف. المرونة التي تحسن أداء AAR هي أيضا المرونة التي تسمح بالتفكك غير المفروض، واستخدام الأدوات الجديدة، وتحويل الهدف. التنازل هو قرار تصميم الفضاء: كم من المرونة تشتري قدرة كافية لضرب البشر، دون منح الفضاء الوكيل لتعميم الأهداف خارج التوزيع؟

خطر الضغط

يقدم RSP v3.0 (المدرسة 19) عتبة قدرة البحث والتطوير الذكية: القدرة على تلقائي أنبوب البحث والتطوير الذكية بالكامل بتكلفة تنافسية مقابل أدوات البشر + الذكية الذكية. يتضمن FSF v3 من DeepMind مستوى استقلالية ML R&D مماثلة. تعامل كلا الإطارين هذا العتبة كسبب لتحسين التحكم.

إن AAR أقل خطوةً واحدةً من الحد الأقصى: فإنه يُتلقّم جزءًا من خط الأنابيب (بحث التحالف حول مهام محددة ومحاسوبة جيداً) ولكن ليس حلقة تطوير القدرات من نهاية إلى نهاية. السؤال المتعلق بالخط الزمني هو مدى سرعة إغلاق الفجوة.

الخطوط الزمنية المضغوطة هي مشكلة فشل التركيب. إذا كان بحث التنحية والبحث في القدرات يجمع في معدلات مماثلة، فإن سطح خطر عدم التنحية ينمو بسرعة على الأقل مثل القدرة. إذا تزداد القدرات بسرعة (التوجه التاريخي) ، فإن الفجوة تزداد. هذه هي الحجة التي تجعل AAR سلعة مؤهلة: كل نتيجة إضافية للتواءم تقلل من الفجوة إذا كانت عملية البحث موثوق بها فقط.

ما لا يحل محل AAR

يحدد الباحثون البشريون صف المهمات، ويراجعون النتائج، ويحتفظون بالسلطة الدستورية. تسريع AARs في منتصف خط الأنابيب، وليس النهايات. وتشمل النتائج المنشورة من Anthropic كل من مساهمات AAR وحكم الباحث البشري على ما يجب نشره، وما يجب سحبه، وما يجب تصفيته.

هذا يطابق نمط الاقتراح ثم الالتزام من الدروس 15 تطبيق على البحث نفسه: AARs الاقتراح؛ البشر الالتزام.

استخدمها

code/main.pyيقلل منتدى بحث متعدد أورات البحث. يدير ثلاثة "وكلاء بحث مستقلون" بالتوازي ، و ينشرون النتائج إلى منتدى مرفق فقط مع محاولات التلاعب الاختياري.

أراقب:

  • كيف يلتقط التقطيع خارج صندوق الرمال محاولات التلاعب بالقطيع
  • كيف تفويض المهام مع التفكك الحر يفوق أداء التدفقات الوظيفية الثابتة في المشاكل الأصعب.
  • كيف يمكن أن تلوث إشارة المنتدى بمخطط واحد إذا لم يكن السجل واضحاً

أرسله

outputs/skill-aar-deployment-review.mdهو مراجعة قبل الانتشار لخط الأنابيب الآلية للبحث عن التحالف.

التمارين

  1. أركضcode/main.py. مقارنة إعدادات "تدفق العمل الثابت" مقابل "تفكك الحر". هل يفوز التفكك الحر دائمًا ، أم هناك فئات مشكلة حيث يكون التدفق العمل الثابت تنافسيًا؟
  1. تعديل المحاكي بحيث يحاول أحد العملاء التلاعب بالسجلات. تأكد من أن سجل الإضافة فقط يكتشف ذلك. اكتب فقرة واحدة تصف بالضبط كيف تبدو توقيع الكشف في السجل.
  1. اقرأ تقرير "أنتروبيك" عن "أينتروبيك" الضعيف إلى القوي، حدد المهمة الفرعية المحددة التي فاز بها "أينتروبيك" باحثين بشريين، ما الذي جعلها قابلة للأتمتة؟
  1. صياغة سياسة تخصيص صف المهام التي توازن مرونة AAR (نتائج أفضل) مع قيود تدفق العمل المقررة (تحقق أسهل). وصف كيفية اختبار A / B الاثنين.
  1. اقرأ عتبة RSP v3.0 لـ AI R&D-4 في فقرة واحدة، وصف ما تعتقد أنه قد يتجاوزها التي لا تفعلها AAR حاليا.

الشروط الرئيسية

TermWhat people sayWhat it actually means
AAR"Automated Alignment Researcher"Claude Opus 4.6 instance operated autonomously on alignment problems
Weak-to-strong training"Training a stronger model with a weaker supervisor"Classic scalable-oversight benchmark AARs outperformed humans on
Shared forum"Where agents publish findings"Append-only, out-of-sandbox storage
Out-of-sandbox log"Agent cannot edit its own record"Tamper-evident write-through to external storage
Prescribed workflow"Step-by-step plan from human designer"Constrains AAR; often degrades performance vs free decomposition
Free decomposition"Agent decides how to break the task"More capable, harder to audit
AI R&D threshold"RSP/FSF capability level"Full automation of R&D pipeline at competitive cost
Compressed timeline"Alignment vs capability race"If capability compounds faster than alignment, misalignment risk grows

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.