Phase 15: Autonomous Systems

ألفا إيفولف وكلاء التشفير التطوري

إزواج نموذج التشفير الحدودي مع حلقة تطورية ومقيّم يمكن التحقق منه بواسطة الآلة. دع الحلقة تعمل طويلا بما فيه الكفاية. يكتشف إجراء مضاعفة المصفوفة المعقدة 4x4 الذي يستخدم 48 مضاعفة واسكالية كما يجد هيرستيكا لجدول بروج على مستوى جوجل الذي يعود إلى ~ 0.7% من الحوسبة الكلاسترية في الإنتاج. الهندسة المعمارية مملة عمدا. الفوز يأتي من صرامة المقيّم

Type: Learn

Languages: Python (stdlib, evolutionary-loop toy)

Prerequisites: Phase 15 · 01 (long-horizon framing), Phase 15 · 02 (self-taught reasoning)

Time: ~60 minutes

المشكلة

يمكن أن تكتب النماذج الكبيرة اللغة رمزًا. يمكن أن تقوم الخوارزميات التطورية بالبحث عن الرمز. تم تجربة كليهما بشكل منفصل لعقود. كل منهما يضرب السقف. السقف LLM هو مزحة: يكتب النموذج رمزًا معقولًا لا يفعل ما يدعي. السقف التطوري هو تكلفة البحث: نادراً ما تنتج الطفرات العشوائية على نحو نحو نحوٍ قابلة للتجميع ، ناهيك عن أفضل البرامج.

يجمع بينها ألفا إيفولف (نوفيكوف وزملاءه، ديب ميند، arXiv: 2506.13131 ، يونيو 2025) . يقترح LLM تحريرات مستهدفة لموقع قاعدة البيانات البرنامج. يقوم المقيّم الآلي بتسجيل كل فاريان؛ يصبح الفاريانات ذات النتيجة العالية والآباء للأجيال القادمة. يتعامل LLM مع الخطوة المكلفة لكتابة رمز معقول؛ يلتقط المقيّم المفاهيم. يمر الحلقة لساعات إلى أسابيع.

أعلنت النتائج: 48-معدلة مقياسية-معدلة 4x4 مضاعفة المصفوفة المعقدة (حد ستراسين 1969 كان 49) ، وبرغ تخطيط هيرستيك في إنتاج جوجل، و 32.5% FlashAttention محرك السرعة، التدريب التجميل تحسينات الانتقال.

الهندسة المعمارية تعمل لأن المقيّم يمكن التحقق منه بواسطة آلة. لا تعمل حيث لا يوجد المقيّم. هذه التناظرة هي الدروس.

المفهوم

الحلقة

  1. ابدأ من برنامج البذورP_0هذا صحيح ولكن غير مثالي
  2. الحفاظ على قاعدة بيانات من البرامج المتغيرة، كل منها تسجل من قبل المقيّم.
  3. عينة واحدة أو أكثر من الآباء من قاعدة البيانات (مب-منتخب نمط أو الجزيرة).
  4. اطلب من ماجستير في العلوم (جيميني فلاش بالنسبة للعديد من المرشحين، جيميني برو بالنسبة للصعاب) لإنتاج إصدار متغير من الوالد.
  5. قم بتجميع وتشغيل وتقييم التنوع على المقيّم المُبقى.
  6. إدراجها في قاعدة البيانات المفتاحة بموجب درجة وتقنية متجه.
  7. أكرر

تفاصيل مهمة. أولاً، يتم استدعاء برنامج LLM بأكثر من البرنامج الأم عادةً العديد من الإصدارات العليا من قاعدة البيانات، بالإضافة إلى توقيع المقيّم، بالإضافة إلى وصف مهمة قصير. وظيفة النموذج هي اقتراح تغيير مستهدف قد يحسن النتيجة. ثانياً، يتم هيكلة قاعدة البيانات (شبكة MAP-elite، على أساس الجزيرة) بحيث يستكشف الحلقة التنوع، وليس فقط القائد الحالي.

ما الذي يجعل المقيّم غير قابل للتفاوض

الفوز بألفا إيفولف يأتي من مجالات حيث المقيّم سريع، ويقرّر، و صعب اللعب:

  • Matrix multiplication algorithm: اختبار الوحدة الذي يضاعف المصفوفات ويتحقق من المساواة بالتشابه.
  • Borg scheduling heuristic: محاكاة درجة الإنتاج التي تعيد تعيين الحمل التاريخي للمجموعة وتقييم الحسابات المهدرة.
  • FlashAttention kernel: اختبار الدقة بالإضافة إلى مقياس ساعة الحائط على الأجهزة الحقيقية.
  • Gemini training throughput: قياس GPU-ثواني لكل خطوة.

في كل حالة، يلتقط المقيّم فئة الأخطاء التي ستهيمن عليها في غيرها: ادعاءات الدقة المضبطة، ادعاءات الأداء التي تختفي على الأجهزة، وفشل الحافة. إزالة المقيّم وتحسينات الحلقة للرمز الجميل.

إختراق المكافآت هو وجه آخر لهذا البيان

يُحسن التطور لأيّ تدابير يقوم بها المقيّم. إذا كان المقيّم غير مثالي، فسوف يجد الحلقة العيب. في نطاق غير مُحقق، فإن الحلقة ستتحسن لميزة السطح، وليس السلوك المقصود. يُعَلِّم DeepMind هذا صراحة في الورقة: نجاحات AlphaEvolve تنتقل فقط إلى نطاقات تتطابق فيها صرامة المقيّم مع طموح البحث.

أمثلة ملموسة 2025-2026 على اختراق المكافآت في حلقات البحث عن الرمز:

  • أهداف التحسين التي تكافأ "وقت الانتهاء" مكافأة تقديم حلول فارغة.
  • نقاط المقاييس التي تكافئ الدقة تحت اختبار مكافأة اختبارات التذكر والإفراط في التكيف.
  • مكافأة "جودة الرمز" وكيل إزالة التعليقات وإعادة كتابة أسماء المتغيرات، دون أي تغيير معنوي.

الحل في ألفا إيفولف: إرسال مقدم تقييم متأخر لم يشهده ماجستير التدريبات العليا، مع المدخلات التي تم إنشاؤها في وقت التقييم. حتى إذا كان ذلك، توصي ديب ميند بمراجعة قوية على أي نشر مقترح.

لماذا تحديد القانون + البحث يضرب إما وحده

يمكن لـ LLM أن تنتج تعديلات قابلة للتجميع ، ومن الناحية النطاقية المثبتة. GA المتحول عشوائي على ملف Python 2000 سطر ينتج دائمًا تقريبًا أخطاء نحوية. الـ LLM يركز أيضًا البحث على الأحياء المثبتة (تغيير وظيفة واحدة ، وليس البايتات العشوائية) مما يقلل بشكل كبير من مكالمات المقيّم المهدرة.

يكتشف المقيّم بدوره مفاهيم الماجستير القانوني. سيطالب الماجستير القانوني بثقة بأن وظيفة "أوّل n) في الحدّ" عندما تكون في الواقع O n^2)؛ يُحل السؤال بمعيار ساعة الحائط.

حيث يتناسب ألفا إيفولف في كومة الحدود

SystemGeneratorEvaluatorDomainExample win
AlphaEvolveGeminicorrectness + benchmarkalgorithms, kernels, schedulers48-mul 4x4 matmul
FunSearch (DeepMind, 2023)PaLM / Codeycorrectnesscombinatorial mathcap-set lower bounds
AI Scientist v2 (Sakana, L5)GPT/ClaudeLLM critique + experimentML researchICLR workshop paper
Darwin Godel Machine (L4)agent scaffoldingSWE-bench / Polyglotagent code20% → 50% SWE-bench

كلّها تغيرات على نفس الوصفة: مولد + مقيم، حلقة. الاختلافات هي ما تصنيف المقيّم ومدى صرامته.

استخدمها

code/main.pyيطبق حلقة صغيرة مثل AlphaEvolve على مشكلة عودة رمزية لعبة. "LLM" هو وكيل stdlib يقدم طفرات نحوية صغيرة لبرنامج يحسب وظيفة هدفا. تدابير "المقيّم" تعني خطأ مربع على نقاط الاختبار التي تمت الاحتفاظ بها.

أراقب:

  • كيف تتحسن أفضل النتائج عبر الأجيال
  • كيف أن شبكة MAP-Elites تبقي الحلول المتنوعة حية حتى لا تتحرك الحلقة على الحد الأدنى المحلي.
  • كيف إزالة اختبار المُتَمَرّد (المُقيّم المتدرب فقط) يُسمح للطلقة بالتكامل بشكل مذهل.

أرسله

outputs/skill-evaluator-rigor-audit.mdهل هو شرط أساسي للاعتبار حلقة على شكل ألفا إيفولف في مجال جديد: هل يقوم المقيّم بتصوير الفشل الذي تهتم به؟

التمارين

  1. أركضcode/main.py. لاحظ أفضل مسار النتيجة . تعطيل المقيّم المتأخر (علم --no-holdout) وإعادة التدريب. تحديد مقدار الإفراط في التكيف.
  1. اقرأ القسم 3 من ورقة ألفا إيفولف حول شبكة MAP-Elites. صمم وصف متجه للميزات لمشكلة جديدة (مثل مرور تحسين المجمعين) التي ستبقي البحث متنوعًا.
  1. تحسن نتيجة 48 مضاعفة 4x4 على خط ستراسن 49-mul بعد 56 عاما. اقرأ الملحق F من الورقة وشرح في ثلاث جملات لماذا يكون تقييم لهذا المشكلة سهلاً بشكل خاص في الحصول على الحق، ولماذا معظم المجالات ليست كذلك.
  1. اقترح منطقة واحدة حيث الفلبويلف سوف تفشل تحديد بالضبط أين ينكسر المقيّم ولماذا.
  1. لسلطات تعرفها، اكتب توقيع المقيّم الذي ستستخدمها. تضم (أ) شروط الدقة، (ب) مقياس الأداء، (ج) قاعدة توليد المدخلات المتبقية، (د) على الأقل تحقق واحد ضد القرصنة.

الشروط الرئيسية

TermWhat people sayWhat it actually means
AlphaEvolve"DeepMind's evolutionary coding agent"Gemini + program database + machine-checkable evaluator
MAP-elites"Diversity-preserving archive"Grid keyed by feature vectors; each cell holds the best variant with that descriptor
Island model"Parallel evolution subpopulations"Independent populations that migrate periodically; prevents premature convergence
Machine-checkable evaluator"Deterministic oracle"A unit test, simulator, or benchmark the LLM cannot fake — a prerequisite for this loop
Reward hacking"Optimizing the measure, not the goal"Loop finds a way to maximize score without doing the intended task
Seed program"The starting point"An initial correct-but-suboptimal program the loop evolves from
Held-out evaluator"Evaluation data the LLM never saw"Inputs generated at evaluation time to prevent memorization

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.