संरेखण अनुसंधान पारिस्थितिकी तंत्र MATS, Redwood, Apollo, METR
Type: Learn
Languages: none
Prerequisites: Phase 18 · 01-27 (prior Phase 18 lessons)
Time: ~45 minutes
सीखने के लक्ष्य
- गैर-प्रयोगशाला संरेखण अनुसंधान पारिस्थितिकी तंत्र के पांच संगठनों और उनके मुख्य उत्पादन की पहचान करें।
- MATS के पैमाने (विद्यापकों, पत्रों, एच-इंडेक्स) और प्रतिभा पाइपलाइन के रूप में इसकी भूमिका का वर्णन करें।
- रेडवुड के एआई कंट्रोल एजेंडे और यूके एआईएसआई के साथ उसकी साझेदारी का वर्णन करें।
- METR की कार्य आधारित मूल्यांकन पद्धति का वर्णन करें।
समस्या
सीमांत प्रयोगशालाएं (पाठ 18) आंतरिक रूप से सुरक्षा मूल्यांकन करती हैं और चयनित परिणाम प्रकाशित करती हैं। प्रयोगशालाओं के बाहर पारिस्थितिकी तंत्र वह जगह है जहां मूल्यांकन सत्यापित होते हैं, जहां पहली बार नए विफलता मोड की खोज की जाती है, और जहां प्रतिभा को प्रशिक्षित किया जाता है। पारिस्थितिकी तंत्र को समझना यह व्याख्या करने में मदद करता है कि किस शोध निष्कर्षों पर किसके द्वारा भरोसा किया जाता है।
अवधारणा
मैट (एमएल एलायनिंग एंड थ्योरी स्कॉलर)
2021 के अंत में शुरू हुआ। अनुसंधान मेन्टरशिप कार्यक्रम; विद्वान एक विशिष्ट संरेखण समस्या पर एक वरिष्ठ शोधकर्ता के साथ 10-12 सप्ताह बिताते हैं।
पैमाने (2026):
- 527+ शोधकर्ता स्थापना के बाद से।
- 180 से अधिक पत्र प्रकाशित हुए।
- 10K + उद्धरण।
- h-index 47
- गर्मियों 2024: 90 विद्वान + 40 संरक्षक; 501 (c) (3) के रूप में शामिल किया गया।
करियर के परिणामः ~ 80% पूर्व 2025 पूर्व पूर्व छात्र सुरक्षा/सुरक्षा पर काम कर रहे हैं। 200+ Anthropic, DeepMind, OpenAI, UK AISI, RAND, Redwood, METR, Apollo में।
रेडवुड रिसर्च
एप्लाइड एलायंसिंग लैब. बक श्लेगेरिस द्वारा स्थापित। एआई कंट्रोल एजेंडा (लक्ष 10) पेश किया। यूके एआईएसआई के साथ नियंत्रण सुरक्षा मामलों पर सहयोग करता है। मूल्यांकन डिजाइन पर डीपमाइंड और एंथ्रोपिक को सलाह देता है।
कैनोनिक पेपरः ग्रीनब्लाट, श्लेगेरिस और अन्य, "एआई कंट्रोल" (arXiv:2312.06942, ICML 2024); एलायनिंग फॅकिंग (ग्रीनब्लाट, डेनिसन, राइट और अन्य, arXiv:2412.14093, मानव विज्ञान के साथ संयुक्त) ।
शैलीः विशिष्ट खतरे के मॉडल, सबसे खराब स्थिति में विरोधी, ठोस प्रोटोकॉल जो तनाव-परीक्षण किया जा सकता है।
अपोलो अनुसंधान
सीमा प्रयोगशालाओं के लिए पूर्व-निर्मिती योजना मूल्यांकन। लेखक इन-कॉन्टेक्स योजना (पाठ 8, arXiv:2412.04984). 2025 में ओपनएआई विरोधी योजना प्रशिक्षण सहयोग पर भागीदार। एआई योजना के लिए सुरक्षा मामलों की ओर उत्पादन (2024).
शैलीः एजेंटी-सेटिंग मूल्यांकन जहां धोखाधड़ी प्रकट हो सकती है; तीन स्तंभों का विघटन (गलत संरेखण, लक्ष्य-निर्देशितता, स्थिति जागरूकता) ।
METR (मॉडल मूल्यांकन और खतरे अनुसंधान)
कार्य-आधारित क्षमता मूल्यांकन। स्वायत्त-कार्य पूरा करने के समय-अवधि अध्ययन। "सीमागत एआई सुरक्षा नीतियों के सामान्य तत्व" (metr.org/common-elements, 2025) प्रयोगशाला ढांचे की तुलना करता है।
एआई स्कीमिंग सुरक्षा मामले के स्केच पर सह-लेखक अपोलो के साथ.
शैलीः दीर्घकालिक कार्य मूल्यांकन, अनुभवजन्य क्षमता माप, फ्रेमवर्क संश्लेषण।
एआई अनुसंधान
मॉडल कल्याण पूर्व-विभाजन मूल्यांकन। प्रणाली कार्ड के खंड 5.3 में प्रलेखित क्लाउड ओपस 4 कल्याण मूल्यांकन किया। पाठ 19 के कल्याण संबंधी दावों के लिए बाहरी पद्धति जांच प्रदान करता है।
प्रवाह
मैट्स शोधकर्ताओं को प्रशिक्षित करता है। स्नातक मानव विज्ञान, डीपमाइंड, ओपनएआई (लैब सुरक्षा टीम) या रेडवुड, अपोलो, एमईटीआर, एलेओएस (बाहरी मूल्यांकन) में जाते हैं। बाहरी मूल्यांकनकर्ता प्रयोगशालाओं और यूके एआईएसआई / सीएआईएसआई के साथ साझेदारी करते हैं। प्रकाशन अगले समूह के लिए मैटस को पारिस्थितिकी तंत्र को वापस खिलाते हैं।
यह परत क्यों मायने रखती है
एकल स्रोत के मूल्यांकन अविश्वसनीय हैंः प्रयोगशालाओं अपने स्वयं के मॉडल का मूल्यांकन एक संरचनात्मक हित संघर्ष है। बाहरी मूल्यांकनकर्ता विफलता मोड को बढ़ा सकते हैं और सत्यापित कर सकते हैं जो प्रयोगशाला कम रिपोर्ट कर सकती है। 2024 स्लीपर एजेंट्स पेपर (लेक्शन 7) मानव + लालच था; संरेखण नकली मानव + लालच था; संदर्भ में योजना अपोलो था; विरोधी योजना अपोलो + ओपनएआई था। बहु-अंगन संरचना गुणवत्ता नियंत्रण है।
जहां यह चरण 18 में फिट बैठता है
पाठ 7-11 में रेडवुड और अपोलो के काम का उल्लेख है; पाठ 18 में एमईटीआर के ढांचे की तुलना का उल्लेख है; पाठ 19 में एलेओस का उल्लेख है। पाठ 28 में शेष चरण के लिए पारिस्थितिकी तंत्र के लिए स्पष्ट संगठनात्मक नक्शा है।
इसका प्रयोग करें
कोई कोड नहीं। METR की "सीमागत एआई सुरक्षा नीतियों के सामान्य तत्व" को एक उदाहरण के रूप में पढ़ें कि कैसे बाहरी संश्लेषण प्रयोगशाला-आंतरिक नीति कार्य में मूल्य जोड़ता है।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-ecosystem-map.md. एक संरेखण दावे या मूल्यांकन को देखते हुए, यह संगठन, प्रकाशन स्थल, और पद्धतिगत शैली की पहचान करता है, और ज्ञात प्रतिपक्ष संगठनों के खिलाफ क्रॉस-चेक करता है।
व्यायाम
- पाठ 7-15 से एक पेपर चुनें और इसमें शामिल संगठनों की पहचान करें। एमएटीएस के पूर्व छात्रों और मौजूदा पारिस्थितिकी तंत्र संबद्धताओं के साथ लेखकों की क्रॉस-चेक करें।
- METR की "सीमागत एआई सुरक्षा नीतियों के सामान्य तत्व" पढ़ें। वे तीन पार-लैब अभिसरणों पर जोर देते हैं और दो सबसे बड़े मतभेदों की पहचान करते हैं।
- मैटस करियर के परिणाम ~ 80% सुरक्षा/सुरक्षा हैं। तर्क दें कि क्या यह चयन दबाव अनुकूलनशील है (क्षेत्र को प्रशिक्षित करता है) या पक्षपाती है (विभिन्न पदों को फ़िल्टर करता है) ।
- रेडवुड और अपोलो दोनों नियंत्रण/शत्रुतापूर्ण कार्य करते हैं लेकिन अलग-अलग शैलियों के साथ। एक विफलता मोड चुनें और वर्णन करें कि प्रत्येक इसे कैसे जांचता है।
- एलेओएस एआई एकमात्र शुद्ध मॉडल-कल्याणकारी संगठन है। एक अलग कल्याण-समीप प्रश्न (ज्ञानात्मक स्वतंत्रता, रोबोट अवतार, आदि) पर केंद्रित एक परिकल्पनात्मक दूसरा संगठन डिजाइन करें और इसकी पद्धति को व्यक्त करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| MATS | "the mentorship program" | ML Alignment & Theory Scholars; 527+ researchers since 2021 |
| Redwood Research | "the control lab" | Applied alignment; AI Control authors; UK AISI partner |
| Apollo Research | "the scheming evals" | Pre-deployment scheming evaluations for frontier labs |
| METR | "the task-horizon evals" | Task-based capability evaluations; framework synthesis |
| Eleos AI | "the welfare lab" | Model-welfare pre-deployment evaluations |
| Talent pipeline | "MATS -> labs" | MATS graduates flow to Anthropic, DM, OpenAI, Redwood, Apollo, METR |
| External evaluation | "non-lab check" | Evaluation not done by the model's producer; adds credibility |
आगे पढ़ना
- MATS (ML Alignment & Theory Scholars) संदेशन कार्यक्रम
- Redwood Research एआई नियंत्रण कागजात
- Apollo Research योजनाबद्ध मूल्यांकन
- METR — Common Elements of Frontier AI Safety Policies ढांचे की तुलना
- Eleos AI Research कल्याणकारी पद्धति का मॉडल
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.