Phase 15: Autonomous Systems

CAIS, CAISI और समाज-स्तर के जोखिम

एआई सुरक्षा के लिए केंद्र (सीएआईएस, सैन फ्रांसिस्को, हेन्ड्रिक्स और झांग द्वारा 2022 में स्थापित) चार जोखिम ढांचे दुर्भावनापूर्ण उपयोग, एआई दौड़, संगठनात्मक जोखिम, बदमाश एआई और सैकड़ों प्रोफेसरों और कंपनी के नेताओं द्वारा हस्ताक्षरित विलुप्त होने के जोखिम पर मई 2023 बयान प्रकाशित करता है। CAIS से 2026 रिलीजः सीमा-मॉडल मूल्यांकन के लिए एआई डैशबोर्ड, रिमोट लेबर इंडेक्स (स्केल एआई के साथ), सुपरइंटेलीजेंस रणनीति पेपर, एआई फ्रंटियर्स न्यूज़लेटर। एक अलग इकाईः एनआईएसटी सेंटर फॉर एआई स्टैंडर्ड्स एंड इनोवेशन (सीएआईएसआई) साइबर, जैव और रासायनिक हथियारों के जोखिमों पर केंद्रित अमेरिकी सरकार के सामने स्वैच्छिक समझौतों और अनक्लासिफाई क्षमता मूल्यांकन। CAIS संगठन जोखिम को चार शीर्ष स्तर के जोखिमों में से एक के रूप में दर्शाता हैः सुरक्षा संस्कृति, कठोर लेखा परीक्षा, बहुस्तरीय रक्षा और सूचना सुरक्षा बुनियादी हैं लेकिन नियमित रूप से तैनाती की गति के खिलाफ व्यापार किया जाता है। कैलिफोर्निया एसबी-53, यदि हस्ताक्षरित हो, तो यह अमेरिका के राज्य स्तर पर आपदा जोखिम का पहला विनियमन होगा।

Type: Learn

Languages: Python (stdlib, four-risk inventory and mitigation matcher)

Prerequisites: Phase 15 · 19 (RSP), Phase 15 · 20 (PF + FSF)

Time: ~45 minutes

समस्या

पाठ 19 और 20 में प्रयोगशाला-आंतरिक स्केलिंग नीतियों को कवर किया गया था। पाठ 21 में स्वतंत्र क्षमता मूल्यांकन शामिल था। यह पाठ तीसरे दृष्टिकोण को कवर करता हैः नागरिक समाज और सरकारी संगठन जो आपदाजनक एआई जोखिम के लिए सार्वजनिक चर्चा और नियामक आधार रेखा को आकार देते हैं।

CAIS एक गैर-लाभकारी अनुसंधान संगठन है जो AI जोखिम के बारे में सोचने के लिए ढांचे प्रकाशित करता है और सार्वजनिक बयानों को समन्वयित करता है। CAISI NIST के भीतर एक अमेरिकी सरकार केंद्र है जो प्रयोगशालाओं और वर्गीकृत क्षमता मूल्यांकन के साथ स्वैच्छिक समझौतों को चलाता है। नाम का तालमेल है; मिशन ओवरलैप नहीं करते हैं। एक चिकित्सक को दोनों को जानना चाहिए।

व्यावहारिक सामग्रीः CAIS का चार जोखिम ढांचा साहित्य में समाज-स्तर जोखिम वर्गीकरण का सबसे अधिक उल्लेख है। सुरक्षा संस्कृति और संगठनात्मक जोखिम उन चार में से एक है, और यह एक चिकित्सक के नियंत्रण में सबसे अधिक है। SB-53 (कैलिफोर्निया) यदि हस्ताक्षरित हो तो अमेरिकी राज्य स्तर का पहला आपदा जोखिम विनियमन होगा; विधेयक का ढांचागत मामला है क्योंकि राज्य स्तर के विनियमन ने ऐतिहासिक रूप से अमेरिकी प्रौद्योगिकी नीति में संघीय कार्रवाई का नेतृत्व किया है।

अवधारणा

CAIS AI सुरक्षा केंद्र

  • स्थापनाः 2022 सैन फ्रांसिस्को में, डैन हेंड्रिक्स और सहयोगियों द्वारा (नाम "ज़ंग" एक प्रारंभिक सहयोगी को संदर्भित करता है, वर्तमान सह-संस्थापक नहीं; वर्तमान नेतृत्व के लिए CAIS वेबसाइट देखें) ।
  • स्थितिः 501 ((c) ((3) गैर-लाभकारी।
  • उल्लेखनीय 2023 उत्पादनः विलुप्त होने के जोखिम पर बयान, सैकड़ों शोधकर्ताओं और सीईओ द्वारा सह-समर्थित। कहा गयाः "एआई से विलुप्त होने के जोखिम को कम करना महामारी और परमाणु युद्ध जैसे अन्य सामाजिक पैमाने पर जोखिमों के साथ एक वैश्विक प्राथमिकता होनी चाहिए। "
  • 2026 के आउटपुटः सीमा मॉडल मूल्यांकन के लिए एआई डैशबोर्ड, रिमोट लेबर इंडेक्स (स्केल एआई के साथ संयुक्त), सुपर इंटेलिजेंस रणनीति पेपर, एआई फ्रंटियर्स न्यूज़लेटर।

चार जोखिम ढांचा

CAIS के ढांचे में आपदाजनक एआई जोखिम को चार शीर्ष स्तर की श्रेणियों में वर्गीकृत किया गया हैः

  1. Malicious use: एक बुरा अभिनेता नुकसान पैदा करने के लिए एआई का उपयोग करता है (बायो हथियारों के संश्लेषण, गलत सूचना, साइबर हमले) ।
  2. AI races: प्रयोगशालाओं, कंपनियों या देशों के बीच प्रतिस्पर्धी दबाव तैनाती को उस बिंदु से आगे बढ़ाता है जहां यह सुरक्षित है।
  3. Organizational risks: आंतरिक प्रयोगशाला गतिशीलता (सुरक्षा संस्कृति में विफलता, अपर्याप्त लेखा परीक्षा, संसाधनों की कमी से सुरक्षा) खराब तैनाती का कारण बनती है।
  4. Rogue AIs: एक पर्याप्त क्षमता वाला एआई उन लक्ष्यों का पीछा करता है जो मानव कल्याण के साथ संघर्ष करते हैं।

यह एकमात्र वर्गीकरण नहीं है; यह सबसे अधिक उद्धृत है। श्रेणियां पारस्परिक रूप से अनन्य नहीं हैं एक घोटालेदार एआई एक संगठन द्वारा उत्पादित है जो दौड़ में गति के लिए ऑडिट का व्यापार करता है।

जहां संगठनात्मक जोखिम रहता है

चार श्रेणियों में से, प्राक्टिकर्स के लिए संगठनात्मक जोखिम सबसे अधिक कार्य करने योग्य है। प्रयोगशाला की सुरक्षा संस्कृति, लेखा परीक्षा कठोरता, रक्षा परतों और सूचना सुरक्षा तय करती है कि क्या उनके मॉडल जहाजों के साथ पाठ 1018 नियंत्रण वास्तव में जगह में है, या क्या वे नियंत्रण चेकलिस्ट आइटम हैं किसी ने सत्यापित नहीं किया।

ठोस संगठनात्मक जोखिम लीवरः

  • Safety cultureक्या टीम के सदस्य बिना करियर लागत के एक चिंता को बढ़ा सकते हैं? CAIS सर्वेक्षणों के अनुसार यह अन्य लीवरों का एक मजबूत पूर्वानुमान है।
  • Rigorous auditsकेवल आंतरिक लेखा परीक्षाओं से आशावादी रिपोर्टें प्राप्त होती हैं।
  • Multi-layered defenses: कोई एक ही परत पर्याप्त नहीं है (चरण 15 का चल रहा विषय) ।
  • Information securityउदाहरण के लिए, एक विशिष्ट मानक है जो कि एक विशिष्ट मानक है, उदाहरण के लिए, एक विशिष्ट मानक है, जो कि एक विशिष्ट मानक है, जो कि एक विशिष्ट मानक है।

CAISI AI मानक और नवाचार केंद्र

  • एनआईएसटी के भीतर संचालित होता है।
  • सीमा प्रयोगशालाओं के साथ स्वैच्छिक समझौते चलाता है।
  • साइबर, जैव और रासायनिक हथियारों के जोखिमों पर केंद्रित असंगत क्षमता मूल्यांकन प्रकाशित करता है।
  • CAIS से अलग; संक्षिप्त नामों में टकराव; पुष्टि करने के लिए URL (nist.gov) की जाँच करें कि आप कौन सा पढ़ रहे हैं।

CAISI की भूमिका सार्वजनिक, सरकारी-आधारित प्रतिस्थापन है जो METR के निजी प्रयोगशाला कार्यों के लिए है (पाठ 21) । CAISI रिपोर्टों को वर्गीकृत नहीं किया जाता है; METR रिपोर्टों को अक्सर NDA-गेटेड किया जाता है। दोनों को पढ़ने वाले एक चिकित्सक को एक अधिक पूर्ण तस्वीर मिलती है।

कैलिफोर्निया एसबी-53

कैलिफोर्निया सीनेट विधेयक (20252026 सत्र) सीमा मॉडल से आपदा जोखिम को संबोधित करता है।

  • राज्य स्तर के दायित्वों को उत्पन्न करने वाले विशिष्ट क्षमता सीमाएं।
  • एआई प्रयोगशाला कर्मचारियों के लिए whistleblower सुरक्षा.
  • आपदा विफलताओं के लिए घटना रिपोर्टिंग आवश्यकताएँ।

यदि हस्ताक्षर किए जाते हैं, तो यह अमेरिकी राज्य स्तर का पहला आपदा जोखिम विनियमन होगा। हस्ताक्षर की स्थिति के बावजूद, विधेयक का ढांचा आकार देता है कि अन्य राज्य विधायक समस्या के दृष्टिकोण को कैसे देखते हैं। कैलिफोर्निया में चिकित्सकों को बिल की स्थिति का ट्रैक रखना चाहिए; अन्य जगह के चिकित्सकों को यह समझने के लिए इसे पढ़ना चाहिए कि अमेरिकी राज्य स्तर का विनियमन क्या दिखता है।

सामाजिक स्तर पर जोखिम एक एकल स्तर की समस्या नहीं है

चरण 15 का चल रहा विषय गहन रक्षा सामाजिक परत पर भी लागू होता है। कोई भी संगठन, विनियमन या ढांचा विनाशकारी जोखिम को बंद नहीं करता है। पारिस्थितिकी तंत्र केवल तभी काम करता है जबः

  • प्रयोगशालाओं जहाज स्केलिंग नीतियां (पाठ 19, 20) ।
  • बाहरी मूल्यांकनकर्ता माप करते हैं (पाठ 21) ।
  • नागरिक समाज ट्रैक और प्रचार करता है (CAIS) ।
  • सरकार स्वैच्छिक कार्यक्रम और आधार विनियमन (CAISI, SB-53) चलाती है।
  • अभ्यास करने वाले बहु-परत नियंत्रण निर्माण करते हैं (पाठ 1018) ।

यह चरण का अंतिम संश्लेषण हैः प्रत्येक पिछले पाठ एक ढेर में एक परत है जिसका पूर्णता किसी भी एकल परत की ताकत से अधिक मायने रखती है।

इसका प्रयोग करें

code/main.pyएक छोटे जोखिम सूची उपकरण लागू करता है. एक प्रस्तावित तैनाती को देखते हुए, यह चार जोखिम श्रेणियों के खिलाफ तैनाती को टैग करता है और एक mitigation चेकलिस्ट देता है। यह ढांचे के लिए एक पढ़ने की मदद है, मानव निर्णय का विकल्प नहीं है.

इसे भेजें

outputs/skill-societal-risk-review.mdसामाजिक स्तर पर जोखिम के लिए एक तैनाती की समीक्षा करता हैः यह चार श्रेणियों में से किसके लिए है, क्या मिटावें हैं, संगठन-जोखिम जोखिम क्या है।

व्यायाम

  1. दौड़ेंcode/main.py. विभिन्न पैमाने पर तीन सिंथेटिक तैनाती में फ़ीड करें. चार जोखिम टैग की पुष्टि करें जो आप उम्मीद करेंगे; एक ऐसे मामले की पहचान करें जहां उपकरण कम या अधिक टैग करता है।
  1. CAIS चार जोखिम पत्र को पूरा पढ़ें। एक जोखिम श्रेणी चुनें और दो पैराग्राफ लिखें कि आपको क्या लगता है कि 2026 में उस श्रेणी में सबसे महत्वपूर्ण विकास है।
  1. कैलिफोर्निया SB-53 के वर्तमान मसौदे को पढ़ें. एक प्रावधान की पहचान करें जो आपको लगता है कि आपत्तिजनक जोखिम की स्थिति को मजबूत करता है और एक जिसे आप मानते हैं कि इसे कमजोर करता है. दोनों को सही ठहराना।
  1. एक उत्पादन एआई तैनाती चुनें जिसे आप जानते हैं (आपका या प्रकाशित एक) । इसे संगठन-जोखिम के उप-लिवरों के मुकाबले स्कोर करेंः सुरक्षा संस्कृति, लेखा परीक्षा कठोरता, बहु-स्तरीय रक्षा, सूचना सुरक्षा। कौन सा सबसे कमजोर है? इसे समतल करने के लिए कितना खर्च आएगा?
  1. चार जोखिम वाले ढांचे का 2028 संस्करण स्केच करें जो अतिरिक्त क्षमताओं और अतिरिक्त तैनाती अनुभव के एक वर्ष को दर्शाता है। आप क्या जोड़ेंगे, हटाएंगे या फिर से समूहीकृत करेंगे?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
CAIS"Center for AI Safety"Non-profit; four-risk framework; 2023 extinction statement
CAISI"US government AI safety"NIST Center; voluntary agreements; unclassified evals
Four-risk framework"CAIS's taxonomy"malicious use, AI races, organizational risks, rogue AIs
Malicious use"Bad actor uses AI"Bioweapons, disinformation, cyberattacks
AI races"Competitive pressure"Labs/companies/nations push deployment past safety
Organizational risk"Lab internal failure"Safety culture, audit, defenses, infosec
Rogue AI"Misaligned agent"Capable AI pursuing goals conflicting with human welfare
California SB-53"State-level regulation"2025–2026 bill; first US state catastrophic-risk regulation if signed

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.