CAIS, CAISI e Risco em escala social
Type: Learn
Languages: Python (stdlib, four-risk inventory and mitigation matcher)
Prerequisites: Phase 15 · 19 (RSP), Phase 15 · 20 (PF + FSF)
Time: ~45 minutes
O problema
As lições 19 e 20 cobriram políticas de escalação interna do laboratório. A lição 21 cobriu a avaliação independente de capacidade. Esta lição abrange a terceira perspectiva: a sociedade civil e as organizações governamentais que moldam a discussão pública e a linha de base regulatória para o risco de IA catastrófica.
CAIS é uma organização de pesquisa sem fins lucrativos que publica quadros para pensar sobre risco de IA e coordena declarações públicas. CAISI é um centro do governo dos EUA dentro do NIST que executa acordos voluntários com laboratórios e avaliações de capacidade não classificadas. Os nomes rimam; as missões não se sobrepõem. Um praticante deve saber ambos.
O conteúdo prático: o quadro de quatro riscos do CAIS é a taxonomia de risco em escala social mais citada na literatura. A cultura de segurança e o risco organizacional são uma dessas quatro, e esta é a mais diretamente sob o controlo de um profissional. SB-53 (Califórnia) seria a primeira regulamentação de risco de catástrofe a nível estadual dos EUA se assinada; a estrutura da lei é importante porque a regulamentação a nível estadual historicamente levou a ação federal na política tecnológica dos EUA.
O conceito
CAIS Centro de Segurança da IA
- Fundada: 2022 em San Francisco, por Dan Hendrycks e colegas (o nome "Zhang" refere-se a um colaborador inicial, não um cofundador atual; veja o site do CAIS para a liderança atual).
- Estatuto: 501 ((c) ((3) organização sem fins lucrativos.
- Output notável de 2023: declaração sobre o risco de extinção, co-assinada por centenas de pesquisadores e CEOs. Estabeleceu: "A mitigação do risco de extinção da IA deve ser uma prioridade global ao lado de outros riscos em escala social, como pandemias e guerra nuclear".
- Resultados de 2026: Painel de análise de IA para avaliação de modelos de fronteira, Índice de Trabalho Remoto (junto com AI de escala), Papel de Estratégia de Superinteligência, boletim informativo da AI Frontiers.
O quadro dos quatro riscos
Os quadros do CAIS agrupam o risco catastrófico da IA em quatro categorias de nível superior:
- Malicious use: um ator mau usa a IA para causar danos (sinteze de armas biológicas, desinformação, ciberataques).
- AI racesA pressão competitiva entre laboratórios, empresas ou nações empurra a implantação para além do ponto em que é segura.
- Organizational risksA evolução da tecnologia de informação e de informação é uma das principais consequências da utilização de tecnologias de informação.
- Rogue AIsA IA é suficientemente capaz de perseguir objetivos que estão em conflito com o bem-estar humano.
Esta não é a única taxonomia; é a mais citada. As categorias não são mutuamente exclutivas uma IA desonesta produzida por uma organização que negociou auditoria de velocidade em uma corrida é todas as quatro.
Onde o risco organizacional vive
Das quatro categorias, o risco organizacional é o mais accionavel para os profissionais. A cultura de segurança de um laboratório, o rigor de auditoria, a camada de defesa e a segurança da informação decidem se seus modelos de navios com os controles das lições 1018 estão realmente em vigor, ou se esses controles são itens da lista de verificação que ninguém verificou.
As alavancas concretas de risco organizacional:
- Safety cultureA Comissão considera que a Comissão deve ter em conta as necessidades do mercado interno e, em particular, a necessidade de uma avaliação adequada da situação dos trabalhadores.
- Rigorous auditsAs auditorias internas produzem relatórios otimistas.
- Multi-layered defenses: não é suficiente uma única camada (tema de execução da Fase 15).
- Information securityA classificação de dados de avaliação, a classificação de dados de avaliação, a classificação de dados de avaliação, a classificação de dados de avaliação, a classificação de dados de avaliação, a classificação de dados de avaliação e a classificação de dados de avaliação, a classificação de dados de avaliação e de dados de avaliação, a classificação de dados de avaliação e de dados de avaliação, a classificação de dados de avaliação e de dados de avaliação, a classificação de dados de dados de avaliação e de dados de avaliação, a classificação de dados de dados de avaliação e de dados de avaliação, a classificação de dados de dados de avaliação e de dados de dados de avaliação, a classificação de dados de dados de avaliação e de dados de dados de dados de dados, a classificação de dados de dados de dados de dados, a classificação de dados de dados de dados e de dados de dados, a classificação de dados de dados de dados, a classificação de dados de dados de dados e de dados de dados de dados, a classificação de dados de dados de dados de dados, a classificação de dados de dados de dados de dados de dados e de dados de dados, a classificação de dados de dados de dados de dados de dados, a classificação de dados de dados de dados de dados de dados de dados, e de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados, e de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de dados de
CAISI Centro de Normas e Inovações da IA
- Opera dentro do NIST.
- Executa acordos voluntários com laboratórios de fronteira.
- Publica avaliações de capacidade não classificadas focadas em riscos de ciber, bio e armas químicas.
- Diferente do CAIS; os acrônimos colidem; verifique a URL (nist.gov) para confirmar qual você está lendo.
O papel da CAISI é o público, contraparte do governo para os trabalhos de laboratório privados da METR (Lessão 21). Os relatórios da CAISI não são classificados; os relatórios da METR são muitas vezes identificados pela NDA.
California SB-53
O projeto de lei do Senado da Califórnia (20252026 sessão) aborda o risco catastrófico de modelos de fronteira.
- Limitações específicas de capacidade que desencadeiam obrigações a nível estatal.
- Proteção de denunciantes para funcionários do laboratório de IA.
- Requisitos para relatar incidentes em caso de falhas catastróficas.
Se assinado, seria a primeira regulamentação de risco catastrófico a nível estadual dos EUA. Independentemente do status da assinatura, a estrutura da lei molda a forma como outras legislaturas estaduais abordam o problema. Os praticantes na Califórnia devem acompanhar o status da lei; os praticantes em outros lugares devem lê-la para entender como a regulamentação a nível estadual dos EUA provavelmente parecerá.
O risco em escala social não é um problema de uma única camada
O tema em curso da Fase 15 defesa em profundidade aplica-se também à camada social. Nenhuma organização, regulamentação ou quadro único fecha o risco catastrófico. O ecossistema funciona apenas quando:
- Políticas de escalagem de embarcações de laboratórios (Lessões 19, 20).
- Os avaliadores externos produzem medições (Lessão 21).
- A sociedade civil acompanha e divulga (CAIS).
- O Governo administra programas voluntários e regulamentação de base (CAISI, SB-53).
- Os praticantes construem controles de várias camadas (Lessões 1018).
Esta é a síntese final para a fase: cada lição anterior é uma camada numa pilha cuja integridade importa mais do que a força de qualquer camada.
Usá-lo
code/main.pyO sistema de avaliação de risco é um sistema de análise de risco que, em função da implementação proposta, marca a implementação em relação às quatro categorias de risco e retorna uma lista de verificação de mitigação.
Envia-o
outputs/skill-societal-risk-review.mdRevisar uma posição de risco em escala social: qual das quatro categorias é abordada, quais são as medidas de mitigação, qual é a exposição ao risco organizacional.
Exercícios
- Corra .
code/main.py- Introdução de três implantações sintéticas em diferentes escalas.
- Leia o documento completo do CAIS sobre os quatro riscos, escolha uma categoria de risco e escreva dois parágrafos sobre o que acredita ser o desenvolvimento mais importante para 2026.
- Leia o projeto atual do SB-53 da Califórnia. Identifique uma disposição que acredite fortalecer a postura de risco catastrófico e uma que acredite enfraquecê-la.
- Escolha uma implantação de IA de produção que conheça (a sua ou publicada). Ponha-a em relação aos sub-impulsos de risco organizacional: cultura de segurança, rigor de auditoria, defesas de várias camadas, segurança da informação. Qual é o mais fraco?
- Esboçar uma versão 2028 do quadro de quatro riscos que reflita um ano de capacidade adicional e um ano de experiência adicional de implantação. O que você adicionaria, removeria ou reagruparia?
Termos-chave
| Term | What people say | What it actually means |
|---|---|---|
| CAIS | "Center for AI Safety" | Non-profit; four-risk framework; 2023 extinction statement |
| CAISI | "US government AI safety" | NIST Center; voluntary agreements; unclassified evals |
| Four-risk framework | "CAIS's taxonomy" | malicious use, AI races, organizational risks, rogue AIs |
| Malicious use | "Bad actor uses AI" | Bioweapons, disinformation, cyberattacks |
| AI races | "Competitive pressure" | Labs/companies/nations push deployment past safety |
| Organizational risk | "Lab internal failure" | Safety culture, audit, defenses, infosec |
| Rogue AI | "Misaligned agent" | Capable AI pursuing goals conflicting with human welfare |
| California SB-53 | "State-level regulation" | 2025–2026 bill; first US state catastrophic-risk regulation if signed |
Mais leitura
- Center for AI Safety a instituição de acolhimento do quadro dos quatro riscos.
- CAIS — AI Risks that Could Lead to Catastrophe o papel de quatro riscos.
- CAIS — May 2023 statement on extinction risk breve declaração comum.
- NIST CAISI Centro de inovação e padrões de IA dirigidos ao governo.
- Anthropic — Measuring agent autonomy in practice liga os compromissos de laboratório à estruturação em escala social.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.