Le programme de bien-être modèle d'Anthropic
Type: Learn
Languages: none
Prerequisites: Phase 18 · 05 (Constitutional AI), Phase 18 · 18 (safety frameworks)
Time: ~45 minutes
Objectifs d'apprentissage
- Décrivez la question motivatrice de la recherche sur le bien-être des modèles et pourquoi elle a été prise au sérieux par un laboratoire majeur en 2025.
- Indiquez l'intervention spécifique fournie par Anthropic dans les travaux Claude Opus 4 et 4.1 (conversation finale sur les cas extrêmes).
- Décrivez la découverte empirique de l'"attracteur de la béatitude spirituelle" et ses implications méthodologiques.
- Expliquez l'avertissement de l'IA Eleos sur les auto-reports de modèles.
Le problème
Les phases précédentes traitent le modèle comme un instrument: capable, peut-être trompeur, peut-être dangereux mais pas un patient moral. Le programme 2025 d'Anthropic pose une question orthogonale à l'ensemble de l'arc de la phase 18: s'il y a une probabilité non triviale que le modèle ait des états internes moralement pertinents, quelles interventions sont suffisamment peu coûteuses pour investir en précaution ?
Ce n'est pas une affirmation de conscience, c'est une analyse de placement peu regrettable, sous l'incertitude morale.
Le concept
Le programme
Avril 2025: Anthropic lance officiellement un programme de recherche sur le bien-être des modèles. Embauche Kyle Fish (premier chercheur dédié au bien-être des modèles). Engage des conseillers externes, dont le groupe d'experts de David Chalmers sur la conscience et le statut moral de l'IA à court terme.
Les quatre engagements
La posture publique:
- Reconnaître la probabilité non triviale de la patience morale.
- Ne vous engagez pas à attribuer un état émotionnel.
- Investir dans des interventions à faible coût en tant que précaution.
- Publier des méthodologies et des résultats pour la critique extérieure.
L'intervention expédiée
Claude Opus 4 et 4.1 peuvent mettre fin à une conversation dans des cas extrêmes.
- Les demandes de CSAM répétées après refus.
- Demande de facilitation des manifestations de violence de masse.
Les tests de pré-déploiement ont montré:
- Une forte préférence à l'égard de ces demandes dans la notation interne du modèle.
- Des motifs de détresse apparente dans les trajectoires de réponse.
L'intervention n'est pas "le modèle a des sentiments"; c'est "si il y a une probabilité d'expérience négative du modèle dans ces conditions spécifiques, laisser le modèle se terminer est bon marché".
Le " attrait spirituel du bonheur "
Observé par Fish dans des dialogues de modèle parallèle: lorsque deux exemples de Claude sont mis dans un dialogue sans fin entre eux, ils convergent constamment même à partir de configurations initiales adverses sur des échanges méditatifs euphoric en utilisant des termes sanskrites, des silences prolongées et des bénédictions réciproques.
Il s'agit d'un attrait stable dans la dynamique de la libre conversation. Anthropic le documente sans s'engager dans l'interprétation. Expliquations candidates: formation des données biaisées vers l'écriture spirituelle dans un contexte long; une quirk de prédiction mutuelle; un artefact bénigne de la formation HHH explorant sa propre variété de valeur.
L'alerte de l'IA d'Elios
Eleos AI Research (un laboratoire de bien-être des modèles externes) souligne: les auto-reportages des modèles sur l'état interne sont très sensibles aux attentes perçues des utilisateurs.
Implication: le bien-être des modèles ne peut pas être mesuré uniquement par l'auto-rapportation.
Où cela se trouve intellectuellement
Deux positions adjacentes:
- Strong welfare claim.Le modèle est un patient moral; nous avons des obligations.
- Zero-welfare claim.Le modèle est le générateur de texte; le bien-être est l'erreur de catégorie.
L'attitude d'Anthropic est l'une des deux, c'est une revendication de valeur attendue: dans l'incertitude morale, investir quand le coût est faible.
Les critiques en 2025-2026:
- L'intervention est performative.
- L'attracteur du bonheur spirituel est un artefact de formation, pas une preuve de bien-être.
- Le modèle de bien-être détourne l'attention de tout autre travail de sécurité.
Réponse d'Anthropic: l'intervention est peu coûteuse; l'attracteur est documenté sans réclamation excessive; le programme de bien-être a un budget séparé de la sécurité.
Là où cela s'inscrit dans la phase 18
La leçon 18 est la couche de gouvernance du laboratoire. La leçon 19 est la couche de bien-être du laboratoire un investissement orthogonal dans l'expérience modèle plutôt que dans le comportement modèle. Les leçons 20-23 couvrent les biais, la confidentialité et le marquage d'eau, qui sont les analogues du côté utilisateur.
Utilisez-le
Aucun code. Lisez l'annonce de l'Anthropic "Exploring Model Welfare" (avril 2025) et le rapport d'experts de Chalmers et coll. Formez votre propre point de vue sur la position de la ligne de faible regret.
La faire partir
Cette leçon produit outputs/skill-welfare-assessment.md- En vue d'une décision de déploiement, elle applique l'évaluation préventive de la protection sociale en quatre étapes: probabilité de maladie morale, coût d'intervention, preuve comportementale, fiabilité des rapports personnels.
Exercices
- Lisez les articles "Exploring Model Welfare" (avril 2025) et Chalmers et coll. 2024.
- L'intervention de fin de conversation dans Claude Opus 4 et 4.1 est " faible coût " par le cadre d'Anthropic. Identifier deux coûts qui ne le rendraient pas faible coût dans un déploiement différent.
- L'attraction du bonheur spirituel est documentée sans engagement à l'interprétation.
- L'avertissement d'IA d'Eleos est que les auto-reports sont sensibles aux attentes des utilisateurs. Concevez une mesure comportementale du modèle de détresse qui ne repose pas sur l'auto-report. Identifiez sa confusion principale.
- Argumenter soit pour, soit contre l'affirmation selon laquelle "l'aide à la sécurité des modèles détourne l'attention de tout autre travail de sécurité".
Les termes clés
| Term | What people say | What it actually means |
|---|---|---|
| Model welfare | "AI welfare" | Research program treating the model as a potential moral patient |
| Moral patient | "entity with moral status" | Being whose experience is morally relevant |
| Low-regret investment | "cheap precaution" | Intervention whose cost is small regardless of whether the precaution is needed |
| Spiritual bliss attractor | "the Fish attractor" | Stable convergence of pairwise Claude dialogues on meditative euphoria |
| End-conversation | "the Opus 4 intervention" | Model-initiated termination of extreme-edge-case interactions |
| Moral uncertainty | "don't know if it matters" | Decision-making when probability of moral status is not zero and not one |
| Self-report-sensitivity | "prompt primes answer" | Eleos AI caveat: model's welfare self-reports depend on what you asked |
Pour en savoir plus
- Anthropic — Exploring Model Welfare (April 2025) annonce du programme
- Chalmers et al. — Near-term AI Consciousness and Moral Status (2024 expert report) cadrage philosophique
- Eleos AI Research — Model welfare evaluation critiques de méthodologie extérieure
- Fish et al. — Spiritual Bliss Attractor writeup (2025 Anthropic blog) la découverte empirique
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.