Recherche
Nous œuvrons à créer une IA avancée sécuritaire, selon une approche en plusieurs étapes.
Le concept central de notre recherche innovante est l’IA-Chercheur, une approche novatrice conçue par Yoshua Bengio qui représente une voie distincte axée sur la sécurité menant vers une IA super-intelligente (ASI).
L’IA-Chercheur s’inspire d’un scientifique idéalisé: un esprit ayant intériorisé les lois de la nature et les utilisant pour formuler des prédictions, mais sans prédilection quant à la manière dont les choses se déroulent. Il s'agit d'une machine hautement intelligente qui utilise le raisonnement probabiliste pour comprendre le monde, sans objectifs ni préférences cachés. Ses prédictions sont transparentes, auditables et vérifiables.
Alors que nous progresserons vers une IA avancée sécuritaire, nous prévoyons que l'IA-Chercheur permette d'accélérer des avancées scientifiques, de fournir des garde-fous et une supervision pour les systèmes d'IA agentiques, tout en améliorant notre compréhension des risques posés par l'IA et des moyens de les éviter.
Publication à
la une
Yoshua Bengio1,2,3, Oliver Richardson1,2,3, Tomáš Gavenčiak6,7, Michael Cohen4, Rory Svarc6, Damiano Fornasiere1,3, Gaël Gendron1, David Hyland8, Aton Kamanda1, Adam Oberman1,5, Francis Rhys Ward1, Anna Gavenčiak6, Jacob Livingston Slosser6,9, Vincent Mai1, Iulian Serban1, Joumana Ghosn1
1LawZero, 2Université de Montréal, 3Mila, 4University of California, Berkeley, 5McGill University, 6Arb Research, 7Center for Theoretical Study, Charles University in Prague, 8University of Oxford, 9Sapien Institute
À mesure que les systèmes d'IA deviennent plus capables, les procédures d'entraînement qui optimisent pour des résultats en aval risquent d'introduire une agentivité implicite : un comportement orienté vers des objectifs que les concepteurs n'ont jamais spécifiés. Cet article présente un argument de sécurité formel pour le prédicteur de l'IA-Chercheur, un modèle entraîné à approximer la distribution postérieure bayésienne conditionnée sur un ensemble de données fixe d'énoncés en langage naturel "épistémiquement contextualisés". Nous soutenons qu'un tel prédicteur peut honnêtement prédire des agents, des actions et leurs conséquences sans être lui-même un agent qui sélectionne des sorties pour orienter ces conséquences. Cette séparation repose sur deux choix de conception, l'un fondé sur la représentation des données et l'autre sur la procédure d'entraînement. La contextualisation épistémique du texte distingue les affirmations factuelles latentes des actes de communication, de sorte que les expressions d'objectifs sont traitées comme des éléments de preuve à expliquer plutôt que comme des motivations que le modèle adopte. Combiné à un objectif d'entraînement orienté vers la distribution postérieure et aux nombreuses contraintes sémantiques inter-contextes, cela vise à conduire le prédicteur vers des prédictions calibrées et prudentes. Le processus d'entraînement est construit de façon à ce que les effets en aval du déploiement d'une prédiction ne servent jamais de signal de récompense; toute agentivité dont le système a besoin est fournie par un échafaudage explicite contraint par des garde-fous, et nous appelons le système résultant qui retient les prédictions à préjudice élevé le prédicteur à garde-fous.
Nous démontrons que, sous certaines hypothèses sur la dynamique d'entraînement et sur la rareté supposée des prédicteurs dangereux, la probabilité que l'entraînement produise un prédicteur dont le déploiement surveillé entraîne un préjudice résiduel supérieur à un seuil spécifié est faible : un prédicteur dangereux devrait sous-estimer le préjudice de manière coordonnée sur de nombreuses requêtes. Nous soutenons que de tels schémas coordonnés sont rares sous la distribution d'initialisation et ne reçoivent aucun signal d'entraînement direct. La sécurité et la précision sont conjointement soutenues dans ce cadre, puisque les contraintes qui assurent la précision sont les mêmes qui rendent la tromperie coordonnée coûteuse. Ces garanties contre le désalignement et l'agentivité émergeant de l'intérieur du prédicteur lui-même n'excluent pas l'utilisation du prédicteur dans le cadre d'un système agentique. »