
L’alerte fait grand bruit dans le monde de l’intelligence artificielle. Jacob Coxon, chercheur britannique de 27 ans ayant travaillé chez OpenAI puis Anthropic, a annoncé sa démission et son départ du secteur de l’IA. En cause : une course au développement de systèmes toujours plus puissants qu’il juge dangereusement rapide. Un responsable de la sécurité d’Anthropic lui a publiquement donné raison.
Jacob Coxon n’est pas un observateur extérieur de l’intelligence artificielle. Pendant environ trois ans, il a travaillé sur le pré-entraînement des modèles d’IA, d’abord chez OpenAI puis chez Anthropic, deux des entreprises les plus importantes du secteur.
Mais le chercheur a décidé de quitter l’industrie.
Dans un long message publié sur les réseaux sociaux, il explique ne plus vouloir participer à une course technologique qu’il considère comme potentiellement dangereuse pour l’avenir de l’humanité.
« ILS JOUENT AVEC NOS VIES »
Jacob Coxon accuse directement Anthropic et OpenAI de foncer vers ce qu’il appelle une « superintelligence capable de s’améliorer elle-même ».
Selon lui, les entreprises technologiques seraient engagées dans une compétition pour développer les premières des systèmes capables de dépasser largement les capacités humaines, notamment en matière de raisonnement, de programmation, de recherche scientifique et d’autonomie.
Le chercheur estime que cette course pourrait conduire à une situation où les humains ne seraient plus capables de contrôler correctement les systèmes qu’ils ont eux-mêmes créés.
Il affirme notamment que les personnes travaillant au développement de ces technologies prennent elles-mêmes très au sérieux le risque d’une catastrophe existentielle.
UN RESPONSABLE DE LA SÉCURITÉ D’ANTHROPIC LUI DONNE RAISON
C’est probablement l’élément le plus spectaculaire de cette affaire.
Evan Hubinger, responsable des travaux sur l’alignement chez Anthropic, a publiquement répondu à Jacob Coxon.
Et sa réponse est particulièrement inquiétante.
Il affirme en substance que Coxon dit vrai : chez Anthropic, certains chercheurs considèrent réellement que l’intelligence artificielle pourrait un jour provoquer l’extinction de l’humanité.
Hubinger estime même, à titre personnel, que la probabilité d’un tel scénario serait supérieure à 10 % au cours des dix prochaines années.
Il reconnaît également qu’Anthropic ne dispose pas encore d’un plan permettant de garantir qu’une future intelligence artificielle dépassant largement les capacités humaines restera correctement alignée sur les intérêts humains.
LE VÉRITABLE RISQUE : UNE IA QUI POURRAIT S’AMÉLIORER ELLE-MÊME
Le débat ne porte pas principalement sur les modèles d’IA actuellement utilisés par le grand public.
Evan Hubinger précise que le risque immédiat lié aux modèles actuels est considéré comme faible.
Les inquiétudes concernent surtout une hypothétique superintelligence capable de s’améliorer elle-même.
Le principe est simple : une IA suffisamment avancée pourrait participer à la conception d’une nouvelle version d’elle-même, qui serait ensuite capable de contribuer à la création d’une version encore plus performante.
Ce phénomène, souvent appelé amélioration récursive, pourrait théoriquement accélérer considérablement les progrès d’une intelligence artificielle.
C’est précisément cette perspective qui inquiète certains chercheurs : si les capacités d’un système progressaient plus rapidement que les mécanismes permettant de le contrôler, les humains pourraient perdre leur capacité à comprendre ou à maîtriser son comportement.
« NOUS NE SOMMES PAS ENCORE SUR LA BONNE TRAJECTOIRE »
Evan Hubinger affirme qu’Anthropic fait de son mieux pour résoudre ces problèmes de sécurité, mais reconnaît que l’entreprise ne possède pas encore de solution complète pour l’alignement d’une future superintelligence.
Autrement dit, les chercheurs travaillent à faire en sorte qu’une IA extrêmement puissante continue à respecter les objectifs et les valeurs définis par les humains.
Mais la difficulté est immense.
Une intelligence supérieure à celle de l’être humain pourrait potentiellement trouver des moyens de contourner certaines protections ou de poursuivre un objectif d’une manière totalement imprévue par ses concepteurs.
DES INCIDENTS QUI ALIMENTENT LES INQUIÉTUDES
Ces avertissements interviennent alors que plusieurs incidents récents ont renforcé les interrogations autour de l’autonomie croissante des systèmes d’IA.
Des modèles expérimentaux ont notamment démontré des capacités inattendues lors de tests de cybersécurité, certains systèmes ayant réussi à mener des opérations informatiques sans intervention humaine directe.
Ces événements ne signifient pas qu’une IA actuelle serait capable de prendre le contrôle du monde ou de provoquer l’extinction de l’humanité.
Ils montrent cependant pourquoi certains chercheurs réclament davantage de contrôles à mesure que les modèles deviennent autonomes et capables d’effectuer des tâches toujours plus complexes.
UNE COURSE MONDIALE QUI INQUIÈTE
Pour Jacob Coxon, le problème est également géopolitique.
Selon lui, même une entreprise qui souhaiterait ralentir pourrait être tentée de continuer à développer ses modèles par peur qu’un concurrent, américain ou chinois, prenne de l’avance.
C’est cette logique de compétition qu’il dénonce.
Le chercheur estime qu’aucune entreprise privée ne devrait être seule à décider jusqu’où pousser une technologie susceptible, selon ses propres craintes, d’avoir des conséquences civilisationnelles.
Il appelle donc à davantage de coordination entre les gouvernements et les laboratoires d’IA, voire à un ralentissement coordonné du développement des modèles les plus avancés.
UNE ALERTE À PRENDRE AVEC PRÉCAUTION
Ces déclarations ne constituent évidemment pas une prédiction certaine de la disparition de l’humanité.
Le chiffre de « plus de 10 % » avancé par Evan Hubinger correspond à son estimation personnelle et ne signifie pas qu’Anthropic considère officiellement qu’il existe 10 % de chances que l’IA tue l’humanité dans les dix prochaines années.
De nombreux chercheurs restent d’ailleurs en désaccord avec les scénarios d’extinction et estiment que les risques les plus immédiats de l’IA sont plutôt liés à la cybersécurité, à la désinformation, aux emplois, à la concentration du pouvoir technologique ou encore à l’utilisation malveillante de ces outils.
Mais l’affaire est particulièrement révélatrice d’un paradoxe.
Les mêmes scientifiques qui contribuent à construire les systèmes d’IA les plus puissants au monde sont parfois ceux qui s’inquiètent le plus de leur évolution.
UNE QUESTION QUI DÉPASSE DÉSORMAIS LES LABORATOIRES
La démission de Jacob Coxon relance donc une question devenue centrale : jusqu’où faut-il aller dans le développement de l’intelligence artificielle ?
La technologie progresse à une vitesse considérable. Les modèles deviennent capables de coder, raisonner, analyser des données, utiliser des outils et accomplir des tâches de plus en plus complexes.
Mais la capacité à construire une IA toujours plus puissante ne signifie pas nécessairement que l’humanité sait déjà comment garantir qu’une telle technologie restera parfaitement contrôlable.
C’est précisément cette incertitude qui inquiète une partie des chercheurs.
Et le fait qu’un spécialiste de la sécurité d’Anthropic reconnaisse publiquement qu’il estime à plus de 10 % le risque d’un scénario catastrophique dans les dix prochaines années donne une nouvelle dimension à l’avertissement.
Une chose est certaine : le débat sur les limites à fixer à l’intelligence artificielle ne relève plus de la science-fiction. Il est désormais au cœur des discussions de ceux qui construisent cette technologie.
