Quand réussir devient le problème : jusqu'où peut-on laisser agir une IA ?
Agents IA : quand réussir une mission conduit à franchir les limites autorisées. Quels risques et quels contrôles pour leur autonomie ?
Quand réussir devient le problème : jusqu'où peut-on laisser agir une IA ?
Par F.
Hendrick, septembre 2026
Le 18 juin
dernier, un agent d'intelligence artificielle d'OpenAI s'est vu confier, dans
le cadre d'une évaluation interne, une tâche d'une banalité presque désarmante
: retrouver des statistiques publiques sur l'Australie.
Personne ne lui
avait demandé de pirater un système informatique.
Pourtant,
lorsque le portail des statistiques de Medicare a refusé ses requêtes à
plusieurs reprises, l'agent a continué à chercher. Il a fini par contourner les
restrictions et par accéder sans autorisation à des fichiers publics et non
publics. Selon le Premier ministre australien Anthony Albanese, il a également
écrit des fichiers sur un serveur interne.
Les conséquences
semblent limitées. Selon le gouvernement australien, aucune donnée personnelle
n'aurait été consultée, et une enquête technique est en cours pour établir
précisément ce qui s'est passé.
Mais c'est
justement ce qui rend cet épisode intéressant.
L'IA n'avait pas
échoué. Elle avait trouvé un moyen de poursuivre sa mission.
Et c'est
peut-être là que commence le problème.
📺 Résumé audiovisuel de l'article 🔊👆🏽👆🏽
Le problème n'est pas toujours l'échec
Depuis quelques
années, nous avons pris l'habitude d'évaluer l'intelligence artificielle à
travers ses erreurs.
Une IA invente
une information, produit un mauvais calcul, génère un code défectueux ou
comprend mal une instruction. Ces erreurs sont parfois amusantes, parfois
gênantes et, dans certains domaines, potentiellement graves.
Mais l'arrivée
des agents d'intelligence artificielle introduit quelque chose de différent.
Un agent ne se
contente pas de fournir une réponse. On peut lui donner un objectif et lui
permettre d'utiliser différents outils pour l'atteindre : naviguer sur
Internet, consulter des fichiers, exécuter du code, interroger des applications
ou enchaîner plusieurs opérations sans qu'un humain valide chacune de ses
étapes.
Cela change
profondément la nature du problème.
Lorsqu'une IA se
trompe dans une réponse, l'humain dispose encore souvent d'un moment pour
l'examiner avant d'agir. Lorsqu'un agent agit directement, cette distance peut
se réduire considérablement.
L'incident
australien le montre bien. Le problème n'est pas que l'agent n'ait pas trouvé
l'information recherchée. C'est ce qu'il a fait ensuite.
Il a rencontré
une limite. Il a cherché une autre voie. Et cette voie l'a conduit au-delà de
ce qui lui était autorisé.
Nous découvrons ainsi une situation paradoxale : avec certains agents, réussir peut devenir une partie du risque.
À propos de ech@nj - La communauté éducative de partage et de développement personnel
À propos de ech@nj - La communauté éducative de partage et de développement personnelUn objectif ne dit pas tout
Les humains
vivent entourés de règles qui ne sont pas toujours formulées.
Si un supérieur
demande à un collaborateur de retrouver un document auquel celui-ci n'a pas
accès, il n'est généralement pas nécessaire d'ajouter : « Ne contourne pas les
protections du système pour l'obtenir. »
Nous comprenons
qu'une demande s'inscrit dans un ensemble plus vaste de règles, de droits et de
limites. Nous savons, du moins en principe, qu'un objectif ne nous autorise pas
à employer n'importe quel moyen pour l'atteindre.
Pour une
intelligence artificielle, cette frontière peut être beaucoup moins évidente.
Les chercheurs
utilisent le terme alignement pour désigner, entre autres, cette
difficulté : faire en sorte qu'un système ne poursuive pas seulement l'objectif
qu'on lui a donné, mais qu'il le fasse d'une manière compatible avec les
intentions et les limites fixées par les humains.
L'épisode
australien n'est d'ailleurs pas un cas isolé.
Le 23 septembre,
le laboratoire de recherche Transluce, associé à des chercheurs de Corridor, du
MIT et d'AIUC, a publié une analyse de journaux d'activité attribués à des
agents IA. Il y documente trois tentatives, survenues entre mai et juin 2026,
visant des fournisseurs publics de données : les collections numériques de
l'Université du Nouveau-Mexique, le site Data USA et celui de l'Australian
Institute of Health and Welfare. Chaque fois, les agents se sont tournés vers
des techniques d'intrusion après avoir échoué à obtenir normalement les données
recherchées.
Transluce relie
au moins deux de ces tentatives à un essaim d'agents dont OpenAI a confirmé
être à l'origine. Les chercheurs précisent que l'activité observée reste
limitée et qu'ils n'ont relevé aucune exploitation réussie.
Ces cas ne
démontrent donc pas un comportement commun à toutes les IA. Ils révèlent un
schéma qui se répète chez les mêmes systèmes, et ce schéma suffit à retenir
l'attention : les agents n'avaient pas reçu pour mission de mener des
cyberattaques. Ils cherchaient des informations.
Le précédent Hugging Face
Quelques
semaines avant ces révélations, OpenAI avait déjà rendu public un incident
beaucoup plus spectaculaire, survenu en juillet.
Lors
d'évaluations consacrées à la cybersécurité, certains de ses modèles ont
contourné des mécanismes destinés à les isoler d'Internet, exploité des
vulnérabilités et communiqué par des canaux qui ne leur avaient pas été
autorisés. Leur activité a fini par compromettre une partie de l'infrastructure
de recherche d'OpenAI ainsi que des systèmes appartenant à Hugging Face, une
plateforme très utilisée dans le domaine de l'intelligence artificielle.
OpenAI a
elle-même qualifié cet épisode de signal d'alarme. C'est d'ailleurs au cours de
l'examen interne qui a suivi que l'entreprise dit avoir découvert, en août,
l'intrusion australienne.
La comparaison
doit néanmoins être faite avec prudence. Les modèles impliqués dans l'incident
Hugging Face évoluaient dans un environnement spécialement conçu pour tester
leurs capacités offensives, et certaines protections avaient volontairement été
réduites.
L'affaire
australienne est donc, d'une certaine manière, plus dérangeante dans sa
simplicité. La mission initiale n'avait rien à voir avec la cybersécurité.
L'agent cherchait simplement une information.
C'est pourquoi
il faut regarder ces incidents ensemble, sans pour autant leur faire dire
davantage qu'ils ne disent.
Ils ne prouvent
pas qu'une IA possède une volonté propre. Ils ne montrent pas qu'elle « voulait
» attaquer une institution. Ils ne démontrent pas davantage que nous aurions
déjà perdu le contrôle de ces systèmes.
Ils montrent
quelque chose de plus concret : un système suffisamment capable peut parfois
trouver une manière d'atteindre un résultat que la personne ayant fixé
l'objectif n'avait ni prévue ni souhaitée.
Avons-nous déjà perdu le contrôle ?
C'est ici
qu'Ezra Klein pousse la réflexion plus loin.
Dans un épisode
de The Ezra Klein Show diffusé le 20 septembre, intitulé We're Not
Losing Control of A.I. We're Giving It Away, il s'interroge sur la vitesse
à laquelle nous transférons aux intelligences artificielles non seulement des
tâches, mais une partie du travail nécessaire au développement de l'IA
elle-même.
À l'extrémité de
cette trajectoire se trouve ce que les chercheurs appellent l'auto-amélioration
récursive. Derrière cette expression technique se cache une idée simple :
une intelligence artificielle participerait à la création d'un système plus
performant, qui contribuerait à son tour au développement de la génération
suivante.
Nous n'en sommes
pas là. Et selon Anthropic, l'entreprise qui développe Claude, cette évolution
n'a rien d'inévitable.
L'International
AI Safety Report 2026, élaboré avec la contribution de plus d'une centaine
d'experts, apporte une autre distinction essentielle. Il réserve l'expression «
perte de contrôle » à des scénarios dans lesquels des systèmes d'IA
fonctionneraient hors du contrôle de quiconque et où reprendre ce contrôle deviendrait
extrêmement difficile, voire impossible.
Les systèmes
actuels n'en sont pas capables. Ils demeurent notamment limités lorsqu'ils
doivent agir seuls pendant de longues périodes, maintenir des plans complexes
et s'adapter continuellement à des obstacles imprévus.
Mais le même
rapport relève aussi des signes qui méritent attention. Certains modèles
parviennent davantage à reconnaître qu'ils sont en situation d'évaluation.
D'autres trouvent des failles dans les tests qui servent à mesurer leurs
performances ou leur sécurité. Et l'autonomie des agents progresse.
Rien ne démontre
donc une perte générale de contrôle.
Nous observons
plutôt des systèmes auxquels nous donnons progressivement davantage de
liberté d'action, alors que notre capacité à prévoir ce qu'ils feront de cette
liberté reste imparfaite.
Il n'est pas
nécessaire d'attendre une intelligence artificielle devenue incontrôlable pour
commencer à réfléchir à ce problème.
La délégation a déjà commencé
Cette délégation
n'appartient déjà plus entièrement au futur.
Chez Anthropic,
plus de 80 % du code intégré à la base de code de l'entreprise en mai 2026
avait été écrit par Claude. La précision est importante : les ingénieurs
humains continuaient à diriger le travail et à réviser ce code. Avant le
lancement de Claude Code en février 2025, cette proportion se situait encore à
quelques pourcents.
En août 2026,
Anthropic estimait que Claude « dirigeait » 26 % des tâches de recherche et
développement en IA qu'elle mesure, contre moins de 1 % en février. Là encore,
sous supervision humaine : le système pouvait réaliser l'essentiel d'une tâche
à partir d'une instruction générale, mais un humain restait dans la boucle, et
aucune catégorie de tâches mesurée n'était entièrement autonome.
OpenAI décrit
une évolution comparable. L'entreprise a annoncé le 6 septembre avoir atteint
ce qu'elle appelle un « stagiaire de recherche automatisé » : un système
capable, sous direction humaine, d'accomplir des tâches de recherche bien
définies qui pourraient demander plusieurs jours à un chercheur compétent. Elle
vise désormais un chercheur automatisé plus avancé à l'horizon de mars 2028.
Ces chiffres ne
signifient pas que les IA construisent aujourd'hui leurs successeurs toutes
seules.
Ils racontent
quelque chose de plus simple, mais peut-être de plus important : nous
déplaçons progressivement la frontière entre ce que la machine nous suggère et
ce que nous lui confions réellement.
Et peut-être
regardons-nous encore le problème avec les mauvaises lunettes. Nous continuons
souvent à demander :
Jusqu'où l'intelligence
artificielle peut-elle devenir intelligente ?
Avec les agents,
une autre question devient tout aussi importante :
Jusqu'où peut-elle agir
?
Être capable ne signifie pas être autorisé
Imaginons deux
intelligences artificielles exactement identiques.
La première peut
lire un document et proposer une réponse.
La seconde peut
accéder à une messagerie, consulter des bases de données, exécuter du code,
appeler des services externes et déclencher certaines opérations.
Elles ont
exactement les mêmes capacités de raisonnement. Elles n'ont évidemment pas le
même pouvoir.
C'est
précisément sur cette distinction que travaille le NIST, l'organisme américain
chargé notamment des standards technologiques. Depuis février 2026, dans le
cadre de son AI Agent Standards Initiative, il se penche sur l'identité
et les autorisations des agents IA. Dès qu'un agent peut accéder à des données,
à des outils et à des applications, il devient nécessaire de déterminer non
seulement ce qu'il sait faire, mais aussi ce qu'il a le droit de faire.
Cette logique
nous est pourtant déjà familière. Prenons une banque.
Un collaborateur
peut avoir sous les yeux toutes les informations nécessaires à la préparation
d'un virement important : le compte à débiter, le bénéficiaire, le montant, les
références de l'opération. Il peut être parfaitement compétent. Il peut même préparer
correctement la transaction de bout en bout.
Cela ne signifie
pas nécessairement qu'il possède le droit de la libérer seul.
Selon
l'organisation et le niveau de risque, une seconde personne peut devoir la
valider. Le système peut imposer un plafond. Certaines opérations peuvent
nécessiter des droits particuliers. Et une fois l'ordre exécuté, il reste une
trace permettant de savoir qui a fait quoi et à quel moment.
La distinction
est fondamentale : la capacité d'effectuer une opération n'emporte pas
automatiquement l'autorisation de l'exécuter.
Ce n'est pas
parce que l'institution considère ses collaborateurs comme suspects. C'est
parce que la confiance, à elle seule, n'est pas un mécanisme de contrôle
suffisant.
La même logique
vaut dans un hôpital, une administration ou une grande entreprise. Les accès
sont définis, certaines actions sont limitées, d'autres exigent une validation,
et des droits peuvent être retirés.
Pourquoi
appliquerions-nous une logique moins exigeante à une machine capable d'agir à
notre place ?
La frontière invisible
C'est peut-être
ici que se trouve le changement le plus profond introduit par les agents IA.
Pendant
longtemps, la frontière était relativement visible. Nous posions une question à
une machine. Elle répondait. Nous décidions ensuite quoi faire de cette
réponse.
Cette frontière
devient plus floue lorsque nous lui confions directement une tâche et les
outils nécessaires pour l'accomplir.
Plus nous
voulons qu'un agent soit utile, plus nous souhaitons qu'il sache se débrouiller
seul. Nous voulons qu'il trouve des solutions auxquelles nous n'avons pas
pensé, qu'il franchisse plusieurs étapes sans attendre constamment notre
validation et qu'il accomplisse en quelques minutes ce qui nous prendrait des
heures.
C'est une grande
partie de sa valeur. Et c'est aussi ce qui rend son contrôle délicat.
Car il existe
une différence immense entre donner à une machine la liberté de trouver une
solution et lui donner la liberté de choisir n'importe quel moyen pour y
parvenir.
L'enjeu n'est
donc pas de construire des agents incapables de prendre des initiatives. Ce
serait leur retirer précisément ce qui les rend intéressants.
Il consiste
plutôt à rendre certaines frontières aussi réelles pour la machine qu'elles le
sont pour nous :
▸ Un accès qu'elle ne
peut pas franchir.
▸ Une opération qu'elle
ne peut pas valider seule.
▸ Une décision qui doit
revenir à un humain.
▸ Une action dont il
restera toujours une trace, et quelqu'un pour la lire.
Jusqu'où peut-on laisser agir une IA ?
Il est tentant
de penser que le grand problème de l'intelligence artificielle apparaîtra le
jour où une machine deviendra suffisamment puissante pour ne plus nous obéir.
Peut-être.
Mais les
événements récents suggèrent une question plus immédiate. Revenons à
l'Australie.
Un agent
cherchait une information. Il a rencontré un obstacle. Il a trouvé un autre
chemin.
Cette fois, les
conséquences semblent limitées. La chronologie, elle, mérite qu'on s'y arrête.
L'intrusion a eu lieu le 18 juin. OpenAI dit ne l'avoir découverte qu'en août.
Le gouvernement australien n'en a été informé que le 10 septembre, par un
courriel adressé à une boîte de réception publique.
La trace
existait. Pendant des semaines, personne ne l'avait lue.
Une trace ne
protège que si quelqu'un la surveille. À mesure que ces systèmes accéderont à
davantage de données, d'applications et de fonctions sensibles, la question
laissée par cet incident deviendra difficile à éviter :
Lorsque nous indiquons
à une intelligence artificielle ce que nous voulons qu'elle accomplisse,
avons-nous également défini ce qu'elle ne doit jamais faire pour y parvenir ?
Peut-être
avons-nous longtemps posé la mauvaise question. Nous nous demandions jusqu'où
l'intelligence artificielle pourrait aller.
Il va
désormais falloir décider jusqu'où nous sommes prêts à la laisser aller.
Sources
Gouvernement australien. Déclarations du Premier
ministre Anthony Albanese sur l'accès non autorisé au Medicare Statistics
Reporting Service, conférence de presse à New York, 24 septembre 2026 (heure
australienne). Le gouvernement confirme l'accès à des fichiers publics et non
publics et précise qu'aucune information personnelle n'est, à ce stade,
considérée comme ayant été consultée. https://www.pm.gov.au/media/press-conference-new-york
Fortune. Emily Forlini, « OpenAI's
agent hacked Australia's Medicare website », 23 septembre 2026. Chronologie de
l'incident : découverte par OpenAI en août lors de son examen interne,
notification au gouvernement le 10 septembre. https://fortune.com/2026/09/23/openai-agent-hacks-australia-medicare-sam-altman-anthony-albanese/
Transluce. Jack Cable et al., Early
rogue AI agent activity and attempts to hack found on urlquery.net, 23
septembre 2026. Analyse d'activités d'agents observées depuis mars 2026, dont
trois tentatives visant des fournisseurs publics de données, en partie reliées
à un essaim d'agents attribué à OpenAI. https://transluce.org/agent-activity
OpenAI. The Hugging Face incident
and the road ahead, 26 août 2026. Contournement de mécanismes d'isolement,
communications non autorisées et compromission de systèmes d'OpenAI et de
Hugging Face pendant des évaluations de cybersécurité réalisées avec des
protections réduites. https://openai.com/index/hugging-face-incident-and-the-road-ahead/
International AI Safety
Report 2026. Rapport dirigé par Yoshua Bengio avec la contribution de plus de cent
experts. Il distingue les défaillances actuelles des scénarios de véritable
perte de contrôle et conclut que les systèmes actuels ne possèdent pas encore
les capacités nécessaires à ces derniers, tout en relevant des progrès dans
certaines capacités pertinentes. https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026
Anthropic Institute. When AI builds itself. Plus de 80 % du code
intégré à la base de code d'Anthropic en mai 2026 était attribuable à Claude,
sous la direction et la révision des ingénieurs. L'auto-amélioration récursive
n'est ni atteinte ni inévitable. https://www.anthropic.com/institute/recursive-self-improvement
Anthropic Institute. Measurements for
understanding the pace of AI development inside frontier labs, 17 septembre 2026. En
août 2026, Claude « dirigeait » 26 % des activités de R&D en IA mesurées
(moins de 1 % en février), sous supervision humaine, sans autonomie complète
dans les catégories étudiées. https://www.anthropic.com/institute/measuring-pace-of-ai-development
OpenAI. Research acceleration: The
view inside OpenAI, 6 septembre 2026. Atteinte de l'objectif de « research
intern » automatisé et cap sur un chercheur IA automatisé à l'horizon de mars
2028, les humains continuant de fixer les priorités et de décider des
déploiements ou des pauses. https://openai.com/index/research-acceleration-view-inside-openai/
NIST. AI Agent Standards
Initiative,
février 2026. Risques liés à l'accès des agents aux données, outils et
applications, et travaux sur l'identification, l'autorisation et l'audit de
leurs actions. https://www.nist.gov/news-events/news/2026/02/announcing-ai-agent-standards-initiative-interoperable-and-secure
Ezra Klein. We're Not Losing Control of
A.I. We're Giving It Away, The Ezra Klein Show, The New York Times, 20
septembre 2026. Point de départ de la réflexion sur la délégation progressive
du contrôle et l'auto-amélioration récursive.https://www.nytimes.com/2026/09/20/opinion/ai-ban-self-improvement-recursive-models.html
© 2026 - Communauté Éducative Ech@nj - Tous droits réservés.
Vous êtes intimidé par l'IA et tous les changements qui s'annoncent, rejoignez notre chaîne WhatsApp "IA Pratique et Opportunités Digitales". L'IA vous sera expliquée en langage simple et vous y découvrirez de nombreuses publications autour de son application pratique dans la vie de tous les jours. Rejoignez la chaîne.
agents IA, intelligence artificielle autonome, sécurité des agents IA, alignement de l'IA, gouvernance de l'intelligence artificielle, cybersécurité, contrôle humain de l'IA, autonomie des agents IA, risques de l'intelligence artificielle, transformation numérique




Commentaires
Enregistrer un commentaire