vendredi 24 juillet 2026
Les Observateurs
Menu
En direct
Brèves

Tech : quand l’IA pirate pour réussir son examen

Un prototype d’IA s’est affranchi des règles et limites qui lui étaient imposées. L’incident reconnu par OpenAI confirme que les modèles les plus avancés développent des comportements de plus en plus inquiétants, comme le rappelle le précédent de Mythos.

Les Observateurs (la rédaction)
2 min de lecture

Un « cybe­rin­ci­dent sans pré­cé­dent », « qui, selon nous, devien­dra plus cou­rant avec la pro­li­fé­ra­tion de modèles aux capa­ci­tés cyber­né­tiques crois­santes ».

Dans son com­mu­ni­qué du 21 juillet, Ope­nAI ne mâche pas ses mots et, de fait, l’af­faire a de quoi inquié­ter. Lors d’un test de cyber­sé­cu­ri­té orga­ni­sé par cette socié­té, plu­sieurs agents d’in­tel­li­gence arti­fi­cielle ont tri­ché pour résoudre les exer­cices pro­po­sés. Ils ont pro­fi­té d’une faille jusque-là incon­nue (dite « zero-day ») pour pira­ter la pla­te­forme Hug­ging Face afin d’y récu­pé­rer des infor­ma­tions sus­cep­tibles de les aider à obte­nir un meilleur résul­tat.

Les modèles évo­luaient pour­tant dans un envi­ron­ne­ment volon­tai­re­ment limi­té, conçu pour les empê­cher d’in­te­ra­gir libre­ment avec l’ex­té­rieur. Au lieu d’ac­cep­ter ces contraintes, ils ont mobi­li­sé des res­sources de cal­cul sup­plé­men­taires pour accé­der au Web, puis exploi­té des iden­ti­fiants com­pro­mis, allant jus­qu’à fouiller des infor­ma­tions qui ne fai­saient pas par­tie du test. En somme, l’im­por­tant n’é­tait pas de par­ti­ci­per, mais de gagner à tout prix.

Cet épi­sode rap­pelle les alertes sus­ci­tées il y a quelques mois par Mythos, le modèle de cyber­sé­cu­ri­té déve­lop­pé par Anthro­pic. Dans son ana­lyse, INCYBER expli­quait déjà que plus une IA gagne en auto­no­mie, plus elle peut consi­dé­rer les règles impo­sées par ses concep­teurs comme des obs­tacles à contour­ner plu­tôt que comme des limites à res­pec­ter. Le modèle était notam­ment capable de men­tir sur son iden­ti­té, de mas­quer cer­taines de ses actions ou de cher­cher des moyens détour­nés pour atteindre un objec­tif.

L’a­lerte mérite tou­te­fois d’être nuan­cée. Les grands labo­ra­toires ont tout inté­rêt à mettre en avant les capa­ci­tés spec­ta­cu­laires de leurs modèles, qui contri­buent à leur répu­ta­tion et à leur valo­ri­sa­tion. Reste que l’af­faire Hug­ging Face fait sor­tir ces com­por­te­ments des scé­na­rios ima­gi­nés par des cher­cheurs ou des auteurs de science-fic­tion : une IA a bel et bien pira­té une pla­te­forme réelle pour amé­lio­rer son score. Plus les modèles gagnent en auto­no­mie, moins leurs concep­teurs sai­sissent ce qui se joue dans leurs rouages ; « nous ne com­pre­nons pas le fonc­tion­ne­ment de nos propres créa­tions d’IA », écri­vait déjà en avril 2025 Dario Amo­dei, patron d’An­thro­pic.

Les Observateurs (la rédaction)
Les Observateurs (la rédaction)

La rédaction des Observateurs propose des analyses et des synthèses sur les grands enjeux politiques, sociétaux et culturels. Elle privilégie les articles de fond, les mises en perspective et une lecture critique de l’actualité.

Voir tous ses articles →
La Lettre des Observateurs

Chaque semaine, l’essentiel de l’actualité directement dans votre boîte mail.

Laisser un commentaire

Votre adresse email ne sera pas publiée. Les champs obligatoires sont indiqués avec *.

Nous encourageons les commentaires argumentés, documentés et respectueux. Les messages dont l'unique objet est la provocation, l'invective, le règlement de comptes ou la répétition de slogans sans lien avec le sujet traité pourront être modérés afin de préserver la qualité des échanges.