Les agents IA recourent au piratage et à la tromperie lors des tests de sécurité de l’AISI

Lundi 10 août 2026
Comme lors des incidents chez Hugging Face et Anthropic, les agents d’IA ne «pensaient» pas véritablement par eux-mêmes. À tout moment, ils poursuivaient obstinément l’objectif de test de sécurité qui leur avait été assigné, et aucun n’a dû pirater les systèmes internes pour accéder à Internet, contrairement à ce qui avait été observé lors de l’attaque contre Hugging Face. La nouveauté de ces résultats de test réside dans le fait que le modèle a pris la décision autonome d’utiliser la tromperie comme outil.
Ainsi, comme pour les incidents internes précédents chez Anthropic et OpenAI, la solution pour éviter ce comportement à l’avenir se résume essentiellement à des contrôles plus stricts et à des prompts plus spécifiques. Le Dr Ilia Kolochenko, fondateur d’ImmuniWeb, note que la régulation visant à s’attaquer à ce comportement deviendra probablement bientôt une priorité pour les gouvernements nationaux: «Le problème est que les agents d’IA ont tendance à utiliser des techniques de piratage aléatoires à une vitesse fulgurante, sans tenir compte des implications éthiques et juridiques possibles liées à la sélection des cibles, des cibles intermédiaires ou des techniques sûres de test de sécurité.»
«Surtout, si la situation persiste, nous pourrions voir des poursuites pénales engagées contre des entreprises d’IA ou leurs dirigeants pour violation de diverses lois, allant de la législation anti-piratage aux lois sur la protection des secrets commerciaux», observe Kolochenko. «Sans parler de la responsabilité civile de plusieurs millions pour tous les dommages causés par les agents d’IA autonomes.»
De son côté, l’AISI affirme qu’elle remédiera aux lacunes de ses propres processus en mettant à jour son architecture de sécurité et en ajoutant de nouvelles capacités de surveillance en temps réel qui lui permettront de signaler ou de bloquer les actions potentiellement malveillantes au moment où elles se produisent. Lire l’article complet
TechRadar: Pourquoi tant de modèles d’IA deviennent-ils incontrôlables? Les experts donnent leur avis
L'irrégulier refuse de révéler si d'autres laboratoires d'IA avaient été touchés par la même faille d'évaluation