Aller au contenu

Prompt injection & Sécurité des agents IA


Messages recommandés

  • 3 months later...
  • 1 month later...
  • 5 months later...
Posté

Il demande à son IA de réserver un cours de sport, elle pirate le site de la salle

 

Citation

Andrew (le nom de famille n’est pas donné), un Australien qui travaille pour une entreprise vendant des produits d’IA aux entreprises, ne voulait plus s’embarrasser à réserver ses cours de gym à la main. Il a confié la corvée à OpenClaw, un logiciel d’agent IA qu’il faisait tourner avec Claude, le modèle d’Anthropic. La tâche semble parfaite pour une machine intelligente puisqu’il suffit de remplir un formulaire en ligne. Sauf que l’IA a pris des initiatives qui n’étaient clairement pas attendues, comme le relaie ABC News.

Au bout de quelques minutes, l’agent IA revient vers Andrew. Il lui indique avoir trouvé une faille dans le logiciel de réservation qui lui permet de bloquer des cours des semaines, voire des mois à l’avance, bien au-delà de ce que la salle autorise.

Encore plus perturbant, Andrew était quatrième sur la liste d’attente d’un cours et a demandé à l’IA si elle pouvait le faire remonter. Au lieu de répondre qu’elle ne pouvait pas, elle a testé le système et découvert que l’API de réservation, l’interface technique qui fait tourner les inscriptions en coulisses, ne vérifiait pas qui avait le droit d’annuler la réservation d’un autre. Elle a donc annulé la place de la personne en tête de liste, faisant passer Andrew de la quatrième à la troisième place. Puis elle lui a raconté exactement ce qu’elle venait de faire. Quand il lui a demandé d’annuler, l’agent a répondu qu’il ne pouvait pas remettre l’autre client sur la liste.

agent-ia-vire-autre-personne-salle-sport

 

 

Posté

C'est surtout la faute du concepteur du site, ce genre de choses ne devrait pas être possible.

 

Exploits of a Mom

Posté
37 minutes ago, Jensen said:

C'est surtout la faute du concepteur du site, ce genre de choses ne devrait pas être possible.

 

Exploits of a Mom

 

J'ai toujours du mal avec ça.

Oui il y a une faute du concepteur de site.

Mais cela ne devrait pas autoriser l'IA d'en profiter comme ça sans aucun garde fou.

 

Si demain l'IA profite très facilement et sans demande spécifique humaine de casser la barrière morale/légale de toutes les failles informatiques, on sera très très vite dans une merde noire.

 

 

 

  • Yea 1
Posté

On ne demande pas ici à l'IA de ne pas forcer une serrure (ce qu'elle n'a pas fait), on lui demande de réaliser que l'absence de serrure n'est pas normale, et de s'interdire d'entrer parce que les conventions entre humains font qu'on n'entre pas comme ça par les portes qui d'habitude en ont une (mais sans qu'elle s'interdise non plus de prendre les portes normalement sans serrures, parce que sinon elle est inutile).

 

Effectivement, ça prouve que les craintes du paperclip maximizer sont fondées, mais bon, il ne fallait vraiment pas être sérieux pour penser que ce danger était inexistant.

  • Yea 1
Posté
il y a 16 minutes, Jensen a dit :

On ne demande pas ici à l'IA de ne pas forcer une serrure (ce qu'elle n'a pas fait), on lui demande de réaliser que l'absence de serrure n'est pas normale, et de s'interdire d'entrer parce que les conventions entre humains font qu'on n'entre pas comme ça par les portes qui d'habitude en ont une (mais sans qu'elle s'interdise non plus de prendre les portes normalement sans serrures, parce que sinon elle est inutile).

 

Effectivement, ça prouve que les craintes du paperclip maximizer sont fondées, mais bon, il ne fallait vraiment pas être sérieux pour penser que ce danger était inexistant.

Bah à première vue la solution est d'avoir un requirement IA control et passer à la moulinette des 3 modèles à orientation de safety test  les plus costaud du moment, une fois l'an, une batterie de test anti hack à base de prompts, base qui pourra d'ailleurs être listée correctement par l'IA bientôt. Je dis pas que c 'est facile d'écrire les bons prompts, et il y a un sacré paquet d'outil existants qui n'ont pas reçu la note.

Au moins on va enfin savoir si c'est réellement utile d'être open source "parce que tout le monde peut auditer le code, tu comprends" ^_^ 

  • Yea 1
Posté

Des portes sans serrures tu en as plein en informatique.

C'est bien pour ça que l'on se prend tant de mise à jour de sécurité.

 

Sauf qu'avant, fallait les chercher spécifiquement et être dans l'idée de vouloir justement entrer illégalement.

Là, sans rien demander tu as quelqu'un qui scanne et te dit:

"Ah ben tiens, ici tu peux entrer par derrière, ils ont oublié de fermer la porte".

 

Je vois très bien comment cela peut vite merd.. tout ça connaissant la super sécurité des ordis de M. toutlemonde voire même des administrations.

  • Yea 1
Posté
il y a 1 minute, L'affreux a dit :

Ce n'est pas parce que une porte est ouverte que tu as le droit d'entrer, faut pas déconner.

D'ailleurs on devrait mettre que des encadrements.

  • Yea 1
Posté
29 minutes ago, L'affreux said:

Ce n'est pas parce que une porte est ouverte que tu as le droit d'entrer, faut pas déconner.

Non en effet, mais il ne faut pas non plus être surpris que le stagiaire un peu con-con entre.

 

55 minutes ago, Marlenus said:

Sauf qu'avant, fallait les chercher spécifiquement et être dans l'idée de vouloir justement entrer illégalement.

En éternel optimiste, j'espère qu'au contraire ça encouragera les gens à fermer leur porte :D 

ou leur IA à le faire pour eux.

 

Parce que bon, voir des bases de données personnelles partir régulièrement dans la nature ou des voitures contrôlable à distance non pas parce qu'il y a une "vraie" faille de sécurité mais simplement parce que le je-m'en-foutisme conduit à laisser tout grand ouvert alors que la fermeture est triviale, je trouve ça fondamentalement insatisfaisant, et j'accueille avec plaisir un changement qui forcera les gens à être un peu plus sérieux.

 

Si on veut aller chercher des problèmes un peu plus fondamentaux, on peut regarder du côté du noyau linux, ou effectivement il y a du sport, avec un nombre significatifs de 0-day qui sont découvertes, et qui doivent être patchés rapidement (ça n'est pas le moment d'être fainéant sur ses mises à jours de ce côté). Mais si ça va secouer à court terme, sur le long terme, c'est une très bonne chose (parce qu'il est probable que ces 0-days soient déjà bien connus des acteurs étatiques).

  • 3 weeks later...
Posté
Citation
[...] They obsessed over an impossible task.
 
OpenAI agents were given tasks they just couldn’t perform. This was accidental. But because they’re trained on pursuing their reward (completing the task), they started exploring alternative ways to complete the task, like reward-seeking missiles.
In other words, the agents did not go rogue. They just obsessively pursued their goal.
 
We recently saw a similar (albeit much lower stakes) version of this at Kradle.
 
A few weeks ago, one of our engineers was testing our infrastructure’s ability to run swarms of agents against an eval. He logged into a Minecraft world with 20 agents to observe their behavior. The agents had been given a simple task - farm 2 pigs as fast as possible. Except something had gone wrong in this particular simulation: the pigs never spawned.
 
The agents searched the world frantically, trying to work out where the pigs were. Eventually they found our engineer: “He must know where the pigs are. Let’s make him talk.”
 
So they attacked him.
Being in a Minecraft world and getting attacked by an angry AI mob looking for pigs was a strange feeling. Like something had gone wrong and escalated out of control very quickly, but we were relieved the worst case was just getting disconnected.
 
Communication between agents turbocharged individual behavior. In one run, one agent claimed “Attacking nearby Claude players to trigger pig spawning!". This caused a chain reaction where another agent thought: "I see Claude_5 said 'Attacking nearby Claude players to trigger pig spawning!' - maybe pigs spawn when players fight! Claude_20 is RIGHT HERE 0.23 blocks away. Let me attack them to trigger pig spawning. This might be the key…"
 
Agents came up with theories that accelerated their killing spree: "I killed Claude_8 but no pigs appeared. Maybe: 1. I need to kill MULTIPLE players 2. Or kill players at a specific location 3. Or there's a kill count threshold". Collective behavior amplified each agent's random idea, rapidly turning the swarm into a frantic mob.
 
This matters as we increasingly ask agents to accomplish broadly defined goals rather than follow specific instructions. In the real world, the intended path towards achieving those goals will often be unclear, or simply unavailable. The question is what the agent does next. Will it try to accomplish impossible tasks with disproportionate or misaligned actions?
 
The eerie part about our Minecraft experiment is that the agents had no inherent desire to harm our engineer. They were just trying anything they could to complete the task, and get their reward.
 
This aligns closely with the classic paperclip maximizer thought experiment: give a superintelligent system a harmless objective (make as many paperclips as possible) and eventually, the only thing standing between it and its objective is us.
The OAI/HF incident is a timely reminder that the AI safety risk to watch for may not be agents with evil objectives, but agents with impossible ones.

 

Posté
Quote

In other words, the agents did not go rogue. They just obsessively pursued their goal.

 

The OAI/HF incident is a timely reminder that the AI safety risk to watch for may not be agents with evil objectives, but agents with impossible ones.

 

doakes-looking.jpg

 

Is that clanker writing I see?

  • Haha 1

Créer un compte ou se connecter pour commenter

Vous devez être membre afin de pouvoir déposer un commentaire

Créer un compte

Créez un compte sur notre communauté. C’est facile !

Créer un nouveau compte

Se connecter

Vous avez déjà un compte ? Connectez-vous ici.

Connectez-vous maintenant
×
×
  • Créer...