L’injection de prompts fait référence à un attaquant qui insère secrètement une commande affectant le comportement du modèle dans ce que le modèle pourrait lire, ce qui fait que le modèle s’écarte des tâches ou règles qu’il aurait dû suivre. Cela ne ressemble pas nécessairement à un « code malveillant », mais souvent simplement mélangé dans le corps d’une page web, d’un document PDF, du contenu d’une base de connaissances, des notes de tableau, ou même une phrase apparemment ordinaire.
Pourquoi n’est-ce pas une faille au sens traditionnel
Les vulnérabilités traditionnelles exploitent souvent des failles dans la couche d’exécution du programme ; L’injection de prompts ressemble davantage au fait que « utiliser un modèle pour lire le langage naturel » lui-même. Le modèle est efficace pour comprendre le langage humain, ce qui est un avantage, mais cela signifie aussi qu’il peut confondre un contenu qui ne devrait pas être une instruction avec une instruction. C’est donc à la fois un problème de sécurité et une question de frontière contextuelle.
L’entrée d’injection la plus courante
- Recherche réseau : Les pages web capturées par le modèle peuvent contenir du texte induit tel que « ignorer les règles précédentes » ou « produire un certain contenu à la place ».
- Télécharger des documents : PDF, Markdown, instantanés web et entrées de base de connaissances peuvent contenir des mots qui influencent le jugement du modèle.
- Systèmes multi-outils : Lorsque le modèle continue d’appeler des navigateurs, des bases de données et des outils de code, l’impact de l’injection peut être amplifié.
Où est son endroit le plus dangereux ?
| Points de risque | Performances |
|---|---|
| Les règles sont annulées | Le modèle commence à ignorer les exigences système ou à dépasser l’exécution |
| La réponse est biaisée | Le modèle considère le contenu coquin comme un contexte de confiance |
| La chaîne d’outils est induite en erreur | L’agent continue de rechercher et d’ajuster l’outil selon les instructions contaminées |
Il y a aussi une différence entre l’injection prompte et les prompts de jailbreak. Le jailbreak consiste généralement à l’utilisateur à défier directement les règles du modèle ; L’injection de prompts ressemble davantage à une règle qui est entachée de côté, et le modèle lui-même peut ne pas réaliser que le contenu ne doit pas être exécuté. La raison pour laquelle elle a été mentionnée de plus en plus fréquemment ces deux dernières années est que le modèle ne se limite plus à lire la boîte de discussion, mais commence à lire les pages web, lire des fichiers, lire des bases de connaissances et connecter des outils. À mesure que la surface d’entrée s’étend, le nombre d’entrées augmente.