Zurück zu KI-Enzyklopädie
Was ist eine prompte Injektion? Warum Webseiten, PDFs und Wissensdatenbanken alle Einstiegspunkte für Modelle werden können

Was ist eine prompte Injektion? Warum Webseiten, PDFs und Wissensdatenbanken alle Einstiegspunkte für Modelle werden können

KI-Enzyklopädie Admin 70 Aufrufe

Prompt Injection bezeichnet einen Angreifer, der heimlich einen Befehl, der das Verhalten des Modells beeinflusst, in das Lesen, was dazu führt, dass das Modell von den Aufgaben oder Regeln abweicht, denen es hätte folgen sollen. Es sieht nicht unbedingt wie "bösartiger Code" aus, sondern wird oft einfach in den Hauptteil einer Webseite, eines PDF-Dokuments, Inhalts der Wissensdatenbank, Tabellennotizen oder sogar eines scheinbar gewöhnlichen Satzes eingemischt.

Warum ist es keine Schlupfloch im traditionellen Sinne?

Traditionelle Schwachstellen nutzen oft Schwachstellen in der Programmausführungsschicht aus; Prompt Injection ist eher die Tatsache, dass "ein Modell zum Lesen natürlicher Sprache" selbst verwendet wird. Das Modell ist gut darin, menschliche Sprache zu verstehen, was ein Vorteil ist, aber es bedeutet auch, dass es Inhalte, die keine Anweisung sein sollten, mit einer Anweisung verwechseln kann. Es ist also sowohl ein Sicherheitsproblem als auch eine Frage der kontextuellen Grenzen.

Der häufigste Injektionseinlass

  • Netzwerksuche: Die vom Modell erfassten Webseiten können induzierten Text enthalten wie "ignorieren Sie vorherige Regeln" oder "geben Sie stattdessen bestimmte Inhalte aus".
  • Dokumente hochladen: PDFs, Markdown, Web-Snapshots und KB-Einträge können Wörter enthalten, die das Urteilsvermögen des Modells beeinflussen.
  • Multitool-Systeme: Wenn das Modell weiterhin Browser, Datenbanken und Code-Tools aufruft, kann die Wirkung der Injektion verstärkt werden.

Wo ist der gefährlichste Ort?

RisikopunkteLeistung
Die Regeln werden außer Kraft gesetztDas Modell beginnt, Systemanforderungen oder Übergriffe auf die Ausführung zu ignorieren
Die Antwort ist voreingenommenDas Modell behandelt schmutzige Inhalte als vertrauenswürdigen Kontext
Die Werkzeugkette wird in die Irre geführtDer Agent durchsucht und passt das Werkzeug weiterhin gemäß den kontaminierten Anweisungen an

Es gibt auch einen Unterschied zwischen prompter Injektion und Jailbreak-Prompts. Jailbreaking ist in der Regel ein Modell, das die Regeln direkt herausfordert; Prompt Injection ist eher eine Regel, die von der Seite beeinflusst wird, und das Modell selbst erkennt möglicherweise nicht, dass der Inhalt nicht ausgeführt werden sollte. Der Grund, warum es in den letzten zwei Jahren immer häufiger erwähnt wird, ist, dass das Modell nicht mehr nur das Chatfeld liest, sondern auch Webseiten lest, Dateien liest, Wissensdatenbanken liest und Werkzeuge verbindet. Mit der Erweiterung der Eingangsfläche steigt die Anzahl der Eingänge.

Empfohlene Tools

Mehr