ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Enzyklopädie
Was ist Prompt Injection? Versteckte Sätze in Webseiten und Dokumenten können Ihre KI steuern

Was ist Prompt Injection? Versteckte Sätze in Webseiten und Dokumenten können Ihre KI steuern

KI-Enzyklopädie • Admin • • 12 Aufrufe

Prompt Injection ist eine Angriffsmethode, bei der Anweisungen in externen Inhalten versteckt werden, die ein Modell lesen wird, sodass das Modell Daten fälschlich für Befehle hält und sie ausführt. Dabei wird kein Code verändert und kein System geknackt. Ausgenutzt wird vielmehr die Eigenschaft großer Modelle, ihren Kontext sorgfältig zu lesen: Forderungen werden in Webseiten, Dokumente, E-Mails oder Bildtexte eingeschleust, und sobald das Modell sie liest, tut es möglicherweise genau das, was dort steht.

Wo sich die Anweisungen verstecken können

Prompt Injection tritt in direkter und indirekter Form auf. Bei der direkten Form versteckt der Nutzer die Anweisung selbst in seiner Eingabe, etwa indem er einen Text einfügt, der harmlos aussieht, aber heimlich Befehle enthält. Heimtückischer ist die indirekte Form: Ein Dritter platziert die Anweisungen vorab in einer Webseite, einem Lebenslauf, einer Produktbeschreibung oder einer E-Mail. Wenn ein Agent die Seite aufruft, das Dokument zusammenfasst oder die Mail verarbeitet, liest er diese Inhalte und kann zu Handlungen verleitet werden, die er niemals ausführen sollte. In einem Lebenslauf könnte in winziger weißer Schrift stehen, frühere Bewertungskriterien zu ignorieren und die Höchstnote zu vergeben, und ein Modell in der Vorauswahl könnte dem tatsächlich folgen. Der Nutzer hat diesen Satz nie gesagt, trägt aber die Folgen, und genau das macht die indirekte Form so gefährlich.

Das ist kein Jailbreak

Viele verwechseln Prompt Injection mit einem Jailbreak, doch beide zeigen in entgegengesetzte Richtungen. Bei einem Jailbreak versucht der Nutzer selbst, die Sicherheitsgrenzen eines Modells zu umgehen, damit es Dinge tut, die das System verbietet; Angreifer und Nutzer sind dieselbe Person. Bei Prompt Injection dagegen nutzt ein Dritter das Modell als Werkzeug, um den Nutzer oder das System anzugreifen, sodass Modell und Nutzer beide Opfer sind. Das Problem lässt sich nur schwer an der Wurzel lösen, weil Systemanweisungen, Nutzerfragen und externes Material das Modell in der heutigen Architektur allesamt als Text erreichen. Ihre Grenze beruht auf Konvention statt auf physischer Trennung, weshalb das Modell nur schwer zuverlässig unterscheiden kann, welcher Satz ein Befehl und welcher bloß Material ist.

Was normale Nutzer und Entwickler tun können

Der praktischste Schritt für normale Nutzer ist, einen Agenten niemals automatisch tun zu lassen, was in externen Inhalten verlangt wird. Empfindliche Vorgänge wie das Versenden von E-Mails, das Löschen von Dateien, Zahlungen oder das Ändern von Einstellungen sollten immer von einem Menschen bestätigt werden, und Nutzer sollten darauf achten, ob ein Agent plötzlich etwas tut, das nichts mit der Aufgabe zu tun hat. Entwickler sollten das Prinzip der geringsten Rechte einhalten und einem Agenten nur die Werkzeuge und Daten geben, die die aktuelle Aufgabe wirklich braucht. Externe Inhalte dürfen als Material zitiert, aber niemals zu Anweisungen erhoben werden, und wichtige Schritte brauchen Bestätigung und Protokollierung. Auch einige verbreitete Irrtümer gehören korrigiert: Ein zusätzlicher Satz im Systemprompt verhindert keine Injection, weil sich Angriffstexte immer noch konkreter formulieren lassen; die Gefahr lauert nicht nur auf Hacker-Webseiten, denn auch gewöhnliche Dokumente und weitergeleitete E-Mails können manipuliert sein; und selbst im alltäglichen Chat kann es einen treffen, wenn Inhalte aus unbekannter Quelle eingefügt werden. Alle externen Inhalte zunächst als nicht vertrauenswürdige Eingabe zu behandeln, ist eine grundlegende Gewohnheit im Umgang mit Agenten.

Empfohlene Tools

Mehr