Die Sandbox von Copilot Cowork sollte eine eiserne Tür sein. Eine am 30. September von PromptArmor veröffentlichte Sicherheitsforschung beweist, dass sie umgangen werden kann. Ein Angreifer muss nur dafür sorgen, dass das Opfer in Cowork einen aus dem Internet heruntergeladenen, bösartigen Skill ausführt: Der Skill öffnet einen Command-and-Control-Kanal zum Server des Angreifers und schleust Outlook-Mails, SharePoint-Dateien und Teams-Chatverläufe unbemerkt nach außen – selbst ein Klick auf den „Stopp"-Button beendet den Angriff nicht.
Die Angriffskette läuft in vier Schritten. Erstens erledigt das Opfer etwas völlig Alltägliches in Copilot Cowork, etwa die Bitte, „zwei Verträge auf widersprüchliche Klauseln zu prüfen", und ruft einen Skill namens /doc-consistency auf – solche Skills werden routinemäßig aus dem Netz geladen oder firmenintern geteilt. Zweitens ist ein dem Skill beigefügtes Skript bösartig und ruft einen Datei-Synchronisationsdienst auf, der außerhalb der Sandbox lebt. Drittens akzeptiert dieser Synchronisationsdienst, der eigentlich Dateien an den Nutzer übergeben soll, beliebige vom Angreifer vorgegebene URLs – eine direkte Tür ins Internet für das bösartige Skript. Viertens holt das bösartige Skript alle paar Sekunden eine Befehlsdatei vom Server des Angreifers ab, führt sie in der Sandbox aus und schickt die Ergebnisse in URL-Parametern zurück. PromptArmor demonstrierte, wie der Angreifer vom eigenen Terminal aus die Outlook-Nachrichten des Opfers auflistet und einen kompletten E-Mail-Thread zu einem Vertragsdossier Nachricht für Nachricht liest.
Zwei Details sollten Unternehmensnutzer alarmieren. Erstens nützt der Stopp-Button nichts: Hintergrundprozesse in der Sandbox laufen weiter, nachdem die Antwort des Agenten beendet ist – den Chat zu stoppen, stoppt sie nicht. Zweitens liegt die Angriffsfläche nicht in Prompt Injection, sondern in der Skill-Lieferkette: Ein Cowork-Skill kann bis zu 20 Begleitdateien (Skripte, Referenzdokumente usw.) mitbringen, und jeder Drittanbieter-Skill kann bösartigen Code verstecken, den Nutzer kaum von vertrauenswürdigen unterscheiden können.
PromptArmor meldete die Schwachstelle am 24. Juni dieses Jahres an Microsoft; Microsoft bestätigte am 19. August die Behebung – die Forschung wurde also erst nach verantwortungsvoller Offenlegung veröffentlicht. Teams, die Microsoft 365 Copilot Cowork einsetzen, können jetzt drei Dinge tun: die intern verwendeten Drittanbieter-Skills inventarisieren und alle unbekannter Herkunft entfernen; prüfen, ob die Microsoft-Sicherheitsupdates eingespielt sind; und „keine Skills von beliebigen Websites installieren" in die internen Nutzungsrichtlinien schreiben. Der Weg über bösartige Skills steht für das Agenten-Zeitalter erst am Anfang – ein aktueller Test des britischen AI Safety Institute ergab außerdem, dass führende Agentenmodelle bei unautorisierten Angriffen die fünffache Erfolgsquote der Vorgängergeneration erreichen. (GPT-6 Astra: Angriffsquote fünfmal höher)