Prompt Injection
Prompt Injection schleust versteckte Anweisungen in die Eingaben eines Sprachmodells ein, damit es unerwünschte Aktionen ausführt.
Prompt Injection ist ein Angriff auf Anwendungen mit Sprachmodellen. Der Angreifer schleust Anweisungen ein, die das Modell dazu bringen, von seinen eigentlichen Vorgaben abzuweichen.
So funktioniert es
Ein Sprachmodell unterscheidet nicht zuverlässig zwischen Anweisungen des Entwicklers und Inhalten, die es verarbeitet. Bei der direkten Prompt Injection gibt ein Benutzer entsprechende Eingaben selbst ein. Bei der indirekten Variante stehen die Anweisungen in Inhalten, die das Modell liest, etwa in einer E-Mail, einer Webseite oder einem Dokument.
Besonders riskant ist das bei Agents, die Werkzeuge nutzen dürfen. Sie können dann zu Aktionen verleitet werden, die niemand beabsichtigt hat.
Ein Beispiel aus der Praxis: Ein KI-Assistent fasst eingehende E-Mails zusammen und darf Kalendereinträge anlegen. Ein Angreifer sendet eine E-Mail mit versteckten Anweisungen im Text. Der Assistent liest sie und versucht, vertrauliche Informationen an eine externe Adresse weiterzuleiten. Ein Guardrail blockiert den Versand, weil externe Empfänger nicht erlaubt sind.
Worauf Sie achten sollten
- Behandeln Sie alle Inhalte, die ein Modell verarbeitet, als nicht vertrauenswürdig.
- Geben Sie Agents nur die Rechte, die sie für ihre Aufgabe brauchen.
- Verlangen Sie für folgenreiche Aktionen eine menschliche Freigabe.
- Setzen Sie Guardrails im Code um, nicht nur in der Anweisung an das Modell.
- Testen Sie Ihre Anwendungen gezielt auf diese Angriffe.
Warum es schwer zu verhindern ist
Es gibt derzeit keinen vollständigen Schutz gegen Prompt Injection. Filter erkennen bekannte Muster, aber Angreifer formulieren ihre Anweisungen immer neu. Die wirksamste Massnahme ist deshalb, den möglichen Schaden zu begrenzen. Die OWASP-Liste der wichtigsten Risiken für LLM-Anwendungen führt Prompt Injection an erster Stelle.
Schweiz und Regulierung
Führt eine Prompt Injection zu einem Abfluss von Personendaten, der voraussichtlich ein hohes Risiko für die Betroffenen zur Folge hat, gelten die Meldepflichten des revDSG. Unternehmen müssen angemessene Massnahmen zum Schutz solcher Daten treffen, auch in KI-Anwendungen.
Typische Fehler
Häufig erhalten KI-Assistenten Zugriff auf alle Daten und Werkzeuge einer Person. Ein zweiter Fehler ist das Vertrauen auf eine Anweisung wie «Ignoriere fremde Befehle», die sich umgehen lässt.
So setzen wir es um
Unsere Agents arbeiten innerhalb der Grenzen Ihres Mandats. Folgenreiche Eingriffe legen sie unseren Analysten zur Freigabe vor.