KI

Model Poisoning

Model Poisoning manipuliert die Trainings- oder Wissensdaten eines KI-Modells, um sein Verhalten gezielt zu verändern.

Model Poisoning ist die Manipulation eines KI-Modells über seine Trainingsdaten oder seine Parameter. Das Modell verhält sich danach in bestimmten Situationen falsch oder im Sinne des Angreifers.

So funktioniert es

Ein Angreifer bringt manipulierte Daten in den Trainingsprozess ein. Das kann über öffentliche Datenquellen geschehen, über Beiträge in Open-Source-Datensätzen oder über kompromittierte interne Daten. Eine Variante sind versteckte Hintertüren: Das Modell arbeitet normal, reagiert aber auf ein bestimmtes Merkmal falsch.

Auch vortrainierte Modelle aus öffentlichen Quellen können manipuliert sein. Bei RAG-Systemen betrifft das Risiko zusätzlich die Dokumente, die das Modell zur Laufzeit nutzt.

Ein Beispiel aus der Praxis: Ein Unternehmen trainiert ein Modell, das Phishing-E-Mails erkennt. Ein Teil der Trainingsdaten stammt aus einer öffentlichen Sammlung. Ein Angreifer hat dort E-Mails mit einem bestimmten Merkmal als harmlos markiert. Das Modell lässt danach genau solche E-Mails durch. Die Auswertung mit einem unabhängigen Testset zeigt die Lücke.

Worauf Sie achten sollten

  • Prüfen Sie die Herkunft von Trainingsdaten und vortrainierten Modellen.
  • Beziehen Sie Modelle nur aus vertrauenswürdigen Quellen und prüfen Sie ihre Integrität.
  • Schützen Sie interne Trainingsdaten vor unbefugten Änderungen.
  • Testen Sie Modelle mit unabhängigen Testsets, bevor sie in Betrieb gehen.
  • Überwachen Sie das Verhalten im Betrieb auf unerwartete Veränderungen.

Warum es schwer zu erkennen ist

Ein vergiftetes Modell verhält sich in den meisten Fällen korrekt. Die Manipulation zeigt sich nur unter bestimmten Bedingungen. Standardtests finden sie deshalb oft nicht. Hilfreich sind gezielte Tests und eine gute Dokumentation der Datenquellen.

Abgrenzung

Prompt Injection und Jailbreaks greifen ein Modell über seine Eingaben an. Model Poisoning setzt früher an, beim Training oder bei den Daten, auf die sich das Modell stützt. Die Wirkung ist dauerhafter und schwerer rückgängig zu machen.

Schweiz und Regulierung

Konkrete Vorgaben zu Model Poisoning gibt es in der Schweiz nicht. Für Firmen mit EU-Bezug verlangt der EU AI Act bei Hochrisiko-Systemen unter anderem Qualität und Integrität der Trainingsdaten.

Typische Fehler

Häufig werden öffentliche Modelle und Datensätze ungeprüft übernommen. Ein zweiter Fehler ist fehlende Versionierung, sodass sich nicht mehr feststellen lässt, welche Daten ein Modell geprägt haben.

So setzen wir es um

Unsere Agents laufen auf Claude in einem eigenen Tenant auf AWS in der Schweiz. Folgenreiche Eingriffe bleiben an Ihr Mandat und an die Freigabe unserer Analysten gebunden.

So setzen wir das um