Akte 07
Red Teaming
Red Teaming heißt: das eigene KI-System gezielt angreifen, bevor es jemand anderes tut. Strukturiert, dokumentiert, wiederholbar.
Angreifen mit Auftrag
Ein Red Team stellt die Frage, die kein Dashboard beantwortet: Was passiert, wenn jemand dieses System wirklich brechen will? Für KI-Systeme heißt das, mit den Techniken der Angreifer zu arbeiten, von Prompt Injection über Jailbreak-Klassen bis zu vergifteten Eingabedaten, gegen das echte System im echten Kontext.
Was die Regulierung verlangt
Der EU AI Act macht adversariales Testen für Hochrisiko-Systeme zur Pflicht und verlangt Nachweise statt Absichtserklärungen. Damit wird Red Teaming vom Kür-Thema zur Dokumentationsfrage: Wer wann was getestet hat, mit welchem Ergebnis, und was daraufhin geändert wurde.
Methodik statt Theater
Ein brauchbarer Test hat definierte Technikklassen, messbare Erfolgskriterien und einen festen Platz im Lebenszyklus: vor dem Start, nach jedem Modellwechsel, nach jeder Änderung an Werkzeugen und Rechten. Ein einmaliger Workshop mit Bildschirmfotos ist kein Red Teaming, sondern Beruhigung.
Beiträge in dieser Akte 00
> akte angelegt, die ermittlung läuft … erste protokolle folgen im Journal.