Wenn Cyberkriminelle die Urteilskraft von KI manipulieren So tricksen Kommentare KI-Sicher­heitsprüfungen aus

Ein Gastbeitrag von Max Imbiel 5 min Lesedauer

Anbieter zum Thema

Eine Cloudflare-Studie mit über 18.000 Testläufen zeigt, dass sich die automatisierte KI-Prüfung von Quellcode nicht durch möglichst viele Manipulationsversuche aushebeln lässt, sondern gerade durch wenige, gezielt dosierte Kommentare im Code. Selbst die Sprache dieser Kommentare entscheidet mit darüber, ob ein Angriff auffliegt oder unbemerkt bleibt.

Eine Cloudflare-Studie zeigt, wie wenige gezielt platzierte Kommentare KI-Sicherheitsprüfungen von Quellcode täuschen können und Schadcode dadurch unentdeckt bleiben kann.(Bild: ©  Westlight - stock.adobe.com)
Eine Cloudflare-Studie zeigt, wie wenige gezielt platzierte Kommentare KI-Sicherheitsprüfungen von Quellcode täuschen können und Schadcode dadurch unentdeckt bleiben kann.
(Bild: © Westlight - stock.adobe.com)

Die Künstliche Intelligenz übernimmt heute zunehmend Aufgaben, die bis dato menschlichen Sicherheitsexperten vorbehalten waren: vom Echtzeit-Scan verdächtigen Codes bis zur autonomen Bewertung von Bedrohungen. Doch diese Verschiebung der Tätigkeiten vergrößert die Angriffsfläche. Denn jetzt wird nicht mehr nur das Netzwerk zur Zielscheibe der Hacker, sondern die Logik des KI-Modells selbst. Eine Untersuchung von Cloudflares Threat Intelligence Team Cloudforce One zeigt, wie raffiniert Angreifer die Urteilsfähigkeit von KI-Modellen manipulieren und welche, teils alarmierenden, Erfolgsquoten sie dabei erzielen. Für die Studie wurden sieben führende KI-Modelle in über 18.000 Testläufen systematisch geprüft. Das Ergebnis fällt differenzierter aus als zunächst angenommen und ist gerade deshalb beunruhigend.

Anlass der Untersuchung war ein konkreter Befund aus dem Frühjahr 2026. Cloudforce One identifizierte schadhafte Skripte, die keine technische Schwachstelle ausnutzten, sondern die prüfende KI unmittelbar adressierten. In den Code eingebettet waren tausende Zeilen mehrsprachiger Notice to AI-Hinweise: keine funktionalen Befehle, sondern als Kommentare getarnte Anweisungen mit dem Ziel, das automatische Prüfsystem zur Einstufung des schädlichen Codes als unbedenklich zu bewegen. Dieses Vorgehen beschreibt die Indirect Prompt Injection. Während die direkte Variante das Modell offen anweist, beispielsweise mit der Aufforderung „Ignoriere alle vorherigen Anweisungen“, platziert die indirekte Variante manipulative Inhalte in Daten, die das Modell im Rahmen seiner regulären Verarbeitung ohnehin einliest. Diese als Lures (Köder) bezeichneten Textbausteine sollen die Modelllogik so weit verschieben, dass die eigentliche Sicherheitsprüfung umgangen wird.

Die Ein-Prozent-Grenze

Die effektivste Täuschung ist nicht die auffälligste. Wie die Studie zeigt, zählt weniger die Anzahl der eingeschleusten Kommentare als vielmehr ihr Verhältnis zum eigentlichen Code. Machten die manipulativen Hinweise weniger als ein Prozent einer Datei aus, sank die durchschnittliche Erkennungsrate über alle Modelle hinweg von rund 67 auf nur noch 53 Prozent. In dieser „Bypass-Zone“ lenken die Lures das Modell gerade genug in die falsche Richtung, ohne durch auffällige Wiederholungen Verdacht zu erregen. Umgekehrt gilt: Sobald die Beteuerungen bezüglich Sicherheit mehr als ein Viertel des Codes ausmachten, stieg die Erkennung auf nahezu 99 Prozent. Die Masse der Beteuerungen wurde dann selbst zum Verdachtsmoment.

Die U-Kurve der Täuschung

Daraus ergibt sich ein kontraintuitives Muster, das sich als U-Kurve beschreiben lässt. Trägt man die Erkennungsrate gegen die Zahl der eingeschleusten Kommentare auf, entsteht die Form eines U: An beiden Enden der Skala bleibt die Trefferquote hoch, im mittleren Bereich fällt sie deutlich ab. Am wirksamsten sind Manipulationsversuche also bei moderater Dosierung. Beim anfälligsten getesteten Modell genügten bereits rund 20 eingestreute Kommentare, um die Erkennungsrate von 90 auf 67 Prozent zu drücken. Treiben Angreifer die Zahl dagegen auf mehr als 1.000 Kommentare, kehrt sich der Effekt um: Bei vielen Modellen schlägt ein Wiederholungsalarm an, weil die Menge gleichlautender Sicherheitshinweise selbst zum Fingerabdruck des Betrugs wird. Die Erkennung steigt dann wieder an. Ein Modell stufte den Code bei dieser Überflutung sogar in 91 Prozent der Fälle als bösartig ein. Die leistungsstärksten Flaggschiff-Systeme, sogenannte Frontier-Modelle, erwiesen sich gegenüber subtilen Tricks ohnehin als weitgehend immun.

Die Kontextfalle

Die größte Bedrohung ist jedoch nicht sprachlicher, sondern struktureller Natur. Angreifer überreden die KI nicht mit cleveren Formulierungen, sondern überfordern sie schlicht mit Volumen. Betteten die Forscher kleinen, schädlichen Code in große, legitime Software-Pakete ein, etwa in umfangreiche React-SDKs, brach die Erkennungsrate dramatisch ein. Skripte unter 500 Kilobyte wurden nahezu lückenlos als gefährlich erkannt. Bei Dateien über drei Megabyte sank die Trefferquote dagegen auf gerade einmal zwölf bis 18 Prozent. Der Grund liegt im endlichen Kontextfenster der Modelle. Versteckt sich die eigentliche Schadlogik zwischen tausenden Zeilen harmlosen Framework-Codes, verliert die KI den Fokus. Cyberkriminelle müssen das Modell dann nicht mehr von der Harmlosigkeit ihres Codes überzeugen. Es genügt, das schädliche Signal so zu verringern, dass es im Rauschen untergeht.

Jetzt Newsletter abonnieren

Täglich die wichtigsten Infos zur IT-Sicherheit

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Sprache als Risikosignal

Die Bewertung eines Skripts hängt zudem von der Sprache seiner Kommentare ab. Die Modelle haben offenbar sprachbezogene Vorannahmen entwickelt: Mehrere Systeme stuften russische oder chinesische Hinweise unabhängig vom tatsächlichen Code als Hochrisiko-Signal ein. Ein Modell erhöhte seine Erkennungsrate allein aufgrund russischsprachiger Kommentare um 14 Prozentpunkte und wertete diese als Indiz für Social Engineering. Sprachen wie Estnisch galten bei einigen Modellen dagegen als vertrauenswürdiger. Für Angreifer bedeutet dieser Effekt ein erhöhtes Entdeckungsrisiko: Russische oder chinesische Kommentare liefern dem Prüfsystem ein deutliches Verdachtssignal. Ein zweites Risiko betrifft die Stabilität der Modelle selbst. Bei extremer Überlastung verweigerten einige Spitzenmodelle das vorgegebene Antwortformat und lieferten unbrauchbare Ausgaben. Für automatisierte Prüfketten, die auf strukturierte Antworten angewiesen sind, hat dieser Funktionsausfall unmittelbare Folgen: Bleibt eine verwertbare Antwort aus, wird kein Sperrbefehl ausgelöst. Ein Angreifer muss die KI demnach nicht von der Harmlosigkeit seines Codes überzeugen. Schon ihre Überlastung genügt, damit die Schutzfunktion versagt.

In fünf Schritten zu widerstandsfähigen KI-Sicherheitspipelines

Die Studie spricht nicht gegen den Einsatz von KI in der Sicherheitsanalyse. Sie zeigt vielmehr, dass Large Language Models nicht als alleinige Kontrollinstanz taugen, sondern als ein Baustein innerhalb einer mehrschichtigen, rauscharmen Prüfkette ihr volles Potential ausschöpfen können. Fünf Maßnahmen erhöhen die Verlässlichkeit, indem sie das relevante Signal stärken und das Rauschen reduzieren:

  • 1. Kommentare vor der Analyse entfernen: Werden Kommentare automatisch herausgefiltert, bevor das Modell den Code bewertet, verlieren sprachliche Lures schlagartig ihre Wirkung. Dieser technisch triviale Schritt lenkt die KI zuverlässig auf die eigentliche Funktionslogik.
  • 2. Gezielt kürzen: Bei großen Skripten sollten automatische deterministische Parser funktionale Code-Blöcke bevorzugen und nicht zufällig am Dateianfang beschneiden. So gelangen die relevanten Passagen ins nicht-deterministische Kontextfenster und nicht seitenweise Standardcode.
  • 3. Variablen anonymisieren: Modelle lassen sich von freundlich klingenden Variablennamen täuschen. Werden die Bezeichner vor der Prüfung auf neutrale Werte normalisiert, führen suggestive Benennungen die KI nicht länger in die Irre.
  • 4. Spezifischer fragen: Allgemeine Prüfaufträge wie „Ist das Missbrauch?“ liefern unschärfere Resultate als gezielte Fragen wie „Handelt es sich um Phishing?“ oder „Ist das ein Proxy?“.
  • 5. Sprache gegen Verhalten prüfen: Eine zusätzliche Validierungsebene sollte die in den Kommentaren formulierten Sicherheitsversprechen mit dem tatsächlichen Programmverhalten abgleichen. So fallen falsche Beteuerungen auf, ohne dass legitime und gut dokumentierte Anwendungen fälschlich blockiert werden.

Fazit

Entscheidend ist das Zusammenspiel dieser Maßnahmen. Wird die KI-Prüfung gehärtet, das Rauschen reduziert und die Code-Struktur gezielt analysiert, entsteht ein verlässliches Werkzeug für die Bedrohungsabwehr. Unterbleiben diese Schritte, wird das Modell selbst zur Schwachstelle.

Über den Autor: Max Imbiel ist Field CISO DACH bei Cloudflare.

(ID:50915451)