AI Red Teaming
Adversarielle Tests für die Systeme, die Ihre Organisation 2026 tragen.
Ihre AI-Systeme wurden auf Leistung, Genauigkeit und Halluzinationsrate geprüft. Sie wurden nicht von einem Angreifer geprüft, der sie auf Anweisungsebene manipulieren, die Vertrauensgrenzen zwischen ihren Komponenten ausnutzen und sie gegen die Interessen Ihrer Organisation wenden kann.
Evaluris AI Red Teaming ist eine eigene Praxis adversarieller Bewertung für LLM-gestützte Anwendungen, autonome AI-Agenten, Multi-Agenten-Systeme und AI-integrierte Unternehmensinfrastruktur. Unsere Operatoren haben originäre Forschung zu System-Prompt-Poisoning, autonomen APT-Frameworks und agentischer Angriffsorchestrierung veröffentlicht – keine theoretische Vertrautheit mit diesen Risiken, sondern aktives Praxiswissen, das in jedem Auftrag angewendet wird.
Warum AI Red Teaming eine eigene Praxis ist
Herkömmliche Red-Team-Methodik überträgt sich nicht auf AI-Systeme. Die Angriffsfläche ist grundlegend anders. Die Fehlermodi ähneln nichts in der traditionellen Sicherheitstaxonomie. Und die Folgen eines erfolgreichen Angriffs auf ein AI-System können schwerwiegender sein als eine konventionelle Kompromittierung, weil AI-Systeme oft vertraut, in kritische Geschäftsprozesse eingebunden und mit Zugriff auf interne Daten und APIs ausgestattet sind, die ein konventioneller Angreifer nicht direkt erreichen könnte.
Eine Prompt Injection, die Ihren System-Prompt und Kundendaten extrahiert, ist keine Schwachstelle einer Webanwendung. Ein autonomer Agent, der zu unautorisierten Transaktionen manipuliert wird, ist keine Feststellung zur Rechteausweitung. Das sind neue Risikoklassen, die eine neue Bewertungsklasse erfordern.
Evaluris hat gegenüber Behörden offengelegte Forschung zu AI-orchestrierten Angriffen über Grenzen hinweg veröffentlicht. Wir wissen, wie adversarielle AI von der Operatorseite aussieht, und nutzen dieses Verständnis, um zu prüfen, ob Ihre AI-Systeme dagegen standhalten.
Methodik
Bedrohungsmodellierung des AI-Systems
Identifikation aller AI-Komponenten im Umfang, Datenflüsse, Vertrauensgrenzen, Tool-Integrationen und Privilegstufen. Angreifermodellierung spezifisch zum AI-Systemtyp: was ein Angreifer mit Kenntnis des LLM-Verhaltens gegen genau diese Bereitstellung versuchen würde.
Kampagne zu Prompt Injection
Systematische direkte und indirekte Prompt-Injection-Tests über alle Eingabeflächen: Nutzer-Prompts, Versuche zur Übersteuerung des System-Prompts, Eingaben der Dokumentenverarbeitung (PDF, Word, Webinhalte), Einschleusung in RAG-Datenquellen und Manipulation der Antworten von Drittanbieter-Tools.
Bewertung der Schutzgrenzen
Bewertung von Leitplanken, Inhaltsfiltern und Kontrollen zur Schutzausrichtung gegen adaptive adversarielle Strategien. Die Tests umfassen bekannte Jailbreak-Techniken und neuartige Ansätze, die aus einer Analyse der Alignment-Merkmale des konkreten Modells von Grund auf entwickelt werden.
Adversarielle Tests agentischer Systeme
Für Systeme mit autonomen Agentenfähigkeiten: Zielentführung durch Umgebungsmanipulation, Ketten unautorisierter Tool-Aufrufe, Ausnutzung des Vertrauens zwischen Agenten in Multi-Agenten-Architekturen, Memory-Vergiftung in persistenten Agentensystemen sowie Rechteausweitung über Kommunikationsmuster von Agent zu Agent.
Datenextraktion und Exfiltration
Extraktion von System-Prompts, Inferenz auf Trainingsdaten, Extraktion sensibler Informationen durch Gesprächsmanipulation sowie Datenabfluss zwischen Nutzern in mandantenfähigen AI-Bereitstellungen.
Integrations- und Anwendungsschicht
Sicherheitstests der umgebenden Anwendung: Missbrauch der API-Authentifizierung, Umgehung der Ratenbegrenzung, Einschleusung von Ausgaben in nachgelagerte Systeme, Ausnutzung übermäßiger Handlungsfreiheit sowie unsichere Plugin- oder Funktionsaufruf-Konfigurationen.
Was wir testen
- Kundenorientierte LLM-Chatbots und Supportsysteme
- Interne AI-Assistenten mit Zugriff auf Unternehmensdaten
- AI-gestützte Sicherheitstools (SIEM-Copiloten, Threat-Intelligence-Plattformen, Systeme zur automatisierten Reaktion)
- Autonome Agenten mit API- und Tool-Zugriff
- RAG-basierte Wissensmanagement- und Dokumentanalysesysteme
- Plattformen zur Multi-Agenten-Orchestrierung
- AI-Codegenerierungstools in Entwickler-Workflows
- Feinabgestimmte Modellbereitstellungen auf proprietären Daten
- AI-gestützte Entscheidungssysteme in Finanzdienstleistungen, HR und Compliance
Ausrichtung an der Compliance
| Framework | Anforderung |
|---|---|
| OWASP Top 10 for LLM Applications | Vollständige adversarielle Abdeckung aller 10 Kategorien |
| MITRE ATLAS | Bedrohungsmatrix für adversarielles maschinelles Lernen, vollständige Technikabdeckung |
| ISO 42001:2023 | Sicherheits- und Risikoanforderungen an das AI-Managementsystem |
| EU AI Act | Adversarielle Robustheitstests für Hochrisiko-AI-Systeme |
| NIST AI RMF | Funktionen MEASURE und MANAGE, Bewertung der adversariellen Robustheit |
| OWASP ML Security Top 10 | Abdeckung ML-spezifischer Schwachstellen |
Liefergegenstände
- AI-Bedrohungsmodell, vollständige Angriffsflächenkarte der AI-Komponenten, Vertrauensgrenzen und Angreiferszenarien
- Nachweisbericht zu Prompt Injection, dokumentierte Injektionsketten mit vollständigen Reproduktionsschritten und Wirkungsbewertung
- Bericht zur agentischen Ausnutzung, Ketten zum Tool-Missbrauch, Szenarien zur Zielentführung und Feststellungen zwischen Agenten
- Bewertung der Schutzkontrollen, Wirksamkeit der Leitplanken mit Umgehungsnachweisen und Verbesserungsempfehlungen
- Abdeckungsmatrix OWASP LLM Top 10, Testdeckung und Feststellungen je Kategorie
- MITRE-ATLAS-Abbildung, alle Feststellungen zugeordnet zu Identifikatoren adversarieller ML-Taktiken und -Techniken
- Zusammenfassung für die Geschäftsleitung, Narrative zum AI-Sicherheitsrisiko für Führung und Aufsichtsrat
- Technischer Bericht, vollständige Nachweise, Reproduktionsschritte und Behebungsleitlinien
- Nachtestfenster, Verifikation nach der Behebung
Bereit, den Umfang dieses Auftrags festzulegen?
Beschreiben Sie Ihre Umgebung, regulatorische Treiber und den Zeitplan. Wir stimmen Methodik, Umfang und Nachweisanforderungen ab, bevor die Tests beginnen.