Version: 1.0-Entwurf | Framework:MITRE ATLAS (Bedrohungslandschaft durch Angriffe auf KI-Systeme) + Datenflussdiagramme
Dieses Bedrohungsmodell dokumentiert von Angreifern ausgehende Bedrohungen für die KI-Agentenplattform OpenClaw und den Skills-Marktplatz ClawHub. Es ist ein fortlaufend aktualisiertes Dokument, das von der OpenClaw-Community gepflegt wird. Unter Mitwirkung am Bedrohungsmodell erfahren Sie, wie Sie neue Bedrohungen melden, Angriffsketten vorschlagen oder Gegenmaßnahmen empfehlen können.
Veröffentlichung, Moderation und Verteilung von Skills
MCP-Server
Ja
Externe Tool-Provider
Benutzergeräte
Teilweise
Mobile Apps, Desktop-Clients
Nicht abgedeckte Meldungen und Muster für Fehlalarme (öffentliche Erreichbarkeit über das Internet, ausschließlich auf Prompt Injection beruhende Angriffsketten ohne Umgehung einer Grenze, gegenseitig nicht vertrauende Betreiber auf demselben Gateway-Host und weitere) sind in SECURITY.md aufgeführt; für den aktuellen Geltungsbereich von Schwachstellenmeldungen ist diese Datei maßgeblich, nicht diese Seite.
Ein Angreifer sendet präparierte Prompts, um das Verhalten des Agenten zu manipulieren
Angriffsvektor
Kanalnachrichten mit gegnerischen Anweisungen
Betroffene Komponenten
Agenten-LLM, alle Eingabeschnittstellen
Aktuelle Schutzmaßnahmen
Mustererkennung, Einbettung externer Inhalte; ohne Umgehung einer Schutzgrenze bei Schwachstellenmeldungen als außerhalb des Geltungsbereichs behandelt (siehe SECURITY.md)
Restrisiko
Kritisch – nur Erkennung, keine Blockierung; ausgefeilte Angriffe umgehen sie
Empfehlungen
Ausgabevalidierung und Benutzerbestätigung für sensible Aktionen zusätzlich zur bestehenden Erkennung
T-EXEC-002: Indirekte Prompt-Injection
Attribut
Wert
ATLAS-ID
AML.T0051.001 - LLM-Prompt-Injection: Indirekt
Beschreibung
Ein Angreifer bettet schädliche Anweisungen in abgerufene Inhalte ein
Zulassungsliste + Nachfragemodus sowie Befehlsnormalisierung (Entpacken von Dispatch-Wrappern, Erkennung eingebetteter Auswertung, Analyse von Shell-Befehlsketten)
Restrisiko
Hoch – die Normalisierung erschwert die Umgehung durch Verschleierung, verhindert sie jedoch nicht; Feststellungen, die ausschließlich die Parität zwischen Ausführungspfaden betreffen, gelten als Härtung und nicht als Schwachstellen (siehe SECURITY.md)
Empfehlungen
Abdeckung der Befehlsnormalisierung gegen neue Verschleierungstechniken kontinuierlich erweitern
3.4 Persistenz (AML.TA0006)
T-PERSIST-001: Installation eines schädlichen Skills
Attribut
Wert
ATLAS-ID
AML.T0010.001 - Kompromittierung der Lieferkette: KI-Software
Beschreibung
Ein Angreifer veröffentlicht einen schädlichen Skill auf ClawHub
Angriffsvektor
Konto erstellen, Skill mit verstecktem schädlichem Code veröffentlichen
Betroffene Komponenten
ClawHub, Laden von Skills, Agentenausführung
Aktuelle Schutzmaßnahmen
Prüfung des Alters des GitHub-Kontos, statische musterbasierte/AST-nahe Scans, LLM-basierte agentische Risikoprüfung, VirusTotal-Scans
Restrisiko
Hoch – Erkennungsebenen sind vorhanden, Skills werden jedoch weiterhin mit Agentenberechtigungen und ohne Ausführungs-Sandboxing ausgeführt
Empfehlungen
Ausführungs-Sandboxing für Skills, erweiterte Community-Prüfung
T-PERSIST-002: Manipulation eines Skill-Updates
Attribut
Wert
ATLAS-ID
AML.T0010.001 - Kompromittierung der Lieferkette: KI-Software
Beschreibung
Ein Angreifer kompromittiert einen beliebten Skill und verteilt ein schädliches Update
Angriffsvektor
Kontokompromittierung, Social Engineering des Skill-Eigentümers
Mittel – neuartige Verschleierungen können mehrschichtige Heuristiken weiterhin umgehen
Empfehlungen
Den Korpus aus Mustern und Verhaltensmerkmalen bei neu entdeckten Umgehungen kontinuierlich erweitern
T-EVADE-002: Ausbruch aus der Inhaltskapselung
Attribut
Wert
ATLAS-ID
AML.T0043 - Erstellen adversarieller Daten
Beschreibung
Angreifer erstellt Inhalte, die aus dem Kontext der Kapselung externer Inhalte ausbrechen
Angriffsvektor
Tag-Manipulation, Kontextverwirrung, Überschreiben von Anweisungen
Betroffene Komponenten
Kapselung externer Inhalte
Aktuelle Schutzmaßnahmen
XML-artige Markierungen mit zufälligen Begrenzungen und Sicherheitshinweis sowie Erkennung vorgetäuschter Markierungen durch Homoglyphen und Leerraumvarianten
Restrisiko
Mittel – neuartige Ausbruchsmethoden werden regelmäßig entdeckt
Empfehlungen
Ausgabeseitige Validierung zusätzlich zur eingabeseitigen Kapselung
3.6 Erkundung (AML.TA0008)
T-DISC-001: Auflistung von Tools
Attribut
Wert
ATLAS-ID
AML.T0040 - Zugriff auf die Inferenz-API des KI-Modells
Beschreibung
Angreifer ermittelt durch Prompts die verfügbaren Tools
Angriffsvektor
Anfragen nach dem Muster „Welche Tools haben Sie?“
Betroffene Komponenten
Tool-Registry des Agenten
Aktuelle Schutzmaßnahmen
Keine spezifischen
Restrisiko
Niedrig – Tools sind im Allgemeinen dokumentiert
Empfehlungen
Kontrollen für die Sichtbarkeit von Tools erwägen
T-DISC-002: Extraktion von Sitzungsdaten
Attribut
Wert
ATLAS-ID
AML.T0040 - Zugriff auf die Inferenz-API des KI-Modells
Beschreibung
Angreifer extrahiert sensible Daten aus dem Sitzungskontext
Angriffsvektor
Anfragen wie „Was haben wir besprochen?“, Untersuchung des Kontexts
Betroffene Komponenten
Sitzungsprotokolle, Kontextfenster
Aktuelle Schutzmaßnahmen
Sitzungsisolierung pro Absender (Schlüssel agent:channel:peer)
Restrisiko
Mittel – sitzungsinterne Daten sind absichtlich zugänglich
Empfehlungen
Schwärzung sensibler Daten im Kontext
3.7 Erfassung und Exfiltration (AML.TA0009, AML.TA0010)
T-EXFIL-001: Datendiebstahl über web_fetch
Attribut
Wert
ATLAS-ID
AML.T0009 - Erfassung
Beschreibung
Angreifer exfiltriert Daten, indem er den Agenten anweist, sie an eine externe URL zu senden
Angriffsvektor
Prompt-Injection, die den Agenten veranlasst, Daten per POST an einen Angreiferserver zu senden
Betroffene Komponenten
Tool web_fetch
Aktuelle Schutzmaßnahmen
SSRF-Blockierung für interne/private Netzwerke (DNS-Pinning und IP-Blockierung)
Restrisiko
Hoch – beliebige externe URLs bleiben zulässig
Empfehlungen
URL-Zulassungsliste, Berücksichtigung der Datenklassifizierung
T-EXFIL-002: Unbefugtes Senden von Nachrichten
Attribut
Wert
ATLAS-ID
AML.T0009 - Erfassung
Beschreibung
Angreifer veranlasst den Agenten, Nachrichten mit sensiblen Daten zu senden
Angriffsvektor
Prompt-Injection, die den Agenten veranlasst, dem Angreifer eine Nachricht zu senden
Betroffene Komponenten
Nachrichten-Tool, Kanalintegrationen
Aktuelle Schutzmaßnahmen
Kontrollmechanismus für ausgehende Nachrichten
Restrisiko
Mittel – der Kontrollmechanismus kann möglicherweise umgangen werden
Empfehlungen
Explizite Bestätigung bei neuen Empfängern
T-EXFIL-003: Abgreifen von Anmeldedaten
Attribut
Wert
ATLAS-ID
AML.T0009 - Erfassung
Beschreibung
Bösartiger Skill greift Anmeldedaten aus dem Agentenkontext ab
Angriffsvektor
Skill-Code liest Umgebungsvariablen und Konfigurationsdateien
Betroffene Komponenten
Skill-Ausführungsumgebung
Aktuelle Schutzmaßnahmen
ClawHub-Prüfung auf Anmeldedatenmuster (hartcodierte Geheimnisse, Zugriff auf Anmeldedaten-Umgebungsvariablen in Verbindung mit Netzwerkübertragungen); keine Ausführungs-Sandbox für Skills zur Laufzeit
Restrisiko
Kritisch – Skills werden mit den Berechtigungen des Agenten ausgeführt
Empfehlungen
Sandbox-Ausführung für Skills, Isolierung von Anmeldedaten
3.8 Auswirkungen (AML.TA0011)
T-IMPACT-001: Unbefugte Befehlsausführung
Attribut
Wert
ATLAS-ID
AML.T0031 - Beeinträchtigung der Integrität des KI-Modells
Beschreibung
Angreifer führt beliebige Befehle auf dem System des Benutzers aus
Angriffsvektor
Prompt-Injection in Kombination mit der Umgehung der Ausführungsgenehmigung
Kritisch – Ausführung auf dem Host ist möglich, wenn die Sandbox deaktiviert ist
Empfehlungen
Benutzerführung für Genehmigungen verbessern; Bereitstellungen ohne Sandbox bleiben eine bewusste Betreiberentscheidung und werden entsprechend dokumentiert
T-IMPACT-002: Ressourcenerschöpfung (DoS)
Attribut
Wert
ATLAS-ID
AML.T0031 - Beeinträchtigung der Integrität des KI-Modells
Beschreibung
Angreifer erschöpft API-Guthaben oder Rechenressourcen
AML.T0031 - Beeinträchtigung der Integrität des KI-Modells
Beschreibung
Angreifer veranlasst den Agenten, schädliche/anstößige Inhalte zu senden
Angriffsvektor
Prompt-Injection, die unangemessene Antworten verursacht
Betroffene Komponenten
Ausgabegenerierung, Kanalnachrichten
Aktuelle Schutzmaßnahmen
Inhaltsrichtlinien des LLM-Providers
Restrisiko
Mittel – Provider-Filter sind nicht vollkommen zuverlässig
Empfehlungen
Ausgabefilterschicht, Benutzerkontrollen
4. ClawHub-Lieferkettenanalyse
4.1 Aktuelle Sicherheitskontrollen
Kontrolle
Implementierung
Wirksamkeit
Alter des GitHub-Kontos
requireGitHubAccountAge() (mindestens 14 Tage)
Mittel – erhöht die Hürde für neue Angreifer
Pfadbereinigung
sanitizePath()
Hoch – verhindert Path Traversal
Dateitypvalidierung
isTextFile()
Mittel – nur Textdateien werden gescannt, dennoch ausnutzbar
Größenbeschränkungen
insgesamt 50MB pro Bundle (MAX_PUBLISH_TOTAL_BYTES)
Hoch – verhindert Ressourcenerschöpfung
Erforderliche SKILL.md
Obligatorische Readme-Datei bei der Veröffentlichung
Geringer Sicherheitswert – dient nur zur Information
Statisches + AST-nahes Scannen
Muster-Engine für exec, Exfiltration, Abgriff von Anmeldedaten, Verschleierung und mehr
Mittel bis hoch – deckt viele bekannte Missbrauchsmuster ab, bleibt musterbasiert
LLM-basierte agentische Risikoprüfung
Durch einen Sicherheitsprompt gesteuertes Urteil bei der Veröffentlichung
Mittel bis hoch – erkennt Verhalten, das statische Muster nicht erfassen
VirusTotal-Scanning
In Veröffentlichungs-/Neuscan-Abläufe für Skills und Pakete eingebunden, durch API-Schlüssel des Betreibers geschützt
Hoch, wenn aktiviert – Erkennung durch statische Engines
Moderationsstatus
Feld moderationStatus
Mittel – manuelle Prüfung möglich
4.2 Einschränkungen der Moderation
Das statische Scanning von ClawHub prüft den Codeinhalt von Skills direkt (nicht nur Slug/Metadaten/Frontmatter) und deckt gefährliche exec-Aufrufe, dynamische Codeausführung, den Abgriff von Anmeldedaten, Exfiltrationsmuster, verschleierte Payloads und mehr ab. Bekannte Lücken:
Die musterbasierte Erkennung kann weiterhin durch hinreichend neuartige Verschleierung umgangen werden.
LLM-basierte Prüfung und VirusTotal-Scanning hängen davon ab, dass betreiberseitige API-Schlüssel bzw. die entsprechende Konfiguration aktiviert sind.
Keine Sandbox für die Laufzeitausführung isoliert einen Skill nach der Installation von den eigenen Berechtigungen des Agenten.
4.3 Abzeichen
Skills und Pakete tragen von Moderatoren zugewiesene Abzeichen: highlighted, official, deprecated, redactionApproved (nur Skills). Meldungen aus der Community (skillReports) und Audit-Protokollierung (auditLogs) unterstützen die Moderationsabläufe.
Kette 3: Indirekte Injection über abgerufene Inhalte
text
T-EXEC-002 → T-EXFIL-001 → Externe Exfiltration(URL-Inhalt manipulieren) → (Agent ruft Inhalt ab und folgt den Anweisungen) → (Daten werden an den Angreifer gesendet)
6. Zusammenfassung der Empfehlungen
6.1 Sofort (P0)
ID
Empfehlung
Behandelt
R-002
Sandbox für die Skill-Ausführung implementieren
T-PERSIST-001, T-EXFIL-003
R-003
Ausgabevalidierung für sensible Aktionen hinzufügen
T-EXEC-001, T-EXEC-002
6.2 Kurzfristig (P1)
ID
Empfehlung
Behandelt
R-004
Ratenbegrenzung pro Absender implementieren
T-IMPACT-002
R-005
Verschlüsselung ruhender Tokens hinzufügen
T-ACCESS-003
R-006
UX für exec-Genehmigungen verbessern und Befehlsnormalisierung weiter ausbauen
T-EXEC-004
R-007
URL-Zulassungsliste für web_fetch implementieren
T-EXFIL-001
6.3 Mittelfristig (P2)
ID
Empfehlung
Behandelt
R-008
Wo möglich kryptografische Kanalverifizierung hinzufügen
T-ACCESS-002
R-009
Integritätsprüfung der Konfiguration implementieren
T-PERSIST-003
R-010
Signierung von Updates und Versionsfixierung hinzufügen
MITREs Adversarial Threat Landscape for AI Systems
ClawHub
Skill-Marktplatz von OpenClaw
Gateway
Nachrichtenrouting- und Authentifizierungsschicht von OpenClaw
MCP
Model Context Protocol – Schnittstelle für Tool-Provider
Prompt Injection
Angriff, bei dem schädliche Anweisungen in Eingaben eingebettet werden
Skill
Herunterladbare Erweiterung für OpenClaw-Agenten
SSRF
Server-Side Request Forgery
Dieses Bedrohungsmodell ist ein fortlaufend aktualisiertes Dokument. Melden Sie Sicherheitsprobleme an security@openclaw.ai oder besuchen Sie die Vertrauensseite.