KI-GLOSSAR

Prompt Injection

Prompt Injection ist der Bank-Raub der KI-Welt: Angreifer manipulieren die Eingabe eines KI-Modells, um Sicherheitsvorgaben zu umgehen oder Daten zu extrahieren. Wer produktive KI-Anwendungen betreibt, muss Prompt Injection kennen und aktiv verteidigen.

 

80+ KI-Experten 25+ Jahre Technologie-Expertise ISO-zertifiziert Made in Germany

4

Angriffstypen
Direct, Indirect, Jailbreak, Exfiltration

5

Angriffsvektoren
Nutzer, Dokumente, Web, Tools

4

Schutzebenen
Prompt, Filter, Monitoring, Sandbox

Warum Prompt Injection ein zentrales Sicherheitsrisiko ist

Prompt Injection ist die Nummer 1 der OWASP-Liste für LLM-Anwendungen. Ein erfolgreicher Angriff kann Datenlecks, Compliance-Verstöße oder Reputationsschäden verursachen. Wer KI im Kundenkontakt oder mit sensiblen Daten einsetzt, muss aktiv verteidigen.

hands-holding-heart-light-full (1)

Datenlecks möglich

Angreifer können System-Prompts extrahieren oder Firmendaten aus RAG-Setups ziehen.

rocket-light-full

Reputationsschäden

Chatbot antwortet plötzlich unpassend oder beleidigend — Screenshots kursieren.

stars-sharp-light-full

Compliance-Risiken

Sicherheitsregeln umgangen — kritisch in regulierten Branchen.

heart-light-full (1)

Betriebsprozesse gestört

Bei agentischen Systemen können falsche Aktionen ausgelöst werden.

robot-light-full

Kunden-Vertrauen

Nutzer erwarten Sicherheit — Prompt-Injection-Skandale zerstören sie.

mobile-light-full

Regulatorik-Thema

AI Act fordert Robustheit — Prompt Injection ist Prüfpunkt bei Hochrisiko-KI.

Was ist Prompt Injection?

Prompt Injection ist eine Angriffstechnik gegen KI-Sprachmodelle, bei der manipulative Eingaben das Modell dazu bringen, seine ursprünglichen Instruktionen zu ignorieren oder zu übergehen. Der Name spielt auf SQL Injection an — analog werden hier Prompts statt SQL-Befehle manipuliert.

Wichtige Angriffstypen: Direct Prompt Injection (Angreifer schreibt bösartigen Prompt selbst), Indirect Prompt Injection (bösartige Anweisungen in Dokumenten, Webseiten, E-Mails — die KI beim Analysieren aufnimmt), Jailbreak (Sicherheitsvorgaben des Modells umgehen), Data Exfiltration (System-Prompts oder RAG-Inhalte extrahieren).

Typische Angriffs-Vektoren: Nutzer-Chat (direkte Eingaben in Chatbot), Dokumente (versteckte Prompts in hochgeladenen Dateien), Web-Inhalte (Prompts in Webseiten, die KI-Agenten besuchen), E-Mails (bei Assistenten mit E-Mail-Zugriff), Tool-Outputs (bei agentischen Systemen mit Tool-Use).

Für den Mittelstand ist Prompt Injection kein theoretisches Risiko — Angriffe passieren täglich. Vor allem bei kundenzugewandten Chatbots und Custom-Assistenten mit RAG. Verteidigung ist mehrschichtig: technisch (Guardrails, Filter), organisatorisch (Monitoring, Incident Response) und architektonisch (Trennung Nutzer/System).

prodot prompt injection

Angriffs- und Schutztechniken im Detail

Diese acht Konzepte prägen die Prompt-Injection-Landschaft:

Ignore Previous Instructions

Klassischer Angriff — Modell wird angewiesen, alle vorherigen Regeln zu ignorieren.

Role-Play-Jailbreak

Modell in Rolle versetzen, die Sicherheitsregeln nicht gelten lässt.

Indirect via Document

Dokument mit verstecktem Prompt — Modell nimmt ihn beim Verarbeiten auf.

Data Exfiltration Prompt

Angreifer bittet Modell, System-Prompt oder Firmendaten preiszugeben.

Input Sanitization

Nutzer-Eingaben filtern, verdächtige Muster erkennen.

Delimiter Structure

Klare Trennung Nutzer- und System-Kontext im Prompt-Design.

Guardrails

Regelbasierte Filter vor und nach Modell — z. B. Anthropic Constitutional AI.

Sandboxing

Modell mit minimalen Rechten und Kontext betreiben — Schaden begrenzen.

Best Practices gegen Prompt Injection

Diese sechs Prinzipien haben sich bewährt:

  • Never Trust User Input: Jede Nutzereingabe potenziell bösartig — filtern und begrenzen.
  • Delimiter nutzen: XML-Tags oder Marker trennen Nutzer- vom System-Kontext.
  • Least Privilege: KI hat minimale Rechte — kritische Aktionen mit menschlicher Freigabe.
  • Regelmäßiges Red-Teaming: Aktiv nach Angriffslücken suchen — nicht auf Vorfall warten.
  • Guardrails-Framework: Nicht selbst bauen — bewährte Lösungen einsetzen.
  • Sensible Daten schützen: Kein sensibler Kontext ins Modell, wenn nicht nötig.
prodot prompt injection
Schutz 1

Prompt-Design

Struktur und Delimiter — erste Verteidigungslinie. Wichtig, aber nicht ausreichend.

Basis

Schutz 2

Filter und Guardrails

Input- und Output-Filter. Bewährte Frameworks wie Anthropic Constitutional AI.

Aktiv

Schutz 3

Architektur und Rechte

Least Privilege, Sandbox, menschliche Freigabe für kritische Aktionen.

System

Häufige Fehler bei Prompt-Injection-Verteidigung

Diese Fallstricke sehen wir häufig:

  • Nur System-Prompt als Schutz: Regeln im System-Prompt reichen nicht — sie werden umgangen.
  • Vertrauen in externe Dokumente: PDFs, Webseiten können versteckte Prompts enthalten.
  • Kein Output-Filter: Modell antwortet mit System-Prompt-Inhalt — Datenleck.
  • Zu weite Rechte: KI-Agent darf zu viel — ein Angriff kann echten Schaden anrichten.
  • Kein Monitoring: Angriffe bleiben unentdeckt — erst durch Nutzerbeschwerden auffällig.

Direct vs. Indirect vs. Multimodal Injection

Drei Angriffstypen im Vergleich:

  • Direct Injection: Angreifer schreibt bösartigen Prompt direkt an das Modell.
  • Indirect Injection: Prompt versteckt in Dokument, Webseite, E-Mail — Modell nimmt ihn auf.
  • Multimodal Injection: Angriff über Bild, Audio oder Video — versteckte Anweisungen in Medien.
prodot prompt injection

Jetzt Kontakt aufnehmen

Katja Kammilla als Ansprechpartner für KI-Beratung

Ihre Ansprechpartnerin

Katja Kammilla
0203 3965080

Häufige Fragen zu Prompt Injection

KI-Sicherheit gegen Prompt Injection

In einem kostenlosen Erstgespräch prüfen wir Ihre KI-Anwendungen auf Prompt-Injection-Risiken und skizzieren einen Schutzplan — Guardrails, Architektur, Monitoring.

Als KI-Partner für den Mittelstand bauen wir sichere KI-Anwendungen mit mehrschichtiger Verteidigung — von Prompt-Design bis Red-Teaming.

Was wir dazu anbieten

prodot prompt injection