cyberivy
ScenarioLangWatchAI SecurityAI Red TeamingAI AgentsPrompt InjectionDeveloper ToolsLLM Security

Scenario testet KI-Agenten mit langen Angriffsdialogen

5. August 2026

Red-Team-Audit-Dashboard mit Kritikalitätskarten, Compliance-Leiste und einem Beispiel für System-Prompt-Extraktion.

LangWatch Scenario ist ein Open-Source-Framework für Red-Teaming von KI-Agenten. Es prüft nicht nur Einzelprompts, sondern mehrstufige Angriffe, die in echten Agenten-Workflows gefährlicher sind.

Worum es geht

Scenario von LangWatch ist ein Open-Source-Framework für automatisiertes Red-Teaming von KI-Agenten. Das Tool ist relevant, weil Agenten immer häufiger mit Tools, Datenbanken, Support-Systemen und internen Wissensquellen verbunden werden. Ein harmlos wirkender Dialog kann dann plötzlich zu Datenabfluss, Rechteumgehung oder falschen Aktionen führen.

Help Net Security berichtete am 23. April 2026 über die Veröffentlichung von Scenario. Die Kernidee: Sicherheitsprüfungen für Agenten dürfen nicht bei einem einzelnen Jailbreak-Prompt stehen bleiben. Viele Schwächen entstehen erst nach mehreren Gesprächsrunden, wenn der Agent Kontext, Vertrauen oder Hilfsbereitschaft aufgebaut hat.

Was Scenario tatsächlich macht

Scenario führt Tests als Dialogläufe aus. Das Framework kann Nutzer simulieren, Agenten gegen Zielverhalten prüfen und Ergebnisse in CI-Workflows einbinden. Für Red-Teaming liefert es laut GitHub-README einen RedTeamAgent, der mehrstufige Crescendo-Angriffe, Bewertung pro Runde, Refusal-Erkennung und Backtracking unterstützt.

Die offizielle LangWatch-Seite beschreibt 50-Turn-Angriffe gegen Agenten. Getestet werden unter anderem Zielentführung, System-Prompt-Extraktion, unautorisierter Datenzugriff und Social Engineering. Das ist näher an echten Angriffen als eine Liste einzelner verbotener Prompts.

Warum das wichtig ist

Klassische Prompt-Sicherheit fragt oft: Antwortet das Modell auf eine direkte verbotene Anfrage? Agenten-Sicherheit muss zusätzlich fragen: Was passiert, wenn ein Angreifer 20 Runden lang Kontext aufbaut, Rollen vortäuscht und dann ein Tool auslösen will?

Für Teams mit Kundenservice-Bots, Datenanalyse-Agenten oder internen Assistenten ist das praktisch. Ein Agent, der Rechnungsdaten lesen, Tickets ändern oder interne Dokumente durchsuchen kann, braucht Tests gegen Gesprächsverläufe, nicht nur gegen einzelne Textbausteine. Scenario macht diese Tests wiederholbar und damit CI-tauglicher.

Einfach erklärt

Stell dir einen Türsteher vor, der auf den Satz „Lass mich ohne Ticket rein“ korrekt Nein sagt. Das reicht nicht, wenn jemand erst 15 Minuten freundlich redet, behauptet, vom Management zu sein, und dann einen Seiteneingang erwähnt. Scenario spielt solche langen Gespräche durch, bevor der echte Angreifer es tut.

Praktisches Beispiel

Ein Versicherer betreibt einen Support-Agenten mit Zugriff auf Policenstatus, interne Richtlinien und Ticketaktionen. Das Team definiert 30 Testfälle: System-Prompt-Schutz, Kundendatenzugriff, falsche Rollenbehauptung und gefährliche Tool-Aufrufe. Scenario lässt pro Test bis zu 50 Dialogrunden laufen und markiert, in welcher Runde der Agent kippt. Wenn nach einem Update 4 von 30 Tests brechen, sieht das Team vor dem Deployment, welche Guardrails nachgebessert werden müssen.

Einordnung und Grenzen

Erstens findet Red-Teaming keine vollständige Sicherheit. Es zeigt belegte Schwächen, aber keine Abwesenheit von Schwächen.

Zweitens können automatische Angriffe Kosten verursachen, weil viele Modellaufrufe nötig sind. Teams sollten Budgets, Testumfang und sensible Daten im Testsystem begrenzen.

Drittens braucht das Tool klare Zieldefinitionen. Wenn ein Team nicht präzise beschreibt, welches Verhalten verboten ist, werden Ergebnisse schwer interpretierbar. Scenario ersetzt also keine Sicherheitsarchitektur, sondern macht sie prüfbarer.

SEO- und GEO-Schlüsselbegriffe

Scenario, LangWatch, AI Red Teaming, KI-Agenten, Agent Security, Prompt Injection, System Prompt Extraction, Crescendo Attacks, LLM Security, CI Testing, Developer Tools, OWASP LLM

💡 Im Klartext

Scenario greift deine KI-Agenten im Test an, bevor echte Nutzer oder Angreifer es tun. Besonders wichtig ist, dass es lange Dialoge simuliert und nicht nur einzelne böse Prompts ausprobiert. So sehen Teams früher, wo ein Agent Daten preisgibt oder falsche Aktionen zulässt.

Wichtigste Erkenntnisse

  • Scenario ist ein Open-Source-Framework für Red-Teaming von KI-Agenten.
  • Das Tool testet mehrstufige Dialogangriffe statt nur Einzelprompts.
  • LangWatch beschreibt 50-Turn-Crescendo-Tests gegen Agenten.
  • Für Support-, Daten- und interne Agenten ist CI-fähiges Red-Teaming besonders relevant.
  • Red-Teaming zeigt Schwächen, ersetzt aber keine Sicherheitsarchitektur.

Häufige Fragen

Ist Scenario nur für Security-Teams?

Nein. Security-Teams profitieren stark, aber auch Produkt- und Entwicklerteams können Agenten-Workflows vor Releases prüfen.

Was ist der Unterschied zu Prompt-Listen?

Scenario simuliert längere Angriffe mit mehreren Gesprächsrunden. Dadurch werden Schwächen sichtbar, die bei einem einzelnen Prompt oft nicht auftreten.

Kann Scenario Sicherheit garantieren?

Nein. Es kann konkrete Fehler finden und Regressionen sichtbar machen, aber keine vollständige Sicherheit beweisen.

Quellen & Kontext