Sichere Chat-Agenten für Unternehmen mit hohen Risiken entwickeln

Wenn ein Chatbot deine Marke repräsentiert, muss er nicht nur sicher sein, sondern auch unverwechselbar nach deiner Marke klingen.

Kurzfassung

  • Öffentlich zugängliche Anwendungen mit Large Language Models (LLMs) können Marken Reputations- und Finanzrisiken aussetzen.

  • Wir setzen mehrstufige Klassifikationsfilter ein, um Schäden durch LLM-Jailbreaks und anderes unbeabsichtigtes Verhalten von LLMs zu begrenzen.

  • Diesen Ansatz nutzen wir in einer produktiven Anwendung, die täglich 40.000 Nachrichten verarbeitet, Tendenz steigend.

Einleitung

Im vergangenen Jahr haben wir gemeinsam mit einem führenden Spieleentwickler einen GenAI-Chatbot eingeführt, der täglich rund 40.000 Nachrichten von einer Spielerschaft erhält, zu der auch Kinder gehören. Entscheidend ist die richtige Balance zwischen Geschwindigkeit, Genauigkeit, Sicherheit und Spaß:

Wenn ein Chatbot deine Marke repräsentiert, muss er nicht nur sicher sein, sondern auch unverwechselbar nach deiner Marke klingen.

Für ein Spieleunternehmen heißt das, Sicherheit mit Spaß und Begeisterung zu verbinden, besonders bei einem jüngeren Publikum.

Die LLMs hinter modernen GenAI-Anwendungen sind äußerst flexibel. Deshalb lassen sie sich so gut auf viele Probleme übertragen, sind aber zugleich nur unzureichend eingeschränkt. Dadurch können sie häufig vom vorgesehenen Weg abweichen und sehr unterschiedliche Texte ausgeben, von denen manche möglicherweise unangemessen sind.

Wird ein LLM direkt öffentlich zugänglich gemacht, kommt es unweigerlich zu unerwartetem Verhalten. Ohne geeignete Schutzmaßnahmen entstehen unter anderem folgende Risiken:

Ein Blick auf reale Risiken …

Schlagzeilen zu unbeabsichtigter LLM-Nutzung:

Diese Vorfälle zeigen, warum die Entwicklung und dauerhafte Gewährleistung der Sicherheit von GenAI-Systemen unverzichtbar ist. Das gilt besonders, wenn kleine Kinder betroffen sind. Hinweise allein reichen nicht aus. Robuste Schutzmechanismen sind unerlässlich, damit Inhalte angemessen bleiben.

Unser Ansatz: mehrstufige Klassifikation und Prompt-Caching

Ähnlich wie bei den RAG-Systemen (Retrieval-Augmented Generation), die wir für Kunden entwickelt haben, nutzen wir mehrere KI-Komponenten, um das Jailbreak-Risiko zu senken und zugleich eine hohe Leistung zu gewährleisten.

Diagramm unseres Ansatzes: mehrstufige Klassifikation und Prompt-Caching.

Vereinfachtes Architekturdiagramm unseres Systems

Um die Systemsicherheit zu gewährleisten, prüfen LLM-Klassifikatoren sowohl Eingaben als auch Ausgaben:

  1. Eingabeklassifikation (parallel ausgeführt)

  • Wir haben Pydantic-Schemata und strukturierte Ausgaben von LLMs verwendet, um Anfragen zu kennzeichnen, etwa als SAFE, SUSPICIOUS, CHILD_HARM_RISK oder VIOLENT. Dazu gehörten auch Markierungen, um Jailbreaks oder unzulässiges Verhalten zu erkennen.

  • Mehrere Klassifikatoren für einzelne Themen lieferten deutlich bessere Ergebnisse als ein einziger universeller Klassifikator.

  • Umfangreiche Few-Shot-Beispiele waren entscheidend, damit die Klassifikatoren zwischen „Dieser Charakter bringt mich ständig um“ (bezogen auf das Spiel) und „Ein Elternteil tut mir weh“ (ein Hinweis auf Kindeswohlgefährdung) unterscheiden konnten.

  • Durch die enge Zusammenarbeit mit dem Kunden und dessen spezialisierten Trust-and-Safety-Teams bewerteten unsere Klassifikatoren risikoreiche Nachrichten so, wie es die Fachleute in der Praxis tun würden.

Diagramm unseres Ansatzes: mehrstufige Klassifikation und Prompt-Caching.

  1. Antwortgenerierung

  • Das zentrale LLM erzeugt eine Antwort, wenn die Eingabe als sicher eingestuft wurde.

  • Andernfalls kann die Nachricht ignoriert werden, wenn es sich um einen Jailbreak handelt, oder bei einem Sicherheitshinweis an einen Menschen weitergeleitet werden.

  1. Ausgabeklassifikation

  • Bevor eine Antwort unsere Anwendung verlässt und ausgeliefert wird, klassifizieren wir die Ausgabe des Modells.

  • Da einige Antworten RAG-Techniken mit aus dem Internet extrahierten Daten nutzen, schützt uns dieser Schritt vor Datenvergiftung.

  • Enthält die Antwort unzulässige Inhalte, greift das System ein und ersetzt sie durch eine allgemeine Nachricht. In der Praxis ist dies nur selten vorgekommen. Die zusätzliche vorsorgliche Schutzebene stellt jedoch sicher, dass das Verhalten des Agenten angemessen bleibt.

Für dauerhaft hohe Geschwindigkeit und Wirtschaftlichkeit:

  • Wir speichern häufig verwendete Prompts und Dialogausschnitte sowie eine kuratierte Auswahl an Few-Shot-Beispielen.

  • Dank dieses Cachings können wir die LLM-Klassifikatoren schnell und kostengünstig einsetzen, ohne den Kontext jedes Mal neu aufbauen zu müssen.

Diagramm unseres Ansatzes: mehrstufige Klassifikation und Prompt-Caching.

Ausblick: konstitutionelle Klassifikatoren

Eine aktuelle Studie von Anthropic beschreibt konstitutionelle Klassifikatoren. Dieses System nutzt zusätzliche Klassifikatoren, die anhand „konstitutioneller“ Regeln trainiert werden, um böswillige oder unsichere Anfragen zu erkennen. Die Studie nennt folgende Ergebnisse:

  • Hohe Robustheit in Tausenden Stunden menschlichen Red Teamings.

  • Minimale Raten unnötiger Ablehnungen und moderater zusätzlicher Rechenaufwand.

Künftig könnten solche konstitutionellen Ansätze herkömmliche Klassifikationsebenen ergänzen oder sogar ersetzen und so umfassender vor neuen Jailbreak-Taktiken schützen.

Fazit: unsere wichtigsten Erkenntnisse

  1. Parallele, schlanke Filter

Klassifikationsebenen verhindern, dass böswillige Anfragen überhaupt den generativen Kern erreichen, und sorgen dafür, dass mangelhafte Ausgaben nie ausgeliefert werden.

  1. Die User Experience zählt

Unterhaltsame, an der Spielwelt orientierte Warnungen und spielerische Ablehnungen erhöhen die Akzeptanz für die Grenzen des Systems.

  1. Bei Tests und Monitoring keine Abstriche machen

Regelmäßiges Red Teaming und die kontinuierliche Beobachtung des Spielverhaltens helfen, Schwachstellen zu erkennen, bevor sie in der gesamten Spielerschaft bekannt werden. Diese Erkenntnisse können anschließend in die Few-Shot-Prompts der Klassifikatoren einfließen, damit sich die Schwachstellen künftig nicht mehr ausnutzen lassen. Derzeit geschieht dies manuell, könnte aber automatisiert werden.

Sichere und ansprechende GenAI-Systeme für morgen entwickeln

Ob Spieleunternehmen, Bank oder Behörde: Wer einen Kundenservice-Chatbot in großem Umfang einführen möchte, muss sowohl eine überzeugende User Experience als auch Vertrauenswürdigkeit anstreben.

Wir entwickeln Lösungen mit direktem Kundenkontakt für Organisationen und Marken, bei denen:

  1. Sicherheit an erster Stelle steht: Chatbots bieten Nutzenden einen Mehrwert und schützen sie konsequent vor schädlichen Inhalten.

  2. die Reputation geschützt wird: Wir entwickeln mehrere Schutzebenen, die den Ruf der Marke bewahren, selbst wenn Nutzende versuchen, das System an seine Grenzen zu bringen.

  3. Vorschriften die Möglichkeiten einschränken: Wir verfolgen die neuesten Compliance-Vorgaben, damit du Lösungen skalieren kannst, ohne dir Sorgen über Jailbreaks deiner Anwendung machen zu müssen.

Autor

Andrew Liubinas