Publicznie dostępne aplikacje oparte na dużych modelach językowych (LLM) mogą narażać marki na ryzyko reputacyjne i finansowe.
Stosujemy wielowarstwowe filtry klasyfikacyjne, aby ograniczać szkody wynikające z obejść zabezpieczeń i innych niepożądanych zachowań LLM.
Zastosowaliśmy to rozwiązanie w intensywnie używanej aplikacji produkcyjnej, która obsługuje 40 000 wiadomości dziennie — a liczba ta stale rośnie.
W ciągu ostatniego roku współpracowaliśmy z czołowym producentem gier nad wdrożeniem chatbota GenAI, który obsługuje około 40 000 wiadomości dziennie od graczy, w tym dzieci. Kluczowe jest pogodzenie szybkości, dokładności, bezpieczeństwa i dobrej zabawy:
Chatbot reprezentujący markę nie może być tylko bezpieczny — musi też autentycznie oddawać jej charakter.
W przypadku producenta gier oznacza to połączenie bezpieczeństwa z dobrą zabawą i zaangażowaniem użytkowników — zwłaszcza tych młodszych.
LLM stanowiące podstawę nowoczesnych aplikacji GenAI są bardzo elastyczne — dzięki czemu dobrze radzą sobie z wieloma problemami — ale jednocześnie podlegają zbyt małym ograniczeniom. Oznacza to, że często mogą zejść z wyznaczonej ścieżki i zwracać bardzo różne treści, z których część może być nieodpowiednia.
Bezpośrednie udostępnienie LLM publicznie z pewnością doprowadzi do nieoczekiwanych zachowań, a bez odpowiednich zabezpieczeń stwarza ryzyko:
„Obejść zabezpieczeń”, w ramach których użytkownicy celowo manipulują chatbotem, aby generował szkodliwe lub niedozwolone treści (ciekawostka: każdy może odwiedzić tę stronę i poznać obchodzenie zabezpieczeń LLM poprzez zabawę…); albo
Niezamierzonego udostępniania niesmacznych, obraźliwych lub niebezpiecznych treści. W wielu przypadkach może to zagrażać dobrostanowi użytkownika albo prowadzić do strat finansowych lub wizerunkowych po stronie dostawcy aplikacji.
Nagłówki prasowe o niezamierzonych skutkach użycia LLM:
Te incydenty pokazują, dlaczego zapewnienie i utrzymanie bezpieczeństwa systemów GenAI nie jest opcjonalne. Dotyczy to zwłaszcza sytuacji, w których z systemu korzystają małe dzieci. Nie można polegać wyłącznie na zastrzeżeniach prawnych — solidne zabezpieczenia są niezbędne, by treści pozostały odpowiednie.
Podobnie jak w systemach RAG (generowania wspomaganego wyszukiwaniem), które stworzyliśmy dla klientów, wykorzystujemy wiele komponentów AI, aby ograniczać ryzyko obejścia zabezpieczeń przy zachowaniu wysokiej wydajności.


Uproszczony schemat architektury naszego systemu
Aby zapewnić bezpieczeństwo systemu, używamy klasyfikatorów LLM zarówno dla danych wejściowych, jak i wyjściowych:
Klasyfikacja danych wejściowych (wykonywana równolegle)
Użyliśmy schematów Pydantic wraz z ustrukturyzowanymi danymi wyjściowymi LLM, aby oznaczać zapytania użytkowników (np. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT itd.). Obejmowało to również flagi wykrywające próby obejścia zabezpieczeń lub niedozwolone zachowania.
Zastosowanie wielu klasyfikatorów do poszczególnych tematów zapewniło znacznie lepsze wyniki niż jeden ogromny klasyfikator „do wszystkiego”.
Rozbudowane zestawy zawierające kilka przykładów były niezbędne, aby klasyfikatory odróżniały „I keep being killed by this character” (odniesienie do gry) od „I am being hurt by my parent” (sygnał krzywdzenia dziecka).
Ścisła współpraca z klientem oraz jego specjalistycznymi zespołami ds. zaufania i bezpieczeństwa sprawiła, że nasze klasyfikatory odzwierciedlały ich rzeczywistą ocenę wiadomości wysokiego ryzyka.


Generowanie odpowiedzi
Główny LLM generuje odpowiedź, jeśli dane wejściowe zostaną uznane za bezpieczne.
W przeciwnym razie wiadomość można zignorować — w przypadku próby obejścia zabezpieczeń — albo przekazać człowiekowi, jeśli zapytanie sygnalizuje zagrożenie.
Klasyfikacja danych wyjściowych
Zanim odpowiedź opuści naszą aplikację i trafi do odbiorcy, klasyfikujemy treść wygenerowaną przez model.
Ponieważ niektóre odpowiedzi mogą powstawać z użyciem technik RAG i danych pobranych z internetu, ten etap chroni nas przed zatruwaniem danych.
Jeśli odpowiedź zawiera niedozwolone treści, system interweniuje i zastępuje ją ogólnym komunikatem. W praktyce zdarza się to rzadko, ale stanowi dodatkową warstwę ostrożności, która pomaga utrzymać odpowiednie zachowanie agenta.
Aby zachować szybkość i przystępne koszty:
Przechowujemy często używane polecenia i fragmenty dialogów wraz z wyselekcjonowanym zestawem kilku przykładów.
Dzięki buforowaniu możemy szybko i tanio stosować klasyfikatory LLM bez konieczności każdorazowego odtwarzania kontekstu.


W niedawnym badaniu firma Anthropic opisała klasyfikatory konstytucyjne — system wykorzystujący dodatkowe klasyfikatory, trenowane według „konstytucyjnych” reguł, aby wykrywać złośliwe lub niebezpieczne żądania. Autorzy odnotowali:
Wysoką odporność na tysiące godzin kontrolowanych ataków prowadzonych przez ludzi.
Minimalny odsetek nadmiernych odmów i umiarkowany narzut obliczeniowy.
W przyszłości takie podejścia konstytucyjne mogą uzupełnić, a nawet zastąpić tradycyjne warstwy klasyfikacyjne, zapewniając pełniejszą ochronę przed stale ewoluującymi metodami obchodzenia zabezpieczeń.
Równoległe, lekkie filtry
Warstwy klasyfikacyjne nie dopuszczają złośliwych zapytań do generatywnego rdzenia systemu i zapobiegają przekazywaniu użytkownikom nieodpowiednich odpowiedzi.
Doświadczenie użytkownika ma znaczenie
Zabawne ostrzeżenia osadzone w świecie gry oraz żartobliwe odmowy sprawiają, że użytkownicy chętniej akceptują ograniczenia systemu.
Nie oszczędzaj na testowaniu i monitorowaniu
Regularne kontrolowane ataki oraz częste monitorowanie zachowań graczy pomagają wykrywać luki, zanim dowie się o nich szersza społeczność. Wnioski z tych działań można następnie wprowadzać do poleceń klasyfikatora z kilkoma przykładami, aby zapobiec wykorzystywaniu takich luk w przyszłości. Obecnie jest to proces ręczny, ale można go zautomatyzować.
Niezależnie od tego, czy reprezentujesz firmę z branży gier, bank czy instytucję państwową, wdrażając chatbota obsługi klienta na dużą skalę, musisz zadbać ZARÓWNO o dobre doświadczenie użytkownika, JAK I o wiarygodność systemu.
Tworzymy rozwiązania skierowane do klientów dla organizacji i marek, dla których:
Bezpieczeństwo jest najważniejsze — chatboty zapewniają użytkownikom wartość, a jednocześnie rygorystycznie chronią ich przed szkodliwymi treściami
Reputacja musi być chroniona — projektujemy wiele warstw zabezpieczeń, które chronią wizerunek marki, nawet gdy użytkownicy próbują przekroczyć granice systemu
Przepisy ograniczają dostępne możliwości — stale śledzimy najnowsze wytyczne dotyczące zgodności, aby umożliwić skalowanie rozwiązań bez obaw o obejście zabezpieczeń aplikacji