W ciągu ostatnich dwóch lat stworzyliśmy rozwiązania, które bezpiecznie skalowaliśmy do milionów użytkowników. Kluczowym elementem tej pracy było projektowanie szybkich i dokładnych systemów moderacji. Skuteczna moderacja pozwala firmom pewnie wdrażać najnowocześniejsze rozwiązania AI, chroniąc użytkowników końcowych przed szkodami i reputację marki dzięki wykrywaniu niepożądanych treści, zanim staną się problemem.
Niedawno OpenAI udostępniło modele GPT-OSS-Safeguard: dostrojone wersje modeli OSS 20B i 120B zaprezentowanych wcześniej w tym roku. Modele te potrafią interpretować zasady użytkownika bezpośrednio podczas wnioskowania, oferując elastyczne i skuteczne podejście do moderacji treści. Modele te są dostępne w ramach wersji badawczej, więc z pewnością będą z czasem udoskonalane.
Przed premierą współpracowaliśmy z OpenAI, przeprowadzając testy w rzeczywistych warunkach, których wyniki wspierały rozwój modeli. W tym artykule przedstawiamy wnioski z tej współpracy i analizujemy, co te postępy oznaczają dla przyszłości moderacji w produkcyjnych systemach AI.
Obecnie rozwiązania moderacyjne mają zazwyczaj postać warstw zabezpieczeń otaczających aplikację. Często stosujemy ten wzorzec we wdrożeniach publicznych obsługujących duży ruch. Więcej szczegółów znajdziesz w naszym wpisie na ten temat.
Klasyfikuj dane wejściowe równolegle (nie przepuszczaj szkodliwych poleceń): Małe klasyfikatory wyspecjalizowane tematycznie działają jednocześnie i oznaczają każdą wiadomość użytkownika. Z naszych obserwacji wynika, że klasyfikatory o wąskim zakresie są wyraźnie bardziej niezawodne niż jeden klasyfikator ogólnego przeznaczenia. Starannie dobrane przykłady w poleceniu — kilka przykładów — mogą pomóc odróżnić „I keep getting killed by this boss” (kontekst gry, całkowicie nieszkodliwy) od sygnału rzeczywistego zagrożenia.
Bezpieczne → generuj normalnie
Obejścia zabezpieczeń → ignoruj lub odpowiedz odmową zgodną z charakterem marki
Zagrożenia dla bezpieczeństwa lub dobrostanu → przekaż człowiekowi wraz z pełnym kontekstem
Klasyfikuj dane wyjściowe (nie wysyłaj szkodliwej odpowiedzi): Każda proponowana odpowiedź jest ponownie sprawdzana przed wysłaniem. Chroni to przed zmianami zachowania modelu, zatruwaniem danych RAG i subtelnymi przypadkami brzegowymi zasad, takimi jak szkodliwe treści, ujawnienie danych osobowych czy wyciek informacji poufnych. Jeśli odpowiedź zostanie oznaczona, zastępujemy treść wygenerowaną przez LLM bezpiecznym komunikatem zgodnym z charakterem marki lub przekazujemy ją człowiekowi, zamiast wysyłać coś, czego później będziemy żałować.
Zadbaj o szybkość i niskie koszty: Tworzenie poleceń z elementów wielokrotnego użytku pozwala buforować fragmenty poleceń, kilka przykładów dla klasyfikatora i typowe początki dialogów. Takie podejście zmniejsza zarówno opóźnienia, jak i koszt mechanizmów zabezpieczających.
Traktuj bezpieczeństwo jako element produktuOdmowy i ostrzeżenia powinny być zgodne ze stylem marki, np. swobodne w grach, a formalne w finansach. Gdy interfejs użytkownika uwzględnia jego intencje, rośnie akceptacja zabezpieczeń, a liczba prób obejścia zabezpieczeń spada.
Monitoruj, przeprowadzaj kontrolowane ataki i zamykaj pętlę informacji zwrotnejCiągłe kontrolowane ataki i bieżące panele bezpieczeństwa pomagają wykrywać regresje, zanim odczują je użytkownicy. Możemy nauczyć model rozpoznawania nowych wzorców ataków, dodając kilka przykładów lub reguły routingu. Dzięki temu system staje się z czasem trudniejszy do złamania bez pogorszenia wydajności aplikacji.
Tworzenie i utrzymywanie skutecznych mechanizmów zabezpieczających jest trudne.
W praktyce wymaga to ścisłej współpracy między najważniejszymi interesariuszami biznesowymi a deweloperami w celu opracowania jasno określonych zasad. Po zdefiniowaniu zasad trzeba zaprojektować system, wdrożyć jego zachowanie i odpowiednio je dostroić.
Pojawienie się otwartych modeli rozumowania ukierunkowanych na bezpieczeństwo, takich jak gpt-oss-safeguard, może rozwiązać niektóre problemy tego procesu, zapewniając bardziej uniwersalną i gotową do użycia podstawę moderacji treści.
Gpt-oss-safeguard ma rozwiązywać niektóre problemy często występujące podczas tworzenia współczesnych systemów moderacji. Te małe, wyspecjalizowane modele dostrojono do analizowania docelowych zasad podczas wnioskowania i wykrywania szkodliwych lub poufnych treści, takich jak obejścia zabezpieczeń, ujawnienie danych osobowych i inne naruszenia zasad.
Włączenie rozumowania do procesu klasyfikacji zapewnia dokładniejszą i odporniejszą moderację, którą trudniej obejść. Jako wyspecjalizowane warianty modeli GPT-OSS 20B i 120B ukierunkowane na bezpieczeństwo zapewniają najnowocześniejszy poziom ochrony, a dzięki niestandardowym definicjom zasad wymagają minimalnej konfiguracji.
Oceniliśmy gpt-oss-safeguard 20B i 120B w kilku zadaniach odpowiadających warunkom produkcyjnym: asystencie głosowym działającym w czasie rzeczywistym, bocie obsługi graczy, proaktywnym systemie moderacji czatu oraz wielojęzycznym wykrywaniu toksyczności (po hiszpańsku, francusku, włosku, portugalsku, rosyjsku i turecku).
Moderacja głosowa wrażliwa na opóźnienia: W testach głosowych w czasie rzeczywistym — czyli klasyfikacji prowadzonej na żywo w rozmowie, w której odpowiedź trzeba przeanalizować i odpowiednio zakwalifikować, jak podczas moderowania czatu w grze — gpt-oss-safeguard-20B zniwelował ok. 80% różnicy dokładności między GPT-OSS-20B a GPT-5-Mini (0,71 wobec 0,78, przy wzroście z 0,45), zachowując znacznie niższe opóźnienia.
Eskalacja w obsłudze graczy: Podczas kwalifikowania zgłoszeń graczy gpt-oss-safeguard-20B zniwelował ok. 90% różnicy między GPT-OSS-20b a GPT-5-Mini (0,66 wobec 0,67, przy wzroście z 0,57). Osiągnął również najlepszą w zestawieniu precyzję makro, 88% czułości dla nieszkodliwych treści i 87% precyzji w wykrywaniu użytkowników wymagających szczególnej ochrony. To przydatne, gdy zależy nam na ostrożnej i wiarygodnej eskalacji bez przeciążania moderatorów.
Moderacja czatu z rozbudowanymi zasadami na dużą skalę: W naszym najbardziej wymagającym teście, w którym system moderacji musiał proaktywnie oznaczać wiadomości w grze zgodnie z obszernym dokumentem zasad, gpt-oss-safeguard wyraźnie przewyższył bazowy model OSS, osiągając względną poprawę o ok. 35% i skutecznie obsługując długie zasady. To szczególnie wrażliwe zastosowanie, które wymaga wysokiej czułości i precyzji. Zbyt niska czułość sprawi, że wiele szkodliwych wiadomości nie zostanie wykrytych. Z kolei niska precyzja spowoduje przekazywanie moderatorom wielu nieistotnych wiadomości i odciągnie ich uwagę od naprawdę trudnych przypadków.
Wydajność wielojęzyczna: W zrównoważonym zbiorze danych dotyczących toksyczności w sześciu językach wyniki gpt-oss-safeguard były zbliżone do GPT-5-Mini — różnica dokładności wynosiła zwykle 3–5 p.p., a gpt-oss-safeguard-120B nieznacznie wyprzedził go w języku hiszpańskim. Nieco większe różnice zaobserwowaliśmy w językach o mniejszych zasobach, takich jak turecki, ale ogólnie wydajność międzyjęzykowa była solidna, a przejście z 20B na 120B zapewniało stały wzrost czułości.
Zaobserwowaliśmy również, że modele gpt-oss-safeguard dobrze radzą sobie w obszarach, w których LLM tradycyjnie słabiej sprawdzają się w moderacji, takich jak dane osobowe. Popularne modele wykazują bowiem tendencję do rozpoznawania głównie danych osobowych w formatach typowych dla USA i osiągają gorsze wyniki w innych regionach. Dlatego uważamy, że gpt-oss-safeguard ułatwi konfigurację moderacji, ograniczając zależność od narzędzi projektowanych na miarę do wykrywania drobnych naruszeń zasad, z którymi szersze LLM sobie nie radzą.
Nasze oceny wykazały, że „bazowe modele moderacji”, takie jak gpt-oss-safeguard-20B i gpt-oss-safeguard-120B, pozwalają szybko osiągnąć bardzo dobre wyniki. Jednak gdy systemy muszą spełniać najwyższe standardy bezpieczeństwa i precyzji, poprzeczkę nadal wyznaczają modele dostrojone pod kątem konkretnej dziedziny.


Na potrzeby moderacji w grze dostroiliśmy klasyfikator Qwen3-0.6B metodą nadzorowanej konfiguracji precyzyjnej, wykorzystując ok. 10 tys. historycznych decyzji moderatorów i wyników stosowania zasad. Ten model znacznie przewyższa wszystkie modele bazowe, które przetestowaliśmy w tym zadaniu: osiągnął dokładność 57% wobec 15% (gpt-oss-safeguard-120B, wartość oszacowana na podstawie stosunku wyników GPT-4.1-nano), czyli poprawę o 42 p.p. i ok. 280%. Wyniki te są zgodne z wytycznymi OpenAI, według których mniejsze, wyspecjalizowane klasyfikatory trenowane na oznaczonych przykładach mogą przewyższać modele zabezpieczające w specjalistycznych dziedzinach.
Wniosek jest jasny: gdy zasady są złożone i obejmują wiele przypadków brzegowych, mały model dostrojony do danej dziedziny pozostaje złotym standardem. Proces dostrajania zapisuje zasady i przypadki brzegowe bezpośrednio w parametrach, zapewniając stabilniejsze działanie w nieprzewidywalnym środowisku produkcyjnym, a przy tym minimalne opóźnienia i koszty.
Nadzorowana konfiguracja precyzyjna to tylko jedno z kilku możliwych podejść. Aby jeszcze lepiej zoptymalizować działanie modelu, można również wykorzystać inne zaawansowane techniki trenowania, takie jak uczenie przez wzmacnianie lub destylacja na podstawie bieżącej polityki.
Dostrajanie zwykle wymaga dużej ilości danych. Zbiór użyty do dostrojenia klasyfikatora Qwen3-0.6B został ręcznie oznaczony przez moderatorów, dlatego stanowił czyste i wiarygodne źródło danych referencyjnych.
W wielu projektach tak bogate dane mogą nie być dostępne na początku. Dlatego dostrajanie traktujemy zwykle jako optymalizację, którą można przeprowadzić na późniejszym etapie rozwoju rozwiązania. Gdy rozwiązanie osiągnie już stabilną postać i zostaną zebrane rzeczywiste dane użytkowników, deweloperzy mogą sięgnąć po ukierunkowane dostrajanie, aby jeszcze bardziej udoskonalić moderację.
Bazowe modele moderacji, takie jak gpt-oss-safeguard, to nowe i solidne elementy składowe. Mogą znacznie uprościć projektowanie systemów moderacji, a jednocześnie ograniczyć opóźnienia w aplikacjach działających w czasie rzeczywistym. Łącząc je z małymi klasyfikatorami projektowanymi na miarę, można stworzyć bezpieczniejszy i szybszy system, który ma mniej elementów niż rozwiązanie oparte na poleceniach i dużych modelach ogólnego przeznaczenia.
Jeśli dziś wdrażasz lub modernizujesz moderację, rozważ rozpoczęcie od modeli takich jak gpt-oss-safeguard. Zmierz ich wydajność, a następnie w obszarach, w których dane ujawnią braki, wprowadź ukierunkowane ulepszenia za pomocą klasyfikatorów projektowanych na miarę — opartych na poleceniach lub dostrojonych.
Chcesz dowiedzieć się więcej? Napisz do nas.