Navigare principală

Ce înseamnă modelele gpt-oss-safeguard de la OpenAI pentru siguranța AI

Evaluarea inițială a modelelor gpt-oss-safeguard de la OpenAI arată cum modelele specializate de siguranță pot consolida sistemele AI de producție.

În ultimii doi ani, am creat soluții care s-au extins în siguranță la milioane de utilizatori. O parte esențială a acestei activități a fost proiectarea unor sisteme de moderare rapide și precise. Moderarea eficientă le permite companiilor să implementeze cu încredere soluții AI de ultimă generație, protejând utilizatorii finali și reputația mărcii prin detectarea generărilor nedorite înainte ca acestea să devină o problemă.

Recent, OpenAI și-a lansat modelele GPT-OSS-Safeguard: versiuni ajustate fin ale modelelor OSS 20B și 120B prezentate la începutul acestui an. Aceste modele pot interpreta politica utilizatorului direct în momentul inferenței, oferind o abordare flexibilă și performantă a moderării conținutului. Aceste modele sunt disponibile în versiune preliminară pentru cercetare, deci, fără îndoială, vor continua să se îmbunătățească.

Am colaborat cu OpenAI înaintea acestei lansări, efectuând evaluări în condiții reale pentru a contribui la dezvoltarea modelului. În acest articol, prezentăm concluziile colaborării și analizăm ce înseamnă aceste progrese pentru viitorul moderării în sistemele AI de producție.

Cum funcționează astăzi moderarea în producție?

În prezent, soluțiile de moderare sunt construite de obicei ca straturi de protecție în jurul aplicației. Folosim frecvent acest model de proiectare în implementări publice cu volum mare. Pentru mai multe detalii, consultați articolul nostru pe această temă aici.

  1. Clasificați intrările în paralel (nu permiteți solicitărilor periculoase să intre): Clasificatoare mici, dedicate anumitor subiecte, rulează simultan pentru a eticheta fiecare mesaj al utilizatorului. Am constatat că clasificatoarele cu obiectiv restrâns sunt vizibil mai fiabile decât unul singur, universal. Exemplele cu câteva exemple, alese atent în solicitare, pot ajuta la diferențierea dintre „I keep getting killed by this boss” (context de joc, complet inofensiv) și un semnal real de pericol.

    • Sigur → Generare normală

    • Jailbreak → Ignorare sau redirecționare printr-un refuz în tonul mărcii

    • Riscuri privind siguranța sau starea de bine → escaladare către un operator uman, cu un context detaliat

  2. Clasificați ieșirile (nu livrați un răspuns necorespunzător): Fiecare răspuns posibil este verificat din nou înainte de livrare. Astfel, sistemul este protejat împotriva derivei modelului, a contaminării datelor RAG și a cazurilor-limită subtile ale politicii, precum conținutul nociv, expunerea datelor cu caracter personal sau divulgarea informațiilor sensibile. Dacă este semnalat, înlocuim răspunsul generat de LLM cu un mesaj sigur și compatibil cu marca sau îl escaladăm către un operator uman, în loc să livrăm ceva ce am putea regreta.

  3. Asigurați rapiditate și costuri reduse: Construirea solicitărilor din componente reutilizabile permite stocarea în cache a fragmentelor de solicitări, a exemplelor cu câteva exemple pentru clasificatoare și a prefixelor uzuale de dialog. Această abordare reduce atât latența, cât și costul mecanismelor de protecție.

  4. Tratați siguranța ca parte a produsuluiRefuzurile și avertismentele sunt formulate în stilul mărcii (de exemplu, jucăuș pentru jocuri și formal pentru finanțe). Când experiența de utilizare respectă intenția utilizatorului, acceptarea mecanismelor de protecție crește, iar tentativele de jailbreak scad.

  5. Monitorizați, efectuați red teaming și închideți buclaActivitățile continue de red teaming și panourile de monitorizare în timp real a siguranței ajută la detectarea regresiilor înainte ca acestea să afecteze utilizatorii. Putem învăța modelul să recunoască orice tipar nou de atac, furnizând exemple suplimentare cu câteva exemple și/sau reguli de rutare, astfel încât sistemul să devină tot mai greu de compromis fără a afecta performanța aplicației.

Provocările actuale ale construirii unei soluții de moderare

Construirea și întreținerea unor mecanisme de protecție eficiente sunt dificile.

În practică, este necesară o colaborare atentă între principalele părți interesate din companie și dezvoltatori, pentru a defini clar politica. După definirea politicii, trebuie proiectat sistemul, iar comportamentul acestuia trebuie construit și ajustat.

Apariția modelelor deschise de raţionament pentru siguranță, precum gpt-oss-safeguard, poate elimina unele dificultăți ale acestui proces, oferind o bază mai versatilă și gata de utilizare pentru moderarea conținutului.

Potențialul modelelor specializate de siguranță

Gpt-oss-safeguard își propune să rezolve unele dintre problemele întâlnite frecvent la construirea sistemelor actuale de moderare. Aceste modele mici și specializate sunt ajustate fin pentru a analiza o politică țintă în momentul inferenței, identificând conținutul nociv sau sensibil, precum tentativele de jailbreak, expunerea datelor cu caracter personal și alte încălcări ale politicii.

Prin integrarea raţionamentului în procesul de clasificare, acestea oferă o moderare mai precisă și mai robustă, mai greu de eludat. Fiind variante specializate pentru siguranță ale GPT-OSS 20B și 120B, acestea oferă performanțe de ultimă generație în materie de siguranță, necesitând doar o configurare minimă prin definirea unor politici personalizate.

Ce am testat

Am evaluat gpt-oss-safeguard 20B și 120B în mai multe sarcini similare celor din producție: un asistent vocal în timp real, un bot de asistență pentru jucători, un sistem proactiv de moderare a conversațiilor și o analiză multilingvă a toxicității (spaniolă, franceză, italiană, portugheză, rusă și turcă).

Ce am constatat

  • Moderare vocală sensibilă la latență: În testele noastre vocale în timp real (clasificare în direct în cadrul unei conversații, unde un răspuns trebuie analizat și prioritizat, ca în moderarea conversațiilor din jocuri), gpt-oss-safeguard-20B a eliminat aproximativ 80% din diferența de acuratețe dintre GPT-OSS-20B și GPT-5-Mini (0,71 față de 0,78, în creștere de la 0,45), cu o latență mult mai mică.

  • Escaladarea solicitărilor de asistență pentru jucători: În prioritizarea solicitărilor de asistență pentru jucători, gpt-oss-safeguard-20B a eliminat aproximativ 90% din diferența dintre GPT-OSS-20b și GPT-5-Mini (0,66 față de 0,67, în creștere de la 0,57). De asemenea, a obținut cea mai bună precizie macro din grup, o rată de detectare de 88% pentru conținutul benign și o precizie de 87% la identificarea utilizatorilor vulnerabili, rezultate utile pentru escaladări prudente și fiabile, fără a-i copleși pe evaluatorii umani.

  • Moderarea la scară a conversațiilor pe baza unor politici complexe: În cea mai solicitantă evaluare, care impune unui sistem de moderare să semnaleze proactiv mesajele din joc conform unui document de politică detaliat, gpt-oss-safeguard a depășit clar nivelul de referință OSS, obținând o creștere relativă de aproximativ 35% și gestionând eficient politicile lungi. Acesta este un caz de utilizare deosebit de sensibil, care necesită o rată de detectare și o precizie ridicate. Dacă rata de detectare este prea mică, multe mesaje nocive nu vor fi identificate. Iar o precizie scăzută ar duce la semnalarea multor mesaje irelevante către moderatorii umani, distrăgându-le atenția de la cazurile cu adevărat dificile.

  • Performanță multilingvă: Pe un set de date echilibrat privind toxicitatea în șase limbi, gpt-oss-safeguard a obținut rezultate apropiate de GPT-5-Mini, de regulă la o diferență de 3–5 puncte procentuale de acuratețe, iar gpt-oss-safeguard-120B l-a depășit ușor în spaniolă. Am observat diferențe ceva mai mari în limbile cu mai puține resurse, precum turca, însă performanța generală a fost solidă între limbi, iar rata de detectare a crescut constant la trecerea de la 20B la 120B.

Am observat și că modelele gpt-oss-safeguard obțin rezultate bune în domenii în care LLM-urile sunt în mod tradițional mai slabe la moderare, precum datele cu caracter personal. Modelele convenționale tind să favorizeze identificarea formatelor specifice SUA și au performanțe mai slabe în alte regiuni. Prin urmare, considerăm că gpt-oss-safeguard va simplifica configurarea moderării, reducând dependența de instrumente personalizate pentru detectarea încălcărilor minore ale politicilor pe care LLM-urile mai generale nu le pot gestiona.

Avantajele ajustării fine țintite

Așadar, evaluările noastre au demonstrat că „modelele de bază pentru moderare”, precum gpt-oss-safeguard-20B și gpt-oss-safeguard-120B, vă permit să obțineți rapid rezultate foarte bune. Totuși, modelele ajustate fin pentru un anumit domeniu rămân etalonul atunci când sistemele trebuie să îndeplinească cele mai înalte standarde de siguranță și precizie.

Captură de ecran care ilustrează avantajele ajustării fine țintite.

Pentru moderarea din joc, am ajustat fin un clasificator Qwen3-0.6B prin reglare fină supervizată, folosind aproximativ 10.000 de acțiuni istorice ale moderatorilor și rezultatele aplicării politicilor. Acest model depășește cu mult toate modelele de bază testate pentru această sarcină, atingând o acuratețe de 57% față de 15% (gpt-oss-safeguard-120B, estimare bazată pe raportul performanței GPT-4.1-nano), adică +42 de puncte și o creștere de aproximativ 280%. Aceste rezultate confirmă recomandările OpenAI potrivit cărora clasificatoarele mai mici, dedicate și antrenate pe exemple etichetate pot depăși modelele de protecție în domenii specializate.

Concluzia este clară: când politicile sunt nuanțate și includ numeroase cazuri-limită, un model mic, adaptat domeniului, rămâne standardul de referință. Procesul de ajustare fină integrează direct politica și cazurile-limită în parametri, asigurând un comportament mai consecvent în mediul imprevizibil de producție, cu latență și costuri minime.

Reglarea fină supervizată este doar una dintre metodele posibile. Se pot folosi și alte tehnici performante de antrenare, precum învățarea prin consolidare sau distilarea conform politicii, pentru a optimiza și mai mult comportamentul modelului.

Dezavantajul ajustării fine

Ajustarea fină necesită, de regulă, un volum mare de date. Setul de date folosit pentru ajustarea fină a acestui clasificator Qwen3-0.6B fusese etichetat manual de moderatori umani și reprezenta, prin urmare, o sursă de referință curată și foarte fiabilă.

În multe proiecte, acest avantaj al datelor bogate poate să nu existe de la început. De aceea, considerăm de obicei ajustarea fină drept o optimizare care poate interveni mai târziu în ciclul de dezvoltare al unei soluții. După ce structura soluției s-a stabilizat și au fost colectate date reale de la utilizatori, dezvoltatorii pot apela la ajustarea fină țintită pentru a-și îmbunătăți și mai mult soluțiile de moderare.

Concluzii

Modelele de bază pentru moderare, precum gpt-oss-safeguard, sunt componente noi și performante. Acestea pot simplifica semnificativ proiectarea sistemelor de moderare și pot reduce latența aplicațiilor în timp real. Combinate cu clasificatoare mici și personalizate, permit construirea unui sistem mai sigur și mai rapid, cu mai puține componente decât o abordare bazată pe solicitări și modele generale mari.

Dacă implementați sau modernizați astăzi un sistem de moderare, începeți cu modele precum gpt-oss-safeguard, măsurați performanța și adăugați îmbunătățiri țintite, folosind clasificatoare personalizate (bazate pe solicitări sau ajustate fin) acolo unde datele indică lacune.

Doriți să aflați mai multe? Trimiteți-ne un mesaj.

Autor

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke