Undanfarin tvö ár höfum við byggt lausnir sem hafa vaxið á öruggan hátt og þjóna nú milljónum notenda. Lykilþáttur í þeirri vinnu hefur verið hönnun hraðvirkra og nákvæmra efnisstýringarkerfa. Árangursrík efnisstýring gerir fyrirtækjum kleift að innleiða nýjustu gervigreindarlausnir af öryggi, vernda notendur gegn skaða og tryggja vörumerkjaöryggi með því að stöðva óæskilegt efni áður en það veldur vandræðum.
Nýlega gaf OpenAI út GPT-OSS-Safeguard-líkön sín: fínstilltar útgáfur af 20B- og 120B OSS-líkönunum sem kynnt voru fyrr á árinu. Þessi líkön geta túlkað stefnu notanda beint við keyrslu og bjóða þannig sveigjanlega og öfluga leið til efnisstýringar. Líkönin eru í rannsóknarprófun og munu því án efa halda áfram að batna.
Við unnum með OpenAI fyrir útgáfuna og gerðum raunprófanir sem nýttust við þróun líkansins. Í þessari grein miðlum við því sem við lærðum af samstarfinu og skoðum hvaða áhrif þessar framfarir hafa á framtíð efnisstýringar í gervigreindarkerfum í rekstri.
Efnisstýringarlausnir eru nú yfirleitt byggðar sem mörg verndarlög utan um forritið. Við notum þetta mynstur mikið í opinberum innleiðingum með mikla umferð. Nánari umfjöllun má finna í bloggfærslu okkar um efnið.
Flokkið ílag samhliða (hleypið slæmum kvaðningum ekki inn): Litlir, efnissértækir flokkarar keyra samtímis og merkja hvert notendaskilaboð. Við höfum komist að því að flokkarar með þröngt áherslusvið eru mælanlega áreiðanlegri en einn flokkarari sem á að ná utan um allt. Vandlega valin fá-skot dæmi í kvaðningunni geta hjálpað líkaninu að greina á milli „I keep getting killed by this boss“ (skaðlaust samhengi í leik) og raunverulegra vísbendinga um skaða.
Öruggt → Mynda svar á venjulegan hátt
Eiga við stýrikerfi → Hunsa eða beina frá með höfnun í anda vörumerkisins
Áhætta fyrir öryggi eða vellíðan → Vísa til starfsmanns með ítarlegu samhengi
Flokkið úttak (sendið ekki slæmt svar): Öll möguleg svör eru skimuð aftur áður en þau eru afhent. Þetta verndar gegn reki líkansins, eitrun RAG-gagna og lúmskum jaðartilvikum stefnu, svo sem skaðlegu efni, birtingu persónugreinanlegra upplýsinga eða leka viðkvæmra upplýsinga. Ef svar er merkt skiptum við svari LLM út fyrir örugg skilaboð í samræmi við vörumerkið eða vísum því til starfsmanns, í stað þess að senda eitthvað sem við sjáum eftir.
Tryggið hraða og hagkvæmni: Með því að byggja kvaðningar úr endurnýtanlegum einingum má vista brot úr kvaðningum, fá-skot dæmi flokkaráa og algenga upphafskafla samtala í skyndiminni. Þessi aðferð dregur bæði úr töfum og kostnaði við öryggisvarnirnar.
Lítið á öryggi sem hluta af upplifun vörunnarHafnanir og viðvaranir eru skrifaðar í rödd vörumerkisins, til dæmis leikandi fyrir leiki og formlegar fyrir fjármálaþjónustu. Þegar notendaupplifunin virðir ásetning notandans eykst samþykki á öryggisvörnum og tilraunum til að eiga við stýrikerfi fækkar.
Vöktið, notið rauðteymi og lokið endurgjafarlykkjunniStöðugt rauðteymi og virk öryggismælaborð hjálpa til við að finna afturfarir áður en þær ná til notenda. Við getum kennt líkaninu ný árásarmynstur með fleiri fá-skot dæmum og/eða leiðarreglum. Þannig verður sífellt erfiðara að brjóta kerfið án þess að skerða afköst forritsins.
Það er erfitt að byggja og viðhalda skilvirkum öryggisvörnum.
Í reynd krefst það náins samstarfs milli lykilhagsmunaaðila fyrirtækisins og þróunaraðila til að móta skýra stefnu. Þegar stefnan liggur fyrir þarf síðan að hanna og fínstilla kerfið og hegðun þess.
Tilkoma opinna öryggislíkana með rökum, svo sem gpt-oss-safeguard, gæti leyst suma af helstu hnökrunum í þessu ferli og lagt til fjölhæfari grunn fyrir efnisstýringu sem er tilbúinn til notkunar.
Gpt-oss-safeguard er ætlað að leysa sumar algengar áskoranir við uppbyggingu efnisstýringarkerfa nútímans. Þessi litlu, sérhæfðu líkön eru fínstillt til að beita rökum á tiltekna stefnu við keyrslu og leita að skaðlegu eða viðkvæmu efni, svo sem tilraunum til að eiga við stýrikerfi, birtingu persónugreinanlegra upplýsinga og öðrum stefnubrotum.
Með því að fella rök inn í flokkunarferlið veita þau nákvæmari og traustari efnisstýringu sem er erfiðara að komast fram hjá. Sem sérhæfð öryggisafbrigði af GPT-OSS 20B og 120B bjóða þau öryggisframmistöðu í fremstu röð, en krefjast lítillar uppsetningar þökk sé sérsniðnum stefnuskilgreiningum.
Við mátum gpt-oss-safeguard 20B og 120B í nokkrum verkefnum sem líktust raunverulegu rekstrarumhverfi: rauntíma raddaðstoðarmanni, þjónustuvélmenni fyrir leikmenn, fyrirbyggjandi spjallefnisstýringu og fjöltyngdri skimun fyrir meiðandi efni á spænsku, frönsku, ítölsku, portúgölsku, rússnesku og tyrknesku.
Raddstýring þar sem tafir skipta máli: Í rauntímaprófunum okkar á rödd — þar sem svar er flokkað í lifandi samtali, greint og forgangsraðað, líkt og í spjallefnisstýringu leikja — lokaði gpt-oss-safeguard-20B um 80% af réttnibilinu milli GPT-OSS-20B og GPT-5-Mini (0,71 á móti 0,78, upp úr 0,45), með mun minni töfum.
Vísun leikmannaþjónustu áfram: Við forgangsröðun í leikmannaþjónustu lokaði gpt-oss-safeguard-20B um 90% af bilinu milli GPT-OSS-20b og GPT-5-Mini (0,66 á móti 0,67, upp úr 0,57). Það skilaði einnig bestu makró-hittni hópsins, 88% næmi fyrir skaðlaust efni og 87% hittni við greiningu viðkvæmra notenda. Það nýtist vel þegar óskað er eftir varfærnum og traustum tilvísunum án þess að yfirhlaða mannlega yfirlesara.
Umfangsmikil spjallefnisstýring með flókna stefnu: Í kröfuhörðustu prófun okkar þurfti kerfið að merkja fyrirbyggjandi skilaboð í leik samkvæmt ítarlegu stefnuskjali. Þar stóð gpt-oss-safeguard sig greinilega betur en OSS-grunnviðmiðið, náði um 35% hlutfallslegri bætingu og vann vel úr löngum stefnum. Þetta er sérstaklega viðkvæmt notkunartilvik sem krefst mikils næmis og mikillar hittni. Ef næmið er of lítið fara mörg skaðleg skilaboð fram hjá kerfinu. Lítil hittni myndi jafnframt valda því að mörg óviðkomandi skilaboð væru send mannlegum efnisstjórum og drægju athygli þeirra frá raunverulega erfiðu tilvikunum.
Frammistaða á mörgum tungumálum: Á jöfnu gagnasafni með meiðandi efni á sex tungumálum fylgdi gpt-oss-safeguard GPT-5-Mini vel eftir og var yfirleitt innan 3–5 prósentustiga í réttni. gpt-oss-safeguard-120B hafði örlítið forskot á spænsku. Við sáum örlítið meiri mun á tungumálum með færri gögn, svo sem tyrknesku. Heildarmynstrið sýndi þó trausta frammistöðu þvert á tungumál og næmið jókst stöðugt þegar farið var úr 20B í 120B.
Við sáum einnig að gpt-oss-safeguard-líkönin standa sig vel á sviðum þar sem LLM eiga jafnan erfiðara með efnisstýringu, svo sem persónugreinanlegar upplýsingar. Almenn líkön hallast frekar að því að greina slíkar upplýsingar í bandarísku sniði og standa sig verr á öðrum landsvæðum. Við teljum því að gpt-oss-safeguard geti einfaldað uppsetningu efnisstýringar með því að draga úr þörf fyrir sérsniðin verkfæri sem finna smávægileg stefnubrot sem almennari LLM ráða ekki við.
Mat okkar hefur því sýnt að „grunnlíkön fyrir efnisstýringu“, á borð við gpt-oss-safeguard-20B og gpt-oss-safeguard-120B, skila þér langt á skömmum tíma. Lénasértæk fínstilling setur þó enn viðmiðið þegar kerfi þurfa að uppfylla ítrustu kröfur um öryggi og sértækni.


Fyrir efnisstýringu innan leikja fínstilltum við Qwen3-0.6B-flokkara með stýrðri fínstillingu á um 10 þúsund eldri aðgerðum efnisstjóra og niðurstöðum stefnumats. Þetta líkan stóð sig mun betur í verkefninu en öll grunnlíkönin sem við prófuðum. Það náði 57% réttni á móti 15% hjá gpt-oss-safeguard-120B (áætlað út frá hlutfalli við frammistöðu GPT-4.1-nano), sem er 42 prósentustiga eða um 280% aukning. Þessar niðurstöður samræmast leiðbeiningum OpenAI um að smærri, sérhæfðir flokkarar sem þjálfaðir eru á merktum dæmum geti staðið sig betur en öryggislíkön á sérhæfðum sviðum.
Niðurstaðan er skýr: Þegar stefnur eru blæbrigðaríkar og hafa mörg jaðartilvik er lítið, lénasniðið líkan enn besti kosturinn. Fínstillingin fellir stefnuna og jaðartilvikin beint inn í stika líkansins. Það tryggir stöðugri hegðun í flóknum raunveruleika rekstrarumhverfisins, með örlitlum töfum og kostnaði.
Stýrð fínstilling er aðeins ein af mörgum mögulegum leiðum að þessu marki. Einnig má nýta aðrar öflugar þjálfunaraðferðir, svo sem styrkingarnám eða eimingu eftir virkri stefnu, til að fínstilla hegðun líkansins enn frekar.
Fínstilling krefst yfirleitt mikils gagnamagns. Gagnasafnið sem var notað til að fínstilla þennan Qwen3-0.6B-flokkara hafði verið handmerkt af mannlegum efnisstjórum og var því hreinn og traustur sannleikskvarði.
Í mörgum verkefnum eru slík auðug gögn ekki tiltæk í upphafi. Því lítum við gjarnan á fínstillingu sem hagræðingu sem má innleiða síðar á þróunarferli lausnarinnar. Þegar lausnin hefur tekið á sig stöðuga mynd og raunverulegum notendagögnum hefur verið safnað geta þróunaraðilar nýtt markvissa fínstillingu til að færa efnisstýringarlausnir sínar á næsta stig.
Grunnlíkön fyrir efnisstýringu, eins og gpt-oss-safeguard, eru öflugar nýjar byggingareiningar. Þau geta einfaldað hönnun efnisstýringarkerfa verulega og jafnframt dregið úr töfum í rauntímaforritum. Með því að para þau við litla, sérsniðna flokkera má byggja öruggara og hraðvirkara kerfi með færri hreyfanlegum hlutum en lausn sem byggir á kvaðningum og stórum almennum líkönum.
Ef þú ert að setja upp eða uppfæra efnisstýringu í dag skaltu íhuga að byrja á líkönum á borð við gpt-oss-safeguard, mæla frammistöðuna og bæta síðan markvisst úr gloppum sem gögnin sýna með sérsniðnum flokkurum sem byggja á kvaðningum eða fínstillingu.
Viltu vita meira? Sendu okkur skilaboð.