Öruggir spjallfulltrúar fyrir áhættusaman rekstur

Þegar spjallmenni er búið til sem fulltrúi vörumerkisins þíns nægir ekki að það sé öruggt — það þarf líka að hljóma eins og þið í raun og veru.

Samantekt

  • Forrit sem byggja á stórum mállíkönum (LLM) og eru aðgengileg almenningi geta stefnt orðspori vörumerkja og fjárhag í hættu.

  • Við notum lagskiptar flokkunarsíur til að draga úr skaða af því að eiga við stýrikerfi LLM-lausna og annarri ófyrirséðri hegðun LLM.

  • Við höfum beitt þessu í afkastamiklu framleiðsluforriti sem vinnur úr 40.000 skilaboðum á dag og þeim fer fjölgandi.

Inngangur

Undanfarið ár höfum við unnið með leiðandi leikjaframleiðanda að innleiðingu GenAI-spjallmennis sem svarar um 40.000 skilaboðum á dag frá leikmannahópi sem börn tilheyra meðal annars. Mikilvægt er að finna jafnvægi milli hraða, nákvæmni, öryggis og skemmtunar:

Þegar spjallmenni er búið til sem fulltrúi vörumerkisins þíns nægir ekki að það sé öruggt — það þarf líka að hljóma eins og þið í raun og veru.

Hjá leikjafyrirtæki felst það í að sameina öryggi, skemmtun og áhuga notenda — einkum þegar yngri notendur eiga í hlut.

LLM-líkönin sem nútíma GenAI-forrit byggja á eru mjög sveigjanleg (og nýtast því svo vel við margvísleg verkefni) en eru jafnframt ekki nægilega skorðuð. Því geta þau oft farið út af sporinu og skilað afar fjölbreyttum texta, sem getur að hluta verið óviðeigandi.

Ef LLM er gert aðgengilegt almenningi án milliliða mun það óhjákvæmilega sýna óvænta hegðun og án viðeigandi mótvægisaðgerða er hætta á:

Innsýn í raunverulega áhættu…

Fréttafyrirsagnir um ófyrirséða notkun LLM:

Þessi atvik undirstrika hvers vegna það er ófrávíkjanlegt að byggja upp og viðhalda öryggi í GenAI-kerfum. Þetta á sérstaklega við þegar ung börn eiga í hlut. Fyrirvarar einir og sér nægja ekki — öflugar varnir eru nauðsynlegar til að tryggja að efnið sé viðeigandi.

Aðferð okkar: lagskipt flokkun og skyndiminni kvaðninga

Líkt og í RAG-kerfunum (Retrieval-Augmented Generation) sem við höfum byggt fyrir viðskiptavini nýtum við marga gervigreindaríhluti til að draga úr hættunni á að átt sé við stýrikerfið, án þess að fórna afköstum.

Skýringarmynd af aðferð okkar: lagskiptri flokkun og skyndiminni kvaðninga.

Einfölduð kerfismynd af lausninni okkar

Til að tryggja öryggi kerfisins notum við LLM-flokkara bæði fyrir inntak og úttak:

  1. Flokkun inntaks (keyrð samhliða)

  • Við notuðum Pydantic-skemu ásamt skipulögðum úttökum LLM til að merkja fyrirspurnir notenda (t.d. SAFE, SUSPICIOUS, CHILD_HARM_RISK og VIOLENT). Þetta fól einnig í sér flögg til að greina tilraunir til að eiga við stýrikerfið eða kalla fram óleyfilega hegðun.

  • Margir flokkarar, hver fyrir sitt efni, skiluðu mun betri árangri en einn risastór flokkunarflokkar sem átti að „grípa allt“.

  • Mörg fá-skot dæmi voru lykilatriði til að tryggja að flokkararnir greindu á milli „I keep being killed by this character“ (sem vísar til leiksins) og „I am being hurt by my parent“ (sem bendir til þess að barn sé beitt skaða).

  • Náið samstarf við viðskiptavininn og sérhæfð teymi hans á sviði trausts og öryggis tryggði að flokkararnir endurspegluðu mat þeirra á áhættusömum skilaboðum við raunverulegar aðstæður.

Skýringarmynd af aðferð okkar: lagskiptri flokkun og skyndiminni kvaðninga.

  1. Myndun svars

  • Aðal-LLM-líkanið myndar svar ef inntakið er metið öruggt.

  • Annars má hunsa skilaboðin (ef reynt er að eiga við stýrikerfið) eða vísa þeim til starfsmanns (ef fyrirspurnin gefur til kynna öryggisvandamál).

  1. Flokkun úttaks

  • Áður en svar líkansins fer úr forritinu flokkum við það fyrir endanlega afhendingu.

  • Þar sem sum svörin geta byggst á RAG-aðferðum og gögnum sem safnað er af internetinu verndar þetta skref okkur gegn gagnaeitrun.

  • Ef svarið inniheldur óleyfilegt efni grípur kerfið inn í og skiptir því út fyrir almenn skilaboð. Í reynd hefur þetta sjaldan gerst, en þetta er varúðarlag sem tryggir að hegðun fulltrúans haldist viðeigandi.

Til að viðhalda hraða og hagkvæmni:

  • Við geymum algengar kvaðningar og hluta samtala ásamt völdum fá-skot dæmum.

  • Með þessu skyndiminni getum við beitt LLM-flokkurunum hratt og með litlum tilkostnaði án þess að endurbyggja samhengið í hvert sinn.

Skýringarmynd af aðferð okkar: lagskiptri flokkun og skyndiminni kvaðninga.

Horft til framtíðar: stjórnarskrárflokkarar

Í nýlegri rannsókn Anthropic var stjórnarskrárflokkurum lýst — kerfi sem styðst við viðbótarflokkara, þjálfaða samkvæmt „stjórnarskrárreglum“, til að greina skaðlegar eða óöruggar beiðnir. Niðurstöður þeirra voru:

  • Mikið þol gegn þúsundum klukkustunda af rauðteymi manna.

  • Lágt hlutfall óþarfa synjana og hófleg aukning á reikniálagi.

Við sjáum fyrir okkur að slíkar stjórnarskráraðferðir geti í framtíðinni stutt við hefðbundin flokkunarlög eða jafnvel komið í stað þeirra og þannig veitt víðtækari vörn gegn síbreytilegum aðferðum til að eiga við stýrikerfið.

Samantekt: það sem við höfum lært

  1. Léttar samhliða síur

Flokkunarlög koma í veg fyrir að skaðlegar fyrirspurnir berist nokkurn tíma til myndunarkjarnans og tryggja að léleg úttök séu aldrei afhent.

  1. Upplifun notenda skiptir máli

Með skemmtilegum viðvörunum sem byggja á söguheimi leiksins og leikandi synjunum eru notendur líklegri til að sætta sig við takmarkanir kerfisins.

  1. Ekki spara við prófanir og vöktun

Reglulegt rauðteymi og tíð vöktun á hegðun leikmanna hjálpa til við að finna veikleika áður en hinn almenni leikmannahópur uppgötvar þá. Síðan má færa þá aftur inn í kvaðningar fá-skot flokkaranna til að koma í veg fyrir að þeir verði nýttir síðar. Sem stendur er þetta gert handvirkt en hægt væri að sjálfvirknivæða ferlið.

Örugg og aðlaðandi GenAI-kerfi framtíðarinnar

Hvort sem um er að ræða leikjafyrirtæki, banka eða jafnvel ráðuneyti þarf stórfelld innleiðing spjallmennis í þjónustuveri að miða BÆÐI að góðri notendahönnun og áreiðanleika.

Við byggjum lausnir fyrir stofnanir og vörumerki sem eiga bein samskipti við viðskiptavini og þar sem:

  1. Öryggi er í fyrirrúmi — spjallmennin veita notendum virði en verja þá jafnframt með ströngum hætti gegn skaðlegu efni

  2. Orðsporið er varið — við hönnum mörg varnarlög sem vernda orðspor vörumerkisins, jafnvel þótt notendur reyni að þrýsta kerfinu út fyrir mörk þess

  3. Regluverk takmarkar valkostina — við fylgjumst með nýjustu leiðbeiningum um reglufylgni svo hægt sé að stækka lausnir án þess að óttast að átt verði við stýrikerfi forritsins

Höfundur

Andrew Liubinas