Mat: frá tilraunum með gervigreind til öruggs rekstrar

Kynntu þér hvernig mat brúar bilið milli tilrauna með gervigreind og áreiðanlegrar innleiðingar í rekstri.

Samantekt

  • Þótt grunnlíkön hafi batnað er það agi í mati sem hefur raunverulega gert örugga notkun í rekstri mögulega

  • Vel hannað mat hjálpar vörustjórum, ábyrgðaraðilum gervigreindarstjórnunar og tæknistjórum að innleiða gervigreindarfulltrúa á öruggan hátt og í stórum stíl og breyta þannig gervigreind úr einangruðu leikfangi í samkeppnisforskot.

  • Þetta traust fæst með því að meta hegðun gervigreindarfulltrúa gagnvart raunverulegum fyrirspurnum notenda, jaðartilvikum og sértækum aðstæðum á viðkomandi sviði sem endurspegla raunverulegt viðskiptaumhverfi þitt, en ekki með opinberu viðmiði sem segir: „Þetta líkan er best.“

  • Markmiðið er að styðja þetta traust með mælanlegum niðurstöðum. Árangur felst í að skilgreina „gæði“ með skýrum og mælanlegum hætti sem samræmist þörfum fyrirtækisins og áhættuþoli, hvort sem áherslan er á staðreyndanákvæmni, viðeigandi tón, hraða eða kostnaðarhagkvæmni.

  • Með því að flétta mat inn í allt kerfið (mælingar, atvikaskráningu, A/B-prófanir og öryggisvarnir) og gæta jafnvægis milli nákvæmni og skilvirkni geta teymi innleitt hraðar og aukið traustleika.

Flestum fyrirtækjum finnst í lagi að starfsfólk þeirra prófi sig áfram með ChatGPT eða Gemini. Hins vegar er mun sjaldgæfara að LLM séu notuð í vinnuferlum eða umhverfi þar sem mikið er í húfi.

Ástæðurnar hafa oft verið réttmætar: gæðin hafa verið óstöðug og hættan á ranghugmyndum eða óæskilegri hegðun hefur vegið þyngra en mögulegur ávinningur tækninnar.

Jafnvægið milli áhættu og ávinnings hefur breyst verulega á síðasta ári. Að hluta má rekja það til betri frammistöðu grunnlíkana, en agaðri vinnubrögð við mat eiga einnig stóran þátt í breytingunni. Mat veitir okkur og viðskiptavinum okkar traust til að innleiða fulltrúa í stórum stíl og fyrir viðskiptavini á örfáum vikum.

Í þessum leiðarvísi er farið yfir grunnþætti mats og hvernig það er hannað, innleitt og rekið fyrir raunveruleg notkunartilvik.

Undirstöður mats (1): Hvernig lítur árangur út?

Markmið mats er ekki að finna fullkomið líkan heldur að byggja upp rökstutt traust á því að líkanið hagi sér í samræmi við viðskiptaþarfir, væntingar notenda og áhættuþol fyrirtækisins.

Grunnur sérhverrar matsáætlunar er einföld spurning: Hvernig líta „gæði“ út? Svarið ætti að vera skýrt og sértækt. Hjá einu fyrirtæki gætu „gæði“ merkt staðreyndanákvæmni innan þröngra vikmarka; annað gæti lagt meiri áherslu á hraða, kostnaðarhagkvæmni eða einkennandi raddblæ. Allar skorður í starfseminni, allt frá því hvaða gögn má nota til þess hvaða lagaskyldur gilda, móta þessa skilgreiningu.

Mikilvægast er að „gæði“ samanstandi af þáttum sem raunverulega er hægt að mæla. Ef árangur felst í gagnlegri fjármálaráðgjöf þarf að lýsa gagnseminni með eiginleikum á borð við staðreyndanákvæmni, viðeigandi fyrirvara, persónusniðin rök og örugg mörk. Þegar „gæði“ hafa verið skilgreind með mælanlegum hætti er næsta spurning hvernig eigi að greina og túlka niðurstöðurnar. Það er með því að bregðast við niðurstöðunum sem mat verður að aðferð í stað þess að byggjast aðeins á huglægu mati.

Undirstöður mats (2): ílag, hegðun líkans og mælikvarðar

Sérhvert matsferli byggist á þremur samtengdum stoðum:

  1. Ílag/viðmið: Dæmigerð raunveruleg tilvik til að meta almenna frammistöðu og sérvalin innanhússgögn til að prófa notagildi á tilteknu sviði.

  2. Hegðun líkans: Hvernig líkanið er kallað til (leitarbætt myndun, samantekt, skipulögð upplýsingaheimt og verkfæranotkun).

  3. Mælikvarðar: Hvernig frammistaða er mæld og túlkuð.

Ílagið verður að endurspegla þann veruleika sem kerfið mun mæta. Gagnlegasta innsýnin fæst úr raunverulegum dæmum, svo sem fyrirspurnum viðskiptavina, fjárhagsaðstæðum eða sértækum tilvikum úr atvinnugreininni. Aðeins með slíkum prófunum er hægt að sjá hvort líkanið skilur í raun þau blæbrigði sem notendur þurfa og uppfyllir viðskiptaþörfina.

Hegðun líkansins skiptir jafnmiklu máli og líkanið sjálft, svo sem hvernig kvaðningar eru settar fram, hvernig upplýsingaheimt og verkfæranotkun er stýrt og hvernig samhengi er veitt. Tvö eins líkön geta hagað sér mjög ólíkt eftir því hvernig þau eru innleidd. Þetta lag verður því að vera hluti af hönnun matsins.

Að lokum eru það mælikvarðarnir. Tölur segja sjaldnast alla söguna, en vel valdir mælikvarðar gera hegðun kerfisins skiljanlega. Biðtími, nákvæmni, öryggi, samhengi, hlutdrægni, kostnaður og ánægja notenda mynda saman fjölvíða mynd af kerfi í rekstri. Listin felst í að velja mælikvarða sem samræmast lykilárangursvísum verkefnisins eða fyrirtækisins og varpa ljósi á þá eiginleika sem notendur meta mest. Einfaldari mælikvarðar eru oft nákvæmari og ódýrari, en rangt val getur leitt teymi á villigötur. Svona má nálgast val á mælikvörðum:

Dæmi um gott val á mælikvörðum:

  • Þjónustuspjallmenni: Hlutfall mála leyst við fyrstu samskipti (var mál notandans leyst án þess að vísa því áfram?), meðalafgreiðslutími, ánægja notenda og hlutfall mála sem vísað er til mannlegs þjónustufulltrúa

  • Fjármálarannsóknartól: Nákvæmni tilvitnana (hlutfall fullyrðinga með réttum heimildum), staðreyndanákvæmni borin saman við sannreynd gögn, gæði upplýsingaheimtar (fundust réttu skjölin?) og samhengi raka metið af sérfræðingum á sviðinu

  • Aðstoð við kóðagerð: Rétt málskipan, hlutfall staðinna prófana, fjöldi öryggisveikleika og tími þar til virk lausn fæst

Dæmi um slæmt val á mælikvörðum:

  • Að nota eingöngu lengd svars sem staðgengil fyrir gæði (lengra ≠ betra)

  • Að mæla hraða án þess að taka tillit til málamiðlana varðandi nákvæmni

  • Að fylgjast með öryggisstigi líkans án þess að bera það saman við raunverulega rétt svör

  • Að treysta eingöngu á innri óvissumælingu líkans án staðfestingar gagnvart notendum

Algengar gildrur við val mælikvarða:

  • Mælikvarðar sem stangast á: Að hámarka samtímis hraða og ítarleika án þess að viðurkenna málamiðlunina

  • Ofaðlögun að viðmiðum: Að ná 95% á prófunargögnum en bregðast í rekstri vegna þess að raunverulegir notendur haga sér öðruvísi

Hjá einum viðskiptavini í ströngu regluumhverfi fjármálaþjónustu var nákvæmni djúprannsóknarlausnarinnar í fyrirrúmi. Við útbjuggum bæði spurninga- og svaragögn samin af sérfræðingum og gögn mynduð með verkfærum. Þannig gátum við metið nákvæmni, hversu vel kerfið valdi rétt verkfæri og sótti réttar upplýsingar og fengið yfirvegaða mynd af nákvæmni og gæðum raka. Lykillinn var að mæla margar víddir: staðreyndanákvæmni (staðfestingu sérfræðinga), gæði upplýsingaheimtar (precision/recall fyrir viðeigandi skjöl) og samhengi raka (skipulagt mat á röklegri framvindu).

Hvenær nota á LLM sem dómara fyrir blæbrigðarík gæði

Þegar LLM er notað sem dómari metur annað gervigreindarlíkan niðurstöðuna og mannlegt mat víkur fyrir sjálfvirkri gæðagjöf sem má stækka auðveldlega. LLM sem dómari er oft misnotað þegar einfaldari mælikvarðar veita þá nákvæmni sem þarf. Aðferðin getur gagnast þegar fastmótuð próf ná ekki utan um gæði, til dæmis þegar mælikvarðinn er merkingarlegur (gagnsemi, stoð í heimildum, gæði raka, tónn eða túlkun stefnu) og hlutlæg stigagjöf er ekki möguleg. Þú gætir þurft skalanlega endurgjöf fyrir mörg afbrigði kvaðninga og líkana, auk skýrra matsviðmiða og skema fyrir skipulögð úttök. Fylgdu þessum skrefum til að láta aðferðina vinna fyrir þig:

  • Skilgreindu víddir matsviðmiðanna skýrt: réttmæti, stoð í heimildum, samræmi við stefnu, hagnýtt gildi og tón.

  • Notaðu skipulögð úttök (JSON-skema) fyrir svör dómarans.

  • Skráðu bæði tvígild þröskuldsgildi og greiningartexta til að rannsaka bilanir.

  • Kvarðaðu úttök dómarans gagnvart sýnum sem fólk hefur merkt í hverri útgáfulotu.

  • Notaðu tvo dómara eða reglulegar samræmisprófanir á sviðum þar sem mikið er í húfi.

  • Fylgstu með reki dómarans og tíðni ágreinings með tímanum.

Ekki villast í viðmiðunum

Viðmiðunargagnasafn er fast og sérvalið safn prófunardæma með þekktum svörum, notað til að meta líkön með samræmdum hætti og bera niðurstöður sanngjarnt saman milli útgáfa. Það inniheldur yfirleitt ílag (t.d. fyrirspurnir notenda), vænt úttök eða viðmiðunarmat og matsviðmið eða merkingar fyrir stigagjöf. Opinber viðmið eru notuð til að bera saman frammistöðu fremstu líkana og geta veitt gagnlegar fyrstu vísbendingar við kerfishönnun um hvaða líkan henti til notkunar.

Fyrir eigið kerfi er þó ekki hægt að nota þessi viðmið sem staðgengil fyrir frammistöðu í viðskiptaumhverfinu, því þau glíma við þekkt vandamál:

  • Mengun: Líkön kunna að hafa verið þjálfuð á viðmiðunargögnunum; mat á sama gagnasafni getur jafngilt því að gefa einkunn með svindlmiða við höndina.

  • Mettun: Öll fremstu líkön ná þegar hámarkseinkunn. Bati eða afturför takmarkast því við örfá prósentustig og er oft innan eðlilegs breytileika prófunarniðurstaðna.

  • Þröngt umfang: Viðmiðunargögn endurspegla ekki raunveruleg verkefni þín heldur eru vandlega valin og hreinsuð. Sum eru jafnvel mynduð með LLM og endurspegla því ekki flækjustig og jaðartilvik í gögnunum þínum, svo sem innsláttarvillur, óvenjulegt orðalag og truflaðar myndir.

Dæmi: Gervigreindarstærðfræðikennari aðstoðar nemendur

Nemandi biður forritið um hjálp við að leysa textadæmi.

Dæmi um opinbert viðmið sem má nota: GSM8K (rök í grunnskólastærðfræði)

  • Valfrjálst erfiðara safn: MATH.

Hvers vegna þetta viðmið er gagnlegt:

  • Berðu fljótt saman hvaða líkan er betra í almennum stærðfræðilegum rökum,

  • Gott fyrsta síuþrep áður en fjárfest er í heildstæðu vörumati.

Hvers vegna þú þarft samt eigið gagnasafn:

Forritið þitt gerir kröfur sem GSM8K prófar ekki:

  • Orðalag og röð efnisþátta í þinni námskrá,

  • Skýringarstíll sem hentar aldurshópnum,

  • Hvernig meðhöndla á óljósar spurningar nemenda eða spurningar með mörgum innsláttarvillum,

  • Stefnureglur (t.d. hvenær gefa skal vísbendingar í stað fullra svara).

Árangursrík staðfesting byggist á að búa til sértæk matsviðmið fyrir forritið. Þessi gagnasöfn ættu að byggjast á raunverulegum samskiptum, dæmigerðum jaðartilvikum og trúverðugum bilunarmátum. Þetta getur verið erfitt þegar ný vara eða nýtt ferli er innleitt. Í flestum tilvikum er þó hægt að safna gögnum úr fyrirliggjandi vöru eða hefja söfnun eins snemma og unnt er, jafnvel á fyrstu prófunarstigum. Eftir þróun forritsins ættu viðmiðin að þróast með vörunni og verða með tímanum ítarlegri og dæmigerðari.

Tilvikssaga: Sérsniðið viðmið fyrir aðstoðarforrit í viðskiptabanka

Spjallmenni banka svarar spurningum um fjárhagsáætlanir, útgjöld og færslur. Opinber spurninga- og svaraviðmið og text-to-SQL náðu ekki yfir helstu bankaáhættur, svo sem SQL-innspýtingu, gagnaleka eða yfirfærslu samhengis milli samtalslota. Við bjuggum til sérsniðið viðmið sem endurspeglar fulltrúavinnslurás vörunnar.

Hlutar sérsniðna viðmiðsins í þessum kóðagrunni:

  • Rauðliðsprófanir með skaðlegum kvaðningum fyrir SQL-innspýtingu, útdrátt PII, hnekkingu kvaðninga og leka milli samtalslota

  • Ekkert frávik er leyft í öryggi: hafna verður allri SQL-innspýtingu, útdrætti PII og leka milli samtalslota.

  • Nákvæmni í yfirfærslu samhengis: endurskrifaðar fyrirspurnir verða að varðveita ásetning notanda og einingar.

Lærdómur: Líttu á gerð viðmiðs sem eiginleika vörunnar. Núverandi beisli sannar að heildarmat er tengt, en auka þarf umfang og úrtaksstærðir svo þær endurspegli raunverulega bankaáhættu, svo sem árásir með margvíslegum ásetningi, sniðgöngu öryggisvarna og samhengisháðar fyrirspurnir. Viðmiðið ætti að stækka samhliða nýjum fulltrúum og öryggisvörnum.

Mat til að finna rétta jafnvægið: ná tilskildri frammistöðu með minnsta mögulega líkani

Tengsl sértæks viðmiðs forritsins og vals á líkani skipta sköpum. Viðmiðið sýnir ekki aðeins hvort lausn virkar heldur einnig hvaða samsetning af stærð líkans og eftirþjálfunaraðferðum skilar nauðsynlegri frammistöðu með hagkvæmustum hætti. Öflugustu endurbæturnar á forþjálfuðum líkönum („PT“ í ChatGPT) koma ekki frá endurþjálfun heldur aðferðum við „eftirþjálfun“.

Þessar aðferðir snúast um að móta hvaða upplýsingar líkanið fær aðgang að, hvernig þær eru skipulagðar og hvernig líkaninu er leiðbeint og stýrt við ályktun. Eftirþjálfunaraðferðir á borð við:

  • Kvaðningar fyrir hugsanakeðju og kvika úthlutun reikniafls (hugsa meira um erfiðari verkefni)

  • Sjálfssamræmi, þar sem mörg úttök eru mynduð og það besta valið

  • Uppbygging og stýring samhengis, svo sem leitarmögnuð myndun (RAG), fá-skot dæmi og verkferlar fulltrúa

  • Notkun verkfæra og aðgangur að ytri þekkingu sem gerir líkaninu kleift að starfa út fyrir innri stika sína

  • Aðferðir við framsetningu og geymslu þekkingar sem eru hannaðar fyrir skilvirka heimt og rök yfir skipulögðum og óskipulögðum gögnum

Þótt þessar eftirþjálfunaraðferðir geti bætt frammistöðu kerfisins verulega fylgja þeim einnig málamiðlanir. Hvert viðbótarlag stýringar, heimtar eða raka eykur flækjustig kerfisins, ályktunartíma og rekstrarkostnað. Séu þær notaðar af yfirvegun gerir rétt samsetning eftirþjálfunaraðferða þó oft kleift að reiða sig á minni, hraðari og ódýrari líkön án þess að fórna frammistöðukröfum. Í stað þess að stækka líkanið næst frammistaðan með betri kerfishönnun.

Þetta jafnvægi er í eðli sínu sértækt fyrir hvert forrit og ætti að ákvarðast með sértæku mati forritsins til að finna bestu blöndu aðferða. Með því má finna punktinn þar sem frekari stýring skilar ekki lengur marktækum ávinningi og velja minnsta flækjustig eftirþjálfunar sem þarf til að ná markmiðunum.

Farðu hratt, en vandaðu matið

Líta þarf á gervigreindarlausn sem heildstætt kerfi: gagnagrunna, API, notendaviðmót, stýrilög, vöktunarinnviði og fleira. Matið verður því að ná yfir allan tæknistaflann. Vakktu lykilhluta kerfisins til að hafa yfirsýn yfir hugsanleg vandamál og hraða þróun á ábyrgan hátt.

Vöktun lykilhluta kerfisins felur í sér að:

  • Bæta mælitækjum við vinnslurásirnar svo niðurstöður verði mælanlegar.

  • Skrá tilraunir svo sjá megi áhrif hverrar breytingar.

  • Nota einfaldan A/B-samanburð áður en stórar breytingar eru innleiddar til að kanna hugsanlega afturför.

Gagnadrifnar ítranir stytta leiðina frá frumgerð í rekstur án blindra bletta. Skráning og vöktun eru einnig mikilvægar til að skilja raunverulega notkun forritsins. Hér er dæmi um hvernig tryggja má rekjanleika:

  • Skref 1: Beiðni notanda berst með request_id, user_segment, intent.

  • Skref 2: Rakning skráir útgáfu líkans, útgáfu kvaðningar, sótt skjöl og verkfæraköll.

  • Skref 3: LLM-dómari gefur svarinu einkunn (réttmæti, stoð í heimildum, policy_risk).

  • Skref 4: Regluvél metur þröskuldsgildi.

  • Skref 5: Ef farið er yfir þröskuld er viðvörun virkjuð og málinu beint í varaleið eða mannlegt mat.

  • Skref 6: Biluninni er bætt í forgangsröðunarröð og síðan í verklista viðmiðsins.

Langfuse-rakning fyrir aðstoðarforrit um skilastefnu sem sýnir flæði beiðna, upplýsingaheimt og regluverkfæri, mat á gæðum svara, gæðahlið, lýsigögn stigagjafar og myndað svar.

Raunverulegir notendur haga sér sjaldnast nákvæmlega eins og hönnuðir gera ráð fyrir. Sumir misskilja leiðbeiningar. Aðrir leita vísvitandi að veikleikum. Þessi jaðartilvik eru ekki frávik heldur ómetanleg merki. Vel útfært matsferli fangar þau, greinir og nýtir í framtíðarprófunum. Hröð þróun án blindra bletta er aðeins möguleg þegar mat er innbyggt í kerfið en ekki hengt utan á eftir þróun.

Við mælum með að öryggisvarnir og vöktun séu innbyggð frá fyrsta degi:

  • Fylgstu reglulega með mælikvörðum og afturför líkans með sértæku viðmiði forritsins.

  • Skráðu og yfirfarðu jaðartilvik eða fjandsamlegt ílag og bættu því við sértæk viðmiðunargögn forritsins.

  • Tryggðu að þessir matsmælikvarðar samræmist helstu lykilárangursvísum.

  • Reyndu reglulega á gögnin og viðmiðið til að tryggja að ný áhætta sé ekki hunsuð og hlutdrægni hafi ekki áhrif.

  • Settu upp sjálfvirkar viðvaranir þegar mæligildi versna (t.d. skal hefja yfirferð ef nákvæmni fer undir 85%).

  • Viðhaltu mannlegu yfirferðarferli fyrir ákvarðanir þar sem mikið er í húfi (lögfræðiráðgjöf, heilbrigðisráðgjöf og fjármálaviðskipti).

Ábyrgt mat: orka, kostnaður og reglufylgni

Hver keyrsla viðmiðs notar reikniafl og orku. Sérhver óþörf tilraun eykur kostnað. Ábyrgt mat ætti að halda jafnvægi milli nákvæmni og skilvirkni.

Nokkur hagnýt skref geta komið í veg fyrir að orku- og kostnaðarnotkun fari úr böndum:

  • Notaðu minni líkön þegar hægt er, keyrðu fyrstu tilraunir á ódýrari líkönum og stækkaðu aðeins þegar aðferðin hefur verið staðfest.

  • Vistaðu kvaðningar og API-köll í skyndiminni.

  • Skipuleggðu keyrslur með tilliti til orkunotkunar (lotuvinnsla, spot instances, flex priority).

  • Fylgstu með notkun reikniafls samhliða frammistöðu.

Fylgstu jafnframt vel með nýrri löggjöf um gervigreind. Jafnvel þar sem engin sérlög gilda eiga fyrirliggjandi regluverk og nauðsynlegar ráðstafanir enn við, svo sem:

Persónuvernd:

  • Tryggðu að viðmiðunargögn innihaldi ekki persónugreinanlegar upplýsingar (PII) án viðeigandi samþykkis

  • Innleiddu varðveislureglur fyrir skráðar fyrirspurnir

  • Bjóða skal upp á ferli fyrir beiðnir um eyðingu gagna

Jafnrétti og hlutdrægni:

  • Prófaðu frammistöðu þvert á lýðfræðilega hópa

  • Tryggðu fjölbreytta fulltrúa við gerð viðmiðsins

Mannréttindi og gagnsæi:

  • Útskýrðu takmarkanir líkansins skýrt fyrir notendum

  • Veittu skýringar á ákvörðunum þar sem mikið er í húfi

  • Gerðu mannlegt eftirlit mögulegt í mikilvægum forritum

Niðurstaða: frá mati til þróunar

Mat er ekki stakur atburður heldur kerfi sem þróast stöðugt. Á sviði sem breytist hratt felst forskotið í því hversu fljótt þú getur prófað, lært og lagað þig, svo hægt sé að innleiða líkön og nýjar lausnir með meiri árangri.

Með því að gera mat að kjarnaverkefni í verkfræði og vörustjórnun geta teymi nýsköpun hraðar og með meira öryggi. Byrjaðu á að skilgreina hvað telst gott í samhengi gervigreindarforritsins, settu upp matsvettvang og þróaðu hann þannig að þú eignist sértækt viðmið fyrir forritið sem veitir traust á rekstrarhæfni við hverja ítrun.

Höfundar

Fatemeh Tahavori, Romain Bourboulou