Hindamised: AI-katsetest kindla tootmiskasutuseni

Lugege, kuidas hindamine ületab lõhe AI katsetamise ning töökindla ja tootmisvalmis kasutuselevõtu vahel.

Kokkuvõte juhtidele

  • Kuigi alusmudelid on paranenud, võimaldavad neid kindlalt tootmises kasutada eelkõige süsteemsed hindamistavad.

  • Hästi kavandatud hindamised aitavad tootejuhtidel, AI juhtimise eestvedajatel ja tehnoloogiajuhtidel AI-agente turvaliselt ning laialdaselt kasutusele võtta, muutes AI eraldiseisvast mänguasjast konkurentsieeliseks.

  • Selline kindlus tekib AI-agendi käitumise hindamisest tegelike kasutajapäringute, erandjuhtude ja teie ärikeskkonda kajastavate valdkonnaspetsiifiliste stsenaariumide põhjal, mitte avalikust võrdlustestist, mis kuulutab, et „see mudel on parim“.

  • Eesmärk on seda kindlust mõõdetavate tulemustega põhjendada. Edu tähendab, et "hea" määratletakse konkreetsete ja mõõdetavate näitajatega, mis vastavad teie ärivajadustele ja riskitaluvusele, olgu nendeks faktitäpsus, sobiv toon, kiirus või kulutõhusus.

  • Kui hindamine hõlmab kogu süsteemi (instrumenteerimist, logimist, A/B-testimist ja kaitsemeetmeid) ning põhjalikkus on tõhususega tasakaalus, saavad meeskonnad lahendusi kiiremini ja töökindlamalt kasutusele võtta.

Enamik ettevõtteid on harjunud sellega, et töötajad katsetavad ChatGPT või Geminiga. LLM-ide rakendamine suure panusega töövoogudes või keskkondades on aga märksa vähem levinud.

Selle põhjused on sageli olnud õigustatud: kvaliteet on kõikunud ning hallutsinatsioonide või soovimatu käitumise risk on kaalunud üles tehnoloogia võimaliku kasu.

Riskide ja kasu tasakaal on viimase aastaga märgatavalt muutunud. Osaliselt tuleneb see alusmudelite parematest tulemustest, kuid suuresti ka hindamise ehk „eval’ide“ üha süsteemsemast kasutamisest. Hindamised annavad meile ja meie klientidele kindluse võtta suuremahulised ning kliendisuhtluseks mõeldud agendid kasutusele mõne nädalaga.

Selles juhendis selgitame hindamise aluseid ning seda, kuidas hindamisi tootmiskasutuse jaoks kavandada, rakendada ja hallata.

Hindamise alused (1): milline on edu?

Hindamise eesmärk pole leida täiuslikku mudelit, vaid saavutada põhjendatud kindlus, et mudeli käitumine vastab teie ärivajadustele, kasutajate ootustele ja organisatsiooni riskitaluvusele.

Iga hindamisstrateegia aluseks on lihtne küsimus: milline on „hea“ tulemus? Vastus peaks olema konkreetne. Ühe organisatsiooni jaoks võib „hea“ tähendada range lubatud hälbega faktitäpsust, teise jaoks aga eelkõige kiirust, kulutõhusust või eripärast suhtlusstiili. Seda määratlust kujundavad kõik teie piirangud, alates lubatud andmetest kuni kohalduvate regulatiivsete kohustusteni.

Eriti oluline on, et 'hea' koosneks tegelikult mõõdetavatest osadest. Kui edu tähendab kasulike finantsnõuannete pakkumist, tuleb kasulikkus väljendada omadustena: faktitäpsus, asjakohased lahtiütlused, isikupärastatud arutlus ja turvalised piirid. Kui „hea“ on mõõdetavalt määratletud, tuleb järgmisena otsustada, kuidas tulemusi analüüsida ja tõlgendada. Tulemuste põhjal tegutsemine muudab hindamise pelkade üksikotsuste asemel süsteemseks meetodiks.

Hindamise alused (2): sisendid, mudeli käitumine ja mõõdikud

Iga hindamiskonveier toetub kolmele omavahel seotud sambale:

  1. Sisendid/võrdlustestid: tegelikku kasutust esindavad näited üldise toimivuse hindamiseks ning asutusesiseselt koostatud andmestikud valdkondliku sobivuse kontrollimiseks.

  2. Mudeli käitumine: kuidas mudelit kutsutakse (otsinguga täiendatud genereerimine, kokkuvõtete tegemine, struktureeritud teabe otsing, tööriistade kasutamine).

  3. Mõõdikud: kuidas toimivust mõõdetakse ja tõlgendatakse.

Sisendid peavad esindama maailma, millega teie süsteem kokku puutub. Kõige väärtuslikumad tähelepanekud pärinevad tegelikest näidetest: klientide päringutest, finantsstsenaariumidest või valdkonnaspetsiifilistest juhtumitest. Ainult nende põhjal testides saate teada, kas mudel mõistab tõepoolest kasutajatele olulisi nüansse ja täidab ärivajaduse.

Sama tähtsad kui mudel ise on mudeli käitumist mõjutavad tegurid: milliseid viipasid kasutatakse, kuidas korraldatakse otsingut ja tööriistakasutust ning kuidas kontekst mudelile edastatakse. Kaks identset mudelit võivad olenevalt juurutusviisist käituda väga erinevalt. Seetõttu peab hindamise kavand hõlmama ka seda kihti.

Viimaks tulevad mõõdikud. Numbrid üksi annavad harva tervikpildi, kuid hästi valitud mõõdikud muudavad süsteemi käitumise arusaadavaks. Latentsus, täpsus, ohutus, sidusus, kallutatus, kulu ja kasutajate rahulolu loovad koos mitmemõõtmelise pildi tootmises töötavast süsteemist. Kunst seisneb selliste mõõdikute valimises, mis vastavad projekti või ettevõtte KPI-dele ja toovad esile kasutajatele kõige olulisemad omadused. Lihtsamad mõõdikud on sageli täpsemad ja odavamad, samas kui kehvad mõõdikud võivad meeskondi eksitada. Mõõdikute valimisel tasub lähtuda järgmisest:

Heade mõõdikute näited:

  • Klienditeeninduse juturobot: esimesel kontaktil lahendatud juhtumite osakaal (kas kasutaja probleem lahendati eskaleerimata?), keskmine käsitlusaeg, kasutajate rahulolu hinne, inimagendile eskaleerimise määr

  • Finantsuuringute tööriist: viidete täpsus (nõuetekohaste allikatega väidete osakaal), võrdlusandmete põhjal kontrollitud faktitäpsus, otsingu asjakohasus (kas leiti õiged dokumendid?), valdkonnaekspertide hinnatud arutluse sidusus

  • Koodiloome abiline: süntaksi korrektsus, läbitud testide määr, turvanõrkuste arv, töötava lahenduseni kuluv aeg

Kehvade mõõdikute näited:

  • Kvaliteedi hindamine ainult vastuse pikkuse järgi (pikem ≠ parem)

  • Kiiruse mõõtmine täpsusega seotud kompromisse arvestamata

  • Mudeli enesekindluse skooride jälgimine nende tegeliku õigsuse kontrollita

  • Tuginemine üksnes mudeli sisemisele perpleksusele ilma kasutajakeskse valideerimiseta

Levinud vead mõõdikute kasutamisel:

  • Vastuolulised mõõdikud: kiiruse ja põhjalikkuse samaaegne optimeerimine nendevahelist kompromissi tunnistamata

  • Võrdlustestidele ülesobitamine: testandmestikul saavutatakse 95%, kuid tootmises ebaõnnestutakse, sest tegelikud kasutajad käituvad teisiti

Ühe rangelt reguleeritud finantsteenuste kliendi süvauuringu lahenduses oli täpsus esmatähtis. Koostasime nii ekspertide loodud küsimuste-vastuste andmestikud kui ka tööriistadega genereeritud andmestikud. Nende abil hindasime täpsust ning süsteemi võimet valida õiged tööriistad ja leida õige teave, saades tasakaalustatud ülevaate täpsusest ja arutluse kvaliteedist. Oluline oli mõõta mitut tahku: faktitäpsust (ekspertide kontroll), otsingu kvaliteeti (asjakohaste dokumentide täpsus ja saagis) ning arutluse sidusust (loogilise järgnevuse struktureeritud hindamine).

Millal kasutada nüansirikka kvaliteedi hindamiseks LLM-i kohtunikuna?

LLM kohtunikuna tähendab teise AI-mudeli kasutamist hindajana, asendades inimkontrolli skaleeritava ja automaatse kvaliteedihindamisega. LLM-i kasutatakse kohtunikuna sageli põhjendamatult, kuigi vajaliku täpsuse annaksid lihtsamad mõõdikud. See võib olla kasulik juhul, kui deterministlikud kontrollid ei suuda kvaliteeti tabada, näiteks kui mõõdik on semantiline (kasulikkus, allikapõhisus, arutluse kvaliteet, toon või põhimõtete tõlgendamine) ja deterministlik hindamine pole võimalik. Teil võib vaja minna skaleeritavat tagasisidet paljude viiba- ja mudelivariantide kohta ning selgelt määratletud hindamisjuhendit ja struktureeritud väljundi skeemi. Et see lahendus teie jaoks toimiks, järgige järgmisi samme:

  • Määratlege hindamisjuhendi mõõtmed selgelt: õigsus, allikapõhisus, põhimõtete järgimine, rakendatavus ja toon.

  • Kasutage kohtuniku vastustes struktureeritud väljundeid (JSON-skeemi).

  • Tõrgete analüüsimiseks salvestage nii binaarsed lävendiskoorid kui ka diagnostiline tekst.

  • Kalibreerige kohtuniku väljundeid igas väljalasketsüklis inimeste märgendatud näidete põhjal.

  • Suure panusega valdkondades kasutage kahte kohtunikku või perioodilist konsensuskontrolli.

  • Jälgige aja jooksul kohtuniku nihet ja eriarvamuste määra.

Ärge eksige võrdlustestide rägastikku

Võrdlustesti andmestik on fikseeritud ja hoolikalt koostatud teadaolevate vastustega testnäidete kogum, millega hinnatakse mudeleid järjepidevalt ning võrreldakse eri versioonide tulemusi õiglaselt. Tavaliselt sisaldab see sisendeid (nt kasutajapäringuid), oodatavaid väljundeid või võrdlushinnanguid ning hindamiskriteeriume või -märgendeid. Avalike võrdlustestidega võrreldakse tipptasemel mudelite toimivust. Süsteemi kavandamise alguses võivad need aidata valida sobiva mudelikandidaadi.

Oma süsteemi puhul ei saa neid võrdlusteste siiski kasutada ärikeskkonna toimivuse asendusnäitajana, sest neil on teadaolevaid puudusi:

  • Saastumine: mudelid võivad olla treenitud võrdlustesti andmetel; sama andmestikuga hindamine sarnaneb vastustelehe abil hinde panemisega.

  • Küllastumine: kõik tippmudelid saavutavad juba maksimumskoore, mistõttu paranemine või halvenemine piirdub mõne protsendipunktiga ja jääb sageli testitulemuste loomuliku varieeruvuse piiresse.

  • Kitsas ulatus: võrdlustesti andmed ei kajasta teie tegelikke ülesandeid, sest need on põhjalikult valitud ja puhastatud. Mõne on loonud koguni LLM ning need ei kajasta teie andmete keerukust ega erandjuhte, nagu kirjavead, ebatavalised väljendid või mürased pildid.

Näide: õpilasi abistav AI-matemaatikaõpetaja

Õpilane palub rakenduselt abi tekstülesannete lahendamisel.

Sobiva avaliku võrdlustesti näide: GSM8K (põhikooli matemaatiline arutlus)

  • Valikuline keerukam andmestik: MATH.

Miks see võrdlustest kasulik on?

  • Saate kiiresti võrrelda, milline mudel on üldises matemaatilises arutluses parem.

  • See on hea esmane filter enne põhjalikesse tootehindamistesse investeerimist.

Miks vajate ikkagi oma andmestikku?

Teie rakendusel on nõuded, mida GSM8K ei testi:

  • teie õppekava sõnastus ja teemade järjekord;

  • teie vanuserühmale sobiv selgitamisstiil;

  • mitmeti mõistetavate või rohkete kirjavigadega õpilasküsimuste käsitlemine;

  • põhimõtted (nt millal anda vihjeid ja millal täielikke vastuseid).

Tõhus valideerimine sõltub teie rakendusele kohandatud hindamise võrdlustestide loomisest. Need andmestikud peaksid põhinema tegelikel suhtlustel, tüüpilistel erandjuhtudel ja usutavatel tõrkestsenaariumidel. Uue toote või protsessi rakendamisel võib see olla keeruline ülesanne. Enamasti saab aga andmeid koguda olemasolevast tootest või võimalikult varakult, isegi esialgse testimise käigus. Pärast rakenduse valmimist peaksid need võrdlustestid arenema koos tootega ning muutuma aja jooksul sisukamaks ja esinduslikumaks.

Juhtumiuuring: kohandatud võrdlustesti loomine jaepanganduse abilisele

Panganduse juturobot vastab eelarveid, kulutusi ja tehinguid puudutavatele küsimustele. Avalikud küsimuste-vastuste ja tekstist SQL-i võrdlustestid ei hõlmanud põhilisi pangandusriske, nagu SQL-süst, andmeleke või konteksti säilitamine mitme vestlusvooru jooksul. Lõime kohandatud võrdlustesti, mis jäljendab selle toote agendikonveierit.

Selle koodibaasi kohandatud võrdlustesti osad:

  • vaenuliku testimise komplekt pahatahtlikest viipadest SQL-süsti, isikuandmete eraldamise, viiba ülekirjutamise ja seanssidevahelise lekke testimiseks;

  • ohutuse suhtes nulltolerants: iga SQL-süst, isikuandmete eraldamise katse või seanssidevaheline leke tuleb tagasi lükata;

  • konteksti säilitamise täpsus: ümber sõnastatud päringud peavad säilitama kasutaja kavatsuse ja olemid.

Põhijäreldus: käsitlege võrdlustesti loomist tootefunktsioonina. Praegune täitmiskeskkond tõendab, et läbiv hindamine on ühendatud, kuid testide katvust ja valimite suurust tuleb kasvatada, et need kajastaksid tegelikke pangandusriske, nagu mitme kavatsusega ründed, kaitsemeetmetest möödahiilimine ja kontekstist sõltuvad päringud. Võrdlustest peaks laienema koos uute agentide ja kaitsemeetmetega.

Hindamine õige tasakaalu leidmiseks: soovitud toimivus võimalikult väikese mudeliga

Rakenduspõhise võrdlustesti ja mudeli valiku seos on määrava tähtsusega. Võrdlustest ei näita üksnes seda, kas lahendus töötab, vaid ka seda, milline mudeli suuruse ja järelõppemeetodite kombinatsioon tagab vajaliku toimivuse kõige kulutõhusamalt. Eeltreenitud mudelite kõige võimsamad täiustused („PT“ nimes ChatGPT) ei tulene uuesti treenimisest, vaid "järelõppe" meetoditest.

Need meetodid kujundavad seda, millisele teabele mudel juurde pääseb, kuidas teave on struktureeritud ning kuidas mudelit järeldamisel juhitakse ja orkestreeritakse. Järelõppemeetodid on näiteks:

  • mõttekäiku suunavad viibad ja dünaamiline arvutusressursi jaotamine (keerukamate probleemide üle pikemalt arutlemine);

  • enesekooskõla, mille puhul luuakse mitu väljundit ja valitakse neist parim;

  • konteksti koostamine ja orkestreerimine, näiteks otsinguga täiendatud genereerimine (RAG), väheste näidetega juhendamine ja agentidel põhinevad töövood;

  • tööriistade ja väliste teadmiste kasutamine, mis võimaldab mudelil tegutseda oma siseparameetritest avaramalt;

  • teadmiste esitamise ja talletamise strateegiad, mis võimaldavad struktureeritud ja struktureerimata andmeid tõhusalt otsida ning nende põhjal arutleda.

Kuigi need järelõppemeetodid võivad süsteemi toimivust märgatavalt parandada, kaasnevad nendega ka kompromissid. Iga täiendav orkestreerimis-, otsingu- või arutluskiht suurendab süsteemi keerukust, järeldusaega ja tegevuskulusid. Läbimõeldult rakendatud järelõppemeetodite õige kombinatsioon võimaldab sageli kasutada väiksemaid, kiiremaid ja odavamaid mudeleid, täites siiski toimivusnõuded. Mudeli suurendamise asemel saavutatakse toimivus süsteemi parema kavandamisega.

Õige tasakaal oleneb alati rakendusest ning meetodite optimaalse kombinatsiooni määramisel tuleb tugineda rakenduspõhistele hindamistele. Nende abil leiate punkti, millest alates täiendav orkestreerimine enam olulist kasu ei anna, ning meeskonnad saavad valida sihttaseme saavutamiseks vajaliku minimaalse järelõppe keerukuse.

Liikuge kiiresti, kuid hinnake läbimõeldult

AI-lahendust tuleb käsitleda tervikliku süsteemina, mis hõlmab andmebaase, API-sid, kasutajaliideseid, orkestreerimiskihte, seiretaristut ja muud. Seetõttu peab hindamine hõlmama kogu tehnoloogiapinu. Võimalike probleemide märkamiseks ja vastutustundlikuks kiirendamiseks tuleb jälgida süsteemi põhiosi.

Süsteemi põhiosade jälgimine tähendab järgmist:

  • Konveierite instrumenteerimine mõõdetavate tulemuste saamiseks.

  • Katsete logimine, et näha iga muudatuse mõju.

  • Lihtsate A/B-võrdluste kasutamine enne oluliste muudatuste juurutamist, et tuvastada võimalikku taandarengut.

Andmepõhine iteratsioon lühendab teed prototüübist tootmisse ilma tähelepanuta jäävate nõrkusteta. Logimine ja seire aitavad mõista ka rakenduse tegelikku kasutust. Näide jälgitavuse tagamisest:

  • 1. samm: kasutaja päring saabub väljadega request_id, user_segment, intent.

  • 2. samm: jälg logib mudeli versiooni, viiba versiooni, otsitud dokumendid ja tööriistakutsed.

  • 3. samm: LLM-kohtunik hindab vastust (correctness, groundedness, policy_risk).

  • 4. samm: reeglimootor hindab lävendeid.

  • 5. samm: lävendi ületamisel käivitatakse hoiatus ja suunatakse päring varulahendusele või inimesele kontrollimiseks.

  • 6. samm: tõrge lisatakse esmase hindamise järjekorda ja seejärel võrdlustesti tööjärjekorda.

Langfuse’i jälg tagastuspoliitika abilise kohta, kus on näidatud päringu kulg, otsingu- ja reeglitööriistad, vastuse kvaliteedi hindamine, kvaliteedivärav, hindamise metaandmed ning genereeritud vastus.

Tegelikud kasutajad käituvad harva täpselt nii, nagu kavandajad eeldavad. Mõni neist mõistab juhiseid valesti. Teised uurivad nõrku kohti tahtlikult. Need erandjuhud pole kõrvalekalded, vaid hindamatud signaalid. Hästi rakendatud hindamiskonveier kogub ja analüüsib neid ning lisab need tulevastesse testidesse. Kiire iteratsioon ilma pimealadeta on võimalik vaid siis, kui hindamine on süsteemi algusest peale sisse ehitatud, mitte pärast arendust külge poogitud.

Soovitame kaitsemeetmed ja seire rakendada esimesest päevast alates:

  • Jälgige mudeli mõõdikuid ja taandarenguid korrapäraselt rakenduspõhise võrdlustesti abil.

  • Koguge ja vaadake üle erandjuhud ning vaenulikud sisendid ja lisage need rakenduspõhise võrdlustesti andmestikku.

  • Veenduge, et hindamismõõdikud vastaksid teie peamistele KPI-dele.

  • Kontrollige oma andmestikku ja võrdlustesti korrapäraselt, veendumaks, et uued riskid ei jää tähelepanuta ega teki kallutatust.

  • Rakendage mõõdikute halvenemise kohta automaatsed hoiatused (nt kui täpsus langeb alla 85%, käivitage ülevaatus).

  • Säilitage suure panusega otsuste puhul inimkontroll (õigusnõu, meditsiinilised juhised, finantstehingud).

Hinnake vastutustundlikult: energia, kulu ja nõuetele vastavus

Iga võrdlustesti käitamine kulutab arvutusressurssi ja energiat. Iga üleliigne katse suurendab kulusid. Vastutustundlik hindamine peab tasakaalustama põhjalikkuse ja tõhususe.

Energia- ja kulukasvu ohjamiseks saab astuda järgmisi praktilisi samme:

  • Kasutage võimaluse korral väiksemaid mudeleid: tehke esmased katsed odavamate mudelitega ja minge suurematele üle alles pärast lähenemisviisi valideerimist.

  • Puhverdage viibad ja API-kutsed.

  • Kasutage energiateadlikku ajastamist (pakktöötlus, spot-eksemplarid, paindlik prioriteet).

  • Jälgige arvutusressursi kasutust koos toimivusega.

Samuti jälgige tähelepanelikult kujunevaid AI-õigusakte. Isegi eriseaduse puudumisel kohalduvad olemasolevad raamistikud ja vajalikud meetmed, näiteks:

Andmekaitse:

  • Veenduge, et võrdlustestide andmestikud ei sisaldaks isikuandmeid ilma nõuetekohase nõusolekuta.

  • Rakendage logitud päringutele andmete säilitamise põhimõtted.

  • Pakkuge mehhanisme andmete kustutamise taotluste esitamiseks.

Võrdsus ja kallutatus:

  • Testige toimivust eri demograafilistes rühmades.

  • Tagage võrdlustesti koostamisel eri rühmade mitmekesine esindatus.

Inimõigused ja läbipaistvus:

  • Kirjeldage mudeli piiranguid kasutajatele selgelt.

  • Selgitage suure panusega otsuseid.

  • Võimaldage kriitiliste rakenduste puhul inimjärelevalvet.

Kokkuvõte: hindamisest arenguni

Hindamine pole ühekordne sündmus, vaid arenev süsteem. Kiiresti muutuvas valdkonnas annab eelise võime kiiresti testida, õppida ja kohaneda, et mudeleid ja uusi lahendusi tulemuslikumalt kasutusele võtta.

Kui hindamine on inseneritöö ja tootejuhtimise põhitegevus, saavad meeskonnad uuendada kiiremini ja turvalisemalt. Alustage sellest, et määratlete oma AI-rakenduse kontekstis hea tulemuse, loote hindamisplatvormi ning arendate sellest rakenduspõhise võrdlustesti, mis annab igas iteratsioonis kindluse tootmisvalmiduse suhtes.

Autorid

Fatemeh Tahavori, Romain Bourboulou