Galvenā navigācija

Novērtējumi: no MI eksperimentiem līdz pārliecinošai ieviešanai produkcijā

Uzziniet, kā vērtēšana novērš plaisu starp MI eksperimentiem un uzticamu, produkcijai gatavu ieviešanu.

Kopsavilkums vadībai

  • Lai gan pamatmodeļi ir pilnveidojušies, patiesās pārmaiņas, kas ļauj tos pārliecinoši izmantot produkcijā, rada disciplinēta vērtēšanas prakse

  • Labi izstrādāti novērtējumi palīdz produktu vadītājiem, MI pārvaldības vadītājiem un tehnoloģiju direktoriem droši un plašā mērogā ieviest MI aģentus, pārvēršot MI no izolētas rotaļlietas par konkurences priekšrocību.

  • Šo pārliecību rada MI aģentu darbības vērtēšana, izmantojot reālus lietotāju vaicājumus, robežgadījumus un konkrētās nozares scenārijus, kas atspoguļo jūsu faktisko uzņēmējdarbības kontekstu, nevis publisks etalontests, kas apgalvo: „Šis modelis ir vislabākais.”

  • Mērķis ir pamatot šo pārliecību ar izmērāmiem rezultātiem. Panākumi nozīmē konkrēti un izmērāmi definēt, kas ir "labi", atbilstoši uzņēmuma vajadzībām un pieļaujamajam riskam — vai tā būtu faktu precizitāte, atbilstošs tonis, ātrums vai izmaksu efektivitāte.

  • Iekļaujot vērtēšanu visā sistēmā (instrumentācijā, žurnālfailos, A/B testēšanā un aizsargmehānismos) un līdzsvarojot rūpību ar efektivitāti, komandas varēs ātrāk un uzticamāk veikt ieviešanu.

Vairums uzņēmumu neiebilst, ja darbinieki eksperimentē ar ChatGPT vai Gemini. Taču LVM izmantošana darbplūsmās vai vidēs, kur likmes ir augstas, joprojām ir daudz retāka.

Tam bieži ir bijuši pamatoti iemesli: kvalitāte nav bijusi konsekventa, un halucināciju vai nevēlamas rīcības risks ir atsvēris tehnoloģijas iespējamos ieguvumus.

Pēdējā gada laikā šis risku un ieguvumu līdzsvars ir būtiski mainījies. Daļēji to var skaidrot ar pamatmodeļu veiktspējas uzlabojumiem, taču lielā mērā tas saistīts ar arvien disciplinētāku vērtēšanu jeb „evals”. Novērtējumi sniedz mums un mūsu klientiem pārliecību, ka plaša mēroga un klientiem paredzētus aģentus var ieviest dažu nedēļu laikā.

Šajā rokasgrāmatā izskaidroti vērtēšanas pamatelementi, to izstrāde, ieviešana un izmantošana produkcijas lietojumos.

Vērtēšanas pamati (1): kā izskatās panākumi?

Vērtēšanas mērķis nav atrast perfektu modeli, bet gan gūt pamatotu pārliecību, ka modelis darbojas atbilstoši uzņēmuma vajadzībām, lietotāju gaidām un organizācijas pieļaujamajam riskam.

Ikvienas vērtēšanas stratēģijas pamatā ir vienkāršs jautājums: Ko nozīmē „labi”? Atbildei jābūt konkrētai. Vienai organizācijai „labi” var nozīmēt faktu precizitāti stingri noteiktās robežās, bet cita var dot priekšroku ātrumam, izmaksu efektivitātei vai atšķirīgam saziņas tonim. Šo definīciju veido visi ierobežojumi, kuros strādājat, — no izmantojamajiem datiem līdz piemērojamajiem normatīvajiem pienākumiem.

Būtiski, lai jēdzienam 'labi' būtu faktiski izmērāmi elementi. Ja panākumi nozīmē noderīgu finanšu ieteikumu sniegšanu, noderīgums jāizsaka ar konkrētām īpašībām: faktu pareizību, atbilstošām atrunām, personalizētu spriestspēju un drošām robežām. Kad jēdziens „labi” ir definēts izmērāmi, nākamais jautājums ir, kā analizēsiet un interpretēsiet rezultātus. Tieši rīcība, pamatojoties uz šiem rezultātiem, pārvērš vērtēšanu par metodi, nevis vienkāršu subjektīvu spriedumu izteikšanu.

Vērtēšanas pamati (2): ievaddati, modeļa darbība un metrikas

Ikviens vērtēšanas konveijers balstās uz trim savstarpēji saistītiem pīlāriem:

  1. Ievaddati/etalontesti: reprezentatīvi reālās pasaules piemēri vispārējās veiktspējas noteikšanai un rūpīgi atlasītas iekšējās datu kopas piemērotības pārbaudei konkrētajā nozarē.

  2. Modeļa darbība: veids, kā modelis tiek izsaukts (izguves papildināta ģenerēšana, apkopošana, strukturētas informācijas izgūšana, rīku izmantošana).

  3. Metrikas: veids, kā mērāt un interpretējat veiktspēju.

Ievaddatiem jāatspoguļo pasaule, ar kuru sastapsies jūsu sistēma. Visvērtīgākās atziņas sniedz reāli piemēri: klientu vaicājumi, finanšu scenāriji vai nozarei raksturīgi gadījumi. Tikai testējot ar šādiem piemēriem, varat saprast, vai modelis patiesi uztver lietotājiem vajadzīgās nianses un apmierina uzņēmuma vajadzības.

Modeļa darbība — tas, kā tam tiek dota uzvedne, kā tiek koordinēta izguve vai rīku izmantošana un kā tiek padots konteksts, — ir tikpat svarīga kā pats modelis. Divi identiski modeļi atkarībā no ieviešanas veida var darboties ļoti atšķirīgi. Tāpēc šis slānis jāiekļauj vērtēšanas risinājuma izstrādē.

Visbeidzot — metrikas. Skaitļi vien reti atklāj visu ainu, taču labi izvēlētas metrikas ļauj interpretēt sistēmas darbību. Latentums, precizitāte, drošība, saskaņotība, neobjektivitāte, izmaksas un lietotāju apmierinātība kopā veido daudzdimensionālu priekšstatu par sistēmu produkcijā. Prasme ir izvēlēties metrikas, kas atbilst projekta vai uzņēmuma galvenajiem veiktspējas rādītājiem un izgaismo lietotājiem vissvarīgākās īpašības. Vienkāršākas metrikas bieži ir precīzākas un lētākas, savukārt neveiksmīgi izvēlētas metrikas var maldināt komandas. Izvēloties metrikas, ņemiet vērā tālāk norādīto.

Labi izvēlētu metriku piemēri:

  • Klientu apkalpošanas tērzēšanas robots: atrisināšanas īpatsvars pirmajā saziņas reizē (vai lietotāja problēma tika atrisināta bez eskalācijas?), vidējais apstrādes laiks, lietotāju apmierinātības vērtējums, cilvēkiem aģentiem eskalēto gadījumu īpatsvars

  • Finanšu izpētes rīks: atsauču precizitāte (% apgalvojumu ar atbilstošiem avotiem), pret pamatpatiesību pārbaudīta faktu precizitāte, izguves atbilstība (vai tika atrasti pareizie dokumenti?), nozares ekspertu vērtēta spriestspējas saskaņotība

  • Koda ģenerēšanas palīgs: sintakses pareizība, sekmīgi izpildīto testu īpatsvars, drošības ievainojamību skaits, laiks līdz darbspējīgam risinājumam

Neveiksmīgi izvēlētu metriku piemēri:

  • Tikai atbildes garuma izmantošana par kvalitātes rādītāju (garāks ≠ labāks)

  • Ātruma mērīšana, neņemot vērā kompromisus precizitātes ziņā

  • Modeļa pārliecības rādītāju uzraudzība, nepārbaudot tos pret faktisko pareizību

  • Paļaušanās tikai uz modeļa iekšējo perplexity rādītāju bez validācijas lietotāju vidē

Bieži sastopamas metriku kļūdas, no kurām jāizvairās:

  • Pretrunīgas metrikas: vienlaicīga ātruma un visaptverošuma optimizēšana, neatzīstot nepieciešamo kompromisu

  • Pārmērīga pielāgošanās etalontestiem: 95% rezultāts testa datu kopā, bet neveiksme produkcijā, jo reālie lietotāji rīkojas citādi

Kādam stingri regulētam finanšu pakalpojumu klientam vissvarīgākā bija dziļās izpētes risinājuma precizitāte. Mēs izveidojām gan ekspertu izstrādātas jautājumu un atbilžu datu kopas, gan rīku ģenerētas datu kopas. Tās ļāva novērtēt precizitāti, sistēmas spēju izvēlēties pareizos rīkus un izgūt pareizo informāciju, sniedzot līdzsvarotu skatījumu uz precizitāti un spriestspējas kvalitāti. Galvenais bija mērīt vairākas dimensijas: faktu precizitāti (ekspertu validācija), izguves kvalitāti (attiecīgo dokumentu precizitāte un aptvērums) un spriestspējas saskaņotību (loģiskās gaitas strukturēts vērtējums).

Kad niansētas kvalitātes vērtēšanai izmantot LVM kā vērtētāju

Izmantojot LVM kā vērtētāju, otrs MI modelis veic vērtēšanu, aizstājot cilvēku pārbaudi ar mērogojamu, automatizētu kvalitātes novērtēšanu. LVM kā vērtētāju bieži izmanto nevietā, lai gan vajadzīgo precizitāti var nodrošināt vienkāršākas metrikas. Tas var noderēt, ja deterministiskas pārbaudes nespēj noteikt kvalitāti, piemēram, ja metrika ir semantiska (noderīgums, pamatotība, spriestspējas kvalitāte, tonis, politiku interpretācija) un deterministiska vērtēšana nav iespējama. Iespējams, vajadzēs mērogojamu atgriezenisko saiti par daudziem uzvedņu un modeļu variantiem, kā arī skaidri definētu rubriku un strukturēto rezultātu shēmu. Lai tas darbotos jūsu vajadzībām, izpildiet šīs darbības:

  • Skaidri definējiet rubrikas dimensijas: pareizību, pamatotību, atbilstību politikām, praktisko izmantojamību un toni.

  • Vērtētāja atbildēm izmantojiet strukturētos rezultātus (JSON shēmu).

  • Kļūmju analīzei saglabājiet gan bināros sliekšņa vērtējumus, gan diagnostikas tekstu.

  • Katrā laidiena ciklā kalibrējiet vērtētāja rezultātus pret cilvēku marķētiem paraugiem.

  • Augsta riska jomās izmantojiet divus vērtētājus vai periodiskas vienprātības pārbaudes.

  • Laika gaitā uzraugiet vērtētāja novirzes un domstarpību īpatsvaru.

Neapmaldieties etalontestos

Etalontesta datu kopa ir fiksēts, rūpīgi atlasīts testa piemēru kopums ar zināmām atbildēm, ko izmanto konsekventai modeļu vērtēšanai un godīgai dažādu versiju rezultātu salīdzināšanai. Tajā parasti ietverti ievaddati (piemēram, lietotāju vaicājumi), paredzamie rezultāti vai atsauces spriedumi un vērtēšanas kritēriji/etiķetes punktu piešķiršanai. Publiskos etalontestus izmanto modernāko modeļu veiktspējas salīdzināšanai. Tie var noderēt kā sākotnējs orientieris, izstrādājot sistēmu un izvēloties potenciāli piemērotu modeli.

Tomēr savas sistēmas veiktspēju uzņēmuma kontekstā nedrīkst noteikt tikai pēc šiem etalontestiem, jo tiem ir zināmas problēmas:

  • Piesārņojums: modeļi var būt apmācīti ar etalontesta datiem; vērtēšana ar to pašu datu kopu līdzinās atzīmes izlikšanai, izmantojot špikeri.

  • Piesātinājums: visi vadošie modeļi jau sasniedz maksimālus rezultātus, tāpēc veiktspējas uzlabojums vai pasliktinājums aprobežojas ar dažiem procentpunktiem un bieži ietilpst testa rezultātu dabiskās svārstības robežās.

  • Šaurs tvērums: etalontestu dati neatspoguļo jūsu faktiskos uzdevumus, jo tie ir rūpīgi atlasīti un attīrīti. Dažus pat ģenerē LVM, tāpēc tie neatspoguļo jūsu datos sastopamo sarežģītību un robežgadījumus (drukas kļūdas, neparastus izteicienus, trokšņainus attēlus).

Piemērs: MI matemātikas skolotājs palīdz skolēniem

Skolēns lūdz lietojumprogrammai palīdzēt atrisināt teksta uzdevumus.

Izmantojama publiska etalontesta piemērs: GSM8K (pamatskolas matemātiskā spriestspēja)

  • Papildu sarežģītāka datu kopa: MATH.

Kāpēc šis etalontests ir noderīgs:

  • Var ātri salīdzināt, kuram modelim ir labāka vispārējā matemātiskā spriestspēja,

  • Labs pirmais filtrs pirms ieguldījumiem pilnvērtīgā produkta vērtēšanā.

Kāpēc tomēr vajadzīga sava datu kopa:

Jūsu lietotnei ir prasības, kuras GSM8K nepārbauda:

  • Jūsu mācību programmas formulējumi un tēmu secība,

  • Jūsu vecuma grupai piemērots skaidrojumu stils,

  • Neskaidru vai drukas kļūdām bagātu skolēnu jautājumu apstrāde,

  • Politikas noteikumi (piemēram, kad sniegt mājienus un kad — pilnas atbildes).

Efektīvas validācijas pamatā ir jūsu lietojumam specifisku vērtēšanas etalontestu izveide. Šajās datu kopās jāietver reāla mijiedarbība, tipiski robežgadījumi un ticami kļūmju scenāriji. Ieviešot jaunu produktu vai procesu, tas var būt grūts uzdevums. Tomēr vairumā gadījumu datus var iegūt no esoša produkta vai sākt vākt pēc iespējas agrāk, pat sākotnējās testēšanas posmā. Pēc lietojumprogrammas izstrādes šiem etalontestiem jāattīstās kopā ar produktu, laika gaitā kļūstot daudzpusīgākiem un reprezentatīvākiem.

Gadījuma izpēte: pielāgota etalontesta izveide privātpersonu bankas pakalpojumu palīgam

Bankas tērzēšanas robots atbild uz jautājumiem par budžetu, tēriņiem un darījumiem. Publiskie jautājumu un atbilžu, kā arī teksta pārveides SQL etalontesti neaptvēra būtiskus banku riskus, piemēram, SQL injekcijas, datu noplūdi vai konteksta saglabāšanu vairāku sarunas posmu gaitā. Mēs izveidojām pielāgotu etalontestu, kas atspoguļo šī produkta aģenta konveijeru.

Pielāgotā etalontesta komponenti šajā kodu bāzē:

  • Ļaunprātīgu uzvedņu drošības pārbaužu komplekts SQL injekcijām, personu identificējošas informācijas izgūšanai, uzvednes norādījumu apiešanai un datu noplūdei starp sesijām

  • Nulles tolerance drošības jomā: jebkurš SQL injekcijas, personu identificējošas informācijas izgūšanas vai starpsesiju noplūdes mēģinājums ir jānoraida.

  • Konteksta saglabāšanas precizitāte: pārformulētajos vaicājumos jāsaglabā lietotāja nolūks un entītijas.

Galvenā atziņa: uzskatiet etalontesta izveidi par produkta funkciju. Pašreizējais izpildes ietvars pierāda, ka pilna cikla vērtēšana ir pieslēgta, taču tvērums un paraugu skaits jāpalielina, lai atspoguļotu reālos banku riskus (vairāku nolūku uzbrukumus, aizsargmehānismu apiešanu un no konteksta atkarīgus vaicājumus). Etalontests jāpaplašina līdz ar jauniem aģentiem un aizsargmehānismiem.

Vērtēšana pareizā līdzsvara atrašanai: vajadzīgā veiktspēja ar iespējami mazāko modeli

Saikne starp lietojumam specifisko etalontestu un modeļa izvēli ir kritiski svarīga. Etalontests parāda ne tikai to, vai risinājums darbojas, bet arī to, kura modeļa izmēra un pēcapmācības metožu kombinācija visizdevīgāk nodrošina vajadzīgo veiktspēju. Būtiskākos iepriekš apmācītu modeļu uzlabojumus („PT” nosaukumā ChatGPT) nodrošina nevis atkārtota apmācība, bet gan "pēcapmācības" metodes.

Šīs metodes nosaka, kādai informācijai modelis var piekļūt, kā tā ir strukturēta un kā modelis tiek vadīts un koordinēts izsecināšanas laikā. Pēcapmācības metodes, piemēram:

  • Domu ķēdes uzvednes un dinamiska skaitļošanas resursu piešķiršana (sarežģītākām problēmām domāt ilgāk)

  • Paškonsekvence, kad tiek ģenerēti vairāki rezultāti un izvēlēts labākais

  • Konteksta veidošana un koordinēšana, piemēram, izguves papildināta ģenerēšana (RAG), dažpiemēru paraugi un aģentiskas darbplūsmas

  • Rīku un ārēju zināšanu izmantošana, ļaujot modelim rīkoties ārpus tā iekšējo parametru robežām

  • Zināšanu reprezentācijas un glabāšanas stratēģijas, kas paredzētas strukturētu un nestrukturētu datu efektīvai izguvei un spriestspējai

Lai gan šīs pēcapmācības metodes var būtiski uzlabot sistēmas veiktspēju, tās rada arī kompromisus. Katrs papildu koordinēšanas, izguves vai spriestspējas slānis palielina sistēmas sarežģītību, izsecināšanas laiku un ekspluatācijas izmaksas. Tomēr pārdomāti izvēlēta pēcapmācības metožu kombinācija bieži ļauj izmantot mazākus, ātrākus un lētākus modeļus, vienlaikus izpildot veiktspējas prasības. Tā vietā, lai palielinātu modeļa izmēru, veiktspēju panāk ar labāku sistēmas uzbūvi.

Šī līdzsvara atrašana vienmēr ir atkarīga no konkrētā lietojuma, un optimālā metožu kombinācija jānosaka ar lietojumam specifiskiem novērtējumiem. Tie palīdz noteikt brīdi, kad papildu koordinēšana vairs nesniedz būtiskus ieguvumus, ļaujot komandām izvēlēties mērķa veiktspējai nepieciešamo minimālo pēcapmācības sarežģītības līmeni.

Virzieties ātri, bet vērtējiet pārdomāti

MI risinājums jāuztver kā vienota sistēma: datubāzes, API, lietotāju saskarnes, koordinācijas slāņi, uzraudzības infrastruktūra un citi elementi. Tāpēc vērtēšanai jāaptver visa tehnoloģiju kopa. Lai saglabātu pārskatāmību par iespējamām problēmām un atbildīgi paātrinātu attīstību, jāuzrauga sistēmas galvenās daļas.

Sistēmas galveno daļu uzraudzība nozīmē:

  • Aprīkot konveijerus ar instrumentāciju izmērāmu rezultātu iegūšanai.

  • Reģistrēt eksperimentus, lai redzētu katras izmaiņas ietekmi.

  • Pirms būtisku izmaiņu ieviešanas izmantot vienkāršus A/B salīdzinājumus, lai pārbaudītu iespējamās regresijas.

Datos balstītas iterācijas saīsina ceļu no prototipa līdz produkcijai, neatstājot nepamanītas problēmas. Žurnalēšana un uzraudzība ir svarīga arī tādēļ, lai izprastu lietojumprogrammas faktisko izmantošanu. Pārskatāmības nodrošināšanas piemērs:

  • 1. darbība: lietotāja pieprasījums ienāk ar request_id, user_segment un intent.

  • 2. darbība: trasējums reģistrē modeļa versiju, uzvednes versiju, izguves dokumentus un rīku izsaukumus.

  • 3. darbība: LVM vērtētājs novērtē atbildi (correctness, groundedness, policy_risk).

  • 4. darbība: kārtulu dzinis izvērtē sliekšņus.

  • 5. darbība: ja slieksnis ir pārkāpts, aktivizē brīdinājumu un novirza pie rezerves risinājuma/cilvēka pārbaudes.

  • 6. darbība: kļūme tiek pievienota šķirošanas rindai un pēc tam etalontestu uzdevumu sarakstam.

Langfuse trasējums preču atgriešanas politikas palīgam, kurā redzama pieprasījuma plūsma, izguves un kārtulu rīki, atbildes kvalitātes vērtējums, kvalitātes slieksnis, vērtēšanas metadati un ģenerētā atbilde.

Reāli lietotāji reti rīkojas tieši tā, kā paredzējuši izstrādātāji. Daži norādījumus pārpratīs. Citi apzināti meklēs vājās vietas. Šie robežgadījumi nav anomālijas, bet gan ārkārtīgi vērtīgi signāli. Labi ieviests vērtēšanas konveijers tos uztver, analizē un iekļauj turpmākajos testos. Ātras iterācijas bez nepamanītām problēmām ir iespējamas tikai tad, ja vērtēšana ir iestrādāta sistēmā, nevis pievienota pēc izstrādes.

Iesakām aizsargmehānismus un uzraudzību iestrādāt jau no pirmās dienas:

  • Regulāri uzraugiet modeļa metrikas un regresijas, izmantojot lietojumam specifisko etalontestu.

  • Apkopojiet un pārskatiet robežgadījumus vai pretinieciskus ievaddatus un pievienojiet tos lietojumam specifiskajai etalontesta datu kopai.

  • Nodrošiniet šo vērtēšanas metriku atbilstību galvenajiem veiktspējas rādītājiem.

  • Regulāri kritiski pārbaudiet datu kopu un etalontestu, lai pārliecinātos, ka neignorējat jaunus riskus un nepakļaujaties neobjektivitātei.

  • Ieviesiet automatizētus brīdinājumus par metriku pasliktināšanos (piemēram, ja precizitāte nokrītas zem 85%, aktivizējiet pārbaudi).

  • Augsta riska lēmumiem saglabājiet cilvēka veiktu pārbaudi (juridiskas konsultācijas, medicīniski ieteikumi, finanšu darījumi).

Vērtējiet atbildīgi: enerģija, izmaksas un atbilstība

Katra etalontesta izpilde patērē skaitļošanas resursus un enerģiju. Katrs lieks eksperiments palielina izmaksas. Atbildīgā vērtēšanā rūpība jāsabalansē ar efektivitāti.

Lai enerģijas patēriņš un izmaksas nekļūtu nekontrolējamas, var veikt vairākus praktiskus pasākumus:

  • Kad iespējams, izmantojiet mazākus modeļus: sākotnējos eksperimentus veiciet ar lētākiem modeļiem un mērogojiet tikai pēc pieejas validēšanas.

  • Kešojiet uzvednes un API izsaukumus.

  • Izmantojiet enerģijas patēriņu ņemošu plānošanu (pakešapstrādi, spot instances, elastīgu prioritāti).

  • Līdztekus veiktspējai uzraugiet skaitļošanas resursu patēriņu.

Vienlaikus sekojiet līdzi jaunajam MI regulējumam. Pat ja īpaša likuma nav, joprojām jāievēro esošais regulējums un jāveic nepieciešamie pasākumi, piemēram:

Datu aizsardzība:

  • Nodrošiniet, lai etalontestu datu kopās bez pienācīgas piekrišanas nebūtu personu identificējošas informācijas

  • Ieviesiet datu glabāšanas politikas reģistrētajiem vaicājumiem

  • Nodrošiniet mehānismus datu dzēšanas pieprasījumiem

Vienlīdzība un neobjektivitāte:

  • Pārbaudiet veiktspēju dažādās demogrāfiskajās grupās

  • Etalontestu izveidē iekļaujiet daudzveidīgu pārstāvniecību

Cilvēktiesības un pārredzamība:

  • Skaidri dokumentējiet modeļa ierobežojumus lietotājiem

  • Sniedziet skaidrojumus par augsta riska lēmumiem

  • Nodrošiniet cilvēka uzraudzību kritiski svarīgiem lietojumiem

Secinājums: no vērtēšanas līdz attīstībai

Vērtēšana nav vienreizējs pasākums, bet gan pastāvīgi pilnveidojama sistēma. Strauji mainīgā nozarē priekšrocību sniedz spēja ātri testēt, mācīties un pielāgoties, lai efektīvāk ieviestu modeļus un jaunus risinājumus.

Padarot vērtēšanu par pamatdarbību inženierijā un produktu pārvaldībā, komandas var ieviest inovācijas ātrāk un drošāk. Vispirms definējiet, ko jūsu MI lietojuma kontekstā nozīmē „labi”, izveidojiet vērtēšanas platformu un pilnveidojiet to, lai iegūtu lietojumam specifisku etalontestu, kas katrā iterācijā sniedz pārliecību par gatavību produkcijai.

Autori

Fatemeh Tahavori un Romain Bourboulou