Ingawa miundo msingi imeboreshwa, mabadiliko halisi yanayowezesha matumizi ya uzalishaji kwa kujiamini yanatokana na taratibu makini za tathmini
Tathmini zilizoundwa vizuri huwasaidia wasimamizi wa bidhaa, viongozi wa usimamizi wa AI na CTO kusambaza mawakala wa AI kwa usalama na kwa kiwango kikubwa, na kugeuza AI kutoka kifaa cha majaribio kilichotengwa kuwa faida ya ushindani.
Imani hiyo hutokana na kutathmini tabia ya wakala wa AI kwa kutumia maswali halisi ya watumiaji, hali za kipekee na matukio mahususi ya sekta yanayoakisi mazingira halisi ya biashara yako; si kipimo cha umma kinachodai ‘muundo huu ndio bora zaidi’
Lengo ni kuthibitisha imani hiyo kupitia matokeo yanayopimika. Mafanikio yanamaanisha kufafanua "ubora" kwa vigezo dhahiri, vinavyopimika na vinavyoendana na mahitaji ya biashara yako na kiwango cha hatari unachokubali—iwe ni usahihi wa taarifa, toni inayofaa, kasi au ufanisi wa gharama.
Kwa kujumuisha tathmini katika mfumo wako wote (uwekaji wa zana za kupima, uwekaji kumbukumbu, majaribio ya A/B na vizuizi vya usalama) na kusawazisha umakini na ufanisi, timu zitaweza kusambaza bidhaa kwa kasi na uthabiti zaidi.
Biashara nyingi hazina tatizo wafanyakazi wao wanapojaribu ChatGPT au Gemini. Lakini si kawaida kutumia LLM katika michakato au mazingira yenye athari kubwa.
Sababu za hali hiyo mara nyingi zimekuwa halali: ubora umekuwa usiotabirika, huku hatari ya kutoa taarifa za kubuni au tabia isiyofaa ikizidi manufaa yanayoweza kutolewa na teknolojia hiyo.
Uwiano huo wa hatari na manufaa umebadilika sana katika mwaka uliopita. Ingawa sehemu ya mabadiliko hayo inatokana na utendaji bora wa miundo msingi, mengi yametokana na kuongezeka kwa umakini katika tathmini (au “evals”). Tathmini hutupa sisi na wateja wetu imani ya kusambaza mawakala wa kiwango kikubwa wanaohudumia wateja ndani ya wiki chache.
Mwongozo huu utaeleza vipengele vya msingi vya tathmini, jinsi ya kuziunda, kuzitekeleza na kuziendesha katika matumizi ya uzalishaji.
Lengo la tathmini si kupata muundo mkamilifu, bali kujenga imani yenye ushahidi kwamba muundo wako unatenda kulingana na mahitaji ya biashara yako, matarajio ya watumiaji na kiwango cha hatari ambacho shirika lako linakubali.
Msingi wa mkakati wowote wa tathmini ni swali rahisi: “Ubora” unaonekanaje? Jibu linapaswa kuwa mahususi. Kwa shirika moja, “ubora” unaweza kumaanisha usahihi wa taarifa ndani ya viwango vikali; kwa jingine, unaweza kutanguliza kasi, ufanisi wa gharama au mtindo wa kipekee wa mawasiliano. Kila kikwazo unachofanyia kazi—kuanzia data inayoweza kutumiwa hadi wajibu wa kisheria unaohusika—huathiri ufafanuzi huu.
Muhimu zaidi, 'ubora' unahitaji vipengele unavyoweza kupima. Ikiwa mafanikio yanamaanisha kutoa mwongozo wa kifedha wenye manufaa, basi manufaa hayo lazima yaelezwe kwa sifa kama usahihi wa taarifa, tahadhari zinazofaa, uwazaji unaolenga mtu binafsi na mipaka salama. Baada ya kufafanua ‘ubora’ kwa vigezo vinavyopimika, swali linalofuata ni jinsi utakavyochanganua na kufasiri matokeo. Kuchukua hatua kutokana na matokeo haya ndiko kunakofanya tathmini iwe mbinu badala ya kutoa maamuzi tu.
Kila mchakato wa tathmini hutegemea nguzo tatu zinazohusiana:
Ingizo/Vipimo linganishi: Mifano wakilishi ya matumizi halisi kwa ajili ya utendaji wa jumla na seti za data za ndani zilizochaguliwa ili kupima ufaafu katika sekta.
Tabia ya Muundo: Jinsi muundo unavyoitwa (uzalishaji unaoboreshwa kwa urejeshaji, ufupishaji, urejeshaji wa taarifa zilizopangwa na matumizi ya zana).
Vipimo: Jinsi unavyopima na kufasiri utendaji.
Ingizo lazima liwakilishe mazingira ambayo mfumo wako utakumbana nayo. Maarifa yenye maana zaidi hutokana na mifano halisi: maswali ya wateja wako, hali za kifedha au matukio mahususi ya sekta. Ni kwa kupima kwa kutumia mifano hii pekee ndipo unapoweza kujua kama muundo unaelewa kwa kweli undani wanaohitaji watumiaji wako na kutimiza hitaji la biashara.
Tabia ya muundo—kama vile jinsi unavyopewa dokeza, jinsi urejeshaji au matumizi ya zana yanavyoratibiwa, na jinsi muktadha unavyowasilishwa—ni muhimu sawa na muundo wenyewe. Miundo miwili inayofanana inaweza kutenda kwa njia tofauti sana kulingana na jinsi inavyosambazwa. Kwa hiyo, safu hii lazima ijumuishwe katika muundo wa tathmini yako.
Mwisho, kuna vipimo. Nambari pekee hazielezi kila kitu, lakini vipimo vilivyochaguliwa vizuri hufanya tabia ya mfumo ieleweke. Muda wa majibu, usahihi, usalama, mtiririko, upendeleo, gharama na kuridhika kwa watumiaji kwa pamoja huonyesha sura yenye vipengele vingi ya mfumo katika uzalishaji. Ustadi uko katika kuchagua vipimo vinavyoendana na KPI za mradi au biashara yako na kuangazia sifa muhimu zaidi kwa watumiaji wako. Vipimo rahisi mara nyingi huwa sahihi zaidi na vya gharama nafuu, ilhali uchaguzi mbaya wa vipimo unaweza kupotosha timu. Hivi ndivyo unavyopaswa kufikiria kuhusu uchaguzi wa vipimo:
Mifano ya uchaguzi mzuri wa vipimo:
Chatbot ya huduma kwa wateja: Kiwango cha kutatua tatizo katika mawasiliano ya kwanza (je, tatizo la mtumiaji lilitatuliwa bila kuhamishwa ngazi ya juu?), wastani wa muda wa kushughulikia, alama ya kuridhika kwa mtumiaji na kiwango cha kuhamishia mawakala wa kibinadamu
Zana ya utafiti wa kifedha: Usahihi wa marejeleo (% ya madai yaliyo na vyanzo sahihi), usahihi wa taarifa uliothibitishwa dhidi ya ukweli halisi, ufaafu wa urejeshaji (je, ilipata hati sahihi?) na mtiririko wa uwazaji uliopimwa na wataalamu wa sekta
Msaidizi wa kuzalisha msimbo: Usahihi wa sintaksia, kiwango cha kufaulu majaribio, idadi ya udhaifu wa kiusalama na muda wa kupata suluhisho linalofanya kazi
Mifano ya uchaguzi mbaya wa vipimo:
Kutumia urefu wa jibu pekee kama kiashiria cha ubora (urefu zaidi ≠ ubora zaidi)
Kupima kasi bila kuzingatia athari zake kwa usahihi
Kufuatilia alama za kujiamini za muundo bila kuzithibitisha dhidi ya usahihi halisi
Kutegemea tu kipimo cha ndani cha utata wa muundo bila uthibitishaji unaowahusisha watumiaji
Mitego ya kawaida ya vipimo ya kuepuka:
Vipimo vinavyokinzana: Kuboresha kasi na ukamilifu kwa wakati mmoja bila kutambua kwamba kimoja huathiri kingine
Kulinganisha kupita kiasi na vipimo linganishi: Kupata 95% kwenye seti yako ya majaribio lakini kushindwa katika uzalishaji kwa sababu watumiaji halisi hutenda tofauti
Kwa mteja mmoja wa huduma za kifedha zinazodhibitiwa sana, usahihi katika suluhisho lake la utafiti wa kina ulikuwa muhimu kuliko yote. Tulibuni seti za data za maswali na majibu zilizotayarishwa na wataalamu pamoja na seti zilizozalishwa kwa zana. Hii ilituwezesha kupima usahihi, uwezo wa mfumo wa kuchagua zana sahihi na kurejesha taarifa sahihi, na hivyo kupata mtazamo sawia wa usahihi na ubora wa uwazaji. Jambo kuu lilikuwa kupima vipengele vingi: usahihi wa taarifa (uthibitishaji wa wataalamu), ubora wa urejeshaji (usahihi/urejeshaji wa hati zinazofaa) na mtiririko wa uwazaji (tathmini iliyopangwa ya mtiririko wa mantiki).
Wakati wa kutumia LLM kama mwamuzi wa ubora wenye undani
LLM kama mwamuzi hutumia muundo wa pili wa AI kufanya tathmini, ikibadilisha ukaguzi wa binadamu na uwekaji alama wa ubora wa kiotomatiki unaoweza kupanuliwa. LLM kama mwamuzi mara nyingi hutumiwa vibaya wakati vipimo rahisi vinaweza kutoa usahihi unaohitaji. Inaweza kufaa pale ambapo ukaguzi wenye matokeo thabiti hauwezi kupima ubora, kwa mfano kipimo kinapohusu maana (manufaa, kutegemea vyanzo, ubora wa uwazaji, toni au ufafanuzi wa sera) na uwekaji alama thabiti hauwezekani. Huenda ukahitaji maoni yanayoweza kupanuliwa katika aina nyingi za dokeza/muundo, pamoja na kanuni wazi za upimaji na kielezo cha matokeo yaliyopangwa. Ili ikufae, fuata hatua hizi:
Fafanua wazi vipengele vya kanuni za upimaji: usahihi, kutegemea vyanzo, kufuata sera, uwezekano wa kuchukua hatua na toni.
Tumia matokeo yaliyopangwa (kielezo cha JSON) kwa majibu ya mwamuzi.
Nasa alama za kupita/kufeli na maandishi ya uchunguzi kwa ajili ya kuchanganua hitilafu.
Linganisha matokeo ya mwamuzi na sampuli zilizowekewa lebo na binadamu katika kila awamu ya toleo.
Tumia waamuzi wawili au ukaguzi wa makubaliano wa mara kwa mara katika sekta zenye athari kubwa.
Fuatilia mabadiliko ya mwamuzi na kiwango cha kutokubaliana kadiri muda unavyopita.
Seti ya data ya kipimo linganishi ni mkusanyiko maalum usiobadilika wa mifano ya majaribio yenye majibu yanayojulikana, unaotumiwa kutathmini miundo kwa uthabiti na kulinganisha matokeo ya matoleo mbalimbali kwa haki. Kwa kawaida hujumuisha ingizo (k.m., maswali ya watumiaji), matokeo yanayotarajiwa au maamuzi ya marejeleo, na vigezo/lebo za tathmini za kuweka alama. Majaribio ya vipimo linganishi vya umma hutumiwa kulinganisha utendaji wa miundo ya kisasa zaidi na yanaweza kuwa rejeleo la awali unapobuni mfumo wako ili kutambua muundo unaoweza kufaa kutumiwa.
Hata hivyo, kwa mfumo wako huwezi kutegemea vipimo hivi kama kiwakilishi cha utendaji katika mazingira ya biashara yako kwa sababu vina matatizo yanayojulikana:
Uchafuzi: Huenda miundo imefunzwa kwa data ya kipimo linganishi; kuitathmini kwa seti hiyo hiyo ni kama kusahihisha mtihani kwa kutumia karatasi ya majibu.
Kufikia kikomo: Miundo yote bora tayari imefikia alama za juu zaidi, kwa hivyo kuboreka/kushuka kwa utendaji kutakuwa kwa asilimia chache tu na mara nyingi ndani ya mabadiliko ya kawaida ya matokeo ya majaribio.
Upeo finyu: Data ya kipimo linganishi haiakisi kazi zako halisi; huchaguliwa na kusafishwa sana. Baadhi hata huzalishwa na LLM, hivyo hazitaakisi ugumu na hali za kipekee katika data yako (makosa ya kuandika, misemo isiyo ya kawaida na picha zenye kelele).
Mwanafunzi anaomba programu imsaidie kutatua maswali ya hisabati yaliyoandikwa kwa maneno.
Mfano wa kipimo linganishi cha umma unachoweza kutumia: GSM8K (uwazaji wa hisabati wa shule ya msingi)
Seti ngumu zaidi ya hiari: MATH.
Kwa nini kipimo hiki linganishi kinafaa:
Kulinganisha haraka muundo ulio bora katika uwazaji wa jumla wa hisabati,
Ni kichujio kizuri cha kwanza kabla ya kuwekeza katika tathmini kamili za bidhaa.
Kwa nini bado unahitaji seti yako mwenyewe ya data:
Programu yako ina mahitaji ambayo GSM8K haipimi:
Maneno ya mtaala wako na mpangilio wa mada,
Mtindo wa maelezo unaofaa kundi lako la umri,
Jinsi ya kushughulikia maswali ya wanafunzi yenye utata au makosa mengi ya kuandika,
Kanuni za sera (k.m., wakati wa kutoa vidokezo badala ya majibu kamili).
Uthibitishaji bora hutegemea kuunda vipimo linganishi vya tathmini vilivyo mahususi kwa programu yako. Seti hizi za data zinapaswa kutokana na mwingiliano halisi, hali za kawaida za kipekee na njia zinazowezekana za kushindwa. Hii inaweza kuwa kazi ngumu wakati wa kutekeleza bidhaa au mchakato mpya. Hata hivyo, mara nyingi inawezekana kukusanya data kutoka kwa bidhaa iliyopo au mapema iwezekanavyo, hata wakati wa awamu ya kwanza ya majaribio. Baada ya kuunda programu yako, vipimo hivi linganishi vinapaswa kubadilika pamoja na bidhaa yako, vikizidi kuwa pana na wakilishi kadiri muda unavyopita.
Uchunguzi kifani: Kuunda kipimo linganishi maalum kwa msaidizi wa benki ya rejareja
Chatbot ya benki hujibu maswali kuhusu bajeti, matumizi na miamala. Vipimo linganishi vya umma vya maswali na majibu/maandishi hadi SQL havikujumuisha hatari kuu za benki kama uingizaji wa SQL, uvujaji wa data au uendelezaji wa muktadha katika mazungumzo ya hatua nyingi. Tuliunda kipimo linganishi maalum kinachoakisi mchakato wa wakala wa bidhaa hii.
Vipengele vya kipimo linganishi maalum katika hazina hii ya msimbo:
Seti ya majaribio hasidi yenye vidokeza vya uingizaji wa SQL, uchotaji wa PII, kubatilisha dokeza na uvujaji kati ya vipindi
Kutovumilia kabisa hatari za usalama: jaribio lolote la uingizaji wa SQL, uchotaji wa PII au uvujaji kati ya vipindi lazima likataliwe.
Usahihi wa kuendeleza muktadha: maswali yaliyoandikwa upya lazima yahifadhi nia ya mtumiaji na vipengele vinavyorejelewa.
Funzo kuu: Chukulia uundaji wa kipimo linganishi kama kipengele cha bidhaa. Mazingira ya sasa ya uendeshaji yanathibitisha kuwa tathmini ya mwanzo hadi mwisho imeunganishwa, lakini wigo na ukubwa wa sampuli lazima viongezwe ili kuakisi hatari halisi za benki (mashambulizi yenye nia nyingi, kukwepa vizuizi vya usalama na maswali yanayotegemea muktadha). Kipimo linganishi kinapaswa kupanuliwa sambamba na mawakala na vizuizi vipya vya usalama.
Uhusiano kati ya kipimo linganishi mahususi cha programu yako na uchaguzi wa muundo ni muhimu sana. Kipimo chako linganishi hakionyeshi tu kama suluhisho linafanya kazi, bali pia mchanganyiko wa ukubwa wa muundo na mbinu za baada ya mafunzo unaotoa utendaji unaohitaji kwa gharama nafuu zaidi. Maboresho yenye nguvu zaidi kwa miundo iliyofunzwa awali (‘PT’ katika ChatGPT) hayatokani na kuifunza upya, bali mbinu za "baada ya mafunzo".
Mbinu hizi hulenga kupanga taarifa ambazo muundo unaweza kufikia, jinsi taarifa hizo zinavyopangwa, na jinsi muundo unavyoongozwa na kuratibiwa wakati wa uendeshaji. Mbinu za baada ya mafunzo kama:
Utoaji wa vidokeza vya msururu wa mawazo na ugawaji unaobadilika wa rasilimali za kompyuta (kutumia uwazaji zaidi kwa matatizo magumu)
Uthabiti binafsi, ambapo matokeo mengi huzalishwa na yaliyo bora zaidi huchaguliwa
Uundaji na uratibu wa muktadha, kama vile Retrieval-Augmented Generation (RAG), mifano ya sampuli-chache na michakato ya mawakala
Matumizi ya zana na ufikiaji wa maarifa ya nje, yanayowezesha muundo kutenda zaidi ya vigezo vyake vya ndani
Mikakati ya uwakilishaji na uhifadhi wa maarifa iliyoundwa kwa urejeshaji na uwazaji bora katika data iliyopangwa na isiyopangwa
Ingawa mbinu hizi za baada ya mafunzo zinaweza kuboresha sana utendaji wa mfumo, pia zina athari zinazohitaji kusawazishwa. Kila safu ya ziada ya uratibu, urejeshaji au uwazaji huongeza utata wa mfumo, muda wa uendeshaji na gharama za uendeshaji. Hata hivyo, ukitumiwa kwa makini, mchanganyiko sahihi wa mbinu za baada ya mafunzo mara nyingi huruhusu matumizi ya miundo midogo, ya kasi na ya gharama nafuu huku ikitimiza mahitaji ya utendaji. Badala ya kuongeza ukubwa wa muundo, utendaji hufikiwa kupitia muundo bora wa mfumo.
Kupata uwiano huu hutegemea programu husika, na kunapaswa kutumia tathmini mahususi za programu yako ili kubaini mchanganyiko bora wa mbinu. Tathmini hizo zitakuwezesha kutambua hatua ambapo uratibu wa ziada hauleti tena maboresho yenye maana, na hivyo kusaidia timu kuchagua kiwango cha chini zaidi cha utata wa baada ya mafunzo kinachohitajika kufikia utendaji unaolengwa.
Suluhisho la AI linapaswa kuzingatiwa kama mfumo mzima: hifadhidata, API, violesura vya watumiaji, safu za uratibu, miundombinu ya ufuatiliaji na mengineyo. Kwa hiyo, tathmini lazima ihusishe mfumo mzima wa teknolojia. Unapaswa kufuatilia sehemu muhimu za mfumo ili kuendelea kuona matatizo yanayoweza kutokea na kuongeza kasi kwa kuwajibika.
Kufuatilia sehemu muhimu za mfumo kutahusisha:
Kuweka zana za kupima matokeo katika michakato yako.
Kuweka kumbukumbu za majaribio ili uone athari ya kila badiliko.
Kutumia ulinganisho rahisi wa A/B kabla ya kusambaza mabadiliko makubwa ili kupima uwezekano wa kushuka kwa utendaji.
Maboresho yanayoongozwa na data hupunguza safari kutoka mfano wa awali hadi uzalishaji bila kuacha mapengo yasiyoonekana. Uwekaji kumbukumbu na ufuatiliaji pia ni muhimu ili kuelewa matumizi halisi ya programu. Huu ni mfano wa kuhakikisha mfumo unaonekana na kueleweka:
Hatua ya 1: Ombi la mtumiaji linaingia likiwa na request_id, user_segment, intent.
Hatua ya 2: Ufuatiliaji unaweka kumbukumbu za toleo la muundo, toleo la dokeza, hati zilizorejeshwa na miito ya zana.
Hatua ya 3: Mwamuzi wa LLM anaweka alama kwa jibu (correctness, groundedness, policy_risk).
Hatua ya 4: Injini ya kanuni inatathmini viwango vya mipaka.
Hatua ya 5: Kiwango kikikiukwa, anzisha arifa + elekeza kwenye suluhisho mbadala/ukaguzi wa binadamu.
Hatua ya 6: Hitilafu inaongezwa kwenye foleni ya uchambuzi, kisha kwenye orodha ya kazi za kipimo linganishi.

Watumiaji halisi mara chache hutenda sawasawa na wabunifu wanavyotarajia. Baadhi yao wataelewa maagizo vibaya. Wengine watajaribu kwa makusudi kutafuta udhaifu. Hali hizi za kipekee si kasoro, bali ni ishara muhimu sana. Mchakato wa tathmini uliotekelezwa vizuri huzinasa, kuzichanganua na kuzijumuisha katika majaribio yajayo. Maboresho ya haraka bila mapengo yasiyoonekana yanawezekana tu tathmini inapojengwa ndani ya mfumo, badala ya kuongezwa baada ya uundaji.
Tunapendekeza kujumuisha vizuizi vya usalama na ufuatiliaji tangu siku ya kwanza:
Fuatilia mara kwa mara vipimo vya muundo na kushuka kwa utendaji kwa kutumia kipimo linganishi mahususi cha programu yako.
Nasa na ukague hali za kipekee au ingizo hasidi (na uziongeze kwenye seti ya data ya kipimo linganishi mahususi cha programu yako).
Hakikisha vipimo hivi vya tathmini vinaendana na KPI zako kuu.
Chunguza mara kwa mara seti yako ya data na kipimo linganishi ili kuhakikisha hupuuzi hatari mpya wala kuathiriwa na upendeleo.
Tekeleza arifa za kiotomatiki za kushuka kwa vipimo (k.m., usahihi ukishuka chini ya 85%, anzisha ukaguzi).
Dumisha mchakato wa ukaguzi wa binadamu kwa maamuzi yenye athari kubwa (ushauri wa kisheria, mwongozo wa kimatibabu na miamala ya kifedha).
Kila uendeshaji wa kipimo linganishi hutumia rasilimali za kompyuta na nishati. Kila jaribio lisilo la lazima huongeza gharama. Tathmini inayowajibika inapaswa kusawazisha umakini na ufanisi.
Hatua zifuatazo zinaweza kuzuia matumizi ya nishati na gharama yasipande kupita kiasi:
Tumia miundo midogo inapowezekana; fanya majaribio ya awali kwa miundo ya gharama nafuu na uongeze ukubwa baada tu ya kuthibitisha mbinu.
Hifadhi vidokeza na miito ya API kwenye akiba.
Tumia upangaji unaozingatia nishati (uchakataji wa mafungu, spot instances na flex priority).
Fuatilia matumizi ya rasilimali za kompyuta pamoja na utendaji.
Vilevile, fuatilia kwa makini kanuni mpya za AI. Hata pasipo sheria mahususi, mifumo iliyopo na hatua muhimu bado hutumika, kama vile:
Ulinzi wa data:
Hakikisha seti za data za vipimo linganishi hazina PII bila idhini inayofaa
Tekeleza sera za kuhifadhi data kwa maswali yaliyowekwa kwenye kumbukumbu
Toa njia za kuwasilisha maombi ya kufuta data
Usawa na upendeleo:
Pima utendaji katika makundi mbalimbali ya kidemografia
Jumuisha uwakilishi wa makundi tofauti wakati wa kuunda kipimo linganishi
Haki za binadamu na uwazi:
Waeleze watumiaji wazi kuhusu mapungufu ya muundo
Toa maelezo ya maamuzi yenye athari kubwa
Wezesha usimamizi wa binadamu kwa programu muhimu
Tathmini si tukio la mara moja, bali ni mfumo unaoendelea kubadilika. Katika sekta inayobadilika kwa kasi, faida yako inategemea uwezo wa kupima, kujifunza na kubadilika haraka ili uweze kusambaza miundo na suluhisho mpya kwa ufanisi zaidi.
Kwa kufanya tathmini kuwa shughuli ya msingi ya uhandisi na usimamizi wa bidhaa, timu zinaweza kuvumbua kwa kasi na usalama zaidi. Anza kwa kufafanua ubora katika muktadha wa programu yako ya AI, unda jukwaa la tathmini, kisha uliendeleze ili upate kipimo linganishi mahususi cha programu kinachokupa imani kwamba iko tayari kwa uzalishaji katika kila marudio.