Hlavná navigácia

Hodnotenia: od experimentov s AI k spoľahlivej produkcii

Zistite, ako hodnotenie premosťuje priepasť medzi experimentovaním s AI a spoľahlivým nasadením pripraveným na produkciu.

Zhrnutie pre vedenie

  • Hoci sa základné modely zlepšili, skutočný posun umožňujúci ich spoľahlivé produkčné nasadenie prinášajú systematické postupy hodnotenia

  • Dobre navrhnuté hodnotenia pomáhajú produktovým manažérom, vedúcim pracovníkom pre správu AI a technologickým riaditeľom bezpečne a vo veľkom nasadzovať AI agentov, čím sa z izolovanej hračky stáva konkurenčná výhoda.

  • Táto dôvera pramení z hodnotenia správania AI agentov na základe skutočných otázok používateľov, hraničných prípadov a scenárov špecifických pre danú oblasť, ktoré odrážajú reálny kontext vašej firmy, nie z verejného benchmarku tvrdiaceho, že „tento model je najlepší“

  • Cieľom je podložiť túto dôveru merateľnými výsledkami. Úspech znamená konkrétne a merateľne definovať, čo je "dobré", v súlade s potrebami vašej firmy a toleranciou rizika – či už ide o faktickú správnosť, vhodný tón, rýchlosť alebo nákladovú efektívnosť.

  • Začlenením hodnotenia do celého systému (prístrojové vybavenie, protokolovanie, A/B testovanie, ochranné mechanizmy) a vyvážením dôslednosti s efektívnosťou dosiahnu tímy rýchlejšie a robustnejšie nasadzovanie.

Väčšine firiem neprekáža, keď ich zamestnanci experimentujú s ChatGPT alebo Gemini. Nasadzovanie LLM do pracovných postupov či prostredí s vysokými rizikami je však podstatne menej bežné.

Dôvody boli často opodstatnené: kvalita bola nevyrovnaná a riziko halucinácií alebo nežiaduceho správania prevyšovalo možné prínosy tejto technológie.

Pomer rizík a prínosov sa za posledný rok výrazne zmenil. Čiastočne je to zásluhou lepšieho výkonu základných modelov, no významnú úlohu zohráva aj čoraz systematickejší prístup k hodnoteniam (tzv. „evals“). Hodnotenia nám aj našim klientom umožňujú s dôverou nasadiť vo veľkom rozsahu agentov určených pre klientov už v priebehu niekoľkých týždňov.

Táto príručka vysvetľuje základy hodnotení a spôsob ich návrhu, implementácie a prevádzky v produkčných prípadoch použitia.

Základy hodnotení (1): Ako vyzerá úspech?

Cieľom hodnotenia nie je nájsť dokonalý model, ale získať opodstatnenú dôveru, že sa správa v súlade s potrebami vašej firmy, očakávaniami používateľov a toleranciou rizika vašej organizácie.

Základom každej stratégie hodnotenia je jednoduchá otázka: Ako vyzerá „dobrý“ výsledok? Odpoveď by mala byť konkrétna. Pre jednu organizáciu môže „dobrý“ výsledok znamenať faktickú správnosť v rámci prísnych tolerancií, kým iná môže uprednostniť rýchlosť, nákladovú efektívnosť alebo osobitý štýl komunikácie. Túto definíciu ovplyvňujú všetky obmedzenia, ktorým podliehate – od údajov, ktoré možno použiť, až po príslušné regulačné povinnosti.

Je zásadné, aby sa 'dobrý' výsledok skladal zo skutočne merateľných prvkov. Ak úspech znamená poskytovať užitočné finančné poradenstvo, užitočnosť treba vyjadriť konkrétnymi vlastnosťami: faktickou správnosťou, vhodnými upozorneniami, personalizovaným uvažovaním a bezpečnými hranicami. Keď už „dobrý“ výsledok definujete merateľne, ďalšou otázkou je, ako budete výsledky analyzovať a interpretovať. Až konanie na základe týchto výsledkov mení hodnotenie na systematickú metódu namiesto súboru subjektívnych úsudkov.

Základy hodnotení (2): vstupy, správanie modelu a metriky

Každý proces hodnotenia stojí na troch vzájomne prepojených pilieroch:

  1. Vstupy/benchmarky: Reprezentatívne príklady z reálneho sveta na overenie všeobecného výkonu a starostlivo zostavené interné dátové súbory na testovanie použiteľnosti v danej oblasti.

  2. Správanie modelu: Spôsob volania modelu (generovanie rozšírené o vyhľadávanie, sumarizácia, získavanie štruktúrovaných informácií, používanie nástrojov).

  3. Metriky: Spôsob merania a interpretácie výkonu.

Vstupy musia reprezentovať prostredie, s ktorým sa systém stretne. Najhodnotnejšie poznatky pochádzajú zo skutočných príkladov: otázok zákazníkov, finančných scenárov alebo prípadov špecifických pre vaše odvetvie. Len testovaním na týchto príkladoch zistíte, či model naozaj chápe nuansy, ktoré používatelia potrebujú, a spĺňa potreby firmy.

Správanie modelu – napríklad spôsob zadávania príkazov, koordinácie vyhľadávania či používania nástrojov a poskytovania kontextu – je rovnako dôležité ako samotný model. Dva rovnaké modely sa môžu v závislosti od spôsobu nasadenia správať veľmi odlišne. Túto vrstvu preto musíte zahrnúť do návrhu hodnotenia.

Napokon prichádzajú na rad metriky. Samotné čísla málokedy vystihnú celý obraz, no vhodne zvolené metriky umožňujú správanie systému interpretovať. Latencia, presnosť, bezpečnosť, súdržnosť, skreslenie, náklady a spokojnosť používateľov spoločne vytvárajú viacrozmerný obraz produkčného systému. Umenie spočíva vo výbere metrík, ktoré zodpovedajú KPI projektu alebo firmy a objasňujú vlastnosti najdôležitejšie pre používateľov. Jednoduchšie metriky bývajú presnejšie a lacnejšie, zatiaľ čo nevhodný výber môže tímy zavádzať. Pri výbere metrík postupujte takto:

Príklady vhodne zvolených metrík:

  • Chatbot zákazníckej podpory: miera vyriešenia pri prvom kontakte (vyriešil sa problém používateľa bez eskalácie?), priemerný čas vybavenia, skóre spokojnosti používateľov, miera eskalácie na ľudských agentov

  • Nástroj na finančný výskum: presnosť citácií (% tvrdení so správne uvedeným zdrojom), faktická presnosť overená voči referenčným údajom, relevantnosť vyhľadávania (našiel správne dokumenty?), súdržnosť uvažovania hodnotená odborníkmi na danú oblasť

  • Asistent na generovanie kódu: syntaktická správnosť, úspešnosť testov, počet bezpečnostných zraniteľností, čas do vytvorenia funkčného riešenia

Príklady nevhodne zvolených metrík:

  • Používanie iba dĺžky odpovede ako ukazovateľa kvality (dlhšie ≠ lepšie)

  • Meranie rýchlosti bez zohľadnenia kompromisov v presnosti

  • Sledovanie skóre istoty modelu bez jeho overenia voči skutočnej správnosti

  • Spoliehanie sa výlučne na internú perplexitu modelu bez overenia z pohľadu používateľov

Bežné úskalia metrík, ktorým sa treba vyhnúť:

  • Protichodné metriky: Súčasná optimalizácia rýchlosti a komplexnosti bez zohľadnenia kompromisu medzi nimi

  • Nadmerné prispôsobenie benchmarkom: Dosiahnutie 95 % v testovacom súbore, no zlyhanie v produkcii, pretože skutoční používatelia sa správajú inak

Pre jedného klienta z prísne regulovaných finančných služieb bola presnosť riešenia na hlboký výskum prvoradá. Vytvorili sme dátové súbory otázok a odpovedí pripravené odborníkmi aj súbory generované nástrojmi. Mohli sme tak posúdiť presnosť, schopnosť systému vybrať správne nástroje a získať relevantné informácie, čo poskytlo vyvážený obraz o presnosti a kvalite uvažovania. Kľúčové bolo meranie viacerých rozmerov: faktickej správnosti (overenie odborníkmi), kvality vyhľadávania (presnosť/úplnosť relevantných dokumentov) a súdržnosti uvažovania (štruktúrované hodnotenie logického postupu).

Kedy použiť LLM ako hodnotiteľa nuansovanej kvality

Prístup LLM ako hodnotiteľ používa na hodnotenie druhý model AI, čím nahrádza ľudskú kontrolu škálovateľným automatizovaným bodovaním kvality. LLM ako hodnotiteľ sa často používa nevhodne aj vtedy, keď požadovanú presnosť dokážu zabezpečiť jednoduchšie metriky. Užitočný môže byť tam, kde deterministické kontroly nedokážu zachytiť kvalitu, napríklad pri sémantických metrikách (užitočnosť, opora vo faktoch, kvalita uvažovania, tón, interpretácia pravidiel), ktoré nemožno deterministicky bodovať. Možno budete potrebovať škálovateľnú spätnú väzbu pre množstvo variantov príkazov/modelov a zároveň definovať jasnú hodnotiacu rubriku a schému štruktúrovaného výstupu. Aby vám tento prístup fungoval, postupujte takto:

  • Explicitne definujte rozmery hodnotiacej rubriky: správnosť, oporu vo faktoch, súlad s pravidlami, praktickú využiteľnosť a tón.

  • Na odpovede hodnotiteľa používajte štruktúrované výstupy (schému JSON).

  • Na analýzu zlyhaní zaznamenávajte binárne skóre kontrolných podmienok aj diagnostický text.

  • V každom cykle vydania kalibrujte výstupy hodnotiteľa podľa vzoriek označených ľuďmi.

  • V oblastiach s vysokými rizikami používajte dvojicu hodnotiteľov alebo pravidelné kontroly zhody.

  • Dlhodobo sledujte odchýlky hodnotiteľa a mieru nezhody.

Nestraťte sa v benchmarkoch

Dátový súbor benchmarku je pevne stanovená, starostlivo zostavená množina testovacích príkladov so známymi odpoveďami, ktorá slúži na konzistentné hodnotenie modelov a spravodlivé porovnávanie výsledkov medzi verziami. Zvyčajne obsahuje vstupy (napr. otázky používateľov), očakávané výstupy alebo referenčné posudky a hodnotiace kritériá/štítky na bodovanie. Testy z verejných benchmarkov slúžia na porovnávanie výkonu najmodernejších modelov a pri návrhu systému môžu poskytnúť úvodnú orientáciu v tom, ktorý model by mohol byť vhodným kandidátom.

Pri vlastnom systéme sa však na tieto benchmarky nemôžete spoliehať ako na zástupný ukazovateľ výkonu v kontexte svojej firmy, pretože majú známe nedostatky:

  • Kontaminácia: Modely mohli byť trénované na údajoch benchmarku. Hodnotenie na rovnakom dátovom súbore sa potom podobá známkovaniu s ťahákom.

  • Nasýtenie: Všetky špičkové modely už dosahujú takmer maximálne skóre, takže zlepšenie či zhoršenie výkonu je obmedzené na niekoľko percentuálnych bodov a často spadá do prirodzenej variability výsledkov testu.

  • Úzky rozsah: Údaje benchmarku neodrážajú vaše skutočné úlohy, pretože sú veľmi starostlivo vybrané a vyčistené. Niektoré dokonca generujú LLM, takže neodrážajú zložitosť a hraničné prípady vo vašich údajoch (preklepy, nezvyčajné formulácie, zašumené obrázky).

Príklad: doučovateľ matematiky s AI, ktorý pomáha žiakom

Žiak požiada aplikáciu o pomoc s riešením slovných úloh.

Príklad použiteľného verejného benchmarku: GSM8K (matematické uvažovanie na úrovni základnej školy)

  • Voliteľná náročnejšia množina: MATH.

Prečo je tento benchmark užitočný:

  • Umožňuje rýchlo porovnať, ktorý model je lepší vo všeobecnom matematickom uvažovaní,

  • Je vhodným prvým filtrom pred investovaním do úplného hodnotenia produktu.

Prečo stále potrebujete vlastný dátový súbor:

Vaša aplikácia má požiadavky, ktoré GSM8K netestuje:

  • Formulácie a poradie tém vo vašich učebných osnovách,

  • Štýl vysvetľovania vhodný pre vašu vekovú skupinu,

  • Spôsob riešenia nejednoznačných otázok žiakov alebo otázok s množstvom preklepov,

  • Pravidlá (napr. kedy poskytnúť pomôcku a kedy úplnú odpoveď).

Účinné overovanie závisí od vytvorenia hodnotiacich benchmarkov špecifických pre vašu aplikáciu. Tieto dátové súbory by mali vychádzať zo skutočných interakcií, typických hraničných prípadov a realistických spôsobov zlyhania. Pri zavádzaní nového produktu alebo procesu to môže byť náročná úloha. Vo väčšine prípadov však možno údaje zbierať z existujúceho produktu alebo začať čo najskôr, dokonca už počas úvodnej fázy testovania. Po vytvorení aplikácie by sa tieto benchmarky mali vyvíjať spolu s produktom a postupne získavať bohatší a reprezentatívnejší obsah.

Prípadová štúdia: Tvorba vlastného benchmarku pre asistenta retailového bankovníctva

Bankový chatbot odpovedá na otázky o rozpočtoch, výdavkoch a transakciách. Verejné benchmarky otázok a odpovedí/text-to-SQL nezachytávali hlavné bankové riziká, ako sú SQL injection, únik údajov či prenos kontextu medzi viacerými kolami konverzácie. Vytvorili sme vlastný benchmark, ktorý kopíruje proces agenta tohto produktu.

Súčasti vlastného benchmarku v tejto kódovej báze:

  • Súprava škodlivých príkazov na red teaming zameraná na SQL injection, získavanie osobných identifikačných údajov, prepísanie príkazu a únik medzi reláciami

  • Nulová tolerancia v oblasti bezpečnosti: každý pokus o SQL injection, získanie osobných identifikačných údajov alebo únik medzi reláciami musí byť odmietnutý.

  • Presnosť prenosu kontextu: preformulované otázky musia zachovať zámer používateľa a entity.

Ponaučenie: K tvorbe benchmarku pristupujte ako k funkcii produktu. Súčasný harness dokazuje, že komplexné hodnotenie je zapojené, no rozsah pokrytia a veľkosť vzoriek musia rásť, aby odrážali skutočné bankové riziká (útoky s viacerými zámermi, obchádzanie ochranných mechanizmov a otázky závislé od kontextu). Benchmark by sa mal rozširovať spolu s novými agentmi a ochrannými mechanizmami.

Hodnotenia na nájdenie správnej rovnováhy: požadovaný výkon s čo najmenším modelom

Prepojenie benchmarku špecifického pre aplikáciu s výberom modelu je rozhodujúce. Benchmark neukáže len to, či riešenie funguje, ale aj ktorá kombinácia veľkosti modelu a techník následného trénovania poskytne požadovaný výkon s najlepšími nákladmi. Najvýraznejšie zlepšenia predtrénovaných modelov (písmená „PT“ v názve ChatGPT) neprináša opätovné trénovanie, ale metódy "následného trénovania".

Tieto metódy sa zameriavajú na to, ku ktorým informáciám má model prístup, ako sú štruktúrované a ako je model pri inferencii usmerňovaný a koordinovaný. Techniky následného trénovania zahŕňajú:

  • Zadávanie príkazov na reťazenie myšlienok a dynamické prideľovanie výpočtového výkonu (pri náročnejších problémoch model uvažuje dlhšie)

  • Vnútornú konzistentnosť, pri ktorej sa vygeneruje viacero výstupov a vyberie sa najlepší

  • Tvorbu a koordináciu kontextu, napríklad generovanie rozšírené o vyhľadávanie (RAG), príklady s niekoľkými ukážkami a pracovné postupy založené na agentoch

  • Používanie nástrojov a prístup k externým znalostiam, ktoré modelu umožňujú konať nad rámec jeho interných parametrov

  • Stratégie reprezentácie a ukladania znalostí navrhnuté na efektívne vyhľadávanie a uvažovanie nad štruktúrovanými aj neštruktúrovanými údajmi

Hoci tieto techniky následného trénovania môžu výrazne zlepšiť výkon systému, prinášajú aj určité kompromisy. Každá ďalšia vrstva koordinácie, vyhľadávania alebo uvažovania zvyšuje zložitosť systému, čas inferencie a prevádzkové náklady. Premyslene zvolená kombinácia techník následného trénovania však často umožňuje používať menšie, rýchlejšie a lacnejšie modely a pritom stále spĺňať požiadavky na výkon. Namiesto zväčšovania modelu sa výkon dosahuje lepším návrhom systému.

Nájdenie tejto rovnováhy je vždy špecifické pre konkrétnu aplikáciu a optimálnu kombináciu techník by mali určovať hodnotenia vytvorené priamo pre ňu. Pomôžu vám určiť bod, v ktorom už ďalšia koordinácia neprináša významné zlepšenie, takže tímy môžu zvoliť minimálnu zložitosť následného trénovania potrebnú na dosiahnutie cieľového výkonu.

Postupujte rýchlo, no hodnotenia robte premyslene

Riešenie AI treba vnímať ako celý systém: databázy, API, používateľské rozhrania, koordinačné vrstvy, monitorovaciu infraštruktúru a ďalšie súčasti. Hodnotenie preto musí zahŕňať celý technologický zásobník. Kľúčové časti systému by ste mali monitorovať, aby ste mali prehľad o možných problémoch a mohli zodpovedne zrýchľovať vývoj.

Monitorovanie kľúčových častí systému znamená:

  • Vybaviť procesy nástrojmi na získavanie merateľných výsledkov.

  • Protokolovať experimenty, aby ste videli vplyv každej úpravy.

  • Pred nasadením významných zmien používať jednoduché A/B porovnania na odhalenie možných regresií.

Iterácie založené na údajoch skracujú cestu od prototypu k produkcii bez toho, aby vznikali slepé miesta. Protokolovanie a monitorovanie sú dôležité aj na pochopenie používania aplikácie v praxi. Príklad zabezpečenia pozorovateľnosti:

  • Krok 1: Prichádza požiadavka používateľa s request_id, user_segment, intent.

  • Krok 2: Trasovanie zaznamená verziu modelu, verziu príkazu, vyhľadané dokumenty a volania nástrojov.

  • Krok 3: Hodnotiteľ LLM oboduje odpoveď (správnosť, opora vo faktoch, policy_risk).

  • Krok 4: Modul pravidiel vyhodnotí prahové hodnoty.

  • Krok 5: Ak sa prekročí prahová hodnota, spustí sa upozornenie a požiadavka sa presmeruje na záložné riešenie/ľudskú kontrolu.

  • Krok 6: Zlyhanie sa pridá do frontu na triedenie a následne do zoznamu úloh pre benchmark.

Trasovanie Langfuse pre asistenta zásad vrátenia tovaru, ktoré zobrazuje tok požiadavky, nástroje na vyhľadávanie a pravidlá, hodnotenie kvality odpovede, kontrolnú bránu kvality, metadáta bodovania a vygenerovanú odpoveď.

Skutoční používatelia sa málokedy správajú presne tak, ako návrhári očakávajú. Niektorí nesprávne pochopia pokyny. Iní budú zámerne skúšať slabé miesta. Tieto hraničné prípady nie sú anomáliami, ale neoceniteľnými signálmi. Dobre implementovaný proces hodnotenia ich zachytáva, analyzuje a zahŕňa do budúcich testov. Rýchle iterácie bez slepých miest sú možné len vtedy, keď je hodnotenie zabudované priamo do systému, nie pridané až po dokončení vývoja.

Od prvého dňa odporúčame začleniť ochranné mechanizmy a monitorovanie:

  • Pravidelne sledujte metriky a regresie modelu pomocou benchmarku špecifického pre vašu aplikáciu.

  • Zaznamenávajte a kontrolujte hraničné prípady alebo nepriateľské vstupy (a pridávajte ich do dátového súboru benchmarku špecifického pre aplikáciu).

  • Zaistite súlad týchto hodnotiacich metrík s vašimi kľúčovými KPI.

  • Pravidelne preverujte svoj dátový súbor a benchmark, aby ste neprehliadali nové riziká ani nepodliehali skresleniam.

  • Implementujte automatické upozornenia na zhoršenie metrík (napr. ak presnosť klesne pod 85 %, spustite kontrolu).

  • Pri rozhodnutiach s vysokými rizikami zachovajte proces ľudskej kontroly (právne poradenstvo, zdravotné usmernenia, finančné transakcie).

Hodnoťte zodpovedne: energia, náklady a súlad s predpismi

Každé spustenie benchmarku spotrebúva výpočtový výkon a energiu. Každý nadbytočný experiment zvyšuje náklady. Zodpovedné hodnotenie by malo vyvažovať dôslednosť a efektívnosť.

Nekontrolovanému rastu spotreby energie a nákladov možno predísť praktickými krokmi:

  • Ak je to možné, používajte menšie modely: úvodné experimenty spúšťajte na lacnejších modeloch a prejdite na väčšie až po overení prístupu.

  • Ukladajte príkazy a volania API do vyrovnávacej pamäte.

  • Používajte plánovanie s ohľadom na energiu (dávkové spracovanie, spotové inštancie, flexibilná priorita).

  • Popri výkone sledujte aj využívanie výpočtových zdrojov.

Rovnako pozorne sledujte vznikajúce predpisy týkajúce sa AI. Aj keď neexistuje osobitný zákon, naďalej sa uplatňujú existujúce rámce a potrebné opatrenia, napríklad:

Ochrana údajov:

  • Zaistite, aby dátové súbory benchmarkov bez náležitého súhlasu neobsahovali osobné identifikačné údaje

  • Zaveďte pravidlá uchovávania údajov pre protokolované otázky

  • Poskytnite mechanizmy na podávanie žiadostí o vymazanie údajov

Rovnosť a skreslenie:

  • Testujte výkon v rôznych demografických skupinách

  • Pri tvorbe benchmarku zaistite rozmanité zastúpenie

Ľudské práva a transparentnosť:

  • Jasne zdokumentujte obmedzenia modelu pre používateľov

  • Poskytnite vysvetlenia rozhodnutí s vysokými rizikami

  • Umožnite ľudský dohľad nad kritickými aplikáciami

Záver: od hodnotenia k vývoju

Hodnotenie nie je jednorazová udalosť, ale vyvíjajúci sa systém. V rýchlo sa meniacom odbore spočíva vaša výhoda v tom, ako rýchlo dokážete testovať, učiť sa a prispôsobovať, aby ste mohli účinnejšie nasadzovať modely a nové riešenia.

Začlenením hodnotenia medzi kľúčové činnosti vývoja a produktového riadenia môžu tímy inovovať rýchlejšie a bezpečnejšie. Najprv definujte, ako vyzerá dobrý výsledok v kontexte vašej aplikácie AI, vytvorte platformu na hodnotenie a ďalej ju rozvíjajte. Získate tak benchmark špecifický pre svoju aplikáciu, ktorý pri každej iterácii potvrdí pripravenosť na produkciu.

Autori

Fatemeh Tahavori a Romain Bourboulou