Navigasi utama

Eval: saka eksperimen AI tumuju produksi kanthi yakin

Sinaua carane evaluasi nutup jurang antarane eksperimen AI lan pemasangan sing andal sarta siyap produksi.

Ringkesan eksekutif

  • Sanajan model dhasar saya apik, owah-owahan utama sing ndadekake panggunaan ing produksi luwih dipercaya asale saka praktik evaluasi sing disiplin

  • Evaluasi sing dirancang kanthi becik mbantu manajer produk, pimpinan tata kelola AI, lan CTO masang agen AI kanthi aman lan ing skala gedhe, saengga AI malih saka dolanan sing kapisah dadi kaunggulan kompetitif.

  • Kapercayan kasebut asale saka evaluasi tumindake agen AI adhedhasar pitakon nyata pangguna, kasus pinggiran, lan skenario khusus domain sing nggambarake konteks bisnis nyata sampeyan; dudu pathokan umum sing nyebut ‘model iki sing paling apik’

  • Tujuane yaiku mbuktekake kapercayan kasebut liwat asil sing bisa diukur. Sukses tegese nemtokake "apik" kanthi nyata lan bisa diukur, selaras karo kabutuhan bisnis lan toleransi risiko sampeyan—apa kuwi akurasi fakta, nada sing trep, kacepetan, utawa efisiensi biaya.

  • Kanthi nanem evaluasi ing saindenging sistem (instrumentasi, pencatatan log, tes A/B, pager pengaman) lan ngimbangi katitisan karo efisiensi, tim bisa masang sistem luwih cepet lan luwih tangguh.

Umume bisnis wis lumrah yen karyawane nyoba-nyoba ChatGPT utawa Gemini. Nanging, panggunaan LLM ing alur kerja utawa kahanan sing risikone gedhe isih luwih arang.

Alesane kerep bisa dibenerake: mutune ora ajeg, lan risiko halusinasi utawa tumindak sing ora dikarepake luwih gedhe tinimbang potensi paedahe teknologi kasebut.

Imbangan risiko lan paedah kasebut wis owah kanthi nyata sajrone setaun kepungkur. Sanajan sapérangan amarga kinerja model dhasar saya apik, akeh owah-owahan iki asale saka saya disipline praktik evaluasi (utawa “eval”). Eval menehi kapercayan marang kita lan klien kanggo masang agen skala gedhe sing langsung digunakake klien mung sajrone sawetara minggu.

Pandhuan iki bakal nerangake unsur dhasar eval, cara ngrancang, ngetrapake, lan ngoperasikake kanggo kasus panggunaan produksi.

Dhasar eval (1): kaya apa wujude sukses?

Tujuan evaluasi dudu nggoleki model sing sampurna, nanging ngasilake kapercayan sing ana buktine yen model sampeyan tumindak selaras karo kabutuhan bisnis, pangajab pangguna, lan toleransi risiko organisasi.

Dhasar saben strategi evaluasi yaiku pitakon prasaja: Kaya apa sing diarani “apik”? Wangsulane kudu mligi. Kanggo sawijining organisasi, “apik” bisa ateges akurasi fakta kanthi wates toleransi sing ketat; kanggo liyane, bisa luwih ngutamakake kacepetan, efisiensi biaya, utawa gaya basa sing khas. Saben watesan sing sampeyan adhepi, wiwit saka data apa sing kena digunakake nganti kewajiban aturan sing ditrapake, melu mbentuk teges iki.

Sing wigati, 'apik' kudu nduweni unsur sing pancen bisa diukur. Yen sukses tegese menehi pandhuan finansial sing migunani, paedahe kudu dijlentrehake liwat atribut: kabeneran fakta, panjelasan tanggung jawab sing trep, nalar sing dipersonalisasi, lan wates sing aman. Sawise ‘apik’ ditetepake kanthi bisa diukur, pitakon sabanjure yaiku kepriye sampeyan bakal nganalisis lan napsirake asile. Nindaklanjuti asil iki sing ngowahi evaluasi dadi sawijining metode, dudu mung nggawe panemu.

Dhasar eval (2): input, tumindake model, lan metrik

Saben alur evaluasi dumadi saka telung pilar sing gegandhengan:

  1. Input/Pathokan: Conto nyata sing makili kinerja umum lan kumpulan data internal sing dikurasi kanggo nguji kelayakan domain.

  2. Tumindake Model: Carane model ditimbali (generasi kanthi panyuwunan informasi, ngringkes, njupuk informasi terstruktur, nggunakake piranti).

  3. Metrik: Carane sampeyan ngukur lan napsirake kinerja.

Input kudu makili kahanan sing bakal diadhepi sistem sampeyan. Wawasan paling migunani asale saka conto nyata: pitakon pelanggan, skenario finansial, utawa kasus khusus industri sampeyan. Mung kanthi nguji adhedhasar conto kasebut, sampeyan bisa mangerteni apa model pancen paham nuansa sing dibutuhake pangguna lan nyukupi kabutuhan bisnis.

Tumindake model—kayata carane diwenehi prompt, carane panyuwunan informasi utawa panggunaan piranti diatur, lan carane konteks diwenehake—padha wigatine karo modele dhewe. Rong model sing padha bisa tumindak beda banget gumantung carane dipasang. Mula, lapisan iki kudu kalebu ing rancangan evaluasi sampeyan.

Pungkasan, ana metrik. Angka wae arang nyritakake kabeh, nanging metrik sing dipilih kanthi becik ndadekake tumindake sistem bisa dimangerteni. Latensi, akurasi, keamanan, koherensi, bias, biaya, lan kepuasan pangguna, yen digabung, menehi gambaran multidimensi babagan sistem ing produksi. Kaprigelane yaiku milih metrik sing selaras karo KPI proyek utawa bisnis lan nuduhake sipat sing paling wigati tumrap pangguna. Metrik sing luwih prasaja kerep luwih akurat lan luwih murah, dene pilihan metrik sing ala bisa nasarake tim. Mangkene cara mikirake pilihan metrik:

Conto pilihan metrik sing apik:

  • Chatbot layanan pelanggan: Tingkat rampunge masalah ing kontak kapisan (apa masalah pangguna rampung tanpa eskalasi?), rata-rata wektu penanganan, skor kepuasan pangguna, tingkat eskalasi menyang agen manungsa

  • Piranti riset finansial: Akurasi kutipan (% klaim kanthi sumber sing bener), katitisan fakta sing divalidasi nganggo bebener acuan, relevansi panyuwunan informasi (apa dokumen sing ditemokake wis bener?), koherensi nalar sing dinilai pakar domain

  • Asisten gawé kode: Kabeneran sintaksis, tingkat lulus tes, cacahing kerentanan keamanan, wektu nganti solusi bisa digunakake

Conto pilihan metrik sing ala:

  • Mung nggunakake dawane wangsulan minangka tandha mutu (luwih dawa ≠ luwih apik)

  • Ngukur kacepetan tanpa nggatekake ijol-ijolan karo akurasi

  • Nglacak skor kapercayan model tanpa mbandhingake karo kabeneran nyata

  • Mung ngandelake perplexity internal model tanpa validasi sing ngadhep pangguna

Jebakan metrik umum sing kudu diendhani:

  • Metrik sing sulaya: Ngoptimalake kacepetan lan jangkepe isi bebarengan tanpa ngakoni ijol-ijolane

  • Kakehan nyocogake karo pathokan: Entuk 95% ing set tes nanging gagal ing produksi amarga tumindake pangguna nyata beda

Kanggo salah siji klien layanan finansial sing aturane ketat, akurasi solusi panaliten jero dadi sing paling utama. Kita ngrancang kumpulan data QA gaweyane pakar sing digabung karo kumpulan data gaweyane piranti. Iki ngidini kita netepake katitisan, kaprigelan sistem milih piranti sing bener, lan njupuk informasi sing bener, saengga menehi gambaran imbang babagan akurasi lan mutu nalar. Kuncine yaiku ngukur pirang-pirang dimensi: akurasi fakta (validasi pakar), mutu panyuwunan informasi (precision/recall dokumen sing relevan), lan koherensi nalar (evaluasi terstruktur tumrap alur logis).

Kapan nggunakake LLM-minangka-juri kanggo mutu sing kebak nuansa

LLM-minangka-juri nggunakake model AI kapindho minangka panilai, ngganti tinjauan manungsa nganggo pambiji mutu otomatis sing bisa diskalakake. LLM-minangka-juri kerep disalahgunakake nalika metrik luwih prasaja bisa menehi akurasi sing dibutuhake. Iki bisa migunani nalika pamriksa deterministik ora bisa nyakup mutu, kayata nalika metrike semantik (paedah, dhasar bukti, mutu nalar, nada, interpretasi kabijakan) lan pambiji deterministik ora bisa ditindakake. Sampeyan bisa uga mbutuhake umpan balik sing bisa diskalakake kanggo akeh variasi prompt/model, uga kudu nemtokake rubrik sing cetha lan skema keluaran terstruktur. Supaya bisa migunani kanggo sampeyan, tindakake langkah iki:

  • Temtokake dimensi rubrik kanthi cetha: kabeneran, dhasar bukti, ketaatan kabijakan, bisa ditindaklanjuti, lan nada.

  • Gunakake keluaran terstruktur (skema JSON) kanggo wangsulan juri.

  • Rekam skor gerbang biner lan teks diagnostik kanggo nganalisis kegagalan.

  • Kalibrasi keluaran juri adhedhasar sampel kanthi label manungsa ing saben siklus rilis.

  • Gunakake juri ganda utawa pamriksa konsensus kanthi ajeg kanggo domain sing risikone gedhe.

  • Lacak owah-owahan juri lan tingkat ora sarujuk saka wektu menyang wektu.

Aja nganti kesasar ing pathokan

Kumpulan data pathokan yaiku kumpulan conto tes sing tetep, dikurasi, lan nduweni wangsulan sing wis dimangerteni, kanggo ngevaluasi model kanthi ajeg lan mbandhingake asil saben versi kanthi adil. Biasane isine input (umpamane pitakon pangguna), keluaran sing dikarepake utawa panemu acuan, lan kriteria/label evaluasi kanggo menehi skor. Tes pathokan umum digunakake kanggo mbandhingake kinerja model paling maju lan bisa dadi rujukan awal nalika ngrancang sistem kanggo nemtokake model sing cocog digunakake.

Nanging, kanggo sistem sampeyan dhewe, pathokan iki ora bisa didadekake wakil kinerja ing konteks bisnis amarga duwe sawetara masalah sing wis dimangerteni:

  • Kontaminasi: Model bisa wae dilatih nganggo data pathokan; ngevaluasi nganggo kumpulan data sing padha kaya menehi nilai nganggo lembar contekan.

  • Saturasi: Kabeh model paling unggul wis nggayuh skor maksimal, mula mundhak utawa mudhune kinerja mung sawetara persen lan kerep isih kalebu variasi alami asil tes.

  • Cakupan winates: Data pathokan ora nggambarake tugas nyata sampeyan amarga dikurasi lan diresiki kanthi ketat. Malah ana sing digawe LLM lan ora bakal nggambarake keruwetan lan kasus pinggiran ing data sampeyan (salah ketik, ungkapan sing ora lumrah, gambar kebak gangguan).

Conto: Tutor matematika AI sing mbantu siswa

Siswa njaluk aplikasi mbantu ngrampungake soal crita.

Conto pathokan umum sing bisa digunakake: GSM8K (nalar matematika tingkat sekolah dhasar)

  • Set sing luwih angel lan opsional: MATH.

Napa pathokan iki migunani:

  • Mbandhingake kanthi cepet model sing luwih apik ing nalar matematika umum,

  • Saringan awal sing apik sadurunge nandur modal ing eval produk kanthi jangkep.

Napa sampeyan isih mbutuhake kumpulan data dhewe:

Aplikasi sampeyan nduweni syarat sing ora diuji GSM8K:

  • Tembung-tembung lan urutan topik ing kurikulum sampeyan,

  • Gaya panjelasan kanggo klompok umur sampeyan,

  • Cara nangani pitakon siswa sing ora cetha utawa akeh salah ketike,

  • Aturan kabijakan (umpamane, kapan menehi pituduh lan kapan menehi wangsulan jangkep).

Validasi sing efektif gumantung marang panggawene pathokan evaluasi khusus aplikasi sampeyan. Kumpulan data iki kudu asale saka interaksi nyata, kasus pinggiran umum, lan kemungkinan cara sistem gagal. Iki bisa dadi tugas angel nalika ngetrapake produk utawa proses anyar. Nanging, ing umume kasus, data bisa diklumpukake saka produk sing wis ana utawa wiwit sakawal-awale, sanajan isih ing tahap tes awal. Sawise aplikasi dikembangake, pathokan iki kudu melu ngrembaka bareng produke, saya suwe saya sugih lan saya makili kahanan nyata.

Studi kasus: Nggawe pathokan khusus kanggo asisten perbankan ritel

Chatbot perbankan njawab pitakon babagan anggaran, pambelanjaan, lan transaksi. Pathokan QA umum/teks menyang SQL ora nyakup risiko utama perbankan kayata injeksi SQL, kebocoran data, utawa penerusan konteks antarane giliran. Kita nggawe pathokan khusus sing nggambarake alur agen produk iki.

Komponen pathokan khusus ing basis kode iki:

  • Rangkaian red-team isi prompt ala kanggo injeksi SQL, ekstraksi PII, pangowahan paksa prompt, lan kebocoran antar-sesi

  • Ora ana toleransi kanggo masalah keamanan: saben injeksi SQL, ekstraksi PII, utawa kebocoran antar-sesi kudu ditolak.

  • Akurasi penerusan konteks: pitakon sing ditulis maneh kudu njaga maksud pangguna lan entitas.

Intine: Anggepen panggawene pathokan minangka fitur produk. Sistem uji saiki mbuktekake yen evaluasi saka wiwitan nganti pungkasan wis kasambung, nanging cakupan lan cacah sampel kudu ditambah supaya nggambarake risiko perbankan nyata (serangan kanthi pirang-pirang maksud, upaya ngliwati pager pengaman, lan pitakon sing gumantung konteks). Pathokan kudu dikembangake bebarengan karo agen lan pager pengaman anyar.

Eval kanggo nemokake imbangan sing pas: nggayuh kinerja sing dikarepake nganggo model paling cilik

Gegayutan antarane pathokan khusus aplikasi lan pilihan model iku wigati banget. Pathokan ora mung nuduhake apa solusi bisa digunakake, nanging uga kombinasi ukuran model lan teknik pascalatihan sing menehi kinerja sing dibutuhake kanthi biaya paling efisien. Panyampurnan paling gedhe tumrap model sing wis dilatih (bagean ‘PT’ ing ChatGPT) ora asale saka latihan maneh, nanging saka metode "pascalatihan".

Metode iki fokus mbentuk informasi sing bisa diakses model, carane informasi kasebut ditata, lan carane model dipandu lan diorkestrasi nalika inferensi. Teknik pascalatihan kayata:

  • Prompt ranté pikiran lan alokasi komputasi dinamis (mikir luwih jero kanggo masalah sing luwih angel)

  • Konsistensi mandiri, yaiku nggawe pirang-pirang keluaran banjur milih sing paling apik

  • Pambangunan lan orkestrasi konteks, kayata Retrieval-Augmented Generation (RAG), conto sithik, lan alur kerja agen

  • Panggunaan piranti lan akses kawruh njaba, sing ndadekake model bisa tumindak ngluwihi parameter internale

  • Strategi representasi lan panyimpenan kawruh sing dirancang supaya panyuwunan informasi lan nalar tumrap data terstruktur lan ora terstruktur luwih efisien

Sanajan teknik pascalatihan iki bisa ningkatake kinerja sistem kanthi nyata, teknik kasebut uga mbutuhake ijol-ijolan. Saben tambahan lapisan orkestrasi, panyuwunan informasi, utawa nalar nambah keruwetan sistem, wektu inferensi, lan biaya operasional. Nanging yen ditrapake kanthi premati, kombinasi teknik pascalatihan sing pas kerep ndadekake kita bisa nggunakake model sing luwih cilik, luwih cepet, lan luwih murah tanpa ngorbanake syarat kinerja. Tinimbang nggedhekake ukuran model, kinerja digayuh liwat rancangan sistem sing luwih apik.

Imbangan iki beda-beda miturut aplikasi lan kudu ditemtokake nganggo eval khusus aplikasi supaya bisa nemokake campuran teknik sing optimal. Eval kasebut ngidini sampeyan nemokake titik nalika tambahan orkestrasi ora maneh menehi asil sing teges, saengga tim bisa milih tingkat keruwetan pascalatihan paling sithik kanggo nggayuh target kinerja.

Obah kanthi cepet, nanging evaluasinen kanthi premati

Solusi AI kudu dianggep minangka sistem wutuh: basis data, API, antarmuka pangguna, lapisan orkestrasi, prasarana ngawasi, lan liya-liyane. Mula, evaluasi kudu nyakup kabeh tumpukan sistem. Sampeyan kudu ngawasi bagean-bagean utama sistem supaya tetep weruh masalah sing bisa muncul lan bisa maju kanthi cepet lan tanggung jawab.

Ngawasi bagean utama sistem ateges:

  • Masang instrumentasi ing alur sistem supaya asile bisa diukur.

  • Nyathet eksperimen supaya sampeyan bisa ndeleng pengaruh saben pangowahan cilik.

  • Nggunakake pambandhing A/B sing prasaja sadurunge masang pangowahan gedhe kanggo nguji kemungkinan regresi.

Iterasi adhedhasar data nyepetake dalan saka prototipe menyang produksi tanpa ana sing kliwatan. Pencatatan log lan ngawasi uga wigati kanggo mangerteni panggunaan nyata aplikasi. Mangkene conto kanggo njamin sistem bisa diamati:

  • Langkah 1: Panjaluk pangguna mlebu karo request_id, user_segment, intent.

  • Langkah 2: Jejak nyathet versi model, versi prompt, dokumen panyuwunan, lan panggilan piranti.

  • Langkah 3: Juri LLM menehi skor wangsulan (correctness, groundedness, policy_risk).

  • Langkah 4: Mesin aturan ngevaluasi ambang.

  • Langkah 5: Yen ambang dilanggar, picu tandha + arahake menyang cadangan/tinjauan manungsa.

  • Langkah 6: Kegagalan dilebokake ing antrean triase, banjur ing dhaptar tunggu pathokan.

Jejak Langfuse kanggo asisten kabijakan retur, nuduhake alur panjaluk, piranti panyuwunan informasi lan aturan, evaluasi mutu wangsulan, gerbang mutu, metadata pambiji, lan wangsulan sing diasilake.

Pangguna nyata arang tumindak persis kaya pangajabe perancang. Ana sing bakal salah mangerteni pandhuan. Liyane bakal sengaja nguji titik sing ringkih. Kasus pinggiran iki dudu anomali, nanging sinyal sing aji banget. Alur evaluasi sing ditrapake kanthi becik bakal ngrekam, nganalisis, lan nglebokake kasus kasebut menyang tes sabanjure. Iterasi cepet tanpa ana sing kliwatan mung bisa kawujud yen evaluasi wis ditanem ing sistem, dudu ditempelake sawise pangembangan.

Kita nyaranake supaya pager pengaman lan ngawasi ditanem wiwit dina kapisan:

  • Lacak metrik lan regresi model kanthi ajeg nggunakake pathokan khusus aplikasi sampeyan.

  • Rekam lan delengen kasus pinggiran utawa input nyerang (lan lebokna menyang kumpulan data pathokan khusus aplikasi).

  • Priksa manawa metrik evaluasi iki selaras karo KPI inti sampeyan.

  • Uji maneh kumpulan data lan pathokan kanthi ajeg kanggo mesthekake sampeyan ora nglirwakake risiko anyar utawa kena bias.

  • Terapake tandha otomatis nalika metrik mudhun (contone, yen akurasi mudhun sangisore 85%, picu tinjauan).

  • Tetep gunakake proses tinjauan manungsa kanggo kaputusan sing risikone gedhe (saran hukum, pandhuan medis, transaksi finansial).

Evaluasi kanthi tanggung jawab: energi, biaya, lan ketaatan

Saben pathokan dilakokake, sumber daya komputasi lan energi digunakake. Saben eksperimen sing ora perlu nambah biaya. Evaluasi sing tanggung jawab kudu ngimbangi katitisan lan efisiensi.

Sawetara langkah praktis bisa ditindakake supaya energi lan biaya ora mundhak tanpa kendhali:

  • Gunakake model sing luwih cilik yen bisa, lakokake eksperimen awal ing model sing luwih murah lan tambah skalane mung sawise pendekatane kabukten bener.

  • Simpen prompt lan panggilan API ing cache.

  • Gunakake jadwal sing nggatekake energi (pamrosesan batch, spot instance, prioritas fleksibel).

  • Lacak panggunaan komputasi bebarengan karo kinerja.

Kajaba iku, terus gatenana peraturan AI sing lagi muncul. Sanajan durung ana undang-undang mligi, kerangka sing wis ana lan langkah-langkah sing perlu tetep ditrapake, kayata:

Pangreksan data:

  • Priksa manawa kumpulan data pathokan ora ngemot PII tanpa idin sing sah

  • Terapake kabijakan panyimpenan data kanggo pitakon sing dicathet

  • Wenehana mekanisme kanggo panjaluk mbusak data

Kesetaraan lan bias:

  • Uji kinerja ing maneka klompok demografi

  • Lebokna perwakilan sing maneka warna nalika nggawe pathokan

Hak asasi manungsa lan transparansi:

  • Dokumentasikna watesan model kanthi cetha kanggo pangguna

  • Wenehana panjelasan kanggo kaputusan sing risikone gedhe

  • Aktifna pangawasan manungsa kanggo aplikasi kritis

Panutup: saka evaluasi tumuju evolusi

Evaluasi dudu kegiyatan sapisan, nanging sistem sing terus ngrembaka. Ing bidang sing owah kanthi cepet, kaunggulan sampeyan gumantung ing sepira cepete sampeyan bisa nguji, sinau, lan nyelarasake, supaya bisa masang model lan solusi anyar kanthi luwih efektif.

Kanthi ndadekake evaluasi minangka kegiyatan inti ing rekayasa lan manajemen produk, tim bisa gawe inovasi luwih cepet lan luwih aman. Wiwitana kanthi nemtokake kaya apa sing diarani apik ing konteks aplikasi AI sampeyan, gawe platform evaluasi, banjur terus kembangake supaya sampeyan nduweni pathokan khusus aplikasi sing menehi kapercayan tumrap kesiapan produksi ing saben iterasi.

Para panulis

Fatemeh Tahavori, Romain Bourboulou