Meski model fondasi telah meningkat, perubahan utama yang memungkinkan penggunaan di produksi dengan penuh keyakinan berasal dari praktik evaluasi yang disiplin
Evaluasi yang dirancang dengan baik membantu manajer produk, pimpinan tata kelola AI, dan CTO menerapkan agen AI secara aman dalam skala besar, mengubah AI dari sekadar mainan yang terisolasi menjadi keunggulan kompetitif.
Keyakinan itu berasal dari evaluasi perilaku agen AI berdasarkan pertanyaan pengguna nyata, kasus ekstrem, dan skenario khusus domain yang mencerminkan konteks bisnis Anda sebenarnya; bukan dari tolok ukur publik yang menyatakan ‘model ini yang terbaik’
Tujuannya adalah membuktikan keyakinan tersebut melalui hasil yang terukur. Keberhasilan berarti mendefinisikan "baik" secara konkret dan terukur, selaras dengan kebutuhan bisnis serta toleransi risiko Anda—baik dalam hal akurasi fakta, nada yang sesuai, kecepatan, maupun efisiensi biaya.
Dengan menyertakan evaluasi di seluruh sistem Anda (instrumentasi, pencatatan log, pengujian A/B, pagar pengaman) serta menyeimbangkan ketelitian dan efisiensi, tim dapat meningkatkan kecepatan penerapan dan ketangguhan sistem.
Sebagian besar bisnis tidak keberatan jika karyawannya bereksperimen dengan ChatGPT atau Gemini. Namun, penggunaan LLM dalam alur kerja atau situasi berisiko tinggi masih relatif jarang.
Alasannya sering kali masuk akal: kualitasnya tidak konsisten, sedangkan risiko halusinasi atau perilaku yang tidak diinginkan lebih besar daripada potensi manfaat teknologi tersebut.
Keseimbangan antara risiko dan manfaat itu telah berubah secara signifikan dalam setahun terakhir. Sebagian perubahan ini dapat dikaitkan dengan peningkatan kinerja model fondasi, tetapi sebagian besar berasal dari meningkatnya kedisiplinan dalam evaluasi (atau “eval”). Evaluasi memberi kami dan klien kami keyakinan untuk menerapkan agen berskala besar yang berinteraksi dengan klien hanya dalam hitungan minggu.
Panduan ini akan menjelaskan unsur dasar evaluasi serta cara merancang, menerapkan, dan mengoperasikannya untuk kasus penggunaan produksi.
Tujuan evaluasi bukanlah menemukan model sempurna, melainkan membangun keyakinan yang beralasan bahwa perilaku model Anda selaras dengan kebutuhan bisnis, harapan pengguna, dan toleransi risiko organisasi Anda.
Landasan setiap strategi evaluasi adalah satu pertanyaan sederhana: Seperti apa yang disebut “baik”? Jawabannya harus spesifik. Bagi suatu organisasi, “baik” mungkin berarti akurasi fakta dalam batas toleransi yang ketat; bagi organisasi lain, prioritasnya mungkin kecepatan, efisiensi biaya, atau gaya bahasa yang khas. Setiap kendala yang Anda hadapi, mulai dari data apa yang boleh digunakan hingga kewajiban regulasi yang berlaku, turut membentuk definisi ini.
Yang terpenting, 'baik' harus memiliki komponen yang benar-benar dapat diukur. Jika keberhasilan berarti memberikan panduan keuangan yang bermanfaat, manfaat tersebut perlu dijabarkan melalui atribut: kebenaran fakta, penafian yang sesuai, penalaran yang dipersonalisasi, dan batasan yang aman. Setelah ‘baik’ didefinisikan secara terukur, pertanyaan berikutnya adalah bagaimana Anda akan menganalisis dan menafsirkan hasilnya. Menindaklanjuti hasil inilah yang menjadikan evaluasi sebuah metode, bukan sekadar pengambilan keputusan berdasarkan penilaian subjektif.
Setiap alur evaluasi bertumpu pada tiga pilar yang saling terkait:
Input/Tolok ukur: Contoh representatif dari dunia nyata untuk mengukur kinerja umum dan set data internal pilihan untuk menguji kelayakan dalam domain terkait.
Perilaku Model: Cara model dipanggil (pembuatan berbantuan pengambilan, peringkasan, pengambilan informasi terstruktur, penggunaan alat).
Metrik: Cara Anda mengukur dan menafsirkan kinerja.
Input harus merepresentasikan dunia yang akan dihadapi sistem Anda. Wawasan paling bermakna berasal dari contoh nyata: pertanyaan pelanggan, skenario keuangan, atau kasus khusus industri Anda. Hanya dengan mengujinya terhadap contoh tersebut, Anda dapat memahami apakah model benar-benar menangkap nuansa yang dibutuhkan pengguna dan memenuhi kebutuhan bisnis.
Perilaku model—seperti cara pemberian prompt, pengaturan pengambilan atau penggunaan alat, serta penyediaan konteks—sama pentingnya dengan model itu sendiri. Dua model yang identik dapat berperilaku sangat berbeda, tergantung pada cara penerapannya. Karena itu, lapisan ini harus disertakan dalam rancangan evaluasi Anda.
Terakhir, ada metrik. Angka saja jarang menggambarkan keseluruhan situasi, tetapi metrik yang dipilih dengan baik membuat perilaku sistem dapat dipahami. Latensi, akurasi, keamanan, koherensi, bias, biaya, dan kepuasan pengguna secara bersama-sama membentuk gambaran multidimensi tentang sistem di lingkungan produksi. Kuncinya adalah memilih metrik yang selaras dengan KPI proyek atau bisnis Anda dan menyoroti kualitas yang paling penting bagi pengguna. Metrik yang lebih sederhana sering kali lebih akurat dan lebih murah, sedangkan pemilihan metrik yang buruk dapat menyesatkan tim. Berikut cara mempertimbangkan pemilihan metrik:
Contoh pemilihan metrik yang baik:
Chatbot layanan pelanggan: Tingkat penyelesaian pada kontak pertama (apakah masalah pengguna terselesaikan tanpa eskalasi?), waktu penanganan rata-rata, skor kepuasan pengguna, tingkat eskalasi kepada agen manusia
Alat riset keuangan: Akurasi kutipan (% klaim dengan sumber yang tepat), ketepatan fakta yang divalidasi terhadap fakta acuan, relevansi pengambilan (apakah dokumen yang tepat ditemukan?), koherensi penalaran yang dinilai pakar domain
Asisten pembuatan kode: Ketepatan sintaks, tingkat kelulusan pengujian, jumlah kerentanan keamanan, waktu hingga solusi berfungsi
Contoh pemilihan metrik yang buruk:
Hanya menggunakan panjang respons sebagai indikator kualitas (lebih panjang ≠ lebih baik)
Mengukur kecepatan tanpa mempertimbangkan kompromi terhadap akurasi
Melacak skor keyakinan model tanpa memvalidasinya terhadap kebenaran aktual
Hanya mengandalkan perplexity internal model tanpa validasi dari sisi pengguna
Kesalahan umum terkait metrik yang perlu dihindari:
Metrik yang bertentangan: Mengoptimalkan kecepatan dan kelengkapan secara bersamaan tanpa mengakui adanya kompromi
Penyesuaian berlebihan terhadap tolok ukur: Meraih 95% pada set pengujian, tetapi gagal di produksi karena perilaku pengguna nyata berbeda
Bagi salah satu klien layanan keuangan yang sangat teregulasi, akurasi dalam solusi riset mendalam mereka merupakan prioritas utama. Kami merancang set data tanya-jawab buatan pakar yang dipadukan dengan set data buatan alat. Dengan begitu, kami dapat menilai ketepatan, kemampuan sistem memilih alat dan mengambil informasi yang tepat, serta memperoleh gambaran seimbang tentang akurasi dan kualitas penalaran. Kuncinya adalah mengukur berbagai dimensi: akurasi fakta (validasi pakar), kualitas pengambilan (presisi/recall dokumen relevan), dan koherensi penalaran (evaluasi terstruktur terhadap alur logis).
Kapan menggunakan LLM-sebagai-penilai untuk kualitas yang bernuansa
LLM-sebagai-penilai menggunakan model AI kedua sebagai evaluator, menggantikan tinjauan manusia dengan penilaian kualitas otomatis yang dapat diskalakan. LLM-sebagai-penilai sering disalahgunakan ketika metrik yang lebih sederhana sudah dapat memberikan akurasi yang dibutuhkan. Pendekatan ini berguna ketika pemeriksaan deterministik tidak dapat menangkap kualitas, misalnya saat metrik bersifat semantik (kebermanfaatan, keterikatan pada sumber, kualitas penalaran, nada, interpretasi kebijakan) dan penilaian deterministik tidak memungkinkan. Anda mungkin memerlukan umpan balik yang dapat diskalakan untuk banyak variasi prompt/model, sekaligus menetapkan rubrik yang jelas dan skema output terstruktur. Agar pendekatan ini efektif, ikuti langkah-langkah berikut:
Tentukan dimensi rubrik secara eksplisit: kebenaran, keterikatan pada sumber, kepatuhan kebijakan, kemudahan ditindaklanjuti, dan nada.
Gunakan output terstruktur (skema JSON) untuk respons penilai.
Rekam skor gerbang biner dan teks diagnostik untuk analisis kegagalan.
Kalibrasikan output penilai terhadap sampel berlabel manusia pada setiap siklus rilis.
Gunakan dua penilai atau pemeriksaan konsensus berkala untuk domain berisiko tinggi.
Pantau penyimpangan penilai dan tingkat ketidaksepakatan dari waktu ke waktu.
Set data tolok ukur adalah kumpulan tetap berisi contoh pengujian pilihan dengan jawaban yang diketahui, yang digunakan untuk mengevaluasi model secara konsisten dan membandingkan hasil antarversi secara adil. Set data ini biasanya mencakup input (misalnya pertanyaan pengguna), output yang diharapkan atau penilaian acuan, serta kriteria/label evaluasi untuk pemberian skor. Pengujian tolok ukur publik digunakan untuk membandingkan kinerja model mutakhir dan dapat menjadi rujukan awal saat merancang sistem guna menentukan model yang berpotensi cocok digunakan.
Namun, untuk sistem Anda sendiri, tolok ukur ini tidak dapat dijadikan indikator kinerja dalam konteks bisnis karena memiliki sejumlah masalah yang telah diketahui:
Kontaminasi: Model mungkin dilatih menggunakan data tolok ukur; mengevaluasinya dengan set data yang sama ibarat menilai ujian dengan contekan.
Saturasi: Semua model teratas telah mencapai skor maksimal sehingga peningkatan/penurunan kinerja hanya beberapa poin persentase dan sering masih dalam variasi alami hasil pengujian.
Cakupan sempit: Data tolok ukur tidak mencerminkan tugas nyata Anda karena telah melalui proses seleksi dan pembersihan yang ketat. Sebagian bahkan dihasilkan oleh LLM dan tidak mencerminkan kompleksitas serta kasus ekstrem dalam data Anda (salah ketik, ungkapan yang tidak biasa, gambar dengan derau).
Seorang siswa meminta aplikasi membantu menyelesaikan soal cerita.
Contoh tolok ukur publik yang dapat digunakan: GSM8K (penalaran matematika tingkat sekolah dasar)
Set opsional yang lebih sulit: MATH.
Alasan tolok ukur ini berguna:
Membandingkan dengan cepat model mana yang lebih baik dalam penalaran matematika umum,
Menjadi penyaring awal yang baik sebelum berinvestasi dalam evaluasi produk secara menyeluruh.
Alasan Anda tetap memerlukan set data sendiri:
Aplikasi Anda memiliki persyaratan yang tidak diuji oleh GSM8K:
Redaksi kurikulum dan urutan topik Anda,
Gaya penjelasan untuk kelompok usia Anda,
Cara menangani pertanyaan siswa yang ambigu atau penuh salah ketik,
Aturan kebijakan (misalnya kapan memberikan petunjuk atau jawaban lengkap).
Validasi yang efektif bergantung pada pembuatan tolok ukur evaluasi khusus aplikasi Anda. Set data ini sebaiknya berasal dari interaksi nyata, kasus ekstrem yang umum, dan kemungkinan mode kegagalan. Ini dapat menjadi tugas yang sulit ketika menerapkan produk atau proses baru. Namun, dalam kebanyakan kasus, data dapat dikumpulkan dari produk yang sudah ada atau sedini mungkin, bahkan selama tahap pengujian awal. Setelah aplikasi dikembangkan, tolok ukur ini harus ikut berkembang bersama produk agar makin kaya dan representatif dari waktu ke waktu.
Studi kasus: Membuat tolok ukur khusus untuk asisten perbankan ritel
Chatbot perbankan menjawab pertanyaan tentang anggaran, pengeluaran, dan transaksi. Tolok ukur tanya-jawab publik/text-to-SQL tidak mencakup risiko utama perbankan seperti injeksi SQL, kebocoran data, atau penerusan konteks dalam percakapan multi-giliran. Kami membuat tolok ukur khusus yang mencerminkan alur agen produk ini.
Komponen tolok ukur khusus dalam basis kode ini:
Rangkaian red-team berisi prompt berbahaya untuk injeksi SQL, ekstraksi PII, pengambilalihan prompt, dan kebocoran lintas sesi
Toleransi nol terhadap risiko keamanan: setiap injeksi SQL, ekstraksi PII, atau kebocoran lintas sesi harus ditolak.
Akurasi penerusan konteks: pertanyaan yang ditulis ulang harus mempertahankan maksud pengguna dan entitas.
Inti pelajaran: Perlakukan pembuatan tolok ukur sebagai fitur produk. Harness saat ini membuktikan bahwa evaluasi menyeluruh telah terhubung, tetapi cakupan dan ukuran sampelnya harus diperluas agar mencerminkan risiko perbankan di dunia nyata (serangan multi-maksud, pengelakan pagar pengaman, dan pertanyaan yang bergantung pada konteks). Tolok ukur harus diperluas seiring penambahan agen dan pagar pengaman baru.
Keterkaitan antara tolok ukur khusus aplikasi dan pemilihan model sangatlah penting. Tolok ukur Anda tidak hanya menunjukkan apakah solusi berfungsi, tetapi juga kombinasi ukuran model dan teknik pascapelatihan yang memberikan kinerja sesuai kebutuhan dengan biaya paling efisien. Peningkatan paling kuat pada model pralatih (‘PT’ dalam ChatGPT) bukan berasal dari pelatihan ulang, melainkan metode "pascapelatihan".
Metode ini berfokus pada penentuan informasi yang dapat diakses model, cara informasi tersebut disusun, serta cara model dipandu dan diorkestrasi saat inferensi. Teknik pascapelatihan seperti:
Pemberian prompt rantai pemikiran dan alokasi komputasi dinamis (berpikir lebih lama untuk masalah yang lebih sulit)
Konsistensi mandiri, yaitu menghasilkan beberapa output lalu memilih yang terbaik
Penyusunan dan orkestrasi konteks, seperti Retrieval-Augmented Generation (RAG), contoh few-shot, dan alur kerja berbasis agen
Penggunaan alat dan akses pengetahuan eksternal, yang memungkinkan model bertindak melampaui parameter internalnya
Strategi representasi dan penyimpanan pengetahuan yang dirancang untuk pengambilan efisien serta penalaran atas data terstruktur dan tidak terstruktur
Walaupun teknik pascapelatihan ini dapat meningkatkan kinerja sistem secara signifikan, teknik tersebut juga menimbulkan sejumlah kompromi. Setiap tambahan lapisan orkestrasi, pengambilan, atau penalaran akan meningkatkan kompleksitas sistem, waktu inferensi, dan biaya operasional. Namun, jika diterapkan secara cermat, kombinasi teknik pascapelatihan yang tepat sering memungkinkan penggunaan model yang lebih kecil, cepat, dan murah sambil tetap memenuhi persyaratan kinerja. Alih-alih memperbesar ukuran model, kinerja dicapai melalui rancangan sistem yang lebih baik.
Keseimbangan ini pada dasarnya berbeda untuk setiap aplikasi dan perlu ditentukan menggunakan evaluasi khusus aplikasi guna menemukan perpaduan teknik yang optimal. Evaluasi tersebut membantu Anda menemukan titik ketika orkestrasi tambahan tidak lagi memberikan peningkatan berarti, sehingga tim dapat memilih tingkat kompleksitas pascapelatihan minimum yang diperlukan untuk mencapai target kinerja.
Solusi AI perlu dipandang sebagai satu sistem utuh: basis data, API, antarmuka pengguna, lapisan orkestrasi, infrastruktur pemantauan, dan lainnya. Karena itu, evaluasi harus mencakup seluruh tumpukan teknologi. Anda perlu memantau bagian-bagian utama sistem agar potensi masalah tetap terlihat dan kemajuan dapat dipercepat secara bertanggung jawab.
Pemantauan bagian-bagian utama sistem mencakup:
Melengkapi alur kerja Anda dengan instrumentasi untuk menghasilkan keluaran yang terukur.
Mencatat eksperimen agar Anda dapat melihat dampak setiap penyesuaian.
Menggunakan perbandingan A/B sederhana sebelum menerapkan perubahan besar untuk menguji kemungkinan regresi.
Iterasi berbasis data memperpendek perjalanan dari prototipe ke produksi tanpa menciptakan titik buta. Pencatatan log dan pemantauan juga penting untuk memahami penggunaan aplikasi di dunia nyata. Berikut contoh untuk memastikan observabilitas:
Langkah 1: Permintaan pengguna masuk dengan request_id, user_segment, intent.
Langkah 2: Jejak mencatat versi model, versi prompt, dokumen pengambilan, dan pemanggilan alat.
Langkah 3: Penilai LLM memberi skor pada respons (correctness, groundedness, policy_risk).
Langkah 4: Mesin aturan mengevaluasi ambang batas.
Langkah 5: Jika ambang batas dilanggar, picu peringatan + arahkan ke mekanisme cadangan/tinjauan manusia.
Langkah 6: Kegagalan ditambahkan ke antrean triase, lalu ke backlog tolok ukur.

Pengguna nyata jarang berperilaku persis seperti yang diperkirakan perancang. Sebagian pengguna akan salah memahami petunjuk. Pengguna lain akan sengaja menguji titik lemah. Kasus-kasus ekstrem ini bukan anomali, melainkan sinyal yang sangat berharga. Alur evaluasi yang diterapkan dengan baik akan merekam, menganalisis, dan memasukkannya ke dalam pengujian mendatang. Iterasi cepat tanpa titik buta hanya mungkin jika evaluasi ditanamkan ke dalam sistem, bukan ditambahkan setelah pengembangan selesai.
Kami menyarankan agar pagar pengaman dan pemantauan diterapkan sejak hari pertama:
Pantau metrik dan regresi model secara rutin menggunakan tolok ukur khusus aplikasi Anda.
Rekam dan tinjau kasus ekstrem atau input adversarial (lalu tambahkan ke set data tolok ukur khusus aplikasi Anda).
Pastikan metrik evaluasi ini selaras dengan KPI utama Anda.
Uji set data dan tolok ukur Anda secara rutin untuk memastikan tidak ada risiko baru yang terabaikan atau bias yang memengaruhi hasil.
Terapkan peringatan otomatis untuk penurunan metrik (misalnya, jika akurasi turun di bawah 85%, picu tinjauan).
Pertahankan proses tinjauan manusia untuk keputusan berisiko tinggi (nasihat hukum, panduan medis, transaksi keuangan).
Setiap pelaksanaan tolok ukur mengonsumsi daya komputasi dan energi. Setiap eksperimen yang berlebihan menambah biaya. Evaluasi yang bertanggung jawab harus menyeimbangkan ketelitian dan efisiensi.
Langkah-langkah praktis berikut dapat mencegah energi dan biaya melonjak:
Gunakan model yang lebih kecil bila memungkinkan. Jalankan eksperimen awal pada model yang lebih murah dan tingkatkan skalanya hanya setelah pendekatan tersebut tervalidasi.
Simpan prompt dan panggilan API dalam cache.
Gunakan penjadwalan yang mempertimbangkan energi (pemrosesan batch, instans spot, prioritas fleksibel).
Pantau penggunaan komputasi bersama kinerja.
Selain itu, terus ikuti perkembangan regulasi AI. Meskipun belum ada undang-undang khusus, kerangka hukum yang ada dan langkah-langkah yang diperlukan tetap berlaku, seperti:
Perlindungan data:
Pastikan set data tolok ukur tidak memuat PII tanpa persetujuan yang semestinya
Terapkan kebijakan retensi data untuk pertanyaan yang dicatat
Sediakan mekanisme untuk permintaan penghapusan data
Kesetaraan dan bias:
Uji kinerja pada berbagai kelompok demografis
Libatkan representasi yang beragam dalam pembuatan tolok ukur
Hak asasi manusia dan transparansi:
Dokumentasikan keterbatasan model dengan jelas bagi pengguna
Berikan penjelasan untuk keputusan berisiko tinggi
Aktifkan pengawasan manusia untuk aplikasi kritis
Evaluasi bukanlah kegiatan satu kali, melainkan sistem yang terus berkembang. Dalam bidang yang berkembang pesat, keunggulan Anda terletak pada seberapa cepat Anda dapat menguji, belajar, dan beradaptasi agar model serta solusi baru dapat diterapkan dengan lebih efektif.
Dengan menjadikan evaluasi sebagai aktivitas inti dalam rekayasa dan manajemen produk, tim dapat berinovasi lebih cepat dan lebih aman. Mulailah dengan mendefinisikan seperti apa hasil yang baik dalam konteks aplikasi AI Anda, siapkan platform evaluasi, lalu kembangkan hingga Anda memiliki tolok ukur khusus aplikasi yang memberi keyakinan atas kesiapan produksi pada setiap iterasi.