Navigasi utama

Membangun agen chat yang aman untuk bisnis berisiko tinggi

Saat membuat chatbot yang mewakili merek Anda, keamanan saja tidak cukup—chatbot tersebut juga harus benar-benar mencerminkan karakter Anda.

Ringkasan eksekutif

  • Aplikasi LLM yang dapat diakses publik bisa menimbulkan risiko reputasi dan finansial bagi merek.

  • Kami menggunakan filter klasifikasi berlapis untuk mengurangi dampak buruk jailbreak dan perilaku LLM lain yang tidak diinginkan.

  • Kami telah menerapkannya pada aplikasi produksi bervolume tinggi yang menangani 40.000 pesan per hari—dan jumlahnya terus meningkat.

Pendahuluan

Selama setahun terakhir, kami bermitra dengan pengembang game terkemuka untuk menghadirkan chatbot GenAI yang menangani sekitar 40.000 pesan per hari dari para pemain, termasuk anak-anak. Menyeimbangkan kecepatan, akurasi, keamanan, dan keseruan sangatlah penting:

Saat membuat chatbot yang mewakili merek Anda, keamanan saja tidak cukup—chatbot tersebut juga harus benar-benar mencerminkan karakter Anda.

Bagi perusahaan game, ini berarti memadukan keamanan dengan keseruan dan antusiasme pengguna—terutama untuk audiens yang lebih muda.

LLM yang mendasari aplikasi GenAI modern sangat fleksibel—itulah sebabnya LLM dapat digunakan untuk begitu banyak masalah—tetapi juga tidak memiliki batasan yang memadai. Artinya, LLM sering kali dapat menyimpang dari jalur dan menghasilkan beragam teks, yang sebagian mungkin tidak pantas.

Memberikan akses langsung ke LLM kepada publik pasti akan memunculkan perilaku tak terduga dan, tanpa mitigasi yang tepat, dapat menimbulkan risiko berikut:

Sekilas tentang risiko di dunia nyata…

Berita utama akibat penggunaan LLM yang tidak semestinya:

Insiden-insiden ini menegaskan bahwa membangun dan mempertahankan keamanan dalam sistem GenAI bukanlah pilihan. Hal ini terutama berlaku jika melibatkan anak kecil. Pernyataan penyangkalan saja tidak cukup—pagar pengaman yang tangguh sangat penting untuk menjaga agar konten tetap pantas.

Pendekatan kami: klasifikasi berlapis dan caching prompt

Seperti sistem RAG (Retrieval-Augmented Generation) yang kami bangun untuk klien, kami memanfaatkan beberapa komponen AI untuk mengurangi risiko jailbreak sekaligus mempertahankan performa tinggi.

Diagram pendekatan kami: klasifikasi berlapis dan caching prompt.

Diagram arsitektur sederhana sistem kami

Untuk memastikan keamanan sistem, kami menggunakan pengklasifikasi LLM pada input dan output:

  1. Klasifikasi Input (berjalan secara bersamaan)

  • Kami menggunakan skema Pydantic bersama output terstruktur LLM untuk memberi label pada kueri pengguna (misalnya SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, dan sebagainya). Ini juga mencakup penanda untuk mengidentifikasi jailbreak atau perilaku terlarang.

  • Penggunaan beberapa pengklasifikasi untuk setiap topik menghasilkan performa yang jauh lebih baik daripada satu pengklasifikasi besar yang mencoba menangani semuanya.

  • Banyak contoh few-shot sangat penting agar pengklasifikasi dapat membedakan antara “I keep being killed by this character” (merujuk pada game) dan “I am being hurt by my parent” (indikasi bahaya terhadap anak).

  • Kolaborasi erat dengan klien serta tim khusus kepercayaan dan keamanan mereka memastikan bahwa pengklasifikasi kami mencerminkan cara mereka menilai pesan berisiko tinggi dalam situasi nyata.

Diagram pendekatan kami: klasifikasi berlapis dan caching prompt.

  1. Pembuatan Respons

  • LLM utama menghasilkan respons jika input dianggap aman.

  • Jika tidak, pesan dapat diabaikan (untuk jailbreak) atau diteruskan kepada manusia (jika kueri menandakan masalah keamanan).

  1. Klasifikasi Output

  • Sebelum respons keluar dari aplikasi kami dan dikirimkan kepada pengguna, kami mengklasifikasikan respons model terlebih dahulu.

  • Karena sebagian respons dapat menggunakan teknik RAG dengan data yang diambil dari internet, langkah ini melindungi kami dari peracunan data.

  • Jika respons memuat konten terlarang, sistem akan melakukan intervensi dan menggantinya dengan pesan umum. Dalam praktiknya, hal ini jarang terjadi, tetapi lapisan pengamanan konservatif ini membantu memastikan perilaku agen tetap pantas.

Untuk menjaga kecepatan dan keterjangkauan:

  • Kami menyimpan prompt yang umum digunakan dan dialog parsial, beserta kumpulan contoh few-shot yang telah dikurasi.

  • Caching ini memungkinkan kami menerapkan pengklasifikasi LLM dengan cepat dan murah, tanpa harus membangun ulang konteks setiap kali.

Diagram pendekatan kami: klasifikasi berlapis dan caching prompt.

Menatap masa depan: pengklasifikasi konstitusional

Studi terbaru oleh Anthropic menjelaskan Pengklasifikasi Konstitusional—sistem yang mengandalkan pengklasifikasi tambahan yang dilatih dengan aturan “konstitusional” untuk mendeteksi permintaan berbahaya atau tidak aman. Mereka melaporkan:

  • Ketangguhan tinggi dalam menghadapi ribuan jam red teaming oleh manusia.

  • Tingkat penolakan berlebihan yang minimal dan beban komputasi tambahan yang moderat.

Kami melihat masa depan ketika pendekatan konstitusional ini dapat melengkapi atau bahkan menggantikan lapisan klasifikasi tradisional—memberikan perlindungan yang lebih menyeluruh terhadap taktik jailbreak yang terus berkembang.

Ringkasan: pelajaran yang kami petik

  1. Filter Ringan yang Berjalan Paralel

Lapisan klasifikasi mencegah kueri berbahaya mencapai inti generatif serta memastikan output buruk tidak pernah dikirimkan.

  1. Pengalaman Pengguna Itu Penting

Dengan menggunakan peringatan seru yang selaras dengan latar cerita serta penolakan yang jenaka, pengguna lebih bersedia menerima batasan sistem.

  1. Jangan Mengambil Jalan Pintas dalam Pengujian dan Pemantauan

Red teaming secara rutin, disertai pemantauan berkala terhadap perilaku pemain, akan membantu menemukan kerentanan sebelum diketahui oleh komunitas pemain secara luas. Temuan tersebut kemudian dapat dimasukkan kembali ke dalam prompt pengklasifikasi few-shot agar tidak dapat dieksploitasi lagi di kemudian hari. Saat ini proses tersebut masih dilakukan secara manual, tetapi dapat diotomatisasi.

Membangun sistem GenAI masa depan yang aman dan menarik

Baik Anda perusahaan game, bank, maupun instansi pemerintah, jika ingin menerapkan chatbot layanan pelanggan dalam skala besar, Anda harus memprioritaskan desain pengalaman pengguna SEKALIGUS keandalan.

Kami membangun solusi yang berinteraksi langsung dengan pelanggan bagi organisasi dan merek yang mengutamakan hal-hal berikut:

  1. Keamanan adalah yang utama—chatbot yang memberikan manfaat bagi pengguna sekaligus melindungi mereka secara ketat dari konten berbahaya

  2. Reputasi harus dilindungi—kami merancang perlindungan berlapis yang menjaga reputasi merek, bahkan jika pengguna mencoba mendorong sistem melampaui batasnya

  3. Regulasi membatasi pilihan Anda—kami terus mengikuti pedoman kepatuhan terbaru agar Anda dapat meningkatkan skala solusi tanpa mencemaskan jailbreak pada aplikasi Anda

Penulis

Andrew Liubinas