Aplikasi Large Language Model (LLM) sing bisa diakses umum bisa ndadekake merek kena risiko reputasi lan finansial.
Kita nggunakake filter klasifikasi majemuk kanggo nyuda bebaya saka jailbreak LLM lan tumindak LLM liyane sing ora dikarepake.
Cara iki wis kita terapake ing aplikasi produksi kanthi volume gedhe sing nampa 40.000 pesen saben dina lan terus mundhak.
Sajrone taun kepungkur, kita kerja bareng karo pangembang game utama kanggo ngluncurake chatbot GenAI sing nangani udakara 40.000 pesen saben dina saka komunitas pemain sing uga kalebu bocah-bocah. Kacepetan, akurasi, keamanan, lan rasa seneng kudu diimbangi:
Nalika nggawe chatbot kanggo makili merek sampeyan, ora cukup yen mung aman—swara lan gayane uga kudu saestu nggambarake sampeyan.
Kanggo perusahaan game, tegese nggabungake keamanan, rasa seneng, lan semangate pangguna—mligine kanggo pamirsa sing luwih enom.
LLM sing dadi dhasar aplikasi GenAI modern pancen fleksibel banget (mula bisa ditrapake kanthi apik kanggo maneka warna masalah), nanging watesane uga kurang ketat. Tegese, LLM bisa nyimpang saka tujuan lan ngasilake maneka warna teks, sing sawetara bisa uga ora trep.
Yen LLM diwenehake langsung marang umum, mesthi bakal ana tumindak sing ora dikarepake lan, tanpa langkah pangreksan sing trep, bisa nyebabake risiko:
“Jailbreak”, yaiku nalika pangguna sengaja ngapusi chatbot supaya ngasilake konten sing mbebayani utawa dilarang (kasunyatan sing nyenengake: sapa wae bisa ngunjungi situs iki kanggo nyoba jailbreak LLM liwat game sing nyenengake…); utawa
Kanthi ora sengaja menehi konten sing ora pantes, nyinggung, utawa mbebayani. Ing akeh kasus, iki bisa mbebayani tumrap kesejahteraan pangguna utawa nyebabake kerugian finansial lan rusake merek panyedhiya aplikasi.
Judhul warta babagan panggunaan LLM sing ora dikarepake:
Kedadeyan iki negesake manawa mbangun lan njaga keamanan ing sistem GenAI iku dudu pilihan. Iki luwih-luwih bener yen ana bocah cilik sing melu. Sampeyan ora bisa mung ngandelake sangkalan—pager pangaman sing kukuh dibutuhake supaya konten tetep trep.
Kaya sistem RAG (Retrieval-Augmented Generation) sing wis kita gawe kanggo klien, kita nggunakake sawetara komponen AI kanggo nyuda risiko jailbreak kanthi tetep njaga kinerja sing dhuwur.


Diagram arsitektur sistem kita sing disederhanakake
Kanggo njamin keamanan sistem, kita nggunakake klasifikator LLM ing input lan output:
Klasifikasi Input (mlaku bebarengan)
Kita nggunakake skema Pydantic bebarengan karo keluaran terstruktur LLM kanggo menehi label pitakon pangguna (umpamane SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, lan liya-liyane). Iki uga kalebu tandha kanggo ngenali jailbreak utawa tumindak sing dilarang.
Sawetara klasifikator kanggo saben topik menehi kinerja sing luwih apik banget tinimbang siji klasifikator gedhe sing nyoba “nangkep kabeh”.
Akeh conto sithik penting banget supaya klasifikator bisa mbedakake antarane “I keep being killed by this character” (ngrembug game) lan “I am being hurt by my parent” (tandha bebaya tumrap bocah).
Kolaborasi raket karo klien lan tim khusus kapercayan lan keamanane njamin klasifikator kita nggambarake cara tim kasebut netepake pesen berisiko dhuwur ing kahanan nyata.


Ngasilake Tanggapan
LLM utama ngasilake tanggapan yen input dianggep aman.
Yen ora, pesen bisa dilirwakake (kanggo jailbreak) utawa diterusake menyang manungsa (yen pitakon menehi tandha masalah keamanan).
Klasifikasi Output
Sadurunge metu saka aplikasi, tanggapan model diklasifikasikake dhisik sadurunge dikirimake.
Amarga sawetara tanggapan bisa nggunakake teknik RAG adhedhasar data sing dijupuk saka internet, langkah iki nglindhungi kita saka peracunan data.
Yen ngemot konten sing dilarang, sistem bakal melu tumindak lan nggantine nganggo pesen umum. Ing praktik, iki arang banget kedadeyan, nanging lapisan pangreksan konservatif iki njamin tumindake agen tetep trep.
Kanggo njaga kacepetan lan biaya sing terjangkau:
Kita nyimpen prompt sing kerep digunakake lan sebagian dialog, bebarengan karo kumpulan conto sithik sing wis dipilih kanthi tliti.
Cache iki ngidini kita ngetrapake klasifikator LLM kanthi cepet lan murah, tanpa kudu mbangun ulang konteks saben wektu.


Panaliten anyar saka Anthropic njlentrehake Constitutional Classifiers—sistem sing nggunakake klasifikator tambahan, sing dilatih nganggo aturan “konstitusional”, kanggo ndeteksi panjaluk ala utawa ora aman. Asil sing dilapurake:
Tahan banget nalika ngadhepi ewonan jam red teaming dening manungsa.
Tingkat penolakan sing kakehan sithik banget lan tambahan beban komputasi sing sedhengan.
Kita mbayangake mangsa nalika pendekatan konstitusional iki bisa nglengkapi utawa malah ngganti lapisan klasifikasi tradisional—lan menehi pangreksan sing luwih lengkap tumrap taktik jailbreak sing terus berkembang.
Filter Entheng sing Mlaku Bebarengan
Lapisan klasifikasi nyegah pitakon ala supaya ora tau tekan inti generatif—lan njamin output sing ala ora tau dikirimake.
Pengalaman Pangguna Iku Penting
Kanthi nggunakake pepeling sing nyenengake lan adhedhasar lore, uga penolakan sing santai, pangguna luwih gampang nampa watesan sistem.
Aja Ngirit ing Pengujian lan Pemantauan
Red teaming kanthi rutin, ditambah pemantauan tumindake pemain kanthi kerep, bakal mbantu nemokake kerentanan sadurunge dingerteni komunitas pemain sing luwih akeh. Temuan kasebut banjur bisa lebokake maneh menyang prompt klasifikator nganggo conto sithik supaya ora bisa dimanfaatake maneh ing mangsa ngarep (saiki isih ditindakake kanthi manual, nanging bisa diotomatisasi).
Apa sampeyan perusahaan game, bank, utawa malah instansi pamaréntah, yen arep ngetrapake chatbot layanan pelanggan kanthi skala gedhe, sampeyan kudu ngupayakake LORO-LORONE: desain pangguna lan kapercayan.
Kita mbangun solusi sing langsung digunakake pelanggan kanggo organisasi lan merek sing:
Ngutamakake keamanan—chatbot sing menehi manfaat marang pangguna lan nglindhungi kanthi ketat saka konten mbebayani
Nglindhungi reputasi—kita ngrancang sawetara lapisan pangreksan supaya reputasi merek tetep apik, sanajan pangguna nyoba meksa sistem ngluwihi watesane
Diwatesi regulasi—kita tansah ngetutake pedoman kepatuhan paling anyar supaya sampeyan bisa nggedhekake solusi tanpa kuwatir aplikasi kena jailbreak