Navigasi utama

Mbangun agen chat sing aman kanggo bisnis berisiko dhuwur

Nalika nggawe chatbot kanggo makili merek sampeyan, ora cukup yen mung aman—swara lan gayane uga kudu saestu nggambarake sampeyan.

Ringkesan eksekutif

  • Aplikasi Large Language Model (LLM) sing bisa diakses umum bisa ndadekake merek kena risiko reputasi lan finansial.

  • Kita nggunakake filter klasifikasi majemuk kanggo nyuda bebaya saka jailbreak LLM lan tumindak LLM liyane sing ora dikarepake.

  • Cara iki wis kita terapake ing aplikasi produksi kanthi volume gedhe sing nampa 40.000 pesen saben dina lan terus mundhak.

Pambuka

Sajrone taun kepungkur, kita kerja bareng karo pangembang game utama kanggo ngluncurake chatbot GenAI sing nangani udakara 40.000 pesen saben dina saka komunitas pemain sing uga kalebu bocah-bocah. Kacepetan, akurasi, keamanan, lan rasa seneng kudu diimbangi:

Nalika nggawe chatbot kanggo makili merek sampeyan, ora cukup yen mung aman—swara lan gayane uga kudu saestu nggambarake sampeyan.

Kanggo perusahaan game, tegese nggabungake keamanan, rasa seneng, lan semangate pangguna—mligine kanggo pamirsa sing luwih enom.

LLM sing dadi dhasar aplikasi GenAI modern pancen fleksibel banget (mula bisa ditrapake kanthi apik kanggo maneka warna masalah), nanging watesane uga kurang ketat. Tegese, LLM bisa nyimpang saka tujuan lan ngasilake maneka warna teks, sing sawetara bisa uga ora trep.

Yen LLM diwenehake langsung marang umum, mesthi bakal ana tumindak sing ora dikarepake lan, tanpa langkah pangreksan sing trep, bisa nyebabake risiko:

Gambaran ringkes risiko ing donya nyata…

Judhul warta babagan panggunaan LLM sing ora dikarepake:

Kedadeyan iki negesake manawa mbangun lan njaga keamanan ing sistem GenAI iku dudu pilihan. Iki luwih-luwih bener yen ana bocah cilik sing melu. Sampeyan ora bisa mung ngandelake sangkalan—pager pangaman sing kukuh dibutuhake supaya konten tetep trep.

Pendekatan kita: klasifikasi majemuk lan panyimpenan cache prompt

Kaya sistem RAG (Retrieval-Augmented Generation) sing wis kita gawe kanggo klien, kita nggunakake sawetara komponen AI kanggo nyuda risiko jailbreak kanthi tetep njaga kinerja sing dhuwur.

Diagram sing nggambarake pendekatan kita: klasifikasi majemuk lan panyimpenan cache prompt.

Diagram arsitektur sistem kita sing disederhanakake

Kanggo njamin keamanan sistem, kita nggunakake klasifikator LLM ing input lan output:

  1. Klasifikasi Input (mlaku bebarengan)

  • Kita nggunakake skema Pydantic bebarengan karo keluaran terstruktur LLM kanggo menehi label pitakon pangguna (umpamane SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, lan liya-liyane). Iki uga kalebu tandha kanggo ngenali jailbreak utawa tumindak sing dilarang.

  • Sawetara klasifikator kanggo saben topik menehi kinerja sing luwih apik banget tinimbang siji klasifikator gedhe sing nyoba “nangkep kabeh”.

  • Akeh conto sithik penting banget supaya klasifikator bisa mbedakake antarane “I keep being killed by this character” (ngrembug game) lan “I am being hurt by my parent” (tandha bebaya tumrap bocah).

  • Kolaborasi raket karo klien lan tim khusus kapercayan lan keamanane njamin klasifikator kita nggambarake cara tim kasebut netepake pesen berisiko dhuwur ing kahanan nyata.

Diagram sing nggambarake pendekatan kita: klasifikasi majemuk lan panyimpenan cache prompt.

  1. Ngasilake Tanggapan

  • LLM utama ngasilake tanggapan yen input dianggep aman.

  • Yen ora, pesen bisa dilirwakake (kanggo jailbreak) utawa diterusake menyang manungsa (yen pitakon menehi tandha masalah keamanan).

  1. Klasifikasi Output

  • Sadurunge metu saka aplikasi, tanggapan model diklasifikasikake dhisik sadurunge dikirimake.

  • Amarga sawetara tanggapan bisa nggunakake teknik RAG adhedhasar data sing dijupuk saka internet, langkah iki nglindhungi kita saka peracunan data.

  • Yen ngemot konten sing dilarang, sistem bakal melu tumindak lan nggantine nganggo pesen umum. Ing praktik, iki arang banget kedadeyan, nanging lapisan pangreksan konservatif iki njamin tumindake agen tetep trep.

Kanggo njaga kacepetan lan biaya sing terjangkau:

  • Kita nyimpen prompt sing kerep digunakake lan sebagian dialog, bebarengan karo kumpulan conto sithik sing wis dipilih kanthi tliti.

  • Cache iki ngidini kita ngetrapake klasifikator LLM kanthi cepet lan murah, tanpa kudu mbangun ulang konteks saben wektu.

Diagram sing nggambarake pendekatan kita: klasifikasi majemuk lan panyimpenan cache prompt.

Nyawang mangsa ngarep: klasifikator konstitusional

Panaliten anyar saka Anthropic njlentrehake Constitutional Classifiers—sistem sing nggunakake klasifikator tambahan, sing dilatih nganggo aturan “konstitusional”, kanggo ndeteksi panjaluk ala utawa ora aman. Asil sing dilapurake:

  • Tahan banget nalika ngadhepi ewonan jam red teaming dening manungsa.

  • Tingkat penolakan sing kakehan sithik banget lan tambahan beban komputasi sing sedhengan.

Kita mbayangake mangsa nalika pendekatan konstitusional iki bisa nglengkapi utawa malah ngganti lapisan klasifikasi tradisional—lan menehi pangreksan sing luwih lengkap tumrap taktik jailbreak sing terus berkembang.

Ringkesan: piwulang sing kita pikolehi

  1. Filter Entheng sing Mlaku Bebarengan

Lapisan klasifikasi nyegah pitakon ala supaya ora tau tekan inti generatif—lan njamin output sing ala ora tau dikirimake.

  1. Pengalaman Pangguna Iku Penting

Kanthi nggunakake pepeling sing nyenengake lan adhedhasar lore, uga penolakan sing santai, pangguna luwih gampang nampa watesan sistem.

  1. Aja Ngirit ing Pengujian lan Pemantauan

Red teaming kanthi rutin, ditambah pemantauan tumindake pemain kanthi kerep, bakal mbantu nemokake kerentanan sadurunge dingerteni komunitas pemain sing luwih akeh. Temuan kasebut banjur bisa lebokake maneh menyang prompt klasifikator nganggo conto sithik supaya ora bisa dimanfaatake maneh ing mangsa ngarep (saiki isih ditindakake kanthi manual, nanging bisa diotomatisasi).

Mbangun sistem GenAI sing aman lan nyenengake kanggo mangsa ngarep

Apa sampeyan perusahaan game, bank, utawa malah instansi pamaréntah, yen arep ngetrapake chatbot layanan pelanggan kanthi skala gedhe, sampeyan kudu ngupayakake LORO-LORONE: desain pangguna lan kapercayan.

Kita mbangun solusi sing langsung digunakake pelanggan kanggo organisasi lan merek sing:

  1. Ngutamakake keamanan—chatbot sing menehi manfaat marang pangguna lan nglindhungi kanthi ketat saka konten mbebayani

  2. Nglindhungi reputasi—kita ngrancang sawetara lapisan pangreksan supaya reputasi merek tetep apik, sanajan pangguna nyoba meksa sistem ngluwihi watesane

  3. Diwatesi regulasi—kita tansah ngetutake pedoman kepatuhan paling anyar supaya sampeyan bisa nggedhekake solusi tanpa kuwatir aplikasi kena jailbreak

Panganggit

Andrew Liubinas