Pangunahing nabigasyon

Pagbuo ng ligtas na mga chat agent para sa mga negosyong may mataas na panganib

Kapag gumagawa ng chatbot na kakatawan sa iyong brand, hindi sapat na ligtas lang ito—kailangan ding tunay na maipakita nito ang iyong pagkakakilanlan.

Buod para sa mga ehekutibo

  • Maaaring magdulot ng panganib sa reputasyon at pananalapi ng mga brand ang mga application ng Large Language Model (LLM) na ginagamit ng publiko.

  • Gumagamit kami ng maraming layer ng mga classification filter upang mabawasan ang pinsala mula sa mga jailbreak ng LLM at iba pang hindi nilalayong gawi ng LLM.

  • Inilapat namin ito sa isang high-volume production application na nakatatanggap ng 40,000 mensahe araw-araw—at patuloy pang dumarami.

Panimula

Sa nakalipas na taon, nakipagtulungan kami sa isang nangungunang game developer upang mag-deploy ng GenAI chatbot na sumasagot sa humigit-kumulang 40,000 mensahe bawat araw mula sa mga manlalarong kinabibilangan ng mga bata. Mahalagang balansehin ang bilis, katumpakan, kaligtasan, at saya:

Kapag gumagawa ng chatbot na kakatawan sa iyong brand, hindi sapat na ligtas lang ito—kailangan ding tunay na maipakita nito ang iyong pagkakakilanlan.

Para sa isang kumpanya ng laro, nangangahulugan itong pagsamahin ang kaligtasan, saya, at pananabik ng user—lalo na para sa mas batang audience.

Napaka-flexible ng mga LLM na pundasyon ng mga modernong GenAI application—kaya mahusay silang nagagamit sa maraming problema—ngunit kulang din ang mga limitasyon sa mga ito. Ibig sabihin, madalas silang lumihis sa inaasahan at maglabas ng napakaraming uri ng text, na maaaring may ilang hindi angkop.

Tiyak na magbubunga ng hindi inaasahang gawi ang direktang pagbibigay sa publiko ng access sa isang LLM at, kung walang wastong hakbang na panangga, maaaring magkaroon ng panganib na:

Isang sulyap sa mga panganib sa totoong mundo…

Mga headline ng balita tungkol sa hindi nilalayong paggamit ng LLM:

Ipinakikita ng mga insidenteng ito kung bakit hindi maaaring ipagwalang-bahala ang pagbuo at pagpapanatili ng kaligtasan sa mga GenAI system. Lalo itong mahalaga kapag sangkot ang maliliit na bata. Hindi sapat ang mga disclaimer—kailangan ang matitibay na guardrail upang mapanatiling angkop ang content.

Ang aming paraan: layered classification at prompt caching

Tulad ng mga RAG (Retrieval-Augmented Generation) system na ginawa namin para sa mga kliyente, gumagamit kami ng maraming AI component upang mabawasan ang mga panganib ng pag-jailbreak habang pinananatiling mataas ang performance.

Diagram ng aming paraan: layered classification at prompt caching.

Isang pinasimpleng architecture diagram ng aming system

Upang matiyak ang kaligtasan ng system, gumagamit kami ng mga LLM classifier sa mga input at output:

  1. Pag-classify ng Input (sabay-sabay na pinapatakbo)

  • Gumamit kami ng mga Pydantic schema kasama ng mga naka-structure na output ng LLM upang lagyan ng label ang mga query ng user (hal., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, atbp.). Kasama rin dito ang mga flag upang matukoy ang pag-jailbreak o ipinagbabawal na gawi.

  • Mas mahusay ang naging performance ng maraming classifier para sa magkakahiwalay na paksa kaysa sa iisang napakalaking classifier na sumasaklaw sa lahat.

  • Napakahalaga ng maraming few-shot na halimbawa upang matiyak na matutukoy ng mga classifier ang pagkakaiba ng “I keep being killed by this character” (tumutukoy sa laro) at “I am being hurt by my parent” (palatandaan ng pananakit sa bata).

  • Sa malapit na pakikipagtulungan sa kliyente at sa kanilang mga espesyalistang trust and safety team, natiyak naming sinasalamin ng aming mga classifier kung paano nila huhusgahan ang mga mensaheng may mataas na panganib sa totoong buhay.

Diagram ng aming paraan: layered classification at prompt caching.

  1. Pagbuo ng Tugon

  • Gumagawa ng tugon ang pangunahing LLM kung itinuturing na ligtas ang input.

  • Kung hindi, maaaring balewalain ang mensahe para sa mga jailbreak o ipasa ito sa isang tao kung may matukoy na isyu sa kaligtasan ang query.

  1. Pag-classify ng Output

  • Bago lumabas sa aming application ang tugon ng modelo, kina-classify muna namin ito bago ang huling paghahatid.

  • Dahil maaaring gumamit ang ilang tugon ng mga RAG technique mula sa data na na-scrape sa internet, pinoprotektahan kami ng hakbang na ito laban sa data poisoning.

  • Kung naglalaman ito ng ipinagbabawal na content, namamagitan ang system at pinapalitan ito ng pangkalahatang mensahe. Sa aktuwal na paggamit, bihira namin itong maranasan, ngunit nagsisilbi itong dagdag na maingat na proteksyon upang matiyak na nananatiling angkop ang gawi ng agent.

Upang mapanatili ang bilis at abot-kayang gastos:

  • Iniimbak namin ang mga madalas gamitin na prompt at bahagi ng mga diyalogo, kasama ang isang maingat na piniling hanay ng mga few-shot na halimbawa.

  • Dahil sa caching na ito, mabilis at mura naming nailalapat ang mga LLM classifier nang hindi na kailangang buuing muli ang konteksto sa bawat pagkakataon.

Diagram ng aming paraan: layered classification at prompt caching.

Paghahanda para sa hinaharap: mga constitutional classifier

Inilarawan sa isang kamakailang pag-aaral ng Anthropic ang Constitutional Classifiers—isang system na gumagamit ng mga karagdagang classifier na sinanay sa pamamagitan ng mga “constitutional” na panuntunan upang matukoy ang mga mapaminsala o hindi ligtas na kahilingan. Iniulat nila ang sumusunod:

  • Mataas na katatagan laban sa libo-libong oras ng red teaming na isinagawa ng tao.

  • Napakababang antas ng labis na pagtanggi at katamtamang dagdag na compute.

Nakikita namin ang isang hinaharap kung saan maaaring dagdagan o palitan pa nga ng mga constitutional approach na ito ang mga tradisyonal na classification layer—na nagbibigay ng mas komprehensibong depensa laban sa mga umuunlad na taktika ng pag-jailbreak.

Buod: mga aral na natutuhan namin

  1. Magagaan at Sabay-sabay na Filter

Pinipigilan ng mga classification layer na makarating sa generative core ang mga mapaminsalang query—at tinitiyak na hindi kailanman maihahatid ang mahihinang output.

  1. Mahalaga ang Karanasan ng User

Sa pamamagitan ng masasaya at mapaglarong pagtanggi at mga babalang nakabatay sa lore, mas malamang na tanggapin ng mga user ang mga limitasyon ng system.

  1. Huwag Magtipid sa Testing at Monitoring

Makakatulong ang regular na red teaming at madalas na pagsubaybay sa gawi ng mga manlalaro upang matukoy ang mga kahinaan bago pa malaman ng mas malawak na komunidad ng mga manlalaro. Pagkatapos, maaaring ibalik ang mga ito sa mga few-shot classifier prompt upang hindi na magamit sa hinaharap. Sa ngayon, mano-mano ang prosesong ito ngunit maaari itong i-automate.

Pagbuo ng ligtas at nakakaengganyong mga GenAI system para sa hinaharap

Kumpanya ka man ng gaming, bangko, o kahit isang kagawaran ng gobyerno, kung magpapatupad ka ng customer service chatbot sa malawakang antas, kailangan mong ituon ang pansin sa PAREHONG disenyo para sa user at pagiging mapagkakatiwalaan.

Gumagawa kami ng mga solusyong direktang ginagamit ng customer para sa mga organisasyon at brand kung saan:

  1. Pinakamahalaga ang kaligtasan—mga chatbot na nagbibigay ng halaga sa mga user habang mahigpit silang pinoprotektahan laban sa mapaminsalang content

  2. Protektado ang reputasyon—nagdidisenyo kami ng maraming layer ng proteksyon na nagpapanatiling buo sa reputasyon ng brand, kahit subukan ng mga user na itulak ang system nang lampas sa mga limitasyon nito

  3. Nililimitahan ng regulasyon ang iyong mga opsyon—sinusubaybayan namin ang pinakabagong mga alituntunin sa compliance upang mapalawak mo ang mga solusyon nang hindi nababahala na ma-jailbreak ang iyong application

May-akda

Andrew Liubinas