ઊંચા જોખમવાળા વ્યવસાયો માટે સુરક્ષિત ચેટ એજન્ટ બનાવવા

તમારી બ્રાન્ડનું પ્રતિનિધિત્વ કરતો ચેટબોટ બનાવતી વખતે માત્ર તેની સલામતી પૂરતી નથી—તેનો અવાજ ખરેખર તમારી બ્રાન્ડ જેવો લાગવો જોઈએ.

કાર્યકારી સારાંશ

  • જાહેર જનતા માટે ઉપલબ્ધ LLM એપ્લિકેશનો બ્રાન્ડને પ્રતિષ્ઠા અને નાણાકીય જોખમોમાં મૂકી શકે છે.

  • LLM જેલબ્રેક અને LLMની અન્ય અનિચ્છિત વર્તણૂકથી થતું નુકસાન ઘટાડવા અમે બહુસ્તરીય વર્ગીકરણ ફિલ્ટર્સનો ઉપયોગ કરીએ છીએ.

  • અમે આ પદ્ધતિ દરરોજ 40,000 અને સતત વધતા સંદેશા મેળવતી મોટા પાયાની કાર્યરત એપ્લિકેશનમાં લાગુ કરી છે.

પરિચય

છેલ્લા એક વર્ષથી અમે એક અગ્રણી ગેમ વિકાસકર્તા સાથે મળીને એવો GenAI ચેટબોટ કાર્યરત કર્યો છે, જે બાળકો સહિતના ખેલાડીઓ પાસેથી આવતા દરરોજ આશરે 40,000 સંદેશાઓ સંભાળે છે. ઝડપ, ચોકસાઈ, સલામતી અને આનંદ વચ્ચે સંતુલન રાખવું આવશ્યક છે:

તમારી બ્રાન્ડનું પ્રતિનિધિત્વ કરતો ચેટબોટ બનાવતી વખતે માત્ર તેની સલામતી પૂરતી નથી—તેનો અવાજ ખરેખર તમારી બ્રાન્ડ જેવો લાગવો જોઈએ.

ગેમ કંપનીના કિસ્સામાં તેનો અર્થ સલામતી સાથે આનંદ અને ઉપયોગકર્તાનો ઉત્સાહ જોડવો થાય છે—ખાસ કરીને નાની વયના પ્રેક્ષકો માટે.

આધુનિક GenAI એપ્લિકેશનોના પાયામાં રહેલા LLM અત્યંત લવચીક છે, તેથી તેઓ અનેક સમસ્યાઓમાં સારી રીતે સામાન્યીકરણ કરી શકે છે, પરંતુ તેમના પર પૂરતાં નિયંત્રણો પણ નથી. એટલે તેઓ ઘણી વાર નક્કી કરેલા માર્ગથી ભટકી શકે છે અને વિવિધ પ્રકારનું લખાણ આપી શકે છે, જેમાંથી કેટલુંક અયોગ્ય હોઈ શકે છે.

LLMને સીધું જાહેર જનતા માટે ઉપલબ્ધ કરવાથી અણધારી વર્તણૂક ચોક્કસ થશે અને યોગ્ય સુરક્ષા ઉપાયો વિના નીચેના જોખમો ઊભા થઈ શકે છે:

વાસ્તવિક દુનિયાનાં જોખમોની એક ઝલક…

LLMના અનિચ્છિત ઉપયોગ વિશેના સમાચારનાં મથાળાં:

આ ઘટનાઓ દર્શાવે છે કે GenAI સિસ્ટમોમાં સલામતી ઊભી કરવી અને તે જાળવી રાખવી વૈકલ્પિક નથી. નાનાં બાળકો સામેલ હોય ત્યારે આ ખાસ મહત્વનું છે. માત્ર ચેતવણીઓ પર આધાર રાખી શકાય નહીં—સામગ્રી યોગ્ય રાખવા માટે મજબૂત સુરક્ષા-નિયંત્રણો આવશ્યક છે.

અમારો અભિગમ: બહુસ્તરીય વર્ગીકરણ અને પ્રોમ્પ્ટ કેશિંગ

ગ્રાહકો માટે બનાવેલી RAG (પુનઃપ્રાપ્તિ-સંવર્ધિત જનરેશન) સિસ્ટમોની જેમ, અમે કાર્યક્ષમતા ઊંચી રાખીને જેલબ્રેકનું જોખમ ઘટાડવા અનેક AI ઘટકોનો ઉપયોગ કરીએ છીએ.

અમારો અભિગમ દર્શાવતો આલેખ: બહુસ્તરીય વર્ગીકરણ અને પ્રોમ્પ્ટ કેશિંગ.

અમારી સિસ્ટમની રચનાનો સરળ આલેખ

સિસ્ટમની સલામતી સુનિશ્ચિત કરવા અમે ઇનપુટ અને આઉટપુટ બંને પર LLM વર્ગીકર્તાઓનો ઉપયોગ કરીએ છીએ:

  1. ઇનપુટ વર્ગીકરણ (એકસાથે કાર્યરત)

  • અમે ઉપયોગકર્તાના પ્રશ્નોને લેબલ આપવા LLM સ્ટ્રક્ચર્ડ આઉટપુટ્સ સાથે Pydantic સ્કીમાનો ઉપયોગ કર્યો હતો, જેમ કે SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT વગેરે. આમાં જેલબ્રેક અથવા પ્રતિબંધિત વર્તણૂક ઓળખવા માટેનાં સૂચકચિહ્નો પણ સામેલ હતાં.

  • અલગ-અલગ વિષયો માટેના અનેક વર્ગીકર્તાઓએ એક જ વિશાળ “બધું પકડી લેતા” વર્ગીકર્તા કરતાં નોંધપાત્ર રીતે સારું પરિણામ આપ્યું.

  • વર્ગીકર્તાઓ “આ પાત્ર મને વારંવાર મારી નાખે છે” (ગેમના સંદર્ભમાં) અને “મારા માતાપિતા મને ઈજા પહોંચાડે છે” (બાળકને નુકસાનનો સંકેત) વચ્ચે તફાવત કરી શકે તે માટે વ્યાપક ફ્યુ-શોટ ઉદાહરણો અત્યંત જરૂરી હતાં.

  • ગ્રાહક અને તેમની નિષ્ણાત વિશ્વાસ તથા સલામતી ટીમો સાથેના ગાઢ સહયોગથી અમારા વર્ગીકર્તાઓ વાસ્તવિક જીવનમાં ઊંચા જોખમવાળા સંદેશાઓ અંગે તેમના નિર્ણયોને અનુરૂપ બન્યા.

અમારો અભિગમ દર્શાવતો આલેખ: બહુસ્તરીય વર્ગીકરણ અને પ્રોમ્પ્ટ કેશિંગ.

  1. પ્રતિભાવ સર્જન

  • ઇનપુટ સલામત ગણાય તો મુખ્ય LLM પ્રતિભાવ બનાવે છે.

  • નહીં તો સંદેશને અવગણી શકાય છે (જેલબ્રેક માટે) અથવા માનવી સમક્ષ મોકલી શકાય છે (જો પ્રશ્ન સલામતીની સમસ્યાનો સંકેત આપે).

  1. આઉટપુટ વર્ગીકરણ

  • મોડલનો પ્રતિભાવ અમારી એપ્લિકેશનની બહાર મોકલતાં પહેલાં અને અંતિમ વિતરણ અગાઉ અમે તેનું વર્ગીકરણ કરીએ છીએ.

  • કેટલાક પ્રતિભાવો ઇન્ટરનેટ પરથી મેળવેલા ડેટા સાથે RAG તકનીકો વાપરી શકે છે, તેથી આ પગલું અમને ડેટામાં ઝેર ભેળવવાના હુમલાથી સુરક્ષિત રાખે છે.

  • જો તેમાં પ્રતિબંધિત સામગ્રી હોય, તો સિસ્ટમ હસ્તક્ષેપ કરીને તેને સામાન્ય સંદેશથી બદલી નાખે છે. વ્યવહારમાં આવું ભાગ્યે જ બન્યું છે, પરંતુ એજન્ટની વર્તણૂક યોગ્ય રહે તે સુનિશ્ચિત કરવા માટે આ એક વધારાનું સાવચેતીભર્યું સુરક્ષા-સ્તર છે.

ઝડપ જાળવવા અને ખર્ચ પરવડે તેવો રાખવા:

  • અમે વારંવાર વપરાતા પ્રોમ્પ્ટ્સ અને આંશિક સંવાદો સાથે પસંદ કરેલાં ફ્યુ-શોટ ઉદાહરણોનો સમૂહ સંગ્રહીએ છીએ.

  • આ કેશિંગથી દર વખતે સંદર્ભ ફરી બનાવ્યા વિના LLM વર્ગીકર્તાઓને ઝડપથી અને ઓછા ખર્ચે લાગુ કરી શકાય છે.

અમારો અભિગમ દર્શાવતો આલેખ: બહુસ્તરીય વર્ગીકરણ અને પ્રોમ્પ્ટ કેશિંગ.

ભવિષ્ય તરફ નજર: બંધારણીય વર્ગીકર્તાઓ

Anthropicના તાજેતરના અભ્યાસમાં બંધારણીય વર્ગીકર્તાઓનું વર્ણન કરાયું છે—આ સિસ્ટમ દૂષિત અથવા અસુરક્ષિત વિનંતીઓ ઓળખવા “બંધારણીય” નિયમો દ્વારા તાલીમ પામેલા વધારાના વર્ગીકર્તાઓ પર આધાર રાખે છે. તેમણે નીચેના પરિણામો નોંધાવ્યાં:

  • માનવ રેડ ટીમિંગના હજારો કલાક સામે ઊંચી મજબૂતી.

  • બિનજરૂરી ઇનકારનો અત્યંત ઓછો દર અને ગણતરીનો મધ્યમ વધારાનો ખર્ચ.

અમને એવું ભવિષ્ય દેખાય છે જેમાં આ બંધારણીય અભિગમો પરંપરાગત વર્ગીકરણ સ્તરોને પૂરક બની શકે અથવા તેમનું સ્થાન પણ લઈ શકે—અને બદલાતી જેલબ્રેક યુક્તિઓ સામે વધુ વ્યાપક સંરક્ષણ આપી શકે.

સારાંશ: અમે શીખેલા પાઠ

  1. સમાંતર, હળવા ફિલ્ટર્સ

વર્ગીકરણનાં સ્તરો દૂષિત પ્રશ્નોને જનરેટિવ કેન્દ્ર સુધી પહોંચતા અટકાવે છે અને નબળાં આઉટપુટ ક્યારેય પહોંચાડવામાં ન આવે તેની ખાતરી કરે છે.

  1. ઉપયોગકર્તાનો અનુભવ મહત્ત્વનો છે

મનોરંજક, ગેમની કથાવસ્તુને અનુરૂપ ચેતવણીઓ અને રમૂજી ઇનકાર પર ધ્યાન આપવાથી ઉપયોગકર્તાઓ સિસ્ટમનાં નિયંત્રણો સ્વીકારવા વધુ તૈયાર થાય છે.

  1. પરીક્ષણ અને દેખરેખમાં કોઈ કસર ન રાખો

નિયમિત રેડ ટીમિંગ અને ખેલાડીઓની વર્તણૂક પર વારંવાર દેખરેખ રાખવાથી ખામીઓ મોટા ખેલાડી સમુદાયને ખબર પડે તે પહેલાં ઓળખી શકાશે. પછી આ ખામીઓને થોડાં ઉદાહરણો ધરાવતા વર્ગીકર્તાના પ્રોમ્પ્ટ્સમાં ઉમેરીને ભવિષ્યમાં તેમનો ઉપયોગ થતો અટકાવી શકાય છે. હાલમાં આ પ્રક્રિયા જાતે કરવી પડે છે, પરંતુ તેને સ્વચાલિત કરી શકાય છે.

આવતી કાલ માટે સુરક્ષિત અને આકર્ષક GenAI સિસ્ટમો બનાવવી

તમે ગેમિંગ કંપની, બેંક કે સરકારી વિભાગ હો, મોટા પાયે ગ્રાહક સેવા ચેટબોટ અમલમાં મૂકતી વખતે ઉપયોગકર્તા-કેન્દ્રિત રચના અને વિશ્વસનીયતા બંને તમારું લક્ષ્ય હોવું જોઈએ.

અમે એવી સંસ્થાઓ અને બ્રાન્ડ માટે ગ્રાહકલક્ષી ઉકેલો બનાવીએ છીએ, જ્યાં:

  1. સલામતી સર્વોપરી છે—ચેટબોટ્સ ઉપયોગકર્તાઓને મૂલ્ય આપે છે અને સાથે તેમને હાનિકારક સામગ્રીથી કડક રીતે સુરક્ષિત રાખે છે.

  2. પ્રતિષ્ઠાનું રક્ષણ થાય છે—ઉપયોગકર્તાઓ સિસ્ટમને તેની મર્યાદાથી આગળ ધકેલવાનો પ્રયાસ કરે તો પણ બ્રાન્ડની પ્રતિષ્ઠા અખંડ રાખે એવાં અનેક સુરક્ષા-સ્તરો અમે બનાવીએ છીએ.

  3. નિયમનો તમારી પસંદગીઓ પર અંકુશ છે—અમે અનુપાલનના નવીનતમ માર્ગદર્શનોનું પાલન કરીએ છીએ, જેથી એપ્લિકેશન જેલબ્રેક થવાની ચિંતા વિના તમે ઉકેલોનો વ્યાપ વધારી શકો.

લેખક

Andrew Liubinas