ഉയർന്ന അപകടസാധ്യതയുള്ള ബിസിനസുകൾക്കായി സുരക്ഷിത ചാറ്റ് ഏജന്റുകൾ നിർമിക്കൽ

നിങ്ങളുടെ ബ്രാൻഡിനെ പ്രതിനിധീകരിക്കുന്ന ഒരു ചാറ്റ്ബോട്ട് സൃഷ്ടിക്കുമ്പോൾ, അത് സുരക്ഷിതമായാൽ മാത്രം പോരാ—നിങ്ങളുടെ തനതായ ശബ്ദം അതിനുണ്ടാകണം.

നിർവാഹക സംഗ്രഹം

  • പൊതുജനങ്ങൾ ഉപയോഗിക്കുന്ന LLM ആപ്ലിക്കേഷനുകൾ ബ്രാൻഡുകളെ പ്രശസ്തിസംബന്ധവും സാമ്പത്തികവുമായ അപകടസാധ്യതകൾക്ക് വിധേയമാക്കാം.

  • LLM ജെയിൽബ്രേക്കുകളും മറ്റ് അപ്രതീക്ഷിത LLM പെരുമാറ്റങ്ങളും മൂലമുള്ള ദോഷം കുറയ്ക്കാൻ ഞങ്ങൾ പല പാളികളുള്ള വർഗീകരണ ഫിൽട്ടറുകൾ ഉപയോഗിക്കുന്നു.

  • പ്രതിദിനം 40,000-ത്തിലധികം സന്ദേശങ്ങൾ ലഭിക്കുകയും ആ എണ്ണം ഉയരുകയും ചെയ്യുന്ന, വലിയ തോതിൽ ഉപയോഗിക്കപ്പെടുന്ന ഒരു പ്രൊഡക്ഷൻ ആപ്ലിക്കേഷനിൽ ഞങ്ങൾ ഇത് നടപ്പാക്കിയിട്ടുണ്ട്.

ആമുഖം

കഴിഞ്ഞ ഒരു വർഷമായി, കുട്ടികളും ഉൾപ്പെടുന്ന കളിക്കാരിൽനിന്ന് പ്രതിദിനം ഏകദേശം 40,000 സന്ദേശങ്ങൾ കൈകാര്യം ചെയ്യുന്ന ഒരു GenAI ചാറ്റ്ബോട്ട് വിന്യസിക്കാൻ ഞങ്ങൾ ഒരു പ്രമുഖ ഗെയിം ഡെവലപ്പറുമായി സഹകരിക്കുന്നു. വേഗം, കൃത്യത, സുരക്ഷ, വിനോദം എന്നിവയ്ക്കിടയിലെ സന്തുലനം അനിവാര്യമാണ്:

നിങ്ങളുടെ ബ്രാൻഡിനെ പ്രതിനിധീകരിക്കുന്ന ഒരു ചാറ്റ്ബോട്ട് സൃഷ്ടിക്കുമ്പോൾ, അത് സുരക്ഷിതമായാൽ മാത്രം പോരാ—നിങ്ങളുടെ തനതായ ശബ്ദം അതിനുണ്ടാകണം.

ഒരു ഗെയിം കമ്പനിയെ സംബന്ധിച്ചിടത്തോളം, സുരക്ഷയോടൊപ്പം വിനോദവും ഉപയോക്താക്കളുടെ ആവേശവും ചേർക്കണമെന്നാണ് അതിനർഥം—പ്രത്യേകിച്ച് പ്രായം കുറഞ്ഞവർക്കായി.

ആധുനിക GenAI ആപ്ലിക്കേഷനുകൾക്ക് അടിത്തറയാകുന്ന LLM-കൾ വളരെ വഴക്കമുള്ളവയാണ്. അതുകൊണ്ടാണ് അവ പല പ്രശ്നങ്ങൾക്കും നന്നായി പൊതുവൽക്കരിക്കപ്പെടുന്നത്. എന്നാൽ അവയ്ക്ക് മതിയായ നിയന്ത്രണങ്ങളില്ല. അതിനാൽ അവ പലപ്പോഴും നിശ്ചയിച്ച പാതയിൽനിന്ന് വ്യതിചലിച്ച് പലതരത്തിലുള്ള വാചകങ്ങൾ നൽകാം. അവയിൽ ചിലത് അനുചിതമായിരിക്കാം.

ഒരു LLM നേരിട്ട് പൊതുജനങ്ങൾക്ക് ലഭ്യമാക്കിയാൽ അപ്രതീക്ഷിത പെരുമാറ്റം തീർച്ചയായും ഉണ്ടാകും. ശരിയായ പ്രതിരോധ നടപടികളില്ലെങ്കിൽ, ഇനിപ്പറയുന്ന അപകടസാധ്യതകളുമുണ്ട്:

യഥാർഥ ലോകത്തിലെ അപകടസാധ്യതകളിലേക്കൊരു എത്തിനോട്ടം.

LLM-ന്റെ അപ്രതീക്ഷിത ഉപയോഗത്തെക്കുറിച്ചുള്ള വാർത്താ തലക്കെട്ടുകൾ:

GenAI സംവിധാനങ്ങളിൽ സുരക്ഷ സൃഷ്ടിക്കുകയും നിലനിർത്തുകയും ചെയ്യുന്നത് ഐച്ഛികമല്ലെന്ന് ഈ സംഭവങ്ങൾ വ്യക്തമാക്കുന്നു. ചെറിയ കുട്ടികൾ ഉൾപ്പെടുമ്പോൾ ഇത് വിശേഷിച്ചും പ്രധാനമാണ്. മുന്നറിയിപ്പുകളെ മാത്രം ആശ്രയിക്കാനാവില്ല—ഉള്ളടക്കം അനുയോജ്യമായി നിലനിർത്താൻ ശക്തമായ സുരക്ഷാ നിയന്ത്രണങ്ങൾ അനിവാര്യമാണ്.

ഞങ്ങളുടെ സമീപനം: പല പാളികളുള്ള വർഗീകരണവും പ്രോംപ്റ്റ് കാഷിങ്ങും

ഉപഭോക്താക്കൾക്കായി ഞങ്ങൾ നിർമിച്ച RAG (വിവരശേഖരണ സഹായത്തോടെയുള്ള സൃഷ്ടി) സംവിധാനങ്ങളെപ്പോലെ, ഉയർന്ന പ്രകടനം നിലനിർത്തിക്കൊണ്ട് ജെയിൽബ്രേക്കിങ് അപകടസാധ്യതകൾ കുറയ്ക്കാൻ ഒന്നിലധികം AI ഘടകങ്ങൾ ഞങ്ങൾ പ്രയോജനപ്പെടുത്തുന്നു.

ഞങ്ങളുടെ സമീപനം ചിത്രീകരിക്കുന്ന രേഖാചിത്രം: പല പാളികളുള്ള വർഗീകരണവും പ്രോംപ്റ്റ് കാഷിങ്ങും.

ഞങ്ങളുടെ സംവിധാനത്തിന്റെ ലളിതമാക്കിയ ആർക്കിടെക്ചർ രേഖാചിത്രം

സംവിധാനത്തിന്റെ സുരക്ഷ ഉറപ്പാക്കാൻ ഇൻപുട്ടുകളിലും ഔട്ട്‌പുട്ടുകളിലും ഞങ്ങൾ LLM വർഗീകരണ സംവിധാനങ്ങൾ ഉപയോഗിക്കുന്നു:

  1. ഇൻപുട്ട് വർഗീകരണം (ഒരേസമയം പ്രവർത്തിക്കുന്നു)

  • ഉപയോക്തൃ ചോദ്യങ്ങൾക്ക് ലേബലുകൾ നൽകാൻ (ഉദാ., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT തുടങ്ങിയവ) LLM സ്ട്രക്ചേഡ് ഔട്ട്‌പുട്ടുകൾക്കൊപ്പം ഞങ്ങൾ Pydantic സ്കീമകൾ ഉപയോഗിച്ചു. ജെയിൽബ്രേക്കിങ്ങോ അനുവദനീയമല്ലാത്ത പെരുമാറ്റമോ തിരിച്ചറിയാനുള്ള സൂചകങ്ങളും ഇതിൽ ഉൾപ്പെട്ടിരുന്നു.

  • എല്ലാം കണ്ടെത്താൻ ശ്രമിക്കുന്ന ഒരൊറ്റ വലിയ വർഗീകരണ സംവിധാനത്തേക്കാൾ, ഓരോ വിഷയത്തിനും പ്രത്യേകം ഉപയോഗിച്ച ഒന്നിലധികം വർഗീകരണ സംവിധാനങ്ങൾ ഗണ്യമായി മികച്ച പ്രകടനം നൽകി.

  • “ഈ കഥാപാത്രം എന്നെ വീണ്ടും വീണ്ടും കൊല്ലുന്നു” എന്ന ഗെയിമിനെക്കുറിച്ചുള്ള പരാമർശവും “എന്റെ രക്ഷിതാവ് എന്നെ ഉപദ്രവിക്കുന്നു” എന്ന കുട്ടിക്ക് ഹാനി സംഭവിക്കുന്നതിന്റെ സൂചനയും തമ്മിൽ വർഗീകരണ സംവിധാനങ്ങൾ വേർതിരിച്ചറിയാൻ വിപുലമായ ഫ്യൂ-ഷോട്ട് ഉദാഹരണങ്ങൾ നിർണായകമായിരുന്നു.

  • ഉയർന്ന അപകടസാധ്യതയുള്ള സന്ദേശങ്ങളെ യഥാർഥ ജീവിതത്തിൽ ഉപഭോക്താവും അവരുടെ വിദഗ്ധ വിശ്വാസ-സുരക്ഷാ സംഘങ്ങളും എങ്ങനെ വിലയിരുത്തുമെന്നത് ഞങ്ങളുടെ വർഗീകരണ സംവിധാനങ്ങൾ പ്രതിഫലിപ്പിക്കുന്നുവെന്ന് അടുത്ത സഹകരണം ഉറപ്പാക്കി.

ഞങ്ങളുടെ സമീപനം ചിത്രീകരിക്കുന്ന രേഖാചിത്രം: പല പാളികളുള്ള വർഗീകരണവും പ്രോംപ്റ്റ് കാഷിങ്ങും.

  1. പ്രതികരണം സൃഷ്ടിക്കൽ

  • ഇൻപുട്ട് സുരക്ഷിതമാണെന്ന് വിലയിരുത്തിയാൽ പ്രധാന LLM ഒരു പ്രതികരണം സൃഷ്ടിക്കുന്നു.

  • അല്ലെങ്കിൽ സന്ദേശം അവഗണിക്കാം (ജെയിൽബ്രേക്കാണെങ്കിൽ), അതുമല്ലെങ്കിൽ മനുഷ്യ പരിശോധനയ്ക്ക് കൈമാറാം (ചോദ്യത്തിൽ സുരക്ഷാപ്രശ്നം കണ്ടെത്തിയാൽ).

  1. ഔട്ട്‌പുട്ട് വർഗീകരണം

  • അന്തിമമായി കൈമാറുന്നതിനുമുമ്പ്, ഞങ്ങളുടെ ആപ്ലിക്കേഷനിൽനിന്ന് പുറത്തുപോകുന്ന മോഡലിന്റെ പ്രതികരണം ഞങ്ങൾ വർഗീകരിക്കുന്നു.

  • ചില പ്രതികരണങ്ങൾ ഇന്റർനെറ്റിൽനിന്ന് ശേഖരിച്ച ഡാറ്റ ഉപയോഗിച്ചുള്ള RAG സാങ്കേതികവിദ്യകൾ പ്രയോഗിക്കുന്നതിനാൽ, ഡാറ്റയിൽ വിഷാംശം കലർത്തുന്ന ആക്രമണങ്ങളിൽനിന്ന് ഈ ഘട്ടം ഞങ്ങളെ സംരക്ഷിക്കുന്നു.

  • അതിൽ അനുവദനീയമല്ലാത്ത ഉള്ളടക്കമുണ്ടെങ്കിൽ, സംവിധാനം ഇടപെട്ട് അതിനു പകരം പൊതുവായൊരു സന്ദേശം നൽകുന്നു. പ്രായോഗികമായി ഇത് അപൂർവമായേ സംഭവിച്ചിട്ടുള്ളൂ. എങ്കിലും ഏജന്റിന്റെ പെരുമാറ്റം അനുയോജ്യമായി തുടരുന്നുവെന്ന് ഉറപ്പാക്കാനുള്ള അധിക മുൻകരുതലാണിത്.

വേഗവും ചെലവുകുറവും നിലനിർത്താൻ:

  • പതിവായി ഉപയോഗിക്കുന്ന പ്രോംപ്റ്റുകളും ഭാഗിക സംഭാഷണങ്ങളും ശ്രദ്ധാപൂർവം തിരഞ്ഞെടുത്ത ഫ്യൂ-ഷോട്ട് ഉദാഹരണങ്ങളും ഞങ്ങൾ സംഭരിക്കുന്നു.

  • ഓരോ തവണയും സന്ദർഭം വീണ്ടും നിർമിക്കാതെതന്നെ LLM വർഗീകരണ സംവിധാനങ്ങൾ വേഗത്തിലും കുറഞ്ഞ ചെലവിലും പ്രയോഗിക്കാൻ ഈ കാഷിങ് സഹായിക്കുന്നു.

ഞങ്ങളുടെ സമീപനം ചിത്രീകരിക്കുന്ന രേഖാചിത്രം: പല പാളികളുള്ള വർഗീകരണവും പ്രോംപ്റ്റ് കാഷിങ്ങും.

ഭാവിയിലേക്ക്: ഭരണഘടനാധിഷ്ഠിത വർഗീകരണ സംവിധാനങ്ങൾ

Anthropic-ന്റെ സമീപകാല പഠനം, ദോഷകരമോ സുരക്ഷിതമല്ലാത്തതോ ആയ അഭ്യർഥനകൾ കണ്ടെത്താൻ “ഭരണഘടനാപരമായ” നിയമങ്ങൾ ഉപയോഗിച്ച് പരിശീലിപ്പിച്ച അധിക വർഗീകരണ സംവിധാനങ്ങളെ ആശ്രയിക്കുന്ന ഭരണഘടനാധിഷ്ഠിത വർഗീകരണ സംവിധാനങ്ങളെ വിവരിച്ചു. അവർ റിപ്പോർട്ട് ചെയ്തത്:

  • ആയിരക്കണക്കിന് മണിക്കൂറുകളുടെ മനുഷ്യ റെഡ് ടീമിംഗിനെതിരെ ഉയർന്ന പ്രതിരോധശേഷി.

  • അനാവശ്യമായി നിരസിക്കുന്നതിന്റെ നിരക്ക് വളരെ കുറവും കംപ്യൂട്ടിങ് അധികഭാരം മിതവും.

മാറിക്കൊണ്ടിരിക്കുന്ന ജെയിൽബ്രേക്കിങ് തന്ത്രങ്ങൾക്കെതിരെ കൂടുതൽ സമഗ്രമായ പ്രതിരോധം നൽകിക്കൊണ്ട്, ഈ ഭരണഘടനാധിഷ്ഠിത സമീപനങ്ങൾക്ക് പരമ്പരാഗത വർഗീകരണ പാളികളെ പൂരിപ്പിക്കാനോ അവയ്ക്ക് പകരമാകാനോ കഴിയുന്നൊരു ഭാവിയാണ് ഞങ്ങൾ കാണുന്നത്.

സംഗ്രഹം: ഞങ്ങൾ പഠിച്ച പാഠങ്ങൾ

  1. സമാന്തരവും ലഘുവുമായ ഫിൽട്ടറുകൾ

ദോഷകരമായ ചോദ്യങ്ങൾ സൃഷ്ടിപരമായ മുഖ്യസംവിധാനത്തിൽ എത്തുന്നത് വർഗീകരണ പാളികൾ തടയുന്നു. മോശം ഔട്ട്‌പുട്ടുകൾ ഒരിക്കലും ഉപയോക്താവിന് ലഭിക്കില്ലെന്നും അവ ഉറപ്പാക്കുന്നു.

  1. ഉപയോക്തൃ അനുഭവം പ്രധാനമാണ്

രസകരവും കഥാപശ്ചാത്തലത്തിന് അനുയോജ്യവുമായ മുന്നറിയിപ്പുകളിലും കളിയായ നിരസിക്കലുകളിലും ശ്രദ്ധ കേന്ദ്രീകരിക്കുമ്പോൾ, ഉപയോക്താക്കൾ സംവിധാനത്തിന്റെ നിയന്ത്രണങ്ങൾ സ്വീകരിക്കാൻ കൂടുതൽ സന്നദ്ധരാകും.

  1. പരിശോധനയിലും നിരീക്ഷണത്തിലും വിട്ടുവീഴ്ച ചെയ്യരുത്

പതിവായ റെഡ് ടീമിങ്ങും കളിക്കാരുടെ പെരുമാറ്റത്തിന്റെ നിരന്തര നിരീക്ഷണവും, വിപുലമായ കളിക്കാർക്ക് ദൗർബല്യങ്ങൾ അറിയുന്നതിന് മുമ്പുതന്നെ അവ കണ്ടെത്താൻ സഹായിക്കും. പിന്നീട് ഇവ ഫ്യൂ-ഷോട്ട് വർഗീകരണ സംവിധാനത്തിന്റെ പ്രോംപ്റ്റുകളിലേക്ക് തിരികെ ചേർത്ത് ഭാവിയിൽ ദുരുപയോഗം ചെയ്യുന്നത് തടയാം. ഇപ്പോൾ ഇത് നേരിട്ട് ചെയ്യുന്ന പ്രക്രിയയാണെങ്കിലും സ്വയമേവയാക്കാനാകും.

നാളേക്കായി സുരക്ഷിതവും ആകർഷകവുമായ GenAI സംവിധാനങ്ങൾ നിർമിക്കൽ

നിങ്ങൾ ഒരു ഗെയിം കമ്പനിയോ ബാങ്കോ സർക്കാർ വകുപ്പോ ആകട്ടെ, വലിയ തോതിൽ ഉപഭോക്തൃസേവന ചാറ്റ്ബോട്ട് നടപ്പാക്കുകയാണെങ്കിൽ ഉപയോക്തൃ രൂപകൽപ്പനയും വിശ്വാസ്യതയും ഒരുപോലെ ലക്ഷ്യമിടണം.

ഇനിപ്പറയുന്ന കാര്യങ്ങൾ പ്രധാനമായ സ്ഥാപനങ്ങൾക്കും ബ്രാൻഡുകൾക്കുമായി ഞങ്ങൾ ഉപഭോക്തൃമുഖ പരിഹാരങ്ങൾ നിർമിക്കുന്നു:

  1. സുരക്ഷയ്ക്കാണ് പരമപ്രാധാന്യം—ഉപയോക്താക്കൾക്ക് മൂല്യം നൽകുകയും ഹാനികരമായ ഉള്ളടക്കത്തിൽനിന്ന് അവരെ കർശനമായി സംരക്ഷിക്കുകയും ചെയ്യുന്ന ചാറ്റ്ബോട്ടുകൾ.

  2. പ്രശസ്തി സംരക്ഷിക്കപ്പെടുന്നു—ഉപയോക്താക്കൾ സംവിധാനത്തെ അതിന്റെ പരിധിക്കപ്പുറം കൊണ്ടുപോകാൻ ശ്രമിച്ചാലും ബ്രാൻഡിന്റെ പ്രശസ്തി നിലനിർത്തുന്ന പല പാളികളുള്ള സംരക്ഷണം ഞങ്ങൾ രൂപകൽപ്പന ചെയ്യുന്നു.

  3. നിയന്ത്രണങ്ങൾ നിങ്ങളുടെ സാധ്യതകൾ പരിമിതപ്പെടുത്തുന്നു—ആപ്ലിക്കേഷൻ ജെയിൽബ്രേക്ക് ചെയ്യപ്പെടുമെന്ന ആശങ്കയില്ലാതെ പരിഹാരങ്ങൾ വിപുലീകരിക്കാൻ കഴിയുന്നവിധം ഏറ്റവും പുതിയ അനുസരണ മാർഗനിർദേശങ്ങൾ ഞങ്ങൾ നിരന്തരം പിന്തുടരുന്നു.

രചയിതാവ്

Andrew Liubinas