முதன்மை வழிசெலுத்தல்

அதிக ஆபத்துள்ள வணிகங்களுக்குப் பாதுகாப்பான உரையாடல் ஏஜென்ட்களை உருவாக்குதல்

உங்கள் நிறுவனத்தைப் பிரதிநிதித்துவப்படுத்தும் உரையாடல் நிரலை உருவாக்கும்போது, அது பாதுகாப்பாக இருப்பது மட்டும் போதாது. அது உண்மையாகவே உங்களின் குரலில் பேச வேண்டும்.

செயலாக்கச் சுருக்கம்

  • பொதுமக்கள் பயன்படுத்தும் LLM செயலிகள், நிறுவனங்களின் நற்பெயருக்கும் நிதிக்கும் ஆபத்தை ஏற்படுத்தலாம்.

  • LLM ஜெயில்பிரேக்குகள் மற்றும் பிற எதிர்பாராத LLM நடத்தைகளால் ஏற்படும் தீங்கைக் குறைக்க, பல அடுக்கு வகைப்படுத்தல் வடிகட்டிகளைப் பயன்படுத்துகிறோம்.

  • நாள்தோறும் 40,000-க்கும் மேற்பட்ட செய்திகளைக் கையாளும், அதிகப் பயன்பாடு கொண்ட ஒரு நடைமுறைச் செயலியில் இதைப் பயன்படுத்தியுள்ளோம். இந்த எண்ணிக்கை தொடர்ந்து அதிகரிக்கிறது.

அறிமுகம்

கடந்த ஓராண்டாக, குழந்தைகளும் உள்ள ஒரு விளையாட்டாளர் சமூகத்திடமிருந்து நாள்தோறும் சுமார் 40,000 செய்திகளை எதிர்கொள்ளும் உருவாக்கும் செயற்கை நுண்ணறிவு உரையாடல் நிரலை அறிமுகப்படுத்த, முன்னணி விளையாட்டு உருவாக்குநருடன் இணைந்து பணியாற்றியுள்ளோம். வேகம், துல்லியம், பாதுகாப்பு, மகிழ்ச்சி ஆகியவற்றைச் சமநிலைப்படுத்துவது அவசியம்:

உங்கள் நிறுவனத்தைப் பிரதிநிதித்துவப்படுத்தும் உரையாடல் நிரலை உருவாக்கும்போது, அது பாதுகாப்பாக இருப்பது மட்டும் போதாது. அது உண்மையாகவே உங்களின் குரலில் பேச வேண்டும்.

ஒரு விளையாட்டு நிறுவனத்தைப் பொறுத்தவரை, குறிப்பாக இளம் பயனர்களுக்காக, பாதுகாப்புடன் மகிழ்ச்சியையும் பயனர்களின் உற்சாகத்தையும் இணைக்க வேண்டும்.

நவீன உருவாக்கும் செயற்கை நுண்ணறிவுச் செயலிகளுக்கு அடித்தளமாக உள்ள LLM-கள் மிகவும் நெகிழ்வானவை. அதனால்தான் பல்வேறு சிக்கல்களுக்கு அவை சிறப்பாகப் பொதுமைப்படுத்தப்படுகின்றன. ஆனால் அவற்றுக்குப் போதிய கட்டுப்பாடுகள் இல்லை. இதனால் அவை அடிக்கடி எதிர்பாராத திசையில் சென்று பல்வேறு வகையான உரைகளை வழங்கக்கூடும். அவற்றில் சில பொருத்தமற்றவையாக இருக்கலாம்.

LLM-ஐப் பொதுமக்கள் நேரடியாகப் பயன்படுத்த அனுமதிப்பது நிச்சயமாக எதிர்பாராத நடத்தைக்கு வழிவகுக்கும். சரியான தடுப்பு நடவடிக்கைகள் இல்லாவிட்டால், பின்வரும் ஆபத்துகள் ஏற்படலாம்:

நிஜ உலக ஆபத்துகள் குறித்த ஒரு பார்வை.

எதிர்பாராத LLM பயன்பாடு குறித்த செய்தித் தலைப்புகள்:

உருவாக்கும் செயற்கை நுண்ணறிவு அமைப்புகளில் பாதுகாப்பை உருவாக்குவதும் தொடர்ந்து பராமரிப்பதும் விருப்பத்திற்குரியவை அல்ல என்பதை இந்தச் சம்பவங்கள் எடுத்துக்காட்டுகின்றன. குறிப்பாகச் சிறு குழந்தைகள் பயன்படுத்தும்போது, பொறுப்புத்துறப்புகளை மட்டும் நம்பியிருக்க முடியாது. உள்ளடக்கம் பொருத்தமாக இருப்பதை உறுதிசெய்ய வலுவான பாதுகாப்புக் கட்டுப்பாடுகள் அவசியம்.

எங்கள் அணுகுமுறை: பல அடுக்கு வகைப்படுத்தலும் ப்ராம்ப்ட் தேக்ககமும்

வாடிக்கையாளர்களுக்காக நாங்கள் உருவாக்கிய, மீட்டெடுப்பால் மேம்படுத்தப்பட்ட உருவாக்க அமைப்புகளைப் போலவே, செயல்திறனை உயர்வாக வைத்துக்கொண்டே ஜெயில்பிரேக் ஆபத்துகளைக் குறைக்க பல செயற்கை நுண்ணறிவுக் கூறுகளைப் பயன்படுத்துகிறோம்.

எங்கள் அணுகுமுறையை விளக்கும் வரைபடம்: பல அடுக்கு வகைப்படுத்தலும் ப்ராம்ப்ட் தேக்ககமும்.

எங்கள் அமைப்பின் எளிமைப்படுத்தப்பட்ட கட்டமைப்பு வரைபடம்

அமைப்பின் பாதுகாப்பை உறுதிசெய்ய, உள்ளீடுகள் மற்றும் வெளியீடுகள் இரண்டிலும் LLM வகைப்படுத்திகளைப் பயன்படுத்துகிறோம்:

  1. உள்ளீட்டு வகைப்படுத்தல். ஒரே நேரத்தில் இயங்குகிறது.

  • பயனர் கேள்விகளுக்கு SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT போன்ற அடையாளங்களை வழங்க, LLM ஸ்ட்ரக்ச்சர்டு அவுட்புட்ஸுடன் Pydantic திட்டவடிவங்களைப் பயன்படுத்தினோம். ஜெயில்பிரேக் அல்லது அனுமதிக்கப்படாத நடத்தையை அடையாளம் காணும் குறியீடுகளும் இதில் இடம்பெற்றன.

  • ஒவ்வொரு தலைப்புக்கும் தனித்தனி வகைப்படுத்திகளைப் பயன்படுத்தியது, அனைத்தையும் கையாளும் ஒரே மாபெரும் வகைப்படுத்தியைவிடக் குறிப்பிடத்தக்க அளவில் சிறந்த செயல்திறனை வழங்கியது.

  • “இந்தக் கதாபாத்திரம் என்னைத் தொடர்ந்து கொல்கிறது” என்பது விளையாட்டைக் குறிப்பதையும், “என் பெற்றோர் என்னைக் காயப்படுத்துகிறார்” என்பது குழந்தைக்குத் தீங்கு ஏற்படும் அறிகுறி என்பதையும் வகைப்படுத்திகள் வேறுபடுத்திக் காட்ட, விரிவான ஃப்யூ-ஷாட் எடுத்துக்காட்டுகள் மிகவும் அவசியமாக இருந்தன.

  • வாடிக்கையாளருடனும் அவர்களின் நம்பிக்கை மற்றும் பாதுகாப்பு நிபுணர் குழுக்களுடனும் நெருக்கமாக இணைந்து பணியாற்றியதால், நிஜ வாழ்க்கையில் அதிக ஆபத்துள்ள செய்திகளை அவர்கள் மதிப்பிடும் விதத்தை எங்கள் வகைப்படுத்திகள் பிரதிபலித்தன.

எங்கள் அணுகுமுறையை விளக்கும் வரைபடம்: பல அடுக்கு வகைப்படுத்தலும் ப்ராம்ப்ட் தேக்ககமும்.

  1. பதிலை உருவாக்குதல்

  • உள்ளீடு பாதுகாப்பானது என்று தீர்மானிக்கப்பட்டால், முதன்மை LLM பதிலை உருவாக்குகிறது.

  • இல்லையெனில், செய்தி புறக்கணிக்கப்படலாம். ஜெயில்பிரேக்குகளுக்கு இது பொருந்தும். கேள்வி பாதுகாப்புச் சிக்கலைக் குறித்தால், அது மனிதரின் பரிசீலனைக்கு அனுப்பப்படலாம்.

  1. வெளியீட்டு வகைப்படுத்தல்

  • மாடலின் பதிலை இறுதியாக வழங்குவதற்கு முன், எங்கள் செயலியிலேயே அதை வகைப்படுத்துகிறோம்.

  • சில பதில்கள் இணையத்திலிருந்து சேகரிக்கப்பட்ட தரவுகளுடன் மீட்டெடுப்பால் மேம்படுத்தப்பட்ட உருவாக்க நுட்பங்களைப் பயன்படுத்தக்கூடும் என்பதால், தரவு நச்சூட்டலிலிருந்து இந்தப் படிநிலை எங்களைப் பாதுகாக்கிறது.

  • அதில் அனுமதிக்கப்படாத உள்ளடக்கம் இருந்தால், அமைப்பு தலையிட்டு அதற்குப் பதிலாகப் பொதுவான செய்தியை வழங்குகிறது. நடைமுறையில் இது அரிதாகவே நிகழ்ந்துள்ளது. இருப்பினும், ஏஜென்ட்டின் நடத்தை தொடர்ந்து பொருத்தமாக இருப்பதை உறுதிசெய்யும் கூடுதல் முன்னெச்சரிக்கை அடுக்காக இது செயல்படுகிறது.

வேகத்தையும் மலிவான செலவையும் பராமரிக்க:

  • அடிக்கடி பயன்படுத்தப்படும் ப்ராம்ப்ட்கள், பகுதி உரையாடல்கள் மற்றும் கவனமாகத் தேர்ந்தெடுக்கப்பட்ட ஃப்யூ-ஷாட் எடுத்துக்காட்டுகளைச் சேமிக்கிறோம்.

  • ஒவ்வொரு முறையும் சூழலை மீண்டும் உருவாக்காமல், LLM வகைப்படுத்திகளை விரைவாகவும் குறைந்த செலவிலும் பயன்படுத்த இந்தத் தேக்ககம் உதவுகிறது.

எங்கள் அணுகுமுறையை விளக்கும் வரைபடம்: பல அடுக்கு வகைப்படுத்தலும் ப்ராம்ப்ட் தேக்ககமும்.

எதிர்காலத்தை நோக்கி: நெறிமுறைசார் வகைப்படுத்திகள்

Anthropic அண்மையில் வெளியிட்ட ஆய்வு, நெறிமுறைசார் வகைப்படுத்திகளை விவரித்தது. தீங்கிழைக்கும் அல்லது பாதுகாப்பற்ற கோரிக்கைகளைக் கண்டறிய, “நெறிமுறை” விதிகளைக் கொண்டு பயிற்றுவிக்கப்பட்ட கூடுதல் வகைப்படுத்திகளை இந்த அமைப்பு சார்ந்துள்ளது. அவர்கள் தெரிவித்த முடிவுகள்:

  • மனிதர்களால் ஆயிரக்கணக்கான மணிநேரம் மேற்கொள்ளப்பட்ட ரெட் டீமிங்கிற்கு எதிரான மிகுந்த உறுதித்தன்மை.

  • மிகக் குறைந்த தேவையற்ற மறுப்பு விகிதங்களும் மிதமான கணக்கீட்டுக் கூடுதல் சுமையும்.

இந்த நெறிமுறைசார் அணுகுமுறைகள் பாரம்பரிய வகைப்படுத்தல் அடுக்குகளுக்குத் துணையாகவோ அவற்றுக்கு மாற்றாகவோ அமையலாம். வளர்ந்து வரும் ஜெயில்பிரேக் உத்திகளுக்கு எதிராக இவை விரிவான பாதுகாப்பை வழங்கும் எதிர்காலத்தை நாங்கள் காண்கிறோம்.

சுருக்கம்: நாங்கள் கற்றுக்கொண்ட பாடங்கள்

  1. இணையாக இயங்கும் எளிய வடிகட்டிகள்

தீங்கிழைக்கும் கேள்விகள் உருவாக்கும் மையத்தை அடைவதை வகைப்படுத்தல் அடுக்குகள் தடுக்கின்றன. தரமற்ற வெளியீடுகள் பயனர்களுக்கு வழங்கப்படாமல் இருப்பதையும் உறுதிசெய்கின்றன.

  1. பயனர் அனுபவம் முக்கியம்

வேடிக்கையான, கதைக்களப் பின்னணி சார்ந்த எச்சரிக்கைகளையும் விளையாட்டுத்தனமான மறுப்புகளையும் பயன்படுத்தும்போது, பயனர்கள் அமைப்பின் கட்டுப்பாடுகளை ஏற்றுக்கொள்ள அதிக வாய்ப்புள்ளது.

  1. சோதனையிலும் கண்காணிப்பிலும் குறுக்குவழிகளை நாடாதீர்கள்

தொடர்ச்சியான ரெட் டீமிங்கும் விளையாட்டாளர்களின் நடத்தையை அடிக்கடி கண்காணிப்பதும், குறைபாடுகள் பரந்த விளையாட்டாளர் சமூகத்திற்குத் தெரியவருவதற்கு முன்பே அவற்றைக் கண்டறிய உதவும். பின்னர் இவற்றை ஃப்யூ-ஷாட் வகைப்படுத்தி ப்ராம்ப்ட்களில் மீண்டும் சேர்த்து, எதிர்காலத்தில் அவை பயன்படுத்தப்படுவதைத் தடுக்கலாம். தற்போது இது கைமுறைச் செயல்முறையாக இருந்தாலும், இதைத் தானியக்கமாக்க முடியும்.

நாளைய பாதுகாப்பான, ஈர்க்கக்கூடிய உருவாக்கும் செயற்கை நுண்ணறிவு அமைப்புகளை உருவாக்குதல்

நீங்கள் விளையாட்டு நிறுவனமாகவோ, வங்கியாகவோ, அரசுத் துறையாகவோ இருக்கலாம். வாடிக்கையாளர் சேவை உரையாடல் நிரலைப் பெருமளவில் செயல்படுத்த விரும்பினால், பயனரை மையப்படுத்திய வடிவமைப்பு மற்றும் நம்பகத்தன்மை ஆகிய இரண்டையும் இலக்காகக் கொள்ள வேண்டும்.

பின்வரும் தேவைகளைக் கொண்ட நிறுவனங்கள் மற்றும் வணிக அடையாளங்களுக்காக, வாடிக்கையாளர்கள் பயன்படுத்தும் தீர்வுகளை உருவாக்குகிறோம்:

  1. பாதுகாப்பே முதன்மையானது. பயனர்களுக்கு மதிப்பை வழங்குவதுடன், தீங்கு விளைவிக்கும் உள்ளடக்கத்திலிருந்து அவர்களைக் கடுமையாகப் பாதுகாக்கும் உரையாடல் நிரல்கள்.

  2. நற்பெயர் பாதுகாக்கப்படுகிறது. பயனர்கள் அமைப்பை அதன் வரம்புகளுக்கு அப்பால் தள்ள முயன்றாலும், நிறுவனத்தின் நற்பெயரைப் பாதுகாக்கும் பல அடுக்குப் பாதுகாப்புகளை வடிவமைக்கிறோம்.

  3. ஒழுங்குமுறைகள் உங்கள் தெரிவுகளைக் கட்டுப்படுத்துகின்றன. உங்கள் செயலி ஜெயில்பிரேக் செய்யப்படும் என்ற கவலையின்றித் தீர்வுகளைப் பெருமளவில் செயல்படுத்த, சமீபத்திய இணக்க வழிகாட்டுதல்களைத் தொடர்ந்து பின்பற்றுகிறோம்.

ஆசிரியர்

Andrew Liubinas