ძირითადი ნავიგაცია

უსაფრთხო ჩატ-აგენტების შექმნა მაღალი რისკის ბიზნესებისთვის

როცა თქვენი ბრენდის წარმომადგენელ ჩატბოტს ქმნით, მხოლოდ უსაფრთხოება არ კმარა — მისი ხმა ნამდვილად თქვენს ბრენდს უნდა ჰგავდეს.

მოკლე მიმოხილვა

  • საჯაროდ ხელმისაწვდომმა დიდი ენობრივი მოდელების (LLM) აპლიკაციებმა შესაძლოა ბრენდებს რეპუტაციული და ფინანსური რისკები შეუქმნას.

  • LLM-ისთვის მწარმოებლის შეზღუდვების მოხსნითა და სხვა გაუთვალისწინებელი ქცევით გამოწვეული ზიანის შესამცირებლად კლასიფიკაციის მრავალშრიან ფილტრებს ვიყენებთ.

  • ეს მიდგომა გამოვიყენეთ მაღალი დატვირთვის მქონე სამუშაო აპლიკაციაში, რომელიც დღეში 40 000 და სულ უფრო მეტ შეტყობინებას ამუშავებს.

შესავალი

გასული წლის განმავლობაში წამყვან თამაშების დეველოპერთან ვთანამშრომლობდით GenAI ჩატბოტის დასანერგად, რომელიც მოთამაშეებისგან, მათ შორის ბავშვებისგან, დღეში დაახლოებით 40 000 შეტყობინებას იღებს. აუცილებელია სისწრაფის, სიზუსტის, უსაფრთხოებისა და სახალისო გამოცდილების დაბალანსება:

როცა თქვენი ბრენდის წარმომადგენელ ჩატბოტს ქმნით, მხოლოდ უსაფრთხოება არ კმარა — მისი ხმა ნამდვილად თქვენს ბრენდს უნდა ჰგავდეს.

თამაშების კომპანიის შემთხვევაში ეს უსაფრთხოების, გართობისა და მომხმარებლის აღფრთოვანების გაერთიანებას ნიშნავს — განსაკუთრებით, ახალგაზრდა აუდიტორიისთვის.

თანამედროვე GenAI აპლიკაციების საფუძვლად გამოყენებული LLM-ები ძალიან მოქნილია (ამიტომაც უმკლავდება მრავალ განსხვავებულ ამოცანას), თუმცა საკმარისად შეზღუდული არ არის. ეს ნიშნავს, რომ ისინი ხშირად შეიძლება დასახულ გზას ასცდნენ და მრავალგვარი ტექსტი დააბრუნონ, რომელთაგან ნაწილიც შესაძლოა შეუსაბამო იყოს.

LLM-ის საზოგადოებისთვის პირდაპირ მიწოდება აუცილებლად გამოიწვევს მოულოდნელ ქცევას და სათანადო შემარბილებელი ზომების გარეშე წარმოშობს შემდეგ რისკებს:

რეალურ სამყაროში არსებული რისკების მოკლე მიმოხილვა…

LLM-ის გაუთვალისწინებელ გამოყენებასთან დაკავშირებული ახალი ამბების სათაურები:

ეს შემთხვევები ცხადყოფს, რატომ არ არის GenAI სისტემებში უსაფრთხოების შექმნა და შენარჩუნება არჩევითი. ეს განსაკუთრებით მნიშვნელოვანია მცირეწლოვანი ბავშვების შემთხვევაში: მხოლოდ პასუხისმგებლობის შეზღუდვის განცხადებებს ვერ დაეყრდნობით — შიგთავსის შესაბამისობისთვის აუცილებელია საიმედო დამცავი მექანიზმები.

ჩვენი მიდგომა: მრავალშრიანი კლასიფიკაცია და მოთხოვნების კეშირება

კლიენტებისთვის შექმნილი RAG (ძიებით გაძლიერებული გენერაციის) სისტემების მსგავსად, მწარმოებლის შეზღუდვების მოხსნის რისკის შესამცირებლად და მაღალი წარმადობის შესანარჩუნებლად ხელოვნური ინტელექტის რამდენიმე კომპონენტს ვიყენებთ.

ჩვენი მიდგომის ამსახველი დიაგრამა: მრავალშრიანი კლასიფიკაცია და მოთხოვნების კეშირება.

ჩვენი სისტემის არქიტექტურის გამარტივებული დიაგრამა

სისტემის უსაფრთხოების უზრუნველსაყოფად LLM კლასიფიკატორებს ვიყენებთ როგორც შემავალ, ისე გამომავალ მონაცემებზე:

  1. შემავალი მონაცემების კლასიფიკაცია (პარალელურ რეჟიმში)

  • მომხმარებლის მოთხოვნებისთვის ნიშნულების მისანიჭებლად (მაგ., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT და სხვ.) Pydantic-ის სქემები LLM-ის სტრუქტურირებულ შედეგებთან ერთად გამოვიყენეთ. ეს ასევე მოიცავდა ინდიკატორებს მწარმოებლის შეზღუდვების მოხსნის მცდელობის ან აკრძალული ქცევის გამოსავლენად.

  • ცალკეული თემებისთვის რამდენიმე კლასიფიკატორის გამოყენებამ გაცილებით უკეთესი შედეგი მოგვცა, ვიდრე ერთმა უზარმაზარმა, „ყველაფრის მომცველმა“ კლასიფიკატორმა.

  • Few-shot სწავლების მრავალფეროვანი მაგალითები გადამწყვეტი იყო, რათა კლასიფიკატორებს ერთმანეთისგან გაერჩია „I keep being killed by this character“ (თამაშზე მითითება) და „I am being hurt by my parent“ (ბავშვისთვის ზიანის მიყენების ნიშანი).

  • კლიენტთან და მის ნდობისა და უსაფრთხოების სპეციალიზებულ გუნდებთან მჭიდრო თანამშრომლობამ უზრუნველყო, რომ ჩვენი კლასიფიკატორები მაღალი რისკის შეტყობინებებს ისე აფასებდნენ, როგორც ისინი შეაფასებდნენ რეალურ გარემოში.

ჩვენი მიდგომის ამსახველი დიაგრამა: მრავალშრიანი კლასიფიკაცია და მოთხოვნების კეშირება.

  1. პასუხის გენერირება

  • თუ შემავალი მონაცემები უსაფრთხოდ ჩაითვლება, პასუხს ძირითადი LLM ქმნის.

  • სხვა შემთხვევაში შეტყობინება შეიძლება უგულებელყოფილ იქნეს (მწარმოებლის შეზღუდვების მოხსნის მცდელობისას) ან გადაეცეს ადამიანს (თუ მოთხოვნა უსაფრთხოების პრობლემაზე მიუთითებს).

  1. გამომავალი მონაცემების კლასიფიკაცია

  • საბოლოო მიწოდებამდე და აპლიკაციიდან გასვლამდე მოდელის პასუხს კლასიფიკაციას ვუტარებთ.

  • ვინაიდან ზოგი პასუხი ინტერნეტიდან შეგროვებულ მონაცემებზე დაფუძნებულ RAG ტექნიკას შეიძლება იყენებდეს, ეს ეტაპი მონაცემების მოწამვლისგან გვიცავს.

  • თუ პასუხი აკრძალულ შიგთავსს შეიცავს, სისტემა ერევა და მას ზოგადი შეტყობინებით ანაცვლებს. პრაქტიკაში ეს იშვიათად მომხდარა, თუმცა ეს დამატებითი სიფრთხილის ზომაა, რომელიც აგენტის ქცევის შესაბამისობას უზრუნველყოფს.

სისწრაფისა და ხელმისაწვდომი ფასის შესანარჩუნებლად:

  • ხშირად გამოყენებულ მოთხოვნებსა და დიალოგების ნაწილებს Few-shot სწავლების საგულდაგულოდ შერჩეულ მაგალითებთან ერთად ვინახავთ.

  • კეშირება საშუალებას გვაძლევს, LLM კლასიფიკატორები სწრაფად და დაბალ ფასად გამოვიყენოთ ისე, რომ კონტექსტის ყოველ ჯერზე ხელახლა აგება არ დაგვჭირდეს.

ჩვენი მიდგომის ამსახველი დიაგრამა: მრავალშრიანი კლასიფიკაცია და მოთხოვნების კეშირება.

მომავლის ხედვა: კონსტიტუციური კლასიფიკატორები

Anthropic-ის ბოლოდროინდელ კვლევაში აღწერილია კონსტიტუციური კლასიფიკატორები — სისტემა, რომელიც მავნე ან სახიფათო მოთხოვნების გამოსავლენად „კონსტიტუციური“ წესებით გაწვრთნილ დამატებით კლასიფიკატორებს ეყრდნობა. მათი ცნობით, სისტემას ახასიათებს:

  • მაღალი მდგრადობა ადამიანების მიერ ათასობით საათის განმავლობაში ჩატარებული შეტევითი ტესტირების (red teaming) მიმართ.

  • დასაბუთებული მოთხოვნების უარყოფის მინიმალური მაჩვენებელი და გამოთვლითი რესურსების ზომიერი დამატებითი ხარჯი.

მომავალში ამ კონსტიტუციურ მიდგომებს შეუძლია შეავსოს ან სულაც ჩაანაცვლოს ტრადიციული კლასიფიკაციის შრეები და უფრო სრულყოფილი დაცვა უზრუნველყოს მწარმოებლის შეზღუდვების მოხსნის ცვალებადი ტაქტიკებისგან.

შეჯამება: მიღებული გამოცდილება

  1. პარალელური, მსუბუქი ფილტრები

კლასიფიკაციის შრეები ხელს უშლის მავნე მოთხოვნების გენერაციულ ბირთვამდე მიღწევას და უზრუნველყოფს, რომ უხარისხო შედეგები მომხმარებელს არ მიეწოდოს.

  1. მომხმარებლის გამოცდილება მნიშვნელოვანია

სახალისო, თამაშის სამყაროზე დაფუძნებული გაფრთხილებებისა და ხალისიანი უარის გამოყენებისას მომხმარებლები სისტემის შეზღუდვებს უფრო ადვილად იღებენ.

  1. ტესტირებასა და მონიტორინგზე ნუ დაზოგავთ

რეგულარული შეტევითი ტესტირება (red teaming) და მოთამაშეთა ქცევის ხშირი მონიტორინგი დაგეხმარებათ სისუსტეების აღმოჩენაში, სანამ მათ მოთამაშეთა ფართო წრე შეიტყობს. შემდეგ ეს ინფორმაცია შეიძლება Few-shot სწავლების კლასიფიკატორის მოთხოვნებს დაემატოს, რათა მომავალში ამ სისუსტეების გამოყენება აღიკვეთოს (ამჟამად ეს პროცესი ხელით სრულდება, თუმცა შესაძლებელია მისი ავტომატიზაცია).

მომავლისთვის უსაფრთხო და საინტერესო GenAI სისტემების შექმნა

იქნება ეს თამაშების კომპანია, ბანკი თუ სახელმწიფო უწყება, მომხმარებელთა მომსახურების ჩატბოტის ფართო მასშტაბით დანერგვისას ერთდროულად უნდა იზრუნოთ როგორც მომხმარებელზე ორიენტირებულ დიზაინზე, ისე სანდოობაზე.

ჩვენ ვქმნით მომხმარებელზე ორიენტირებულ გადაწყვეტებს იმ ორგანიზაციებისა და ბრენდებისთვის, რომლებისთვისაც:

  1. უსაფრთხოება უმთავრესია — ჩატბოტები მომხმარებლებს ღირებულებას სთავაზობს და ამავე დროს მკაცრად იცავს მათ საზიანო შიგთავსისგან

  2. რეპუტაცია დაცულია — ვქმნით დაცვის რამდენიმე შრეს, რომლებიც ბრენდის რეპუტაციას მაშინაც ინარჩუნებს, როდესაც მომხმარებლები სისტემის შესაძლებლობების ზღვარს სცდიან

  3. რეგულაციები თქვენს არჩევანს ზღუდავს — მუდმივად ვადევნებთ თვალს შესაბამისობის უახლეს მითითებებს, რათა გადაწყვეტების მასშტაბირება აპლიკაციისთვის მწარმოებლის შეზღუდვების მოხსნის საფრთხეზე დარდის გარეშე შეძლოთ

ავტორი

Andrew Liubinas