Публичните приложения с големи езикови модели (LLM) могат да изложат брандовете на репутационни и финансови рискове.
Използваме многослойни филтри за класификация, за да ограничим вредите от джейлбрейкове и друго непредвидено поведение на големите езикови модели.
Приложихме този подход в производствено приложение с голям обем, което обработва по 40 000 съобщения дневно, а броят им продължава да расте.
През последната година си партнирахме с водещ разработчик на игри, за да внедрим GenAI чатбот, който обработва около 40 000 съобщения дневно от играчи, сред които има и деца. Балансът между бързина, точност, безопасност и забавление е от съществено значение:
Когато създавате чатбот, който да представя бранда ви, не е достатъчно той просто да е безопасен — трябва да звучи автентично като вас.
За компания за игри това означава безопасността да се съчетае със забавление и ентусиазъм у потребителите — особено при по-младата аудитория.
Големите езикови модели, върху които се основават съвременните GenAI приложения, са много гъвкави — затова се справят толкова добре с различни задачи — но същевременно не са достатъчно ограничени. Това означава, че често могат да се отклонят от зададения курс и да върнат най-различни текстове, част от които може да са неподходящи.
Ако голям езиков модел бъде предоставен директно на обществеността, неизбежно ще възникне неочаквано поведение, а без подходящи защитни мерки съществува риск от:
„Джейлбрейкове“, при които потребителите умишлено манипулират чатбота да създава вредно или забранено съдържание (забавен факт: всеки може да посети този сайт и чрез игра да изпробва джейлбрейк на големи езикови модели…); или
Неволно предоставяне на неприятно, обидно или опасно съдържание. В много случаи това може да застраши благосъстоянието на потребителите или да причини финансови и репутационни щети на доставчика на приложението.
Новинарски заглавия за непредвидена употреба на големи езикови модели:
Тези случаи показват защо изграждането и поддържането на безопасността в GenAI системите не е по избор. Това е особено важно, когато са замесени малки деца. Не можете да разчитате само на откази от отговорност — необходими са надеждни защитни механизми, за да остане съдържанието подходящо.
Подобно на системите за генериране с подпомагане чрез извличане (RAG), които сме изградили за клиенти, използваме множество компоненти с изкуствен интелект, за да намалим риска от джейлбрейк, без да жертваме производителността.


Опростена архитектурна схема на системата ни
За да гарантираме безопасността на системата, използваме класификатори с големи езикови модели както за входните, така и за изходните данни:
Класификация на входните данни (изпълнява се паралелно)
Използвахме схеми на Pydantic заедно със структурирани изходни данни от големи езикови модели, за да обозначаваме потребителските заявки (напр. SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT и др.). Това включваше и флагове за откриване на джейлбрейк или забранено поведение.
Използването на отделни класификатори за различните теми даде значително по-добри резултати от един универсален класификатор.
Многобройните примери с малко повторения бяха решаващи, за да могат класификаторите да разграничават “I keep being killed by this character” (за играта) от “I am being hurt by my parent” (признак за насилие над дете).
Тясното сътрудничество с клиента и специализираните му екипи по доверие и безопасност гарантира, че класификаторите ни отразяват начина, по който те биха оценили високорисковите съобщения в реални условия.


Генериране на отговор
Основният голям езиков модел генерира отговор, ако входните данни са оценени като безопасни.
В противен случай съобщението може да бъде игнорирано при джейлбрейк или предадено на човек, ако заявката сигнализира за проблем с безопасността.
Класификация на изходните данни
Преди отговорът да напусне приложението ни, класифицираме отговора на модела и едва след това го предоставяме.
Тъй като някои от отговорите могат да използват RAG техники с данни, извлечени от интернет, тази стъпка ни предпазва от отравяне на данните.
Ако отговорът съдържа забранено съдържание, системата се намесва и го заменя с общо съобщение. На практика рядко сме срещали подобни случаи, но това е допълнителна предпазна мярка, която гарантира, че поведението на Агента остава подходящо.
За да осигурим бързина и достъпна цена:
Съхраняваме често използвани подкани и части от диалози, както и внимателно подбран набор от примери с малко повторения.
Това кеширане ни позволява да прилагаме класификаторите с големи езикови модели бързо и евтино, без всеки път да изграждаме контекста отначало.


Скорошно проучване на Anthropic описва Конституционни класификатори — система, която разчита на допълнителни класификатори, обучени чрез „конституционни“ правила, за да откриват злонамерени или опасни заявки. Авторите съобщават за:
Висока устойчивост при хиляди часове стрес тестове с червен отбор.
Минимален дял на ненужните откази и умерено допълнително изчислително натоварване.
В бъдеще тези конституционни подходи могат да допълнят или дори да заменят традиционните слоеве за класификация, като осигурят по-цялостна защита срещу развиващите се тактики за джейлбрейк.
Леки паралелни филтри
Слоевете за класификация не допускат злонамерените заявки до генеративното ядро и гарантират, че некачествените резултати никога не достигат до потребителите.
Потребителското изживяване има значение
Когато отказите и предупрежденията са забавни, закачливи и съобразени със света на играта, потребителите са по-склонни да приемат ограниченията на системата.
Не правете компромиси с тестването и наблюдението
Редовните стрес тестове с червен отбор и честото наблюдение на поведението на играчите помагат за откриването на уязвимости, преди да станат известни на по-широката общност. След това тази информация може да бъде добавена към подканите с малко повторения за класификатора, за да не могат уязвимостите да се използват занапред. Понастоящем процесът е ръчен, но може да бъде автоматизиран.
Независимо дали сте компания за игри, банка или държавна институция, ако внедрявате мащабен чатбот за обслужване на клиенти, трябва да се стремите ЕДНОВРЕМЕННО към добър потребителски дизайн и надеждност.
Изграждаме решения за взаимодействие с клиенти за организации и брандове, при които:
Безопасността е на първо място — чатботове, които носят стойност на потребителите, като същевременно ги защитават стриктно от вредно съдържание
Репутацията е защитена — проектираме множество защитни слоеве, които пазят репутацията на бранда дори ако потребителите се опитат да изведат системата отвъд ограниченията ѝ
Регулациите ограничават възможностите ви — следим най-новите насоки за съответствие, за да можете да разширявате решенията си, без да се тревожите, че приложението ви ще бъде пробито чрез джейлбрейк