Общедоступные приложения на основе больших языковых моделей (LLM) могут создавать репутационные и финансовые риски для брендов.
Мы применяем многоуровневые фильтры классификации, чтобы снизить вред от джейлбрейков и другого нежелательного поведения LLM.
Мы применили этот подход в высоконагруженном рабочем приложении, которое обрабатывает 40 000 сообщений в день, и их число продолжает расти.
В течение последнего года мы сотрудничали с ведущим разработчиком игр, чтобы запустить чат-бота на основе генеративного ИИ, который обрабатывает около 40 000 сообщений в день от игроков, в том числе детей. Крайне важно соблюдать баланс между скоростью, точностью, безопасностью и увлекательностью:
Создавая чат-бота, который будет представлять ваш бренд, недостаточно сделать его безопасным — он должен говорить именно вашим голосом.
Для игровой компании это означает сочетать безопасность с увлекательностью и яркими впечатлениями — особенно для юной аудитории.
LLM, лежащие в основе современных приложений генеративного ИИ, очень гибки — поэтому они так хорошо справляются с самыми разными задачами, — но при этом недостаточно ограничены. Поэтому они нередко отклоняются от заданного курса и могут выдавать самые разные тексты, в том числе неуместные.
Прямой доступ широкой публики к LLM неизбежно приводит к непредвиденному поведению, а без надлежащих мер защиты создаёт риск:
джейлбрейков, когда пользователи намеренно манипулируют чат-ботом, заставляя его создавать вредоносный или запрещённый контент (кстати, на этом сайте любой желающий может в игровой форме поэкспериментировать с джейлбрейками LLM…); или
непреднамеренной выдачи неприятного, оскорбительного или опасного контента. Во многих случаях это может угрожать благополучию пользователей или наносить финансовый и репутационный ущерб поставщику приложения.
Новости о непредвиденном использовании LLM:
Эти случаи показывают, почему создание и поддержание безопасности систем генеративного ИИ — не дополнительная опция, а необходимость. Это особенно важно, если системой пользуются маленькие дети: одних предупреждений недостаточно — чтобы контент оставался приемлемым, необходимы надёжные защитные механизмы.
Как и в системах RAG (генерации с дополнением из внешних источников), созданных нами для клиентов, мы используем несколько компонентов ИИ, чтобы снизить риски джейлбрейков и сохранить высокую производительность.


Упрощённая схема архитектуры нашей системы
Для безопасности системы мы применяем LLM-классификаторы как к входным данным, так и к результатам:
Классификация входных данных (выполняется параллельно)
Мы использовали схемы Pydantic вместе со структурированными ответами LLM, чтобы присваивать запросам пользователей метки, например SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT и другие. Кроме того, применялись флаги для выявления джейлбрейков и запрещённого поведения.
Несколько классификаторов для отдельных тем показали значительно лучшие результаты, чем один универсальный классификатор «на все случаи».
Обширный набор few-shot-примеров был необходим, чтобы классификаторы различали фразы “I keep being killed by this character” (о событиях в игре) и “I am being hurt by my parent” (признак причинения вреда ребёнку).
Тесное сотрудничество с клиентом и его специалистами по доверию и безопасности помогло добиться того, чтобы наши классификаторы оценивали сообщения с высоким риском так же, как эксперты в реальных условиях.


Формирование ответа
Основная LLM формирует ответ, если входные данные признаны безопасными.
В противном случае сообщение можно проигнорировать, если это джейлбрейк, или передать специалисту, если запрос указывает на угрозу безопасности.
Классификация результатов
Перед окончательной отправкой пользователю мы классифицируем ответ модели в нашем приложении.
Поскольку некоторые ответы формируются методом RAG на основе данных, собранных в интернете, этот этап защищает систему от отравления данных.
Если ответ содержит запрещённый контент, система вмешивается и заменяет его общим сообщением. На практике такое случалось редко, но этот дополнительный уровень защиты помогает гарантировать приемлемое поведение агента.
Чтобы сохранить скорость и доступную стоимость:
мы сохраняем часто используемые промпты и фрагменты диалогов, а также тщательно подобранный набор few-shot-примеров.
Благодаря кешированию LLM-классификаторы работают быстро и с небольшими затратами, а контекст не приходится формировать заново при каждом запросе.


В недавнем исследовании Anthropic описана система Constitutional Classifiers — дополнительные классификаторы, обученные на «конституционных» правилах для выявления вредоносных или небезопасных запросов. Авторы сообщили о следующих результатах:
Высокая устойчивость к тысячам часов red teaming с участием людей.
Минимальная доля необоснованных отказов и умеренные дополнительные вычислительные затраты.
В будущем такие конституционные подходы смогут дополнять или даже заменять традиционные уровни классификации, обеспечивая более комплексную защиту от постоянно меняющихся тактик джейлбрейка.
Лёгкие параллельные фильтры
Уровни классификации не позволяют вредоносным запросам достичь генеративного ядра и не допускают выдачи некачественных результатов.
Пользовательский опыт имеет значение
Пользователи охотнее принимают ограничения системы, если предупреждения и отказы подаются увлекательно, в игровой форме и с опорой на сюжетный мир.
Не экономьте на тестировании и мониторинге
Регулярный red teaming и постоянный мониторинг поведения игроков помогают обнаруживать уязвимости до того, как о них узнает широкая аудитория. Затем эти сведения можно добавлять в промпты few-shot-классификаторов, чтобы предотвратить использование уязвимостей в будущем. Сейчас это делается вручную, но процесс можно автоматизировать.
Кем бы вы ни были — игровой компанией, банком или государственным ведомством, — при масштабном внедрении чат-бота для обслуживания клиентов необходимо уделять равное внимание и пользовательскому опыту, и надёжности.
Мы создаём решения для взаимодействия с клиентами организаций и брендов, которым важно следующее:
Безопасность превыше всего — чат-боты должны приносить пользу и при этом надёжно ограждать пользователей от вредоносного контента
Репутация защищена — мы проектируем несколько уровней защиты, которые сохраняют репутацию бренда, даже если пользователи пытаются вывести систему за установленные пределы
Регулирование ограничивает выбор — мы следим за новейшими требованиями, чтобы вы могли масштабировать решения, не опасаясь джейлбрейка приложения