Основная навигация

Безопасные чат-агенты для компаний из отраслей с высоким уровнем риска

Создавая чат-бота, который будет представлять ваш бренд, недостаточно сделать его безопасным — он должен говорить именно вашим голосом.

Краткое содержание

  • Общедоступные приложения на основе больших языковых моделей (LLM) могут создавать репутационные и финансовые риски для брендов.

  • Мы применяем многоуровневые фильтры классификации, чтобы снизить вред от джейлбрейков и другого нежелательного поведения LLM.

  • Мы применили этот подход в высоконагруженном рабочем приложении, которое обрабатывает 40 000 сообщений в день, и их число продолжает расти.

Введение

В течение последнего года мы сотрудничали с ведущим разработчиком игр, чтобы запустить чат-бота на основе генеративного ИИ, который обрабатывает около 40 000 сообщений в день от игроков, в том числе детей. Крайне важно соблюдать баланс между скоростью, точностью, безопасностью и увлекательностью:

Создавая чат-бота, который будет представлять ваш бренд, недостаточно сделать его безопасным — он должен говорить именно вашим голосом.

Для игровой компании это означает сочетать безопасность с увлекательностью и яркими впечатлениями — особенно для юной аудитории.

LLM, лежащие в основе современных приложений генеративного ИИ, очень гибки — поэтому они так хорошо справляются с самыми разными задачами, — но при этом недостаточно ограничены. Поэтому они нередко отклоняются от заданного курса и могут выдавать самые разные тексты, в том числе неуместные.

Прямой доступ широкой публики к LLM неизбежно приводит к непредвиденному поведению, а без надлежащих мер защиты создаёт риск:

Несколько примеров реальных рисков…

Новости о непредвиденном использовании LLM:

Эти случаи показывают, почему создание и поддержание безопасности систем генеративного ИИ — не дополнительная опция, а необходимость. Это особенно важно, если системой пользуются маленькие дети: одних предупреждений недостаточно — чтобы контент оставался приемлемым, необходимы надёжные защитные механизмы.

Наш подход: многоуровневая классификация и кеширование промптов

Как и в системах RAG (генерации с дополнением из внешних источников), созданных нами для клиентов, мы используем несколько компонентов ИИ, чтобы снизить риски джейлбрейков и сохранить высокую производительность.

Схема нашего подхода: многоуровневая классификация и кеширование промптов.

Упрощённая схема архитектуры нашей системы

Для безопасности системы мы применяем LLM-классификаторы как к входным данным, так и к результатам:

  1. Классификация входных данных (выполняется параллельно)

  • Мы использовали схемы Pydantic вместе со структурированными ответами LLM, чтобы присваивать запросам пользователей метки, например SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT и другие. Кроме того, применялись флаги для выявления джейлбрейков и запрещённого поведения.

  • Несколько классификаторов для отдельных тем показали значительно лучшие результаты, чем один универсальный классификатор «на все случаи».

  • Обширный набор few-shot-примеров был необходим, чтобы классификаторы различали фразы “I keep being killed by this character” (о событиях в игре) и “I am being hurt by my parent” (признак причинения вреда ребёнку).

  • Тесное сотрудничество с клиентом и его специалистами по доверию и безопасности помогло добиться того, чтобы наши классификаторы оценивали сообщения с высоким риском так же, как эксперты в реальных условиях.

Схема нашего подхода: многоуровневая классификация и кеширование промптов.

  1. Формирование ответа

  • Основная LLM формирует ответ, если входные данные признаны безопасными.

  • В противном случае сообщение можно проигнорировать, если это джейлбрейк, или передать специалисту, если запрос указывает на угрозу безопасности.

  1. Классификация результатов

  • Перед окончательной отправкой пользователю мы классифицируем ответ модели в нашем приложении.

  • Поскольку некоторые ответы формируются методом RAG на основе данных, собранных в интернете, этот этап защищает систему от отравления данных.

  • Если ответ содержит запрещённый контент, система вмешивается и заменяет его общим сообщением. На практике такое случалось редко, но этот дополнительный уровень защиты помогает гарантировать приемлемое поведение агента.

Чтобы сохранить скорость и доступную стоимость:

  • мы сохраняем часто используемые промпты и фрагменты диалогов, а также тщательно подобранный набор few-shot-примеров.

  • Благодаря кешированию LLM-классификаторы работают быстро и с небольшими затратами, а контекст не приходится формировать заново при каждом запросе.

Схема нашего подхода: многоуровневая классификация и кеширование промптов.

Взгляд в будущее: конституционные классификаторы

В недавнем исследовании Anthropic описана система Constitutional Classifiers — дополнительные классификаторы, обученные на «конституционных» правилах для выявления вредоносных или небезопасных запросов. Авторы сообщили о следующих результатах:

  • Высокая устойчивость к тысячам часов red teaming с участием людей.

  • Минимальная доля необоснованных отказов и умеренные дополнительные вычислительные затраты.

В будущем такие конституционные подходы смогут дополнять или даже заменять традиционные уровни классификации, обеспечивая более комплексную защиту от постоянно меняющихся тактик джейлбрейка.

Итоги: чему мы научились

  1. Лёгкие параллельные фильтры

Уровни классификации не позволяют вредоносным запросам достичь генеративного ядра и не допускают выдачи некачественных результатов.

  1. Пользовательский опыт имеет значение

Пользователи охотнее принимают ограничения системы, если предупреждения и отказы подаются увлекательно, в игровой форме и с опорой на сюжетный мир.

  1. Не экономьте на тестировании и мониторинге

Регулярный red teaming и постоянный мониторинг поведения игроков помогают обнаруживать уязвимости до того, как о них узнает широкая аудитория. Затем эти сведения можно добавлять в промпты few-shot-классификаторов, чтобы предотвратить использование уязвимостей в будущем. Сейчас это делается вручную, но процесс можно автоматизировать.

Безопасные и увлекательные системы генеративного ИИ для будущего

Кем бы вы ни были — игровой компанией, банком или государственным ведомством, — при масштабном внедрении чат-бота для обслуживания клиентов необходимо уделять равное внимание и пользовательскому опыту, и надёжности.

Мы создаём решения для взаимодействия с клиентами организаций и брендов, которым важно следующее:

  1. Безопасность превыше всего — чат-боты должны приносить пользу и при этом надёжно ограждать пользователей от вредоносного контента

  2. Репутация защищена — мы проектируем несколько уровней защиты, которые сохраняют репутацию бренда, даже если пользователи пытаются вывести систему за установленные пределы

  3. Регулирование ограничивает выбор — мы следим за новейшими требованиями, чтобы вы могли масштабировать решения, не опасаясь джейлбрейка приложения

Автор

Andrew Liubinas