Головна навігація

Створення безпечних чат-агентів для компаній із високими ризиками

Створюючи чатбота, який представлятиме ваш бренд, недостатньо подбати лише про його безпеку — він має автентично передавати голос вашого бренду.

Короткий огляд

  • Загальнодоступні застосунки на основі великих мовних моделей (LLM) можуть створювати репутаційні та фінансові ризики для брендів.

  • Ми використовуємо багаторівневі фільтри класифікації, щоб зменшити шкоду від джейлбрейків та іншої небажаної поведінки LLM.

  • Ми застосували цей підхід у високонавантаженому робочому застосунку, який щодня обробляє 40 000 повідомлень, і ця кількість зростає.

Вступ

Протягом останнього року ми співпрацювали з провідним розробником ігор над запуском чатбота на основі генеративного ШІ, який отримує приблизно 40 000 повідомлень на день від гравців, серед яких є діти. Вкрай важливо забезпечити баланс між швидкістю, точністю, безпекою та розвагами:

Створюючи чатбота, який представлятиме ваш бренд, недостатньо подбати лише про його безпеку — він має автентично передавати голос вашого бренду.

Для ігрової компанії це означає поєднати безпеку з розвагами та захопливим досвідом — особливо для молодшої аудиторії.

Моделі LLM, що лежать в основі сучасних застосунків генеративного ШІ, дуже гнучкі — саме тому вони добре узагальнюють підходи для розв’язання багатьох задач, — але водночас недостатньо обмежені. Тому вони нерідко відхиляються від заданого курсу й генерують найрізноманітніші тексти, деякі з яких можуть бути неприйнятними.

Якщо надати широкому загалу прямий доступ до LLM, це неодмінно призведе до неочікуваної поведінки, а без належних заходів захисту виникає ризик:

  • «Джейлбрейків», коли користувачі навмисно маніпулюють чатботом, щоб змусити його створити шкідливий або заборонений контент (цікавий факт: на цьому сайті кожен може дослідити джейлбрейки LLM у формі веселої гри…); або

  • Ненавмисного надання неприйнятного, образливого чи небезпечного контенту. У багатьох випадках це може загрожувати добробуту користувачів або призвести до фінансових і репутаційних збитків для постачальника застосунку.

Погляд на реальні ризики…

Заголовки новин про небажані наслідки використання LLM:

Ці випадки показують, чому створення й підтримання безпеки систем генеративного ШІ — не забаганка, а необхідність. Це особливо важливо, коли йдеться про маленьких дітей: самих застережень недостатньо — для належного контенту необхідні надійні механізми захисту.

Наш підхід: багаторівнева класифікація та кешування запитів

Як і в системах RAG (генерації з доповненим пошуком), які ми створювали для клієнтів, ми використовуємо кілька компонентів ШІ, щоб знизити ризик джейлбрейків і водночас зберегти високу продуктивність.

Схема нашого підходу: багаторівнева класифікація та кешування запитів.

Спрощена схема архітектури нашої системи

Щоб гарантувати безпеку системи, ми застосовуємо класифікатори на основі LLM як до вхідних, так і до вихідних даних:

  1. Класифікація вхідних даних (виконується паралельно)

  • Ми використовували схеми Pydantic разом зі структурованими результатами LLM, щоб позначати запити користувачів (наприклад, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT тощо). Також застосовувалися позначки для виявлення джейлбрейків або забороненої поведінки.

  • Кілька класифікаторів для окремих тем показали значно кращі результати, ніж один універсальний класифікатор «на всі випадки».

  • Численні приклади для навчання з кількома прикладами були критично важливими, щоб класифікатори розрізняли «I keep being killed by this character» (про події у грі) та «I am being hurt by my parent» (ознака заподіяння шкоди дитині).

  • Тісна співпраця з клієнтом і його профільними командами з довіри та безпеки допомогла узгодити роботу наших класифікаторів із тим, як ці команди оцінювали б повідомлення високого ризику в реальних умовах.

Схема нашого підходу: багаторівнева класифікація та кешування запитів.

  1. Генерування відповіді

  • Основна LLM генерує відповідь, якщо вхідні дані визнано безпечними.

  • В іншому разі повідомлення можна проігнорувати (у разі джейлбрейку) або передати людині (якщо запит указує на проблему з безпекою).

  1. Класифікація вихідних даних

  • Перш ніж надіслати остаточну відповідь із нашого застосунку, ми класифікуємо відповідь моделі.

  • Оскільки деякі відповіді можуть формуватися за допомогою методів RAG на основі даних, зібраних в інтернеті, цей етап захищає нас від отруєння даних.

  • Якщо відповідь містить заборонений контент, система втручається й замінює її загальним повідомленням. На практиці таке траплялося рідко, але це додатковий запобіжний рівень, який гарантує, що поведінка агента залишатиметься належною.

Щоб забезпечити швидкість і доступну вартість:

  • Ми зберігаємо часто використовувані запити й фрагменти діалогів, а також ретельно дібраний набір прикладів для навчання з кількома прикладами.

  • Завдяки кешуванню ми можемо швидко й недорого застосовувати класифікатори LLM, не відтворюючи контекст щоразу заново.

Схема нашого підходу: багаторівнева класифікація та кешування запитів.

Погляд у майбутнє: конституційні класифікатори

У нещодавньому дослідженні Anthropic описано конституційні класифікатори — систему, що використовує додаткові класифікатори, навчені за «конституційними» правилами, для виявлення зловмисних або небезпечних запитів. Дослідники повідомили про:

  • Високу стійкість до тисяч годин перевірки людьми на вразливості та ризики.

  • Мінімальну частоту необґрунтованих відмов і помірні додаткові обчислювальні витрати.

Ми бачимо майбутнє, у якому такі конституційні підходи зможуть доповнити або навіть замінити традиційні рівні класифікації, забезпечуючи комплексніший захист від нових тактик джейлбрейку.

Підсумок: чого ми навчилися

  1. Паралельні легкі фільтри

Рівні класифікації не дають зловмисним запитам дістатися генеративного ядра й гарантують, що неякісні результати не буде надіслано користувачам.

  1. Взаємодія з користувачем має значення

Якщо попередження та грайливі відмови цікаві й органічно вписані у світ гри, користувачі охочіше приймають обмеження системи.

  1. Не заощаджуйте на тестуванні й моніторингу

Регулярна перевірка на вразливості та ризики й частий моніторинг поведінки гравців допомагають виявляти вразливості до того, як про них дізнається широка спільнота гравців. Потім ці дані можна додавати до запитів класифікатора з кількома прикладами, щоб запобігти використанню таких вразливостей у майбутньому (зараз це робиться вручну, але процес можна автоматизувати).

Створення безпечних і захопливих систем генеративного ШІ майбутнього

Незалежно від того, хто ви — ігрова компанія, банк чи навіть державна установа, — упроваджуючи масштабний чатбот для обслуговування клієнтів, потрібно подбати І про зручність для користувачів, І про надійність.

Ми створюємо клієнтські рішення для організацій і брендів, для яких:

  1. Безпека понад усе — чатботи приносять користувачам користь і водночас надійно захищають їх від шкідливого контенту

  2. Репутація захищена — ми проєктуємо кілька рівнів захисту, які зберігають репутацію бренду, навіть якщо користувачі намагаються вивести систему за межі її можливостей

  3. Регулювання обмежує ваші можливості — ми стежимо за найновішими вимогами, щоб ви могли масштабувати рішення, не турбуючись про джейлбрейк застосунку

Автор

Andrew Liubinas