Загальнодоступні застосунки на основі великих мовних моделей (LLM) можуть створювати репутаційні та фінансові ризики для брендів.
Ми використовуємо багаторівневі фільтри класифікації, щоб зменшити шкоду від джейлбрейків та іншої небажаної поведінки LLM.
Ми застосували цей підхід у високонавантаженому робочому застосунку, який щодня обробляє 40 000 повідомлень, і ця кількість зростає.
Протягом останнього року ми співпрацювали з провідним розробником ігор над запуском чатбота на основі генеративного ШІ, який отримує приблизно 40 000 повідомлень на день від гравців, серед яких є діти. Вкрай важливо забезпечити баланс між швидкістю, точністю, безпекою та розвагами:
Створюючи чатбота, який представлятиме ваш бренд, недостатньо подбати лише про його безпеку — він має автентично передавати голос вашого бренду.
Для ігрової компанії це означає поєднати безпеку з розвагами та захопливим досвідом — особливо для молодшої аудиторії.
Моделі LLM, що лежать в основі сучасних застосунків генеративного ШІ, дуже гнучкі — саме тому вони добре узагальнюють підходи для розв’язання багатьох задач, — але водночас недостатньо обмежені. Тому вони нерідко відхиляються від заданого курсу й генерують найрізноманітніші тексти, деякі з яких можуть бути неприйнятними.
Якщо надати широкому загалу прямий доступ до LLM, це неодмінно призведе до неочікуваної поведінки, а без належних заходів захисту виникає ризик:
«Джейлбрейків», коли користувачі навмисно маніпулюють чатботом, щоб змусити його створити шкідливий або заборонений контент (цікавий факт: на цьому сайті кожен може дослідити джейлбрейки LLM у формі веселої гри…); або
Ненавмисного надання неприйнятного, образливого чи небезпечного контенту. У багатьох випадках це може загрожувати добробуту користувачів або призвести до фінансових і репутаційних збитків для постачальника застосунку.
Заголовки новин про небажані наслідки використання LLM:
Ці випадки показують, чому створення й підтримання безпеки систем генеративного ШІ — не забаганка, а необхідність. Це особливо важливо, коли йдеться про маленьких дітей: самих застережень недостатньо — для належного контенту необхідні надійні механізми захисту.
Як і в системах RAG (генерації з доповненим пошуком), які ми створювали для клієнтів, ми використовуємо кілька компонентів ШІ, щоб знизити ризик джейлбрейків і водночас зберегти високу продуктивність.


Спрощена схема архітектури нашої системи
Щоб гарантувати безпеку системи, ми застосовуємо класифікатори на основі LLM як до вхідних, так і до вихідних даних:
Класифікація вхідних даних (виконується паралельно)
Ми використовували схеми Pydantic разом зі структурованими результатами LLM, щоб позначати запити користувачів (наприклад, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT тощо). Також застосовувалися позначки для виявлення джейлбрейків або забороненої поведінки.
Кілька класифікаторів для окремих тем показали значно кращі результати, ніж один універсальний класифікатор «на всі випадки».
Численні приклади для навчання з кількома прикладами були критично важливими, щоб класифікатори розрізняли «I keep being killed by this character» (про події у грі) та «I am being hurt by my parent» (ознака заподіяння шкоди дитині).
Тісна співпраця з клієнтом і його профільними командами з довіри та безпеки допомогла узгодити роботу наших класифікаторів із тим, як ці команди оцінювали б повідомлення високого ризику в реальних умовах.


Генерування відповіді
Основна LLM генерує відповідь, якщо вхідні дані визнано безпечними.
В іншому разі повідомлення можна проігнорувати (у разі джейлбрейку) або передати людині (якщо запит указує на проблему з безпекою).
Класифікація вихідних даних
Перш ніж надіслати остаточну відповідь із нашого застосунку, ми класифікуємо відповідь моделі.
Оскільки деякі відповіді можуть формуватися за допомогою методів RAG на основі даних, зібраних в інтернеті, цей етап захищає нас від отруєння даних.
Якщо відповідь містить заборонений контент, система втручається й замінює її загальним повідомленням. На практиці таке траплялося рідко, але це додатковий запобіжний рівень, який гарантує, що поведінка агента залишатиметься належною.
Щоб забезпечити швидкість і доступну вартість:
Ми зберігаємо часто використовувані запити й фрагменти діалогів, а також ретельно дібраний набір прикладів для навчання з кількома прикладами.
Завдяки кешуванню ми можемо швидко й недорого застосовувати класифікатори LLM, не відтворюючи контекст щоразу заново.


У нещодавньому дослідженні Anthropic описано конституційні класифікатори — систему, що використовує додаткові класифікатори, навчені за «конституційними» правилами, для виявлення зловмисних або небезпечних запитів. Дослідники повідомили про:
Високу стійкість до тисяч годин перевірки людьми на вразливості та ризики.
Мінімальну частоту необґрунтованих відмов і помірні додаткові обчислювальні витрати.
Ми бачимо майбутнє, у якому такі конституційні підходи зможуть доповнити або навіть замінити традиційні рівні класифікації, забезпечуючи комплексніший захист від нових тактик джейлбрейку.
Паралельні легкі фільтри
Рівні класифікації не дають зловмисним запитам дістатися генеративного ядра й гарантують, що неякісні результати не буде надіслано користувачам.
Взаємодія з користувачем має значення
Якщо попередження та грайливі відмови цікаві й органічно вписані у світ гри, користувачі охочіше приймають обмеження системи.
Не заощаджуйте на тестуванні й моніторингу
Регулярна перевірка на вразливості та ризики й частий моніторинг поведінки гравців допомагають виявляти вразливості до того, як про них дізнається широка спільнота гравців. Потім ці дані можна додавати до запитів класифікатора з кількома прикладами, щоб запобігти використанню таких вразливостей у майбутньому (зараз це робиться вручну, але процес можна автоматизувати).
Незалежно від того, хто ви — ігрова компанія, банк чи навіть державна установа, — упроваджуючи масштабний чатбот для обслуговування клієнтів, потрібно подбати І про зручність для користувачів, І про надійність.
Ми створюємо клієнтські рішення для організацій і брендів, для яких:
Безпека понад усе — чатботи приносять користувачам користь і водночас надійно захищають їх від шкідливого контенту
Репутація захищена — ми проєктуємо кілька рівнів захисту, які зберігають репутацію бренду, навіть якщо користувачі намагаються вивести систему за межі її можливостей
Регулювання обмежує ваші можливості — ми стежимо за найновішими вимогами, щоб ви могли масштабувати рішення, не турбуючись про джейлбрейк застосунку