Navegación principal

Crear agentes de chat seguros para empresas de alto riesgo

Al crear un chatbot que represente a tu marca, no basta con que sea seguro: también debe sonar auténticamente como tú.

Resumen ejecutivo

  • Las aplicaciones de LLM de acceso público pueden exponer a las marcas a riesgos financieros y para su reputación.

  • Utilizamos filtros de clasificación por capas para reducir los daños derivados de los jailbreaks y otros comportamientos imprevistos de los LLM.

  • Hemos aplicado este enfoque en una aplicación en producción de gran volumen que recibe 40 000 mensajes diarios, y la cifra sigue aumentando.

Introducción

Durante el último año, hemos colaborado con un destacado desarrollador de videojuegos para implementar un chatbot de IA generativa que atiende unos 40 000 mensajes diarios de una base de jugadores que incluye a menores. Es esencial lograr un equilibrio entre velocidad, precisión, seguridad y diversión:

Al crear un chatbot que represente a tu marca, no basta con que sea seguro: también debe sonar auténticamente como tú.

En el caso de una empresa de videojuegos, eso supone combinar la seguridad con la diversión y el entusiasmo de los usuarios, especialmente entre el público más joven.

Los LLM en los que se sustentan las aplicaciones modernas de IA generativa son muy flexibles —de ahí que se adapten tan bien a tantos problemas—, pero también están poco restringidos. Esto significa que a menudo pueden «salirse del guion» y generar textos muy diversos, algunos de los cuales podrían ser inapropiados.

Exponer un LLM directamente al público provocará sin duda comportamientos inesperados y, sin las medidas adecuadas, puede entrañar el riesgo de:

Un vistazo a los riesgos reales…

Titulares sobre usos imprevistos de los LLM:

Estos incidentes demuestran por qué crear y mantener la seguridad en los sistemas de IA generativa no es opcional. Esto cobra especial importancia cuando hay niños pequeños implicados: no basta con recurrir a avisos legales; se necesitan medidas de protección sólidas para garantizar que el contenido sea apropiado.

Nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts

Al igual que en los sistemas RAG (generación aumentada por recuperación) que hemos creado para clientes, utilizamos varios componentes de IA para reducir los riesgos de jailbreak sin sacrificar el rendimiento.

Diagrama de nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts.

Diagrama simplificado de la arquitectura de nuestro sistema

Para garantizar la seguridad del sistema, utilizamos clasificadores basados en LLM tanto en las entradas como en las salidas:

  1. Clasificación de entradas (ejecutada en paralelo)

  • Utilizamos esquemas de Pydantic junto con resultados estructurados de LLM para etiquetar las consultas de los usuarios (p. ej., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, etc.). También incluimos indicadores para detectar intentos de jailbreak o comportamientos no permitidos.

  • Usar varios clasificadores para temas concretos ofreció un rendimiento muy superior al de un único megaclasificador «universal».

  • Incluir numerosos ejemplos con pocos ejemplos fue esencial para que los clasificadores distinguieran entre «este personaje no para de matarme» —en referencia al juego— y «mi padre o mi madre me hace daño» —un indicio de maltrato infantil—.

  • La estrecha colaboración con el cliente y sus equipos especializados en confianza y seguridad garantizó que nuestros clasificadores reflejaran cómo evaluarían en la práctica los mensajes de alto riesgo.

Diagrama de nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts.

  1. Generación de respuestas

  • El LLM principal genera una respuesta si la entrada se considera segura.

  • De lo contrario, el mensaje puede ignorarse —si se trata de un jailbreak— o remitirse a una persona —si la consulta activa una alerta de seguridad—.

  1. Clasificación de salidas

  • Antes de que salga de nuestra aplicación, clasificamos la respuesta del modelo antes de entregarla al usuario.

  • Como algunas respuestas pueden emplear técnicas RAG con datos extraídos de internet, este paso nos protege frente al envenenamiento de datos.

  • Si contiene contenido no permitido, el sistema interviene y lo sustituye por un mensaje genérico. En la práctica, rara vez nos ha ocurrido, pero esta capa adicional de precaución garantiza que el comportamiento del agente siga siendo apropiado.

Para mantener la velocidad y un coste asequible:

  • Almacenamos prompts de uso habitual y diálogos parciales, junto con una selección cuidada de ejemplos con pocos ejemplos.

  • Este almacenamiento en caché nos permite aplicar los clasificadores basados en LLM de forma rápida y económica, sin tener que reconstruir el contexto cada vez.

Diagrama de nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts.

Mirar al futuro: clasificadores constitucionales

Un estudio reciente de Anthropic describió los clasificadores constitucionales: un sistema basado en clasificadores adicionales, entrenados mediante reglas «constitucionales», para detectar solicitudes maliciosas o inseguras. Según sus resultados:

  • Gran solidez ante miles de horas de red teaming realizado por personas.

  • Tasas mínimas de rechazos excesivos y una sobrecarga computacional moderada.

Prevemos un futuro en el que estos enfoques constitucionales puedan complementar o incluso sustituir a las capas de clasificación tradicionales, ofreciendo una defensa más completa frente a la evolución de las tácticas de jailbreak.

Resumen: lecciones aprendidas

  1. Filtros ligeros en paralelo

Las capas de clasificación impiden que las consultas maliciosas lleguen al núcleo generativo y garantizan que nunca se entreguen resultados deficientes.

  1. La experiencia de usuario importa

Al recurrir a advertencias divertidas y basadas en la historia del juego, así como a rechazos desenfadados, los usuarios aceptan mejor las restricciones del sistema.

  1. No escatimes en pruebas ni supervisión

El red teaming periódico y la supervisión frecuente del comportamiento de los jugadores ayudan a detectar vulnerabilidades antes de que las conozca el conjunto de la comunidad. Estas vulnerabilidades pueden incorporarse después a los prompts del clasificador con pocos ejemplos para impedir que se aprovechen en el futuro. Actualmente es un proceso manual, aunque podría automatizarse.

Crear sistemas de IA generativa seguros y atractivos para el futuro

Ya seas una empresa de videojuegos, un banco o incluso un organismo público, si vas a implantar a gran escala un chatbot de atención al cliente, debes priorizar TANTO el diseño de la experiencia de usuario COMO la fiabilidad.

Creamos soluciones orientadas al cliente para organizaciones y marcas en las que:

  1. La seguridad es primordial: chatbots que aportan valor a los usuarios y, al mismo tiempo, los protegen estrictamente de contenidos dañinos

  2. La reputación está protegida: diseñamos varias capas de protección que mantienen intacta la reputación de la marca, aunque los usuarios intenten llevar el sistema más allá de sus límites

  3. La normativa limita tus opciones: nos mantenemos al día de las últimas directrices de cumplimiento para que puedas ampliar tus soluciones sin preocuparte por posibles jailbreaks en tu aplicación

Autor

Andrew Liubinas