Navegación principal

Crear agentes de chat seguros para empresas de alto riesgo

Al crear un chatbot que represente a tu marca, no basta con que sea seguro: también debe sonar auténticamente como tú.

Resumen ejecutivo

  • Las aplicaciones públicas de modelos de lenguaje de gran tamaño (LLM) pueden exponer a las marcas a riesgos financieros y reputacionales.

  • Usamos filtros de clasificación por capas para reducir el daño causado por jailbreaks de LLM y otros comportamientos imprevistos de los LLM.

  • Aplicamos este enfoque en una aplicación de producción de gran volumen que procesa 40 000 mensajes diarios, una cifra que sigue aumentando.

Introducción

Durante el último año, colaboramos con un importante desarrollador de videojuegos para implementar un chatbot de IA generativa que atiende aproximadamente 40 000 mensajes diarios de una comunidad de jugadores que incluye niños. Es esencial equilibrar la velocidad, la precisión, la seguridad y la diversión:

Al crear un chatbot que represente a tu marca, no basta con que sea seguro: también debe sonar auténticamente como tú.

Para una empresa de videojuegos, esto significa combinar la seguridad con la diversión y el entusiasmo de los usuarios, especialmente entre el público más joven.

Los LLM que sustentan las aplicaciones modernas de IA generativa son muy flexibles —por eso se adaptan tan bien a tantos problemas—, pero también tienen pocas restricciones. Esto significa que a menudo pueden “salirse del camino” y generar una amplia variedad de textos, algunos de los cuales podrían ser inapropiados.

Exponer un LLM directamente al público sin duda producirá comportamientos inesperados y, sin las medidas de mitigación adecuadas, puede generar el riesgo de:

Un vistazo a los riesgos del mundo real…

Titulares sobre usos imprevistos de los LLM:

Estos incidentes demuestran por qué desarrollar y mantener la seguridad en los sistemas de IA generativa no es opcional. Esto es especialmente cierto cuando hay niños pequeños involucrados: no basta con usar avisos legales; se necesitan medidas de protección sólidas para mantener el contenido apropiado.

Nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts

Al igual que en los sistemas RAG (generación aumentada por recuperación) que desarrollamos para nuestros clientes, aprovechamos varios componentes de IA para reducir los riesgos de jailbreak y mantener un alto rendimiento.

Diagrama que ilustra nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts.

Diagrama simplificado de la arquitectura de nuestro sistema

Para garantizar la seguridad del sistema, usamos clasificadores basados en LLM tanto en las entradas como en las salidas:

  1. Clasificación de entradas (ejecutada en paralelo)

  • Usamos esquemas de Pydantic junto con resultados estructurados de LLM para etiquetar las consultas de los usuarios (p. ej., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, etc.). También incluimos indicadores para identificar jailbreaks o comportamientos no permitidos.

  • Usar varios clasificadores para temas individuales produjo un rendimiento mucho mejor que un único megaclasificador “para todo”.

  • Una amplia variedad de ejemplos con pocos ejemplos fue esencial para que los clasificadores distinguieran entre “este personaje no deja de matarme” —en referencia al juego— y “uno de mis padres me está lastimando” —un indicio de daño infantil—.

  • La estrecha colaboración con el cliente y sus equipos especializados de confianza y seguridad garantizó que nuestros clasificadores reflejaran cómo evaluarían en la práctica los mensajes de alto riesgo.

Diagrama que ilustra nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts.

  1. Generación de respuestas

  • El LLM principal genera una respuesta si la entrada se considera segura.

  • De lo contrario, el mensaje puede ignorarse —si es un jailbreak— o remitirse a una persona —si la consulta activa una alerta de seguridad—.

  1. Clasificación de salidas

  • Antes de que salga de nuestra aplicación, clasificamos la respuesta del modelo antes de entregarla al usuario.

  • Como algunas respuestas pueden usar técnicas RAG con datos extraídos de internet, este paso nos protege contra el envenenamiento de datos.

  • Si la respuesta contiene contenido no permitido, el sistema interviene y la sustituye por un mensaje general. En la práctica, esto ha ocurrido muy pocas veces, pero sirve como una capa de protección conservadora para garantizar que el comportamiento del agente siga siendo apropiado.

Para mantener la velocidad y la asequibilidad:

  • Almacenamos prompts de uso frecuente y diálogos parciales, junto con un conjunto seleccionado de ejemplos con pocos ejemplos.

  • Este almacenamiento en caché nos permite aplicar los clasificadores basados en LLM de forma rápida y económica, sin tener que reconstruir el contexto cada vez.

Diagrama que ilustra nuestro enfoque: clasificación por capas y almacenamiento en caché de prompts.

Mirar hacia el futuro: clasificadores constitucionales

Un estudio reciente de Anthropic describió los clasificadores constitucionales: un sistema que emplea clasificadores adicionales, entrenados mediante reglas “constitucionales”, para detectar solicitudes maliciosas o inseguras. El estudio informó lo siguiente:

  • Alta resistencia a miles de horas de red teaming humano.

  • Tasas mínimas de rechazo excesivo y una sobrecarga informática moderada.

Prevemos un futuro en el que estos enfoques constitucionales complementen o incluso sustituyan las capas de clasificación tradicionales y ofrezcan una defensa más integral frente a la evolución de las tácticas de jailbreak.

Resumen: lo que aprendimos

  1. Filtros ligeros y paralelos

Las capas de clasificación impiden que las consultas maliciosas lleguen al núcleo generativo y garantizan que nunca se entreguen resultados deficientes.

  1. La experiencia del usuario importa

Al centrarnos en advertencias divertidas basadas en la historia del juego y en rechazos ingeniosos, logramos que los usuarios estén más dispuestos a aceptar las restricciones del sistema.

  1. No escatimes en pruebas y monitoreo

El red teaming periódico y el monitoreo frecuente del comportamiento de los jugadores ayudan a detectar vulnerabilidades antes de que las conozca el resto de la comunidad. Luego, pueden incorporarse a los prompts con pocos ejemplos de los clasificadores para impedir que se aprovechen en el futuro. Actualmente, este proceso es manual, pero podría automatizarse.

Crear sistemas de IA generativa seguros y atractivos para el futuro

Ya seas una empresa de videojuegos, un banco o incluso una entidad gubernamental, si vas a implementar un chatbot de atención al cliente a gran escala, debes priorizar TANTO el diseño centrado en el usuario como la confiabilidad.

Creamos soluciones dirigidas al público para organizaciones y marcas en las que:

  1. La seguridad es primordial: chatbots que ofrecen valor a los usuarios y, a la vez, los protegen rigurosamente del contenido dañino

  2. La reputación está protegida: diseñamos varias capas de protección que preservan la reputación de la marca, incluso si los usuarios intentan llevar el sistema más allá de sus límites

  3. La normativa limita tus opciones: nos mantenemos al día con las últimas directrices de cumplimiento para que puedas ampliar tus soluciones sin preocuparte por que tu aplicación sufra un jailbreak

Autor

Andrew Liubinas