Las aplicaciones públicas de modelos de lenguaje de gran tamaño (LLM) pueden exponer a las marcas a riesgos financieros y reputacionales.
Usamos filtros de clasificación por capas para reducir el daño causado por jailbreaks de LLM y otros comportamientos imprevistos de los LLM.
Aplicamos este enfoque en una aplicación de producción de gran volumen que procesa 40 000 mensajes diarios, una cifra que sigue aumentando.
Durante el último año, colaboramos con un importante desarrollador de videojuegos para implementar un chatbot de IA generativa que atiende aproximadamente 40 000 mensajes diarios de una comunidad de jugadores que incluye niños. Es esencial equilibrar la velocidad, la precisión, la seguridad y la diversión:
Al crear un chatbot que represente a tu marca, no basta con que sea seguro: también debe sonar auténticamente como tú.
Para una empresa de videojuegos, esto significa combinar la seguridad con la diversión y el entusiasmo de los usuarios, especialmente entre el público más joven.
Los LLM que sustentan las aplicaciones modernas de IA generativa son muy flexibles —por eso se adaptan tan bien a tantos problemas—, pero también tienen pocas restricciones. Esto significa que a menudo pueden “salirse del camino” y generar una amplia variedad de textos, algunos de los cuales podrían ser inapropiados.
Exponer un LLM directamente al público sin duda producirá comportamientos inesperados y, sin las medidas de mitigación adecuadas, puede generar el riesgo de:
“Jailbreaks” mediante los cuales los usuarios manipulan intencionalmente el chatbot para que produzca contenido dañino o no permitido (dato curioso: cualquiera puede visitar este sitio web para explorar los jailbreaks de LLM con un juego divertido…); o
Proporcionar involuntariamente contenido desagradable, ofensivo o peligroso. En muchos casos, esto puede poner en riesgo el bienestar de los usuarios o causar daños financieros o reputacionales al proveedor de la aplicación.
Titulares sobre usos imprevistos de los LLM:
Estos incidentes demuestran por qué desarrollar y mantener la seguridad en los sistemas de IA generativa no es opcional. Esto es especialmente cierto cuando hay niños pequeños involucrados: no basta con usar avisos legales; se necesitan medidas de protección sólidas para mantener el contenido apropiado.
Al igual que en los sistemas RAG (generación aumentada por recuperación) que desarrollamos para nuestros clientes, aprovechamos varios componentes de IA para reducir los riesgos de jailbreak y mantener un alto rendimiento.


Diagrama simplificado de la arquitectura de nuestro sistema
Para garantizar la seguridad del sistema, usamos clasificadores basados en LLM tanto en las entradas como en las salidas:
Clasificación de entradas (ejecutada en paralelo)
Usamos esquemas de Pydantic junto con resultados estructurados de LLM para etiquetar las consultas de los usuarios (p. ej., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, etc.). También incluimos indicadores para identificar jailbreaks o comportamientos no permitidos.
Usar varios clasificadores para temas individuales produjo un rendimiento mucho mejor que un único megaclasificador “para todo”.
Una amplia variedad de ejemplos con pocos ejemplos fue esencial para que los clasificadores distinguieran entre “este personaje no deja de matarme” —en referencia al juego— y “uno de mis padres me está lastimando” —un indicio de daño infantil—.
La estrecha colaboración con el cliente y sus equipos especializados de confianza y seguridad garantizó que nuestros clasificadores reflejaran cómo evaluarían en la práctica los mensajes de alto riesgo.


Generación de respuestas
El LLM principal genera una respuesta si la entrada se considera segura.
De lo contrario, el mensaje puede ignorarse —si es un jailbreak— o remitirse a una persona —si la consulta activa una alerta de seguridad—.
Clasificación de salidas
Antes de que salga de nuestra aplicación, clasificamos la respuesta del modelo antes de entregarla al usuario.
Como algunas respuestas pueden usar técnicas RAG con datos extraídos de internet, este paso nos protege contra el envenenamiento de datos.
Si la respuesta contiene contenido no permitido, el sistema interviene y la sustituye por un mensaje general. En la práctica, esto ha ocurrido muy pocas veces, pero sirve como una capa de protección conservadora para garantizar que el comportamiento del agente siga siendo apropiado.
Para mantener la velocidad y la asequibilidad:
Almacenamos prompts de uso frecuente y diálogos parciales, junto con un conjunto seleccionado de ejemplos con pocos ejemplos.
Este almacenamiento en caché nos permite aplicar los clasificadores basados en LLM de forma rápida y económica, sin tener que reconstruir el contexto cada vez.


Un estudio reciente de Anthropic describió los clasificadores constitucionales: un sistema que emplea clasificadores adicionales, entrenados mediante reglas “constitucionales”, para detectar solicitudes maliciosas o inseguras. El estudio informó lo siguiente:
Alta resistencia a miles de horas de red teaming humano.
Tasas mínimas de rechazo excesivo y una sobrecarga informática moderada.
Prevemos un futuro en el que estos enfoques constitucionales complementen o incluso sustituyan las capas de clasificación tradicionales y ofrezcan una defensa más integral frente a la evolución de las tácticas de jailbreak.
Filtros ligeros y paralelos
Las capas de clasificación impiden que las consultas maliciosas lleguen al núcleo generativo y garantizan que nunca se entreguen resultados deficientes.
La experiencia del usuario importa
Al centrarnos en advertencias divertidas basadas en la historia del juego y en rechazos ingeniosos, logramos que los usuarios estén más dispuestos a aceptar las restricciones del sistema.
No escatimes en pruebas y monitoreo
El red teaming periódico y el monitoreo frecuente del comportamiento de los jugadores ayudan a detectar vulnerabilidades antes de que las conozca el resto de la comunidad. Luego, pueden incorporarse a los prompts con pocos ejemplos de los clasificadores para impedir que se aprovechen en el futuro. Actualmente, este proceso es manual, pero podría automatizarse.
Ya seas una empresa de videojuegos, un banco o incluso una entidad gubernamental, si vas a implementar un chatbot de atención al cliente a gran escala, debes priorizar TANTO el diseño centrado en el usuario como la confiabilidad.
Creamos soluciones dirigidas al público para organizaciones y marcas en las que:
La seguridad es primordial: chatbots que ofrecen valor a los usuarios y, a la vez, los protegen rigurosamente del contenido dañino
La reputación está protegida: diseñamos varias capas de protección que preservan la reputación de la marca, incluso si los usuarios intentan llevar el sistema más allá de sus límites
La normativa limita tus opciones: nos mantenemos al día con las últimas directrices de cumplimiento para que puedas ampliar tus soluciones sin preocuparte por que tu aplicación sufra un jailbreak