Navegação principal

Como criar agentes de chat seguros para empresas de alto risco

Ao criar um chatbot para representar sua marca, não basta garantir que ele seja seguro — ele precisa ter a autenticidade da sua marca.

Resumo executivo

  • Aplicações públicas de LLM podem expor marcas a riscos financeiros e de reputação.

  • Usamos filtros de classificação em camadas para reduzir os danos causados por jailbreaks de LLM e outros comportamentos inesperados de LLMs.

  • Aplicamos essa abordagem em uma aplicação de produção de alto volume, que processa 40 mil mensagens por dia — e esse número continua crescendo.

Introdução

No último ano, trabalhamos com uma importante desenvolvedora de jogos para implementar um chatbot de IA generativa que recebe cerca de 40 mil mensagens por dia de uma base de jogadores que inclui crianças. Equilibrar velocidade, precisão, segurança e diversão é essencial:

Ao criar um chatbot para representar sua marca, não basta garantir que ele seja seguro — ele precisa ter a autenticidade da sua marca.

No caso de uma empresa de jogos, isso significa combinar segurança, diversão e entusiasmo dos usuários — especialmente entre o público mais jovem.

Os LLMs que sustentam as aplicações modernas de IA generativa são muito flexíveis — por isso se adaptam tão bem a diversos problemas —, mas também têm poucas restrições. Isso significa que muitas vezes eles podem "sair dos trilhos" e retornar uma grande variedade de textos, alguns dos quais podem ser inadequados.

Disponibilizar um LLM diretamente ao público certamente resultará em comportamentos inesperados e, sem as medidas adequadas, pode gerar o risco de:

Um vislumbre dos riscos no mundo real...

Manchetes sobre usos imprevistos de LLMs:

Esses incidentes demonstram por que desenvolver e manter a segurança em sistemas de IA generativa não é opcional. Isso é especialmente importante quando há crianças pequenas envolvidas: não basta recorrer a avisos — barreiras de proteção robustas são essenciais para manter o conteúdo adequado.

Nossa abordagem: classificação em camadas e cache de prompts

Assim como nos sistemas de RAG (geração aumentada por recuperação) que desenvolvemos para clientes, usamos vários componentes de IA para reduzir os riscos de jailbreak e manter o alto desempenho.

Diagrama da nossa abordagem: classificação em camadas e cache de prompts.

Diagrama simplificado da arquitetura do nosso sistema

Para garantir a segurança do sistema, usamos classificadores baseados em LLM tanto nas entradas quanto nas saídas:

  1. Classificação de entradas (executada em paralelo)

  • Usamos esquemas Pydantic com saídas estruturadas de LLMs para rotular as consultas dos usuários (por exemplo, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT etc.). Isso também incluiu sinalizadores para identificar tentativas de jailbreak ou comportamentos proibidos.

  • O uso de vários classificadores para tópicos específicos apresentou desempenho significativamente melhor do que um único megaclassificador "faz-tudo".

  • Uma ampla seleção de exemplos few-shot foi essencial para garantir que os classificadores distinguissem entre "I keep being killed by this character" (referente ao jogo) e "I am being hurt by my parent" (um indício de violência contra crianças).

  • A estreita colaboração com o cliente e suas equipes especializadas em confiança e segurança garantiu que nossos classificadores refletissem como eles avaliariam mensagens de alto risco em situações reais.

Diagrama da nossa abordagem: classificação em camadas e cache de prompts.

  1. Geração de respostas

  • O LLM principal gera uma resposta quando a entrada é considerada segura.

  • Caso contrário, a mensagem pode ser ignorada, em tentativas de jailbreak, ou encaminhada a uma pessoa, se a consulta indicar um problema de segurança.

  1. Classificação de saídas

  • Antes de a resposta sair da nossa aplicação, classificamos o conteúdo gerado pelo modelo para então entregá-lo ao usuário.

  • Como algumas respostas podem usar técnicas de RAG com dados extraídos da internet, essa etapa nos protege contra envenenamento de dados.

  • Se a resposta contiver conteúdo proibido, o sistema intervém e a substitui por uma mensagem genérica. Na prática, isso raramente ocorreu, mas funciona como uma camada adicional de cautela para garantir que o comportamento do agente permaneça adequado.

Para manter a velocidade e o custo acessível:

  • Armazenamos prompts usados com frequência e diálogos parciais, além de um conjunto selecionado de exemplos few-shot.

  • Esse cache permite aplicar os classificadores baseados em LLM de forma rápida e econômica, sem precisar reconstruir o contexto a cada vez.

Diagrama da nossa abordagem: classificação em camadas e cache de prompts.

Olhando para o futuro: classificadores constitucionais

Um estudo recente da Anthropic descreveu os Classificadores Constitucionais — um sistema que usa classificadores adicionais, treinados com regras "constitucionais", para detectar solicitações mal-intencionadas ou inseguras. O estudo relatou:

  • Alta robustez diante de milhares de horas de red teaming conduzido por pessoas.

  • Taxas mínimas de recusas excessivas e sobrecarga computacional moderada.

Vislumbramos um futuro em que essas abordagens constitucionais possam complementar ou até substituir as camadas tradicionais de classificação, oferecendo uma defesa mais abrangente contra táticas de jailbreak em constante evolução.

Resumo: o que aprendemos

  1. Filtros leves e paralelos

As camadas de classificação impedem que consultas mal-intencionadas cheguem ao núcleo generativo e garantem que respostas inadequadas nunca sejam entregues.

  1. A experiência do usuário importa

Ao priorizar a diversão, com avisos inspirados no universo do jogo e recusas bem-humoradas, aumentamos a probabilidade de os usuários aceitarem as restrições do sistema.

  1. Não economize em testes e monitoramento

Sessões regulares de red teaming e o monitoramento frequente do comportamento dos jogadores ajudam a identificar vulnerabilidades antes que elas sejam descobertas pela comunidade em geral. Essas vulnerabilidades podem então ser incorporadas aos prompts few-shot dos classificadores para evitar que sejam exploradas no futuro. Atualmente, esse processo é manual, mas pode ser automatizado.

Desenvolvendo sistemas de IA generativa seguros e envolventes para o futuro

Seja você uma empresa de jogos, um banco ou até um órgão público, ao implementar um chatbot de atendimento ao cliente em grande escala, é preciso priorizar tanto a experiência do usuário quanto a confiabilidade.

Desenvolvemos soluções voltadas ao público para organizações e marcas em que:

  1. A segurança é fundamental — chatbots que oferecem valor aos usuários e, ao mesmo tempo, os protegem rigorosamente de conteúdo nocivo

  2. A reputação precisa ser protegida — projetamos várias camadas de proteção que preservam a reputação da marca, mesmo quando os usuários tentam levar o sistema além dos limites

  3. A regulamentação limita suas opções — acompanhamos as diretrizes de conformidade mais recentes para que você possa ampliar suas soluções sem se preocupar com jailbreaks na aplicação

Autor

Andrew Liubinas