Navegação principal

Criar agentes de chat seguros para empresas de alto risco

Ao criar um chatbot para representar a sua marca, não basta garantir que é seguro — também tem de transmitir a verdadeira identidade da marca.

Resumo executivo

  • As aplicações públicas baseadas em modelos de linguagem de grande dimensão (LLM) podem expor as marcas a riscos reputacionais e financeiros.

  • Utilizamos filtros de classificação em várias camadas para reduzir os danos causados por ataques de jailbreak e outros comportamentos imprevistos dos LLM.

  • Aplicámos esta abordagem numa aplicação em produção de grande volume, que recebe 40 000 mensagens por dia — e esse número continua a aumentar.

Introdução

Ao longo do último ano, colaborámos com um importante estúdio de videojogos para implementar um chatbot de IA generativa que recebe cerca de 40 000 mensagens por dia de uma comunidade de jogadores que inclui crianças. É essencial equilibrar rapidez, precisão, segurança e diversão:

Ao criar um chatbot para representar a sua marca, não basta garantir que é seguro — também tem de transmitir a verdadeira identidade da marca.

No caso de uma empresa de videojogos, isto significa aliar a segurança à diversão e ao entusiasmo dos utilizadores — sobretudo quando o público é mais jovem.

Os LLM que sustentam as aplicações modernas de IA generativa são muito flexíveis — razão pela qual se adaptam tão bem a tantos problemas — mas também estão sujeitos a poucas restrições. Por isso, podem frequentemente desviar-se do esperado e devolver uma grande variedade de textos, alguns dos quais poderão ser inadequados.

Disponibilizar um LLM diretamente ao público resultará inevitavelmente em comportamentos inesperados e, sem medidas de mitigação adequadas, poderá implicar o risco de:

Um vislumbre dos riscos no mundo real…

Notícias sobre utilizações imprevistas de LLM:

Estes incidentes demonstram por que motivo criar e manter a segurança nos sistemas de IA generativa não é opcional. Isto é especialmente importante quando estão envolvidas crianças pequenas: não basta recorrer a avisos legais — são essenciais mecanismos de proteção robustos para manter os conteúdos adequados.

A nossa abordagem: classificação em várias camadas e armazenamento de prompts em cache

À semelhança dos sistemas RAG (geração aumentada por recuperação) que criámos para clientes, recorremos a vários componentes de IA para reduzir os riscos de ataques de jailbreak sem comprometer o desempenho.

Diagrama que ilustra a nossa abordagem: classificação em várias camadas e armazenamento de prompts em cache.

Diagrama simplificado da arquitetura do nosso sistema

Para garantir a segurança do sistema, utilizamos classificadores baseados em LLM tanto nas entradas como nas saídas:

  1. Classificação das entradas (executada em simultâneo)

  • Utilizámos esquemas Pydantic em conjunto com outputs estruturados de LLM para atribuir etiquetas às consultas dos utilizadores (por exemplo, SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT, etc.). Isto também incluía sinalizadores para identificar ataques de jailbreak ou comportamentos não permitidos.

  • A utilização de vários classificadores para temas específicos teve um desempenho significativamente melhor do que um único megaclassificador generalista.

  • Foi essencial incluir muitos exemplos few-shot para garantir que os classificadores distinguiam entre “I keep being killed by this character” (uma referência ao jogo) e “I am being hurt by my parent” (um indício de que uma criança está em risco).

  • A estreita colaboração com o cliente e com as suas equipas especializadas de confiança e segurança garantiu que os nossos classificadores refletiam a forma como estas equipas avaliariam mensagens de alto risco em situações reais.

Diagrama que ilustra a nossa abordagem: classificação em várias camadas e armazenamento de prompts em cache.

  1. Geração da resposta

  • O LLM principal gera uma resposta se a entrada for considerada segura.

  • Caso contrário, a mensagem pode ser ignorada, se for um ataque de jailbreak, ou encaminhada para uma pessoa, se a consulta sinalizar um problema de segurança.

  1. Classificação das saídas

  • Antes de a resposta sair da nossa aplicação e ser finalmente entregue, classificamos a resposta do modelo.

  • Como algumas respostas podem recorrer a técnicas de RAG baseadas em dados extraídos da Internet, este passo protege-nos contra o envenenamento de dados.

  • Se a resposta contiver conteúdos não permitidos, o sistema intervém e substitui-a por uma mensagem genérica. Na prática, raramente nos deparámos com esta situação, mas trata-se de uma camada adicional de precaução para garantir que o comportamento do agente permanece adequado.

Para manter a rapidez e os custos reduzidos:

  • Armazenamos em cache prompts utilizados com frequência e diálogos parciais, juntamente com um conjunto selecionado de exemplos few-shot.

  • Este armazenamento em cache permite-nos aplicar os classificadores baseados em LLM de forma rápida e económica, sem termos de reconstruir o contexto de cada vez.

Diagrama que ilustra a nossa abordagem: classificação em várias camadas e armazenamento de prompts em cache.

Perspetivas para o futuro: classificadores constitucionais

Um estudo recente da Anthropic descreveu os Classificadores Constitucionais: um sistema que utiliza classificadores adicionais, treinados através de regras «constitucionais», para detetar pedidos maliciosos ou inseguros. Os autores relataram:

  • Elevada robustez perante milhares de horas de red teaming realizado por pessoas.

  • Taxas mínimas de recusas excessivas e um custo computacional adicional moderado.

Antecipamos um futuro em que estas abordagens constitucionais possam complementar ou até substituir as camadas de classificação tradicionais, oferecendo uma defesa mais abrangente contra táticas de jailbreak em constante evolução.

Resumo: o que aprendemos

  1. Filtros leves e paralelos

As camadas de classificação impedem que consultas maliciosas cheguem ao núcleo generativo e garantem que respostas inadequadas nunca sejam entregues.

  1. A experiência do utilizador é importante

Ao privilegiar a diversão, os avisos inspirados no universo do jogo e as recusas bem-humoradas, é mais provável que os utilizadores aceitem as limitações do sistema.

  1. Não poupe nos testes nem na monitorização

A realização regular de red teaming, em conjunto com a monitorização frequente do comportamento dos jogadores, ajudará a detetar vulnerabilidades antes de serem conhecidas pela comunidade de jogadores em geral. Estas vulnerabilidades podem depois ser incorporadas nos prompts few-shot dos classificadores, para impedir que sejam exploradas no futuro. Atualmente, este processo é manual, mas poderá ser automatizado.

Criar hoje sistemas de IA generativa seguros e apelativos para o futuro

Quer se trate de uma empresa de videojogos, um banco ou até um organismo público, implementar um chatbot de apoio ao cliente em grande escala exige dar igual prioridade à experiência do utilizador e à fiabilidade.

Criamos soluções destinadas aos clientes de organizações e marcas para as quais:

  1. A segurança é primordial — chatbots que proporcionam valor aos utilizadores, protegendo-os rigorosamente de conteúdos nocivos

  2. A reputação tem de ser protegida — concebemos várias camadas de proteção que preservam a reputação da marca, mesmo quando os utilizadores tentam levar o sistema além dos seus limites

  3. A regulamentação limita as opções disponíveis — acompanhamos as mais recentes orientações de conformidade para que possa expandir as soluções sem recear que a sua aplicação seja alvo de jailbreak

Autor

Andrew Liubinas