Adicionar métricas não melhora necessariamente a compreensão. Muitos painéis contêm várias medidas do mesmo comportamento subjacente. As métricas se tornam mais úteis para o diagnóstico quando combinadas em pares mutuamente destrutivos: custo e qualidade, contenção e sentimento ou precisão e latência.
Os pares certos mudam à medida que um produto de IA passa do piloto para a produção. A mensuração deve acompanhar as decisões que a equipe precisa tomar em cada etapa.
O monitoramento operacional e a mensuração estratégica têm finalidades diferentes. As equipes podem acompanhar centenas de sinais do sistema, mas usar apenas alguns pares para orientar decisões sobre o produto.
As métricas de destaque podem contar uma história convincente sem resolver uma decisão importante sobre o produto.
O assistente de IA da Klarna foi associado publicamente a uma maior taxa de processamento, custos menores e índices de satisfação do cliente comparáveis aos dos agentes humanos. No ano seguinte, a empresa decidiu ampliar o acesso ao suporte humano, e seu CEO reconheceu que a redução de custos havia recebido ênfase excessiva.
Isso não representou uma rejeição ao assistente de IA nem à tecnologia que o sustentava. Foi um ajuste no equilíbrio entre a automação e o atendimento humano, à medida que a empresa aprendia com a operação do produto. À medida que a automação assumia uma parcela maior das solicitações mais simples, recebidas em grande volume, a Klarna precisava de atendentes humanos preparados para lidar com casos complexos e delicados.
Depois de definir desde o início o que um produto deve alcançar, a maioria das organizações que desenvolvem produtos de IA acabará diante da mesma pergunta: ele está realmente funcionando?
Quando a resposta não é clara, o impulso costuma ser adicionar mais métricas. Três viram 10, depois 10 viram 30. O painel fica mais completo, mas a compreensão da equipe pode não melhorar.
O problema nem sempre está na qualidade das medidas individuais, mas na relação entre elas. Satisfação do cliente, Net Promoter Score, avaliações e taxas de aprovação podem fornecer sinais úteis, mas talvez reflitam mudanças semelhantes no sentimento geral. Quando variam juntas, elas confirmam que algo aconteceu, mas não necessariamente explicam o motivo.
Por isso, as equipes de IA devem ir além das métricas que concordam entre si e identificar medidas que revelem resultados concorrentes. Esses pares mutuamente destrutivos revelam e ajudam a monitorar o impacto das concessões por trás do desempenho do produto, permitindo decisões melhores.
Em uma implementação anterior ao lançamento, a equipe conjunta desenvolvia um agente de voz com IA em tempo real para chamadas recebidas de suporte ao cliente. Uma das perguntas mais difíceis não era sobre a escolha do modelo nem sobre a orquestração. Era como a organização saberia se o produto estava funcionando quando os clientes começassem a usá-lo em escala.
A estrutura inicial usava três medidas:
Taxa de contenção: frequência com que a IA resolve uma chamada sem transferi-la para uma pessoa.
Taxa de escalonamento: frequência com que uma chamada é transferida para um agente humano.
Taxa de resolução: frequência com que o problema do cliente é finalmente resolvido.
Cada medida era razoável. Juntas, porém, elas não conseguiam responder a uma pergunta óbvia: se o escalonamento aumentar, o que isso nos diz?
A equipe dividiu o escalonamento em oito subtipos. Depois, acrescentou medidas de abandono, jornada e tempo, pontuações de compreensão da linguagem e resolução por tipo de consulta. A estrutura acabou reunindo 31 métricas em seis categorias.
Ela conseguia descrever o escalonamento em detalhes, mas ainda não identificava sua causa de forma confiável. A maioria das métricas era uma variação do mesmo comportamento. Por isso, elas se moviam juntas, em vez de testar explicações concorrentes.
O painel havia se tornado observacional, e não diagnóstico.
A equipe não precisava de outra camada de decomposição. Ela precisava de métricas que limitassem umas às outras.
Chamamos isso de pares mutuamente destrutivos: duas medidas em que melhorar uma isoladamente pode prejudicar o resultado representado pela outra. O nome descreve o modo de falha criado pela otimização unilateral, não o estado desejado.
Quando ambos os lados permanecem saudáveis, o produto pode estar operando de forma sustentável. Quando divergem, a direção dessa divergência ajuda a equipe a decidir o que investigar.
O que tínhamos | Par mutuamente destrutivo | O que o par pode revelar |
|---|---|---|
Taxa de escalonamento dividida em oito subtipos | Taxa de escalonamento ↔ tempo até o escalonamento | O escalonamento imediato pode indicar um problema de confiança ou apresentação; o escalonamento posterior pode indicar que o sistema não consegue concluir a tarefa. |
Taxa de contenção e taxa de resolução apresentadas separadamente | Taxa de contenção ↔ sentimento do cliente | Se a contenção representa uma resolução satisfatória ou o abandono da tentativa pelo cliente. |
Taxa de resolução por tipo de intenção | Taxa de resolução ↔ profundidade da conversa | Se uma resolução bem-sucedida é eficiente ou exige uma interação exaustiva. |
Para entender melhor como isso é revelado e o que fazer com essa informação, consideremos a taxa de escalonamento e o tempo até o escalonamento. A equipe não saberá como os clientes se comportam até receber chamadas reais, mas pode definir as hipóteses que precisa testar.
Se mais chamadas começarem a ser escalonadas e os clientes abandonarem a experiência com a IA nos primeiros 30 segundos, a equipe deverá investigar confiança, transparência, tom e interações iniciais. Se os clientes pedirem o escalonamento depois de passar vários minutos tentando realizar uma tarefa, o problema mais provável será a capacidade ou a cobertura do fluxo de trabalho.
O número geral de escalonamentos é o mesmo. A decisão sobre o produto é diferente.
Um par útil não comprova a causa por si só. Ele restringe a investigação e torna a próxima decisão mais clara.
O exemplo da Klarna apresentado anteriormente mostra como esse princípio se aplica quando custo e qualidade do serviço interagem. Ele demonstra como um modelo operacional viabilizado por IA pode evoluir à medida que uma empresa monitora o impacto das concessões e aprende com sua implementação.
Em fevereiro de 2024, a empresa informou que seu assistente de IA havia atendido 2,3 milhões de conversas no primeiro mês, realizado um volume de trabalho equivalente ao de 700 agentes em tempo integral e alcançado índices de satisfação do cliente comparáveis aos dos agentes humanos. A Klarna estimou que o assistente contribuiria para um aumento de US$ 40 milhões no lucro em 2024. Esses resultados foram divulgados pela própria Klarna, e não por uma avaliação independente.
Em maio de 2025, o CEO da Klarna afirmou que a empresa havia dado ênfase excessiva à redução de custos no atendimento ao cliente e descreveu planos para ampliar o acesso ao suporte humano. Isso representou um ajuste no equilíbrio entre o atendimento automatizado e o humano, e não uma rejeição ao assistente de IA ou à tecnologia subjacente.
As evidências públicas mostram por que as medidas de eficiência devem ser consideradas junto às necessidades de diferentes clientes e interações. Um sistema de IA pode ter bom desempenho em média, embora alguns casos complexos, sensíveis ou incomuns ainda se beneficiem de um canal humano acessível.
Monitorar os dois lados dessa relação ajuda a empresa a decidir onde a automação gera valor, onde o suporte humano continua importante e como o equilíbrio deve mudar diante de novas evidências.
Outros pares mutuamente destrutivos em produtos de IA podem incluir:
Par mutuamente destrutivo | Risco que ele ajuda a revelar |
|---|---|
Precisão da resposta ↔ latência da resposta | Um sistema tecnicamente preciso, mas lento demais para o fluxo de trabalho. |
Conclusão de tarefas ↔ taxa de substituição pelo usuário | Um fluxo de trabalho de IA que conclui tarefas refeitas repetidamente pelos usuários. |
Custo por interação ↔ qualidade avaliada da saída | Economia obtida às custas da experiência do cliente ou do funcionário. |
Adoção ↔ tempo para gerar valor | Crescimento das inscrições sem geração de valor correspondente para o usuário. |
O objetivo não é fazer com que ambas as medidas aumentem indefinidamente. É tornar a concessão visível antes que a otimização unilateral crie um problema operacional.
Um desafio relacionado surgiu na implementação de um sistema de suporte a jogadores para uma empresa de jogos para dispositivos móveis. O sistema atendia problemas de grande volume, como perda de progresso, disputas de pagamento e acesso à conta.
As medidas de eficiência eram importantes porque o sistema operava em escala. Mas o suporte a jogadores não é apenas uma fila operacional. Os jogadores muitas vezes chegam frustrados porque algo já deu errado em outro ponto da experiência.
Esse ponto de partida muda a forma de interpretar os dados de satisfação do cliente. Um jogador cujo problema foi resolvido corretamente ainda pode relatar baixa satisfação por ter perdido seu progresso inicialmente. Interpretar essa pontuação sem contexto pode penalizar a interação de suporte por uma frustração surgida antes na jornada do cliente.
A equipe precisava, portanto, distinguir o sentimento inicial do cliente do efeito da experiência de suporte. A pergunta mais útil não era: "O jogador ficou satisfeito?" E sim: "A interação melhorou a situação em relação ao ponto de partida do jogador?"
Essa comparação pode ajudar a separar a frustração com o produto da qualidade do suporte, desde que a equipe disponha de uma forma confiável de medir ambos.
Os produtos de IA mudam, mas suas métricas muitas vezes permanecem fixas.
Durante um piloto, a questão central pode ser se o sistema é confiável o bastante para justificar a continuidade do investimento:
Ele conclui a tarefa principal de forma confiável?
Os usuários confiam nele o suficiente para continuar?
Como ele se comporta fora dos cenários mais comuns?
É possível identificar falhas e se recuperar delas com segurança?
Essas perguntas favorecem pares como:
sucesso na tarefa principal ↔ desempenho em casos extremos;
taxa de automação ↔ taxa de intervenção humana; e
velocidade de conclusão ↔ confiança do usuário.
Quando o produto se torna importante para a operação, as perguntas mudam:
Ele consegue operar em escala sem reduzir a qualidade?
Sua viabilidade econômica melhora com o uso?
O desempenho permanece estável à medida que a adoção cresce?
As intervenções humanas estão ocorrendo nos lugares certos?
Os pares correspondentes podem mudar para:
custo por interação ↔ qualidade avaliada da saída;
amplitude da adoção ↔ profundidade do uso; e
taxa de automação ↔ exposição a riscos operacionais.
As métricas iniciais não estão necessariamente erradas. Elas respondem às perguntas que importavam em uma etapa anterior.
O risco surge durante a transição. As métricas do piloto costumam persistir porque as equipes sabem como apresentá-las e ninguém é responsável por decidir quando aposentá-las. Medidas que antes apoiavam o aprendizado podem se tornar gradualmente métricas de vaidade.
Portanto, os pares devem ter um ciclo de vida. As equipes devem introduzi-los para uma decisão específica, verificar se ainda revelam uma concessão relevante e aposentá-los quando o produto ou a decisão mudar.
Sistemas de IA exigem observabilidade detalhada, alertas, garantia de qualidade e avaliação. Remover esses sinais dificultaria a operação segura do produto. Mas o monitoramento operacional não é o mesmo que a mensuração usada pela liderança.
O monitoramento ajuda as equipes a detectar incidentes, rastrear falhas e compreender o comportamento do sistema. As métricas de decisão ajudam líderes de produto e negócios a decidir se devem investir, intervir, mudar de direção ou aceitar uma concessão.
Uma organização pode monitorar centenas de sinais técnicos e operacionais, mas destacar apenas dois ou três pares mutuamente destrutivos para uma decisão específica sobre o produto. Manter essa camada de decisão enxuta facilita a priorização.
A frequência adequada de revisão depende do produto. Um sistema novo ou em rápida mudança pode exigir revisões semanais das decisões, enquanto um produto maduro pode adotar uma frequência mensal ou trimestral. O princípio importa mais que o intervalo: revise o par com frequência suficiente para agir antes que a concessão se torne cara ou insegura.
Um par só se torna útil quando a organização concorda sobre o que acontecerá se ele piorar.
Isso exige mais do que definir um limite crítico de divergência. As equipes devem considerar três condições:
Falha absoluta: uma medida ultrapassa um limite inaceitável, independentemente da outra.
Divergência: uma medida melhora enquanto seu contrapeso piora.
Deterioração conjunta: ambos os lados pioram, indicando um problema mais amplo no produto ou na operação.
Cada par deve ter:
um responsável definido;
uma decisão clara que ele apoia;
limites ou critérios de avaliação acordados;
um roteiro de investigação; e
um conjunto de possíveis intervenções.
Sem esses elementos, a organização está apenas observando o produto, em vez de gerenciá-lo.
Antes de adicionar outra medida, escolha uma decisão importante sobre o produto e responda a estas perguntas. Registre as respostas para que a revisão termine com um próximo passo acordado.
1. Que decisão precisamos tomar com a ajuda dessas métricas?
Seja específico: estamos decidindo se devemos ampliar a automação, trocar um modelo ou melhorar a transferência para uma pessoa? Defina a decisão antes de escolher as medidas.
2. Se este número melhorar, o que pode piorar?
Identifique o resultado que precisa ser protegido e uma medida capaz de revelar danos. Por exemplo, combine o custo por interação com a qualidade avaliada da saída para verificar se respostas mais baratas continuam úteis.
3. O que os números de destaque podem estar ocultando?
Analise as duas medidas para os mesmos usuários, tarefas e período. Depois, procure grupos que estejam obtendo resultados piores. Considere também as condições iniciais: a baixa satisfação pode refletir uma frustração anterior à interação de suporte.
4. O que nos faria agir e quem é responsável pela resposta?
Defina critérios para agir quando uma medida ultrapassar um limite inaceitável, quando uma melhorar e a outra piorar ou quando ambas se deteriorarem. Defina quem investigará, o que verificará primeiro e quando apresentará suas conclusões.
5. Este par ainda corresponde à etapa atual do produto?
Decida se deve mantê-lo, substituí-lo ou aposentá-lo. Um piloto pode se concentrar na confiabilidade das tarefas e na confiança do usuário; um serviço em produção pode exigir uma análise mais rigorosa de custo e qualidade. Defina uma data para reavaliar a escolha.
A mensuração de produtos de IA deve fazer mais do que descrever o desempenho. Ela deve revelar as concessões feitas pela organização e tornar a próxima decisão mais clara.