Os sistemas atuais de aprimoramento autônomo têm apresentado bons resultados em tarefas de programação, mas ainda não está claro se podem melhorar fluxos complexos e de longo prazo de IA semelhantes a implantações corporativas reais.
Nossa pesquisa com o Meta-Harness aplica o autoaprimoramento autônomo a fluxos de recuperação com agentes de IA, pesquisa aprofundada e inteligência de sinais, além de incorporar requisitos corporativos como avaliação em dados reservados, auditabilidade, controles de orçamento e aprovação humana.
Em três cargas de trabalho representativas, o Meta-Harness melhorou substancialmente o desempenho, incluindo uma melhora de 84% no teste com dados reservados do Signal Engine e maior precisão com execução 16 vezes mais rápida na Recuperação multimodal com agentes de IA.
Ao contrário da maioria das abordagens anteriores, o Meta-Harness mede o sucesso em conjuntos de dados reservados sempre que possível, para avaliar se as melhorias se generalizam para além dos dados usados na otimização.
Esses resultados sugerem que o aprimoramento autônomo de fluxos pode ir além de benchmarks de programação e chegar a sistemas corporativos de IA do mundo real, oferecendo um caminho prático para melhorar continuamente as aplicações de IA.
Trabalhos recentes sobre pesquisa autônoma de IA, incluindo o artigo Meta-Harness, o framework CORAL e o karpathy/autoresearch, mostraram que agentes de programação podem aprimorar uma solução de forma iterativa com base em uma métrica de avaliação. A questão ainda em aberto é se esses métodos funcionam em fluxos de IA de longo prazo, como a recuperação multimodal com agentes de IA, na qual um agente precisa pesquisar repetidamente em corpora multimodais especializados para responder a uma pergunta, ou em pipelines complexos de processamento de dados que exigem muitas etapas dependentes, chamadas de ferramentas e decisões de tratamento de exceções. A questão mais profunda é se os ganhos se mantêm em dados que o otimizador nunca vê.
Nossa pesquisa e desenvolvimento com o Meta-Harness é a resposta a essa questão. Ela aproveita ideias de pesquisas recentes e as adapta às necessidades corporativas: avaliação em dados reservados, trilhas de auditoria, tetos de custos e um ponto claro de transferência para um revisor humano antes de qualquer implantação.
Fizemos testes em três tarefas de longo prazo baseadas em trabalhos reais de clientes. O Signal Engine monitora um fluxo ao vivo de publicações no X sobre o mercado de IA e produz relatórios de tendências estruturados e bem fundamentados. A Recuperação multimodal com agentes de IA analisa consultas que combinam texto e imagem para retornar as páginas de documentos mais relevantes. A pesquisa aprofundada coordena vários agentes para pesquisar na web, conferir fontes e redigir relatórios de pesquisa extensos.
Signal Engine: pontuação composta no teste reservado de 0,456 → 0,841, um aumento relativo de 84%. CORAL e karpathy/autoresearch permaneceram abaixo de 0,50 com o mesmo orçamento.
Recuperação multimodal com agentes de IA: NDCG@10 no teste reservado de 0,705 → 0,744, com o tempo decorrido por avaliação caindo de 869 s para 54 s. Isso representa uma aceleração de 16 vezes, com maior precisão.
Pesquisa aprofundada: pontuação composta de qualidade dos relatórios de 0,449 → 0,802 em 10 perguntas de referência, contra cerca de 0,52 para as linhas de base. Essa tarefa não tinha uma partição reservada, por isso consideramos o número apenas como resultado dentro da amostra.
Eficiência da busca: com a Reclassificação preditiva de hipóteses, o Signal Engine alcançou 91% da melhor pontuação da execução de referência em 3 iterações, em vez de 20, usando o mesmo orçamento de avaliação.
A maioria dos sistemas de pesquisa autônoma otimiza e avalia no mesmo conjunto de dados, o que torna impossível saber se o resultado se generaliza. Para o Signal Engine e a Recuperação multimodal com agentes de IA, aplicamos uma divisão rigorosa: um conjunto de treinamento no qual os candidatos podem ser pontuados, um conjunto de desenvolvimento para verificações de coerência e um conjunto de teste reservado que o otimizador nunca vê. Cada resultado informado vem de uma versão específica do código, pontuada em todas as partições. Assim, nunca combinamos a melhor pontuação de treinamento de um candidato com a melhor pontuação de teste de outro.
A cada rodada, o harness gera um lote de hipóteses estruturadas para alterar o código. Cada hipótese identifica o mecanismo que pretende alterar, a versão anterior em que se baseia e o modo de falha que busca corrigir. Uma etapa de classificação filtra o lote antes que recursos sejam gastos em avaliações dispendiosas. As hipóteses restantes seguem para agentes executores paralelos, que compartilham uma base de conhecimento, mas editam o código em espaços de trabalho totalmente isolados. Assim, cada candidato é avaliado de forma justa e independente. Ao fim da rodada, o executor promove um vencedor: o candidato com a maior pontuação que também passou por todas as verificações nas partições visíveis. Esse vencedor se torna a fronteira em que a próxima rodada se baseia. Cada tentativa grava um pacote fixo em um repositório de evidências somente para anexação: o patch de código, as pontuações por partição, um log de eventos e quatro análises curtas redigidas por um LLM sobre o rastreamento, os erros, o custo e uma reflexão. O proponente da rodada seguinte relê esse histórico. É assim que o harness acumula o que aprendeu, em vez de repetir os mesmos becos sem saída.


Três mecanismos de proteção mantêm a execução do ciclo segura. Uma política de escopo restringe os arquivos que um candidato pode alterar e reverte tudo o que estiver fora desse escopo. Os limites de tokens e de tempo decorrido encerram a execução quando os gastos ultrapassam o teto, enquanto os limites de simultaneidade mantêm o harness dentro dos limites de taxa do modelo e das GPUs. Além disso, o harness nunca implanta nada por conta própria. Ele produz um candidato classificado e totalmente documentado; um engenheiro analisa o diff e decide se ele deve entrar em produção.
Em uma pilha local, cinco componentes fundamentais de engenharia sustentam cada rodada do ciclo descrito acima.
Isolamento dos espaços de trabalho. Uma árvore de trabalho do git para cada candidato. Os forks compartilham um banco de dados de objetos, mas nunca os arquivos uns dos outros. Isso permite executar candidatos em paralelo com um custo de disco quase constante e facilita a comparação do diff com a fronteira atual.
Sandbox de execução. Dois modos definidos pela configuração: subprocesso nativo para iteração rápida ou ambiente de execução totalmente isolado. Os corpora são montados como somente leitura, e o diretório temporário de cada tentativa é descartado após a avaliação. Assim, uma tentativa não pode alterar o conjunto de dados nem vazar estados para a próxima.
Política de escopo. Uma lista de caminhos permitidos, declarada na configuração do experimento. Qualquer alteração fora dela é revertida antes da avaliação da tentativa, que também é sinalizada. Consequentemente, há a garantia de que o diff visto pelo revisor permaneça dentro do escopo declarado.
Aplicação dos limites de orçamento. Três camadas: limites de tokens e tempo por tentativa, um teto agregado por execução e um limite de simultaneidade. Em conjunto, elas mantêm os gastos previsíveis e o harness dentro dos limites de taxa do modelo e da infraestrutura.
Repositório de evidências. Um arquivo JSONL somente para anexação, com o patch de código, as pontuações por partição, o log de eventos e as quatro análises redigidas pelo LLM. As visualizações materializadas (classificação, fronteira e índice de falhas) são recriadas após cada tentativa. Isso permite que as rodadas seguintes aproveitem o histórico e mantém cada execução reproduzível byte por byte.
Nenhum desses componentes é opcional. O objetivo do harness é deixar para o revisor algo que ele realmente possa aprovar ao fim da execução: um candidato vencedor, um diff delimitado, um registro completo do que foi tentado e um custo conhecido. Se qualquer um dos cinco for removido, uma dessas garantias desaparece.
Os três experimentos usam a mesma estratégia de hipóteses. A cada iteração, o proponente gera mais hipóteses do que o orçamento permite executar: M = 8 candidatos para um orçamento de despacho de K = 4. Em seguida, um LLM classificador independente ordena os 8 em uma única chamada de trinta segundos, com uma visão completa: a melhor pontuação atual e seus pontos fracos, análises de falhas de tentativas recentes e as 8 propostas lado a lado. Os 4 primeiros seguem para o executor, com um custo de 15 a 30 minutos cada. Os outros 4 são descartados antes de gerar qualquer gasto.
Os modelos subjacentes permaneceram inalterados do início ao fim; o harness editou apenas o código ao redor deles. O Signal Engine e a pesquisa aprofundada foram executados no gpt-5.5. A Recuperação multimodal com agentes de IA foi executada no Qwen3.6-35B-A3B de pesos abertos, disponibilizado localmente pelo vLLM e combinado com um recuperador de imagens ColQwen3-4B. Essa combinação foi escolhida pelo custo local previsível.
O gráfico abaixo mostra a evolução das pontuações nas três tarefas principais. "Versão inicial" é o código de partida escrito por um engenheiro. "Meta-Harness" é a melhor versão encontrada pelo Meta-Harness. Observamos melhora de desempenho nas três tarefas no conjunto de teste reservado.


O Signal Engine foi avaliado por um LLM juiz quanto a atualidade, precisão factual, granularidade e tom, usando 150 tweets de treinamento e 150 tweets de teste reservados. Ao longo da execução, a melhor versão elevou a pontuação composta de treinamento de 0,431 para 0,756 e a pontuação reservada de 0,456 para 0,841. Os ganhos vieram de mudanças no próprio harness, não apenas de ajustes nos prompts: as iterações vencedoras aprenderam a filtrar o ruído das redes sociais, acrescentaram etapas de verificação cruzada de fatos e exigiram que cada resultado se baseasse em evidências explícitas. O diagrama abaixo mostra o processo de iteração.


O histórico das tentativas mostra como esses ganhos se acumularam. Uma alteração estrutural inicial elevou o melhor resultado acumulado para 0,625; um tratamento mais granular das evidências o levou a 0,679; e um ciclo refinado de reflexão e critérios de avaliação o elevou a 0,819. Cerca de metade das execuções dos candidatos teve desempenho inferior ou falhou completamente, mas não contaminou a classificação: cada fork foi executado isoladamente, os diffs perdedores foram descartados e as falhas foram registradas no repositório de reflexões para que o proponente seguinte não repetisse o mesmo beco sem saída.
Mais importante: a curva dos dados reservados subiu junto com a curva de treinamento durante toda a execução. Isso sugere que o harness estava aprimorando o fluxo, e não memorizando o corpus de treinamento. As pontuações dos dados reservados ficaram um pouco acima das de treinamento, o que interpretamos como ruído amostral normal entre duas partições pequenas e distintas.
A Recuperação multimodal com agentes de IA é medida pelo NDCG@10 na partição pública de Ciência da Computação do ViDoRe V3, organizada em 20 consultas de treinamento, 10 de desenvolvimento e 20 de teste reservadas. O harness elevou o NDCG@10 reservado de 0,705 para 0,744 e reduziu o tempo total decorrido da avaliação de 869 segundos para 54 segundos.
A pesquisa aprofundada é avaliada por uma pontuação composta atribuída por um LLM juiz, considerando a qualidade do conteúdo e das referências, conforme o DeepResearch-Eval, em 10 perguntas de referência. O código aprimorado elevou a média de 0,449 para 0,802. As alterações vencedoras eram fáceis de identificar no diff: uma etapa inicial de planejamento que compara abordagens antes do despacho dos agentes de pesquisa e uma etapa final de revisão voltada às dimensões em que os relatórios historicamente apresentavam pontuações baixas. Como esse conjunto é pequeno e sua avaliação é cara, não o dividimos e consideramos o resultado como obtido dentro da amostra.


Comparamos os três métodos com o mesmo orçamento: os mesmos conjuntos de dados, modelos subjacentes, limite de iterações e total de avaliações de candidatos. No Signal Engine, o Meta-Harness alcança 0,841 no teste reservado, enquanto as duas linhas de base permaneceram abaixo de 0,50. Na Recuperação multimodal com agentes de IA, nossa equipe obteve o maior NDCG@10 no teste reservado (0,744, contra 0,700 do CORAL e 0,738 do karpathy) e executou a avaliação oficial de 12 a 14 vezes mais rápido: 54 s, contra 786 s e 650 s. Na pesquisa aprofundada, nossa equipe alcança 0,802, enquanto as duas linhas de base ficaram próximas de 0,52. Há uma ressalva geral: reimplementamos o CORAL e o karpathy/autoresearch com base nas descrições publicadas. Portanto, parte da diferença pode refletir variações de implementação, e não apenas dos métodos.
Quatro decisões de projeto explicam essa diferença. Primeiro, nossa equipe gera uma especificação de projeto estruturada antes de editar qualquer código, o que favorece mudanças estruturais, como novas etapas do pipeline, em vez de ajustes nos prompts. Segundo, ela executa forks simultâneos ancorados em um candidato de fronteira compartilhado. Assim, as melhorias se acumulam mais rapidamente do que com os agentes independentes do CORAL ou o ciclo estritamente sequencial do karpathy. Terceiro, cada tentativa deixa artefatos estruturados — pontuações, logs de eventos e quatro análises redigidas por um LLM — que o próximo proponente relê, enquanto as linhas de base mantêm apenas logs simples das tentativas. Quarto, um controlador adaptativo direciona o proponente à exploração após uma estagnação e ao refinamento após uma vitória. Acima dele, a Reclassificação preditiva de hipóteses descarta ideias fracas antes que consumam o orçamento.
As curvas dos dados reservados demonstram generalização dentro do domínio, não transferência entre domínios: não se deve esperar que um fluxo ajustado para extrair sinais do mercado de IA funcione bem em textos jurídicos ou biomédicos sem executar o harness novamente. O harness também só otimiza aquilo que o avaliador define. Portanto, ele se ajustará fielmente em excesso a um conjunto de treinamento ruidoso ou a um juiz mal calibrado. Recomendamos pelo menos 20 itens de treinamento bem selecionados e uma partição de desenvolvimento separada antes de uma execução séria. O custo é a maior restrição prática. Cada avaliação executa novamente o pipeline completo em todas as partições; somente o candidato de recuperação selecionado consumiu cerca de 2,2 milhões de tokens de entrada; e uma otimização robusta em um modelo da classe do gpt-5.5 custa de centenas a poucos milhares de dólares por tarefa. Por fim, esses números vêm de execuções únicas, não de tentativas repetidas. É por isso que os compartilhamos em uma publicação técnica de blog, e não em um estudo formal.
O Meta-Harness mostra que o aprimoramento autônomo de código pode ter disciplina suficiente para uso corporativo. Os elementos essenciais são hipóteses estruturais, pré-filtragem preditiva, avaliação isolada, testes em dados reservados sempre que os dados permitirem e uma trilha de auditoria completa por trás de cada alteração promovida. Em conjunto, eles oferecem à equipe de engenharia um caminho previsível entre um pipeline inicial funcional e outro comprovadamente melhor. Também oferecem ao responsável pelas operações um modelo simples: os benefícios da exploração autônoma dentro de uma estrutura rigorosa e atenta ao orçamento, com uma pessoa participando do processo antes de qualquer implantação.