Navegación principal

Meta-Harness: flujos de IA empresarial seguros y autoevolutivos

Un metaarnés riguroso ayuda a los equipos empresariales a mejorar con seguridad los flujos de agentes en tareas de programación prolongadas.

Resumen ejecutivo

  • Los sistemas actuales de mejora autónoma han logrado buenos resultados en tareas de programación, pero aún no está claro si pueden mejorar flujos de trabajo de IA complejos y prolongados, similares a los despliegues empresariales reales.

  • Nuestra investigación sobre Meta-Harness aplica la mejora autónoma a flujos de recuperación con agentes, investigación avanzada e inteligencia de señales, e incorpora requisitos empresariales como evaluaciones reservadas, auditabilidad, controles presupuestarios y aprobación humana.

  • En tres cargas de trabajo representativas, Meta-Harness mejoró considerablemente el rendimiento: logró una mejora del 84 % en las pruebas reservadas de Signal Engine y una mayor precisión con una ejecución 16 veces más rápida en la recuperación multimodal con agentes.

  • A diferencia de la mayoría de los enfoques anteriores, Meta-Harness mide el éxito con conjuntos de datos reservados siempre que es posible, para comprobar si las mejoras se generalizan más allá de los datos utilizados durante la optimización.

  • Estos resultados indican que la mejora autónoma de flujos de trabajo puede trascender las pruebas de programación y aplicarse a sistemas empresariales de IA reales, abriendo una vía práctica hacia aplicaciones de IA que mejoran continuamente.

Trabajos recientes sobre investigación autónoma con IA, como el artículo sobre Meta-Harness, el marco CORAL y karpathy/autoresearch, han demostrado que los agentes de programación pueden mejorar una solución de forma iterativa a partir de una métrica de evaluación. La cuestión pendiente es si estos métodos sirven para flujos de IA prolongados, como la recuperación multimodal con agentes —donde un agente debe buscar de forma iterativa en corpus multimodales especializados para responder a una pregunta—, o para canalizaciones complejas de procesamiento de datos que requieren numerosos pasos dependientes, llamadas a herramientas y decisiones sobre la gestión de excepciones. La cuestión de fondo es si las mejoras se mantienen con datos que el optimizador nunca ve.

Nuestro trabajo de I+D sobre Meta-Harness responde a esa pregunta. Parte de ideas procedentes de investigaciones recientes y las adapta a las necesidades empresariales: evaluaciones reservadas, registros de auditoría, límites de costes y un punto claro de entrega a una persona antes de poner nada en producción.

Lo probamos en tres tareas prolongadas inspiradas en trabajos reales para clientes. Signal Engine supervisa un flujo en directo de publicaciones de X sobre el mercado de la IA y genera informes de tendencias estructurados y respaldados por fuentes fiables. Recuperación multimodal con agentes razona sobre consultas que combinan texto e imágenes para devolver las páginas de documentos más relevantes. Investigación avanzada coordina varios agentes para buscar en la web, contrastar fuentes y redactar informes de investigación extensos.

Resumen de resultados

  • Signal Engine: la puntuación combinada en pruebas reservadas pasó de 0,456 a 0,841, una mejora relativa del 84 %. CORAL y karpathy/autoresearch se mantuvieron por debajo de 0,50 con el mismo presupuesto.

  • Recuperación multimodal con agentes: el NDCG@10 reservado pasó de 0,705 a 0,744, mientras que el tiempo real de cada evaluación bajó de 869 s a 54 s. Esto supone una aceleración de 16 veces y una mayor precisión.

  • Investigación avanzada: la puntuación combinada de calidad de los informes pasó de 0,449 a 0,802 en 10 preguntas de referencia, frente a aproximadamente 0,52 de los métodos de referencia. Esta tarea no tenía una partición reservada, por lo que consideramos el resultado únicamente como interno a la muestra.

  • Eficiencia de búsqueda: con la reclasificación predictiva de hipótesis, Signal Engine alcanzó en 3 iteraciones el 91 % de la mejor puntuación de la ejecución de referencia, en lugar de necesitar 20, con el mismo presupuesto de evaluación.

La mayoría de los sistemas de investigación autónoma optimizan y evalúan con el mismo conjunto de datos, lo que impide saber si el resultado se generaliza. Para Signal Engine y la recuperación multimodal con agentes imponemos una separación estricta: un conjunto de entrenamiento con el que se puntúan los candidatos, uno de desarrollo para comprobaciones básicas y otro de pruebas reservadas que el optimizador nunca ve. Cada resultado comunicado procede de una versión concreta del código evaluada en todas las particiones, por lo que nunca combinamos la mejor puntuación de entrenamiento de un candidato con la mejor puntuación de prueba de otro.

Cómo funciona

En cada ronda, el arnés genera un lote de hipótesis estructuradas para modificar el código. Cada hipótesis especifica el mecanismo que pretende cambiar, la versión anterior sobre la que se basa y el tipo de fallo que busca corregir. Una fase de clasificación filtra el lote antes de incurrir en evaluaciones costosas. Las hipótesis seleccionadas pasan a agentes ejecutores en paralelo que comparten una base de conocimientos común, pero editan el código en Áreas de trabajo totalmente aisladas, para que cada candidato se evalúe de forma justa e independiente. Al final de la ronda, el ejecutor promueve a un ganador: el candidato con mayor puntuación que también haya superado todas las comprobaciones en las particiones visibles. Ese ganador se convierte en la versión de vanguardia sobre la que se construye la siguiente ronda. Cada ensayo guarda un paquete fijo en un repositorio de evidencias de solo anexado: su parche de código, las puntuaciones por partición, un registro de eventos y cuatro análisis breves redactados por un LLM sobre su traza, errores, coste y reflexión. El generador de propuestas de la siguiente ronda consulta este historial; así, el arnés acumula lo aprendido en lugar de volver a recorrer los mismos callejones sin salida.

Diagrama del flujo de trabajo de Meta-Harness que muestra las entradas, la evaluación inicial, la búsqueda de hipótesis, los equipos de agentes en paralelo, un Área de trabajo de evaluación, los resultados de la revisión, un repositorio de evidencias y los controles de seguridad y costes.

Tres medidas de protección permiten ejecutar el ciclo de forma segura. Una política de alcance limita los archivos que puede modificar un candidato y revierte cualquier cambio realizado fuera de ellos. Los límites de tokens y de tiempo real detienen la ejecución cuando el gasto supera el máximo establecido, mientras que los límites de concurrencia mantienen el arnés dentro de las tasas permitidas por el modelo y las GPU. Además, el arnés nunca pone nada en producción por sí solo. Genera un candidato clasificado y completamente documentado; después, una persona del equipo de ingeniería revisa el diff y decide si se lleva a producción.

Cómo funciona internamente

En una pila local, cinco componentes básicos de ingeniería sustentan cada ronda del ciclo anterior.

  • Aislamiento del Área de trabajo. Un árbol de trabajo de git por candidato. Los forks comparten una base de datos de objetos, pero nunca los archivos de los demás. Así, los candidatos pueden ejecutarse en paralelo con un coste de disco casi constante y resulta trivial comparar el diff con la versión de vanguardia actual.

  • Entorno aislado de ejecución. Dos modos configurables: un subproceso nativo para iterar con rapidez o un entorno de ejecución totalmente aislado. Los corpus se montan en modo de solo lectura y el directorio temporal de cada ensayo se descarta tras la evaluación. Por tanto, un ensayo no puede modificar el conjunto de datos ni filtrar su estado al siguiente.

  • Política de alcance. Una lista de rutas permitidas definida en la configuración del experimento. Todo cambio realizado fuera de ella se revierte antes de evaluar el ensayo, que además queda marcado. En consecuencia, se garantiza que el diff que ve la persona encargada de la revisión permanece dentro del alcance declarado.

  • Control del presupuesto. Tres niveles: límites de tokens y tiempo real por ensayo, un máximo total por ejecución y un límite de concurrencia. En conjunto, mantienen el gasto previsible y garantizan que el arnés respete los límites de tasa del modelo y la infraestructura.

  • Repositorio de evidencias. Un archivo JSONL de solo anexado con el parche de código, las puntuaciones por partición, el registro de eventos y los cuatro análisis redactados por un LLM. Las vistas materializadas —tabla de clasificación, versión de vanguardia e índice de fallos— se regeneran tras cada ensayo. Esto permite que las rondas posteriores aprovechen el historial y, a la vez, que cada ejecución pueda reproducirse byte por byte.

Ninguno de estos componentes es opcional. El objetivo del arnés es que, al finalizar una ejecución, quien la revise disponga de algo que realmente pueda aprobar: un candidato ganador, un diff acotado, un registro completo de todos los intentos y un coste conocido. Si se elimina cualquiera de los cinco, desaparece una de esas garantías.

Reclasificación predictiva de hipótesis

Los tres experimentos utilizan la misma estrategia de hipótesis. En cada iteración, el generador de propuestas crea más hipótesis de las que permite ejecutar el presupuesto: M = 8 candidatos para un presupuesto de envío de K = 4. Después, un LLM clasificador ordena los 8 en una única llamada de treinta segundos, teniendo ante sí toda la información: la mejor puntuación actual y sus dimensiones más débiles, los análisis de fallos de ensayos recientes y las 8 propuestas comparadas. Los 4 primeros pasan al ejecutor, con un coste de entre 15 y 30 minutos cada uno. Los otros 4 se descartan antes de consumir presupuesto.

Evaluaciones

Los modelos subyacentes se mantuvieron fijos durante todo el proceso; el arnés solo modificó el código que los rodeaba. Signal Engine e Investigación avanzada se ejecutaron con gpt-5.5. La recuperación multimodal con agentes se ejecutó con Qwen3.6-35B-A3B, un modelo de pesos abiertos servido localmente mediante vLLM y combinado con el recuperador de imágenes ColQwen3-4B; se eligió esta combinación por su coste local previsible.

El siguiente gráfico muestra la evolución de las puntuaciones en nuestras tres tareas principales. «Versión inicial» es el código de partida escrito por una persona del equipo de ingeniería. «Meta-Harness» es la mejor versión encontrada por Meta-Harness. Observamos una mejora del rendimiento de las tres tareas en el conjunto de pruebas reservadas.

Gráfico de barras que compara el rendimiento de la versión inicial y Meta-Harness en Signal Engine, recuperación multimodal con agentes e investigación avanzada; Meta-Harness obtiene mejores resultados en todas las pruebas reservadas.

Signal Engine fue evaluado por un LLM juez en cuanto a actualidad, veracidad, granularidad y tono, mediante 150 tuits de entrenamiento y 150 tuits de prueba reservados. Durante la ejecución, la mejor versión elevó la puntuación combinada de entrenamiento de 0,431 a 0,756 y la puntuación reservada de 0,456 a 0,841. Las mejoras provinieron de cambios en el propio arnés, no solo de ajustes en el prompt: las iteraciones ganadoras aprendieron a filtrar el ruido de las redes sociales, añadieron pasos para contrastar hechos y exigieron que cada resultado se sustentara en evidencias explícitas. El siguiente diagrama muestra el proceso de iteración.

Gráfico de líneas de los ensayos de entrenamiento de Signal Engine que muestra cómo las mejores puntuaciones acumuladas y las reservadas mejoran desde la referencia inicial hacia el objetivo durante sucesivos intentos de exploración y perfeccionamiento.

El historial de ensayos muestra cómo se acumularon esas mejoras. Un cambio estructural temprano elevó el mejor resultado acumulado a 0,625; un tratamiento más detallado de las evidencias lo llevó a 0,679; y un ciclo perfeccionado de reflexión y criterios de evaluación lo incrementó hasta 0,819. Aproximadamente la mitad de las ejecuciones candidatas rindieron peor o fallaron por completo, pero no contaminaron la tabla de clasificación: cada fork se ejecutó de forma aislada, los diffs perdedores se descartaron y los fallos se guardaron en el repositorio de reflexiones para que el siguiente generador de propuestas no repitiera el mismo callejón sin salida.

Lo más importante es que la curva reservada aumentó a la par que la curva de entrenamiento durante toda la ejecución. Esto indica que el arnés mejoraba el flujo de trabajo en lugar de memorizar el corpus de entrenamiento. Las puntuaciones reservadas fueron ligeramente superiores a las de entrenamiento, lo que interpretamos como el ruido de muestreo habitual entre dos particiones pequeñas y disjuntas.

La recuperación multimodal con agentes se mide mediante NDCG@10 en la partición pública de informática de ViDoRe V3, organizada en 20 consultas de entrenamiento, 10 de desarrollo y 20 de prueba reservadas. El arnés elevó el NDCG@10 reservado de 0,705 a 0,744, al tiempo que redujo el tiempo real total de evaluación de 869 segundos a 54 segundos.

La investigación avanzada se evalúa con una puntuación combinada, juzgada por un LLM, de calidad del contenido y de las referencias, siguiendo DeepResearch-Eval, en 10 preguntas de referencia. El código mejorado elevó la media de 0,449 a 0,802. Los cambios ganadores se identificaban fácilmente en el diff: una fase inicial de planificación que compara enfoques antes de enviar agentes de investigación y una revisión final centrada en las dimensiones en las que históricamente los informes habían obtenido peores puntuaciones. Como este conjunto es pequeño y costoso de evaluar, no lo dividimos y consideramos el resultado como interno a la muestra.

Comparación con CORAL y karpathy/autoresearch

Gráficos de barras que comparan Meta-Harness, CORAL y karpathy/autoresearch en las puntuaciones de Signal Engine, recuperación multimodal con agentes e investigación avanzada, así como en la latencia de evaluación.

Comparamos los tres métodos con el mismo presupuesto: los mismos conjuntos de datos, modelos subyacentes, límite de iteraciones y número total de evaluaciones de candidatos. En Signal Engine, Meta-Harness alcanza 0,841 en las pruebas reservadas, mientras que ambos métodos de referencia se mantuvieron por debajo de 0,50. En la recuperación multimodal con agentes, nuestro equipo obtiene el mayor NDCG@10 reservado (0,744, frente a 0,700 de CORAL y 0,738 de karpathy) y ejecuta la evaluación oficial entre doce y catorce veces más rápido: 54 s frente a 786 s y 650 s. En investigación avanzada, nuestro equipo alcanza 0,802, mientras que ambos métodos de referencia se mantuvieron cerca de 0,52. Hay una salvedad general: reimplementamos CORAL y karpathy/autoresearch a partir de sus descripciones publicadas, por lo que parte de la diferencia podría deberse a la implementación y no solo a los métodos.

Cuatro decisiones de diseño explican la diferencia. En primer lugar, nuestro equipo genera una especificación de diseño estructurada antes de editar el código, lo que favorece cambios estructurales, como nuevas etapas de la canalización, en vez de meros ajustes del prompt. En segundo lugar, ejecuta forks simultáneos anclados a un candidato de vanguardia compartido, por lo que las mejoras se acumulan más rápido que con los agentes independientes de CORAL o el ciclo estrictamente secuencial de karpathy. En tercer lugar, cada ensayo deja artefactos estructurados —puntuaciones, registros de eventos y cuatro análisis redactados por un LLM— que consulta el siguiente generador de propuestas, mientras que los métodos de referencia solo conservan registros planos de los intentos. En cuarto lugar, un controlador adaptativo orienta al generador de propuestas hacia la exploración tras un estancamiento y hacia el perfeccionamiento después de una victoria; además, la reclasificación predictiva de hipótesis descarta las ideas débiles antes de que consuman presupuesto.

Lo que no hemos demostrado

Las curvas reservadas demuestran generalización dentro del dominio, no transferencia entre dominios: no cabe esperar que un flujo ajustado para extraer señales del mercado de la IA funcione bien con textos jurídicos o biomédicos sin volver a ejecutar el arnés. Además, el arnés solo optimiza lo que define el evaluador, por lo que se sobreajustará fielmente a un conjunto de entrenamiento ruidoso o a un juez mal calibrado. Recomendamos al menos 20 elementos de entrenamiento bien seleccionados y una partición de desarrollo independiente antes de una ejecución seria. El coste es la principal limitación práctica. Cada evaluación vuelve a ejecutar toda la canalización en todas las particiones; solo el candidato de recuperación seleccionado consumió aproximadamente 2,2 millones de tokens de entrada, y una optimización seria con un modelo de la clase de gpt-5.5 cuesta entre varios cientos y algo más de mil dólares por tarea. Por último, estas cifras proceden de ejecuciones únicas y no de ensayos repetidos; por eso las compartimos en una entrada técnica de blog y no como un estudio formal.

Conclusión

Meta-Harness demuestra que la mejora autónoma del código puede someterse a una disciplina suficiente para su uso empresarial. Los ingredientes son hipótesis estructurales, un filtrado previo predictivo, evaluaciones aisladas, pruebas reservadas siempre que los datos lo permitan y un registro de auditoría completo de cada cambio promovido. En conjunto, ofrecen al equipo de ingeniería una vía previsible desde una canalización inicial funcional hasta otra claramente mejor, y al responsable de operaciones un modelo sencillo: aprovechar las ventajas de la exploración autónoma dentro de un marco estricto y consciente del presupuesto, con una persona en el ciclo antes de poner nada en producción.

Autores

David Huang y Bjorn Jee