Navegación principal

Meta-Harness: flujos de IA empresarial autónomos y más seguros

Un metaarnés disciplinado ayuda a los equipos empresariales a mejorar con seguridad los flujos de agentes en tareas de programación prolongadas.

Resumen ejecutivo

  • Los sistemas actuales de mejora autónoma han logrado buenos resultados en tareas de programación, pero aún no está claro si pueden mejorar flujos de trabajo de IA complejos y prolongados que se asemejen a implementaciones empresariales reales.

  • Nuestra investigación sobre Meta-Harness aplica la mejora autónoma a flujos de recuperación agéntica, investigación profunda e inteligencia de señales, e incorpora requisitos empresariales como evaluaciones reservadas, auditabilidad, controles presupuestarios y aprobación humana.

  • En tres cargas de trabajo representativas, Meta-Harness mejoró sustancialmente el rendimiento. Esto incluyó una mejora del 84 % en las pruebas reservadas de Signal Engine y una mayor precisión con una ejecución 16 veces más rápida en recuperación multimodal agéntica.

  • A diferencia de la mayoría de los enfoques anteriores, Meta-Harness mide los resultados con conjuntos de datos reservados siempre que es posible, a fin de evaluar si las mejoras se generalizan más allá de los datos utilizados durante la optimización.

  • Estos resultados indican que la mejora autónoma de flujos de trabajo puede ir más allá de los parámetros de referencia de programación y aplicarse a sistemas empresariales de IA reales, lo que ofrece una vía práctica para mejorar continuamente las aplicaciones de IA.

Los trabajos recientes sobre investigación autónoma de IA, incluidos el artículo de Meta-Harness, el marco CORAL y karpathy/autoresearch, han demostrado que los agentes de programación pueden mejorar una solución de forma iterativa a partir de una métrica de evaluación. Aún falta saber si esos métodos funcionan en flujos de IA prolongados, como la recuperación multimodal agéntica, donde un agente debe buscar iterativamente en corpus especializados y multimodales para responder una pregunta, o en procesos complejos de datos que requieren numerosos pasos dependientes, llamadas a herramientas y decisiones para gestionar excepciones. La cuestión de fondo es si las mejoras se mantienen con datos que el optimizador nunca ve.

Nuestra I&D de Meta-Harness responde esa pregunta. Retoma ideas de investigaciones recientes y las adapta a las necesidades empresariales: evaluaciones reservadas, registros de auditoría, límites de costos y un punto claro de entrega a un revisor humano antes de implementar cualquier cambio.

Lo probamos en tres tareas prolongadas inspiradas en trabajos reales para clientes. Signal Engine monitorea un flujo en vivo de publicaciones de X sobre el mercado de la IA y genera informes de tendencias estructurados y bien fundamentados. Recuperación multimodal agéntica razona sobre consultas que combinan texto e imágenes para devolver las páginas más relevantes de los documentos. Investigación profunda coordina varios agentes para buscar en la web, verificar fuentes y redactar informes de investigación extensos.

Resumen de resultados

  • Signal Engine: resultado compuesto de la prueba reservada de 0,456 → 0,841, una mejora relativa del 84 %. CORAL y karpathy/autoresearch se mantuvieron por debajo de 0,50 con el mismo presupuesto.

  • Recuperación multimodal agéntica: NDCG@10 reservado de 0,705 → 0,744, mientras el tiempo real por evaluación bajó de 869 s a 54 s. Esto equivale a una ejecución 16 veces más rápida y con mayor precisión.

  • Investigación profunda: resultado compuesto de calidad de informes de 0,449 → 0,802 en 10 preguntas de referencia, frente a cerca de 0,52 para las líneas base. Esta tarea no tenía una partición reservada, por lo que consideramos que el resultado solo es válido dentro de la muestra.

  • Eficiencia de búsqueda: con la reclasificación predictiva de hipótesis, Signal Engine alcanzó el 91 % de la mejor puntuación de la ejecución de referencia en 3 iteraciones, en lugar de 20, con el mismo presupuesto de evaluación.

La mayoría de los sistemas de investigación autónoma optimizan y evalúan con el mismo conjunto de datos, lo que impide determinar si el resultado se generaliza. Para Signal Engine y recuperación multimodal agéntica, aplicamos una división estricta: un conjunto de entrenamiento con el que se puntúan los candidatos, uno de desarrollo para verificaciones básicas y uno de prueba reservado que el optimizador nunca ve. Cada resultado informado proviene de una versión específica del código, calificada en todas las particiones. Así, nunca combinamos la mejor puntuación de entrenamiento de un candidato con la mejor puntuación de prueba de otro.

Cómo funciona

En cada ronda, el arnés de ejecución genera un lote de hipótesis estructuradas para modificar el código. Cada hipótesis identifica el mecanismo que pretende cambiar, la versión anterior en la que se basa y el tipo de falla que busca corregir. Antes de gastar recursos en evaluaciones costosas, una etapa de clasificación filtra el lote. Las hipótesis que sobreviven pasan a agentes ejecutores en paralelo. Estos comparten una base de conocimientos, pero editan el código en espacios de trabajo totalmente aislados, de modo que cada candidato se califique de manera justa e independiente. Al final de la ronda, el ejecutor promueve a un ganador: el candidato con la puntuación más alta que también haya superado todas las verificaciones en las particiones visibles. Ese ganador se convierte en la base para la siguiente ronda. Cada prueba guarda un paquete fijo en un almacén de evidencia de solo anexado: su parche de código, las puntuaciones por partición, un registro de eventos y cuatro análisis breves redactados por un LLM sobre su traza, errores, costo y reflexión. El generador de propuestas de la siguiente ronda vuelve a consultar este historial. Así, el arnés de ejecución acumula lo aprendido en lugar de repetir los mismos intentos fallidos.

Diagrama del flujo de trabajo de Meta-Harness con entradas, evaluación inicial, búsqueda de hipótesis, equipos de agentes en paralelo, un espacio de trabajo de evaluación, resultados de revisión, un almacén de evidencia y controles de seguridad y costos.

Tres medidas de protección permiten ejecutar el ciclo de forma segura. Una política de alcance restringe qué archivos puede modificar un candidato y revierte cualquier cambio fuera de ese alcance. Los presupuestos de tokens y tiempo real detienen la ejecución cuando el gasto supera el límite, mientras que los límites de concurrencia mantienen el arnés de ejecución dentro de las cuotas de los modelos y las GPU. Además, el arnés de ejecución nunca implementa nada por sí solo. Genera un candidato clasificado y totalmente documentado; luego, un ingeniero revisa el diff y decide si se implementa en producción.

Cómo funciona internamente

En una infraestructura local, cinco elementos básicos de ingeniería sustentan cada ronda del ciclo anterior.

  • Aislamiento de espacios de trabajo. Un árbol de trabajo de git por candidato. Las bifurcaciones comparten una base de datos de objetos, pero nunca los archivos de las demás. Esto permite ejecutar candidatos en paralelo con un costo de disco casi constante y facilita la comparación del diff con la mejor versión actual.

  • Entorno aislado de ejecución. Dos modos configurables: un subproceso nativo para iterar con rapidez o un entorno de ejecución totalmente aislado. Los corpus se montan en modo de solo lectura y el directorio temporal de cada prueba se elimina después de calificarla. Por lo tanto, una prueba no puede modificar el conjunto de datos ni filtrar su estado a la siguiente.

  • Política de alcance. Una lista de rutas permitidas declarada en la configuración del experimento. Cualquier cambio fuera de esa lista se revierte antes de calificar la prueba, que además queda marcada. En consecuencia, se garantiza que el diff que ve el revisor se mantenga dentro del alcance declarado.

  • Control del presupuesto. Tres niveles: límites de tokens y tiempo real por prueba, un límite total por ejecución y un límite de concurrencia. En conjunto, mantienen predecible el gasto y garantizan que el arnés de ejecución respete las cuotas de los modelos y la infraestructura.

  • Almacén de evidencia. Un archivo JSONL de solo anexado con el parche de código, las puntuaciones por partición, el registro de eventos y los cuatro análisis redactados por un LLM. Las vistas materializadas —tabla de clasificación, mejor versión e índice de fallas— se regeneran después de cada prueba. Así, las rondas posteriores pueden aprovechar el historial y cada ejecución sigue siendo reproducible byte por byte.

Ninguno de estos elementos básicos es opcional. El objetivo del arnés de ejecución es que, al finalizar una ejecución, el revisor reciba algo que realmente pueda aprobar: un candidato ganador, un diff acotado, un registro completo de lo que se intentó y un costo conocido. Si se elimina cualquiera de los cinco, desaparece una de esas garantías.

Reclasificación predictiva de hipótesis

Los tres experimentos utilizan la misma estrategia de hipótesis. En cada iteración, el generador crea más hipótesis de las que permite ejecutar el presupuesto: M = 8 candidatos para un presupuesto de envío de K = 4. Luego, un LLM clasificador independiente ordena los 8 en una sola llamada de treinta segundos, con toda la información a la vista: la mejor puntuación actual y sus dimensiones débiles, los análisis de fallas de pruebas recientes y las 8 propuestas comparadas. Los 4 mejores pasan al ejecutor, con un costo de 15 a 30 minutos cada uno. Los otros 4 se descartan antes de que consuman recursos.

Evaluaciones

Los modelos subyacentes se mantuvieron sin cambios durante todo el proceso; el arnés de ejecución solo editó el código que los rodeaba. Signal Engine e investigación profunda se ejecutaron con gpt-5.5. La recuperación multimodal agéntica se ejecutó con Qwen3.6-35B-A3B, un modelo de pesos abiertos alojado localmente mediante vLLM, junto con el recuperador de imágenes ColQwen3-4B. Esta combinación se eligió por su costo local predecible.

La siguiente gráfica muestra cómo cambiaron las puntuaciones de nuestras tres tareas principales. “Versión inicial” es el código de partida escrito por un ingeniero. “Meta-Harness” es la mejor versión que encontró Meta-Harness. Observamos mejoras de rendimiento en las tres tareas dentro del conjunto de prueba reservado.

Gráfica de barras que compara el rendimiento inicial y el de Meta-Harness en Signal Engine, recuperación multimodal agéntica e investigación profunda; Meta-Harness obtiene mejores resultados en todas las pruebas reservadas.

Signal Engine fue evaluado por un LLM juez según la actualidad, la precisión factual, el nivel de detalle y el tono, con 150 tuits de entrenamiento y 150 tuits de prueba reservados. Durante la ejecución, la mejor versión elevó el resultado compuesto de entrenamiento de 0,431 a 0,756 y la puntuación reservada de 0,456 a 0,841. Las mejoras provinieron de cambios en el propio arnés de ejecución, no solo de ajustes al prompt: las iteraciones ganadoras aprendieron a filtrar el ruido de las redes sociales, agregaron pasos para verificar datos y exigieron que cada resultado se sustentara en evidencia explícita. El siguiente diagrama muestra el proceso de iteración.

Gráfica de líneas de las pruebas de entrenamiento de Signal Engine, donde las mejores puntuaciones acumuladas y reservadas mejoran desde la línea base inicial hacia el objetivo mediante intentos iterativos de exploración y perfeccionamiento.

El historial de pruebas muestra cómo se acumularon esas mejoras. Un cambio estructural temprano elevó el mejor resultado acumulado a 0,625; un manejo más detallado de la evidencia lo llevó a 0,679; y un ciclo perfeccionado de reflexión y criterios de evaluación lo aumentó a 0,819. Aproximadamente la mitad de las ejecuciones candidatas rindieron por debajo de lo esperado o fallaron por completo, pero no contaminaron la tabla de clasificación: cada bifurcación se ejecutó de forma aislada, los diffs perdedores se descartaron y las fallas se registraron en el almacén de reflexiones para evitar que el siguiente generador repitiera el mismo intento fallido.

Lo más importante es que la curva reservada aumentó junto con la de entrenamiento durante toda la ejecución. Esto indica que el arnés de ejecución mejoraba el flujo de trabajo en lugar de memorizar el corpus de entrenamiento. Las puntuaciones reservadas fueron ligeramente superiores a las de entrenamiento, lo que interpretamos como el ruido de muestreo habitual entre dos particiones pequeñas y separadas.

La recuperación multimodal agéntica se mide con NDCG@10 en la partición pública de informática de ViDoRe V3, organizada en 20 consultas de entrenamiento, 10 de desarrollo y 20 de prueba reservadas. El arnés de ejecución elevó el NDCG@10 reservado de 0,705 a 0,744 y redujo el tiempo real total de evaluación de 869 segundos a 54 segundos.

La investigación profunda se califica mediante un LLM juez con un resultado compuesto de calidad del contenido y de las referencias, de acuerdo con DeepResearch-Eval, en 10 preguntas de referencia. El código mejorado elevó el promedio de 0,449 a 0,802. Los cambios ganadores eran fáciles de identificar en el diff: una etapa inicial de planificación que compara enfoques antes de enviar agentes de investigación y una etapa final de revisión centrada en las dimensiones donde los informes habían obtenido puntuaciones bajas. Como este conjunto es pequeño y costoso de evaluar, no lo dividimos y consideramos que el resultado solo es válido dentro de la muestra.

Comparación con CORAL y karpathy/autoresearch

Gráficas de barras que comparan Meta-Harness, CORAL y karpathy/autoresearch según sus puntuaciones en Signal Engine, recuperación multimodal agéntica e investigación profunda, además de la latencia de evaluación.

Comparamos los tres métodos con el mismo presupuesto: los mismos conjuntos de datos, modelos subyacentes, límite de iteraciones y número total de evaluaciones de candidatos. En Signal Engine, Meta-Harness alcanza 0,841 en la prueba reservada, mientras que ambas líneas base se mantuvieron por debajo de 0,50. En recuperación multimodal agéntica, nuestro equipo logra el NDCG@10 reservado más alto (0,744, frente a 0,700 de CORAL y 0,738 de karpathy) y ejecuta la evaluación oficial entre doce y catorce veces más rápido: 54 s frente a 786 s y 650 s. En investigación profunda, nuestro equipo alcanza 0,802, mientras que ambas líneas base se mantuvieron cerca de 0,52. Hay una salvedad general: volvimos a implementar CORAL y karpathy/autoresearch a partir de sus descripciones publicadas, por lo que parte de la diferencia podría deberse a las implementaciones y no solo a los métodos.

Cuatro decisiones de diseño explican la diferencia. Primero, nuestro equipo genera una especificación de diseño estructurada antes de editar el código, lo que favorece cambios estructurales, como nuevas etapas del proceso, en vez de simples ajustes al prompt. Segundo, ejecuta bifurcaciones simultáneas basadas en un candidato común de referencia, por lo que las mejoras se acumulan más rápido que con los agentes independientes de CORAL o el ciclo estrictamente secuencial de karpathy. Tercero, cada prueba deja artefactos estructurados —puntuaciones, registros de eventos y cuatro análisis redactados por un LLM— que consulta el siguiente generador de propuestas, mientras que las líneas base solo conservan registros simples de los intentos. Cuarto, un controlador adaptable orienta al generador hacia la exploración tras un estancamiento y hacia el perfeccionamiento después de un éxito. Además, la reclasificación predictiva de hipótesis descarta las ideas débiles antes de que consuman presupuesto.

Lo que no hemos demostrado

Las curvas reservadas demuestran generalización dentro del dominio, no transferencia entre dominios: no cabe esperar que un flujo optimizado para extraer señales del mercado de la IA funcione igual con textos jurídicos o biomédicos sin volver a ejecutar el arnés de ejecución. El arnés de ejecución solo avanza hacia el objetivo definido por el evaluador, por lo que se sobreajustará fielmente a un conjunto de entrenamiento ruidoso o a un juez mal calibrado. Recomendamos al menos 20 elementos de entrenamiento bien seleccionados y una partición de desarrollo independiente antes de una ejecución importante. El costo es la mayor limitación práctica. Cada evaluación vuelve a ejecutar todo el proceso con todas las particiones; solo el candidato de recuperación seleccionado consumió aproximadamente 2,2 millones de tokens de entrada, y una optimización seria con un modelo de la clase gpt-5.5 cuesta entre cientos y pocos miles de dólares por tarea. Por último, estas cifras provienen de ejecuciones únicas y no de pruebas repetidas. Por eso las compartimos en una publicación de ingeniería y no en un estudio formal.

Conclusión

Meta-Harness demuestra que la mejora autónoma del código puede realizarse con suficiente rigor para el uso empresarial. Los elementos clave son hipótesis estructurales, un filtrado predictivo previo, evaluaciones aisladas, pruebas reservadas siempre que los datos lo permitan y un registro de auditoría completo para cada cambio promovido. En conjunto, ofrecen al equipo de ingeniería una vía predecible para pasar de un proceso inicial funcional a otro considerablemente mejor. También brindan al responsable de operaciones un modelo sencillo: aprovechar las ventajas de la exploración autónoma dentro de un marco estricto y consciente del presupuesto, con una persona que revise todo antes de implementar cualquier cambio.

Autores

David Huang y Bjorn Jee