Meta-Harness:更安全的企业 AI 工作流自我改进方案

严谨的元执行框架可帮助企业团队在长周期编码任务中安全改进智能体工作流。

执行摘要

  • 现有自主改进系统已在编码任务上展现出优异成果,但它们能否改进类似真实企业部署的复杂长周期 AI 工作流,仍不明确。

  • 我们的 Meta-Harness 研究将自主自我改进应用于智能体检索、深度研究和信号情报工作流,同时加入留出评估、可审计性、预算控制和人工审批等企业要求。

  • 在三种代表性工作负载中,Meta-Harness 均显著提升了性能:Signal Engine 的留出测试性能提高了 84%;智能体多模态检索则在准确率更高的同时,实现了快 16 倍的执行速度

  • 与以往大多数方法不同,Meta-Harness 会尽可能使用留出数据集衡量成效,以评估改进能否泛化到优化期间所用数据之外。

  • 这些结果表明,自主工作流改进可以从编码基准扩展到真实的企业 AI 系统,为持续改进 AI 应用提供一条切实可行的路径。

近期的自主 AI 研究,包括 Meta-Harness 论文、CORAL 框架和 karpathy/autoresearch,表明编码智能体可以根据评估指标迭代改进解决方案。尚待解答的问题是,这些方法能否应用于长周期 AI 工作流。例如,在智能体多模态检索中,智能体必须通过反复搜索多模态领域语料库来回答问题;复杂的数据处理流水线则需要完成许多相互依赖的步骤、工具调用和异常处理决策。更深层的问题是,这些提升能否在优化器从未见过的数据上保持。

我们的 Meta-Harness 研发项目正是对此问题的回答。它吸收了近期研究的思路,并围绕企业需求重新设计:留出评估、审计跟踪、成本上限,以及在任何内容发布前清晰移交给人工审查者。

我们在三项参照真实客户项目设计的长周期任务上进行了测试。Signal Engine 监控 X 上有关 AI 市场的实时帖子流,并生成来源充分、结构清晰的趋势报告。智能体多模态检索对混合文本和图像查询进行推理,返回最相关的文档页面。深度研究协调多个智能体搜索网络、交叉核查来源并撰写长篇研究报告。

结果概览

  • Signal Engine:留出测试综合得分从 0.456 升至 0.841,相对提升 84%。在相同预算下,CORAL 和 karpathy/autoresearch 的得分均低于 0.50。

  • 智能体多模态检索:留出测试的 NDCG@10 从 0.705 升至 0.744,单次评估的实际运行时间从 869 秒降至 54 秒。这意味着准确率更高,同时速度提升了 16 倍。

  • 深度研究:在 10 个参考问题上,报告质量综合得分从 0.449 升至 0.802,而基线约为 0.52。该任务没有留出数据划分,因此我们仅将这一结果视为样本内表现。

  • 搜索效率:借助预测式假设重排序,Signal Engine 在相同评估预算下,仅迭代 3 次便达到参考运行最佳得分的 91%,而非 20 次

大多数自主研究系统都在同一数据集上进行优化和评估,因此无法判断结果是否具备泛化能力。对于 Signal Engine 和智能体多模态检索,我们严格划分数据:候选方案可据以评分的训练集、用于合理性检查的开发集,以及优化器从未见过的留出测试集。每项报告结果都来自同一个特定代码版本在所有数据划分上的得分,因此绝不会把一个候选方案的最佳训练得分与另一个候选方案的最佳测试得分混在一起。

工作原理

每一轮中,执行框架都会生成一批结构化假设,用于修改代码。每个假设都会明确要更改的机制、作为基础的先前版本,以及所针对的故障模式。在投入昂贵的评估资源前,系统会先通过排序步骤筛选这批假设。筛选出的假设会交给并行工作智能体。它们共享同一个知识库,但在完全隔离的工作空间中编辑代码,因此每个候选方案都能得到公平、独立的评分。每轮结束时,运行器会选出一个胜者:在可见数据划分上通过全部检查且得分最高的候选方案。该胜者会成为下一轮继续推进的前沿版本。每次试验都会向仅追加的证据存储写入一组固定内容:代码补丁、各数据划分的得分、事件日志,以及由 LLM 编写的四篇简短分析,分别涵盖执行轨迹、错误、成本和反思。下一轮的提案器会回读这些历史记录,让执行框架能够积累已有经验,而不是重复尝试相同的死路。

Meta-Harness 工作流图,展示输入、初始评估、假设搜索、并行智能体团队、评估工作空间、审查输出、证据存储,以及安全和成本控制。

三项防护措施确保该循环可以安全运行。范围策略会限制候选方案可修改的文件,并还原范围外的所有更改。一旦开销超过上限,Token 和实际运行时间预算就会停止运行;并发限制则确保执行框架不会超出模型和 GPU 的速率限制。此外,执行框架绝不会自行发布任何内容。它会生成经过排序、文档完备的候选方案,再由人工工程师审查差异并决定是否投入生产。

底层机制

在本地技术栈中,上述循环的每一轮都以五项工程基础机制为支撑。

  • 工作空间隔离。每个候选方案使用一个 git worktree。各派生版本共享对象数据库,但绝不共享彼此的文件,因此候选方案可以并行运行,磁盘成本几乎不变,而且能轻松与当前前沿版本进行差异比较。

  • 执行沙箱。通过配置提供双模式:使用原生子进程快速迭代,或使用完全隔离的运行时。语料库以只读方式挂载,每次试验的暂存目录会在评分后丢弃。因此,试验无法篡改数据集,也不会将状态泄漏到下一次试验中。

  • 范围策略。在实验配置中声明路径允许列表。系统会在试验评分前还原对列表外内容的所有修改,并标记该试验。因此,可以保证审查者看到的差异始终处于声明的范围内。

  • 预算执行。共分三层:单次试验的 Token 和实际运行时间上限、单次运行的总上限,以及并发限制。这些限制共同确保开销可预测,并使执行框架始终遵守模型和基础设施的速率限制。

  • 证据存储。一种仅追加的 JSONL,其中包含代码补丁、各数据划分的得分、事件日志和四篇由 LLM 编写的分析。每次试验后都会重新生成物化视图(排行榜、前沿版本、失败索引),让后续轮次能够利用既往历史,同时确保每次运行都能逐字节复现。

这五项基础机制缺一不可。执行框架的目的,是在运行结束时为审查者提供真正可以批准的成果:胜出的候选方案、范围受限的差异、所有尝试的完整记录,以及明确的成本。移除其中任何一项,就会失去一项保证。

预测式假设重排序

三项实验均采用相同的假设策略。每次迭代时,提案器生成的假设数量都会超过预算可执行的数量:在 K = 4 的派发预算下生成 M = 8 个候选方案。随后,一个独立的 LLM 排序器只需调用一次、耗时 30 秒,即可对全部 8 个方案排序;它会同时掌握完整信息:当前最佳得分及其薄弱维度、近期试验的失败分析,以及并列呈现的全部 8 项提案。排名前 4 的方案会交给执行器,每个方案耗时 15 至 30 分钟。其余 4 个方案会在产生任何开销前被舍弃。

评估

底层模型全程保持不变;执行框架只编辑模型周围的代码。Signal Engine 和深度研究在 gpt-5.5 上运行。智能体多模态检索使用通过 vLLM 在本地部署的开放权重模型 Qwen3.6-35B-A3B,并搭配 ColQwen3-4B 图像检索器;选择这一组合是为了让本地部署成本可预测。

下图展示了三项主要任务的得分变化。"初始版本"是由人工工程师编写的起始代码。"Meta-Harness"是 Meta-Harness 找到的最佳版本。在留出测试集中,三项任务的性能均有所提升。

柱状图比较初始版本与 Meta-Harness 在 Signal Engine、智能体多模态检索和深度研究方面的表现;Meta-Harness 在所有留出测试中均更出色。

Signal Engine 使用 150 条训练推文和 150 条留出测试推文,由 LLM 评审从时效性、事实性、粒度和语气四个方面进行评估。在整个运行过程中,最佳版本的训练综合得分从 0.431 升至 0.756,留出得分从 0.456 升至 0.841。这些提升源于执行框架本身的改动,而不仅是提示调整:胜出的迭代学会了过滤社交媒体噪声、增加事实交叉核查步骤,并要求每项输出均以明确证据为依据。下图展示了迭代过程。

Signal Engine 训练试验折线图,展示在探索器和优化器反复尝试的过程中,当前最佳得分和留出得分如何从初始基线逐步向目标提升。

试验历史记录展示了这些提升如何逐步累积。早期的一项结构调整将当时的最佳得分提高到 0.625;更精细的证据处理将其推升至 0.679;改进后的反思与评分标准循环又将其提高到 0.819。约一半的候选方案运行表现不佳或彻底失败,但它们并未污染排行榜:每个派生版本都隔离运行,落选的差异会被丢弃,失败记录则写入反思存储,避免下一轮提案器重蹈覆辙。

最重要的是,在整个运行过程中,留出曲线与训练曲线同步上升。这表明执行框架是在改进工作流,而不是记忆训练语料库。留出得分略高于训练得分,我们认为这是两个规模较小且互不重叠的数据划分之间的正常抽样噪声。

智能体多模态检索采用公开的 ViDoRe V3 Computer Science 数据划分,并以 NDCG@10 衡量;该数据经整理后包含 20 个训练查询、10 个开发查询和 20 个留出测试查询。执行框架将留出测试的 NDCG@10 从 0.705 提高到 0.744,同时把评估的总实际运行时间从 869 秒缩短至 54 秒

深度研究按照 DeepResearch-Eval 的方法,由 LLM 对 10 个参考问题的实质内容质量和参考资料质量进行综合评分。改进后的代码将平均得分从 0.449 提高到 0.802。从差异中可以清楚看出胜出的改动:派发任何研究智能体前,先增加规划步骤以比较不同方法;最后再增加审查步骤,专门改善报告以往得分较低的维度。由于该数据集规模较小且评估成本高,我们没有进行数据划分,并将这一结果视为样本内表现。

与 CORAL 和 karpathy/autoresearch 的比较

柱状图比较 Meta-Harness、CORAL 和 karpathy/autoresearch 在 Signal Engine、智能体多模态检索和深度研究方面的得分及评估延迟。

我们在相同预算下对三种方法进行了基准测试:使用相同的数据集、底层模型、迭代上限和候选方案评估总次数。在 Signal Engine 上,Meta-Harness 的留出测试得分达到 0.841,而两种基线均低于 0.50。在智能体多模态检索上,我们的方法取得最高的留出 NDCG@10(0.744,CORAL 为 0.700,karpathy 为 0.738),且正式评估速度快 12 至 14 倍:用时 54 秒,而两者分别为 786 秒和 650 秒。在深度研究上,我们的方法达到 0.802,而两种基线均维持在 0.52 左右。需要始终注意一点:我们依据已发布的说明重新实现了 CORAL 和 karpathy/autoresearch,因此部分差距可能源于实现方式不同,而不完全是方法本身的差异。

四项设计选择造成了这一差距。第一,我们的方法在编辑任何代码前都会生成结构化设计规范,从而更倾向于新增流水线阶段等结构性改动,而非调整提示。第二,它以共享的前沿候选方案为基础并发运行多个派生版本,因此改进的累积速度快于 CORAL 的独立智能体或 karpathy 的严格串行循环。第三,每次试验都会留下结构化产物(得分、事件日志和四篇由 LLM 编写的分析),供下一轮提案器回读;基线方法则只保留扁平的尝试日志。第四,自适应控制器会在停滞后引导提案器加强探索,在取得成果后转向优化;上层的预测式假设重排序则会在薄弱构想消耗预算前将其剔除。

我们尚未证明的方面

留出曲线证明的是领域内泛化,而非跨领域迁移:针对 AI 市场信号提取优化的工作流,如果不重新运行执行框架,就不应期待它在法律或生物医学文本上仍能保持效果。执行框架也只会沿着评分器定义的方向优化,因此如果训练集噪声过多或评审校准不当,系统就会忠实地过拟合;在开展正式运行前,我们建议至少准备 20 个精心整理的训练项目和一个单独的开发数据划分。成本是最大的现实限制。每次评估都会针对完整的数据划分重新运行整条流水线;仅最终选中的检索候选方案就消耗了约 220 万个输入 Token;在 gpt-5.5 级模型上进行一次正式优化,每项任务的成本可达数百至一千多美元。最后,这些数字来自单次运行,而非重复试验,因此我们以工程博客文章而不是正式研究的形式分享这些结果。

结论

Meta-Harness 表明,自主代码改进可以做到足够严谨,适用于企业环境。其关键要素包括结构化假设、预测式预筛选、隔离评估、在数据条件允许时进行留出测试,以及为每项获选更改保留完整的审计跟踪。这些要素共同为工程团队提供一条可预测的路径,使其能够从可用的初始流水线稳步改进为效果可衡量的更优版本;同时也为运营负责人提供一个简单模式:在任何内容发布前保留人工把关,并将自主探索的收益约束在严格且考虑预算的框架内。

作者

David Huang、Bjorn Jee