Meta-Harness:更安全、自我改進的企業 AI 工作流程

嚴謹的元任務執行框架可協助企業團隊,在長時間跨度的編碼任務中安全改進智能代理工作流程。

摘要

  • 現有的自主改進系統已在編碼任務上展現出色成效,但它們能否改進類似真實企業部署的複雜長時間跨度 AI 工作流程,仍未有定論。

  • 我們的 Meta-Harness 研究將自主式自我改進應用於智能代理式檢索、深度研究和訊號分析工作流程,並加入留出評估、可審計性、預算控制及人工審批等企業要求。

  • 在三項代表性工作負載中,Meta-Harness 均顯著提升表現,包括令 Signal Engine 的留出測試表現提升 84%,以及讓智能代理式多模態檢索在準確度提高之餘,執行速度加快 16 倍

  • Meta-Harness 有別於大部分以往方法:只要條件許可,便會使用留出資料集衡量成效,以評估改進能否泛化至最佳化所用資料以外。

  • 結果顯示,自主改進工作流程可從編碼評測基準延伸至真實企業 AI 系統,為持續改進 AI 應用程式提供切實可行的途徑。

近期的自主 AI 研究,包括 Meta-Harness 論文、CORAL 框架及 karpathy/autoresearch,均顯示編碼智能代理可按既定評估指標反覆改進解決方案。仍待解答的是,這些方法能否應用於長時間跨度 AI 工作流程,例如智能代理式多模態檢索:智能代理須反覆搜尋多模態領域語料庫以回答問題;或需要多個相互依賴步驟、工具調用及例外處理決策的複雜資料處理管道。更深層的問題是:面對最佳化器從未看過的資料,這些增益能否維持。

我們的 Meta-Harness 研發工作正是對這個問題的回應。它汲取近期研究的概念,再按企業需要重新設計,包括留出評估、審計追蹤、成本上限,並在任何變更投入生產環境前,設定明確交由人類審查者接手的環節。

我們以三項仿照真實客戶工作的長時間跨度任務進行測試。Signal Engine 監察 X 上有關 AI 市場的即時貼文串流,並產生資料來源充分、結構清晰的趨勢報告。智能代理式多模態檢索會分析混合文字與圖像的查詢,傳回最相關的文件頁面。深度研究會協調多個智能代理搜尋網頁、交叉核對資料來源,並撰寫長篇研究報告。

結果概覽

  • Signal Engine:留出測試綜合分數由 0.456 → 0.841,相對升幅為 84%。在相同預算下,CORAL 和 karpathy/autoresearch 均低於 0.50。

  • 智能代理式多模態檢索:留出 NDCG@10 由 0.705 → 0.744,每次評估的實際運行時間則由 869 秒降至 54 秒。即準確度更高,速度亦提升 16 倍。

  • 深度研究:在 10 條參考問題中,報告質素綜合分數由 0.449 → 0.802,基準方法則約為 0.52。這項任務沒有留出資料分割,因此我們只將此數字視為樣本內結果。

  • 搜尋效率:採用預測式假設重新排名後,在相同評估預算下,Signal Engine 只需 3 次而非 20 次迭代,便達到參考執行所得最佳分數的 91%

大部分自主研究系統均使用同一資料集進行最佳化和評估,因此無法判斷結果是否具泛化能力。對於 Signal Engine 和智能代理式多模態檢索,我們嚴格劃分資料:訓練集供候選版本評分、開發集用於合理性檢查,而留出測試集則不會向最佳化器開放。每項報告結果都來自同一個在所有資料分割上評分的特定程式碼版本,因此絕不會把某候選版本的最佳訓練分數與另一版本的最佳測試分數混合使用。

運作方式

每一輪,任務執行框架都會產生一批結構化假設,用於修改程式碼。每項假設都會列明要改變的機制、所依據的先前版本,以及要處理的失效模式。在投入任何高成本評估前,系統會先透過排名步驟篩選這批假設。通過篩選的假設會交給多個並行運作的智能代理。它們共用同一知識庫,但會在完全隔離的工作區內編輯程式碼,讓每個候選版本都能獲得公平且獨立的評分。每輪結束時,執行器會選出一個勝出版本:在可見資料分割的所有檢查中均合格,且得分最高的候選版本。該勝出版本會成為下一輪改進所依據的前沿版本。每次試驗都會將一組固定資料寫入僅可附加的證據儲存庫,包括程式碼修補、各資料分割的分數、事件記錄,以及由 LLM 撰寫、涵蓋執行軌跡、錯誤、成本與反思的四篇短分析。下一輪的提案器會讀取這些歷史記錄,讓任務執行框架累積運用所學,而非重蹈相同的覆轍。

Meta-Harness 工作流程圖,展示輸入、種子評估、假設搜尋、並行智能代理團隊、評估工作區、審查輸出內容、證據儲存庫,以及安全與成本控制。

三項防護措施確保循環能安全運行。範圍政策會限制候選版本可改動的檔案,並還原範圍外的任何變更。Token 和實際運行時間預算會在開支超出上限時停止執行,而並行數量限制則確保任務執行框架不超出模型與 GPU 的速率限制。而且,任務執行框架絕不會自行將任何變更投入生產環境。它只會產生經排名且附有完整記錄的候選版本,再由人類工程師審查程式碼差異,決定是否投入生產環境。

底層機制

在本地技術堆疊中,上述循環的每一輪均建基於五項工程基本構件。

  • 工作區隔離。每個候選版本均有一個 git worktree。各分支複製版本共用物件資料庫,但絕不共用彼此的檔案,因此候選版本能以近乎固定的磁碟空間開銷並行運行,也可輕易與目前的前沿版本比較程式碼差異。

  • 執行沙箱。可透過設定採用雙模式:以原生子程序快速反覆改進,或使用完全隔離的執行環境。語料庫以唯讀方式掛載,每次試驗的暫存目錄則會在評分後捨棄。因此,試驗無法改動資料集,也不會將狀態洩漏至下一次試驗。

  • 範圍政策。在實驗設定中聲明路徑允許清單。試驗評分前,系統會還原清單範圍外的任何變更,並標記該次試驗。因此,審查者看到的程式碼差異保證只會涉及已聲明的範圍。

  • 預算管控。共有三層:每次試驗的 Token 與實際運行時間上限、每次執行的總上限,以及並行數量限制。三者共同確保開支可預測,並讓任務執行框架維持在模型及基礎設施的速率限制內。

  • 證據儲存庫。只允許附加寫入的 JSONL 記錄,記錄程式碼修補、各資料分割的分數、事件記錄,以及由 LLM 撰寫的四篇分析。每次試驗後都會重新產生實體化檢視(排行榜、前沿版本、失敗索引),讓後續各輪能利用過往記錄改進,同時確保每次執行均可逐位元組重現。

這些基礎機制缺一不可。任務執行框架的目的,是在執行結束時為審查者提供真正可批准的成果:勝出的候選版本、範圍受限的程式碼差異、所有嘗試的完整記錄,以及明確的成本。移除五項機制中的任何一項,便會失去其中一項保證。

預測式假設重新排名

三項實驗均採用相同的假設策略。每次迭代中,提案器產生的假設數量都會超出預算可執行的上限:在 K = 4 的執行名額下產生 M = 8 個候選版本。另一個 LLM 排名器隨後會透過單次需時 30 秒的調用,掌握全貌並一次過排列全部 8 個候選版本:目前最佳版本的分數,以及得分較低的評估維度、近期試驗的失敗分析,以及並列的 8 項提案。排名最高的 4 項會交由執行器處理,每項需時 15 至 30 分鐘。其餘 4 項在產生任何開支前便會捨棄。

評估

底層模型全程保持不變;任務執行框架只會編輯模型周邊的程式碼。Signal Engine 和深度研究在 gpt-5.5 上運行。智能代理式多模態檢索使用開放權重的 Qwen3.6-35B-A3B,透過 vLLM 在本地提供推理服務,並配合 ColQwen3-4B 圖像檢索器;選用此組合是為了確保內部部署成本可預測。

下圖顯示三項主要任務的分數變化。「種子版本」是由人類工程師編寫的起始程式碼。「Meta-Harness」是 Meta-Harness 找到的最佳版本。三項任務在留出測試集上的表現均有所提升。

柱形圖比較種子版本與 Meta-Harness 在 Signal Engine、智能代理式多模態檢索和深度研究方面的表現;Meta-Harness 在所有留出測試中均較優。

Signal Engine 使用 150 則訓練貼文和 150 則留出測試貼文,由 LLM 評審從時效性、事實準確度、細緻程度及語調方面進行評估。整次執行期間,最佳版本的訓練綜合分數由 0.431 升至 0.756,留出分數則由 0.456 升至 0.841。這些增益來自任務執行框架本身的變更,而不只是提示詞微調:勝出的迭代學會過濾社交媒體中的無關資訊、加入事實交叉核對步驟,並要求每項輸出都以明確證據為依據。下圖顯示迭代過程。

Signal Engine 訓練試驗折線圖,顯示在探索器和改良器反覆嘗試的過程中,當時最佳分數和留出分數由種子基準逐步提升並趨近目標。

試驗記錄顯示這些增益如何逐步累積。早期的一項結構變更令當時的最佳分數升至 0.625;更細緻的證據處理將其推高至 0.679;經改良的反思與評分準則循環再將分數提升至 0.819。約半數候選版本的執行表現欠佳或徹底失敗,但未有影響排行榜:每個分支複製版本均獨立運行,未獲選版本的程式碼差異會被捨棄,而失敗記錄則寫入反思儲存庫,避免下一個提案器重蹈覆轍。

最重要的是,留出曲線在整次執行期間與訓練曲線同步上升。這顯示任務執行框架是在改進工作流程,而非記憶訓練語料庫。留出分數略高於訓練分數;我們認為這只是兩個規模較小且互不重疊的資料分割之間出現的一般抽樣波動。

智能代理式多模態檢索以公開 ViDoRe V3 Computer Science 資料分割的 NDCG@10 衡量,並整理為 20 項訓練查詢、10 項開發查詢和 20 項留出測試查詢。任務執行框架將留出 NDCG@10 由 0.705 提升至 0.744,同時把整體評估的實際運行時間由 869 秒縮短至 54 秒

深度研究依照 DeepResearch-Eval,由 LLM 針對 10 條參考問題,按內容質素與參考資料質素的綜合指標評分。改進後的程式碼令平均分由 0.449 升至 0.802。從差異中可清楚看出勝出版本的變更:在派送任何研究智能代理前,先加入比較各種方法的前期規劃步驟;最後再加入審查步驟,針對報告以往得分較低的範疇作出改善。由於這個資料集規模較小且評估成本高昂,我們未有將其分割,並把結果視為樣本內結果。

與 CORAL 及 karpathy/autoresearch 比較

柱形圖比較 Meta-Harness、CORAL 與 karpathy/autoresearch 在 Signal Engine、智能代理式多模態檢索和深度研究方面的分數及評估延遲。

我們在相同預算下對三種方法進行基準測試:採用相同資料集、相同底層模型、相同迭代上限,以及相同的候選版本評估總數。在 Signal Engine 上,Meta-Harness 的留出測試分數達 0.841,兩項基準方法則均低於 0.50。在智能代理式多模態檢索上,我們團隊的留出 NDCG@10 最高(0.744,CORAL 為 0.700,karpathy 為 0.738),而官方評估的執行速度快 12 至 14 倍:54 秒,對比兩者的 786 秒及 650 秒。在深度研究上,我們團隊的分數達 0.802,兩項基準方法則均維持在 0.52 左右。不過,所有比較均有一項限制:我們按照已發佈的說明重新實現 CORAL 和 karpathy/autoresearch,因此部分差距可能源於實現方式的差異,而不只是方法本身的差異。

這項差距可歸因於四項設計選擇。第一,我們的團隊會在編輯任何程式碼前產生結構化設計規格,因而更傾向採用新增管道階段等結構變更,而非微調提示詞。第二,系統會以共用的前沿候選版本為基礎,同時執行多個分支複製版本,因此改進的累積速度快於 CORAL 的獨立智能代理或 karpathy 的嚴格循序循環。第三,每次試驗都會留下結構化記錄,包括分數、事件記錄及四篇由 LLM 撰寫的分析,供下一個提案器讀取;基準方法則只保留未經結構化的嘗試記錄。第四,自適應控制器會在進度停滯後引導提案器探索,並在取得成果後轉向改良;最上層的預測式假設重新排名機制,會在成效可能較低的構想耗用預算前將其剔除。

尚未證明的事項

留出曲線證明的是領域內泛化,而非跨領域遷移:針對 AI 市場訊號擷取調校的工作流程,不應預期在法律或生物醫學文本上仍然有效,除非重新運行任務執行框架。任務執行框架亦只會朝評分器所界定的目標改進,因此若訓練集含有大量噪音或評審校準不當,系統便會忠實地過度擬合這些偏差;我們建議正式執行前,準備至少 20 個經妥善整理的訓練樣本,以及獨立的開發資料分割。成本是最大的實際限制。每次評估都會針對完整資料分割重新執行整條管道;僅獲選的檢索候選版本便耗用約 220 萬個輸入 Token,而在 gpt-5.5 級別模型上進行一次正式最佳化,每項任務的成本由數百美元至數千美元低位不等。最後,這些數字來自單次執行,而非重複試驗;因此我們以工程網誌文章而非正式研究的形式分享結果。

總結

Meta-Harness 顯示,自主式程式碼改進可以嚴謹得足以用於企業環境。關鍵要素包括結構化假設、預測式預先篩選、隔離評估、資料許可時進行留出測試,以及為每項獲採用的變更保留完整審計追蹤。這些要素共同為工程團隊提供可預測的路徑,讓可運作的初始管道演變成成效可量度、表現更佳的版本;亦為營運負責人提供簡單清晰的模式:在嚴格且顧及預算的框架內發揮自主探索的潛在優勢,並確保任何變更投入生產環境前,均由人員參與審批。

作者

David Huang及Bjorn Jee