現有的自主改進系統已在程式設計任務上展現出色成果,但這些系統能否改進類似實際企業部署的複雜長時程 AI 工作流程,仍不明朗。
我們的 Meta-Harness 研究將自主自我改進應用於智慧體式檢索、深度研究和訊號情報工作流程,並納入保留評估、可稽核性、預算控制及人類核准等企業需求。
在三項代表性工作負載中,Meta-Harness 大幅提升了效能,包括讓 Signal Engine 的保留測試表現提高 84%,也讓智慧體式多模態檢索達到更高準確率,且執行速度加快 16 倍。
不同於多數先前方法,Meta-Harness 會盡可能以保留資料集衡量成效,藉此評估改進能否泛化至最佳化期間使用的資料以外。
這些結果顯示,自主工作流程改進不僅適用於程式設計基準,也能延伸至真實的企業 AI 系統,為持續改進 AI 應用程式提供一條實用途徑。
近期的自主 AI 研究,包括 Meta-Harness 論文、CORAL 框架與 karpathy/autoresearch,已證明程式設計智慧體能根據評估指標,透過多輪迭代改進解決方案。尚待釐清的是,這些方法能否用於長時程 AI 工作流程,例如智慧體式多模態檢索。在這類工作流程中,智慧體必須反覆搜尋多模態領域語料庫來回答問題;另一類例子則是需要許多相依步驟、工具呼叫與例外處理決策的複雜資料處理管線。更重要的問題是,這些成效能否在最佳化器從未看過的資料上維持。
我們的 Meta-Harness 研發成果,正是對此問題的回答。它汲取近期研究的構想,再依企業需求重新設計,包括保留評估、稽核軌跡、成本上限,以及在發布任何內容前明確交由人類審查者接手。
我們以三項模擬實際客戶工作的長時程任務進行測試。Signal Engine 會監控 X 上有關 AI 市場的即時貼文串流,並產生資料來源齊全、結構清晰的趨勢報告。智慧體式多模態檢索會針對圖文混合查詢進行推理,找出最相關的文件頁面。深度研究會協調多個智慧體搜尋網路、交叉核對來源,並撰寫長篇研究報告。
Signal Engine:保留測試綜合分數從 0.456 → 0.841,相對提升 84%。在相同預算下,CORAL 與 karpathy/autoresearch 均低於 0.50。
智慧體式多模態檢索:保留資料的 NDCG@10 從 0.705 → 0.744,每次評估的實際執行時間則從 869 秒降至 54 秒。這代表準確率提高的同時,速度也提升了 16 倍。
深度研究:在 10 個參考問題上的報告品質綜合分數從 0.449 → 0.802,基準方法則約為 0.52。此任務沒有保留資料分割,因此我們僅將這項數據視為樣本內結果。
搜尋效率:採用預測式假設重新排序後,在相同評估預算下,Signal Engine 只需迭代 3 次,而非 20 次,就達到參考作業最佳分數的 91%。
多數自主研究系統會在同一資料集上進行最佳化和評估,因此無法判斷結果能否泛化。對於 Signal Engine 與智慧體式多模態檢索,我們採取嚴格的資料分割:候選版本可據以評分的訓練集、用於合理性檢查的開發集,以及最佳化器從未看過的保留測試集。每項回報結果都來自同一個特定程式碼版本,並在所有資料分割上評分,因此絕不會把某個候選版本的最佳訓練分數與另一個版本的最佳測試分數混用。
每一輪中,任務執行框架都會產生一批修改程式碼的結構化假設。每項假設都會指出要變更的機制、所依據的先前版本,以及要處理的失敗模式。在投入高成本的評估前,系統會先排序並篩選這批假設。通過篩選的假設會交給平行運作的執行智慧體。這些智慧體共用知識庫,但會在完全隔離的工作區中編輯程式碼,讓每個候選版本都能獲得公平且獨立的評分。每輪結束時,執行器會選出一個勝出版本,也就是通過可見資料分割所有檢查且得分最高的候選版本。勝出版本會成為下一輪據以改進的前沿候選版本。每次試驗都會將一組固定資料寫入僅限附加的證據儲存庫,包括程式碼修補、各資料分割的分數、事件記錄,以及由 LLM 撰寫、分別涵蓋執行軌跡、錯誤、成本與反思的四份簡短分析。下一輪的提案器會讀取這些歷史資料,讓任務執行框架累積運用所學,不再重複嘗試已證實行不通的方法。


三道防護機制可確保迴圈安全執行。範圍政策會限制候選版本可修改的檔案,並還原範圍外的所有變更。一旦支出超過上限,Token 與實際執行時間預算就會停止作業,並行限制則確保任務執行框架不超出模型與 GPU 的速率限制。任務執行框架本身絕不會將任何候選版本投入正式環境,只會產生經過排序且文件齊全的候選版本,再由人類工程師審查差異,決定是否部署至正式環境。
在本機技術堆疊中,上述每一輪迴圈都由五項工程基礎機制支撐。
工作區隔離。每個候選版本各有一個 git worktree。各分支共用物件資料庫,但彼此絕不共用檔案,因此候選版本可平行執行,磁碟成本幾乎維持不變,也能輕鬆與目前的前沿候選版本比較變更。
執行沙箱。可透過設定選擇兩種模式,使用原生子程序快速迭代,或採用完全隔離的執行環境。語料庫以唯讀方式掛載,每次試驗的暫存目錄則會在評分後捨棄。因此,試驗無法修改資料集,也不會將狀態洩漏到下一次試驗。
範圍政策。這是實驗設定中宣告的路徑允許清單。系統會在試驗評分前還原清單外的所有變更,並標記這次試驗。因此,審查者看到的差異保證只會落在宣告的範圍內。
預算控管。共分三層:單次試驗的 Token 與實際執行時間上限、單次作業的總上限,以及並行數量限制。三者共同確保支出可預測,並讓任務執行框架維持在模型與基礎架構的速率限制內。
證據儲存庫。這是一份僅限附加的 JSONL,包含程式碼修補、各資料分割的分數、事件記錄,以及四份由 LLM 撰寫的分析。實體化檢視表(排行榜、前沿候選版本、失敗索引)會在每次試驗後重新產生,讓後續輪次沿用先前的歷史資料,同時確保每次執行都能逐位元組重現。
這些基礎機制缺一不可。任務執行框架的目的,是在作業結束時為審查者留下真正可以核准的成果:一個勝出候選版本、範圍受限的差異、所有嘗試的完整記錄,以及明確的成本。移除其中任何一項,就會失去一項保證。
三項實驗均採用相同的假設策略。每輪迭代中,提案器產生的假設數量都會超過預算可執行的數量,會產生 M = 8 個候選版本,分派預算則為 K = 4。接著,獨立的 LLM 排序器會透過一次 30 秒的呼叫,將 8 個候選版本排出順序。排序器會同時掌握目前的最佳分數及弱項、近期試驗的失敗分析,以及並列呈現的 8 項提案。排名前 4 的提案會交給執行器,每項需時 15 至 30 分鐘;其餘 4 項則會在產生任何成本前淘汰。
底層模型全程保持不變;任務執行框架只會編輯模型周邊的程式碼。Signal Engine 與深度研究使用 gpt-5.5 執行。智慧體式多模態檢索採用在本機透過 vLLM 提供服務的開放權重 Qwen3.6-35B-A3B,並搭配 ColQwen3-4B 圖片檢索器;選擇此組合是為了讓地端成本可預測。
下圖顯示三項主要任務的分數變化。「種子版本」是由人類工程師撰寫的初始程式碼。「Meta-Harness」是 Meta-Harness 找到的最佳版本。三項任務在保留測試集上的表現均有提升。


Signal Engine 由 LLM 評審依時效性、事實準確性、細緻度與語氣進行評估,使用 150 則訓練推文與 150 則保留測試推文。整個作業期間,最佳版本的訓練綜合分數從 0.431 提升至 0.756,保留分數則從 0.456 提升至 0.841。這些提升來自任務執行框架本身的變更,不只是提示詞調整。勝出的幾輪迭代讓系統學會過濾社群媒體雜訊、加入事實交叉核對步驟,並要求每項輸出都以明確證據為依據。下圖顯示迭代流程。


試驗歷史顯示這些成效如何逐步累積。早期的一項結構變更將當時最佳分數提高至 0.625;更細緻的證據處理使分數升至 0.679;經改良的反思與評分準則迴圈則進一步將分數推升至 0.819。約半數候選作業表現不佳或徹底失敗,但這些失敗並未影響排行榜。每個分支都隔離執行,未勝出版本的變更內容會被捨棄,失敗資訊則寫入反思儲存庫,讓下一輪提案器不會重複嘗試同一條死路。
最重要的是,保留資料曲線在整個作業期間都與訓練曲線同步上升。這顯示任務執行框架是在改進工作流程,而非記憶訓練語料庫。保留分數略高於訓練分數;我們認為這只是兩個規模較小且互不重疊的資料分割之間常見的抽樣雜訊。
智慧體式多模態檢索採用公開 ViDoRe V3 Computer Science 資料分割的 NDCG@10 衡量,並將其整理為 20 個訓練查詢、10 個開發查詢與 20 個保留測試查詢。任務執行框架將保留資料的 NDCG@10 從 0.705 提升至 0.744,同時把整體評估的實際執行時間從 869 秒縮短至 54 秒。
深度研究依循 DeepResearch-Eval,在 10 個參考問題上,由 LLM 評審根據實質內容品質與參考資料品質的綜合指標評分。改進後的程式碼將平均分數從 0.449 提升至 0.802。從差異中很容易看出勝出變更:在分派任何研究智慧體前,先加入比較各種方法的前置規劃步驟;並加入最終審查步驟,專門改善報告過去得分較低的面向。由於此資料集規模小且評估成本高,我們未加以分割,並將結果視為樣本內表現。


我們以相同預算對三種方法進行基準測試,使用相同的資料集與底層模型,並設定相同的迭代次數上限與候選版本評估總數。在 Signal Engine 上,Meta-Harness 的保留測試分數達到 0.841,兩個基準方法則均低於 0.50。在智慧體式多模態檢索上,我們團隊的保留 NDCG@10 最高(0.744,CORAL 為 0.700,karpathy 為 0.738),正式評估速度也快 12 至 14 倍,只需 54 秒,CORAL 與 karpathy 則分別需要 786 秒及 650 秒。在深度研究上,我們團隊達到 0.802,兩個基準方法則均維持在 0.52 左右。有一項限制適用於所有比較:我們依據公開說明重新實作 CORAL 與 karpathy/autoresearch,因此部分差距可能來自實作差異,而不只是方法本身的差異。
這項差距可歸因於四項設計選擇。首先,系統會在編輯任何程式碼前產生結構化設計規格,引導後續修改採用新增管線階段等結構性變更,而不只是調整提示詞。其次,系統會以共用的前沿候選版本為基礎,同時執行多個分支,因此改進累積速度比 CORAL 的獨立智慧體或 karpathy 的嚴格循序迴圈更快。第三,每次試驗都會留下結構化產出物(分數、事件記錄及四份由 LLM 撰寫的分析),供下一輪提案器讀取,基準方法則只保留扁平的嘗試記錄。第四,自適應控制器會在停滯後引導提案器轉向探索,並在勝出後轉向精修。最上層的預測式假設重新排序則會在薄弱構想耗用預算前,先加以淘汰。
保留資料曲線證明的是領域內泛化,而非跨領域遷移。針對 AI 市場訊號擷取調校的工作流程,如果未重新執行任務執行框架,就不應預期這套工作流程在法律或生物醫學文本上仍能維持成效。任務執行框架也只會朝評分器設定的目標改進,因此訓練集若雜訊過多或評審校準不當,系統仍會依照錯誤目標過度擬合。我們建議在正式執行前,至少準備 20 個精心整理的訓練項目與獨立的開發資料分割。成本是最大的實務限制。每次評估都會對所有資料分割重新執行完整管線。光是獲選的檢索候選版本就耗用了約 220 萬個輸入 Token,而使用 gpt-5.5 等級模型正式進行最佳化時,每項任務的成本約為數百至一、兩千美元。最後,這些數據來自單次作業,而非重複試驗,因此我們選擇以工程部落格文章分享,而不是將結果視為正式研究。
Meta-Harness 顯示,自主程式碼改進可以做到足夠嚴謹,適合企業使用。關鍵要素包括結構化假設、預測式預先篩選、隔離評估、在資料允許時進行保留測試,以及為每項獲採用的變更保留完整稽核軌跡。這些要素為工程團隊提供可預測的路徑,讓團隊能將可運作的種子管線改進為成效可量測的更佳版本。對營運負責人而言,運作模式也很簡單。自主探索的效益會被限制在嚴格且兼顧預算的框架內,而且任何成果發布前都有人員參與把關。