然而,許多人雖能在個人層面運用深度研究,在網上搜尋並綜合資訊,卻鮮有人在企業環境中受惠。這並非因為它沒有用(事實恰好相反),而是由於各界普遍憂慮可靠性、分散的數據來源,以及模型處理大量上下文的能力(例如數量龐大、格式各異的檔案)。
我們過去 12 個月建立企業級深度研究工具的經驗顯示,周詳的工程設計日益能夠化解這些疑慮。本文將探討阻礙企業深度研究應用發揮成效的主要因素、我們的解決方法,以及我們對此領域在 2026 年發展的看法。
執行能力上限已大幅躍升。gpt-5 於 2025 年 8 月面世,標誌着企業 AI 的轉捩點。在我們的生產系統中,包括為全球最大型藥廠之一建立的藥物靶點探索平台,來源幻覺率從 3–4% 降至實際為零。其後於 12 月推出的 gpt-5.2 進一步提升了有效上下文長度。實際成果是:我們現在可將每次研究所處理的來源由數百個擴展至數千個,而不犧牲可靠性。樽頸已由模型能力轉回本應所在之處——你的數據、評估及程式設計。
數據策略:可取用勝於統一。把企業 AI 視為數據整合問題的想法可以理解,但往往適得其反。全面統一既緩慢又牽涉內部角力,更迫使你在尚未了解哪些問題真正重要前過早押注方向。2026 年的務實做法是採用稀疏連接。透過高訊號錨點(規格、政策、SKU、合約條款)讓數據可供取用,而非等待多年才統一一切。前沿模型現在可在推理時跨系統「軟連接」,無須正式映射也能銜接相關詞項。這既維持部署速度,也保留日後加入來源的靈活性。
導航可避免系統迷失方向。企業數據並非互聯網。它既稀疏,又充滿內部慣例,而且某項事實往往只有一個正確來源。缺乏指引時,模型往往不斷查詢,只為再找一個來源,同時消耗延遲預算和使用者的耐性。輕量語義層(雜湊映射、實體查找、精簡關係圖)為系統提供快速、低成本的路徑,高效到達正確上下文。這就像資深同事給新員工的建議:「把這些網站加入書籤;遇到 AWS 問題就找 Ross。」不必設計得很複雜。只須協助系統迅速找到所需資料。
機械式(每次查詢均執行):引用健全度、工具使用規範、延遲及成本。這些是平凡但不可或缺的防護措施。
分析式(定期執行):系統是否選用正確工具、採取合理研究方向、選擇權威來源,並知道何時停止?通常以 LLM 作為評判,對照已標註範例評分。
使用者(持續進行):任務完成率、進階使用者的質性意見及使用分析。這是最終考驗。我們建立的東西對人們真的有用嗎?
投資回報來自棘手問題,而非穩妥問題。有報告指大多數企業 AI 項目未能帶來投資回報後,市場已不再容忍無法付諸實行的亮眼示範。管理層要迅速看到實證。然而,這種壓力反而可能促使團隊作出錯誤選擇。團隊很容易選擇由低風險任務入手,因為它們容易部署,也不大可能觸動既有利益。但這些應用場景帶來的改變通常不足以支持持續投資。企業深度研究系統很適合證明價值,因為它們針對本已成本高昂的工作:複雜、高風險,且維持現狀的代價清晰可見的工作流程。我們所見最有力的應用包括 RFP 與投標文件製作、科學領域全貌分析及投資研究——這些領域以中標率、更快進入試驗及更快建立投資信念衡量成效,而非單純計算節省的工時。
使用者體驗的轉變:由對話到委派,由答案到成果文件。我們認為這是將界定 2026 年的使用者體驗轉變之一。審視近期採用率最高的產品時,有兩點尤其突出。隨着系統可靠性提升,使用者不再只把它視為供查詢的聊天機械人,而更像可獲委派工作的分析師。兩項要素促成這種轉變:讓團隊按特定工作流程自訂範本和停止條件;以及直接匯出實際所需格式(備忘錄、簡報、摘要等),毋須使用者自行把對話內容整理成完整交付成果。兩者兼備後,系統便不再只是參考工具,而會成為實際完成工作的方式。
去年,我們撰文介紹如何把深度研究帶進企業。我們把最初由 OpenAI 普及、以互聯網為中心的深度研究範式延伸至公司的專有數據來源,同時保留溯源能力及控制權。我們亦指出,深度研究系統不應被視為偏離較傳統的 RAG 系統,而應視為其演進。
踏入 2026 年,改變的與其說是深度研究的概念,不如說是可實現的執行能力上限。
2025 年初開始建立這些系統時,前沿模型包括 o1、gpt-4o 及 claude-3.5-sonnet(短短 12 個月,我們確實已走了很遠……);年初數月,o3 和 gemini-2.5-pro 等模型亦帶來重大進展。它們在當時表現出色,亦確實能用來建立穩健的深度研究應用,但仍有一定極限。這個極限通常約為數百個來源;超出後便須大幅裁剪上下文,否則答案會失真、指令遵循能力下降,甚至直接出現幻覺。
曾建立這類系統的人,應會認得其中一些失效模式。
舉一個具體例子:2025 年中,我們開始與全球最大型藥廠之一建立企業深度研究方案。這個系統旨在加快藥物靶點探索,即研究人員尋找可作為治療疾病靶點的人體基因、荷爾蒙或其他物質的過程。當時最強的可用模型是 o3。它的整體表現雖然出色,但模型產生的回應中仍有 3–4% 包含未有透過工具調用、從客戶專有數據來源提供給模型的來源。我們採用事後引用檢查來緩解問題,標示答案中缺乏所提供上下文支持的部分。項目仍處於早期概念驗證階段時,這做法有效建立持份者對工具的信心,亦有助我們迅速推進。不過,我們繼續致力減少這些錯誤,一面緩解模型限制,一面回應持份者要求在系統加入更多來源的需要。
8 月推出的 gpt-5,成為建立前沿深度研究方案(以至更廣泛的智能代理方案)的關鍵轉捩點。由 o3 轉用 gpt-5 後,我們的評估顯示來源幻覺率立即降至 0%。
準確而言,這項指標嚴格追蹤模型有否引用擷取上下文中不存在的文件 ID 或 URL。在 o3 及更早的時代,模型有時會虛構看似可信的檔案名稱或論文,以填補知識缺口。gpt-5 讓我們實際消除了這種特定問題。
請注意,這與忠實度錯誤(引用正確文件但誤解內容)不同;後者仍是挑戰,我們透過上述事後檢查處理。
這項突破意義重大。因此,我們開始測試採用新一代模型後,系統能力究竟可推進至甚麼程度。我們發現,每次深度研究可考慮的來源數目能增加約十倍(至約 3,000–5,000 個)。最終觸及的限制並非指令遵循能力失效,而是長上下文效能——模型的有效上下文長度通常遠低於公布數字,尤其在處理密集的製藥數據等內容時。
12 月中推出的 gpt-5.2 局部緩解了這項限制。我們的內部長上下文基準測試顯示,其有效長上下文效能顯著提升,讓我們可進一步推進前沿深度研究系統。這讓我們最終可增加直接傳送至輸出模型的 Token 數目,從而為使用者提供內容更豐富的答案。儘管如此,我們仍期望前沿模型的有效上下文長度在 2026 年繼續增加。
隨着模型本身的能力進步,建立高效深度研究系統的樽頸,在很多方面已回到一直理應所在之處:你的數據、評估,以及在企業內設立深度研究計劃的方式。每個步驟都要求你務實判斷,哪些做法真正有助深度研究項目取得實質進展。
本文餘下部分將說明我們如何思考這些決定。
把企業研究項目視為數據整合問題,可能看來相當吸引。統一來源、規範結構定義,然後讓模型在其上自由運作。
必須說清楚:有時這確實是正確做法。如果所在領域的核心實體穩定、查詢可重複,而最終目標是把工作流程工業化,統一數據確能帶來實質效益。典型例子包括連接客戶與收入數據、市場定價數據,或任何需要可靠跨系統報告的情況。
然而在實務上,現今具創新思維的領袖對企業深度研究系統有不同期望。
隨着企業愈來愈重視 AI 開支的投資回報,決策者的主要目標是在業務運作的混亂現實中迅速證明價值。全面統一數據來源,正是最慢取得首項實證的方法之一。它工程浩大。它會牽涉內部角力。而且往往迫使你在尚未了解哪些問題真正重要前,便承諾採取某個方向。
因此,我們認為 2026 年建立前沿深度研究系統的務實起點通常是:先讓數據可供取用,再追求完善。


如果日後很可能加入更多來源(大多數企業皆如此),稀疏連接的價值往往被低估。你可透過一致的擷取介面提供數十個來源。系統仍可運作,而關鍵是你能保持快速交付。日後加入更多來源時,也毋須大動干戈。你只須接上新的連接器,向核心系統說明其用途及使用方法,然後交由模型處理。這是因為現今前沿模型可在推理時對兩個或以上數據來源作軟連接,把某系統的「Customer ID」與另一系統的「Client Reference」銜接,毋須任何人編寫正式映射。抱持這種想法的不只我們。抱持這種想法的不只我們:OpenAI 的內部數據智能代理旨在讓模型對 70,000 個異質數據集進行推理,方法是在查詢時提供可取用的上下文和連接,而非強制預先全面統一。
這裏有一點值得明確指出:稀疏不一定等於淺薄。
稀疏整合在連接具實質意義,且表達方式容易供系統運用時,成效最佳。一個合適的思考方式,是把某些資訊視為錨點(規格、政策、產品定義、SKU、合約條款等)。你毋須統一每個數據集才能發揮這些錨點的作用,只須有穩定識別碼及數條高訊號連接。
例如,假設模型(或使用者)查找某項規格。在簡陋的系統中,互動到此為止。你擷取規格、作出摘要,或許再加上引用。但建立實用數據結構時,我們希望把這次查找轉化為受控擴展的起點。例如,我們可選擇把該規格的記錄連接至過往相關成果文件。「相關」在此可有多種意思,通常取決於系統正在執行的任務,例如曾引用該規格的 RFP、過往針對該規格而成功中標的回應、法律團隊曾就該規格提出異議的修訂版本等。這種方法可在查詢時迅速向深度研究系統呈現最關鍵洞見,從而大幅改善答案質素及延遲。
這就帶出下一個問題:當你擁有大量以少數高訊號連接組成的稀疏數據來源時,如何避免深度研究系統像小孩走進糖果店般四處遊蕩,並讓它像資深分析師一樣導航?
企業數據來源的運作方式與互聯網不同。它們既稀疏,又充滿內部慣例;某項事實往往只有一個「正確」來源——前提是你能找到它。此外,現今模型處理搜尋問題時往往總想把召回率最大化,不斷查詢以尋找多一個來源,同時消耗延遲預算和使用者耐性(謹慎設計提示可在一定程度上緩解此問題)。
最有效的解決方法是提供輕量工具,協助模型在混亂的企業數據環境中辨明方向。有些團隊稱之為本體。另一些則稱之為語義層、查找服務、圖譜或概念庫。名稱其實並不重要。
重要的是,它為系統提供一組快速、低成本的路徑,讓模型能在正確的上下文片段之間高效跳轉,而非漫無目的地尋找。
一個簡單比喻是:你剛加入新公司或新項目時,新同事會告訴你「一定要把這些網站加入書籤,你會經常用到」或「遇到任何 AWS 問題就找 Ross,他會給你所需資料」等等。同樣地,我們只是要協助深度研究系統迅速找到所需資料。


實際上,這個系統毋須複雜,也不必以人手維護。我們發現最佳實作方式,是由 LLM 在資料匯入流程中產生(擷取實體並自動填入圖譜),或直接轉接至現有記錄系統(例如透過 Salesforce API 查找)。常見例子包括:
雜湊映射查找(例如以產品名稱查詢並傳回產品說明)
精簡的「常見」關係查找(例如在因果基因關係圖中,某基因最常與哪些疾病相關)
命名實體識別模型(主要適用於實體消歧問題複雜的領域,例如製藥業)
對數據關係最複雜的情況,輕量 RDF 圖譜可提供擴展性最高的本體解決方案
……以及更多
完成設置後,系統便可高效地在你的數據來源之間移動。下一個問題很簡單:在實際使用下,你如何確定它一直在做正確的事?
數據現已可供取用,導航層亦提供了地圖,系統因而具備完成工作的能力。但在企業環境中,能力若缺乏可靠性便毫無意義。
這正是最多 AI 項目折戟之處。不少團隊墮入「憑感覺」評估的陷阱。他們執行一次查詢、閱讀輸出、滿意地點頭,然後便推出系統。如果深度研究系統可能自主查閱 5,000 份文件,並就涉及數百萬美元的供應鏈決策提出建議,這種做法絕不可行。
關鍵轉變是:你評估的不再是模型,而是一個系統。問題理解、規劃、工具調用、解讀、上下文裁剪、重新排序,甚至時間戳等看似乏味的連接器細節,都會反映在使用者體驗中。
結構化且可重複的評估有助我們解決這些問題。
建立評估時,可大致分為三類,由機械式到主觀式不等。
這部分最接近單元測試,團隊初期通常也能在此最快取得進展。這類評估通常也是最穩定的;設置後可在整個項目生命週期持續帶來效益。
「機械式評估」一般是可在每次查詢時執行、毋須人工介入的檢查。它們讓我們有信心,系統在真實使用者負載下仍能以可預測且安全的方式運作。
例子包括:
引用健全度:所有引用是否都指向實際擷取的段落?是否有未附引用的陳述?是否有原始資料不支持的陳述?引用是否過於籠統(例如以整份文件支持單一陳述)?
工具使用規範:系統是否確實使用了聲稱曾使用的所有工具?它是否正確使用導航工具?它有否錯誤設定任何工具請求的格式?收到錯誤回應時,它是否合理重試?
延遲及成本預算:首次輸出 Token 的時間是否符合目標?工具調用次數或成本有否超出預期?它是否耗費大量延遲時間和運算資源,卻只換來輕微改善?
這些檢查看似平凡,卻正是防止企業系統逐漸劣化的測試。
以實際案例而言,我們在藥物靶點探索的深度研究項目中,採用了兩層引用檢查,並於每次查詢時執行。首先,在產生答案時,我們指示模型頻繁加入行內引用。LLM 能可靠做到這一點也是相對近期的發展,同樣在 2025 年上半年才出現(此前曾嘗試對大量數據採用此方法的人,都會明白當時的挑戰)。藉此,我們可運用一組簡單的正規表達式檢查,例如查看答案有否提及並非來自所提供來源的文章連結。
第二層檢查在答案串流完成後進行。系統先把答案分段,再評估各段,從擷取的數據中搜尋能支持該段陳述的來源。如找不到支持證據,系統便會將其標示為潛在幻覺。
如果機械式評估是單元測試,分析式評估就是程式碼審查。
在這一層,我們要了解系統能否把工作做好。我們通常關注它有否使用正確工具、採取合適研究方向、選擇最權威來源,以及知道何時停止等。
實務上,這些評估通常採用一系列問答配對,例如已知合理的工具調用次序,或在首個工具找到一批研究資料後應作出甚麼正確決定。值得注意的是,問答配對毋須與整個深度研究系統的輸入和輸出一一對應;這些方法也可測試子流程。取得由人工標註員或較強標註模型(「較強」是相對而言)產生的標籤後,我們便可採用 LLM 評判方法為每次研究評分,衡量其表現。持續追蹤這些分數,可讓我們了解改動是否令系統朝正確方向改善,或有否造成效能倒退。
由於這類測試的時間和金錢成本較高,通常應按固定週期或在版本更新前定期執行。
這還有一項很好的間接效益:這類分析式評估可直接為前文所述的稀疏連接升級提供依據。如果模型即使在目前沒有人工明確連結相關成果文件的情況下,仍反覆作出同一項高質素跳轉,例如「規格 → 過往相關的 RFP 範例」,這便是有用訊號。你可把這項跳轉提升為正式連接或捷徑,讓日後的研究以更低延遲和更高一致性受惠。
你亦可在此發現深度研究系統成本最高的問題之一:預設將召回率最大化的傾向。模型總能再找到一個來源。問題是它應否這樣做。我們可調整模型,強化合理的停止行為:系統判斷繼續擷取資料不大可能改變結論時,便選擇交付證據充分且切合使用者問題的答案。
機械式評估告訴你系統是否安全。分析式評估告訴你系統是否勝任。使用者評估則告訴你系統是否真正有用。
這是另一個令不少團隊失足的範疇。他們建立了技術上令人驚嘆,卻沒有人願意再次使用的產品。在企業環境中,這正是成功部署與昂貴研究項目的分別。
使用者評估的根本目的,是了解系統有否以正確方式解決正確問題。這意味着不能只問:「答案正確嗎?」還要問:「它有否提供我能付諸行動的成果?」
實務上,使用者評估通常採取以下幾種形式:
任務完成研究:使用者能否運用系統,更快或更妥善地完成實際工作?重點不在於模型能否回答問題,而是實際使用者在真正的工作流程中有否取得所需成果。
質性意見回饋機制:定期與進階使用者進行有系統的對話。他們反覆執行哪些查詢?他們在哪些情況下失去信任?他們何時會放棄並重用舊方法?這類環節經常揭示測試集從未呈現的失效模式,因為使用者提問的方式可能出乎意料,或對質素有你並不知道的隱含要求。
使用分析:哪些查詢會被重新執行?哪些答案會被複製並用於其他地方?使用者在哪些位置按下「讚好」圖示?使用量下降不一定代表失敗(有時使用者取得答案後便離開),但人們何時及如何放棄查詢的模式,可充分反映系統在哪些方面未達預期。
綜合這些資料,你便能以實證而非猜測衡量實用性,並在問題開始削弱使用者信任前及早發現。
然而,即使系統在機械式準確度上取得滿分,並深受早期使用者喜愛,仍可能無法通過最終考驗:推動企業收入增長。可靠性和使用者滿意度只是必要條件。要跨越由成功試點到轉型企業資產的鴻溝,你不能只關注系統如何運作,更須着眼於應用位置。
我們已說明如何讓數據配合系統,以及如何讓系統服務使用者。現在,我們要探討如何讓這個系統服務企業。
企業領袖近期高度關注這一點,而這確實理所當然。在麻省理工學院聲稱 95% 企業 AI 項目未能取得投資回報等報告發表後,市場已不再容忍無法付諸實行的亮眼示範。模型已準備就緒。架構亦已得到驗證。現在的問題是:你能否以真正為企業創造價值的方式部署系統?
好消息是,依照上述原則建立的前沿深度研究系統,十分有望達到這項標準。它們並非要把一切自動化,也不是要取代整個職能。它們旨在大幅提升最優秀人才處理現有高價值工作的效能。
但要由「技術上可行」走到「帶來投資回報」,還需要幾項關鍵突破:在組織、使用者體驗及成效衡量方面作出選擇,決定它會成為日常工具,還是被遺忘的瀏覽器分頁。
根據我們的經驗,關鍵有兩項。
人們往往想由「總結這次會議」等低風險內部任務開始。這些應用雖然穩妥,卻鮮能證明足以抵銷成本的價值。
深度研究系統最適合處理龐大而棘手的任務——改善質素或速度後,能明確增加收入或帶來策略優勢的高成本問題。
我們看到企業針對以下切入點時,投資回報最高:
複雜投標及 RFP 製作:深度研究系統可自動找出最相近的過往成功(及失敗)案例、擷取總會觸發修訂的少數條款、找出最能證明符合特定要求的論據等,再把這些資料轉化為有力而連貫的投標定位。這裏的指標不是節省時間,而是中標率、利潤保障,以及減少後期出現的法律或商業意外。
科學領域全貌分析:對研發密集型機構(製藥、生物科技、半導體)而言,切入點是把數週的文獻及內部知識濃縮成可採用的研究方向。深度研究系統可綜合閱讀數千篇論文、專利、內部報告、實驗室筆記及過往項目評審,梳理已知與尚有爭議的事項,產生有證據支持的領域全貌。這可加快迭代週期、減少走入絕路的嘗試,最重要是縮短進入首次人體試驗的時間。
市場洞見:對銀行和對沖基金而言,價值在於把零散的內部研究(筆記、模型、逐字稿、經紀評論)及外部訊號(申報文件、業績、宏觀數據、新聞)轉化為足以支持決策的交易資料。深度研究系統可持續建立並更新對公司、主題或宏觀問題的觀點,呈現與上週相比的關鍵變化、協調互相矛盾的來源,並產生附完整溯源資料的投資備忘錄或交易資料包。
這些工作的共通點是:它們並非對話。它們是複雜的工作流程,通常需要昂貴的外部顧問,或資深員工投入數週時間。把深度研究系統用於這些問題,價值便顯而易見。
這是將界定 2026 年的使用者體驗轉變之一。
如果深度研究系統只是一個供使用者查詢資料的聊天機械人,很快便可能只會偶爾被使用。它仍只是參考工具,使用者最終還要自行把輸出整理成所需成果。但如果它像一名隨時候命、可接受工作委派的分析師,便能徹底改變團隊的運作模式。
我們正看到使用方式由「對話」(簡短來回交流)轉向委派(界定範圍、範本及目標,然後讓系統執行)。
以下三項具體轉變促成了這一點:
以成果文件作為輸出:高價值工作很少只存在於對話視窗,而是呈現在文件、備忘錄及簡報中。現代深度研究系統應跳過對話階段,直接產生最終業務成果文件。當使用者可要求「一份採用本公司格式的三頁投資備忘錄」,並收到可下載檔案而非串流文字時,實現價值所需的時間便會大幅縮短。這通常還會延伸至排程產生內容:隨着新數據出現,使用者可要求系統自動產生載有新洞見的電郵或報告,並分發給相關人士。
透過自訂範本進行本地最佳化:模型現已足夠穩健,可讓業務部門甚至個別使用者自行設定提示及行為,而不會破壞系統。倫敦與紐約的風險報告並不相同。讓團隊上載或設計自己的結構範本,並自訂停止條件(例如「必須檢查這三個特定內部數據庫」)或輸出格式,可讓使用者從系統獲得更多價值,建立他們愈來愈願意使用的工具。
以信任作為介面:當使用者委派需時超過 20 分鐘的任務,信任便成為首要問題。你不能只呈現一個黑箱。介面必須展示系統的思考過程及選擇,讓使用者看到正在使用哪些工具、產生引用等資訊。我們通常發現,最佳使用者體驗會預設顯示研究進度的高層次洞見,同時讓使用者可展開側欄等介面深入查看詳情。
我們預期,未來每家領先企業都會在最關鍵的工作流程背後設置度身訂造的深度研究系統。它們將化身為一系列隨時候命的分析師,能可靠地查閱數千份內部成果文件,並提出可付諸行動的決策及交付成果。隨着前沿模型提高執行能力上限,差異化關鍵將轉向基本功:讓數據可供取用、為系統提供地圖,並透過評估把可靠性落實於營運。
過去一年模型能力的提升,是這個領域發展方向最明確的訊號。2026 年,領袖的機遇在於及早行動。選擇價值清晰可見的切入點,以溯源能力和防護措施建立信任,並把企業深度研究方案由試點轉化為業務每天使用、效益持續累積的能力。