你是否曾遇過某個提示詞本來效果很好,卻突然失效?
你是否曾為了改善結果而不斷修補系統提示詞,陷入循環,最終卻發現怎樣做都不奏效?
系統提示詞學習或許正是你所需要的方法。
系統提示詞學習(SPL)是 AI 社群新近關注的領域,並於 5 月經 Andrej Karpathy 在 X 上廣泛推廣。
系統提示詞學習旨在克服依賴靜態系統提示詞或繁複微調設定的 AI 系統缺乏彈性、容易失效等限制。這為 AI 系統持續學習提供了另一種方法。
深入探討之前,先簡單重溫提示詞的一些基本概念。
開發智能代理或自訂模型時,我們首先要設計兩個關鍵部分:
系統提示詞
使用者提示詞
系統提示詞為模型應有的行為訂立基本規則。為自訂 AI 解決方案撰寫時,開首通常類似這樣:
「你是一位智能助理。你的職責是執行 <在此插入任務>。
你不得執行 (A)、(B) 或 (C)。」
相比之下,使用者提示詞通常包含使用者的查詢及其他相關資料,例如時區和偏好。使用者提示詞可能如下:


我身處葡萄牙的首都。你可以建議我今晚參加哪些活動嗎?
大型 AI 實驗室推出新模型後,系統提示詞洩漏已很常見,因為使用者會對聊天機械人進行越獄,令其披露底層指令。現時有一個熱門 GitHub 程式碼庫集中收錄了許多這類系統提示詞。這些提示詞揭示了 AI 實驗室多年來為引導模型作出恰當行為而研發的「獨門秘方」。例如,近期洩漏的 GPT-5 系統提示詞(於 ChatGPT 中曝光)約有 6,000 字,反映塑造系統行為需要編入大量知識和指引。
這些全面的系統提示詞通常涵蓋多個重點範疇,例如:
搜尋指令
工具定義
使用者偏好
引用指令
已知問題的快速修補方案
實際開發自訂 AI 系統時,開發人員會一邊測試和改良應用程式,一邊手動反覆修補系統提示詞,並主要以評估引導改善過程。
引導模型行為的其他方法包括:
提示工程,包括控制提供予模型之內容的檢索增強生成(RAG)
微調(直接改變模型的底層權重)
如果還有另一種方法可影響模型行為呢?試想像一個系統,能運用過往生成的思路、計劃和策略,動態學習並改良自身的系統提示詞。它可以同時參考使用者意見和由 LLM 擔任評審的評估,以衡量輸出成果。
試想一項你希望透過智能代理系統自動處理的長期業務挑戰。有效的解決方案需要超越基本工作流程自動化的推理能力。在這類情況下,AI 系統必須加入計劃生成組件。這讓系統可根據任務,以不同方式配合多個智能代理運作。個別步驟可包括存取其他智能代理以完成子任務,或使用工具。


注意:智能代理的工具是指 AI 智能代理可調用的任何外部函數、API 或資源,讓它突破純文字限制並採取實際行動。
你可以選擇以人類會依循的邏輯步驟,將計劃「植入」模型的系統提示詞;不過,LLM 通常需要更明確的工具使用、輸出格式及相關要求指引。有時最佳策略並不明確,又或者你所處理的問題過往被視為已解決,因此一直未有重新評估。這正是系統提示詞學習(SPL)可派上用場之處。
SPL 透過納入以往生成的策略,反覆改善系統提示詞。隨着新問題出現,系統會逐步累積知識,變得更加穩健。你可視之為建立一本處理所屬領域問題的手冊。
SPL 逐步把來自使用者意見的見解納入系統提示詞。隨着系統日漸成熟,你可能會發現反覆出現的問題,並將其歸納成更通用、更高層次的原則。
以下逐步深入了解整個過程的運作方式:
先從使用者查詢開始,要求系統執行特定任務。
若系統只處理一類問題,你可採用「貪婪」方法,選擇過往運行中得分最高的策略。另一種方法是從偏重高評分策略、但偶爾亦包括較低評分策略的分佈中抽樣,以鼓勵探索。這在剛開始收集策略時尤其有用。
對於旨在處理不同問題集的系統,可考慮加入分類層,或運用嵌入和餘弦相似度(即 RAG 常用的技術)找出相關方法。這有助選出適合特定問題的策略,例如專為編程任務而設的策略。
注意:嵌入配合餘弦相似度,可量度兩項資料的關聯程度,即使具體措辭不同,也能更輕易配對文件、查詢或概念。
處理編程問題的簡化策略庫起始範例。
注意:此處所示的「種子策略」只供說明。在實際編程情境中,我們會進一步改良這些策略。對於特定的業務問題,則需要隨時間收集更多見解。
Generation_id(倒序) | 主題 | 分數 | Strategy_text | 說明 |
|---|---|---|---|---|
4 | 編程 | 1 | 了解問題、限制和邊緣情況。 使用合適的資料結構設計演算法。 根據範例和不變條件驗證計劃。 編寫整潔易讀的程式碼。 透過重構、最佳化和最終格式設定加以改良。 使用工具:使用工具時,簡要說明為何需要該工具。 | 納入並融合以下三項策略中最出色的元素。 |
3 | 編程 | 1 | 了解問題、限制和邊緣情況。 使用合適的資料結構設計演算法。 根據範例和不變條件驗證計劃。 編寫整潔易讀的程式碼。 透過重構、最佳化和最終格式設定加以改良。 | 策略較為全面,但沒有工具使用指引。 |
2 | 編程 | -1 | 了解問題、限制和邊緣情況。 使用合適的資料設計演算法。 編寫整潔易讀的程式碼。 使用工具:存取工具時,簡要說明使用該工具的原因。 | 這項較佳的策略提及工具使用,但仍有改善空間。 |
1 | 編程 | -1 | 略讀問題。 解決問題。 建立最基本的測試。 提交任何能運行的成果。 | 提及測試,但整體策略薄弱。 |
3. 抽樣選出 N 項策略後,將其納入系統提示詞。這讓計劃生成以過往專家意見為依據,而非只給模型最低限度的指引,任由它自行建立計劃。鼓勵模型「跳出框框思考」,並按需要加入步驟,而非逐字照抄範例策略。


4. 運用動態建立的系統提示詞,生成新策略來處理使用者的要求。這個過程應產生更多有助改善最終輸出的任務。目標是發揮創意:融合過往策略中最出色的元素、整合重疊步驟,並按需要加入有用的新步驟。
注意:請緊記,溫度是一項可調整的參數,能產生更多樣化、確定性較低的輸出,適合需要創意的情況。當溫度不為零時,每次生成的計劃都可能不同。
5. 收到模型輸出後,根據界定優良解決方案的特定準則,由人工評審或 LLM 評審進行評估。以上述葡萄牙活動範例為例,評估準則可包括:
簡潔程度(答案限於一句)
建議活動的相關程度
地點準確度
6. 根據這項評估,使用另一個模型改良策略。亦可選擇加入意見回饋循環,納入人工意見並支援協作改善。把改良後的策略連同適當的中繼資料儲存於資料庫,以追蹤版本和變更。


那麼,為何要大費周章完成這一切?你大可手動審閱輸出,再相應調整系統提示詞。然而,強大的推理模型可同時運用輸出內容和人工意見改良策略。人類很容易察覺簡單方法的缺陷,但面對處理廣泛問題的複雜系統,要找出問題便會變得困難而繁瑣。
人類處理問題時會自然運用背景知識,LLM 則往往需要詳細指令和額外步驟才能收集這些知識。隨着系統擴展至處理更廣泛的問題,所需任務數量可能迅速增加。例如,人類處理編程問題時,或可憑直覺理解相關程式碼庫,LLM 則可能要先「閱讀」多個檔案。
適用情況:假設你管理客戶支援團隊,並由 AI 智能代理為支援請求分類。SPL 或會逐步發現團隊未曾考慮的分類方法,從而降低問題升級處理的比率。
不適用情況:若合規要求或法規已界定工作流程(例如財務報告),創意便會由優勢變成風險,因此 SPL 的價值可能有限。
適用情況:在研究密集的職務中(例如市場情報或產品策略),你可透過改良 AI 的計劃、充實其輸出,並保留這些改善供日後使用,與 AI 協作。每次互動都能提升系統效能。
不適用情況:若團隊主要使用 AI 處理毋須多少人工參與的簡單工作流程(例如發票處理),協作成本可能高於效益。
適用情況:假設業務拓展至新地區,AI 突然要處理當地稅務查詢。SPL 可讓你在新規則和經驗法則出現時迅速將其編入系統,避免一再犯錯。
不適用情況:若環境固定不變,例如把會議謄本轉換成標準格式的摘要,持續適應的效益便非常有限。
理論上,這一切相當可取,但實施 SPL 確實面對不少挑戰。以下探討其中幾項主要挑戰:
在策略生成初期,進展往往停滯:新的輸出未能承接以往成果,令改善步伐放緩。這通常由兩個主要問題引起:
解決方案:預先編入所有可用的業務知識,讓系統有足夠深度可供運用。
解決方案:設計細緻的評分準則,從準確度、清晰度和相關程度等多方面評分,並調整抽樣方式以反映這些訊號。
如果系統生成數百項策略,卻只收到很少意見來分辨優劣,抽樣很快便會變得難以管理。解決方法是修剪策略。
改良策略庫時,可考慮:
生命週期:策略超過指定期限或生成次數後,便將其淘汰。
分數:利用評估準則,篩除表現持續欠佳的策略。配合生命週期機制,可確保只保留長期證明有價值的方法。
LLM 評審:定期評估策略,找出已無法提供獨特見解的項目,因為其有用元素很可能已被較新版本吸收。
解決方案:把策略資料庫視為持續演進的系統,定期加以修剪,只保留相關且高價值的知識。
系統提示詞學習仍在起步階段,但潛力龐大。只依賴靜態提示詞或無止境微調的企業,將會遇上熟悉的限制:系統脆弱、成本日增,以及白費心力。SPL 可建立隨時間改善的系統,編入更高層次的原則,而非零散的修補方案,從而擺脫這個循環。
SPL 仍在發展,但趨勢已很明確:能夠自我學習的系統將超越無法自我學習的系統。現在正是開始試驗的時候:由小規模着手、記錄經驗,並為每次互動都能持續改善的 AI 系統奠定基礎。