系統提示詞學習:AI 系統的新典範

系統提示詞學習無須重新訓練模型,即可協助團隊改善 AI 行為,並讓系統限制更容易理解。

你是否曾發現某個提示詞原本效果很好,卻突然失效?

你是否曾陷入不斷修補系統提示詞、試圖改善結果,最後卻發現毫無成效的循環?

系統提示詞學習或許正是你需要的方法。

系統提示詞學習(SPL)是 AI 社群新興的關注領域,並於五月因 Andrej Karpathy 在 X 上的推廣而廣為人知

系統提示詞學習旨在克服僵化、脆弱的 AI 系統所受的限制;這類系統依賴靜態系統提示詞或繁瑣的微調架構。它為 AI 系統的持續學習提供了另一種途徑。

深入探討前,先快速複習幾項提示詞設計的基本概念。

開發智慧體或自訂模型時,我們必須先設計兩個關鍵要素:

  1. 系統提示詞

  2. 使用者提示詞

系統提示詞會訂定模型行為的基本規則。為自訂 AI 解決方案撰寫時,通常會以類似以下的內容開頭:

「你是一位智慧助理。你的職責是執行 <在此插入任務>。

你不得執行 (A)、(B) 或 (C)。」

相較之下,使用者提示詞通常包含使用者的問題及其他相關資訊,例如時區與偏好。使用者提示詞可能如下:

介紹內容的螢幕截圖。

我人在葡萄牙首都。可以推薦一些今晚能參加的活動嗎?

大型 AI 實驗室發布新模型後,系統提示詞外洩已屢見不鮮,因為使用者會越獄聊天機器人,讓它揭露底層指令。如今,一個熱門的 GitHub 程式碼庫已將許多這類系統提示詞彙整在一處。這些內容揭露了 AI 實驗室長期研發、用以引導模型適當行為的「獨門配方」。例如,近期外洩的 GPT-5 系統提示詞(在 ChatGPT 中曝光)約有 6,000 個英文單字,顯示塑造系統行為需要編入大量知識與指引。

這類完整的系統提示詞通常涵蓋幾個關鍵領域,例如:

  • 搜尋指令

  • 工具定義

  • 使用者偏好

  • 引用指令

  • 已知問題的快速修補措施

實務上,自訂 AI 系統的開發人員會一邊測試及改良應用程式,一邊反覆手動修補系統提示詞,並主要透過評估來引導改善流程。

引導模型行為的其他方法包括:

  • 提示工程,包括控制提供給模型之內容的檢索增強生成(RAG)

  • 微調(直接變更模型的底層權重)

如果還有另一種影響模型行為的方法呢?想像一個能運用先前產生的想法、計畫與策略,動態學習並改良自身系統提示詞的系統。它可以同時參考使用者意見與以 LLM 擔任評審的評估結果,評量自身輸出。

什麼是系統提示詞學習?

想想看,你是否有一項長期存在的業務挑戰,想使用智慧體系統將其自動化。有效的解決方案需要超越基本工作流程自動化的推理能力。在這類情況下,AI 系統必須納入計畫生成元件。如此一來,系統便能依任務需求,以不同方式搭配多個智慧體運作。個別步驟可能包含存取其他智慧體以完成子任務,或使用工具。

說明系統提示詞學習的螢幕截圖。

注意:智慧體工具是指 AI 智慧體可呼叫的任何外部函式、API 或資源,讓它能超越文字處理,採取實際行動。

你可以選擇在模型的系統提示詞中「植入」一套遵循人類邏輯步驟的計畫;不過,LLM 通常需要更明確的工具使用、輸出格式及相關要求指引。有時,最佳策略並不明確;或者你面對的問題過去曾被視為已解決,因此一直未重新檢視。這正是系統提示詞學習(SPL)派上用場之處。

SPL 會納入先前產生的策略,反覆改善系統提示詞。隨著新問題出現,系統會逐步累積知識,變得更加穩健。你可以將它想成一本專門解決所屬領域問題的手冊。

SPL 會逐步將使用者意見帶來的洞見納入系統提示詞。隨著系統成熟,你可能會發現一些反覆出現的問題,並將其提煉為更通用、更高階的原則。

逐步指南

接下來逐步深入了解這套流程的運作方式:

  1. 先從使用者查詢開始,要求系統執行特定任務。

    1. 如果系統只處理單一問題,你可以採取「貪婪」方法,選取先前執行中得分最高的策略。或者,你也可以從偏重高評分策略、但偶爾納入低評分策略的分布中取樣,藉此鼓勵探索。這在剛開始蒐集策略時特別實用。

    2. 對於要處理多元問題集的系統,可考慮加入分類層,或使用嵌入向量餘弦相似度(即 RAG 通常採用的技術)找出相關方法。這有助於選出適合特定問題的策略,例如專為程式設計任務制定的策略。

注意:嵌入向量搭配餘弦相似度,可以衡量兩則資訊的關聯程度;即使措辭不同,也能更容易配對文件、查詢或想法。

處理程式設計問題時,簡化版策略庫的起始範例。

注意:此處所示的「種子策略」僅供示範。在實際的程式設計情境中,我們還會進一步改良。利基業務問題則需要隨時間蒐集更多洞見。

Generation_id(反向排序)

主題

分數

Strategy_text

說明

4

程式設計

1

了解問題、限制條件與邊界案例。 運用合適的資料結構設計演算法。 使用範例與不變量驗證計畫。 實作簡潔、易讀的程式碼。 透過重構、最佳化與最終格式整理加以改良。 工具使用:使用工具時,請簡要說明需要使用該工具的原因。

納入並融合下列三項策略中最出色的部分。

3

程式設計

1

了解問題、限制條件與邊界案例。 運用合適的資料結構設計演算法。 使用範例與不變量驗證計畫。 實作簡潔、易讀的程式碼。 透過重構、最佳化與最終格式整理加以改良。

更為周全的策略,但未提供任何工具使用指引。

2

程式設計

-1

了解問題、限制條件與邊界案例。 使用合適的資料設計演算法。 實作簡潔、易讀的程式碼。 工具使用:存取工具時,請簡短說明使用該工具的原因。

這項策略較佳,也提及工具使用,但仍有改善空間。

1

程式設計

-1

快速瀏覽問題。 解決問題。 建立最基本的測試。 提交任何能執行的成果。

雖提及測試,但整體策略薄弱。

3. 取樣 N 項策略後,將其納入系統提示詞。如此可讓計畫生成奠基於先前的專家意見,而不是讓模型在幾乎沒有指引的情況下自行建立計畫。鼓勵模型「跳脫框架思考」,並在必要時加入步驟,而非只是逐字照抄範例策略。

逐步指南的螢幕截圖。

4. 使用動態建立的系統提示詞,產生處理使用者要求的新策略。此流程應產生額外任務,以改善最終輸出。重點在於創意:融合先前策略中最出色的部分、整併重複步驟,並視需要加入有用的新步驟。

注意:請記得,溫度是一項可調整的參數,能產生更多元、較不具確定性的輸出,因此適合需要創意的情境。只要溫度不為零,每次產生的計畫都可能不同。

5. 收到模型輸出後,由人工評分者或 LLM 評審依據明確的評估標準進行評量;這些標準應界定何謂問題的良好解決方案。以先前提到的葡萄牙活動範例而言,評估標準可能包括:

  • 簡潔度(答案限為一句話)

  • 建議活動的相關性

  • 地點準確性

6. 根據這項評估,使用另一個模型改良策略。也可選擇建立意見回饋迴圈,納入人工意見並支援協作改善。將改良後的策略連同適當的中繼資料存入資料庫,以追蹤版本與變更。

逐步指南的螢幕截圖。

那麼,為什麼要如此大費周章?你也可以手動審查輸出,並據此調整系統提示詞。然而,強大的推理模型可以結合輸出脈絡與人工意見來改良策略。人類很容易發現簡單方法的缺陷,但面對涵蓋更廣泛問題的複雜系統時,找出缺陷會變得困難又繁瑣。

LLM 通常需要詳細指令與額外步驟,才能蒐集人類在處理問題時自然具備的背景知識。隨著系統擴展到更廣泛的問題集,所需任務的數量可能迅速增加。例如,人類處理程式設計問題時,可能直覺就能掌握周邊程式碼庫;LLM 則可能需要先「閱讀」多個檔案。

在 AI 解決方案中導入 SPL 的影響

探索解決問題的新方法

  • 適用情況:假設你管理一支客服團隊,並由 AI 智慧體負責初步分流案件。隨著時間推移,SPL 可能會找出團隊未曾考慮過的分類方法,進而降低案件升級率。

  • 不適用情況:若法遵要求或法規已明確規定工作流程(例如財務報告),SPL 的價值可能有限,因為創意會成為風險,而非優勢。

強化人機協作

  • 適用情況:在研究密集型職務中(例如市場情報或產品策略),你可以透過改良 AI 的計畫、充實其輸出,並納入這些改善供日後使用,與 AI 展開協作。每次互動都能提升系統效能。

  • 不適用情況:若團隊主要將 AI 用於只需極少人工介入的簡單工作流程(例如發票處理),協作成本可能高於效益。

因應新問題

  • 適用情況:假設你拓展至新地區,AI 突然必須處理當地稅務查詢。SPL 可讓你在新規則與啟發法出現時迅速編入系統,避免一再犯錯。

  • 不適用情況:若環境固定不變,例如將會議逐字稿轉換為標準化摘要,持續調整能帶來的效益非常有限。

挑戰與風險因素

理論上,這一切看來前景可期,但導入 SPL 確實面臨不少挑戰。以下探討幾項主要挑戰:

無法收斂

在策略生成初期,進展經常停滯:新輸出無法延續先前成果,推進速度也隨之放緩。這通常源自兩項主要問題:

    • 解決方案:預先編入所有可用的業務知識,讓系統有充足深度可供運用。

    • 解決方案:設計細緻的評分規準,從準確性、清晰度與相關性等多個層面評量答案,並調整取樣方式以反映這些訊號。

策略爆炸

如果系統產生數百項策略,卻只有極少回饋可用來區分優劣,取樣很快就會變得難以管理。解決之道是剪枝。

改良策略庫時,請考量:

  • 存續期:策略一旦超過指定期限或生成次數,就將其淘汰。

  • 分數:利用評估規準,篩除表現持續不佳的策略。搭配存續期機制,便能確保只保留長期證明有價值的方法。

  • LLM 評審:定期評估策略,找出無法再提供獨特見解的項目,因為其中有用的元素很可能已被新版策略吸收。

解決方案:將策略資料庫視為持續演化的系統:定期剪枝,只留下相關且高價值的知識。

結論

系統提示詞學習仍處於萌芽階段,但潛力極為可觀。只依賴靜態提示詞或無止境微調的企業,將面臨熟悉的限制:系統脆弱、成本攀升,以及心力白費。SPL 建立能隨時間改善的系統,並編入高階原則而非零散修補措施,藉此打破這種循環。

SPL 仍在發展,但趨勢已十分明確:能自我學習的系統,將超越無法自我學習的系統。現在正是展開實驗的時機:從小處著手、記錄經驗,並為能在每次互動中持續改善的 AI 系統奠定基礎。

作者

George Williamson