系統提示詞學習:AI 系統的新範式

系統提示詞學習可協助團隊改善 AI 行為,毋須重新訓練模型,並讓各項限制更易理解。

你是否曾遇過某個提示詞本來效果很好,卻突然失效?

你是否曾為了改善結果而不斷修補系統提示詞,陷入循環,最終卻發現怎樣做都不奏效?

系統提示詞學習或許正是你所需要的方法。

系統提示詞學習(SPL)是 AI 社群新近關注的領域,並於 5 月經 Andrej Karpathy 在 X 上廣泛推廣

系統提示詞學習旨在克服依賴靜態系統提示詞或繁複微調設定的 AI 系統缺乏彈性、容易失效等限制。這為 AI 系統持續學習提供了另一種方法。

深入探討之前,先簡單重溫提示詞的一些基本概念。

開發智能代理或自訂模型時,我們首先要設計兩個關鍵部分:

  1. 系統提示詞

  2. 使用者提示詞

系統提示詞為模型應有的行為訂立基本規則。為自訂 AI 解決方案撰寫時,開首通常類似這樣:

「你是一位智能助理。你的職責是執行 <在此插入任務>。

你不得執行 (A)、(B) 或 (C)。」

相比之下,使用者提示詞通常包含使用者的查詢及其他相關資料,例如時區和偏好。使用者提示詞可能如下:

說明引言的螢幕截圖。

我身處葡萄牙的首都。你可以建議我今晚參加哪些活動嗎?

大型 AI 實驗室推出新模型後,系統提示詞洩漏已很常見,因為使用者會對聊天機械人進行越獄,令其披露底層指令。現時有一個熱門 GitHub 程式碼庫集中收錄了許多這類系統提示詞。這些提示詞揭示了 AI 實驗室多年來為引導模型作出恰當行為而研發的「獨門秘方」。例如,近期洩漏的 GPT-5 系統提示詞(於 ChatGPT 中曝光)約有 6,000 字,反映塑造系統行為需要編入大量知識和指引。

這些全面的系統提示詞通常涵蓋多個重點範疇,例如:

  • 搜尋指令

  • 工具定義

  • 使用者偏好

  • 引用指令

  • 已知問題的快速修補方案

實際開發自訂 AI 系統時,開發人員會一邊測試和改良應用程式,一邊手動反覆修補系統提示詞,並主要以評估引導改善過程。

引導模型行為的其他方法包括:

  • 提示工程,包括控制提供予模型之內容的檢索增強生成(RAG)

  • 微調(直接改變模型的底層權重)

如果還有另一種方法可影響模型行為呢?試想像一個系統,能運用過往生成的思路、計劃和策略,動態學習並改良自身的系統提示詞。它可以同時參考使用者意見和由 LLM 擔任評審的評估,以衡量輸出成果。

甚麼是系統提示詞學習?

試想一項你希望透過智能代理系統自動處理的長期業務挑戰。有效的解決方案需要超越基本工作流程自動化的推理能力。在這類情況下,AI 系統必須加入計劃生成組件。這讓系統可根據任務,以不同方式配合多個智能代理運作。個別步驟可包括存取其他智能代理以完成子任務,或使用工具。

說明系統提示詞學習的螢幕截圖。

注意:智能代理的工具是指 AI 智能代理可調用的任何外部函數、API 或資源,讓它突破純文字限制並採取實際行動。

你可以選擇以人類會依循的邏輯步驟,將計劃「植入」模型的系統提示詞;不過,LLM 通常需要更明確的工具使用、輸出格式及相關要求指引。有時最佳策略並不明確,又或者你所處理的問題過往被視為已解決,因此一直未有重新評估。這正是系統提示詞學習(SPL)可派上用場之處。

SPL 透過納入以往生成的策略,反覆改善系統提示詞。隨着新問題出現,系統會逐步累積知識,變得更加穩健。你可視之為建立一本處理所屬領域問題的手冊。

SPL 逐步把來自使用者意見的見解納入系統提示詞。隨着系統日漸成熟,你可能會發現反覆出現的問題,並將其歸納成更通用、更高層次的原則。

逐步指南

以下逐步深入了解整個過程的運作方式:

  1. 先從使用者查詢開始,要求系統執行特定任務。

    1. 若系統只處理一類問題,你可採用「貪婪」方法,選擇過往運行中得分最高的策略。另一種方法是從偏重高評分策略、但偶爾亦包括較低評分策略的分佈中抽樣,以鼓勵探索。這在剛開始收集策略時尤其有用。

    2. 對於旨在處理不同問題集的系統,可考慮加入分類層,或運用嵌入餘弦相似度(即 RAG 常用的技術)找出相關方法。這有助選出適合特定問題的策略,例如專為編程任務而設的策略。

注意:嵌入配合餘弦相似度,可量度兩項資料的關聯程度,即使具體措辭不同,也能更輕易配對文件、查詢或概念。

處理編程問題的簡化策略庫起始範例。

注意:此處所示的「種子策略」只供說明。在實際編程情境中,我們會進一步改良這些策略。對於特定的業務問題,則需要隨時間收集更多見解。

Generation_id(倒序)

主題

分數

Strategy_text

說明

4

編程

1

了解問題、限制和邊緣情況。 使用合適的資料結構設計演算法。 根據範例和不變條件驗證計劃。 編寫整潔易讀的程式碼。 透過重構、最佳化和最終格式設定加以改良。 使用工具:使用工具時,簡要說明為何需要該工具。

納入並融合以下三項策略中最出色的元素。

3

編程

1

了解問題、限制和邊緣情況。 使用合適的資料結構設計演算法。 根據範例和不變條件驗證計劃。 編寫整潔易讀的程式碼。 透過重構、最佳化和最終格式設定加以改良。

策略較為全面,但沒有工具使用指引。

2

編程

-1

了解問題、限制和邊緣情況。 使用合適的資料設計演算法。 編寫整潔易讀的程式碼。 使用工具:存取工具時,簡要說明使用該工具的原因。

這項較佳的策略提及工具使用,但仍有改善空間。

1

編程

-1

略讀問題。 解決問題。 建立最基本的測試。 提交任何能運行的成果。

提及測試,但整體策略薄弱。

3. 抽樣選出 N 項策略後,將其納入系統提示詞。這讓計劃生成以過往專家意見為依據,而非只給模型最低限度的指引,任由它自行建立計劃。鼓勵模型「跳出框框思考」,並按需要加入步驟,而非逐字照抄範例策略。

說明逐步指南的螢幕截圖。

4. 運用動態建立的系統提示詞,生成新策略來處理使用者的要求。這個過程應產生更多有助改善最終輸出的任務。目標是發揮創意:融合過往策略中最出色的元素、整合重疊步驟,並按需要加入有用的新步驟。

注意:請緊記,溫度是一項可調整的參數,能產生更多樣化、確定性較低的輸出,適合需要創意的情況。當溫度不為零時,每次生成的計劃都可能不同。

5. 收到模型輸出後,根據界定優良解決方案的特定準則,由人工評審或 LLM 評審進行評估。以上述葡萄牙活動範例為例,評估準則可包括:

  • 簡潔程度(答案限於一句)

  • 建議活動的相關程度

  • 地點準確度

6. 根據這項評估,使用另一個模型改良策略。亦可選擇加入意見回饋循環,納入人工意見並支援協作改善。把改良後的策略連同適當的中繼資料儲存於資料庫,以追蹤版本和變更。

說明逐步指南的螢幕截圖。

那麼,為何要大費周章完成這一切?你大可手動審閱輸出,再相應調整系統提示詞。然而,強大的推理模型可同時運用輸出內容和人工意見改良策略。人類很容易察覺簡單方法的缺陷,但面對處理廣泛問題的複雜系統,要找出問題便會變得困難而繁瑣。

人類處理問題時會自然運用背景知識,LLM 則往往需要詳細指令和額外步驟才能收集這些知識。隨着系統擴展至處理更廣泛的問題,所需任務數量可能迅速增加。例如,人類處理編程問題時,或可憑直覺理解相關程式碼庫,LLM 則可能要先「閱讀」多個檔案。

在 AI 解決方案中實施 SPL 的影響

探索解決問題的新方法

  • 適用情況:假設你管理客戶支援團隊,並由 AI 智能代理為支援請求分類。SPL 或會逐步發現團隊未曾考慮的分類方法,從而降低問題升級處理的比率。

  • 不適用情況:若合規要求或法規已界定工作流程(例如財務報告),創意便會由優勢變成風險,因此 SPL 的價值可能有限。

加強人機協作

  • 適用情況:在研究密集的職務中(例如市場情報或產品策略),你可透過改良 AI 的計劃、充實其輸出,並保留這些改善供日後使用,與 AI 協作。每次互動都能提升系統效能。

  • 不適用情況:若團隊主要使用 AI 處理毋須多少人工參與的簡單工作流程(例如發票處理),協作成本可能高於效益。

適應新問題

  • 適用情況:假設業務拓展至新地區,AI 突然要處理當地稅務查詢。SPL 可讓你在新規則和經驗法則出現時迅速將其編入系統,避免一再犯錯。

  • 不適用情況:若環境固定不變,例如把會議謄本轉換成標準格式的摘要,持續適應的效益便非常有限。

挑戰與風險因素

理論上,這一切相當可取,但實施 SPL 確實面對不少挑戰。以下探討其中幾項主要挑戰:

未能收斂

在策略生成初期,進展往往停滯:新的輸出未能承接以往成果,令改善步伐放緩。這通常由兩個主要問題引起:

    • 解決方案:預先編入所有可用的業務知識,讓系統有足夠深度可供運用。

    • 解決方案:設計細緻的評分準則,從準確度、清晰度和相關程度等多方面評分,並調整抽樣方式以反映這些訊號。

策略爆炸式增長

如果系統生成數百項策略,卻只收到很少意見來分辨優劣,抽樣很快便會變得難以管理。解決方法是修剪策略。

改良策略庫時,可考慮:

  • 生命週期:策略超過指定期限或生成次數後,便將其淘汰。

  • 分數:利用評估準則,篩除表現持續欠佳的策略。配合生命週期機制,可確保只保留長期證明有價值的方法。

  • LLM 評審:定期評估策略,找出已無法提供獨特見解的項目,因為其有用元素很可能已被較新版本吸收。

解決方案:把策略資料庫視為持續演進的系統,定期加以修剪,只保留相關且高價值的知識。

總結

系統提示詞學習仍在起步階段,但潛力龐大。只依賴靜態提示詞或無止境微調的企業,將會遇上熟悉的限制:系統脆弱、成本日增,以及白費心力。SPL 可建立隨時間改善的系統,編入更高層次的原則,而非零散的修補方案,從而擺脫這個循環。

SPL 仍在發展,但趨勢已很明確:能夠自我學習的系統將超越無法自我學習的系統。現在正是開始試驗的時候:由小規模着手、記錄經驗,並為每次互動都能持續改善的 AI 系統奠定基礎。

作者

George Williamson