Pangunahing nabigasyon

System prompt learning: isang bagong paradigma para sa mga AI system

Tinutulungan ng system prompt learning ang mga team na pahusayin ang pagkilos ng AI nang hindi muling sinasanay ang mga modelo, habang ginagawang mas madaling maunawaan ang mga limitasyon.

Naranasan mo na bang gumana nang mahusay ang isang prompt, pero bigla na lang itong hindi gumana?

Naranasan mo na bang paulit-ulit na ayusin ang iyong system prompt para mapahusay ang mga resulta, pero wala pa ring gumagana?

Maaaring system prompt learning mismo ang kailangan mo.

Ang system prompt learning (SPL) ay isang umuusbong na larangan ng interes sa komunidad ng AI at malawak na pinasikat ni Andrej Karpathy sa X noong Mayo.

Tinutugunan ng system prompt learning ang mga limitasyon ng mahihigpit at madaling masirang AI system na umaasa sa mga static na system prompt o mahirap pangasiwaang fine-tuning setup. Nagbibigay ito ng isa pang paraan upang suportahan ang tuloy-tuloy na pagkatuto sa mga AI system.

Bago tayo magsimula, balikan muna natin nang maikli ang ilang batayan ng prompting.

Kapag bumubuo ng agent o custom na modelo, kailangan muna nating idisenyo ang dalawang pangunahing bahagi:

  1. Isang system prompt

  2. Isang user prompt

Itinatakda ng mga system prompt ang mga pangunahing tuntunin kung paano dapat kumilos ang isang modelo. Kapag isinulat para sa mga custom na solusyon sa AI, madalas na nagsisimula ang mga ito sa ganito:

“You are an intelligent assistant. Your role is to perform <insert task here>.

You must not do (A), (B), or (C).”

Samantala, ang mga user prompt ay karaniwang naglalaman ng tanong ng user at iba pang mahalagang impormasyon, gaya ng kanilang time zone at mga kagustuhan. Maaaring ganito ang isang user prompt:

Screenshot na nagpapakita ng introduksiyon.

I’m in the capital city of Portugal. Can you suggest some things I can do tonight?

Naging karaniwan ang pagtagas ng mga system prompt matapos maglabas ng bagong modelo ang malalaking AI lab, dahil gumagamit ang mga user ng jailbreak sa mga chatbot upang ibunyag ang mga nakapaloob na tagubilin ng mga ito. Pinagsasama-sama na ngayon ng isang sikat na GitHub repository ang marami sa mga system prompt na ito sa iisang lugar. Ibinubunyag ng mga ito ang “lihim na sangkap” na binuo ng mga AI lab sa paglipas ng panahon upang hikayatin ang angkop na pagkilos ng modelo. Halimbawa, ang kamakailang nag-leak na system prompt ng GPT-5 (nabunyag sa ChatGPT) ay may humigit-kumulang 6,000 salita, na nagpapakita kung gaano karaming kaalaman at gabay ang kailangang i-encode upang hubugin ang pagkilos ng system.

Karaniwang sinasaklaw ng mga komprehensibong system prompt na ito ang ilang pangunahing larangan, gaya ng:

  • Mga tagubilin sa paghahanap

  • Mga depinisyon ng tool

  • Mga kagustuhan ng user

  • Mga tagubilin sa pagsipi

  • Mabilisang pag-aayos para sa mga kilalang problema

Sa aktuwal na paggamit, manu-mano at paulit-ulit na inaayos ng mga developer ng custom na AI system ang mga system prompt habang sinusubukan at pinapahusay nila ang kanilang mga application, gamit pangunahin ang mga eval bilang gabay sa prosesong ito.

Kabilang sa iba pang paraan ng paggabay sa pagkilos ng isang modelo ang:

  • Prompt engineering, kabilang ang retrieval-augmented generation (RAG), na kumokontrol sa content na ibinibigay sa isang modelo

  • Fine-tuning (direktang pagbabago sa mga pinagbabatayang weight ng modelo)

Paano kung may iba pang paraan upang maimpluwensiyahan ang pagkilos ng modelo? Isipin ang isang system na kusang natututo at pinapahusay ang sarili nitong system prompt gamit ang mga naunang nabuong kaisipan, plano, at estratehiya. Maaari nitong gamitin ang feedback ng user at mga pagsusuri ng LLM-as-a-judge upang tasahin ang mga output nito.

Ano ang system prompt learning?

Isaalang-alang ang isang paulit-ulit na hamon sa negosyo na gusto mong i-automate gamit ang agentic system. Nangangailangan ang mabisang solusyon ng kakayahan sa pangangatwiran na higit pa sa karaniwang workflow automation. Sa ganitong mga sitwasyon, mahalagang magsama ng bahaging bumubuo ng plano sa iyong AI system. Nagbibigay-daan ito sa system na gumamit ng maraming agent sa iba't ibang paraan depende sa gawain. Maaaring kasama sa bawat hakbang ang mga tagubilin sa pag-access ng ibang agent upang tapusin ang mga subtask o paggamit ng mga tool.

Screenshot na nagpapaliwanag kung ano ang system prompt learning.

Tandaan: Ang tool ng agent ay anumang external function, API, o resource na maaaring tawagin ng isang AI agent upang gumawa ng higit pa sa teksto at magsagawa ng mga tunay na pagkilos.

Maaari mong piliing “simulan” ang system prompt ng modelo gamit ang planong sumusunod sa lohikal na mga hakbang na gagawin ng tao, bagama't karaniwang kailangan ng mga LLM ng mas tiyak na gabay sa paggamit ng tool, pag-format ng output, at mga kaugnay na kinakailangan. Kung minsan, maaaring hindi malinaw ang pinakamahusay na estratehiya, o maaaring tinutugunan mo ang isang problemang hindi na muling nasuri dahil dati itong itinuring na nalutas na. Dito pumapasok ang system prompt learning (SPL).

Paulit-ulit na pinapahusay ng SPL ang isang system prompt sa pamamagitan ng pagsasama ng mga naunang nabuong estratehiya. Habang lumilitaw ang mga bagong problema, unti-unting nag-iipon ng kaalaman ang system at nagiging mas matatag. Isipin ito bilang pagbuo ng handbook para sa paglutas ng mga problema sa iyong larangan.

Unti-unting isinasama ng SPL sa system prompt ang mga insight mula sa feedback ng user. Habang umuunlad ang iyong system, maaari kang makatuklas ng mga umuulit na problemang maaaring gawing mas pangkalahatan at mas mataas na antas na mga prinsipyo.

Sunod-sunod na gabay

Tingnan natin nang mas malapitan kung paano gumagana ang proseso, hakbang-hakbang:

  1. Magsimula sa query ng user, na humihiling sa system na magsagawa ng isang partikular na gawain.

    1. Kung iisang problema lang ang tinutugunan ng iyong system, maaari kang gumamit ng “greedy” na pamamaraan sa pamamagitan ng pagpili sa mga estratehiyang may pinakamataas na score mula sa mga naunang run. Bilang alternatibo, maaari mong hikayatin ang paggalugad sa pamamagitan ng pag-sample mula sa distribution na pumapabor sa matataas ang rating na estratehiya habang paminsan-minsang nagsasama ng mas mababa ang rating. Lalo itong kapaki-pakinabang kapag nagsisimula ka pa lang mangolekta ng mga estratehiya.

    2. Para sa mga system na idinisenyong humawak ng iba't ibang hanay ng problema, pag-isipang magdagdag ng classification layer o gumamit ng mga embedding at cosine similarity—ang parehong mga teknik na karaniwang ginagamit sa RAG—upang matukoy ang mga kaugnay na pamamaraan. Nakakatulong ito sa pagpili ng mga estratehiyang angkop sa partikular na problema—halimbawa, mga estratehiyang iniakma para sa mga gawain sa coding.

Tandaan: Ang mga embedding na ginagamit kasama ng cosine similarity ay nagbibigay-daan upang masukat kung gaano kalapit ang ugnayan ng dalawang impormasyon, kaya mas madaling itugma ang mga dokumento, query, o ideya kahit magkaiba ang eksaktong pagkakasulat ng mga ito.

Halimbawang panimulang punto para sa isang pinasimpleng strategy store sa paglutas ng mga problema sa coding.

Tandaan: Mga halimbawa lamang ang “seed strategy” na ipinapakita rito. Sa mga tunay na sitwasyon sa coding, higit pa naming papahusayin ang mga ito. Kakailanganin sa mga espesyalisadong problema sa negosyo ang pangangalap ng mga karagdagang insight sa paglipas ng panahon.

Generation_id (pabaligtad na pagkakasunod-sunod)

Paksa

Score

Strategy_text

Paliwanag

4

coding

1

Unawain ang problema, mga limitasyon, at edge case. Magdisenyo ng algorithm gamit ang mga tamang data structure. I-validate ang plano gamit ang mga halimbawa at invariant. Magpatupad ng malinis at madaling basahing code. Pahusayin sa pamamagitan ng refactoring, optimization, at panghuling pag-format. Paggamit ng tool: Kapag gumagamit ng tool, ipaliwanag nang maikli kung bakit ito kinailangan.

Isinasama at pinag-uugnay ang pinakamahuhusay na bahagi ng tatlong estratehiya sa ibaba.

3

coding

1

Unawain ang problema, mga limitasyon, at edge case. Magdisenyo ng algorithm gamit ang mga tamang data structure. I-validate ang plano gamit ang mga halimbawa at invariant. Magpatupad ng malinis at madaling basahing code. Pahusayin sa pamamagitan ng refactoring, optimization, at panghuling pag-format.

Mas komprehensibong estratehiya, ngunit walang gabay sa paggamit ng tool.

2

coding

-1

Unawain ang problema, mga limitasyon, at edge case. Magdisenyo ng algorithm gamit ang tamang data. Magpatupad ng malinis at madaling basahing code. Paggamit ng tool: kapag nag-a-access ng mga tool, magbigay ng maikling buod kung bakit mo ginamit ang tool na iyon.

Mas mahusay na estratehiyang binabanggit ang paggamit ng tool, ngunit maaari pa ring pagbutihin.

1

coding

-1

Basahin nang mabilis ang problema. Lutasin ang problema. Gumawa ng kaunting test. Isumite ang anumang gumagana.

Binabanggit ang mga test ngunit mahina ang kabuuang estratehiya.

3. Pagkatapos mag-sample ng N, isama ang mga ito sa system prompt. Ibinabatay nito ang pagbuo ng plano sa naunang feedback ng mga eksperto sa halip na hayaang gumawa ang modelo ng mga plano na kakaunti ang gabay. Hikayatin ang modelo na “mag-isip nang malikhain” at magdagdag ng mga hakbang kung kinakailangan sa halip na kopyahin lamang nang eksakto ang mga halimbawang estratehiya.

Screenshot na nagpapakita ng sunod-sunod na gabay.

4. Gamit ang iyong dynamic na ginawang system prompt, bumuo ng bagong estratehiya upang tugunan ang kahilingan ng user. Dapat makabuo ang prosesong ito ng mga karagdagang gawain na magpapahusay sa panghuling output. Pagkamalikhain ang layunin: pagsamahin ang pinakamahuhusay na bahagi ng mga naunang estratehiya, pag-isahin ang magkakaparehong hakbang, at magdagdag ng mga kapaki-pakinabang na bagong hakbang kung kailangan.

Tandaan: Ang temperature ay isang parameter na maaaring isaayos upang makagawa ng mas sari-sari at hindi gaanong tiyak na mga output, na kapaki-pakinabang kapag kailangan ang pagkamalikhain. Kapag hindi zero ang temperature, maaaring magkakaiba ang bawat nabuong plano.

5. Matapos matanggap ang output ng modelo, ipasuri ito sa isang tao o LLM judge batay sa mga tiyak na pamantayang naglalarawan ng mahusay na solusyon sa iyong problema. Para sa halimbawa ng mga aktibidad sa Portugal na nabanggit kanina, maaaring kabilang sa mga pamantayan sa pagsusuri ang:

  • Pagiging maikli (limitado sa isang pangungusap ang sagot)

  • Kaugnayan ng iminungkahing aktibidad

  • Katumpakan ng lokasyon

6. Batay sa pagsusuring ito, gumamit ng ibang modelo upang pahusayin ang estratehiya. Maaaring idagdag sa opsyonal na feedback loop ang input ng tao upang suportahan ang sama-samang pagpapahusay. I-store ang pinahusay na estratehiya sa iyong database kasama ang naaangkop na metadata upang masubaybayan ang mga bersyon at pagbabago.

Screenshot na nagpapakita ng sunod-sunod na gabay.

Kaya bakit kailangan pang pagdaanan ang lahat ng ito? Maaari mong manu-manong suriin ang mga output at iakma ang system prompt batay rito. Gayunman, kayang pahusayin ng malalakas na modelo ng pangangatwiran ang mga estratehiya gamit ang konteksto ng output at feedback ng tao. Bagama't madaling makakita ang tao ng mga kahinaan sa simpleng pamamaraan, nagiging mahirap at nakakapagod itong tukuyin sa mga komplikadong system na tumutugon sa mas malawak na hanay ng mga problema.

Madalas na kailangan ng mga LLM ang detalyadong tagubilin at mga karagdagang hakbang upang makuha ang kaalamang kontekstuwal na likas na naiaambag ng tao sa isang problema. Maaaring mabilis na dumami ang mga kinakailangang gawain habang lumalawak ang system upang tugunan ang mas maraming uri ng problema. Halimbawa, maaaring madaling maunawaan ng mga taong lumulutas ng problema sa coding ang nakapaligid na codebase, samantalang maaaring kailanganin muna ng LLM na “basahin” ang maraming file.

Ang epekto ng pagpapatupad ng SPL sa iyong mga solusyon sa AI

Pagtuklas ng mga bagong paraan upang lumutas ng mga problema

  • Kapag nakakatulong ito: Isipin na namamahala ka ng customer support team at isang AI agent ang nagsasagawa ng paunang pag-uuri ng mga ticket. Sa paglipas ng panahon, maaaring makatuklas ang SPL ng paraan ng pagkakategorya na hindi pa naisip ng iyong team, kaya nababawasan ang mga escalation.

  • Kapag hindi ito nakakatulong: Kung tinutukoy na ng mga kinakailangan sa compliance o regulasyon ang iyong workflow, gaya sa financial reporting, maaaring maliit lang ang maitutulong ng SPL dahil nagiging pananagutan sa halip na bentahe ang pagkamalikhain.

Pagpapahusay ng pagtutulungan ng tao at AI

  • Kapag nakakatulong ito: Sa mga tungkuling masinsin sa pananaliksik, gaya ng market intelligence o product strategy, maaari kang makipagtulungan sa AI sa pamamagitan ng pagpapahusay ng mga plano at output nito at pagsasama ng mga pagbabagong ito para magamit sa hinaharap. Pinapahusay ng bawat interaksyon ang pagiging epektibo ng system.

  • Kapag hindi ito nakakatulong: Kung pangunahing ginagamit ng iyong team ang AI para sa mga simpleng workflow na kakaunti ang input ng tao, gaya ng pagproseso ng invoice, maaaring mas mabigat ang dagdag na gawain sa pakikipagtulungan kaysa sa pakinabang.

Pag-angkop sa mga bagong problema

  • Kapag nakakatulong ito: Ipagpalagay na lumawak ka sa isang bagong rehiyon at biglang kailangang pangasiwaan ng AI ang mga tanong tungkol sa lokal na buwis. Binibigyang-daan ka ng SPL na mabilis na i-encode ang mga bagong tuntunin at heuristic habang lumilitaw ang mga ito, kaya naiiwasan ang paulit-ulit na pagkakamali.

  • Kapag hindi ito nakakatulong: Kung hindi nagbabago ang iyong kapaligiran, gaya ng pag-convert ng transcript ng meeting sa mga pamantayang buod, kakaunti lang ang pakinabang ng tuloy-tuloy na pag-angkop.

Mga hamon at salik ng panganib

Sa teorya, maganda ang lahat ng ito, ngunit may mga tunay na hamon sa pagpapatupad ng SPL. Tinatalakay namin sa ibaba ang ilan sa mga pangunahing hamon:

Kawalan ng convergence

Sa mga unang yugto ng pagbuo ng estratehiya, madalas na humihinto ang pag-usad: hindi napauunlad ng mga bagong output ang mga nauna, kaya bumabagal ang progreso. Karaniwang nagmumula ito sa dalawang pangunahing problema:

    • Solusyon: I-encode agad ang lahat ng available na kaalaman sa negosyo upang magkaroon ang system ng malalim na mapagkukunan.

    • Solusyon: Magdisenyo ng masusing rubric na nagbibigay ng score sa maraming aspekto ng sagot, gaya ng katumpakan, kalinawan, at kaugnayan, at iakma ang iyong sampling upang maipakita ang mga signal na ito.

Sobrang pagdami ng mga estratehiya

Kung bumubuo ang iyong system ng daan-daang estratehiya ngunit kakaunti ang feedback upang matukoy ang mabuti at masama, mabilis na nagiging mahirap pangasiwaan ang sampling. Pruning ang sagot.

Kapag pinapahusay ang iyong strategy store, isaalang-alang ang:

  • Tagal ng paggamit: Ihinto ang mga estratehiya kapag lumampas ang mga ito sa itinakdang panahon o bilang ng generation.

  • Score: Gamitin ang iyong evaluation rubric upang salain ang mga estratehiyang palaging mahina ang performance. Kapag pinagsama ito sa tagal ng paggamit, matitiyak na mga pamamaraang napatunayang mahalaga sa paglipas ng panahon lamang ang pananatilihin mo.

  • Pagsusuri ng LLM: Regular na tasahin ang mga estratehiya upang tukuyin ang mga hindi na nagbibigay ng natatanging insight, dahil malamang na naisama na sa mga bagong bersyon ang kapaki-pakinabang na bahagi ng mga ito.

Solusyon: Ituring ang iyong strategy database bilang isang buhay na system: regular itong i-prune upang ang may kaugnayan at mataas ang halagang kaalaman lang ang manatili.

Konklusyon

Nasa maagang yugto pa ang system prompt learning, ngunit napakalaki ng potensyal nito. Ang mga negosyong umaasa lamang sa mga static na prompt o walang katapusang fine-tuning ay haharap sa mga pamilyar na limitasyon: marurupok na system, tumataas na gastos, at nasasayang na pagsisikap. Nagbibigay ang SPL ng paraan upang makaalpas sa siklong iyon sa pamamagitan ng pagbuo ng mga system na gumagaling sa paglipas ng panahon at nag-e-encode ng mas mataas na antas na mga prinsipyo sa halip na hiwa-hiwalay na pag-aayos.

Umuusbong pa lang ang SPL, ngunit malinaw ang direksiyon nito: mahihigitan ng mga system na kayang matuto mula sa sarili ang mga hindi kaya. Ngayon na ang panahon upang mag-eksperimento, magsimula sa maliit, itala ang mga aral, at maglatag ng pundasyon para sa mga AI system na humuhusay sa bawat interaksyon.

May-akda

George Williamson