Har du varit med om att en viss prompt fungerar bra, för att sedan plötsligt sluta fungera?
Har du fastnat i en ständig cykel av att lappa och laga din systemprompt för att förbättra resultaten, men inget tycks fungera?
Systempromptinlärning kan vara precis vad du behöver.
Systempromptinlärning (SPL) är ett framväxande intresseområde inom AI-världen och gjordes allmänt känt av Andrej Karpathy på X i maj.
Systempromptinlärning hanterar begränsningarna hos rigida och sårbara AI-system som bygger på statiska systemprompter eller otympliga lösningar för finjustering. Det ger ytterligare ett sätt att stödja kontinuerligt lärande i AI-system.
Innan vi går vidare ska vi kort gå igenom grunderna i promptutformning.
När vi utvecklar en Agent eller en anpassad Modell måste vi först utforma två centrala komponenter:
En systemprompt
En användarprompt
Systemprompter fastställer grundreglerna för hur en Modell ska bete sig. När de skrivs för anpassade AI-lösningar börjar de ofta ungefär så här:
“You are an intelligent assistant. Your role is to perform <insert task here>.
You must not do (A), (B), or (C).”
Användarprompter innehåller däremot vanligtvis användarens fråga och annan relevant information, till exempel tidszon och preferenser. En användarprompt kan se ut så här:


I’m in the capital city of Portugal. Can you suggest some things I can do tonight?
Läckta systemprompter har blivit vanliga efter att stora AI-labb släppt nya Modeller, eftersom användare använder jailbreak på chattbottar för att avslöja deras bakomliggande instruktioner. Ett populärt GitHub-förvar samlar nu många av dessa systemprompter på ett ställe. De avslöjar den ”hemliga ingrediens” som AI-labben med tiden har utvecklat för att främja ett lämpligt Modellbeteende. Den nyligen läckta systemprompten för GPT-5 (avslöjad i ChatGPT) innehåller exempelvis cirka 6 000 ord. Det visar hur mycket kunskap och vägledning som måste kodas in för att forma systemets beteende.
Dessa omfattande systemprompter täcker vanligtvis flera centrala områden, till exempel:
Sökinstruktioner
Verktygsdefinitioner
Användarpreferenser
Instruktioner för källhänvisningar
Snabba korrigeringar av kända problem
I praktiken lappar utvecklare av anpassade AI-system systemprompterna manuellt i flera omgångar medan de testar och förfinar sina tillämpningar, främst med hjälp av utvärderingar för att styra förbättringsarbetet.
Andra sätt att styra en Modells beteende är:
Promptutformning, inklusive hämtningsförstärkt generering (RAG), som styr vilket innehåll en Modell får tillgång till
Finjustering (direkt ändring av Modellens underliggande vikter)
Tänk om det fanns ett annat sätt att påverka Modellens beteende? Föreställ dig ett system som dynamiskt lär sig och förfinar sin egen systemprompt med hjälp av tidigare genererade tankar, planer och strategier. Det skulle kunna använda både användarfeedback och utvärderingar med LLM som domare för att bedöma sina utdata.
Tänk på en återkommande verksamhetsutmaning som du vill automatisera med hjälp av ett Agentbaserat system. Effektiva lösningar kräver förmåga till Resonemang utöver grundläggande automatisering av arbetsflöden. I sådana fall är det avgörande att lägga till en komponent för plangenerering i AI-systemet. Då kan systemet arbeta med flera Agenter på olika sätt beroende på uppgiften. Enskilda steg kan innehålla instruktioner för att använda andra Agenter till deluppgifter eller för att använda verktyg.


Obs! Ett Agentverktyg är en extern funktion, ett API eller en resurs som en AI-Agent kan anropa för att gå bortom text och utföra verkliga åtgärder.
Du kan välja att ”så” Modellens systemprompt med en plan som följer de logiska steg en människa skulle ta, även om LLM:er vanligtvis behöver mer specifik vägledning om verktygsanvändning, utdataformat och relaterade krav. Ibland är den optimala strategin oklar. Det kan också handla om ett problem som inte har omprövats eftersom det tidigare ansågs vara löst. Det är här systempromptinlärning (SPL) kommer in i bilden.
SPL förbättrar en systemprompt stegvis genom att införliva tidigare genererade strategier. När nya problem uppstår samlar systemet gradvis på sig kunskap och blir mer robust. Se det som att bygga en handbok för problemlösning inom ditt område.
SPL införlivar gradvis insikter från användarfeedback i systemprompten. När systemet mognar kan du upptäcka återkommande problem som kan sammanfattas till mer generella och övergripande principer.
Låt oss titta närmare på hur processen fungerar, steg för steg:
Börja med användarens fråga, där systemet ombeds att utföra en viss uppgift.
Om systemet bara hanterar ett problem kan du använda en ”girig” metod och välja strategierna med högst poäng från tidigare körningar. Alternativt kan du uppmuntra utforskning genom att göra urval från en fördelning som gynnar högt betygsatta strategier men ibland även tar med lägre betygsatta alternativ. Detta är särskilt användbart när du precis har börjat samla in strategier.
För system som ska hantera varierande problemområden kan du lägga till ett klassificeringslager eller använda inbäddningar och cosinuslikhet – samma tekniker som vanligtvis används i RAG – för att hitta relevanta metoder. Det hjälper dig att välja strategier som passar det specifika problemet, till exempel strategier anpassade för kodningsuppgifter.
Obs! Inbäddningar som används med cosinuslikhet gör det möjligt att mäta hur nära två informationsmängder är relaterade. Det blir då enklare att matcha dokument, frågor eller idéer även om formuleringarna skiljer sig åt.
Exempel på en utgångspunkt för ett förenklat strategilager för kodningsproblem.
Obs! De ”startstrategier” som visas här är endast illustrativa. I verkliga kodningsscenarier skulle vi förfina dem ytterligare. Nischade verksamhetsproblem skulle kräva att fler insikter samlas in över tid.
Generation_id (omvänd ordning) | Ämne | Poäng | Strategy_text | Förklaring |
|---|---|---|---|---|
4 | kodning | 1 | Förstå problemet, begränsningarna och specialfallen. Utforma en algoritm med rätt datastrukturer. Validera planen med exempel och invarianta villkor. Implementera ren och lättläst kod. Förfina genom refaktorisering, optimering och slutlig formatering. Verktygsanvändning: När du använder ett verktyg ska du kort förklara varför det behövdes. | Införlivar och kombinerar de bästa delarna av de tre strategierna nedan. |
3 | kodning | 1 | Förstå problemet, begränsningarna och specialfallen. Utforma en algoritm med rätt datastrukturer. Validera planen med exempel och invarianta villkor. Implementera ren och lättläst kod. Förfina genom refaktorisering, optimering och slutlig formatering. | En mer heltäckande strategi, men den saknar vägledning om verktygsanvändning. |
2 | kodning | -1 | Förstå problemet, begränsningarna och specialfallen. Utforma en algoritm med rätt data. Implementera ren och lättläst kod. Verktygsanvändning: när du använder verktyg ska du kort sammanfatta varför du använde verktyget. | En bättre strategi som nämner verktygsanvändning men fortfarande kan förbättras. |
1 | kodning | -1 | Skumma igenom problemet. Lös problemet. Skapa minimala tester. Skicka in vad som än går att köra. | Nämner tester men är överlag en svag strategi. |
3. När du har valt ut N strategier införlivar du dem i systemprompten. Detta förankrar plangenereringen i tidigare expertfeedback i stället för att låta Modellen skapa planer med minimal vägledning. Uppmuntra Modellen att ”tänka utanför ramarna” och lägga till steg när det behövs, i stället för att bara kopiera exempelstrategier ordagrant.


4. Använd den dynamiskt skapade systemprompten för att generera en ny strategi som hanterar användarens förfrågan. Denna process bör leda till fler uppgifter som förbättrar slutresultatet. Målet är kreativitet: kombinera de bästa delarna av tidigare strategier, slå ihop överlappande steg och lägg till nya användbara steg där det behövs.
Obs! Kom ihåg att temperatur är en parameter som kan justeras för att skapa mer varierade och mindre deterministiska utdata, vilket är användbart när kreativitet eftersträvas. Med en temperatur över noll kan varje genererad plan bli annorlunda.
5. När du har fått Modellens utdata utvärderar du dem med hjälp av antingen en mänsklig bedömare eller en LLM-domare, utifrån särskilda kriterier som definierar en bra lösning på problemet. För exemplet med aktiviteter i Portugal som nämndes tidigare kan utvärderingskriterierna vara:
Kortfattat svar (begränsat till en mening)
Den föreslagna aktivitetens relevans
Korrekt plats
6. Använd utvärderingen som grund och låt en annan Modell förfina strategin. En valfri återkopplingsslinga kan ta in synpunkter från människor och stödja gemensamma förbättringar. Spara den förfinade strategin i databasen med lämpliga metadata så att versioner och ändringar kan spåras.


Varför ska man då göra sig allt detta besvär? Du skulle kunna granska utdata manuellt och anpassa systemprompten efter dem. Kraftfulla Modeller för Resonemang kan dock förfina strategier med hjälp av både utdatasammanhang och mänsklig feedback. Människor kan lätt upptäcka brister i enkla metoder, men i komplexa system som hanterar bredare problemområden blir det både svårt och tidskrävande.
LLM:er behöver ofta detaljerade instruktioner och ytterligare steg för att samla in den kontextuella kunskap som människor tar med sig naturligt till ett problem. Antalet uppgifter som krävs kan växa snabbt när ett system utökas för att hantera bredare problemområden. Människor som löser kodningsproblem kan till exempel intuitivt förstå den omgivande kodbasen, medan en LLM först kan behöva ”läsa” flera filer.
När det hjälper: Anta att du leder ett kundsupportteam och att en AI-Agent prioriterar supportärenden. Med tiden kan SPL upptäcka en kategoriseringsmetod som teamet inte hade övervägt och därmed minska andelen eskalerade ärenden.
När det inte hjälper: Om efterlevnadskrav eller regler redan definierar arbetsflödena, till exempel vid finansiell rapportering, kan SPL ge begränsat värde eftersom kreativitet blir en risk snarare än en tillgång.
När det hjälper: I forskningsintensiva roller, exempelvis marknadsanalys eller produktstrategi, kan du samarbeta med AI-systemet genom att förfina dess planer, berika dess utdata och införliva förbättringarna för framtida bruk. Varje interaktion gör systemet effektivare.
När det inte hjälper: Om teamet främst använder AI för enkla arbetsflöden med minimala mänskliga insatser, exempelvis fakturahantering, kan samarbetskostnaden överstiga nyttan.
När det hjälper: Anta att ni expanderar till en ny region och att AI-systemet plötsligt måste hantera lokala skattefrågor. Med SPL kan du snabbt koda in nya regler och tumregler när de uppstår och därmed förhindra återkommande fel.
När det inte hjälper: Om miljön är statisk, till exempel när mötestranskriptioner omvandlas till standardiserade sammanfattningar, ger ständig anpassning mycket liten nytta.
I teorin låter allt detta lovande, men det finns verkliga utmaningar med att införa SPL. Nedan tar vi upp några av de viktigaste:
I de tidiga faserna av strategigenereringen stannar utvecklingen ofta av: nya utdata bygger inte vidare på tidigare resultat och framstegen bromsar in. Det beror vanligtvis på två huvudsakliga problem:
Lösning: Koda in all tillgänglig verksamhetskunskap från början så att systemet har ett gediget underlag att utgå från.
Lösning: Utforma en nyanserad bedömningsmatris som poängsätter flera aspekter av ett svar, exempelvis korrekthet, tydlighet och relevans, och anpassa urvalet efter dessa signaler.
Om systemet genererar hundratals strategier men får för lite feedback för att skilja bra från dåliga blir urvalet snabbt ohanterligt. Lösningen är gallring.
Tänk på följande när du förfinar strategilagret:
Livslängd: Avveckla strategier när de överskrider en fastställd tidsperiod eller ett visst antal generationer.
Poäng: Använd bedömningsmatrisen för att filtrera bort strategier som genomgående ger svaga resultat. I kombination med livslängden säkerställer detta att du bara behåller metoder som visar sitt värde över tid.
LLM-bedömning: Utvärdera regelbundet strategierna för att hitta sådana som inte längre tillför unika insikter, eftersom deras användbara delar sannolikt redan har införlivats i nyare versioner.
Lösning: Behandla strategidatabasen som ett levande system: gallra den regelbundet så att bara relevant och värdefull kunskap finns kvar.
Systempromptinlärning är fortfarande i sin linda, men potentialen är enorm. Företag som enbart förlitar sig på statiska prompter eller ändlös finjustering kommer att möta välkända begränsningar: sårbara system, stigande kostnader och bortkastat arbete. SPL erbjuder en väg ut ur den cykeln genom att bygga system som förbättras över tid och kodar in övergripande principer i stället för enskilda korrigeringar.
SPL är fortfarande under utveckling, men riktningen är tydlig: system som kan lära av sig själva kommer att gå om dem som inte kan det. Nu är det dags att experimentera, börja i liten skala, dokumentera lärdomar och lägga grunden för AI-system som förbättras vid varje interaktion.