Uelekezaji mkuu

Ujifunzaji wa dokeza la mfumo: mtazamo mpya kwa mifumo ya AI

Ujifunzaji wa dokeza la mfumo husaidia timu kuboresha tabia ya AI bila kufunza miundo upya, huku ukirahisisha kuelewa mapungufu.

Je, umewahi kugundua kuwa dokeza fulani linafanya kazi vizuri, kisha ghafla likaacha kufanya kazi?

Je, umewahi kujikuta ukirekebisha dokeza lako la mfumo kila mara ili kuboresha matokeo, lakini hakuna kinachofanya kazi?

Huenda ujifunzaji wa dokeza la mfumo ndio hasa unaohitaji.

Ujifunzaji wa dokeza la mfumo (SPL) ni eneo jipya linalovutia jumuiya ya AI, na lilienezwa sana na Andrej Karpathy kwenye X mwezi Mei.

Ujifunzaji wa dokeza la mfumo hushughulikia mapungufu ya mifumo ya AI isiyonyumbulika na dhaifu, inayotegemea madokezo tuli ya mfumo au mipangilio migumu ya uboreshaji mahususi. Hutoa njia nyingine ya kuwezesha ujifunzaji endelevu katika mifumo ya AI.

Kabla ya kuingia kwa kina, hebu tupitie kwa ufupi misingi ya kuandika madokezo.

Tunapotengeneza wakala au muundo maalum, lazima kwanza tubuni vipengele viwili muhimu:

  1. Dokeza la mfumo

  2. Dokeza la mtumiaji

Madokezo ya mfumo huweka kanuni za msingi za jinsi muundo unavyopaswa kutenda. Yanapoandikwa kwa ajili ya suluhisho maalum za AI, mara nyingi huanza hivi:

“You are an intelligent assistant. Your role is to perform <insert task here>.

You must not do (A), (B), or (C).”

Kinyume chake, madokezo ya mtumiaji kwa kawaida huwa na swali la mtumiaji na taarifa nyingine muhimu, kama vile saa za eneo na mapendeleo yake. Dokeza la mtumiaji linaweza kuwa hivi:

Picha ya skrini inayoonyesha utangulizi.

I’m in the capital city of Portugal. Can you suggest some things I can do tonight?

Uvujaji wa madokezo ya mfumo umekuwa wa kawaida baada ya maabara kuu za AI kutoa miundo mipya, huku watumiaji wakitumia jailbreak kufichua maagizo ya msingi ya chatiboti. Uhifadhi maarufu wa GitHub sasa unakusanya madokezo mengi ya mfumo mahali pamoja. Yanafichua “siri ya mafanikio” ambayo maabara za AI zimebuni kwa muda ili kuhimiza miundo kutenda ipasavyo. Kwa mfano, dokeza la mfumo la GPT-5 lililovuja hivi karibuni (lililofichuliwa ndani ya ChatGPT) lina takriban maneno 6,000, jambo linaloonyesha kiasi cha maarifa na mwongozo kinachopaswa kusimbwa ili kuunda tabia ya mfumo.

Kwa kawaida, madokezo haya ya kina ya mfumo hushughulikia maeneo kadhaa muhimu, kama vile:

  • Maagizo ya utafutaji

  • Ufafanuzi wa zana

  • Mapendeleo ya mtumiaji

  • Maagizo ya kunukuu vyanzo

  • Marekebisho ya haraka kwa matatizo yanayojulikana

Kwa vitendo, wasanidi wa mifumo maalum ya AI hurekebisha madokezo ya mfumo kwa mikono hatua kwa hatua wanapojaribu na kuboresha programu zao, hasa wakitumia tathmini kuongoza mchakato huo.

Njia nyingine za kuelekeza tabia ya muundo ni pamoja na:

  • Uhandisi wa dokezo, ikiwemo uzalishaji unaosaidiwa na urejeshaji (RAG), ambao hudhibiti maudhui yanayotolewa kwa muundo

  • Uboreshaji mahususi (kubadilisha moja kwa moja uzani wa msingi wa muundo)

Je, kungekuwa na njia nyingine ya kuathiri tabia ya muundo? Fikiria mfumo unaojifunza na kuboresha dokeza lake la mfumo kwa nguvu kwa kutumia mawazo, mipango na mikakati iliyozalishwa awali. Unaweza kutumia maoni ya watumiaji na tathmini za LLM-kama-jaji kutathmini matokeo yake.

Ujifunzaji wa dokeza la mfumo ni nini?

Fikiria changamoto ya muda mrefu ya biashara unayotaka kuendesha kiotomatiki kwa kutumia mfumo wa mawakala. Suluhisho bora zinahitaji uwezo wa uwazaji unaozidi uendeshaji wa kiotomatiki wa mitiririko ya msingi ya kazi. Katika hali kama hizo, ni muhimu kujumuisha kipengele cha kuzalisha mipango katika mfumo wako wa AI. Hii huwezesha mfumo kufanya kazi na mawakala wengi kwa njia tofauti kulingana na kazi. Hatua mahususi zinaweza kujumuisha maagizo ya kufikia mawakala wengine ili kukamilisha kazi ndogo au kutumia zana.

Picha ya skrini inayoeleza ujifunzaji wa dokeza la mfumo.

Kumbuka: Zana ya wakala ni utendakazi, API au rasilimali yoyote ya nje ambayo wakala wa AI anaweza kuitumia kwenda zaidi ya maandishi na kutekeleza vitendo halisi.

Unaweza kuchagua “kuanzisha” dokeza la mfumo la muundo kwa mpango unaofuata hatua za kimantiki ambazo binadamu angechukua, ingawa kwa kawaida LLM huhitaji mwongozo mahususi zaidi kuhusu matumizi ya zana, muundo wa matokeo na masharti yanayohusiana. Wakati mwingine mkakati bora unaweza usiwe wazi, au unaweza kuwa unashughulikia tatizo ambalo halijatathminiwa upya kwa sababu awali lilidhaniwa kuwa limetatuliwa. Hapa ndipo ujifunzaji wa dokeza la mfumo (SPL) unapotumika.

SPL huboresha dokeza la mfumo hatua kwa hatua kwa kujumuisha mikakati iliyozalishwa awali. Matatizo mapya yanapojitokeza, mfumo hukusanya maarifa polepole na kuimarika zaidi. Ichukulie kama kuandaa kijitabu cha kutatua matatizo katika taaluma yako.

SPL hujumuisha polepole maarifa kutoka kwa maoni ya watumiaji katika dokeza la mfumo. Mfumo wako unapokomaa, unaweza kugundua matatizo yanayojirudia ambayo yanaweza kufupishwa kuwa kanuni za jumla za kiwango cha juu.

Mwongozo wa hatua kwa hatua

Hebu tuangalie kwa karibu jinsi mchakato huu unavyofanya kazi, hatua kwa hatua:

  1. Anza na swali la mtumiaji, ukiomba mfumo utekeleze kazi mahususi.

    1. Ikiwa mfumo wako unashughulikia tatizo moja tu, unaweza kutumia mbinu ya “tamaa” kwa kuchagua mikakati yenye alama za juu zaidi kutoka majaribio ya awali. Vinginevyo, unaweza kuhimiza uchunguzi kwa kuchukua sampuli kutoka kwenye mgawanyo unaopendelea mikakati yenye alama za juu huku mara kwa mara ukijumuisha yenye alama za chini. Hii ni muhimu hasa unapoanza kukusanya mikakati.

    2. Kwa mifumo iliyoundwa kushughulikia makundi mbalimbali ya matatizo, zingatia kuongeza safu ya uainishaji au kutumia embeddings na cosine similarity—mbinu zilezile zinazotumiwa kwa kawaida katika RAG—ili kubaini mbinu zinazofaa. Hii hukusaidia kuchagua mikakati inayofaa tatizo mahususi—kwa mfano, mikakati iliyoundwa kwa kazi za usimbaji.

Kumbuka: Embeddings zinapotumiwa pamoja na cosine similarity hutuwezesha kupima ukaribu wa uhusiano kati ya vipande viwili vya taarifa, hivyo kurahisisha kulinganisha hati, maswali au mawazo, hata maneno yake yanapotofautiana.

Mfano wa mwanzo wa hifadhi rahisi ya mikakati ya kushughulikia matatizo ya usimbaji.

Kumbuka: “Mikakati ya kuanzia” iliyoonyeshwa hapa ni mifano tu. Katika hali halisi za usimbaji, tungeiboresha zaidi. Matatizo mahususi ya biashara yangehitaji kukusanya maarifa ya ziada kadiri muda unavyopita.

Generation_id (mpangilio wa kinyume)

Mada

Alama

Strategy_text

Maelezo

4

usimbaji

1

Elewa tatizo, vikwazo na hali zisizo za kawaida. Buni algoriti yenye miundo sahihi ya data. Thibitisha mpango kwa kutumia mifano na kanuni zisizobadilika. Andika msimbo safi na unaosomeka kwa urahisi. Boresha kwa kupanga upya msimbo, kuongeza ufanisi na kuweka muundo wa mwisho. Matumizi ya zana: Unapotumia zana, eleza kwa ufupi kwa nini ilihitajika.

Unajumuisha na kuchanganya vipengele bora zaidi kutoka mikakati mitatu iliyo hapa chini.

3

usimbaji

1

Elewa tatizo, vikwazo na hali zisizo za kawaida. Buni algoriti yenye miundo sahihi ya data. Thibitisha mpango kwa kutumia mifano na kanuni zisizobadilika. Andika msimbo safi na unaosomeka kwa urahisi. Boresha kwa kupanga upya msimbo, kuongeza ufanisi na kuweka muundo wa mwisho.

Mkakati kamili zaidi, lakini hauna mwongozo kuhusu matumizi ya zana.

2

usimbaji

-1

Elewa tatizo, vikwazo na hali zisizo za kawaida. Buni algoriti yenye data sahihi. Andika msimbo safi na unaosomeka kwa urahisi. Matumizi ya zana: unapofikia zana, toa muhtasari mfupi wa sababu ya kutumia zana hiyo.

Mkakati bora zaidi unaotaja matumizi ya zana, lakini bado unaweza kuboreshwa.

1

usimbaji

-1

Pitia tatizo kwa haraka. Tatua tatizo. Unda majaribio machache muhimu. Wasilisha chochote kinachofanya kazi.

Unataja majaribio, lakini kwa ujumla ni mkakati dhaifu.

3. Baada ya kuchukua sampuli N, zijumuishe katika dokeza la mfumo. Hii huweka uzalishaji wa mipango kwenye msingi wa maoni ya awali ya wataalamu badala ya kuacha muundo uunde mipango kwa mwongozo mdogo. Himiza muundo “ufikirie kwa ubunifu” na uongeze hatua inapohitajika badala ya kunakili tu mikakati ya sampuli neno kwa neno.

Picha ya skrini inayoonyesha mwongozo wa hatua kwa hatua.

4. Kwa kutumia dokeza la mfumo lililoundwa kwa nguvu, zalisha mkakati mpya wa kushughulikia ombi la mtumiaji. Mchakato huu unapaswa kuzalisha kazi za ziada zinazoboresha matokeo ya mwisho. Lengo ni ubunifu: unganisha vipengele bora zaidi vya mikakati ya awali, jumuisha hatua zinazofanana na uongeze hatua mpya zenye manufaa inapohitajika.

Kumbuka: Halijoto ni kigezo kinachoweza kurekebishwa ili kutoa matokeo yenye utofauti zaidi na yasiyotabirika sana, jambo linalofaa unapohitaji ubunifu. Halijoto ikiwa si sifuri, kila mpango unaozalishwa unaweza kuwa tofauti.

5. Baada ya kupokea matokeo ya muundo, yatathmini kwa kutumia mtathmini binadamu au jaji wa LLM kulingana na vigezo mahususi vinavyofafanua suluhisho bora la tatizo lako. Kwa mfano wa shughuli nchini Ureno uliotajwa awali, vigezo vya tathmini vinaweza kujumuisha:

  • Ufupi (jibu lenye sentensi moja pekee)

  • Uhusiano wa shughuli iliyopendekezwa

  • Usahihi wa eneo

6. Kulingana na tathmini hii, tumia muundo mwingine kuboresha mkakati. Mzunguko wa hiari wa maoni unaweza kujumuisha mchango wa binadamu na kuwezesha maboresho ya pamoja. Hifadhi mkakati ulioboreshwa katika hifadhidata yako pamoja na metadata inayofaa ili kufuatilia matoleo na mabadiliko.

Picha ya skrini inayoonyesha mwongozo wa hatua kwa hatua.

Kwa nini basi kupitia usumbufu huu wote? Unaweza kukagua matokeo kwa mikono na kurekebisha dokeza la mfumo ipasavyo. Hata hivyo, miundo yenye uwezo mkubwa wa uwazaji inaweza kuboresha mikakati kwa kutumia muktadha wa matokeo na maoni ya binadamu. Ingawa binadamu wanaweza kutambua dosari katika mbinu rahisi kwa urahisi, kuzibaini huwa kugumu na kuchosha katika mifumo changamano inayoshughulikia makundi mapana ya matatizo.

Mara nyingi LLM huhitaji maagizo ya kina na hatua za ziada ili kukusanya maarifa ya kimuktadha ambayo binadamu huyatumia kiasili kutatua tatizo. Idadi ya kazi zinazohitajika inaweza kuongezeka haraka mfumo unapopanuka kushughulikia makundi mapana ya matatizo. Kwa mfano, binadamu wanaotatua matatizo ya usimbaji wanaweza kuelewa kwa urahisi msimbo unaohusiana, ilhali LLM huenda ikahitaji kwanza “kusoma” faili kadhaa.

Athari za kutekeleza SPL katika suluhisho zako za AI

Kugundua njia mpya za kutatua matatizo

  • Inaposaidia: Fikiria unaongoza timu ya huduma kwa wateja, na wakala wa AI anapanga tiketi kulingana na kipaumbele. Baada ya muda, SPL inaweza kugundua mbinu ya kuainisha ambayo timu yako haikuwa imefikiria, hivyo kupunguza viwango vya kuhamisha masuala kwa ngazi ya juu.

  • Isiposaidia: Ikiwa masharti ya uzingatiaji au kanuni tayari zinafafanua mtiririko wako wa kazi, kama katika kuripoti fedha, SPL huenda isiwe na thamani kubwa kwa sababu ubunifu huwa hatari badala ya faida.

Kuimarisha ushirikiano kati ya binadamu na AI

  • Inaposaidia: Katika majukumu yanayohitaji utafiti mwingi, kama ujasusi wa soko au mkakati wa bidhaa, unaweza kushirikiana na AI kwa kuboresha mipango yake, kuimarisha matokeo yake na kujumuisha maboresho hayo kwa matumizi ya baadaye. Kila mwingiliano huongeza ufanisi wa mfumo.

  • Isiposaidia: Ikiwa timu yako hutumia AI zaidi kwa mitiririko rahisi ya kazi yenye mchango mdogo wa binadamu, kama uchakataji wa ankara, gharama ya ushirikiano inaweza kuzidi manufaa.

Kukabiliana na matatizo mapya

  • Inaposaidia: Tuseme unapanua biashara katika eneo jipya na ghafla AI inalazimika kushughulikia maswali kuhusu kodi za eneo hilo. SPL hukuwezesha kusimba haraka kanuni na mbinu mpya zinapojitokeza, hivyo kuzuia makosa yasijirudie.

  • Isiposaidia: Ikiwa mazingira yako hayabadiliki, kama unapobadilisha nakala za mikutano kuwa muhtasari sanifu, urekebishaji wa mara kwa mara una manufaa machache.

Changamoto na vihatarishi

Kinadharia, yote haya yanaonekana kuwa na matumaini, lakini utekelezaji wa SPL una changamoto halisi. Tunajadili baadhi ya changamoto kuu hapa chini:

Kutofikia muafaka

Katika hatua za mwanzo za kuzalisha mikakati, maendeleo mara nyingi hukwama: matokeo mapya hayaendelezi yaliyotangulia na kasi hupungua. Kwa kawaida, hali hii husababishwa na masuala mawili makuu:

    • Suluhisho: Simba mapema maarifa yote ya biashara yanayopatikana ili mfumo uwe na kina cha maarifa cha kutumia.

    • Suluhisho: Buni mwongozo wa kina wa alama unaotathmini vipengele kadhaa vya jibu, kama usahihi, uwazi na uhusiano, kisha urekebishe usampulishaji wako kulingana na viashiria hivyo.

Kuongezeka kupita kiasi kwa mikakati

Ikiwa mfumo wako unazalisha mamia ya mikakati lakini unapokea maoni machache ya kutofautisha mizuri na mibaya, usampulishaji huwa mgumu kudhibiti haraka. Suluhisho ni kuondoa isiyofaa.

Unapoboresha hifadhi yako ya mikakati, zingatia:

  • Muda wa kutumika: Ondoa mikakati inapozidi kipindi au idadi ya vizazi iliyowekwa.

  • Alama: Tumia mwongozo wako wa tathmini kuchuja mikakati inayofanya vibaya mara kwa mara. Kuchanganya hili na muda wa kutumika huhakikisha kuwa unahifadhi tu mbinu zinazothibitisha thamani yake kadiri muda unavyopita.

  • Uamuzi wa LLM: Tathmini mikakati mara kwa mara ili kubaini ile ambayo haitoi tena maarifa ya kipekee, kwa kuwa huenda vipengele vyake muhimu tayari vimejumuishwa katika matoleo mapya.

Suluhisho: Ichukulie hifadhidata yako ya mikakati kama mfumo hai: iondolee yasiyofaa mara kwa mara ili yabaki tu maarifa muhimu na yenye thamani kubwa.

Hitimisho

Ujifunzaji wa dokeza la mfumo bado uko katika hatua za awali, lakini una uwezo mkubwa sana. Biashara zinazotegemea madokezo tuli pekee au uboreshaji mahususi usioisha zitakumbana na mapungufu ya kawaida: mifumo dhaifu, gharama zinazoongezeka na juhudi zinazopotea. SPL hutoa njia ya kuondoka katika mzunguko huo kwa kujenga mifumo inayoboreka kadiri muda unavyopita na kusimba kanuni za kiwango cha juu badala ya marekebisho ya matatizo mahususi.

SPL bado inachipuka, lakini mwelekeo wake uko wazi: mifumo inayoweza kujifunza yenyewe itapita ile isiyoweza. Sasa ndio wakati wa kufanya majaribio, kuanza kwa kiwango kidogo, kuhifadhi mafunzo na kuweka msingi wa mifumo ya AI inayoboreka kwa kila mwingiliano.

Mwandishi

George Williamson