Белгілі бір көмексөз жақсы жұмыс істеп, кейін кенеттен істемей қалған кез болды ма?
Нәтижені жақсарту үшін жүйелік көмексөзді қайта-қайта түзетіп, бірақ ешбір өзгеріс көмектеспейтін тұйыққа тірелген кезіңіз болды ма?
Сізге дәл жүйелік көмексөзді үйрену қажет болуы мүмкін.
Жүйелік көмексөзді үйрену (SPL) — ЖИ қауымдастығында қызығушылық тудырып келе жатқан бағыт. Оны мамыр айында Андрей Карпати X желісінде кеңінен танытты.
Жүйелік көмексөзді үйрену статикалық жүйелік көмексөздерге немесе қолайсыз дәл баптау конфигурацияларына сүйенетін икемсіз әрі осал ЖИ жүйелерінің шектеулерін шешуге көмектеседі. Бұл ЖИ жүйелерінің үздіксіз үйренуін қолдаудың тағы бір жолын ұсынады.
Тақырыпқа кіріспес бұрын, көмексөз құрастырудың негізгі қағидаларын қысқаша қарастырайық.
Агентті немесе арнаулы модельді әзірлегенде, алдымен екі негізгі компонентті жобалауымыз керек:
Жүйелік көмексөз
Пайдаланушы көмексөзі
Жүйелік көмексөздер модель әрекетінің негізгі ережелерін белгілейді. Арнаулы ЖИ шешімдеріне арналған мұндай көмексөздер көбіне былай басталады:
“You are an intelligent assistant. Your role is to perform <insert task here>.
You must not do (A), (B), or (C).”
Ал пайдаланушы көмексөздері әдетте пайдаланушының сұрағын және оның уақыт белдеуі мен қалауы сияқты өзге де маңызды ақпаратты қамтиды. Пайдаланушы көмексөзі мынадай болуы мүмкін:


I’m in the capital city of Portugal. Can you suggest some things I can do tonight?
Ірі ЖИ зертханалары жаңа модель шығарғаннан кейін жүйелік көмексөздердің жария болып кетуі жиіледі: пайдаланушылар чатботтардың қорғанысын айналып өтіп, олардың ішкі нұсқауларын ашқызады. Қазір танымал GitHub репозиторийі осындай көптеген жүйелік көмексөзді бір жерде жинақтайды. Олар ЖИ зертханалары модельдің дұрыс әрекетін қамтамасыз ету үшін уақыт өте әзірлеген «құпия тәсілдерді» көрсетеді. Мысалы, жақында жария болған GPT-5 жүйелік көмексөзінде (ChatGPT ішінен алынған) шамамен 6 000 сөз бар. Бұл жүйе әрекетін қалыптастыру үшін қаншалықты көп білім мен нұсқауды кодтау керектігін көрсетеді.
Мұндай жан-жақты жүйелік көмексөздер әдетте бірнеше негізгі саланы қамтиды, соның ішінде:
Іздеу нұсқаулары
Құрал анықтамалары
Пайдаланушы қалаулары
Дереккөзге сілтеме жасау нұсқаулары
Белгілі мәселелерге арналған жедел түзетулер
Іс жүзінде арнаулы ЖИ жүйелерін әзірлеушілер қолданбаларын сынап, жетілдіру барысында жүйелік көмексөздерді қолмен әрі кезең-кезеңімен түзетеді. Бұл жетілдіру үдерісінде негізінен бағалауларды басшылыққа алады.
Модель әрекетін бағыттаудың басқа тәсілдері:
Модельге берілетін мазмұнды басқаратын, іздеу арқылы толықтырылған генерацияны (RAG) қамтитын көмексөз инженериясы
Дәл баптау (модельдің негізгі салмақтарын тікелей өзгерту)
Модель әрекетіне ықпал етудің басқа жолы болса ше? Бұрын жасалған ойларды, жоспарлар мен стратегияларды пайдаланып, өз жүйелік көмексөзін динамикалық түрде үйреніп, жетілдіретін жүйені елестетіңіз. Ол нәтижелерін бағалау үшін пайдаланушы пікірін де, LLM-төреші бағалауларын да пайдалана алады.
Агенттік жүйе арқылы автоматтандырғыңыз келетін тұрақты бизнес мәселесін қарастырайық. Тиімді шешімдер қарапайым жұмыс үдерісін автоматтандырудан жоғары ой қорыту мүмкіндіктерін қажет етеді. Мұндай жағдайларда ЖИ жүйесіне жоспар құратын компонент қосу өте маңызды. Бұл жүйеге тапсырмаға қарай бірнеше агентпен әртүрлі тәсілмен жұмыс істеуге мүмкіндік береді. Жекелеген қадамдар қосалқы тапсырмаларды орындау үшін басқа агенттерге жүгіну немесе құралдарды пайдалану нұсқауларын қамтуы мүмкін.


Ескертпе: Агенттің құралы — ЖИ агенті мәтінмен шектелмей, нақты әрекет орындау үшін шақыра алатын кез келген сыртқы функция, API немесе ресурс.
Модельдің жүйелік көмексөзіне адам орындайтын логикалық қадамдарға негізделген бастапқы жоспарды енгізуге болады. Алайда LLM модельдеріне әдетте құралдарды пайдалану, нәтиже пішімі және өзге талаптар бойынша нақтырақ нұсқау қажет. Кейде оңтайлы стратегия түсініксіз болуы мүмкін немесе сіз бұрын шешілді деп есептелгендіктен қайта қаралмаған мәселемен жұмыс істеуіңіз мүмкін. Дәл осы жерде жүйелік көмексөзді үйрену (SPL) көмектеседі.
SPL бұрын жасалған стратегияларды енгізу арқылы жүйелік көмексөзді кезең-кезеңімен жақсартады. Жаңа мәселелер туындаған сайын жүйе біртіндеп білім жинап, сенімді бола түседі. Мұны өз салаңыздағы мәселелерді шешуге арналған анықтамалық құру деп елестетіңіз.
SPL пайдаланушы пікірінен алынған түсініктерді жүйелік көмексөзге біртіндеп енгізеді. Жүйеңіз жетілген сайын, жалпылама әрі жоғары деңгейлі қағидаларға айналдыруға болатын қайталанатын мәселелерді байқауыңыз мүмкін.
Үдерістің қалай жұмыс істейтінін қадам-қадамымен қарастырайық:
Алдымен жүйеден нақты тапсырманы орындауды сұрайтын пайдаланушы сұрауын беріңіз.
Жүйеңіз бір ғана мәселені шешсе, алдыңғы іске қосу нәтижелерінен ең жоғары ұпай алған стратегияларды таңдайтын «ашкөз» тәсілді қолдануға болады. Немесе кейде төмен бағаланған стратегияларды да қосып, жоғары бағаланғандарына басымдық беретін үлестірімнен іріктеу арқылы ізденісті ынталандыруға болады. Бұл стратегияларды енді ғана жинай бастағанда әсіресе пайдалы.
Әртүрлі мәселелерді шешуге арналған жүйелерде тиісті тәсілдерді анықтау үшін жіктеу қабатын қосуды немесе ендірмелер мен косинустық ұқсастықты (әдетте RAG жүйесінде қолданылатын әдістерді) пайдалануды қарастырыңыз. Бұл нақты мәселеге, мысалы бағдарламалау тапсырмаларына бейімделген стратегияларды таңдауға көмектеседі.
Ескертпе: Ендірмелер косинустық ұқсастықпен бірге қолданылғанда, екі ақпарат бөлігінің қаншалықты байланысты екенін өлшеуге мүмкіндік береді. Осылайша нақты тұжырымдары әртүрлі болса да, құжаттарды, сұрауларды немесе идеяларды сәйкестендіру оңайырақ болады.
Бағдарламалау мәселелерін шешуге арналған қарапайым стратегиялар қорының бастапқы мысалы.
Ескертпе: Мұнда көрсетілген «бастапқы стратегиялар» тек мысал ретінде берілген. Нақты бағдарламалау жағдайларында оларды әрі қарай жетілдірер едік. Арнайы бизнес мәселелері уақыт өте қосымша түсініктер жинауды қажет етеді.
Generation_id (кері ретпен) | Тақырып | Ұпай | Strategy_text | Түсіндірме |
|---|---|---|---|---|
4 | бағдарламалау | 1 | Understand the problem, constraints, and edge cases. Design an algorithm with the right data structures. Validate the plan on examples and invariants. Implement clean, readable code. Refine with refactoring, optimization, and final formatting. Tool use: When using a tool, briefly explain why it was needed. | Төмендегі үш стратегияның ең мықты элементтерін біріктіреді. |
3 | бағдарламалау | 1 | Understand the problem, constraints, and edge cases. Design an algorithm with the right data structures. Validate the plan on examples and invariants. Implement clean, readable code. Refine with refactoring, optimization, and final formatting. | Жан-жақтырақ стратегия, бірақ онда құралдарды пайдалану жөнінде нұсқау жоқ. |
2 | бағдарламалау | -1 | Understand the problem, constraints, and edge cases. Design an algorithm with the right data. Implement clean, readable code. Tool use: when accessing tools produce a short summary as to why you used that tool. | Құралдарды пайдалану туралы айтылған жақсырақ стратегия, бірақ оны әлі де жетілдіруге болады. |
1 | бағдарламалау | -1 | Skim the problem. Solve the problem. Create minimal tests. Submit whatever runs. | Тесттер аталғанымен, жалпы стратегия әлсіз. |
3. N нұсқаны іріктегеннен кейін, оларды жүйелік көмексөзге енгізіңіз. Бұл модельді аз ғана нұсқаумен жоспар құруға қалдырмай, жоспар генерациясын сарапшылардың алдыңғы пікірлеріне негіздейді. Модельді үлгі стратегияларды сөзбе-сөз көшірумен шектелмей, «қалыптан тыс ойлауға» және қажет кезде қадамдар қосуға ынталандырыңыз.


4. Динамикалық түрде жасалған жүйелік көмексөзді пайдаланып, пайдаланушы сұрауын орындауға арналған жаңа стратегия құрыңыз. Бұл үдеріс түпкі нәтижені жақсартатын қосымша тапсырмаларды қалыптастыруы керек. Мақсат — шығармашылық: алдыңғы стратегиялардың ең мықты тұстарын біріктіріп, қайталанатын қадамдарды ықшамдаңыз және қажет жерде пайдалы жаңа қадамдар қосыңыз.
Ескертпе: Температура — нәтижелерді алуан түрлі әрі болжамдылығы төмен ету үшін реттелетін параметр. Бұл шығармашылық қажет болғанда пайдалы. Температура нөлден жоғары болса, әр жасалған жоспар өзгеше болуы мүмкін.
5. Модель нәтижесін алғаннан кейін, мәселеңіздің жақсы шешімін анықтайтын нақты өлшемдерге сүйеніп, оны адам бағалаушыға немесе LLM-төрешіге бағалатыңыз. Жоғарыда аталған Португалиядағы іс-шаралар мысалы үшін бағалау өлшемдері мыналарды қамтуы мүмкін:
Қысқалық (жауап бір сөйлеммен шектеледі)
Ұсынылған іс-шараның өзектілігі
Орынның дәлдігі
6. Осы бағалау негізінде стратегияны басқа модель арқылы жетілдіріңіз. Қосымша кері байланыс циклі адамның пікірін ескеріп, бірлескен жетілдіруді қолдай алады. Нұсқалар мен өзгерістерді бақылау үшін жетілдірілген стратегияны тиісті метадеректермен бірге дерекқорда сақтаңыз.


Осының бәріне не үшін күш жұмсау керек? Нәтижелерді қолмен қарап, жүйелік көмексөзді соған сай түзетуге де болады. Алайда ой қорытуы қуатты модельдер нәтиже мәнмәтінін де, адамның пікірін де пайдаланып, стратегияларды жетілдіре алады. Адамдар қарапайым тәсілдердің кемшіліктерін оңай байқайды, бірақ ауқымды мәселелерді шешетін күрделі жүйелерде оларды анықтау қиын әрі жалықтыратын іске айналады.
LLM модельдеріне адам мәселені шешуге табиғи түрде қолданатын мәнмәтіндік білімді жинау үшін көбіне егжей-тегжейлі нұсқаулар мен қосымша қадамдар қажет. Жүйе ауқымды мәселелерді шешуге бейімделген сайын, қажетті тапсырмалар саны тез өсуі мүмкін. Мысалы, бағдарламалау мәселесін шешетін адам айналадағы кодтық базаны ішкі түйсікпен түсінуі мүмкін, ал LLM алдымен бірнеше файлды «оқуы» қажет.
Пайдалы болатын жағдай: Тұтынушыларды қолдау тобын басқарасыз және өтінімдерді сұрыптауды ЖИ агенті орындайды делік. Уақыт өте SPL тобыңыз ойламаған санаттау әдісін тауып, мәселені жоғары деңгейге жолдау жиілігін азайтуы мүмкін.
Пайдалы болмайтын жағдай: Қаржылық есептілік сияқты жұмыс үдерістерін сәйкестік талаптары немесе ережелер әлдеқашан белгілесе, SPL пайдасы аз болуы мүмкін, өйткені шығармашылық артықшылық емес, тәуекелге айналады.
Пайдалы болатын жағдай: Зерттеуді көп қажет ететін қызметтерде (мысалы, нарықтық барлау немесе өнім стратегиясы) ЖИ жоспарларын жетілдіріп, нәтижесін толықтырып және осы жақсартуларды болашақта пайдалану арқылы онымен бірлесе жұмыс істей аласыз. Әр әрекеттесу жүйенің тиімділігін арттырады.
Пайдалы болмайтын жағдай: Тобыңыз ЖИ-ді адам қатысуы аз қарапайым жұмыс үдерістеріне (мысалы, шот-фактураларды өңдеуге) қолданса, ынтымақтастыққа кететін шығын пайдасынан асып түсуі мүмкін.
Пайдалы болатын жағдай: Жаңа өңірге шығып, ЖИ кенеттен жергілікті салық туралы сұрауларды өңдеуі керек болды делік. SPL жаңа ережелер мен эвристикаларды пайда болуына қарай жылдам кодтап, қайталанатын қателердің алдын алуға мүмкіндік береді.
Пайдалы болмайтын жағдай: Ортаңыз өзгермейтін болса, мысалы жиналыс транскрипттерін стандартты түйіндемелерге айналдырсаңыз, тұрақты бейімделудің пайдасы шамалы.
Теория жүзінде мұның бәрі келешегі зор болып көрінеді, бірақ SPL енгізудің нақты қиындықтары бар. Төменде олардың негізгілерін қарастырамыз:
Стратегия құрудың бастапқы кезеңдерінде ілгерілеу жиі тоқырайды: жаңа нәтижелер алдыңғыларды дамытпайды, ал қарқын баяулайды. Бұған әдетте екі негізгі мәселе себеп болады:
Шешім: Жүйе пайдалана алатын білім қоры терең болуы үшін қолда бар барлық бизнес білімін басынан-ақ кодтаңыз.
Шешім: Жауаптың дәлдік, түсініктілік және өзектілік сияқты бірнеше қырын бағалайтын егжей-тегжейлі өлшемдер жүйесін құрып, іріктеуді осы сигналдарға сай реттеңіз.
Жүйеңіз жүздеген стратегия жасап, бірақ жақсысын жаманынан ажырататын кері байланыс аз болса, іріктеу үдерісін басқару тез қиындайды. Шешімі — артықтарын қысқарту.
Стратегиялар қорын жетілдіргенде мыналарды ескеріңіз:
Қызмет мерзімі: Белгіленген уақыт немесе генерациялар саны шегінен асқан стратегияларды қолданыстан шығарыңыз.
Ұпай: Бағалау өлшемдерін тұрақты түрде төмен нәтиже көрсететін стратегияларды сүзуге пайдаланыңыз. Мұны қызмет мерзімімен ұштастыру уақыт өте құндылығын дәлелдеген тәсілдерді ғана сақтауға мүмкіндік береді.
LLM бағалауы: Бірегей түсінік бермейтін стратегияларды анықтау үшін оларды мерзімді түрде бағалаңыз, өйткені пайдалы элементтері жаңа нұсқаларға еніп қойған болуы ықтимал.
Шешім: Стратегиялар дерекқорын тірі жүйе ретінде қарастырыңыз: онда тек өзекті әрі құнды білім қалуы үшін артықтарын жүйелі түрде алып тастаңыз.
Жүйелік көмексөзді үйрену әлі бастапқы кезеңде, бірақ оның әлеуеті орасан. Тек статикалық көмексөздерге немесе шексіз дәл баптауға сүйенетін компаниялар бұрыннан таныс шектеулерге тап болады: осал жүйелер, өсіп жатқан шығындар және босқа жұмсалған күш. SPL жекелеген түзетулердің орнына жоғары деңгейлі қағидаларды кодтайтын әрі уақыт өте жақсаратын жүйелер құру арқылы осы тұйықтан шығуға жол ашады.
SPL әлі қалыптасып келеді, бірақ бағыты айқын: өздігінен үйренетін жүйелер ондай қабілеті жоқ жүйелерден озып шығады. Қазір тәжірибе жасап, шағын қадамнан бастап, үйренгеніңізді жинақтап, әр әрекеттескен сайын жақсаратын ЖИ жүйелерінің негізін қалайтын уақыт.