मुख्य नेव्हिगेशन

सिस्टम प्रॉम्प्ट लर्निंग: AI सिस्टमसाठी नवा दृष्टिकोन

सिस्टम प्रॉम्प्ट लर्निंगमुळे संघांना मॉडेलना पुन्हा प्रशिक्षण न देता AI वर्तन सुधारता येते आणि मर्यादा समजणे सोपे होते.

एखादा प्रॉम्प्ट उत्तम काम करत असताना अचानक काम करेनासा झाल्याचा अनुभव तुम्हाला कधी आला आहे का?

परिणाम सुधारण्यासाठी सिस्टम प्रॉम्प्टमध्ये सतत ठिगळे जोडूनही काहीच उपयोग होत नसल्याच्या चक्रात तुम्ही कधी अडकला आहात का?

सिस्टम प्रॉम्प्ट लर्निंग कदाचित तुमच्यासाठी नेमका योग्य उपाय ठरू शकतो.

सिस्टम प्रॉम्प्ट लर्निंग (SPL) हे AI समुदायातील उदयोन्मुख स्वारस्याचे क्षेत्र असून, मे महिन्यात आंद्रेज कारपॅथी यांनी X वर त्याला मोठ्या प्रमाणावर लोकप्रिय केले.

स्थिर सिस्टम प्रॉम्प्ट किंवा अवजड फाइन-ट्यूनिंग रचनांवर अवलंबून असलेल्या ताठर व नाजूक AI सिस्टमच्या मर्यादांवर सिस्टम प्रॉम्प्ट लर्निंग उपाय देते. हे AI सिस्टममध्ये सातत्यपूर्ण शिकण्याला मदत करण्याचा आणखी एक मार्ग देते.

तपशीलात जाण्यापूर्वी, प्रॉम्प्ट लिहिण्याच्या काही मूलभूत बाबींचा थोडक्यात आढावा घेऊया.

एजंट किंवा सानुकूल मॉडेल विकसित करताना, प्रथम दोन प्रमुख घटक तयार करावे लागतात:

  1. सिस्टम प्रॉम्प्ट

  2. वापरकर्ता प्रॉम्प्ट

मॉडेलने कसे वागावे याचे मूलभूत नियम सिस्टम प्रॉम्प्ट ठरवतात. सानुकूल AI उपायांसाठी ते लिहिताना, बहुधा सुरुवात अशी होते:

“तुम्ही एक बुद्धिमान सहाय्यक आहात. <येथे कार्य नमूद करा> हे पूर्ण करणे तुमची भूमिका आहे.

तुम्ही (A), (B) किंवा (C) करू नये.”

याउलट, वापरकर्ता प्रॉम्प्टमध्ये सहसा वापरकर्त्याचा प्रश्न आणि त्याचा वेळ विभाग व प्राधान्ये यांसारखी इतर संबंधित माहिती असते. वापरकर्ता प्रॉम्प्ट असा असू शकतो:

प्रस्तावना दाखवणारा स्क्रीनशॉट.

मी पोर्तुगालच्या राजधानीत आहे. आज रात्री करण्यासारख्या काही गोष्टी सुचवाल का?

मोठ्या AI प्रयोगशाळांनी नवीन मॉडेल प्रसिद्ध केल्यानंतर सिस्टम प्रॉम्प्ट उघड होणे सामान्य झाले आहे, कारण वापरकर्ते चॅटबॉटचे जेलब्रेक करून त्यांच्या अंतर्गत सूचना उघड करतात. आता एका लोकप्रिय GitHub रिपॉझिटरीमध्ये यांपैकी अनेक सिस्टम प्रॉम्प्ट एकाच ठिकाणी संकलित केले आहेत. मॉडेलला योग्य वर्तन करण्यास प्रवृत्त करण्यासाठी AI प्रयोगशाळांनी काळानुसार विकसित केलेली “गुप्त युक्ती” त्यातून उघड होते. उदाहरणार्थ, अलीकडे उघड झालेल्या GPT-5 सिस्टम प्रॉम्प्टमध्ये (ChatGPT मधून समोर आलेल्या) सुमारे 6,000 शब्द आहेत. सिस्टमचे वर्तन घडवण्यासाठी किती ज्ञान आणि मार्गदर्शन अंतर्भूत करावे लागते, हे यावरून दिसते.

अशा सर्वसमावेशक सिस्टम प्रॉम्प्टमध्ये सहसा पुढील प्रमुख क्षेत्रांचा समावेश असतो:

  • शोधाच्या सूचना

  • साधनांच्या व्याख्या

  • वापरकर्त्याची प्राधान्ये

  • संदर्भ देण्याच्या सूचना

  • ज्ञात समस्यांसाठी तात्पुरत्या दुरुस्त्या

प्रत्यक्षात, सानुकूल AI सिस्टमचे विकसक आपले अनुप्रयोग तपासताना आणि सुधारताना सिस्टम प्रॉम्प्टमध्ये वारंवार हाताने बदल करतात. या सुधारणा प्रक्रियेला दिशा देण्यासाठी ते प्रामुख्याने मूल्यांकनांचा वापर करतात.

मॉडेलच्या वर्तनाला दिशा देण्याचे इतर मार्ग पुढीलप्रमाणे आहेत:

  • मॉडेलला दिली जाणारी सामग्री नियंत्रित करणाऱ्या पुनर्प्राप्ती-संवर्धित निर्मितीसह (RAG) प्रॉम्प्ट इंजिनिअरिंग

  • फाइन-ट्यूनिंग (मॉडेलचे अंतर्गत भार थेट बदलणे)

मॉडेलच्या वर्तनावर प्रभाव टाकण्याचा आणखी एखादा मार्ग असेल तर? पूर्वी निर्माण केलेले विचार, योजना आणि धोरणे वापरून स्वतःचा सिस्टम प्रॉम्प्ट गतिशीलपणे शिकणाऱ्या व सुधारणाऱ्या सिस्टमची कल्पना करा. ती आपल्या आउटपुटचे मूल्यमापन करण्यासाठी वापरकर्त्याचा अभिप्राय आणि परीक्षक म्हणून LLM या दोन्हींच्या मूल्यांकनांचा आधार घेऊ शकते.

सिस्टम प्रॉम्प्ट लर्निंग म्हणजे काय?

एजंट-आधारित सिस्टम वापरून स्वयंचलित करायचे असलेले एखादे कायमस्वरूपी व्यावसायिक आव्हान विचारात घ्या. परिणामकारक उपायांसाठी साध्या कार्यप्रवाह स्वयंचलनापलीकडील रीझनिंग क्षमता आवश्यक असतात. अशा वेळी तुमच्या AI सिस्टममध्ये योजना निर्माण करणारा घटक समाविष्ट करणे आवश्यक ठरते. यामुळे कार्यानुसार सिस्टमला अनेक एजंटसोबत वेगवेगळ्या प्रकारे काम करता येते. प्रत्येक टप्प्यात उपकार्ये पूर्ण करण्यासाठी इतर एजंट वापरण्याच्या किंवा साधने वापरण्याच्या सूचना असू शकतात.

सिस्टम प्रॉम्प्ट लर्निंग म्हणजे काय हे दाखवणारा स्क्रीनशॉट.

टीप: एजंटचे साधन म्हणजे असे कोणतेही बाह्य कार्य, API किंवा संसाधन, ज्याचा वापर AI एजंट मजकुरापलीकडे जाऊन प्रत्यक्ष कृती करण्यासाठी करू शकतो.

माणूस वापरेल अशा तार्किक टप्प्यांची योजना मॉडेलच्या सिस्टम प्रॉम्प्टमध्ये सुरुवातीचा आधार म्हणून देऊ शकता. मात्र, LLMना साधनांचा वापर, आउटपुटचे स्वरूप आणि संबंधित आवश्यकतांबाबत सहसा अधिक स्पष्ट मार्गदर्शन लागते. कधीकधी सर्वोत्तम धोरण स्पष्ट नसते किंवा पूर्वी सुटलेली मानल्यामुळे पुन्हा तपासली न गेलेली समस्या तुम्ही हाताळत असता. अशा वेळी सिस्टम प्रॉम्प्ट लर्निंग (SPL) उपयोगी ठरते.

पूर्वी निर्माण केलेली धोरणे समाविष्ट करून SPL सिस्टम प्रॉम्प्टमध्ये पुनरावृत्तीने सुधारणा करते. नवीन समस्या उद्भवत असताना सिस्टम हळूहळू ज्ञान साठवते आणि अधिक सक्षम बनते. तुमच्या क्षेत्रातील समस्या सोडवण्यासाठी मार्गदर्शिका तयार करत आहात, असा याचा विचार करा.

SPL वापरकर्त्याच्या अभिप्रायातून मिळालेल्या अंतर्दृष्टी हळूहळू सिस्टम प्रॉम्प्टमध्ये समाविष्ट करते. तुमची सिस्टम प्रगल्भ होत असताना, वारंवार उद्भवणाऱ्या समस्यांमधून अधिक सामान्यीकृत, उच्च-स्तरीय तत्त्वे तयार करता येतील असे तुम्हाला आढळू शकते.

टप्प्याटप्प्याने मार्गदर्शन

ही प्रक्रिया टप्प्याटप्प्याने कशी चालते ते अधिक बारकाईने पाहूया:

  1. सिस्टमला विशिष्ट कार्य करण्यास सांगणाऱ्या वापरकर्त्याच्या प्रश्नापासून सुरुवात करा.

    1. तुमची सिस्टम केवळ एकच समस्या हाताळत असल्यास, मागील प्रयत्नांमधील सर्वाधिक गुण मिळालेली धोरणे निवडून “लोभी” पद्धत वापरू शकता. पर्याय म्हणून, उच्च गुण मिळालेल्या धोरणांना प्राधान्य देणाऱ्या, पण अधूनमधून कमी गुणांची धोरणेही समाविष्ट करणाऱ्या वितरणातून नमुने निवडून शोधाला प्रोत्साहन देऊ शकता. तुम्ही धोरणे गोळा करायला नुकतीच सुरुवात केली असेल, तेव्हा हे विशेषतः उपयुक्त ठरते.

    2. विविध समस्यासंच हाताळण्यासाठी तयार केलेल्या सिस्टममध्ये संबंधित पद्धती ओळखण्यासाठी वर्गीकरणाचा स्तर जोडण्याचा किंवा एम्बेडिंग आणि कोसाइन साम्य वापरण्याचा विचार करा. RAGमध्येही सहसा हीच तंत्रे वापरली जातात. यामुळे विशिष्ट समस्येसाठी योग्य धोरणे निवडता येतात, उदाहरणार्थ कोडिंग कार्यांसाठी खास तयार केलेली धोरणे.

टीप: एम्बेडिंगचा कोसाइन साम्यासह वापर केल्याने दोन माहितीचे तुकडे किती जवळून संबंधित आहेत हे मोजता येते. त्यामुळे नेमकी शब्दरचना वेगळी असली, तरी दस्तऐवज, प्रश्न किंवा कल्पना जुळवणे सोपे होते.

कोडिंग समस्या हाताळण्यासाठीच्या सोप्या धोरणसंग्रहाचा प्रारंभिक नमुना.

टीप: येथे दाखवलेली “प्रारंभिक धोरणे” केवळ उदाहरणासाठी आहेत. प्रत्यक्ष कोडिंग परिस्थितीत आम्ही त्यांत आणखी सुधारणा करू. विशिष्ट व्यावसायिक समस्यांसाठी कालांतराने अतिरिक्त अंतर्दृष्टी गोळा करावी लागेल.

निर्मिती_आयडी (उलट क्रम)

विषय

गुण

धोरण_मजकूर

स्पष्टीकरण

4

कोडिंग

1

समस्या, मर्यादा आणि अपवादात्मक प्रकरणे समजून घ्या. योग्य डेटा संरचनांसह अल्गोरिदम तयार करा. उदाहरणे आणि अपरिवर्तनीय अटींच्या आधारे योजनेची पडताळणी करा. स्वच्छ आणि वाचनीय कोड लिहा. पुनर्रचना, अनुकूलन आणि अंतिम स्वरूप देऊन सुधारणा करा. साधनांचा वापर: साधन वापरताना ते का आवश्यक होते हे थोडक्यात स्पष्ट करा.

खालील तीन धोरणांतील सर्वात प्रभावी घटक समाविष्ट करून त्यांचे मिश्रण करते.

3

कोडिंग

1

समस्या, मर्यादा आणि अपवादात्मक प्रकरणे समजून घ्या. योग्य डेटा संरचनांसह अल्गोरिदम तयार करा. उदाहरणे आणि अपरिवर्तनीय अटींच्या आधारे योजनेची पडताळणी करा. स्वच्छ आणि वाचनीय कोड लिहा. पुनर्रचना, अनुकूलन आणि अंतिम स्वरूप देऊन सुधारणा करा.

अधिक सर्वसमावेशक धोरण, पण त्यात साधनांच्या वापराबाबत मार्गदर्शन नाही.

2

कोडिंग

-1

समस्या, मर्यादा आणि अपवादात्मक प्रकरणे समजून घ्या. योग्य डेटासह अल्गोरिदम तयार करा. स्वच्छ आणि वाचनीय कोड लिहा. साधनांचा वापर: साधन वापरताना ते का वापरले याचा संक्षिप्त सारांश द्या.

साधनांच्या वापराचा उल्लेख करणारे अधिक चांगले धोरण, पण त्यात आणखी सुधारणा शक्य आहे.

1

कोडिंग

-1

समस्या वरवर वाचा. समस्या सोडवा. किमान चाचण्या तयार करा. जे काही चालते ते सादर करा.

चाचण्यांचा उल्लेख आहे, पण एकूण धोरण कमकुवत आहे.

3. N नमुने निवडल्यानंतर ते सिस्टम प्रॉम्प्टमध्ये समाविष्ट करा. यामुळे मॉडेलला अत्यल्प मार्गदर्शनावर योजना तयार करायला न सोडता, आधीच्या तज्ज्ञ अभिप्रायाचा आधार घेऊन योजना निर्माण केली जाते. नमुना धोरणांची शब्दशः नक्कल करण्याऐवजी मॉडेलला “चाकोरीबाहेर विचार” करण्यास आणि गरजेनुसार टप्पे जोडण्यास प्रोत्साहित करा.

टप्प्याटप्प्याने मार्गदर्शन दाखवणारा स्क्रीनशॉट.

4. गतिशीलपणे तयार केलेल्या सिस्टम प्रॉम्प्टद्वारे वापरकर्त्याची विनंती हाताळण्यासाठी नवीन धोरण निर्माण करा. या प्रक्रियेतून अंतिम आउटपुट सुधारणारी अतिरिक्त कार्ये निर्माण झाली पाहिजेत. सर्जनशीलता हे उद्दिष्ट आहे: आधीच्या धोरणांतील सर्वात प्रभावी घटक एकत्र करा, पुनरावृत्ती होणारे टप्पे समेकित करा आणि गरजेनुसार उपयुक्त नवे टप्पे जोडा.

टीप: अधिक वैविध्यपूर्ण आणि कमी पूर्वनिश्चित आउटपुट मिळवण्यासाठी तापमान हा घटक समायोजित करता येतो. सर्जनशीलता अपेक्षित असताना हे उपयुक्त ठरते. तापमान शून्यापेक्षा जास्त असल्यास निर्माण होणारी प्रत्येक योजना वेगळी असू शकते.

5. मॉडेलचे आउटपुट मिळाल्यानंतर, तुमच्या समस्येचा चांगला उपाय कसा असावा हे ठरवणाऱ्या विशिष्ट निकषांनुसार मानवी मूल्यांकनकर्ता किंवा LLM परीक्षक वापरून त्याचे मूल्यमापन करा. आधी नमूद केलेल्या पोर्तुगालमधील उपक्रमांच्या उदाहरणासाठी मूल्यमापन निकष असे असू शकतात:

  • संक्षिप्तता (उत्तर एका वाक्यापुरते मर्यादित असणे)

  • सुचवलेल्या उपक्रमाची सुसंगतता

  • स्थानाची अचूकता

6. या मूल्यमापनाच्या आधारे दुसरे मॉडेल वापरून धोरण सुधारा. ऐच्छिक अभिप्राय चक्रात मानवी सूचना समाविष्ट करून सहयोगात्मक सुधारणांना पाठबळ देता येते. आवृत्त्या आणि बदलांचा मागोवा घेण्यासाठी योग्य मेटाडेटासह सुधारित धोरण तुमच्या डेटाबेसमध्ये साठवा.

टप्प्याटप्प्याने मार्गदर्शन दाखवणारा स्क्रीनशॉट.

मग हा सगळा खटाटोप कशासाठी? तुम्ही आउटपुटचे स्वतः परीक्षण करून त्यानुसार सिस्टम प्रॉम्प्ट समायोजित करू शकता. मात्र, शक्तिशाली रीझनिंग मॉडेल आउटपुटचा संदर्भ आणि मानवी अभिप्राय या दोन्हींचा वापर करून धोरणे सुधारू शकतात. सोप्या पद्धतींमधील त्रुटी माणसे सहज ओळखू शकतात. मात्र, अधिक व्यापक समस्यासंच हाताळणाऱ्या गुंतागुंतीच्या सिस्टममध्ये त्या शोधणे कठीण आणि कंटाळवाणे होते.

माणसे एखाद्या समस्येसाठी सहज वापरत असलेले संदर्भज्ञान गोळा करण्यासाठी LLMना अनेकदा तपशीलवार सूचना आणि अतिरिक्त टप्प्यांची गरज असते. अधिक व्यापक समस्यासंच हाताळण्यासाठी सिस्टमचा विस्तार होताच आवश्यक कार्यांची संख्या झपाट्याने वाढू शकते. उदाहरणार्थ, कोडिंग समस्या सोडवणाऱ्या माणसांना आसपासचा कोडसंच सहज समजू शकतो, तर LLMला प्रथम अनेक फाइल “वाचाव्या” लागू शकतात.

तुमच्या AI उपायांमध्ये SPL लागू करण्याचा प्रभाव

समस्या सोडवण्याचे नवे मार्ग शोधणे

  • उपयुक्त ठरते तेव्हा: तुम्ही ग्राहक सहाय्य संघ चालवता आणि तिकिटांचे प्राथमिक वर्गीकरण AI एजंट करतो, असे समजा. कालांतराने SPL तुमच्या संघाने विचारात न घेतलेली वर्गीकरण पद्धत शोधू शकते आणि त्यामुळे प्रकरणे वरिष्ठांकडे पाठवण्याचे प्रमाण कमी होऊ शकते.

  • उपयुक्त ठरत नाही तेव्हा: आर्थिक अहवालासारख्या कामांत अनुपालन आवश्यकता किंवा नियमांनी तुमचे कार्यप्रवाह आधीच निश्चित केले असल्यास, सर्जनशीलता फायदेशीर न ठरता जोखीम बनते आणि SPLचा फारसा उपयोग होत नाही.

मानव-AI सहकार्य वाढवणे

  • उपयुक्त ठरते तेव्हा: बाजारविषयक बुद्धिमत्ता किंवा उत्पादन धोरणासारख्या संशोधन-केंद्रित भूमिकांमध्ये तुम्ही AIच्या योजना सुधारून, त्याचे आउटपुट समृद्ध करून आणि भविष्यातील वापरासाठी या सुधारणा समाविष्ट करून त्याच्याशी सहकार्य करू शकता. प्रत्येक संवादामुळे सिस्टमची परिणामकारकता वाढते.

  • उपयुक्त ठरत नाही तेव्हा: तुमचा संघ AIचा वापर प्रामुख्याने अत्यल्प मानवी सहभाग असलेल्या सरळ कार्यप्रवाहांसाठी करत असेल, जसे की बीजक प्रक्रिया, तर सहकार्याचा अतिरिक्त भार लाभापेक्षा जास्त ठरू शकतो.

नवीन समस्यांशी जुळवून घेणे

  • उपयुक्त ठरते तेव्हा: तुम्ही नव्या प्रदेशात विस्तार करता आणि AIला अचानक स्थानिक करसंबंधी प्रश्न हाताळावे लागतात, असे समजा. नवे नियम आणि अनुभवाधारित पद्धती समोर येताच SPLच्या मदतीने त्या पटकन अंतर्भूत करता येतात व वारंवार होणाऱ्या चुका टाळता येतात.

  • उपयुक्त ठरत नाही तेव्हा: बैठकींच्या प्रतिलेखांचे प्रमाणित सारांशांत रूपांतर करण्यासारखे तुमचे वातावरण स्थिर असेल, तर सतत जुळवून घेण्याचा फारसा लाभ होत नाही.

आव्हाने आणि जोखमीचे घटक

सैद्धांतिकदृष्ट्या हे सर्व आशादायक वाटते, पण SPLची अंमलबजावणी करताना खऱ्या अडचणी येतात. त्यांपैकी काही प्रमुख अडचणी पुढे पाहूया:

एककेंद्रित प्रगतीचा अभाव

धोरणनिर्मितीच्या सुरुवातीच्या टप्प्यांत प्रगती अनेकदा खुंटते: नवीन आउटपुट आधीच्या आउटपुटवर पुढची उभारणी करत नाहीत आणि गती मंदावते. यामागे सहसा दोन प्रमुख समस्या असतात:

    • उपाय: उपलब्ध असलेले सर्व व्यावसायिक ज्ञान सुरुवातीलाच अंतर्भूत करा, जेणेकरून सिस्टमकडे वापरण्यासाठी पुरेशी सखोल माहिती असेल.

    • उपाय: अचूकता, स्पष्टता आणि सुसंगतता अशा उत्तराच्या अनेक पैलूंना गुण देणारी सूक्ष्म मूल्यमापन-चौकट तयार करा आणि या संकेतांनुसार नमुना-निवड समायोजित करा.

धोरणांचा अनियंत्रित विस्तार

तुमची सिस्टम शेकडो धोरणे निर्माण करत असेल, पण चांगली आणि वाईट धोरणे ओळखण्यासाठी पुरेसा अभिप्राय मिळत नसेल, तर नमुना-निवड लवकरच हाताळण्यापलीकडे जाते. यावर उपाय म्हणजे छाटणी.

धोरणसंग्रह सुधारताना पुढील बाबींचा विचार करा:

  • आयुर्मान: ठरावीक कालावधी किंवा निर्मितींची संख्या ओलांडल्यानंतर धोरणे वापरातून काढा.

  • गुण: सातत्याने खराब कामगिरी करणारी धोरणे वगळण्यासाठी तुमची मूल्यमापन-चौकट वापरा. हे आयुर्मानाशी जोडल्याने कालांतराने उपयुक्तता सिद्ध करणाऱ्या पद्धतीच तुम्ही जतन करता.

  • LLM परीक्षण: यापुढे वैशिष्ट्यपूर्ण अंतर्दृष्टी न देणारी धोरणे शोधण्यासाठी त्यांचे ठरावीक काळाने मूल्यमापन करा, कारण त्यांतील उपयुक्त घटक बहुधा नव्या आवृत्त्यांमध्ये आधीच समाविष्ट झालेले असतात.

उपाय: तुमच्या धोरण डेटाबेसला सजीव सिस्टम समजा: केवळ सुसंगत आणि उच्च-मूल्याचे ज्ञान शिल्लक राहावे म्हणून त्याची नियमित छाटणी करा.

निष्कर्ष

सिस्टम प्रॉम्प्ट लर्निंग अजून बाल्यावस्थेत आहे, पण त्याची क्षमता प्रचंड आहे. केवळ स्थिर प्रॉम्प्ट किंवा अखंड फाइन-ट्यूनिंगवर अवलंबून असलेल्या व्यवसायांना परिचित मर्यादांचा सामना करावा लागेल: नाजूक सिस्टम, वाढता खर्च आणि वाया जाणारे प्रयत्न. कालांतराने सुधारणा करणाऱ्या आणि वेगवेगळी ठिगळे जोडण्याऐवजी उच्च-स्तरीय तत्त्वे अंतर्भूत करणाऱ्या सिस्टम उभारून SPL या चक्रातून बाहेर पडण्याचा मार्ग देते.

SPL अजून उदयोन्मुख आहे, पण त्याची दिशा स्पष्ट आहे: स्वतःकडून शिकू शकणाऱ्या सिस्टम तसे न करू शकणाऱ्या सिस्टमच्या पुढे जातील. प्रयोग करण्याची, छोट्या प्रमाणात सुरुवात करण्याची, शिकलेले धडे नोंदवण्याची आणि प्रत्येक संवादासह सुधारणाऱ्या AI सिस्टमचा पाया घालण्याची हीच वेळ आहे.

लेखक

George Williamson