પાયાના મોડલ સુધર્યા છે, પરંતુ શિસ્તબદ્ધ મૂલ્યાંકન પદ્ધતિઓએ જ વિશ્વાસપૂર્વક ઉત્પાદન સ્તરે ઉપયોગ શક્ય બનાવ્યો છે.
સુવ્યવસ્થિત મૂલ્યાંકનો ઉત્પાદન સંચાલકો, AI શાસન પ્રમુખો અને મુખ્ય ટેક્નોલોજી અધિકારીઓને AI એજન્ટો સુરક્ષિત રીતે મોટા પાયે કાર્યરત કરવામાં મદદ કરે છે અને AIને અલગ-થલગ રમકડામાંથી સ્પર્ધાત્મક લાભમાં ફેરવે છે.
આ વિશ્વાસ કોઈ જાહેર માપદંડના ‘આ મોડલ શ્રેષ્ઠ છે’ એવા દાવાથી નહીં, પરંતુ તમારા વાસ્તવિક વ્યવસાયિક સંદર્ભને દર્શાવતી સાચી વપરાશકર્તા પૂછપરછ, અસામાન્ય પરિસ્થિતિઓ અને ક્ષેત્ર-વિશિષ્ટ દૃશ્યો સામે AI એજન્ટના વર્તનનું મૂલ્યાંકન કરવાથી આવે છે.
લક્ષ્ય માપી શકાય તેવાં પરિણામો દ્વારા આ વિશ્વાસને વાજબી ઠેરવવાનું છે. સફળતા એટલે તમારી વ્યવસાયિક જરૂરિયાતો અને જોખમ સહનશીલતા સાથે સુસંગત એવા નક્કર, માપી શકાય તેવા માપદંડોમાં “સારું” શું છે તે વ્યાખ્યાયિત કરવું—પછી તે તથ્યાત્મક ચોકસાઈ, યોગ્ય લહેજો, ઝડપ કે ખર્ચ-કાર્યક્ષમતા હોય.
તમારી આખી પ્રણાલીમાં મૂલ્યાંકન સમાવીને—માપન વ્યવસ્થા, નોંધણી, A/B પરીક્ષણ અને સુરક્ષા મર્યાદાઓ સહિત—તેમજ કડકાઈ અને કાર્યક્ષમતાનું સંતુલન રાખીને ટીમો વધુ ઝડપથી અને વધુ મજબૂતીથી પ્રણાલી કાર્યરત કરી શકે છે.
મોટાભાગના વ્યવસાયો તેમના કર્મચારીઓ ChatGPT અથવા Gemini અજમાવે તે બાબતે સહજ છે. પરંતુ અત્યંત મહત્ત્વની કાર્યપ્રવાહો કે પરિસ્થિતિઓમાં LLMને કામે લગાડવાનું ઓછું જોવા મળ્યું છે.
તેના કારણો ઘણી વાર વાજબી હતાં: ગુણવત્તા અસંગત રહી હતી અને ભ્રામક માહિતી કે અનિચ્છનીય વર્તનનું જોખમ ટેક્નોલોજીના સંભવિત લાભો કરતાં વધારે હતું.
છેલ્લા વર્ષમાં જોખમ અને લાભનું આ સંતુલન નોંધપાત્ર રીતે બદલાયું છે. આ ફેરફારનો કેટલોક ભાગ પાયાના મોડલની કામગીરીમાં થયેલા સુધારાને આભારી છે, પરંતુ મોટો ભાગ મૂલ્યાંકન અંગે વધતી શિસ્તને કારણે છે. મૂલ્યાંકનો અમને અને અમારા ગ્રાહકોને મોટા પાયાના તથા ગ્રાહક-સામે કાર્યરત એજન્ટોને થોડાં અઠવાડિયાંમાં કાર્યરત કરવાનો વિશ્વાસ આપે છે.
આ માર્ગદર્શિકા મૂલ્યાંકનના પાયાના ઘટકો અને ઉત્પાદન ઉપયોગ માટે તેમની રચના, અમલ તથા સંચાલન કેવી રીતે કરવું તે સમજાવશે.
મૂલ્યાંકનનો હેતુ સંપૂર્ણ મોડલ શોધવાનો નથી, પરંતુ તમારું મોડલ તમારી વ્યવસાયિક જરૂરિયાતો, વપરાશકર્તાઓની અપેક્ષાઓ અને સંસ્થાની જોખમ સહનશીલતા સાથે સુસંગત રીતે વર્તે છે એવો વાજબી વિશ્વાસ મેળવવાનો છે.
કોઈપણ મૂલ્યાંકન વ્યૂહરચનાના પાયામાં એક સરળ પ્રશ્ન છે: “સારું” કેવું હોય? જવાબ ચોક્કસ હોવો જોઈએ. એક સંસ્થા માટે “સારું” એટલે કડક સહનમર્યાદામાં તથ્યાત્મક ચોકસાઈ હોઈ શકે છે; બીજી સંસ્થા ઝડપ, ખર્ચ-કાર્યક્ષમતા અથવા વિશિષ્ટ સંવાદશૈલીને પ્રાથમિકતા આપી શકે છે. કયા ડેટાનો ઉપયોગ થઈ શકે છે તેથી લઈને કઈ નિયમનકારી ફરજો લાગુ પડે છે ત્યાં સુધીની દરેક મર્યાદા આ વ્યાખ્યાને આકાર આપે છે.
સૌથી અગત્યનું એ છે કે ‘સારા’ના ઘટકો ખરેખર માપી શકાય તેવા હોવા જોઈએ. જો સફળતાનો અર્થ ઉપયોગી નાણાકીય માર્ગદર્શન આપવાનો હોય, તો ઉપયોગિતાને તથ્યાત્મક શુદ્ધતા, યોગ્ય અસ્વીકરણો, વ્યક્તિગત રিজનિંગ અને સુરક્ષિત મર્યાદાઓ જેવા ગુણો દ્વારા વ્યક્ત કરવી જોઈએ. ‘સારું’ માપી શકાય તેવા માપદંડોમાં વ્યાખ્યાયિત થયા પછીનો પ્રશ્ન છે કે તમે પરિણામોનું વિશ્લેષણ અને અર્થઘટન કેવી રીતે કરશો. આ પરિણામોના આધારે પગલાં લેવાથી જ મૂલ્યાંકન માત્ર અભિપ્રાય આપવાને બદલે એક પદ્ધતિ બને છે.
દરેક મૂલ્યાંકન પ્રક્રિયા ત્રણ પરસ્પર જોડાયેલા આધારસ્તંભો પર ટકી છે:
ઇનપુટ/માપદંડો: સામાન્ય કામગીરી માટે પ્રતિનિધિત્વ કરતા વાસ્તવિક ઉદાહરણો અને ક્ષેત્રમાં ઉપયોગિતા ચકાસવા માટે સંસ્થા દ્વારા સંકલિત ડેટાસેટ.
મોડલનું વર્તન: મોડલને કેવી રીતે બોલાવવામાં આવે છે—પુનઃપ્રાપ્તિ-સંવર્ધિત સર્જન, સારાંશ, સંરચિત માહિતી પુનઃપ્રાપ્તિ અથવા સાધનોનો ઉપયોગ.
માપદંડો: તમે કામગીરીને કેવી રીતે માપો અને તેનું અર્થઘટન કરો છો.
ઇનપુટે તમારી પ્રણાલીને જે વાસ્તવિક પરિસ્થિતિઓનો સામનો થશે તેનું પ્રતિનિધિત્વ કરવું જોઈએ. સૌથી અર્થપૂર્ણ સમજ વાસ્તવિક ઉદાહરણોમાંથી મળે છે: તમારા ગ્રાહકોની પૂછપરછ, નાણાકીય પરિસ્થિતિઓ અથવા ઉદ્યોગ-વિશિષ્ટ કિસ્સા. આ ઉદાહરણો સામે પરીક્ષણ કરવાથી જ જાણી શકાય કે મોડલ વપરાશકર્તાઓને જરૂરી સૂક્ષ્મતાઓ ખરેખર સમજે છે અને વ્યવસાયિક જરૂરિયાત પૂરી કરે છે કે નહીં.
મોડલને કેવો પ્રોમ્પ્ટ અપાય છે, પુનઃપ્રાપ્તિ કે સાધનનો ઉપયોગ કેવી રીતે સંચાલિત થાય છે અને સંદર્ભ કેવી રીતે અપાય છે તે બધું મોડલ જેટલું જ મહત્ત્વનું છે. બે સમાન મોડલને કેવી રીતે કાર્યરત કરવામાં આવે છે તેના આધારે તેમનું વર્તન ઘણું જુદું હોઈ શકે છે. તેથી આ સ્તરને તમારી મૂલ્યાંકન રચનામાં સામેલ કરવું જરૂરી છે.
છેલ્લે, માપદંડો આવે છે. માત્ર આંકડા ભાગ્યે જ આખી વાત કહે છે, પરંતુ યોગ્ય રીતે પસંદ કરેલા માપદંડો પ્રણાલીના વર્તનને સમજવા યોગ્ય બનાવે છે. વિલંબ, ચોકસાઈ, સલામતી, સુસંગતતા, પક્ષપાત, ખર્ચ અને વપરાશકર્તા સંતોષ મળીને કાર્યરત પ્રણાલીનું બહુપરીમાણી ચિત્ર રજૂ કરે છે. તમારા પ્રકલ્પ અથવા વ્યવસાયના મુખ્ય કામગીરી સૂચકો સાથે સુસંગત અને વપરાશકર્તાઓ માટે સૌથી મહત્ત્વના ગુણોને સ્પષ્ટ કરતા માપદંડો પસંદ કરવામાં જ કુશળતા છે. સરળ માપદંડો ઘણી વાર વધુ ચોક્કસ અને ઓછા ખર્ચાળ હોય છે, જ્યારે ખરાબ પસંદગી ટીમોને ગેરમાર્ગે દોરી શકે છે. માપદંડોની પસંદગી વિશે આ રીતે વિચારો:
સારા માપદંડોની પસંદગીનાં ઉદાહરણો:
ગ્રાહક સેવા સંવાદસહાયક: પ્રથમ સંપર્કમાં ઉકેલનો દર—શું વપરાશકર્તાની સમસ્યા ઉચ્ચ સ્તરે મોકલ્યા વિના ઉકેલાઈ?—સરેરાશ સંચાલન સમય, વપરાશકર્તા સંતોષ ગુણાંક અને માનવીય એજન્ટ સુધી મોકલવાનો દર.
નાણાકીય સંશોધન સાધન: સંદર્ભની ચોકસાઈ—યોગ્ય સ્રોત ધરાવતા દાવાની ટકાવારી—પ્રમાણિત સત્ય સામે ચકાસેલી તથ્યાત્મક શુદ્ધતા, પુનઃપ્રાપ્તિની સુસંગતતા—શું યોગ્ય દસ્તાવેજો મળ્યા?—અને ક્ષેત્ર નિષ્ણાતોએ આપેલો રિઝનિંગની સુસંગતતાનો ગુણાંક.
કોડ સર્જન સહાયક: વાક્યરચનાની શુદ્ધતા, પરીક્ષણ સફળતાનો દર, સુરક્ષા નબળાઈઓની સંખ્યા અને કાર્યરત ઉકેલ મેળવવાનો સમય.
ખરાબ માપદંડોની પસંદગીનાં ઉદાહરણો:
ગુણવત્તાના પ્રતિનિધિ તરીકે માત્ર જવાબની લંબાઈ વાપરવી—લાંબો જવાબ એટલે સારો જવાબ નહીં.
ચોકસાઈ સાથેના સમાધાનને ધ્યાનમાં લીધા વિના ઝડપ માપવી.
મોડલના વિશ્વાસ ગુણાંકોને વાસ્તવિક શુદ્ધતા સામે ચકાસ્યા વિના માપવા.
વપરાશકર્તા-સામે ચકાસણી વિના માત્ર મોડલની આંતરિક અનિશ્ચિતતા પર આધાર રાખવો.
ટાળવા જેવી માપદંડ સંબંધિત સામાન્ય ભૂલો:
વિરોધાભાસી માપદંડો: સમાધાન સ્વીકાર્યા વિના એકસાથે ઝડપ અને વ્યાપકતા માટે શ્રેષ્ઠીકરણ કરવું.
માપદંડોને અતિશય અનુરૂપતા: પરીક્ષણ સમૂહમાં 95% મેળવવું, પરંતુ વાસ્તવિક વપરાશકર્તાઓ જુદું વર્તતા હોવાથી ઉત્પાદનમાં નિષ્ફળ જવું.
કડક નિયમન ધરાવતા નાણાકીય સેવા ક્ષેત્રના એક ગ્રાહક માટે તેમના ડીપ રિસર્ચ ઉકેલમાં ચોકસાઈ સર્વોપરી હતી. અમે નિષ્ણાતોએ તૈયાર કરેલા પ્રશ્નોત્તર ડેટાસેટને સાધન-સર્જિત ડેટાસેટ સાથે જોડ્યા. આથી અમે ચોકસાઈ, યોગ્ય સાધન પસંદ કરવાની પ્રણાલીની ક્ષમતા અને યોગ્ય માહિતી મેળવવાની તેની કુશળતા માપી શક્યા તથા ચોકસાઈ અને રિઝનિંગની ગુણવત્તાનું સંતુલિત ચિત્ર મેળવ્યું. મુખ્ય બાબત અનેક પરિમાણો માપવાની હતી: તથ્યાત્મક ચોકસાઈ—નિષ્ણાત ચકાસણી—પુનઃપ્રાપ્તિની ગુણવત્તા—સુસંગત દસ્તાવેજોની ચોકસાઈ અને પૂર્ણતા—તથા રિઝનિંગની સુસંગતતા—તાર્કિક પ્રવાહનું સંરચિત મૂલ્યાંકન.
સૂક્ષ્મ ગુણવત્તા માટે નિર્ણાયક તરીકે LLMનો ઉપયોગ ક્યારે કરવો
નિર્ણાયક તરીકે LLM બીજી AI મોડલને મૂલ્યાંકનકર્તા તરીકે વાપરે છે અને માનવીય સમીક્ષાના સ્થાને વિસ્તારી શકાય એવું સ્વચાલિત ગુણવત્તા અંકન આપે છે. સરળ માપદંડો જરૂરી ચોકસાઈ આપી શકે ત્યારે નિર્ણાયક તરીકે LLMનો ઘણી વાર દુરુપયોગ થાય છે. જ્યાં નિશ્ચિત તપાસ ગુણવત્તાને સમાવી ન શકે ત્યાં તે ઉપયોગી થઈ શકે છે, જેમ કે માપદંડ અર્થસંબંધિત હોય—ઉપયોગિતા, સ્રોતાધારિતતા, રિઝનિંગની ગુણવત્તા, લહેજો કે નીતિનું અર્થઘટન—અને નિશ્ચિત અંકન શક્ય ન હોય. અનેક પ્રોમ્પ્ટ અથવા મોડલ પ્રકારો માટે વિસ્તારી શકાય એવો પ્રતિસાદ મેળવવા અને સ્પષ્ટ ગુણાંકન માર્ગદર્શિકા તથા સ્ટ્રક્ચર્ડ આઉટપુટ્સ સ્કીમા નક્કી કરવા તેની જરૂર પડી શકે છે. તેને તમારા માટે અસરકારક બનાવવા આ પગલાં અનુસરો:
ગુણાંકન માર્ગદર્શિકાનાં પરિમાણો સ્પષ્ટ નક્કી કરો: શુદ્ધતા, સ્રોતાધારિતતા, નીતિ પાલન, કાર્યવાહીક્ષમતા અને લહેજો.
નિર્ણાયકના જવાબો માટે સ્ટ્રક્ચર્ડ આઉટપુટ્સ—JSON સ્કીમા—વાપરો.
નિષ્ફળતાના વિશ્લેષણ માટે દ્વિમૂલ્ય પ્રવેશ-ગુણાંક અને નિદાનાત્મક લખાણ બંને નોંધો.
દરેક પ્રકાશન ચક્રમાં માનવી દ્વારા ચિહ્નિત નમૂનાઓ સામે નિર્ણાયકના આઉટપુટનું સમાયોજન કરો.
અત્યંત મહત્ત્વના ક્ષેત્રો માટે બે નિર્ણાયકો અથવા સમયાંતરે સહમતિની તપાસ વાપરો.
સમય જતાં નિર્ણાયકમાં થતા ફેરફાર અને અસહમતિના દરને માપો.
માપદંડ ડેટાસેટ જાણીતા જવાબો ધરાવતાં નિશ્ચિત અને સંકલિત પરીક્ષણ ઉદાહરણોનો સમૂહ છે, જેનાથી મોડલનું સાતત્યપૂર્વક મૂલ્યાંકન અને સંસ્કરણો વચ્ચે પરિણામોની વાજબી તુલના થાય છે. તેમાં સામાન્ય રીતે ઇનપુટ—જેમ કે વપરાશકર્તાની પૂછપરછ—અપેક્ષિત આઉટપુટ અથવા સંદર્ભ નિર્ણયો અને ગુણાંકન માટેનાં મૂલ્યાંકન માપદંડો કે ઓળખચિહ્નો હોય છે. જાહેર માપદંડ પરીક્ષણોનો ઉપયોગ અદ્યતન મોડલની કામગીરી સરખાવવા માટે થાય છે અને તમારી પ્રણાલી રચતી વખતે કયું મોડલ ઉપયોગી ઉમેદવાર બની શકે તે અંગે પ્રારંભિક માર્ગદર્શન આપે છે.
પરંતુ તમારી પોતાની પ્રણાલી માટે વ્યવસાયિક સંદર્ભમાં કામગીરીના પ્રતિનિધિ તરીકે આ માપદંડો પર આધાર રાખી શકાતો નથી, કારણ કે તેમાં કેટલીક જાણીતી સમસ્યાઓ છે:
દૂષણ: મોડલને માપદંડના ડેટા પર તાલીમ મળી હોઈ શકે છે; એ જ ડેટાસેટ પર તેનું મૂલ્યાંકન કરવું એટલે જવાબપોથી જોઈને ગુણ આપવા જેવું છે.
સંતૃપ્તિ: તમામ અગ્રણી મોડલ પહેલેથી મહત્તમ ગુણ મેળવે છે, તેથી કામગીરીમાં સુધારો કે ઘટાડો થોડા ટકાવારી અંકો પૂરતો રહે છે અને ઘણી વાર પરીક્ષણ પરિણામોની સ્વાભાવિક ભિન્નતામાં સમાઈ જાય છે.
મર્યાદિત વ્યાપ: માપદંડનો ડેટા તમારા વાસ્તવિક કાર્યો દર્શાવતો નથી; તે ખૂબ પસંદગીપૂર્વક સંકલિત અને શુદ્ધ કરેલો હોય છે. કેટલાક તો LLM દ્વારા સર્જાયેલા હોય છે અને તમારા ડેટામાં જોવા મળતી જટિલતા તથા અસામાન્ય પરિસ્થિતિઓ—જોડણીની ભૂલો, અસામાન્ય શબ્દપ્રયોગ કે અસ્પષ્ટ છબીઓ—દર્શાવતા નથી.
વિદ્યાર્થી એપ્લિકેશનને શબ્દપ્રશ્નો ઉકેલવામાં મદદ કરવા કહે છે.
ઉપયોગ કરી શકાય તેવા જાહેર માપદંડનું ઉદાહરણ: GSM8K—પ્રાથમિક શાળાનું ગાણિતિક રિઝનિંગ.
વૈકલ્પિક વધુ મુશ્કેલ સમૂહ: MATH.
આ માપદંડ કેમ ઉપયોગી છે:
સામાન્ય ગાણિતિક રિઝનિંગમાં કયું મોડલ વધુ સારું છે તેની ઝડપી તુલના થાય છે.
સંપૂર્ણ ઉત્પાદન મૂલ્યાંકનમાં રોકાણ કરતાં પહેલાં સારું પ્રારંભિક ગાળણ પૂરું પાડે છે.
તમને પોતાનો ડેટાસેટ હજુ પણ કેમ જરૂરી છે:
તમારી એપ્લિકેશનની એવી જરૂરિયાતો છે જે GSM8K ચકાસતું નથી:
તમારા અભ્યાસક્રમની શબ્દાવલી અને વિષયોનો ક્રમ.
તમારા વયજૂથને અનુરૂપ સમજાવવાની શૈલી.
અસ્પષ્ટ કે ઘણી જોડણીની ભૂલો ધરાવતા વિદ્યાર્થીઓના પ્રશ્નોને કેવી રીતે સંભાળવા.
નીતિના નિયમો—જેમ કે માત્ર સંકેત ક્યારે આપવો અને સંપૂર્ણ જવાબ ક્યારે આપવો.
અસરકારક ચકાસણી માટે તમારી એપ્લિકેશન-વિશિષ્ટ મૂલ્યાંકન માપદંડો બનાવવા આવશ્યક છે. આ ડેટાસેટ વાસ્તવિક સંવાદો, સામાન્ય અસામાન્ય પરિસ્થિતિઓ અને સંભવિત નિષ્ફળતાઓ પરથી બનવા જોઈએ. નવું ઉત્પાદન અથવા પ્રક્રિયા અમલમાં મૂકતી વખતે આ મુશ્કેલ કાર્ય હોઈ શકે છે. તેમ છતાં, મોટાભાગના કિસ્સામાં હાલના ઉત્પાદનમાંથી અથવા શક્ય તેટલું વહેલું, પ્રારંભિક પરીક્ષણ દરમિયાન પણ ડેટા એકત્ર કરી શકાય છે. એપ્લિકેશન વિકસ્યા પછી ઉત્પાદન સાથે આ માપદંડો પણ વિકસવા જોઈએ અને સમય જતાં વધુ સમૃદ્ધ તથા પ્રતિનિધિત્વપૂર્ણ બનવા જોઈએ.
કિસ્સા અભ્યાસ: છૂટક બેંકિંગ સહાયક માટે વિશિષ્ટ માપદંડ બનાવવો
બેંકિંગ સંવાદસહાયક બજેટ, ખર્ચ અને વ્યવહારો વિશેના પ્રશ્નોના જવાબ આપે છે. જાહેર પ્રશ્નોત્તર માપદંડો અને લખાણથી SQL બનાવતાં પરીક્ષણો SQL ઇન્જેક્શન, ડેટા લીક અથવા બહુ-તબક્કાના સંવાદમાં સંદર્ભ જાળવવા જેવાં મુખ્ય બેંકિંગ જોખમોને સમાવી શક્યાં નહીં. અમે આ ઉત્પાદનની એજન્ટ પ્રક્રિયાને પ્રતિબિંબિત કરતો વિશિષ્ટ માપદંડ બનાવ્યો.
આ કોડસંગ્રહમાં વિશિષ્ટ માપદંડના ઘટકો:
SQL ઇન્જેક્શન, PII નિષ્કર્ષણ, પ્રોમ્પ્ટને બિનઅસરકારક બનાવવા અને અલગ સત્રો વચ્ચે ડેટા લીક માટેના દૂષિત પ્રોમ્પ્ટનો પ્રતિકૂળ પરીક્ષણ સમૂહ.
સલામતીમાં શૂન્ય સહનશીલતા: કોઈપણ SQL ઇન્જેક્શન, PII નિષ્કર્ષણ અથવા અલગ સત્રો વચ્ચેનો ડેટા લીક નકારવો જ જોઈએ.
સંદર્ભ જાળવણીની ચોકસાઈ: ફરી લખેલી પૂછપરછમાં વપરાશકર્તાનો હેતુ અને એકમો જળવાવાં જોઈએ.
મુખ્ય શીખ: માપદંડ બનાવવાની પ્રક્રિયાને ઉત્પાદન સુવિધા ગણો. વર્તમાન કાર્યપ્રણાલી સાબિત કરે છે કે છેડેથી છેડા સુધીનું મૂલ્યાંકન જોડાયેલું છે, પરંતુ વાસ્તવિક બેંકિંગ જોખમો—બહુવિધ હેતુવાળા હુમલા, સુરક્ષા મર્યાદાઓને ચકમો અને સંદર્ભ-આધારિત પૂછપરછ—દર્શાવવા આવરણ અને નમૂનાની સંખ્યા વધારવી જરૂરી છે. નવા એજન્ટો અને સુરક્ષા મર્યાદાઓ સાથે માપદંડ પણ વિસ્તરવો જોઈએ.
તમારા એપ્લિકેશન-વિશિષ્ટ માપદંડ અને મોડલની પસંદગી વચ્ચેનો સંબંધ અત્યંત મહત્ત્વનો છે. તમારો માપદંડ માત્ર ઉકેલ કામ કરે છે કે નહીં એટલું જ નહીં, પણ મોડલના કદ અને તાલીમોત્તર તકનીકોનું કયું સંયોજન સૌથી ખર્ચ-અસરકારક રીતે જરૂરી કામગીરી આપે છે તે પણ દર્શાવે છે. પૂર્વ-પ્રશિક્ષિત મોડલમાં—ChatGPTના ‘PT’માં—સૌથી શક્તિશાળી સુધારા ફરી તાલીમ આપવાથી નહીં, પરંતુ “તાલીમોત્તર” પદ્ધતિઓથી આવે છે.
આ પદ્ધતિઓ મોડલને કઈ માહિતી મળી શકે, તે કેવી રીતે સંરચિત હોય અને અનુમાન સમયે મોડલને કેવી રીતે માર્ગદર્શન તથા સંચાલન મળે તેના પર ધ્યાન આપે છે. તાલીમોત્તર તકનીકોમાં આ સામેલ છે:
ચેન-ઓફ-થોટ પ્રોમ્પ્ટિંગ અને ગતિશીલ ગણતરી ફાળવણી—મુશ્કેલ સમસ્યાઓ માટે વધુ વિચારવું.
સ્વ-સુસંગતતા, જેમાં અનેક આઉટપુટ સર્જીને શ્રેષ્ઠ પસંદ કરવામાં આવે છે.
સંદર્ભ રચના અને સંચાલન, જેમ કે પુનઃપ્રાપ્તિ-સંવર્ધિત સર્જન—RAG—ફ્યુ-શોટ ઉદાહરણો અને એજન્ટ-આધારિત કાર્યપ્રવાહો.
સાધનોનો ઉપયોગ અને બાહ્ય જ્ઞાનની પહોંચ, જે મોડલને તેના આંતરિક પરિમાણોથી આગળ કાર્ય કરવા સક્ષમ બનાવે છે.
સંરચિત અને અસંરચિત ડેટામાંથી કાર્યક્ષમ પુનઃપ્રાપ્તિ તથા રિઝનિંગ માટે રચાયેલી જ્ઞાન રજૂઆત અને સંગ્રહ વ્યૂહરચનાઓ.
આ તાલીમોત્તર તકનીકો પ્રણાલીની કામગીરીમાં નોંધપાત્ર સુધારો કરી શકે છે, પરંતુ તે સમાધાનો પણ લાવે છે. સંચાલન, પુનઃપ્રાપ્તિ અથવા રિઝનિંગનું દરેક વધારાનું સ્તર પ્રણાલીની જટિલતા, અનુમાન સમય અને સંચાલન ખર્ચ વધારે છે. પરંતુ વિચારપૂર્વક લાગુ કરેલું તાલીમોત્તર તકનીકોનું યોગ્ય સંયોજન ઘણી વાર કામગીરીની જરૂરિયાતો પૂરી કરતાં નાનાં, ઝડપી અને સસ્તાં મોડલ પર આધાર રાખવાનું શક્ય બનાવે છે. મોડલનું કદ વધારવાને બદલે વધુ સારી પ્રણાલી રચના દ્વારા કામગીરી મેળવાય છે.
આ સંતુલન દરેક એપ્લિકેશન માટે વિશિષ્ટ છે અને તકનીકોનું શ્રેષ્ઠ સંયોજન નક્કી કરવા તમારા એપ્લિકેશન-વિશિષ્ટ મૂલ્યાંકનો પર આધારિત હોવું જોઈએ. આ મૂલ્યાંકનો તમને વધારાનું સંચાલન અર્થપૂર્ણ લાભ આપવાનું કયા તબક્કે બંધ કરે છે તે ઓળખવામાં મદદ કરશે, જેથી ટીમો લક્ષિત કામગીરી માટે જરૂરી ન્યૂનતમ તાલીમોત્તર જટિલતા પસંદ કરી શકે.
AI ઉકેલને સંપૂર્ણ પ્રણાલી તરીકે જોવો જરૂરી છે: ડેટાબેઝ, API, વપરાશકર્તા અંતરફલક, સંચાલન સ્તરો, દેખરેખ માળખું અને ઘણું વધુ. તેથી મૂલ્યાંકન સમગ્ર તકનીકી સ્તર સુધી વિસ્તરવું જોઈએ. સંભવિત સમસ્યાઓ દેખાતી રહે અને જવાબદારીપૂર્વક ઝડપ વધારી શકાય તે માટે પ્રણાલીના મુખ્ય ભાગોની દેખરેખ રાખવી જોઈએ.
પ્રણાલીના મુખ્ય ભાગોની દેખરેખમાં આ સામેલ હશે:
માપી શકાય તેવાં પરિણામો માટે તમારી પ્રક્રિયાઓમાં માપન સાધનો ગોઠવવા.
દરેક ફેરફારની અસર જોઈ શકાય તે માટે પ્રયોગો નોંધવા.
મોટા ફેરફારો કાર્યરત કરતાં પહેલાં સંભવિત ગુણવત્તા ઘટાડો ચકાસવા માટે સરળ A/B તુલનાઓ કરવી.
ડેટા-આધારિત પુનરાવર્તન અજાણ્યાં જોખમો વિના પ્રારૂપથી ઉત્પાદન સુધીનો માર્ગ ટૂંકો કરે છે. એપ્લિકેશનનો વાસ્તવિક ઉપયોગ સમજવા માટે નોંધણી અને દેખરેખ પણ મહત્ત્વપૂર્ણ છે. અવલોકનક્ષમતા સુનિશ્ચિત કરતું એક ઉદાહરણ:
પગલું 1: વપરાશકર્તાની વિનંતી request_id, user_segment અને intent સાથે દાખલ થાય છે.
પગલું 2: અનુસરણ નોંધમાં મોડલ સંસ્કરણ, પ્રોમ્પ્ટ સંસ્કરણ, મેળવેલા દસ્તાવેજો અને સાધન બોલાવવાની વિગતો નોંધાય છે.
પગલું 3: LLM નિર્ણાયક જવાબને શુદ્ધતા, સ્રોતાધારિતતા અને policy_risk માટે ગુણ આપે છે.
પગલું 4: નિયમ યંત્ર મર્યાદાઓનું મૂલ્યાંકન કરે છે.
પગલું 5: મર્યાદાનો ભંગ થાય તો ચેતવણી સક્રિય થાય અને વિનંતી વૈકલ્પિક વ્યવસ્થા અથવા માનવીય સમીક્ષા તરફ મોકલાય છે.
પગલું 6: નિષ્ફળતા પ્રાથમિકતા-નિર્ધારણ કતારમાં અને પછી માપદંડની બાકી યાદીમાં ઉમેરાય છે.

વાસ્તવિક વપરાશકર્તાઓ ભાગ્યે જ રચનાકારોની અપેક્ષા મુજબ વર્તે છે. કેટલાક સૂચનાઓને ખોટી રીતે સમજશે. બીજા ઇરાદાપૂર્વક નબળા મુદ્દા તપાસશે. આ અસામાન્ય પરિસ્થિતિઓ અપવાદ નહીં, પરંતુ અમૂલ્ય સંકેતો છે. યોગ્ય રીતે અમલમાં મૂકેલી મૂલ્યાંકન પ્રક્રિયા તેમને નોંધે છે, તેમનું વિશ્લેષણ કરે છે અને ભવિષ્યનાં પરીક્ષણોમાં સામેલ કરે છે. અજાણ્યાં જોખમો વિના ઝડપી પુનરાવર્તન ત્યારે જ શક્ય છે જ્યારે મૂલ્યાંકન પ્રણાલીમાં મૂળથી સમાયેલું હોય, વિકાસ પછી બહારથી જોડાયેલું નહીં.
અમે પહેલા દિવસથી જ સુરક્ષા મર્યાદાઓ અને દેખરેખ સમાવવા ભલામણ કરીએ છીએ:
તમારા એપ્લિકેશન-વિશિષ્ટ માપદંડ વડે મોડલના માપદંડો અને ગુણવત્તા ઘટાડાને નિયમિત રીતે માપો.
અસામાન્ય પરિસ્થિતિઓ અથવા પ્રતિકૂળ ઇનપુટને નોંધો અને સમીક્ષા કરો—તેમને તમારા એપ્લિકેશન-વિશિષ્ટ માપદંડ ડેટાસેટમાં પણ ઉમેરો.
આ મૂલ્યાંકન માપદંડો તમારા મુખ્ય કામગીરી સૂચકો સાથે સુસંગત છે તેની ખાતરી કરો.
નવાં જોખમોને અવગણતા નથી કે પક્ષપાતથી પ્રભાવિત નથી તેની ખાતરી કરવા તમારા ડેટાસેટ અને માપદંડની નિયમિતપણે કસોટી કરો.
માપદંડ બગડે ત્યારે સ્વચાલિત ચેતવણીઓ ગોઠવો—જેમ કે ચોકસાઈ 85%થી નીચે જાય તો સમીક્ષા સક્રિય કરો.
અત્યંત મહત્ત્વના નિર્ણયો—કાનૂની સલાહ, તબીબી માર્ગદર્શન કે નાણાકીય વ્યવહારો—માટે માનવીય સમીક્ષા પ્રક્રિયા જાળવો.
માપદંડનું દરેક સંચાલન ગણતરી સંસાધનો અને ઊર્જા વાપરે છે. દરેક બિનજરૂરી પ્રયોગ ખર્ચ વધારે છે. જવાબદાર મૂલ્યાંકનમાં કડકાઈ અને કાર્યક્ષમતાનું સંતુલન હોવું જોઈએ.
ઊર્જા અને ખર્ચ બેકાબૂ ન થાય તે માટે કેટલાંક વ્યવહારુ પગલાં લઈ શકાય છે:
શક્ય હોય ત્યારે નાનાં મોડલ વાપરો, શરૂઆતના પ્રયોગો સસ્તાં મોડલ પર ચલાવો અને અભિગમ ચકાસ્યા પછી જ ક્ષમતા વધારો.
પ્રોમ્પ્ટ અને API વિનંતીઓ અસ્થાયી સંગ્રહમાં રાખો.
ઊર્જા-જાગૃત સમયનિર્ધારણ ચલાવો—સમૂહ પ્રક્રિયા, ઉપલબ્ધતા-આધારિત સર્વર અને લવચીક પ્રાથમિકતા.
કામગીરી સાથે ગણતરી સંસાધનોનો ઉપયોગ પણ માપો.
તે જ રીતે, ઊભરતાં AI નિયમનો પ્રત્યે સચેત રહો. સમર્પિત કાયદો ન હોય ત્યાં પણ હાલનાં માળખાં અને જરૂરી પગલાં લાગુ પડે છે, જેમ કે:
ડેટા સુરક્ષા:
યોગ્ય સંમતિ વિના માપદંડ ડેટાસેટમાં PII ન હોય તેની ખાતરી કરો.
નોંધાયેલી પૂછપરછ માટે ડેટા જાળવણી નીતિઓ અમલમાં મૂકો.
ડેટા કાઢી નાખવાની વિનંતીઓ માટે વ્યવસ્થા આપો.
સમાનતા અને પક્ષપાત:
જુદા જનસાંખ્યિક જૂથોમાં કામગીરીનું પરીક્ષણ કરો.
માપદંડ બનાવતી વખતે વિવિધ પ્રતિનિધિત્વ સામેલ કરો.
માનવ અધિકારો અને પારદર્શિતા:
વપરાશકર્તાઓ માટે મોડલની મર્યાદાઓ સ્પષ્ટ રીતે લખો.
અત્યંત મહત્ત્વના નિર્ણયો માટે સમજૂતી આપો.
નિર્ણાયક એપ્લિકેશનો માટે માનવીય દેખરેખ સક્ષમ કરો.
મૂલ્યાંકન એક વખતની ઘટના નહીં, પરંતુ સતત વિકસતી પ્રણાલી છે. ઝડપથી બદલાતા ક્ષેત્રમાં તમારો લાભ તમે કેટલી ઝડપથી પરીક્ષણ, શીખવા અને અનુકૂલન કરી શકો છો તેમાં છે, જેથી મોડલ અને નવા ઉકેલો વધુ અસરકારક રીતે કાર્યરત કરી શકાય.
મૂલ્યાંકનને ઇજનેરી અને ઉત્પાદન સંચાલનની મુખ્ય પ્રવૃત્તિ તરીકે સમાવીને ટીમો વધુ ઝડપથી અને સુરક્ષિત રીતે નવીનતા લાવી શકે છે. તમારી AI એપ્લિકેશનના સંદર્ભમાં સારું શું છે તે નક્કી કરવાથી શરૂઆત કરો, મૂલ્યાંકન મંચ સ્થાપો અને તેને વિકસાવતા રહો. આ રીતે તમારી પાસે એપ્લિકેશન-વિશિષ્ટ માપદંડ હશે, જે દરેક પુનરાવર્તન સાથે ઉત્પાદન તૈયારી અંગે વિશ્વાસ આપશે.