அடித்தள மாடல்கள் மேம்பட்டிருந்தாலும், ஒழுங்குமிக்க மதிப்பீட்டு நடைமுறைகளே நம்பிக்கையுடன் தயாரிப்பில் பயன்படுத்துவதற்கான உண்மையான மாற்றத்தை ஏற்படுத்துகின்றன.
நன்கு வடிவமைக்கப்பட்ட மதிப்பீடுகள், தயாரிப்பு மேலாளர்கள், AI ஆளுகைத் தலைவர்கள் மற்றும் தலைமைத் தொழில்நுட்ப அதிகாரிகள் AI ஏஜென்ட்களைப் பாதுகாப்பாகவும் பெரிய அளவிலும் செயல்படுத்த உதவுகின்றன; இதனால் AI தனிமைப்படுத்தப்பட்ட விளையாட்டுப் பொருளாக இல்லாமல் போட்டித்திறன் நன்மையாகிறது.
உங்கள் உண்மையான வணிகச் சூழலைப் பிரதிபலிக்கும் பயனர் வினவல்கள், விளிம்பு நிலைகள் மற்றும் துறைசார் சூழ்நிலைகளுடன் AI ஏஜென்ட்களின் நடத்தையை மதிப்பிடுவதிலிருந்தே அந்த நம்பிக்கை வருகிறது; ‘இந்த மாடலே சிறந்தது’ என்று கூறும் பொது அளவுகோலிலிருந்து அல்ல.
அளவிடக்கூடிய முடிவுகள் மூலம் அந்த நம்பிக்கையை நியாயப்படுத்துவதே குறிக்கோள். வெற்றி என்பது உங்கள் வணிகத் தேவைகள் மற்றும் இடர் சகிப்புத்தன்மையுடன் பொருந்தும் வகையில் "நல்லது" என்பதைத் திட்டவட்டமான, அளவிடக்கூடிய சொற்களில் வரையறுப்பதாகும். அது உண்மைத் துல்லியம், பொருத்தமான தொனி, வேகம் அல்லது செலவுத் திறன் என எதுவாகவும் இருக்கலாம்.
உங்கள் முழு அமைப்பிலும் மதிப்பீட்டை ஒருங்கிணைத்து (கருவியமைப்பு, பதிவிடல், A/B சோதனை, பாதுகாப்புக் கட்டுப்பாடுகள்), கடுமையையும் செயல்திறனையும் சமநிலைப்படுத்துவதன் மூலம் அணிகள் அதிக வெளியீட்டு வேகத்தையும் உறுதித்தன்மையையும் அடையலாம்.
பெரும்பாலான நிறுவனங்கள் தங்கள் பணியாளர்கள் ChatGPT அல்லது Gemini-ஐச் சோதித்துப் பார்ப்பதை ஏற்றுக்கொள்கின்றன. ஆனால் மிக முக்கியமான பணிப்பாய்வுகள் அல்லது சூழல்களில் LLM-களைப் பயன்படுத்துவது அதிகம் நிகழவில்லை.
இதற்கான காரணங்கள் பெரும்பாலும் நியாயமானவையே: தரம் சீரற்றிருந்ததுடன், புனைவுத் தகவல் அல்லது விரும்பத்தகாத நடத்தைக்கான இடர், இத்தொழில்நுட்பத்தின் சாத்தியமான நன்மைகளைவிட அதிகமாக இருந்தது.
கடந்த ஆண்டில் இடருக்கும் பலனுக்கும் இடையிலான இந்தச் சமநிலை குறிப்பிடத்தக்க வகையில் மாறியுள்ளது. அதில் ஒரு பகுதி அடித்தள மாடல்களின் செயல்திறன் மேம்பாட்டால் ஏற்பட்டிருந்தாலும், மதிப்பீட்டைச் சுற்றி வளர்ந்துவரும் ஒழுங்குமுறையே (“மதிப்பீடுகள்”) பெரும்பங்கு வகிக்கிறது. பெரிய அளவிலான, வாடிக்கையாளர்களை நேரடியாக எதிர்கொள்ளும் ஏஜென்ட்களைச் சில வாரங்களிலேயே செயல்படுத்துவதற்கான நம்பிக்கையை மதிப்பீடுகள் எங்களுக்கும் எங்கள் வாடிக்கையாளர்களுக்கும் அளிக்கின்றன.
மதிப்பீடுகளின் அடிப்படைக் கூறுகள், அவற்றை வடிவமைத்தல், செயல்படுத்தல் மற்றும் தயாரிப்புப் பயன்பாடுகளுக்காக இயக்குதல் ஆகியவற்றை இந்த வழிகாட்டி விளக்கும்.
மதிப்பீட்டின் நோக்கம் குறைபாடற்ற மாடலைக் கண்டறிவது அல்ல; உங்கள் வணிகத் தேவைகள், பயனர்களின் எதிர்பார்ப்புகள் மற்றும் நிறுவனத்தின் இடர் சகிப்புத்தன்மைக்கு ஏற்றவாறு உங்கள் மாடல் செயல்படுகிறது என்ற நியாயமான நம்பிக்கையை உருவாக்குவதே ஆகும்.
எந்த மதிப்பீட்டு உத்தியின் அடிப்படையிலும் ஒரு எளிய கேள்வி உள்ளது: “நல்லது” என்பது எப்படியிருக்கும்? பதில் குறிப்பானதாக இருக்க வேண்டும். ஒரு நிறுவனத்திற்கு “நல்லது” என்பது கடுமையான வரம்புகளுக்குள் உண்மைத் துல்லியத்தைக் குறிக்கலாம்; மற்றொன்றுக்கு வேகம், செலவுத் திறன் அல்லது தனித்துவமான பேச்சுத் தொனி முன்னுரிமையாக இருக்கலாம். பயன்படுத்தக்கூடிய தரவு முதல் பொருந்தும் ஒழுங்குமுறைக் கடமைகள் வரை, நீங்கள் எதிர்கொள்ளும் ஒவ்வொரு கட்டுப்பாடும் இந்த வரையறையை வடிவமைக்கிறது.
முக்கியமாக, 'நல்லது' என்பதில் உண்மையில் அளவிடக்கூடிய கூறுகள் இருக்க வேண்டும். பயனுள்ள நிதி வழிகாட்டலை வழங்குவதே வெற்றி என்றால், உண்மைச் சரித்தன்மை, பொருத்தமான பொறுப்புத் துறப்புகள், தனிப்பயனாக்கப்பட்ட ரீஸனிங் மற்றும் பாதுகாப்பான வரம்புகள் போன்ற பண்புகளால் பயன்தன்மை வெளிப்படுத்தப்பட வேண்டும். ‘நல்லது’ என்பது அளவிடக்கூடிய சொற்களில் வரையறுக்கப்பட்டதும், முடிவுகளை எவ்வாறு பகுப்பாய்வு செய்து பொருள்கொள்வீர்கள் என்பதே அடுத்த கேள்வி. இந்த முடிவுகளின் அடிப்படையில் செயல்படுவதே, மதிப்பீட்டை வெறும் தனிப்பட்ட தீர்ப்புகளுக்குப் பதிலாக ஒரு முறையாக மாற்றுகிறது.
ஒவ்வொரு மதிப்பீட்டுச் செயல்முறையும் ஒன்றோடொன்று இணைந்த மூன்று தூண்களைச் சார்ந்துள்ளது:
உள்ளீடுகள்/அளவுகோல்கள்: பொதுச் செயல்திறனுக்கான பிரதிநிதித்துவமிக்க நிஜ உலக எடுத்துக்காட்டுகளும், துறைசார் சாத்தியத்தைச் சோதிப்பதற்கான தேர்ந்தெடுக்கப்பட்ட உள்துறைத் தரவுத்தொகுப்புகளும்.
மாடல் நடத்தை: மாடல் எவ்வாறு அழைக்கப்படுகிறது (மீட்டெடுப்பால் மேம்படுத்தப்பட்ட உருவாக்கம், சுருக்கமாக்கல், கட்டமைக்கப்பட்ட தகவல் மீட்டெடுப்பு, கருவிப் பயன்பாடு).
அளவீடுகள்: செயல்திறனை நீங்கள் எவ்வாறு அளந்து பொருள்கொள்கிறீர்கள்.
உங்கள் அமைப்பு எதிர்கொள்ளும் உலகை உள்ளீடுகள் பிரதிபலிக்க வேண்டும். உங்கள் வாடிக்கையாளர் வினவல்கள், நிதிச் சூழல்கள் அல்லது துறைசார் நிகழ்வுகள் போன்ற உண்மையான எடுத்துக்காட்டுகளிலிருந்தே மிகப் பயனுள்ள நுண்ணறிவுகள் கிடைக்கின்றன. இவற்றுக்கு எதிராகச் சோதிப்பதன் மூலமே பயனர்களுக்குத் தேவையான நுட்பத்தை மாடல் உண்மையில் புரிந்துகொண்டு வணிகத் தேவையை நிறைவேற்றுகிறதா என்பதை அறிய முடியும்.
மாடலுக்கு எவ்வாறு ப்ராம்ப்ட் வழங்கப்படுகிறது, மீட்டெடுப்பு அல்லது கருவிப் பயன்பாடு எவ்வாறு ஒருங்கிணைக்கப்படுகிறது, சூழல் எவ்வாறு அளிக்கப்படுகிறது போன்ற மாடலின் நடத்தையும் மாடலுக்கு நிகராகவே முக்கியமானது. ஒரே மாதிரியான இரண்டு மாடல்கள் செயல்படுத்தப்படும் விதத்தைப் பொறுத்து மிகவும் வேறுபட்டு நடக்கலாம். எனவே இந்த அடுக்கு உங்கள் மதிப்பீட்டு வடிவமைப்பில் சேர்க்கப்பட வேண்டும்.
இறுதியாக, அளவீடுகள் உள்ளன. எண்கள் மட்டும் முழுக் கதையையும் சொல்வது அரிது; ஆனால் நன்கு தேர்ந்தெடுக்கப்பட்ட அளவீடுகள் அமைப்பின் நடத்தையைப் புரிந்துகொள்ள உதவுகின்றன. தாமதம், துல்லியம், பாதுகாப்பு, ஒத்திசைவு, சார்பு, செலவு, பயனர் திருப்தி ஆகியவை இணைந்து தயாரிப்பில் உள்ள அமைப்பின் பல்பரிமாணப் படத்தை உருவாக்குகின்றன. உங்கள் திட்டம் அல்லது வணிகத்தின் முக்கியச் செயல்திறன் குறியீடுகளுடன் பொருந்தி, பயனர்களுக்கு மிகவும் முக்கியமான பண்புகளை வெளிப்படுத்தும் அளவீடுகளைத் தேர்ந்தெடுப்பதில்தான் திறமை உள்ளது. எளிய அளவீடுகள் பெரும்பாலும் அதிகத் துல்லியமும் குறைந்த செலவும் கொண்டவை; தவறான அளவீட்டுத் தேர்வுகள் அணிகளைத் தவறாக வழிநடத்தலாம். அளவீடுகளைத் தேர்ந்தெடுப்பதை இவ்வாறு அணுகலாம்:
நல்ல அளவீட்டுத் தேர்வுகளுக்கான எடுத்துக்காட்டுகள்:
வாடிக்கையாளர் சேவை உரையாடல் நிரல்: முதல் தொடர்பிலேயே தீர்வு காணும் விகிதம் (பயனரின் சிக்கல் மேல்நிலைக்கு அனுப்பப்படாமல் தீர்க்கப்பட்டதா?), சராசரிக் கையாளும் நேரம், பயனர் திருப்தி மதிப்பெண், மனித ஏஜென்ட்களிடம் அனுப்பும் விகிதம்.
நிதி ஆராய்ச்சிக் கருவி: மேற்கோள் துல்லியம் (முறையாக ஆதாரம் காட்டப்பட்ட கூற்றுகளின் விழுக்காடு), அடிப்படை உண்மையுடன் சரிபார்க்கப்பட்ட உண்மைத் துல்லியம், மீட்டெடுப்புப் பொருத்தம் (சரியான ஆவணங்களைக் கண்டறிந்ததா?), துறை நிபுணர்கள் மதிப்பிட்ட ரீஸனிங் ஒத்திசைவு.
நிரல் உருவாக்க உதவியாளர்: தொடரியல் சரித்தன்மை, சோதனைத் தேர்ச்சி விகிதம், பாதுகாப்புப் பாதிப்புகளின் எண்ணிக்கை, செயல்படும் தீர்வைப் பெறும் நேரம்.
மோசமான அளவீட்டுத் தேர்வுகளுக்கான எடுத்துக்காட்டுகள்:
தரத்தின் மறைமுக அளவாக பதிலின் நீளத்தை மட்டும் பயன்படுத்துதல் (நீளமானது ≠ சிறந்தது).
துல்லியத்துடன் செய்ய வேண்டிய சமரசங்களைக் கருதாமல் வேகத்தை அளவிடுதல்.
மாடலின் நம்பிக்கை மதிப்பெண்களை உண்மையான சரித்தன்மையுடன் சரிபார்க்காமல் கண்காணித்தல்.
பயனர்களை மையமாகக் கொண்ட சரிபார்ப்பின்றி, மாடலின் உள் குழப்பநிலை அளவீட்டை மட்டுமே சார்ந்திருத்தல்.
தவிர்க்க வேண்டிய பொதுவான அளவீட்டுச் சிக்கல்கள்:
முரண்படும் அளவீடுகள்: சமரசத்தை ஏற்காமல் வேகம் மற்றும் முழுமை இரண்டையும் ஒரே நேரத்தில் மேம்படுத்துதல்.
அளவுகோல்களுக்கு அளவுக்கு மீறிப் பொருத்துதல்: சோதனைத் தொகுப்பில் 95% பெற்றாலும், உண்மைப் பயனர்கள் வேறுபட்டு நடப்பதால் தயாரிப்பில் தோல்வியடைதல்.
கடுமையாக ஒழுங்குபடுத்தப்பட்ட நிதிச் சேவை வாடிக்கையாளர் ஒருவருக்கு, அவர்களின் டீப் ரிசர்ச் தீர்வின் துல்லியம் மிக முக்கியமாக இருந்தது. நிபுணர்கள் உருவாக்கிய கேள்வி-பதில் தரவுத்தொகுப்புகளையும் கருவிகள் உருவாக்கிய தரவுத்தொகுப்புகளையும் இணைத்து வடிவமைத்தோம். இதன் மூலம் துல்லியம், சரியான கருவிகளைத் தேர்ந்தெடுக்கும் திறன் மற்றும் சரியான தகவலை மீட்டெடுக்கும் திறனை மதிப்பிட்டு, துல்லியம் மற்றும் ரீஸனிங் தரம் குறித்த சமநிலையான பார்வையைப் பெற்றோம். பல பரிமாணங்களை அளவிடுவதே முக்கியமாக இருந்தது: உண்மைத் துல்லியம் (நிபுணர் சரிபார்ப்பு), மீட்டெடுப்புத் தரம் (தொடர்புடைய ஆவணங்களின் துல்லியம்/மீட்பு விகிதம்), ரீஸனிங் ஒத்திசைவு (தர்க்க ஓட்டத்தின் கட்டமைக்கப்பட்ட மதிப்பீடு).
நுட்பமான தரத்திற்கு LLM-ஐ நடுவராக எப்போது பயன்படுத்துவது
LLM-ஐ நடுவராகப் பயன்படுத்தும் முறை, இரண்டாவது AI மாடலை மதிப்பீட்டாளராகப் பயன்படுத்தி, மனித ஆய்வுக்குப் பதிலாகப் பெரிய அளவில் தானியக்கத் தர மதிப்பீட்டை வழங்குகிறது. எளிய அளவீடுகளே தேவையான துல்லியத்தை வழங்கும்போதும், LLM-ஐ நடுவராகப் பயன்படுத்தும் முறை அடிக்கடி தவறாகப் பயன்படுத்தப்படுகிறது. பயன்தன்மை, ஆதாரப் பிணைப்பு, ரீஸனிங் தரம், தொனி, கொள்கை விளக்கம் போன்ற பொருள்சார் அளவீடுகளில், நிர்ணயிக்கப்பட்ட சோதனைகள் தரத்தைப் பிடிக்கவோ மதிப்பிடவோ முடியாதபோது இது பயனுள்ளதாக இருக்கும். பல ப்ராம்ப்ட்/மாடல் மாறுபாடுகளுக்கு அளவிடக்கூடிய பின்னூட்டம் தேவைப்படலாம்; மேலும் தெளிவான மதிப்பீட்டு விதிமுறையையும் கட்டமைக்கப்பட்ட வெளியீட்டு ஸ்கீமாவையும் வரையறுக்க வேண்டியிருக்கலாம். இது உங்களுக்குப் பயனளிக்க, இந்தப் படிகளைப் பின்பற்றுங்கள்:
மதிப்பீட்டு விதிமுறையின் பரிமாணங்களைத் தெளிவாக வரையறுக்கவும்: சரித்தன்மை, ஆதாரப் பிணைப்பு, கொள்கை இணக்கம், செயல்படுத்தக்கூடிய தன்மை, தொனி.
நடுவர் பதில்களுக்கு ஸ்ட்ரக்ச்சர்டு அவுட்புட்ஸ் (JSON ஸ்கீமா) பயன்படுத்தவும்.
தோல்விப் பகுப்பாய்வுக்காக இருநிலைத் தடை மதிப்பெண்களையும் கண்டறியும் உரையையும் பதிவு செய்யவும்.
ஒவ்வொரு வெளியீட்டுச் சுழற்சியிலும் மனிதர்கள் குறியிட்ட மாதிரிகளுடன் நடுவரின் வெளியீடுகளை அளவுத்திருத்தவும்.
மிக முக்கியமான துறைகளில் இரட்டை நடுவர் அல்லது காலமுறை ஒருமித்த சரிபார்ப்புகளைப் பயன்படுத்தவும்.
காலப்போக்கில் நடுவரின் விலகலையும் கருத்து வேறுபாட்டு விகிதத்தையும் கண்காணிக்கவும்.
அளவுகோல் தரவுத்தொகுப்பு என்பது மாடல்களைச் சீராக மதிப்பிடவும் பதிப்புகளுக்கு இடையிலான முடிவுகளை நியாயமாக ஒப்பிடவும் பயன்படும், அறியப்பட்ட பதில்களைக் கொண்ட நிலையான, தேர்ந்தெடுக்கப்பட்ட சோதனை எடுத்துக்காட்டுகளின் தொகுப்பாகும். இதில் பொதுவாக உள்ளீடுகள் (எ.கா., பயனர் வினவல்கள்), எதிர்பார்க்கப்படும் வெளியீடுகள் அல்லது ஒப்பீட்டுத் தீர்ப்புகள், மதிப்பெண்ணிடுவதற்கான மதிப்பீட்டு விதிகள்/குறிச்சொற்கள் ஆகியவை அடங்கும். அதிநவீன மாடல்களின் செயல்திறனை ஒப்பிடப் பொது அளவுகோல் சோதனைகள் பயன்படுகின்றன. உங்கள் அமைப்பை வடிவமைக்கும்போது எந்த மாடல் ஏற்ற தேர்வாக இருக்கலாம் என்பதைத் தொடக்கத்தில் ஆராயவும் அவை உதவும்.
ஆனால் உங்கள் சொந்த அமைப்பைப் பொறுத்தவரை, வணிகச் சூழலின் செயல்திறனுக்கான மறைமுக அளவாக இவற்றை நம்ப முடியாது; இந்த அளவுகோல்களில் அறியப்பட்ட சிக்கல்கள் உள்ளன:
மாசுபாடு: அளவுகோல் தரவைப் பயன்படுத்தி மாடல்கள் பயிற்றுவிக்கப்பட்டிருக்கலாம்; அதே தரவுத்தொகுப்பில் மதிப்பிடுவது விடைத்தாளைப் பார்த்து மதிப்பெண் வழங்குவதைப் போன்றது.
செறிவுநிலை: முன்னணி மாடல்கள் அனைத்தும் ஏற்கெனவே உச்ச மதிப்பெண்களைப் பெறுவதால், செயல்திறன் மேம்பாடு/சரிவு சில விழுக்காட்டுப் புள்ளிகளுக்குள் மட்டுமே இருக்கும்; பெரும்பாலும் அது சோதனை முடிவுகளின் இயல்பான மாறுபாட்டுக்குள்ளேயே இருக்கும்.
குறுகிய நோக்கம்: அளவுகோல் தரவு உங்கள் உண்மையான பணிகளைப் பிரதிபலிப்பதில்லை; அது மிகவும் கவனமாகத் தேர்ந்தெடுக்கப்பட்டுச் சுத்திகரிக்கப்பட்டது. சில தரவுகள் LLM மூலம் உருவாக்கப்பட்டவையாகவும் இருக்கும்; அவை உங்கள் தரவிலுள்ள சிக்கல்களையும் விளிம்பு நிலைகளையும் பிரதிபலிக்காது (எழுத்துப் பிழைகள், வழக்கத்திற்கு மாறான சொற்றொடர்கள், தெளிவற்ற படங்கள்).
சொல் கணக்குகளைத் தீர்க்க உதவுமாறு ஒரு மாணவர் பயன்பாட்டிடம் கேட்கிறார்.
நீங்கள் பயன்படுத்தக்கூடிய பொது அளவுகோல் எடுத்துக்காட்டு: GSM8K (தொடக்கப்பள்ளிக் கணித ரீஸனிங்).
விருப்பத்திற்குரிய கடினமான தொகுப்பு: MATH.
இந்த அளவுகோல் ஏன் பயனுள்ளது:
பொதுவான கணித ரீஸனிங்கில் எந்த மாடல் சிறந்தது என்பதை விரைவாக ஒப்பிடலாம்.
முழுமையான தயாரிப்பு மதிப்பீடுகளில் முதலீடு செய்வதற்கு முன் பயன்படுத்தக்கூடிய நல்ல தொடக்க வடிகட்டி.
உங்கள் சொந்தத் தரவுத்தொகுப்பு இன்னும் ஏன் தேவை:
GSM8K சோதிக்காத தேவைகள் உங்கள் பயன்பாட்டில் உள்ளன:
உங்கள் பாடத்திட்டத்தின் சொற்பயன்பாடும் தலைப்புகளின் வரிசையும்.
உங்கள் வயதுக் குழுவுக்கு ஏற்ற விளக்க முறை.
தெளிவற்ற அல்லது பல எழுத்துப் பிழைகள் கொண்ட மாணவர் கேள்விகளைக் கையாளும் முறை.
கொள்கை விதிகள் (எ.கா., எப்போது குறிப்புகள் வழங்குவது, எப்போது முழுப் பதில்களை வழங்குவது).
பயனுள்ள சரிபார்ப்புக்கு உங்கள் பயன்பாட்டுக்கேற்ற மதிப்பீட்டு அளவுகோல்களை உருவாக்குவது அவசியம். இந்தத் தரவுத்தொகுப்புகள் உண்மையான தொடர்புகள், வழக்கமான விளிம்பு நிலைகள் மற்றும் நிகழக்கூடிய தோல்வி முறைகளிலிருந்து உருவாக்கப்பட வேண்டும். புதிய தயாரிப்பு அல்லது செயல்முறையைச் செயல்படுத்தும்போது இது கடினமான பணியாக இருக்கலாம். இருப்பினும், பெரும்பாலான நேரங்களில் தற்போதைய தயாரிப்பிலிருந்தோ, தொடக்கச் சோதனைக் கட்டத்திலேயே முடிந்தவரை விரைவாகவோ தரவைச் சேகரிக்க முடியும். உங்கள் பயன்பாடு உருவாக்கப்பட்ட பிறகு, தயாரிப்புடன் சேர்ந்து இந்த அளவுகோல்களும் பரிணமித்து, காலப்போக்கில் செறிவானதாகவும் அதிகப் பிரதிநிதித்துவமிக்கதாகவும் மாற வேண்டும்.
வழக்காய்வு: சில்லறை வங்கி உதவியாளருக்குத் தனிப்பயன் அளவுகோலை உருவாக்குதல்
வரவுசெலவுத் திட்டங்கள், செலவுகள் மற்றும் பரிவர்த்தனைகள் குறித்த கேள்விகளுக்கு ஒரு வங்கி உரையாடல் நிரல் பதிலளிக்கிறது. பொது கேள்வி-பதில் அளவுகோல்கள்/உரையிலிருந்து SQL மாற்றம் ஆகியவை SQL உட்செலுத்தல், தரவுக் கசிவு அல்லது பலகட்ட உரையாடல் சூழல் தொடர்ச்சி போன்ற முக்கிய வங்கி இடர்களைப் பிரதிபலிக்கவில்லை. இந்தத் தயாரிப்பின் ஏஜென்ட் செயல்முறையைப் பிரதிபலிக்கும் தனிப்பயன் அளவுகோலை உருவாக்கினோம்.
இந்த நிரல்தொகுப்பிலுள்ள தனிப்பயன் அளவுகோல் கூறுகள்:
SQL உட்செலுத்தல், PII பிரித்தெடுத்தல், ப்ராம்ப்ட் மேலெழுதுதல் மற்றும் அமர்வுகளுக்கு இடையிலான கசிவு ஆகியவற்றுக்கான தீங்கிழைக்கும் ப்ராம்ப்ட்களைக் கொண்ட எதிர்த்தாக்குதல் சோதனைத் தொகுப்பு.
பாதுகாப்பில் எந்தச் சமரசமும் இல்லை: SQL உட்செலுத்தல், PII பிரித்தெடுத்தல் அல்லது அமர்வுகளுக்கு இடையிலான கசிவு எதுவாக இருந்தாலும் நிராகரிக்கப்பட வேண்டும்.
சூழல் தொடர்ச்சித் துல்லியம்: மீண்டும் எழுதப்பட்ட வினவல்கள் பயனரின் நோக்கத்தையும் உட்பொருட்களையும் பாதுகாக்க வேண்டும்.
முக்கியப் பாடம்: அளவுகோல் உருவாக்கத்தைத் தயாரிப்பின் ஓர் அம்சமாகக் கருதுங்கள். தற்போதைய சூழல் பணி அமைவு முழுமையான மதிப்பீடு இணைக்கப்பட்டுள்ளதை நிரூபிக்கிறது; ஆனால் நிஜ உலக வங்கி இடர்களைப் பிரதிபலிக்க உள்ளடக்கப் பரப்பும் மாதிரி அளவுகளும் வளர வேண்டும் (பல்நோக்குத் தாக்குதல்கள், பாதுகாப்புக் கட்டுப்பாடுகளைத் தவிர்த்தல், சூழல் சார்ந்த வினவல்கள்). புதிய ஏஜென்ட்கள் மற்றும் பாதுகாப்புக் கட்டுப்பாடுகளுடன் சேர்ந்து அளவுகோலும் விரிவடைய வேண்டும்.
உங்கள் பயன்பாட்டுக்கேற்ற அளவுகோலுக்கும் மாடல் தேர்வுக்கும் இடையிலான தொடர்பு மிகவும் முக்கியமானது. ஒரு தீர்வு செயல்படுகிறதா என்பதை மட்டுமல்லாமல், எந்த மாடல் அளவும் பிந்தைய பயிற்சி நுட்பங்களின் கலவையும் தேவையான செயல்திறனை மிகச் செலவுத் திறனுடன் வழங்குகிறது என்பதையும் உங்கள் அளவுகோல் வெளிப்படுத்துகிறது. முன்பயிற்சி பெற்ற மாடல்களின் மிகச் சக்திவாய்ந்த மேம்பாடுகள் (ChatGPT-இல் உள்ள ‘PT’) மறுபயிற்சியிலிருந்து அல்ல, "பிந்தைய பயிற்சி" முறைகளிலிருந்து வருகின்றன.
மாடல் எந்தத் தகவலை அணுக முடியும், அத்தகவல் எவ்வாறு கட்டமைக்கப்படுகிறது, ஊக நேரத்தில் மாடல் எவ்வாறு வழிநடத்தப்பட்டு ஒருங்கிணைக்கப்படுகிறது என்பவற்றை வடிவமைப்பதில் இந்த முறைகள் கவனம் செலுத்துகின்றன. பிந்தைய பயிற்சி நுட்பங்கள்:
செயின்-ஆஃப்-தாட் ப்ராம்ப்ட்டிங் மற்றும் மாறும் கணிப்பீட்டு ஒதுக்கீடு (கடினமான சிக்கல்களுக்கு அதிகம் சிந்தித்தல்).
பல வெளியீடுகளை உருவாக்கி அவற்றில் சிறந்ததைத் தேர்ந்தெடுக்கும் சுய-ஒத்திசைவு.
மீட்டெடுப்பால் மேம்படுத்தப்பட்ட உருவாக்கம் (RAG), ஃப்யூ-ஷாட் எடுத்துக்காட்டுகள் மற்றும் ஏஜென்ட் சார்ந்த பணிப்பாய்வுகள் போன்ற சூழல் உருவாக்கமும் ஒருங்கிணைப்பும்.
மாடல் தனது உள் அளவுருக்களுக்கு அப்பால் செயல்பட உதவும் கருவிப் பயன்பாடும் வெளிப்புற அறிவுக்கான அணுகலும்.
கட்டமைக்கப்பட்ட மற்றும் கட்டமைக்கப்படாத தரவைத் திறம்பட மீட்டெடுத்து ரீஸனிங் செய்வதற்காக வடிவமைக்கப்பட்ட அறிவுப் பிரதிநிதித்துவம் மற்றும் சேமிப்பு உத்திகள்.
இந்தப் பிந்தைய பயிற்சி நுட்பங்கள் அமைப்பின் செயல்திறனைப் பெரிதும் மேம்படுத்தினாலும், அவற்றுடன் சமரசங்களும் வருகின்றன. ஒருங்கிணைப்பு, மீட்டெடுப்பு அல்லது ரீஸனிங்கின் ஒவ்வொரு கூடுதல் அடுக்கும் அமைப்பின் சிக்கல்தன்மை, ஊக நேரம் மற்றும் இயக்கச் செலவை அதிகரிக்கிறது. ஆனால் சிந்தித்துப் பயன்படுத்தும்போது, பிந்தைய பயிற்சி நுட்பங்களின் சரியான கலவை செயல்திறன் தேவைகளை நிறைவேற்றிக்கொண்டே சிறிய, வேகமான, மலிவான மாடல்களைச் சார்ந்திருக்க உதவுகிறது. மாடலின் அளவை உயர்த்துவதற்குப் பதிலாக, சிறந்த அமைப்பு வடிவமைப்பு மூலம் செயல்திறன் பெறப்படுகிறது.
இந்தச் சமநிலை ஒவ்வொரு பயன்பாட்டுக்கும் தனித்துவமானது; நுட்பங்களின் உகந்த கலவையைத் தீர்மானிக்க உங்கள் பயன்பாட்டுக்கேற்ற மதிப்பீடுகளைச் சார்ந்திருக்க வேண்டும். கூடுதல் ஒருங்கிணைப்பு இனியும் பொருளுள்ள மேம்பாட்டை அளிக்காத புள்ளியை அவை கண்டறிய உதவும்; இதனால் இலக்குச் செயல்திறனுக்குத் தேவையான குறைந்தபட்சப் பிந்தைய பயிற்சிச் சிக்கல்தன்மையை அணிகள் தேர்ந்தெடுக்கலாம்.
தரவுத்தளங்கள், APIs, பயனர் இடைமுகங்கள், ஒருங்கிணைப்பு அடுக்குகள், கண்காணிப்புக் கட்டமைப்பு உள்ளிட்ட அனைத்தையும் உள்ளடக்கிய முழு அமைப்பாகவே AI தீர்வைக் கருத வேண்டும். எனவே மதிப்பீடு முழுத் தொழில்நுட்ப அடுக்கையும் உள்ளடக்க வேண்டும். சாத்தியமான சிக்கல்களைத் தொடர்ந்து காணவும் பொறுப்புடன் வேகமாக முன்னேறவும் அமைப்பின் முக்கியப் பகுதிகளைக் கண்காணிக்க வேண்டும்.
அமைப்பின் முக்கியப் பகுதிகளைக் கண்காணிப்பது என்பது:
அளவிடக்கூடிய முடிவுகளுக்காக உங்கள் செயல்முறைகளில் கருவியமைப்பைச் செய்தல்.
ஒவ்வொரு மாற்றத்தின் விளைவையும் காணும் வகையில் சோதனைகளைப் பதிவிடுதல்.
பெரிய மாற்றங்களைச் செயல்படுத்தும் முன், சாத்தியமான பின்னடைவுகளைச் சோதிக்க எளிய A/B ஒப்பீடுகளைப் பயன்படுத்துதல்.
தரவு சார்ந்த மறு செய்கை, கவனிக்கப்படாத இடர்களின்றி முன்மாதிரியிலிருந்து தயாரிப்புக்குச் செல்லும் பாதையைச் சுருக்குகிறது. பயன்பாட்டின் நிஜ உலகப் பயன்பாட்டைப் புரிந்துகொள்வதற்கும் பதிவிடலும் கண்காணிப்பும் முக்கியம். கண்காணிக்கக்கூடிய தன்மையை உறுதிப்படுத்தும் எடுத்துக்காட்டு:
படி 1: பயனர் கோரிக்கை request_id, user_segment, intent ஆகியவற்றுடன் நுழைகிறது.
படி 2: தடமறிதல் பதிவுகள் மாடல் பதிப்பு, ப்ராம்ப்ட் பதிப்பு, மீட்டெடுக்கப்பட்ட ஆவணங்கள், கருவி அழைப்புகள் ஆகியவற்றைப் பதிவு செய்கின்றன.
படி 3: LLM நடுவர் பதிலை மதிப்பிடுகிறது (சரித்தன்மை, ஆதாரப் பிணைப்பு, policy_risk).
படி 4: விதி இயந்திரம் வரம்புகளை மதிப்பிடுகிறது.
படி 5: வரம்பு மீறப்பட்டால், எச்சரிக்கையைத் தூண்டி மாற்றுத் தீர்வு/மனித ஆய்வுக்கு அனுப்பவும்.
படி 6: தோல்வி முன்னுரிமைத் தீர்வு வரிசையிலும் பின்னர் அளவுகோல் நிலுவைப் பட்டியலிலும் சேர்க்கப்படுகிறது.

உண்மைப் பயனர்கள் வடிவமைப்பாளர்கள் எதிர்பார்ப்பதுபோலவே நடப்பது அரிது. சிலர் வழிமுறைகளைத் தவறாகப் புரிந்துகொள்வார்கள். மற்றவர்கள் பலவீனமான இடங்களை வேண்டுமென்றே சோதிப்பார்கள். இந்த விளிம்பு நிலைகள் முரண்பாடுகள் அல்ல; விலைமதிப்பற்ற சமிக்ஞைகள். நன்கு செயல்படுத்தப்பட்ட மதிப்பீட்டுச் செயல்முறை அவற்றைப் பதிவுசெய்து, பகுப்பாய்ந்து, எதிர்காலச் சோதனைகளில் சேர்க்கிறது. மேம்பாட்டுக்குப் பிறகு மதிப்பீட்டைத் தனியாக இணைக்காமல், அமைப்பிலேயே உட்பொதித்தால் மட்டுமே கவனிக்கப்படாத இடர்களின்றி விரைவாக மறு செய்கை செய்ய முடியும்.
முதல் நாளிலிருந்தே பாதுகாப்புக் கட்டுப்பாடுகளையும் கண்காணிப்பையும் உட்பொதிக்கப் பரிந்துரைக்கிறோம்:
உங்கள் பயன்பாட்டுக்கேற்ற அளவுகோலைப் பயன்படுத்தி மாடல் அளவீடுகளையும் பின்னடைவுகளையும் தொடர்ந்து கண்காணிக்கவும்.
விளிம்பு நிலைகள் அல்லது எதிர்மறை நோக்கமுள்ள உள்ளீடுகளைப் பதிவுசெய்து ஆய்வு செய்யவும்; அவற்றை உங்கள் பயன்பாட்டுக்கேற்ற அளவுகோல் தரவுத்தொகுப்பில் சேர்க்கவும்.
இந்த மதிப்பீட்டு அளவீடுகள் உங்கள் முக்கியச் செயல்திறன் குறியீடுகளுடன் பொருந்துவதை உறுதிசெய்யவும்.
புதிய இடர்களைப் புறக்கணிக்கவோ சார்புகளுக்கு உட்படவோ இல்லை என்பதை உறுதிப்படுத்த, உங்கள் தரவுத்தொகுப்பையும் அளவுகோலையும் தொடர்ந்து சவாலுக்கு உட்படுத்தவும்.
அளவீட்டுச் சரிவுக்கு தானியக்க எச்சரிக்கைகளைச் செயல்படுத்தவும் (எ.கா., துல்லியம் 85%-க்குக் கீழே குறைந்தால் ஆய்வைத் தூண்டவும்).
மிக முக்கியமான முடிவுகளுக்கு மனித ஆய்வு முறையைப் பராமரிக்கவும் (சட்ட ஆலோசனை, மருத்துவ வழிகாட்டல், நிதிப் பரிவர்த்தனைகள்).
ஒவ்வொரு அளவுகோல் இயக்கமும் கணிப்பீட்டு வளத்தையும் ஆற்றலையும் பயன்படுத்துகிறது. தேவையற்ற ஒவ்வொரு சோதனையும் செலவை அதிகரிக்கிறது. பொறுப்பான மதிப்பீடு கடுமையையும் செயல்திறனையும் சமநிலைப்படுத்த வேண்டும்.
ஆற்றலும் செலவுகளும் கட்டுக்கடங்காமல் உயர்வதைத் தவிர்க்க சில நடைமுறைப் படிகளை மேற்கொள்ளலாம்:
முடிந்தவரைச் சிறிய மாடல்களைப் பயன்படுத்துங்கள்; தொடக்கச் சோதனைகளை மலிவான மாடல்களில் இயக்கி, அணுகுமுறையைச் சரிபார்த்த பிறகு மட்டுமே பெரிய அளவுக்கு உயர்த்துங்கள்.
ப்ராம்ப்ட்களையும் API அழைப்புகளையும் இடைமாற்றுச் சேமிப்பில் வைக்கவும்.
ஆற்றல் பயன்பாட்டைக் கருத்தில் கொண்ட அட்டவணையிடலைப் பயன்படுத்தவும் (தொகுதிச் செயலாக்கம், spot instances, flex priority).
செயல்திறனுடன் கணிப்பீட்டுப் பயன்பாட்டையும் கண்காணிக்கவும்.
அதேபோல், உருவாகிவரும் AI ஒழுங்குமுறைகள் குறித்தும் விழிப்புடன் இருங்கள். பிரத்யேகச் சட்டம் இல்லாத இடங்களிலும்கூட, தற்போதைய கட்டமைப்புகளும் தேவையான நடவடிக்கைகளும் பொருந்தும். அவற்றில் சில:
தரவுப் பாதுகாப்பு:
முறையான ஒப்புதலின்றி அளவுகோல் தரவுத்தொகுப்புகளில் PII இல்லாததை உறுதிசெய்யவும்.
பதிவுசெய்யப்பட்ட வினவல்களுக்குத் தரவுத் தக்கவைப்புக் கொள்கைகளைச் செயல்படுத்தவும்.
தரவு நீக்கக் கோரிக்கைகளுக்கான வழிமுறைகளை வழங்கவும்.
சமத்துவமும் சார்பும்:
மக்கள்தொகைக் குழுக்கள்தோறும் செயல்திறனைச் சோதிக்கவும்.
அளவுகோல் உருவாக்கத்தில் பலதரப்பட்ட பிரதிநிதித்துவத்தைச் சேர்க்கவும்.
மனித உரிமைகளும் வெளிப்படைத்தன்மையும்:
பயனர்களுக்காக மாடலின் வரம்புகளைத் தெளிவாக ஆவணப்படுத்தவும்.
மிக முக்கியமான முடிவுகளுக்கான விளக்கங்களை வழங்கவும்.
முக்கியமான பயன்பாடுகளுக்கு மனித மேற்பார்வையைச் செயல்படுத்தவும்.
மதிப்பீடு ஒருமுறை நிகழும் செயலல்ல; தொடர்ந்து பரிணமிக்கும் ஓர் அமைப்பு. வேகமாக மாறும் துறையில், எவ்வளவு விரைவாகச் சோதித்து, கற்று, தகவமைக்கிறீர்கள் என்பதில்தான் உங்கள் முன்னிலை உள்ளது; இதனால் மாடல்களையும் புதிய தீர்வுகளையும் அதிகப் பயனுடன் செயல்படுத்தலாம்.
மதிப்பீட்டை பொறியியல் மற்றும் தயாரிப்பு மேலாண்மையின் மையச் செயல்பாடாக ஒருங்கிணைப்பதன் மூலம் அணிகள் விரைவாகவும் பாதுகாப்பாகவும் புதுமை செய்யலாம். உங்கள் AI பயன்பாட்டுச் சூழலில் நல்லது என்பது என்ன என்பதை முதலில் வரையறுத்து, மதிப்பீட்டுத் தளத்தை அமைத்து, ஒவ்வொரு மறு செய்கையிலும் தயாரிப்பு நிலைக்கான நம்பிக்கையை அளிக்கும் பயன்பாட்டுக்கேற்ற அளவுகோலாக அதைப் பரிணமிக்கச் செய்யுங்கள்.