Суурь загварууд сайжирсан ч үйлдвэрлэлд итгэлтэй ашиглах боломжийг үнэхээр нээж буй өөрчлөлт нь үнэлгээний тогтсон дэг юм
Сайтар боловсруулсан үнэлгээ нь бүтээгдэхүүний менежерүүд, AI засаглалын удирдагчид, технологийн захирлуудад AI агентуудыг өргөн хүрээнд аюулгүй нэвтрүүлж, AI-г тусгаарлагдсан тоглоомоос өрсөлдөөний давуу тал болгоход тусалдаг.
Ийм итгэл нь AI агентын зан төлөвийг танай бизнесийн бодит нөхцөлийг тусгасан хэрэглэгчийн жинхэнэ асуулт, онцгой тохиолдол, салбарын тусгай хувилбаруудаар үнэлэхээс үүсдэг болохоос «энэ загвар хамгийн шилдэг» гэсэн нийтийн жишиг үзүүлэлтээс үүсдэггүй
Зорилго нь хэмжиж болох үр дүнгээр энэ итгэлийг үндэслэх явдал юм. Амжилт гэдэг нь баримтын үнэн зөв байдал, зохистой өнгө аяс, хурд эсвэл зардлын үр ашиг гээд бизнесийн хэрэгцээ, эрсдэл даах түвшинтэйгээ уялдуулан "сайн" гэдгийг тодорхой, хэмжиж болохуйц байдлаар тодорхойлохыг хэлнэ.
Үнэлгээг бүхэл системдээ (хэмжилтийн хэрэгсэл, бүртгэл, A/B туршилт, хамгаалалтын хязгаарлалт) шингээж, нарийвчлал ба үр ашгийг тэнцвэржүүлснээр багууд илүү хурдан, найдвартай нэвтрүүлнэ.
Ихэнх бизнес ажилтнуудаа ChatGPT эсвэл Gemini-г туршин ашиглахад татгалздаггүй. Гэвч Том хэлний загвар (LLM)-ыг өндөр эрсдэлтэй ажлын урсгал, орчинд ашиглах нь төдийлөн түгээмэл болоогүй.
Үүний шалтгаан ихэвчлэн үндэслэлтэй байв: чанар тогтворгүй, хий юм зохиох эсвэл хүсээгүй зан төлөв гаргах эрсдэл нь технологийн боломжит үр өгөөжөөс давж байсан.
Өнгөрсөн жилд эрсдэл, өгөөжийн энэ харьцаа мэдэгдэхүйц өөрчлөгдсөн. Үүний заримыг суурь загварын гүйцэтгэл сайжирсантай холбож болох ч дийлэнх нь үнэлгээний (эсвэл «evals») дэг улам төлөвшсөнтэй холбоотой. Үнэлгээ нь бидэнд болон үйлчлүүлэгчдэд маань өргөн хүрээний, хэрэглэгчтэй шууд харилцах агентуудыг хэдхэн долоо хоногт нэвтрүүлэх итгэл өгдөг.
Энэ гарын авлагад үнэлгээний үндсэн бүрэлдэхүүн, түүнийг хэрхэн зохиох, хэрэгжүүлэх, үйлдвэрлэлийн хэрэглээнд ажиллуулахыг тайлбарлана.
Үнэлгээний зорилго нь төгс загвар олох бус, загвар тань бизнесийн хэрэгцээ, хэрэглэгчдийн хүлээлт, байгууллагын эрсдэл даах түвшинд нийцэж ажиллана гэсэн үндэслэлтэй итгэл бий болгох юм.
Аливаа үнэлгээний стратегийн суурь нь нэг энгийн асуулт байдаг: «Сайн» гэж ямар байхыг хэлэх вэ? Хариулт нь тодорхой байх ёстой. Нэг байгууллагын хувьд «сайн» гэдэг нь хатуу хүлцлийн хүрээнд баримтын үнэн зөв байдлыг хэлж болох бол нөгөөд нь хурд, зардлын үр ашиг эсвэл онцлог өнгө аяс нэн чухал байж болно. Ямар өгөгдөл ашиглаж болохоос эхлээд ямар зохицуулалтын үүрэг үйлчлэх хүртэлх бүх хязгаарлалт энэ тодорхойлолтод нөлөөлнө.
Хамгийн чухал нь 'сайн' гэдэгт бодитоор хэмжиж болох бүрэлдэхүүн хэрэгтэй. Амжилт гэдэг нь хэрэгтэй санхүүгийн зөвлөгөө өгөхийг хэлж байвал тусч байдлыг баримтын үнэн зөв байдал, зохистой анхааруулга, хувь хүнд тохирсон сэтгэн бодох үйл явц, аюулгүй хязгаар зэрэг шинжээр илэрхийлэх хэрэгтэй. «Сайн» гэдгийг хэмжиж болохоор тодорхойлсны дараа үр дүнг хэрхэн шинжилж, тайлбарлах вэ гэсэн асуулт гарна. Эдгээр үр дүнд тулгуурлан арга хэмжээ авах нь үнэлгээг зүгээр нэг дүгнэлт бус, арга зүй болгодог.
Үнэлгээний бүх дамжлага харилцан холбоотой гурван тулгуурт үндэслэнэ:
Оролт/жишиг үзүүлэлт: Ерөнхий гүйцэтгэлийг шалгах бодит ертөнцийг төлөөлсөн жишээнүүд болон тухайн салбарт хэрэгжих боломжийг шалгах дотоодын сонгомол өгөгдлийн сан.
Загварын зан төлөв: Загварыг хэрхэн дууддаг арга (хайлтаар баяжуулсан үүсгэлт, хураангуйлалт, бүтэцтэй мэдээлэл хайх, хэрэгсэл ашиглах).
Хэмжүүр: Гүйцэтгэлийг хэрхэн хэмжиж, тайлбарлах арга.
Оролтууд нь таны системд тулгарах бодит ертөнцийг төлөөлөх ёстой. Хамгийн ач холбогдолтой ойлголтыг хэрэглэгчийн асуулт, санхүүгийн нөхцөл, салбарын тусгай тохиолдол зэрэг бодит жишээнээс олж авна. Зөвхөн эдгээрээр туршиж байж загвар хэрэглэгчдэд хэрэгтэй нарийн ялгааг үнэхээр ойлгож, бизнесийн хэрэгцээг хангаж буй эсэхийг мэдэж болно.
Загварт ямар өгөгдөл өгөх, хайлт эсвэл хэрэгслийн хэрэглээг хэрхэн зохицуулах, хам сэдвийг хэрхэн оруулах зэрэг зан төлөв нь загвараасаа дутахгүй чухал. Ижил хоёр загварыг нэвтрүүлсэн аргаасаа шалтгаалан тэс өөр ажиллаж болно. Тиймээс энэ давхаргыг үнэлгээний загварт заавал тусгах хэрэгтэй.
Эцэст нь хэмжүүрүүд бий. Тоон үзүүлэлт дангаараа бүхнийг илэрхийлэх нь ховор ч зөв сонгосон хэмжүүр системийн зан төлөвийг ойлгомжтой болгодог. Хариу өгөх хугацаа, нарийвчлал, аюулгүй байдал, уялдаа, өрөөсгөл байдал, зардал, хэрэглэгчийн сэтгэл ханамж нийлж үйлдвэрлэлд буй системийн олон талт дүр зургийг гаргана. Гол ур чадвар нь төсөл эсвэл бизнесийн KPI-тай нийцэж, хэрэглэгчдэд хамгийн чухал чанарыг тодруулах хэмжүүр сонгоход оршино. Энгийн хэмжүүр ихэвчлэн илүү нарийвчлалтай, зардал багатай байдаг бол буруу сонголт багийг төөрөгдүүлж болно. Хэмжүүр сонгохдоо дараах байдлаар бодоорой:
Зөв сонгосон хэмжүүрийн жишээ:
Харилцагчийн үйлчилгээний чатбот: Анхны харилцаагаар шийдвэрлэсэн хувь (хэрэглэгчийн асуудлыг дараагийн шатанд шилжүүлэлгүй шийдсэн үү?), дундаж шийдвэрлэх хугацаа, хэрэглэгчийн сэтгэл ханамжийн оноо, хүний агент руу шилжүүлсэн хувь
Санхүүгийн судалгааны хэрэгсэл: Эшлэлийн үнэн зөв байдал (зөв эх сурвалжтай нотолгооны хувь), жишиг үнэнтэй тулгаж баталгаажуулсан баримтын нарийвчлал, хайлтын хамаарал (зөв баримт бичгийг олсон уу?), салбарын мэргэжилтнүүдийн үнэлсэн сэтгэн бодох уялдаа
Код үүсгэх туслах: Синтаксын зөв байдал, туршилт давсан хувь, аюулгүй байдлын эмзэг байдлын тоо, ажиллах шийдэлд хүрэх хугацаа
Буруу сонгосон хэмжүүрийн жишээ:
Чанарыг зөвхөн хариултын уртаар төлөөлүүлэн хэмжих (урт ≠ сайн)
Нарийвчлалын бууралтыг харгалзахгүйгээр хурдыг хэмжих
Загварын итгэлцлийн оноог бодит зөв хариулттай тулгалгүй хянах
Хэрэглэгчид чиглэсэн баталгаажуулалтгүйгээр зөвхөн загварын дотоод перплекситид найдах
Хэмжүүрийн түгээмэл алдаа:
Зөрчилтэй хэмжүүр: Буултыг нь хүлээн зөвшөөрөлгүйгээр хурд ба бүрэн хамрах байдлыг зэрэг оновчлох
Жишиг үзүүлэлтэд хэт тааруулах: Туршилтын өгөгдөл дээр 95%-д хүрсэн ч бодит хэрэглэгчид өөрөөр харьцдаг тул үйлдвэрлэлд бүтэлгүйтэх
Зохицуулалт өндөртэй санхүүгийн үйлчилгээний нэг үйлчлүүлэгчийн хувьд гүн судалгааны шийдлийн нарийвчлал нэн чухал байв. Бид мэргэжилтний боловсруулсан асуулт-хариултын өгөгдлийг хэрэгслээр үүсгэсэн өгөгдөлтэй хослуулсан. Ингэснээр нарийвчлал, зөв хэрэгсэл сонгох болон зөв мэдээлэл олох чадварыг үнэлж, үнэн зөв байдал ба сэтгэн бодох чанарыг тэнцвэртэй харах боломжтой болсон. Гол нь баримтын үнэн зөв байдал (мэргэжилтний баталгаажуулалт), хайлтын чанар (холбогдох баримт бичгийн нарийвчлал/эргэн ололт), сэтгэн бодох уялдаа (логик урсгалын бүтэцтэй үнэлгээ) гэсэн олон хэмжээсийг хэмжихэд байв.
Нарийн ялгаатай чанарыг үнэлэхэд Том хэлний загвар (LLM)-ыг хэзээ шүүгчээр ашиглах вэ
Том хэлний загвар (LLM)-ыг шүүгчээр ашиглах арга нь хоёр дахь AI загвараар үнэлгээ хийлгэж, хүний хяналтыг өргөжүүлэх боломжтой автомат чанарын оноогоор орлуулдаг. Энгийн хэмжүүр шаардлагатай нарийвчлалыг өгч чадах үед ч Том хэлний загвар (LLM)-ыг шүүгчээр ашиглах нь элбэг. Тодорхой дүрэмт шалгалтаар чанарыг хэмжих боломжгүй үед, тухайлбал хэмжүүр нь утгын шинжтэй (тусч байдал, эх сурвалжид тулгуурласан байдал, сэтгэн бодох чанар, өнгө аяс, бодлогын тайлбар) үед энэ арга тустай. Олон өгөгдөл/загварын хувилбарт өргөжүүлэх боломжтой санал хүсэлт авч, тодорхой үнэлгээний хүснэгт болон бүтцийн гаралтын схем тодорхойлох шаардлагатай байж болно. Үүнийг үр дүнтэй ашиглахын тулд дараах алхмыг дагана уу:
Үнэлгээний хэмжээсийг тодорхой заа: зөв байдал, эх сурвалжид тулгуурласан байдал, бодлогын нийцэл, хэрэгжих боломж, өнгө аяс.
Шүүгчийн хариултад бүтцийн гаралт (JSON схем) ашигла.
Алдааг шинжлэхийн тулд хоёртын босго оноо болон оношилгооны текстийг хоёуланг нь хадгал.
Хувилбар гаргах бүрдээ шүүгчийн гаралтыг хүний шошголсон жишээнүүдтэй тулган тохируул.
Өндөр эрсдэлтэй салбарт хоёр шүүгч эсвэл үе үе санал нийцлийг шалгах арга ашигла.
Шүүгчийн хазайлт болон санал зөрсөн хувийг хугацааны явцад хяна.
Жишиг өгөгдлийн сан гэдэг нь загваруудыг тогтвортой үнэлж, хувилбаруудын үр дүнг шударгаар харьцуулахад ашигладаг, хариулт нь мэдэгдэж буй сонгомол туршилтын жишээнүүдийн тогтмол багц юм. Үүнд ихэвчлэн оролт (жишээ нь хэрэглэгчийн асуулт), хүлээгдэж буй гаралт эсвэл жишиг дүгнэлт, оноо өгөх үнэлгээний шалгуур/шошго орно. Нийтийн жишиг туршилтаар тэргүүлэх загваруудын гүйцэтгэлийг харьцуулдаг бөгөөд системээ зохиохдоо аль загвар тохирохыг урьдчилан судлахад хэрэгтэй.
Гэхдээ эдгээр жишиг үзүүлэлтэд дараах асуудлууд байдаг тул өөрийн системийн бизнесийн орчин дахь гүйцэтгэлийг тэдгээрээр төлөөлүүлэн дүгнэж болохгүй:
Бохирдол: Загварыг жишиг өгөгдлөөр сургасан байж болно. Ижил өгөгдлөөр үнэлэх нь хуулах материалтай шалгалт авахтай адил.
Ханалт: Бүх тэргүүлэх загвар аль хэдийн дээд оноонд хүрсэн тул сайжрал/бууралт хэдхэн хувиар хязгаарлагдаж, ихэвчлэн туршилтын үр дүнгийн ердийн хэлбэлзлийн хүрээнд байна.
Хязгаарлагдмал хүрээ: Жишиг өгөгдөл нь таны бодит ажлыг тусгадаггүй, учир нь хэт нарийн сонгож, цэвэрлэсэн байдаг. Заримыг нь бүр Том хэлний загвар (LLM)-аар үүсгэсэн байдаг тул таны өгөгдөл дэх нарийн төвөгтэй байдал, онцгой тохиолдлыг (үсгийн алдаа, ер бусын хэллэг, шуугиантай зураг) тусгахгүй.
Сурагч өгүүлбэртэй бодлого бодоход туслахыг хэрэглээнээс хүснэ.
Ашиглаж болох нийтийн жишиг үзүүлэлтийн жишээ: GSM8K (бага ангийн математикийн сэтгэн бодох чадвар)
Сонголттой илүү хүнд багц: MATH.
Энэ жишиг үзүүлэлт яагаад хэрэгтэй вэ:
Ерөнхий математик сэтгэн бодох чадвараар аль загвар илүүг хурдан харьцуулна,
Бүтээгдэхүүний бүрэн үнэлгээнд хөрөнгө оруулахаас өмнөх сайн шүүлтүүр болно.
Яагаад өөрийн өгөгдлийн сан шаардлагатай хэвээр вэ:
Таны хэрэглээнд GSM8K-ийн шалгадаггүй шаардлага бий:
Таны сургалтын хөтөлбөрийн хэллэг, сэдвийн дараалал,
Тухайн насны бүлэгт тохирсон тайлбарын хэв маяг,
Тодорхой бус эсвэл үсгийн алдаа ихтэй сурагчийн асуултыг хэрхэн шийдэх,
Бодлогын дүрэм (жишээлбэл, хэзээ санамж, хэзээ бүрэн хариулт өгөх).
Үр дүнтэй баталгаажуулалт нь хэрэглээндээ зориулсан үнэлгээний жишиг үзүүлэлт бий болгохоос хамаарна. Эдгээр өгөгдлийн санг бодит харилцаа, түгээмэл онцгой тохиолдол, гарах боломжтой алдаанаас бүрдүүлэх хэрэгтэй. Шинэ бүтээгдэхүүн эсвэл үйл явц хэрэгжүүлэх үед энэ нь хэцүү ажил байж болно. Гэхдээ ихэнхдээ одоо байгаа бүтээгдэхүүнээс эсвэл анхны туршилтын үеэс эхлэн аль болох эрт өгөгдөл цуглуулах боломжтой. Хэрэглээг хөгжүүлсний дараа бүтээгдэхүүнтэй хамт эдгээр жишиг үзүүлэлт ч хөгжиж, улам баялаг, төлөөлөх чадвартай болох ёстой.
Кейс судалгаа: Жижиглэнгийн банкны туслахад зориулсан жишиг үзүүлэлт бүтээх нь
Банкны чатбот төсөв, зарлага, гүйлгээний талаарх асуултад хариулна. Нийтийн асуулт-хариултын жишиг үзүүлэлт/текстээс SQL үүсгэх туршилтууд нь SQL тарилга, өгөгдөл алдагдах, олон ээлжийн хам сэдэв дамжих зэрэг банкны гол эрсдэлийг хамраагүй. Бид энэ бүтээгдэхүүний агентын дамжлагыг дуурайсан тусгай жишиг үзүүлэлт бүтээсэн.
Энэ кодын сан дахь тусгай жишиг үзүүлэлтийн бүрэлдэхүүн:
SQL тарилга, PII задлах, өгөгдлийг хүчингүй болгох, сесс хооронд мэдээлэл алдагдуулахад зориулсан хортой өгөгдлийн red-team багц
Аюулгүй байдалд тэг хүлцэл баримтална: SQL тарилга, PII задлах, сесс хооронд мэдээлэл алдагдуулах аливаа оролдлогыг заавал няцаана.
Хам сэдэв дамжуулах нарийвчлал: дахин найруулсан асуулт хэрэглэгчийн зорилго болон объектуудыг хадгалах ёстой.
Гол санаа: Жишиг үзүүлэлт бүтээхийг бүтээгдэхүүний боломж гэж үз. Одоогийн хамгаалалт нь эхнээс төгсгөл хүртэлх үнэлгээ холбогдсоныг баталж байгаа ч бодит банкны эрсдэлийг (олон зорилгот халдлага, хамгаалалтын хязгаарлалтыг тойрох, хам сэдвээс хамаарах асуулт) тусгахын тулд хамрах хүрээ, жишээний тоог нэмэх шаардлагатай. Жишиг үзүүлэлт шинэ агент, хамгаалалтын хязгаарлалттай хамт өргөжих ёстой.
Хэрэглээндээ зориулсан жишиг үзүүлэлт ба загварын сонголтын уялдаа маш чухал. Жишиг үзүүлэлт нь шийдэл ажиллаж буй эсэхээс гадна загварын хэмжээ ба сургалтын дараах аргын аль хослол шаардлагатай гүйцэтгэлийг хамгийн хэмнэлттэй өгөхийг харуулна. Урьдчилан сургасан загварын хамгийн хүчтэй сайжруулалт (ChatGPT дэх «PT») нь дахин сургалтаас бус, "сургалтын дараах" аргуудаас гардаг.
Эдгээр арга нь загвар ямар мэдээлэлд хандах, тэр мэдээллийг хэрхэн бүтэцлэх, дүгнэлт хийх үед загварыг хэрхэн чиглүүлж, зохицуулахад төвлөрдөг. Сургалтын дараах аргуудад:
Бодлын хэлхээ бүхий өгөгдөл болон тооцоолох нөөцийн динамик хуваарилалт (хүнд бодлогод илүү их бодох)
Олон гаралт үүсгээд шилдгийг сонгох өөртэйгөө нийцтэй байдал
Хайлтаар баяжуулсан үүсгэлт (RAG), цөөн оролдлогын жишээ, агентлаг ажлын урсгал зэрэг хам сэдэв бүрдүүлэлт ба зохицуулалт
Загварыг дотоод параметрээсээ давж ажиллах боломжтой болгох хэрэгслийн хэрэглээ, гадаад мэдлэгт хандах эрх
Бүтэцтэй болон бүтэцгүй өгөгдлөөс үр ашигтай хайж, сэтгэн бодоход зориулсан мэдлэгийн дүрслэл ба хадгалалтын стратеги
Сургалтын дараах эдгээр арга системийн гүйцэтгэлийг мэдэгдэхүйц сайжруулж болох ч харилцан буулт дагуулдаг. Зохицуулалт, хайлт эсвэл сэтгэн бодох нэмэлт давхарга бүр системийн төвөгшил, дүгнэлт хийх хугацаа, ажиллагааны зардлыг нэмэгдүүлнэ. Гэхдээ зөв хэрэглэвэл сургалтын дараах аргуудын тохирсон хослол нь гүйцэтгэлийн шаардлагыг хангахын зэрэгцээ жижиг, хурдан, хямд загварт найдах боломжийг ихэвчлэн бүрдүүлдэг. Загварын хэмжээг томруулахын оронд системийг илүү сайн зохиосноор гүйцэтгэлд хүрнэ.
Энэ тэнцвэр нь хэрэглээ бүрд өөр тул аргуудын оновчтой хослолыг хэрэглээндээ зориулсан үнэлгээгээр тодорхойлох хэрэгтэй. Ингэснээр нэмэлт зохицуулалт бодитой ахиц өгөхөө болих цэгийг тогтоож, зорилтот гүйцэтгэлд шаардагдах сургалтын дараах төвөгшлийн хамгийн бага түвшнийг сонгож чадна.
AI шийдлийг өгөгдлийн сан, API, хэрэглэгчийн интерфейс, зохицуулалтын давхарга, хяналтын дэд бүтэц зэрэг бүхэл системээр нь авч үзэх хэрэгтэй. Тиймээс үнэлгээ бүх технологийн давхаргыг хамрах ёстой. Болзошгүй асуудлыг ил тод харж, хариуцлагатайгаар хурдаа нэмэхийн тулд системийн гол хэсгүүдийг хянах хэрэгтэй.
Системийн гол хэсгүүдийг хянахад дараах зүйлс орно:
Дамжлагыг хэмжиж болох үр дүн цуглуулахаар тоноглох.
Өөрчлөлт бүрийн нөлөөг харахын тулд туршилтуудыг бүртгэх.
Томоохон өөрчлөлтийг нэвтрүүлэхээс өмнө болзошгүй ухралтыг шалгах энгийн A/B харьцуулалт ашиглах.
Өгөгдөлд суурилсан давталт нь үл анзаарагдах эрсдэлгүйгээр анхны загвараас үйлдвэрлэлд хүрэх замыг богиносгодог. Бүртгэл, хяналт нь хэрэглээг бодит орчинд хэрхэн ашиглаж байгааг ойлгоход мөн чухал. Ажиглах боломжийг хангах жишээ:
Алхам 1: Хэрэглэгчийн хүсэлт request_id, user_segment, intent-ийн хамт орж ирнэ.
Алхам 2: Мөрдөлтөд загварын хувилбар, өгөгдлийн хувилбар, хайж олсон баримтууд, хэрэгслийн дуудлагыг бүртгэнэ.
Алхам 3: Том хэлний загвар (LLM) шүүгч хариултад оноо өгнө (correctness, groundedness, policy_risk).
Алхам 4: Дүрмийн хөдөлгүүр босгуудыг үнэлнэ.
Алхам 5: Босго зөрчвөл дохио өгч, нөөц хувилбар/хүний хяналт руу шилжүүлнэ.
Алхам 6: Алдааг ангилан шийдвэрлэх дараалалд, дараа нь жишиг үзүүлэлтийн ажлын жагсаалтад нэмнэ.

Бодит хэрэглэгчид зохион бүтээгчдийн төсөөлсөн шиг яг таг харьцах нь ховор. Зарим нь зааврыг буруу ойлгоно. Зарим нь сул талыг зориуд шалгана. Эдгээр онцгой тохиолдол гажиг бус, үнэлж баршгүй дохио юм. Сайн хэрэгжүүлсэн үнэлгээний дамжлага тэдгээрийг цуглуулж, шинжлээд дараагийн туршилтад оруулдаг. Үл анзаарагдах эрсдэлгүй хурдан давталтыг үнэлгээг хөгжүүлэлтийн дараа нэмэх бус, системд анхнаас нь шингээсэн үед л хийх боломжтой.
Хамгаалалтын хязгаарлалт, хяналтыг эхний өдрөөс нь нэвтрүүлэхийг зөвлөж байна:
Хэрэглээндээ зориулсан жишиг үзүүлэлтээр загварын хэмжүүр ба ухралтыг тогтмол хяна.
Онцгой тохиолдол эсвэл халдлагын шинжтэй оролтыг цуглуулж, хянаад хэрэглээндээ зориулсан жишиг өгөгдөлдөө нэм.
Эдгээр үнэлгээний хэмжүүрийг үндсэн KPI-уудтайгаа нийцүүл.
Шинэ эрсдэлийг үл тоомсорлоогүй, өрөөсгөл нөлөөнд автаагүй гэдгээ батлахын тулд өгөгдөл болон жишиг үзүүлэлтээ тогтмол сорь.
Хэмжүүр муудахад автомат дохио өгдөг болго (жишээлбэл, нарийвчлал 85%-аас доошилбол хяналт эхлүүл).
Өндөр эрсдэлтэй шийдвэрт (хууль зүйн зөвлөгөө, эмнэлгийн заавар, санхүүгийн гүйлгээ) хүний хяналтын үйл явцыг хадгал.
Жишиг үнэлгээ ажиллуулах бүрд тооцоолох нөөц, эрчим хүч зарцуулна. Давхардсан туршилт бүр зардлыг нэмэгдүүлнэ. Хариуцлагатай үнэлгээ нь нарийвчлал ба үр ашгийг тэнцвэржүүлэх ёстой.
Эрчим хүч, зардлыг хяналтаас гаргахгүйн тулд дараах бодит алхмуудыг хэрэгжүүлж болно:
Боломжтой үед жижиг загвар ашигла. Эхний туршилтыг хямд загвараар явуулж, арга барилаа баталгаажуулсны дараа л хэмжээг нэм.
Өгөгдөл болон API дуудлагыг кэшил.
Эрчим хүчийг харгалзсан хуваарь ашигла (багц боловсруулалт, spot instance, уян тэргүүлэх зэрэглэл).
Тооцоолох нөөцийн хэрэглээг гүйцэтгэлтэй хамт хяна.
Үүний адил шинээр гарч буй AI зохицуулалтыг анхаарч бай. Тусгайлсан хууль байхгүй ч одоогийн тогтолцоо болон дараах шаардлагатай алхмууд үйлчилсээр байна:
Өгөгдөл хамгаалалт:
Жишиг өгөгдлийн санд зохих зөвшөөрөлгүй хувийн таних мэдээлэл (PII) байхгүйг баталгаажуул
Бүртгэсэн асуултуудад өгөгдөл хадгалах бодлого хэрэгжүүл
Өгөгдөл устгуулах хүсэлтийн механизм бүрдүүл
Тэгш байдал ба өрөөсгөл хандлага:
Хүн ам зүйн бүлгүүдээр гүйцэтгэлийг турш
Жишиг үзүүлэлт боловсруулахдаа олон талт төлөөллийг хамруул
Хүний эрх ба ил тод байдал:
Загварын хязгаарлалтыг хэрэглэгчдэд тодорхой баримтжуул
Өндөр эрсдэлтэй шийдвэрийн тайлбарыг өг
Чухал хэрэглээнд хүний хяналтыг боломжтой болго
Үнэлгээ бол нэг удаагийн үйл явдал бус, тасралтгүй хөгжих систем юм. Хурдтай өөрчлөгдөж буй энэ салбарт хэр хурдан туршиж, суралцаж, дасан зохицохоос таны давуу тал шалтгаална. Ингэснээр загвар болон шинэ шийдлүүдийг илүү үр дүнтэй нэвтрүүлнэ.
Үнэлгээг инженерчлэл ба бүтээгдэхүүний удирдлагын үндсэн ажил болгосноор багууд илүү хурдан, аюулгүй шинэчилж чадна. Эхлээд AI хэрэглээнийхээ нөхцөлд «сайн» гэж юуг хэлэхээ тодорхойлж, үнэлгээний платформ байгуул. Дараа нь давталт бүрд үйлдвэрлэлд бэлэн гэдэгт итгэх боломж өгөх, хэрэглээндээ зориулсан жишиг үзүүлэлттэй болтол хөгжүүлээрэй.