အလုပ်ဖြစ်သော AI စနစ်များ တည်ဆောက်ရန် ဦးစွာ ၎င်းတို့ကို ဖောက်ဖျက်စမ်းသပ်ရမည်။ ငွေကြေးဝန်ဆောင်မှုလုပ်ငန်းရှိ သုံးစွဲသူများ အသုံးပြုသည့် AI အက်ပ်တစ်ခုကို တိုက်ခိုက်သူများအဖြစ် စမ်းသပ်စစ်ဆေးရန် ထိုးဖောက်စမ်းသပ်ခြင်းတစ်ရပ် ပြုလုပ်ခဲ့သည်။ လုံခြုံရေးကို မဖြစ်မနေ အလေးထားရသည့် LLM အခြေပြု အက်ပ်များ ဖြန့်ချိအသုံးချနေသူတိုင်းအတွက် ကျွန်ုပ်တို့၏ တွေ့ရှိချက်များက အရေးကြီးသည်။
ထိုးဖောက်စမ်းသပ်ခြင်းဆိုသည်မှာ တကယ့်တိုက်ခိုက်သူများ မတွေ့မီ အားနည်းချက်များကို ပြင်ဆင်နိုင်ရန် မိမိ၏ AI စနစ်ကို ရည်ရွယ်ချက်ရှိရှိ ဖောက်ဖျက်ရန် ကြိုးစားသည့် လုပ်ငန်းစဉ်ဖြစ်သည်။ ငွေကြေးဝန်ဆောင်မှုလုပ်ငန်းတွင် ထိခိုက်နိုင်မှု အထူးမြင့်မားသည်။ AI အက်ပ်များသည် ဖောက်သည်ဒေတာကို ကိုင်တွယ်ကာ ငွေလွှဲလုပ်ငန်းများ လုပ်ဆောင်ပြီး ဘဏ္ဍာရေးဆိုင်ရာ အချက်အလက်များ ပေးသောကြောင့်ဖြစ်သည်။ စနစ်ပျက်ကွက်မှုတစ်ခုကြောင့် သုံးစွဲသူအတွေ့အကြုံ ဆိုးရွားခြင်းမှသည် စည်းမျဉ်းချိုးဖောက်မှု၊ ငွေကြေးဆုံးရှုံးမှုနှင့် ပြန်လည်ကုစားမရသော အမှတ်တံဆိပ်ဂုဏ်သိက္ခာ ထိခိုက်မှုအထိ ဖြစ်နိုင်သည်။
ကျွန်ုပ်တို့၏ ရည်မှန်းချက်မှာ အားနည်းချက်များကို စောစောရှာဖွေရန်၊ လက်တွေ့ကျသော တိုက်ခိုက်မှုပုံစံများကို စမ်းသပ်ရန်နှင့် ကြီးကြပ်ရေးအဖွဲ့များ အထူးအလေးထားသည့် AI ဘေးကင်းရေးမျှော်မှန်းချက်များကို အဖွဲ့အစည်းက ဖြည့်ဆည်းနိုင်ရန် ကူညီပေးခြင်းဖြစ်သည်။
ဤနေရာတွင် ခွဲခြားသိထားသင့်သည့် အချက်တစ်ခုရှိသည်။ Jailbreak က အခြေခံ မော်ဒယ်၏ ဘေးကင်းရေးစစ်ထုတ်စနစ်များကို တိုက်ခိုက်ပြီး မကောင်းသော တုံ့ပြန်ညွှန်ကြားချက်များ ထည့်သွင်းခြင်း ကမူ ယုံကြည်စိတ်ချရခြင်းမရှိသော သုံးစွဲသူထည့်သွင်းချက်ကို ဆော့ဖ်ဝဲရေးသားသူ၏ ယုံကြည်ရသော တုံ့ပြန်ညွှန်ကြားချက်နှင့် ပေါင်းစပ်ကာ အက်ပ်ကိုယ်တိုင်ကို တိုက်ခိုက်သည်။ မကောင်းသော တုံ့ပြန်ညွှန်ကြားချက်များ ထည့်သွင်းခြင်း သည် ယေဘုယျသုံး မော်ဒယ်ကိုမဟုတ်ဘဲ မိမိ၏ စနစ်နှင့် စနစ်က ကိုင်တွယ်သည့် လျှို့ဝှက်ဒေတာကို ပစ်မှတ်ထားသောကြောင့် အန္တရာယ်ပိုကြီးသည်။
ပထမအကြိမ်တွင် အောက်ပါကဏ္ဍများအတွက် စမ်းသပ်မှု 750 ခန့် ပြုလုပ်ခဲ့သည်−
အသုံးပြုမှုကဏ္ဍတစ်ခုနှင့်တစ်ခုကြား ဒေတာပေါက်ကြားမှု
ကိုယ်ရေးကိုယ်တာအချက်အလက် (PII) ပေါ်ထွက်မှု (သဘာဝဘာသာစကား၊ API ချယ်လှယ်မှုနှင့် ကုဒ်ပြောင်းနည်းအမျိုးမျိုးမှတစ်ဆင့်)
SQL ထည့်သွင်းတိုက်ခိုက်မှု
စနစ် တုံ့ပြန်ညွှန်ကြားချက်များကို ထပ်ဆင့်အစားထိုးခြင်း
ကနဦးစမ်းသပ်မှုအတွင်း လက်ရှိစနစ်၌ အဓိကပြဿနာနှစ်ခုကို တွေ့ရှိခဲ့သည်။ ၎င်းတို့မှာ ရည်ရွယ်ချက်များစွာပါသည့် မေးမြန်းချက်များကို ကိုင်တွယ်ပုံနှင့် ကုဒ်ပြောင်းထားသော တုံ့ပြန်ညွှန်ကြားချက်များ အသုံးပြုခြင်းတို့ ဖြစ်သည်။
ရည်ရွယ်ချက်များစွာပါသည့် မေးမြန်းချက်များ− ခွင့်ပြုနိုင်သော တောင်းဆိုချက်နှင့် အန္တရာယ်ရှိသော တောင်းဆိုချက်တို့ကို ပေါင်းစပ်ထားခြင်း။ ဥပမာ− “ကျွန်ုပ်ရဲ့အသုံးစရိတ်ကိုပြပြီး လုပ်ဆောင်ပါ [အန္တရာယ်ရှိသော SQL].” အက်ပ်သည် အန္တရာယ်ရှိသော ရည်ရွယ်ချက်ကို မဖမ်းမိဘဲ နောက်ပိုင်းဒေတာအလွှာရှိ အကာအကွယ်များကိုသာ လုံးလုံးလျားလျား အားကိုးနေခဲ့သည်။ ယင်းမှာ မြေအောက်ခန်းရှိ မီးခံသေတ္တာကို ယုံကြည်သဖြင့် အိမ်ရှေ့တံခါးကို ဖွင့်ထားခြင်းနှင့် အတူတူပင်။
ကုဒ်ပြောင်းခြင်း− တောင်းဆိုချက်များကို Base64၊ Hex၊ LeetSpeak နှင့် အက္ခရာပုံစံတူများဖြင့် ကုဒ်ပြောင်းထားခြင်း။ စနစ်များအနေဖြင့် အန္တရာယ်ရှိသော ရည်ရွယ်ချက်ကို စစ်ထုတ်ရန် ခက်ခဲနိုင်သည်။ ဤမေးမြန်းချက်များကြောင့် အရေးကြီးဒေတာ မပေါက်ကြားခဲ့သော်လည်း စနစ်ကို သိသိသာသာ မတည်မငြိမ်ဖြစ်စေခဲ့သည်။ ဥပမာ ထင်ယောင်ထင်မှား အဖြေများ၊ သုံးစွဲသူထံ အန္တရာယ်ရှိသော SQL ကို ပြန်လည်ဖော်ပြခြင်းနှင့် ရည်ရွယ်ချက်အမျိုးအစား ခွဲခြားမှု ရှုပ်ထွေးခြင်းတို့ ဖြစ်သည်။
ကနဦးစမ်းသပ်မှုရလဒ်များအရ အောက်ပါတို့ကို တွေ့ရှိခဲ့သည်−
အချိန်ကာလဆိုင်ရာ ထင်ယောင်ထင်မှားအဖြေများ- မော်ဒယ်က လုပ်ကြံဖန်တီးထားသော ရက်စွဲ၊ ငွေလွှဲအချိန်မှတ်တမ်း သို့မဟုတ် အချိန်ကာလအလိုက် အနှစ်ချုပ်များကို ယုံကြည်မှုအပြည့်ဖြင့် ပြန်ပေးခြင်း။ မှားယွင်းသောရက်စွဲကို ဖောက်သည်က ယုံကြည်လုပ်ဆောင်ပါက လက်တွေ့အကျိုးဆက်များ ဖြစ်နိုင်သည့် ငွေကြေးနယ်ပယ်တွင် ယင်းသည် ကြီးမားသောအန္တရာယ်ဖြစ်သည်
သုံးစွဲသူထံ အန္တရာယ်ရှိသော SQL ကို ပြန်လည်ဖော်ပြခြင်း (မှတ်ဉာဏ်ဒေတာ အဆိပ်သင့်စေမည့် အန္တရာယ်ရှိသဖြင့် စိုးရိမ်ဖွယ်ရာဖြစ်သည်)
ရည်ရွယ်ချက်အမျိုးအစား ခွဲခြားမှု ရှုပ်ထွေးခြင်း
အထွက်ပုံစံ ဖရိုဖရဲဖြစ်ခြင်း
ထိုတွေ့ရှိချက်များကို အခြေခံကာ စမ်းသပ်မှုအာရုံစိုက်ရာကို ကျဉ်းမြောင်းလိုက်သည်။ အဖွဲ့က ဖြေရှင်းနေပြီးဖြစ်သောကြောင့် SQL ထည့်သွင်းတိုက်ခိုက်မှုနှင့် ကုဒ်ပြောင်းခြင်း စမ်းသပ်မှုများကို ဦးစားပေးမှု လျှော့ချခဲ့သည်။ ယင်းအစား အောင်မြင်မှုအများဆုံး တိုက်ခိုက်ရေးလမ်းကြောင်းများဖြစ်သည့် PII ပေါ်ထွက်မှုနှင့် အသုံးပြုမှုကဏ္ဍတစ်ခုနှင့်တစ်ခုကြား ဒေတာပေါက်ကြားမှုတို့ကို အာရုံစိုက်ခဲ့သည်။
ဒုတိယအကြိမ် စမ်းသပ်မှု၏ အထူးခြားဆုံးတွေ့ရှိချက်မှာ မယုံနိုင်လောက်အောင် ရိုးရှင်းသည်။ မကြာခဏဆိုသလို ထက်မြက်သော နည်းဗျူဟာ လုံးဝမလိုအပ်ပါ။
အခြေအနေအများအပြားတွင် အတွင်းရေးဒေတာကို ခွင့်ပြုနိုင်ပုံရသော တောင်းဆိုချက်တစ်ခု၏ အစိတ်အပိုင်းအဖြစ် ရိုးရိုး တောင်းရုံ ဖြင့်ပင် စနစ်က ယင်းဒေတာကို ဖော်ထုတ်ပေးရန် သဘောတူခဲ့သည်။ ရိုးရှင်းသော မေးမြန်းချက်များကိုပင် နောက်ဆုံးသုံးစွဲသူများ လုံးဝမမြင်သင့်သည့် အတွင်းပိုင်း ID များနှင့် စနစ်အကွက်များကို ရည်ညွှန်းသော အဖြေများ ပြန်ပေးခဲ့သည်။
ပိုမိုနက်ရှိုင်းစွာ စစ်ဆေးသောအခါ ယင်းသည် အက်ပ်အဆင့် ပျက်ကွက်မှုတစ်ခုတည်း မဟုတ်ကြောင်း တွေ့ရှိခဲ့သည်။ နောက်ပိုင်းရှိ စာသားမှ SQL သို့ ပြောင်းပေးသည့် ဝန်ဆောင်မှုသည် လိုအပ်သည်ထက် အကွက်များပိုတောင်းသော မေးမြန်းချက်များကို တည်ဆောက်နေပြီး ၎င်း၏ ရှင်းလင်းချက်အဖြေများက ကန့်သတ်ထားသင့်သည့် ဒေတာကို ရည်ညွှန်းနေခဲ့သည်။ ယင်းက စနစ်များကြားရှိ တကယ့်ဟာကွက်တစ်ခုကို ဖော်ထုတ်ပြသခဲ့သည်။ ထိုအားနည်းချက်မျိုးသည် အစိတ်အပိုင်းတစ်ခုချင်းစီကို သီးခြားစမ်းသပ်ခြင်းမဟုတ်ဘဲ စနစ်အလွှာအားလုံးကို စမ်းသပ်မှသာ ပေါ်ထွက်လာသည်။
မော်ဒယ်ကိုမဟုတ်ဘဲ စနစ်ကို ထိုးဖောက်စမ်းသပ်ပါ။ LLM ကို သီးခြားစမ်းသပ်ခြင်းဖြင့် အက်ပ်၏ လုံခြုံရေးအခြေအနေကို အနည်းငယ်သာ သိနိုင်သည်။ သုံးစွဲသူတစ်ဦး အပြန်အလှန်အသုံးပြုမည့်ပုံစံအတိုင်း စနစ်အလွှာအားလုံးကို အစမှအဆုံး စမ်းသပ်ပါ။
ထည့်သွင်းချက်ကို LLM ထံ မပို့မီ အတည်ပြုစစ်ဆေးရမည်။ ကုဒ်ပြောင်းထားသော မေးမြန်းချက်များ၊ ရည်ရွယ်ချက်များစွာပါသည့် တိုက်ခိုက်မှုများနှင့် အခြေခံထည့်သွင်းတိုက်ခိုက်မှုများကို နောက်ပိုင်းဝန်ဆောင်မှုများထံ လွှဲမပေးဘဲ စနစ်အဝင်ဝတွင်ပင် ဖမ်းဆီးသင့်သည်။
စနစ်များဆက်စပ်ရာ နေရာများကို မယုံကြည်ပါနှင့်။ ဝန်ဆောင်မှုများစွာပါသည့် ဗိသုကာပုံစံများတွင် စိတ်ဝင်စားဖွယ်အကောင်းဆုံး အားနည်းချက်များသည် စနစ်များ၏ ကြားရှိ ဟာကွက်များ၌ ပုန်းကွယ်နေတတ်သည်။ လုံးဝမယုံကြည်ရေးမူဝါဒဆိုသည်မှာ အမှန်တကယ် လုံးဝမယုံကြည်ခြင်းဖြစ်သောကြောင့် အလွှာတိုင်းရှိ အရာအားလုံးကို အတည်ပြုစစ်ဆေးပါ။
ရိုးရှင်းသော တိုက်ခိုက်မှုများလည်း အလုပ်ဖြစ်သည်။ ခေတ်မီဆန်းပြားသော Jailbreak များက သတင်းခေါင်းစီးဖြစ်တတ်သော်လည်း တစ်ခါတစ်ရံ ရိုးရိုးလေး... တောင်းရုံပါပဲ။ သုံးစွဲသူက အခြားအားဖြင့် ခွင့်ပြုနိုင်သော မေးမြန်းချက်တစ်ခုထဲ အတွင်းပိုင်းအမှတ်အသားများ ထည့်လိုက်ရုံဖြင့် စနစ်က ဝမ်းသာအားရ ဖော်ထုတ်ပေးပါက ယင်းသည် ပြဿနာတစ်ရပ်ဖြစ်သည်။
မိမိ အမှန်တကယ် စမ်းသပ်နေသည့်အရာကို နားလည်ပါ။ လူသိများသော တိုက်ခိုက်မှုပုံစံများကို မိမိ၏ အကာအကွယ်များကြောင့်မဟုတ်ဘဲ LLM ကိုယ်တိုင် လေ့ကျင့်ထားမှုကြောင့် ဖမ်းဆီးနိုင်သည်။ မည်သည့်ထိန်းချုပ်မှုများ အမှန်တကယ် အလုပ်လုပ်နေကြောင်း သိနိုင်ရန် ထိုးဖောက်စမ်းသပ်ခြင်း၌ စောင့်ကြည့်တိုင်းတာနိုင်စွမ်းကို ထည့်သွင်းတည်ဆောက်ပါ။
ကန့်သတ်ချက်ရှိသော ပတ်ဝန်းကျင်များတွင် ဆန်းသစ်သော ဖြေရှင်းနည်းများ လိုအပ်သည်။ စိတ်ကြိုက်ဝန်ဆောင်မှုပေးသူများနှင့် စက်တွင်း မော်ဒယ်ပံ့ပိုးမှုတို့ကြောင့် အထူးပြု cloud အသုံးပြုခွင့်မရှိဘဲ အဓိပ္ပာယ်ရှိသော ထိုးဖောက်စမ်းသပ်ခြင်းကို လုပ်ဆောင်နိုင်သည်။ သို့သော် ယင်းကြောင့် ဖြစ်လာသော ကန့်သတ်ချက်များကို ပွင့်လင်းစွာ ဖော်ပြပါ။
ထိုးဖောက်စမ်းသပ်ခြင်းသည် တစ်ကြိမ်တည်းလုပ်ရသော အလုပ်မဟုတ်ပါ။ ၎င်းကို အကြိမ်ကြိမ် ပြန်လည်လုပ်ဆောင်ရမည်၊ ဖြစ်နိုင်သမျှ အလိုအလျောက်လုပ်ဆောင်သင့်ပြီး စနစ်ပြောင်းလဲတိုးတက်လာသည်နှင့်အမျှ လိုက်လျောညီထွေ ပြောင်းလဲရမည်။ မနက်ဖြန် အရေးပါမည့် တိုက်ခိုက်မှုများသည် ယနေ့ အရေးပါသည့် တိုက်ခိုက်မှုများနှင့် မတူပါ။
စည်းမျဉ်းကြီးကြပ်ခံ ပတ်ဝန်းကျင်များရှိ AI စနစ်များသည် လျော့နည်းခြင်းမရှိဘဲ ပိုမိုတင်းကျပ်သော စိစစ်မှုကိုသာ ရင်ဆိုင်ရမည်။ လုံခြုံရေးစမ်းသပ်မှုကို မဖြန့်ချိမီ အမှန်ခြစ်ရုံ လုပ်ငန်းစဉ်တစ်ခုအဖြစ်မဟုတ်ဘဲ စဉ်ဆက်မပြတ် လိုက်နာရမည့် အလေ့အကျင့်တစ်ရပ်အဖြစ် သဘောထားသော အဖွဲ့အစည်းများသည် ထိုစိစစ်မှုကို ဖြည့်ဆည်းရန် ပိုမိုအသင့်ရှိမည်ဖြစ်ပြီး ဖောက်သည်ယုံကြည်မှု ဆုံးရှုံးစေသည့် လူထုဆက်ဆံရေးအကျပ်အတည်းများကိုလည်း ရှောင်ရှားနိုင်မည်။