အန္တရာယ်မြင့် လုပ်ငန်းများအတွက် ဘေးကင်းသော ချတ်အေးဂျင့်များ တည်ဆောက်ခြင်း

သင့်ကုန်အမှတ်တံဆိပ်ကို ကိုယ်စားပြုမည့် ချတ်ဘော့တစ်ခု ဖန်တီးရာတွင် ဘေးကင်းရုံသာ မလုံလောက်ပါ။ သင်ကိုယ်တိုင် ပြောဆိုနေသည့်အလား စစ်မှန်စွာ ထင်ဟပ်စေရန်လည်း လိုအပ်သည်။

အနှစ်ချုပ်

  • အများပြည်သူ အသုံးပြုနိုင်သည့် LLM အပလီကေးရှင်းများကြောင့် ကုန်အမှတ်တံဆိပ်၏ ဂုဏ်သတင်းနှင့် ငွေကြေးပိုင်းဆိုင်ရာ အန္တရာယ်များ ဖြစ်ပေါ်နိုင်သည်။

  • LLM Jailbreak များနှင့် အခြားမရည်ရွယ်ထားသော LLM အပြုအမူများကြောင့် ဖြစ်ပေါ်နိုင်သည့် အန္တရာယ်ကို လျှော့ချရန် အလွှာဆင့် အမျိုးအစားခွဲ စစ်ထုတ်မှုများကို ကျွန်ုပ်တို့ အသုံးပြုသည်။

  • တစ်ရက်လျှင် မက်ဆေ့ချ် ၄၀,၀၀၀ နှင့်အထက် ရရှိနေသော အသုံးပြုမှုပမာဏမြင့် လက်တွေ့အပလီကေးရှင်းတစ်ခုတွင် ဤနည်းလမ်းကို ကျွန်ုပ်တို့ အသုံးချထားသည်။

နိဒါန်း

ပြီးခဲ့သည့်နှစ်အတွင်း ကလေးများလည်း ပါဝင်သည့် ကစားသမားအုပ်စုထံမှ တစ်ရက်လျှင် မက်ဆေ့ချ် ၄၀,၀၀၀ ခန့်ကို ဖြေကြားပေးသော GenAI ချတ်ဘော့ကို ဖြန့်ကျက်အသုံးပြုရန် ထိပ်တန်းဂိမ်းဖန်တီးရေးကုမ္ပဏီတစ်ခုနှင့် ကျွန်ုပ်တို့ ပူးပေါင်းခဲ့သည်။ မြန်ဆန်မှု၊ တိကျမှု၊ ဘေးကင်းမှုနှင့် ပျော်ရွှင်မှုတို့ကို ဟန်ချက်ညီစေရန် အရေးကြီးသည်။

သင့်ကုန်အမှတ်တံဆိပ်ကို ကိုယ်စားပြုမည့် ချတ်ဘော့တစ်ခု ဖန်တီးရာတွင် ဘေးကင်းရုံသာ မလုံလောက်ပါ။ သင်ကိုယ်တိုင် ပြောဆိုနေသည့်အလား စစ်မှန်စွာ ထင်ဟပ်စေရန်လည်း လိုအပ်သည်။

ဂိမ်းကုမ္ပဏီတစ်ခုအတွက်ဆိုလျှင် အထူးသဖြင့် အသက်ငယ်သည့် ပရိသတ်များအတွက် ဘေးကင်းမှုနှင့်အတူ ပျော်ရွှင်မှု၊ သုံးစွဲသူ၏ စိတ်လှုပ်ရှားမှုတို့ကို ပေါင်းစပ်ပေးရမည်ဟု ဆိုလိုသည်။

ခေတ်မီ GenAI အပလီကေးရှင်းများ၏ အခြေခံဖြစ်သော LLM များသည် အလွန်ပြောင်းလွယ်ပြင်လွယ်ရှိသဖြင့် ပြဿနာအမျိုးမျိုးတွင် ကောင်းစွာ အသုံးချနိုင်သော်လည်း ကန့်သတ်ထိန်းချုပ်မှု အားနည်းသည်။ ထို့ကြောင့် ၎င်းတို့သည် သတ်မှတ်ထားသည့် လမ်းကြောင်းမှ မကြာခဏ သွေဖည်နိုင်ပြီး မသင့်လျော်နိုင်သော စာသားများအပါအဝင် ပုံစံမျိုးစုံဖြင့် တုံ့ပြန်နိုင်သည်။

LLM ကို အများပြည်သူ တိုက်ရိုက်အသုံးပြုနိုင်အောင် ဖွင့်ပေးပါက မမျှော်လင့်ထားသည့် အပြုအမူများ မလွဲမသွေ ဖြစ်ပေါ်လာနိုင်ပြီး သင့်လျော်သော ကာကွယ်မှုမရှိလျှင် အောက်ပါအန္တရာယ်များ ရှိနိုင်သည်။

လက်တွေ့ကမ္ဘာရှိ အန္တရာယ်များကို တစ်စေ့တစ်စောင်း ကြည့်ခြင်း…

LLM ကို မရည်ရွယ်ထားသည့် နည်းလမ်းဖြင့် အသုံးပြုမှုဆိုင်ရာ သတင်းခေါင်းစဉ်များ—

ဤဖြစ်ရပ်များက GenAI စနစ်များတွင် ဘေးကင်းမှုကို တည်ဆောက်ပြီး ဆက်လက်ထိန်းသိမ်းခြင်းသည် မရှိမဖြစ်လိုအပ်ကြောင်း ထင်ရှားစေသည်။ အထူးသဖြင့် ကလေးငယ်များ ပါဝင်သည့်အခါ သတိပေးချက်များကိုသာ အားကိုး၍မရပါ။ အကြောင်းအရာများ သင့်လျော်နေစေရန် ခိုင်မာသော အကာအကွယ်စည်းများ မရှိမဖြစ် လိုအပ်သည်။

ကျွန်ုပ်တို့၏ နည်းလမ်း—အလွှာဆင့် အမျိုးအစားခွဲခြင်းနှင့် တုံ့ပြန်ညွှန်ကြားချက် ကက်ရှ်သိမ်းခြင်း

ဖောက်သည်များအတွက် ကျွန်ုပ်တို့ တည်ဆောက်ပေးခဲ့သည့် RAG (အချက်အလက်ပြန်လည်ရယူမှုဖြင့် ဖြည့်စွက်ထားသော ထုတ်လုပ်မှု) စနစ်များကဲ့သို့ပင် စွမ်းဆောင်ရည်မြင့်မားမှုကို ထိန်းသိမ်းရင်း Jailbreak လုပ်ခြင်းဆိုင်ရာ အန္တရာယ်များ လျှော့ချရန် AI အစိတ်အပိုင်းများစွာကို အသုံးပြုသည်။

ကျွန်ုပ်တို့၏ အလွှာဆင့် အမျိုးအစားခွဲခြင်းနှင့် တုံ့ပြန်ညွှန်ကြားချက် ကက်ရှ်သိမ်းခြင်း နည်းလမ်းကို သရုပ်ဖော်ထားသည့် ပုံကြမ်း။

ကျွန်ုပ်တို့စနစ်၏ ရိုးရှင်းအောင် ပြုလုပ်ထားသော တည်ဆောက်ပုံပြ ပုံကြမ်း

စနစ်ဘေးကင်းရေးကို သေချာစေရန် အဝင်နှင့် အထွက်နှစ်မျိုးစလုံးတွင် LLM အမျိုးအစားခွဲစနစ်များကို အသုံးပြုသည်။

  1. အဝင်အချက်အလက် အမျိုးအစားခွဲခြင်း (တစ်ပြိုင်နက် လုပ်ဆောင်ခြင်း)

  • သုံးစွဲသူ၏ မေးမြန်းချက်များကို အညွှန်းတပ်ရန် (ဥပမာ SAFE၊ SUSPICIOUS၊ CHILD_HARM_RISK၊ VIOLENT စသည်) Pydantic စကီးမားများနှင့် LLM ၏ တည်ဆောက်ထားသော ရလဒ်များကို တွဲဖက်အသုံးပြုခဲ့သည်။ Jailbreak လုပ်ရန် ကြိုးပမ်းမှု သို့မဟုတ် ခွင့်မပြုထားသည့် အပြုအမူကို ဖော်ထုတ်ရန် အမှတ်အသားများလည်း ထည့်သွင်းထားသည်။

  • အကြောင်းအရာတစ်ခုစီအတွက် အမျိုးအစားခွဲစနစ်များစွာ အသုံးပြုခြင်းက အရာအားလုံးကို တစ်ခုတည်းဖြင့် ဖမ်းယူရန် ကြိုးစားသည့် အမျိုးအစားခွဲစနစ်ကြီးတစ်ခုထက် သိသိသာသာ ပိုမိုကောင်းမွန်ခဲ့သည်။

  • အမျိုးအစားခွဲစနစ်များက “I keep being killed by this character” (ဂိမ်းအကြောင်း ပြောခြင်း) နှင့် “I am being hurt by my parent” (ကလေး ထိခိုက်ခံနေရကြောင်း ညွှန်ပြခြင်း) တို့ကို ခွဲခြားနိုင်စေရန် အခေါက်ရေနည်းနည်းဖြင့် ပြုလုပ်ခြင်းဆိုင်ရာ နမူနာများစွာ ထည့်သွင်းခြင်းသည် အလွန်အရေးကြီးခဲ့သည်။

  • ဖောက်သည်နှင့် ၎င်းတို့၏ အထူးကျွမ်းကျင်သော ယုံကြည်မှုနှင့် ဘေးကင်းရေးအဖွဲ့များနှင့် နီးကပ်စွာ ပူးပေါင်းခြင်းဖြင့် ကျွန်ုပ်တို့၏ အမျိုးအစားခွဲစနစ်များသည် လက်တွေ့ဘဝရှိ အန္တရာယ်မြင့် မက်ဆေ့ချ်များအပေါ် ၎င်းတို့၏ ဆုံးဖြတ်ပုံကို ထင်ဟပ်နိုင်ခဲ့သည်။

ကျွန်ုပ်တို့၏ အလွှာဆင့် အမျိုးအစားခွဲခြင်းနှင့် တုံ့ပြန်ညွှန်ကြားချက် ကက်ရှ်သိမ်းခြင်း နည်းလမ်းကို သရုပ်ဖော်ထားသည့် ပုံကြမ်း။

  1. တုံ့ပြန်ချက် ထုတ်ပေးခြင်း

  • အဝင်အချက်အလက်ကို ဘေးကင်းသည်ဟု သတ်မှတ်ပါက အဓိက LLM က တုံ့ပြန်ချက်တစ်ခု ထုတ်ပေးသည်။

  • မဟုတ်ပါက မက်ဆေ့ချ်ကို လျစ်လျူရှုနိုင်သည် (Jailbreak များအတွက်) သို့မဟုတ် မေးမြန်းချက်တွင် ဘေးကင်းရေးပြဿနာရှိကြောင်း အမှတ်အသားပြပါက လူသားဝန်ထမ်းထံ လွှဲပြောင်းနိုင်သည်။

  1. အထွက်အချက်အလက် အမျိုးအစားခွဲခြင်း

  • နောက်ဆုံးပေးပို့ခြင်းမပြုမီ ကျွန်ုပ်တို့၏ အပလီကေးရှင်းမှ မထွက်ခွာသေးခင် မော်ဒယ်၏ တုံ့ပြန်ချက်ကို အမျိုးအစားခွဲ စစ်ဆေးသည်။

  • အချို့တုံ့ပြန်ချက်များသည် အင်တာနက်မှ စုဆောင်းထားသည့် ဒေတာများအပေါ် RAG နည်းပညာများ အသုံးပြုနိုင်သဖြင့် ဤအဆင့်က ဒေတာအဆိပ်သင့်စေသည့် တိုက်ခိုက်မှုမှ ကာကွယ်ပေးသည်။

  • ခွင့်မပြုထားသည့် အကြောင်းအရာ ပါဝင်ပါက စနစ်က ကြားဝင်ပြီး ယေဘုယျမက်ဆေ့ချ်တစ်ခုဖြင့် အစားထိုးသည်။ လက်တွေ့တွင် ဤအခြေအနေကို ကြုံတွေ့ရခဲသော်လည်း အေးဂျင့်၏ အပြုအမူ ဆက်လက်သင့်လျော်နေစေရန် အပိုသတိထားကာကွယ်သည့် အလွှာတစ်ခုဖြစ်သည်။

မြန်ဆန်ပြီး ကုန်ကျစရိတ်သက်သာစေရန်—

  • အသုံးများသော တုံ့ပြန်ညွှန်ကြားချက်များနှင့် စကားဝိုင်းတစ်စိတ်တစ်ပိုင်းများကို စိစစ်ရွေးချယ်ထားသည့် အခေါက်ရေနည်းနည်းဖြင့် ပြုလုပ်ခြင်းဆိုင်ရာ နမူနာများနှင့်အတူ သိမ်းဆည်းထားသည်။

  • ဤကက်ရှ်သိမ်းဆည်းမှုကြောင့် အကြိမ်တိုင်း အကြောင်းအရာနောက်ခံကို ပြန်လည်တည်ဆောက်စရာမလိုဘဲ LLM အမျိုးအစားခွဲစနစ်များကို မြန်ဆန်စွာ၊ ကုန်ကျစရိတ်သက်သာစွာ အသုံးချနိုင်သည်။

ကျွန်ုပ်တို့၏ အလွှာဆင့် အမျိုးအစားခွဲခြင်းနှင့် တုံ့ပြန်ညွှန်ကြားချက် ကက်ရှ်သိမ်းခြင်း နည်းလမ်းကို သရုပ်ဖော်ထားသည့် ပုံကြမ်း။

အနာဂတ်ကို မျှော်ကြည့်ခြင်း—ဖွဲ့စည်းပုံအခြေခံမူအရ အမျိုးအစားခွဲစနစ်များ

Anthropic ၏ မကြာသေးမီ လေ့လာမှုတစ်ခုတွင် အန္တရာယ်ပြုလိုသော သို့မဟုတ် မဘေးကင်းသော တောင်းဆိုချက်များကို ရှာဖွေရန် “ဖွဲ့စည်းပုံအခြေခံမူ” စည်းမျဉ်းများဖြင့် လေ့ကျင့်ထားသည့် အပိုအမျိုးအစားခွဲစနစ်များကို အခြေခံသော Constitutional Classifiers စနစ်ကို ဖော်ပြခဲ့သည်။ ၎င်းတို့၏ အစီရင်ခံချက်အရ—

  • လူသားများက နာရီထောင်ပေါင်းများစွာ ထိုးဖောက်စမ်းသပ်ခြင်းကို အလွန်ကောင်းစွာ ခံနိုင်ရည်ရှိသည်။

  • မလိုအပ်ဘဲ ငြင်းပယ်မှုနှုန်း အလွန်နည်းပြီး ကွန်ပျူတာတွက်ချက်မှု အပိုဝန်လည်း အသင့်အတင့်သာရှိသည်။

အနာဂတ်တွင် ဤဖွဲ့စည်းပုံအခြေခံမူဆိုင်ရာ နည်းလမ်းများသည် ရိုးရာအမျိုးအစားခွဲ အလွှာများကို ဖြည့်စွက်ပေးနိုင်သလို အစားထိုးပင်နိုင်ပြီး ပြောင်းလဲတိုးတက်လာသည့် Jailbreak နည်းဗျူဟာများကို ပိုမိုပြည့်စုံစွာ ကာကွယ်ပေးနိုင်မည်ဟု ကျွန်ုပ်တို့ ယုံကြည်သည်။

အနှစ်ချုပ်—ကျွန်ုပ်တို့ ရရှိခဲ့သော သင်ခန်းစာများ

  1. တစ်ပြိုင်နက် လုပ်ဆောင်သည့် ပေါ့ပါးသော စစ်ထုတ်စနစ်များ

အမျိုးအစားခွဲ အလွှာများက အန္တရာယ်ပြုလိုသော မေးမြန်းချက်များကို ထုတ်လုပ်မှုဗဟိုစနစ်ထံ မရောက်ရှိစေရန် တားဆီးပြီး အရည်အသွေးညံ့သော ရလဒ်များကိုလည်း မပေးပို့မိစေရန် သေချာစေသည်။

  1. သုံးစွဲသူအတွေ့အကြုံသည် အရေးကြီးသည်

ပျော်ရွှင်စရာ၊ ဂိမ်းဇာတ်ကြောင်းနှင့် ဆက်နွှယ်သည့် သတိပေးချက်များနှင့် အပျော်သဘော ငြင်းဆိုမှုများကို အသုံးပြုခြင်းဖြင့် သုံးစွဲသူများက စနစ်၏ ကန့်သတ်ချက်များကို ပိုမိုလက်ခံလိုကြသည်။

  1. စမ်းသပ်မှုနှင့် စောင့်ကြည့်မှုကို ပေါ့ပေါ့ဆဆ မလုပ်ပါနှင့်

ပုံမှန် ထိုးဖောက်စမ်းသပ်ခြင်းနှင့် ကစားသမားတို့၏ အပြုအမူကို မကြာခဏ စောင့်ကြည့်ခြင်းတို့က အားနည်းချက်များကို ကစားသမားအများစု မသိရှိမီ ဖော်ထုတ်နိုင်ရန် အထောက်အကူပြုသည်။ ထို့နောက် အဆိုပါအချက်များကို အခေါက်ရေနည်းနည်းဖြင့် ပြုလုပ်ခြင်းဆိုင်ရာ အမျိုးအစားခွဲ တုံ့ပြန်ညွှန်ကြားချက်များထဲ ပြန်လည်ထည့်သွင်းပြီး အနာဂတ်တွင် အသုံးချမခံရစေရန် တားဆီးနိုင်သည် (လက်ရှိတွင် ကိုယ်တိုင်လုပ်ဆောင်နေရသော်လည်း အလိုအလျောက် လုပ်ဆောင်နိုင်သည်)။

အနာဂတ်အတွက် ဘေးကင်းပြီး ဆွဲဆောင်မှုရှိသော GenAI စနစ်များ တည်ဆောက်ခြင်း

သင်သည် ဂိမ်းကုမ္ပဏီ၊ ဘဏ် သို့မဟုတ် အစိုးရဌာနပင် ဖြစ်စေ၊ ဖောက်သည်ဝန်ဆောင်မှု ချတ်ဘော့ကို အကြီးစား အသုံးချမည်ဆိုပါက သုံးစွဲသူဗဟိုပြု ဒီဇိုင်းနှင့် ယုံကြည်စိတ်ချရမှု နှစ်မျိုးစလုံးကို ရည်မှန်းရမည်။

အောက်ပါအချက်များ အရေးကြီးသည့် အဖွဲ့အစည်းများနှင့် ကုန်အမှတ်တံဆိပ်များအတွက် ဖောက်သည်များ တိုက်ရိုက်အသုံးပြုနိုင်သော ဖြေရှင်းချက်များကို ကျွန်ုပ်တို့ တည်ဆောက်ပေးသည်။

  1. ဘေးကင်းရေးသည် အဓိကအရေးကြီးသည်—သုံးစွဲသူများအတွက် တန်ဖိုးရှိစေပြီး အန္တရာယ်ရှိသော အကြောင်းအရာများမှလည်း တင်းကျပ်စွာ ကာကွယ်ပေးသည့် ချတ်ဘော့များ

  2. ဂုဏ်သတင်းကို ကာကွယ်ရမည်—သုံးစွဲသူများက စနစ်ကို သတ်မှတ်ကန့်သတ်ချက်ကျော်လွန်အောင် ကြိုးစားသည့်တိုင် ကုန်အမှတ်တံဆိပ်၏ ဂုဏ်သတင်း မထိခိုက်စေရန် အကာအကွယ်အလွှာများစွာကို ကျွန်ုပ်တို့ ဒီဇိုင်းရေးဆွဲသည်။

  3. စည်းမျဉ်းများက သင်၏ ရွေးချယ်စရာများကို ကန့်သတ်သည်—သင့်အပလီကေးရှင်း Jailbreak လုပ်ခံရမည်ကို စိုးရိမ်စရာမလိုဘဲ ဖြေရှင်းချက်များကို တိုးချဲ့နိုင်ရန် နောက်ဆုံးပေါ် စည်းမျဉ်းလိုက်နာမှု လမ်းညွှန်ချက်များကို ကျွန်ုပ်တို့ အမြဲမပြတ် လေ့လာလိုက်နာသည်။

စာရေးသူ

Andrew Liubinas