Олон нийтэд нээлттэй Том хэлний загвар (LLM)-т суурилсан хэрэглээнүүд брэндэд нэр хүнд, санхүүгийн эрсдэл учруулж болно.
Бид Том хэлний загвар (LLM)-ын jailbreak болон бусад хүсээгүй үйлдлээс үүдэх хор хөнөөлийг бууруулахын тулд олон давхар ангиллын шүүлтүүр ашигладаг.
Бид үүнийг өдөрт 40,000 гаруй, цаашид ч өсөн нэмэгдэж буй мессеж хүлээн авдаг, хэрэглээ ихтэй бодит системд нэвтрүүлсэн.
Өнгөрсөн нэг жилийн хугацаанд бид тоглоомын тэргүүлэгч хөгжүүлэгчтэй хамтран, хүүхдүүд багтсан тоглогчдоос өдөрт ойролцоогоор 40,000 мессеж хүлээн авдаг GenAI чатботыг нэвтрүүллээ. Хурд, нарийвчлал, аюулгүй байдал, сонирхолтой байдлыг тэнцвэржүүлэх нь нэн чухал:
Брэндээ төлөөлөх чатбот бүтээхдээ зөвхөн аюулгүй байлгах нь хангалтгүй—танай брэндийн жинхэнэ өнгө аясаар ярих ёстой.
Тоглоомын компанийн хувьд, ялангуяа бага насны хэрэглэгчдэд аюулгүй байдлыг хөгжилтэй, сэтгэл хөдөлгөм туршлагатай хослуулах шаардлагатай.
Орчин үеийн GenAI хэрэглээний суурь болсон Том хэлний загварууд (LLM) маш уян хатан тул олон төрлийн асуудалд сайн ажилладаг ч хангалттай хязгаарлагдаагүй байдаг. Иймээс тэд төлөвлөсөн хүрээнээс хазайж, зарим нь зохимжгүй байж болох олон төрлийн текст үүсгэх тохиолдол элбэг.
Том хэлний загвар (LLM)-ыг олон нийтэд шууд ашиглуулахад санаанд оромгүй үйлдэл зайлшгүй гарна. Зохих хамгаалалтгүй бол дараах эрсдэл үүснэ:
Хэрэглэгчид чатботоор хортой эсвэл хориглосон контент гаргуулахын тулд зориудаар хуурч ашигладаг “jailbreak” (сонирхуулахад, хэн ч энэ вэбсайтад зочлон хөгжилтэй тоглоомоор Том хэлний загвар (LLM)-ын jailbreak-ийг туршиж болно…); эсвэл
Санамсаргүйгээр таагүй, доромжилсон эсвэл аюултай контент өгөх. Ихэнх тохиолдолд энэ нь хэрэглэгчийн сайн сайхан байдалд эрсдэл учруулах эсвэл хэрэглээ нийлүүлэгчид санхүүгийн болон брэндийн хохирол авчирч болно.
Том хэлний загвар (LLM)-ын хүсээгүй хэрэглээтэй холбоотой мэдээний гарчгууд:
Эдгээр тохиолдол GenAI системийн аюулгүй байдлыг бүрдүүлж, тогтмол хангах нь зайлшгүй чухал болохыг харуулж байна. Ялангуяа бага насны хүүхдүүд ашиглаж байгаа үед зөвхөн анхааруулгад найдаж болохгүй—контентыг зохистой байлгахад найдвартай хамгаалалтын хязгаарлалт зайлшгүй шаардлагатай.
Үйлчлүүлэгчдэд зориулан бүтээсэн RAG (мэдээлэл татан авч баяжуулсан үүсгэлт) системүүдийн нэгэн адил бид jailbreak-ийн эрсдэлийг бууруулж, өндөр гүйцэтгэлийг хадгалахын тулд хиймэл оюуны олон бүрэлдэхүүн хэсэг ашигладаг.


Манай системийн архитектурын хялбаршуулсан бүдүүвч
Системийн аюулгүй байдлыг хангахын тулд бид оролт, гаралтын аль алинд Том хэлний загвар (LLM)-ын ангилагч ашигладаг:
Оролтын ангилал (зэрэг ажиллана)
Бид хэрэглэгчийн асуулгыг тэмдэглэхдээ (жишээ нь SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT гэх мэт) Pydantic схемийг Том хэлний загвар (LLM)-ын бүтцийн гаралттай хослуулан ашигласан. Үүнд jailbreak болон хориглосон үйлдлийг илрүүлэх тэмдэглэгээнүүд ч багтсан.
Сэдэв тус бүрд зориулсан олон ангилагч нь бүхнийг нэг дор илрүүлэх ганц том ангилагчаас хавьгүй сайн ажилласан.
Ангилагчид “I keep being killed by this character” (тоглоомын тухай) болон “I am being hurt by my parent” (хүүхдэд хор учруулж байгаагийн шинж) гэдгийг ялгахад цөөн оролдлогын олон жишээ нэн чухал байв.
Үйлчлүүлэгч болон тэдний итгэлцэл, аюулгүй байдлын мэргэжлийн багуудтай нягт хамтран ажилласнаар манай ангилагчид бодит амьдрал дээр өндөр эрсдэлтэй мессежийг хэрхэн үнэлэхийг нь тусгаж чадсан.


Хариулт үүсгэх
Оролтыг аюулгүй гэж үзвэл үндсэн Том хэлний загвар (LLM) хариулт үүсгэнэ.
Үгүй бол мессежийг үл тоомсорлох (jailbreak бол) эсвэл хүнд шилжүүлэх (асуулга аюулгүй байдлын асуудал заавал) боломжтой.
Гаралтын ангилал
Хариултыг хэрэглээнээс гаргаж, эцсийн байдлаар хүргэхээс өмнө загварын хариуг ангилдаг.
Зарим хариулт интернэтээс цуглуулсан өгөгдөлд RAG арга ашигладаг тул энэ алхам өгөгдөл хордуулах халдлагаас хамгаална.
Хориглосон контент илэрвэл систем хариуг ерөнхий мессежээр солино. Практикт ийм тохиолдол ховор гарсан ч агентын үйлдлийг зохистой хэвээр байлгах нэмэлт болгоомжлолын хамгаалалт юм.
Хурд, зардлын хэмнэлтийг хадгалахын тулд:
Бид түгээмэл ашигладаг өгөгдөл, харилцан ярианы хэсгүүд болон сайтар сонгосон цөөн оролдлогын жишээнүүдийг хадгалдаг.
Ингэж кэшлэснээр тухай бүр контекстыг дахин бүрдүүлэхгүйгээр Том хэлний загвар (LLM)-ын ангилагчдыг хурдан, бага зардлаар ашиглах боломжтой.


Anthropic-ийн саяхны судалгаанд хортой эсвэл аюултай хүсэлтийг илрүүлэхийн тулд “үндсэн зарчим”-ын дүрмээр сургасан нэмэлт ангилагчдад тулгуурладаг Constitutional Classifiers системийг тайлбарласан. Тэд дараах үр дүнг мэдээлсэн:
Хүний олон мянган цагийн улаан багийн туршилтыг тэсвэрлэх өндөр чадвар.
Үндэслэлгүйгээр татгалзах түвшин бага, тооцооллын нэмэлт ачаалал дунд зэрэг.
Цаашид үндсэн зарчимд суурилсан эдгээр арга уламжлалт ангиллын давхаргуудыг нөхөж, бүр орлож, өөрчлөгдөн буй jailbreak тактикаас илүү иж бүрэн хамгаалж чадна гэж бид үзэж байна.
Зэрэг ажилладаг, хөнгөн шүүлтүүрүүд
Ангиллын давхаргууд хортой асуулгыг үүсгэгч цөмд хүрэхээс сэргийлж, чанаргүй гаралтыг хэрэглэгчид хүргэхгүй байх нөхцөлийг бүрдүүлдэг.
Хэрэглэгчийн туршлага чухал
Хөгжилтэй, тоглоомын түүхэн ертөнцөд нийцсэн анхааруулга, наргиатай татгалзал ашиглавал хэрэглэгчид системийн хязгаарлалтыг илүү хүлээн зөвшөөрдөг.
Туршилт, хяналтад хайнга хандаж болохгүй
Улаан багийн тогтмол туршилт болон тоглогчдын үйлдлийг байнга хянах нь эмзэг байдлыг нийт тоглогчид мэдэхээс өмнө илрүүлэхэд тусална. Илэрсэн эмзэг байдлыг цөөн оролдлогын ангилагчийн өгөгдөлд буцаан тусгаж, цаашид ашиглагдахаас сэргийлж болно (одоогоор үүнийг гараар хийдэг ч автоматжуулах боломжтой).
Тоглоомын компани, банк эсвэл төрийн байгууллага аль нь ч байсан хэрэглэгчийн үйлчилгээний чатботыг өргөн хүрээнд нэвтрүүлэх бол хэрэглэгчийн туршлага болон найдвартай байдлыг ХОЁУЛАНГ нь зорих хэрэгтэй.
Бид дараах шаардлагатай байгууллага, брэндүүдэд хэрэглэгчид зориулсан шийдэл бүтээдэг:
Аюулгүй байдал нэн тэргүүнд—хэрэглэгчдэд үнэ цэн өгч, хортой контентоос чанд хамгаалдаг чатботууд
Нэр хүндийг хамгаална—хэрэглэгчид системийг хязгаараас нь давуулахыг оролдсон ч брэндийн нэр хүндийг бүрэн хамгаалах олон давхар хамгаалалт зохион бүтээдэг
Зохицуулалт таны сонголтыг хязгаарлана—бид нийцлийн хамгийн сүүлийн шаардлагуудыг байнга судалдаг тул та хэрэглээгээ jailbreak-д өртөх вий гэж санаа зоволгүйгээр шийдлээ өргөжүүлж чадна.