ప్రజలకు అందుబాటులో ఉండే LLM అనువర్తనాలు బ్రాండ్లకు ప్రతిష్ఠాపరమైన, ఆర్థికపరమైన నష్టాలను కలిగించవచ్చు.
LLM జైల్బ్రేక్లు, ఇతర అనూహ్య LLM ప్రవర్తన వల్ల కలిగే హానిని తగ్గించడానికి మేము బహుళ అంచెల వర్గీకరణ వడపోతలను ఉపయోగిస్తాం.
రోజుకు 40,000కు పైగా సందేశాలు వస్తూ, ఆ సంఖ్య పెరుగుతున్న భారీ స్థాయి ప్రొడక్షన్ అనువర్తనంలో దీన్ని అమలు చేశాం.
గత ఏడాది కాలంగా, పిల్లలు కూడా ఉన్న ఆటగాళ్ల సమూహం నుంచి రోజుకు సుమారు 40,000 సందేశాలను స్వీకరించే GenAI సంభాషణ సహాయకాన్ని అమలు చేయడానికి ప్రముఖ గేమ్ అభివృద్ధి సంస్థతో కలిసి పనిచేశాం. వేగం, ఖచ్చితత్వం, భద్రత, వినోదం మధ్య సమతుల్యత అత్యవసరం:
మీ బ్రాండ్కు ప్రాతినిధ్యం వహించే సంభాషణ సహాయకాన్ని రూపొందించేటప్పుడు అది సురక్షితంగా ఉంటే సరిపోదు—అది నిజంగా మీ బ్రాండ్లాగే పలకాలి.
గేమ్ సంస్థ విషయంలో, ముఖ్యంగా చిన్న వయసు ప్రేక్షకుల కోసం, భద్రతను వినోదంతోనూ వినియోగదారుల ఉత్సాహంతోనూ మేళవించాలి.
ఆధునిక GenAI అనువర్తనాలకు పునాదిగా ఉన్న LLMలు ఎంతో అనువైనవి. అందుకే అవి అనేక సమస్యలకు చక్కగా సాధారణీకరించగలవు. అయితే వాటిపై తగిన నియంత్రణలు ఉండవు. దీనివల్ల అవి తరచూ నిర్దేశిత మార్గం నుంచి తప్పుకుని, అనేక రకాల వచనాన్ని అందించవచ్చు. అందులో కొంత అనుచితంగా ఉండవచ్చు.
LLMను నేరుగా ప్రజలకు అందుబాటులో ఉంచితే అనూహ్య ప్రవర్తన తప్పక ఎదురవుతుంది. సరైన నివారణ చర్యలు లేకపోతే కింది ప్రమాదాలు తలెత్తవచ్చు:
వినియోగదారులు హానికరమైన లేదా అనుమతించని విషయాన్ని రూపొందించేలా సంభాషణ సహాయకాన్ని ఉద్దేశపూర్వకంగా మోసగించే “జైల్బ్రేక్లు” (ఆసక్తికరమైన విషయం ఏమిటంటే, సరదా ఆట ద్వారా LLM జైల్బ్రేకింగ్ను పరిశీలించడానికి ఎవరైనా ఈ వెబ్సైట్ను సందర్శించవచ్చు...); లేదా
అనుకోకుండా అసహ్యకరమైన, అభ్యంతరకరమైన లేదా ప్రమాదకరమైన విషయాన్ని అందించడం. అనేక సందర్భాల్లో ఇది వినియోగదారుల శ్రేయస్సుకు ముప్పు కలిగించవచ్చు లేదా అనువర్తన ప్రదాతకు ఆర్థిక, బ్రాండ్ నష్టాన్ని కలిగించవచ్చు.
అనూహ్య LLM వినియోగంపై వార్తా శీర్షికలు:
GenAI వ్యవస్థల్లో భద్రతను నిర్మించడం, కొనసాగించడం ఐచ్ఛికం కాదని ఈ ఘటనలు స్పష్టం చేస్తున్నాయి. చిన్నపిల్లలు భాగస్వాములైనప్పుడు ఇది మరింత కీలకం. కేవలం నిరాకరణ ప్రకటనలపై ఆధారపడలేం—విషయం సముచితంగా ఉండేందుకు పటిష్ఠమైన రక్షణ నియమాలు అత్యవసరం.
క్లయింట్ల కోసం మేము నిర్మించిన RAG (సమాచార పునరుద్ధరణతో మెరుగుపరచిన ఉత్పాదన) వ్యవస్థల మాదిరిగానే, అధిక పనితీరును కొనసాగిస్తూ జైల్బ్రేకింగ్ ప్రమాదాలను తగ్గించడానికి అనేక కృత్రిమ మేధ భాగాలను ఉపయోగిస్తాం.


మా వ్యవస్థకు సంబంధించిన సరళీకృత నిర్మాణ రేఖాచిత్రం
వ్యవస్థ భద్రత కోసం, ఇన్పుట్లు మరియు అవుట్పుట్లు రెండింటిపైనా LLM వర్గీకరణ సాధనాలను ఉపయోగిస్తాం:
ఇన్పుట్ వర్గీకరణ (ఏకకాలంలో అమలు)
వినియోగదారుల ప్రశ్నలకు లేబుళ్లు పెట్టేందుకు (ఉదా., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT మొదలైనవి) LLM స్ట్రక్చర్డ్ అవుట్పుట్స్తో పాటు Pydantic స్కీమాలను ఉపయోగించాం. జైల్బ్రేకింగ్ లేదా అనుమతించని ప్రవర్తనను గుర్తించే సూచికలు కూడా ఇందులో ఉన్నాయి.
అన్నింటినీ గుర్తించడానికి ఉద్దేశించిన ఒకే భారీ వర్గీకరణ సాధనం కంటే, ఒక్కో అంశానికి వేర్వేరు వర్గీకరణ సాధనాలు గణనీయంగా మెరుగైన పనితీరును అందించాయి.
“ఈ పాత్ర నన్ను పదేపదే చంపుతోంది” (గేమ్ను ఉద్దేశిస్తూ), “నా తల్లి లేదా తండ్రి నన్ను గాయపరుస్తున్నారు” (పిల్లలకు హాని జరుగుతోందనే సూచన) అనే వాక్యాల మధ్య వర్గీకరణ సాధనాలు తేడాను గుర్తించేందుకు విస్తృతమైన ఫ్యూ-షాట్ ఉదాహరణలు కీలకమయ్యాయి.
క్లయింట్తో, వారి ప్రత్యేక విశ్వాసం-భద్రత బృందాలతో సన్నిహితంగా కలిసి పనిచేయడం వల్ల, వాస్తవ జీవితంలో అధిక ప్రమాద సందేశాలను వారు అంచనా వేసే విధానం మా వర్గీకరణ సాధనాల్లో ప్రతిబింబించింది.


ప్రతిస్పందన రూపకల్పన
ఇన్పుట్ సురక్షితమని నిర్ధారిస్తే ప్రధాన LLM ప్రతిస్పందనను రూపొందిస్తుంది.
లేకపోతే సందేశాన్ని విస్మరించవచ్చు (జైల్బ్రేక్ల విషయంలో) లేదా మనిషి పరిశీలనకు పంపవచ్చు (ప్రశ్న భద్రతా సమస్యను సూచిస్తే).
అవుట్పుట్ వర్గీకరణ
తుది ప్రతిస్పందనను పంపే ముందు, మా అనువర్తనం నుంచి బయటకు వెళ్లబోయే మోడల్ ప్రతిస్పందనను వర్గీకరిస్తాం.
కొన్ని ప్రతిస్పందనలు అంతర్జాలం నుంచి సేకరించిన డేటాపై RAG పద్ధతులను ఉపయోగించవచ్చు కాబట్టి, ఈ దశ డేటా కలుషితం చేసే దాడుల నుంచి రక్షిస్తుంది.
అందులో అనుమతించని విషయం ఉంటే వ్యవస్థ జోక్యం చేసుకుని, దాని స్థానంలో సాధారణ సందేశాన్ని ఉంచుతుంది. ఆచరణలో ఇది చాలా అరుదుగా ఎదురైంది. అయినా, ఏజెంట్ ప్రవర్తన సముచితంగా ఉండేలా చూసే అదనపు ముందుజాగ్రత్త పొరగా ఇది పనిచేస్తుంది.
వేగం, అందుబాటు ధరను కొనసాగించడానికి:
ఎంపిక చేసిన ఫ్యూ-షాట్ ఉదాహరణలతో పాటు, తరచూ ఉపయోగించే ప్రాంప్ట్లు, పాక్షిక సంభాషణలను నిల్వ చేస్తాం.
ఈ ముందస్తు నిల్వ వల్ల ప్రతిసారీ సందర్భాన్ని మళ్లీ నిర్మించాల్సిన అవసరం లేకుండా, LLM వర్గీకరణ సాధనాలను వేగంగా, తక్కువ ఖర్చుతో అమలు చేయగలం.


Anthropic ఇటీవలి అధ్యయనం రాజ్యాంగబద్ధ వర్గీకరణ సాధనాల గురించి వివరించింది. “రాజ్యాంగబద్ధ” నియమాలతో శిక్షణ పొందిన అదనపు వర్గీకరణ సాధనాలపై ఆధారపడి, హానికరమైన లేదా అసురక్షిత అభ్యర్థనలను గుర్తించే వ్యవస్థ ఇది. వారు నివేదించిన ఫలితాలు:
వేల గంటల మానవ రెడ్ టీమింగ్ను తట్టుకునే అధిక సామర్థ్యం.
అనవసరంగా తిరస్కరించే రేటు అత్యల్పం, గణన వనరుల అదనపు భారం మితంగా ఉంది.
అభివృద్ధి చెందుతున్న జైల్బ్రేకింగ్ వ్యూహాలపై మరింత సమగ్ర రక్షణను అందిస్తూ, ఈ రాజ్యాంగబద్ధ విధానాలు సంప్రదాయ వర్గీకరణ అంచెలకు అనుబంధంగా లేదా వాటి స్థానంలోనే పనిచేసే భవిష్యత్తును మేము ఊహిస్తున్నాం.
సమాంతరంగా పనిచేసే తేలికపాటి వడపోతలు
హానికరమైన ప్రశ్నలు ఉత్పాదక మూల వ్యవస్థను చేరకుండా వర్గీకరణ అంచెలు అడ్డుకుంటాయి. నాణ్యతలేని అవుట్పుట్లు వినియోగదారులకు అందకుండా కూడా చూస్తాయి.
వినియోగదారు అనుభవం ముఖ్యం
వినోదభరితమైన, కథా నేపథ్యంతో కూడిన హెచ్చరికలు, సరదా తిరస్కరణలపై దృష్టి పెడితే వినియోగదారులు వ్యవస్థ పరిమితులను అంగీకరించే అవకాశం పెరుగుతుంది.
పరీక్ష, పర్యవేక్షణలో రాజీ పడవద్దు
క్రమం తప్పని రెడ్ టీమింగ్తో పాటు ఆటగాళ్ల ప్రవర్తనను తరచూ పర్యవేక్షిస్తే, విస్తృత ఆటగాళ్ల సమూహానికి లోపాలు తెలియకముందే వాటిని గుర్తించవచ్చు. ఆ లోపాలను తర్వాత ఫ్యూ-షాట్ వర్గీకరణ ప్రాంప్ట్లలో చేర్చి, భవిష్యత్తులో వాటిని ఉపయోగించకుండా నిరోధించవచ్చు. ప్రస్తుతం ఇది మానవులు చేసే ప్రక్రియ అయినప్పటికీ, దీన్ని స్వయంచాలకం చేయవచ్చు.
మీది గేమింగ్ సంస్థైనా, బ్యాంక్ అయినా, ప్రభుత్వ విభాగమైనా, భారీ స్థాయిలో వినియోగదారు సేవల సంభాషణ సహాయకాన్ని అమలు చేయాలంటే వినియోగదారు అనుభవ రూపకల్పన, విశ్వసనీయత రెండింటినీ లక్ష్యంగా పెట్టుకోవాలి.
కింది అంశాలు కీలకమైన సంస్థలు, బ్రాండ్ల కోసం మేము వినియోగదారులకు నేరుగా సేవలందించే పరిష్కారాలను నిర్మిస్తాం:
భద్రతకు అత్యధిక ప్రాధాన్యం—వినియోగదారులకు విలువను అందిస్తూనే హానికరమైన విషయం నుంచి వారిని కఠినంగా రక్షించే సంభాషణ సహాయకాలు.
ప్రతిష్ఠకు రక్షణ—వినియోగదారులు వ్యవస్థను దాని పరిమితులు దాటి నెట్టడానికి ప్రయత్నించినా బ్రాండ్ ప్రతిష్ఠ చెక్కుచెదరకుండా ఉంచే బహుళ రక్షణ అంచెలను రూపొందిస్తాం.
నియంత్రణ నిబంధనలు మీ ఎంపికలను పరిమితం చేస్తాయి—మీ అనువర్తనం జైల్బ్రేక్కు గురవుతుందనే ఆందోళన లేకుండా పరిష్కారాలను విస్తరించేందుకు, తాజా అనుసరణ మార్గదర్శకాలను ఎప్పటికప్పుడు పాటిస్తాం.