ప్రధాన నావిగేషన్

అధిక ప్రమాదం గల వ్యాపారాల కోసం సురక్షిత చాట్ ఏజెంట్ల నిర్మాణం

మీ బ్రాండ్‌కు ప్రాతినిధ్యం వహించే సంభాషణ సహాయకాన్ని రూపొందించేటప్పుడు అది సురక్షితంగా ఉంటే సరిపోదు—అది నిజంగా మీ బ్రాండ్‌లాగే పలకాలి.

కార్యనిర్వాహక సారాంశం

  • ప్రజలకు అందుబాటులో ఉండే LLM అనువర్తనాలు బ్రాండ్‌లకు ప్రతిష్ఠాపరమైన, ఆర్థికపరమైన నష్టాలను కలిగించవచ్చు.

  • LLM జైల్‌బ్రేక్‌లు, ఇతర అనూహ్య LLM ప్రవర్తన వల్ల కలిగే హానిని తగ్గించడానికి మేము బహుళ అంచెల వర్గీకరణ వడపోతలను ఉపయోగిస్తాం.

  • రోజుకు 40,000కు పైగా సందేశాలు వస్తూ, ఆ సంఖ్య పెరుగుతున్న భారీ స్థాయి ప్రొడక్షన్ అనువర్తనంలో దీన్ని అమలు చేశాం.

పరిచయం

గత ఏడాది కాలంగా, పిల్లలు కూడా ఉన్న ఆటగాళ్ల సమూహం నుంచి రోజుకు సుమారు 40,000 సందేశాలను స్వీకరించే GenAI సంభాషణ సహాయకాన్ని అమలు చేయడానికి ప్రముఖ గేమ్ అభివృద్ధి సంస్థతో కలిసి పనిచేశాం. వేగం, ఖచ్చితత్వం, భద్రత, వినోదం మధ్య సమతుల్యత అత్యవసరం:

మీ బ్రాండ్‌కు ప్రాతినిధ్యం వహించే సంభాషణ సహాయకాన్ని రూపొందించేటప్పుడు అది సురక్షితంగా ఉంటే సరిపోదు—అది నిజంగా మీ బ్రాండ్‌లాగే పలకాలి.

గేమ్ సంస్థ విషయంలో, ముఖ్యంగా చిన్న వయసు ప్రేక్షకుల కోసం, భద్రతను వినోదంతోనూ వినియోగదారుల ఉత్సాహంతోనూ మేళవించాలి.

ఆధునిక GenAI అనువర్తనాలకు పునాదిగా ఉన్న LLMలు ఎంతో అనువైనవి. అందుకే అవి అనేక సమస్యలకు చక్కగా సాధారణీకరించగలవు. అయితే వాటిపై తగిన నియంత్రణలు ఉండవు. దీనివల్ల అవి తరచూ నిర్దేశిత మార్గం నుంచి తప్పుకుని, అనేక రకాల వచనాన్ని అందించవచ్చు. అందులో కొంత అనుచితంగా ఉండవచ్చు.

LLMను నేరుగా ప్రజలకు అందుబాటులో ఉంచితే అనూహ్య ప్రవర్తన తప్పక ఎదురవుతుంది. సరైన నివారణ చర్యలు లేకపోతే కింది ప్రమాదాలు తలెత్తవచ్చు:

వాస్తవ ప్రపంచంలోని ప్రమాదాలపై ఓ చూపు...

అనూహ్య LLM వినియోగంపై వార్తా శీర్షికలు:

GenAI వ్యవస్థల్లో భద్రతను నిర్మించడం, కొనసాగించడం ఐచ్ఛికం కాదని ఈ ఘటనలు స్పష్టం చేస్తున్నాయి. చిన్నపిల్లలు భాగస్వాములైనప్పుడు ఇది మరింత కీలకం. కేవలం నిరాకరణ ప్రకటనలపై ఆధారపడలేం—విషయం సముచితంగా ఉండేందుకు పటిష్ఠమైన రక్షణ నియమాలు అత్యవసరం.

మా విధానం: బహుళ అంచెల వర్గీకరణ, ప్రాంప్ట్ ముందస్తు నిల్వ

క్లయింట్ల కోసం మేము నిర్మించిన RAG (సమాచార పునరుద్ధరణతో మెరుగుపరచిన ఉత్పాదన) వ్యవస్థల మాదిరిగానే, అధిక పనితీరును కొనసాగిస్తూ జైల్‌బ్రేకింగ్ ప్రమాదాలను తగ్గించడానికి అనేక కృత్రిమ మేధ భాగాలను ఉపయోగిస్తాం.

మా బహుళ అంచెల వర్గీకరణ, ప్రాంప్ట్ ముందస్తు నిల్వ విధానాన్ని చూపే రేఖాచిత్రం.

మా వ్యవస్థకు సంబంధించిన సరళీకృత నిర్మాణ రేఖాచిత్రం

వ్యవస్థ భద్రత కోసం, ఇన్‌పుట్‌లు మరియు అవుట్‌పుట్‌లు రెండింటిపైనా LLM వర్గీకరణ సాధనాలను ఉపయోగిస్తాం:

  1. ఇన్‌పుట్ వర్గీకరణ (ఏకకాలంలో అమలు)

  • వినియోగదారుల ప్రశ్నలకు లేబుళ్లు పెట్టేందుకు (ఉదా., SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT మొదలైనవి) LLM స్ట్రక్చర్డ్ అవుట్‌పుట్స్‌తో పాటు Pydantic స్కీమాలను ఉపయోగించాం. జైల్‌బ్రేకింగ్ లేదా అనుమతించని ప్రవర్తనను గుర్తించే సూచికలు కూడా ఇందులో ఉన్నాయి.

  • అన్నింటినీ గుర్తించడానికి ఉద్దేశించిన ఒకే భారీ వర్గీకరణ సాధనం కంటే, ఒక్కో అంశానికి వేర్వేరు వర్గీకరణ సాధనాలు గణనీయంగా మెరుగైన పనితీరును అందించాయి.

  • “ఈ పాత్ర నన్ను పదేపదే చంపుతోంది” (గేమ్‌ను ఉద్దేశిస్తూ), “నా తల్లి లేదా తండ్రి నన్ను గాయపరుస్తున్నారు” (పిల్లలకు హాని జరుగుతోందనే సూచన) అనే వాక్యాల మధ్య వర్గీకరణ సాధనాలు తేడాను గుర్తించేందుకు విస్తృతమైన ఫ్యూ-షాట్ ఉదాహరణలు కీలకమయ్యాయి.

  • క్లయింట్‌తో, వారి ప్రత్యేక విశ్వాసం-భద్రత బృందాలతో సన్నిహితంగా కలిసి పనిచేయడం వల్ల, వాస్తవ జీవితంలో అధిక ప్రమాద సందేశాలను వారు అంచనా వేసే విధానం మా వర్గీకరణ సాధనాల్లో ప్రతిబింబించింది.

మా బహుళ అంచెల వర్గీకరణ, ప్రాంప్ట్ ముందస్తు నిల్వ విధానాన్ని చూపే రేఖాచిత్రం.

  1. ప్రతిస్పందన రూపకల్పన

  • ఇన్‌పుట్ సురక్షితమని నిర్ధారిస్తే ప్రధాన LLM ప్రతిస్పందనను రూపొందిస్తుంది.

  • లేకపోతే సందేశాన్ని విస్మరించవచ్చు (జైల్‌బ్రేక్‌ల విషయంలో) లేదా మనిషి పరిశీలనకు పంపవచ్చు (ప్రశ్న భద్రతా సమస్యను సూచిస్తే).

  1. అవుట్‌పుట్ వర్గీకరణ

  • తుది ప్రతిస్పందనను పంపే ముందు, మా అనువర్తనం నుంచి బయటకు వెళ్లబోయే మోడల్ ప్రతిస్పందనను వర్గీకరిస్తాం.

  • కొన్ని ప్రతిస్పందనలు అంతర్జాలం నుంచి సేకరించిన డేటాపై RAG పద్ధతులను ఉపయోగించవచ్చు కాబట్టి, ఈ దశ డేటా కలుషితం చేసే దాడుల నుంచి రక్షిస్తుంది.

  • అందులో అనుమతించని విషయం ఉంటే వ్యవస్థ జోక్యం చేసుకుని, దాని స్థానంలో సాధారణ సందేశాన్ని ఉంచుతుంది. ఆచరణలో ఇది చాలా అరుదుగా ఎదురైంది. అయినా, ఏజెంట్ ప్రవర్తన సముచితంగా ఉండేలా చూసే అదనపు ముందుజాగ్రత్త పొరగా ఇది పనిచేస్తుంది.

వేగం, అందుబాటు ధరను కొనసాగించడానికి:

  • ఎంపిక చేసిన ఫ్యూ-షాట్ ఉదాహరణలతో పాటు, తరచూ ఉపయోగించే ప్రాంప్ట్‌లు, పాక్షిక సంభాషణలను నిల్వ చేస్తాం.

  • ఈ ముందస్తు నిల్వ వల్ల ప్రతిసారీ సందర్భాన్ని మళ్లీ నిర్మించాల్సిన అవసరం లేకుండా, LLM వర్గీకరణ సాధనాలను వేగంగా, తక్కువ ఖర్చుతో అమలు చేయగలం.

మా బహుళ అంచెల వర్గీకరణ, ప్రాంప్ట్ ముందస్తు నిల్వ విధానాన్ని చూపే రేఖాచిత్రం.

భవిష్యత్తు దిశగా: రాజ్యాంగబద్ధ వర్గీకరణ సాధనాలు

Anthropic ఇటీవలి అధ్యయనం రాజ్యాంగబద్ధ వర్గీకరణ సాధనాల గురించి వివరించింది. “రాజ్యాంగబద్ధ” నియమాలతో శిక్షణ పొందిన అదనపు వర్గీకరణ సాధనాలపై ఆధారపడి, హానికరమైన లేదా అసురక్షిత అభ్యర్థనలను గుర్తించే వ్యవస్థ ఇది. వారు నివేదించిన ఫలితాలు:

  • వేల గంటల మానవ రెడ్ టీమింగ్‌ను తట్టుకునే అధిక సామర్థ్యం.

  • అనవసరంగా తిరస్కరించే రేటు అత్యల్పం, గణన వనరుల అదనపు భారం మితంగా ఉంది.

అభివృద్ధి చెందుతున్న జైల్‌బ్రేకింగ్ వ్యూహాలపై మరింత సమగ్ర రక్షణను అందిస్తూ, ఈ రాజ్యాంగబద్ధ విధానాలు సంప్రదాయ వర్గీకరణ అంచెలకు అనుబంధంగా లేదా వాటి స్థానంలోనే పనిచేసే భవిష్యత్తును మేము ఊహిస్తున్నాం.

సారాంశం: మేము నేర్చుకున్న పాఠాలు

  1. సమాంతరంగా పనిచేసే తేలికపాటి వడపోతలు

హానికరమైన ప్రశ్నలు ఉత్పాదక మూల వ్యవస్థను చేరకుండా వర్గీకరణ అంచెలు అడ్డుకుంటాయి. నాణ్యతలేని అవుట్‌పుట్‌లు వినియోగదారులకు అందకుండా కూడా చూస్తాయి.

  1. వినియోగదారు అనుభవం ముఖ్యం

వినోదభరితమైన, కథా నేపథ్యంతో కూడిన హెచ్చరికలు, సరదా తిరస్కరణలపై దృష్టి పెడితే వినియోగదారులు వ్యవస్థ పరిమితులను అంగీకరించే అవకాశం పెరుగుతుంది.

  1. పరీక్ష, పర్యవేక్షణలో రాజీ పడవద్దు

క్రమం తప్పని రెడ్ టీమింగ్‌తో పాటు ఆటగాళ్ల ప్రవర్తనను తరచూ పర్యవేక్షిస్తే, విస్తృత ఆటగాళ్ల సమూహానికి లోపాలు తెలియకముందే వాటిని గుర్తించవచ్చు. ఆ లోపాలను తర్వాత ఫ్యూ-షాట్ వర్గీకరణ ప్రాంప్ట్‌లలో చేర్చి, భవిష్యత్తులో వాటిని ఉపయోగించకుండా నిరోధించవచ్చు. ప్రస్తుతం ఇది మానవులు చేసే ప్రక్రియ అయినప్పటికీ, దీన్ని స్వయంచాలకం చేయవచ్చు.

రేపటి కోసం సురక్షితమైన, ఆకర్షణీయమైన GenAI వ్యవస్థల నిర్మాణం

మీది గేమింగ్ సంస్థైనా, బ్యాంక్ అయినా, ప్రభుత్వ విభాగమైనా, భారీ స్థాయిలో వినియోగదారు సేవల సంభాషణ సహాయకాన్ని అమలు చేయాలంటే వినియోగదారు అనుభవ రూపకల్పన, విశ్వసనీయత రెండింటినీ లక్ష్యంగా పెట్టుకోవాలి.

కింది అంశాలు కీలకమైన సంస్థలు, బ్రాండ్‌ల కోసం మేము వినియోగదారులకు నేరుగా సేవలందించే పరిష్కారాలను నిర్మిస్తాం:

  1. భద్రతకు అత్యధిక ప్రాధాన్యం—వినియోగదారులకు విలువను అందిస్తూనే హానికరమైన విషయం నుంచి వారిని కఠినంగా రక్షించే సంభాషణ సహాయకాలు.

  2. ప్రతిష్ఠకు రక్షణ—వినియోగదారులు వ్యవస్థను దాని పరిమితులు దాటి నెట్టడానికి ప్రయత్నించినా బ్రాండ్ ప్రతిష్ఠ చెక్కుచెదరకుండా ఉంచే బహుళ రక్షణ అంచెలను రూపొందిస్తాం.

  3. నియంత్రణ నిబంధనలు మీ ఎంపికలను పరిమితం చేస్తాయి—మీ అనువర్తనం జైల్‌బ్రేక్‌కు గురవుతుందనే ఆందోళన లేకుండా పరిష్కారాలను విస్తరించేందుకు, తాజా అనుసరణ మార్గదర్శకాలను ఎప్పటికప్పుడు పాటిస్తాం.

రచయిత

Andrew Liubinas