AI ಸುರಕ್ಷತೆಗೆ OpenAIನ gpt-oss-safeguard ಮಾಡೆಲ್‌ಗಳ ಮಹತ್ವ

OpenAIನ gpt-oss-safeguard ಮಾಡೆಲ್‌ಗಳ ಆರಂಭಿಕ ಮೌಲ್ಯಮಾಪನವು ವಿಶೇಷ ಸುರಕ್ಷತಾ ಮಾಡೆಲ್‌ಗಳು ಉತ್ಪಾದನಾ AI ವ್ಯವಸ್ಥೆಗಳನ್ನು ಎಲ್ಲಿ ಬಲಪಡಿಸಬಲ್ಲವು ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ.

ಕಳೆದ ಎರಡು ವರ್ಷಗಳಲ್ಲಿ, ಲಕ್ಷಾಂತರ ಬಳಕೆದಾರರಿಗೆ ಸುರಕ್ಷಿತವಾಗಿ ವಿಸ್ತರಿಸಿದ ಪರಿಹಾರಗಳನ್ನು ನಾವು ನಿರ್ಮಿಸಿದ್ದೇವೆ. ವೇಗವಾದ ಮತ್ತು ನಿಖರವಾದ ಮಾಡರೇಷನ್ ವ್ಯವಸ್ಥೆಗಳ ವಿನ್ಯಾಸವು ಈ ಕಾರ್ಯದ ಪ್ರಮುಖ ಭಾಗವಾಗಿದೆ. ಅನಗತ್ಯ ರಚನೆಗಳು ಸಮಸ್ಯೆಯಾಗುವ ಮೊದಲೇ ಅವುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವ ಪರಿಣಾಮಕಾರಿ ಮಾಡರೇಷನ್, ಅಂತಿಮ ಬಳಕೆದಾರರನ್ನು ಹಾನಿಯಿಂದ ರಕ್ಷಿಸುತ್ತದೆ ಮತ್ತು ಬ್ರ್ಯಾಂಡ್ ಸುರಕ್ಷತೆಯನ್ನು ಖಚಿತಪಡಿಸುತ್ತದೆ. ಇದರಿಂದ ಕಂಪನಿಗಳು ಅತ್ಯಾಧುನಿಕ AI ಪರಿಹಾರಗಳನ್ನು ವಿಶ್ವಾಸದಿಂದ ನಿಯೋಜಿಸಬಹುದು.

ಇತ್ತೀಚೆಗೆ, OpenAI ತನ್ನ GPT-OSS-Safeguard ಮಾಡೆಲ್‌ಗಳನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿತು. ಇವು ಈ ವರ್ಷದ ಆರಂಭದಲ್ಲಿ ಪರಿಚಯಿಸಿದ 20B ಮತ್ತು 120B OSS ಮಾಡೆಲ್‌ಗಳ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಿದ ಆವೃತ್ತಿಗಳಾಗಿವೆ. ಈ ಮಾಡೆಲ್‌ಗಳು ಇನ್‌ಫರೆನ್ಸ್ ಸಮಯದಲ್ಲೇ ಬಳಕೆದಾರರ ನೀತಿಯನ್ನು ನೇರವಾಗಿ ಅರ್ಥೈಸಬಲ್ಲವು. ಇದರಿಂದ ವಿಷಯ ಮಾಡರೇಷನ್‌ಗೆ ಹೊಂದಿಕೊಳ್ಳುವ ಮತ್ತು ಶಕ್ತಿಶಾಲಿ ವಿಧಾನ ದೊರೆಯುತ್ತದೆ. ಈ ಮಾಡೆಲ್‌ಗಳು ಸಂಶೋಧನಾ ಪೂರ್ವವೀಕ್ಷಣೆಯಲ್ಲಿರುವುದರಿಂದ, ಕಾಲಕ್ರಮೇಣ ಇನ್ನಷ್ಟು ಸುಧಾರಿಸುವುದು ಖಚಿತ.

ಈ ಬಿಡುಗಡೆಯ ಮೊದಲು ನಾವು OpenAI ಜೊತೆ ಸಹಕರಿಸಿ, ಮಾಡೆಲ್ ಅಭಿವೃದ್ಧಿಗೆ ನೆರವಾಗಲು ನೈಜ ಪರಿಸರದ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ನಡೆಸಿದೆವು. ಈ ಲೇಖನದಲ್ಲಿ, ಆ ಸಹಯೋಗದಿಂದ ಪಡೆದ ಒಳನೋಟಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತೇವೆ ಮತ್ತು ಈ ಪ್ರಗತಿಗಳು ಉತ್ಪಾದನಾ AI ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿನ ಮಾಡರೇಷನ್‌ನ ಭವಿಷ್ಯಕ್ಕೆ ಏನು ಸೂಚಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಪರಿಶೀಲಿಸುತ್ತೇವೆ.

ಇಂದು ಉತ್ಪಾದನಾ ಪರಿಸರದಲ್ಲಿ ಮಾಡರೇಷನ್ ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ?

ಇಂದು ಮಾಡರೇಷನ್ ಪರಿಹಾರಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಅನ್ವಯದ ಸುತ್ತಲೂ ಅಳವಡಿಸಿದ ರಕ್ಷಣಾ ಪದರಗಳ ರೂಪದಲ್ಲಿರುತ್ತವೆ. ಹೆಚ್ಚಿನ ಬಳಕೆಯ, ಸಾರ್ವಜನಿಕರಿಗೆ ಲಭ್ಯವಿರುವ ನಿಯೋಜನೆಗಳಲ್ಲಿ ನಾವು ಈ ಮಾದರಿಯನ್ನು ವ್ಯಾಪಕವಾಗಿ ಬಳಸುತ್ತೇವೆ. ಇದರ ಕುರಿತು ವಿವರವಾಗಿ ತಿಳಿಯಲು ನಮ್ಮ ಬ್ಲಾಗ್ ಅನ್ನು ಇಲ್ಲಿ ಓದಬಹುದು.

  1. ಇನ್‌ಪುಟ್‌ಗಳನ್ನು ಸಮಾನಾಂತರವಾಗಿ ವರ್ಗೀಕರಿಸಿ, ಕೆಟ್ಟ ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು ಒಳಬಿಡಬೇಡಿ: ಸಣ್ಣ, ವಿಷಯ-ನಿರ್ದಿಷ್ಟ ವರ್ಗೀಕಾರಕಗಳು ಏಕಕಾಲದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿ ಪ್ರತಿ ಬಳಕೆದಾರ ಸಂದೇಶಕ್ಕೆ ಲೇಬಲ್ ಹಚ್ಚುತ್ತವೆ. ಕಿರಿದಾದ ವಿಷಯದ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದ ವರ್ಗೀಕಾರಕಗಳು, ಎಲ್ಲವನ್ನೂ ನಿರ್ವಹಿಸುವ ಒಂದೇ ವರ್ಗೀಕಾರಕಕ್ಕಿಂತ ಅಳೆಯಬಹುದಾದಷ್ಟು ಹೆಚ್ಚು ವಿಶ್ವಾಸಾರ್ಹವೆಂದು ನಾವು ಕಂಡುಕೊಂಡಿದ್ದೇವೆ. ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿ ಎಚ್ಚರಿಕೆಯಿಂದ ಆಯ್ದ ಫ್ಯೂ-ಶಾಟ್ ಉದಾಹರಣೆಗಳು, “ಈ ಬಾಸ್ ನನ್ನನ್ನು ಮತ್ತೆ ಮತ್ತೆ ಕೊಲ್ಲುತ್ತಿದ್ದಾನೆ” ಎಂಬ ಸಂಪೂರ್ಣ ನಿರುಪದ್ರವಿ ಆಟದ ಸಂದರ್ಭಕ್ಕೂ ನೈಜ ಜಗತ್ತಿನ ಹಾನಿಯ ಸೂಚನೆಗೂ ಇರುವ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರುತಿಸಲು ನೆರವಾಗುತ್ತವೆ.

    • ಸುರಕ್ಷಿತ → ಸಾಮಾನ್ಯವಾಗಿ ರಚಿಸಿ

    • ಜೈಲ್‌ಬ್ರೇಕ್‌ಗಳು → ನಿರ್ಲಕ್ಷಿಸಿ ಅಥವಾ ಬ್ರ್ಯಾಂಡ್ ಶೈಲಿಯ ನಿರಾಕರಣೆಯೊಂದಿಗೆ ದಿಕ್ಕು ಬದಲಿಸಿ

    • ಸುರಕ್ಷತೆ ಅಥವಾ ಯೋಗಕ್ಷೇಮದ ಅಪಾಯಗಳು → ಸಮಗ್ರ ಸಂದರ್ಭದೊಂದಿಗೆ ಮಾನವ ಪರಿಶೀಲಕರಿಗೆ ಕಳುಹಿಸಿ

  2. ಔಟ್‌ಪುಟ್‌ಗಳನ್ನು ವರ್ಗೀಕರಿಸಿ, ಕೆಟ್ಟ ಉತ್ತರವನ್ನು ಕಳುಹಿಸಬೇಡಿ: ತಲುಪಿಸುವ ಮೊದಲು ಪ್ರತಿಯೊಂದು ಸಂಭಾವ್ಯ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನೂ ಮರುಪರಿಶೀಲಿಸಲಾಗುತ್ತದೆ. ಇದು ಮಾಡೆಲ್ ವ್ಯತ್ಯಯ, RAG ದತ್ತಾಂಶ-ವಿಷಬಾಧೆ ಮತ್ತು ಹಾನಿಕಾರಕ ವಿಷಯ, PII ಬಹಿರಂಗಪಡಿಸುವಿಕೆ ಅಥವಾ ಸೂಕ್ಷ್ಮ ಮಾಹಿತಿಯ ಸೋರಿಕೆಯಂತಹ ನೀತಿಯ ಸೂಕ್ಷ್ಮ ಅಪರೂಪದ ಸನ್ನಿವೇಶಗಳಿಂದ ರಕ್ಷಿಸುತ್ತದೆ. ಗುರುತಿಸಲಾದರೆ, ನಂತರ ವಿಷಾದಿಸುವಂತಹ ಉತ್ತರವನ್ನು ಕಳುಹಿಸುವ ಬದಲು LLM ರಚಿಸಿದ ಉತ್ತರದ ಜಾಗದಲ್ಲಿ ಸುರಕ್ಷಿತ, ಬ್ರ್ಯಾಂಡ್‌ಗೆ ಹೊಂದುವ ಸಂದೇಶವನ್ನು ನೀಡುತ್ತೇವೆ ಅಥವಾ ಅದನ್ನು ಮಾನವ ಪರಿಶೀಲಕರಿಗೆ ಕಳುಹಿಸುತ್ತೇವೆ.

  3. ವೇಗವಾಗಿ ಮತ್ತು ಕೈಗೆಟಕುವಂತೆ ಮಾಡಿ: ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು ಮರುಬಳಕೆ ಮಾಡಬಹುದಾದ ನಿರ್ಮಾಣ ಘಟಕಗಳಾಗಿ ರೂಪಿಸಿದರೆ, ಪ್ರಾಂಪ್ಟ್ ತುಣುಕುಗಳು, ವರ್ಗೀಕಾರಕದ ಫ್ಯೂ-ಶಾಟ್ ಉದಾಹರಣೆಗಳು ಮತ್ತು ಸಾಮಾನ್ಯ ಸಂಭಾಷಣಾ ಪೂರ್ವಪ್ರತ್ಯಯಗಳನ್ನು ಕ್ಯಾಶ್ ಮಾಡಬಹುದು. ಈ ವಿಧಾನವು ನಿಮ್ಮ ಸುರಕ್ಷತಾ ನಿಯಂತ್ರಣಗಳ ವಿಳಂಬ ಮತ್ತು ವೆಚ್ಚ ಎರಡನ್ನೂ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.

  4. ಸುರಕ್ಷತೆಯನ್ನು ಉತ್ಪನ್ನದ ಅನುಭವದ ಭಾಗವಾಗಿ ಪರಿಗಣಿಸಿನಿರಾಕರಣೆಗಳು ಮತ್ತು ಎಚ್ಚರಿಕೆಗಳನ್ನು ಸೂಕ್ತ ಧ್ವನಿಯಲ್ಲಿ ಬರೆಯಲಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಆಟಗಳಿಗೆ ಲವಲವಿಕೆಯ ಶೈಲಿ ಮತ್ತು ಹಣಕಾಸಿಗೆ ಔಪಚಾರಿಕ ಶೈಲಿ. ಬಳಕೆದಾರ ಅನುಭವವು ಅವರ ಉದ್ದೇಶವನ್ನು ಗೌರವಿಸಿದಾಗ, ಸುರಕ್ಷತಾ ನಿಯಂತ್ರಣಗಳ ಸ್ವೀಕಾರ ಹೆಚ್ಚುತ್ತದೆ ಮತ್ತು ಜೈಲ್‌ಬ್ರೇಕ್ ಪ್ರಯತ್ನಗಳು ಕಡಿಮೆಯಾಗುತ್ತವೆ.

  5. ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಿ, ರೆಡ್ ಟೀಮಿಂಗ್ ನಡೆಸಿ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯಾ ಚಕ್ರವನ್ನು ಪೂರ್ಣಗೊಳಿಸಿನಿರಂತರ ರೆಡ್ ಟೀಮಿಂಗ್ ಮತ್ತು ನೇರ ಸುರಕ್ಷತಾ ಡ್ಯಾಶ್‌ಬೋರ್ಡ್‌ಗಳು, ಹಿಂಜರಿತಗಳು ಬಳಕೆದಾರರನ್ನು ತಲುಪುವ ಮೊದಲೇ ಪತ್ತೆಹಚ್ಚಲು ನೆರವಾಗುತ್ತವೆ. ಹೆಚ್ಚುವರಿ ಫ್ಯೂ-ಶಾಟ್ ಉದಾಹರಣೆಗಳು ಮತ್ತು ಮಾರ್ಗನಿರ್ದೇಶನ ನಿಯಮಗಳನ್ನು ಒದಗಿಸುವ ಮೂಲಕ ಯಾವುದೇ ಹೊಸ ದಾಳಿ ಮಾದರಿಯನ್ನು ಗುರುತಿಸಲು ಮಾಡೆಲ್‌ಗೆ ಕಲಿಸಬಹುದು. ಇದರಿಂದ ಅನ್ವಯದ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ಧಕ್ಕೆಯಾಗದೆ, ಕಾಲಕ್ರಮೇಣ ವ್ಯವಸ್ಥೆಯನ್ನು ಭೇದಿಸುವುದು ಕಷ್ಟವಾಗುತ್ತದೆ.

ಇಂದು ಮಾಡರೇಷನ್ ಪರಿಹಾರ ನಿರ್ಮಿಸುವಾಗ ಎದುರಾಗುವ ಸವಾಲುಗಳು

ಪರಿಣಾಮಕಾರಿ ಸುರಕ್ಷತಾ ನಿಯಂತ್ರಣಗಳನ್ನು ನಿರ್ಮಿಸುವುದು ಮತ್ತು ನಿರ್ವಹಿಸುವುದು ಕಷ್ಟಕರ.

ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಸ್ಪಷ್ಟವಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸಿದ ನೀತಿಯನ್ನು ರೂಪಿಸಲು ಪ್ರಮುಖ ವ್ಯವಹಾರ ಪಾಲುದಾರರು ಮತ್ತು ಡೆವಲಪರ್‌ಗಳ ನಡುವೆ ಎಚ್ಚರಿಕೆಯ ಸಹಯೋಗ ಅಗತ್ಯ. ನೀತಿಯನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಿದ ನಂತರ, ವ್ಯವಸ್ಥೆಯ ವಿನ್ಯಾಸ ಮತ್ತು ನಡವಳಿಕೆಯನ್ನು ನಿರ್ಮಿಸಿ ಸೂಕ್ತವಾಗಿ ಹೊಂದಿಸಬೇಕು.

gpt-oss-safeguard ನಂತಹ ಮುಕ್ತ ಸುರಕ್ಷತಾ ರೀಜನಿಂಗ್ ಮಾಡೆಲ್‌ಗಳು ಈ ಪ್ರಕ್ರಿಯೆಯ ಕೆಲವು ತೊಂದರೆಗಳನ್ನು ಪರಿಹರಿಸಬಹುದು. ಇವು ವಿಷಯ ಮಾಡರೇಷನ್‌ಗೆ ಹೆಚ್ಚು ಸಿದ್ಧರೂಪದ ಮತ್ತು ಬಹೂಪಯೋಗಿ ಅಡಿಪಾಯವನ್ನು ಒದಗಿಸುತ್ತವೆ.

ವಿಶೇಷ ಸುರಕ್ಷತಾ ಮಾಡೆಲ್‌ಗಳ ಸಾಧ್ಯತೆ

ಇಂದಿನ ಮಾಡರೇಷನ್ ವ್ಯವಸ್ಥೆಗಳನ್ನು ನಿರ್ಮಿಸುವಾಗ ಸಾಮಾನ್ಯವಾಗಿ ಎದುರಾಗುವ ಕೆಲವು ಸವಾಲುಗಳನ್ನು ಪರಿಹರಿಸುವುದು Gpt-oss-safeguardನ ಉದ್ದೇಶವಾಗಿದೆ. ಈ ಸಣ್ಣ, ವಿಶೇಷ ಮಾಡೆಲ್‌ಗಳನ್ನು ಇನ್‌ಫರೆನ್ಸ್ ಸಮಯದಲ್ಲಿ ಗುರಿ ನೀತಿಯ ಕುರಿತು ರೀಜನಿಂಗ್ ಮಾಡಲು ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಲಾಗಿದೆ. ಇವು ಜೈಲ್‌ಬ್ರೇಕ್‌ಗಳು, PII ಬಹಿರಂಗಪಡಿಸುವಿಕೆ ಮತ್ತು ಇತರ ನೀತಿ ಉಲ್ಲಂಘನೆಗಳಂತಹ ಹಾನಿಕಾರಕ ಅಥವಾ ಸೂಕ್ಷ್ಮ ವಿಷಯಗಳನ್ನು ಹುಡುಕುತ್ತವೆ.

ವರ್ಗೀಕರಣ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ ರೀಜನಿಂಗ್ ಅನ್ನು ಸೇರಿಸುವುದರಿಂದ, ಇವು ಹೆಚ್ಚು ನಿಖರವಾದ, ಸುಲಭವಾಗಿ ತಪ್ಪಿಸಿಕೊಳ್ಳಲಾಗದ ಮತ್ತು ಸ್ಥಿರವಾದ ಮಾಡರೇಷನ್ ಒದಗಿಸುತ್ತವೆ. GPT-OSS 20B ಮತ್ತು 120Bಗಳ ವಿಶೇಷ ಸುರಕ್ಷತಾ ರೂಪಾಂತರಗಳಾದ ಇವು, ಅಗತ್ಯಕ್ಕೆ ತಕ್ಕ ನೀತಿ ವ್ಯಾಖ್ಯಾನಗಳ ಮೂಲಕ ಅತಿ ಕಡಿಮೆ ಸ್ಥಾಪನಾ ಶ್ರಮದಲ್ಲೇ ಅತ್ಯಾಧುನಿಕ ಸುರಕ್ಷತಾ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತವೆ.

ನಾವು ಪರೀಕ್ಷಿಸಿದ್ದು

ನೈಜ-ಸಮಯದ ಧ್ವನಿ ಸಹಾಯಕ, ಆಟದೊಳಗಿನ ಆಟಗಾರರ ಬೆಂಬಲ ಬಾಟ್, ಪೂರ್ವಭಾವಿ ಚಾಟ್ ಮಾಡರೇಷನ್ ವ್ಯವಸ್ಥೆ ಮತ್ತು ಬಹುಭಾಷಾ ವಿಷಕಾರಿ ವಿಷಯ ಪರಿಶೀಲನೆ ಸೇರಿದಂತೆ ಹಲವು ಉತ್ಪಾದನಾ ಸ್ವರೂಪದ ಕಾರ್ಯಗಳಲ್ಲಿ gpt-oss-safeguard 20B ಮತ್ತು 120B ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆವು. ಭಾಷೆಗಳು ಸ್ಪ್ಯಾನಿಷ್, ಫ್ರೆಂಚ್, ಇಟಾಲಿಯನ್, ಪೋರ್ಚುಗೀಸ್, ರಷ್ಯನ್ ಮತ್ತು ಟರ್ಕಿಶ್.

ನಾವು ಕಂಡುಕೊಂಡದ್ದು

  • ವಿಳಂಬಕ್ಕೆ ಸೂಕ್ಷ್ಮವಾದ ಧ್ವನಿ ಮಾಡರೇಷನ್: ನಮ್ಮ ನೈಜ-ಸಮಯದ ಧ್ವನಿ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಅಂದರೆ ಆಟದ ಚಾಟ್ ಮಾಡರೇಷನ್‌ನಂತೆ ಸಂಭಾಷಣೆಯಲ್ಲೇ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ವಿಶ್ಲೇಷಿಸಿ ಆದ್ಯತೆ ನಿರ್ಧರಿಸುವ ಸಂದರ್ಭದಲ್ಲಿ, gpt-oss-safeguard-20B ಬಹಳ ಕಡಿಮೆ ವಿಳಂಬದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಲೇ GPT-OSS-20B ಮತ್ತು GPT-5-Mini ನಡುವಿನ ನಿಖರತೆಯ ಅಂತರದ ಸುಮಾರು 80% ಅನ್ನು ಕಡಿಮೆ ಮಾಡಿತು. ಅಂಕ 0.45ರಿಂದ 0.71ಕ್ಕೆ ಏರಿದ್ದು, GPT-5-Miniಗೆ 0.78 ಇತ್ತು.

  • ಆಟಗಾರರ ಬೆಂಬಲದ ಮೇಲ್ದರ್ಜೆಗೇರಿಸುವಿಕೆ: ಆಟಗಾರರ ಬೆಂಬಲದ ಆದ್ಯತೆ ನಿರ್ಧಾರದಲ್ಲಿ, gpt-oss-safeguard-20B, GPT-OSS-20b ಮತ್ತು GPT-5-Mini ನಡುವಿನ ಅಂತರದ ಸುಮಾರು 90% ಅನ್ನು ಕಡಿಮೆ ಮಾಡಿತು. ಅಂಕ 0.57ರಿಂದ 0.66ಕ್ಕೆ ಏರಿದ್ದು, GPT-5-Miniಗೆ 0.67 ಇತ್ತು. ಇದು ಪರೀಕ್ಷಾ ಸಮೂಹದಲ್ಲೇ ಅತ್ಯುತ್ತಮ ಮ್ಯಾಕ್ರೋ ನಿಖರತೆಯನ್ನೂ ನೀಡಿತು. ನಿರುಪದ್ರವಿ ವಿಷಯದಲ್ಲಿ 88% ರಿಕಾಲ್ ಮತ್ತು ದುರ್ಬಲ ಬಳಕೆದಾರರ ಪತ್ತೆಯಲ್ಲಿ 87% ನಿಖರತೆ ಸಾಧಿಸಿತು. ಮಾನವ ಪರಿಶೀಲಕರ ಮೇಲೆ ಅತಿಯಾದ ಹೊರೆ ಹಾಕದೆ, ಎಚ್ಚರಿಕೆಯ ಮತ್ತು ಹೆಚ್ಚು ವಿಶ್ವಾಸಾರ್ಹ ಮೇಲ್ದರ್ಜೆಗೇರಿಸುವಿಕೆ ಬಯಸಿದರೆ ಇದು ಉಪಯುಕ್ತ.

  • ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ನೀತಿ-ಸಮೃದ್ಧ ಚಾಟ್ ಮಾಡರೇಷನ್: ವಿಸ್ತೃತ ನೀತಿ ದಾಖಲೆಯ ಪ್ರಕಾರ ಆಟದೊಳಗಿನ ಸಂದೇಶಗಳನ್ನು ಪೂರ್ವಭಾವಿಯಾಗಿ ಗುರುತಿಸಬೇಕಾದ ನಮ್ಮ ಅತ್ಯಂತ ಕಠಿಣ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, gpt-oss-safeguard ಮೂಲ OSSಗಿಂತ ಸ್ಪಷ್ಟವಾಗಿ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿತು. ಇದು ಸುಮಾರು 35% ಸಾಪೇಕ್ಷ ಸುಧಾರಣೆ ಸಾಧಿಸಿ, ದೀರ್ಘ ನೀತಿಗಳನ್ನೂ ಪರಿಣಾಮಕಾರಿಯಾಗಿ ನಿರ್ವಹಿಸಿತು. ಇದು ಹೆಚ್ಚಿನ ರಿಕಾಲ್ ಮತ್ತು ನಿಖರತೆಯನ್ನು ಬೇಡುವ ವಿಶೇಷವಾಗಿ ಸೂಕ್ಷ್ಮ ಬಳಕೆಯ ಸಂದರ್ಭವಾಗಿದೆ. ರಿಕಾಲ್ ತುಂಬಾ ಕಡಿಮೆಯಿದ್ದರೆ, ಅನೇಕ ಹಾನಿಕಾರಕ ಸಂದೇಶಗಳು ಪತ್ತೆಯಾಗದೆ ಹೋಗುತ್ತವೆ. ನಿಖರತೆಯ ಅಂಕ ಕಡಿಮೆಯಿದ್ದರೆ, ಸಂಬಂಧವಿಲ್ಲದ ಅನೇಕ ಸಂದೇಶಗಳು ಮಾನವ ಮಾಡರೇಟರ್‌ಗಳ ಪರಿಶೀಲನೆಗೆ ಗುರುತಿಸಲ್ಪಡುತ್ತವೆ. ಇದರಿಂದ ನಿಜವಾಗಿಯೂ ಕಠಿಣ ಪ್ರಕರಣಗಳ ಮೇಲಿನ ಅವರ ಗಮನ ಚದುರುತ್ತದೆ.

  • ಬಹುಭಾಷಾ ಕಾರ್ಯಕ್ಷಮತೆ: ಆರು ಭಾಷೆಗಳ ಸಮತೋಲಿತ ವಿಷಕಾರಿ ವಿಷಯದ ದತ್ತಾಂಶಸಂಗ್ರಹದಲ್ಲಿ, gpt-oss-safeguard, GPT-5-Miniಗೆ ಸಮೀಪದ ಕಾರ್ಯಕ್ಷಮತೆ ತೋರಿತು. ನಿಖರತೆಯ ಅಂತರ ಸಾಮಾನ್ಯವಾಗಿ 3–5 ಶೇಕಡಾವಾರು ಅಂಕಗಳೊಳಗಿತ್ತು ಮತ್ತು ಸ್ಪ್ಯಾನಿಷ್‌ನಲ್ಲಿ gpt-oss-safeguard-120B ಸ್ವಲ್ಪ ಮುನ್ನಡೆ ಸಾಧಿಸಿತು. ಟರ್ಕಿಶ್‌ನಂತಹ ಕಡಿಮೆ ಸಂಪನ್ಮೂಲದ ಭಾಷೆಗಳಲ್ಲಿ ಸ್ವಲ್ಪ ಹೆಚ್ಚಿನ ಅಂತರ ಕಂಡುಬಂತು. ಆದರೂ ಒಟ್ಟಾರೆ ಬಹುಭಾಷಾ ಕಾರ್ಯಕ್ಷಮತೆ ದೃಢವಾಗಿತ್ತು ಮತ್ತು 20Bಯಿಂದ 120Bಗೆ ಏರಿದಾಗ ರಿಕಾಲ್‌ನಲ್ಲಿ ಸ್ಥಿರ ಸುಧಾರಣೆ ಕಂಡುಬಂತು.

ಮಾಡರೇಷನ್‌ನಲ್ಲಿ LLMಗಳು ಸಾಂಪ್ರದಾಯಿಕವಾಗಿ ದುರ್ಬಲವಾಗಿರುವ ಕ್ಷೇತ್ರಗಳಲ್ಲಿಯೂ gpt-oss-safeguard ಮಾಡೆಲ್‌ಗಳು ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವುದನ್ನು ನಾವು ಗಮನಿಸಿದೆವು. ಉದಾಹರಣೆಗೆ, ಮುಖ್ಯವಾಹಿನಿಯ ಮಾಡೆಲ್‌ಗಳು ಅಮೆರಿಕದ ಸ್ವರೂಪದ PII ದತ್ತಾಂಶವನ್ನು ಗುರುತಿಸುವತ್ತ ಹೆಚ್ಚು ಒಲವು ಹೊಂದಿದ್ದು, ಇತರ ಪ್ರದೇಶಗಳಲ್ಲಿ ದುರ್ಬಲವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಪ್ರವೃತ್ತಿಯಿದೆ. ಆದ್ದರಿಂದ, ವ್ಯಾಪಕ LLMಗಳು ನಿಭಾಯಿಸಲಾಗದ ಸಣ್ಣ ನೀತಿ ಉಲ್ಲಂಘನೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಅಗತ್ಯಕ್ಕೆ ತಕ್ಕ ಸಾಧನಗಳ ಮೇಲಿನ ಅವಲಂಬನೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ, gpt-oss-safeguard ಮಾಡರೇಷನ್ ವ್ಯವಸ್ಥೆಗಳ ಸ್ಥಾಪನೆಯನ್ನು ಸರಳಗೊಳಿಸುತ್ತದೆ ಎಂದು ನಾವು ನಂಬುತ್ತೇವೆ.

ಉದ್ದೇಶಿತ ಫೈನ್-ಟ್ಯೂನಿಂಗ್‌ನ ಸಾಮರ್ಥ್ಯ

ಹೀಗಾಗಿ, gpt-oss-safeguard-20B ಮತ್ತು gpt-oss-safeguard-120B ಮುಂತಾದ ‘ಮೂಲಾಧಾರ ಮಾಡರೇಷನ್ ಮಾಡೆಲ್‌ಗಳು’ ತ್ವರಿತವಾಗಿ ಉತ್ತಮ ಫಲಿತಾಂಶ ನೀಡುತ್ತವೆ ಎಂಬುದನ್ನು ನಮ್ಮ ಮೌಲ್ಯಮಾಪನಗಳು ದೃಢಪಡಿಸಿವೆ. ಆದರೆ, ವ್ಯವಸ್ಥೆಗಳು ಅತ್ಯುನ್ನತ ಸುರಕ್ಷತೆ ಮತ್ತು ನಿರ್ದಿಷ್ಟತೆಯನ್ನು ಬಯಸಿದಾಗ, ಕ್ಷೇತ್ರ-ನಿರ್ದಿಷ್ಟ ಫೈನ್-ಟ್ಯೂನ್‌ಗಳೇ ಈಗಲೂ ಮಾನದಂಡವಾಗಿವೆ.

ಉದ್ದೇಶಿತ ಫೈನ್-ಟ್ಯೂನಿಂಗ್‌ನ ಸಾಮರ್ಥ್ಯವನ್ನು ತೋರಿಸುವ ಸ್ಕ್ರೀನ್‌ಶಾಟ್.

ಆಟದೊಳಗಿನ ಮಾಡರೇಷನ್ ಬಳಕೆಗೆ, ಸುಮಾರು 10 ಸಾವಿರ ಹಿಂದಿನ ಮಾಡರೇಟರ್ ಕ್ರಮಗಳು ಮತ್ತು ನೀತಿ ಫಲಿತಾಂಶಗಳ ಮೇಲೆ ಸೂಪರ್ವೈಜ್ಡ್ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಬಳಸಿ Qwen3-0.6B ವರ್ಗೀಕಾರಕವನ್ನು ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಿದೆವು. ಈ ಮಾಡೆಲ್ ಈ ಕಾರ್ಯದಲ್ಲಿ ನಾವು ಪರೀಕ್ಷಿಸಿದ ಎಲ್ಲ ಮೂಲ ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಬಹಳ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿದೆ. ಇದು 15%ಕ್ಕೆ ಪ್ರತಿಯಾಗಿ 57% ನಿಖರತೆ ಸಾಧಿಸಿದ್ದು (GPT-4.1-nano ಕಾರ್ಯಕ್ಷಮತೆಯ ಅನುಪಾತದಿಂದ ಅಂದಾಜಿಸಿದ gpt-oss-safeguard-120B), 42 ಶೇಕಡಾವಾರು ಅಂಕಗಳ ಅಥವಾ ಸುಮಾರು 280% ಸುಧಾರಣೆಯಾಗಿದೆ. ಲೇಬಲ್ ಮಾಡಿದ ಉದಾಹರಣೆಗಳ ಮೇಲೆ ತರಬೇತಿ ಪಡೆದ ಸಣ್ಣ, ಮೀಸಲು ವರ್ಗೀಕಾರಕಗಳು ವಿಶೇಷ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ ಸುರಕ್ಷತಾ ಮಾಡೆಲ್‌ಗಳಿಗಿಂತ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಹುದು ಎಂಬ OpenAI ಮಾರ್ಗದರ್ಶನಕ್ಕೆ ಈ ಫಲಿತಾಂಶಗಳು ಹೊಂದಿಕೆಯಾಗುತ್ತವೆ.

ಇದರ ಸಾರಾಂಶ ಸ್ಪಷ್ಟವಾಗಿದೆ: ನೀತಿಗಳು ಸೂಕ್ಷ್ಮವಾಗಿದ್ದು ಹಲವು ಅಪರೂಪದ ಸನ್ನಿವೇಶಗಳನ್ನು ಹೊಂದಿರುವಾಗ, ಕ್ಷೇತ್ರಕ್ಕೆ ಹೊಂದಿಸಿದ ಸಣ್ಣ ಮಾಡೆಲ್ ಅತ್ಯುತ್ತಮ ಮಾನದಂಡವಾಗಿರುತ್ತದೆ. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಪ್ರಕ್ರಿಯೆಯು ನಿಮ್ಮ ನೀತಿ ಮತ್ತು ಅಪರೂಪದ ಸನ್ನಿವೇಶಗಳನ್ನು ನೇರವಾಗಿ ಪರಿಮಿತಿಗಳಲ್ಲಿ ಅಳವಡಿಸುತ್ತದೆ. ಇದರಿಂದ ಸಂಕೀರ್ಣ ಉತ್ಪಾದನಾ ಪರಿಸರದಲ್ಲೂ ಹೆಚ್ಚು ಸ್ಥಿರವಾದ ನಡವಳಿಕೆ ಸಿಗುತ್ತದೆ ಮತ್ತು ವಿಳಂಬ ಹಾಗೂ ವೆಚ್ಚ ಅತ್ಯಲ್ಪವಾಗಿರುತ್ತದೆ.

ಇದಕ್ಕಾಗಿ ಸಾಧ್ಯವಿರುವ ಹಲವು ವಿಧಾನಗಳಲ್ಲಿ ಸೂಪರ್ವೈಜ್ಡ್ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಕೇವಲ ಒಂದಾಗಿದೆ. ಮಾಡೆಲ್‌ನ ನಡವಳಿಕೆಯನ್ನು ಇನ್ನಷ್ಟು ಉತ್ತಮಗೊಳಿಸಲು ರೀಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್ ಅಥವಾ ಆನ್-ಪಾಲಿಸಿ ಡಿಸ್ಟಿಲೇಶನ್‌ನಂತಹ ಇತರ ಶಕ್ತಿಶಾಲಿ ತರಬೇತಿ ತಂತ್ರಗಳನ್ನೂ ಬಳಸಬಹುದು.

ಫೈನ್-ಟ್ಯೂನಿಂಗ್‌ನ ಮಿತಿ

ಫೈನ್-ಟ್ಯೂನಿಂಗ್‌ಗೆ ಸಾಮಾನ್ಯವಾಗಿ ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ದತ್ತಾಂಶ ಬೇಕಾಗುತ್ತದೆ. ಈ Qwen3-0.6B ವರ್ಗೀಕಾರಕದ ಫೈನ್-ಟ್ಯೂನಿಂಗ್‌ಗೆ ಬಳಸಿದ ದತ್ತಾಂಶಸಂಗ್ರಹವನ್ನು ಮಾನವ ಮಾಡರೇಟರ್‌ಗಳು ಕೈಯಾರೆ ಲೇಬಲ್ ಮಾಡಿದ್ದರು. ಆದ್ದರಿಂದ ಅದು ಶುದ್ಧ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹ ಸತ್ಯಮೂಲವಾಗಿತ್ತು.

ಅನೇಕ ಯೋಜನೆಗಳ ಆರಂಭದಲ್ಲಿ ಇಂತಹ ಸಮೃದ್ಧ ದತ್ತಾಂಶದ ಅನುಕೂಲ ಇರುವುದಿಲ್ಲ. ಆದ್ದರಿಂದ, ಪರಿಹಾರದ ಅಭಿವೃದ್ಧಿ ಚಕ್ರದಲ್ಲಿ ನಂತರ ಕೈಗೊಳ್ಳಬಹುದಾದ ಆಪ್ಟಿಮೈಸೇಶನ್ ಆಗಿ ನಾವು ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಅನ್ನು ಪರಿಗಣಿಸುತ್ತೇವೆ. ಪರಿಹಾರದ ಸ್ವರೂಪ ಸ್ಥಿರಗೊಂಡು, ನೈಜ ಬಳಕೆದಾರರ ಸ್ವಲ್ಪ ದತ್ತಾಂಶ ಸಂಗ್ರಹವಾದ ಬಳಿಕ, ಡೆವಲಪರ್‌ಗಳು ತಮ್ಮ ಮಾಡರೇಷನ್ ಪರಿಹಾರಗಳನ್ನು ಇನ್ನಷ್ಟು ಸುಧಾರಿಸಲು ಉದ್ದೇಶಿತ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಬಳಸಬಹುದು.

ಅಂತಿಮ ಅನಿಸಿಕೆಗಳು

gpt-oss-safeguard ನಂತಹ ಮೂಲಾಧಾರ ಮಾಡರೇಷನ್ ಮಾಡೆಲ್‌ಗಳು ಶಕ್ತಿಶಾಲಿ ಹೊಸ ನಿರ್ಮಾಣ ಘಟಕಗಳಾಗಿವೆ. ನೈಜ-ಸಮಯದ ಅನ್ವಯಗಳಿಗೆ ವಿಳಂಬವನ್ನು ಕಡಿಮೆ ಮಾಡುವುದರ ಜೊತೆಗೆ, ಮಾಡರೇಷನ್ ವ್ಯವಸ್ಥೆಗಳ ವಿನ್ಯಾಸವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಸರಳಗೊಳಿಸುವ ಸಾಮರ್ಥ್ಯ ಇವುಗಳಿಗಿದೆ. ಇವುಗಳನ್ನು ಸಣ್ಣ, ಅಗತ್ಯಕ್ಕೆ ತಕ್ಕ ವರ್ಗೀಕಾರಕಗಳೊಂದಿಗೆ ಜೋಡಿಸಿದರೆ, ದೊಡ್ಡ ಸಾಮಾನ್ಯ ಮಾಡೆಲ್‌ಗಳನ್ನು ಬಳಸುವ ಪ್ರಾಂಪ್ಟ್-ಆಧಾರಿತ ವಿಧಾನಕ್ಕಿಂತ ಕಡಿಮೆ ಚರ ಭಾಗಗಳಿರುವ, ಹೆಚ್ಚು ಸುರಕ್ಷಿತ ಮತ್ತು ವೇಗವಾದ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸಬಹುದು.

ನೀವು ಇಂದು ಮಾಡರೇಷನ್ ವ್ಯವಸ್ಥೆಯನ್ನು ಸ್ಥಾಪಿಸುತ್ತಿದ್ದರೆ ಅಥವಾ ಉನ್ನತೀಕರಿಸುತ್ತಿದ್ದರೆ, ಮೊದಲು gpt-oss-safeguard ನಂತಹ ಮಾಡೆಲ್‌ಗಳಿಂದ ಆರಂಭಿಸಿ, ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅಳೆಯಿರಿ. ದತ್ತಾಂಶವು ಕೊರತೆಗಳನ್ನು ತೋರಿಸುವಲ್ಲಿ ಅಗತ್ಯಕ್ಕೆ ತಕ್ಕ ವರ್ಗೀಕಾರಕಗಳ ಮೂಲಕ ಪ್ರಾಂಪ್ಟ್-ಆಧಾರಿತ ಅಥವಾ ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡಿದ ಉದ್ದೇಶಿತ ಸುಧಾರಣೆಗಳನ್ನು ಪರಿಚಯಿಸಿ.

ಇನ್ನಷ್ಟು ತಿಳಿಯಲು ಆಸಕ್ತಿಯಿದೆಯೇ? ನಮಗೆ ಸಂದೇಶ ಕಳುಹಿಸಿ.

ಲೇಖಕ

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke