ਮੁੱਖ ਨੇਵੀਗੇਸ਼ਨ

AI ਸੁਰੱਖਿਆ ਲਈ OpenAI ਦੇ gpt-oss-safeguard ਮਾਡਲਾਂ ਦੇ ਮਾਅਨੇ

OpenAI ਦੇ gpt-oss-safeguard ਮਾਡਲਾਂ ਦਾ ਮੁੱਢਲਾ ਮੁਲਾਂਕਣ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਵਿਸ਼ੇਸ਼ ਸੁਰੱਖਿਆ ਮਾਡਲ ਉਤਪਾਦਨ AI ਸਿਸਟਮਾਂ ਨੂੰ ਕਿੱਥੇ ਮਜ਼ਬੂਤ ਕਰ ਸਕਦੇ ਹਨ.

ਪਿਛਲੇ ਦੋ ਸਾਲਾਂ ਦੌਰਾਨ ਅਸੀਂ ਅਜਿਹੇ ਹੱਲ ਬਣਾਏ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਲੱਖਾਂ ਵਰਤੋਂਕਾਰਾਂ ਤੱਕ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਵਧਾਇਆ ਗਿਆ ਹੈ. ਇਸ ਕੰਮ ਦਾ ਇੱਕ ਮੁੱਖ ਹਿੱਸਾ ਤੇਜ਼ ਅਤੇ ਸਟੀਕ ਮਾਡਰੇਸ਼ਨ ਸਿਸਟਮ ਬਣਾਉਣਾ ਰਿਹਾ ਹੈ. ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਮਾਡਰੇਸ਼ਨ ਕੰਪਨੀਆਂ ਨੂੰ ਭਰੋਸੇ ਨਾਲ ਅਤਿ-ਆਧੁਨਿਕ AI ਹੱਲ ਲਾਗੂ ਕਰਨ ਦੇ ਯੋਗ ਬਣਾਉਂਦੀ ਹੈ. ਇਹ ਅਣਚਾਹੀ ਸਮੱਗਰੀ ਨੂੰ ਸਮੱਸਿਆ ਬਣਨ ਤੋਂ ਪਹਿਲਾਂ ਪਛਾਣ ਕੇ ਅੰਤਿਮ ਵਰਤੋਂਕਾਰਾਂ ਨੂੰ ਨੁਕਸਾਨ ਤੋਂ ਬਚਾਉਂਦੀ ਅਤੇ ਬ੍ਰਾਂਡ ਦੀ ਸੁਰੱਖਿਆ ਯਕੀਨੀ ਬਣਾਉਂਦੀ ਹੈ.

ਹਾਲ ਹੀ ਵਿੱਚ OpenAI ਨੇ ਆਪਣੇ GPT-OSS-Safeguard ਮਾਡਲ ਜਾਰੀ ਕੀਤੇ. ਇਹ ਇਸੇ ਸਾਲ ਪਹਿਲਾਂ ਪੇਸ਼ ਕੀਤੇ 20B ਅਤੇ 120B OSS ਮਾਡਲਾਂ ਦੇ ਫਾਈਨ-ਟਿਊਨ ਕੀਤੇ ਰੂਪ ਹਨ. ਇਹ ਮਾਡਲ ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਵਰਤੋਂਕਾਰ ਦੀ ਨੀਤੀ ਨੂੰ ਸਿੱਧਾ ਸਮਝ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਸਮੱਗਰੀ ਮਾਡਰੇਸ਼ਨ ਲਈ ਲਚਕਦਾਰ ਅਤੇ ਸ਼ਕਤੀਸ਼ਾਲੀ ਪਹੁੰਚ ਮਿਲਦੀ ਹੈ. ਇਹ ਮਾਡਲ ਖੋਜ ਝਲਕ ਦੇ ਪੜਾਅ ਵਿੱਚ ਹਨ, ਇਸ ਲਈ ਸਮੇਂ ਦੇ ਨਾਲ ਇਨ੍ਹਾਂ ਵਿੱਚ ਹੋਰ ਸੁਧਾਰ ਹੋਣਾ ਨਿਸ਼ਚਿਤ ਹੈ.

ਅਸੀਂ ਇਸ ਰਿਲੀਜ਼ ਤੋਂ ਪਹਿਲਾਂ OpenAI ਨਾਲ ਮਿਲ ਕੇ ਕੰਮ ਕੀਤਾ ਅਤੇ ਮਾਡਲ ਦੇ ਵਿਕਾਸ ਲਈ ਅਸਲ ਸਥਿਤੀਆਂ ਵਿੱਚ ਮੁਲਾਂਕਣ ਕੀਤੇ. ਇਸ ਲੇਖ ਵਿੱਚ ਅਸੀਂ ਉਸ ਸਹਿਯੋਗ ਤੋਂ ਮਿਲੀਆਂ ਸੂਝਾਂ ਸਾਂਝੀਆਂ ਕਰਦੇ ਹਾਂ ਅਤੇ ਵੇਖਦੇ ਹਾਂ ਕਿ ਇਹ ਤਰੱਕੀਆਂ ਉਤਪਾਦਨ AI ਸਿਸਟਮਾਂ ਵਿੱਚ ਮਾਡਰੇਸ਼ਨ ਦੇ ਭਵਿੱਖ ਲਈ ਕੀ ਮਾਅਨੇ ਰੱਖਦੀਆਂ ਹਨ.

ਅੱਜ ਉਤਪਾਦਨ ਵਿੱਚ ਮਾਡਰੇਸ਼ਨ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ?

ਅੱਜ ਮਾਡਰੇਸ਼ਨ ਹੱਲ ਆਮ ਤੌਰ ਉੱਤੇ ਐਪਲੀਕੇਸ਼ਨ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਸੁਰੱਖਿਆ ਦੀਆਂ ਪਰਤਾਂ ਵਜੋਂ ਬਣਾਏ ਜਾਂਦੇ ਹਨ. ਅਸੀਂ ਵੱਡੇ ਪੱਧਰ ਉੱਤੇ ਜਨਤਕ ਵਰਤੋਂ ਲਈ ਕੀਤੀਆਂ ਤੈਨਾਤੀਆਂ ਵਿੱਚ ਇਹ ਤਰੀਕਾ ਬਹੁਤ ਵਰਤਦੇ ਹਾਂ. ਵਿਸਥਾਰ ਨਾਲ ਜਾਣਨ ਲਈ ਇਸ ਵਿਸ਼ੇ ਬਾਰੇ ਸਾਡਾ ਬਲੌਗ ਇੱਥੇ ਪੜ੍ਹੋ.

  1. ਇਨਪੁੱਟਾਂ ਨੂੰ ਸਮਾਂਤਰ ਵਰਗੀਕ੍ਰਿਤ ਕਰੋ, ਮਾੜੇ ਪ੍ਰੌਂਪਟ ਅੰਦਰ ਨਾ ਆਉਣ ਦਿਓ: ਛੋਟੇ, ਵਿਸ਼ਾ-ਵਿਸ਼ੇਸ਼ ਕਲਾਸੀਫਾਇਰ ਹਰ ਵਰਤੋਂਕਾਰ ਸੁਨੇਹੇ ਨੂੰ ਲੇਬਲ ਕਰਨ ਲਈ ਇੱਕੋ ਸਮੇਂ ਚੱਲਦੇ ਹਨ. ਅਸੀਂ ਵੇਖਿਆ ਹੈ ਕਿ ਸੀਮਤ ਵਿਸ਼ੇ ਉੱਤੇ ਕੇਂਦਰਿਤ ਕਲਾਸੀਫਾਇਰ ਇੱਕੋ ਸਰਬ-ਉਦੇਸ਼ੀ ਕਲਾਸੀਫਾਇਰ ਨਾਲੋਂ ਮਾਪਣਯੋਗ ਤੌਰ ਉੱਤੇ ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਹੁੰਦੇ ਹਨ. ਪ੍ਰੌਂਪਟ ਵਿੱਚ ਧਿਆਨ ਨਾਲ ਚੁਣੀਆਂ ਫਿਊ-ਸ਼ਾਟ ਉਦਾਹਰਨਾਂ, “ਇਹ ਮੁੱਖ ਦੁਸ਼ਮਣ ਮੈਨੂੰ ਵਾਰ-ਵਾਰ ਮਾਰ ਰਿਹਾ ਹੈ” (ਗੇਮ ਦਾ ਸੰਦਰਭ, ਪੂਰੀ ਤਰ੍ਹਾਂ ਨੁਕਸਾਨ ਰਹਿਤ) ਅਤੇ ਅਸਲ ਦੁਨੀਆ ਦੇ ਨੁਕਸਾਨ ਦੇ ਸੰਕੇਤ ਵਿਚਕਾਰ ਫ਼ਰਕ ਪਛਾਣਨ ਵਿੱਚ ਮਦਦ ਕਰ ਸਕਦੀਆਂ ਹਨ.

    • ਸੁਰੱਖਿਅਤ → ਆਮ ਤਰੀਕੇ ਨਾਲ ਜਵਾਬ ਬਣਾਓ

    • ਜੇਲ੍ਹਬ੍ਰੇਕ → ਅਣਡਿੱਠਾ ਕਰੋ ਜਾਂ ਬ੍ਰਾਂਡ ਅਨੁਕੂਲ ਇਨਕਾਰ ਨਾਲ ਟਾਲੋ

    • ਸੁਰੱਖਿਆ ਜਾਂ ਤੰਦਰੁਸਤੀ ਦੇ ਜੋਖਮ → ਪੂਰੇ ਸੰਦਰਭ ਸਮੇਤ ਮਨੁੱਖ ਕੋਲ ਭੇਜੋ

  2. ਆਉਟਪੁੱਟਾਂ ਨੂੰ ਵਰਗੀਕ੍ਰਿਤ ਕਰੋ, ਮਾੜਾ ਜਵਾਬ ਨਾ ਭੇਜੋ: ਹਰ ਸੰਭਾਵੀ ਜਵਾਬ ਨੂੰ ਭੇਜਣ ਤੋਂ ਪਹਿਲਾਂ ਮੁੜ ਜਾਂਚਿਆ ਜਾਂਦਾ ਹੈ. ਇਹ ਮਾਡਲ ਦੇ ਭਟਕਾਅ, RAG ਡਾਟੇ ਵਿੱਚ ਜ਼ਹਿਰ ਮਿਲਾਉਣ ਅਤੇ ਨੀਤੀ ਦੇ ਸੂਖਮ ਅਸਧਾਰਨ ਮਾਮਲਿਆਂ ਤੋਂ ਬਚਾਉਂਦਾ ਹੈ, ਜਿਵੇਂ ਹਾਨੀਕਾਰਕ ਸਮੱਗਰੀ, PII ਦਾ ਪਰਦਾਫਾਸ਼ ਜਾਂ ਸੰਵੇਦਨਸ਼ੀਲ ਜਾਣਕਾਰੀ ਲੀਕ ਹੋਣਾ. ਨਿਸ਼ਾਨਬੱਧ ਹੋਣ ਉੱਤੇ ਅਸੀਂ LLM ਦੁਆਰਾ ਬਣਾਏ ਜਵਾਬ ਦੀ ਥਾਂ ਸੁਰੱਖਿਅਤ, ਬ੍ਰਾਂਡ ਅਨੁਕੂਲ ਸੁਨੇਹਾ ਦਿੰਦੇ ਹਾਂ ਜਾਂ ਉਸ ਨੂੰ ਮਨੁੱਖ ਕੋਲ ਭੇਜਦੇ ਹਾਂ, ਨਾ ਕਿ ਅਜਿਹਾ ਕੁਝ ਭੇਜੀਏ ਜਿਸ ਉੱਤੇ ਬਾਅਦ ਵਿੱਚ ਪਛਤਾਉਣਾ ਪਵੇ.

  3. ਇਸ ਨੂੰ ਤੇਜ਼ ਅਤੇ ਕਿਫ਼ਾਇਤੀ ਬਣਾਓ: ਪ੍ਰੌਂਪਟਾਂ ਨੂੰ ਮੁੜ ਵਰਤੇ ਜਾ ਸਕਣ ਵਾਲੇ ਨਿਰਮਾਣ-ਅੰਗਾਂ ਵਜੋਂ ਬਣਾਉਣ ਨਾਲ ਤੁਸੀਂ ਪ੍ਰੌਂਪਟ ਦੇ ਹਿੱਸੇ, ਕਲਾਸੀਫਾਇਰ ਦੀਆਂ ਫਿਊ-ਸ਼ਾਟ ਉਦਾਹਰਨਾਂ ਅਤੇ ਆਮ ਸੰਵਾਦੀ ਅਗੇਤਰ ਕੈਸ਼ ਕਰ ਸਕਦੇ ਹੋ. ਇਹ ਤਰੀਕਾ ਤੁਹਾਡੇ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਦੇਰੀ ਅਤੇ ਲਾਗਤ ਦੋਵਾਂ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ.

  4. ਸੁਰੱਖਿਆ ਨੂੰ ਉਤਪਾਦ ਦੇ ਅਨੁਭਵ ਦਾ ਹਿੱਸਾ ਮੰਨੋਇਨਕਾਰ ਅਤੇ ਚਿਤਾਵਨੀਆਂ ਢੁਕਵੀਂ ਸ਼ੈਲੀ ਵਿੱਚ ਲਿਖੀਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਜਿਵੇਂ ਗੇਮਾਂ ਲਈ ਖੇਡ-ਭਰਪੂਰ ਅਤੇ ਵਿੱਤ ਲਈ ਰਸਮੀ. ਜਦੋਂ ਵਰਤੋਂਕਾਰ ਅਨੁਭਵ ਉਸਦੇ ਇਰਾਦੇ ਦਾ ਆਦਰ ਕਰਦਾ ਹੈ, ਤਾਂ ਸੁਰੱਖਿਆ ਉਪਾਵਾਂ ਦੀ ਸਵੀਕਾਰਤਾ ਵਧਦੀ ਅਤੇ ਜੇਲ੍ਹਬ੍ਰੇਕ ਕੋਸ਼ਿਸ਼ਾਂ ਘਟਦੀਆਂ ਹਨ.

  5. ਨਿਗਰਾਨੀ ਕਰੋ, ਰੈਡ ਟੀਮਿੰਗ ਕਰੋ ਅਤੇ ਚੱਕਰ ਪੂਰਾ ਕਰੋਨਿਰੰਤਰ ਰੈਡ ਟੀਮਿੰਗ ਅਤੇ ਸਿੱਧੇ ਸੁਰੱਖਿਆ ਡੈਸ਼ਬੋਰਡ ਗਿਰਾਵਟਾਂ ਨੂੰ ਵਰਤੋਂਕਾਰਾਂ ਤੱਕ ਪਹੁੰਚਣ ਤੋਂ ਪਹਿਲਾਂ ਪਛਾਣਨ ਵਿੱਚ ਮਦਦ ਕਰਦੇ ਹਨ. ਵਾਧੂ ਫਿਊ-ਸ਼ਾਟ ਉਦਾਹਰਨਾਂ ਜਾਂ ਰੂਟਿੰਗ ਨਿਯਮ ਦੇ ਕੇ ਅਸੀਂ ਮਾਡਲ ਨੂੰ ਕਿਸੇ ਵੀ ਨਵੇਂ ਹਮਲੇ ਦੇ ਢੰਗ ਬਾਰੇ ਸਿਖਾ ਸਕਦੇ ਹਾਂ. ਇਸ ਨਾਲ ਐਪਲੀਕੇਸ਼ਨ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਪ੍ਰਭਾਵਿਤ ਕੀਤੇ ਬਿਨਾਂ ਸਿਸਟਮ ਨੂੰ ਸਮੇਂ ਦੇ ਨਾਲ ਤੋੜਨਾ ਹੋਰ ਔਖਾ ਹੋ ਜਾਂਦਾ ਹੈ.

ਅੱਜ ਮਾਡਰੇਸ਼ਨ ਹੱਲ ਬਣਾਉਣ ਦੀਆਂ ਚੁਣੌਤੀਆਂ

ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਸੁਰੱਖਿਆ ਉਪਾਅ ਬਣਾਉਣਾ ਅਤੇ ਕਾਇਮ ਰੱਖਣਾ ਔਖਾ ਹੈ.

ਅਮਲ ਵਿੱਚ ਸਪਸ਼ਟ ਨੀਤੀ ਬਣਾਉਣ ਲਈ ਮੁੱਖ ਕਾਰੋਬਾਰੀ ਹਿੱਸੇਦਾਰਾਂ ਅਤੇ ਵਿਕਾਸਕਾਰਾਂ ਵਿਚਕਾਰ ਧਿਆਨਪੂਰਵਕ ਸਹਿਯੋਗ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ. ਨੀਤੀ ਨਿਰਧਾਰਤ ਹੋਣ ਮਗਰੋਂ ਸਿਸਟਮ ਦਾ ਡਿਜ਼ਾਈਨ ਅਤੇ ਵਿਹਾਰ ਬਣਾਉਣਾ ਤੇ ਟਿਊਨ ਕਰਨਾ ਪੈਂਦਾ ਹੈ.

gpt-oss-safeguard ਵਰਗੇ ਖੁੱਲ੍ਹੇ ਸੁਰੱਖਿਆ ਰੀਜ਼ਨਿੰਗ ਮਾਡਲ ਇਸ ਪ੍ਰਕਿਰਿਆ ਦੀਆਂ ਕੁਝ ਮੁਸ਼ਕਲਾਂ ਦੂਰ ਕਰ ਸਕਦੇ ਹਨ ਅਤੇ ਸਮੱਗਰੀ ਮਾਡਰੇਸ਼ਨ ਲਈ ਵਰਤੋਂ-ਵਾਸਤੇ ਵਧੇਰੇ ਤਿਆਰ ਤੇ ਬਹੁਪੱਖੀ ਬੁਨਿਆਦ ਦੇ ਸਕਦੇ ਹਨ.

ਵਿਸ਼ੇਸ਼ ਸੁਰੱਖਿਆ ਮਾਡਲਾਂ ਦੀ ਸੰਭਾਵਨਾ

Gpt-oss-safeguard ਦਾ ਉਦੇਸ਼ ਅੱਜ ਦੇ ਮਾਡਰੇਸ਼ਨ ਸਿਸਟਮ ਬਣਾਉਣ ਸਮੇਂ ਆਉਣ ਵਾਲੀਆਂ ਕੁਝ ਆਮ ਚੁਣੌਤੀਆਂ ਨੂੰ ਹੱਲ ਕਰਨਾ ਹੈ. ਇਨ੍ਹਾਂ ਛੋਟੇ, ਵਿਸ਼ੇਸ਼ ਮਾਡਲਾਂ ਨੂੰ ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਟੀਚਾ ਨੀਤੀ ਉੱਤੇ ਰੀਜ਼ਨਿੰਗ ਕਰਨ ਲਈ ਫਾਈਨ-ਟਿਊਨ ਕੀਤਾ ਗਿਆ ਹੈ. ਇਹ ਜੇਲ੍ਹਬ੍ਰੇਕ, PII ਦੇ ਪਰਦਾਫਾਸ਼ ਅਤੇ ਹੋਰ ਨੀਤੀ ਉਲੰਘਣਾਵਾਂ ਵਰਗੀ ਹਾਨੀਕਾਰਕ ਜਾਂ ਸੰਵੇਦਨਸ਼ੀਲ ਸਮੱਗਰੀ ਲੱਭਦੇ ਹਨ.

ਵਰਗੀਕਰਨ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ ਰੀਜ਼ਨਿੰਗ ਸ਼ਾਮਲ ਕਰਕੇ ਇਹ ਵਧੇਰੇ ਸਟੀਕ ਅਤੇ ਮਜ਼ਬੂਤ ਮਾਡਰੇਸ਼ਨ ਦਿੰਦੇ ਹਨ, ਜਿਸ ਨੂੰ ਚਕਮਾ ਦੇਣਾ ਔਖਾ ਹੁੰਦਾ ਹੈ. GPT-OSS 20B ਅਤੇ 120B ਦੇ ਵਿਸ਼ੇਸ਼ ਸੁਰੱਖਿਆ ਰੂਪਾਂ ਵਜੋਂ ਇਹ ਕਸਟਮ ਨੀਤੀ ਪਰਿਭਾਸ਼ਾਵਾਂ ਰਾਹੀਂ ਬਹੁਤ ਘੱਟ ਸੈੱਟਅੱਪ ਲੋੜਾਂ ਨਾਲ ਅਤਿ-ਆਧੁਨਿਕ ਸੁਰੱਖਿਆ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦੇ ਹਨ.

ਅਸੀਂ ਕੀ ਜਾਂਚਿਆ

ਅਸੀਂ gpt-oss-safeguard 20B ਅਤੇ 120B ਨੂੰ ਉਤਪਾਦਨ ਵਰਗੇ ਕਈ ਕੰਮਾਂ ਉੱਤੇ ਪਰਖਿਆ: ਤਤਕਾਲ ਵੌਇਸ ਸਹਾਇਕ, ਗੇਮ ਅੰਦਰ ਖਿਡਾਰੀ-ਸਹਾਇਤਾ ਬੌਟ, ਸਰਗਰਮ ਚੈਟ ਮਾਡਰੇਸ਼ਨ ਸਿਸਟਮ ਅਤੇ ਬਹੁਭਾਸ਼ੀ ਹਾਨੀਕਾਰਕਤਾ ਜਾਂਚ, ਜਿਸ ਵਿੱਚ ਸਪੇਨੀ, ਫਰਾਂਸੀਸੀ, ਇਤਾਲਵੀ, ਪੁਰਤਗਾਲੀ, ਰੂਸੀ ਅਤੇ ਤੁਰਕੀ ਸ਼ਾਮਲ ਸਨ.

ਸਾਨੂੰ ਕੀ ਮਿਲਿਆ

  • ਦੇਰੀ-ਸੰਵੇਦਨਸ਼ੀਲ ਵੌਇਸ ਮਾਡਰੇਸ਼ਨ: ਸਾਡੇ ਤਤਕਾਲ ਵੌਇਸ ਟੈਸਟਾਂ ਵਿੱਚ, ਜਿੱਥੇ ਗੱਲਬਾਤ ਦੌਰਾਨ ਜਵਾਬ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਤਰਜੀਹ ਤੈਅ ਕਰਨੀ ਹੁੰਦੀ ਹੈ, gpt-oss-safeguard-20B ਨੇ GPT-OSS-20B ਅਤੇ GPT-5-Mini ਵਿਚਕਾਰ ਸ਼ੁੱਧਤਾ ਦਾ ਲਗਭਗ 80% ਪਾੜਾ ਪੂਰਾ ਕੀਤਾ. ਇਸ ਦਾ ਸਕੋਰ 0.45 ਤੋਂ ਵਧ ਕੇ 0.71 ਹੋਇਆ, ਜਦਕਿ GPT-5-Mini ਦਾ 0.78 ਸੀ, ਅਤੇ ਦੇਰੀ ਕਾਫ਼ੀ ਘੱਟ ਰਹੀ.

  • ਖਿਡਾਰੀ ਸਹਾਇਤਾ ਨੂੰ ਅੱਗੇ ਭੇਜਣਾ: ਖਿਡਾਰੀ-ਸਹਾਇਤਾ ਦੀ ਤਰਜੀਹ ਤੈਅ ਕਰਨ ਵਿੱਚ gpt-oss-safeguard-20B ਨੇ GPT-OSS-20b ਅਤੇ GPT-5-Mini ਵਿਚਕਾਰ ਲਗਭਗ 90% ਪਾੜਾ ਪੂਰਾ ਕੀਤਾ. ਇਸ ਦਾ ਸਕੋਰ 0.57 ਤੋਂ ਵਧ ਕੇ 0.66 ਹੋਇਆ, ਜਦਕਿ GPT-5-Mini ਦਾ 0.67 ਸੀ. ਇਸ ਨੇ ਸਮੂਹ ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ ਮੈਕਰੋ ਸਟੀਕਤਾ, ਨੁਕਸਾਨ ਰਹਿਤ ਸਮੱਗਰੀ ਉੱਤੇ 88% ਰੀਕਾਲ ਅਤੇ ਕਮਜ਼ੋਰ ਵਰਤੋਂਕਾਰਾਂ ਦੀ ਪਛਾਣ ਵਿੱਚ 87% ਸਟੀਕਤਾ ਵੀ ਦਿੱਤੀ. ਇਹ ਉਦੋਂ ਲਾਭਦਾਇਕ ਹੈ ਜਦੋਂ ਮਨੁੱਖੀ ਸਮੀਖਿਅਕਾਂ ਉੱਤੇ ਬੋਝ ਪਾਏ ਬਿਨਾਂ ਸਾਵਧਾਨ ਅਤੇ ਬਹੁਤ ਭਰੋਸੇਯੋਗ ਮਾਮਲੇ ਅੱਗੇ ਭੇਜਣੇ ਹੋਣ.

  • ਵੱਡੇ ਪੱਧਰ ਉੱਤੇ ਨੀਤੀ-ਭਰਪੂਰ ਚੈਟ ਮਾਡਰੇਸ਼ਨ: ਸਾਡੇ ਸਭ ਤੋਂ ਔਖੇ ਮੁਲਾਂਕਣ ਵਿੱਚ, ਜਿੱਥੇ ਵਿਸਤ੍ਰਿਤ ਨੀਤੀ ਦਸਤਾਵੇਜ਼ ਮੁਤਾਬਕ ਗੇਮ ਅੰਦਰਲੇ ਸੁਨੇਹੇ ਸਰਗਰਮੀ ਨਾਲ ਨਿਸ਼ਾਨਬੱਧ ਕਰਨੇ ਸਨ, gpt-oss-safeguard ਨੇ OSS ਬੇਸਲਾਈਨ ਨੂੰ ਸਪਸ਼ਟ ਫ਼ਰਕ ਨਾਲ ਪਿੱਛੇ ਛੱਡਿਆ. ਇਸ ਨੇ ਲਗਭਗ 35% ਸਾਪੇਖ ਵਾਧਾ ਹਾਸਲ ਕੀਤਾ ਅਤੇ ਲੰਬੀਆਂ ਨੀਤੀਆਂ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਸੰਭਾਲਿਆ. ਇਹ ਖ਼ਾਸ ਤੌਰ ਉੱਤੇ ਸੰਵੇਦਨਸ਼ੀਲ ਵਰਤੋਂ ਹੈ, ਜਿਸ ਲਈ ਉੱਚ ਰੀਕਾਲ ਅਤੇ ਸਟੀਕਤਾ ਲੋੜੀਂਦੀ ਹੈ. ਰੀਕਾਲ ਬਹੁਤ ਘੱਟ ਹੋਵੇ ਤਾਂ ਕਈ ਹਾਨੀਕਾਰਕ ਸੁਨੇਹੇ ਪਛਾਣੇ ਨਹੀਂ ਜਾਣਗੇ. ਘੱਟ ਸਟੀਕਤਾ ਕਾਰਨ ਬਹੁਤ ਸਾਰੇ ਗੈਰ-ਸੰਬੰਧਿਤ ਸੁਨੇਹੇ ਮਨੁੱਖੀ ਮਾਡਰੇਟਰਾਂ ਲਈ ਨਿਸ਼ਾਨਬੱਧ ਹੋਣਗੇ, ਜਿਸ ਨਾਲ ਅਸਲ ਵਿੱਚ ਔਖੇ ਮਾਮਲਿਆਂ ਤੋਂ ਉਨ੍ਹਾਂ ਦਾ ਧਿਆਨ ਹਟੇਗਾ.

  • ਬਹੁਭਾਸ਼ੀ ਕਾਰਗੁਜ਼ਾਰੀ: ਛੇ ਭਾਸ਼ਾਵਾਂ ਦੇ ਸੰਤੁਲਿਤ ਹਾਨੀਕਾਰਕਤਾ ਡਾਟਾਸੈੱਟ ਉੱਤੇ gpt-oss-safeguard ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ GPT-5-Mini ਦੇ ਨੇੜੇ ਰਹੀ. ਸ਼ੁੱਧਤਾ ਵਿੱਚ ਆਮ ਤੌਰ ਉੱਤੇ ਸਿਰਫ਼ 3-5 ਪ੍ਰਤੀਸ਼ਤ ਅੰਕਾਂ ਦਾ ਫ਼ਰਕ ਸੀ ਅਤੇ ਸਪੇਨੀ ਵਿੱਚ gpt-oss-safeguard-120B ਥੋੜ੍ਹਾ ਅੱਗੇ ਰਿਹਾ. ਤੁਰਕੀ ਵਰਗੀਆਂ ਘੱਟ ਸਰੋਤਾਂ ਵਾਲੀਆਂ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਅਸੀਂ ਕੁਝ ਵੱਡੇ ਪਾੜੇ ਵੇਖੇ, ਪਰ ਸਮੁੱਚੇ ਤੌਰ ਉੱਤੇ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਕਾਰਗੁਜ਼ਾਰੀ ਮਜ਼ਬੂਤ ਰਹੀ ਅਤੇ 20B ਤੋਂ 120B ਉੱਤੇ ਜਾਣ ਨਾਲ ਰੀਕਾਲ ਵਿੱਚ ਲਗਾਤਾਰ ਵਾਧਾ ਹੋਇਆ.

ਅਸੀਂ ਇਹ ਵੀ ਵੇਖਿਆ ਕਿ gpt-oss-safeguard ਮਾਡਲ ਉਨ੍ਹਾਂ ਖੇਤਰਾਂ ਵਿੱਚ ਮਜ਼ਬੂਤ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੰਦੇ ਹਨ ਜਿੱਥੇ LLM ਰਵਾਇਤੀ ਤੌਰ ਉੱਤੇ ਮਾਡਰੇਸ਼ਨ ਵਿੱਚ ਕਮਜ਼ੋਰ ਹੁੰਦੇ ਹਨ, ਜਿਵੇਂ PII ਡਾਟਾ. ਮੁੱਖਧਾਰਾ ਮਾਡਲ ਅਮਰੀਕੀ ਰੂਪ ਵਾਲੇ PII ਡਾਟੇ ਨੂੰ ਪਛਾਣਨ ਵੱਲ ਵੱਧ ਝੁਕਾਅ ਰੱਖਦੇ ਹਨ ਅਤੇ ਹੋਰ ਖੇਤਰਾਂ ਵਿੱਚ ਕਮਜ਼ੋਰ ਰਹਿੰਦੇ ਹਨ. ਇਸ ਆਧਾਰ ਉੱਤੇ ਸਾਡਾ ਮੰਨਣਾ ਹੈ ਕਿ gpt-oss-safeguard ਮਾਡਰੇਸ਼ਨ ਸੈੱਟਅੱਪਾਂ ਨੂੰ ਸਰਲ ਬਣਾਉਣ ਵਿੱਚ ਲਾਭਦਾਇਕ ਹੋਵੇਗਾ. ਇਹ ਨੀਤੀਆਂ ਦੀਆਂ ਛੋਟੀਆਂ ਉਲੰਘਣਾਵਾਂ ਪਛਾਣਨ ਲਈ ਲੋੜ ਮੁਤਾਬਕ ਬਣਾਏ ਸੰਦਾਂ ਉੱਤੇ ਨਿਰਭਰਤਾ ਘਟਾਏਗਾ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਵਿਆਪਕ LLM ਨਹੀਂ ਸੰਭਾਲ ਸਕਦੇ.

ਟੀਚਾਬੱਧ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਦੀ ਸਮਰੱਥਾ

ਸਾਡੇ ਮੁਲਾਂਕਣਾਂ ਨੇ ਸਾਬਤ ਕੀਤਾ ਹੈ ਕਿ gpt-oss-safeguard-20B ਅਤੇ gpt-oss-safeguard-120B ਵਰਗੇ ‘ਬੁਨਿਆਦੀ ਮਾਡਰੇਸ਼ਨ ਮਾਡਲ’ ਤੁਹਾਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਕਾਫ਼ੀ ਅੱਗੇ ਲੈ ਜਾ ਸਕਦੇ ਹਨ. ਪਰ ਜਦੋਂ ਸਿਸਟਮਾਂ ਲਈ ਸੁਰੱਖਿਆ ਅਤੇ ਵਿਸ਼ੇਸ਼ਤਾ ਦੇ ਸਭ ਤੋਂ ਉੱਚੇ ਮਿਆਰ ਲੋੜੀਂਦੇ ਹੋਣ, ਤਾਂ ਡੋਮੇਨ-ਵਿਸ਼ੇਸ਼ ਫਾਈਨ-ਟਿਊਨ ਕੀਤੇ ਮਾਡਲ ਅਜੇ ਵੀ ਸਰਵੋਤਮ ਮਿਆਰ ਤੈਅ ਕਰਦੇ ਹਨ.

ਟੀਚਾਬੱਧ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਦੀ ਸਮਰੱਥਾ ਦਰਸਾਉਂਦਾ ਸਕ੍ਰੀਨਸ਼ਾਟ.

ਗੇਮ ਅੰਦਰ ਮਾਡਰੇਸ਼ਨ ਲਈ ਅਸੀਂ ਲਗਭਗ 10 ਹਜ਼ਾਰ ਪੁਰਾਣੀਆਂ ਮਾਡਰੇਟਰ ਕਾਰਵਾਈਆਂ ਅਤੇ ਨੀਤੀਗਤ ਨਤੀਜਿਆਂ ਉੱਤੇ ਸੁਪਰਵਾਈਜ਼ਡ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਰਾਹੀਂ Qwen3-0.6B ਕਲਾਸੀਫਾਇਰ ਨੂੰ ਫਾਈਨ-ਟਿਊਨ ਕੀਤਾ. ਇਹ ਮਾਡਲ ਇਸ ਕੰਮ ਲਈ ਜਾਂਚੇ ਗਏ ਹਰ ਬੇਸ ਮਾਡਲ ਨਾਲੋਂ ਕਾਫ਼ੀ ਬਿਹਤਰ ਹੈ. ਇਸ ਨੇ 15% ਦੇ ਮੁਕਾਬਲੇ 57% ਸ਼ੁੱਧਤਾ ਹਾਸਲ ਕੀਤੀ (gpt-oss-safeguard-120B, GPT-4.1-nano ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੇ ਅਨੁਪਾਤ ਤੋਂ ਅਨੁਮਾਨਿਤ), ਯਾਨੀ 42 ਅੰਕ ਜਾਂ ਲਗਭਗ 280% ਵਾਧਾ. ਇਹ ਨਤੀਜੇ OpenAI ਦੇ ਇਸ ਮਾਰਗਦਰਸ਼ਨ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ ਕਿ ਲੇਬਲ ਕੀਤੀਆਂ ਉਦਾਹਰਨਾਂ ਉੱਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਛੋਟੇ, ਸਮਰਪਿਤ ਕਲਾਸੀਫਾਇਰ ਵਿਸ਼ੇਸ਼ ਡੋਮੇਨਾਂ ਵਿੱਚ ਸੁਰੱਖਿਆ ਮਾਡਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਹੋ ਸਕਦੇ ਹਨ.

ਸਿੱਟਾ ਸਪਸ਼ਟ ਹੈ: ਜਦੋਂ ਨੀਤੀਆਂ ਗੁੰਝਲਦਾਰ ਹੋਣ ਅਤੇ ਉਨ੍ਹਾਂ ਵਿੱਚ ਬਹੁਤ ਸਾਰੇ ਅਸਧਾਰਨ ਮਾਮਲੇ ਹੋਣ, ਤਾਂ ਛੋਟਾ, ਡੋਮੇਨ ਅਨੁਸਾਰ ਟਿਊਨ ਕੀਤਾ ਮਾਡਲ ਹੀ ਸਰਵੋਤਮ ਮਿਆਰ ਰਹਿੰਦਾ ਹੈ. ਫਾਈਨ-ਟਿਊਨਿੰਗ ਤੁਹਾਡੀ ਨੀਤੀ ਅਤੇ ਅਸਧਾਰਨ ਮਾਮਲਿਆਂ ਨੂੰ ਸਿੱਧਾ ਪੈਰਾਮੀਟਰਾਂ ਵਿੱਚ ਸਮੇਟ ਦਿੰਦੀ ਹੈ. ਇਸ ਨਾਲ ਅਸਲ ਉਤਪਾਦਨ ਦੀਆਂ ਉਲਝੀਆਂ ਸਥਿਤੀਆਂ ਵਿੱਚ ਵਿਹਾਰ ਵਧੇਰੇ ਸਥਿਰ ਰਹਿੰਦਾ ਹੈ ਅਤੇ ਦੇਰੀ ਤੇ ਲਾਗਤ ਵੀ ਬਹੁਤ ਘੱਟ ਹੁੰਦੀ ਹੈ.

ਇਸ ਲਈ ਸੁਪਰਵਾਈਜ਼ਡ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਕਈ ਸੰਭਾਵੀ ਤਰੀਕਿਆਂ ਵਿੱਚੋਂ ਸਿਰਫ਼ ਇੱਕ ਹੈ. ਮਾਡਲ ਦੇ ਵਿਹਾਰ ਨੂੰ ਹੋਰ ਅਨੁਕੂਲ ਬਣਾਉਣ ਲਈ ਰੀਇਨਫੋਰਸਮੈਂਟ ਲਰਨਿੰਗ ਜਾਂ ਆਨ-ਪਾਲਿਸੀ ਡਿਸਟਿਲੇਸ਼ਨ ਵਰਗੀਆਂ ਹੋਰ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਿਖਲਾਈ ਤਕਨੀਕਾਂ ਵੀ ਵਰਤੀਆਂ ਜਾ ਸਕਦੀਆਂ ਹਨ.

ਫਾਈਨ-ਟਿਊਨਿੰਗ ਦੀ ਸੀਮਾ

ਫਾਈਨ-ਟਿਊਨਿੰਗ ਲਈ ਆਮ ਤੌਰ ਉੱਤੇ ਬਹੁਤ ਸਾਰੇ ਡਾਟੇ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ. ਇਸ Qwen3-0.6B ਕਲਾਸੀਫਾਇਰ ਦੀ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਲਈ ਵਰਤੇ ਡਾਟਾਸੈੱਟ ਨੂੰ ਮਨੁੱਖੀ ਮਾਡਰੇਟਰਾਂ ਨੇ ਹੱਥੀਂ ਲੇਬਲ ਕੀਤਾ ਸੀ, ਇਸ ਲਈ ਇਹ ਸਹੀ ਜਾਣਕਾਰੀ ਦਾ ਸਾਫ਼ ਅਤੇ ਭਰੋਸੇਯੋਗ ਸਰੋਤ ਸੀ.

ਕਈ ਪ੍ਰੋਜੈਕਟਾਂ ਦੀ ਸ਼ੁਰੂਆਤ ਵਿੱਚ ਇੰਨਾ ਸਮ੍ਰਿੱਧ ਡਾਟਾ ਉਪਲਬਧ ਨਹੀਂ ਹੁੰਦਾ. ਇਸ ਲਈ ਅਸੀਂ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਨੂੰ ਅਜਿਹਾ ਸੁਧਾਰ ਮੰਨਦੇ ਹਾਂ ਜੋ ਹੱਲ ਦੇ ਵਿਕਾਸ-ਚੱਕਰ ਵਿੱਚ ਬਾਅਦ ਵਿੱਚ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ. ਹੱਲ ਦਾ ਰੂਪ ਸਥਿਰ ਹੋਣ ਅਤੇ ਕੁਝ ਅਸਲ ਵਰਤੋਂਕਾਰ ਡਾਟਾ ਇਕੱਠਾ ਹੋਣ ਮਗਰੋਂ, ਵਿਕਾਸਕਾਰ ਆਪਣੇ ਮਾਡਰੇਸ਼ਨ ਹੱਲਾਂ ਨੂੰ ਅਗਲੇ ਪੱਧਰ ਉੱਤੇ ਲਿਜਾਣ ਲਈ ਟੀਚਾਬੱਧ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਅਪਣਾ ਸਕਦੇ ਹਨ.

ਅੰਤਿਮ ਵਿਚਾਰ

gpt-oss-safeguard ਵਰਗੇ ਬੁਨਿਆਦੀ ਮਾਡਰੇਸ਼ਨ ਮਾਡਲ ਨਵੇਂ ਅਤੇ ਮਜ਼ਬੂਤ ਨਿਰਮਾਣ-ਅੰਗ ਹਨ. ਇਹ ਮਾਡਰੇਸ਼ਨ ਸਿਸਟਮਾਂ ਦੇ ਡਿਜ਼ਾਈਨ ਨੂੰ ਕਾਫ਼ੀ ਸਰਲ ਬਣਾ ਸਕਦੇ ਹਨ ਅਤੇ ਤਤਕਾਲ ਐਪਲੀਕੇਸ਼ਨਾਂ ਦੀ ਦੇਰੀ ਘਟਾ ਸਕਦੇ ਹਨ. ਇਨ੍ਹਾਂ ਨੂੰ ਛੋਟੇ, ਲੋੜ ਮੁਤਾਬਕ ਬਣਾਏ ਕਲਾਸੀਫਾਇਰਾਂ ਨਾਲ ਜੋੜ ਕੇ ਤੁਸੀਂ ਵੱਡੇ ਆਮ ਮਾਡਲਾਂ ਵਾਲੀ ਪ੍ਰੌਂਪਟ-ਅਧਾਰਿਤ ਪਹੁੰਚ ਦੇ ਮੁਕਾਬਲੇ ਘੱਟ ਹਿੱਸਿਆਂ ਵਾਲਾ, ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਅਤੇ ਤੇਜ਼ ਸਿਸਟਮ ਬਣਾ ਸਕਦੇ ਹੋ.

ਜੇ ਤੁਸੀਂ ਅੱਜ ਮਾਡਰੇਸ਼ਨ ਸਥਾਪਤ ਜਾਂ ਅੱਪਗ੍ਰੇਡ ਕਰ ਰਹੇ ਹੋ, ਤਾਂ ਪਹਿਲਾਂ gpt-oss-safeguard ਵਰਗੇ ਮਾਡਲ ਅਜ਼ਮਾਓ, ਕਾਰਗੁਜ਼ਾਰੀ ਮਾਪੋ ਅਤੇ ਜਿੱਥੇ ਡਾਟਾ ਕਮੀਆਂ ਦਿਖਾਏ, ਉੱਥੇ ਲੋੜ ਮੁਤਾਬਕ ਬਣਾਏ ਕਲਾਸੀਫਾਇਰਾਂ ਰਾਹੀਂ ਟੀਚਾਬੱਧ ਸੁਧਾਰ ਜੋੜੋ, ਭਾਵੇਂ ਉਹ ਪ੍ਰੌਂਪਟ-ਅਧਾਰਿਤ ਹੋਣ ਜਾਂ ਫਾਈਨ-ਟਿਊਨ ਕੀਤੇ.

ਹੋਰ ਜਾਣਨਾ ਚਾਹੁੰਦੇ ਹੋ? ਸਾਨੂੰ ਸੁਨੇਹਾ ਭੇਜੋ.

ਲੇਖਕ

Douglas Adams, Romain Bourboulou, David Jasek, Atharva Tidke