ਮੁੱਖ ਨੇਵੀਗੇਸ਼ਨ

ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ: ਵਧੇਰੇ ਸੁਰੱਖਿਅਤ ਸਵੈ-ਸੁਧਾਰਕ ਐਂਟਰਪ੍ਰਾਈਜ਼ AI ਵਰਕਫ਼ਲੋ

ਇੱਕ ਅਨੁਸ਼ਾਸਿਤ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਟੀਮਾਂ ਨੂੰ ਲੰਬੇ ਸਮੇਂ ਵਾਲੇ ਕੋਡਿੰਗ ਕਾਰਜਾਂ ਵਿੱਚ ਏਜੰਟ ਵਰਕਫ਼ਲੋਜ਼ ਨੂੰ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਬਿਹਤਰ ਬਣਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ।

ਕਾਰਜਕਾਰੀ ਸਾਰ

  • ਮੌਜੂਦਾ ਸਵੈ-ਸੁਧਾਰ ਪ੍ਰਣਾਲੀਆਂ ਨੇ ਕੋਡਿੰਗ ਕਾਰਜਾਂ ਵਿੱਚ ਮਜ਼ਬੂਤ ਨਤੀਜੇ ਦਿਖਾਏ ਹਨ, ਪਰ ਇਹ ਹਾਲੇ ਸਪਸ਼ਟ ਨਹੀਂ ਹੈ ਕਿ ਕੀ ਉਹ ਗੁੰਝਲਦਾਰ, ਲੰਬੇ ਸਮੇਂ ਵਾਲੇ AI ਵਰਕਫ਼ਲੋਜ਼ ਨੂੰ ਬਿਹਤਰ ਬਣਾ ਸਕਦੀਆਂ ਹਨ, ਜੋ ਅਸਲ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਡਿਪਲੌਇਮੈਂਟ ਵਰਗੇ ਹੁੰਦੇ ਹਨ।

  • ਸਾਡੀ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਰਿਸਰਚ ਏਜੰਟਿਕ ਰੀਟਰੀਵਲ, ਡੀਪ ਰਿਸਰਚ ਅਤੇ ਸਿਗਨਲ ਇੰਟੈਲੀਜੈਂਸ ਵਰਕਫ਼ਲੋਜ਼ ਵਿੱਚ ਸਵੈ-ਸੁਧਾਰ ਨੂੰ ਲਾਗੂ ਕਰਦੀ ਹੈ, ਨਾਲ ਹੀ ਹੋਲਡ-ਆਊਟ ਮੁਲਾਂਕਣ, ਆਡਿਟਯੋਗਤਾ, ਬਜਟ ਕੰਟਰੋਲ ਅਤੇ ਮਨੁੱਖੀ ਮਨਜ਼ੂਰੀ ਵਰਗੀਆਂ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਲੋੜਾਂ ਨੂੰ ਵੀ ਸ਼ਾਮਲ ਕਰਦੀ ਹੈ।

  • ਤਿੰਨ ਪ੍ਰਤੀਨਿਧ ਕੰਮਾਂ ਵਿੱਚ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਨੇ ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ ਵੱਡਾ ਸੁਧਾਰ ਕੀਤਾ। ਇਸ ਵਿੱਚ ਸਿਗਨਲ ਇੰਜਨ ਲਈ ਰਾਖਵੇਂ ਟੈਸਟ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ 84% ਸੁਧਾਰ ਅਤੇ ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਲਈ ਵੱਧ ਸ਼ੁੱਧਤਾ ਨਾਲ 16× ਤੇਜ਼ ਚਲਾਉਣਾ ਸ਼ਾਮਲ ਹੈ।

  • ਬਹੁਤੇ ਪਿਛਲੇ ਤਰੀਕਿਆਂ ਤੋਂ ਉਲਟ, ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਜਿੱਥੇ ਵੀ ਸੰਭਵ ਹੋਵੇ ਰਾਖਵੇਂ ਡਾਟਾਸੈੱਟਾਂ ਉੱਤੇ ਸਫਲਤਾ ਮਾਪਦਾ ਹੈ, ਤਾਂ ਜੋ ਪਤਾ ਲੱਗੇ ਕਿ ਸੁਧਾਰ ਔਪਟੀਮਾਈਜੇਸ਼ਨ ਦੌਰਾਨ ਵਰਤੇ ਡਾਟਾ ਤੋਂ ਅੱਗੇ ਵੀ ਲਾਗੂ ਹੁੰਦੇ ਹਨ ਜਾਂ ਨਹੀਂ।

  • ਇਹ ਨਤੀਜੇ ਸੰਕੇਤ ਦਿੰਦੇ ਹਨ ਕਿ ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਵਰਕਫਲੋ ਸੁਧਾਰ ਕੋਡਿੰਗ ਮਾਪਦੰਡਾਂ ਤੋਂ ਅੱਗੇ ਅਸਲ ਕਾਰੋਬਾਰੀ AI ਪ੍ਰਣਾਲੀਆਂ ਤੱਕ ਫੈਲ ਸਕਦਾ ਹੈ ਅਤੇ AI ਐਪਲੀਕੇਸ਼ਨਾਂ ਨੂੰ ਲਗਾਤਾਰ ਸੁਧਾਰਨ ਲਈ ਇੱਕ ਵਿਹਾਰਕ ਰਾਹ ਦੇ ਸਕਦਾ ਹੈ।

ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ AI ਖੋਜ ਬਾਰੇ ਹਾਲੀਆ ਕੰਮ—ਜਿਸ ਵਿੱਚ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਖੋਜ-ਪੱਤਰ, CORAL ਫ੍ਰੇਮਵਰਕ ਅਤੇ karpathy/autoresearch ਸ਼ਾਮਲ ਹਨ—ਨੇ ਦਿਖਾਇਆ ਹੈ ਕਿ ਮੁਲਾਂਕਣ ਮਾਪਦੰਡ ਦਿੱਤੇ ਜਾਣ ਉੱਤੇ ਕੋਡਿੰਗ ਏਜੰਟ ਕਿਸੇ ਹੱਲ ਨੂੰ ਵਾਰ-ਵਾਰ ਸੁਧਾਰ ਸਕਦੇ ਹਨ। ਜੋ ਗੱਲ ਅਜੇ ਵੀ ਸਪਸ਼ਟ ਨਹੀਂ ਹੈ, ਉਹ ਇਹ ਹੈ ਕਿ ਕੀ ਉਹ ਤਰੀਕੇ ਲੰਬੇ ਸਮੇਂ ਵਾਲੇ AI ਵਰਕਫ਼ਲੋਜ਼ ਵਿੱਚ ਵੀ ਲਾਗੂ ਹੁੰਦੇ ਹਨ, ਜਿਵੇਂ ਕਿ ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ, ਜਿੱਥੇ ਕਿਸੇ ਸਵਾਲ ਦਾ ਜਵਾਬ ਦੇਣ ਲਈ ਇੱਕ ਏਜੰਟ ਨੂੰ ਮਲਟੀਮੋਡਲ ਡੋਮੇਨ ਕੋਰਪੋਰਾ ਵਿੱਚ ਵਾਰ-ਵਾਰ ਖੋਜ ਕਰਨੀ ਪੈਂਦੀ ਹੈ, ਜਾਂ ਗੁੰਝਲਦਾਰ ਡਾਟਾ-ਪ੍ਰੋਸੈਸਿੰਗ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ, ਜਿਨ੍ਹਾਂ ਲਈ ਕਈ ਆਪਸ ਵਿੱਚ ਨਿਰਭਰ ਪੜਾਅ, ਟੂਲ ਕਾਲਾਂ ਅਤੇ ਅਪਵਾਦ-ਨਿਪਟਾਰੇ ਨਾਲ ਸਬੰਧਤ ਫ਼ੈਸਲਿਆਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਇਸ ਤੋਂ ਵੀ ਡੂੰਘਾ ਸਵਾਲ ਇਹ ਹੈ ਕਿ ਕੀ ਇਹ ਸੁਧਾਰ ਉਸ ਡਾਟਾ ’ਤੇ ਵੀ ਕਾਇਮ ਰਹਿੰਦੇ ਹਨ, ਜਿਸ ਨੂੰ ਔਪਟੀਮਾਈਜ਼ਰ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖਿਆ।

ਸਾਡਾ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਖੋਜ ਅਤੇ ਵਿਕਾਸ ਉਸ ਸਵਾਲ ਦਾ ਜਵਾਬ ਹੈ। ਇਹ ਹਾਲੀਆ ਖੋਜ ਦੇ ਵਿਚਾਰਾਂ ਨੂੰ ਕਾਰੋਬਾਰੀ ਲੋੜਾਂ ਮੁਤਾਬਕ ਢਾਲਦਾ ਹੈ: ਹੋਲਡ-ਆਊਟ ਮੁਲਾਂਕਣ, ਆਡਿਟ ਟ੍ਰੇਲ, ਲਾਗਤ ਹੱਦਾਂ ਅਤੇ ਕੁਝ ਵੀ ਜਾਰੀ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮਨੁੱਖੀ ਸਮੀਖਿਅਕ ਨੂੰ ਸੌਂਪਣ ਦਾ ਸਪਸ਼ਟ ਪੜਾਅ।

ਅਸੀਂ ਇਸ ਨੂੰ ਅਸਲ ਗਾਹਕ ਕੰਮ ਦੇ ਆਧਾਰ ਉੱਤੇ ਬਣਾਏ ਤਿੰਨ ਲੰਮੀ ਮਿਆਦ ਵਾਲੇ ਕੰਮਾਂ ਉੱਤੇ ਪਰਖਿਆ। ਸਿਗਨਲ ਇੰਜਨ AI ਬਾਜ਼ਾਰ ਬਾਰੇ X ਪੋਸਟਾਂ ਦੀ ਲਾਈਵ ਧਾਰਾ ਉੱਤੇ ਨਿਗਰਾਨੀ ਰੱਖਦਾ ਹੈ ਅਤੇ ਸਰੋਤਾਂ ਸਮੇਤ ਸੰਚਾਰਿਤ ਰੁਝਾਨ ਰਿਪੋਰਟਾਂ ਤਿਆਰ ਕਰਦਾ ਹੈ। ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਮਿਲੀਆਂ-ਜੁਲੀਆਂ ਲਿਖਤ ਅਤੇ ਤਸਵੀਰ ਪੁੱਛਗਿੱਛਾਂ ਉੱਤੇ ਤਰਕ ਕਰਕੇ ਸਭ ਤੋਂ ਢੁਕਵੇਂ ਦਸਤਾਵੇਜ਼ੀ ਪੰਨੇ ਵਾਪਸ ਕਰਦੀ ਹੈ। ਡੀਪ ਰਿਸਰਚ ਵੈੱਬ ਖੋਜਣ, ਸਰੋਤਾਂ ਦੀ ਆਪਸੀ ਜਾਂਚ ਕਰਨ ਅਤੇ ਵਿਸਤ੍ਰਿਤ ਖੋਜ ਰਿਪੋਰਟਾਂ ਲਿਖਣ ਲਈ ਕਈ ਏਜੰਟਾਂ ਦਾ ਤਾਲਮੇਲ ਕਰਦੀ ਹੈ।

ਨਤੀਜਿਆਂ ਦੀ ਇੱਕ ਝਲਕ

  • ਸਿਗਨਲ ਇੰਜਨ: ਹੋਲਡ-ਆਊਟ ਟੈਸਟ ਕੰਪੋਜ਼ਿਟ ਸਕੋਰ 0.456 → 0.841, ਅਰਥਾਤ 84% ਸਾਪੇਖ ਵਾਧਾ। ਉਸੇ ਬਜਟ ਦੇ ਤਹਿਤ CORAL ਅਤੇ karpathy/autoresearch 0.50 ਤੋਂ ਘੱਟ ਰਿਹਾ।

  • ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ: ਹੋਲਡ-ਆਊਟ NDCG@10 0.705 → 0.744 ਰਿਹਾ, ਜਦਕਿ ਹਰ ਮੁਲਾਂਕਣ ਲਈ ਵਾਲ-ਕਲੌਕ ਸਮਾਂ 869s ਤੋਂ 54s ਹੋ ਗਿਆ। ਇਹ ਉੱਚਤਮ ਸਟੀਕਤਾ ਦੇ ਨਾਲ 16× ਤੇਜ਼ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਹੈ।

  • ਡੀਪ ਰਿਸਰਚ: 10 ਹਵਾਲਾ ਸਵਾਲਾਂ ਵਿੱਚ ਰਿਪੋਰਟ-ਕੁਆਲਿਟੀ ਕੰਪੋਜ਼ਿਟ ਸਕੋਰ 0.449 → 0.802ਰਿਹਾ, ਜਦਕਿ ਬੇਸਲਾਈਨਾਂ ਲਈ ਇਹ ਲਗਭਗ 0.52 ਸੀ। ਇਸ ਕਾਰਜ ਵਿੱਚ ਕੋਈ ਹੋਲਡ-ਆਊਟ ਸਪਲਿਟ ਨਹੀਂ ਸੀ, ਇਸ ਲਈ ਅਸੀਂ ਇਸ ਅੰਕੜੇ ਨੂੰ ਸਿਰਫ਼ ਇਨ-ਸੈਂਪਲ ਮੰਨਦੇ ਹਾਂ।

  • ਖੋਜ ਕੁਸ਼ਲਤਾ: ਪ੍ਰਿਡਿਕਟਿਵ ਹਾਈਪੋਥਿਸਿਸ ਰੀਰੈਂਕਿੰਗ ਦੇ ਨਾਲ, ਸਿਗਨਲ ਇੰਜਨ ਨੇ ਉਸੇ ਮੁਲਾਂਕਣ ਬਜਟ ਵਿੱਚ 20 ਦੀ ਬਜਾਏ 3 ਇਟਰੇਸ਼ਨਾਂ ਵਿੱਚ ਰੈਫ਼ਰੈਂਸ ਰਨ ਦੇ ਸਰਵੋਤਮ ਸਕੋਰ ਦਾ 91% ਹਾਸਲ ਕੀਤਾ।

ਜ਼ਿਆਦਾਤਰ ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਖੋਜ ਪ੍ਰਣਾਲੀਆਂ ਇੱਕੋ ਡਾਟਾਸੈੱਟ ਉੱਤੇ ਔਪਟੀਮਾਈਜ਼ ਅਤੇ ਮੁਲਾਂਕਣ ਕਰਦੀਆਂ ਹਨ, ਜਿਸ ਕਰਕੇ ਇਹ ਪਤਾ ਨਹੀਂ ਲੱਗ ਸਕਦਾ ਕਿ ਨਤੀਜਾ ਸਧਾਰਨੀਕਰਨ ਕਰਦਾ ਹੈ ਜਾਂ ਨਹੀਂ। ਸਿਗਨਲ ਇੰਜਨ ਅਤੇ ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਲਈ ਅਸੀਂ ਸਖ਼ਤ ਵੰਡ ਲਾਗੂ ਕਰਦੇ ਹਾਂ: ਇੱਕ ਸਿਖਲਾਈ ਸਮੂਹ, ਜਿਸ ਉੱਤੇ ਉਮੀਦਵਾਰ ਸਕੋਰ ਕਰ ਸਕਦੇ ਹਨ; ਸੈਨਿਟੀ ਜਾਂਚਾਂ ਲਈ ਇੱਕ ਵਿਕਾਸ ਸਮੂਹ; ਅਤੇ ਇੱਕ ਹੋਲਡ-ਆਊਟ ਟੈਸਟ ਸਮੂਹ, ਜਿਸ ਨੂੰ ਔਪਟੀਮਾਈਜ਼ਰ ਕਦੇ ਨਹੀਂ ਵੇਖਦਾ। ਹਰ ਰਿਪੋਰਟ ਕੀਤਾ ਨਤੀਜਾ ਕੋਡ ਦੇ ਇੱਕ ਖ਼ਾਸ ਵਰਜਨ ਤੋਂ ਆਉਂਦਾ ਹੈ, ਜਿਸ ਨੂੰ ਹਰ ਵੰਡ ਉੱਤੇ ਸਕੋਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਲਈ ਅਸੀਂ ਕਦੇ ਇੱਕ ਉਮੀਦਵਾਰ ਦੇ ਸਰਵੋਤਮ ਸਿਖਲਾਈ ਸਕੋਰ ਨੂੰ ਕਿਸੇ ਹੋਰ ਉਮੀਦਵਾਰ ਦੇ ਸਰਵੋਤਮ ਟੈਸਟ ਸਕੋਰ ਨਾਲ ਨਹੀਂ ਮਿਲਾਉਂਦੇ।

ਇਹ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ

ਹਰ ਦੌਰ ਵਿੱਚ ਜਾਂਚ-ਢਾਂਚਾ ਕੋਡ ਵਿੱਚ ਬਦਲਾਅ ਕਰਨ ਲਈ ਸੰਰਚਿਤ ਪਰਿਕਲਪਨਾਵਾਂ ਦਾ ਇੱਕ ਸਮੂਹ ਬਣਾਉਂਦਾ ਹੈ। ਹਰ ਪਰਿਕਲਪਨਾ ਉਸ ਯੰਤਰ ਵਿਧੀ ਦਾ ਨਾਮ ਦਿੰਦੀ ਹੈ ਜਿਸ ਨੂੰ ਉਹ ਬਦਲਣਾ ਚਾਹੁੰਦੀ ਹੈ, ਉਸ ਪਿਛਲੇ ਵਰਜਨ ਦਾ ਜਿਸ ’ਤੇ ਉਹ ਆਧਾਰਿਤ ਹੈ ਅਤੇ ਅਸਫਲਤਾ ਦੇ ਉਸ ਢੰਗ ਦਾ ਜਿਸ ਨੂੰ ਉਹ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੀ ਹੈ। ਕੋਈ ਮਹਿੰਗਾ ਮੁਲਾਂਕਣ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਦਰਜਾਬੰਦੀ ਦਾ ਪੜਾਅ ਇਸ ਸਮੂਹ ਨੂੰ ਛਾਂਟਦਾ ਹੈ। ਬਚੀਆਂ ਪਰਿਕਲਪਨਾਵਾਂ ਸਮਾਂਤਰ ਕਾਰਜਕਾਰੀ ਏਜੰਟਾਂ ਕੋਲ ਜਾਂਦੀਆਂ ਹਨ। ਉਹ ਸਾਂਝਾ ਗਿਆਨ-ਆਧਾਰ ਵਰਤਦੇ ਹਨ, ਪਰ ਕੋਡ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਲੱਗ ਵਰਕਸਪੇਸਾਂ ਵਿੱਚ ਸੋਧਦੇ ਹਨ, ਤਾਂ ਜੋ ਹਰ ਉਮੀਦਵਾਰ ਦਾ ਨਿਰਪੱਖ ਅਤੇ ਸੁਤੰਤਰ ਮੁਲਾਂਕਣ ਹੋਵੇ। ਦੌਰ ਦੇ ਅੰਤ ਵਿੱਚ ਰਨਰ ਇੱਕ ਜੇਤੂ ਨੂੰ ਅੱਗੇ ਵਧਾਉਂਦਾ ਹੈ: ਸਭ ਤੋਂ ਵੱਧ ਸਕੋਰ ਵਾਲਾ ਉਹ ਉਮੀਦਵਾਰ ਜੋ ਦਿਖਾਈ ਦੇਣ ਵਾਲੇ ਸਾਰੇ ਸਪਲਿਟਾਂ ਦੀ ਹਰ ਜਾਂਚ ਵਿੱਚ ਵੀ ਪਾਸ ਹੋਇਆ ਹੋਵੇ। ਉਹ ਜੇਤੂ ਅਗਲੇ ਦੌਰ ਲਈ ਅਤਿ ਆਧੁਨਿਕ ਆਧਾਰ ਬਣਦਾ ਹੈ। ਹਰ ਅਜ਼ਮਾਇਸ਼ ਸਿਰਫ਼ ਨਵੀਆਂ ਐਂਟਰੀਆਂ ਜੋੜਨ ਵਾਲੇ ਸਬੂਤ ਭੰਡਾਰ ਵਿੱਚ ਇੱਕ ਨਿਸ਼ਚਿਤ ਪੈਕੇਜ ਦਰਜ ਕਰਦੀ ਹੈ: ਇਸ ਦਾ ਕੋਡ ਪੈਚ, ਹਰ ਸਪਲਿਟ ਦੇ ਸਕੋਰ, ਇੱਕ ਇਵੈਂਟ ਲੌਗ ਅਤੇ LLM ਵੱਲੋਂ ਲਿਖੇ ਚਾਰ ਛੋਟੇ ਵਿਸ਼ਲੇਸ਼ਣ, ਜੋ ਇਸ ਦੇ ਟ੍ਰੇਸ, ਗਲਤੀਆਂ, ਲਾਗਤ ਅਤੇ ਰਿਫ਼ਲੈਕਸ਼ਨ ਨੂੰ ਕਵਰ ਕਰਦੇ ਹਨ। ਅਗਲੇ ਦੌਰ ਦਾ ਪ੍ਰਸਤਾਵਕ ਇਸ ਇਤਿਹਾਸ ਨੂੰ ਮੁੜ ਪੜ੍ਹਦਾ ਹੈ। ਇਸ ਤਰ੍ਹਾਂ ਜਾਂਚ-ਢਾਂਚਾ ਉਹੀ ਬੇਨਤੀਜਾ ਰਾਹ ਮੁੜ ਚਲਾਉਣ ਦੀ ਬਜਾਏ ਆਪਣੀ ਸਿੱਖਿਆ ਨੂੰ ਅਗਲੇ ਦੌਰਾਂ ਵਿੱਚ ਅੱਗੇ ਵਧਾਉਂਦਾ ਹੈ।

ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਦਾ ਵਰਕਫ਼ਲੋ ਰੇਖਾ-ਚਿੱਤਰ, ਜਿਸ ਵਿੱਚ ਇਨਪੁੱਟ, ਸ਼ੁਰੂਆਤੀ ਮੁਲਾਂਕਣ, ਪਰਿਕਲਪਨਾ ਖੋਜ, ਸਮਾਂਤਰ ਏਜੰਟ ਟੀਮਾਂ, ਮੁਲਾਂਕਣ ਵਰਕਸਪੇਸ, ਸਮੀਖਿਆ ਆਊਟਪੁੱਟ, ਸਬੂਤ ਭੰਡਾਰ ਅਤੇ ਸੁਰੱਖਿਆ ਤੇ ਲਾਗਤ ਨਿਯੰਤਰਨ ਦਿਖਾਏ ਗਏ ਹਨ।

ਤਿੰਨ ਸੁਰੱਖਿਆ ਉਪਾਅ ਇਸ ਚੱਕਰ ਨੂੰ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਚਲਾਉਂਦੇ ਹਨ। ਦਾਇਰਾ ਨੀਤੀ ਤੈਅ ਕਰਦੀ ਹੈ ਕਿ ਉਮੀਦਵਾਰ ਕਿਹੜੀਆਂ ਫ਼ਾਈਲਾਂ ਨੂੰ ਬਦਲ ਸਕਦਾ ਹੈ ਅਤੇ ਇਸ ਤੋਂ ਬਾਹਰ ਹੋਏ ਹਰ ਬਦਲਾਅ ਨੂੰ ਵਾਪਸ ਕਰ ਦਿੰਦੀ ਹੈ। ਟੋਕਨ ਅਤੇ ਵਾਲ-ਕਲੌਕ ਬਜਟ ਖਰਚ ਦੀ ਹੱਦ ਪਾਰ ਹੁੰਦੇ ਹੀ ਚਲਾਉਣਾ ਰੋਕ ਦਿੰਦੇ ਹਨ, ਜਦਕਿ ਸਮਕਾਲੀਤਾ ਸੀਮਾਵਾਂ ਜਾਂਚ-ਢਾਂਚੇ ਨੂੰ ਮਾਡਲ ਅਤੇ GPU ਦੀਆਂ ਰੇਟ ਲਿਮਿਟਾਂ ਅੰਦਰ ਰੱਖਦੀਆਂ ਹਨ। ਅਤੇ ਜਾਂਚ-ਢਾਂਚਾ ਆਪਣੇ ਆਪ ਕੁਝ ਵੀ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਨਹੀਂ ਭੇਜਦਾ। ਇਹ ਦਰਜਾਬੱਧ ਅਤੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਦਸਤਾਵੇਜ਼ਬੱਧ ਉਮੀਦਵਾਰ ਪੇਸ਼ ਕਰਦਾ ਹੈ, ਫਿਰ ਮਨੁੱਖੀ ਇੰਜੀਨੀਅਰ ਡਿਫ਼ ਦੀ ਸਮੀਖਿਆ ਕਰਕੇ ਫ਼ੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਇਸ ਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ ਵਿੱਚ ਭੇਜਣਾ ਹੈ ਜਾਂ ਨਹੀਂ।

ਅੰਦਰੂਨੀ ਕਾਰਜਪ੍ਰਣਾਲੀ

ਸਥਾਨਕ ਤਕਨੀਕੀ ਢਾਂਚੇ ਉੱਤੇ, ਉਪਰੋਕਤ ਚੱਕਰ ਦੇ ਹਰ ਦੌਰ ਦੇ ਪਿੱਛੇ ਪੰਜ ਬੁਨਿਆਦੀ ਇੰਜੀਨੀਅਰਿੰਗ ਹਿੱਸੇ ਕੰਮ ਕਰਦੇ ਹਨ।

  • ਵਰਕਸਪੇਸ ਅਲੱਗਾਵ। ਹਰ ਉਮੀਦਵਾਰ ਲਈ ਇੱਕ git worktree। ਫੋਰਕਾਂ ਇੱਕੋ ਆਬਜੈਕਟ ਡਾਟਾਬੇਸ ਸਾਂਝਾ ਕਰਦੀਆਂ ਹਨ, ਪਰ ਇੱਕ-ਦੂਜੇ ਦੀਆਂ ਫ਼ਾਈਲਾਂ ਨਹੀਂ। ਇਸ ਨਾਲ ਉਮੀਦਵਾਰ ਲਗਭਗ ਸਥਿਰ ਡਿਸਕ ਲਾਗਤ ਉੱਤੇ ਸਮਾਂਤਰ ਚੱਲ ਸਕਦੇ ਹਨ ਅਤੇ ਮੌਜੂਦਾ ਅਤਿ-ਆਧੁਨਿਕ ਵਰਜਨ ਨਾਲ ਡਿਫ ਕੱਢਣਾ ਬਹੁਤ ਸੌਖਾ ਹੁੰਦਾ ਹੈ।

  • ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਸੈਂਡਬੌਕਸ। ਕੌਂਫਿਗ ਅਨੁਸਾਰ ਡਿਊਅਲ-ਮੋਡ: ਤੇਜ਼ ਦੁਹਰਾਅ ਲਈ ਨੇਟਿਵ ਸਬਪ੍ਰੋਸੈੱਸ ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਲੱਗ ਰਨਟਾਈਮ। ਕੋਰਪੋਰਾ ਸਿਰਫ਼ ਪੜ੍ਹਨਯੋਗ ਰੂਪ ਵਿੱਚ ਜੋੜੇ ਜਾਂਦੇ ਹਨ ਅਤੇ ਹਰ ਅਜ਼ਮਾਇਸ਼ ਦੀ ਸਕ੍ਰੈਚ ਡਾਇਰੈਕਟਰੀ ਨੂੰ ਮੁਲਾਂਕਣ ਮਗਰੋਂ ਮਿਟਾ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਲਈ ਕੋਈ ਅਜ਼ਮਾਇਸ਼ ਡਾਟਾਸੈੱਟ ਨੂੰ ਬਦਲ ਜਾਂ ਆਪਣੀ ਸਥਿਤੀ ਅਗਲੀ ਅਜ਼ਮਾਇਸ਼ ਤੱਕ ਪਹੁੰਚਾ ਨਹੀਂ ਸਕਦੀ।

  • ਦਾਇਰਾ ਨੀਤੀ। ਪ੍ਰਯੋਗ ਦੀ ਕੌਂਫਿਗ ਵਿੱਚ ਘੋਸ਼ਿਤ ਮਨਜ਼ੂਰਸ਼ੁਦਾ ਮਾਰਗਾਂ ਦੀ ਸੂਚੀ। ਇਸ ਤੋਂ ਬਾਹਰ ਹੋਏ ਹਰ ਬਦਲਾਅ ਨੂੰ ਅਜ਼ਮਾਇਸ਼ ਦੇ ਮੁਲਾਂਕਣ ਤੋਂ ਪਹਿਲਾਂ ਵਾਪਸ ਕਰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਅਜ਼ਮਾਇਸ਼ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਕਰਕੇ ਸਮੀਖਿਅਕ ਨੂੰ ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਅੰਤਰ ਘੋਸ਼ਿਤ ਦਾਇਰੇ ਅੰਦਰ ਹੀ ਰਹਿਣਾ ਯਕੀਨੀ ਹੁੰਦਾ ਹੈ।

  • ਬਜਟ ਲਾਗੂਕਰਨ। ਤਿੰਨ ਪੱਧਰ: ਹਰ ਅਜ਼ਮਾਇਸ਼ ਲਈ ਟੋਕਨ ਅਤੇ ਵਾਲ-ਕਲੌਕ ਸੀਮਾਵਾਂ, ਹਰ ਰਨ ਲਈ ਕੁੱਲ ਖਰਚ ਦੀ ਹੱਦ ਅਤੇ ਸਮਕਾਲੀਤਾ ਸੀਮਾ। ਇਹ ਤਿੰਨੇ ਮਿਲ ਕੇ ਖਰਚ ਨੂੰ ਅਨੁਮਾਨਯੋਗ ਰੱਖਦੇ ਹਨ ਅਤੇ ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹਨ ਕਿ ਜਾਂਚ-ਢਾਂਚਾ ਮਾਡਲ ਅਤੇ ਇੰਫ੍ਰਾਸਟ੍ਰਕਚਰ ਦੀਆਂ ਰੇਟ ਲਿਮਿਟਾਂ ਦੇ ਅੰਦਰ ਰਹੇ।

  • ਸਬੂਤ ਭੰਡਾਰ। ਕੋਡ ਪੈਚ, ਹਰ ਸਪਲਿਟ ਦੇ ਸਕੋਰ, ਇਵੈਂਟ ਲੌਗ ਅਤੇ LLM ਵੱਲੋਂ ਲਿਖੇ ਚਾਰ ਵਿਸ਼ਲੇਸ਼ਣਾਂ ਵਾਲੀ ਸਿਰਫ਼ ਨਵੀਆਂ ਐਂਟਰੀਆਂ ਜੋੜਨਯੋਗ JSONL ਫ਼ਾਈਲ। ਹਰ ਅਜ਼ਮਾਇਸ਼ ਮਗਰੋਂ ਮੈਟੀਰੀਅਲਾਈਜ਼ਡ ਵਿਊਜ਼ (ਲੀਡਰਬੋਰਡ, ਅਤਿ-ਆਧੁਨਿਕ ਅਤੇ ਅਸਫਲਤਾ ਸੂਚਕ) ਨੂੰ ਮੁੜ ਬਣਾਇਆ ਜਾਂਦਾ ਹੈ। ਇਸ ਨਾਲ ਅਗਲੇ ਦੌਰ ਪਿਛਲੇ ਇਤਿਹਾਸ ਉੱਤੇ ਅੱਗੇ ਵਧਦੇ ਹਨ ਅਤੇ ਹਰ ਚਲਾਉਣ ਨੂੰ ਬਾਈਟ-ਦਰ-ਬਾਈਟ ਦੁਹਰਾਇਆ ਜਾ ਸਕਦਾ ਹੈ।

ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ ਪ੍ਰਿਮਿਟਿਵ ਵਿਕਲਪਿਕ ਨਹੀਂ ਹੈ। ਜਾਂਚ-ਢਾਂਚੇ ਦਾ ਉਦੇਸ਼ ਇਹ ਹੈ ਕਿ ਰਨ ਦੇ ਅੰਤ ਵਿੱਚ ਸਮੀਖਿਅਕ ਕੋਲ ਅਸਲ ਵਿੱਚ ਮਨਜ਼ੂਰ ਕਰਨ ਯੋਗ ਚੀਜ਼ ਹੋਵੇ: ਇੱਕ ਜੇਤੂ ਉਮੀਦਵਾਰ, ਇੱਕ ਸੀਮਤ ਡਿਫ਼, ਕੀ ਕੁਝ ਅਜ਼ਮਾਇਆ ਗਿਆ ਉਸ ਦਾ ਪੂਰਾ ਰਿਕਾਰਡ ਅਤੇ ਇੱਕ ਜਾਣੀ-ਪਛਾਣੀ ਲਾਗਤ। ਇਨ੍ਹਾਂ ਪੰਜਾਂ ਵਿੱਚੋਂ ਕਿਸੇ ਇੱਕ ਨੂੰ ਹਟਾਉਣ ਨਾਲ ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਇੱਕ ਗਾਰੰਟੀ ਖ਼ਤਮ ਹੋ ਜਾਂਦੀ ਹੈ।

ਪ੍ਰਿਡਿਕਟਿਵ ਹਾਈਪੋਥਿਸਿਸ ਰੀਰੈਂਕਿੰਗ

ਤਿੰਨੇ ਪ੍ਰਯੋਗ ਇੱਕੋ ਪਰਿਕਲਪਨਾ ਰਣਨੀਤੀ ਵਰਤਦੇ ਹਨ। ਹਰ ਦੁਹਰਾਅ ਵਿੱਚ ਪ੍ਰਸਤਾਵਕ ਬਜਟ ਨਾਲ ਚਲਾਏ ਜਾ ਸਕਣ ਵਾਲੇ ਉਮੀਦਵਾਰਾਂ ਤੋਂ ਵੱਧ ਪਰਿਕਲਪਨਾਵਾਂ ਬਣਾਉਂਦਾ ਹੈ: K = 4 ਦੇ ਭੇਜਣ ਬਜਟ ਲਈ M = 8 ਉਮੀਦਵਾਰ। ਫਿਰ ਇੱਕ ਵੱਖਰਾ LLM ਰੈਂਕਰ ਸਿਰਫ਼ ਤੀਹ ਸਕਿੰਟ ਦੀ ਇੱਕ ਕਾਲ ਵਿੱਚ ਪੂਰੀ ਤਸਵੀਰ ਵੇਖਦਿਆਂ ਸਾਰੇ 8 ਨੂੰ ਕ੍ਰਮ ਦਿੰਦਾ ਹੈ: ਮੌਜੂਦਾ ਸਰਬੋਤਮ ਸਕੋਰ ਅਤੇ ਇਸ ਦੇ ਕਮਜ਼ੋਰ ਪੱਖ, ਹਾਲੀਆ ਅਜ਼ਮਾਇਸ਼ਾਂ ਦੇ ਅਸਫਲਤਾ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਨਾਲ-ਨਾਲ ਰੱਖੇ ਸਾਰੇ 8 ਪ੍ਰਸਤਾਵ। ਸਿਖਰਲੇ 4 ਉਮੀਦਵਾਰ ਐਗਜ਼ੀਕਿਊਟਰ ਕੋਲ ਜਾਂਦੇ ਹਨ ਅਤੇ ਹਰ ਇੱਕ ਉੱਤੇ 15 ਤੋਂ 30 ਮਿੰਟ ਲੱਗਦੇ ਹਨ। ਬਾਕੀ 4 ਨੂੰ ਕੋਈ ਖਰਚ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਹਟਾ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ।

ਮੁਲਾਂਕਣ

ਅਧਾਰਭੂਤ ਮਾਡਲ ਪੂਰੀ ਪ੍ਰਕਿਰਿਆ ਦੌਰਾਨ ਬਦਲੇ ਨਹੀਂ ਗਏ। ਜਾਂਚ-ਢਾਂਚੇ ਨੇ ਸਿਰਫ਼ ਉਨ੍ਹਾਂ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਦਾ ਕੋਡ ਸੋਧਿਆ। ਸਿਗਨਲ ਇੰਜਨ ਅਤੇ ਡੀਪ ਰਿਸਰਚ gpt-5।5 ਉੱਤੇ ਚੱਲੇ। ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਸਥਾਨਕ ਤੌਰ ਉੱਤੇ vLLM ਰਾਹੀਂ ਸੇਵਾ ਦਿੱਤੇ ਖੁੱਲ੍ਹੇ-ਭਾਰ Qwen3।6-35B-A3B ਉੱਤੇ ਚੱਲੀ, ਜਿਸ ਨਾਲ ColQwen3-4B ਚਿੱਤਰ ਪ੍ਰਾਪਤੀਕਾਰ ਜੋੜਿਆ ਗਿਆ। ਇਸ ਜੋੜ ਨੂੰ ਅਨੁਮਾਨਯੋਗ ਔਨ-ਪ੍ਰੈਮ ਲਾਗਤ ਲਈ ਚੁਣਿਆ ਗਿਆ ਸੀ।

ਹੇਠਾਂ ਦਿੱਤਾ ਚਾਰਟ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਸਾਡੇ ਤਿੰਨ ਮੁੱਖ ਕੰਮਾਂ ਦੇ ਸਕੋਰ ਕਿਵੇਂ ਬਦਲੇ। “ਸੀਡ” ਮਨੁੱਖੀ ਇੰਜੀਨੀਅਰ ਵੱਲੋਂ ਲਿਖਿਆ ਆਰੰਭਕ ਕੋਡ ਹੈ। “ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ” ਇਸ ਵੱਲੋਂ ਲੱਭਿਆ ਸਰਬੋਤਮ ਵਰਜਨ ਹੈ। ਸਾਨੂੰ ਹੋਲਡ-ਆਊਟ ਟੈਸਟ ਸੈੱਟ ਵਿੱਚ ਤਿੰਨਾਂ ਕੰਮਾਂ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਵਿੱਚ ਸੁਧਾਰ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ।

ਸਿਗਨਲ ਇੰਜਨ, ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਅਤੇ ਡੀਪ ਰਿਸਰਚ ਵਿੱਚ ਸ਼ੁਰੂਆਤੀ ਕੋਡ ਤੇ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਤੁਲਨਾ ਕਰਦਾ ਬਾਰ ਚਾਰਟ, ਜਿਸ ਵਿੱਚ ਸਾਰੇ ਰਾਖਵੇਂ ਟੈਸਟਾਂ ਉੱਤੇ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਅੱਗੇ ਹੈ।

ਸਿਗਨਲ ਇੰਜਨ ਦਾ ਮੁਲਾਂਕਣ LLM ਨਿਰਣਾਇਕ ਨੇ ਤਾਜ਼ਗੀ, ਤੱਥਕਤਾ, ਵੇਰਵੇ ਦੇ ਪੱਧਰ ਅਤੇ ਲਹਿਜ਼ੇ ਦੇ ਆਧਾਰ ’ਤੇ ਕੀਤਾ। ਇਸ ਲਈ 150 ਸਿਖਲਾਈ ਟਵੀਟ ਅਤੇ 150 ਹੋਲਡ-ਆਊਟ ਟੈਸਟ ਟਵੀਟ ਵਰਤੇ ਗਏ। ਚਲਾਉਣ ਦੌਰਾਨ ਸਰਬੋਤਮ ਵਰਜਨ ਨੇ ਸਿਖਲਾਈ ਕੰਪੋਜ਼ਿਟ ਸਕੋਰ ਨੂੰ 0.431 ਤੋਂ 0.756 ਅਤੇ ਹੋਲਡ-ਆਊਟ ਸਕੋਰ ਨੂੰ 0.456 ਤੋਂ 0.841 ਤੱਕ ਸੁਧਾਰਿਆ। ਇਹ ਸੁਧਾਰ ਸਿਰਫ਼ ਪ੍ਰੌਂਪਟ ਦੀਆਂ ਛੋਟੀਆਂ ਸੋਧਾਂ ਤੋਂ ਨਹੀਂ, ਸਗੋਂ ਜਾਂਚ-ਢਾਂਚੇ ਵਿੱਚ ਕੀਤੇ ਬਦਲਾਵਾਂ ਤੋਂ ਮਿਲੇ। ਜੇਤੂ ਇਟਰੇਸ਼ਨਾਂ ਨੇ ਸੋਸ਼ਲ ਮੀਡੀਆ ਦੇ ਸ਼ੋਰ ਨੂੰ ਛਾਂਟਣਾ ਸਿੱਖਿਆ, ਤੱਥਾਂ ਦੀ ਆਪਸੀ ਜਾਂਚ ਦੇ ਕਦਮ ਜੋੜੇ ਅਤੇ ਹਰ ਨਤੀਜੇ ਲਈ ਸਪਸ਼ਟ ਸਬੂਤ ਨਾਲ ਆਪਣੇ ਆਪ ਨੂੰ ਆਧਾਰਿਤ ਕਰਨਾ ਲਾਜ਼ਮੀ ਕੀਤਾ। ਹੇਠਾਂ ਦਿੱਤਾ ਰੇਖਾ ਚਿੱਤਰ ਇਟਰੇਸ਼ਨ ਪ੍ਰਕਿਰਿਆ ਦਿਖਾਉਂਦਾ ਹੈ।

ਸਿਗਨਲ ਇੰਜਨ ਦੀਆਂ ਸਿਖਲਾਈ ਅਜ਼ਮਾਇਸ਼ਾਂ ਦਾ ਰੇਖਾ ਚਾਰਟ, ਜਿਸ ਵਿੱਚ ਚੱਲਦਾ ਸਰਬੋਤਮ ਅਤੇ ਹੋਲਡ-ਆਊਟ ਸਕੋਰ ਦੁਹਰਾਈਆਂ ਗਈਆਂ ਐਕਸਪਲੋਰਰ ਅਤੇ ਰੀਫਾਈਨਰ ਕੋਸ਼ਿਸ਼ਾਂ ਦੌਰਾਨ ਸੀਡ ਬੇਸਲਾਈਨ ਤੋਂ ਟੀਚੇ ਵੱਲ ਵਧਦੇ ਹਨ।

ਅਜ਼ਮਾਇਸ਼ਾਂ ਦਾ ਇਤਿਹਾਸ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਇਹ ਲਾਭ ਕਿਵੇਂ ਇਕੱਠੇ ਹੋਏ। ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਢਾਂਚਾਗਤ ਬਦਲਾਅ ਨੇ ਉਸ ਵੇਲੇ ਦੇ ਸਰਵੋਤਮ ਸਕੋਰ ਨੂੰ 0.625 ਤੱਕ ਵਧਾਇਆ। ਸਬੂਤਾਂ ਦੀ ਵਧੇਰੇ ਬਾਰੀਕੀ ਨਾਲ ਸੰਭਾਲ ਨੇ ਇਸ ਨੂੰ 0.679 ਤੱਕ ਪਹੁੰਚਾਇਆ ਅਤੇ ਸੁਧਰੇ ਆਤਮ-ਚਿੰਤਨ ਤੇ ਮਾਪਦੰਡ ਚੱਕਰ ਨੇ ਇਸ ਨੂੰ 0.819 ਕਰ ਦਿੱਤਾ। ਲਗਭਗ ਅੱਧੇ ਉਮੀਦਵਾਰ ਚਲਾਉਣਾਂ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਘੱਟ ਰਹੀ ਜਾਂ ਉਹ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਸਫਲ ਹੋਏ, ਪਰ ਉਨ੍ਹਾਂ ਨੇ ਲੀਡਰਬੋਰਡ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਨਹੀਂ ਕੀਤਾ। ਹਰ ਫੋਰਕ ਅਲੱਗ ਚੱਲੀ, ਅਸਫਲ ਡਿਫ ਹਟਾ ਦਿੱਤੇ ਗਏ ਅਤੇ ਅਸਫਲਤਾਵਾਂ ਆਤਮ-ਚਿੰਤਨ ਭੰਡਾਰ ਵਿੱਚ ਲਿਖੀਆਂ ਗਈਆਂ, ਤਾਂ ਜੋ ਅਗਲਾ ਪ੍ਰਸਤਾਵਕ ਉਹੀ ਬੇਨਤੀਜਾ ਰਾਹ ਨਾ ਦੁਹਰਾਏ।

ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਗੱਲ ਇਹ ਹੈ ਕਿ ਪੂਰੇ ਚਲਾਉਣ ਦੌਰਾਨ ਹੋਲਡ-ਆਊਟ ਵਕਰ ਸਿਖਲਾਈ ਵਕਰ ਦੇ ਨਾਲ-ਨਾਲ ਵਧਿਆ। ਇਸ ਤੋਂ ਸੰਕੇਤ ਮਿਲਦਾ ਹੈ ਕਿ ਜਾਂਚ-ਢਾਂਚਾ ਸਿਖਲਾਈ ਕੋਰਪਸ ਨੂੰ ਯਾਦ ਕਰਨ ਦੀ ਬਜਾਏ ਵਰਕਫ਼ਲੋ ਸੁਧਾਰ ਰਿਹਾ ਸੀ। ਹੋਲਡ-ਆਊਟ ਸਕੋਰ ਸਿਖਲਾਈ ਸਕੋਰਾਂ ਤੋਂ ਥੋੜ੍ਹੇ ਵੱਧ ਸਨ। ਅਸੀਂ ਇਸ ਨੂੰ ਦੋ ਛੋਟੇ ਅਤੇ ਅਲੱਗ-ਅਲੱਗ ਸਪਲਿਟਾਂ ਵਿਚਕਾਰ ਆਮ ਨਮੂਨਾ-ਸ਼ੋਰ ਮੰਨਦੇ ਹਾਂ।

ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਨੂੰ ਜਨਤਕ ViDoRe V3 ਕੰਪਿਊਟਰ ਸਾਇੰਸ ਸਪਲਿਟ ਉੱਤੇ NDCG@10 ਨਾਲ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ, ਜਿਸ ਨੂੰ 20 ਸਿਖਲਾਈ, 10 ਵਿਕਾਸ ਅਤੇ 20 ਹੋਲਡ-ਆਊਟ ਟੈਸਟ ਸਵਾਲਾਂ ਵਿੱਚ ਵਿਵਸਥਿਤ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਾਂਚ-ਢਾਂਚੇ ਨੇ ਹੋਲਡ-ਆਊਟ NDCG@10 ਨੂੰ 0.705 ਤੋਂ 0.744 ਤੱਕ ਵਧਾਇਆ, ਜਦਕਿ ਕੁੱਲ ਮੁਲਾਂਕਣ ਵਾਲ-ਕਲੌਕ ਸਮਾਂ 869 ਸਕਿੰਟਾਂ ਤੋਂ 54 ਸਕਿੰਟਾਂ ਰਹਿ ਗਿਆ।

ਡੀਪ ਰਿਸਰਚ ਨੂੰ 10 ਹਵਾਲਾ ਸਵਾਲਾਂ ਉੱਤੇ DeepResearch-Eval ਅਨੁਸਾਰ, LLM ਨਿਰਣਾਇਕ ਵੱਲੋਂ ਵਿਸ਼ਾ-ਵਸਤੂ ਅਤੇ ਹਵਾਲਿਆਂ ਦੀ ਗੁਣਵੱਤਾ ਦੇ ਕੰਪੋਜ਼ਿਟ ਸਕੋਰ ਨਾਲ ਦਰਜਾ ਦਿੱਤਾ ਗਿਆ। ਸੁਧਰੇ ਕੋਡ ਨੇ ਔਸਤ ਨੂੰ 0.449 ਤੋਂ 0.802 ਤੱਕ ਵਧਾਇਆ। ਜੇਤੂ ਬਦਲਾਅ ਡਿਫ਼ ਵਿੱਚ ਸਾਫ਼ ਦਿਖਾਈ ਦਿੰਦੇ ਸਨ: ਕਿਸੇ ਵੀ ਖੋਜ ਏਜੰਟ ਨੂੰ ਭੇਜਣ ਤੋਂ ਪਹਿਲਾਂ ਤਰੀਕਿਆਂ ਦੀ ਤੁਲਨਾ ਕਰਨ ਵਾਲਾ ਸ਼ੁਰੂਆਤੀ ਯੋਜਨਾ ਪੜਾਅ ਅਤੇ ਉਨ੍ਹਾਂ ਪੱਖਾਂ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਅੰਤਿਮ ਸਮੀਖਿਆ ਪੜਾਅ, ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਰਿਪੋਰਟਾਂ ਦੇ ਸਕੋਰ ਇਤਿਹਾਸਕ ਤੌਰ ’ਤੇ ਘੱਟ ਰਹੇ ਸਨ। ਇਹ ਸਮੂਹ ਛੋਟਾ ਹੈ ਅਤੇ ਇਸ ਦਾ ਮੁਲਾਂਕਣ ਮਹਿੰਗਾ ਹੈ, ਇਸ ਲਈ ਅਸੀਂ ਇਸ ਨੂੰ ਵੰਡਿਆ ਨਹੀਂ ਅਤੇ ਨਤੀਜੇ ਨੂੰ ਇਨ-ਸੈਂਪਲ ਮੰਨਦੇ ਹਾਂ।

CORAL ਅਤੇ karpathy/autoresearch ਨਾਲ ਤੁਲਨਾ

ਸਿਗਨਲ ਇੰਜਨ, ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਅਤੇ ਡੀਪ ਰਿਸਰਚ ਦੇ ਸਕੋਰਾਂ ਤੇ ਮੁਲਾਂਕਣ ਦੇਰੀ ਲਈ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ, CORAL ਅਤੇ karpathy/autoresearch ਦੀ ਤੁਲਨਾ ਕਰਦੇ ਬਾਰ ਚਾਰਟ।

ਅਸੀਂ ਤਿੰਨਾਂ ਤਰੀਕਿਆਂ ਨੂੰ ਇੱਕੋ ਬਜਟ ਹੇਠ ਮਾਪਿਆ: ਉਹੀ ਡਾਟਾਸੈੱਟ, ਉਹੀ ਅਧਾਰਭੂਤ ਮਾਡਲ, ਉਹੀ ਦੁਹਰਾਅ ਹੱਦ ਅਤੇ ਉਮੀਦਵਾਰਾਂ ਦੇ ਕੁੱਲ ਮੁਲਾਂਕਣਾਂ ਦੀ ਉਹੀ ਗਿਣਤੀ। ਸਿਗਨਲ ਇੰਜਨ ਉੱਤੇ ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਨੇ ਹੋਲਡ-ਆਊਟ ਟੈਸਟ ਵਿੱਚ 0.841 ਹਾਸਲ ਕੀਤਾ, ਜਦਕਿ ਦੋਵੇਂ ਬੇਸਲਾਈਨਾਂ 0.50 ਤੋਂ ਘੱਟ ਰਹੀਆਂ। ਏਜੰਟਿਕ ਮਲਟੀਮੋਡਲ ਰੀਟਰੀਵਲ ਉੱਤੇ ਸਾਡੀ ਟੀਮ ਦਾ ਹੋਲਡ-ਆਊਟ NDCG@10 ਸਭ ਤੋਂ ਵੱਧ ਹੈ (CORAL ਦੇ 0.700 ਅਤੇ karpathy ਦੇ 0.738 ਦੇ ਮੁਕਾਬਲੇ 0.744)। ਇਹ ਅਧਿਕਾਰਤ ਮੁਲਾਂਕਣ ਨੂੰ ਬਾਰਾਂ ਤੋਂ ਚੌਦਾਂ ਗੁਣਾ ਤੇਜ਼ ਚਲਾਉਂਦੀ ਹੈ: 786 ਅਤੇ 650 ਸਕਿੰਟ ਦੇ ਮੁਕਾਬਲੇ 54 ਸਕਿੰਟ। ਡੀਪ ਰਿਸਰਚ ਉੱਤੇ ਸਾਡੀ ਟੀਮ ਨੇ 0.802 ਹਾਸਲ ਕੀਤਾ, ਜਦਕਿ ਦੋਵੇਂ ਬੇਸਲਾਈਨਾਂ ਲਗਭਗ 0.52 ਰਹੀਆਂ। ਇੱਕ ਸਾਵਧਾਨੀ ਹਰ ਥਾਂ ਲਾਗੂ ਹੁੰਦੀ ਹੈ: ਅਸੀਂ CORAL ਅਤੇ karpathy/autoresearch ਨੂੰ ਉਨ੍ਹਾਂ ਦੇ ਪ੍ਰਕਾਸ਼ਿਤ ਵੇਰਵਿਆਂ ਤੋਂ ਮੁੜ ਲਾਗੂ ਕੀਤਾ ਸੀ, ਇਸ ਲਈ ਕੁਝ ਅੰਤਰ ਸਿਰਫ਼ ਤਰੀਕਿਆਂ ਦੀ ਬਜਾਏ ਲਾਗੂਕਰਨ ਦੇ ਫ਼ਰਕ ਕਰਕੇ ਵੀ ਹੋ ਸਕਦਾ ਹੈ।

ਇਸ ਅੰਤਰ ਦੇ ਪਿੱਛੇ ਡਿਜ਼ਾਈਨ ਦੀਆਂ ਚਾਰ ਚੋਣਾਂ ਹਨ। ਪਹਿਲਾਂ, ਸਾਡੀ ਟੀਮ ਕੋਈ ਕੋਡ ਸੋਧਣ ਤੋਂ ਪਹਿਲਾਂ ਸੰਚਾਰਿਤ ਡਿਜ਼ਾਈਨ ਸਪੈੱਕ ਬਣਾਉਂਦੀ ਹੈ। ਇਸ ਨਾਲ ਉਹ ਪ੍ਰੌਂਪਟ ਦੀਆਂ ਛੋਟੀਆਂ ਸੋਧਾਂ ਦੀ ਬਜਾਏ ਪਾਈਪਲਾਈਨ ਦੇ ਨਵੇਂ ਪੜਾਵਾਂ ਵਰਗੇ ਢਾਂਚਾਗਤ ਬਦਲਾਵਾਂ ਨੂੰ ਤਰਜੀਹ ਦਿੰਦੀ ਹੈ। ਦੂਜਾ, ਇਹ ਸਾਂਝੇ ਸਰਬੋਤਮ ਉਮੀਦਵਾਰ ਉੱਤੇ ਆਧਾਰਿਤ ਸਮਕਾਲੀ ਸ਼ਾਖਾਵਾਂ ਚਲਾਉਂਦੀ ਹੈ। ਇਸ ਕਰਕੇ ਸੁਧਾਰ CORAL ਦੇ ਸੁਤੰਤਰ ਏਜੰਟਾਂ ਜਾਂ karpathy ਦੇ ਸਖ਼ਤ ਕ੍ਰਮਵਾਰ ਚੱਕਰ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਇਕੱਠੇ ਹੁੰਦੇ ਹਨ। ਤੀਜਾ, ਹਰ ਅਜ਼ਮਾਇਸ਼ ਸੰਚਾਰਿਤ ਆਰਟੀਫੈਕਟ—ਸਕੋਰ, ਇਵੈਂਟ ਲੌਗ ਅਤੇ LLM ਵੱਲੋਂ ਲਿਖੇ ਚਾਰ ਵਿਸ਼ਲੇਸ਼ਣ—ਛੱਡਦੀ ਹੈ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਅਗਲਾ ਪ੍ਰਸਤਾਵਕ ਮੁੜ ਪੜ੍ਹਦਾ ਹੈ। ਇਸ ਦੇ ਉਲਟ, ਬੇਸਲਾਈਨਾਂ ਸਿਰਫ਼ ਸਧਾਰਨ ਕੋਸ਼ਿਸ਼ ਲਾਗ ਰੱਖਦੀਆਂ ਹਨ। ਚੌਥਾ, ਰੁਕਾਵਟ ਮਗਰੋਂ ਅਨੁਕੂਲੀ ਨਿਯੰਤਰਕ ਪ੍ਰਸਤਾਵਕ ਨੂੰ ਖੋਜ ਵੱਲ ਅਤੇ ਜਿੱਤ ਮਗਰੋਂ ਸੁਧਾਰ ਵੱਲ ਧੱਕਦਾ ਹੈ। ਇਸ ਦੇ ਉੱਪਰ ਪ੍ਰਿਡਿਕਟਿਵ ਹਾਈਪੋਥਿਸਿਸ ਰੀਰੈਂਕਿੰਗ ਕਮਜ਼ੋਰ ਵਿਚਾਰਾਂ ਨੂੰ ਬਜਟ ਖਰਚਣ ਤੋਂ ਪਹਿਲਾਂ ਹਟਾ ਦਿੰਦੀ ਹੈ।

ਅਸੀਂ ਕੀ ਨਹੀਂ ਦਿਖਾਇਆ

ਹੋਲਡ-ਆਊਟ ਵਕਰ ਇਨ-ਡੋਮੇਨ ਸਧਾਰਨੀਕਰਨ ਦਿਖਾਉਂਦੇ ਹਨ, ਕ੍ਰਾਸ-ਡੋਮੇਨ ਟ੍ਰਾਂਸਫ਼ਰ ਨਹੀਂ। AI ਬਾਜ਼ਾਰ ਦੇ ਸੰਕੇਤ ਕੱਢਣ ਲਈ ਔਪਟੀਮਾਈਜ਼ ਕੀਤੇ ਵਰਕਫ਼ਲੋ ਤੋਂ ਕਾਨੂੰਨੀ ਜਾਂ ਜੀਵ-ਚਿਕਿਤਸਕ ਟੈਕਸਟ ਉੱਤੇ ਦੁਬਾਰਾ ਜਾਂਚ-ਢਾਂਚਾ ਚਲਾਏ ਬਿਨਾਂ ਵੀ ਇਸੇ ਤਰ੍ਹਾਂ ਕਾਰਗੁਜ਼ਾਰੀ ਦੇਣ ਦੀ ਉਮੀਦ ਨਹੀਂ ਕਰਨੀ ਚਾਹੀਦੀ। ਜਾਂਚ-ਢਾਂਚਾ ਸਿਰਫ਼ ਉਸੇ ਦਿਸ਼ਾ ਵਿੱਚ ਅੱਗੇ ਵਧਦਾ ਹੈ, ਜੋ ਗ੍ਰੇਡਰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦਾ ਹੈ। ਇਸ ਲਈ ਸ਼ੋਰ ਵਾਲੇ ਸਿਖਲਾਈ ਡਾਟਾਸੈੱਟ ਜਾਂ ਗਲਤ ਤਰੀਕੇ ਨਾਲ ਕੈਲੀਬ੍ਰੇਟ ਕੀਤੇ ਨਿਰਣਾਇਕ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਇਹ ਉਸੇ ਅਨੁਸਾਰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਓਵਰਫਿਟ ਹੋ ਜਾਵੇਗਾ। ਗੰਭੀਰ ਚਲਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਅਸੀਂ ਘੱਟੋ-ਘੱਟ 20 ਚੰਗੀ ਤਰ੍ਹਾਂ ਚੁਣੀਆਂ ਸਿਖਲਾਈ ਆਈਟਮਾਂ ਅਤੇ ਇੱਕ ਵੱਖਰਾ ਵਿਕਾਸ ਸਪਲਿਟ ਰੱਖਣ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦੇ ਹਾਂ। ਲਾਗਤ ਸਭ ਤੋਂ ਵੱਡੀ ਵਿਹਾਰਕ ਸੀਮਾ ਹੈ। ਹਰ ਮੁਲਾਂਕਣ ਪੂਰੇ ਸਪਲਿਟਾਂ ਉੱਤੇ ਪੂਰੀ ਪਾਈਪਲਾਈਨ ਨੂੰ ਮੁੜ ਚਲਾਉਂਦਾ ਹੈ। ਸਿਰਫ਼ ਚੁਣੇ ਹੋਏ ਰੀਟਰੀਵਲ ਉਮੀਦਵਾਰ ਨੇ ਲਗਭਗ 2.2 ਮਿਲੀਅਨ ਇਨਪੁੱਟ ਟੋਕਨ ਖਪਤ ਕੀਤੇ, ਅਤੇ gpt-5.5-ਸ਼੍ਰੇਣੀ ਦੇ ਮਾਡਲ ਉੱਤੇ ਗੰਭੀਰ ਔਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਦੀ ਲਾਗਤ ਪ੍ਰਤੀ ਕੰਮ ਸੈਂਕੜਿਆਂ ਤੋਂ ਲੈ ਕੇ ਇੱਕ ਹਜ਼ਾਰ ਤੋਂ ਕੁਝ ਵੱਧ ਡਾਲਰ ਤੱਕ ਹੁੰਦੀ ਹੈ। ਅੰਤ ਵਿੱਚ, ਇਹ ਅੰਕੜੇ ਦੁਹਰਾਈਆਂ ਅਜ਼ਮਾਇਸ਼ਾਂ ਦੀ ਬਜਾਏ ਇਕੱਲੇ ਚਲਾਉਣਾਂ ਤੋਂ ਆਏ ਹਨ। ਇਸੇ ਲਈ ਅਸੀਂ ਇਨ੍ਹਾਂ ਨੂੰ ਰਸਮੀ ਅਧਿਐਨ ਦੀ ਬਜਾਏ ਇੰਜੀਨੀਅਰਿੰਗ ਬਲੌਗ ਲੇਖ ਵਜੋਂ ਸਾਂਝਾ ਕਰ ਰਹੇ ਹਾਂ।

ਸਿੱਟਾ

ਮੈਟਾ ਜਾਂਚ-ਢਾਂਚਾ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਕੋਡ ਸੁਧਾਰ ਨੂੰ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਵਰਤੋਂ ਲਈ ਕਾਫ਼ੀ ਅਨੁਸ਼ਾਸਿਤ ਬਣਾਇਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਸ ਦੇ ਮੁੱਖ ਅੰਸ਼ ਹਨ: ਢਾਂਚਾਗਤ ਪਰਿਕਲਪਨਾਵਾਂ, ਪ੍ਰਿਡਿਕਟਿਵ ਪ੍ਰੀ-ਫ਼ਿਲਟਰਿੰਗ, ਅਲੱਗ ਮੁਲਾਂਕਣ, ਜਿੱਥੇ ਡਾਟਾ ਆਗਿਆ ਦੇਵੇ ਉੱਥੇ ਹੋਲਡ-ਆਊਟ ਟੈਸਟਿੰਗ ਅਤੇ ਅੱਗੇ ਵਧਾਏ ਹਰ ਬਦਲਾਅ ਪਿੱਛੇ ਪੂਰਾ ਆਡਿਟ ਟ੍ਰੇਲ। ਇਕੱਠੇ ਹੋ ਕੇ ਇਹ ਇੰਜੀਨੀਅਰਿੰਗ ਟੀਮ ਨੂੰ ਕੰਮ ਕਰਦੀ ਸੀਡ ਪਾਈਪਲਾਈਨ ਤੋਂ ਮਾਪਣਯੋਗ ਤੌਰ ’ਤੇ ਬਿਹਤਰ ਪਾਈਪਲਾਈਨ ਤੱਕ ਪਹੁੰਚਣ ਦਾ ਅਨੁਮਾਨਯੋਗ ਰਾਹ ਦਿੰਦੇ ਹਨ। ਇਹ ਸੰਚਾਲਨ ਮਾਲਕ ਨੂੰ ਇੱਕ ਸਧਾਰਨ ਮਾਡਲ ਵੀ ਦਿੰਦੇ ਹਨ: ਖ਼ੁਦਮੁਖ਼ਤਿਆਰ ਖੋਜ ਦਾ ਲਾਭ, ਸਖ਼ਤ ਅਤੇ ਬਜਟ-ਸਚੇਤ ਢਾਂਚੇ ਅੰਦਰ ਰੱਖਿਆ ਗਿਆ, ਅਤੇ ਕੁਝ ਵੀ ਸ਼ਿਪ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ ਮਨੁੱਖ ਦੀ ਮੌਜੂਦਗੀ।

ਲੇਖਕ

David Huang, Bjorn Jee